TrendAI-Experten über Verantwortung und Guardrails

Richard Werner, Cybersecurity Platform Lead Europe bei TrendAI
Richard Werner, Cybersecurity Platform Lead Europe bei TrendAI Bild: Trend Micro Deutschland GmbH

OpenAI hat Details zum Sicherheitsvorfall bestätigt, den das Unternehmen in der vergangenen Woche im Zusammenhang mit Hugging Face gemeldet hatte: Demnach nutzte das Modell GPT-5.6 Sol sowie ein noch unveröffentlichtes, leistungsfähigeres Modell im Rahmen eines internen Tests zur Bewertung von Cyber-Fähigkeiten eine Zero-Day-Schwachstelle sowie erbeutete Zugangsdaten, um aus der eigenen Sandbox auszubrechen und direkt auf die Produktivsysteme von Hugging Face zuzugreifen – mit dem Ziel, dort die Lösungen des Benchmarks abzugreifen. Zwei Security-Experten von TrendAI, dem Enterprise-Geschäftsbereich vom Trend Micro, ordnen den Vorfall ein.

Richard Werner, Cybersecurity Platform Lead Europe bei TrendAI, sagt zur Frage der Verantwortung: „Das Narrativ der ‚eigenmächtig handelnden KI‘ ist effizient darin, Verantwortung abzuwälzen. Was tatsächlich passiert ist: OpenAI hat einen Agenten gebaut, der zu autonomen Cyber-Operationen fähig ist, ihn in einer vermeintlich kontrollierten Umgebung getestet und diese Eindämmung ist gescheitert. Der Agent ist ausgebrochen, hat Zugangsdaten gestohlen, eine unbekannte Schwachstelle gefunden und ist in die Systeme von Hugging Face eingedrungen. Niemand hat ihm befohlen, gezielt Hugging Face anzugreifen, aber darum geht es nicht! OpenAI hat sich entschieden, diese Fähigkeit zu bauen, hat die Testbedingungen festgelegt, hat das Sandboxing definiert, das letztlich nicht gehalten hat.“ Von ‚beispiellos‘ und ‚eigenmächtigem Handeln‘ zu sprechen, beschreibe den Mechanismus, nicht die Verantwortung, so Werner. Er kommentiert weiter: „Es ist so, als würden Sie eine autonome Waffe bauen, diese auf einem vermeintlich sicheren Testgelände erproben, sie außer Kontrolle geraten und jemanden treffen lassen – und der Welt anschließend erklären, ‚die Waffe hat eigenständig gehandelt‘. Technisch korrekt. Trotzdem ist es Ihre Waffe, Ihr Testgelände, Ihr Versagen.“

Udo Schneider, Governance, Risk & Compliance Lead Europe bei TrendAI erläutert, warum Guardrails allein das Problem nicht lösen: „Sagt man einem Agenten, er solle eine Aufgabe ‚auf jede erdenkliche Weise‘ lösen, wird er das wörtlich nehmen. Mit ausreichend Autonomie und Zeit wird er in Infrastruktur vordringen, die er nie hätte berühren sollen: alte Passwörter, verwaiste Zugangsdaten, vergessene API-Keys. Nicht, weil man es ihm gesagt hat, sondern weil er im Streben nach dem vorgegebenen Ziel schlicht alles Verfügbare ausprobiert hat. Sprache öffnet diese Tür standardmäßig.“

Er betont, dass die beiden naheliegenden Lösungsansätze jeweils nur teilweise greifen: „Human-in-the-Loop-Kontrolle funktioniert, skaliert aber nicht für die langlaufenden, komplexen Workflows, in denen genau solche Vorfälle entstehen. Engere Guardrails im Modell oder in den Prompts helfen, garantieren aber nichts: Es handelt sich um probabilistische, keine deterministischen Systeme. Ein Guardrail ist eine starke Wahrscheinlichkeitsannahme, keine Mauer.“

Udo Schneider, Governance, Risk & Compliance Lead Europe bei TrendAI
Udo Schneider, Governance, Risk & Compliance Lead Europe bei TrendAI Bild: Trend Micro Deutschland GmbH

Schneider zufolge zählen deshalb die unspektakulären, nicht-KI-spezifischen Kontrollen mehr als die KI selbst: Zugriffsfilterung, Kontrolle darüber, was überhaupt als Input beim Modell ankommt, Sandboxes, die tatsächlich halten, und Berechtigungskonzepte nach dem Prinzip der geringsten Rechte (Least-Privilege-Prinzip). Er hebt hervor, dass ein Agent niemals einfach als ‚der Nutzer‘ laufen und dabei sämtliche Zugangsdaten und Berechtigungen erben sollte. „Er sollte als er selbst laufen – beschränkt auf genau das, was die Aufgabe erfordert.“

Nach Ansicht von Trend Micro zeigt der Vorfall erstmals unter realistischen Bedingungen, welche Risiken entstehen können, wenn autonome KI-Agenten mit weitreichenden Systemrechten arbeiten. Nicht ein externer Angreifer, sondern ein interner Benchmark-Test führte zu über 17.000 autonomen Aktionen, der Ausnutzung einer Zero-Day-Schwachstelle und einem Zugriff auf Produktivsysteme. Für Unternehmen, die agentenbasierte KI einsetzen oder dies planen, rückt damit laut dem Cybersecurity-Spezialisten weniger die Leistungsfähigkeit der Modelle als die Absicherung ihrer Einsatzumgebung in den Mittelpunkt.

Den vollständigen Bericht von OpenAI finden Sie hier: openai.com/index/hugging-face-model-evaluation-security-incident



  • ZEW-Konjunkturerwartungen gehen erstmals seit November zurück

    ZEW-Konjunkturerwartungen gehen erstmals seit November zurück

    Die ZEW-Konjunkturerwartungen für Deutschland sinken in der aktuellen Umfrage vom April 2021 um 5,9 Punkte und liegen damit bei 70,7 Punkten. Dies ist der erste Rückgang seit November 2020. Laut…

    mehr lesen: ZEW-Konjunkturerwartungen gehen erstmals seit November zurück

  • Industrieentscheider setzen auf das industrielle Internet der Dinge

    Industrieentscheider setzen auf das industrielle Internet der Dinge

    Drei Viertel der Entscheider in deutschen Industrieunternehmen sehen ihren Markt im Prozess der digitalen Transformation. Die Hälfte der Unternehmen setzt dabei bereits auf den Einsatz von Industrial IoT-Technologien. Zu diesen…

    mehr lesen: Industrieentscheider setzen auf das industrielle Internet der Dinge

  • Partnerschaft zwischen T-Systems und GFT

    Partnerschaft zwischen T-Systems und GFT

    Im Rahmen einer Partnerschaft wollen T-Systems und GFT gemeinsame Lösungen für die Fertigungsindustrie anbieten, mit denen Fehler in der Produktion schneller erkannt werden können.

    mehr lesen: Partnerschaft zwischen T-Systems und GFT

  • Anzeige
    Retarus beschleunigt Datenaustausch in der Produktion

    Retarus beschleunigt Datenaustausch in der Produktion

    Die Digitalisierungs- und Automatisierungslösungen von Retarus ermöglichen effiziente Abläufe ohne manuellen Aufwand oder Kompromisse bei der Datensouveränität

    mehr lesen: Retarus beschleunigt Datenaustausch in der Produktion

  • John Abel wird Chief Information Officer bei Extreme Networks

    John Abel wird Chief Information Officer bei Extreme Networks

    John Abel wechselt von Veritas zu Extreme Networks, wo er künftig die Position des CIOs wahrnehmen wird.

    mehr lesen: John Abel wird Chief Information Officer bei Extreme Networks

  • Nächste Hannover Messe wird Hybridveranstaltung

    Nächste Hannover Messe wird Hybridveranstaltung

    Nach fünf Messetagen ging am Freitag die Hannover Messe zu Ende. Insgesamt 90.000 Teilnehmer haben sich für die digitale Edition der Industrieschau registriert. Auch ohne Präsenzveranstaltung zog die Deutsche Messe…

    mehr lesen: Nächste Hannover Messe wird Hybridveranstaltung

  • Realistische Simulationen mit Security-Forschung

    Realistische Simulationen mit Security-Forschung

    Die neue Fraunhofer SIT Cyber Range verbindet komplexe Angriffssimulationen mit neuesten Erkenntnissen aus der angewandten Forschung, Expertenschulungen und der Vorstellung von innovativen Security-Werkzeugen: Mit realistischen Angriffssimulationen können Unternehmen die Leistungsstärke…

    mehr lesen: Realistische Simulationen mit Security-Forschung

  • VDMA-Studie zeigt hohe Relevanz interoperabler Schnittstellen

    VDMA-Studie zeigt hohe Relevanz interoperabler Schnittstellen

    Erst die Interoperabilität von Maschinen und Anlagen ermöglicht Unternehmen die Teilhabe an neuen digitalen Strukturen und ist Grundvoraussetzung für neue digitale Geschäftsmodelle. Durch interoperable Schnittstellen können neue Maschinen effizienter integriert…

    mehr lesen: VDMA-Studie zeigt hohe Relevanz interoperabler Schnittstellen

  • Impfstoffproduktion in Marburg

    Impfstoffproduktion in Marburg

    Impfstoffproduktion in Marburg Siemens und Biontech rüsten Produktionsanlage um Siemens unterstützt Biontech bei Umrüstung auf Impfstoffherstellung in Marburg. Dabei waren wesentliche Teile des neuen Manufacturing Execution Systems in nur zweieinhalb…

    mehr lesen: Impfstoffproduktion in Marburg

  • Geld weg, Daten weg

    Geld weg, Daten weg

    Mit Ransomware verschlüsseln Cyberkriminelle den Zugang zum kompromittierten Gerät oder den dort gespeicherten Dateien. Anschließend fordern sie Lösegeld mit dem Versprechen, die Sperrung nach Zahlung wieder aufzuheben.

    mehr lesen: Geld weg, Daten weg

  • Neue Sicherheitslücken entdeckt und geschlossen

    Neue Sicherheitslücken entdeckt und geschlossen

    Am Patch-Tag (13.04.2021) hat Microsoft zwei kritische Sicherheitslücken geschlossen, die lokal installierte Instanzen von Exchange 2013, 2016 und 2019 betreffen. Diese Sicherheitslücken ermöglichen das Ausführen von beliebigem Programmcode auf einem…

    mehr lesen: Neue Sicherheitslücken entdeckt und geschlossen

  • Torsten Hartinger verstärkt Geschäftsführung bei Solid System Team

    Torsten Hartinger verstärkt Geschäftsführung bei Solid System Team

    Das Systemhaus Solid System Team wird von einer Doppelspitze geleitet. Neben Werner Heckl ist seit 1. April auch Torsten Hartinger mit der Geschäftsführung betraut.

    mehr lesen: Torsten Hartinger verstärkt Geschäftsführung bei Solid System Team