TrendAI-Experten über Verantwortung und Guardrails

Richard Werner, Cybersecurity Platform Lead Europe bei TrendAI
Richard Werner, Cybersecurity Platform Lead Europe bei TrendAI Bild: Trend Micro Deutschland GmbH

OpenAI hat Details zum Sicherheitsvorfall bestätigt, den das Unternehmen in der vergangenen Woche im Zusammenhang mit Hugging Face gemeldet hatte: Demnach nutzte das Modell GPT-5.6 Sol sowie ein noch unveröffentlichtes, leistungsfähigeres Modell im Rahmen eines internen Tests zur Bewertung von Cyber-Fähigkeiten eine Zero-Day-Schwachstelle sowie erbeutete Zugangsdaten, um aus der eigenen Sandbox auszubrechen und direkt auf die Produktivsysteme von Hugging Face zuzugreifen – mit dem Ziel, dort die Lösungen des Benchmarks abzugreifen. Zwei Security-Experten von TrendAI, dem Enterprise-Geschäftsbereich vom Trend Micro, ordnen den Vorfall ein.

Richard Werner, Cybersecurity Platform Lead Europe bei TrendAI, sagt zur Frage der Verantwortung: „Das Narrativ der ‚eigenmächtig handelnden KI‘ ist effizient darin, Verantwortung abzuwälzen. Was tatsächlich passiert ist: OpenAI hat einen Agenten gebaut, der zu autonomen Cyber-Operationen fähig ist, ihn in einer vermeintlich kontrollierten Umgebung getestet und diese Eindämmung ist gescheitert. Der Agent ist ausgebrochen, hat Zugangsdaten gestohlen, eine unbekannte Schwachstelle gefunden und ist in die Systeme von Hugging Face eingedrungen. Niemand hat ihm befohlen, gezielt Hugging Face anzugreifen, aber darum geht es nicht! OpenAI hat sich entschieden, diese Fähigkeit zu bauen, hat die Testbedingungen festgelegt, hat das Sandboxing definiert, das letztlich nicht gehalten hat.“ Von ‚beispiellos‘ und ‚eigenmächtigem Handeln‘ zu sprechen, beschreibe den Mechanismus, nicht die Verantwortung, so Werner. Er kommentiert weiter: „Es ist so, als würden Sie eine autonome Waffe bauen, diese auf einem vermeintlich sicheren Testgelände erproben, sie außer Kontrolle geraten und jemanden treffen lassen – und der Welt anschließend erklären, ‚die Waffe hat eigenständig gehandelt‘. Technisch korrekt. Trotzdem ist es Ihre Waffe, Ihr Testgelände, Ihr Versagen.“

Udo Schneider, Governance, Risk & Compliance Lead Europe bei TrendAI erläutert, warum Guardrails allein das Problem nicht lösen: „Sagt man einem Agenten, er solle eine Aufgabe ‚auf jede erdenkliche Weise‘ lösen, wird er das wörtlich nehmen. Mit ausreichend Autonomie und Zeit wird er in Infrastruktur vordringen, die er nie hätte berühren sollen: alte Passwörter, verwaiste Zugangsdaten, vergessene API-Keys. Nicht, weil man es ihm gesagt hat, sondern weil er im Streben nach dem vorgegebenen Ziel schlicht alles Verfügbare ausprobiert hat. Sprache öffnet diese Tür standardmäßig.“

Er betont, dass die beiden naheliegenden Lösungsansätze jeweils nur teilweise greifen: „Human-in-the-Loop-Kontrolle funktioniert, skaliert aber nicht für die langlaufenden, komplexen Workflows, in denen genau solche Vorfälle entstehen. Engere Guardrails im Modell oder in den Prompts helfen, garantieren aber nichts: Es handelt sich um probabilistische, keine deterministischen Systeme. Ein Guardrail ist eine starke Wahrscheinlichkeitsannahme, keine Mauer.“

Udo Schneider, Governance, Risk & Compliance Lead Europe bei TrendAI
Udo Schneider, Governance, Risk & Compliance Lead Europe bei TrendAI Bild: Trend Micro Deutschland GmbH

Schneider zufolge zählen deshalb die unspektakulären, nicht-KI-spezifischen Kontrollen mehr als die KI selbst: Zugriffsfilterung, Kontrolle darüber, was überhaupt als Input beim Modell ankommt, Sandboxes, die tatsächlich halten, und Berechtigungskonzepte nach dem Prinzip der geringsten Rechte (Least-Privilege-Prinzip). Er hebt hervor, dass ein Agent niemals einfach als ‚der Nutzer‘ laufen und dabei sämtliche Zugangsdaten und Berechtigungen erben sollte. „Er sollte als er selbst laufen – beschränkt auf genau das, was die Aufgabe erfordert.“

Nach Ansicht von Trend Micro zeigt der Vorfall erstmals unter realistischen Bedingungen, welche Risiken entstehen können, wenn autonome KI-Agenten mit weitreichenden Systemrechten arbeiten. Nicht ein externer Angreifer, sondern ein interner Benchmark-Test führte zu über 17.000 autonomen Aktionen, der Ausnutzung einer Zero-Day-Schwachstelle und einem Zugriff auf Produktivsysteme. Für Unternehmen, die agentenbasierte KI einsetzen oder dies planen, rückt damit laut dem Cybersecurity-Spezialisten weniger die Leistungsfähigkeit der Modelle als die Absicherung ihrer Einsatzumgebung in den Mittelpunkt.

Den vollständigen Bericht von OpenAI finden Sie hier: openai.com/index/hugging-face-model-evaluation-security-incident



  • Gefasoft eröffnet neuen Firmensitz

    Gefasoft eröffnet neuen Firmensitz

    In Regensburg ist die neue Firmenzentrale von Gefasoft offiziell eingeweiht worden.

    mehr lesen: Gefasoft eröffnet neuen Firmensitz

  • 4. Verpackungstag

    4. Verpackungstag

    Auf dem 4. Verpackungstag in Marktheidenfeld am 6. November werden die neuesten Trends für Verpackungsmaschinen vorgestellt. Das Networking-Event der Verpackungstechnik findet diesmal im globalen Headquarter für Machine Solutions von Schneider…

    mehr lesen: 4. Verpackungstag

  • Microsoft und Nvidia arbeiten zusammen

    Microsoft und Nvidia arbeiten zusammen

    Die beiden IT-Konzerne Nvidia und Microsoft kooperieren mit dem Ziel, Edge Computing intelligenter und schneller zu machen. Das gab Nvidia-CEO Jensen Huang im Rahmen des Mobile World Congress in Las…

    mehr lesen: Microsoft und Nvidia arbeiten zusammen

  • Anzeige
    Retarus beschleunigt Datenaustausch in der Produktion

    Retarus beschleunigt Datenaustausch in der Produktion

    Die Digitalisierungs- und Automatisierungslösungen von Retarus ermöglichen effiziente Abläufe ohne manuellen Aufwand oder Kompromisse bei der Datensouveränität

    mehr lesen: Retarus beschleunigt Datenaustausch in der Produktion

  • Smarte Daten nutzen

    Smarte Daten nutzen

    Die Managementberatung T.A. Cook lädt vom 5. bis zum 6. Dezember zum Fachforum ‚Smart Data und Data Analytics in Instandhaltung und Technik‘ nach Berlin ein.

    mehr lesen: Smarte Daten nutzen

  • Erlöse mit Abo-Modellen wachsen

    Erlöse mit Abo-Modellen wachsen

    Weltweit hat die Subscription Economy in den vergangenen sieben Jahren zugelegt, um mehr als 350 Prozent. Im aktuellen Subscription Economy Index von Zuora wartet besonders die fertigende Industrie mit steigenden…

    mehr lesen: Erlöse mit Abo-Modellen wachsen

  • Unternehmen passen ihre Strategie an

    Unternehmen passen ihre Strategie an

    Disruption und Digitalisierung stellen Unternehmen vor Herausforderungen. In einer Studie des Datenspezialisten Teradata sieht sich die Mehrheit der Befragten damit konfrontiert, aufgrund dieser Herausforderungen die eigene Strategie zu überdenken.

    mehr lesen: Unternehmen passen ihre Strategie an

  • Software AG steigert Quartalsumsatz und -gewinn

    Software AG steigert Quartalsumsatz und -gewinn

    Im dritten Geschäftsquartal hat die Software AG bei Umsatz und Gewinn zugelegt. Der Gesamtumsatz wuchs um 7 Prozent, der Gewinn um 15 Prozent.

    mehr lesen: Software AG steigert Quartalsumsatz und -gewinn

  • Immer mehr Unternehmen setzen Industrie 4.0 um

    Immer mehr Unternehmen setzen Industrie 4.0 um

    Der Industrie-4.0-Index, den die Unternehmensberatung Staufen bereits zum sechsten Mal aufgelegt hat, ist auch in der 2019er Auflage erneut gestiegen. Demnach setzen mehr als die Hälfte der befragten Unternehmen Industrie…

    mehr lesen: Immer mehr Unternehmen setzen Industrie 4.0 um

  • 105 Millionen Angriffe im ersten Halbjahr 2019

    105 Millionen Angriffe im ersten Halbjahr 2019

    Die IT-Security Eperten haben die Daten ihrer selbst eingerichteten Honeypots ausgwertet. Dabei zeigt sich ein großer Anstieg der Angriffe auf IoT-Geräte im Vergleich zum Vorjahr.

    mehr lesen: 105 Millionen Angriffe im ersten Halbjahr 2019

  • Wibu Systems errichtet neue Firmenzentrale

    Wibu Systems errichtet neue Firmenzentrale

    Auf insgesamt 8.400m² errichtet Wibu System zwei neue Gebäude. Das eine soll zukünftig als Unternehmenssitz dienen, das andere soll als House of IT Security u.a. die Zusammenarbeit mit Startups fördern.

    mehr lesen: Wibu Systems errichtet neue Firmenzentrale

  • Unternehmen erstellen Einsatzkonzepte für digitalen Zwilling

    Unternehmen erstellen Einsatzkonzepte für digitalen Zwilling

    Der Einsatz des digitalen Zwillings verspricht vielfältige Potenziale für den gesamten Lebenszyklus eines Produktes. Im Rahmen einer Befragung der Managementberatung Detecon halten die Studienteilnehmer vor allem den Unternehmensübergreifenden Einsatz für…

    mehr lesen: Unternehmen erstellen Einsatzkonzepte für digitalen Zwilling