TrendAI-Experten über Verantwortung und Guardrails

Richard Werner, Cybersecurity Platform Lead Europe bei TrendAI
Richard Werner, Cybersecurity Platform Lead Europe bei TrendAI Bild: Trend Micro Deutschland GmbH

OpenAI hat Details zum Sicherheitsvorfall bestätigt, den das Unternehmen in der vergangenen Woche im Zusammenhang mit Hugging Face gemeldet hatte: Demnach nutzte das Modell GPT-5.6 Sol sowie ein noch unveröffentlichtes, leistungsfähigeres Modell im Rahmen eines internen Tests zur Bewertung von Cyber-Fähigkeiten eine Zero-Day-Schwachstelle sowie erbeutete Zugangsdaten, um aus der eigenen Sandbox auszubrechen und direkt auf die Produktivsysteme von Hugging Face zuzugreifen – mit dem Ziel, dort die Lösungen des Benchmarks abzugreifen. Zwei Security-Experten von TrendAI, dem Enterprise-Geschäftsbereich vom Trend Micro, ordnen den Vorfall ein.

Richard Werner, Cybersecurity Platform Lead Europe bei TrendAI, sagt zur Frage der Verantwortung: „Das Narrativ der ‚eigenmächtig handelnden KI‘ ist effizient darin, Verantwortung abzuwälzen. Was tatsächlich passiert ist: OpenAI hat einen Agenten gebaut, der zu autonomen Cyber-Operationen fähig ist, ihn in einer vermeintlich kontrollierten Umgebung getestet und diese Eindämmung ist gescheitert. Der Agent ist ausgebrochen, hat Zugangsdaten gestohlen, eine unbekannte Schwachstelle gefunden und ist in die Systeme von Hugging Face eingedrungen. Niemand hat ihm befohlen, gezielt Hugging Face anzugreifen, aber darum geht es nicht! OpenAI hat sich entschieden, diese Fähigkeit zu bauen, hat die Testbedingungen festgelegt, hat das Sandboxing definiert, das letztlich nicht gehalten hat.“ Von ‚beispiellos‘ und ‚eigenmächtigem Handeln‘ zu sprechen, beschreibe den Mechanismus, nicht die Verantwortung, so Werner. Er kommentiert weiter: „Es ist so, als würden Sie eine autonome Waffe bauen, diese auf einem vermeintlich sicheren Testgelände erproben, sie außer Kontrolle geraten und jemanden treffen lassen – und der Welt anschließend erklären, ‚die Waffe hat eigenständig gehandelt‘. Technisch korrekt. Trotzdem ist es Ihre Waffe, Ihr Testgelände, Ihr Versagen.“

Udo Schneider, Governance, Risk & Compliance Lead Europe bei TrendAI erläutert, warum Guardrails allein das Problem nicht lösen: „Sagt man einem Agenten, er solle eine Aufgabe ‚auf jede erdenkliche Weise‘ lösen, wird er das wörtlich nehmen. Mit ausreichend Autonomie und Zeit wird er in Infrastruktur vordringen, die er nie hätte berühren sollen: alte Passwörter, verwaiste Zugangsdaten, vergessene API-Keys. Nicht, weil man es ihm gesagt hat, sondern weil er im Streben nach dem vorgegebenen Ziel schlicht alles Verfügbare ausprobiert hat. Sprache öffnet diese Tür standardmäßig.“

Er betont, dass die beiden naheliegenden Lösungsansätze jeweils nur teilweise greifen: „Human-in-the-Loop-Kontrolle funktioniert, skaliert aber nicht für die langlaufenden, komplexen Workflows, in denen genau solche Vorfälle entstehen. Engere Guardrails im Modell oder in den Prompts helfen, garantieren aber nichts: Es handelt sich um probabilistische, keine deterministischen Systeme. Ein Guardrail ist eine starke Wahrscheinlichkeitsannahme, keine Mauer.“

Udo Schneider, Governance, Risk & Compliance Lead Europe bei TrendAI
Udo Schneider, Governance, Risk & Compliance Lead Europe bei TrendAI Bild: Trend Micro Deutschland GmbH

Schneider zufolge zählen deshalb die unspektakulären, nicht-KI-spezifischen Kontrollen mehr als die KI selbst: Zugriffsfilterung, Kontrolle darüber, was überhaupt als Input beim Modell ankommt, Sandboxes, die tatsächlich halten, und Berechtigungskonzepte nach dem Prinzip der geringsten Rechte (Least-Privilege-Prinzip). Er hebt hervor, dass ein Agent niemals einfach als ‚der Nutzer‘ laufen und dabei sämtliche Zugangsdaten und Berechtigungen erben sollte. „Er sollte als er selbst laufen – beschränkt auf genau das, was die Aufgabe erfordert.“

Nach Ansicht von Trend Micro zeigt der Vorfall erstmals unter realistischen Bedingungen, welche Risiken entstehen können, wenn autonome KI-Agenten mit weitreichenden Systemrechten arbeiten. Nicht ein externer Angreifer, sondern ein interner Benchmark-Test führte zu über 17.000 autonomen Aktionen, der Ausnutzung einer Zero-Day-Schwachstelle und einem Zugriff auf Produktivsysteme. Für Unternehmen, die agentenbasierte KI einsetzen oder dies planen, rückt damit laut dem Cybersecurity-Spezialisten weniger die Leistungsfähigkeit der Modelle als die Absicherung ihrer Einsatzumgebung in den Mittelpunkt.

Den vollständigen Bericht von OpenAI finden Sie hier: openai.com/index/hugging-face-model-evaluation-security-incident



  • Security-Check für Unternehmen

    Security-Check für Unternehmen

    Produzierende Unternehmen, die ihre Maschinen und Anlagen vernetzen, sind durch Sicherheitslücken und Angriffe auf ihre IT-Infrastruktur oftmals gefährdet. Wissenschaftler möchten nun in einem AiF-geförderten Forschungsprojekt gemeinsam mit kleinen und mittleren…

    mehr lesen: Security-Check für Unternehmen

  • Auftragseingang im Maschinen- und Anlagenbau wächst erneut

    Auftragseingang im Maschinen- und Anlagenbau wächst erneut

    Die Maschinen- und Anlagenbauer konnten im Mai ihre Auftragsbücher erneut füllen. Insgesamt verbuchte die Branche einen Zuwachs der Bestellungen von real 47 Prozent zum – vergleichsweise schwachen – Vorjahr.

    mehr lesen: Auftragseingang im Maschinen- und Anlagenbau wächst erneut

  • 6G-Forschung für die Zukunft

    6G-Forschung für die Zukunft

    Unter Koordinierung des DFKI forschen im Projekt Open6GHub 17 Projektpartner bereits an der nächsten Mobilfunkgeneration 6G.

    mehr lesen: 6G-Forschung für die Zukunft

  • Anzeige
    Retarus beschleunigt Datenaustausch in der Produktion

    Retarus beschleunigt Datenaustausch in der Produktion

    Die Digitalisierungs- und Automatisierungslösungen von Retarus ermöglichen effiziente Abläufe ohne manuellen Aufwand oder Kompromisse bei der Datensouveränität

    mehr lesen: Retarus beschleunigt Datenaustausch in der Produktion

  • China steigert Industrieroboter-Absatz

    China steigert Industrieroboter-Absatz

    Weltweit waren die Roboterinstallationen im vergangenen Jahr rückläufig, in China stieg jedoch die Zahl der verkauften Industrieroboter. Für Europa und Nordamerika erwartet die International Federation of Robotics ein starkes Wachstum…

    mehr lesen: China steigert Industrieroboter-Absatz

  • Partnerschaft zwischen AWS und Salesforce

    Partnerschaft zwischen AWS und Salesforce

    Salesforce und AWS wollen ihre jeweiligen Lösungen im Rahmen einer Partnerschaft neu integrieren, so dass Anwender die Lösungen in Kombination nutzen können.

    mehr lesen: Partnerschaft zwischen AWS und Salesforce

  • Paul Repmann wird Manager Sales & Marketing in Chicago

    Paul Repmann wird Manager Sales & Marketing in Chicago

    MPDV will mit Paul Repmann als Manager für Sales & Marketing die Präsenz in Nordamerika stärken.

    mehr lesen: Paul Repmann wird Manager Sales & Marketing in Chicago

  • Positive Aussichten für den Arbeitsmarkt

    Positive Aussichten für den Arbeitsmarkt

    Das IAB-Arbeitsmarktbarometer hat im Juni gegenüber dem Vormonat um 2,7 Punkte auf 107,4 Punkte zugelegt. Der Frühindikator des Instituts für Arbeitsmarkt- und Berufsforschung erreicht damit den höchsten Stand seit Beginn…

    mehr lesen: Positive Aussichten für den Arbeitsmarkt

  • Exporterwartungen legen zu

    Exporterwartungen legen zu

    Die Exporterwartungen des Ifo Instituts sind im Juni gestiegen, auf den höchsten Wert seit Januar 2011. Nahezu alle Branchen rechnen in der aktuellen Erhebung mit steigenden Exporten.

    mehr lesen: Exporterwartungen legen zu

  • Preisgestaltung oftmals nicht transparent genug

    Preisgestaltung oftmals nicht transparent genug

    Cloud-Produkte sind in den meisten Unternehmen und Branchen etabliert. Details liefert diesbezüglich eine Umfrage der Deutschsprachigen SAP-Anwendergruppe e.V. (DSAG). Zu den Ergebnissen zählt unter anderem, dass die Transparenz der Preisgestaltung…

    mehr lesen: Preisgestaltung oftmals nicht transparent genug

  • Partnerschaft zwischen Photocentric und CoreTechnologie

    Partnerschaft zwischen Photocentric und CoreTechnologie

    Im Rahmen einer Partnerschaft wollen der Softwareanbieter CoreTechnologie und der Druckmaschinenhersteller Photocentric gemeinsame Lösungen anbieten.

    mehr lesen: Partnerschaft zwischen Photocentric und CoreTechnologie

  • Personelle Veränderungen bei Robert Bosch

    Personelle Veränderungen bei Robert Bosch

    Zum Jahreswechsel kommt es bei der Robert Bosch GmbH zu einigen personellen Veränderungen. U.a. verabschiedet sich Aufsichtsratschef Franz Fehrenbach in den Ruhestand.

    mehr lesen: Personelle Veränderungen bei Robert Bosch