TrendAI-Experten über Verantwortung und Guardrails

Richard Werner, Cybersecurity Platform Lead Europe bei TrendAI
Richard Werner, Cybersecurity Platform Lead Europe bei TrendAI Bild: Trend Micro Deutschland GmbH

OpenAI hat Details zum Sicherheitsvorfall bestätigt, den das Unternehmen in der vergangenen Woche im Zusammenhang mit Hugging Face gemeldet hatte: Demnach nutzte das Modell GPT-5.6 Sol sowie ein noch unveröffentlichtes, leistungsfähigeres Modell im Rahmen eines internen Tests zur Bewertung von Cyber-Fähigkeiten eine Zero-Day-Schwachstelle sowie erbeutete Zugangsdaten, um aus der eigenen Sandbox auszubrechen und direkt auf die Produktivsysteme von Hugging Face zuzugreifen – mit dem Ziel, dort die Lösungen des Benchmarks abzugreifen. Zwei Security-Experten von TrendAI, dem Enterprise-Geschäftsbereich vom Trend Micro, ordnen den Vorfall ein.

Richard Werner, Cybersecurity Platform Lead Europe bei TrendAI, sagt zur Frage der Verantwortung: „Das Narrativ der ‚eigenmächtig handelnden KI‘ ist effizient darin, Verantwortung abzuwälzen. Was tatsächlich passiert ist: OpenAI hat einen Agenten gebaut, der zu autonomen Cyber-Operationen fähig ist, ihn in einer vermeintlich kontrollierten Umgebung getestet und diese Eindämmung ist gescheitert. Der Agent ist ausgebrochen, hat Zugangsdaten gestohlen, eine unbekannte Schwachstelle gefunden und ist in die Systeme von Hugging Face eingedrungen. Niemand hat ihm befohlen, gezielt Hugging Face anzugreifen, aber darum geht es nicht! OpenAI hat sich entschieden, diese Fähigkeit zu bauen, hat die Testbedingungen festgelegt, hat das Sandboxing definiert, das letztlich nicht gehalten hat.“ Von ‚beispiellos‘ und ‚eigenmächtigem Handeln‘ zu sprechen, beschreibe den Mechanismus, nicht die Verantwortung, so Werner. Er kommentiert weiter: „Es ist so, als würden Sie eine autonome Waffe bauen, diese auf einem vermeintlich sicheren Testgelände erproben, sie außer Kontrolle geraten und jemanden treffen lassen – und der Welt anschließend erklären, ‚die Waffe hat eigenständig gehandelt‘. Technisch korrekt. Trotzdem ist es Ihre Waffe, Ihr Testgelände, Ihr Versagen.“

Udo Schneider, Governance, Risk & Compliance Lead Europe bei TrendAI erläutert, warum Guardrails allein das Problem nicht lösen: „Sagt man einem Agenten, er solle eine Aufgabe ‚auf jede erdenkliche Weise‘ lösen, wird er das wörtlich nehmen. Mit ausreichend Autonomie und Zeit wird er in Infrastruktur vordringen, die er nie hätte berühren sollen: alte Passwörter, verwaiste Zugangsdaten, vergessene API-Keys. Nicht, weil man es ihm gesagt hat, sondern weil er im Streben nach dem vorgegebenen Ziel schlicht alles Verfügbare ausprobiert hat. Sprache öffnet diese Tür standardmäßig.“

Er betont, dass die beiden naheliegenden Lösungsansätze jeweils nur teilweise greifen: „Human-in-the-Loop-Kontrolle funktioniert, skaliert aber nicht für die langlaufenden, komplexen Workflows, in denen genau solche Vorfälle entstehen. Engere Guardrails im Modell oder in den Prompts helfen, garantieren aber nichts: Es handelt sich um probabilistische, keine deterministischen Systeme. Ein Guardrail ist eine starke Wahrscheinlichkeitsannahme, keine Mauer.“

Udo Schneider, Governance, Risk & Compliance Lead Europe bei TrendAI
Udo Schneider, Governance, Risk & Compliance Lead Europe bei TrendAI Bild: Trend Micro Deutschland GmbH

Schneider zufolge zählen deshalb die unspektakulären, nicht-KI-spezifischen Kontrollen mehr als die KI selbst: Zugriffsfilterung, Kontrolle darüber, was überhaupt als Input beim Modell ankommt, Sandboxes, die tatsächlich halten, und Berechtigungskonzepte nach dem Prinzip der geringsten Rechte (Least-Privilege-Prinzip). Er hebt hervor, dass ein Agent niemals einfach als ‚der Nutzer‘ laufen und dabei sämtliche Zugangsdaten und Berechtigungen erben sollte. „Er sollte als er selbst laufen – beschränkt auf genau das, was die Aufgabe erfordert.“

Nach Ansicht von Trend Micro zeigt der Vorfall erstmals unter realistischen Bedingungen, welche Risiken entstehen können, wenn autonome KI-Agenten mit weitreichenden Systemrechten arbeiten. Nicht ein externer Angreifer, sondern ein interner Benchmark-Test führte zu über 17.000 autonomen Aktionen, der Ausnutzung einer Zero-Day-Schwachstelle und einem Zugriff auf Produktivsysteme. Für Unternehmen, die agentenbasierte KI einsetzen oder dies planen, rückt damit laut dem Cybersecurity-Spezialisten weniger die Leistungsfähigkeit der Modelle als die Absicherung ihrer Einsatzumgebung in den Mittelpunkt.

Den vollständigen Bericht von OpenAI finden Sie hier: openai.com/index/hugging-face-model-evaluation-security-incident



  • Nur noch 5,6 Millionen in Kurzarbeit

    Nur noch 5,6 Millionen in Kurzarbeit

    Die Zahl der Beschäftigten in Kurzarbeit ging im Juli auf 5,6 Millionen zurück, gegenüber 6,7 Millionen im Juni. Doch während immer mehr Händler und Dienstleister aufatmen können, sinken die Zahlen…

    mehr lesen: Nur noch 5,6 Millionen in Kurzarbeit

  • Auch nach der Pandemie mehr Homeoffice

    Auch nach der Pandemie mehr Homeoffice

    Rund 37 Prozent der produzierenden Unternehmen wollen Homeoffice auch nach der Corona-Krise nutzen. Vor Ausbruch der Pandemie waren es nur etwa 25 Prozent der Fertigungsbetriebe, wie eine repräsentative Umfrage des…

    mehr lesen: Auch nach der Pandemie mehr Homeoffice

  • Erwartungen für August steigen deutlich

    Erwartungen für August steigen deutlich

    Die ZEW-Konjunkturerwartungen für Deutschland steigen im August 2020 gegenüber dem Vormonat wieder deutlich an, nachdem sie im Juli leicht zurückgegangen waren. Die Konjunkturerwartungen liegen aktuell bei 71,5 Punkten, also 12,2…

    mehr lesen: Erwartungen für August steigen deutlich

  • Anzeige
    Retarus beschleunigt Datenaustausch in der Produktion

    Retarus beschleunigt Datenaustausch in der Produktion

    Die Digitalisierungs- und Automatisierungslösungen von Retarus ermöglichen effiziente Abläufe ohne manuellen Aufwand oder Kompromisse bei der Datensouveränität

    mehr lesen: Retarus beschleunigt Datenaustausch in der Produktion

  • Hintergrundwissen zur OT- und IT-Welt

    Hintergrundwissen zur OT- und IT-Welt

    Die internetbasierte Veranstaltung IT meets OT am 08. September 2020 bietet Hintergrundwissen zu den zentralen Aspekten von OT- und IT-Architekturen. Dabei werden Fragen adressiert wie: Warum ist Integrität das Schutzziel…

    mehr lesen: Hintergrundwissen zur OT- und IT-Welt

  • Schneider Electric übernimmt Proleit

    Schneider Electric übernimmt Proleit

    Schneider Electric hat den MES-Anbieter Proleit AG erworben. Mit diesem Schritt will der französische Konzern seine Kompetenzen bei der Software-gestützten Automatisierung erweitern.

    mehr lesen: Schneider Electric übernimmt Proleit

  • Konjunkturerholung in der Digitalbranche setzt sich fort

    Konjunkturerholung in der Digitalbranche setzt sich fort

    Im Juli ist der Bitkom-Ifo-Digitalindex erneut gestiegen — der dritte Anstieg in Folge. Die Bitkom-Branche blickt zudem wieder in die Zukunft. Die Erwartungen an das nächste halbe Jahr liegen wider…

    mehr lesen: Konjunkturerholung in der Digitalbranche setzt sich fort

  • Roland Busch folgt auf Joe Kaeser

    Roland Busch folgt auf Joe Kaeser

    Siemens stellt sein Topmanagement um: Roland Busch übernimmt ab Oktober die Verantwortung für das Geschäftsjahr 2021. Auf der Hauptversammlung nächsten Februar löst Busch Topmanager Joe Kaeser als Vorstandsvorsitzenden ab. Digital…

    mehr lesen: Roland Busch folgt auf Joe Kaeser

  • Weniger Aufträge im ersten Halbjahr

    Weniger Aufträge im ersten Halbjahr

    Die durch Handelsstreitigkeiten und politische Verwerfungen geschwächte Weltkonjunktur wurde durch die Covid-19-Pandemie zusätzlich getroffen. Das zeigt sich auch am deutlichen Orderminus im Maschinen- und Anlagenbau.

    mehr lesen: Weniger Aufträge im ersten Halbjahr

  • Alexander Kläger ist neuer SAP Deutschland-Chef

    Alexander Kläger ist neuer SAP Deutschland-Chef

    Mit Alexander Kläger hat SAP Deutschland seit dem 1. August einen neuen Geschäftsführer. Der 49-Jährige ist seit 2012 für den Software-Konzern tätig.

    mehr lesen: Alexander Kläger ist neuer SAP Deutschland-Chef

  • Unternehmen sollten mehr auf Sicherheitsexperten setzen

    Unternehmen sollten mehr auf Sicherheitsexperten setzen

    In jedem dritten Unternehmen (28 Prozent) gab es im letzten Jahr mindestens einen gravierenden Sicherheitsvorfall. Das sind 2 Prozent mehr als noch ein Jahr zuvor. Meist handelte es sich dabei…

    mehr lesen: Unternehmen sollten mehr auf Sicherheitsexperten setzen

  • Schwachstellen priorisieren und beheben

    Schwachstellen priorisieren und beheben

    Mit der Vulnerability Mitigation App (VMA) stellt Tufin eine Applikation zur Verfügung, die es Unternehmen ermöglicht, Bedrohungen zu priorisieren und auf diese Weise eine effektive Fehlerbehebung und automatisierte Risikominderung zu…

    mehr lesen: Schwachstellen priorisieren und beheben