TrendAI-Experten über Verantwortung und Guardrails

Richard Werner, Cybersecurity Platform Lead Europe bei TrendAI
Richard Werner, Cybersecurity Platform Lead Europe bei TrendAI Bild: Trend Micro Deutschland GmbH

OpenAI hat Details zum Sicherheitsvorfall bestätigt, den das Unternehmen in der vergangenen Woche im Zusammenhang mit Hugging Face gemeldet hatte: Demnach nutzte das Modell GPT-5.6 Sol sowie ein noch unveröffentlichtes, leistungsfähigeres Modell im Rahmen eines internen Tests zur Bewertung von Cyber-Fähigkeiten eine Zero-Day-Schwachstelle sowie erbeutete Zugangsdaten, um aus der eigenen Sandbox auszubrechen und direkt auf die Produktivsysteme von Hugging Face zuzugreifen – mit dem Ziel, dort die Lösungen des Benchmarks abzugreifen. Zwei Security-Experten von TrendAI, dem Enterprise-Geschäftsbereich vom Trend Micro, ordnen den Vorfall ein.

Richard Werner, Cybersecurity Platform Lead Europe bei TrendAI, sagt zur Frage der Verantwortung: „Das Narrativ der ‚eigenmächtig handelnden KI‘ ist effizient darin, Verantwortung abzuwälzen. Was tatsächlich passiert ist: OpenAI hat einen Agenten gebaut, der zu autonomen Cyber-Operationen fähig ist, ihn in einer vermeintlich kontrollierten Umgebung getestet und diese Eindämmung ist gescheitert. Der Agent ist ausgebrochen, hat Zugangsdaten gestohlen, eine unbekannte Schwachstelle gefunden und ist in die Systeme von Hugging Face eingedrungen. Niemand hat ihm befohlen, gezielt Hugging Face anzugreifen, aber darum geht es nicht! OpenAI hat sich entschieden, diese Fähigkeit zu bauen, hat die Testbedingungen festgelegt, hat das Sandboxing definiert, das letztlich nicht gehalten hat.“ Von ‚beispiellos‘ und ‚eigenmächtigem Handeln‘ zu sprechen, beschreibe den Mechanismus, nicht die Verantwortung, so Werner. Er kommentiert weiter: „Es ist so, als würden Sie eine autonome Waffe bauen, diese auf einem vermeintlich sicheren Testgelände erproben, sie außer Kontrolle geraten und jemanden treffen lassen – und der Welt anschließend erklären, ‚die Waffe hat eigenständig gehandelt‘. Technisch korrekt. Trotzdem ist es Ihre Waffe, Ihr Testgelände, Ihr Versagen.“

Udo Schneider, Governance, Risk & Compliance Lead Europe bei TrendAI erläutert, warum Guardrails allein das Problem nicht lösen: „Sagt man einem Agenten, er solle eine Aufgabe ‚auf jede erdenkliche Weise‘ lösen, wird er das wörtlich nehmen. Mit ausreichend Autonomie und Zeit wird er in Infrastruktur vordringen, die er nie hätte berühren sollen: alte Passwörter, verwaiste Zugangsdaten, vergessene API-Keys. Nicht, weil man es ihm gesagt hat, sondern weil er im Streben nach dem vorgegebenen Ziel schlicht alles Verfügbare ausprobiert hat. Sprache öffnet diese Tür standardmäßig.“

Er betont, dass die beiden naheliegenden Lösungsansätze jeweils nur teilweise greifen: „Human-in-the-Loop-Kontrolle funktioniert, skaliert aber nicht für die langlaufenden, komplexen Workflows, in denen genau solche Vorfälle entstehen. Engere Guardrails im Modell oder in den Prompts helfen, garantieren aber nichts: Es handelt sich um probabilistische, keine deterministischen Systeme. Ein Guardrail ist eine starke Wahrscheinlichkeitsannahme, keine Mauer.“

Udo Schneider, Governance, Risk & Compliance Lead Europe bei TrendAI
Udo Schneider, Governance, Risk & Compliance Lead Europe bei TrendAI Bild: Trend Micro Deutschland GmbH

Schneider zufolge zählen deshalb die unspektakulären, nicht-KI-spezifischen Kontrollen mehr als die KI selbst: Zugriffsfilterung, Kontrolle darüber, was überhaupt als Input beim Modell ankommt, Sandboxes, die tatsächlich halten, und Berechtigungskonzepte nach dem Prinzip der geringsten Rechte (Least-Privilege-Prinzip). Er hebt hervor, dass ein Agent niemals einfach als ‚der Nutzer‘ laufen und dabei sämtliche Zugangsdaten und Berechtigungen erben sollte. „Er sollte als er selbst laufen – beschränkt auf genau das, was die Aufgabe erfordert.“

Nach Ansicht von Trend Micro zeigt der Vorfall erstmals unter realistischen Bedingungen, welche Risiken entstehen können, wenn autonome KI-Agenten mit weitreichenden Systemrechten arbeiten. Nicht ein externer Angreifer, sondern ein interner Benchmark-Test führte zu über 17.000 autonomen Aktionen, der Ausnutzung einer Zero-Day-Schwachstelle und einem Zugriff auf Produktivsysteme. Für Unternehmen, die agentenbasierte KI einsetzen oder dies planen, rückt damit laut dem Cybersecurity-Spezialisten weniger die Leistungsfähigkeit der Modelle als die Absicherung ihrer Einsatzumgebung in den Mittelpunkt.

Den vollständigen Bericht von OpenAI finden Sie hier: openai.com/index/hugging-face-model-evaluation-security-incident



  • Vorbereitungen für Motek und Bondexpo laufen

    Vorbereitungen für Motek und Bondexpo laufen

    Die Hürden der Automatisierung sinken weiter. Das will die diesjährige 42. Motek, internationale Fachmesse für Produktions- und Montageautomatisierung, zusammen mit der 17. Bondexpo, internationale Fachmesse für Klebtechnologie, zeigen und stellen…

    mehr lesen: Vorbereitungen für Motek und Bondexpo laufen

  • Weniger Studienanfänger in Ingenieurwissenschaften

    Weniger Studienanfänger in Ingenieurwissenschaften

    Die Zahl der offenen Stellen in den Ingenieurberufen ist trotz konjunktureller Eintrübung hoch. Laut VDI Ingenieurmonitor ist die Zahl der Studienanfänger und -anfängerinnen im ersten Hochschulsemester in den Fächern Ingenieurwissenschaften…

    mehr lesen: Weniger Studienanfänger in Ingenieurwissenschaften

  • DFKI und TAIX wollen KI-Spitzenforschung fördern

    DFKI und TAIX wollen KI-Spitzenforschung fördern

    Das Deutsche Forschungszentrum für Künstliche Intelligenz (DFKI) und das Expertennetzwerk Transatlantic AI eXchange (TAIX) planen den Aufbau einer gemeinsamen europäischen KI-Transfer- und Kooperationsbörse. Ziel dieser Partnerschaft ist es, den Transfer…

    mehr lesen: DFKI und TAIX wollen KI-Spitzenforschung fördern

  • Anzeige
    Retarus beschleunigt Datenaustausch in der Produktion

    Retarus beschleunigt Datenaustausch in der Produktion

    Die Digitalisierungs- und Automatisierungslösungen von Retarus ermöglichen effiziente Abläufe ohne manuellen Aufwand oder Kompromisse bei der Datensouveränität

    mehr lesen: Retarus beschleunigt Datenaustausch in der Produktion

  • Fraunhofer-Institute forschen an neuen Recyclingmöglichkeiten

    Fraunhofer-Institute forschen an neuen Recyclingmöglichkeiten

    Ein Großteil der täglich genutzten Verbrauchs- und Gebrauchsgegenstände besteht aus Kunststoffen, die auf Erdöl basieren. Nur etwas weniger als die Hälfte der dadurch resultierenden kunststoffhaltigen Abfälle wird in Deutschland werkstofflich…

    mehr lesen: Fraunhofer-Institute forschen an neuen Recyclingmöglichkeiten

  • Orderrückgang im Maschinen- und Anlagenbau

    Orderrückgang im Maschinen- und Anlagenbau

    Im Januar blieben die Bestellungen im Maschinen und Anlagenbau 10 Prozent unter dem Vorjahreswert. Mit Blick auf die vergangenen drei Monate ergibt sich ein ähnliches Bild.

    mehr lesen: Orderrückgang im Maschinen- und Anlagenbau

  • Forcam Enisco und Jasan Automation werden Partner

    Forcam Enisco und Jasan Automation werden Partner

    Um die eigene Präsenz in Indien auszubauen und dort ansässige Industrieunternehmen mit MES-Software zu beliefern, arbeitet Forcam Enisco künftig mit Jasan Automation zusammen.

    mehr lesen: Forcam Enisco und Jasan Automation werden Partner

  • Materialengpässe in der Industrie leicht gestiegen

    Materialengpässe in der Industrie leicht gestiegen

    Im Februar berichten wieder mehr Industrieunternehmen von Materialengpässen. Laut Ifo Institut verzeichnen vor allem Unternehmen aus der Chemischen Industrie Zuwächse.

    mehr lesen: Materialengpässe in der Industrie leicht gestiegen

  • Bosch und Microsoft erarbeiten Einsatzmöglichkeiten generativer KI im Auto

    Bosch und Microsoft erarbeiten Einsatzmöglichkeiten generativer KI im Auto

    Gemeinsam mit Microsoft will Bosch generative KI ins Auto bringen, etwa um die Sicherheit für Verkehrsteilnehmer zu erhöhen. Beide Unternehmen wollen zunächst Möglichkeiten der Zusammenarbeit ergründen.

    mehr lesen: Bosch und Microsoft erarbeiten Einsatzmöglichkeiten generativer KI im Auto

  • T-Systems ernennt Christine Knackfuß-Nikolic zur CTO

    T-Systems ernennt Christine Knackfuß-Nikolic zur CTO

    Christine Knackfuß-Nikolic wechselt von der Telekom zu T-Systems und wird dort ab März die Position der CTO übernehmen.

    mehr lesen: T-Systems ernennt Christine Knackfuß-Nikolic zur CTO

  • Prozessdampf nachhaltiger machen

    Prozessdampf nachhaltiger machen

    Für technische Produktionsprozesse, etwa in der chemischen Industrie, kommt zur Wärmeversorgung sogenannter Prozessdampf zum Einsatz. Für die Dampferzeugung werden bisher zumeist fossile Brennstoffe verwendet. Ein Forschungsprojekt will diesen Prozess nun…

    mehr lesen: Prozessdampf nachhaltiger machen

  • Autocrypt und MicroNova arbeiten zusammen

    Autocrypt und MicroNova arbeiten zusammen

    Im Rahmen einer strategischen Partnerschaft wollen die Unternehmen Autocrypt und MicroNova Testlösungen im Bereich der automobilen Cybersicherheit entwickeln.

    mehr lesen: Autocrypt und MicroNova arbeiten zusammen