TrendAI-Experten über Verantwortung und Guardrails

Richard Werner, Cybersecurity Platform Lead Europe bei TrendAI
Richard Werner, Cybersecurity Platform Lead Europe bei TrendAI Bild: Trend Micro Deutschland GmbH

OpenAI hat Details zum Sicherheitsvorfall bestätigt, den das Unternehmen in der vergangenen Woche im Zusammenhang mit Hugging Face gemeldet hatte: Demnach nutzte das Modell GPT-5.6 Sol sowie ein noch unveröffentlichtes, leistungsfähigeres Modell im Rahmen eines internen Tests zur Bewertung von Cyber-Fähigkeiten eine Zero-Day-Schwachstelle sowie erbeutete Zugangsdaten, um aus der eigenen Sandbox auszubrechen und direkt auf die Produktivsysteme von Hugging Face zuzugreifen – mit dem Ziel, dort die Lösungen des Benchmarks abzugreifen. Zwei Security-Experten von TrendAI, dem Enterprise-Geschäftsbereich vom Trend Micro, ordnen den Vorfall ein.

Richard Werner, Cybersecurity Platform Lead Europe bei TrendAI, sagt zur Frage der Verantwortung: „Das Narrativ der ‚eigenmächtig handelnden KI‘ ist effizient darin, Verantwortung abzuwälzen. Was tatsächlich passiert ist: OpenAI hat einen Agenten gebaut, der zu autonomen Cyber-Operationen fähig ist, ihn in einer vermeintlich kontrollierten Umgebung getestet und diese Eindämmung ist gescheitert. Der Agent ist ausgebrochen, hat Zugangsdaten gestohlen, eine unbekannte Schwachstelle gefunden und ist in die Systeme von Hugging Face eingedrungen. Niemand hat ihm befohlen, gezielt Hugging Face anzugreifen, aber darum geht es nicht! OpenAI hat sich entschieden, diese Fähigkeit zu bauen, hat die Testbedingungen festgelegt, hat das Sandboxing definiert, das letztlich nicht gehalten hat.“ Von ‚beispiellos‘ und ‚eigenmächtigem Handeln‘ zu sprechen, beschreibe den Mechanismus, nicht die Verantwortung, so Werner. Er kommentiert weiter: „Es ist so, als würden Sie eine autonome Waffe bauen, diese auf einem vermeintlich sicheren Testgelände erproben, sie außer Kontrolle geraten und jemanden treffen lassen – und der Welt anschließend erklären, ‚die Waffe hat eigenständig gehandelt‘. Technisch korrekt. Trotzdem ist es Ihre Waffe, Ihr Testgelände, Ihr Versagen.“

Udo Schneider, Governance, Risk & Compliance Lead Europe bei TrendAI erläutert, warum Guardrails allein das Problem nicht lösen: „Sagt man einem Agenten, er solle eine Aufgabe ‚auf jede erdenkliche Weise‘ lösen, wird er das wörtlich nehmen. Mit ausreichend Autonomie und Zeit wird er in Infrastruktur vordringen, die er nie hätte berühren sollen: alte Passwörter, verwaiste Zugangsdaten, vergessene API-Keys. Nicht, weil man es ihm gesagt hat, sondern weil er im Streben nach dem vorgegebenen Ziel schlicht alles Verfügbare ausprobiert hat. Sprache öffnet diese Tür standardmäßig.“

Er betont, dass die beiden naheliegenden Lösungsansätze jeweils nur teilweise greifen: „Human-in-the-Loop-Kontrolle funktioniert, skaliert aber nicht für die langlaufenden, komplexen Workflows, in denen genau solche Vorfälle entstehen. Engere Guardrails im Modell oder in den Prompts helfen, garantieren aber nichts: Es handelt sich um probabilistische, keine deterministischen Systeme. Ein Guardrail ist eine starke Wahrscheinlichkeitsannahme, keine Mauer.“

Udo Schneider, Governance, Risk & Compliance Lead Europe bei TrendAI
Udo Schneider, Governance, Risk & Compliance Lead Europe bei TrendAI Bild: Trend Micro Deutschland GmbH

Schneider zufolge zählen deshalb die unspektakulären, nicht-KI-spezifischen Kontrollen mehr als die KI selbst: Zugriffsfilterung, Kontrolle darüber, was überhaupt als Input beim Modell ankommt, Sandboxes, die tatsächlich halten, und Berechtigungskonzepte nach dem Prinzip der geringsten Rechte (Least-Privilege-Prinzip). Er hebt hervor, dass ein Agent niemals einfach als ‚der Nutzer‘ laufen und dabei sämtliche Zugangsdaten und Berechtigungen erben sollte. „Er sollte als er selbst laufen – beschränkt auf genau das, was die Aufgabe erfordert.“

Nach Ansicht von Trend Micro zeigt der Vorfall erstmals unter realistischen Bedingungen, welche Risiken entstehen können, wenn autonome KI-Agenten mit weitreichenden Systemrechten arbeiten. Nicht ein externer Angreifer, sondern ein interner Benchmark-Test führte zu über 17.000 autonomen Aktionen, der Ausnutzung einer Zero-Day-Schwachstelle und einem Zugriff auf Produktivsysteme. Für Unternehmen, die agentenbasierte KI einsetzen oder dies planen, rückt damit laut dem Cybersecurity-Spezialisten weniger die Leistungsfähigkeit der Modelle als die Absicherung ihrer Einsatzumgebung in den Mittelpunkt.

Den vollständigen Bericht von OpenAI finden Sie hier: openai.com/index/hugging-face-model-evaluation-security-incident



  • Vertrauenswürdige Elektronik für das Internet der Dinge

    Vertrauenswürdige Elektronik für das Internet der Dinge

    Zwölf Partner aus Forschung und Industrie haben das Forschungsprojekt VE-Vides gestartet. Ziel ist die Entwicklung eines Sicherheitskonzepts für das Internet der Dinge.

    mehr lesen: Vertrauenswürdige Elektronik für das Internet der Dinge

  • Martina Hofmann übernimmt Vorsitz

    Martina Hofmann übernimmt Vorsitz

    Prof. Dr.-Ing. Martina Hofmann von der Hochschule Aalen ist neue Vorsitzende des VDE-Ausschusses Studium, Beruf und Gesellschaft. Neben klassischer Ausschussarbeit will sie die Themen Frauen und Technik sowie Klimaschutz in…

    mehr lesen: Martina Hofmann übernimmt Vorsitz

  • So können sich Unternehmen schützen

    So können sich Unternehmen schützen

    Eine aktuelle Studie des Digitalverbands Bitkom bewertet Ransomware als Haupttreiber für den enormen Anstieg an Cyberattacken. Die Erpresserangriffe verursachen bei den Betroffenen einen enormen wirtschaftlichen Schaden.

    mehr lesen: So können sich Unternehmen schützen

  • Anzeige
    Retarus beschleunigt Datenaustausch in der Produktion

    Retarus beschleunigt Datenaustausch in der Produktion

    Die Digitalisierungs- und Automatisierungslösungen von Retarus ermöglichen effiziente Abläufe ohne manuellen Aufwand oder Kompromisse bei der Datensouveränität

    mehr lesen: Retarus beschleunigt Datenaustausch in der Produktion

  • Steuerungstechnik, IT und IoT sicher verbinden

    Steuerungstechnik, IT und IoT sicher verbinden

    Die Vernetzung in der Industrie und das damit verbundene Industrial Internet of Things (IIoT) definieren die Anforderungen an die Sicherheit neu – und damit auch an die eingesetzten Automatisierungslösungen.

    mehr lesen: Steuerungstechnik, IT und IoT sicher verbinden

  • Doppelspitze bei Valantic CEC Schweiz

    Doppelspitze bei Valantic CEC Schweiz

    Florian Heidecke leitet seit Anfang August gemeinsam mit Reto Rutz Valantic CEC in der Schweiz.

    mehr lesen: Doppelspitze bei Valantic CEC Schweiz

  • Maschinen lernen voneinander

    Maschinen lernen voneinander

    Das Kunststoff-Zentrum SKZ in Würzburg führt im Rahmen des Forschungsprojekts Darwin mit dem Fraunhofer Spin-off plus10 mehrere Versuchsreihen durch. Ziel ist die Entwicklung kontinuierlich lernender Modelle, die eine höhere Qualität…

    mehr lesen: Maschinen lernen voneinander

  • Wirtschaftliche Lage in Deutschland im August

    Wirtschaftliche Lage in Deutschland im August

    Das Bruttoinlandsprodukt (BIP) ist im 2. Quartal gewachsen. Damit setzt die deutsche Wirtschaft ihren Erholungskurs fort.

    mehr lesen: Wirtschaftliche Lage in Deutschland im August

  • Digitalisierungsziele werden oft noch nicht erreicht

    Digitalisierungsziele werden oft noch nicht erreicht

    Laut einer Studie von Tata Communications hat die große Mehrheit der 750 befragten Unternehmen ihre Digital-First-Ziele noch nicht erreicht. Dabei werden die Unternehmen in drei Reifegrad-Kategorien eingeteilt.

    mehr lesen: Digitalisierungsziele werden oft noch nicht erreicht

  • Der Fokus liegt auf der Elektromobilität

    Der Fokus liegt auf der Elektromobilität

    Eine gemeinsame Studie von VDA und Deloitte zeigt, dass Automobilzulieferer sich mitten in der Transformation befinden, aktuell jedoch noch 85 Prozent des Umsatzes aus der Verbrennertechnologie generiert wird. Dabei geht…

    mehr lesen: Der Fokus liegt auf der Elektromobilität

  • Förderung für den Messeauftritt

    Förderung für den Messeauftritt

    Kleine und mittlere Unternehmen können für Ihren Auftritt bei bestimmten Messen eine Förderung des BMWi in Anspruch nehmen. Auf bis zu 12.000€ kann sich der Förderbetrag belaufen.

    mehr lesen: Förderung für den Messeauftritt

  • Wenn Cyberangriffe schiefgehen

    Wenn Cyberangriffe schiefgehen

    Ransomware hat sich zu einem kriminellen Geschäft mit hohen Um- und Einsätzen entwickelt. Doch nicht jeder Angriff verläuft wie geplant. Der Security-Anbieter Sophos zählt einige Pannen auf.

    mehr lesen: Wenn Cyberangriffe schiefgehen