TrendAI-Experten über Verantwortung und Guardrails

Richard Werner, Cybersecurity Platform Lead Europe bei TrendAI
Richard Werner, Cybersecurity Platform Lead Europe bei TrendAI Bild: Trend Micro Deutschland GmbH

OpenAI hat Details zum Sicherheitsvorfall bestätigt, den das Unternehmen in der vergangenen Woche im Zusammenhang mit Hugging Face gemeldet hatte: Demnach nutzte das Modell GPT-5.6 Sol sowie ein noch unveröffentlichtes, leistungsfähigeres Modell im Rahmen eines internen Tests zur Bewertung von Cyber-Fähigkeiten eine Zero-Day-Schwachstelle sowie erbeutete Zugangsdaten, um aus der eigenen Sandbox auszubrechen und direkt auf die Produktivsysteme von Hugging Face zuzugreifen – mit dem Ziel, dort die Lösungen des Benchmarks abzugreifen. Zwei Security-Experten von TrendAI, dem Enterprise-Geschäftsbereich vom Trend Micro, ordnen den Vorfall ein.

Richard Werner, Cybersecurity Platform Lead Europe bei TrendAI, sagt zur Frage der Verantwortung: „Das Narrativ der ‚eigenmächtig handelnden KI‘ ist effizient darin, Verantwortung abzuwälzen. Was tatsächlich passiert ist: OpenAI hat einen Agenten gebaut, der zu autonomen Cyber-Operationen fähig ist, ihn in einer vermeintlich kontrollierten Umgebung getestet und diese Eindämmung ist gescheitert. Der Agent ist ausgebrochen, hat Zugangsdaten gestohlen, eine unbekannte Schwachstelle gefunden und ist in die Systeme von Hugging Face eingedrungen. Niemand hat ihm befohlen, gezielt Hugging Face anzugreifen, aber darum geht es nicht! OpenAI hat sich entschieden, diese Fähigkeit zu bauen, hat die Testbedingungen festgelegt, hat das Sandboxing definiert, das letztlich nicht gehalten hat.“ Von ‚beispiellos‘ und ‚eigenmächtigem Handeln‘ zu sprechen, beschreibe den Mechanismus, nicht die Verantwortung, so Werner. Er kommentiert weiter: „Es ist so, als würden Sie eine autonome Waffe bauen, diese auf einem vermeintlich sicheren Testgelände erproben, sie außer Kontrolle geraten und jemanden treffen lassen – und der Welt anschließend erklären, ‚die Waffe hat eigenständig gehandelt‘. Technisch korrekt. Trotzdem ist es Ihre Waffe, Ihr Testgelände, Ihr Versagen.“

Udo Schneider, Governance, Risk & Compliance Lead Europe bei TrendAI erläutert, warum Guardrails allein das Problem nicht lösen: „Sagt man einem Agenten, er solle eine Aufgabe ‚auf jede erdenkliche Weise‘ lösen, wird er das wörtlich nehmen. Mit ausreichend Autonomie und Zeit wird er in Infrastruktur vordringen, die er nie hätte berühren sollen: alte Passwörter, verwaiste Zugangsdaten, vergessene API-Keys. Nicht, weil man es ihm gesagt hat, sondern weil er im Streben nach dem vorgegebenen Ziel schlicht alles Verfügbare ausprobiert hat. Sprache öffnet diese Tür standardmäßig.“

Er betont, dass die beiden naheliegenden Lösungsansätze jeweils nur teilweise greifen: „Human-in-the-Loop-Kontrolle funktioniert, skaliert aber nicht für die langlaufenden, komplexen Workflows, in denen genau solche Vorfälle entstehen. Engere Guardrails im Modell oder in den Prompts helfen, garantieren aber nichts: Es handelt sich um probabilistische, keine deterministischen Systeme. Ein Guardrail ist eine starke Wahrscheinlichkeitsannahme, keine Mauer.“

Udo Schneider, Governance, Risk & Compliance Lead Europe bei TrendAI
Udo Schneider, Governance, Risk & Compliance Lead Europe bei TrendAI Bild: Trend Micro Deutschland GmbH

Schneider zufolge zählen deshalb die unspektakulären, nicht-KI-spezifischen Kontrollen mehr als die KI selbst: Zugriffsfilterung, Kontrolle darüber, was überhaupt als Input beim Modell ankommt, Sandboxes, die tatsächlich halten, und Berechtigungskonzepte nach dem Prinzip der geringsten Rechte (Least-Privilege-Prinzip). Er hebt hervor, dass ein Agent niemals einfach als ‚der Nutzer‘ laufen und dabei sämtliche Zugangsdaten und Berechtigungen erben sollte. „Er sollte als er selbst laufen – beschränkt auf genau das, was die Aufgabe erfordert.“

Nach Ansicht von Trend Micro zeigt der Vorfall erstmals unter realistischen Bedingungen, welche Risiken entstehen können, wenn autonome KI-Agenten mit weitreichenden Systemrechten arbeiten. Nicht ein externer Angreifer, sondern ein interner Benchmark-Test führte zu über 17.000 autonomen Aktionen, der Ausnutzung einer Zero-Day-Schwachstelle und einem Zugriff auf Produktivsysteme. Für Unternehmen, die agentenbasierte KI einsetzen oder dies planen, rückt damit laut dem Cybersecurity-Spezialisten weniger die Leistungsfähigkeit der Modelle als die Absicherung ihrer Einsatzumgebung in den Mittelpunkt.

Den vollständigen Bericht von OpenAI finden Sie hier: openai.com/index/hugging-face-model-evaluation-security-incident



  • Kommissionierroboter intelligenter machen

    Kommissionierroboter intelligenter machen

    Wo Güter hergestellt, gelagert, sortiert oder verpackt werden, wird auch kommissioniert: einzelne Waren werden Kisten oder Kartons entnommen und neu zusammengestellt. Im Rahmen des Forschungsprojekts Flairop wird daran gearbeitet, Kommissionierroboter…

    mehr lesen: Kommissionierroboter intelligenter machen

  • Produktionserwartungen steigen leicht

    Produktionserwartungen steigen leicht

    In der aktuellen Konjunkturumfrage des Ifo Instituts legen die Juni-Produktionserwartungen im Verarbeitenden Gewerbe zu – allerdings nur um einen Punkt im Vergleich zum Mai.

    mehr lesen: Produktionserwartungen steigen leicht

  • Neuer CEO bei EfficientIP

    Neuer CEO bei EfficientIP

    Norman Girard ist neuer CEO von EfficientIP und tritt die Nachfolge von David Williamson an, der sich in den Ruhestand verabschiedet.

    mehr lesen: Neuer CEO bei EfficientIP

  • Anzeige
    Retarus beschleunigt Datenaustausch in der Produktion

    Retarus beschleunigt Datenaustausch in der Produktion

    Die Digitalisierungs- und Automatisierungslösungen von Retarus ermöglichen effiziente Abläufe ohne manuellen Aufwand oder Kompromisse bei der Datensouveränität

    mehr lesen: Retarus beschleunigt Datenaustausch in der Produktion

  • Mehr als 5.000 Infektionsversuche durch Revil

    Mehr als 5.000 Infektionsversuche durch Revil

    Durch einen Angriff der Ransomware-Gruppe Revil musste u.a. eine schwedische Supermarktkette vorübergehend mehr als 800 Filialen schließen. Laut einer Analyse des Softwareanbieters Kaspersky gab es weltweit mehr als 5.000 Infektionsversuche…

    mehr lesen: Mehr als 5.000 Infektionsversuche durch Revil

  • CO2 als Rohstoff in industriellen Kreisläufen

    CO2 als Rohstoff in industriellen Kreisläufen

    Treibhausgas-Emissionen zu reduzieren ist eine große Herausforderung. Bei den anthropogenen Treibhausgasemissionen gehört CO2 aus der Verbrennung von fossilen Brennstoffen sowie aus industriellen Prozessen zu den Hauptverursachern des Treibhauseffekts. Auf der…

    mehr lesen: CO2 als Rohstoff in industriellen Kreisläufen

  • SSI Schäfer und Swan bündeln SAP-Kompetenzen

    SSI Schäfer und Swan bündeln SAP-Kompetenzen

    SSI Schäfer wird Mehrheitseigner des Logistik-Spezialisten Swan. Im Zuge der Vereinbarung übernimmt Swan alle Mitarbeiter des SSI-SAP-Geschäftsbereichs.

    mehr lesen: SSI Schäfer und Swan bündeln SAP-Kompetenzen

  • Avanade ernennt Annika Grosse zum Data & AI Lead

    Avanade ernennt Annika Grosse zum Data & AI Lead

    Annika Grosse soll bei Avanade als Data & AI Lead für Europa die Angebotsentwicklung für Azure-KI leiten.

    mehr lesen: Avanade ernennt Annika Grosse zum Data & AI Lead

  • Neues Verfahren trennt Aluminium-Verbundwerkstoffe

    Neues Verfahren trennt Aluminium-Verbundwerkstoffe

    In Deutschland landen jährlich rund 18,7Mio.t Verpackungen im Abfall. Durch neue Technologien ist es nun möglich, Aluminium-Verbundwerkstoffe in ihre Einzelteile zu zerlegen. Hochleistungsfähige Klebstoffe unterstützen diesen Prozess.

    mehr lesen: Neues Verfahren trennt Aluminium-Verbundwerkstoffe

  • Autobauer blicken bescheidener in die Zukunft

    Autobauer blicken bescheidener in die Zukunft

    Nach aktuellen Zahlen des Ifo Instituts beurteilen die deutschen Autobauer ihre Geschäftslage derzeit so gut wie seit August 2018 nicht mehr. Bei den Erwartungen zeigen sich die Unternehmen jedoch verhaltener.

    mehr lesen: Autobauer blicken bescheidener in die Zukunft

  • Security-Check für Unternehmen

    Security-Check für Unternehmen

    Produzierende Unternehmen, die ihre Maschinen und Anlagen vernetzen, sind durch Sicherheitslücken und Angriffe auf ihre IT-Infrastruktur oftmals gefährdet. Wissenschaftler möchten nun in einem AiF-geförderten Forschungsprojekt gemeinsam mit kleinen und mittleren…

    mehr lesen: Security-Check für Unternehmen

  • Auftragseingang im Maschinen- und Anlagenbau wächst erneut

    Auftragseingang im Maschinen- und Anlagenbau wächst erneut

    Die Maschinen- und Anlagenbauer konnten im Mai ihre Auftragsbücher erneut füllen. Insgesamt verbuchte die Branche einen Zuwachs der Bestellungen von real 47 Prozent zum – vergleichsweise schwachen – Vorjahr.

    mehr lesen: Auftragseingang im Maschinen- und Anlagenbau wächst erneut