TrendAI-Experten über Verantwortung und Guardrails

Richard Werner, Cybersecurity Platform Lead Europe bei TrendAI
Richard Werner, Cybersecurity Platform Lead Europe bei TrendAI Bild: Trend Micro Deutschland GmbH

OpenAI hat Details zum Sicherheitsvorfall bestätigt, den das Unternehmen in der vergangenen Woche im Zusammenhang mit Hugging Face gemeldet hatte: Demnach nutzte das Modell GPT-5.6 Sol sowie ein noch unveröffentlichtes, leistungsfähigeres Modell im Rahmen eines internen Tests zur Bewertung von Cyber-Fähigkeiten eine Zero-Day-Schwachstelle sowie erbeutete Zugangsdaten, um aus der eigenen Sandbox auszubrechen und direkt auf die Produktivsysteme von Hugging Face zuzugreifen – mit dem Ziel, dort die Lösungen des Benchmarks abzugreifen. Zwei Security-Experten von TrendAI, dem Enterprise-Geschäftsbereich vom Trend Micro, ordnen den Vorfall ein.

Richard Werner, Cybersecurity Platform Lead Europe bei TrendAI, sagt zur Frage der Verantwortung: „Das Narrativ der ‚eigenmächtig handelnden KI‘ ist effizient darin, Verantwortung abzuwälzen. Was tatsächlich passiert ist: OpenAI hat einen Agenten gebaut, der zu autonomen Cyber-Operationen fähig ist, ihn in einer vermeintlich kontrollierten Umgebung getestet und diese Eindämmung ist gescheitert. Der Agent ist ausgebrochen, hat Zugangsdaten gestohlen, eine unbekannte Schwachstelle gefunden und ist in die Systeme von Hugging Face eingedrungen. Niemand hat ihm befohlen, gezielt Hugging Face anzugreifen, aber darum geht es nicht! OpenAI hat sich entschieden, diese Fähigkeit zu bauen, hat die Testbedingungen festgelegt, hat das Sandboxing definiert, das letztlich nicht gehalten hat.“ Von ‚beispiellos‘ und ‚eigenmächtigem Handeln‘ zu sprechen, beschreibe den Mechanismus, nicht die Verantwortung, so Werner. Er kommentiert weiter: „Es ist so, als würden Sie eine autonome Waffe bauen, diese auf einem vermeintlich sicheren Testgelände erproben, sie außer Kontrolle geraten und jemanden treffen lassen – und der Welt anschließend erklären, ‚die Waffe hat eigenständig gehandelt‘. Technisch korrekt. Trotzdem ist es Ihre Waffe, Ihr Testgelände, Ihr Versagen.“

Udo Schneider, Governance, Risk & Compliance Lead Europe bei TrendAI erläutert, warum Guardrails allein das Problem nicht lösen: „Sagt man einem Agenten, er solle eine Aufgabe ‚auf jede erdenkliche Weise‘ lösen, wird er das wörtlich nehmen. Mit ausreichend Autonomie und Zeit wird er in Infrastruktur vordringen, die er nie hätte berühren sollen: alte Passwörter, verwaiste Zugangsdaten, vergessene API-Keys. Nicht, weil man es ihm gesagt hat, sondern weil er im Streben nach dem vorgegebenen Ziel schlicht alles Verfügbare ausprobiert hat. Sprache öffnet diese Tür standardmäßig.“

Er betont, dass die beiden naheliegenden Lösungsansätze jeweils nur teilweise greifen: „Human-in-the-Loop-Kontrolle funktioniert, skaliert aber nicht für die langlaufenden, komplexen Workflows, in denen genau solche Vorfälle entstehen. Engere Guardrails im Modell oder in den Prompts helfen, garantieren aber nichts: Es handelt sich um probabilistische, keine deterministischen Systeme. Ein Guardrail ist eine starke Wahrscheinlichkeitsannahme, keine Mauer.“

Udo Schneider, Governance, Risk & Compliance Lead Europe bei TrendAI
Udo Schneider, Governance, Risk & Compliance Lead Europe bei TrendAI Bild: Trend Micro Deutschland GmbH

Schneider zufolge zählen deshalb die unspektakulären, nicht-KI-spezifischen Kontrollen mehr als die KI selbst: Zugriffsfilterung, Kontrolle darüber, was überhaupt als Input beim Modell ankommt, Sandboxes, die tatsächlich halten, und Berechtigungskonzepte nach dem Prinzip der geringsten Rechte (Least-Privilege-Prinzip). Er hebt hervor, dass ein Agent niemals einfach als ‚der Nutzer‘ laufen und dabei sämtliche Zugangsdaten und Berechtigungen erben sollte. „Er sollte als er selbst laufen – beschränkt auf genau das, was die Aufgabe erfordert.“

Nach Ansicht von Trend Micro zeigt der Vorfall erstmals unter realistischen Bedingungen, welche Risiken entstehen können, wenn autonome KI-Agenten mit weitreichenden Systemrechten arbeiten. Nicht ein externer Angreifer, sondern ein interner Benchmark-Test führte zu über 17.000 autonomen Aktionen, der Ausnutzung einer Zero-Day-Schwachstelle und einem Zugriff auf Produktivsysteme. Für Unternehmen, die agentenbasierte KI einsetzen oder dies planen, rückt damit laut dem Cybersecurity-Spezialisten weniger die Leistungsfähigkeit der Modelle als die Absicherung ihrer Einsatzumgebung in den Mittelpunkt.

Den vollständigen Bericht von OpenAI finden Sie hier: openai.com/index/hugging-face-model-evaluation-security-incident



  • Tage der digitalen Technologien

    Tage der digitalen Technologien

    Das Bundeswirtschaftsministerium lädt am 16. und 17. November zu den Tagen der digitalen Technologien ein. In diesem Jahr findet die Veranstaltung als reines Online-Event statt.

    mehr lesen: Tage der digitalen Technologien

  • Sicherheit für Remote-Arbeitsplätze

    Sicherheit für Remote-Arbeitsplätze

    Fortinet stellt FortiGate 2600F vor. Die Netzwerk-Firewall verbindet Networking mit Security, sowohl in hybriden Rechenzentren, Multi-Cloudumgebungen als auch bei einer großen Anzahl von Remote-Arbeitsplätzen.

    mehr lesen: Sicherheit für Remote-Arbeitsplätze

  • Multiagentensysteme für die autonome Produktion

    Multiagentensysteme für die autonome Produktion

    Im Forschungsprojekt MAS4AI (Multi-Agent Systems for pervasive Artificial Intelligence for assisting humans in modular production environments) hat sich ein Konsortium aus siebzehn europäischen Partnern das Ziel gesetzt, ein Multiagentensysteme für…

    mehr lesen: Multiagentensysteme für die autonome Produktion

  • Anzeige
    Retarus beschleunigt Datenaustausch in der Produktion

    Retarus beschleunigt Datenaustausch in der Produktion

    Die Digitalisierungs- und Automatisierungslösungen von Retarus ermöglichen effiziente Abläufe ohne manuellen Aufwand oder Kompromisse bei der Datensouveränität

    mehr lesen: Retarus beschleunigt Datenaustausch in der Produktion

  • Sehen, wenn die Schraube locker ist

    Sehen, wenn die Schraube locker ist

    Das Forschungszentrum IoT-COMMs hat eine intelligente Schraubverbindung entwickelt, die eine drahtlose, energieautarke Überwachung ermöglicht. Ziel ist es, eine energieautarke Überwachung von Strukturen wie z.B. Brücken, Gerüsten, Windkraftanlagen in einem permanenten…

    mehr lesen: Sehen, wenn die Schraube locker ist

  • Sabine Schaar wird Regional Vice President Sales bei Equinix

    Sabine Schaar wird Regional Vice President Sales bei Equinix

    Mit Sabine Schaar hat Equinix eine neue Vice President Sales für Deutschland. Schaar kommt von Capgemini Deutschland zu Equinix.

    mehr lesen: Sabine Schaar wird Regional Vice President Sales bei Equinix

  • Siemens mit leichten Umsatzeinbußen

    Siemens mit leichten Umsatzeinbußen

    Weniger Umsatz und weniger Aufträge. Die Siemens AG hat ihre Zahlen für das am 30. September abgelaufene Geschäftsjahr vorgestellt.

    mehr lesen: Siemens mit leichten Umsatzeinbußen

  • Mehr KI-Einsatz in der Industrie

    Mehr KI-Einsatz in der Industrie

    Die Deutschen stehen dem Einsatz von künstlicher Intelligenz im industriellen Umfeld positiv gegenüber. In anderen Bereichen fällt die Zustimmung laut einer Bosch-Studie jedoch geringer aus.

    mehr lesen: Mehr KI-Einsatz in der Industrie

  • Stratasys und nTopology arbeiten zusammen

    Stratasys und nTopology arbeiten zusammen

    Stratasys und nTopology wollen ihre Kräfte bündeln, um 3D-gedruckte Werkzeuge und Vorrichtungen für die Fertigung zu vereinfachen.

    mehr lesen: Stratasys und nTopology arbeiten zusammen

  • TÜV und Ponemon Institute veröffentlichen Studie

    TÜV und Ponemon Institute veröffentlichen Studie

    Die gesamte Wertschöpfungskette vor Cyberattacken zu schützen, zählt in der zunehmend digitalisierten Welt zu den größten Herausforderungen. Besonders der Industrie- und Fertigungsbranche fällt es schwer, Cyberrisiken in ihren Unternehmen und…

    mehr lesen: TÜV und Ponemon Institute veröffentlichen Studie

  • Neuer Managing Director bei Dassault Systèmes

    Neuer Managing Director bei Dassault Systèmes

    Mit Dominic Kurtaz hat Dassault Systèmes einen neuen Managing Director für Zentraleuropa ernannt. Zudem wurde das Vertriebsteam neu aufgestellt.

    mehr lesen: Neuer Managing Director bei Dassault Systèmes

  • S&T hebt Prognose an

    S&T hebt Prognose an

    Mehr Umsatz, ein besseres Ergebnis und angehobene Ziele für das laufende Geschäftsjahr. Der Technologiekonzern ist bisher vergleichsweise gut durch die aktuelle Krise gekommen. Verantwortlich dafür sind auch Zuwächse im Medizintechnikbereich.

    mehr lesen: S&T hebt Prognose an