TrendAI-Experten über Verantwortung und Guardrails

Richard Werner, Cybersecurity Platform Lead Europe bei TrendAI
Richard Werner, Cybersecurity Platform Lead Europe bei TrendAI Bild: Trend Micro Deutschland GmbH

OpenAI hat Details zum Sicherheitsvorfall bestätigt, den das Unternehmen in der vergangenen Woche im Zusammenhang mit Hugging Face gemeldet hatte: Demnach nutzte das Modell GPT-5.6 Sol sowie ein noch unveröffentlichtes, leistungsfähigeres Modell im Rahmen eines internen Tests zur Bewertung von Cyber-Fähigkeiten eine Zero-Day-Schwachstelle sowie erbeutete Zugangsdaten, um aus der eigenen Sandbox auszubrechen und direkt auf die Produktivsysteme von Hugging Face zuzugreifen – mit dem Ziel, dort die Lösungen des Benchmarks abzugreifen. Zwei Security-Experten von TrendAI, dem Enterprise-Geschäftsbereich vom Trend Micro, ordnen den Vorfall ein.

Richard Werner, Cybersecurity Platform Lead Europe bei TrendAI, sagt zur Frage der Verantwortung: „Das Narrativ der ‚eigenmächtig handelnden KI‘ ist effizient darin, Verantwortung abzuwälzen. Was tatsächlich passiert ist: OpenAI hat einen Agenten gebaut, der zu autonomen Cyber-Operationen fähig ist, ihn in einer vermeintlich kontrollierten Umgebung getestet und diese Eindämmung ist gescheitert. Der Agent ist ausgebrochen, hat Zugangsdaten gestohlen, eine unbekannte Schwachstelle gefunden und ist in die Systeme von Hugging Face eingedrungen. Niemand hat ihm befohlen, gezielt Hugging Face anzugreifen, aber darum geht es nicht! OpenAI hat sich entschieden, diese Fähigkeit zu bauen, hat die Testbedingungen festgelegt, hat das Sandboxing definiert, das letztlich nicht gehalten hat.“ Von ‚beispiellos‘ und ‚eigenmächtigem Handeln‘ zu sprechen, beschreibe den Mechanismus, nicht die Verantwortung, so Werner. Er kommentiert weiter: „Es ist so, als würden Sie eine autonome Waffe bauen, diese auf einem vermeintlich sicheren Testgelände erproben, sie außer Kontrolle geraten und jemanden treffen lassen – und der Welt anschließend erklären, ‚die Waffe hat eigenständig gehandelt‘. Technisch korrekt. Trotzdem ist es Ihre Waffe, Ihr Testgelände, Ihr Versagen.“

Udo Schneider, Governance, Risk & Compliance Lead Europe bei TrendAI erläutert, warum Guardrails allein das Problem nicht lösen: „Sagt man einem Agenten, er solle eine Aufgabe ‚auf jede erdenkliche Weise‘ lösen, wird er das wörtlich nehmen. Mit ausreichend Autonomie und Zeit wird er in Infrastruktur vordringen, die er nie hätte berühren sollen: alte Passwörter, verwaiste Zugangsdaten, vergessene API-Keys. Nicht, weil man es ihm gesagt hat, sondern weil er im Streben nach dem vorgegebenen Ziel schlicht alles Verfügbare ausprobiert hat. Sprache öffnet diese Tür standardmäßig.“

Er betont, dass die beiden naheliegenden Lösungsansätze jeweils nur teilweise greifen: „Human-in-the-Loop-Kontrolle funktioniert, skaliert aber nicht für die langlaufenden, komplexen Workflows, in denen genau solche Vorfälle entstehen. Engere Guardrails im Modell oder in den Prompts helfen, garantieren aber nichts: Es handelt sich um probabilistische, keine deterministischen Systeme. Ein Guardrail ist eine starke Wahrscheinlichkeitsannahme, keine Mauer.“

Udo Schneider, Governance, Risk & Compliance Lead Europe bei TrendAI
Udo Schneider, Governance, Risk & Compliance Lead Europe bei TrendAI Bild: Trend Micro Deutschland GmbH

Schneider zufolge zählen deshalb die unspektakulären, nicht-KI-spezifischen Kontrollen mehr als die KI selbst: Zugriffsfilterung, Kontrolle darüber, was überhaupt als Input beim Modell ankommt, Sandboxes, die tatsächlich halten, und Berechtigungskonzepte nach dem Prinzip der geringsten Rechte (Least-Privilege-Prinzip). Er hebt hervor, dass ein Agent niemals einfach als ‚der Nutzer‘ laufen und dabei sämtliche Zugangsdaten und Berechtigungen erben sollte. „Er sollte als er selbst laufen – beschränkt auf genau das, was die Aufgabe erfordert.“

Nach Ansicht von Trend Micro zeigt der Vorfall erstmals unter realistischen Bedingungen, welche Risiken entstehen können, wenn autonome KI-Agenten mit weitreichenden Systemrechten arbeiten. Nicht ein externer Angreifer, sondern ein interner Benchmark-Test führte zu über 17.000 autonomen Aktionen, der Ausnutzung einer Zero-Day-Schwachstelle und einem Zugriff auf Produktivsysteme. Für Unternehmen, die agentenbasierte KI einsetzen oder dies planen, rückt damit laut dem Cybersecurity-Spezialisten weniger die Leistungsfähigkeit der Modelle als die Absicherung ihrer Einsatzumgebung in den Mittelpunkt.

Den vollständigen Bericht von OpenAI finden Sie hier: openai.com/index/hugging-face-model-evaluation-security-incident



  • Cybersicherheit soll das Potenzial von 5G nicht einschränken

    Cybersicherheit soll das Potenzial von 5G nicht einschränken

    5G ist die mobile Technologie, um immer größere Datenmengen zu bewegen. Sie ist in der Lage, Verbindungen praktisch ohne Verzögerung bereitzustellen.

    mehr lesen: Cybersicherheit soll das Potenzial von 5G nicht einschränken

  • KI-Spezialist Empolis erwirbt Intelligent Views

    KI-Spezialist Empolis erwirbt Intelligent Views

    Der Analytics-Dienstleister Empolis Information Management erwirbt Intelligent Views. Mit der Akquise will Empolis seine Künstliche Intelligenz-Kompetenzen insbesondere für die Industrie und öffentliche Verwaltung ausbauen. Zudem soll eine Standardlösung zum Erstellen…

    mehr lesen: KI-Spezialist Empolis erwirbt Intelligent Views

  • Damit der Roboter erkennt, wem was wann gehört

    Damit der Roboter erkennt, wem was wann gehört

    Für Maschinen stellen wechselnde Funktionen von Objekten ein ungelöstes Problem dar: Ein Laborroboter weiß beispielsweise nicht, welches Werkzeug gerade welchem Mitarbeiter zuzuordnen ist. Die drei Forschungsbereiche des DFKI-Labors Niedersachsen arbeiten…

    mehr lesen: Damit der Roboter erkennt, wem was wann gehört

  • Anzeige
    Retarus beschleunigt Datenaustausch in der Produktion

    Retarus beschleunigt Datenaustausch in der Produktion

    Die Digitalisierungs- und Automatisierungslösungen von Retarus ermöglichen effiziente Abläufe ohne manuellen Aufwand oder Kompromisse bei der Datensouveränität

    mehr lesen: Retarus beschleunigt Datenaustausch in der Produktion

  • Transformation Stage, Digital Ecosystems und Future Hub

    Transformation Stage, Digital Ecosystems und Future Hub

    Vom 20. bis zum 24. April öffnet die Hannover Messe ihre Pforten. Rund 6.500 Aussteller und mehr als 220.000 Besucher werden zur Weltleitmesse der Industrie erwartet. Neu in diesem jahr…

    mehr lesen: Transformation Stage, Digital Ecosystems und Future Hub

  • IT-Totalschaden vermeiden

    IT-Totalschaden vermeiden

    Nach einem Cyberangriff mit dem Trojaner Emotet vor fünf Monaten ist das Berliner Kammergericht noch immer weitgehend offline. Vor wenigen Tagen enthüllte ein Bericht, dass der Sicherheitsvorfall deutlich verheerender war,…

    mehr lesen: IT-Totalschaden vermeiden

  • Ein KI-Assistent für Datenlöschung

    Ein KI-Assistent für Datenlöschung

    In Verwaltungen von Unternehmen häufen sich große Datenmengen an. Dabei den Überblick zu behalten, fällt Mitarbeitern oft schwer.

    mehr lesen: Ein KI-Assistent für Datenlöschung

  • Smarte Lieferketten, Seewege und das IoT im Visier

    Smarte Lieferketten, Seewege und das IoT im Visier

    Am Montag stellt der TÜV Rheinland seine Cybersecurity Trends 2020 vor. Demnach könnten sich Cyberangriffe zunehmend auf persönliche Sicherheit sowie die Stabilität der Gesellschaft auswirken. Auch smarte Lieferketten stehen dabei…

    mehr lesen: Smarte Lieferketten, Seewege und das IoT im Visier

  • Förderung online berechnen

    Förderung online berechnen

    Zu Beginn des Jahres ist das Forschungszulagengesetz in Kraft getreten, um den Bereich Forschung und Entwicklung zu stärken. Mit einem Online-Tool können sich interessierte Unternehmen die voraussichtliche Fördersumme berechnen.

    mehr lesen: Förderung online berechnen

  • Ohne Überraschungen ins neue Jahr

    Ohne Überraschungen ins neue Jahr

    Der Auftragseingang im Maschinen- und Anlagenbau lag im Jahr 2019 um neun Prozent unter dem Vorjahreswert. Auch zum Jahresende verfehlten die Bestellungen das Vorjahresniveau.

    mehr lesen: Ohne Überraschungen ins neue Jahr

  • Raphael Binder übernimmt Geschäftsleitung von Syslogic

    Raphael Binder übernimmt Geschäftsleitung von Syslogic

    Wechsel an der Spitze von Syslogic. Raphael Binder hat zum 1. Januar die Geschäftsleitung der Embedded-Spezialistin übernommen.

    mehr lesen: Raphael Binder übernimmt Geschäftsleitung von Syslogic

  • SAP verlängert Support für Business Suite

    SAP verlängert Support für Business Suite

    SAP verlängert den Support für seine Business Suite um zwei Jahre bis Ende 2027. Zudem sagt der Softwarekonzern die Wartung für SAP S/4HANA bis 2040 zu.

    mehr lesen: SAP verlängert Support für Business Suite