TrendAI-Experten über Verantwortung und Guardrails

Richard Werner, Cybersecurity Platform Lead Europe bei TrendAI
Richard Werner, Cybersecurity Platform Lead Europe bei TrendAI Bild: Trend Micro Deutschland GmbH

OpenAI hat Details zum Sicherheitsvorfall bestätigt, den das Unternehmen in der vergangenen Woche im Zusammenhang mit Hugging Face gemeldet hatte: Demnach nutzte das Modell GPT-5.6 Sol sowie ein noch unveröffentlichtes, leistungsfähigeres Modell im Rahmen eines internen Tests zur Bewertung von Cyber-Fähigkeiten eine Zero-Day-Schwachstelle sowie erbeutete Zugangsdaten, um aus der eigenen Sandbox auszubrechen und direkt auf die Produktivsysteme von Hugging Face zuzugreifen – mit dem Ziel, dort die Lösungen des Benchmarks abzugreifen. Zwei Security-Experten von TrendAI, dem Enterprise-Geschäftsbereich vom Trend Micro, ordnen den Vorfall ein.

Richard Werner, Cybersecurity Platform Lead Europe bei TrendAI, sagt zur Frage der Verantwortung: „Das Narrativ der ‚eigenmächtig handelnden KI‘ ist effizient darin, Verantwortung abzuwälzen. Was tatsächlich passiert ist: OpenAI hat einen Agenten gebaut, der zu autonomen Cyber-Operationen fähig ist, ihn in einer vermeintlich kontrollierten Umgebung getestet und diese Eindämmung ist gescheitert. Der Agent ist ausgebrochen, hat Zugangsdaten gestohlen, eine unbekannte Schwachstelle gefunden und ist in die Systeme von Hugging Face eingedrungen. Niemand hat ihm befohlen, gezielt Hugging Face anzugreifen, aber darum geht es nicht! OpenAI hat sich entschieden, diese Fähigkeit zu bauen, hat die Testbedingungen festgelegt, hat das Sandboxing definiert, das letztlich nicht gehalten hat.“ Von ‚beispiellos‘ und ‚eigenmächtigem Handeln‘ zu sprechen, beschreibe den Mechanismus, nicht die Verantwortung, so Werner. Er kommentiert weiter: „Es ist so, als würden Sie eine autonome Waffe bauen, diese auf einem vermeintlich sicheren Testgelände erproben, sie außer Kontrolle geraten und jemanden treffen lassen – und der Welt anschließend erklären, ‚die Waffe hat eigenständig gehandelt‘. Technisch korrekt. Trotzdem ist es Ihre Waffe, Ihr Testgelände, Ihr Versagen.“

Udo Schneider, Governance, Risk & Compliance Lead Europe bei TrendAI erläutert, warum Guardrails allein das Problem nicht lösen: „Sagt man einem Agenten, er solle eine Aufgabe ‚auf jede erdenkliche Weise‘ lösen, wird er das wörtlich nehmen. Mit ausreichend Autonomie und Zeit wird er in Infrastruktur vordringen, die er nie hätte berühren sollen: alte Passwörter, verwaiste Zugangsdaten, vergessene API-Keys. Nicht, weil man es ihm gesagt hat, sondern weil er im Streben nach dem vorgegebenen Ziel schlicht alles Verfügbare ausprobiert hat. Sprache öffnet diese Tür standardmäßig.“

Er betont, dass die beiden naheliegenden Lösungsansätze jeweils nur teilweise greifen: „Human-in-the-Loop-Kontrolle funktioniert, skaliert aber nicht für die langlaufenden, komplexen Workflows, in denen genau solche Vorfälle entstehen. Engere Guardrails im Modell oder in den Prompts helfen, garantieren aber nichts: Es handelt sich um probabilistische, keine deterministischen Systeme. Ein Guardrail ist eine starke Wahrscheinlichkeitsannahme, keine Mauer.“

Udo Schneider, Governance, Risk & Compliance Lead Europe bei TrendAI
Udo Schneider, Governance, Risk & Compliance Lead Europe bei TrendAI Bild: Trend Micro Deutschland GmbH

Schneider zufolge zählen deshalb die unspektakulären, nicht-KI-spezifischen Kontrollen mehr als die KI selbst: Zugriffsfilterung, Kontrolle darüber, was überhaupt als Input beim Modell ankommt, Sandboxes, die tatsächlich halten, und Berechtigungskonzepte nach dem Prinzip der geringsten Rechte (Least-Privilege-Prinzip). Er hebt hervor, dass ein Agent niemals einfach als ‚der Nutzer‘ laufen und dabei sämtliche Zugangsdaten und Berechtigungen erben sollte. „Er sollte als er selbst laufen – beschränkt auf genau das, was die Aufgabe erfordert.“

Nach Ansicht von Trend Micro zeigt der Vorfall erstmals unter realistischen Bedingungen, welche Risiken entstehen können, wenn autonome KI-Agenten mit weitreichenden Systemrechten arbeiten. Nicht ein externer Angreifer, sondern ein interner Benchmark-Test führte zu über 17.000 autonomen Aktionen, der Ausnutzung einer Zero-Day-Schwachstelle und einem Zugriff auf Produktivsysteme. Für Unternehmen, die agentenbasierte KI einsetzen oder dies planen, rückt damit laut dem Cybersecurity-Spezialisten weniger die Leistungsfähigkeit der Modelle als die Absicherung ihrer Einsatzumgebung in den Mittelpunkt.

Den vollständigen Bericht von OpenAI finden Sie hier: openai.com/index/hugging-face-model-evaluation-security-incident



  • Unternehmen mit steigenden Erwartungen

    Unternehmen mit steigenden Erwartungen

    Nach dem Rückgang im vergangenen Monat legt der Ifo-Geschäftsklimaindex im Mai wieder zu. Dabei haben sich vor allem die Erwartungen für die kommenden Monate verbessert.

    mehr lesen: Unternehmen mit steigenden Erwartungen

  • PLM-Lösungen im Vergleich

    PLM-Lösungen im Vergleich

    Im Marktspiegel ‘Business Software PLM/PDM 2020/2021‘ werden mehr als 40 PLM-Lösungen hinsichtlich ihrer Funktionen untersucht.

    mehr lesen: PLM-Lösungen im Vergleich

  • „Das hohe Maß an Flexibilität und Kreativität sollte uns positiv in die Zukunft blicken lassen“

    „Das hohe Maß an Flexibilität und Kreativität sollte uns positiv in die Zukunft blicken lassen“

    Die Corona-Krise stellt die Globalisierung auf den Prüfstand. Für VDI-Präsident Volker Kefer ist die Situation Herausforderung und Chance zugleich. Im Interview spricht er über die Lage des Technikstandorts Deutschland heute…

    mehr lesen: „Das hohe Maß an Flexibilität und Kreativität sollte uns positiv in die Zukunft blicken lassen“

  • Anzeige
    Retarus beschleunigt Datenaustausch in der Produktion

    Retarus beschleunigt Datenaustausch in der Produktion

    Die Digitalisierungs- und Automatisierungslösungen von Retarus ermöglichen effiziente Abläufe ohne manuellen Aufwand oder Kompromisse bei der Datensouveränität

    mehr lesen: Retarus beschleunigt Datenaustausch in der Produktion

  • Die digitale Version der XR Expo geht online

    Die digitale Version der XR Expo geht online

    Ab sofort können sich Aussteller und Besucher auf einer digitalen Plattform für die XR Expo Virtual 2020 am 25. und 26. Juni registrieren.

    mehr lesen: Die digitale Version der XR Expo geht online

  • Vernetzte Systeme im Vorfeld testen

    Vernetzte Systeme im Vorfeld testen

    Wechselnde Umgebungsbedingungen durch Ad-hoc-Vernetzung, ständige Rekonfigurationen bedingt durch kleine Losgrößen und Softwareupdates im Feld sind Indikatoren dafür, dass das Testen von Systemen im laufenden Betrieb zunehmend an Bedeutung gewinnt. Um…

    mehr lesen: Vernetzte Systeme im Vorfeld testen

  • Unternehmen gewichten Technologie und Qualifizierung gleich

    Unternehmen gewichten Technologie und Qualifizierung gleich

    Unternehmen mit KI-Projekten sind dann am erfolgreichsten, wenn die Qualifizierung der eigenen Mitarbeiter den gleichen Stellenwert wie Investitionen in intelligente Technologien hat. Dazu gehört auch das Schaffen einer Lernkultur, die…

    mehr lesen: Unternehmen gewichten Technologie und Qualifizierung gleich

  • Wie ist der Stand der Industrie 4.0?

    Wie ist der Stand der Industrie 4.0?

    Von Februar bis April befragte der Digitalverband Bitkom Industrieunternehmen nach dem Stand der Digitalisierung. Im Vergleich zur Studie von vor zwei Jahren zeigt sich eine positive Entwicklung.

    mehr lesen: Wie ist der Stand der Industrie 4.0?

  • Weniger Ausfuhren, Entspannungstendenzen aus China

    Weniger Ausfuhren, Entspannungstendenzen aus China

    Aufgrund der Corona-Pandemie sind die Exporte der deutschen Maschinenbauer im ersten Quartal gesunken — im Vergleich zum Vorjahr um 6,6 Prozent.

    mehr lesen: Weniger Ausfuhren, Entspannungstendenzen aus China

  • Unternehmen wollen nach Corona digitaler werden

    Unternehmen wollen nach Corona digitaler werden

    63 Prozent der KMU rechnen laut einer McKinsey-Befragung mit einem Umsatzrückgang im aktuellen Quartal. Dennoch blicken 77 Prozent nach wie vor positiv in die Zukunft.

    mehr lesen: Unternehmen wollen nach Corona digitaler werden

  • SmartFactory-KL präsentiert Production Level 4 Demonstrator

    SmartFactory-KL präsentiert Production Level 4 Demonstrator

    Im Production Level 4 Demonstrator stellt die SmartFactoty-KL neue Produktionstechniken vor — ein Update der Industrie 4.0.

    mehr lesen: SmartFactory-KL präsentiert Production Level 4 Demonstrator

  • Welche Vorteile bringt Servitization für die Fertigung

    Welche Vorteile bringt Servitization für die Fertigung

    Unternehmen, die dank digitaler Technologien auf Servitization setzen, können laut einer Studie 30 Prozent mehr Umsätze im Service-Bereich erzielen, als ihre Mitbewerber.

    mehr lesen: Welche Vorteile bringt Servitization für die Fertigung