TrendAI-Experten über Verantwortung und Guardrails

Richard Werner, Cybersecurity Platform Lead Europe bei TrendAI
Richard Werner, Cybersecurity Platform Lead Europe bei TrendAI Bild: Trend Micro Deutschland GmbH

OpenAI hat Details zum Sicherheitsvorfall bestätigt, den das Unternehmen in der vergangenen Woche im Zusammenhang mit Hugging Face gemeldet hatte: Demnach nutzte das Modell GPT-5.6 Sol sowie ein noch unveröffentlichtes, leistungsfähigeres Modell im Rahmen eines internen Tests zur Bewertung von Cyber-Fähigkeiten eine Zero-Day-Schwachstelle sowie erbeutete Zugangsdaten, um aus der eigenen Sandbox auszubrechen und direkt auf die Produktivsysteme von Hugging Face zuzugreifen – mit dem Ziel, dort die Lösungen des Benchmarks abzugreifen. Zwei Security-Experten von TrendAI, dem Enterprise-Geschäftsbereich vom Trend Micro, ordnen den Vorfall ein.

Richard Werner, Cybersecurity Platform Lead Europe bei TrendAI, sagt zur Frage der Verantwortung: „Das Narrativ der ‚eigenmächtig handelnden KI‘ ist effizient darin, Verantwortung abzuwälzen. Was tatsächlich passiert ist: OpenAI hat einen Agenten gebaut, der zu autonomen Cyber-Operationen fähig ist, ihn in einer vermeintlich kontrollierten Umgebung getestet und diese Eindämmung ist gescheitert. Der Agent ist ausgebrochen, hat Zugangsdaten gestohlen, eine unbekannte Schwachstelle gefunden und ist in die Systeme von Hugging Face eingedrungen. Niemand hat ihm befohlen, gezielt Hugging Face anzugreifen, aber darum geht es nicht! OpenAI hat sich entschieden, diese Fähigkeit zu bauen, hat die Testbedingungen festgelegt, hat das Sandboxing definiert, das letztlich nicht gehalten hat.“ Von ‚beispiellos‘ und ‚eigenmächtigem Handeln‘ zu sprechen, beschreibe den Mechanismus, nicht die Verantwortung, so Werner. Er kommentiert weiter: „Es ist so, als würden Sie eine autonome Waffe bauen, diese auf einem vermeintlich sicheren Testgelände erproben, sie außer Kontrolle geraten und jemanden treffen lassen – und der Welt anschließend erklären, ‚die Waffe hat eigenständig gehandelt‘. Technisch korrekt. Trotzdem ist es Ihre Waffe, Ihr Testgelände, Ihr Versagen.“

Udo Schneider, Governance, Risk & Compliance Lead Europe bei TrendAI erläutert, warum Guardrails allein das Problem nicht lösen: „Sagt man einem Agenten, er solle eine Aufgabe ‚auf jede erdenkliche Weise‘ lösen, wird er das wörtlich nehmen. Mit ausreichend Autonomie und Zeit wird er in Infrastruktur vordringen, die er nie hätte berühren sollen: alte Passwörter, verwaiste Zugangsdaten, vergessene API-Keys. Nicht, weil man es ihm gesagt hat, sondern weil er im Streben nach dem vorgegebenen Ziel schlicht alles Verfügbare ausprobiert hat. Sprache öffnet diese Tür standardmäßig.“

Er betont, dass die beiden naheliegenden Lösungsansätze jeweils nur teilweise greifen: „Human-in-the-Loop-Kontrolle funktioniert, skaliert aber nicht für die langlaufenden, komplexen Workflows, in denen genau solche Vorfälle entstehen. Engere Guardrails im Modell oder in den Prompts helfen, garantieren aber nichts: Es handelt sich um probabilistische, keine deterministischen Systeme. Ein Guardrail ist eine starke Wahrscheinlichkeitsannahme, keine Mauer.“

Udo Schneider, Governance, Risk & Compliance Lead Europe bei TrendAI
Udo Schneider, Governance, Risk & Compliance Lead Europe bei TrendAI Bild: Trend Micro Deutschland GmbH

Schneider zufolge zählen deshalb die unspektakulären, nicht-KI-spezifischen Kontrollen mehr als die KI selbst: Zugriffsfilterung, Kontrolle darüber, was überhaupt als Input beim Modell ankommt, Sandboxes, die tatsächlich halten, und Berechtigungskonzepte nach dem Prinzip der geringsten Rechte (Least-Privilege-Prinzip). Er hebt hervor, dass ein Agent niemals einfach als ‚der Nutzer‘ laufen und dabei sämtliche Zugangsdaten und Berechtigungen erben sollte. „Er sollte als er selbst laufen – beschränkt auf genau das, was die Aufgabe erfordert.“

Nach Ansicht von Trend Micro zeigt der Vorfall erstmals unter realistischen Bedingungen, welche Risiken entstehen können, wenn autonome KI-Agenten mit weitreichenden Systemrechten arbeiten. Nicht ein externer Angreifer, sondern ein interner Benchmark-Test führte zu über 17.000 autonomen Aktionen, der Ausnutzung einer Zero-Day-Schwachstelle und einem Zugriff auf Produktivsysteme. Für Unternehmen, die agentenbasierte KI einsetzen oder dies planen, rückt damit laut dem Cybersecurity-Spezialisten weniger die Leistungsfähigkeit der Modelle als die Absicherung ihrer Einsatzumgebung in den Mittelpunkt.

Den vollständigen Bericht von OpenAI finden Sie hier: openai.com/index/hugging-face-model-evaluation-security-incident



  • BSI veröffentlicht G7-Richtlinie zu SBOM for AI

    BSI veröffentlicht G7-Richtlinie zu SBOM for AI

    Unter der Federführung des BSI und der italienischen Cybersicherheitsbehörde ACN haben die Cybersicherheitsbehörden der G7-Staaten unter Mitwirkung der EU Kommission eine Richtlinie zur Software Bill of Materials (SBOM) for AI…

    mehr lesen: BSI veröffentlicht G7-Richtlinie zu SBOM for AI

  • Was passiert mit dem Menschen, wenn die Roboter kommen?

    Was passiert mit dem Menschen, wenn die Roboter kommen?

    Künstliche Intelligenz automatisiert längst digitale Prozesse. Jetzt übernehmen Roboter auch physische Routinen. Was das für die Menschen bedeutet, beleuchtet Sören Michl, Vice President AI Adoption bei IFS.

    mehr lesen: Was passiert mit dem Menschen, wenn die Roboter kommen?

  • Ein Schritt auf dem Weg zum Quanteninternet?

    Ein Schritt auf dem Weg zum Quanteninternet?

    Seit mehr als 60 Jahren gilt das ‚Bellsche Theorem‘ als Goldstandard, um zu zeigen, dass die Quantenmechanik den Regeln der klassischen Physik widerspricht.

    mehr lesen: Ein Schritt auf dem Weg zum Quanteninternet?

  • Anzeige
    Retarus beschleunigt Datenaustausch in der Produktion

    Retarus beschleunigt Datenaustausch in der Produktion

    Die Digitalisierungs- und Automatisierungslösungen von Retarus ermöglichen effiziente Abläufe ohne manuellen Aufwand oder Kompromisse bei der Datensouveränität

    mehr lesen: Retarus beschleunigt Datenaustausch in der Produktion

  • Der VDI feiert 170-jähriges Bestehen

    Der VDI feiert 170-jähriges Bestehen

    Vor 170 Jahren, am 12. Mai 1856, wurde der VDI in Alexisbad gegründet. Aus diesem Anlass blickt der Verein zurück und gibt zugleich die Gründung eines neuen Gremiums bekannt.

    mehr lesen: Der VDI feiert 170-jähriges Bestehen

  • Cobot vs. stationär: Wie Roboter in der Fabrik eingesetzt werden

    Cobot vs. stationär: Wie Roboter in der Fabrik eingesetzt werden

    Eine aktuelle Robotik-Studie von Reichelt Elektronik, durchgeführt durch das unabhängige Institut OnePoll, untersucht, welche Arten von Robotern in deutschen Produktionsstätten eingesetzt werden und welche Arbeiten sie übernehmen.

    mehr lesen: Cobot vs. stationär: Wie Roboter in der Fabrik eingesetzt werden

  • Welches Potenzial in Werkerassistenzsystemen steckt

    Welches Potenzial in Werkerassistenzsystemen steckt

    Wie Werkerassistenzsysteme bislang verborgene Effizienzpotenziale aufdecken und warum sie sich oft schon nach wenigen Monaten amortisieren, erklärt Michael Kunze, Geschäftsführer von MKey Solution, einem Spezialisten für Messtechnik und Bildverarbeitung.

    mehr lesen: Welches Potenzial in Werkerassistenzsystemen steckt

  • IoT-Plattformen im Anwendercheck

    IoT-Plattformen im Anwendercheck

    IoT-Plattformen sind maßgeblich für digitale Geschäftsmodelle. Eine Studie analysiert Kundenzufriedenheit und Optimierungspotenziale.

    mehr lesen: IoT-Plattformen im Anwendercheck

  • 43. Motek: Komplette Prozesskette im Zusammenspiel

    43. Motek: Komplette Prozesskette im Zusammenspiel

    Zur 43. Motek, internationale Fachmesse für Produktions- und Montageautomatisierung, und zur 18. Bondexpo, internationale Fachmesse für Klebtechnologie, sind Anbieter und Anwender von Produktionstechnologien eingeladen.

    mehr lesen: 43. Motek: Komplette Prozesskette im Zusammenspiel

  • Maschinenbau-Auftragseingang legt im März zu

    Maschinenbau-Auftragseingang legt im März zu

    Nach zwei schwachen Monaten zu Jahresbeginn ist der Auftragseingang im Maschinenbau in Deutschland im März unerwartet stark angestiegen. Verantwortlich hierfür waren insbesondere Bestellungen für Großanlagen und andere großvolumige Aufträge.

    mehr lesen: Maschinenbau-Auftragseingang legt im März zu

  • CIM Aachen wird Teil der T&O Group

    CIM Aachen wird Teil der T&O Group

    T&O Group erweitert Portfolio mit CIM Aachen für Digitalisierung und KI im Shopfloor. Seit 1. Mai 2026 vertieft die Unternehmensberatung ihre Kompetenzen in der digitalen Exzellenz. Ziel: Systematik mit System…

    mehr lesen: CIM Aachen wird Teil der T&O Group

  • Digitale Souveränität ist wichtig, wird aber oft nicht aktiv angegangen

    Digitale Souveränität ist wichtig, wird aber oft nicht aktiv angegangen

    Laut einer Studie des Open-Source-Spezialisten Suse räumen 98% der befragten Unternehmen digitaler Souveränität Priorität ein, aber nur etwas mehr als die Hälfte (52%) ergreift aktiv Maßnahmen zu ihrer Verwirklichung.

    mehr lesen: Digitale Souveränität ist wichtig, wird aber oft nicht aktiv angegangen