KI-Modelle für Compliance-Aufgaben verglichen

Die EQS Group GmbH hat gemeinsam mit dem Berufsverband der Compliance Manager e.V. (BCM) die Leistungsfähigkeit von künstlicher Intelligenz im Bereich Compliance untersucht. Der veröffentlichte EQS AI Benchmark testete sechs große Sprachmodelle in 120 praxisnahen Anwendungen, darunter Risikoanalysen, Bewertungen von Interessenkonflikten und Third-Party-Screenings. Ziel war es, zu prüfen, inwieweit KI-Systeme den Anforderungen des Arbeitsalltags von Compliance-Fachleuten entsprechen. Bei strukturierten Aufgaben erzielten die getesteten Modelle laut EQS Group besonders hohe Genauigkeiten, während die Ergebnisse bei offenen oder mehrdeutigen Aufgaben deutlich uneinheitlicher waren.

%C2%A9nateejindakum AdobeStock 1535598481
Bild: ©nateejindakum/stock.adobe.com

Leistungsunterschiede und Fortschritte

Nach den Ergebnissen erreichen KI-Modelle bei eindeutig definierten Entscheidungsaufgaben durchschnittlich eine Genauigkeit von 90,8 Prozent und beim Datenabgleich von 91,8 Prozent. Vier der sechs Systeme lagen dabei über 95 Prozent. Bei komplexeren Analysen ergaben sich größere Unterschiede: Zwischen dem besten und dem schwächsten Modell betrug die Differenz 60 Prozentpunkte. Das Modell Gemini 2.5 Pro von Google erzielte den besten Wert mit 88 Prozent, während GPT-5 von OpenAI auf 62 Prozent und GPT-4o auf 28 Prozent kam. Im Gesamtranking belegte Gemini 2.5 Pro mit 86,7 Prozent knapp den ersten Platz vor GPT-5 mit 86,5 Prozent. GPT-5 zeigte laut EQS besondere Stärken bei kreativen Textaufgaben, während Gemini bei analytischen Aufgaben vorne lag. OpenAI o3 erreichte 83,3 Prozent, Claude Opus 4.1 von Anthropic 81,5 Prozent, GPT-4o 72,9 Prozent und Mistral Large 2 70,1 Prozent. Die Ergebnisse zeigen laut EQS Group den technischen Fortschritt zwischen 2024 und 2025.

Anwendungsmöglichkeiten und Grenzen

Die Analyse macht deutlich, dass die aktuellen KI-Modelle bei strukturierten Aufgaben verlässlich arbeiten, bei offenen Aufgaben oder Bewertungen jedoch Grenzen haben. Offene Aufgaben, etwa Management-Briefings oder Berichte zu internen Untersuchungen, wurden zusätzlich durch Fachjurys geprüft. GPT-5 erreichte in dieser Kategorie 67,4 Prozent. Die Ergebnisse unterstützen nach Angaben von EQS eine realistische Einschätzung des aktuellen Reifegrads von KI in Compliance-Prozessen.

Konsistenz und Fehlerraten

Der Bericht prüfte auch, wie verlässlich die geprüften Modelle in sich sind. Bei mehrfach wiederholten Multiple-Choice-Aufgaben gaben die Systeme in über 95 Prozent der Fälle dieselbe Antwort. Halluzinationen, also sachlich falsche Angaben, traten in drei Fällen auf und entsprechen einer Rate von 0,71 Prozent. Die EQS Group bewertet das als Zeichen dafür, dass KI-Modelle bei klar definierten Aufgaben stabile und überprüfbare Ergebnisse liefern können. Da Fehler nicht ausgeschlossen sind, bleibt eine menschliche Kontrolle insbesondere bei sensiblen Inhalten oder regulatorischen Sachverhalten notwendig.

Prompt-Design und Modellwahl

In der Studie wurde außerdem untersucht, wie stark die Qualität der Ergebnisse von der Formulierung der Aufgabenstellung abhängt. Je präziser die Fragestellung – etwa bei Screening-Daten oder der Gewichtung von Vorwürfen – formuliert wurde, desto besser fielen die Resultate aus. Insbesondere GPT-5 und Gemini 2.5 Pro setzten laut EQS komplexe Anweisungen zuverlässig um, was als Vorteil für Compliance-Teams gilt, die mit umfangreichen Daten und differenzierten Regelwerken arbeiten.

Methodik und Aufbau der Untersuchung

Für den EQS AI Benchmark Report wurden die Modelle OpenAI GPT-5, GPT-4o und o3 sowie Google Gemini 2.5 Pro, Anthropic Claude Opus 4.1 und Mistral Large 2 geprüft. Testgrundlage waren 120 Aufgaben aus zehn Kernbereichen der Compliance, darunter Risikoanalysen, Whistleblowing-Auswertungen, Trainings-Evaluationen und regulatorische Analysen. Die Aufgaben wurden unter Mitwirkung von Compliance-Praktikerinnen und -Praktikern entwickelt und teilweise auf realen oder synthetischen Daten aufgebaut, etwa aus Personal- oder Trainingsinformationen und Policy-Texten. Offene Aufgaben wurden in Zusammenarbeit mit dem BCM durch Fachjurys bewertet.

Bedeutung für Praxis und Umsetzung

Nach Angaben der EQS Group liefert der Benchmark einen Einblick in den Stand der KI-Entwicklung im Compliance-Umfeld und soll Organisationen helfen, den Nutzen und die Grenzen von KI realistisch einzuordnen. Die Studie zeigt sowohl den technologischen Fortschritt als auch die bestehenden Einschränkungen bei komplexen Aufgaben. Sie verdeutlicht, dass KI menschliche Entscheidungen und Verantwortung im Compliance-Management nicht ersetzt, sondern ergänzen kann.



  • Zwei Neuzugänge bei Igel

    Zwei Neuzugänge bei Igel

    Christiane Ohlgart und Kris Hamner verstärken das Management-Team von Igel. Ohlgart wird als neue Finanzchefin und Hamner als neuer Personalchef zum Executive Team in San Francisco stoßen.

    mehr lesen: Zwei Neuzugänge bei Igel

  • Einheitliche Standards für die Industrie 4.0

    Einheitliche Standards für die Industrie 4.0

    In dem vom Bundesministerium für Wirtschaft und Energie geförderten Forschungsprojekt InterOpera wollen Forscherinnen und Forscher zusammen mit der Industrie einheitliche Methoden zur Umsetzung der Verwaltungsschale in der Praxis erarbeiten.

    mehr lesen: Einheitliche Standards für die Industrie 4.0

  • BSI fordert den Crashtest für Cyber-Sicherheit

    BSI fordert den Crashtest für Cyber-Sicherheit

    In seinem Branchenbild Automotive spricht sich das Bundesamt für Sicherheit in der Informationstechnik dafür aus, auch die Cybersicherheit in der Lieferkette der Automobilbauer bzw. in einem frühen Entwicklungsstadium in den…

    mehr lesen: BSI fordert den Crashtest für Cyber-Sicherheit

  • Schnittstellen validieren in regulierten Industrien

    Schnittstellen validieren in regulierten Industrien

    Die Richtlinie VDI/VDE 3516 Blatt 6 ‚Validierung im GxP-Umfeld – Validierung von Schnittstellen‘ ist im August 2021 erschienen. Sie lässt sich zur Validierung von Schnittstellen zwischen computergestützten Systemen im regulierten…

    mehr lesen: Schnittstellen validieren in regulierten Industrien

  • Motek 2021: Montagetechnik-Messe mit echten Menschen

    Motek 2021: Montagetechnik-Messe mit echten Menschen

    Fachbesucher der industriellen Automatisierungsbranche treffen sich vom 5. bis 8. Oktober auf dem Messeduo Motek/Bondexpo in Stuttgart. Beide Messen sollen als Präsenzmesse stattfinden.

    mehr lesen: Motek 2021: Montagetechnik-Messe mit echten Menschen

  • Materialmangel der Industrie verschärft sich

    Materialmangel der Industrie verschärft sich

    Der Materialmangel in der deutschen Industrie hat sich weiter verschärft. 69,2 Prozent der Industriefirmen in Deutschland klagten im August laut einer Umfrage des Ifo Instituts über Engpässe und Probleme bei…

    mehr lesen: Materialmangel der Industrie verschärft sich

  • T-Systems und Google arbeiten an souveräner Cloud

    T-Systems und Google arbeiten an souveräner Cloud

    Gemeinsam wollen T-Systems und Google Cloud ab Mitte 2022 eine souveräne Cloud für Deutschland zur Verfügung stellen. Der Betrieb der Cloud unterliegt dabei der Kontrolle von T-Systems.

    mehr lesen: T-Systems und Google arbeiten an souveräner Cloud

  • Open Industry 4.0 Alliance und Packaging Valley arbeiten zusammen

    Open Industry 4.0 Alliance und Packaging Valley arbeiten zusammen

    Open Industry 4.0 Alliance und Packaging Valley wollen gemeinsam die herstellerübergreifende Integration in der Verpackungsindustrie realisieren. Die Schwerpunkte der Zusammenarbeit liegen auf Master Data Management, Plant Analytics und Predictive Maintenance.

    mehr lesen: Open Industry 4.0 Alliance und Packaging Valley arbeiten zusammen

  • Pepperl+Fuchs übernimmt Aava

    Pepperl+Fuchs übernimmt Aava

    Das finnische Unternehmen Aava gehört ab sofort zur Pepperl+Fuchs-Gruppe. Das Unternehmen bietet u.a. Tablet Computer für die Industrie ab.

    mehr lesen: Pepperl+Fuchs übernimmt Aava

  • Manufacturing Execution-Systeme im Vergleich

    Manufacturing Execution-Systeme im Vergleich

    Der vom Trovarit Competence Center MES in Zusammenarbeit mit dem Fraunhofer Institut Produktionstechnik und Automatisierung (IPA) und dem VDI herausgegebene ’Aachener Marktspiegel Business Software – MES/Fertigungssteuerung 2021/2022‘, untersucht das Angebot…

    mehr lesen: Manufacturing Execution-Systeme im Vergleich

  • Weniger Kurzarbeit im August

    Weniger Kurzarbeit im August

    In Deutschland waren im August nach Angaben des Ifo Instituts 688.000 Menschen in Kurzarbeit, ein deutlicher Rückgang im Vergleich zum Vormonat. Die Lieferengpässe in der Industrie hatten demnach kaum Auswirkungen…

    mehr lesen: Weniger Kurzarbeit im August

  • Konjunkturerwartungen gehen zurück

    Konjunkturerwartungen gehen zurück

    Zum vierten Mal in Folge haben die ZEW-Konjunkturerwartungen ein Minus verzeichnet. Der Index lag in der September-Umfrage bei 26,5 Punkten nach 40,4 Punkten im Vormonat. Die aktuelle Lage wird jedoch…

    mehr lesen: Konjunkturerwartungen gehen zurück