KI-Modelle für Compliance-Aufgaben verglichen

Die EQS Group GmbH hat gemeinsam mit dem Berufsverband der Compliance Manager e.V. (BCM) die Leistungsfähigkeit von künstlicher Intelligenz im Bereich Compliance untersucht. Der veröffentlichte EQS AI Benchmark testete sechs große Sprachmodelle in 120 praxisnahen Anwendungen, darunter Risikoanalysen, Bewertungen von Interessenkonflikten und Third-Party-Screenings. Ziel war es, zu prüfen, inwieweit KI-Systeme den Anforderungen des Arbeitsalltags von Compliance-Fachleuten entsprechen. Bei strukturierten Aufgaben erzielten die getesteten Modelle laut EQS Group besonders hohe Genauigkeiten, während die Ergebnisse bei offenen oder mehrdeutigen Aufgaben deutlich uneinheitlicher waren.

%C2%A9nateejindakum AdobeStock 1535598481
Bild: ©nateejindakum/stock.adobe.com

Leistungsunterschiede und Fortschritte

Nach den Ergebnissen erreichen KI-Modelle bei eindeutig definierten Entscheidungsaufgaben durchschnittlich eine Genauigkeit von 90,8 Prozent und beim Datenabgleich von 91,8 Prozent. Vier der sechs Systeme lagen dabei über 95 Prozent. Bei komplexeren Analysen ergaben sich größere Unterschiede: Zwischen dem besten und dem schwächsten Modell betrug die Differenz 60 Prozentpunkte. Das Modell Gemini 2.5 Pro von Google erzielte den besten Wert mit 88 Prozent, während GPT-5 von OpenAI auf 62 Prozent und GPT-4o auf 28 Prozent kam. Im Gesamtranking belegte Gemini 2.5 Pro mit 86,7 Prozent knapp den ersten Platz vor GPT-5 mit 86,5 Prozent. GPT-5 zeigte laut EQS besondere Stärken bei kreativen Textaufgaben, während Gemini bei analytischen Aufgaben vorne lag. OpenAI o3 erreichte 83,3 Prozent, Claude Opus 4.1 von Anthropic 81,5 Prozent, GPT-4o 72,9 Prozent und Mistral Large 2 70,1 Prozent. Die Ergebnisse zeigen laut EQS Group den technischen Fortschritt zwischen 2024 und 2025.

Anwendungsmöglichkeiten und Grenzen

Die Analyse macht deutlich, dass die aktuellen KI-Modelle bei strukturierten Aufgaben verlässlich arbeiten, bei offenen Aufgaben oder Bewertungen jedoch Grenzen haben. Offene Aufgaben, etwa Management-Briefings oder Berichte zu internen Untersuchungen, wurden zusätzlich durch Fachjurys geprüft. GPT-5 erreichte in dieser Kategorie 67,4 Prozent. Die Ergebnisse unterstützen nach Angaben von EQS eine realistische Einschätzung des aktuellen Reifegrads von KI in Compliance-Prozessen.

Konsistenz und Fehlerraten

Der Bericht prüfte auch, wie verlässlich die geprüften Modelle in sich sind. Bei mehrfach wiederholten Multiple-Choice-Aufgaben gaben die Systeme in über 95 Prozent der Fälle dieselbe Antwort. Halluzinationen, also sachlich falsche Angaben, traten in drei Fällen auf und entsprechen einer Rate von 0,71 Prozent. Die EQS Group bewertet das als Zeichen dafür, dass KI-Modelle bei klar definierten Aufgaben stabile und überprüfbare Ergebnisse liefern können. Da Fehler nicht ausgeschlossen sind, bleibt eine menschliche Kontrolle insbesondere bei sensiblen Inhalten oder regulatorischen Sachverhalten notwendig.

Prompt-Design und Modellwahl

In der Studie wurde außerdem untersucht, wie stark die Qualität der Ergebnisse von der Formulierung der Aufgabenstellung abhängt. Je präziser die Fragestellung – etwa bei Screening-Daten oder der Gewichtung von Vorwürfen – formuliert wurde, desto besser fielen die Resultate aus. Insbesondere GPT-5 und Gemini 2.5 Pro setzten laut EQS komplexe Anweisungen zuverlässig um, was als Vorteil für Compliance-Teams gilt, die mit umfangreichen Daten und differenzierten Regelwerken arbeiten.

Methodik und Aufbau der Untersuchung

Für den EQS AI Benchmark Report wurden die Modelle OpenAI GPT-5, GPT-4o und o3 sowie Google Gemini 2.5 Pro, Anthropic Claude Opus 4.1 und Mistral Large 2 geprüft. Testgrundlage waren 120 Aufgaben aus zehn Kernbereichen der Compliance, darunter Risikoanalysen, Whistleblowing-Auswertungen, Trainings-Evaluationen und regulatorische Analysen. Die Aufgaben wurden unter Mitwirkung von Compliance-Praktikerinnen und -Praktikern entwickelt und teilweise auf realen oder synthetischen Daten aufgebaut, etwa aus Personal- oder Trainingsinformationen und Policy-Texten. Offene Aufgaben wurden in Zusammenarbeit mit dem BCM durch Fachjurys bewertet.

Bedeutung für Praxis und Umsetzung

Nach Angaben der EQS Group liefert der Benchmark einen Einblick in den Stand der KI-Entwicklung im Compliance-Umfeld und soll Organisationen helfen, den Nutzen und die Grenzen von KI realistisch einzuordnen. Die Studie zeigt sowohl den technologischen Fortschritt als auch die bestehenden Einschränkungen bei komplexen Aufgaben. Sie verdeutlicht, dass KI menschliche Entscheidungen und Verantwortung im Compliance-Management nicht ersetzt, sondern ergänzen kann.



  • Sicherheit vor Malware und Hackern

    Sicherheit vor Malware und Hackern

    Fernwirkanlagen und Scada-Systeme nutzen das Internet und sind damit potenziellen Angriffen von Hackern und Schadsoftware ausgesetzt. Auf der Seite der Datenbank kann auch das Unternehmen ConiuGo nur die bekannten Konzepte…

    mehr lesen: Sicherheit vor Malware und Hackern

  • Nutzung von Cloudanwendungen in Unternehmen

    Nutzung von Cloudanwendungen in Unternehmen

    Cloudanwendungen boomen: Aktuell gibt es nach Aussagen von führenden TÜV Rheinland-Experten mehr als 30.000 Cloudanwendungen weltweit, von denen Unternehmen aktiv durchschnittlich 1.500 Anwendungen nutzen – mit oder ohne Freigabe der…

    mehr lesen: Nutzung von Cloudanwendungen in Unternehmen

  • Maschinenbau baut digitale Dienste aus

    Maschinenbau baut digitale Dienste aus

    Fast 80 Prozent der Maschinenbauer sehen die Notwendigkeit, bei digitalen Geschäftsmodellen zu kooperieren. Das hat der VDMA in einer Befragung mit McKinsey ermittelt. Auf großes Wachtumspotenzial deutet dabei hin, dass…

    mehr lesen: Maschinenbau baut digitale Dienste aus

  • Anzeige
    Retarus beschleunigt Datenaustausch in der Produktion

    Retarus beschleunigt Datenaustausch in der Produktion

    Die Digitalisierungs- und Automatisierungslösungen von Retarus ermöglichen effiziente Abläufe ohne manuellen Aufwand oder Kompromisse bei der Datensouveränität

    mehr lesen: Retarus beschleunigt Datenaustausch in der Produktion

  • 15 Jahre SmartFactory Kaiserslautern

    15 Jahre SmartFactory Kaiserslautern

    Die Technologieinitiative SmartFactory KL feiert ihr 15-jähriges Bestehen. Heute beteiligen sich mehr als 50 Unternehmen und Wissenschaftseinrichtungen an der Initiative.

    mehr lesen: 15 Jahre SmartFactory Kaiserslautern

  • Eine Matte gegen Haltungsschäden

    Eine Matte gegen Haltungsschäden

    Wissenschaftler vom Fraunhofer-Institut für Produktionstechnik und Automatisierung IPA haben in Zusammenarbeit mit der Isoloc Schwingungstechnik GmbH eine Sensormatte für Steharbeitsplätze entwickelt. Sie erfasst die Fußposition eines Mitarbeiters und erkennt Gewichtsverlagerungen.

    mehr lesen: Eine Matte gegen Haltungsschäden

  • Verschlüsselungskomponenten, die Angreifern ausweichen

    Verschlüsselungskomponenten, die Angreifern ausweichen

    Verschlüsselungssoftware spielt auf dem Weg zu mehr Datenschutz eine wichtige Rolle, doch können Computersysteme auch auf physikalischem Wege angegriffen werden. Durch das Abfangen von Stromschwankungen oder das Auslösen von Fehlern…

    mehr lesen: Verschlüsselungskomponenten, die Angreifern ausweichen

  • Unternehmen sehen Notwendigkeit für mehr IoT-Sicherheit

    Unternehmen sehen Notwendigkeit für mehr IoT-Sicherheit

    Das Internet der Dinge ist für viele Unternehmen in Deutschland sowohl eine Chance als auch ein Risiko, so das Ergebnis einer aktuellen Studie im Auftrag von Palo Alto Networks.

    mehr lesen: Unternehmen sehen Notwendigkeit für mehr IoT-Sicherheit

  • Gaia-X-Mitglieder unterzeichnen Gründungsurkunde

    Gaia-X-Mitglieder unterzeichnen Gründungsurkunde

    Die Gründungsmitglieder der Gaia-X-Initiative haben die Gründungsurkunden zur Gaia-X AISBL unterzeichnet. Interessierte Unternehmen und Initiativen sind aufgerufen, sich an der gemeinnützigen Vereinigung zu beteiligen.

    mehr lesen: Gaia-X-Mitglieder unterzeichnen Gründungsurkunde

  • TÜV-Verband fordert Regulierung von KI-Anwendungen

    TÜV-Verband fordert Regulierung von KI-Anwendungen

    Der TÜV-Verband fordert in einem Positionspapier KI-gestützte Anwendungen und Systeme — etwa automatisierte Fahrzeuge oder Roboter — in Abhängigkeit vom Risiko zu regulieren.

    mehr lesen: TÜV-Verband fordert Regulierung von KI-Anwendungen

  • Was es bei der Container-Nutzung zu beachten gilt

    Was es bei der Container-Nutzung zu beachten gilt

    Die Nutzung von Containertechnologien steigt, was aber gilt es bei der Auswahl zu beachten? Der Software-Entwickler Red Hat gibt Antworten darauf.

    mehr lesen: Was es bei der Container-Nutzung zu beachten gilt

  • Kulturelle Werte ebenso wichtig wie die technologische Innovation

    Kulturelle Werte ebenso wichtig wie die technologische Innovation

    Wenn Unternehmen Digitalisierungsprojekte angehen, tun sie dies oft mit einem externen Partner. Die Frage ist nur mit welchem? IFS hat in einer Studie ermittelt, welche Faktoren bei der Auswahl eine…

    mehr lesen: Kulturelle Werte ebenso wichtig wie die technologische Innovation