KI-Modelle für Compliance-Aufgaben verglichen

Die EQS Group GmbH hat gemeinsam mit dem Berufsverband der Compliance Manager e.V. (BCM) die Leistungsfähigkeit von künstlicher Intelligenz im Bereich Compliance untersucht. Der veröffentlichte EQS AI Benchmark testete sechs große Sprachmodelle in 120 praxisnahen Anwendungen, darunter Risikoanalysen, Bewertungen von Interessenkonflikten und Third-Party-Screenings. Ziel war es, zu prüfen, inwieweit KI-Systeme den Anforderungen des Arbeitsalltags von Compliance-Fachleuten entsprechen. Bei strukturierten Aufgaben erzielten die getesteten Modelle laut EQS Group besonders hohe Genauigkeiten, während die Ergebnisse bei offenen oder mehrdeutigen Aufgaben deutlich uneinheitlicher waren.

%C2%A9nateejindakum AdobeStock 1535598481
Bild: ©nateejindakum/stock.adobe.com

Leistungsunterschiede und Fortschritte

Nach den Ergebnissen erreichen KI-Modelle bei eindeutig definierten Entscheidungsaufgaben durchschnittlich eine Genauigkeit von 90,8 Prozent und beim Datenabgleich von 91,8 Prozent. Vier der sechs Systeme lagen dabei über 95 Prozent. Bei komplexeren Analysen ergaben sich größere Unterschiede: Zwischen dem besten und dem schwächsten Modell betrug die Differenz 60 Prozentpunkte. Das Modell Gemini 2.5 Pro von Google erzielte den besten Wert mit 88 Prozent, während GPT-5 von OpenAI auf 62 Prozent und GPT-4o auf 28 Prozent kam. Im Gesamtranking belegte Gemini 2.5 Pro mit 86,7 Prozent knapp den ersten Platz vor GPT-5 mit 86,5 Prozent. GPT-5 zeigte laut EQS besondere Stärken bei kreativen Textaufgaben, während Gemini bei analytischen Aufgaben vorne lag. OpenAI o3 erreichte 83,3 Prozent, Claude Opus 4.1 von Anthropic 81,5 Prozent, GPT-4o 72,9 Prozent und Mistral Large 2 70,1 Prozent. Die Ergebnisse zeigen laut EQS Group den technischen Fortschritt zwischen 2024 und 2025.

Anwendungsmöglichkeiten und Grenzen

Die Analyse macht deutlich, dass die aktuellen KI-Modelle bei strukturierten Aufgaben verlässlich arbeiten, bei offenen Aufgaben oder Bewertungen jedoch Grenzen haben. Offene Aufgaben, etwa Management-Briefings oder Berichte zu internen Untersuchungen, wurden zusätzlich durch Fachjurys geprüft. GPT-5 erreichte in dieser Kategorie 67,4 Prozent. Die Ergebnisse unterstützen nach Angaben von EQS eine realistische Einschätzung des aktuellen Reifegrads von KI in Compliance-Prozessen.

Konsistenz und Fehlerraten

Der Bericht prüfte auch, wie verlässlich die geprüften Modelle in sich sind. Bei mehrfach wiederholten Multiple-Choice-Aufgaben gaben die Systeme in über 95 Prozent der Fälle dieselbe Antwort. Halluzinationen, also sachlich falsche Angaben, traten in drei Fällen auf und entsprechen einer Rate von 0,71 Prozent. Die EQS Group bewertet das als Zeichen dafür, dass KI-Modelle bei klar definierten Aufgaben stabile und überprüfbare Ergebnisse liefern können. Da Fehler nicht ausgeschlossen sind, bleibt eine menschliche Kontrolle insbesondere bei sensiblen Inhalten oder regulatorischen Sachverhalten notwendig.

Prompt-Design und Modellwahl

In der Studie wurde außerdem untersucht, wie stark die Qualität der Ergebnisse von der Formulierung der Aufgabenstellung abhängt. Je präziser die Fragestellung – etwa bei Screening-Daten oder der Gewichtung von Vorwürfen – formuliert wurde, desto besser fielen die Resultate aus. Insbesondere GPT-5 und Gemini 2.5 Pro setzten laut EQS komplexe Anweisungen zuverlässig um, was als Vorteil für Compliance-Teams gilt, die mit umfangreichen Daten und differenzierten Regelwerken arbeiten.

Methodik und Aufbau der Untersuchung

Für den EQS AI Benchmark Report wurden die Modelle OpenAI GPT-5, GPT-4o und o3 sowie Google Gemini 2.5 Pro, Anthropic Claude Opus 4.1 und Mistral Large 2 geprüft. Testgrundlage waren 120 Aufgaben aus zehn Kernbereichen der Compliance, darunter Risikoanalysen, Whistleblowing-Auswertungen, Trainings-Evaluationen und regulatorische Analysen. Die Aufgaben wurden unter Mitwirkung von Compliance-Praktikerinnen und -Praktikern entwickelt und teilweise auf realen oder synthetischen Daten aufgebaut, etwa aus Personal- oder Trainingsinformationen und Policy-Texten. Offene Aufgaben wurden in Zusammenarbeit mit dem BCM durch Fachjurys bewertet.

Bedeutung für Praxis und Umsetzung

Nach Angaben der EQS Group liefert der Benchmark einen Einblick in den Stand der KI-Entwicklung im Compliance-Umfeld und soll Organisationen helfen, den Nutzen und die Grenzen von KI realistisch einzuordnen. Die Studie zeigt sowohl den technologischen Fortschritt als auch die bestehenden Einschränkungen bei komplexen Aufgaben. Sie verdeutlicht, dass KI menschliche Entscheidungen und Verantwortung im Compliance-Management nicht ersetzt, sondern ergänzen kann.



  • Wenn Cyberangriffe schiefgehen

    Wenn Cyberangriffe schiefgehen

    Ransomware hat sich zu einem kriminellen Geschäft mit hohen Um- und Einsätzen entwickelt. Doch nicht jeder Angriff verläuft wie geplant. Der Security-Anbieter Sophos zählt einige Pannen auf.

    mehr lesen: Wenn Cyberangriffe schiefgehen

  • Universal Robots erzielt +75 Prozent

    Universal Robots erzielt +75 Prozent

    Nach einem großen Umsatzplus im zweiten Quartal rechnet Universal Robots auch im 3. Quartal mit einem zweistelligen Umsatzwachstum.

    mehr lesen: Universal Robots erzielt +75 Prozent

  • Internationale Lieferketten bleiben bestehen

    Internationale Lieferketten bleiben bestehen

    Deutsche Unternehmen halten an ihren international aufgestellten Lieferketten fest — trotz der Probleme während der Pandemie. Dabei setzen Großunternehmen auf mehr Zulieferer, kleinere und mittlere Unternehmen auf mehr Lagerhaltung, so…

    mehr lesen: Internationale Lieferketten bleiben bestehen

  • German Edge Cloud und Schuler kooperieren

    German Edge Cloud und Schuler kooperieren

    German Edge Cloud kooperiert mit dem Anlagenbauer Schuler. Im Zuge der Kooperation bietet Schuler innerhalb seiner Digital Suite eine Track- und Trace-Lösung für Presswerke an, die auf der Technologie der…

    mehr lesen: German Edge Cloud und Schuler kooperieren

  • Bechtle übernimmt Cadmes

    Bechtle übernimmt Cadmes

    Bechtle baut die Präsenz in den Niederlanden und Belgien aus. Das Unternehmen hat den CAD/CAM/PLM-Spezialisten Cadmes übernommen.

    mehr lesen: Bechtle übernimmt Cadmes

  • Wechsel in der Leitung bei ABB Elektrifizierung in Deutschland

    Wechsel in der Leitung bei ABB Elektrifizierung in Deutschland

    Torsten Nolting (Bild) übernimmt am 1. August die Leitung der Business Area Elektrifizierung in Deutschland. Er folgt damit auf Uwe Laudenklos, der am 1. April des Jahres zum Lead Business…

    mehr lesen: Wechsel in der Leitung bei ABB Elektrifizierung in Deutschland

  • Siemens erzielt Auftrags- und Umsatzplus

    Siemens erzielt Auftrags- und Umsatzplus

    Mit einem Auftrags- und Umsatzplus hat Siemens das dritte Quartal abgeschlossen. Der Ausblick für das aktuelle Geschäftsjahr wurde zudem angehoben.

    mehr lesen: Siemens erzielt Auftrags- und Umsatzplus

  • Wieder mehr persönlicher Kundenkontakt in der Industrie

    Wieder mehr persönlicher Kundenkontakt in der Industrie

    Im Zuge der Pandemie setzten viele Unternehmen auf digitale Kommunikation. Laut einer Umfrage des Finanzdienstleisters CBAF treffen vier von fünf Industrieunternehmen ihre Kunden wieder persönlich. Probleme haben die Befragten derzeit…

    mehr lesen: Wieder mehr persönlicher Kundenkontakt in der Industrie

  • Hoher Schaden für die deutsche Wirtschaft

    Hoher Schaden für die deutsche Wirtschaft

    Ein Schaden in Höhe von 223Mrd.€ entsteht der deutschen Wirtschaft jährlich durch Diebstahl, Spionage und Sabotage. Allein Ransomware-Angriffe nahmen im Vergleich zu den Jahren 2018/2019 um 358 Prozent zu.

    mehr lesen: Hoher Schaden für die deutsche Wirtschaft

  • Software AG mit neuem Management-Team

    Software AG mit neuem Management-Team

    Die Software AG führt eine neue Management-Team-Struktur ein. Das neue Team soll aus den vier Vorstandsmitgliedern sowie zwei intern ernannten Mitgliedern bestehen und die Struktur ergänzen: Scott Little wird ab…

    mehr lesen: Software AG mit neuem Management-Team

  • HoreKa schafft 17 PetaFlops

    HoreKa schafft 17 PetaFlops

    Am KIT in Karlsruhe hat der neue Hochleistungsrechner HoreKa seine Arbeit aufgenommen. Die Rechenleistung des Supercomputers soll dabei unterschiedlichen Forschungsdisziplinen neue Erkenntnisse ermöglichen.

    mehr lesen: HoreKa schafft 17 PetaFlops

  • Wo Technologien berufliche Tätigkeiten ersetzen können

    Wo Technologien berufliche Tätigkeiten ersetzen können

    Der Anteil der Tätigkeiten, die heute schon potenziell von Computern erledigt werden könnten, ist in Fachkraftberufen mit 4,6 und Spezialistenberufen mit 4,8 Prozentpunkten zwischen 2016 und 2019 stark angestiegen. In…

    mehr lesen: Wo Technologien berufliche Tätigkeiten ersetzen können