Die Ära der kostenlosen KI ist vorbei

Alan Trefler
Bild: Pegasystems GmbH

Die Wirtschaftlichkeit großer Sprachmodelle steht kurz davor, mit der Unternehmensrealität zu kollidieren, schreibt Pegasystems-CEO Alan Trefler (Bild). Warum er das so sieht, beschreibt er in einem Kommentar:

In der ersten Phase der Einführung wurde KI meist in Form subventionierter, häufig nutzerbasierter, Preismodelle angeboten. Die Tokens schienen praktisch kostenlos zu sein. Das machte das Experimentieren einfach – vor allem für jene, die inzwischen regelrecht von ihrer täglichen Dosis KI-Agenten abhängig geworden sind. In manchen Unternehmen scheint die Nutzung inzwischen zum Selbstzweck geworden zu sein. Der absurde Trend des sogenannten Tokenmaxxing feiert Quantität statt Qualität, als ob sich Eingaben einfach mit Ergebnissen gleichsetzen lassen.

Doch jetzt, da die großen Sprachmodelle die Unternehmen an KI-Agenten gewöhnt haben, wird die eigentliche Rechnung fällig.

Hunderte Milliarden Dollar fließen derzeit in KI-Infrastrukturen und irgendjemand wird diese Kosten tragen müssen. Jüngste Schritte großer Anbieter deuten darauf hin, dass Token-basierte Abrechnungsmodelle zum Standard werden. Was zunächst wie ein All-you-can-eat-Buffet begann, verwandelt sich zunehmend in einen Taxameter.

Für viele Führungskräfte wird dabei die größere Überraschung nicht in den sichtbaren Output-Tokens liegen. Vielmehr ist entscheidend, dass im Hintergrund sogenannte Reasoning-Tokens verbraucht werden, wann immer ein Modell eine Entscheidung eigenständig herleitet. Und dann noch einmal überdenkt und neu bewertet. Genau diese Tokens sind die teuersten überhaupt, obwohl niemand ausdrücklich darum gebeten hat.

Reasoning-KI ist zwar leistungsstark, sie ist aber auch kostspielig, unvorhersehbar und oft unnötig. Jede operative Entscheidung immer wieder neu zu durchdenken, mag anspruchsvoll wirken, ist jedoch das Gegenteil von Disziplin. Sobald Logik, Richtlinien und Workflows sauber aufgesetzt sind, verursacht deren endloses Neugenerieren während des laufenden Betriebs unnötige Kosten und Risiken, ohne einen Mehrwert zu schaffen.

Reasoning in der Designphase, also dort, wo Kreativität, Exploration und neue Erkenntnisse gefragt sind, ist hingegen die Stärke generativer KI. Die Runtime-Ausführung ist jedoch etwas grundlegend anderes. Hier zählen Vorhersehbarkeit, Konsistenz und Kostenkontrolle mehr als Kreativität. Der Einsatz schlanker semantischer KI-Funktionen in dieser Phase ermöglicht es Agenten, definierte Workflows effizienter und kostengünstiger zu befolgen. Genau so lässt sich KI sinnvoll skalieren.

Nachhaltige KI ist keine Magie, sie basiert vielmehr auf klugen Abwägungen.

Die nächste Phase von Enterprise-KI wird weniger durch spektakuläre Demos als durch Disziplin geprägt sein. Durch vorhersehbare Ergebnisse und durch kalkulierbare Kosten. Und durch eine klare Entscheidung darüber, wann sich aufwendiges Reasoning wirklich lohnt und wann nicht.

Unternehmen, die sich frühzeitig mit der wachsenden Abhängigkeit von agentenbasierter KI auseinandersetzen und dabei auf Token-Effizienz und architektonische Klarheit setzen, werden nicht nur Kosten sparen. Sie werden auch Systeme aufbauen, die vertrauenswürdiger, leichter zu steuern und einfacher zu skalieren sind. Dies wird insbesondere dann von Vorteil sein, wenn KI nicht mehr als kostenlos wahrgenommen wird, sondern als realer wirtschaftlicher Faktor.



  • Bain analysiert den Markt für generative KI

    Bain analysiert den Markt für generative KI

    Auch abseits der großen KI-Modelle tut sich viel auf dem Markt für generative künstliche Intelligenz. Was? Das hat die Unternehmensberatung Bain & Company untersucht und Anbieter unter die Lupe genommen.

    mehr lesen: Bain analysiert den Markt für generative KI

  • So viele unbesetzte Ausbildungsstellen wie nie zuvor

    So viele unbesetzte Ausbildungsstellen wie nie zuvor

    Im Jahr 2023 wurden wieder mehr neue Ausbildungsverträge abgeschlossen. Dennoch hat der Anteil unbesetzter Ausbildungsstellen ein Rekordhoch erreicht.

    mehr lesen: So viele unbesetzte Ausbildungsstellen wie nie zuvor

  • Teilchenbeschleuniger ressourcenschonend betreiben

    Teilchenbeschleuniger ressourcenschonend betreiben

    Ein ressourcenschonender Betrieb von Teilchenbeschleunigern und anderen Großanlagen ist Ziel des EU-Forschungsprojekts Research Facility 2.0 (RF 2.0). Seit Jahresbeginn arbeiten zehn europäische Projektpartner, koordiniert vom Karlsruher Instituts für Technologie (KIT),…

    mehr lesen: Teilchenbeschleuniger ressourcenschonend betreiben

  • Anzeige
    Retarus beschleunigt Datenaustausch in der Produktion

    Retarus beschleunigt Datenaustausch in der Produktion

    Die Digitalisierungs- und Automatisierungslösungen von Retarus ermöglichen effiziente Abläufe ohne manuellen Aufwand oder Kompromisse bei der Datensouveränität

    mehr lesen: Retarus beschleunigt Datenaustausch in der Produktion

  • Ein Kompetenzzentrum für den digitalen Zwilling

    Ein Kompetenzzentrum für den digitalen Zwilling

    Mit der Gründung eines Digital Twin Center of Excellence (CoE) wollen Altair und L&T Technology Services gemeinsamen Kunden in den Bereichen Mobilität, Hightech und Nachhaltigkeit weltweit Technologien für digitale Zwillinge…

    mehr lesen: Ein Kompetenzzentrum für den digitalen Zwilling

  • Jährlicher Wertschöpfungsverlust von 13 Milliarden Euro

    Jährlicher Wertschöpfungsverlust von 13 Milliarden Euro

    Im ersten Quartal 2024 ist die Gesamtzahl an offenen Stellen in Ingenieurberufen im Vorjahresvergleich um 15,6% auf 148.000 gesunken, bleibt aber weiterhin auf hohem Niveau.

    mehr lesen: Jährlicher Wertschöpfungsverlust von 13 Milliarden Euro

  • AMDT ernennt Eva Wittka zur neuen COO des Executive Board

    AMDT ernennt Eva Wittka zur neuen COO des Executive Board

    Eva Wittka bringt ihre Erfahrungen aus verschiedenen Führungspositionen in den Bereichen IT und SaaS zukünftig als neue Chief Operating Officer (COO) bei AMDT ein.

    mehr lesen: AMDT ernennt Eva Wittka zur neuen COO des Executive Board

  • Classiq stellt Qmod vor

    Classiq stellt Qmod vor

    Als High-Level-Programmiersprache bietet Qmod Hardware-agnostische Modellierungsmethoden für die Quantenprogrammierung in Forschung und Industrie.

    mehr lesen: Classiq stellt Qmod vor

  • Swap-IT: Eine hochflexible Produktionsarchitektur für unterschiedliche Branchen

    Swap-IT: Eine hochflexible Produktionsarchitektur für unterschiedliche Branchen

    Produzierende Unternehmen müssen heute mit vielschichtigen Herausforderungen umgehen. Dazu gehören unter anderem Stückzahlbandbreiten von der Losgröße 1 bis zu größeren Serien und nicht zuletzt der Umgang mit Verzögerungen und Ausfällen…

    mehr lesen: Swap-IT: Eine hochflexible Produktionsarchitektur für unterschiedliche Branchen

  • Unternehmen halten am Homeoffice fest

    Unternehmen halten am Homeoffice fest

    Durch die Corona-Pandemie haben sich Homeoffice-Modelle in deutschen Unternehmen etabliert. Und wie eine ZEW-Studie zeigt, erwarten Firmen sogar einen weiteren Anstieg des Angebots.

    mehr lesen: Unternehmen halten am Homeoffice fest

  • Siemens erweitert Vorstand

    Siemens erweitert Vorstand

    Siemens hat Personalentscheidungen auf Vorstandsebene verkündet und den Vorstand des Konzern von fünf auf sieben Vorstandsmitglieder erweitert.

    mehr lesen: Siemens erweitert Vorstand

  • Wie die Deutschen mit KI-Bots sprechen

    Wie die Deutschen mit KI-Bots sprechen

    Knapp die Hälfte (46 Prozent) der Deutschen hat schon einmal einen KI-Chatbot verwendet – und pflegt dabei unterschiedliche Umgangsformen.

    mehr lesen: Wie die Deutschen mit KI-Bots sprechen