Logo von rethink.expert
Insight · 19. September 2026 · AI Agents & Automation

Wenn KI arbeitet, läuft der Zähler mit: Warum Unternehmen bei AI Agents neu über Kosten nachdenken müssen

Michael MohauptVon Michael Mohaupt
AI AgentsKI-KostenFinOps

„Tokenmaxxing“ klingt nach einem weiteren Buzzword aus der KI-Bubble. Dahinter steckt aber eine Entwicklung, die für Unternehmen ziemlich handfest werden kann: Mit autonomen AI Agents verändert sich die Kostenlogik von Software – weg von der planbaren Lizenz, hin zu einer Rechnung, die mitläuft, während der Agent arbeitet.

250 %mehr Tokenverbrauch von Dezember 2024 bis Dezember 2025
98 %günstiger wurde ein Token im selben Zeitraum – trotzdem stiegen die Gesamtkosten

Ein Rebound-Effekt: Sinkende Preise pro Token haben die Ausgaben nicht gesenkt, sondern den Verbrauch beflügelt.

Auf einen Blick
  • →„Tokenmaxxing“ bezeichnet die Praxis, Mitarbeitende zu maximalem KI-Tokenverbrauch anzuhalten – teils über interne Leaderboards, teils als informelle Erwartungshaltung.
  • →Zwischen Dezember 2024 und Dezember 2025 stieg der Tokenverbrauch um 250 %, während der Preis pro Token im selben Zeitraum um rund 98 % fiel – die Gesamtkosten sanken trotzdem nicht.
  • →Uber soll laut Berichten sein komplettes KI-Budget für 2026 (rund 2,97 Mrd. €) bereits nach vier Monaten mit 5.000 Entwicklern aufgebraucht haben; ein Anthropic-Kunde erhielt Berichten zufolge eine Rechnung über 439 Mio. €.
  • →Bei Amazon sollen Mitarbeitende ihren Tokenverbrauch künstlich erhöht haben, um interne Zielvorgaben zu erfüllen – ein Beispiel dafür, dass eine falsche Metrik falsches Verhalten erzeugt.
  • →Schon die Wahl der Programmiersprache beeinflusst laut einer aktuellen Studie den Tokenverbrauch von Coding-Agents um bis zu 69 % – ein Beleg dafür, dass Tokenmenge allein keine Produktivität misst.
Was ist passiert

Sinkende Tokenpreise, steigende Gesamtkosten

Software war für Unternehmen lange vergleichsweise einfach kalkulierbar: eine Lizenz pro Nutzer und Monat, mehr Mitarbeiter bedeuten mehr Lizenzen. Bei AI Agents funktioniert diese Logik nicht mehr. Ein Agent bekommt eine Aufgabe, analysiert sie, durchsucht Daten, ruft Tools auf, bewertet Zwischenergebnisse und versucht es womöglich noch einmal – jeder dieser Schritte kann neue Modellaufrufe und damit neue Token erzeugen. Für die Maximierung dieser Nutzung hat sich inzwischen sogar ein Begriff etabliert: „Tokenmaxxing“ – die informelle bis formelle Praxis, Mitarbeitende zu maximalem Tokenverbrauch anzuhalten, teils über interne Leaderboards.

Wie konkret das werden kann, zeigen mehrere öffentlich berichtete Fälle: Nvidia-Chef Jensen Huang äußerte sich im März 2026 „deeply alarmed“, sollte ein 500.000-Dollar-Entwickler nicht mindestens 250.000 Dollar jährlich in Tokens investieren. Bei Meta konkurrierten Mitarbeitende intern um Ränge wie „Token Legend“ oder „Session Immortal“. Uber soll sein komplettes KI-Budget für 2026 – rund 2,97 Mrd. € – bereits nach vier Monaten mit 5.000 Entwicklern aufgebraucht haben. Ein Anthropic-Kunde erhielt Berichten zufolge eine Rechnung über 439 Mio. €. Und bei Amazon sollen Mitarbeitende ihren Tokenverbrauch künstlich erhöht haben, um interne Zielvorgaben zu erfüllen.

Gleichzeitig ist Rechenleistung pro Token deutlich günstiger geworden: von rund 18 € pro Million Token (2022) auf etwa 0,35 € (2026). Trotzdem sanken die Gesamtkosten nicht – im Gegenteil.

Zwei Kurven, ein Rebound-Effekt
Preis pro Million Token (2022–2026)−98 %
Tokenverbrauch (Dez. 2024–Dez. 2025)+250 %
gesunkengestiegen
Warum das relevant ist

Tokenverbrauch ist noch keine Produktivität

Ein Agent, der für eine Aufgabe zehn Millionen Token benötigt, ist nicht automatisch produktiver als einer, der dasselbe Ergebnis mit einer Million erreicht. Im Gegenteil: Ein hoher Verbrauch kann genauso gut bedeuten, dass unnötig große Kontexte übertragen werden, das falsche Modell zum Einsatz kommt oder sich Prozesse in Schleifen bewegen. Damit wiederholt sich ein bekanntes Muster: Gemessen wird zunächst, was technisch leicht messbar ist – nicht unbedingt, was wirtschaftlich relevant ist.

Wie stark technische Details den Tokenverbrauch beeinflussen können, ohne dass sich am eigentlichen Ergebnis etwas ändert, zeigt eine aktuelle Studie zu Coding-Agents: Bei identischen Programmieraufgaben variierte der Tokenverbrauch allein durch die gewählte Programmiersprache erheblich – über fünf Modelle, vier Sprachen und 100 Aufgaben hinweg (2.000 Agent-Sessions insgesamt).

1,0×Python (Baseline)
0,85–1,34×Java
1,07–1,57×Rust
1,28–1,69×OCaml

Tokenverbrauch relativ zu Python, je nach Modell – dieselbe Aufgabe, unterschiedliche Sprache.

Reality Check

Behauptung: „Hoher Tokenverbrauch ist ein Beleg für intensive, wertschöpfende KI-Nutzung.“

Einordnung: Nein. Ein Agent, der für dieselbe Aufgabe zehn Millionen Token benötigt, ist nicht automatisch produktiver als einer mit einer Million – hoher Verbrauch kann genauso gut Ineffizienz, falsche Modellwahl oder Verarbeitungsschleifen bedeuten.

Behauptung: „Sinkende Tokenpreise senken automatisch die KI-Gesamtkosten von Unternehmen.“

Einordnung: Das Gegenteil war zuletzt der Fall: Der Preis pro Token fiel um rund 98 %, der Verbrauch stieg im selben Zeitraum um 250 % – ein klassischer Rebound-Effekt.

Behauptung: „Die genannten Einzelfälle (Uber, ein Anthropic-Kunde, Amazon) sind repräsentativ für die KI-Kosten typischer Unternehmen.“

Einordnung: Nein. Das sind öffentlich berichtete Extremfälle von Konzernen mit tausenden Entwicklern – kein Beleg für typische Kosten im Mittelstand, auch wenn sie das strukturelle Risiko illustrieren.

Behauptung: „Der Sprachvergleich beweist, dass Python immer die günstigste Wahl für Coding-Agents ist.“

Einordnung: Die Studie zeigt Python als Baseline mit dem niedrigsten Durchschnittsverbrauch, aber die Spanne variiert je nach Modell – bei einem Modell war Java sogar leicht günstiger als Python. Getestet wurden zudem nur vier Sprachen (Python, Java, Rust, OCaml), keine Aussage etwa über JavaScript oder Go.

Was das für Unternehmen heißt

Von Cost per Token zu Cost per Outcome

Als Gegenentwurf zum Tokenmaxxing hat sich der Begriff „Valuemaxxing“ etabliert – geprägt von Marc Boroditsky, Chief Revenue Officer bei Nebius. Statt Tokenverbrauch zu messen, fragt Valuemaxxing nach abgeschlossenen Aufgaben, eingesparter Entwicklerzeit und vermiedener Nacharbeit:

„Token consumption is a cost signal, not a value metric.“ — IBM
Cost per Token
wird als Steuerungsgröße abgelöst von
Cost per Outcome

Daraus entsteht praktisch eine Art KI-Ableger des aus der Cloud-Welt bekannten FinOps-Gedankens: Kosten je Agent und Workflow, Tokenverbrauch je erfolgreichem Ergebnis, Anzahl und Kosten von Retries, Modellwahl je Teilaufgabe, Tool Calls und externe API-Kosten sowie der menschliche Kontroll- und Nachbearbeitungsaufwand. Erst zusammen ergeben diese Größen eine belastbare Aussage darüber, ob ein Agent wirtschaftlich arbeitet – ein günstiger Token ist noch kein günstiger Prozess.

1

Kosten pro Agent und Workflow einem konkreten Ergebnis zuordnen, nicht nur dem Tokenverbrauch.

2

Prüfen, ob interne Anreize – Leaderboards, Zielvorgaben – versehentlich Tokenverbrauch statt Wertschöpfung belohnen und damit Gaming-Verhalten erzeugen.

3

Modellwahl, Kontextgröße, Tool-Auswahl und Programmiersprache als Kostenhebel behandeln, nicht als technisches Detail.

rethink

Die richtige Frage ist nicht, wie viel KI genutzt wird

Unternehmen dürfen KI-Nutzung nicht mit KI-Wertschöpfung verwechseln. Bei Copiloten – KI-Assistenten, die pro Schritt einen Vorschlag machen und auf menschliche Bestätigung warten – ließ sich ineffiziente Nutzung noch relativ leicht übersehen; bei autonomen Agenten, die mehrere Schritte selbstständig hintereinander ausführen, wird sie unmittelbar zu variablen Betriebskosten. Die entscheidende Kennzahl ist am Ende weder die Zahl der eingesetzten Agenten noch die Menge der verbrauchten Token, sondern: Was kostet ein verlässlich erreichtes Ergebnis – und was wäre dieses Ergebnis ohne den Agenten wert?

Verwandter Gedanke

Dieselbe Verwechslung: Aktivität ist kein Erfolg

Der Insight „Spezifikation statt Ausführung“ beschreibt, warum die reine Ausführung einer Aufgabe durch einen Agenten nicht automatisch bedeutet, dass sie auch richtig oder wirtschaftlich sinnvoll erledigt wurde. Tokenmaxxing ist die ökonomische Variante desselben Problems: Aktivität – hier in Tokens gemessen – wird mit Erfolg verwechselt.

Häufige Fragen

Kurz beantwortet

Die Praxis, Mitarbeitende zu möglichst hohem KI-Tokenverbrauch anzuhalten – oft in der Annahme, dass mehr Verbrauch automatisch mehr Produktivität bedeutet. Teils wird das informell erwartet, teils formell über interne Leaderboards oder Zielvorgaben durchgesetzt.

Weil ihre Kosten variabel statt planbar sind: Jeder Analyseschritt, Tool-Aufruf und Wiederholungsversuch eines Agenten erzeugt neue Token – und damit neue Kosten. Die Rechnung hängt von Aufgabe, Kontextgröße, Modellwahl und Anzahl der Schritte ab, nicht von einer festen Lizenzgebühr.

Der Gegenentwurf zum Tokenmaxxing: Statt Tokenverbrauch zu maximieren, misst Valuemaxxing Ergebnisse – abgeschlossene Aufgaben, eingesparte Zeit, vermiedene Nacharbeit. Die zentrale Frage lautet nicht mehr „Wie viel KI nutzen wir?“, sondern „Was kostet ein erfolgreiches Ergebnis?“.

Indem sie Kosten pro Agent und Workflow einem konkreten Ergebnis zuordnen, interne Anreize auf Wertschöpfung statt Tokenverbrauch ausrichten und Modellwahl, Kontextgröße sowie technische Details wie die Programmiersprache aktiv als Kostenhebel behandeln.

Wie Sie einordnen, ob Ihre KI-Agenten wirtschaftlich arbeiten – und wo Tokenverbrauch von tatsächlichem Ergebnis abweicht.

Beratungsgespräch vereinbaren →