# Was bleibt nach dem Token?

> Die Intelligenz können wir einkaufen. Die Lernkurve müssen wir behalten. Warum nach jedem KI-Lauf mehr zurückbleiben muss als sein Output.

- **Autor:** Dominic Asche
- **Datum:** 09 / 2026
- **Lesezeit:** 5 min
- **URL:** https://fse-group.de/thinktank/was-bleibt-nach-dem-token

Unsere Tokenrechnung steigt, seit Agenten bei uns mitarbeiten. Die interessante Frage ist nicht, wie hoch sie ausfällt. Sondern was übrig bleibt, wenn der Token verbraucht ist.

Das Investment in KI steigt, bei uns wie überall. Das kann sich lohnen. Aus unserer Sicht aber nur dann, wenn dabei mehr entsteht als Output: ein System, das mit jeder Nutzung besser wird.

Seit wir KI bei FSE ernsthaft einsetzen, ist mit unserer Produktivität auch unsere tägliche Tokenrechnung gestiegen. Wir haben Agenten ins Team geholt, die nicht nur antworten, sondern arbeiten: Informationen lesen, entscheiden, Werkzeuge benutzen, Ergebnisse prüfen und bei Bedarf noch einmal ansetzen. Das kostet Konzept, Entwicklung und eben Tokens.

Diese Rechnung wird eher wachsen als schrumpfen. Bei OpenAI entfielen im Juni bereits 64 Prozent der kombinierten Output-Tokens von ChatGPT und Codex im Enterprise-Bereich auf Codex. Unternehmen im oberen Zehntel der Nutzung erzeugten pro aktivem Nutzer 8,3-mal so viele Output-Tokens wie typische Unternehmen. OpenAI schränkt dabei selbst ein: Tokenvolumen misst keinen Geschäftswert. Es zeigt, wie intensiv KI genutzt und wie viel Arbeit an sie abgegeben wird. [1]

Daten von OpenRouter zeigen denselben Effekt aus einer anderen Richtung. Agentische Anwendungen verbrauchen inzwischen fast fünfmal so viele Tokens wie menschliche Nutzer, und mehr als 85 Prozent davon entfallen auf gecachten Kontext. Das ist plausibel: Ein Chat folgt dem Muster Frage und Antwort. Ein Agent iteriert auf ein Ziel hin. [2]

An diesen Zahlen interessiert uns weniger die Menge. Uns interessiert, was übrig bleibt, wenn die Tokens verbraucht sind.

![Infografik mit dem Titel Aus Nutzung wird Fähigkeit zur Frage, was nach dem Token bleibt. Oben eine Kette in vier Schritten: erstens wird aus einem Fehler ein Eval, zweitens aus einer Anweisung eine Regel, drittens aus einem Vorgehen ein Tool, viertens aus einem Guardrail eine technische Grenze. Darunter ein Liniendiagramm mit dem Titel Agenten verbrauchen weit mehr Tokens als Menschen, ein 7-Tage-Durchschnitt des Tokenverbrauchs auf OpenRouter nach Typ. Die Linie für agentische Nutzung liegt lange flach und steigt dann steil an, während menschliche und gemischte Nutzung nur leicht zunehmen. Agentische Anwendungen verbrauchen fast fünfmal so viele Tokens wie menschliche Nutzer, mehr als 85 Prozent davon entfallen auf gecachten Kontext. Quelle OpenRouter, Auswertung a16z vom 21.08.2026. Am Fuß drei Konsequenzen: Evals statt Erfahrung, damit Verbesserung reproduzierbar wird; Regeln in den Harness statt in den Prompt; modellagnostisch bleiben und die Lernkurve behalten.](https://fse-group.de/media/think-pieces/20260901_thinktank-token.png)

### Mehrmals für dieselbe Erkenntnis bezahlen

Ein Agent macht einen Fehler. Wir analysieren ihn, schärfen seinen Prompt, beim nächsten Mal läuft es. Gut.

Steckt diese Erkenntnis aber nur in diesem einen Prompt oder im Kopf einer Kollegin, ist wenig gewonnen. Beim nächsten Agenten, beim nächsten Modell, in einem anderen Prozess fängt die Arbeit von vorne an. Wir kaufen also noch einmal Intelligenz ein, um etwas herauszufinden, das wir längst gelernt hatten.

Nicht der einzelne Token ist zu teuer. Teuer wird es, dieselbe Erkenntnis immer wieder neu zu erzeugen.

### Was nach dem Lauf zurückbleiben muss

Nach einem KI-Lauf muss deshalb mehr bleiben als sein Ergebnis. Aus einem Fehler kann ein Eval werden. Aus einer wiederkehrenden Anweisung eine feste Regel. Aus einem bewährten Vorgehen ein Tool. Und ist ein Guardrail wirklich wichtig, sollte ihn kein Modell mehr interpretieren müssen, sondern die Technik durchsetzen.

Der Token ist weg. Die Fähigkeit, die ins System gewandert ist, bleibt.

Das hat verändert, wie wir unsere eigene Agentenplattform weiterentwickeln. Am Anfang steckte viel Logik in standardisierten Agentenbeschreibungen: erlaubte Werkzeuge, Regeln, Grenzen, Prüfungen. Dem Modell wurde möglichst genau erklärt, was es darf und was nicht. Das funktionierte erstaunlich gut.

Mit jedem weiteren Agenten wuchsen zwei Probleme. Der Kontext wurde größer, und dieselben Regeln tauchten an mehreren Stellen auf. Inkonsistenzen häuften sich, wir steuerten nach, und die Regeldateien wuchsen weiter. Irgendwann stand eine einfache Frage im Raum: Wenn uns eine Regel wirklich wichtig ist, warum bitten wir das Modell dann nur darum, sie einzuhalten?

### Regeln gehören in den Harness, nicht in den Prompt

Aus der Frage wurde ein kleiner, aber wirksamer Umbau. Wichtige Guardrails, Regeln und Werkzeuge sind aus den Markdown-Dateien und Prompts heraus und in unseren eigenen Harness hineingewandert.

Aus „verwende nur diese Tools“ werden Berechtigungen. Aus „höre nach X Schritten auf“ wird eine technische Grenze. Aus „prüfe dein Ergebnis“ werden definierte Gates und Readbacks. Und aus „der Agent scheint jetzt besser zu laufen“ werden Evals.

Der Grund dafür ist nicht in erster Linie Governance. Wir wissen nur so, ob unser System tatsächlich besser wird. Ein Fehler, den wir heute korrigieren, ist eine Erfahrung. Ein Fehler, aus dem ein Eval wird, verändert unsere Qualitätsmessung dauerhaft. Beim Modellwechsel lässt sich dann prüfen, ob die neue Variante besser oder schlechter abschneidet. Verbesserung wird reproduzierbar.

Unsere eigentliche Investition ist deshalb nicht der einzelne Agent. Sie liegt in der Fähigkeit, das Gesamtsystem messbar besser zu machen.

### Die Intelligenz darf wechseln, die Lernkurve nicht

Dazu passt eine zweite Entwicklung. Das Stanford Institute for Human-Centered AI hat die Inferenzkosten für Modellleistung auf GPT-3.5-Niveau verglichen: von 20 Dollar je Million Tokens im November 2022 auf 0,07 Dollar im Oktober 2024. Das ist ungefähr Faktor 280. [3]

Daraus folgt nicht, dass alle Modelle gleich werden. Unsere Schlussfolgerung ist kleiner: Der reine Zugang zu leistungsfähiger allgemeiner Modellintelligenz taugt immer weniger zur Unterscheidung.

Welches Modell für eine bestimmte Aufgabe vorne liegt, wird weiter wechseln. Heute Claude, morgen GPT, Gemini oder ein kleineres spezialisiertes Modell. Genau deshalb binden wir unsere Differenzierung so wenig wie möglich an einen einzelnen Anbieter. Modell und Harness müssen austauschbar sein. Bleiben müssen unsere Prozesse, Werkzeuge, Regeln, Evals, Traces und das Wissen darüber, was überhaupt ein gutes Ergebnis ist.

Satya Nadella argumentiert mit seinem „Reverse Information Paradox“ in eine ähnliche Richtung: Unternehmen sollten die Kontrolle über ihre Evals, ihr Feedback und ihre Lernumgebung behalten und die Wahl zwischen Modellen offenhalten. Sein fünftes Prinzip nennt er „Compound“. Nutzung soll den eigenen Vorsprung vergrößern. [4]

Für uns lässt sich das einfacher sagen: Die Intelligenz können wir einkaufen. Die Lernkurve müssen wir behalten.

### Was das für Energieversorger bedeutet

Das gilt für uns als IT-Dienstleister genauso wie für Unternehmen der Energiewirtschaft. Wenn am Ende alle auf dieselben leistungsfähigen Modelle zugreifen, entsteht Unterscheidung nicht dadurch, dass jemand Claude, GPT oder Gemini bedienen kann. Sie entsteht dort, wo aus dieser Intelligenz ein System wird, das reale Prozesse besser ausführt, Fehler nicht ständig wiederholt und seine Qualität nachweisbar steigert.

Für ein EVU wird das an einer Stelle sehr konkret. Wer einen Agenten für Klärfälle baut, sollte nicht nur zählen, wie viele Fälle er löst. Die härteren Fragen sind andere: Kommen die Fehlerbilder von vor drei Monaten heute noch vor? Greift eine Regel, die für die Abrechnung gilt, auch im Lieferantenwechsel? Und wenn das Modell gewechselt wird, wird das Ergebnis dann besser oder schlechter, und woher wissen wir das?

Wer diese Fragen nicht beantworten kann, hat keinen Agenten gebaut, sondern eine teure Gewohnheit.

Damit landet man bei einer ziemlich unspektakulären Frage, die vom Hype zurück zur Ökonomie führt: Was bekommen wir für unser Investment?

Mehr Tokens bedeuten mehr Nutzung. Mehr Output kann mehr Produktivität bedeuten. Interessant wird es aber erst, wenn nach der Nutzung etwas bleibt, das beim nächsten Mal besser funktioniert. Dann konsumieren wir nicht nur Intelligenz. Dann bauen wir eine Fähigkeit auf, und mit einer Fähigkeit lässt sich Wertschöpfung erzielen.

#### Quellenverzeichnis

- [1] OpenAI: [*Enterprise Signals: What frontier firms are doing differently*](https://openai.com/business/enterprise-signals/), aktualisiert am 12. August 2026.

- [2] Andreessen Horowitz: [*Charts of the Week: Agents Are Early, But They’re Already Changing Things*](https://www.a16z.news/p/charts-of-the-week-agents-are-early), 21. August 2026. Auswertung von OpenRouter-Daten.

- [3] Stanford Institute for Human-Centered AI: [*AI Index Report 2025*](https://hai.stanford.edu/ai-index/2025-ai-index-report), Kapitel Research and Development.

- [4] Cloudmagazin: [*Nadellas Paradox: Wer KI nutzt, zahlt zweimal*](https://cloudmagazin.com/2026/07/13/nadellas-paradox-wer-ki-nutzt-zahlt-zweimal/), 13. Juli 2026.
