Die wichtigsten Erkenntnisse
- Kostengleichung: Die gesamten KI-Kosten spiegeln das Token-Volumen und den effektiven Token-Tarif wider.
- Aufwärtstreiber: Agenten, Premium-Modelle, mehr Anfragen und zusätzliche Tools können die Ausgaben erhöhen.
- Sparhebel: Caching, kürzerer Kontext und Output sowie passende Verarbeitungsmodi können die Kosten senken.
- Diagnostische Signale: Jeder Treiber wirkt sich unterschiedlich auf Volumen, Kosten pro Anfrage, effektiven Tarif oder Anbieterzahl aus.
KI-Token-Kosten können steigen, obwohl Mitarbeiterzahl und Softwareverträge unverändert bleiben. Token sind Verbrauchseinheiten. Jeder Prompt, jede Antwort, jedes Dokument, jeder automatisierte Aufruf und jeder Wiederholungsversuch kann deshalb zusätzliche Kosten verursachen.
Um Veränderungen zu erklären, muss die Finanzabteilung Nutzung, Modellwahl, Token-Arten, Caching und Verarbeitungsmodus getrennt betrachten. Die Gesamtrechnung zeigt, dass sich etwas verändert hat. Erst die Nutzungsdaten zeigen, warum.
Behalten Sie Ihre KI-Token-Ausgaben zentral im Blick
Um Kostentreiber zu erkennen, benötigen Finanzteams eine gemeinsame Übersicht. Token-Ausgaben verteilen sich häufig auf Mitarbeitende, automatisierte Workflows und verschiedene Anbieter, während die Finanzabteilung oft erst Einblick erhält, nachdem die Kosten bereits entstanden sind.
Deshalb haben wir den Moss AI Token Cost Tracker entwickelt: ein kostenloses Dashboard, das lokal auf Ihrem Computer läuft und die KI-Ausgaben Ihrer verbundenen Anbieter in einer auf das Finanzteam zugeschnittenen Übersicht zusammenführt. So können Sie Kosten bis auf Ebene des Anbieters, Modells, Teams, der Person, des API-Keys oder Workflows zurückverfolgen.
Probieren Sie den Tracker selbst aus. Folgen Sie dazu einfach dem Video-Tutorial und der Schritt-für-Schritt-Anleitung für Ihr System:
Getting started
Works with Claude Code, OpenAI's Codex, and other terminal-based AI coding agents. Copy this prompt and paste it into your agent - it will clone the repo, install dependencies, and start the app for you.
Clone and set up the moss-ai-token-cost-tracker tool for me. Act as my setup assistant using your file system and terminal access: 1. First check whether the current folder (or a `moss-ai-token-cost-tracker` subfolder) already contains this tool (look for server.mjs and index.html). If it's already there, run `git pull` inside that folder to get the latest changes, then skip straight to step 3. 2. Otherwise, clone the repo: git clone https://github.com/getmoss/moss-ai-token-cost-tracker then work from inside that folder, and check whether Git, nvm, and the Node.js version this repo's README requires are installed, installing or switching to whatever is missing. 3. Ask me whether I want to run it in production mode (connecting my real accounts with API keys) or demo mode (mocked data, so I can just see how it looks without any API keys). Wait for my answer before continuing. 4. Double check that everything needed is set up correctly, and then run `npm start` for production mode, or `npm run demo` for demo mode, based on my answer. 5. Watch the terminal output for errors. If something fails, diagnose the root cause, explain it to me in plain language, and either fix it or tell me exactly what to run. 6. Tell me the URL to open in my browser once the server is running. 7. Later, if I ask you to stop or restart the tool, do that for me. Important: never read, print, or send the contents of my .env file, and never share any API keys or company data outside this terminal session.
Was ist ein KI-Token?
Ein Token ist eine kleine Texteinheit, die ein KI-Modell verarbeitet. Dabei kann es sich um ein Wort, einen Wortteil, eine Zahl oder ein Satzzeichen handeln. Die genaue Anzahl hängt von Modell, Sprache und Inhalt ab.
Für die Abrechnung sind vor allem drei Arten relevant:
- Eingabe-Token umfassen Prompts, Dokumente, Systemanweisungen und den relevanten Gesprächsverlauf.
- Ausgabe-Token umfassen die Antwort des Modells und werden häufig zu einem höheren Tarif abgerechnet.
- Zwischengespeicherte Token sind wiederkehrende Teile der Eingabe, die aus einem Cache erneut verwendet und je nach Anbieter günstiger abgerechnet werden können.
Die Finanzabteilung braucht deshalb mehr als die Gesamtsumme. Sie muss erkennen können, welche Form der Nutzung sich verändert hat und welcher der folgenden acht Treiber dahintersteht.
1. Agentenbasierte Workflows und versteckte Aufrufe
Eine einzelne Anfrage kann einen KI-Agenten dazu veranlassen, mehrere Schritte auszuführen. Der Agent plant, recherchiert, ruft Tools auf, prüft sein Ergebnis und startet möglicherweise weitere Versuche. Mitarbeitende lösen nur eine Aufgabe aus, während im Hintergrund zahlreiche Modellaufrufe entstehen.
Schleifen, unnötige Zwischenschritte und wiederholte Korrekturversuche können die Kosten zusätzlich erhöhen. Entwicklungs- und IT-Teams sollten deshalb die maximale Anzahl von Schritten, Aufrufen und Wiederholungsversuchen begrenzen. Auch ein Budget oder eine maximale Laufzeit pro Ausführung kann starke Ausreißer verhindern.
Finanzsignal: Nach der Einführung eines automatisierten Workflows steigen Aufrufe und Kosten deutlich. Gleichzeitig erhöhen sich die Kosten pro erfolgreich abgeschlossener Aufgabe gegenüber der begleiteten Testphase.
2. Wechsel zu teureren Modellen
Ein Team kann zu einem leistungsfähigeren Modell wechseln, ohne ein neues Tool zu beschaffen oder die Zahl der Anfragen zu verändern. Auch ein Produktupdate kann die voreingestellte Modellversion verändern. Dadurch steigt der Tarif, obwohl das Arbeitsvolumen weitgehend gleich bleibt.
Routineaufgaben sollten zunächst mit leichteren Modellen getestet werden. Leistungsfähigere Modelle eignen sich für komplexe Aufgaben, bei denen ihre zusätzlichen Fähigkeiten tatsächlich benötigt werden.
Entscheidend sind nicht allein die veröffentlichten Token-Tarife. Benötigt ein ungeeignetes Modell mehr Versuche oder manuelle Korrekturen, kann es trotz niedrigerem Tarif insgesamt teurer sein.
Finanzsignal: Die Kosten steigen, während Token-Volumen und Anzahl der Anfragen weitgehend stabil bleiben. Gleichzeitig nimmt der Anteil höher bepreister Modelle zu.
3. Mehr Anbieter, Modelle und Abonnements
Verschiedene Abteilungen können eigene KI-Tools für Softwareentwicklung, Recherche, Kundenservice oder juristische Aufgaben einführen. Jeder einzelne Einkauf wirkt möglicherweise überschaubar. Zusammen führen zusätzliche Anbieter, Modelle und Abonnements jedoch zu höheren Gesamtkosten und erschweren die Übersicht.
Besonders problematisch sind überlappende Tools und API-Konten, die nicht im zentralen Verzeichnis erfasst sind. Unternehmen sollten deshalb genehmigte Tools und Modelle nach Anwendungsfall festlegen, Überschneidungen regelmäßig prüfen und sämtliche KI-Ausgaben zentral erfassen.
Finanzsignal: Die Anzahl der Anbieter, Abonnements, Modelle oder Rechnungspositionen steigt. Kosten verteilen sich zunehmend auf Firmenkarten, Cloud-Konten und direkte Anbieterrechnungen.
4. Mehr Anfragen und Nutzungsereignisse
Die Kosten steigen, wenn mehr Mitarbeitende, Kunden, Produkte oder automatisierte Workflows KI-Modelle aufrufen. Produkteinführungen, Kampagnen, Vertragsprüfungen, neue Teams oder zusätzliche Agenten können das Volumen deutlich erhöhen, selbst wenn der Token-Tarif unverändert bleibt oder sinkt.
Nicht jede zusätzliche Nutzung ist ineffizient. Ein Anstieg kann auf erfolgreiche Einführung oder wachsendes Geschäftsvolumen zurückzuführen sein. Finanzteams sollten geplante Ereignisse deshalb in Prognosen aufnehmen und ungewöhnliche Veränderungen mit Warnmeldungen überwachen.
Finanzsignal: Token-Volumen, Anzahl der Anfragen und Gesamtkosten steigen gemeinsam, während der effektive Tarif weitgehend stabil bleibt. Das spricht eher für höheres Volumen als für eine Preisänderung.
5. Schwache oder sinkende Cache-Nutzung
API-basierte Workflows verwenden häufig dieselben Systemanweisungen, Beispiele oder Referenzmaterialien. Prompt-Caching ermöglicht es, diese wiederkehrenden Eingaben günstiger zu verarbeiten.
Die Ersparnis sinkt, wenn wiederverwendbare Inhalte häufig verändert, unterschiedlich angeordnet oder nicht mehr als gemeinsamer Teil der Eingabe erkannt werden. Dann wird mehr Inhalt zum regulären Eingabetarif verarbeitet.
Caching wird vor allem bei der technischen Gestaltung von API-Workflows berücksichtigt. Wiederkehrende Anweisungen und Referenzinhalte sollten möglichst stabil strukturiert sein. Gleichzeitig sollten Teams beobachten, welcher Anteil der Eingabe aus dem Cache bedient wird.
Finanzsignal: Bei vergleichbarem Modell, Anfragevolumen und Arbeitsumfang steigen die Kosten. Gleichzeitig sinkt der Anteil zwischengespeicherter Token und mehr Eingabe wird zum regulären Tarif abgerechnet.
6. Längerer Kontext und Gesprächsverlauf
Umfangreiche Systemanweisungen, vollständige Dokumente, doppelte Auszüge und lange Chatverläufe erhöhen die Eingabe-Token. In längeren Konversationen kann der bisherige Verlauf bei jeder weiteren Anfrage erneut als Kontext verarbeitet werden.
Mitarbeitende sollten für unabhängige Aufgaben neue Chats beginnen und nur die tatsächlich benötigten Informationen bereitstellen. Automatisierte Workflows sollten ebenfalls nur den für die aktuelle Aufgabe relevanten Kontext an das Modell übergeben.
Mehr Kontext ist sinnvoll, wenn das Modell ihn für eine korrekte Antwort benötigt. Unnötige oder doppelte Inhalte erhöhen dagegen die Kosten, ohne die Qualität zu verbessern.
Finanzsignal: Das Eingabevolumen und dessen Anteil an den Gesamtkosten steigen, obwohl die Anzahl der Anfragen weitgehend stabil bleibt. Gleichzeitig werden Prompts, Dokumente oder Gesprächsverläufe umfangreicher.
7. Längere Modellantworten
Berichte, Code, ausführliche Erklärungen und mehrere neu erzeugte Versionen können mehr Ausgabe erzeugen, als die Aufgabe erfordert. Da Ausgabe-Token häufig teurer sind als Eingabe-Token, können längere Antworten die Kosten deutlich erhöhen.
Mitarbeitende können den Umfang begrenzen, indem sie Format und Länge bereits in der ersten Anfrage festlegen. Je nach Aufgabe können fünf Stichpunkte, eine Zusammenfassung mit 150 Wörtern oder eine Liste der wichtigsten Ausnahmen ausreichen.
Eine möglichst kurze Antwort ist jedoch nicht immer wirtschaftlicher. Fehlen wichtige Informationen, entstehen zusätzliche Korrekturrunden. Die gewünschte Länge sollte deshalb zur Aufgabe passen.
Finanzsignal: Das Ausgabevolumen und der Anteil der Ausgabe an den Gesamtkosten steigen. Eingabevolumen und Anzahl der Anfragen bleiben dagegen weitgehend stabil.
8. Schnellere oder priorisierte Verarbeitung
Manche Anbieter berechnen höhere Tarife für priorisierte Verarbeitung, geringere Latenz oder reservierte Kapazität. Diese Optionen können sinnvoll sein, wenn eine schnelle Antwort geschäftlich notwendig ist.
Nicht dringende Berichte, umfangreiche Dokumentenverarbeitung und Massenanalysen benötigen jedoch häufig keine sofortige Antwort. Wo der Anbieter dies unterstützt, können Standard- oder Batch-Verarbeitung günstiger sein.
Unternehmen sollten deshalb festlegen, welche Aufgaben wirklich eine priorisierte Bearbeitung benötigen. Für alle anderen Workflows kann die Standardverarbeitung als Voreinstellung dienen.
Finanzsignal: Der effektive Tarif steigt, obwohl Modell, Token-Volumen und Anzahl der Anfragen weitgehend unverändert bleiben. Gleichzeitig ändern sich der Verarbeitungsmodus oder die gebuchte Kapazität.
Diagnostische Signale für Finanzteams
- Kosten und Token steigen gemeinsam: Prüfen Sie Anfragevolumen, neue Nutzer, Produkteinführungen und zusätzliche Workflows.
- Kosten steigen bei stabilem Token-Volumen: Prüfen Sie Modellwahl, Verarbeitungsmodus, Preise und effektiven Tarif.
- Eingabevolumen steigt bei stabiler Anfragezahl: Prüfen Sie Systemanweisungen, Dokumente und Gesprächsverläufe.
- Ausgabevolumen steigt: Prüfen Sie Antwortlänge, angeforderte Formate und wiederholte Neuerstellungen.
- Cache-Nutzung sinkt: Prüfen Sie Änderungen an wiederkehrenden Anweisungen und der Struktur des gemeinsamen Kontexts.
- Kosten pro abgeschlossener Aufgabe steigen nach einer Automatisierung: Prüfen Sie Agentenschritte, Tool-Aufrufe, Wiederholungsversuche und Schleifen.
- Die Zahl der Anbieter und Modelle steigt: Prüfen Sie überlappende Tools, nicht erfasste Konten und den tatsächlichen Bedarf.
Das Muster bestimmt die richtige Reaktion. Kürzere Prompts lösen keinen Wechsel zu einem teureren Modell. Neue Vertragskonditionen lösen keinen Agenten, der in einer Schleife feststeckt. Die Finanzabteilung muss deshalb zuerst den Kostentreiber erkennen und das Problem anschließend an das Team weiterleiten, das tatsächlich handeln kann.
