Die wichtigsten Erkenntnisse
- Tokenspezifische Preisgestaltung: Anbieter berechnen Input-, Output- und zwischengespeicherte Token getrennt.
- Höhere Output-Tarife: Generierte Token kosten meist mehr als Input-Token.
- Variable effektive Tarife: Modellstufe, Kontext, Caching, Batch-Verarbeitung und Geschwindigkeit beeinflussen die Preisgestaltung.
- Listenpreis versus tatsächliche Kosten: Vergleichen Sie die öffentlichen Preise mit dem effektiven Tarif des Unternehmens pro einer Million Token.
Behalten Sie Ihre KI-Token-Ausgaben an einem Ort im Blick
Wer KI-Kosten verstehen und steuern will, muss zunächst sehen können, wo sie entstehen. In der Praxis verteilen sich Token-Ausgaben auf Mitarbeitende, automatisierte Workflows und verschiedene Anbieter. Die Finanzabteilung erhält jedoch häufig erst Einblick, nachdem die Kosten bereits entstanden sind.
Deshalb haben wir den Moss AI Token Cost Tracker entwickelt: ein kostenloses Dashboard, das lokal auf Ihrem Computer läuft und die KI-Ausgaben Ihrer verbundenen Anbieter in einer auf das Finanzteam zugeschnittenen Übersicht zusammenführt. So können Sie Kosten bis auf Ebene des Anbieters, Modells, Teams, der Person, des API-Keys oder Workflows zurückverfolgen.
Probieren Sie den Tracker selbst aus. Folgen Sie dazu einfach dem Video-Tutorial und der Schritt-für-Schritt-Anleitung für Ihr System:
Getting started
Works with Claude Code, OpenAI's Codex, and other terminal-based AI coding agents. Copy this prompt and paste it into your agent - it will clone the repo, install dependencies, and start the app for you.
Clone and set up the moss-ai-token-cost-tracker tool for me. Act as my setup assistant using your file system and terminal access: 1. First check whether the current folder (or a `moss-ai-token-cost-tracker` subfolder) already contains this tool (look for server.mjs and index.html). If it's already there, run `git pull` inside that folder to get the latest changes, then skip straight to step 3. 2. Otherwise, clone the repo: git clone https://github.com/getmoss/moss-ai-token-cost-tracker then work from inside that folder, and check whether Git, nvm, and the Node.js version this repo's README requires are installed, installing or switching to whatever is missing. 3. Ask me whether I want to run it in production mode (connecting my real accounts with API keys) or demo mode (mocked data, so I can just see how it looks without any API keys). Wait for my answer before continuing. 4. Double check that everything needed is set up correctly, and then run `npm start` for production mode, or `npm run demo` for demo mode, based on my answer. 5. Watch the terminal output for errors. If something fails, diagnose the root cause, explain it to me in plain language, and either fix it or tell me exactly what to run. 6. Tell me the URL to open in my browser once the server is running. 7. Later, if I ask you to stop or restart the tool, do that for me. Important: never read, print, or send the contents of my .env file, and never share any API keys or company data outside this terminal session.
Was sind KI-Token?
Um die im Tracker dargestellten Kosten einordnen zu können, hilft zunächst ein Blick auf die Grundlage der Abrechnung: Token. Ein KI-Token ist eine kleine Texteinheit, die von einem Modell verarbeitet wird. Das kann ein ganzes Wort, ein Wortteil, eine Zahl oder ein Satzzeichen sein.
Prompts bestehen aus Input-Token, Antworten aus Output-Token. Anbieter zählen beide Kategorien und wenden darauf die jeweiligen Tarife an. Als grobe Orientierung entsprechen 1.000 Token etwa 750 englischen Wörtern.
Für Finanzteams sind sieben Bestandteile der Token-Preisgestaltung besonders relevant.
1. Die grundlegende Token-Kostenberechnung
Anbieter geben API-Preise meist pro eine Million Token an. Die Gesamtkosten ergeben sich aus den einzelnen abrechenbaren Kategorien:
Tokenkosten =
(Input-Token / 1.000.000 × Input-Tarif)
+ (Cache-Read-Token / 1.000.000 × Cache-Read-Tarif)
+ (Cache-Write-Token / 1.000.000 × Cache-Write-Tarif, sofern berechnet)
+ (Output-Token / 1.000.000 × Output-Tarif)
+ weitere nutzungsabhängige Gebühren
Jedes Modell hat eigene Tarife. Zwei Teams können beim selben Anbieter das gleiche Token-Volumen verarbeiten und trotzdem unterschiedlich viel bezahlen, wenn sie verschiedene Modelle oder Token-Kategorien nutzen.
Auch die Tokenisierung kann einen Unterschied machen: Modelle können denselben Text in unterschiedlich viele Token zerlegen. Ein niedrigerer Preis pro Token garantiert deshalb nicht automatisch geringere Gesamtkosten für einen bestimmten Workflow.
2. Input-, Output- und zwischengespeicherte Token
Input-Token umfassen alle Informationen, die an das Modell gesendet werden: Nutzeranweisungen, System-Prompts, Konversationsverläufe, Dokumente und weiteren Kontext. Lange Prompts und umfangreiche Dokumente erhöhen das Input-Volumen. Das gilt auch, wenn derselbe Konversationsverlauf wiederholt und ohne wirksames Caching übermittelt wird.
Output-Token sind die vom Modell generierten Inhalte. Sie werden häufig zu einem höheren Tarif abgerechnet. Ein kurzer Prompt, der einen langen Bericht anfordert, kann daher durch die Antwort mehr kosten als durch die sichtbare Anfrage.
Zwischengespeicherte Token sind wiederkehrende Teile des Inputs, die erneut verwendet werden können. Cache-Lesevorgänge erhalten häufig einen günstigeren Tarif, während für das Erstellen oder Speichern eines Caches eigene Bedingungen gelten können. Bei der Rechnungsprüfung sollten Finanzteams diese Kategorien deshalb getrennt betrachten.
3. Warum Output-Token meist mehr kostet
Ein Modell kann große Teile des Inputs gleichzeitig verarbeiten. Den Output erzeugt es dagegen schrittweise, wobei jedes neue Token auf den vorherigen basiert. Diese sequenzielle Verarbeitung benötigt mehr Zeit und Rechenleistung.
Lange Antworten erzeugen entsprechend mehr abrechenbaren Output, häufig zum höheren Tarif. Manche Reasoning-Modelle verwenden zudem interne Reasoning-Token, bevor sie die sichtbare Antwort ausgeben. Werden diese als Output abgerechnet, kann auch eine kurze Antwort mit erheblicher Verarbeitung verbunden sein..
4. Modellstufe und Kontextlänge
Kompaktere Modelle sind für einfachere Aufgaben zu niedrigeren Tarifen gedacht, während leistungsfähigere Modelle anspruchsvollere Aufgaben zu höheren Preisen bearbeiten. Wird ein Workflow auf eine andere Modellstufe umgestellt, kann sich die Rechnung daher auch bei gleichbleibendem Anfragevolumen verändern.
Die Kontextlänge beschreibt, wie viele Informationen ein Modell innerhalb einer Anfrage berücksichtigen kann. Große System-Prompts, vollständige Dokumente und lange Konversationsverläufe erhöhen das Input-Volumen. Manche Anbieter oder Modelle verwenden zudem höhere Tarife, sobald eine bestimmte Kontextlänge überschritten wird.
Das günstigste Modell auf dem Preisblatt ist nicht immer die kostengünstigste Lösung für eine erfolgreich abgeschlossene Aufgabe. Ein weniger leistungsfähiges Modell kann zusätzliche Anweisungen oder Wiederholungsversuche benötigen. Finanzteams sollten daher Kosten und Ergebnisqualität gemeinsam betrachten und prüfen, ob die aktuelle Modellstufe und Kontextgröße tatsächlich für die entsprechende Aufgabe erforderlich sind.
5. Caching und Batch-Pricing
Prompt-Caching senkt die Kosten, wenn Anfragen wiederholt dieselben Systemanweisungen, Dokumente oder andere feste Inhalte verwenden. Diese Inhalte können erneut genutzt und zu einem günstigeren Cache-Tarif abgerechnet werden.
Batch-Pricing bietet niedrigere Tarife für Aufgaben, die keine sofortige Antwort benötigen, etwa nächtliche Dokumentenverarbeitung, Reporting oder Massenanalysen.
Beide Optionen sind vor allem für API-basierte Agents und wiederkehrende Workflows relevant. Caching eignet sich bei wiederkehrenden Inhalten, Batch-Pricing bei Aufgaben, deren Ergebnisse zeitversetzt verarbeitet werden können.
6. Schnellere Verarbeitung und zusätzliche Kosten
Einige Anbieter bieten gegen Aufpreis schnellere oder priorisierte Verarbeitungsmodi an. Sie eignen sich für Workflows, bei denen kurze Antwortzeiten oder eine gleichmäßigere Leistung wichtig sind. Manche Enterprise-Verträge nutzen außerdem feste oder reservierte Kapazitäten, sodass die Kosten nicht nur von der tatsächlichen Token-Nutzung abhängen.
Je nach Anbieter können zusätzliche Gebühren für Tool-Aufrufe, Websuche, Codeausführung, Datei- oder Vektorspeicherung und regionale Verarbeitung entstehen. KI-Coding-Tools können zudem Abonnements, Inklusivkontingente und kostenpflichtige Mehrnutzung kombinieren.
7. Listenpreis versus effektiver Tarif
Der Listenpreis ist der öffentlich angegebene Tarif für ein bestimmtes Modell und eine bestimmte Token-Kategorie. Der effektive Tarif zeigt dagegen, was ein Unternehmen über seinen tatsächlichen Mix aus Modellen, Token-Kategorien und Verarbeitungsmodi bezahlt hat.
Effektiver Tokenpreis pro Million Token =
relevante Tokenkosten / abgerechnete Token × 1.000.000
Dabei müssen vergleichbare Werte gegenübergestellt werden. Ein gemischter Tarif über mehrere Modelle und Token-Kategorien lässt sich nicht direkt mit dem reinen Input-Listenpreis eines einzelnen Modells vergleichen. Vertragskonditionen, Caching, Batch-Verarbeitung und der Modellmix können den effektiven Tarif zusätzlich beeinflussen.
Aktuelle Tarife brauchen ein Datum
Da sich Listenpreise, Modellnamen und Tarifstrukturen regelmäßig ändern, sind Preisvergleiche immer zeitgebunden. Sie sollten deshalb Anbieter, Modell und Version, Region, Input-, Output- und Cache-Tarife, Verarbeitungsmodus, vertragliche Anpassungen, Quelle und Gültigkeitsdatum festhalten.
Bevor ein Vergleich für ein Budget oder eine Prognose verwendet wird, sollten die Angaben erneut geprüft werden. Auch ohne einen neuen Beschaffungsvorgang kann eine Preistabelle veralten, etwa wenn ein Anbieter seine Tarife ändert, ein Modell ersetzt oder die Standardeinstellung eines Tools anpasst.
Was die Finanzabteilung bei der Prüfung von KI-Preisen fragen sollte
- Welches Modell hat den Workflow verarbeitet?
- Wie viele Input-, Output- und zwischengespeicherte Token wurden abgerechnet?
- Wurden die Anfragen über Standard-, Batch- oder Schnellverarbeitung ausgeführt?
- Hat sich die Nutzung, der Tarif oder der Modellmix verändert?
- Benötigt der Workflow tatsächlich die aktuelle Modellstufe, Kontextlänge und Verarbeitungsgeschwindigkeit?
Mit diesen Antworten kann das Finanzteam nachvollziehen, warum sich die Rechnung verändert hat. Anschließend können Mitarbeitende und IT gemeinsam prüfen, wie sich unnötige Token-Nutzung reduzieren und Modelle oder Verarbeitungsmodi gezielter auswählen lassen.
