Skip to content
DigitalNeuron
Business & Finanzierung

Wie KI-Modellpreise tatsächlich funktionieren: Tokens, Caching und Batching

KI-APIs werden pro Token abgerechnet, ein- und ausgehend, zu unterschiedlichen Sätzen – und die Hebel, die eine Rechnung um 80 % senken, sind selten diejenigen, nach denen Teams zuerst greifen. Ein praktischer Leitfaden zum Kostenmodell.

Von DigitalNeuron Desk3 Min. Lesezeit

Kurze Antwort

Wie werden die Preise für KI-APIs berechnet?

Fast jede KI-API rechnet pro Million Tokens ab, mit separaten Preisen für Input und Output. Output kostet in der Regel ein Vielfaches des Inputs. Gecachter Input, Batch-Verarbeitung und kleinere Modelle können die Rechnung jeweils erheblich senken, und die Gesamtkosten für eine Konversation steigen mit der Historie, da die meisten APIs den gesamten Thread bei jedem Durchgang erneut senden.

Das Wichtigste

  • Input und Output werden separat bepreist, wobei der Output die teurere Seite ist – oft drei- bis fünfmal so teuer wie der Input.
  • Chatkosten wachsen quadratisch mit der Gesprächslänge, da die gesamte Historie bei jedem Zug erneut gesendet wird.
  • Prompt-Caching und Batch-Endpunkte sind die beiden größten Rabatte, die ohne Modelländerung verfügbar sind.
  • Modell-Routing – kleines Modell zuerst, bei Schwierigkeiten eskalieren – schlägt in der Regel jede Optimierung auf Prompt-Ebene.

Die KI-Preisgestaltung wirkt einfach – eine Zahl pro Million Tokens – und dann kommt die erste Rechnung und niemand kann sie erklären. Das Preismodell ist nicht kompliziert, aber es hat eine Form, die die offensichtliche Art des Aufbaus von Dingen bestraft.

Die Basiseinheit

Jeder große Anbieter rechnet pro Million Tokens ab, mit zwei separaten Tarifen:

  • Input-Tokens – alles, was Sie senden: System-Prompt, Tool-Definitionen, Konversationsverlauf, angehängte Dokumente.
  • Output-Tokens – alles, was das Modell generiert.

Output ist die teure Seite, üblicherweise drei- bis fünfmal so teuer wie der Input-Tarif. Der Grund ist mechanisch: Input kann parallel über die Sequenz verarbeitet werden, während Output Token für Token erzeugt werden muss, wobei jeder einen vollständigen Durchlauf durch das Modell erfordert.

Die erste praktische Konsequenz: eine wortreiche Antwort kostet mehr als eine lange Frage. „Fasse in drei Stichpunkten zusammen“ ist eine Kostenkontrolle, nicht nur eine Stilpräferenz.

Wo das Geld tatsächlich hingeht

Konversationsverlauf. Dies ist der Punkt, der Teams überrascht. Die meisten Chat-APIs sind zustandslos: Um eine Konversation fortzusetzen, senden Sie sie erneut. Zug 1 sendet 500 Tokens. Zug 10 sendet alles von Zügen 1–9 plus die neue Nachricht. Über einen langen Thread wächst der kumulative Input ungefähr mit dem Quadrat der Anzahl der Züge.

Fester Overhead pro Anfrage. Ein System-Prompt mit 2.000 Tokens und Tool-Schemas mit 3.000 Tokens kosten 5.000 Input-Tokens bei jedem einzelnen Aufruf, auch bei denen, bei denen der Benutzer „Danke“ eingegeben hat.

Reasoning-Tokens. Modelle, die nachdenken, bevor sie antworten, geben interne Tokens aus, die als Output abgerechnet werden. Eine Anfrage, die eine dreizeilige Antwort liefert, hat möglicherweise weit mehr als drei Zeilen an Tokens generiert.

Wiederholungsversuche und Agenten-Schleifen. Ein Agent, der fünfzehn Schritte benötigt, sind fünfzehn abrechenbare Anfragen, die jeweils den vollständigen Kontext tragen. Die Wiederholungslogik vervielfacht dies leise.

Die vier Hebel, nach Wirkung geordnet

1. An ein kleineres Modell weiterleiten. Die Preisspanne zwischen einem Spitzenmodell und einem kleinen Modell beträgt typischerweise das 10- bis 30-fache. Die meisten Produktions-Workloads enthalten einen großen Anteil an einfachen Anfragen – Klassifizierung, Extraktion, Formatierung –, die ein kleines Modell mit voller Qualität bewältigt. Senden Sie diese an das kleine Modell und eskalieren Sie nur bei Schwierigkeiten oder geringer Zuversicht. Nichts anderes auf dieser Liste kommt auch nur annähernd an die gleiche Einsparung heran.

2. Den stabilen Präfix cachen. Prompt-Caching berechnet einen kleinen Bruchteil des Input-Tarifs für einen Präfix, den der Anbieter bereits gesehen hat. Es erfordert byte-identische Präfixe, was eine Disziplin auferlegt:

[system prompt]        ← stabil, diese cachen
[tool definitions]     ← stabil
[reference documents]  ← pro Sitzung stabil
[conversation history] ← ändert sich
[current message]      ← ändert sich

Das Hinzufügen eines Zeitstempels oder eines Benutzernamens am Anfang des Prompts vereitelt das Caching vollständig. Dies ist ein häufiger und teurer Fehler.

3. Stapeln, was nicht interaktiv ist. Batch-Endpunkte tauschen Latenz gegen etwa den halben Preis. Nächtliche Klassifizierung, Auffüllen von Embeddings, Auswertungssuiten, Massenübersetzung – keine dieser Aufgaben benötigt eine synchrone Antwort.

4. Die Schleife verkürzen. Begrenzen Sie den Konversationsverlauf auf N aktuelle Züge plus eine Zusammenfassung. Beschneiden Sie Tool-Definitionen auf die, die diese Aufgabe benötigt. Legen Sie explizite Längenbegrenzungen für die Ausgabe fest. Individuell klein; zusammen oft ein Drittel der Rechnung.

Kosten, die keine Tokens sind

  • Embeddings sind pro Aufruf günstig und laufen bei der Neuindizierung leicht auf. Das erneute Einbetten eines gesamten Korpus nach einer Änderung der Segmentierung ist ein echter Posten.
  • Fine-Tuning hat Kosten für das Training plus in einigen Fällen eine höhere Inferenzrate oder eine Hosting-Gebühr für das benutzerdefinierte Modell.
  • Bild- und Audioeingaben werden in Token-Äquivalente umgerechnet, zu Tarifen, die je nach Anbieter und Auflösung variieren – prüfen Sie die spezifische Formel, anstatt Annahmen zu treffen.
  • Rate-Limit-Stufen. Höherer Durchsatz erfordert manchmal eine feste Ausgabenverpflichtung. Das ist eine Beschaffungsfrage, keine technische, und es lohnt sich, frühzeitig danach zu fragen.

Erstellen einer verteidigungsfähigen Prognose

Zuerst instrumentieren. Protokollieren Sie pro Anfrage: Modell, Input-Tokens, Output-Tokens, gecachte Tokens, Funktion und Benutzer. Ohne diese Aufschlüsselung ist Kostenoptimierung Raten.

Dann ist die Arithmetik einfach:

monatliche Kosten ≈ Anfragen/Monat
             × (input_tokens × input_rate
              + cached_tokens × cache_rate
              + output_tokens × output_rate)

Modellieren Sie drei Szenarien – erwartet, doppelt und zehnfach – und prüfen Sie, welches Ihre Einheitsökonomie zerstört. Ein Produkt pro Sitzplatz mit einer unbegrenzten Chat-Funktion kann seine eigene Marge umkehren, und die Zeit, dies herauszufinden, ist vor dem Start.

Die unbequeme Wahrheit in den meisten Überprüfungen ist, dass die größte Einsparung kein cleverer Prompt ist. Es ist die Erkenntnis, dass 70 % des Traffics das teure Modell nie benötigt haben.

Häufige Fragen

Warum ist meine Rechnung schneller gestiegen als mein Verbrauch?
Wahrscheinlichste Gesprächslänge. Wenn jede Runde die vollständige Historie erneut sendet, kostet ein Gespräch mit 20 Runden weit mehr als 20 einzelne Fragen. Das Zusammenfassen oder Kürzen alter Runden behebt dies.
Was ist Prompt-Caching und wie viel spart es?
Anbieter können den unveränderten Präfix einer Anfrage – System-Prompt, Tool-Definitionen, ein langes Dokument – cachen und für nachfolgende Aufrufe einen Bruchteil des normalen Eingaberates berechnen. Dies funktioniert nur, wenn der Präfix Byte für Byte identisch ist, daher muss stabile Inhalte zuerst kommen.
Lohnt sich eine Batch-API angesichts der Verzögerung?
Für alles, was nicht interaktiv ist – Klassifizierung, Anreicherung, Auswertungsdurchläufe, Übersetzungsrückstände – ja. Batch-Endpunkte kosten typischerweise etwa die Hälfte des synchronen Tarifs im Austausch für Ergebnisse innerhalb von Stunden statt Sekunden.
Sind Reasoning-Modelle teurer, als ihre Preisliste vermuten lässt?
Oft, ja. Sie generieren interne Denk-Tokens vor der sichtbaren Antwort, und diese Tokens werden als Ausgabe abgerechnet. Der angegebene Preis gilt pro Token; die Token-Anzahl pro Anfrage ändert sich.

Quellen

  1. API pricing — Anthropic
  2. API pricing — OpenAI
  3. Gemini API pricing — Google
Schlagwörterpricingtokenscostcachingbatch

Passend dazu

Analyse: Die Preise für KI fallen ständig, warum steigen also die Rechnungen?

Der Preis pro Token ist durch bessere Hardware, kleinere destillierte Modelle und Optimierungen bei der Bereitstellung stark gesunken. Der Verbrauch ist schneller gestiegen: längere Kontexte, Schlussfolgerungsmodelle, die pro Antwort weit mehr Token generieren, und Agenten, die eine Benutzeraktion in Dutzende von Modellaufrufen umwandeln. Sinkende Stückpreise bei steigenden Stückzahlen führen zu größeren Rechnungen.

3 Min. Lesezeit

Cloudera und Mistral kooperieren bei souveräner KI für Unternehmen

Mistral AI und Cloudera haben eine Partnerschaft angekündigt, in deren Rahmen die KI-Modelle von Mistral in die Hybrid-Datenplattform von Cloudera integriert werden. Die Vereinbarung ermöglicht es Unternehmen, Inferenz in privaten Clouds, öffentlichen Clouds, On-Premise- und abgeschotteten Umgebungen auszuführen sowie eigene Modelle auf Basis proprietärer Daten zu trainieren – wobei sie sowohl die Eigentumsrechte an den Daten als auch an der daraus resultierenden Intelligenz behalten, wie die Unternehmen am 10. September 2026 mitteilten.

2 Min. Lesezeit

Mistral nimmt in einer von Samsung angeführten Serie-D-Runde 3 Milliarden Euro ein

Mistral kündigte eine von Samsung Electronics angeführte Series-D-Finanzierungsrunde über 3 Milliarden Euro an, die dem Unternehmen eine Post-Money-Bewertung von mehr als 21 Milliarden Euro verleiht. Mistral erklärte, die Mittel für den Ausbau der Spitzenforschung, der Rechenkapazitäten und der Infrastruktur einsetzen und zugleich das kommerzielle Wachstum sowie die internationale Präsenz beschleunigen zu wollen.

2 Min. Lesezeit