Skip to content
DigitalNeuron
Business & Finanzierung

Analyse: Die Preise für KI fallen ständig, warum steigen also die Rechnungen?

Die Kosten pro Token sind eingebrochen, während die gesamten KI-Ausgaben gestiegen sind. Beides ist wahr, und die Lücke zwischen ihnen erklärt den Großteil dessen, was mit der Ökonomie von KI-Produkten geschieht.

Von DigitalNeuron Desk3 Min. Lesezeit

Kurze Antwort

Warum steigen die Kosten für KI, wenn der Preis pro Token sinkt?

Der Preis pro Token ist durch bessere Hardware, kleinere destillierte Modelle und Optimierungen bei der Bereitstellung stark gesunken. Der Verbrauch ist schneller gestiegen: längere Kontexte, Schlussfolgerungsmodelle, die pro Antwort weit mehr Token generieren, und Agenten, die eine Benutzeraktion in Dutzende von Modellaufrufen umwandeln. Sinkende Stückpreise bei steigenden Stückzahlen führen zu größeren Rechnungen.

Das Wichtigste

  • Stückpreis gesunken und Gesamtausgaben gestiegen sind vereinbar – die Tokenanzahl pro Aufgabe ist schneller gewachsen, als der Preis gefallen ist.
  • Argumentationsmodelle und Agentenschleifen sind die beiden größten Multiplikatoren für Tokens pro Benutzeraktion.
  • Sitzplatzbasierte Preisgestaltung für eine unbegrenzte KI-Funktion kehrt die Marge für Vielnutzer um; aus diesem Grund verbreitet sich die nutzungsabhängige Preisgestaltung.
  • Die größte verfügbare Einsparung bei den meisten Produkten besteht darin, einfache Anfragen an ein kleines Modell zu leiten.

Zwei Aussagen sind gleichzeitig wahr und werden ständig für einen Widerspruch gehalten: Der Preis für eine Einheit KI-Berechnung ist dramatisch gesunken, und Unternehmen geben mehr für KI aus als je zuvor. Die Lücke zwischen ihnen ist der Ort, an dem die interessante Ökonomie lebt.

Was tatsächlich billiger wurde

Mehrere Kräfte drückten den Preis pro Token gleichzeitig nach unten:

  • Hardware-Generationen. Jede Beschleunigergeneration liefert mehr Durchsatz pro Watt und pro Dollar.
  • Optimierungen für die Auslieferung. Kontinuierliches Batching, Paged Attention für Key-Value-Caches, spekulative Dekodierung, Quantisierung. Das sind technische Erfolge, keine Modelländerungen, und sie summieren sich.
  • Sparse Architekturen. Mixture-of-Experts-Designs aktivieren nur einen Bruchteil der Parameter pro Token, sodass ein sehr großes Modell beim Ausliefern wie ein viel kleineres kosten kann.
  • Destillation. Kleine Modelle, die auf den Ausgaben großer Modelle trainiert wurden, erledigen nun ein breites Spektrum routinemäßiger Arbeiten zu einem Bruchteil des Preises.
  • Wettbewerb. Mehrere glaubwürdige Anbieter auf jeder Fähigkeitsstufe, mit ausreichend niedrigen Wechselkosten, um real zu sein.

Das Ergebnis ist ein echter, um Größenordnungen sinkender Preis für ein gegebenes Fähigkeitsniveau über einige Jahre hinweg. Daran zweifelt niemand.

Was pro Aufgabe teurer wurde

In der Zwischenzeit ist die Anzahl der Token, die eine einzelne Benutzeraktion verbraucht, aus vier Gründen gestiegen:

Längerer Kontext. Produkte, die früher eine 500-Token-Eingabeaufforderung sendeten, fügen jetzt Dokumente, Gesprächsverläufe, abgerufene Passagen und Tool-Definitionen hinzu. Zehntausend Eingabe-Token pro Aufruf sind keine Seltenheit.

Schlussfolgerungsmodelle. Modelle, die interne Überlegungen anstellen, bevor sie antworten, können pro Anfrage um ein Vielfaches mehr Ausgabe-Token generieren als ein Modell, das direkt antwortet. Die Preisliste hat sich nicht geändert; die Token-Anzahl schon.

Agenten. Dies ist der größte Multiplikator. Eine Anweisung – "gleiche diese Konten ab" – wird zu fünfzehn Modellaufrufen, von denen jeder den angesammelten Kontext trägt. Aus Abrechnungssicht ist das kein einzelner Request. Es sind fünfzehn, und jeder ist länger als der letzte.

Wiederholungsversuche und Evaluierung. Produktionssysteme wiederholen bei Fehlern und führen kontinuierlich Evaluierungssuiten aus. Beides ist für Benutzer unsichtbar und auf Rechnungen sichtbar.

Multiplizieren Sie einen Preisrückgang um das 10-fache mit einer Zunahme der Token pro Aufgabe um das 30-fache, und die Rechnung verdreifacht sich, während jede Einheit billiger wurde. Das ist das ganze Rätsel.

Was das für Produktmargen bedeutet

Das Muster zeigt sich am deutlichsten bei Software pro Sitzplatz. Ein Sitzplatz kostet einen festen Betrag pro Monat. Eine KI-Funktion, die an diesen Sitzplatz gebunden ist, kostet, was der Benutzer verbraucht. Die Verteilung der Nutzung ist nicht normal – ein kleiner Bruchteil der Benutzer generiert eine große Mehrheit der Token, und sie sind in der Regel am engagiertesten und am unwahrscheinlichsten, abzuwandern.

Drei Reaktionen sind üblich geworden:

  1. Nutzungsabhängige Preisgestaltung. Credits oder Stufen mit expliziten Limits. Weniger elegant als Pauschalpreise, und es übersteht den Kontakt mit Heavy-Usern.
  2. Routing. Ein kleines Modell bearbeitet den Großteil der Anfragen; das teure Modell ist für schwierige reserviert. Bei den meisten Workloads ist dies die größte verfügbare Einsparung, noch vor jeder Optimierung auf Prompt-Ebene.
  3. Caching und Batching. Gecachte Präfixe reduzieren die Kosten für wiederholte System-Prompts und Dokumente; Batch-Endpunkte halbieren ungefähr den Preis für alles, was keine sofortige Antwort benötigt.

Die Infrastruktur-Grenze

Es gibt eine Grenze, wie weit das fallen kann, und sie ist physisch. Das Ausliefern eines Modells erfordert Beschleuniger, Speicherbandbreite, ein Gebäude, Kühlung und einen Netzanschluss – und in mehreren großen Märkten ist der Netzanschluss nun die einschränkende Bedingung, mit Anschlusswarteschlangen, die in Jahren gemessen werden.

Kapitalkosten werden über ein Volumen amortisiert, das weiter wachsen muss, um sie zu rechtfertigen. Das funktioniert, solange die Nachfrage wächst. Es erklärt auch, warum Kapazitätsankündigungen jetzt eher wie Versorgungsplanungspapiere als wie Produktnachrichten klingen.

Worauf man achten sollte

Für jeden, der ein KI-Produkt betreibt, sind drei Zahlen wichtiger als der Schlagzeilenpreis pro Million Token:

  • Token pro abgeschlossener Aufgabe, über die Zeit verfolgt. Dies erfasst die Sache, die tatsächlich wächst.
  • Anteil des Traffics, der vom günstigsten ausreichenden Modell bedient wird. Wenn er unter der Hälfte liegt, liegt Geld auf dem Tisch.
  • Cache-Trefferquote auf dem stabilen Präfix. Eine Änderung auf Byte-Ebene am Anfang eines Prompts kann das Caching lautlos deaktivieren und die Kosten über Nacht erhöhen.

Der Stückpreis wird weiter sinken. Ob Ihre Rechnung folgt, hängt fast ausschließlich davon ab, ob Ihre Token-Anzahl pro Aufgabe stillsteht – und in einer Produkt-Roadmap voller Agenten und längerer Kontexte wird dies nicht zufällig geschehen.

Häufige Fragen

Wird KI billiger oder teurer?
Günstiger pro Recheneinheit, teurer pro abgeschlossener Aufgabe bei vielen Produkten, da Aufgaben jetzt weit mehr Rechenleistung verbrauchen als früher. Welcher Trend sich für Sie bemerkbar macht, hängt davon ab, ob Ihre Token-Nutzung pro Aufgabe stabil ist.
Warum kosten Reasoning-Modelle mehr als ihr ausgewiesener Preis vermuten lässt?
Sie erzeugen interne Denk‑Tokens, bevor die sichtbare Antwort erscheint, und werden als Ausgabe berechnet. Der Preis pro Token bleibt unverändert; die Anzahl der Tokens pro Anfrage ist viel höher.
Wie schützen KI-Produkte ihre Margen?
Modell‑Routing, Prompt‑Caching, Batch‑Verarbeitung für nicht‑interaktive Aufgaben, begrenzte Kontextlänge und Preismodelle, die sich nach Nutzung und nicht nach Sitzplätzen richten.
Reduziert das Selbsthosting eines Open-Weight-Modells die Kosten?
Er kann bei hoher, konstanter Auslastung Hardware beschäftigen. Bei niedriger oder schwankender Auslastung kosten inaktive Beschleuniger in der Regel mehr als API‑Aufrufe.

Quellen

  1. API pricing — OpenAI
  2. API pricing — Anthropic
  3. Electricity 2024 — analysis and forecast to 2026 — International Energy Agency
Schlagwörterpricingunit economicsinferenceagentsmargins

Passend dazu

Wie KI-Modellpreise tatsächlich funktionieren: Tokens, Caching und Batching

Fast jede KI-API rechnet pro Million Tokens ab, mit separaten Preisen für Input und Output. Output kostet in der Regel ein Vielfaches des Inputs. Gecachter Input, Batch-Verarbeitung und kleinere Modelle können die Rechnung jeweils erheblich senken, und die Gesamtkosten für eine Konversation steigen mit der Historie, da die meisten APIs den gesamten Thread bei jedem Durchgang erneut senden.

3 Min. Lesezeit

Cloudera und Mistral kooperieren bei souveräner KI für Unternehmen

Mistral AI und Cloudera haben eine Partnerschaft angekündigt, in deren Rahmen die KI-Modelle von Mistral in die Hybrid-Datenplattform von Cloudera integriert werden. Die Vereinbarung ermöglicht es Unternehmen, Inferenz in privaten Clouds, öffentlichen Clouds, On-Premise- und abgeschotteten Umgebungen auszuführen sowie eigene Modelle auf Basis proprietärer Daten zu trainieren – wobei sie sowohl die Eigentumsrechte an den Daten als auch an der daraus resultierenden Intelligenz behalten, wie die Unternehmen am 10. September 2026 mitteilten.

2 Min. Lesezeit

Mistral nimmt in einer von Samsung angeführten Serie-D-Runde 3 Milliarden Euro ein

Mistral kündigte eine von Samsung Electronics angeführte Series-D-Finanzierungsrunde über 3 Milliarden Euro an, die dem Unternehmen eine Post-Money-Bewertung von mehr als 21 Milliarden Euro verleiht. Mistral erklärte, die Mittel für den Ausbau der Spitzenforschung, der Rechenkapazitäten und der Infrastruktur einsetzen und zugleich das kommerzielle Wachstum sowie die internationale Präsenz beschleunigen zu wollen.

2 Min. Lesezeit