Skip to content
DigitalNeuron
Chips & Infrastruktur

Warum verbraucht KI so viel Strom?

Training macht die Schlagzeilen, aber das Bereitstellen des Modells verbraucht über die gesamte Lebensdauer eines Systems Strom. Hier fließt die Energie tatsächlich hin, und deshalb hat sich die Einschränkung von Chips auf Netzanschlüsse verlagert.

Von DigitalNeuron Desk4 Min. Lesezeit

Kurze Antwort

Warum verbraucht KI so viel Strom?

KI-Beschleuniger verbrauchen pro Rack weitaus mehr Strom als herkömmliche Server, und diese Leistung muss kontinuierlich bereitgestellt, gekühlt und bezahlt werden. Das Training eines großen Modells ist ein einmaliger Spitzenbedarf; die Bereitstellung für Millionen von Benutzern ist eine permanente Last, und die Inferenz dominiert den Energieverbrauch über die Lebensdauer eines eingesetzten Modells.

Das Wichtigste

  • Ein KI-Rack kann um eine Größenordnung mehr Strom verbrauchen als ein herkömmliches Server-Rack, was das Gebäude verändert und nicht nur die Einkaufsliste.
  • Training ist ein Spurt; Inferenz ist eine Dauerlast. Über die Lebensdauer eines Modells hinweg dominiert der Service.
  • Die bindende Einschränkung in vielen Regionen ist jetzt die Netzverbindung und Transformatoren, nicht die Chipversorgung.
  • Effizienzgewinne pro Token sind real und groß, aber die Nachfrage ist schneller gewachsen, sodass der Gesamtverbrauch weiter steigt.

Rechenzentren verbrauchen seit zwei Jahrzehnten erhebliche Mengen an Strom. Was sich mit KI geändert hat, ist die Dichte: wie viel Strom ein einzelnes Rack benötigt und was ein Gebäude daher liefern und abführen können muss.

Wohin die Energie tatsächlich fließt

Vier Orte, absteigend geordnet:

Die Beschleuniger. GPUs und speziell entwickelte KI-Chips sind darauf ausgelegt, Tausende von arithmetischen Einheiten gleichzeitig zu beschäftigen. Ein High-End-Beschleuniger verbraucht allein mehrere hundert bis über tausend Watt, und ein Trainingsknoten bündelt mehrere davon. Während ein herkömmliches Server-Rack möglicherweise 5–15 kW verbraucht, werden KI-Racks im Bereich von zehn Kilowatt und bei den neuesten Designs über 100 kW spezifiziert.

Daten bewegen. Große Modelle werden auf viele Chips aufgeteilt, die ständig Zwischenergebnisse austauschen müssen. High-Bandwidth-Speicher und das Interconnect-Fabric verbrauchen einen erheblichen Anteil des Gesamtbedarfs – und im Gegensatz zur Rechenleistung sinkt dieser Anteil mit jeder Generation nicht so schnell.

Kühlung. Jede Watt, die hineingeht, kommt als Wärme wieder heraus. Luftkühlung wird bei etwa 30–40 kW pro Rack unpraktisch, weshalb Flüssigkeitskühlung in neuen KI-Hallen von exotisch zu Standard geworden ist. Die Effizienz wird mit PUE (Power Usage Effectiveness) verfolgt: Gesamtenergieverbrauch der Anlage geteilt durch die IT-Energie. Eine gut geführte moderne Anlage liegt nahe 1,1–1,2; ältere luftgekühlte Standorte sind erheblich schlechter.

Alles andere. Stromwandlungsverluste, unterbrechungsfreie Stromversorgungen, Netzwerke, Speicher.

Training ist ein Spitzenbedarf, Inferenz ist eine Last

Das Training eines Spitzenmodells läuft wochenlang mit Tausenden von Beschleunigern auf Hochtouren. Es ist teuer, sichtbar und endlich.

Das Ausliefern dieses Modells ist anders. Jede Anfrage führt Berechnungen durch, und ein beliebtes Produkt bearbeitet täglich Millionen davon, und das über Jahre hinweg. Die Energie pro Anfrage ist gering; die Multiplikation ist es nicht. Für jedes Modell, das in der realen Produktion eingesetzt wird, übersteigt die kumulative Inferenzenergie die Trainingsenergie bei weitem innerhalb seiner Lebensdauer – und im Gegensatz zum Training endet die Last nie.

Zwei Dinge treiben die Inferenzenergie weiter in die Höhe:

  • Längere Ausgaben. Die Generierung ist sequenziell – jedes Token erfordert einen vollständigen Durchlauf durch das Modell. Modelle im Stil von Schlussfolgerungen, die lange interne Ketten produzieren, bevor sie antworten, leisten proportional mehr Arbeit pro Anfrage.
  • Agenten. Eine Benutzeranweisung kann zu Dutzenden von Modellaufrufen plus Tool-Aufrufen führen. Aus Sicht des Rechenzentrums sind das Dutzende von Anfragen, nicht eine.

Und eine Sache senkt sie stark: Modellauswahl. Energie skaliert mit der Rechenleistung, daher ist das Ausliefern einer Aufgabe mit einem kleinen Modell anstelle eines großen keine marginale Einsparung. Routing – zuerst ein günstiges Modell, nur bei Bedarf eskalieren – ist der wirksamste Hebel, den die meisten Teams haben.

Die Einschränkung hat sich von den Chips zum Stromnetz verlagert

Eine Zeit lang war der Engpass die Verfügbarkeit von Beschleunigern. Zunehmend ist es die elektrische Vernetzung: die Warteschlange zur Anbindung einer neuen großen Last an das Übertragungsnetz und die Vorlaufzeit für Transformatoren und Schaltanlagen. In mehreren großen Märkten werden diese Warteschlangen in Jahren gemessen.

Das verändert die Branche auf bemerkenswerte Weise:

  • Standortwahl folgt der Stromversorgung. Betreiber bauen dort, wo Stromerzeugung und Netzkapazität vorhanden sind, anstatt in der Nähe der Nutzer – akzeptabel für das Training, schwieriger für latenzempfindliches Serving.
  • Langfristige Stromabnahmeverträge. Mehrjährige Stromabnahmeverträge, auch mit Betreibern von Kern- und Geothermieanlagen, sind zu Standardnachrichten über Infrastruktur geworden, anstatt zu Nachhaltigkeitsankündigungen.
  • Vor-Ort-Stromerzeugung und -speicherung. Stromerzeugung hinter dem Zähler, um die Anschlusswarteschlange vollständig zu vermeiden.
  • Lokale Politik. Strompreiserhöhungen und Wasserverbrauch sind nun aktuelle kommunale Themen, wo immer große Anlagen vorgeschlagen werden.

Die Effizienz verbessert sich – und der Verbrauch steigt trotzdem

Beide Aussagen sind wahr, und die Spannung verwirrt viele Berichterstattungen.

Die Energie pro Token ist durch bessere Hardware, Quantisierung, Batching, Caching, spärliche Architekturen, die nur einen Teil des Modells pro Token aktivieren, und destillierte kleine Modelle, die Routinearbeiten erledigen, stark gesunken. Das sind keine marginalen Gewinne; sie sind groß.

Der Gesamtverbrauch ist trotzdem gestiegen, da die Nutzung schneller gewachsen ist als die Effizienz. Dies ist das übliche Rebound-Muster: Wenn eine Einheit von etwas billiger wird, wird mehr davon verbraucht. Effizienz ist notwendig und nicht ausreichend.

Was man tatsächlich messen sollte

Wenn Sie einen Dienst betreiben und eine belastbare Zahl anstelle einer Schlagzeile wünschen:

  • Anlagen-PUE, vom Betreiber.
  • CO2-Intensität des Stromnetzes, wo und wann Sie betreiben. Die gleiche Arbeitslast kann sich zwischen Regionen und Tageszeiten um ein Vielfaches unterscheiden.
  • Pro Energieeinheit bediente Tokens, über die Zeit verfolgt. Dies erfasst Ihre Modell- und Routing-Entscheidungen, die die Teile sind, die Sie kontrollieren.
  • Wassernutzungseffektivität, wenn Sie in einer wasserarmen Region tätig sind.

Die unbequeme Zusammenfassung: Die meisten Hebel, die den KI-Energieverbrauch senken, sind die gleichen, die die KI-Kosten senken – kleinere Modelle, wo sie ausreichen, Caching, Batching, kürzere Ausgaben. Diese Ausrichtung ist der Grund für moderate Optimismus hinsichtlich des Pro-Anfrage-Trends, und sie ist auch der Grund, warum die Gesamtnachfrage weiter steigt.

Häufige Fragen

Wie viel Strom verbraucht eine einzelne KI-Anfrage?
Es variiert um Größenordnungen mit Modellgröße, Ausgabelänge und Hardware, und die meisten veröffentlichten Einzelabfrage-Zahlen sind Schätzungen und keine Messungen. Der nützliche Vergleich ist nicht pro Abfrage, sondern pro Bereitstellung: ein Dienst, der Millionen von Anfragen pro Tag bearbeitet, hat eine kontinuierliche Last von mehreren Megawatt.
Ist Training oder Inferenz für mehr Energieverbrauch verantwortlich?
Training ist eine große einmalige Kosten; Inferenz sind kleinere Kosten, die unendlich oft wiederholt werden. Für jedes weit verbreitete Modell übersteigen die kumulativen Inferenzkosten die Trainingsenergie bei weitem innerhalb ihrer Lebensdauer.
Hilft die Verwendung eines kleineren Modells tatsächlich?
Erheblich. Die Energie pro Token skaliert mit der durchgeführten Berechnung, sodass die Weiterleitung einfacher Anfragen an ein kleines Modell und die Reservierung des großen Modells für schwierige Anfragen sowohl Kosten als auch Strom für die gleiche Arbeitslast senkt.
Warum brauchen Rechenzentren so viel Wasser?
Verdunstungskühlung ist billig und effizient, verbraucht aber Wasser. Kühlkreislauf- und Flüssigkeitskühlsysteme verbrauchen weitaus weniger Wasser, ziehen aber mehr Strom – die beiden Ressourcen tauschen sich gegeneinander aus.

Quellen

  1. Electricity 2024 — analysis and forecast to 2026 — International Energy Agency
  2. Data centre energy use — research programme — Lawrence Berkeley National Laboratory
  3. Power usage effectiveness (PUE) — The Green Grid
Schlagwörterdata centresenergyGPUsinferencesustainability

Passend dazu

AWS führt Modell-Caching ein, um Kaltstarts bei der Inferenz auf SageMaker HyperPod zu verkürzen

AWS hat Modell-Caching für Amazon SageMaker Inference auf HyperPod eingeführt. Die Funktion lädt Modellgewichte und Container-Images vorab auf die Cluster-Knoten, sodass Pods mit rund 7 GB/s von lokalem NVMe-Speicher statt über das Netzwerk lesen können. Dadurch beginnen Pods laut AWS in der Regel innerhalb von Sekunden statt zig Minuten mit der Verarbeitung von Traffic.

2 Min. Lesezeit

Analyse: Ein offenes Modell selbst hosten — die Rechnung, die darüber entscheidet, und die Kosten, die niemand einplant

Nur bei hoher, gleichmäßiger Auslastung. Eigenes Hosting verwandelt variable Kosten pro Token in feste Stundenkosten — das lohnt sich, solange die Beschleuniger durchgehend ausgelastet sind, und rächt sich empfindlich, sobald sie leerlaufen. Ein ehrlicher Vergleich bepreist den gesamten Stack — Beschleuniger-Stunden, Redundanz, Entwicklungszeit und die Evaluationsarbeit, die nötig ist, um zu bestätigen, dass das kleinere Modell ausreicht — gegen die API-Rechnung für denselben Traffic. Souveränität, Datenresidenz und Latenzuntergrenzen sind eigenständige Gründe, die eigenes Hosting unabhängig von dieser Rechnung rechtfertigen können.

6 Min. Lesezeit