Skip to content
DigitalNeuron

Chips & Infrastruktur

Beschleuniger, Rechenzentren, Speicherversorgung und die Stromrechnung der KI.

6 Beiträge

AWS führt Modell-Caching ein, um Kaltstarts bei der Inferenz auf SageMaker HyperPod zu verkürzen

AWS hat Modell-Caching für Amazon SageMaker Inference auf HyperPod eingeführt. Die Funktion lädt Modellgewichte und Container-Images vorab auf die Cluster-Knoten, sodass Pods mit rund 7 GB/s von lokalem NVMe-Speicher statt über das Netzwerk lesen können. Dadurch beginnen Pods laut AWS in der Regel innerhalb von Sekunden statt zig Minuten mit der Verarbeitung von Traffic.

2 Min. Lesezeit

Anthropic wählt Google Cloud zur Unterstützung der Claude-Entwicklung

Anthropic hat Google Cloud im Rahmen einer am 3. Februar 2023 angekündigten Partnerschaft als Cloud-Anbieter ausgewählt. Die Unternehmen planen, gemeinsam KI-Computing-Systeme zu entwickeln, während Anthropic erklärt, die GPU- und TPU-Cluster von Google Cloud zum Training, zur Skalierung und zum Einsatz seiner KI-Systeme, einschließlich Claude, zu nutzen.

2 Min. Lesezeit

Analyse: Ein offenes Modell selbst hosten — die Rechnung, die darüber entscheidet, und die Kosten, die niemand einplant

Nur bei hoher, gleichmäßiger Auslastung. Eigenes Hosting verwandelt variable Kosten pro Token in feste Stundenkosten — das lohnt sich, solange die Beschleuniger durchgehend ausgelastet sind, und rächt sich empfindlich, sobald sie leerlaufen. Ein ehrlicher Vergleich bepreist den gesamten Stack — Beschleuniger-Stunden, Redundanz, Entwicklungszeit und die Evaluationsarbeit, die nötig ist, um zu bestätigen, dass das kleinere Modell ausreicht — gegen die API-Rechnung für denselben Traffic. Souveränität, Datenresidenz und Latenzuntergrenzen sind eigenständige Gründe, die eigenes Hosting unabhängig von dieser Rechnung rechtfertigen können.

6 Min. Lesezeit

Warum verbraucht KI so viel Strom?

KI-Beschleuniger verbrauchen pro Rack weitaus mehr Strom als herkömmliche Server, und diese Leistung muss kontinuierlich bereitgestellt, gekühlt und bezahlt werden. Das Training eines großen Modells ist ein einmaliger Spitzenbedarf; die Bereitstellung für Millionen von Benutzern ist eine permanente Last, und die Inferenz dominiert den Energieverbrauch über die Lebensdauer eines eingesetzten Modells.

4 Min. Lesezeit