d-Matrix announced it will use NVIDIA NVLink Fusion to connect its next-generation Raptor XPUs to NVIDIA's AI infrastructure platform, including NVLink scale-up and Spectrum-X networking and the MGX rack architecture. The company said this gives it a path to deploy Raptor at large scale alongside NVIDIA systems.
AWS hat Modell-Caching für Amazon SageMaker Inference auf HyperPod eingeführt. Die Funktion lädt Modellgewichte und Container-Images vorab auf die Cluster-Knoten, sodass Pods mit rund 7 GB/s von lokalem NVMe-Speicher statt über das Netzwerk lesen können. Dadurch beginnen Pods laut AWS in der Regel innerhalb von Sekunden statt zig Minuten mit der Verarbeitung von Traffic.
Databricks unveiled Proteus, a system that uses agents to generate specialized GPU kernels and subjects candidates to controlled validation and repeated benchmarking. The company says individual kernels generated for Qwen 3.5 122B were 1.8 to 5.2 times faster than the best implementations available in vLLM.
Anthropic hat Google Cloud im Rahmen einer am 3. Februar 2023 angekündigten Partnerschaft als Cloud-Anbieter ausgewählt. Die Unternehmen planen, gemeinsam KI-Computing-Systeme zu entwickeln, während Anthropic erklärt, die GPU- und TPU-Cluster von Google Cloud zum Training, zur Skalierung und zum Einsatz seiner KI-Systeme, einschließlich Claude, zu nutzen.
Nur bei hoher, gleichmäßiger Auslastung. Eigenes Hosting verwandelt variable Kosten pro Token in feste Stundenkosten — das lohnt sich, solange die Beschleuniger durchgehend ausgelastet sind, und rächt sich empfindlich, sobald sie leerlaufen. Ein ehrlicher Vergleich bepreist den gesamten Stack — Beschleuniger-Stunden, Redundanz, Entwicklungszeit und die Evaluationsarbeit, die nötig ist, um zu bestätigen, dass das kleinere Modell ausreicht — gegen die API-Rechnung für denselben Traffic. Souveränität, Datenresidenz und Latenzuntergrenzen sind eigenständige Gründe, die eigenes Hosting unabhängig von dieser Rechnung rechtfertigen können.
KI-Beschleuniger verbrauchen pro Rack weitaus mehr Strom als herkömmliche Server, und diese Leistung muss kontinuierlich bereitgestellt, gekühlt und bezahlt werden. Das Training eines großen Modells ist ein einmaliger Spitzenbedarf; die Bereitstellung für Millionen von Benutzern ist eine permanente Last, und die Inferenz dominiert den Energieverbrauch über die Lebensdauer eines eingesetzten Modells.