d-Matrix anunció que utilizará NVLink Fusion de NVIDIA para conectar sus XPU Raptor de nueva generación a la plataforma de infraestructura de IA de NVIDIA, incluida la red de escalado vertical NVLink, la red de escalado horizontal Spectrum-X y la arquitectura de racks MGX. La compañía afirmó que esto le abre una vía para desplegar Raptor a gran escala junto a los sistemas de NVIDIA.
AWS launched model caching for Amazon SageMaker Inference on HyperPod. The feature pre-loads model weights and container images onto cluster nodes so pods can read from local NVMe storage at about 7 GB/s instead of downloading over the network, letting pods typically start serving traffic in seconds rather than tens of minutes, AWS says.
Databricks unveiled Proteus, a system that uses agents to generate specialized GPU kernels and subjects candidates to controlled validation and repeated benchmarking. The company says individual kernels generated for Qwen 3.5 122B were 1.8 to 5.2 times faster than the best implementations available in vLLM.
Anthropic eligió Google Cloud como proveedor de servicios en la nube mediante una alianza anunciada el 3 de febrero de 2023. Las empresas prevén desarrollar conjuntamente sistemas informáticos de IA, mientras que Anthropic afirma que utilizará los clústeres de GPU y TPU de Google Cloud para entrenar, ampliar y desplegar sus sistemas de IA, incluido Claude.
Solo con una utilización elevada y constante. El alojamiento propio transforma un coste variable por token en un coste fijo por hora, de modo que resulta ventajoso cuando los aceleradores se mantienen ocupados y muy desfavorable cuando están inactivos. Una comparación rigurosa debe contraponer el coste de toda la infraestructura —horas de acelerador, redundancia, tiempo de ingeniería y el trabajo de evaluación necesario para confirmar que el modelo más pequeño ofrece una calidad suficiente— con la factura de la API para el mismo volumen de tráfico. La soberanía, la residencia de los datos y los requisitos mínimos de latencia son motivos independientes que pueden justificar el alojamiento propio al margen de los cálculos.
Los aceleradores de IA consumen mucha más energía por rack que los servidores tradicionales, y esa energía debe ser suministrada, enfriada y pagada continuamente. Entrenar un modelo grande es un pico puntual; servirlo a millones de usuarios es una carga permanente, y la inferencia es lo que domina el uso de energía durante la vida útil de un modelo desplegado.