Skip to content
DigitalNeuron

Chips e infraestructura

Aceleradores, centros de datos, suministro de memoria y la factura eléctrica de la IA.

6 artículos

d-Matrix conectará sus XPU Raptor a la plataforma de NVIDIA mediante NVLink Fusion

d-Matrix anunció que utilizará NVLink Fusion de NVIDIA para conectar sus XPU Raptor de nueva generación a la plataforma de infraestructura de IA de NVIDIA, incluida la red de escalado vertical NVLink, la red de escalado horizontal Spectrum-X y la arquitectura de racks MGX. La compañía afirmó que esto le abre una vía para desplegar Raptor a gran escala junto a los sistemas de NVIDIA.

2 min de lectura

AWS lanza el almacenamiento en caché de modelos para reducir los arranques en frío de inferencia en SageMaker HyperPod

AWS launched model caching for Amazon SageMaker Inference on HyperPod. The feature pre-loads model weights and container images onto cluster nodes so pods can read from local NVMe storage at about 7 GB/s instead of downloading over the network, letting pods typically start serving traffic in seconds rather than tens of minutes, AWS says.

3 min de lectura

Anthropic elige Google Cloud para apoyar el desarrollo de Claude

Anthropic eligió Google Cloud como proveedor de servicios en la nube mediante una alianza anunciada el 3 de febrero de 2023. Las empresas prevén desarrollar conjuntamente sistemas informáticos de IA, mientras que Anthropic afirma que utilizará los clústeres de GPU y TPU de Google Cloud para entrenar, ampliar y desplegar sus sistemas de IA, incluido Claude.

2 min de lectura

Análisis: alojar por cuenta propia un modelo de pesos abiertos, la aritmética que determina si compensa y los costes que nadie presupuesta

Solo con una utilización elevada y constante. El alojamiento propio transforma un coste variable por token en un coste fijo por hora, de modo que resulta ventajoso cuando los aceleradores se mantienen ocupados y muy desfavorable cuando están inactivos. Una comparación rigurosa debe contraponer el coste de toda la infraestructura —horas de acelerador, redundancia, tiempo de ingeniería y el trabajo de evaluación necesario para confirmar que el modelo más pequeño ofrece una calidad suficiente— con la factura de la API para el mismo volumen de tráfico. La soberanía, la residencia de los datos y los requisitos mínimos de latencia son motivos independientes que pueden justificar el alojamiento propio al margen de los cálculos.

7 min de lectura

¿Por qué la IA consume tanta electricidad?

Los aceleradores de IA consumen mucha más energía por rack que los servidores tradicionales, y esa energía debe ser suministrada, enfriada y pagada continuamente. Entrenar un modelo grande es un pico puntual; servirlo a millones de usuarios es una carga permanente, y la inferencia es lo que domina el uso de energía durante la vida útil de un modelo desplegado.

4 min de lectura