AWS lanza el almacenamiento en caché de modelos para reducir los arranques en frío de inferencia en SageMaker HyperPod
AWS announced model caching for Amazon SageMaker Inference on HyperPod, pre-loading model weights and container images to cut pod startup time from tens of minutes to seconds.
Respuesta rápida
¿Qué anunció AWS para reducir los tiempos de arranque en frío de la inferencia en Amazon SageMaker HyperPod?
AWS launched model caching for Amazon SageMaker Inference on HyperPod. The feature pre-loads model weights and container images onto cluster nodes so pods can read from local NVMe storage at about 7 GB/s instead of downloading over the network, letting pods typically start serving traffic in seconds rather than tens of minutes, AWS says.
Claves
- AWS says deploying an LLM on SageMaker HyperPod involves two sequential downloads before a pod can serve traffic: the inference server container image from Amazon ECR, then the model weights from a storage source such as Amazon S3, FSx for Lustre, or HuggingFace Hub.
- Según AWS, los modelos de gran tamaño, como DeepSeek-R1, que superan los 600 GB, pueden tardar 30 minutos o más en estar listos, y cada evento de escalado horizontal repite el mismo ciclo de descarga.
- AWS states that model caching pre-loads model weights and container images onto cluster nodes before pods need them, letting pods read from local NVMe storage at approximately 7 GB/s instead of downloading over the network.
- AWS afirma que la función incluye una caché de pesos, que se activa añadiendo modelCacheConfig con weightsCache a un recurso InferenceEndpointConfig o JumpStartModel, lo que hace que el HyperPod Inference Operator cree un recurso ModelDataCacheConfig y comience a descargar los pesos por adelantado.
- AWS says the two capabilities in model caching can be enabled together or separately.
Amazon Web Services anunció el almacenamiento en caché de modelos para Amazon SageMaker Inference en HyperPod, una función diseñada para reducir el tiempo que tardan los pods de inferencia en empezar a atender tráfico.
El problema del arranque en frío
Según AWS, implementar un modelo de lenguaje de gran tamaño para inferencia en SageMaker HyperPod implica un desfase entre la solicitud de un pod y el momento en que ese pod está listo para atender solicitudes. AWS atribuye este desfase a dos descargas secuenciales: la imagen del contenedor del servidor de inferencia desde Amazon Elastic Container Registry y los pesos del modelo desde una fuente de almacenamiento como Amazon S3, Amazon FSx for Lustre o HuggingFace Hub.
AWS afirma que las imágenes de contenedor para servidores como vLLM o LMI ocupan varios gigabytes y tardan entre 5 y 7 minutos en descargarse, ya que incluyen controladores de GPU, bibliotecas CUDA y el framework de servicio. Después de eso, el servidor de inferencia descarga los pesos del modelo. AWS señala que un modelo de 145 GB alojado en Amazon S3 puede tardar más de 20 minutos adicionales según las condiciones de red, y un modelo de más de 600 GB, como DeepSeek-R1, puede llegar a tardar hasta 30 minutos en total.
AWS también indica que este ciclo de descarga se repite en cada pod nuevo durante un evento de escalado horizontal. En su ejemplo, si el tráfico se dispara y un HorizontalPodAutoscaler solicita cinco pods nuevos, los cinco pasan por la secuencia de descarga de forma independiente. AWS señala que, si bien la política de autoescalado puede reaccionar en cuestión de segundos, el tiempo real antes de poder atender tráfico adicional es de entre 25 y más de 30 minutos, ya que cada pod debe completar primero sus propias descargas.
Cómo funciona el almacenamiento en caché de modelos
AWS explica que el almacenamiento en caché de modelos precarga los datos en los nodos antes de que se programen los pods, e introduce dos capacidades independientes que pueden activarse juntas o por separado.
Una de ellas, la caché de pesos, descarga de antemano los pesos del modelo al almacenamiento NVMe local de cada nodo, según AWS. AWS describe el proceso de configuración como añadir modelCacheConfig con weightsCache habilitado a un recurso InferenceEndpointConfig o JumpStartModel y aplicarlo. Una vez aplicado, AWS indica que el HyperPod Inference Operator crea automáticamente un recurso ModelDataCacheConfig y comienza a descargar los pesos del modelo desde la fuente configurada, que puede ser Amazon S3, entre otras.
Con el almacenamiento en caché de modelos activado, AWS afirma que los pods pueden leer desde el almacenamiento NVMe local a una velocidad aproximada de 7 GB/s en lugar de descargar a través de la red. Como resultado, AWS indica que los pods pueden por lo general empezar a atender tráfico en cuestión de segundos, en lugar de decenas de minutos.
Fuente: AWS Machine Learning Blog, "Reduce inference cold starts on Amazon SageMaker HyperPod with model caching", publicado el 10 de septiembre de 2026.
Preguntas frecuentes
- ¿Qué problema resuelve el almacenamiento en caché de modelos, según AWS?
- AWS says it addresses the gap between requesting a pod on SageMaker HyperPod and that pod being ready to serve traffic, a gap it attributes to sequential downloads of the container image and model weights.
- ¿Cuánto más rápido, según AWS, arrancan los pods con el almacenamiento en caché de modelos habilitado?
- AWS says pods can typically start serving traffic in seconds rather than tens of minutes once model caching is enabled.
- ¿Cuáles son las dos capacidades dentro del almacenamiento en caché de modelos?
- AWS describes a weights cache, which pre-loads model weights to local NVMe storage on each node, as one of two independent capabilities that can be enabled together or separately; the announcement's excerpt does not fully detail the second.
- ¿Cómo se habilita la caché de pesos?
- AWS says a user adds modelCacheConfig with weightsCache enabled to an InferenceEndpointConfig or JumpStartModel resource, which causes the HyperPod Inference Operator to create a ModelDataCacheConfig resource and start downloading weights from the configured source.
Fuentes
- Reduce inference cold starts on Amazon SageMaker HyperPod with model caching | Artificial Intelligence — Amazon Web Services (AWS)