Skip to content
DigitalNeuron
반도체·인프라

AWS, 세이지메이커 하이퍼포드에 모델 캐싱 도입…추론 콜드 스타트 시간 단축

AWS가 아마존 세이지메이커 인퍼런스의 하이퍼포드용 모델 캐싱 기능을 발표했다. 모델 가중치와 컨테이너 이미지를 미리 로드해 파드 시작 시간을 수십 분에서 몇 초로 줄이는 것이 골자다.

DigitalNeuron Desk2분 읽기

한 줄 답

AWS는 아마존 세이지메이커 하이퍼포드의 추론 콜드 스타트를 줄이기 위해 무엇을 발표했나?

AWS는 하이퍼포드용 아마존 세이지메이커 인퍼런스의 모델 캐싱 기능을 출시했다. 이 기능은 모델 가중치와 컨테이너 이미지를 클러스터 노드에 미리 로드해, 파드가 네트워크를 통해 내려받는 대신 로컬 NVMe 스토리지에서 초당 약 7GB 속도로 데이터를 읽도록 한다. AWS에 따르면 이를 통해 파드는 보통 수십 분이 아닌 몇 초 만에 트래픽 처리를 시작할 수 있다.

핵심 요약

  • AWS에 따르면 세이지메이커 하이퍼포드에 LLM을 배포할 때 파드가 트래픽을 처리하기 전 두 가지 순차적 다운로드가 필요하다. 아마존 ECR에서 받는 추론 서버 컨테이너 이미지와, 아마존 S3나 FSx 포 러스터, 허깅페이스 허브 같은 저장소에서 받는 모델 가중치다.
  • AWS에 따르면 딥시크-R1처럼 600GB가 넘는 대형 모델은 준비되기까지 30분 이상 걸릴 수 있으며, 스케일 아웃이 발생할 때마다 동일한 다운로드 과정이 반복된다.
  • AWS는 모델 캐싱이 파드가 필요로 하기 전에 모델 가중치와 컨테이너 이미지를 클러스터 노드에 미리 로드해, 파드가 네트워크 다운로드 대신 로컬 NVMe 스토리지에서 초당 약 7GB 속도로 읽을 수 있게 한다고 밝혔다.
  • AWS에 따르면 이 기능에는 가중치 캐시가 포함되며, InferenceEndpointConfig나 JumpStartModel 리소스에 weightsCache를 포함한 modelCacheConfig를 추가하면 하이퍼포드 인퍼런스 오퍼레이터가 ModelDataCacheConfig 리소스를 생성하고 가중치를 미리 내려받기 시작한다.
  • AWS는 모델 캐싱을 구성하는 두 가지 기능을 함께 켜거나 개별적으로 켤 수 있다고 밝혔다.

아마존 웹서비스(AWS)가 아마존 세이지메이커 인퍼런스의 하이퍼포드용 모델 캐싱 기능을 발표했다. 추론 파드가 트래픽 처리를 시작하기까지 걸리는 시간을 단축하기 위해 설계된 기능이다.

콜드 스타트 문제

AWS에 따르면 세이지메이커 하이퍼포드에서 대규모 언어 모델을 추론용으로 배포할 때는 파드를 요청한 시점과 해당 파드가 요청을 처리할 준비가 되는 시점 사이에 간극이 발생한다. AWS는 이 간극의 원인을 두 가지 순차적 다운로드로 설명한다. 아마존 일래스틱 컨테이너 레지스트리(ECR)에서 내려받는 추론 서버 컨테이너 이미지와, 아마존 S3나 아마존 FSx 포 러스터, 허깅페이스 허브 같은 저장소에서 내려받는 모델 가중치다.

AWS는 vLLM이나 LMI 같은 서버용 컨테이너 이미지는 용량이 수 기가바이트에 달해 내려받는 데 5~7분이 걸린다고 설명한다. GPU 드라이버와 CUDA 라이브러리, 서빙 프레임워크가 함께 묶여 있기 때문이다. 이 과정이 끝나면 추론 서버는 모델 가중치를 내려받는다. AWS에 따르면 아마존 S3에 저장된 145GB 규모 모델은 네트워크 상태에 따라 추가로 20분 이상이 걸릴 수 있고, 딥시크-R1처럼 600GB를 넘는 모델은 전체적으로 30분 이상 소요될 수 있다.

AWS는 이 다운로드 과정이 스케일 아웃 상황에서 새로 생성되는 파드마다 반복된다고 밝혔다. 예를 들어 트래픽이 급증해 수평형 파드 오토스케일러(HorizontalPodAutoscaler)가 새 파드 5개를 요청하면, 5개 파드 모두 독립적으로 동일한 다운로드 절차를 거친다. AWS는 오토스케일링 정책 자체는 몇 초 만에 반응할 수 있지만, 각 파드가 다운로드를 마쳐야 하므로 실제로 추가 트래픽을 처리할 수 있기까지는 25분에서 30분 이상이 걸린다고 설명했다.

모델 캐싱 작동 방식

AWS에 따르면 모델 캐싱은 파드가 스케줄링되기 전에 데이터를 노드에 미리 로드하는 방식으로, 함께 켜거나 개별적으로 켤 수 있는 두 가지 독립된 기능으로 구성된다.

이 중 하나인 가중치 캐시는 각 노드의 로컬 NVMe 스토리지에 모델 가중치를 미리 내려받는다고 AWS는 설명했다. AWS에 따르면 설정 방법은 InferenceEndpointConfig나 JumpStartModel 리소스에 weightsCache를 활성화한 modelCacheConfig를 추가해 적용하는 것이다. 이를 적용하면 하이퍼포드 인퍼런스 오퍼레이터가 자동으로 ModelDataCacheConfig 리소스를 생성하고, 아마존 S3를 비롯해 설정된 소스로부터 모델 가중치 다운로드를 시작한다고 AWS는 밝혔다.

모델 캐싱을 활성화하면 파드가 네트워크를 통해 내려받는 대신 로컬 NVMe 스토리지에서 초당 약 7GB 속도로 데이터를 읽을 수 있다고 AWS는 설명했다. 그 결과 파드는 보통 수십 분이 아닌 몇 초 만에 트래픽 처리를 시작할 수 있다고 AWS는 밝혔다.

출처: AWS 머신러닝 블로그, "Reduce inference cold starts on Amazon SageMaker HyperPod with model caching", 2026년 9월 10일 게재.

자주 묻는 질문

AWS에 따르면 모델 캐싱은 어떤 문제를 해결하나?
AWS는 세이지메이커 하이퍼포드에서 파드를 요청한 시점과 실제로 트래픽 처리가 가능해지는 시점 사이의 간극을 해결한다고 밝혔다. 이 간극은 컨테이너 이미지와 모델 가중치를 순차적으로 다운로드하는 데서 비롯된다고 설명했다.
AWS에 따르면 모델 캐싱을 적용하면 파드 시작 속도가 얼마나 빨라지나?
AWS는 모델 캐싱을 활성화하면 파드가 보통 수십 분이 아닌 몇 초 만에 트래픽 처리를 시작할 수 있다고 밝혔다.
모델 캐싱을 구성하는 두 가지 기능은 무엇인가?
AWS는 각 노드의 로컬 NVMe 스토리지에 모델 가중치를 미리 로드하는 가중치 캐시를, 함께 또는 개별적으로 활성화할 수 있는 두 가지 독립 기능 중 하나로 설명했다. 이번 발표 내용에는 두 번째 기능에 대한 상세 설명은 담기지 않았다.
가중치 캐시는 어떻게 활성화하나?
AWS에 따르면 사용자가 InferenceEndpointConfig나 JumpStartModel 리소스에 weightsCache를 활성화한 modelCacheConfig를 추가하면, 하이퍼포드 인퍼런스 오퍼레이터가 ModelDataCacheConfig 리소스를 생성하고 설정된 소스로부터 가중치 다운로드를 시작한다.

출처

  1. Reduce inference cold starts on Amazon SageMaker HyperPod with model caching | Artificial IntelligenceAmazon Web Services (AWS)
태그awssagemakerhyperpodinferencemodel-cachingamazon-bedrock

함께 읽기

분석: 오픈 웨이트 모델 자체호스팅 — 결정을 가르는 산수와, 아무도 예산에 안 넣는 비용들

가동률이 높고 «꾸준할 때»만 그렇다. 자체호스팅은 토큰당 변동비를 시간당 고정비로 바꾼다 — 가속기가 계속 바쁘면 이기고, 놀면 크게 진다. 정직한 비교는 스택 전체에 값을 매긴다: 가속기 시간, 이중화, 엔지니어 시간, 그리고 «더 작은 모델로도 충분한가»를 확인하는 평가 작업까지. 같은 트래픽에 대한 API 청구서와 그것을 견준다. 데이터 주권·데이터 소재지·지연 하한은 산수와 무관하게 자체호스팅을 정당화할 수 있는 별개의 이유다.

6분 읽기

AI 는 왜 전기를 그렇게 많이 쓰는가

AI 가속기는 랙당 전력이 기존 서버보다 훨씬 크고, 그 전력을 계속 공급하고 식히고 지불해야 한다. 대형 모델 학습은 한 번의 스파이크지만 수백만 사용자에게 서비스하는 일은 영구적인 부하이며, 배포된 모델의 생애 에너지는 추론이 지배한다.

4분 읽기