Skip to content
DigitalNeuron

반도체·인프라

가속기, 데이터센터, 메모리 수급, 그리고 AI 의 전기요금.

기사 6건

AWS, 세이지메이커 하이퍼포드에 모델 캐싱 도입…추론 콜드 스타트 시간 단축

AWS는 하이퍼포드용 아마존 세이지메이커 인퍼런스의 모델 캐싱 기능을 출시했다. 이 기능은 모델 가중치와 컨테이너 이미지를 클러스터 노드에 미리 로드해, 파드가 네트워크를 통해 내려받는 대신 로컬 NVMe 스토리지에서 초당 약 7GB 속도로 데이터를 읽도록 한다. AWS에 따르면 이를 통해 파드는 보통 수십 분이 아닌 몇 초 만에 트래픽 처리를 시작할 수 있다.

2분 읽기

앤스로픽, 클로드 개발 지원을 위해 구글 클라우드 선택

앤스로픽은 2023년 2월 3일 발표한 파트너십을 통해 구글 클라우드를 클라우드 제공업체로 선택했다. 양사는 AI 컴퓨팅 시스템을 공동 개발할 계획이며, 앤스로픽은 클로드를 포함한 자사의 AI 시스템을 훈련하고 확장하며 배포하는 데 구글 클라우드의 GPU 및 TPU 클러스터를 활용할 것이라고 밝혔다.

2분 읽기

분석: 오픈 웨이트 모델 자체호스팅 — 결정을 가르는 산수와, 아무도 예산에 안 넣는 비용들

가동률이 높고 «꾸준할 때»만 그렇다. 자체호스팅은 토큰당 변동비를 시간당 고정비로 바꾼다 — 가속기가 계속 바쁘면 이기고, 놀면 크게 진다. 정직한 비교는 스택 전체에 값을 매긴다: 가속기 시간, 이중화, 엔지니어 시간, 그리고 «더 작은 모델로도 충분한가»를 확인하는 평가 작업까지. 같은 트래픽에 대한 API 청구서와 그것을 견준다. 데이터 주권·데이터 소재지·지연 하한은 산수와 무관하게 자체호스팅을 정당화할 수 있는 별개의 이유다.

6분 읽기

AI 는 왜 전기를 그렇게 많이 쓰는가

AI 가속기는 랙당 전력이 기존 서버보다 훨씬 크고, 그 전력을 계속 공급하고 식히고 지불해야 한다. 대형 모델 학습은 한 번의 스파이크지만 수백만 사용자에게 서비스하는 일은 영구적인 부하이며, 배포된 모델의 생애 에너지는 추론이 지배한다.

4분 읽기