d-Matrix announced it will use NVIDIA NVLink Fusion to connect its next-generation Raptor XPUs to NVIDIA's AI infrastructure platform, including NVLink scale-up and Spectrum-X networking and the MGX rack architecture. The company said this gives it a path to deploy Raptor at large scale alongside NVIDIA systems.
AWS는 하이퍼포드용 아마존 세이지메이커 인퍼런스의 모델 캐싱 기능을 출시했다. 이 기능은 모델 가중치와 컨테이너 이미지를 클러스터 노드에 미리 로드해, 파드가 네트워크를 통해 내려받는 대신 로컬 NVMe 스토리지에서 초당 약 7GB 속도로 데이터를 읽도록 한다. AWS에 따르면 이를 통해 파드는 보통 수십 분이 아닌 몇 초 만에 트래픽 처리를 시작할 수 있다.
Databricks unveiled Proteus, a system that uses agents to generate specialized GPU kernels and subjects candidates to controlled validation and repeated benchmarking. The company says individual kernels generated for Qwen 3.5 122B were 1.8 to 5.2 times faster than the best implementations available in vLLM.
앤스로픽은 2023년 2월 3일 발표한 파트너십을 통해 구글 클라우드를 클라우드 제공업체로 선택했다. 양사는 AI 컴퓨팅 시스템을 공동 개발할 계획이며, 앤스로픽은 클로드를 포함한 자사의 AI 시스템을 훈련하고 확장하며 배포하는 데 구글 클라우드의 GPU 및 TPU 클러스터를 활용할 것이라고 밝혔다.
가동률이 높고 «꾸준할 때»만 그렇다. 자체호스팅은 토큰당 변동비를 시간당 고정비로 바꾼다 — 가속기가 계속 바쁘면 이기고, 놀면 크게 진다. 정직한 비교는 스택 전체에 값을 매긴다: 가속기 시간, 이중화, 엔지니어 시간, 그리고 «더 작은 모델로도 충분한가»를 확인하는 평가 작업까지. 같은 트래픽에 대한 API 청구서와 그것을 견준다. 데이터 주권·데이터 소재지·지연 하한은 산수와 무관하게 자체호스팅을 정당화할 수 있는 별개의 이유다.