Skip to content

半導体・インフラ

アクセラレータ、データセンター、メモリ供給、そして AI の電気代。

6 本

d-Matrix、NVLink FusionでRaptor XPUをNVIDIAプラットフォームに接続へ

d-Matrixは、次世代XPU「Raptor」をNVIDIAのAIインフラプラットフォームに接続するためNVIDIAのNVLink Fusionを採用すると発表した。これにはNVLinkによるスケールアップネットワークやSpectrum-Xネットワーク、MGXラックアーキテクチャとの接続も含まれる。同社は、これによりNVIDIAシステムと並んでRaptorを大規模展開する道が開けるとしている。

約2分

AWSがSageMaker HyperPodに「モデルキャッシング」機能を追加、推論のコールドスタートを短縮

AWS launched model caching for Amazon SageMaker Inference on HyperPod. The feature pre-loads model weights and container images onto cluster nodes so pods can read from local NVMe storage at about 7 GB/s instead of downloading over the network, letting pods typically start serving traffic in seconds rather than tens of minutes, AWS says.

約3分

Anthropic、Claude開発支援にGoogle Cloudを採用

Anthropicは、2023年2月3日に発表した提携に基づき、クラウドプロバイダーとしてGoogle Cloudを採用した。両社はAIコンピューティングシステムを共同開発する計画で、AnthropicはClaudeを含む自社のAIシステムの訓練、規模拡大、展開にGoogle CloudのGPUおよびTPUクラスターを利用するとしている。

約2分

分析:オープンウェイトモデルのセルフホスティング——導入を左右する採算計算と、誰も予算に織り込まないコスト

高水準かつ安定した稼働率を確保できる場合に限られる。セルフホスティングでは、トークン単位の変動費が時間単位の固定費に変わるため、アクセラレーターを高稼働させられれば有利だが、遊休時間が生じると大幅に不利になる。正確に比較するには、アクセラレーターの稼働時間、冗長化、エンジニアリング工数に加え、小規模モデルで十分な品質を確保できるかを検証する評価作業まで含めたシステム全体の費用を、同一トラフィックに対するAPI料金と比べる必要がある。主権、データレジデンシー、最低遅延の保証は、採算計算とは別にセルフホスティングを正当化し得る理由となる。

約9分

AIはなぜこんなに多くの電気を使うのか?

AIアクセラレータは従来のサーバーに比べてラックあたりの消費電力がはるかに大きく、その電力は常に供給、冷却、支払いが必要です。大規模モデルの学習は一時的なピークですが、数百万のユーザーに提供する際は永続的な負荷となり、導入されたモデルのライフサイクル全体でエネルギー消費を主導するのは推論です。

約5分