Skip to content
半導体・インフラ

AIはなぜこんなに多くの電気を使うのか?

学習は注目を集めるが、モデルのサービングではシステムのライフサイクル全体で電力が消費される。ここで実際に電力がどこに使われ、チップから電力網への制約が移行したのかが分かる。

DigitalNeuron Desk約1分

ひとことで言うと

なぜAIはこれほど多くの電力を消費するのか?

AIアクセラレータは従来のサーバーに比べてラックあたりの消費電力がはるかに大きく、その電力は常に供給、冷却、支払いが必要です。大規模モデルの学習は一時的なピークですが、数百万のユーザーに提供する際は永続的な負荷となり、導入されたモデルのライフサイクル全体でエネルギー消費を主導するのは推論です。

要点

  • AIラックは従来のサーバーラックと比べて桁違いの電力を消費し、建物そのものの構造まで変えることになる。
  • 学習は一時的なピークに過ぎず、推論は永続的な負荷です。モデルのライフサイクル全体で、サービングが支配的です。
  • 多くの地域では、現在の制約はチップ供給ではなく、グリッド接続とトランスフォーマーだ。
  • トークンあたりの効率向上は確かに大きいが、需要はさらに速く増えているため、総消費量は引き続き増加し続けている。

データセンターは20年間、かなりの量の電力を消費してきました。AIで変わったのはその密度です。つまり、1つのラックがどれだけの電力を必要とし、それゆえ建物がどれだけの電力を供給し、除去できなければならないかということです。

電力は実際にどこに使われるか

降順で4つの場所です。

アクセラレータ。 GPUと専用AIチップは、数千もの算術ユニットを同時に稼働させるように設計されています。ハイエンドのアクセラレータは、それ自体で数百ワットから1000ワット以上を消費し、トレーニングノードにはそれらが複数搭載されています。従来のサーバーラックが5〜15kWを消費するのに対し、AIラックは数十kW、最新の設計では100kW以上で仕様が定められています。

データの移動。 大規模なモデルは多くのチップに分割され、それらは中間結果を絶えず交換する必要があります。高帯域幅メモリとインターコネクトファブリックは、総消費量のかなりの部分を占めており、コンピューティングとは異なり、世代が進むにつれてその割合はそれほど速く低下しません。

冷却。 入力されたワットはすべて熱として放出されます。ラックあたり30〜40kWを超えると、空冷は実用的でなくなり、そのため新しいAIホールでは液冷が珍しいものから標準的なものへと移行しています。効率はPUE(電力使用効率)で追跡されます。施設全体の電力 ÷ IT機器の電力。適切に管理された最新の施設は1.1〜1.2付近ですが、古い空冷サイトはかなり悪いです。

その他すべて。 電力変換損失、無停電電源装置、ネットワーク、ストレージ。

トレーニングはスパイク、推論は負荷

最先端のモデルをトレーニングするには、数週間にわたって数千ものアクセラレータをフル稼働させます。これは高価で、目立ち、そして有限です。

そのモデルを提供するということは、種類が異なります。すべてのリクエストは計算を実行し、人気の製品は毎日、何百万ものリクエストを何年にもわたって処理します。リクエストあたりのエネルギーは小さいですが、その掛け合わせはそうではありません。実際に運用されているモデルでは、累積推論エネルギーは、そのサービス期間中にトレーニングエネルギーをはるかに上回ります。そしてトレーニングとは異なり、負荷は決して終わりません。

推論エネルギーをさらに押し上げる2つの要因があります。

  • 長い出力。 生成はシーケンシャルであり、各トークンはモデルを完全に通過する必要があります。回答する前に長い内部チェーンを生成する推論スタイルのモデルは、リクエストあたりの作業量が比例して多くなります。
  • エージェント。 1つのユーザー指示が、数十回のモデル呼び出しとツール呼び出しになる可能性があります。データセンターの観点からは、これは1回ではなく数十回の要求です。

そして、それを大きく押し下げる1つの要因があります。それはモデルの選択です。エネルギーは計算量に比例するため、大きなモデルではなく小さなモデルでタスクを提供することは、わずかな節約ではありません。ルーティング(まず安価なモデルを使用し、必要に応じてのみエスカレートする)は、ほとんどのチームが持つ最も効果的な単一のレバーです。

制約がチップからグリッドへ移動した

しばらくの間、ボトルネックはアクセラレータの供給でした。ますます、それは電力の相互接続になっています。新しい大きな負荷を伝送ネットワークに接続するためのキュー、および変圧器と開閉装置のリードタイムです。いくつかの主要市場では、これらのキューは数年単位で測定されています。

これは業界を注目に値する方法で再形成しています。

  • 立地は電力に従う。 運用者は、ユーザーの近くではなく、発電とグリッド容量が存在する場所に建設します。トレーニングには許容できますが、レイテンシに敏感な提供にはより困難です。
  • 長期的な発電契約。 原子力および地熱発電事業者との複数年の電力購入契約は、持続可能性の発表ではなく、標準的なインフラニュースになりました。
  • オンサイト発電とストレージ。 相互接続キューを完全に回避するための、メーターの後ろの発電。
  • 地方政治。 電力料金の上昇と水の使用は、大規模な施設が提案されている場所ではどこでも、現在進行中の地方自治体の問題となっています。

効率は改善している — そして消費は依然として増加している

両方の声明は真実であり、その緊張関係は多くの報道を混乱させています。

ハードウェア、量子化、バッチ処理、キャッシング、トークンごとにモデルの一部のみをアクティブ化するスパースアーキテクチャ、および日常業務を処理する蒸留された小さなモデルの改善により、トークンあたりのエネルギーは急激に低下しました。これらはわずかな利益ではなく、大きなものです。

しかし、使用量が効率よりも速く増加したため、総消費量は増加しました。これは標準的なリバウンドパターンです。ある単位のものが安くなると、より多くが使用されます。効率は必要ですが、十分ではありません。

実際に測定すべきこと

サービスを運用しており、見出しではなく、防御可能な数値が必要な場合:

  • 施設PUE、運用者から。
  • 実行する場所と時間のグリッドの炭素強度。同じワークロードでも、地域間や1日の時間帯によって数倍異なる場合があります。
  • エネルギー単位あたりの提供トークン、経時的に追跡。これは、あなたが制御できるモデルとルーティングの選択を捉えます。
  • 水使用効率、水ストレス地域で運用している場合。

不快な要約:AIのエネルギー使用量を削減するレバーのほとんどは、AIのコストを削減するレバーと同じです — 十分な場合はより小さなモデル、キャッシング、バッチ処理、短い出力。その整合性は、リクエストあたりの傾向について適度に楽観的である理由であり、また総需要が上昇し続ける理由でもあります。

よくある質問

単一のAIクエリはどの程度の電力を消費しますか?
モデルのサイズ、出力長、ハードウェアによって大きく異なります。そして、ほとんどの公開された単一クエリの数値は推定値であり、実際の測定値ではありません。比較する際に有用なのは、1クエリあたりではなく、デプロイメントあたりです。1日数百万件のリクエストを処理するサービスは、常に数メガワット規模の負荷を抱えています。
学習と推論、どちらがより多くのエネルギーを消費するのか?
学習は大きな一回限りのコストで、推論は小さなコストを無限に繰り返すものです。広く使われるモデルでは、累積した推論エネルギーがサービスライフの初期段階で学習エネルギーを上回ります。
小さなモデルを使うことは実際に役立つのか?
概ね、トークンあたりのエネルギーは実行される計算量に比例します。そのため、簡単なリクエストを小さなモデルにルーティングし、難しいリクエストは大規模なモデルに残すことで、同じ作業量でもコストと電力の両方を削減できます。
データセンターはなぜ大量の水を必要とするのか?
エバポラティブ冷却は安価で効率的ですが、水を消費します。クローズドループや液体冷却方式は水の使用量を大幅に削減しますが、電力消費量を増やす――この2つの資源は相互に取引関係にあります。

出典

  1. Electricity 2024 — analysis and forecast to 2026 — International Energy Agency
  2. Data centre energy use — research programme — Lawrence Berkeley National Laboratory
  3. Power usage effectiveness (PUE) — The Green Grid
タグdata centresenergyGPUsinferencesustainability

あわせて読みたい

AWSがSageMaker HyperPodに「モデルキャッシング」機能を追加、推論のコールドスタートを短縮

AWS launched model caching for Amazon SageMaker Inference on HyperPod. The feature pre-loads model weights and container images onto cluster nodes so pods can read from local NVMe storage at about 7 GB/s instead of downloading over the network, letting pods typically start serving traffic in seconds rather than tens of minutes, AWS says.

約3分

分析:オープンウェイトモデルのセルフホスティング——導入を左右する採算計算と、誰も予算に織り込まないコスト

高水準かつ安定した稼働率を確保できる場合に限られる。セルフホスティングでは、トークン単位の変動費が時間単位の固定費に変わるため、アクセラレーターを高稼働させられれば有利だが、遊休時間が生じると大幅に不利になる。正確に比較するには、アクセラレーターの稼働時間、冗長化、エンジニアリング工数に加え、小規模モデルで十分な品質を確保できるかを検証する評価作業まで含めたシステム全体の費用を、同一トラフィックに対するAPI料金と比べる必要がある。主権、データレジデンシー、最低遅延の保証は、採算計算とは別にセルフホスティングを正当化し得る理由となる。

約9分

d-Matrix、NVLink FusionでRaptor XPUをNVIDIAプラットフォームに接続へ

d-Matrixは、次世代XPU「Raptor」をNVIDIAのAIインフラプラットフォームに接続するためNVIDIAのNVLink Fusionを採用すると発表した。これにはNVLinkによるスケールアップネットワークやSpectrum-Xネットワーク、MGXラックアーキテクチャとの接続も含まれる。同社は、これによりNVIDIAシステムと並んでRaptorを大規模展開する道が開けるとしている。

約2分