分析:AIの価格は下がり続けているのに、なぜ請求書は上がっているのか?
トークンあたりのコストは急落し、AI全体の支出は増加している。両者が同時に成立しており、その間のギャップがAI製品の経済性に起きている大部分を説明している。
ひとことで言うと
なぜ、1トーカンあたりの価格が下がっているのに、AIのコストは上昇しているのか?
価格は、ハードウェアの向上、蒸留モデルの小型化、サービング最適化により急激に下がっています。需要は、より長いコンテキスト、回答ごとに大量のトークンを生成する推論モデル、ユーザーの1アクションを多数のモデル呼び出しに変換するエージェントといった要因で、さらに速く増加しています。単価の低下と単位の増加が相まって、請求額は大きくなっています。
要点
- 単価は下がり、総支出は上がる――タスクごとのトークン数は価格の下落よりも速く増加している。
- 推論モデルとエージェントループは、ユーザーの行動あたりのトークン数を増幅する最大の要因です。
- 無制限のAI機能に対する席単価は、重いユーザーのマージンを逆転させる;その理由から、使用量に基づく課金が広がっている。
- ほとんどの製品で最大の節約は、簡単なリクエストを小さなモデルにルーティングすることです。
AIコンピューティングの単価は劇的に下落したにもかかわらず、企業はAIへの支出を過去最高に増やしている。この二つの事実は同時に真実であり、しばしば矛盾として混同されている。その間のギャップこそが、興味深い経済学が存在する場所である。
何が実際に安くなったか
いくつかの要因が、トークンあたりの価格を同時に押し下げた。
- ハードウェア世代。 各アクセラレータ世代は、ワットあたり、ドルあたりのスループットを向上させる。
- サービング最適化。 コンティニュアスバッチング、キー・バリューキャッシュのためのページングアテンション、スペキュラティブデコーディング、量子化。これらはモデルの変更ではなく、エンジニアリングの勝利であり、積み重なる。
- スパースアーキテクチャ。 Mixture-of-Experts設計は、トークンあたりパラメータの一部しかアクティブにしないため、非常に大きなモデルでも、はるかに小さなモデルと同じようなコストでサービングできる。
- 蒸留。 大規模モデルの出力でトレーニングされた小規模モデルが、現在、幅広い定型業務を低価格で処理している。
- 競争。 各能力階層に複数の信頼できるプロバイダーが存在し、切り替えコストは十分に低く、現実的である。
その結果、数年間にわたり、特定の能力レベルに対する価格が文字通り桁違いに低下した。これは誰もが認める事実である。
タスクあたりのコストが増加したもの
一方、単一のユーザーアクションが消費するトークン数は、4つの理由で増加した。
長いコンテキスト。 かつて500トークンのプロンプトを送信していた製品が、現在ではドキュメント、会話履歴、取得した抜粋、ツール定義を添付している。1回の呼び出しで1万トークンというのは珍しくない。
推論モデル。 回答前に内部的な検討を行うモデルは、直接回答モデルよりも1回の要求で何倍もの出力トークンを生成できる。料金表は変わらず、トークン数が増加した。
エージェント。 これが最大の乗数である。「これらのアカウントを照合する」という1つの指示が、15回のモデル呼び出しになり、それぞれが累積されたコンテキストを運ぶ。請求の観点からは、これは1回の要求ではない。15回であり、それぞれが前回よりも長くなる。
リトライと評価。 本番システムは、失敗時にリトライし、継続的に評価スイートを実行する。これらはどちらもユーザーには見えず、請求書には表示される。
10倍の価格低下に、タスクあたりのトークン数の30倍の増加を掛けると、請求額は3倍になるが、各ユニットは安くなった。これがパズルの全容である。
製品マージンへの影響
このパターンは、シートあたりのソフトウェアで最も顕著に現れる。シートは月額固定料金である。そのシートに付随するAI機能は、ユーザーが消費したものに応じて課金される。利用状況の分布は正規分布ではない。少数のユーザーがトークンの大部分を生成し、彼らは通常、最もエンゲージメントが高く、解約しにくいユーザーである。
3つの対応策が一般的になっている。
- 利用量連動型価格設定。 クレジット、または明確な制限付きのティア。フラットな価格設定よりも洗練されていないが、ヘビーユーザーとの接触にも耐える。
- ルーティング。 小規模モデルが大部分のリクエストを処理し、高価なモデルは困難なものに予約される。ほとんどのワークロードにおいて、これはプロンプトレベルの最適化よりも、利用可能な最大の節約策である。
- キャッシュとバッチ処理。 キャッシュされたプレフィックスは、繰り返し使用されるシステムプロンプトやドキュメントのコストを削減する。バッチエンドポイントは、即時応答を必要としないものの価格をほぼ半減させる。
インフラストラクチャの底値
これ以上下落しない限界があり、それは物理的なものである。モデルをサービングするには、アクセラレータ、メモリ帯域幅、建物、冷却、グリッド接続が必要である。そして、いくつかの主要市場では、グリッド接続が現在の制約となっている。相互接続キューは数年単位で測定される。
資本コストは、それを正当化するために成長し続けなければならないボリュームで償却されている。これは需要が成長している間はうまくいく。また、容量のアナウンスが、製品ニュースというよりはユーティリティ計画文書のように読まれる理由でもある。
注目すべき点
AI製品を運営する人にとって、ヘッドラインの100万トークンあたりの価格よりも重要な3つの数字がある。
- 完了したタスクあたりのトークン数。 時間の経過とともに追跡する。これは実際に増加しているものを捉える。
- 最も安価で十分なモデルで処理されたトラフィックの割合。 それが半分未満であれば、テーブルの上に金がある。
- 安定したプレフィックスのキャッシュヒット率。 プロンプトの先頭のバイトレベルの変更は、キャッシュを静かに無効にし、一晩でコストを増加させる可能性がある。
単価は下がり続けるだろう。あなたの請求額がそれに続くかどうかは、ほぼ完全に、タスクあたりのトークン数が横ばいで推移するかどうかにかかっている。そして、エージェントや長いコンテキストで満載の製品ロードマップでは、それは偶然にはそうならないだろう。
よくある質問
- AIはどんどん安くなっているのか、それとも高くなっているのか?
- 計算単位あたりのコストは安くなる一方、タスクが完了するごとのコストは多くの製品で高くなる傾向があります。これはタスクが以前よりもはるかに多くの計算資源を消費するようになったためです。どちらの傾向が当てはまるかは、タスクあたりのトークン使用量が安定しているかどうかに依ります。
- なぜ推論モデルは掲載されている料金以上に高くなるのか?
- 彼らは、見える回答の前に内部的な推論トークンを生成し、それが出力として課金されます。レートは変わらず、リクエストあたりのトークン数は大幅に増えています。
- AI製品はどのようにして利益率を守っているのか?
- モデルルーティング、プロンプトキャッシュ、非対話作業用のバッチ処理、上限付きコンテキスト長、および使用量に応じて価格が変動する価格設定
- オープンソースのモデルを自前でホスティングすると、コストが削減されますか?
- 高い、安定した負荷がかかるときは、ハードウェアを常に忙しく保つことができます。一方、低負荷や突発的な負荷では、アイドル状態のアクセラレータは、APIコールを使用するよりもコストが高くなることが多いです。
出典
- API pricing — OpenAI
- API pricing — Anthropic
- Electricity 2024 — analysis and forecast to 2026 — International Energy Agency