AIモデルの価格が実際にどのように機能するか:トークン、キャッシュ、バッチング
AI APIはトークン数に応じて課金され、入出力で料金が異なります。請求額を80%削減できる手段は、チームが最初に手に取るものとは限りません。コストモデルの実践的なガイドです。
ひとことで言うと
AI APIの料金はどのように計算されますか?
ほぼすべてのAI APIは、入出力それぞれに対してトークン単位で課金されます。出力は通常、入力の数倍の料金がかかります。キャッシュされた入力、バッチ処理、より小さなモデルを使用すれば、料金を大幅に削減できますが、会話の履歴が増えるにつれて総額は増加します。なぜなら、ほとんどのAPIは毎ターン全体のスレッドを再送するからです。
要点
- 入力と出力は別々に課金され、出力の方が高価で、通常は入力の3〜5倍になることが多いです。
- チャットのコストは会話の長さに比例して二次的に増加します。これは各ターンで全体の履歴が再送されるためです。
- プロンプトキャッシュとバッチエンドポイントは、モデルを変更せずに利用できる最大の割引の2つです。
- モデルルーティングは、まず小さなモデルを使い、難易度に応じてエスカレートさせる手法で、通常はすべてのプロンプトレベルの最適化を上回ります。
AIの価格設定は、100万トークンあたりの単価というシンプルなものに見えますが、最初の請求書が届くと誰も説明できません。価格設定モデルは複雑ではありませんが、物事を構築する際の明白な方法を罰するような形状をしています。
基本単位
主要なプロバイダーはすべて、100万トークンあたりで課金し、2つの別々の料金があります。
- 入力トークン — システムプロンプト、ツール定義、会話履歴、添付ドキュメントなど、送信するすべて。
- 出力トークン — モデルが生成するすべて。
出力は高価な側であり、通常は入力レートの3〜5倍です。その理由は機械的なものです。入力はシーケンス全体で並列処理できますが、出力は一度に1トークンずつ生成する必要があり、それぞれがモデルを完全に通過する必要があります。
最初の実際的な結果:冗長な回答は、長い質問よりもコストがかかります。「3つの箇条書きで要約してください」は、単なるスタイルの好みではなく、コスト管理です。
実際のお金の流れ
会話履歴。これはチームを驚かせるものです。ほとんどのチャットAPIはステートレスです。会話を続けるには、再送信する必要があります。ターン1は500トークンを送信します。ターン10は、ターン1〜9のすべてと新しいメッセージを送信します。長いスレッド全体で、累積入力はターン数の二乗にほぼ比例して増加します。
リクエストごとの固定オーバーヘッド。 2,000トークンのシステムプロンプトと3,000トークンのツールスキーマは、ユーザーが「ありがとう」と入力した呼び出しを含め、すべての単一の呼び出しで5,000入力トークンをコストします。
推論トークン。回答する前に思考するモデルは、出力として課金される内部トークンを生成します。3行の回答を返すリクエストは、3行以上のトークンを生成した可能性があります。
リトライとエージェントループ。15ステップかかるエージェントは、15回の課金対象リクエストであり、それぞれが完全なコンテキストを運びます。リトライロジックはこれを静かに倍増させます。
効果の順序での4つのレバー
1. より小さなモデルにルーティングする。最先端モデルと小型モデルの価格差は通常10〜30倍です。ほとんどの本番ワークロードには、分類、抽出、フォーマットなど、小型モデルが完全な品質で処理できる簡単なリクエストの大部分が含まれています。それらを小型モデルに送信し、難易度または信頼性が低い場合にのみエスカレートしてください。このリストの他のものは、同じ節約には及びません。
2. 安定したプレフィックスをキャッシュする。プロンプトキャッシュは、プロバイダーが既に見たプレフィックスに対して、入力レートのわずかな割合を請求します。バイト単位で同一のプレフィックスが必要であり、これは規律を課します。
[システムプロンプト] ← 安定しており、キャッシュします
[ツール定義] ← 安定しています
[参照ドキュメント] ← セッションごとに安定しています
[会話履歴] ← 変更されます
[現在のメッセージ] ← 変更されますプロンプトの先頭にタイムスタンプやユーザー名を入れると、キャッシュが完全に無効になります。これは一般的で高価な間違いです。
3. インタラクティブでないものをバッチ処理する。バッチエンドポイントは、レイテンシを約半額で取引します。夜間の分類、埋め込みのバックフィル、評価スイート、バルク翻訳 — これらは同期応答を必要としません。
4. ループを短縮する。会話履歴をN回の最近のターンと要約に制限します。このタスクに必要なものだけにツール定義をトリミングします。明示的な出力長制限を設定します。個々には小さいですが、全体で請求額の3分の1になることがよくあります。
トークンではないコスト
- 埋め込みは呼び出しごとに安価で、再インデックス中に簡単に増加します。チャンク変更後のコーパス全体の再埋め込みは、実際の項目です。
- ファインチューニングにはトレーニングコストがあり、場合によっては、推論レートが高くなるか、カスタムモデルのホスティング料金がかかります。
- 画像と音声の入力は、プロバイダーと解像度によって異なるレートでトークン相当に変換されます — 仮定するのではなく、特定の式を確認してください。
- レート制限ティア。スループットが高い場合、コミットされた支出が必要になることがあります。これはエンジニアリングの問題ではなく、調達の問題であり、早期に質問する価値があります。
説明可能な予測の構築
まず計測します。リクエストごとに、モデル、入力トークン、出力トークン、キャッシュされたトークン、機能、ユーザーをログに記録します。この内訳なしでは、コスト最適化は推測です。
その後、計算は簡単です。
月額コスト ≈ リクエスト数/月
× (入力トークン × 入力レート
+ キャッシュトークン × キャッシュレート
+ 出力トークン × 出力レート)3つのシナリオ(予想、2倍、10倍)をモデル化し、どれがユニットエコノミクスを破るかを確認します。無制限のチャット機能を備えたシートごとの製品は、独自の利益率を逆転させる可能性があり、それを発見する時間は発売前です。
ほとんどのレビューで不快な真実は、最大の節約は巧妙なプロンプトではないということです。それは、トラフィックの70%が高価なモデルを必要としなかったことに気づくことです。
よくある質問
- 私の請求書が使用量よりも早く増えていくのはなぜですか?
- おそらく会話の長さ。各ターンで全履歴を再送すると、20ターンの会話は20個の単独の質問よりもはるかにコストが高くなる。過去のターンを要約または切り捨てると、これを解決できる。
- プロンプトキャッシュとは何か、そしてどれだけの節約ができるのか?
- プロバイダーは、変更のないリクエストのプレフィックス(システムプロンプトやツール定義、長い文書など)をキャッシュし、以降のリクエストでは通常の入力料金の一部で済むようにする。ただし、プレフィックスがバイト単位で同一である必要があるため、安定したコンテンツは最初に来る必要がある。
- バッチAPIは遅延に見合う価値があるか?
- 対話型でないもの — 分類、エンリッチメント、評価実行、翻訳バックログ — はい。バッチエンドポイントは通常、数時間で結果が得られる代わりに、同期型の約半額のコストで提供されます。
- 推論モデルは、価格表以上に高価ですか?
- 多くはそうですね。見える回答の前に内部の推論トークンを生成し、そのトークンは出力として課金されます。表示されている料金はトークン単位で、リクエストごとのトークン数が変動するためです。
出典
- API pricing — Anthropic
- API pricing — OpenAI
- Gemini API pricing — Google