実運用のプロダクトに合うAIモデルの選び方
ランキングではなく、制約条件から出発する。許容できるレイテンシー、リクエストあたりのコスト上限、必要なコンテキスト量、ツール呼び出しや構造化出力が必要かどうか、そしてデータをどこまで送ってよいか。この5つを書き出せば、候補の大半はふるい落とせる。残った2〜3件を、自社の実際のトラフィックから抽出した50件の実例でテストし、平均ではなくケースごとに比較したうえで、合格ラインを満たす中で最も安いモデルを選ぶ。
繰り返し出てくる AI の疑問に、平易な言葉で答えます。分野の変化に合わせて更新します。
ランキングではなく、制約条件から出発する。許容できるレイテンシー、リクエストあたりのコスト上限、必要なコンテキスト量、ツール呼び出しや構造化出力が必要かどうか、そしてデータをどこまで送ってよいか。この5つを書き出せば、候補の大半はふるい落とせる。残った2〜3件を、自社の実際のトラフィックから抽出した50件の実例でテストし、平均ではなくケースごとに比較したうえで、合格ラインを満たす中で最も安いモデルを選ぶ。
まず失敗の原因を診断する。モデルが何かを知らないのであれば、それは知識の不足であり、検索によって解決できる。モデルは知っているのに、構成や口調、形式が不適切なら、それは振る舞いの問題であり、まずプロンプトで、それでも足りなければファインチューニングで対処する。その両方を試しても専門的な技能を発揮できない場合、残る選択肢がファインチューニングだ。プロンプトは最も安価で元に戻しやすく、事実を扱うなら検索が標準的な選択肢となる。ファインチューニングは3つの中で最も高価で、最も元に戻しにくい。
AIアクセラレータは従来のサーバーに比べてラックあたりの消費電力がはるかに大きく、その電力は常に供給、冷却、支払いが必要です。大規模モデルの学習は一時的なピークですが、数百万のユーザーに提供する際は永続的な負荷となり、導入されたモデルのライフサイクル全体でエネルギー消費を主導するのは推論です。
検索拡張生成とは、質問に関連する箇所を自社の文書から探し出し、それをモデルのプロンプトに入れて、その内容にもとづいて答えさせる方式である。モデルの重みは変わらない。知識はリクエスト時にコンテキストとして届く。
AI エージェントとは、呼び出せるツールと追うべき目標を与えられ、各ステップで人間に尋ねずに複数の手順を進める権限を持った言語モデルである。チャットボットは質問に答えて止まるが、エージェントは目標が達成されたと判断するか、予算を使い切るまで行動し続ける。
オープンな重みとは、学習済みのモデルファイルをダウンロードし、ライセンスに従って自分で実行できるという意味です。オープンソースは、使用・学習・改変・再配布が制限なく行えるというより厳しい法的基準です。多くの広く使われるモデルはオープンな重みですが、オープンソースとは限りません。
ほぼすべてのAI APIは、入出力それぞれに対してトークン単位で課金されます。出力は通常、入力の数倍の料金がかかります。キャッシュされた入力、バッチ処理、より小さなモデルを使用すれば、料金を大幅に削減できますが、会話の履歴が増えるにつれて総額は増加します。なぜなら、ほとんどのAPIは毎ターン全体のスレッドを再送するからです。
コンテキストウィンドウは、モデルが一度のリクエストで考慮できるテキストの最大量(トークン数で測定)です。システム指示、これまでの会話、貼り付けたドキュメント、生成中の回答を含みます。合計が制限を超えると、何かを削除したり要約したりしなければなりません。