Skip to content

AI 用語集

ニュース・契約書・製品ドキュメントに登場する AI 用語を正確に定義します。

#

エキスパートの混合
Mixture of expertsはネットワークの一部を多くの並列サブネットワークに分割し、ルータが各トークンを数少ないサブネットワークの一つだけを通すようにします。全体のパラメータ数は大きいまま、トークンごとの計算量は小さく保たれるため、非常に大きなモデルでもそのサイズに見合うほどサービングが安くなるのです。
オープンな重み
オープン重みとは、学習済みパラメータファイルが公開され、ダウンロードして自分のハードウェアで実行、検証、ファインチューニングできることを意味します。付随するライセンスが、法的に何ができるかを決め、多くのオープン重みモデルはオープンソースの定義に合致しないカスタムライセンスで配布されています。
コンテキストウィンドウ
コンテキストウィンドウは、モデルが一度のリクエストで処理できるトークン数の上限です。システムプロンプト、ツール定義、会話履歴、添付文書、生成された出力などが含まれます。ウィンドウ外の内容はモデルには見えません。
トークン
トークンは、言語モデルが処理する最小のテキスト単位です。トークナイザーが生成する一般的な単語の一部です。英語では、1トークンは平均して約4文字、または約0.75語に相当します。コンテキストの上限やAPI料金は、単語ではなくトークン単位で計算されます。
プロンプトインジェクション
プロンプトインジェクションは、モデルが処理するコンテンツ(ウェブページ、メール、文書、コードコメントなど)に指示を埋め込む攻撃です。モデルはそれらの指示をオペレーターからのものとして扱い、従います。モデルが信頼できる指示と読むべきテキストを区別する信頼性の高い方法はありません。
ベンチマーク
ベンチマークは、既知の答えを持つ固定されたタスクの集合で、モデルのスコア付けや比較に使用されます。公開されたベンチマークは大まかな能力ランキングを示しますが、トレーニングデータの漏洩に脆弱で、短く明確に定義された問題に設計されているため、実際の本番環境での作業とは異なります。
マルチモーダルモデル
マルチモーダルモデルは、同じリクエスト内で複数種類の入力を処理できます。一般的にはテキストと画像の組み合わせですが、徐々に音声や動画も含まれるようになっています。非テキスト入力は、トークンと同じ内部表現に変換されるため、単一の画像がコンテキストウィンドウの大きな割合を占めることがあります。
モデルコンテキストプロトコル (MCP)
Model Context Protocolは、AIアプリケーションが外部ツール、リソース、プロンプトを発見して呼び出す方法を定義するオープンスタンダードです。サーバーは一度実装すれば、互換性のあるクライアントはそれを利用でき、個別製品ごとのカスタム接続を置き換えます。
検索拡張生成 (RAG)
リトリーバー拡張生成は、質問に関連する文書集合から関連箇所を検索し、それをモデルのプロンプトに挿入して、モデルにそれらを使用して回答させます。モデルの重みは変更されず、知識は要求時にコンテキストとして提供されるため、文書を更新すれば即座に回答が変わります。
幻覚
ハルシネーションとは、流暢で自信に満ちたが、事実上誤っているか根拠がない出力のことです。作り出した引用、存在しない関数、根拠のない数値などが該当します。これはモデルが統計的にlikelyな続きを生成するため起こりますが、likelyに聞こえる主張が必ずしも真実とは限らないからです。
蒸留
蒸留は、より大きな教師モデルの出力を使って小さな学生モデルを学習させる手法です。これにより、学生モデルははるかに低コストで教師モデルの挙動の多くを再現できます。これが小さなモデルが急速に性能を向上させた主な理由であり、商用 API の利用規約では制限や禁止が課されていることが多いです。
推論
推論とは、訓練済みのモデルに新しい入力を与えて出力を得る行為であり、モデル自体を作成する訓練とは対照的です。訓練は一度だけかかるコストですが、推論は毎回のリクエストで繰り返され、広く使用されるモデルのライフサイクルを通じて、支出とエネルギー消費の大部分を占めます。
整列
アライメントは、訓練済みモデルの振る舞いを調整し、指示に従い、できるだけ真実を告げ、有害な要求には応じないようにする過程です。これは事前学習後に行われ、主にデモンストレーションに対する監督付き微調整と、人間やAIからのフィードバックを用いた強化学習を通じて実施されます。
大規模言語モデル (LLM)
大規模言語モデルは、数十億のパラメータを持つニューラルネットワークで、大規模なテキストコーパスで訓練され、シーケンスの次のトークンを予測することを目的としています。その単一の目的だけで、十分なスケールがあれば、質問への回答、コードの作成、翻訳、要約といった能力が得られます。これらは直接訓練されたものではありません。
微調整
ファインチューニングは、事前に学習したモデルを小さなタスク固有データセットでさらに学習し、重みを調整して特定の形式やトーン、限定的なスキルを安定して出力できるようにします。しかし、事実を教える手段としては不向きで、変化する情報は要求時に取得すべきです。
埋め込み
埋め込み(エンベディング)は、モデルによって生成される固定長の数値ベクトルで、テキスト、画像、音声の一部を表します。意味が似ているアイテムは、このベクトル空間内で近い位置に配置され、これが意味的検索、クラスタリング、推薦に役立っています。
量子化
量子化はモデルの重みの数値精度を下げるもので、例えば16ビット浮動小数点を8ビットや4ビット整数に変換します。これによってモデルはメモリを少なくて済み、処理が速くなります。8ビットでは品質の低下はほとんどなく、4ビットでは目立つものの、しばしば許容できるレベルです。

A

AIエージェント
AIエージェントは、単なる質問に答えるだけでなく、目標が与えられたときに使用できるツールを呼び出し、結果を読み取り、次のステップを決定し、目標が達成されるか、または上限に達するまで繰り返すことができる言語モデルです。このループがチャットボットとの違いです。