Skip to content
モデル・研究

大規模言語モデル (LLM)

LLM · foundation model

ひとことで

大規模言語モデルは、数十億のパラメータを持つニューラルネットワークで、大規模なテキストコーパスで訓練され、シーケンスの次のトークンを予測することを目的としています。その単一の目的だけで、十分なスケールがあれば、質問への回答、コードの作成、翻訳、要約といった能力が得られます。これらは直接訓練されたものではありません。

大規模言語モデルは一つのタスクで学習します:トークンの列が与えられたら次のトークンを予測するだけです。膨大なコーパス全体でそのプロセスを繰り返すと、モデルのパラメータは文法、事実はもちろん、推論パターンやコードの規則、そして膨大な人間の書き込みスタイルまでを内包するようになります。 現代のほとんどのLLMは、入力の各位置が他のすべての位置に影響を与える注意メカニズムを持つ transformer アーキテクチャを採用しています。これが長距離の整合性を実現し、シーケンス長に応じた計算量の増大を招きます。 学習は段階的に行われます。 事前学習 で広範なテキストを使うと、素地の能力が得られます。 後学習 — デモンストレーションに対する監督微調整、そして人間やAIからのフィードバックを用いた強化学習 — によって、テキスト予測器が指示に従い有害な要求を拒否するような振る舞いへと変わります。 実務上重要な二つの特性があります。モデルは ステートレス です:要求の間に覚えておくのは、コンテキストウィンドウに入れたもの以外は何もありません。また、モデルは 確率的 です:同じプロンプトでも出力は異なる可能性があり、トーンに対する自信は正確性に関する情報を示すものではありません。

よくある質問

LLMは自分が書くものを理解しているのか?
それは人間の意味での信念や意図を持っていません。言語の統計的構造を十分にモデル化しているため、出力はしばしば正しく有用ですが、構造が間違った方向を指すと、自信に満ちた誤答をします。
言語モデルが「大規模」であるとは何か?
パラメータ数、学習データ量、学習計算量はすべて、以前のモデルをはるかに上回っています。正式な閾値は存在せず、この用語は比較的なものであり、基準は常に変わり続けています。

関連語

2026年8月22日 最終更新