Skip to content
安全・倫理

整列

RLHF · post-training · safety tuning

ひとことで

アライメントは、訓練済みモデルの振る舞いを調整し、指示に従い、できるだけ真実を告げ、有害な要求には応じないようにする過程です。これは事前学習後に行われ、主にデモンストレーションに対する監督付き微調整と、人間やAIからのフィードバックを用いた強化学習を通じて実施されます。

事前学習だけで作られたモデルはテキストを予測するだけだ。指示に従わず、真実よりも妥当性を好まず、拒否すべきものを認識しない。そしてアライメントは、それをアシスタントに変えるものである。標準的なパイプラインは二つの段階からなる。教師あり微調整は、良い応答の厳選された例で学習する。好みの最適化(RLHF、または報酬モデルを別に用意せずに行うDPOなど)は、人間が高く評価した応答を好むようにモデルを学習させる。憲法的アプローチは、多くの人間のラベリングを代わりに、書かれた原則のセットを使用する:モデルは自分自身の出力を述べられたルールに照らして批判・修正し、スケールした好みデータを生成する。注意すべき二つの限界がある。アライメントは行動的であり、認識的ではない — — それはモデルに役立つように振る舞わせ、適切に拒否させるが、主張が真実かどうかを判断するメカニズムを与えるわけではない。そのため、幻覚は依然として残る。また、これは争点である:誰の価値観を尊重し、どのような拒否を設け、モデルが役立たなくなるまでどれだけの慎重さが必要かは、技術的な答えがない問いだ。研究プログラムは製品の振る

よくある質問

RLHFとは何ですか?
人間のフィードバックによる強化学習:人間は代替モデルの応答をランキングし、そのランキングをもとに報酬モデルを訓練し、モデルはそれに最適化される。バリアントでは一部の人間のランキングをAI生成のもので置き換える。
アライメントはモデルの能力を低下させるのか?
それは、端に置くと — — 無害なリクエストに対する過度な慎重さが通常のクレームです。役立つことと慎重さのバランスは、明示的なチューニングのトレードオフであり、偶然ではありません。

関連語

2026年8月22日 最終更新