ベンチマーク
eval · evaluation set · leaderboard
ひとことで
ベンチマークは、既知の答えを持つ固定されたタスクの集合で、モデルのスコア付けや比較に使用されます。公開されたベンチマークは大まかな能力ランキングを示しますが、トレーニングデータの漏洩に脆弱で、短く明確に定義された問題に設計されているため、実際の本番環境での作業とは異なります。
ベンチマークは、モデル比較に共通の指標が必要だから存在します。そして本当に有用です:大まかな順序付けを行い、大きな退化を検知します。
また、ベンチマークは予測可能な方法で失敗します。そのすべては、ある単一の動的要因に起因しています――数値が目標になると、測定基準ではなくなるからです。
- Contamination(汚染) 公開ベンチマークは公開ウェブ上にあり、学習コーパスは公開ウェブからスクレイピングされます。
- Optimisation pressure(最適化圧力) ベンダーは、評価対象のベンチマークに合わせてチューニングします。これは合理的であり、未検証の能力に対してスコアを膨らませます。
- Task shape(タスクの形) 短く、単一ターン、曖昧さがなく、正解が一つだけです。実際の業務ではそのようなケースは少ないです。
- Selective reporting(選択的報告) 発表ごとに、勝ったベンチマークだけが示されます。
- Saturation(飽和) 信頼できるすべてのモデルが90%以上のスコアを取ると、残る差異はノイズになります。
代替案はベンチマークを放棄することではなく、独自のベンチマークを追加することです。数百件の実際のトラフィックリクエストに、ドメイン知識のある人が同意した正解を付け、毎回同じ評価基準でスコアリングします。このセットは、実際に抱えている質問――どのモデルがこのタスクに適しているか――に答え、モデルのアップグレードを生き残る唯一の方法です。
実際にベンチマークを構築するチームは、リーダーボードとの順序が異なることが多く、場合によっては安価なモデルが有利になることがあります。
よくある質問
- なぜベンチマークのリーダーは本番環境で期待外れになることがあるのか?
- ベンチマークは短く、曖昧さがなく、単一ターンのタスクを報酬として与える。一方、本番での作業は長く、曖昧で、マルチターンであり、対抗的である。二つの間の相関は実在するが緩やかである。
- ベンチマークの汚染とは何か?
- モデルの学習データに含まれるベンチマークの質問や答えは、一般にウェブ上で公開されたものです。汚染されたベンチマークは、能力ではなく再現性を測定し、完全に排除できないことがあります。