Anthropic、AIによる被害を評価する枠組みの詳細を公表
Anthropicは、責任あるスケーリングポリシーを補完するものとして、AIがもたらす害を5つの観点から評価する発展途上のフレームワークを公表したと発表した。
ひとことで言うと
Anthropicは、AIによる被害を評価するためにどのような枠組みを発表しましたか?
Anthropicは、AIがもたらしうる害を身体的、心理的、経済的、社会的、個人の自律性という5つの側面から評価する枠組みを開発したと発表した。同社によると、この枠組みは責任あるスケーリングポリシー(Responsible Scaling Policy)と併用され、利用ポリシーや各種評価、検知の取り組み、そしてコンピュータ操作機能やClaude 3.7 Sonnetを含む執行措置に反映されるという。
要点
- Anthropicは、AIによる害を評価するための枠組みを発表した。身体的影響、心理的影響、経済的影響、社会的影響、そして個人の自律性への影響という5つの側面から検討するものだ。
- 同社によると、この枠組みは、壊滅的なリスクに重点を置く「責任あるスケーリング方針」を補完し、より幅広い潜在的な危害に対処するものだ。
- Anthropicは、コンピュータ操作機能について、金融ソフトウェアやコミュニケーションツールをめぐるリスクを特定したとし、これに対してより厳格な実施基準と階層的な要約技術で対応したと述べた。
- Anthropicは、この枠組みをClaude 3.7 Sonnetに適用した結果、有害なコンテンツに対する安全対策を維持しながら、不要な回答拒否が45%減少したと明らかにした。
- 同社はこの取り組みについて、なお発展途上にあるとした上で、外部の研究者や政策専門家に協力を呼びかけた。
Anthropic、被害評価の枠組みを公表
Anthropicは、生物学的脅威などの破滅的リスクから、子どもの安全、偽情報、詐欺といった懸念まで、自社のAIシステムがもたらし得るさまざまな被害を評価・軽減するため、現在も発展を続けるアプローチを共有すると発表した。
同社によると、この枠組みは破滅的リスクに特化した「責任あるスケーリング方針」を補完し、その他の影響もより幅広く検討するものだ。Anthropicは、このアプローチはなお発展途上にあり、今後も更新される現時点での考え方を公開したとしている。
被害を捉える5つの側面
Anthropicは、潜在的な影響を以下の5つの基本的側面から評価するとしている。
- 身体的影響:身体の健康と福祉への影響
- 心理的影響:精神的健康と認知機能への影響
- 経済的影響:金銭的な結果と財産に関する影響
- 社会的影響:地域社会、制度、社会共通の仕組みへの影響
- 個人の自律性への影響:個人の意思決定と自由への影響
同社は各側面について、発生可能性、規模、影響を受ける人々、持続期間、因果関係、被害に対する技術の寄与度、軽減策の実現可能性などを検討するとしている。
Anthropicは、この枠組みで特定したリスクを、複数の対策を組み合わせて管理している。具体的には、利用規約、公開前後に実施するレッドチーミングや敵対的テストなどの評価、不正利用の特定を目的とする検知技術、プロンプトの修正からアカウントの停止までを含む措置を挙げている。
適用事例
Anthropicは、この枠組みを適用した事例を2つ紹介した。
モデルがコンピューターのインターフェースを操作できる「computer use」機能について、同社は、無許可の自動化が詐欺や不正操作を助長しかねない金融ソフトウェアや銀行プラットフォームに関連するリスクのほか、標的型の影響工作やフィッシングに悪用される可能性がある通信ツールについて検討したとしている。この分析を受け、Anthropicは規制措置を講じる基準をより厳格に設定し、プライバシー基準を維持しながら被害を検知できる手法だとする「階層的要約」を導入した。
同社はまた、明らかに無害な依頼と明らかに有害な依頼の中間に位置する要求をモデルがどう扱うかを対象とした「モデルの応答境界」に関する取り組みも説明した。Anthropicによると、有用性を高めるよう訓練されたモデルは有害な行動に傾くことがある一方、無害性を過度に重視するモデルは、無害な依頼であっても情報提供を拒む場合がある。Claude 3.7 Sonnetでは、この連続的な範囲に沿ってさまざまな種類の依頼を評価し、曖昧なプロンプトの処理方法を変更。拒否するのではなく、安全かつ有用な回答を優先するようにしたという。Anthropicによると、その結果、有害コンテンツに対する強固な安全対策を維持しながら、不必要な拒否を45%削減した。この種の分析は、子ども、社会的に疎外されたコミュニティー、危機的状況にある人々など、リスクが特に高い可能性があると同社が特定した集団について、安全性評価の重点をどこに置くかを決める際にも活用されているという。
今後も進化
Anthropicは、被害を理解し対処するためのこのアプローチは、同社のより広範な安全戦略を構成する要素の一つだと説明した。AIシステムの能力が高まるにつれ、新たな課題が生じると見込んでいる。同社は研究者、政策専門家、業界パートナーに協力を呼びかけ、連絡先としてusersafety@anthropic.comを案内している。
出典:Anthropic「AIによる被害の理解と対処に向けた当社のアプローチ」、2025年4月21日公開。
よくある質問
- Anthropicの危害フレームワークは、どのような側面を対象としているのか?
- Anthropicによると、このフレームワークは身体的、心理的、経済的、社会的、そして個人の自律性への影響という5つの側面をカバーしており、それぞれについて発生の可能性、規模、影響を受ける対象者といった追加要素も考慮されているという。
- How does this framework relate to Anthropic's Responsible Scaling Policy?
- Anthropicによると、この「害悪フレームワーク」は、壊滅的リスクに特化した同社の「責任あるスケーリングポリシー」を補完するものであり、これによって他の種類の影響についてもより広い視野で評価できるようになるという。
- AnthropicはClaude 3.7 Sonnetと回答拒否について何と述べましたか?
- Anthropicによると、このフレームワークをClaude 3.7 Sonnetに適用した結果、曖昧なプロンプトへの対応が改善され、不要な拒否応答が45%減少したという。同社は、有害なコンテンツに対する強力な安全対策は維持されたとしている。
- Anthropicは、有害性を軽減するためのアプローチを徹底するうえで、どのようなツールを使用していますか?
- Anthropicによると、同社は利用ポリシーのほか、レッドチーム演習を含む提供前・提供後の評価、不正利用の検知手法、そしてプロンプトの修正からアカウントの停止に至るまでの対応措置を組み合わせて運用しているという。