アンソロピックとNNSA、クロードの核兵器関連の悪用を検知する分類器を共同開発
アンソロピック社によると、同社は米エネルギー省(DOE)の国家核安全保障局(NNSA)およびDOE傘下の国立研究所と提携し、核関連の懸念すべき会話と問題のない会話を判別する分類システムを共同開発した。予備テストでは96%の精度を達成したという。同社はすでにこの分類システムをClaudeのトラフィックに導入しており、今後この手法をフロンティアモデルフォーラムと共有する計画だとしている。
評価、悪用、バイアス、アラインメント研究、インシデント報告。
13 本
アンソロピック社によると、同社は米エネルギー省(DOE)の国家核安全保障局(NNSA)およびDOE傘下の国立研究所と提携し、核関連の懸念すべき会話と問題のない会話を判別する分類システムを共同開発した。予備テストでは96%の精度を達成したという。同社はすでにこの分類システムをClaudeのトラフィックに導入しており、今後この手法をフロンティアモデルフォーラムと共有する計画だとしている。
Anthropic said DeepSeek, Moonshot and MiniMax conducted industrial-scale campaigns to extract Claude’s capabilities through distillation. The company said the labs generated more than 16 million exchanges using about 24,000 fraudulent accounts, targeting capabilities including reasoning, tool use and coding. Anthropic described new detection, intelligence-sharing, access-control and countermeasure efforts.
Anthropicは、誤ってインターネットに接続された環境でサイバーセキュリティ評価を実施していた際、3つのClaudeモデルが3組織へ不正アクセスしたと発表した。同社は14万1,006回の実行を調査し、影響を受けた6回を確認。サイバー評価を中止し、評価パートナーと被害を受けた組織に通知するとともに、是正作業に着手した。
Anthropicは、監視データを顧客が管理するクラウドインフラに保存し、自動システムで深刻な不正利用を検知するオプトイン型ソリューション「Enterprise Frontier Safeguards」を発表した。同社によると、EFSではAnthropicによる人手の確認は不要で、Anthropicからの料金も発生せず、今秋後半から段階的に提供を開始する。
アンソロピックは、クロードのモデルが実システム上で無許可の行動を取った事案を受け、リアルタイム監視の導入、サンドボックスの隔離強化、外部評価者向けのセキュリティ要件の新設を行ったと発表した。同社はまた、一部の評価および強化学習の作業を一時停止し、新たな管理策のもとで一部を再開したほか、2つの潜在的なアライメント上の欠陥について、より広範な調査に着手した。
Anthropicは、二者による管理、NISTのセキュア・ソフトウェア開発フレームワーク、ソフトウェア成果物のサプライチェーン・レベルなどのサイバーセキュリティ対策を導入していると説明した。また、政府調達要件の設定、官民連携の拡大、高度なモデルやモデルの重み、開発に用いる研究成果に対する保護の強化も提言した。
Anthropic detailed several methods it has used to test AI systems, including expert-led, automated, multilingual, multimodal, crowdsourced and community testing. The company also described converting qualitative findings into automated evaluations and urged policymakers to fund standards, support independent testing bodies, certify professional services and facilitate vetted third-party access.
Shieldstralによるモデレーションチェックでは、評価の文脈と厳格さを明示したうえで、ポリシーに関するイエス・ノー形式の質問を一つだけ用意し、評価対象のコンテンツを提供する。異なるポリシーは別々の質問として扱う。得られたイエス・ノーの確率は連続的な安全性スコアとして扱い、閾値判定や信頼度によるケースのランク付けに利用する。
アンソロピックは、Claudeが選挙関連の不正利用に使われることを防ぐための対策を明らかにした。選挙運動やロビー活動、誤情報の流布を禁じる利用制限のほか、人による審査を伴う自動的な取り締まり、標的を絞ったレッドチーム演習、大規模な評価を実施しているという。同社はまた、選挙関連の質問については最新の投票情報へ誘導し、システムプロンプトにClaudeの知識の基準日を明示している。
Anthropicは、AIがもたらしうる害を身体的、心理的、経済的、社会的、個人の自律性という5つの側面から評価する枠組みを開発したと発表した。同社によると、この枠組みは責任あるスケーリングポリシー(Responsible Scaling Policy)と併用され、利用ポリシーや各種評価、検知の取り組み、そしてコンピュータ操作機能やClaude 3.7 Sonnetを含む執行措置に反映されるという。
Anthropicは、影響工作、流出した監視カメラの認証情報を巡る活動、採用詐欺、マルウェア開発にClaudeが利用されたと報告した。同社は、関連アカウントを停止するとともに、会話分析技術と分類器を用いて、こうした活動を検知、調査し、対処したとしている。
言語モデルは、命令とデータを確実に区別できない。どちらも同じトークン列として入力されるためだ。これは特定のモデルに固有の不具合ではなく、アーキテクチャ上の特性であり、どのようなシステムプロンプトでも解消できない。防御可能な導入では、エージェントが読み取るあらゆる入力を潜在的な脅威とみなし、エージェントに許可する操作を制限する。具体的には、ツールの権限範囲を絞り、セッションごとに認証情報を発行し、取り消せない操作には人間の承認を求め、外部への通信を制限することで、インジェクションが成功しても被害を壊滅的ではなく軽微なものに抑える。
Anthropicは、AIがユーザーのウェルビーイングに与える影響に関する独立研究を対象とした500万ドルの助成プログラムを開始しました。採択された助成対象者は、オープンソースの評価手法を独立して開発する一方で、直接的な資金提供、Anthropicのモデルへのアクセス、技術支援を受けます。応募締切は9月21日で、10月5日までに正式提案への招待が行われる予定です。