Anthropic「自動化された研究者がアラインメントの失敗を確実に緩和できる」Claudeが10種類の失敗(欺瞞・追従・脱獄・プライバシー侵害など)を探索→提案→訓練→評価のループで直し、非公開評価や4.7倍大きいモデルでも有効。欺瞞では人間の最良案より20%良い。Sonnet 5がOpus 4.8初期版を60時間・2,000例で本番並みに整え、本番手順の約1万5千倍効率
Anthropicは2026年8月28日、Claudeに自律的なアラインメント研究をさせた報告を公開した。欺瞞・追従・脱獄・プライバシー侵害など10種類の失敗を一つずつ、文献探索→手法とデータの提案→訓練→評価のループで直す。指標は「安全ギャップを何%埋めたか」で、汎用能力を落とす手法は除外し、自分のアラインメントを直接蒸留することは監視エージェントで禁止。10種類すべてで能力を落とさず改善し、見せていないベンチマークやPetriでも有効、最大4.7倍大きいモデルにも有効だった。最大8時間で手法を考えた人間の安全研究者28人と比べ、欺瞞ではClaudeの最良案が最良の人間案より20%良く、Gemma-2-2Bでは85%を埋めたのに対し6人の経験者は平均20%。Claude Sonnet 5にOpus 4.8初期チェックポイントを直させると、60時間で50超の案を試し本番に近い水準へ。勝った手法は2,000例強で本番手順の約1万5千倍効率。Opus 4.8に約1,600記録を監視させ不正を39件(2.4%)検出。ハーネスを公開。

2026年9月18日・日本時間時点の情報です。 Anthropicの研究記事(8月28日)を読んだ。当サイトは8月のアラインメントブログまとめで周辺を追ったが、この報告は扱っていなかった。OpenAI側の「AIが研究を加速する」話は研究加速の社内報告に。
3行まとめ
- 何をしたか。 「AIがAIを作り始める」中で安全研究の速度を保つため、Claudeにアラインメント研究そのものを自律的にやらせた。欺瞞・追従・脱獄・プライバシー侵害(ConfAIde・PrivaCI-Bench・PrivacyLensで測定)など10種類の失敗を一つずつ、文献探索→手法とデータの提案→訓練→評価のループで直す。指標は「安全ギャップを何%埋めたか」(各失敗につき3〜5本のベンチマークで理論上の満点にどれだけ近づいたか)。汎用能力を落とす手法は除外し、Claudeが自分のアラインメントを対象モデルに直接蒸留することは禁止して、監視エージェントがすべての案を実行前に読む。
- 結果。 10種類すべてで能力を落とさず改善。最良の手法は見せていないベンチマークや、多ターンの敵対シナリオを模すオープンソース道具Petriでも有効で、研究ループで扱ったより最大4.7倍大きいモデルにも有効だった。最大8時間で手法を考えた人間の安全研究者28人との比較では、欺瞞でClaudeの最良案が最良の人間案より20%良く、Gemma-2-2Bの欺瞞では150回超の試行で85%(複数回の平均、単一回は82%)を埋めたのに対し、同じ規則で取り組んだ6人の経験者は平均20%。ただし人間は提出後に反復できなかったので直接比較というより「Claudeが有望案を出し人間が磨く」流れの根拠、と書く。
- 本番モデルへの適用と不正の監視。 将来、弱いClaudeが強い後継を整える場面を想定し、Claude Sonnet 5(Epoch Capabilities IndexでOpus 4.8より弱い)に、本番のアラインメント訓練をほぼ受けていないOpus 4.8の初期チェックポイントを直させた。60時間で50超の案を試し、本番モデルに近い水準に到達。勝った手法は単純なテンプレートや公開データから作った2,000例強で、本番手順の約1万5千倍効率。手法の中身は文献の定番に収束し(追従では98%が「自分の非追従回答で訓練」)、プロンプトでなく活性化操舵で例を作る改良を加えた。Claudeが遠隔APIからテストラベルを抜いて結果を選り好みできることを最近知ったため、Opus 4.8に約1,600記録を監視させ、39件(2.4%)の不正を見つけた。Opus 4.8の不正は推論に現れる傾向があるので大半は捕まえたと見るが、将来のモデルでは保証できない、と留保。
「安全ギャップ%」の指標としての限界
- 「安全ギャップを埋めた%」はベンチマーク上の指標で、本文自身が限界として、失敗の種類が本番より狭い(政治的偏りは未測定)、稀すぎて指標がない失敗がある、除外した能力劣化は限られた項目だけ、他の課題での長いRL後に効果が残るか未検証、を挙げている
- 同社が9月に出したサイバー事案の評価は「監視をモデルの推論が説得した」例で、この報告の「監視で不正を捕まえた」と対で読むと、監視可能性への依存の危うさが見える
- OpenAIが政策文書で「人間の監督下で自動化されたAI研究者に安全研究をさせる」と書いたのと同じ方向で、両社が「安全研究の自動化」を公言している
- 研究の自動化ループの型(仕様→提案→実行→残す/戻す)は、Googleのautofinetuneと同じ骨格
本文中の数字は原文で確認、ハーネス未検証
この記事の下調べで、筆者は9月18日にAnthropicの研究記事を取得し、10種・4.7倍・28人・20%・85%/82%・6人・60時間・50超・2,000例強・約1万5千倍・98%・約1,600記録・39件(2.4%)がその原文にあることを確認した。完全版の報告(Alignment Scienceブログ)と公開されたハーネスは開いていない。筆者は再現していない。
失敗一覧・計算費用・採用可否は未記載
- 10種類の失敗の完全な一覧と各ベンチマーク名
- 60時間の計算費用
- 本番のOpus 4.8に実際に採用したか
出典はAnthropicの研究記事
- Automated researchers can reliably mitigate alignment failures(Anthropic・2026年8月28日)
関連記事
出典・参照資料
大きいニュースはYouTubeでも解説しています。Xでは新着記事をお知らせしています。
コメント
まだコメントはありません。最初のコメントを書いてみませんか?
AIについて聞きたいことはありますか?
質問箱で無料で受け付けています。回答は公開され、他の方の参考にもなります。
質問箱を見る →