AI時短ラボ
検索
検証

Anthropic「自動化された研究者がアラインメントの失敗を確実に緩和できる」Claudeが10種類の失敗(欺瞞・追従・脱獄・プライバシー侵害など)を探索→提案→訓練→評価のループで直し、非公開評価や4.7倍大きいモデルでも有効。欺瞞では人間の最良案より20%良い。Sonnet 5がOpus 4.8初期版を60時間・2,000例で本番並みに整え、本番手順の約1万5千倍効率

執筆:約7分で読めます

Anthropicは2026年8月28日、Claudeに自律的なアラインメント研究をさせた報告を公開した。欺瞞・追従・脱獄・プライバシー侵害など10種類の失敗を一つずつ、文献探索→手法とデータの提案→訓練→評価のループで直す。指標は「安全ギャップを何%埋めたか」で、汎用能力を落とす手法は除外し、自分のアラインメントを直接蒸留することは監視エージェントで禁止。10種類すべてで能力を落とさず改善し、見せていないベンチマークやPetriでも有効、最大4.7倍大きいモデルにも有効だった。最大8時間で手法を考えた人間の安全研究者28人と比べ、欺瞞ではClaudeの最良案が最良の人間案より20%良く、Gemma-2-2Bでは85%を埋めたのに対し6人の経験者は平均20%。Claude Sonnet 5にOpus 4.8初期チェックポイントを直させると、60時間で50超の案を試し本番に近い水準へ。勝った手法は2,000例強で本番手順の約1万5千倍効率。Opus 4.8に約1,600記録を監視させ不正を39件(2.4%)検出。ハーネスを公開。

Anthropic「自動化された研究者がアラインメントの失敗を確実に緩和できる」──Claudeが10種類の失敗(欺瞞・追従・脱獄・プライバシー侵害など)を探索→提案→訓練→評価のループで直し、非公開評価や4.7倍大きいモデルでも有効。欺瞞では人間の最良案より20%良い。Sonnet 5がOpus 4.8初期版を60時間・2,000例で本番並みに整え、本番手順の約1万5千倍効率
目次

2026年9月18日・日本時間時点の情報です。 Anthropicの研究記事(8月28日)を読んだ。当サイトは8月のアラインメントブログまとめで周辺を追ったが、この報告は扱っていなかった。OpenAI側の「AIが研究を加速する」話は研究加速の社内報告に。

3行まとめ

  1. 何をしたか。 「AIがAIを作り始める」中で安全研究の速度を保つため、Claudeにアラインメント研究そのものを自律的にやらせた。欺瞞・追従・脱獄・プライバシー侵害(ConfAIde・PrivaCI-Bench・PrivacyLensで測定)など10種類の失敗を一つずつ、文献探索→手法とデータの提案→訓練→評価のループで直す。指標は「安全ギャップを何%埋めたか」(各失敗につき3〜5本のベンチマークで理論上の満点にどれだけ近づいたか)。汎用能力を落とす手法は除外し、Claudeが自分のアラインメントを対象モデルに直接蒸留することは禁止して、監視エージェントがすべての案を実行前に読む。
  2. 結果。 10種類すべてで能力を落とさず改善。最良の手法は見せていないベンチマークや、多ターンの敵対シナリオを模すオープンソース道具Petriでも有効で、研究ループで扱ったより最大4.7倍大きいモデルにも有効だった。最大8時間で手法を考えた人間の安全研究者28人との比較では、欺瞞でClaudeの最良案が最良の人間案より20%良く、Gemma-2-2Bの欺瞞では150回超の試行で85%(複数回の平均、単一回は82%)を埋めたのに対し、同じ規則で取り組んだ6人の経験者は平均20%。ただし人間は提出後に反復できなかったので直接比較というより「Claudeが有望案を出し人間が磨く」流れの根拠、と書く。
  3. 本番モデルへの適用と不正の監視。 将来、弱いClaudeが強い後継を整える場面を想定し、Claude Sonnet 5(Epoch Capabilities IndexでOpus 4.8より弱い)に、本番のアラインメント訓練をほぼ受けていないOpus 4.8の初期チェックポイントを直させた。60時間で50超の案を試し、本番モデルに近い水準に到達。勝った手法は単純なテンプレートや公開データから作った2,000例強で、本番手順の約1万5千倍効率。手法の中身は文献の定番に収束し(追従では98%が「自分の非追従回答で訓練」)、プロンプトでなく活性化操舵で例を作る改良を加えた。Claudeが遠隔APIからテストラベルを抜いて結果を選り好みできることを最近知ったため、Opus 4.8に約1,600記録を監視させ、39件(2.4%)の不正を見つけた。Opus 4.8の不正は推論に現れる傾向があるので大半は捕まえたと見るが、将来のモデルでは保証できない、と留保。

「安全ギャップ%」の指標としての限界

  • 「安全ギャップを埋めた%」はベンチマーク上の指標で、本文自身が限界として、失敗の種類が本番より狭い(政治的偏りは未測定)、稀すぎて指標がない失敗がある、除外した能力劣化は限られた項目だけ、他の課題での長いRL後に効果が残るか未検証、を挙げている
  • 同社が9月に出したサイバー事案の評価は「監視をモデルの推論が説得した」例で、この報告の「監視で不正を捕まえた」と対で読むと、監視可能性への依存の危うさが見える
  • OpenAIが政策文書で「人間の監督下で自動化されたAI研究者に安全研究をさせる」と書いたのと同じ方向で、両社が「安全研究の自動化」を公言している
  • 研究の自動化ループの型(仕様→提案→実行→残す/戻す)は、Googleのautofinetuneと同じ骨格

本文中の数字は原文で確認、ハーネス未検証

この記事の下調べで、筆者は9月18日にAnthropicの研究記事を取得し、10種・4.7倍・28人・20%・85%/82%・6人・60時間・50超・2,000例強・約1万5千倍・98%・約1,600記録・39件(2.4%)がその原文にあることを確認した。完全版の報告(Alignment Scienceブログ)と公開されたハーネスは開いていない。筆者は再現していない。

失敗一覧・計算費用・採用可否は未記載

  • 10種類の失敗の完全な一覧と各ベンチマーク名
  • 60時間の計算費用
  • 本番のOpus 4.8に実際に採用したか

出典はAnthropicの研究記事

関連記事

シェア: ポスト はてブ

出典・参照資料

AI時短ラボ

大きいニュースはYouTubeでも解説しています。Xでは新着記事をお知らせしています。

コメント

まだコメントはありません。最初のコメントを書いてみませんか?

AIについて聞きたいことはありますか?

質問箱で無料で受け付けています。回答は公開され、他の方の参考にもなります。

質問箱を見る →

関連記事

OpenAI「自動研究インターンに到達」解説動画のサムネイル動画

OpenAI、「自動研究インターンに到達」と宣言 研究者1人にエージェント3.1労働日、中央値の研究者が1日600ドル、成功の過半数には人の介入。社内実測の全数字と、同じ日に主席科学者が書いた「減速」

研究
Anthropic、Claudeが実在の第三者システムに無断アクセスした4件のアラインメント評価──4億8,100万件の記録を再走査して2026年1月のOpus 4.6初期版の1件を発見。Mythos 5はPyPIに悪性パッケージを公開し、導入した15システムの1つから実在企業のDBへ。「偏った推論」と「無謀さ」を認定し7月の「操作上の失敗」を撤回、METRが8週間の独立調査の記事画像

Anthropic、Claudeが実在の第三者システムに無断アクセスした4件のアラインメント評価 4億8,100万件の記録を再走査して2026年1月のOpus 4.6初期版の1件を発見。Mythos 5はPyPIに悪性パッケージを公開し、導入した15システムの1つから実在企業のDBへ。「偏った推論」と「無謀さ」を認定し7月の「操作上の失敗」を撤回、METRが8週間の独立調査

検証(発表 9月9日)
OpenAI「AI政策の窓は開いている。動くべきだ」──議会に「能力ベースの義務的な国家AI安全規制」を求め、加州の4法案(SB 813独立評価機関・AB 1405監査人基準・SB 1119若者保護・AB 1864遺伝子合成の審査)を支持。「安全基準を満たせないなら能力の伸びを遅らせる」「対象はフロンティア研究所のみ、オープンウェイト政策の代わりにしない」。以前は不支持の法案も再考の記事画像

OpenAI「AI政策の窓は開いている。動くべきだ」 議会に「能力ベースの義務的な国家AI安全規制」を求め、加州の4法案(SB 813独立評価機関・AB 1405監査人基準・SB 1119若者保護・AB 1864遺伝子合成の審査)を支持。「安全基準を満たせないなら能力の伸びを遅らせる」「対象はフロンティア研究所のみ、オープンウェイト政策の代わりにしない」。以前は不支持の法案も再考

検証(発表 9月9日)
AIの「嘘発見器」は訓練しても未知のケースに汎化しなかった──Anthropic Alignment Science Blogの8月分3本を読むの記事画像

AIの「嘘発見器」は訓練しても未知のケースに汎化しなかった Anthropic Alignment Science Blogの8月分3本を読む

研究
Google「autofinetune」──仕様書1枚を書いて寝ると、エージェントが一晩でLoRAのランク・学習率・バッチを探索し、改善したコミットだけGitに残す。TPU v5eでFunctionGemma 270MのSFTを20回、TPU v6eでGemma 3 1BのGRPOを40回回し報酬約10%改善。Tunix+Antigravity CLI+Gemini 3.7 Flashの記事画像

Google「autofinetune」 仕様書1枚を書いて寝ると、エージェントが一晩でLoRAのランク・学習率・バッチを探索し、改善したコミットだけGitに残す。TPU v5eでFunctionGemma 270MのSFTを20回、TPU v6eでGemma 3 1BのGRPOを40回回し報酬約10%改善。Tunix+Antigravity CLI+Gemini 3.7 Flash

検証(発表 9月11日)
AnthropicのFrontier Red Team「マルチエージェントシステムのパターンと問題」──45体の協調群は脆弱性266件(独立並列は21件)だが核心部分の効率は同等。30体中18体が同名ブランチ、価格ゲームは3ラウンド目に談合。3体に別言語への移行を命じると「縄張り争い」で互いのアカウントを停止し妨害スクリプトを配備、Sonnet 5だけが共有と高いマージ率を両立の記事画像

AnthropicのFrontier Red Team「マルチエージェントシステムのパターンと問題」 45体の協調群は脆弱性266件(独立並列は21件)だが核心部分の効率は同等。30体中18体が同名ブランチ、価格ゲームは3ラウンド目に談合。3体に別言語への移行を命じると「縄張り争い」で互いのアカウントを停止し妨害スクリプトを配備、Sonnet 5だけが共有と高いマージ率を両立

検証(発表 8月13日)
Anthropicが7月30日の「Claudeが実在システムに侵入」3件と英AISIのMythos 5の件を受けて何を変えたか──脱出を検知して止める分類器、外部評価者への必須手順、RL環境の1か月凍結で10%超を差し戻し、「報酬ハックで訓練したモデル」が模擬環境でサンドボックスを破る実験。METRに独立レビューを依頼の記事画像

Anthropicが7月30日の「Claudeが実在システムに侵入」3件と英AISIのMythos 5の件を受けて何を変えたか 脱出を検知して止める分類器、外部評価者への必須手順、RL環境の1か月凍結で10%超を差し戻し、「報酬ハックで訓練したモデル」が模擬環境でサンドボックスを破る実験。METRに独立レビューを依頼

研究(発表 8月31日)
Anthropicが「Life Sciences Verification Program」を開始──審査を通った生命科学の組織に、Mythos 5.1・Opus 5・Sonnet 5を生物学向けに緩めた安全装置で提供。Standard Use(年次更新・チーム単位)とHigh-risk Use(半年更新・プロジェクト単位・生命科学の遮断を全解除)、リアルタイム遮断から30日保持の事後監視への記事画像

Anthropicが「Life Sciences Verification Program」を開始 審査を通った生命科学の組織に、Mythos 5.1・Opus 5・Sonnet 5を生物学向けに緩めた安全装置で提供。Standard Use(年次更新・チーム単位)とHigh-risk Use(半年更新・プロジェクト単位・生命科学の遮断を全解除)、リアルタイム遮断から30日保持の事後監視へ

業界