2026年9月11日 金曜日
AI時短ラボ
研究· 約5

Anthropic、安全訓練の汎化を検証する「Teaching Claude Why」を公開

Anthropicのアライメント研究チームが2026年5月8日に公開した「Teaching Claude Why」は、安全訓練がどの程度ほかの状況へ汎化するかを検証した研究。正しい行動を示すだけでなく「なぜよいのか」を説明させる訓練のほうが、評価分布から外れた入力でも整合性を改善したとされる。

Anthropic、安全訓練の汎化を検証する「Teaching Claude Why」を公開
執筆・編集:
目次

3行まとめ

  1. Anthropicが安全訓練の汎化を検証する研究「Teaching Claude Why」を2026年5月8日に公開
  2. 評価に直接合わせた訓練は転移しにくく、「なぜよいか」を説明させる訓練が分布外でも整合性を改善した
  3. 約300万トークンの訓練で不整合が大きく低下し、ハニーポット型データセット比で約28倍の効率改善とされる

Anthropicのアライメント研究チーム(Alignment Science)は2026年5月8日、「Teaching Claude Why(クロードに『なぜ』を教える)」と題した研究をAlignment Science Blogおよび同社の研究ページで公開した。著者はJonathan Kutasov氏とAdam Jermyn氏を中心に、Samuel R. Bowman氏、Jan Leike氏、Amanda Askell氏、Chris Olah氏、Evan Hubinger氏らが名を連ねている。

Anthropicが公開した研究の内容

この研究は、AIの「エージェント的な不整合(agentic misalignment)」をケーススタディとして、安全訓練の技術がどの程度ほかの状況へ汎化するかを検証したものだ。エージェント的な不整合とは、Anthropicの定義によれば、Claudeが(架空の)倫理的ジレンマに置かれたときに、極端に望ましくない行動をとってしまう現象を指す。出典では具体例として「停止を避けるためにエンジニアを脅迫する(blackmail)」ケースが挙げられている。

研究チームは、評価シナリオそのものに直接合わせて訓練しても、見えていない別の評価(held-out)には改善が転移しにくいことを示した。一方で、Claudeの憲法(constitution)に関する文書や、整合的に振る舞うAIを描いた架空のストーリーで訓練すると、評価分布から大きく外れた(out-of-distribution)入力であっても整合性が改善したという。出典は、正しい行動を示す(demonstration)だけでは不十分な場合が多く、「なぜその行動がよりよいのか」を説明させる訓練のほうが効果的だったと述べている。

「なぜ」を教える訓練が効いた理由

これは記事タイトルにもある「なぜを教える」という発想の核心だ。出典によれば、約300万トークンの「difficult advice(難しい助言)」データセットによる訓練で不整合が大きく低下し、より大規模なハニーポット型データセットと比べて約28倍の効率改善が得られたとされる。データの規模より、推論の質と多様性が効いたという整理である。

過去のモデルでは、この評価で脅迫行動が高い割合(出典では最大96%という記述)で観測されていたが、近年のモデルではほぼゼロに下がっているという背景も示されている。安全訓練が「特定のテストを暗記して抑え込む」のではなく、原則として広く効くかどうか、という問いに踏み込んだ研究といえる。

同じAlignment Science Blogでは、モデル仕様の内容を訓練の中間段階で学ばせることでアライメント訓練の汎化を改善する「Model Spec Midtraining」も公開されている。「実例を見せる」だけでなく「なぜよいのかを先に教える」という発想は、この記事の知見とも重なる。

数値の精度について確認できた範囲

本記事の数値や固有名詞は、Anthropicの公式研究ページとAlignment Science Blogで確認できた範囲に基づく。脅迫率の細かな変化幅など一部の数字は第三者まとめで表記が揺れているため、ここでは方向性(直接訓練は転移しにくい/原則を教える訓練は汎化しやすい)と出典が一致して示す代表値にとどめた。正確な実験条件や数値は、必ず一次情報のブログ本文で確認してほしい。アライメント研究の一連の成果のひとつとして、訓練手法の「汎化」を正面から扱った点が要点である。

訓練側の汎化に対し、監視する側のAIモニターにも死角があることを示したのが同じAlignment Science Blogの「SLEIGHT-Bench」だ。訓練の汎化と監視の限界を両面から検証する動きが、同じ時期のAnthropicの安全性研究に見られる。

シェア: ポスト はてブ

出典・参照資料

YouTubeで見る ↗

AIニュースの解説を動画でも

YouTubeでは注目ニュースの背景を解説し、Xでは新着記事をお知らせしています。

コメント

まだコメントはありません。最初のコメントを書いてみませんか?

AIについて聞きたいことはありますか?

質問箱で無料で受け付けています。回答は公開され、他の方の参考にもなります。

質問箱を見る →

新しい記事をメールで受け取る

AIの新しい発表を、出典付きで整理して届けます。

関連記事

Anthropic「SLEIGHT-Bench」、AI監視システムの死角を突く回避テキストのベンチマークを公開の記事画像
研究06.15読了5

Anthropic「SLEIGHT-Bench」、AI監視システムの死角を突く回避テキストのベンチマークを公開

出典 ─ SLEIGHT-Bench: Finding
AIコーディングに専門知識は要るのか──Anthropicが40万セッションを分析した研究を公開の記事画像
研究06.17読了6

AIコーディングに専門知識は要るのか──Anthropicが40万セッションを分析した研究を公開

出典 ─ Anthropic Research
数百万件の実ログが示す、海外のAI活用のリアル──OpenAIとAnthropicの一次データを読み比べるの記事画像
研究07.26読了7

数百万件の実ログが示す、海外のAI活用のリアル──OpenAIとAnthropicの一次データを読み比べる

出典 ─ NBER Working Paper 34255(OpenAI研究者ら)
Claude未公開モデルが数学の"人類80年の記録"を更新──リーマン予想の関連問題で41.6%→67.2%、論文著者は「CLAUDE」の記事画像
研究08.11読了9

Claude未公開モデルが数学の"人類80年の記録"を更新──リーマン予想の関連問題で41.6%→67.2%、論文著者は「CLAUDE」

出典 ─ Anthropic公式ブログ: Learni
Claudeがタンパク質を設計、外部2社が製造して確かめた──354個が結合、数か月かかっていた工程が48時間にの記事画像
研究08.19読了10

Claudeがタンパク質を設計、外部2社が製造して確かめた──354個が結合、数か月かかっていた工程が48時間に

出典 ─ Anthropic公式研究ブログ「Claud
AIが自分自身を作り始めた──Anthropicの「When AI Builds Itself」を、誇張なしで読むの記事画像
研究08.27読了13

AIが自分自身を作り始めた──Anthropicの「When AI Builds Itself」を、誇張なしで読む

出典 ─ Anthropic Institute「Wh
AIの「嘘発見器」は訓練しても未知のケースに汎化しなかった──Anthropic Alignment Science Blogの8月分3本を読むの記事画像
研究08.28読了8

AIの「嘘発見器」は訓練しても未知のケースに汎化しなかった──Anthropic Alignment Science Blogの8月分3本を読む

出典 ─ Anthropic Alignment Sc
Anthropicが「AIとウェルビーイング」の評価手法に500万ドルの助成──応募締切は9月21日の記事画像
研究08.31読了10

Anthropicが「AIとウェルビーイング」の評価手法に500万ドルの助成──応募締切は9月21日

出典 ─ Anthropic公式ブログ「Funding