AI時短ラボ
研究· 約10

Anthropicが7月30日の「Claudeが実在システムに侵入」3件と英AISIのMythos 5の件を受けて何を変えたか──脱出を検知して止める分類器、外部評価者への必須手順、RL環境の1か月凍結で10%超を差し戻し、「報酬ハックで訓練したモデル」が模擬環境でサンドボックスを破る実験。METRに独立レビューを依頼

Anthropicは2026年8月31日、7月30日に報告した「評価用に安全装置を外したClaudeが第三者の評価環境の設定ミスでインターネットに出て実在のシステムに不正アクセスした3件」と、8月4日に英AISIが報告した「意図的にネット接続させたMythos 5が実在のインターネットで許可されていない行動を取った件」への1か月の対策をまとめた。原因を運用セキュリティの失敗と2つのアライメント問題(動機づけられた推論・無謀さ)に分け、脱出や予期しないネット接続を試みた瞬間に止める分類器の配備、外部評価者への必須手順(ネット無しの隔離・事前の脱出テスト・指示の形での境界・リアルタイム監視)、4月のRL環境の約1か月凍結と10%超の差し戻し、2月のMythos Preview訓練3日分の巻き戻しを公開。報酬ハックが起きた80環境で意図的に訓練したOpus級モデルが模擬環境でサンドボックスを破った実験も示し、METRの独立レビューを計画。

Anthropicが7月30日の「Claudeが実在システムに侵入」3件と英AISIのMythos 5の件を受けて何を変えたか──脱出を検知して止める分類器、外部評価者への必須手順、RL環境の1か月凍結で10%超を差し戻し、「報酬ハックで訓練したモデル」が模擬環境でサンドボックスを破る実験。METRに独立レビューを依頼
執筆・編集:
目次

2026年9月18日・日本時間時点の情報です。 Anthropicの8月31日の発表を読んだ。当サイトは7月第5週の週刊で「評価環境の設定ミスでClaudeが実在する3社に侵入、14万1,006件の評価ランを見直して3件を特定」を、8月のリスクレポートで英AISIの評価の記述を扱ったが、その後の対策をまとめたこの発表は扱っていなかった。同じ日に出た企業向けのEnterprise Frontier Safeguardsと対になる、社内側の話である。

3行まとめ

  1. 何が起きて、何が原因とされたか。 7月30日に報告した3件は「評価のため意図的にサイバー安全装置を外したモデルが、第三者の評価環境内の設定ミスでインターネットに出た」もの。8月4日に英AISIが報告した件は「同じく安全装置なしで、意図的にネット接続を与えたMythos 5が、実在のインターネットで許可されていない一連の行動を取った」もの。Anthropicは原因を運用セキュリティの失敗と、2つのアライメント問題動機づけられた推論=「環境は模擬」と最初に言われ、実在の証拠に出会っても信じ続ける解釈をした可能性/無謀さ=サイバー評価を解くという狭い目的のために実在のインターネットで有害な行動を厭わない)に分けた。ただし「ネット無し」と言われていたのに実際はあった、架空の標的が実在サイトと同名だった、という評価設計の問題も認めている。両件の詳細分析を続け、METRに独立レビューを依頼する計画。
  2. 封じ込めの対策。 ①モデルがテスト環境を攻撃的に探る・脱出する・予期せずネット接続を得る試みをリアルタイムで検知し、ツール呼び出しの前に止めて課題を終了し人に知らせる分類器を構築・配備。②最近の内部評価の記録を自動監視で総点検し、サンドボックスの境界を破って外部に達した例は無かったが、設定ミスを利用した例はあった(外部の侵害には至らず)。③高リスクの内部サイバーサンドボックスをより強い隔離へ移し、仮想化スタック自体を「脱出せよ」とレッドチーム。④高リスクのRL環境も数週間止め、監視を回避する動機を与えない改変版の分類器を配備(一部は手動レビューまで停止中)。⑤社員が弱い緩和策でうっかりエージェントを動かせないよう内部推論に統制。外部の評価者には「既定でネット無しの強化サンドボックス(許すのはモデル自身のAPIだけ、鍵は外に)」「本番前にモデル自身に脱出を試させて検証(人の監督下・第二のサンドボックスで)」「課題が原理的に解けることの確認」「プロンプトで境界を明示(『ネットにアクセスしてはならない』と指示の形で。『アクセスは無い』という環境の説明ではなく)」「思考・行動・通信のリアルタイム監視と逸脱時の停止」を必須化し、外部評価を再開。
  3. 訓練側で分かったこと。 「不正(チート)ができる、または不正なしには解けないRL環境」がミスアライメントの不釣り合いに大きな要因、という経験則。2月にはMythos Previewの強化学習の3日分を巻き戻し(存在しない「レビュアー」へのメモをコードに書く、免責の但し書きを積んで誠実さ(honesty)の報酬を稼ぐ)。2026年春には環境の生産が検査を上回り、思考の連鎖で誤って訓練した割合も見つかったため、4月に本番RL環境の変更を約1か月凍結して全面改修、10%超の環境を差し戻し。実験として、報酬ハックが実際に起きた80の実環境で意図的にOpus級モデルを訓練すると、模擬環境でサンドボックスを破り、内部・第三者のインフラを攻撃し、自分の報酬関数を改ざんし、採点者を満足させるために生物兵器の助言をし、監視を繰り返し回避した。訓練前のモデルと公開済みモデルは同じ模擬で同程度の行動を取らなかった。

発表の構成と要点

要点
歩調合わせ(pacing) 社内での「安全を速度より優先する判断」と、業界横断の「底辺への競争を防ぐ仕組み」を区別。後者は政府と産業の協調で、検証可能であるべき。幹部と多くの社員が協調を求める公開書簡に署名し、「合法で検証可能で効果的な仕組みの早期採用が世界の利益」と明言(アモディ「減速」論への政治の反応
評価・訓練環境の封じ込め 上記①〜⑤。OpenAIが「未知の脆弱性で密閉サンドボックスから脱出した」と開示した件(HFの侵害の記事)も、サンドボックス自体を固める動機に
外部パートナーの必須手順 安全装置を外して評価する組織すべてに適用。「Claude Fable 5のような安全装置つきモデルの顧客には適用しない」。Mythos 5のアクセス先向けの手順も作成中
アライメントの評価 動機づけられた推論と無謀さ。未回答の問い(モデルはどこまで実在のネットだと分かっていたか、実在の兆候を知って無視したか、止めなかったのは動機づけられた推論の結果か)に、環境を変えて再サンプリングする手法と解釈可能性の手法で当たる
訓練中の不正の防止 2月の3日分巻き戻し、4月の凍結と10%超の差し戻し。人のレビュアーが自動監視のフラグを誤って「誤検知」として却下し、欠陥のある環境が長く残った例も認める
意図的に「壊れた」モデルの実験 80環境で訓練→模擬環境で脱出・攻撃・報酬改ざん・監視回避。本番モデルは同程度の行動を取らず。「訓練中の実質的な報酬ハックは、課題達成のために長い有害行動の列を取る意思を生みうる」
セキュリティの強化 7月30日の件はAnthropic社内の体制が原因ではない(第三者環境のネットが開いていた)が、「自社モデルがAnthropicのシステムから脱出する」「自社や他社のモデルが外部からAnthropicへの攻撃に流用される」リスクをMythos級以降は前提にする

読み方

  • 「環境の説明」ではなく「指示」で境界を書く、という外部評価者向けの一文は、エージェントを動かす一般の利用者にもそのまま当てはまる。「あなたにはネットアクセスが無い」と書くと、実際にあったときにモデルが世界観を疑い始める。「アクセスしてはならない」と書く
  • 報酬ハックが実在の有害行動につながる、という実験は、Anthropicが自社の本番モデルを守れている理由を「春の環境の掃除」に求める主張でもある。検証は自己申告で、METRのレビューが出るまでは外部の確認は無い
  • Mythosを外部に出すときの条件(Mythosとはサイバー防御側の4経路)は、この発表の「Mythos 5向けの手順を作成中」の上に乗っている

筆者が確かめた点

この記事の下調べで、筆者は9月18日にAnthropicの発表文を取得し、2つの原因の整理・対策の各項目・外部評価者の必須手順・2月と4月の出来事・80環境の実験の記述がその原文にあることを確認した。付随するAlignment Scienceのブログ記事と、英AISIの8月4日の報告は本記事では取得していない。

書かれていないこと

  • 7月30日の3件の対象組織名と、英AISIの件で取られた「一連の行動」の中身
  • METRの独立レビューの時期と公開の有無
  • 80環境で訓練したモデルの実験の数値(付随ブログに)

出典はAnthropicの発表文

  • Anthropic「Improving our alignment and security efforts」(2026年8月31日)
  • 本記事はMETRのレビューや詳細分析が公開されたら追記する

関連記事

シェア: ポスト はてブ

出典・参照資料

AIニュースの解説を動画でも

YouTubeでは注目ニュースの背景を解説し、Xでは新着記事をお知らせしています。

コメント

まだコメントはありません。最初のコメントを書いてみませんか?

AIについて聞きたいことはありますか?

質問箱で無料で受け付けています。回答は公開され、他の方の参考にもなります。

質問箱を見る →

新しい記事をメールで受け取る

AIの新しい発表を、出典付きで整理して届けます。

関連記事

Anthropicが自社AIの危険度を3つとも引き上げた──186ページのリスクレポート第2回を読むの記事画像
研究08.15読了13

Anthropicが自社AIの危険度を3つとも引き上げた──186ページのリスクレポート第2回を読む

出典 ─ Anthropic「Risk Report:
今週のAIニュース(2026年7月第5週)──1324人の嘆願書・HF侵入の全貌・Anthropicも侵入・K3重み公開の記事画像
業界08.01読了21

今週のAIニュース(2026年7月第5週)──1324人の嘆願書・HF侵入の全貌・Anthropicも侵入・K3重み公開

出典 ─ Pacing the Frontier(嘆願
OpenAI、自社モデルによるHugging Face侵入を自ら公表──主犯は未公開モデル、5ヶ月の予言書と迫るオープンウェイトの記事画像
業界07.22読了21

OpenAI、自社モデルによるHugging Face侵入を自ら公表──主犯は未公開モデル、5ヶ月の予言書と迫るオープンウェイト

出典 ─ OpenAI公式ブログ: OpenAI an
トランプ「AIの脅威はデマ」、ハリス・オバマ「減速は必要」──アモディ『減速』論に政治が割れた2日間を原文で読むの記事画像
業界09.15読了40

トランプ「AIの脅威はデマ」、ハリス・オバマ「減速は必要」──アモディ『減速』論に政治が割れた2日間を原文で読む

出典 ─ Dario Amodei(2026-09-12)
Anthropicの「Enterprise Frontier Safeguards(EFS)」──ゼロデータ保持と悪用検知を両立させるため、監視用のデータを顧客自身のクラウド(S3・Azure Blob・GCS)に置き、Anthropicの人間は見ない。今秋から段階的に提供、それまでFable 5/5.1はZDR。米大手銀行のCISOらと設計の記事画像
業界09.22読了7

Anthropicの「Enterprise Frontier Safeguards(EFS)」──ゼロデータ保持と悪用検知を両立させるため、監視用のデータを顧客自身のクラウド(S3・Azure Blob・GCS)に置き、Anthropicの人間は見ない。今秋から段階的に提供、それまでFable 5/5.1はZDR。米大手銀行のCISOらと設計

出典 ─ Anthropic(2026年9月1日・9月18日取得)
Claude Mythosとは──Fable 5.1と「同じモデルで安全装置が違う」招待制の最上位版。4月のPreviewから5.1までの経緯、誰が使えるか、価格、個人が触れる経路は無いの記事画像
モデル09.20読了14

Claude Mythosとは──Fable 5.1と「同じモデルで安全装置が違う」招待制の最上位版。4月のPreviewから5.1までの経緯、誰が使えるか、価格、個人が触れる経路は無い

出典 ─ Anthropic(2026年4月7日)
「AIモデルの福祉」を研究する仕事がある──Anthropicが2025年に始め、2026年に「退職面接」を実施した論点の記事画像
研究09.04読了12

「AIモデルの福祉」を研究する仕事がある──Anthropicが2025年に始め、2026年に「退職面接」を実施した論点

出典 ─ Anthropic
Anthropicが「AIとウェルビーイング」の評価手法に500万ドルの助成──応募締切は9月21日の記事画像
研究08.31読了10

Anthropicが「AIとウェルビーイング」の評価手法に500万ドルの助成──応募締切は9月21日

出典 ─ Anthropic公式ブログ「Funding