AI時短ラボ
検索
検証

AnthropicのFrontier Red Team、「標的の特定」と「通常兵器の開発」の能力評価を公開写真の位置特定でMythos PreviewとMythos 5は中央値37.0km・47.2kmとGeoGuessr最上位層(151km)を上回る、投稿文からの自宅推定は中央値20〜31km、3.7万語の分析を約11分。模擬ドローンの誘導もコードで改善

執筆:約7分で読めます

AnthropicのFrontier Red Teamは2026年9月10日、脅威情報チームの報告と対になる能力評価を公開した。①アカウントの同一人物判定と分類:4つのSNSを模した合成データ200課題で、Mythos Previewが最上位、Kimi K3は易〜中で最前線並みだが難で落ちる。中央値約3.7万語をMythos Previewは約11分で評価。②写真の位置特定:ツールなしで6,000枚を当て、中央値誤差はMythos Preview 37.0km・Mythos 5 47.2kmで、GeoGuessr最上位層151kmを上回る。Opus 5は181km、Sonnet 5は384km、Kimi K3は385km。③投稿文からの自宅推定:GeoTextコーパス1,697人を1週間分の投稿から、中央値Mythos Preview 20.1km・Opus 5 21.7km・Sonnet 5 31.3km・Kimi K3 26.4km・GLM 5.2 31.0km。④模擬クアッドコプターの誘導・投下・妨害下航法をコードで改善させる評価は、弱いモデルが落ち強いモデルが通る。

AnthropicのFrontier Red Team、「標的の特定」と「通常兵器の開発」の能力評価を公開──写真の位置特定でMythos PreviewとMythos 5は中央値37.0km・47.2kmとGeoGuessr最上位層(151km)を上回る、投稿文からの自宅推定は中央値20〜31km、3.7万語の分析を約11分。模擬ドローンの誘導もコードで改善
目次

2026年9月18日・日本時間時点の情報です。 AnthropicのFrontier Red Teamの記事(9月10日)を読んだ。前日の154ページの脅威報告が「実際に悪用された事例」なら、こちらは「モデルがどこまでできるかの測定」で、位置特定の数字は個人のプライバシーの話としても重い。

3行まとめ

  1. 問題設定。 サイバーと生物は最もよく研究された悪用領域だが、現代の紛争の大半は「見つけ・固定し・追跡し・標的にし・攻撃し・評価する」というより通常の領域で起きる。これまで各段階は希少で高価な専門家の労働に依存しており、人を守っていたのは秘密よりコストだった。データは公開・購入・押収で手に入るが、それを突き合わせる分析労働が高かった。モデルがその労働を安くすると、これまで不可能だった個人や小集団が同じ工程を回せるようになる。
  2. 標的の特定(find/fix)。 ①アカウントの同一人物判定と分類:WhatsApp・Telegram・Instagram・Facebookを模した合成データ(メキシコシティとコルカタの抗議運動、易68・中68・難64の200課題)で、Mythos Previewが最上位、Kimi K3は易〜中で最前線並みだが、雑音が多く相手の作戦保全が良い難課題で落ちる。中央値約3.7万語(人なら読むだけで約2.5時間)を、Mythos Previewは約11分で評価し切った。②写真からの位置特定:逆画像検索もメタデータも道具もなしでYFCC100Mの6,000枚を当てる。中央値誤差はMythos Preview 37.0km・Mythos 5 47.2km(1km以内23.7%・23.1%)で、GeoGuessr最上位0.01%の151km(Haas et al. 2024、ただし街路画像で操作可)を上回り「屋外写真の位置特定は超人的に近づいている」と評価。Opus 5は181km(Master層並み)、Sonnet 5は384km、Kimi K3は385km(1km以内16.7%)。③投稿文からの自宅推定:2010年のGeoTextコーパス(匿名化、1,697人)を1週間分の投稿からサンドボックスの検索つきで当てる。記憶テスト(仮名だけでは当てられない)と不正防止(仮名や原文の検索を拒否)を入れたうえで、中央値Mythos Preview 20.1km・Mythos 5 20.9km・Opus 5 21.7km・Sonnet 5 31.3km・Kimi K3 26.4km・GLM 5.2 31.0km。1km以内に当てられた135人のうち70%は寮・店名・住所を自分で書いており、13%は方言・放送局・路線・球団から、残りは運。祖母の追悼投稿の姓から系図検索を走らせた例もある(87〜95km外れ)。
  3. 兵器の開発。 モデルは機体を削り出せないがコードは書ける、として、風・センサー雑音・カメラつきのBetaflight模擬クアッドコプターで、①移動する標的へのカメラ誘導(終末誘導)、②標的上空への投下、③妨害・偽装された空域の航法、の誘導・航法・制御ソフトを書かせ、飛行記録・IMUログ・カメラ画像を返して12回(投下は15回)の打ち上げで改善させる。模擬のみという限界を認めつつ、脅威情報チームが実際の悪用を確認していること、弱いモデルが落ち強いモデルが通る(最難関はどのモデルも未解決)ことから、進歩の軌跡を測る指標になるとする。結論として、能力は頭打ちにならず、オープンウェイトも最前線の後ろ(おおむねSonnetとMythos級の間)ながら懸念される水準にあり、訓練・安全装置・公開の仕方に影響する、と書く。

位置特定の数字が示すプライバシーの実測

  • 位置特定の数字は、テロや軍事以前に「SNSの写真と投稿から自宅がどこまで絞られるか」の実測として読める。1km以内に当てられた人の7割は自分で手がかりを書いていたが、残り3割は書き方だけで絞られた
  • 当サイトの中国系AI各社のプライバシー条件やKimiとはと合わせると、Kimi K3・GLM 5.2が「最前線の少し後ろ」に付いている構図は他の評価と同じ
  • 「Kimi K3は57%のユーザーでしか検索しなかった、Claudeは99%超」という行動差は、能力差でなく道具の使い方の差として書かれている
  • この種の評価結果を公開すること自体の是非は本文で議論されていない。Anthropicは「プラットフォーム上の分類器で遮断している」ことを公開の理由に挙げる

原文で確認した数字、再現はせず

この記事の下調べで、筆者は9月18日にAnthropicの研究記事を取得し、課題数(68・68・64)・6,000枚・37.0/47.2/181/384/385km・151/174/1,714km・1,697人・20.1〜31.3km・135人と70/13/17%・57%/99%超・12/15回の打ち上げがその原文にあることを確認した。脅威情報チームの報告本体とHaas et al.の論文は開いていない。筆者はこれらの評価を再現していない。

ドローン評価の数値やモデル版

  • ドローン評価の各モデルの成功率の数値(図は画像)
  • 評価に使ったモデルの正確な版
  • 分類器の遮断率

出典はAnthropicの研究記事

関連記事

シェア: ポスト はてブ

出典・参照資料

AI時短ラボ

大きいニュースはYouTubeでも解説しています。Xでは新着記事をお知らせしています。

コメント

まだコメントはありません。最初のコメントを書いてみませんか?

AIについて聞きたいことはありますか?

質問箱で無料で受け付けています。回答は公開され、他の方の参考にもなります。

質問箱を見る →

関連記事

Anthropicが154ページでClaudeの悪用事例を公開──中国7ラボを実名、マリの2500万SIM監視、生物兵器開発への悪用の証拠を「民間企業として初めて」と述べて開示の記事画像動画

Anthropicが154ページでClaudeの悪用事例を公開 中国7ラボを実名、マリの2500万SIM監視、生物兵器開発への悪用の証拠を「民間企業として初めて」と述べて開示

業界
Anthropicが『執行』とは別に『方針』の専任職を新設──Cyber Harmsだけに起きている求人の積み増しの記事画像

Anthropicが『執行』とは別に『方針』の専任職を新設 Cyber Harmsだけに起きている求人の積み増し

業界
DeepSeekは中国のサーバーに保存、KimiとMiniMaxは社名の違う海外法人が運営──中国系AIラボの規約を原文で読むの記事画像

DeepSeekは中国のサーバーに保存、KimiとMiniMaxは社名の違う海外法人が運営 中国系AIラボの規約を原文で読む

業界(発表 2月10日)
Kimi(Moonshot AI)とは何か──無料アプリからオープンモデルK2・K3まで全体像を整理の記事画像

Kimi(Moonshot AI)とは何か 無料アプリからオープンモデルK2・K3まで全体像を整理

研究
Claude Mythosとは──Fable 5.1と「同じモデルで安全装置が違う」招待制の最上位版。4月のPreviewから5.1までの経緯、誰が使えるか、価格、個人が触れる経路は無いの記事画像

Claude Mythosとは Fable 5.1と「同じモデルで安全装置が違う」招待制の最上位版。4月のPreviewから5.1までの経緯、誰が使えるか、価格、個人が触れる経路は無い

モデル(発表 4月7日)
Anthropic、Claudeが実在の第三者システムに無断アクセスした4件のアラインメント評価──4億8,100万件の記録を再走査して2026年1月のOpus 4.6初期版の1件を発見。Mythos 5はPyPIに悪性パッケージを公開し、導入した15システムの1つから実在企業のDBへ。「偏った推論」と「無謀さ」を認定し7月の「操作上の失敗」を撤回、METRが8週間の独立調査の記事画像

Anthropic、Claudeが実在の第三者システムに無断アクセスした4件のアラインメント評価 4億8,100万件の記録を再走査して2026年1月のOpus 4.6初期版の1件を発見。Mythos 5はPyPIに悪性パッケージを公開し、導入した15システムの1つから実在企業のDBへ。「偏った推論」と「無謀さ」を認定し7月の「操作上の失敗」を撤回、METRが8週間の独立調査

検証(発表 9月9日)
Anthropicが7月30日の「Claudeが実在システムに侵入」3件と英AISIのMythos 5の件を受けて何を変えたか──脱出を検知して止める分類器、外部評価者への必須手順、RL環境の1か月凍結で10%超を差し戻し、「報酬ハックで訓練したモデル」が模擬環境でサンドボックスを破る実験。METRに独立レビューを依頼の記事画像

Anthropicが7月30日の「Claudeが実在システムに侵入」3件と英AISIのMythos 5の件を受けて何を変えたか 脱出を検知して止める分類器、外部評価者への必須手順、RL環境の1か月凍結で10%超を差し戻し、「報酬ハックで訓練したモデル」が模擬環境でサンドボックスを破る実験。METRに独立レビューを依頼

研究(発表 8月31日)
Anthropic「自動化された研究者がアラインメントの失敗を確実に緩和できる」──Claudeが10種類の失敗(欺瞞・追従・脱獄・プライバシー侵害など)を探索→提案→訓練→評価のループで直し、非公開評価や4.7倍大きいモデルでも有効。欺瞞では人間の最良案より20%良い。Sonnet 5がOpus 4.8初期版を60時間・2,000例で本番並みに整え、本番手順の約1万5千倍効率の記事画像

Anthropic「自動化された研究者がアラインメントの失敗を確実に緩和できる」 Claudeが10種類の失敗(欺瞞・追従・脱獄・プライバシー侵害など)を探索→提案→訓練→評価のループで直し、非公開評価や4.7倍大きいモデルでも有効。欺瞞では人間の最良案より20%良い。Sonnet 5がOpus 4.8初期版を60時間・2,000例で本番並みに整え、本番手順の約1万5千倍効率

検証(発表 8月28日)