2026年7月24日 金曜日
AI時短ラボ
モデル· 約9

Claude Opus 5が登場──価格据え置きでFable 5級の知能、アライメントは歴代最高

Anthropicが2026年7月24日にClaude Opus 5を公開。価格は入力$5/出力$25とOpus 4.8据え置きのまま、最上位Fable 5の約半額の水準でその知能に迫る。ARC-AGI-3は次点の3倍、ミスアライメントスコアは歴代最低の2.30。公式ベンチを全数チェックしました。

Claude Opus 5が登場──価格据え置きでFable 5級の知能、アライメントは歴代最高
執筆・編集:
目次

2026年7月25日時点の情報です。ベンチマーク数値はすべてAnthropicの公表値であり、第三者による独立検証はこれからです。

Anthropicは2026年7月24日、新モデル「Claude Opus 5」を公開しました。全プラットフォームで即日利用開始、モデルIDはclaude-opus-5です。位置づけは「最上位モデルClaude Fable 5のフロンティア知能に、半額で迫る」。価格は入力100万トークンあたり5ドル・出力25ドルと、Opus 4.8から据え置きのまま性能が引き上げられました。公式ベンチマークを全数確認した内容を整理します。解説動画(約8分半)はこちら

  • 価格は入力$5/出力$25(Opus 4.8据え置き)。Claude Maxのデフォルト、Claude Proの最強モデル。Fast Modeは2.5倍速で基本の2倍料金
  • 新規問題解決ARC-AGI-3は30.2%で次点の3倍以上、PC操作OSWorld 2.0は70.6%、知識労働GDPvalはElo 1861でFable 5・GPT-5.6 Solを上回る
  • ミスアライメントスコア2.30(低いほど良い)で歴代最高のアライメント。脆弱性の発見力は上げつつ悪用は抑える非対称設計

何が出たのか

Claude Opus 5は、Anthropicが「思慮深く、自ら動く(proactive)」と位置づけるモデルです。公式は、答えを一度で出すのではなく、自分の作業を検証し、成功するまで反復する挙動を強調しています。発表ページの例では、機構図面を閲覧できなかった課題で、Opus 5が自前のコンピュータビジョン処理を組み、3D FreeCADモデルを作り直して解いたこと、競合モデルが5回の試行で解けなかった課題だったことが挙げられています。

価格はOpus 4.8と同じ入力$5・出力$25(100万トークンあたり)。速度重視の「Fast Mode」は2.5倍速・基本の2倍料金で提供されます。

ベンチマーク(すべてAnthropic公表値)

公式サマリー表(Opus 5 / Fable 5 / Opus 4.8 / GPT-5.6 Sol)の主な数値は以下の通りです。

ベンチマーク Opus 5 Fable 5 Opus 4.8 GPT-5.6 Sol
ターミナルコーディング(Frontier-Bench v0.1) 43.3% 33.7% 21.1% 34.4%
知識労働(GDPval-AA v2・Elo) 1861 1747 1593 1736
新規問題解決(ARC-AGI-3) 30.2% 1.5% 7.8%
エージェント検索(BrowseComp) 90.8% 87.4% 84.3% 90.4%
多分野推論(HLE・ツール有り) 64.7% 63.9% 57.9%
PC操作(OSWorld 2.0) 70.6% 66.1% 55.7% 62.6%
エージェントコーディング(DeepSWE v1.1) 68.8% 69.7% 59.0% 72.7%
ビジネス自動化(AutomationBench) 26.0% 17.4% 17.0% 18.1%
法律(Legal Agent Benchmark) 11.7% 13.3% 10.4% 2.5%

コーディングのFrontier-BenchはOpus 4.8の2倍以上。ARC-AGI-3は次点の3倍以上です。一方で、エージェントコーディングのDeepSWEはGPT-5.6 Solが72.7%で上、法律ベンチはFable 5が13.3%で上と、Opus 5が全項目で首位というわけではありません。CursorBenchでは、最大努力設定でFable 5のピークとの差が0.5%以内に収まり、それを半分のコストで達成したとされています。

ライフサイエンスでは、Opus 4.8比で有機化学の内部ベンチが+10.2ポイント、タンパク質配列タスクが+7.7ポイント。生物学のBioMysteryBench(難問セット)は49.4%で、「一般提供されているモデルの中で最も高性能な科学研究モデル」と位置づけられています。

アライメントが歴代最高という主張

今回Anthropicが強く打ち出しているのが安全性です。行動を自動監査するテストのミスアライメントスコアは2.30(低いほど良い)で、Opus 4.8の2.85、Sonnet 5の3.35を下回り、歴代で最もアライメントスコアの高いモデルとされています。欺瞞的な振る舞いの率が最低、悪用しようとする操作への耐性が最高、とも記載されています。

サイバー面は非対称に設計されています。OSS-Fuzz評価では、脆弱性の「発見」でMythos 5(80.0%)にOpus 5(79.4%)が接近する一方、「悪用の成功数」はMythos 5の13件に対しOpus 5は4件と大きく下回ります。Anthropicはこれを「危険なフロンティアは前進させない」設計と説明しています。サイバー分類器の介入は最上位Fable 5比で約85%減らし、開発者が使いやすいよう調整したとしています。生物学では、これまでFable 5でブロックされていた要求が、Opus 4.8ではなくOpus 5にルーティングされるようになりました(自律的な長時間研究タスクには制限あり)。

提供と新機能

利用できるのはClaude API・Claude.ai・Claude Code・Claude Cowork・Claude Platform。Claude Maxではデフォルトモデル、Claude Proでは最強モデルになります。ベータ機能として、Claude Platformでの会話中のツール切り替え(プロンプトキャッシュの無効化を回避)と、APIでの安全分類器フラグ時の自動フォールバックが追加されました。

なぜこのタイミングで出てきたのか

性能とは別に、「なぜ今この形で出てきたのか」という論点があります。Opus 4.8のリリースは2026年5月28日、Opus 5への置き換えが7月24日で、フラッグシップの寿命は57日でした。その間、最上位のFable 5は輸出指令による停止と復旧を挟み、7月20日にMax・Team Premiumのみ・週の利用枠の50%までという形に変わっています(Pro・Team Standardはプランから外れ、一回きりのクレジット後はAPI料金)。

一方、第三者が同一条件で測るArtificial Analysis Intelligence Indexでは、7月25日時点でKimi K3が57、Opus 4.8が56。オープンウェイトモデルがAnthropicの主力を上回る位置にいました。この時系列と第三者データから何が読めるかは、考察動画(約8分半)で扱っています。

この記事を書いている立場から

筆者はClaude Codeを日常の制作パイプラインで使っており、モデルの世代交代は実務に直接影響します。今回の速報は公式発表とベンチ図の全数確認に基づく整理で、実際に触った使用感は追って別途扱う予定です。数値はいずれもAnthropicの公表値であり、独立した第三者検証が出そろうまでは「メーカー公表値」として読むのが妥当です。

出典・但し書き

  • 一次ソース:Anthropic「Claude Opus 5」(2026-07-24)https://www.anthropic.com/news/claude-opus-5
  • 数値はすべてAnthropic公表値。Frontier-Bench v0.1は内部ベンチで、Opus 4.8がセーフティ分類器の拒否時フォールバックとして使われています
  • サマリー表のHealth・Biologyの一部最高値はMythos 5の値を含みます(公式表の注記に準拠)
  • 本記事は続報があり次第更新します(実利用レビュー・第三者ベンチ)
シェア: ポスト はてブ

出典・参照資料

YouTubeで見る ↗

AIニュースの解説を動画でも

YouTubeでは注目ニュースの背景を解説し、Xでは新着記事をお知らせしています。

コメント

まだコメントはありません。最初のコメントを書いてみませんか?

AIについて聞きたいことはありますか?

質問箱で無料で受け付けています。回答は公開され、他の方の参考にもなります。

質問箱を見る →

関連記事