AI時短ラボ
検索

Gemini 4 Argonを発表公式の比較表19項目のうち13項目で1位、出力の上限は100万トークン、最初に使えるのはサイバー防御の専門家だけ

執筆:約14分で読めます

Googleは日本時間2026年10月1日5時、新しい最上位モデル「Gemini 4 Argon」を公式ブログで発表した。公式の比較表では、GPT-6 Astra・Claude Fable 5.1・Claude Opus 5.5と並べた19項目のうち13項目で単独1位、5項目は他社が上だった。導入価格は100万トークンあたり入力2ドル・出力10ドル、出力の上限は100万トークン。いま使えるのはFairwindプログラムのサイバー防御の専門家だけで、一般向けの日付は出ていない。

Gemini 4 Argonを発表──公式の比較表19項目のうち13項目で1位、出力の上限は100万トークン、最初に使えるのはサイバー防御の専門家だけ
目次

2026年10月1日朝・日本時間時点の情報です。Googleは日本時間10月1日5時(米国時間9月30日)、新しい最上位モデルGemini 4 Argonを公式ブログで発表した。公式の比較表では、OpenAIのGPT-6 Astra、AnthropicのClaude Fable 5.1とClaude Opus 5.5と並べた19項目のうち13項目で単独1位、1項目で同率1位、残る5項目は他社が上だった。導入価格は100万トークンあたり入力2ドル・出力10ドル、出力の上限は100万トークン。ただし、いま使えるのはFairwindプログラムに入っているサイバー防御の専門家だけで、一般向けの日付は出ていない。

  • Google公式ブログによると、Gemini 4 Argonは比較表の19項目のうち13項目で単独1位、CWE-bench v1で同率1位。FrontierSWE v2など3項目はGPT-6 Astra、Terminal-bench 4.0など2項目はClaude Opus 5.5が上
  • 導入価格は100万トークンあたり入力2ドル・出力10ドル(導入期間の後は4ドル・20ドル)。出力の上限は6万4,000トークンから100万トークンに
  • 最初の提供先はFairwindプログラムのサイバー防御の専門家。次がAPIの有料利用者とGoogle AI Ultraの契約者で、日付は未発表

公式の表とグラフを全部読んで解説した動画はこちら(10分48秒)。

何が発表されたのか

項目 内容(Google公式ブログ)
名前 Gemini 4 Argon
発表 2026年9月30日(米国時間)・日本時間10月1日5時。署名はGoogle DeepMindのKoray Kavukcuoglu氏
得意な分野 実際のソフトウェア開発、法務や金融のような知識労働、サイバー防御
いま使える人 Fairwindプログラムの信頼できるサイバー防御の担当者
次に広がる先 APIの有料利用者と、Google AI Ultraの契約者から(日付は未発表)
導入価格 100万トークンあたり入力2ドル・出力10ドル。キャッシュされた入力は入力価格の95%引き
導入期間の後 入力4ドル・出力20ドル
出力の上限 100万トークン(前は6万4,000トークン)

ブログはArgonを、長くて込み入った仕事を深く考え続けてやり切るためのモデルと説明している。出力の上限を100万トークンに広げた理由も同じで、「1回の流れで何十万トークンも考えて書けると、難しい問題を一度で解ける」と書いている。

公開の進め方について、ブログは「段階を踏む」と書く。米国政府の、公開前にモデルを試してもらう自主的な仕組みに参加しながら、テスターの意見を集めて安全の仕組みを直し、「できるだけ早く」開発者・企業・一般に出すという。

公式の比較表:13項目で1位、5項目は他社が上

ブログに載った比較表を、数字をそのまま書き写した。太字が各行の1位。

分野 ベンチマーク Gemini 4 Argon GPT-6 Astra Claude Fable 5.1 Claude Opus 5.5
知識労働 Vals Index 68.9% 63.1% 65.8% 67.0%
知識労働 AutomationBench 51.3% 41.4% 31.4% 42.5%
知識労働 Vals Finance Agent v2 65.4% 53.5% 58.9% 58.6%
知識労働 Harvey's Legal Agent Benchmark 19.6% 5.4% 6.7% 3.8%
コーディング DeepSWE v1.1 77.9% 74.1% 67.4% 74.2%
コーディング FrontierSWE v2 55.0% 65.5% 56.3% 62.3%
コーディング Vibe Code Bench 91.9% 89.6% 90.3% 90.3%
コーディング Terminal-bench 4.0 57.4% 58.2% 57.9% 66.4%
機械学習 PostTrainBench 45.3% 44.3% 40.2% 49.3%
科学と数学 Terminal-Bench Science 0.1 57.6% 68.1% 52.6% 63.3%
科学と数学 LABBench 2 88.8% 85.4% 68.6% 73.1%
科学と数学 RiemannBench 76.0% 72.0% 65.6% 69.6%
長い文脈 GraphWalks(12万8,000まで) 99.7% 98.7% 91.4% 90.6%
長い文脈 GraphWalks(25万6,000〜100万) 84.2% 71.8% 65.0% 66.8%
画面操作 Agent's Last Exam 39.5% 34.2% — 38.2%
画面操作 OSWorld-2.0(オフライン) 69.2% 72.6% — —
画像・動画 Chartography 71.6% 71.0% 46.2% 66.3%
画像・動画 LVBench 91.7% 87.5% 79.7% 83.7%
サイバー CWE-bench v1 68.0% 68.0% 58.0% 67.0%

差の付き方には濃淡がある。

  • 大差の項目: 法務(Harvey)は19.6%で、他の3つは3.8〜6.7%。長い文脈(25万6,000〜100万トークン)は2位より12.4ポイント上、AutomationBenchは8.8ポイント上。
  • 僅差の項目: Vals Indexは1.9ポイント、Vibe Code Benchは1.6ポイント、Chartographyは0.6ポイント上。
  • 負けた項目: Terminal-bench 4.0はOpus 5.5が9.0ポイント上、FrontierSWE v2とTerminal-Bench ScienceはAstraが10.5ポイント上。FrontierSWE v2の55.0%は4つの中で一番低い。

Google社内ではもう使われている

ブログによると、Argonはすでに何千人ものGoogle社員が使っていて、例として次の4つを挙げている。

  • 量子計算: 計算の部品にかかる資源(量子ビット×ゲート)を減らす課題で、発表済みの基準を数分で40%上回った
  • メモリ: Argonのエージェントがデータセンター全体の計測記録を調べ、メモリの無駄を自分で見つけて直した。展開すると300TiB以上が空き、全体で500TiB〜1PiBの節約を見込む
  • C/C++からRustへの書き換え: 数万行のライブラリから、80万行を超えるFuchsia OSのZirconカーネルまで。重要な仕組みなので、自動と人の手の監査・テストを経てから本番に出すとしている
  • 動画デコーダーlibgav1: 既存のRust版のSIMDコード3万2,000行を置き換え、元のRust版より2.7倍速くなった。出力される映像は同じ

サイバー防御:制限を外した版を専門家に渡す

ブログはArgonを「ソフトウェアの重大な弱点を、自分で見つけて、確かめて、直せる」モデルと説明している。前のGemini 3.8 Flash Cyberとの比較のグラフでは、20の言語のコードから弱点を探す課題で85.8%対71.0%、ソースコード無しで動いているWebサービスを調べるWizの侵入テストで70.9%対58.2%だった。弱点を直す力を見るCWE-bench v1は68%で、グラフではGrok 4.7とGPT-6 Astraも同じ68%で並んでいる。

注目したいのは、信頼できる防御の担当者とGoogle社内向けには、サイバー面の制限を外したArgonを出すと書いている点だ。最初の提供先がFairwindプログラムに限られているのはこのためで、DeepMindのFairwindのページは、参加組織の背景調査、アクセスの転売・再配布の禁止、社内のセキュリティ担当チームだけに使わせることを条件に挙げている。

実例として、Wizが公共インフラを無料で守る取り組みでArgonを使い、世界中の病院で使われている医療ソフトに個人情報が漏れる重大な弱点を見つけた、とブログは書く。「前の最先端のモデルたちは見落としていた」という。

広く出す前の安全対策4つ

  1. 悪用の防止: サイバー攻撃や化学・生物・放射性物質・核の攻撃への利用を断る。モデルの内部の動きを見て悪用を見つける技術も強めた
  2. プロンプトインジェクション: 読ませた文章に仕込んだ命令でAIを乗っ取る攻撃への強さ。Gray Swanの評価(15回攻撃した時の成功率・低いほど良い)はArgonが0.7%で、グラフの中で最も低い。Claude Opus 5.5とFable 5.1は1.0%、GPT-6 Astraは8.5%、GPT-6 Solは10.1%
  3. 指示を越えた動きの見張り: 考えている過程と行動を監視し、必要なら止める。見張りで見つけたことは学習に戻さない(見張りを避ける考え方を覚えさせないため)。業界に向けて「考えの過程が見えるままにしておこう」と呼びかけている
  4. 試す環境を固める: 危ない学習や評価の前に、環境を外から切り離して閉じる

9月のリークと比べると

当サイトは9月27日に、X上の投稿をもとに「Gemini 4 Proの社内チェックポイント『argon』が出回り始めた」というリーク記事を出していた。答え合わせをすると、名前のargonは当たっていたが、製品名は「Pro」ではなく「Gemini 4 Argon」だった。出力の上限は、リーク投稿の「25万6,000トークン」に対して公式は100万トークンで、外れていた。「従来は6万4,000」という部分は公式の説明と一致した。投稿にあった「barium-b」は、今回の発表には出てこない。

Googleの比較表に載っていない相手

比較表は、Googleが相手を3モデルに絞って出したものだ。DeepMindの評価手法のPDFは、他社の数字は原則として各社の自己申告の値、Argonの数字のうちDeepSWE v1.1・Terminal-Bench 4.0・Terminal-Bench Science・OSWorld-2.0などはGoogleが自分で測った値だと書いている。LVBenchは全モデルをGoogleが測っていて、読ませた動画のフレーム数がモデルごとに違う(Geminiは1秒1枚、GPT-6 Astraは800枚、Fable 5.1は300枚、Opus 5.5は600枚。PDFはAPIの制限のためと説明)。

ベンチマークの提供元の表も見た。当サイトが10月1日5時41分に取得したVals AIのVals Indexの表では、1位がGemini 4 Argonの68.90%、2位はGoogleの比較表に入っていないClaude Sonnet 5.5の67.04%、3位がClaude Opus 5.5の66.97%だった。同じくVals AIのHarveyの法務ベンチのページでは、Muse Spark 1.2が25.42%で最も高いと書かれていた。表に並ぶ相手を変えると、順位の見え方は変わる。

提供元の表にArgonの数字が載っていたのは、当サイトが取得した範囲では、Vals AI(Vals Index・Finance Agent v2・Harvey・Vibe Code Bench)、ZapierのAutomationBench、CWE-benchだった。DeepSWEとLVBenchの提供元のリーダーボードには、取得した時点でArgonの数字は無かった。一般の利用者が触れるようになってからの評価も待ちたい。

確かめた出典と、確かめられなかったこと

  • 数字はすべて、Google公式ブログの本文と、同ブログに載った比較表・グラフの画像から書き写した。比較表の19項目は、GraphWalksの2つの範囲を別々に数えている
  • 取得した時点(10月1日5時台)で、Gemini APIとVertex AIのモデル一覧・料金のページにはArgonの記載が無く、モデルIDは確認できていない
  • キャッシュされた入力の値段は、ブログの「入力価格の95%引き」に従った
  • 本記事は、一般向けの提供が始まり次第更新します
シェア: ポスト はてブ

出典・参照資料

YouTubeで見る ↗
AI時短ラボ

大きいニュースはYouTubeでも解説しています。Xでは新着記事をお知らせしています。

コメント

まだコメントはありません。最初のコメントを書いてみませんか?

AIについて聞きたいことはありますか?

質問箱で無料で受け付けています。回答は公開され、他の方の参考にもなります。

質問箱を見る →

関連記事

【リーク】Gemini 4 Pro の記事サムネイル

【リーク】Gemini 4 Pro、Google社内でチェックポイント「argon」が出回り始めたと投稿 出力の上限は25万6,000トークン、新しい版「barium-b」の投稿も

モデル(発表 9月15日)
Google「Fairwind Program」──Gemini 3.8 Flash CyberとCodeMenderを政府・重要インフラ・基盤ソフトの「信頼できる防御側」に限定提供。参加は650超、社内のセキュリティ・インシデント対応・侵入テストの担当者に限りMFA必須。Google.orgのサイバー資金は累計1億ドル超、米国35のサイバークリニックに3,600万ドルの記事画像

Google「Fairwind Program」 Gemini 3.8 Flash CyberとCodeMenderを政府・重要インフラ・基盤ソフトの「信頼できる防御側」に限定提供。参加は650超、社内のセキュリティ・インシデント対応・侵入テストの担当者に限りMFA必須。Google.orgのサイバー資金は累計1億ドル超、米国35のサイバークリニックに3,600万ドル

検証(発表 9月2日)
Google、Gemini 3.8 Flashと3.8 Flash Cyberを発表──6週間で3本目のFlash、Opus 5の7分の1の値段で金融・法務・長尺動画のベンチは上、汎用エージェントは19.1%対51.8%の記事画像動画

Google、Gemini 3.8 Flashと3.8 Flash Cyberを発表 6週間で3本目のFlash、Opus 5の7分の1の値段で金融・法務・長尺動画のベンチは上、汎用エージェントは19.1%対51.8%

モデル
GPT-6 AstraとClaude Fable 5.1の公式比較資料を並べた画像

GPT-6 Astra vs Claude Fable 5.1 比較 同じ$10/$50で何が違うか。公式ベンチの突合・独立指標・プラン別に使える条件・キャッシュ単価の4倍差を1枚に

モデル
Claude Opus 5.5が登場──入力4ドル・出力20ドルでOpus 5より2割安、公式ベンチ9項目のうち7項目で首位の記事画像動画

Claude Opus 5.5が登場 入力4ドル・出力20ドルでOpus 5より2割安、公式ベンチ9項目のうち7項目で首位

モデル
Google、Gemini 3.7 Flashを発表──3.6から3週間・導入価格は半額の0.75ドル、一方で総合指標と知識労働は他社の下の記事画像動画

Google、Gemini 3.7 Flashを発表 3.6から3週間・導入価格は半額の0.75ドル、一方で総合指標と知識労働は他社の下

モデル
Google、Gemini 3.6 Flashなど3モデルを同時発表──出力トークン17%減・長文1Mで54.0%、一方でコーディング4種目は1位ゼロの記事画像動画

Google、Gemini 3.6 Flashなど3モデルを同時発表 出力トークン17%減・長文1Mで54.0%、一方でコーディング4種目は1位ゼロ

モデル
Gemini無料版の制限──公式ヘルプで確認できた具体的な数字の記事画像

Gemini無料版の制限 公式ヘルプで確認できた具体的な数字

検証