Gemini 4 Argonを発表公式の比較表19項目のうち13項目で1位、出力の上限は100万トークン、最初に使えるのはサイバー防御の専門家だけ
Googleは日本時間2026年10月1日5時、新しい最上位モデル「Gemini 4 Argon」を公式ブログで発表した。公式の比較表では、GPT-6 Astra・Claude Fable 5.1・Claude Opus 5.5と並べた19項目のうち13項目で単独1位、5項目は他社が上だった。導入価格は100万トークンあたり入力2ドル・出力10ドル、出力の上限は100万トークン。いま使えるのはFairwindプログラムのサイバー防御の専門家だけで、一般向けの日付は出ていない。

目次
2026年10月1日朝・日本時間時点の情報です。Googleは日本時間10月1日5時(米国時間9月30日)、新しい最上位モデルGemini 4 Argonを公式ブログで発表した。公式の比較表では、OpenAIのGPT-6 Astra、AnthropicのClaude Fable 5.1とClaude Opus 5.5と並べた19項目のうち13項目で単独1位、1項目で同率1位、残る5項目は他社が上だった。導入価格は100万トークンあたり入力2ドル・出力10ドル、出力の上限は100万トークン。ただし、いま使えるのはFairwindプログラムに入っているサイバー防御の専門家だけで、一般向けの日付は出ていない。
- Google公式ブログによると、Gemini 4 Argonは比較表の19項目のうち13項目で単独1位、CWE-bench v1で同率1位。FrontierSWE v2など3項目はGPT-6 Astra、Terminal-bench 4.0など2項目はClaude Opus 5.5が上
- 導入価格は100万トークンあたり入力2ドル・出力10ドル(導入期間の後は4ドル・20ドル)。出力の上限は6万4,000トークンから100万トークンに
- 最初の提供先はFairwindプログラムのサイバー防御の専門家。次がAPIの有料利用者とGoogle AI Ultraの契約者で、日付は未発表
公式の表とグラフを全部読んで解説した動画はこちら(10分48秒)。
何が発表されたのか
| 項目 | 内容(Google公式ブログ) |
|---|---|
| 名前 | Gemini 4 Argon |
| 発表 | 2026年9月30日(米国時間)・日本時間10月1日5時。署名はGoogle DeepMindのKoray Kavukcuoglu氏 |
| 得意な分野 | 実際のソフトウェア開発、法務や金融のような知識労働、サイバー防御 |
| いま使える人 | Fairwindプログラムの信頼できるサイバー防御の担当者 |
| 次に広がる先 | APIの有料利用者と、Google AI Ultraの契約者から(日付は未発表) |
| 導入価格 | 100万トークンあたり入力2ドル・出力10ドル。キャッシュされた入力は入力価格の95%引き |
| 導入期間の後 | 入力4ドル・出力20ドル |
| 出力の上限 | 100万トークン(前は6万4,000トークン) |
ブログはArgonを、長くて込み入った仕事を深く考え続けてやり切るためのモデルと説明している。出力の上限を100万トークンに広げた理由も同じで、「1回の流れで何十万トークンも考えて書けると、難しい問題を一度で解ける」と書いている。
公開の進め方について、ブログは「段階を踏む」と書く。米国政府の、公開前にモデルを試してもらう自主的な仕組みに参加しながら、テスターの意見を集めて安全の仕組みを直し、「できるだけ早く」開発者・企業・一般に出すという。
公式の比較表:13項目で1位、5項目は他社が上
ブログに載った比較表を、数字をそのまま書き写した。太字が各行の1位。
| 分野 | ベンチマーク | Gemini 4 Argon | GPT-6 Astra | Claude Fable 5.1 | Claude Opus 5.5 |
|---|---|---|---|---|---|
| 知識労働 | Vals Index | 68.9% | 63.1% | 65.8% | 67.0% |
| 知識労働 | AutomationBench | 51.3% | 41.4% | 31.4% | 42.5% |
| 知識労働 | Vals Finance Agent v2 | 65.4% | 53.5% | 58.9% | 58.6% |
| 知識労働 | Harvey's Legal Agent Benchmark | 19.6% | 5.4% | 6.7% | 3.8% |
| コーディング | DeepSWE v1.1 | 77.9% | 74.1% | 67.4% | 74.2% |
| コーディング | FrontierSWE v2 | 55.0% | 65.5% | 56.3% | 62.3% |
| コーディング | Vibe Code Bench | 91.9% | 89.6% | 90.3% | 90.3% |
| コーディング | Terminal-bench 4.0 | 57.4% | 58.2% | 57.9% | 66.4% |
| 機械学習 | PostTrainBench | 45.3% | 44.3% | 40.2% | 49.3% |
| 科学と数学 | Terminal-Bench Science 0.1 | 57.6% | 68.1% | 52.6% | 63.3% |
| 科学と数学 | LABBench 2 | 88.8% | 85.4% | 68.6% | 73.1% |
| 科学と数学 | RiemannBench | 76.0% | 72.0% | 65.6% | 69.6% |
| 長い文脈 | GraphWalks(12万8,000まで) | 99.7% | 98.7% | 91.4% | 90.6% |
| 長い文脈 | GraphWalks(25万6,000〜100万) | 84.2% | 71.8% | 65.0% | 66.8% |
| 画面操作 | Agent's Last Exam | 39.5% | 34.2% | — | 38.2% |
| 画面操作 | OSWorld-2.0(オフライン) | 69.2% | 72.6% | — | — |
| 画像・動画 | Chartography | 71.6% | 71.0% | 46.2% | 66.3% |
| 画像・動画 | LVBench | 91.7% | 87.5% | 79.7% | 83.7% |
| サイバー | CWE-bench v1 | 68.0% | 68.0% | 58.0% | 67.0% |
差の付き方には濃淡がある。
- 大差の項目: 法務(Harvey)は19.6%で、他の3つは3.8〜6.7%。長い文脈(25万6,000〜100万トークン)は2位より12.4ポイント上、AutomationBenchは8.8ポイント上。
- 僅差の項目: Vals Indexは1.9ポイント、Vibe Code Benchは1.6ポイント、Chartographyは0.6ポイント上。
- 負けた項目: Terminal-bench 4.0はOpus 5.5が9.0ポイント上、FrontierSWE v2とTerminal-Bench ScienceはAstraが10.5ポイント上。FrontierSWE v2の55.0%は4つの中で一番低い。
Google社内ではもう使われている
ブログによると、Argonはすでに何千人ものGoogle社員が使っていて、例として次の4つを挙げている。
- 量子計算: 計算の部品にかかる資源(量子ビット×ゲート)を減らす課題で、発表済みの基準を数分で40%上回った
- メモリ: Argonのエージェントがデータセンター全体の計測記録を調べ、メモリの無駄を自分で見つけて直した。展開すると300TiB以上が空き、全体で500TiB〜1PiBの節約を見込む
- C/C++からRustへの書き換え: 数万行のライブラリから、80万行を超えるFuchsia OSのZirconカーネルまで。重要な仕組みなので、自動と人の手の監査・テストを経てから本番に出すとしている
- 動画デコーダーlibgav1: 既存のRust版のSIMDコード3万2,000行を置き換え、元のRust版より2.7倍速くなった。出力される映像は同じ
サイバー防御:制限を外した版を専門家に渡す
ブログはArgonを「ソフトウェアの重大な弱点を、自分で見つけて、確かめて、直せる」モデルと説明している。前のGemini 3.8 Flash Cyberとの比較のグラフでは、20の言語のコードから弱点を探す課題で85.8%対71.0%、ソースコード無しで動いているWebサービスを調べるWizの侵入テストで70.9%対58.2%だった。弱点を直す力を見るCWE-bench v1は68%で、グラフではGrok 4.7とGPT-6 Astraも同じ68%で並んでいる。
注目したいのは、信頼できる防御の担当者とGoogle社内向けには、サイバー面の制限を外したArgonを出すと書いている点だ。最初の提供先がFairwindプログラムに限られているのはこのためで、DeepMindのFairwindのページは、参加組織の背景調査、アクセスの転売・再配布の禁止、社内のセキュリティ担当チームだけに使わせることを条件に挙げている。
実例として、Wizが公共インフラを無料で守る取り組みでArgonを使い、世界中の病院で使われている医療ソフトに個人情報が漏れる重大な弱点を見つけた、とブログは書く。「前の最先端のモデルたちは見落としていた」という。
広く出す前の安全対策4つ
- 悪用の防止: サイバー攻撃や化学・生物・放射性物質・核の攻撃への利用を断る。モデルの内部の動きを見て悪用を見つける技術も強めた
- プロンプトインジェクション: 読ませた文章に仕込んだ命令でAIを乗っ取る攻撃への強さ。Gray Swanの評価(15回攻撃した時の成功率・低いほど良い)はArgonが0.7%で、グラフの中で最も低い。Claude Opus 5.5とFable 5.1は1.0%、GPT-6 Astraは8.5%、GPT-6 Solは10.1%
- 指示を越えた動きの見張り: 考えている過程と行動を監視し、必要なら止める。見張りで見つけたことは学習に戻さない(見張りを避ける考え方を覚えさせないため)。業界に向けて「考えの過程が見えるままにしておこう」と呼びかけている
- 試す環境を固める: 危ない学習や評価の前に、環境を外から切り離して閉じる
9月のリークと比べると
当サイトは9月27日に、X上の投稿をもとに「Gemini 4 Proの社内チェックポイント『argon』が出回り始めた」というリーク記事を出していた。答え合わせをすると、名前のargonは当たっていたが、製品名は「Pro」ではなく「Gemini 4 Argon」だった。出力の上限は、リーク投稿の「25万6,000トークン」に対して公式は100万トークンで、外れていた。「従来は6万4,000」という部分は公式の説明と一致した。投稿にあった「barium-b」は、今回の発表には出てこない。
Googleの比較表に載っていない相手
比較表は、Googleが相手を3モデルに絞って出したものだ。DeepMindの評価手法のPDFは、他社の数字は原則として各社の自己申告の値、Argonの数字のうちDeepSWE v1.1・Terminal-Bench 4.0・Terminal-Bench Science・OSWorld-2.0などはGoogleが自分で測った値だと書いている。LVBenchは全モデルをGoogleが測っていて、読ませた動画のフレーム数がモデルごとに違う(Geminiは1秒1枚、GPT-6 Astraは800枚、Fable 5.1は300枚、Opus 5.5は600枚。PDFはAPIの制限のためと説明)。
ベンチマークの提供元の表も見た。当サイトが10月1日5時41分に取得したVals AIのVals Indexの表では、1位がGemini 4 Argonの68.90%、2位はGoogleの比較表に入っていないClaude Sonnet 5.5の67.04%、3位がClaude Opus 5.5の66.97%だった。同じくVals AIのHarveyの法務ベンチのページでは、Muse Spark 1.2が25.42%で最も高いと書かれていた。表に並ぶ相手を変えると、順位の見え方は変わる。
提供元の表にArgonの数字が載っていたのは、当サイトが取得した範囲では、Vals AI(Vals Index・Finance Agent v2・Harvey・Vibe Code Bench)、ZapierのAutomationBench、CWE-benchだった。DeepSWEとLVBenchの提供元のリーダーボードには、取得した時点でArgonの数字は無かった。一般の利用者が触れるようになってからの評価も待ちたい。
確かめた出典と、確かめられなかったこと
- 数字はすべて、Google公式ブログの本文と、同ブログに載った比較表・グラフの画像から書き写した。比較表の19項目は、GraphWalksの2つの範囲を別々に数えている
- 取得した時点(10月1日5時台)で、Gemini APIとVertex AIのモデル一覧・料金のページにはArgonの記載が無く、モデルIDは確認できていない
- キャッシュされた入力の値段は、ブログの「入力価格の95%引き」に従った
- 本記事は、一般向けの提供が始まり次第更新します
出典・参照資料
- 一次資料Gemini 4 Argon: our next era of frontier intelligence — Google公式ブログ(2026-09-30・比較表とグラフの画像を含む) ↗
- 一次資料Gemini 4 Argon Model Evaluation — Google DeepMind(評価の方法・PDF) ↗
- 一次資料Fairwind Program — Google DeepMind ↗
- 一次資料Vals Index — Vals AI(2026-10-01 05:41 JST 取得) ↗
- 一次資料Harvey's Legal Agent Benchmark — Vals AI(2026-10-01 05:41 JST 取得) ↗
この記事の解説動画
YouTubeで見る ↗大きいニュースはYouTubeでも解説しています。Xでは新着記事をお知らせしています。
コメント
まだコメントはありません。最初のコメントを書いてみませんか?
AIについて聞きたいことはありますか?
質問箱で無料で受け付けています。回答は公開され、他の方の参考にもなります。
質問箱を見る →