AI時短ラボ
検索

Mistral Large 4が登場、米国・欧州製のオープンウェイトで首位公式グラフでは法務とサイバーで中国勢を上回り、コーディングと金融ではGLM-5.3やKimi K3が上

執筆:約21分で読めます実機で検証

フランスのMistral AIが2026年10月6日、総パラメータ約1兆・1回に動くのは490億のMistral Large 4を発表した。公式グラフでは法務(15.8)とサイバー(CyberGym-E2E 82)で比べた全モデルを上回った一方、Terminal-Bench 4.0ではGLM-5.3の41.9に対し28.3だった。Artificial Analysisの知能指数は38で、重みが公開されたモデルでは中国の7モデルが上、中国以外では首位。

Mistralのロゴと「#1 in Sovereign AI.」の文字、オレンジから赤の帯の上にドット絵の黒猫
画像:画像: Mistral AI(公式ブログのOG画像)
目次

2026年10月6日夜(日本時間)時点の情報です。フランスのMistral AI(ミストラル・エーアイ)が、新しい旗艦モデルMistral Large 4を発表した。公式のあだ名はLe Chonk(ル・チョンク)。総パラメータは約1兆、1回に動くのは490億で、今日使えるのはプレビュー版のAPIだけ、重みは「今月末」に公開するという。Mistralは公式Xで、米国と欧州のオープンウェイトの中で一番だと書いた。では、重みを先に出している中国のモデルと比べるとどうなのか。公式ブログのグラフを全部読み、外部の測定と並べた結果を解説動画にまとめた。この記事はその数字と出どころを並べたものだ。

3行まとめ

  1. Mistral Large 4は総パラメータ約1兆(公式ドキュメントでは1.05兆)、1回に動くのは490億。定価は100万トークンあたり入力1.36ドル・出力4.18ドルで、公式ドキュメントでは今その半額が表示されている。重みは今月末に公開予定で、ライセンスは未発表。
  2. 公式グラフでは、法務のHarveyのベンチ(15.8)と、脆弱性を再現して直すCyberGym-E2E(82)で比べた全モデルを上回った。一方、Terminal-Bench 4.0はGLM-5.3の41.9に対して28.3、DeepSWE 1.1はKimi K3の68に対して62だった。
  3. Artificial Analysisの知能指数は38(225モデル中64位)。重みが公開されたモデルと並べると、上にいる7つは全部中国のモデルで、中国以外ではMistral Large 4が一番上になる。約2.4兆のQwen3.8との差は1.5点だった。
項目 Mistral Large 4(2026-10-06時点)
総パラメータ/1回に動く量 約1兆(公式ドキュメントでは1.05兆)/490億(MoE)
入力・出力 入力は文章と画像、出力は文章。指示に答えるモードと推論を1つのモデルで切り替える
扱える長さ 公式ドキュメントは100万トークン。Artificial Analysisは52万4,288、Vals AIは51万2千と表示
価格(100万トークンあたり) 定価 入力1.36ドル/キャッシュ入力0.14ドル/出力4.18ドル。表示価格はその半額(0.68/0.07/2.09ドル)
使える範囲 プレビュー版のAPI(Mistral Studio)
重み・ライセンス 重みは今月末に公開予定(報道では10月27日)。ライセンスは未発表
学習 欧州にある自社データセンターで、NVIDIAのGrace Blackwell 3,800基を使いゼロから学習(公式ブログ)

1兆パラメータ・動くのは490億、重みはまだ出ていない

公式ブログの書き出しはこうだ。

"ML4 is a 1 trillion-parameter natively multimodal model with 49 billion active parameters."

(ML4は、総パラメータ1兆、アクティブパラメータ490億の、ネイティブなマルチモーダルモデルだ)

公式ドキュメントでは、総パラメータは1.05兆、画像を読む部分(視覚エンコーダー)は16億と書かれている。1兆というのは、今のオープンウェイトの中で大きい方ではない。7月に重みが出たKimi K3はHugging Faceの表示で約2.78兆、Qwen3.8の大型版は約2.4兆ある。1回に動く量も、Artificial Analysisの表示ではKimi K3の1,040億に対してMistral Large 4は490億だ。

重みの公開についてブログは、こう書いている。

"We will release the weights by the end of the month."

(重みは今月末までに公開する)

報道ではEuronewsとThe Next Webが「10月27日」と書いているが、公式ブログに日付は無い。ライセンスもまだ発表されていない。前の世代のMistral Large 3は、公式発表で「All models are released under the Apache 2.0 license」(すべてのモデルをApache 2.0ライセンスで公開する)としていた。

学習は、欧州にある自社のデータセンターで、NVIDIAのGrace Blackwell 3,800基を使ってゼロから行ったと書かれている。CNBCとEuronewsは「約4,000基・約2か月」と報じている。学習データには160以上の言語が入り、EUの公用語はすべて含まれるという。重みの公開までの間は、サイバーセキュリティの企業や国の機関などに、制限を弱めてサイバー能力を広げた版を渡して試してもらっている、とも書いている。

もう1つ、ブログは今の数字が途中経過だと明言している。

"The reinforcement learning run behind this preview is still in flight, and the model is showing no signs of saturation"

(このプレビューの元になっている強化学習はまだ走っていて、モデルに頭打ちの兆しは見えていない)

定価はGLM-5.3やDeepSeek V4 Proとほぼ同じ

Artificial Analysisに載っている各社の定価と並べると、Mistral Large 4は中国の主要モデルとほぼ同じ水準にある。

モデル 入力(100万トークン) 出力(100万トークン)
Mistral Large 4 1.36ドル 4.18ドル
GLM-5.3 1.40ドル 4.40ドル
DeepSeek V4 Pro 1.32ドル 3.96ドル
Kimi K3 3ドル 15ドル
Claude Opus 5.5 4ドル 20ドル

公式ドキュメントでは、この定価に取り消し線が引かれ、半額の入力0.68ドル・出力2.09ドルが表示されていた(10月6日確認)。半額がいつまで続くかは、今回見たページには書かれていなかった。

公式グラフで中国勢が上だった項目

公式ブログには、ベンチマークのグラフが20枚以上載っている。比べている相手は、GLM-5.3、Kimi K3、DeepSeek V4 Pro、Qwen3.8など中国のモデルが中心だ。そのうちコーディングと金融では、Mistral Large 4より上にいる中国のモデルがグラフに出ている。

ベンチマーク(測定元) Mistral Large 4 上にいたモデル
DeepSWE 1.1(Artificial Analysis) 62 Kimi K3 68
Terminal-Bench 4.0(Artificial Analysis) 28.3 GLM-5.3 41.9
SWE-Atlas-QnA 59 DeepSeek V4 Pro 66/Kimi K3 62/Qwen3.8 Max 62
AutomationBench(Artificial Analysis) 59.9 GLM-5.3 62.2
Finance Agent v2(Vals AI) 54.7 GLM-5.3 55.8
FinWorkBench 67.4 Kimi K3 77.3
GDP.pdf(Artificial Analysis) 18.6 Kimi K3 22

コーディングについて公式ブログは、3つのベンチを合わせた指数を49.8%とし、「places it ahead of DeepSeek V4 Pro 0813 and Qwen3.8 Max」(DeepSeek V4 Pro 0813とQwen3.8 Maxより上)と書いている。名前が挙がっているのはこの2つだけだ。CNBCも、コーディングなどの分野ではまだ最先端に遅れていると書いた。

法務・サイバー・画像の位置当てでは全モデルの上

一方で、比べた全モデルを上回った項目もある。

ベンチマーク(測定元) Mistral Large 4 次点
Harveyの法務ベンチ(Vals AI) 15.8 Kimi K3 12.9(GPT-6 Astraは5.4)
CyberGym-E2E(Artificial Analysis) 82 MiMo-V2.6 Pro 79
Cybench 93 Kimi K3 90
Dense200(物が密集した写真で位置を当てる) 42.0 GPT-6 Astra 41.5(Kimi K3は28.9)

法務とDense200で下回ったKimi K3は、総パラメータが約2.8兆ある。ただしDense200のGPT-6 Astraとの差は0.5ポイントだ。サイバーの総合指数(Artificial Analysis Cyber Index)では、Mistral Large 4とGLM-5.3-Flashがどちらも50で並んでいる。

「Opus 5.5とGPT-6 Astraはほぼ0点」が意味するもの

サイバーの節で、公式ブログはアメリカの閉じたモデルについてこう書いている。

"Several leading closed models, including Claude Opus 5.5 and GPT-6 Astra, score near zero on the same test because they refuse to perform the task."

(Claude Opus 5.5やGPT-6 Astraを含むいくつかの主要な閉じたモデルは、同じテストでほぼ0点になる。作業を断るからだ)

「同じテスト」は、オープンソースのソフトの実際の脆弱性を再現してから直す課題で、Mistral Large 4はここで82%を取った。同じブログに載っているArtificial Analysis Cyber Indexのグラフでは、成功した数と、安全のために止めた数が分けて描かれている。Opus 5.5は成功25・止めたのが36、GPT-6 Astraは成功33・止めたのが38、Mistral Large 4は成功50だった。点が低い理由が「できない」ではなく「断る」だ、というのがMistralの説明になる。

共同創業者でチーフサイエンティストのギヨーム・ランプル氏は、CNBCにこう話している。

"the cyber defense capabilities will enable enterprises and governments to defend themselves against threat actors that are jailbreaking closed models to perform cyber attacks"

(このサイバー防御の能力によって、企業や政府は、閉じたモデルを脱獄させてサイバー攻撃に使う相手から身を守れるようになる)

同じブログには、有害なサイバーの依頼を断った割合(JailbreakBench・StrongREJECT・AgentHarmの平均)も載っていて、Mistral Large 4は95.3%だった。比べたKimi K3(93.7%)、GLM-5.3(87%)、DeepSeek V4 Pro(77.7%)より高い。

外部の知能指数は38、上の7つは全部中国製

Mistralの発表とは別に、Artificial Analysisがすでにプレビュー版を測っている。知能指数は38(38.37)で、225モデル中64位だった。閉じたモデルの上位は、Claude Opus 5.5が57.6、GPT-6 Astraが52.7、Gemini 4 Argonが52.6で、20点近い差がある。

同じページに載っている各モデルのうち、重みが公開されているものだけを抜き出して並べ直した(各モデルの最も高い設定の値)。

モデル 開発元の国 知能指数
MiMo-V2.6 Pro 中国 46.3
GLM-5.3 中国 44.8
Kimi K3 中国 43.6
GLM-5.3 Flash 中国 41.8
Qwen3.8 2.4T 中国 39.9
Qwen3.8 Flash Next 中国 39.8
DeepSeek V4.1 Flash 中国 39.5
Mistral Large 4 フランス 38.4
DeepSeek V4 Pro 中国 36.0
Motif 3 韓国 33.6
Nemotron 3 Ultra 米国 22.9

公式Xの「the best open weights model from US or Europe on aggregated benchmarks」(総合的なベンチマークで、米国・欧州のオープンウェイトで一番)という言い方は、この表と合っている。ただし、中国のモデルを含めると上に7つある。なお、Artificial Analysisは今のMistral Large 4を「Proprietary model」(独自のモデル)と表示している。重みの公開はこれからだ。

もう1つの測定サイトVals AIでは、総合のVals Indexが48.05%だった。Artificial Analysisは、出力の速さは1秒あたり116.1トークンで平均より速いが、答えがとても長くなりやすい(very verbose)とも書いている。

1兆でこの点数をどう見るか

大きさと知能指数を並べると、見え方が変わる。

モデル 総パラメータ 1回に動く量 知能指数
Mistral Large 4 約1兆 490億 38.4
Kimi K3 約2.8兆 1,040億 43.6
Qwen3.8 2.4T 約2.4兆 950億 39.9
DeepSeek V4 Pro 約1.6兆 490億 36.0
MiMo-V2.6 Pro 約1.02兆 420億 46.3
GLM-5.3 約7,530億 400億 44.8

2倍以上大きいQwen3.8の2.4兆版との差は1.5点で、同じ490億が動く約1.6兆のDeepSeek V4 Proには上回っている。大きい相手に対しては、1兆という大きさの割に点が取れている。一方で、Mistral Large 4より小さいGLM-5.3は44.8、ほぼ同じ大きさのMiMo-V2.6 Proは46.3で、大きさあたりの点数ではこの2つが上だ。

公式ブログの文章とグラフを突き合わせてわかったこと

筆者は動画を作るにあたって、公式ブログのグラフ24枚を1枚ずつ書き起こし、本文の主張と並べた。ほとんどは本文と合っていたが、1か所だけ食い違いがあった。科学のコードを書くSciCode-Verifiedについて、本文は「In benchmarks, ML4 is state of the art on SciCode-Verified among open-weight models.」(ベンチマークでは、ML4はオープンウェイトの中でSciCode-Verifiedの最高水準にある)と書いている。ところが同じページのグラフでは、Mistral Large 4の91.8に対して、重みが公開されているGLM-5.3が92.5、MiMo-V2.6 Proが91.9で、どちらもわずかに上にいた。

もう1つ、筆者がArtificial Analysisのページに埋め込まれているデータから、重みが公開されているモデルだけを抜き出して開発元の国を見たところ、Mistral Large 4より知能指数が上のモデルは7つで、その国コードは全部「cn」だった。動画で「中国以外では首位、中国勢を含めると7つの下」と言っているのは、この抜き出しに基づいている。

この時点で確かめられなかったこと

  • ベンチマークのグラフはMistralが自社のブログに載せたもので、一部はArtificial AnalysisやVals AIの測定と表示されているが、どのベンチを載せるかはMistralが選んでいる。
  • 強化学習は途中で、重みの公開までに数字は変わるとMistral自身が書いている。この記事の数字は10月6日のプレビュー版のものだ。
  • 扱える長さは、公式の100万トークンと、外部2サイトの52万4,288・51万2千が食い違っている。実際にどこまで使えるかは試していない。
  • 重みのライセンスは未発表。「10月27日」という日付は報道によるもので、公式は「今月末」とだけ書いている。
  • 「Opus 5.5とGPT-6 Astraはほぼ0点」はMistralの記述で、そのテストを第三者が追試した結果はまだ見つけていない。
  • Hacker Newsの反応は分かれていて、「中国以外で唯一のオープンウェイトの最先端モデル」という声と、「1年ほど前のモデルの水準」という声の両方があった。

本記事は、重みとライセンスが公開され次第更新します。

出典と数字の取り方

シェア: ポスト はてブ

出典・参照資料

YouTubeで見る ↗
AI時短ラボ

大きいニュースはYouTubeでも解説しています。Xでは新着記事をお知らせしています。

コメント

まだコメントはありません。最初のコメントを書いてみませんか?

AIについて聞きたいことはありますか?

質問箱で無料で受け付けています。回答は公開され、他の方の参考にもなります。

質問箱を見る →

関連記事

XiaomiがMiMo-V2.6を公開──1.02兆パラメータのオープンウェイト、公式掲載のArtificial Analysis指数46、価格はV2.5据え置きの記事画像動画

XiaomiがMiMo-V2.6を公開 1.02兆パラメータのオープンウェイト、公式掲載のArtificial Analysis指数46、価格はV2.5据え置き

モデル
z.aiがGLM-5.3を公開──事後学習だけでTerminal Bench 6倍、サイバー能力が「予想外に」伸びたの記事画像動画

z.aiがGLM-5.3を公開 事後学習だけでTerminal Bench 6倍、サイバー能力が「予想外に」伸びた

モデル
Kimi K3の重みが公開された──1.56TBの中身を開けて、公称スペックを全部数え直したの記事画像動画

Kimi K3の重みが公開された 1.56TBの中身を開けて、公称スペックを全部数え直した

モデル
Mistral AIの資金調達発表(Mistral AI公式の画像)

Mistral AIが30億ユーロを調達、評価額210億ユーロ超 欧州テック史上最大の株式調達をサムスン電子が主導、「主権を保てるオープンウェイトAI」を旗印に20か国・125社超へ

業界
Mistral AI(ミストラル)とは──Le ChatはVibeに改称、無料・Pro月$14.99・Team月$24.99、オープンウェイトのモデルとAPI料金、会話の学習利用まで公式ページで整理【2026年10月】の記事画像

Mistral AI(ミストラル)とは Le ChatはVibeに改称、無料・Pro月$14.99・Team月$24.99、オープンウェイトのモデルとAPI料金、会話の学習利用まで公式ページで整理【2026年10月】

業界
Gemini 4 Argonを発表──公式の比較表19項目のうち13項目で1位、出力の上限は100万トークン、最初に使えるのはサイバー防御の専門家だけの記事画像動画

Gemini 4 Argonを発表 公式の比較表19項目のうち13項目で1位、出力の上限は100万トークン、最初に使えるのはサイバー防御の専門家だけ

モデル
解説動画「【AI減速論はどうなる?】GLM-5.3がMythos Previewに肉薄、Anthropic自身が評価」のサムネイル動画

GLM-5.3がMythos Previewに肉薄とAnthropic自身が評価 米政府機関の評価では米国の最先端から約4か月遅れ、減速論のあと2社は18日で5モデル

業界
オープンウェイトとは何か──「オープンソース」との違いを一次資料で読み解くの記事画像

オープンウェイトとは何か 「オープンソース」との違いを一次資料で読み解く

活用