2026年8月3日 月曜日
AI時短ラボ
モデル· 約13

Alibabaが最上位「Qwen3.8-Max」を発表──2.4兆パラメータの重みを来週公開。ベンチ86行を全部数えた

AlibabaのQwenチームが最上位モデルQwen3.8-Maxを正式発表。2.4兆パラメータ(アクティブ950億)で、Max級では初めて重みを来週公開すると予告した。公式ベンチ表86行を全行集計すると、言語・エージェント系はClaude Fable 5が14行で首位最多、マルチモーダルはQwen3.8-Maxが27行で圧勝という棲み分けが出た。第三者のArenaリーダーボードではフロントエンドコード部門4位。

Alibabaが最上位「Qwen3.8-Max」を発表──2.4兆パラメータの重みを来週公開。ベンチ86行を全部数えた
執筆・編集:
目次

2026年8月3日時点の情報です。

AlibabaのQwenチームが、同社最上位のAIモデルQwen3.8-Maxを正式発表しました。規模は2.4兆パラメータ(応答時に動くのは950億)。発表と同時に2枚・計86行のベンチマーク表を公表し、さらにMax級モデルとしては初めて、重み(モデル本体のファイル)を来週無償公開すると予告しています。

動画版はこちら(12分58秒)。読みにくい公式ベンチ表86行を全行図解に組み直し、デモ5本と使い方まで通しで解説しています。この記事では数字と一次ソースを整理します。

  • Qwen3.8-Maxは2.4兆パラメータ(アクティブ950億)。重みは来週Hugging FaceとModelScopeで公開予定(Max級では史上初)
  • 公式ベンチ86行を当ラボが全行集計: 言語・エージェント系(表1)はClaude Fable 5が14行で首位最多、マルチモーダル(表2)はQwen3.8-Maxが27行で圧勝
  • Qwen公表値ではGPT-5.6 Solに勝つ行が多数(SWE-bench Pro、PaperBench、IFBench等)。一方でHLEやDeepSWEでは届かず
  • 第三者のArena AIリーダーボード(フロントエンドコード部門)で1668点の世界4位。3位のClaude Opus 5 (High)と1点差
  • 数値はすべてQwenの自己申告。第三者の独立検証は重み公開後から

何が発表されたか

項目 内容
モデル名 Qwen3.8-Max(Qwenファミリー最上位)
規模 2.4兆パラメータ(アクティブ950億)
基盤 Qwen3.5のアーキテクチャ
提供 QwenCloudのAPIで提供中(OpenAI互換+Anthropic互換)
重み公開 来週、Hugging Face / ModelScopeで公開予定
コンテキスト 100万トークン(公式接続設定例の値)
推論制御 reasoning_effortを3段階でサポート(既定はxhigh)

用語について1点。今回公開が予告されたのは重みファイルのみで、学習データや訓練コードは含まれません。したがって本記事では「オープンソース化」ではなく**「オープンウェイト(重み公開)」**と表記します(Qwenブログ自体は "open-source the weights" という表現を使っています)。

ベンチ表1──言語・エージェント系はFable 5がまだ最多首位

公式ブログのベンチ表は2枚あります。表1はコーディング・エージェント実務・一般能力の31行、表2はマルチモーダルの55行。比較対象はClaude Opus 4.8 / Claude Fable 5 / GPT-5.6 Sol / 前世代Qwenです(表2はGemini3.1-Pro入りの6モデル)。

公式ベンチ表の組み直し(コーディング前半)。出典: Qwen公式ブログ(2026年8月)・数値は全てQwen自己申告

Qwen公表値で目立つ行を挙げると:

  • PaperBench(AI論文のコード再現): 93.0で全モデル中首位(Fable 5=88.8、GPT-5.6 Sol=90.5)
  • SWE-bench Pro: 67.7でGPT-5.6 Sol(64.6)に勝ち。ただし首位はFable 5の80.0
  • IFBench(指示への忠実さ): 82.8で首位。Fable 5(63.5)に19ポイント差
  • WideSearch: 81.9で首位
  • 一方、HLE(道具あり)は56.2でFable 5の64.5に届かず。DeepSWE 1.1は56.6でGPT-5.6 Sol(73.0)に届かず

興味深いのは、Qwen自身が作った社内ベンチ4本(QwenSWEBench等)で、4本ともFable 5やGPT-5.6 Solに首位を譲ったまま表を公開していることです。自社の土俵での負けを載せた発表資料は珍しい部類です。

ベンチ表2──マルチモーダルはQwen3.8-Maxの圧勝

当ラボで86行を全行集計した結果がこちらです(単純比較できる数値行のみ対象。スラッシュ併記・未公表の行は除外、同点は両者に加算、Qwen社内ベンチを含む)。

86行の行内首位集計。表1はFable5が14行、表2はQwen3.8-Maxが27行。集計: AI時短ラボ(Qwen公式表より)

  • 表1(24行): Fable 5が14行、GPT-5.6 Solが7行、Qwen3.8-Maxが5行
  • 表2(39行): Qwen3.8-Maxが27行、Fable 5が6行、GPT-5.6 Solが5行、Gemini3.1-Proが1行

言語・エージェント系の首位争いはまだClaude、「目」の領域はQwenという棲み分けです。個別では、PC操作のOSWorld-Verifiedが86.1でFable 5(85.0)を上回り首位を取った一方、スマホ操作のAndroidWorld(Fable 5=88.8 > 85.3)や画面クリック精度のScreenSpot Pro(Fable 5=87.3 > 84.5)では届いていません。

筆者は発表当日にこの86行を1行ずつ表計算に落として検算しました。PRBench-Legalで3モデルが57.6で並ぶ三つ巴の同点や、Qwenが社内ベンチでも負けている行のような細部は、要約だけ読むと消えてしまう類の情報です。

デモ5本──ベンチより「長期自走」を売りにしている

Qwen発表によると、ベンチとは別に自律実行のデモが5本示されています(いずれもQwen自己申告。GitHub履歴の公開など検証可能な形式のものを含む)。

デモ 数字
16日間の完全自律開発 265コミット・127PR・151イシュー(履歴はGitHubで公開と記載)
AI研究論文の再現と改良 125時間自走・コード7600行・GPU訓練33回。論文手法を**+2.7ポイント**上回る改良に到達
人間との実コンペ対決 24時間制限・45回提出で精度0.60→0.853。人間526チーム中458チームを抜き上位13%
半導体(暗号チップ)設計 約500ターンの自走で8,298ゲート→678ゲート(約12分の1)。物理レイアウトまで通過
1年間のEC経営シミュレーション 元手10万元→41万6,252元(4.16倍)で参加モデル中1位。2位GLM-5.2を38%上回る

共通するのは、数百〜数千ターンの長丁場で品質が崩れない「長期自走」を前面に出していることです。

第三者データ──Arenaで世界4位、上位8つのうち4つが中国勢

ここまでの数字はすべてQwenの自己申告です。数少ない第三者データとして、Arena AIのリーダーボード(フロントエンドコード部門)を見ると:

Arena AI Leaderboard(Frontend Code部門・2026年8月3日取得)。出典: arena.ai/leaderboard/code

  • Qwen3.8-Maxは1668点で4位。3位のClaude Opus 5 (High)=1669とわずか1点差
  • Claude Fable 5 (High)=1630、GPT-5.6 Sol (xHigh)=1620より上
  • 上位8つのうち4つが中国勢(2位Kimi K3、4位Qwen3.8-Max、7位GLM-5.2、8位DeepSeek-V4 Flash)

2位のKimi K3(Moonshot AI)は2026年7月に重みを公開済みで、そこに来週Qwen3.8-Maxが続く構図です。フロンティア数ポイント差の水準のモデルが、続けて「配られる側」に回っています。なおこの順位はフロントエンドコードという1部門のもので、総合力の順位ではありません。

言語モデル以外でも同じ動きがあります。本記事公開日の8月3日時点で、MiniMaxが動画・音声生成モデルMiniMax-H3(330億パラメータ・アクティブ約200億。最大2K解像度・15秒のステレオ音声付き動画を生成)の重みをHugging Faceで公開しています(ライセンスはMiniMax H3 Community License)。生成系まで含めて、中国勢のオープン化が同じ週に重なりました。

この数字をどう読むか(注意点)

  • すべてQwenの自己申告です。重み公開前のため、第三者による独立検証はまだ存在しません
  • 比較モデルの一部スコアは、条件の異なる他社公表値・公式リーダーボードからの転記であると原文脚注に明記されています(厳密な同一条件比較ではありません)
  • 表にはQwen社内ベンチが8本含まれます
  • 脚注には「Fable 5の結果はフォールバックを含む可能性がある(Fable5 results may involve fallbacks)」との注記がありますが、詳細条件は書かれていません
  • 一方で、コーディング系の多くをClaude Code(Anthropicの開発ツール)をハーネスとして測定したと脚注に明記するなど、負けている行も含めて測定条件を開示する姿勢は確認できます

使い方──Claude Codeの中身をQwen3.8-Maxにする公式手順まで

QwenCloudのAPIはOpenAI互換に加えてAnthropic互換があり、公式ブログにはClaude Code・Codex・OpenClaw等への接続手順が載っています。Claude Codeの場合は環境変数3つ(ANTHROPIC_MODEL / ANTHROPIC_BASE_URL / ANTHROPIC_AUTH_TOKEN)の変更だけで中身がQwen3.8-Maxになります。試す場合は、普段の設定ファイルを書き換えず、別ディレクトリで環境変数付きで起動することをおすすめします。

なお、重みが公開されても2.4兆パラメータを個人環境で動かすのは現実的ではありません(4ビット圧縮でも単純計算で1.2TB級のメモリが必要)。個人にとっての意味は、検証・蒸留などの研究利用と、クラウド経由での利用が広がることになります。

出典・但し書き

  • Qwen公式ブログ「Qwen3.8: A New Bar for Coding and Cowork」(2026年8月)
  • Arena AI Leaderboard (Frontend Code)(2026年8月3日取得。リーダーボードは変動します)
  • ベンチ数値はすべてQwen(Alibaba)の自己申告値です
  • 「86行の首位数」集計は当ラボによるものです(単純数値行のみ対象・同点は両者に加算・社内ベンチ含む)
  • 「4ビット圧縮で1.2TB級」はパラメータ数からの単純計算で、実運用にはさらにメモリが必要です
  • EC経営シミュレーションの金額は人民元です
  • 本記事は続報があり次第更新します(来週予定の重み公開後、ライセンス条件と第三者検証の状況を追記予定)

感想・指摘は動画のコメント欄へ。重み公開後の手元検証に反映します。

シェア: ポスト はてブ

出典・参照資料

YouTubeで見る ↗

AIニュースの解説を動画でも

YouTubeでは注目ニュースの背景を解説し、Xでは新着記事をお知らせしています。

コメント

まだコメントはありません。最初のコメントを書いてみませんか?

AIについて聞きたいことはありますか?

質問箱で無料で受け付けています。回答は公開され、他の方の参考にもなります。

質問箱を見る →

関連記事