NVIDIAの次世代ラック「Vera Rubin NVL72」がMLPerf Inference v6.1に初登場──Qwen3-VLでGB300 NVL72の最大3.7倍、DeepSeek-R1で最大2.5倍(プレビュー提出)。GB300は4ラック288GPUで99%のスケーリング効率、ソフトウェア改善だけでv6.0比最大1.6倍。エージェント向け指標では30倍という自社測定も
MLCommonsが2026年9月16日に公開したMLPerf Inference v6.1で、NVIDIAは次世代のVera Rubin NVL72をプレビュー区分で初めて提出し、Qwen3-VLで現行のGB300 NVL72に対し最大3.7倍(vLLM+Dynamo)、DeepSeek-R1で最大2.5倍(TensorRT-LLM)のスループットを出した。GB300 NVL72は1ラック72GPUから4ラック288GPUへ広げて99%のスケーリング効率、WAN 2.2の動画生成では単一ノード比9倍。ソフトウェア改善だけでGB300のQwen3-VLがv6.0比最大1.6倍。要因はNVFP4精度、prefillとdecodeを分けた分離サービング、第6世代NVLink。SemiAnalysisのAgentXではGB300比30倍(自社測定)、MLPerfはエージェント向け「MLPerf Endpoints」を追加予定。Jetson AGX ThorはEdge-Agentic(Qwen3.6-27B)に提出、パートナー19社(富士通・Dell・HPEなど)が参加。

2026年9月18日・日本時間時点の情報です。 NVIDIAのブログ(9月16日)を読んだ。MLPerf Inference v6.1(業界団体MLCommonsの推論ベンチマーク)の結果発表に合わせた記事で、次世代ラックの「初めての数字」が載っている。当サイトでVera Rubinに触れたのはSpaceXAIがVera CPUを採用の文脈だけだったので、性能の話として整理する。OpenAIの自社チップJalapeñoの最初の結果と並べて読める。
3行まとめ
- Vera Rubin NVL72の初提出(プレビュー区分)。 最も重い2つのベンチマークで、Qwen3-VLで現行GB300 NVL72の最大3.7倍(オフライン・サーバー・インタラクティブの各シナリオ。vLLM+オープンソースのDynamo)、DeepSeek-R1で最大2.5倍(TensorRT-LLM)のスループット。要因としてNVIDIAは、強化されたTensor CoreとTransformer Engine(prefillとdecodeの両方を加速)、NVFP4精度(重み・注意・KVキャッシュのメモリを削減)、prefillとdecodeを分ける分離サービングと大規模なエキスパート並列、第6世代NVLink/NVLink Switch(市販Ethernet比でパケットレート10倍・遅延3分の1)を挙げる。Nebiusもプレビュー結果を提出。
- GB300 NVL72のスケーリングとソフトウェア改善。 DeepSeek-R1を1ラック72GPU→4ラック288GPUに広げてオフラインで99%のスケーリング効率(ほぼ比例)。WAN 2.2のテキストから動画では720p動画を毎秒0.65本・1本5.7秒で、単一ノード比9倍のスループット・7.5倍低い遅延。ソフトウェアだけでQwen3-VLがv6.0比最大1.6倍(KVキャッシュの低精度化、カーネル融合、より良いカーネル、vLLMとDynamoの分離サービング)。提出後もGPT-OSS-120BとDLRMv3で改善(MLCommons未検証)。
- エージェント向けの指標と裾野。 SemiAnalysisのAgentXでは、Vera Rubin NVL72がGB300 NVL72の30倍(プレビュー・NVIDIAの測定)。MLPerfは今後、多段階のエージェント推論を測るMLPerf Endpointsを追加予定。エッジではJetson AGX Thorが新設のEdge-Agentic(Qwen3.6-27B)に提出。パートナー19社(うち8社が複数ノードのBlackwell NVL72)=ASUS・Azure・Cisco・CoreWeave・Crusoe・Dell・富士通・Giga Computing・HPE・Inventec・Lambda・MiTAC・Nebius・Oracle Cloud・Quanta・Red Hat・ScitiX・Supermicro・Wiwynn。
数字の一覧(NVIDIAの記事の記載)
| 項目 | 値 | 注記 |
|---|---|---|
| Vera Rubin NVL72 vs GB300 NVL72(Qwen3-VL) | 最大3.7倍 | プレビュー。vLLM+Dynamo。MLPerf v6.1 Closed、エントリ6.1-0106/0074 |
| 同(DeepSeek-R1) | 最大2.5倍 | TensorRT-LLM |
| GB300 NVL72のスケーリング効率(DeepSeek-R1、72→288GPU) | 99% | オフライン。エントリ6.1-0073/0074 |
| GB300 NVL72のWAN 2.2(動画) | 毎秒0.65本・1本5.7秒 | 単一ノード比9倍・遅延7.5分の1 |
| GB300のソフト改善(Qwen3-VL、v6.0→v6.1) | 最大1.6倍 | |
| AgentX(SemiAnalysis) | 30倍 | プレビュー・NVIDIA測定。MLPerf外 |
読み方
- 「同じ計算量で何トークン出るか」が売上に直結する、というのが記事の前提で、3.7倍・2.5倍は「1ラックあたりのトークン数と収益」の話として書かれている。当サイトがコンテキスト窓とRAMの式で見たKVキャッシュのメモリが、NVFP4で圧縮される点が性能の一因
- ベンチマークのモデルがDeepSeek-R1とQwen3-VLである点は、中国AIモデルまとめの文脈で見ると、業界標準の推論指標が中国発のオープンウェイトで測られている、ということになる
- 30倍のAgentXはMLPerfの検証を経ていないNVIDIAの測定値で、記事も「プレビューテスト」と書く。MLPerf Endpointsが出てからが比較可能な数字になる
- 国内でGPUを借りる側の動きはNTTドコモビジネスのGPUaaSに
筆者が確かめた点
この記事の下調べで、筆者は9月18日にNVIDIAのブログを取得し、倍率・スケーリング効率・エントリ番号・パートナー19社の記述がその原文にあることを確認した。MLCommonsの結果表そのもの(mlcommons.org)は本記事では参照しておらず、他社(AMD・Google TPUなど)の提出との比較は書いていない。
書かれていないこと
- 他社の提出結果と、Vera Rubin NVL72の絶対値(トークン/秒)
- Vera Rubin NVL72の出荷時期と価格
- AgentXの測定条件
出典はNVIDIAのブログ
- NVIDIA「NVIDIA Vera Rubin NVL72 Delivers Leading Performance in MLPerf Inference v6.1 Debut」(2026年9月16日)
- 本記事はMLCommonsの結果表や他社の比較を確認したら追記する
関連記事
出典・参照資料
AIニュースの解説を動画でも
YouTubeでは注目ニュースの背景を解説し、Xでは新着記事をお知らせしています。
コメント
まだコメントはありません。最初のコメントを書いてみませんか?
AIについて聞きたいことはありますか?
質問箱で無料で受け付けています。回答は公開され、他の方の参考にもなります。
質問箱を見る →新しい記事をメールで受け取る
AIの新しい発表を、出典付きで整理して届けます。