AI時短ラボ
業界· 約8分

NVIDIAの次世代ラック「Vera Rubin NVL72」がMLPerf Inference v6.1に初登場──Qwen3-VLでGB300 NVL72の最大3.7倍、DeepSeek-R1で最大2.5倍(プレビュー提出)。GB300は4ラック288GPUで99%のスケーリング効率、ソフトウェア改善だけでv6.0比最大1.6倍。エージェント向け指標では30倍という自社測定も

MLCommonsが2026年9月16日に公開したMLPerf Inference v6.1で、NVIDIAは次世代のVera Rubin NVL72をプレビュー区分で初めて提出し、Qwen3-VLで現行のGB300 NVL72に対し最大3.7倍(vLLM+Dynamo)、DeepSeek-R1で最大2.5倍(TensorRT-LLM)のスループットを出した。GB300 NVL72は1ラック72GPUから4ラック288GPUへ広げて99%のスケーリング効率、WAN 2.2の動画生成では単一ノード比9倍。ソフトウェア改善だけでGB300のQwen3-VLがv6.0比最大1.6倍。要因はNVFP4精度、prefillとdecodeを分けた分離サービング、第6世代NVLink。SemiAnalysisのAgentXではGB300比30倍(自社測定)、MLPerfはエージェント向け「MLPerf Endpoints」を追加予定。Jetson AGX ThorはEdge-Agentic(Qwen3.6-27B)に提出、パートナー19社(富士通・Dell・HPEなど)が参加。

NVIDIAの次世代ラック「Vera Rubin NVL72」がMLPerf Inference v6.1に初登場──Qwen3-VLでGB300 NVL72の最大3.7倍、DeepSeek-R1で最大2.5倍(プレビュー提出)。GB300は4ラック288GPUで99%のスケーリング効率、ソフトウェア改善だけでv6.0比最大1.6倍。エージェント向け指標では30倍という自社測定も
執筆・編集:
目次

2026年9月18日・日本時間時点の情報です。 NVIDIAのブログ(9月16日)を読んだ。MLPerf Inference v6.1(業界団体MLCommonsの推論ベンチマーク)の結果発表に合わせた記事で、次世代ラックの「初めての数字」が載っている。当サイトでVera Rubinに触れたのはSpaceXAIがVera CPUを採用の文脈だけだったので、性能の話として整理する。OpenAIの自社チップJalapeñoの最初の結果と並べて読める。

3行まとめ

  1. Vera Rubin NVL72の初提出(プレビュー区分)。 最も重い2つのベンチマークで、Qwen3-VLで現行GB300 NVL72の最大3.7倍(オフライン・サーバー・インタラクティブの各シナリオ。vLLM+オープンソースのDynamo)、DeepSeek-R1で最大2.5倍(TensorRT-LLM)のスループット。要因としてNVIDIAは、強化されたTensor CoreとTransformer Engine(prefillとdecodeの両方を加速)、NVFP4精度(重み・注意・KVキャッシュのメモリを削減)、prefillとdecodeを分ける分離サービングと大規模なエキスパート並列、第6世代NVLink/NVLink Switch(市販Ethernet比でパケットレート10倍・遅延3分の1)を挙げる。Nebiusもプレビュー結果を提出。
  2. GB300 NVL72のスケーリングとソフトウェア改善。 DeepSeek-R1を1ラック72GPU→4ラック288GPUに広げてオフラインで99%のスケーリング効率(ほぼ比例)。WAN 2.2のテキストから動画では720p動画を毎秒0.65本・1本5.7秒で、単一ノード比9倍のスループット・7.5倍低い遅延。ソフトウェアだけでQwen3-VLがv6.0比最大1.6倍(KVキャッシュの低精度化、カーネル融合、より良いカーネル、vLLMとDynamoの分離サービング)。提出後もGPT-OSS-120BとDLRMv3で改善(MLCommons未検証)。
  3. エージェント向けの指標と裾野。 SemiAnalysisのAgentXでは、Vera Rubin NVL72がGB300 NVL72の30倍(プレビュー・NVIDIAの測定)。MLPerfは今後、多段階のエージェント推論を測るMLPerf Endpointsを追加予定。エッジではJetson AGX Thorが新設のEdge-Agentic(Qwen3.6-27B)に提出。パートナー19社(うち8社が複数ノードのBlackwell NVL72)=ASUS・Azure・Cisco・CoreWeave・Crusoe・Dell・富士通・Giga Computing・HPE・Inventec・Lambda・MiTAC・Nebius・Oracle Cloud・Quanta・Red Hat・ScitiX・Supermicro・Wiwynn。

数字の一覧(NVIDIAの記事の記載)

項目 値 注記
Vera Rubin NVL72 vs GB300 NVL72(Qwen3-VL) 最大3.7倍 プレビュー。vLLM+Dynamo。MLPerf v6.1 Closed、エントリ6.1-0106/0074
同(DeepSeek-R1) 最大2.5倍 TensorRT-LLM
GB300 NVL72のスケーリング効率(DeepSeek-R1、72→288GPU) 99% オフライン。エントリ6.1-0073/0074
GB300 NVL72のWAN 2.2(動画) 毎秒0.65本・1本5.7秒 単一ノード比9倍・遅延7.5分の1
GB300のソフト改善(Qwen3-VL、v6.0→v6.1) 最大1.6倍
AgentX(SemiAnalysis) 30倍 プレビュー・NVIDIA測定。MLPerf外

読み方

  • 「同じ計算量で何トークン出るか」が売上に直結する、というのが記事の前提で、3.7倍・2.5倍は「1ラックあたりのトークン数と収益」の話として書かれている。当サイトがコンテキスト窓とRAMの式で見たKVキャッシュのメモリが、NVFP4で圧縮される点が性能の一因
  • ベンチマークのモデルがDeepSeek-R1とQwen3-VLである点は、中国AIモデルまとめの文脈で見ると、業界標準の推論指標が中国発のオープンウェイトで測られている、ということになる
  • 30倍のAgentXはMLPerfの検証を経ていないNVIDIAの測定値で、記事も「プレビューテスト」と書く。MLPerf Endpointsが出てからが比較可能な数字になる
  • 国内でGPUを借りる側の動きはNTTドコモビジネスのGPUaaSに

筆者が確かめた点

この記事の下調べで、筆者は9月18日にNVIDIAのブログを取得し、倍率・スケーリング効率・エントリ番号・パートナー19社の記述がその原文にあることを確認した。MLCommonsの結果表そのもの(mlcommons.org)は本記事では参照しておらず、他社(AMD・Google TPUなど)の提出との比較は書いていない。

書かれていないこと

  • 他社の提出結果と、Vera Rubin NVL72の絶対値(トークン/秒)
  • Vera Rubin NVL72の出荷時期と価格
  • AgentXの測定条件

出典はNVIDIAのブログ

  • NVIDIA「NVIDIA Vera Rubin NVL72 Delivers Leading Performance in MLPerf Inference v6.1 Debut」(2026年9月16日)
  • 本記事はMLCommonsの結果表や他社の比較を確認したら追記する

関連記事

シェア: ポスト はてブ

出典・参照資料

AIニュースの解説を動画でも

YouTubeでは注目ニュースの背景を解説し、Xでは新着記事をお知らせしています。

コメント

まだコメントはありません。最初のコメントを書いてみませんか?

AIについて聞きたいことはありますか?

質問箱で無料で受け付けています。回答は公開され、他の方の参考にもなります。

質問箱を見る →

新しい記事をメールで受け取る

AIの新しい発表を、出典付きで整理して届けます。

関連記事

SpaceXAIがNVIDIA Vera CPUを採用──「Vera Rubin NVL72を宇宙に上げる」計画は今どの段階かの記事画像
プロダクト09.04読了12分

SpaceXAIがNVIDIA Vera CPUを採用──「Vera Rubin NVL72を宇宙に上げる」計画は今どの段階か

出典 ─ NVIDIA Newsroom
OpenAI自社チップJalapeño、初の実測値公開──NVIDIA最上位比ワット効率1.5〜1.9倍の記事画像
業界08.26読了10分

OpenAI自社チップJalapeño、初の実測値公開──NVIDIA最上位比ワット効率1.5〜1.9倍

出典 ─ Jalapeño's first resul
中国AIモデルまとめ【2026年9月版】──DeepSeek・Qwen・Kimi・GLM・MiniMax・Tencentの現行モデル、API価格、重みの公開状況(Hugging Faceで確認)、ライセンスの条件、データの保存先。覆面モデル(Ox/Union Alpha)の正体までの記事画像
モデル09.24読了17分

中国AIモデルまとめ【2026年9月版】──DeepSeek・Qwen・Kimi・GLM・MiniMax・Tencentの現行モデル、API価格、重みの公開状況(Hugging Faceで確認)、ライセンスの条件、データの保存先。覆面モデル(Ox/Union Alpha)の正体まで

出典 ─ Hugging Face Models AP
Macで動くモデルサイズの計算式──「コンテキスト窓が広い」の裏でVRAMが消えていく仕組みの記事画像
活用09.03読了14分

Macで動くモデルサイズの計算式──「コンテキスト窓が広い」の裏でVRAMが消えていく仕組み

出典 ─ The Hidden Memory Cost
NTTドコモビジネスが「1GPUから」のGPUクラウド「GPUaaS」を9月30日に開始──閉域網と国内クラウドで「AI処理からデータ保管まで国内完結」のソブリンAI。同じ日、NTTデータ系のフォーティエンスは消費財向け「AI駆動型需要予測FDEサービス」(19種の予測モデルをSKUごとに自動選択、現場がバイブコーディングで改善)の記事画像
業界09.24読了7分

NTTドコモビジネスが「1GPUから」のGPUクラウド「GPUaaS」を9月30日に開始──閉域網と国内クラウドで「AI処理からデータ保管まで国内完結」のソブリンAI。同じ日、NTTデータ系のフォーティエンスは消費財向け「AI駆動型需要予測FDEサービス」(19種の予測モデルをSKUごとに自動選択、現場がバイブコーディングで改善)

出典 ─ NTTドコモビジネス(2026年9月17日・9月18日取得)
Emerald AI・Google・NVIDIAが「AI Energy Management Alliance(AEMA)」を設立──AIデータセンターを「電力を柔軟に減らせる資源」として電力網につなぐ。負荷の移動・蓄電・併設発電で系統の逼迫に応じ、接続前にライドスルー・抑制・緊急応答の義務を定め、検証可能な柔軟性を約束した事業者には速い接続経路をの記事画像
業界09.25読了6分

Emerald AI・Google・NVIDIAが「AI Energy Management Alliance(AEMA)」を設立──AIデータセンターを「電力を柔軟に減らせる資源」として電力網につなぐ。負荷の移動・蓄電・併設発電で系統の逼迫に応じ、接続前にライドスルー・抑制・緊急応答の義務を定め、検証可能な柔軟性を約束した事業者には速い接続経路を

出典 ─ NVIDIA Blog(Josh Parker・2026年9月16日・9月18日取得)
NVIDIAが「商用規模で走る主要ロボタクシーはすべて自社スタックの上」と書いた──訓練(DGX+Alpamayo)・シミュレーション(Omniverse/Cosmos)・車載(Hyperion=Thor×2、カメラ14・レーダー9・ライダー3)の3台構成。日本はTIER IV・いすゞのレベル4バス、日産×Wayve×Uber。Uberは2028年に28都市の記事画像
業界09.24読了7分

NVIDIAが「商用規模で走る主要ロボタクシーはすべて自社スタックの上」と書いた──訓練(DGX+Alpamayo)・シミュレーション(Omniverse/Cosmos)・車載(Hyperion=Thor×2、カメラ14・レーダー9・ライダー3)の3台構成。日本はTIER IV・いすゞのレベル4バス、日産×Wayve×Uber。Uberは2028年に28都市

出典 ─ NVIDIA Blog(Ali Kani・2026年9月10日・9月18日取得)
月刊AIニュース 2026年8月号の動画サムネイル
業界09.18読了23分

2026年8月のAIニュース46本まとめ──中国勢の激安高性能モデルが月末に集中、米2社は主力モデルなし、OpenAIがCursorを切った月【月刊AIニュース】

出典 ─ Z.ai: GLM-5.3-Flash(20