Kimi K3正式発表──2.8兆パラメータ・世界初のオープン3Tクラス、公式ベンチでOpus 4.8とGPT-5.5をほぼ全種目で上回る
Moonshot AIがKimi K3を正式発表しました。総パラメータ2.8兆・世界初のオープン3Tクラス・コンテキスト1Mトークン・入力$3/出力$15。公式ベンチでは掲載35種目中、GPT-5.5には31勝2分1敗、Opus 4.8には31勝4敗と大半で上回るものの、一部種目(Toolathlon-Verifiedなど)では負け越しもあります。首位のClaude Fable 5とGPT-5.6 Solには個別ベンチで数点差、総合Eloでは80点以上の差。モデルの重み・技術レポートは2026年7月27日に公開済みです(本記事は7月17日発表時点の記録)。

目次
2026年7月17日昼・日本時間時点の発表内容を記録した記事です。重み・技術レポートは予告どおり2026年7月27日(日本時間28日未明)に公開されました。詳細は重み公開の記事を参照してください。
Moonshot AIがフラッグシップモデル「Kimi K3」を正式発表しました。総パラメータ2.8兆——同社が「世界初のオープン3Tクラスモデル」と位置づける規模で、公式ベンチマーク掲載35種目のうち、GPT-5.5には31勝2分1敗、Opus 4.8には31勝4敗(敗のうちToolathlon-Verifiedは両モデルに対する敗北、Office QA Pro・HLE-Full・HLE-Full w/toolsはOpus 4.8に対する敗北)と大半で優位に立っていますが、「全種目で勝ちか同点」ではありません。首位のClaude Fable 5・GPT-5.6 Solには個別ベンチで数点差まで迫っています(総合のGDPval-AA v2 Eloでは80〜92点の差)。それでいて価格はFable 5の約3分の1(Fable 5価格は当サイト別記事の料金早見表に基づく数値で、この記事の出典では未確認)。この記事では公式ブログとベンチ図を全数確認した内容を整理します。解説動画(9分)はこちら。
- 2.8兆パラメータのMoE・ネイティブビジョン・コンテキスト1Mトークン。API価格は入力$3/出力$15(キャッシュヒット時入力$0.30)
- 公式ベンチ掲載35種目中、GPT-5.5には31勝2分1敗、Opus 4.8には31勝4敗。負け・同点があるベンチも存在し「全種目で勝ちか同点」ではない。首位はFable 5とGPT-5.6 Solで、個別ベンチは数点差・総合Eloは80〜92点差
- モデルの重み・技術レポートは2026年7月27日に公開済み(重み公開の記事)
スペック早見表
| 項目 | 内容 |
|---|---|
| 総パラメータ | 2.8兆(MoE:896エキスパート中16をアクティブ化、アクティブ率約1.8%) |
| アーキテクチャ | Kimi Delta Attention(KDA)+ Attention Residuals、LatentMoE |
| スケーリング効率 | 前世代K2比 約2.5倍(公式主張) |
| モダリティ | ネイティブビジョン(画像を最初から扱う設計) |
| コンテキスト | 1,048,576トークン |
| 思考モード | 最大(max)がデフォルト。軽量モードは後日追加予定 |
| API価格 | 入力$3.00/出力$15.00/キャッシュヒット入力$0.30(1Mトークンあたり) |
| 提供 | Kimiアプリ・デスクトップ・CLI・API(API・CLIは正式発表前から提供を確認) |
| 重み公開 | 2026年7月27日に公開済み(47ページの技術レポートも同時公開。詳細) |
公式ベンチマーク──どこで勝ち、どこで負けているか
公式ブログ掲載のベンチマーク図を全数確認した結果です。比較条件は全モデル「最大思考モード」(図の注記どおり)。
コーディングは全8種目でOpus 4.8・GPT-5.5に勝利。 DeepSWE、Terminal Bench 2.1、FrontierSWE、Program Bench、SWE Marathon、PostTrain Bench、MLS Bench、内製Kimi Code Bench 2.0の全8種目で、Opus 4.8・GPT-5.5の両方に勝っています。特に長時間開発のSWE MarathonではGPT-5.5の3倍のスコア(42.0対14.0)を付けています。
エージェント系・視覚系は「ほぼ勝ち越し」だが全勝ではない。 掲載されたエージェント系12種目・視覚系12種目・推論系3種目のうち、K3はToolathlon-Verified(K3 73.2)でOpus 4.8(76.2)・GPT-5.5(73.5)の両方に負けています。さらにOpus 4.8にはOffice QA Pro(63.3対63.9)、HLE-Full(43.5対49.8)、HLE-Full w/tools(56.0対57.9)でも負けており、35種目合計でOpus 4.8には31勝4敗です。GPT-5.5に対してはGPQA-Diamond(93.5同点)とZeroBench_main w/python(41.0同点)の2種目が同点で、31勝2分1敗です。「全種目で勝ちか同点」という要約は不正確なため、この記事では実数で表記します。
単独1位の種目も複数。 Program Bench(77.8)、ブラウザ調査のBrowseComp(91.2)、表計算のSpreadsheetBench 2、Automation Benchなど、実務系ベンチで首位です。
一方、GPUカーネル最適化の比較(公式ブログのkernel-arenaデータ)は、K3が一貫してFable 5を上回ったわけではありません。DSAカーネルの時間短縮ではK3が55.1%、Fable 5が57.3%でFable 5がK3をわずかに上回り、96層のAttnResカーネル(15時間の連続反復で283.6msから114.4msに短縮)では公式ブログが「K3とFable 5はほぼ同等の性能」と明記しています。K3が上回ったのは512次元MLAカーネルの生スループット(K3 517.8TFLOPS、次点モデル492.7TFLOPS)とKDA・GPGPU代替ベンダー環境での時間短縮(73.6%、比較対象モデルの数値は非公開)で、いずれも「+59.7%対+57.1%」という数値は公式ブログに存在しません。
首位2モデルにはまだ届かず。 総合系のGDPval-AA v2 Elo(K3: 1668、Fable 5: 1760、GPT-5.6 Sol: 1748)、FrontierSWE(81.2対Fable 86.6)、視覚系のCharXiv・ZerobenchではFable 5が上。Moonshot自身もブログで「総合ではFable 5とGPT-5.6 Solに劣る」「使い勝手には差が残る」と明記しています。
数字の信頼性について。 自社の内製ベンチ(Kimi Code Bench 2.0)でFable 5の勝利(76.9対72.9)をそのまま掲載しており、自社有利の数字だけを選ぶ発表とは一線を画しています。公式ブログ掲載の35種目のうち、比較対象がGPT-5.5とOpus 4.8のみで首位2モデル(Fable 5・GPT-5.6 Sol)のスコアが欠けている種目は見当たりませんでした(唯一の欠損はDeepSearchQAのGPT-5.6 Sol値)。
価格の文脈──コスト当たりでは順位が変わる
入力$3/出力$15はClaude Sonnet 5の現行価格($2/$10)よりやや高く、Claude Fable 5($10/$50)の約3分の1です(AI API料金早見表にK3の行を追記済み。Sonnet 5は2026年9月1日に$3/$15へ値上げ予定と本記事執筆時点で公式に予告されていたが、2026年8月10日付のAnthropic公式リリースノートでこの値上げは撤回され、$2/$10が標準価格になっている)。個別ベンチの性能差が数点で価格が3分の1なら、コスト当たり性能では順位の見え方が逆転します。同じ予算で約3倍の思考を回せるため、長時間動かすエージェント用途ほどこの差は効いてきます(この段落は筆者の解釈です)。
...NVIDIAは1日で約5,890億ドルという史上最大の時価総額損失を記録しました(CNBC報道)。今回の構図はDeepSeekショックと相似形——中国勢のオープンモデル、フロンティア級の性能、首位の3分の1の価格——ですが...7月27日に重みが実際に公開されれば、自前運用・低価格な再提供・蒸留が解禁されます。この比較の詳細は動画の考察章で扱っています。
正式発表前にCLIで見つけた第一報
筆者は発表の半日前、深夜のKimi Code(同社のCLIツール)に「Kimi K3 is now ready」の案内が出ているのを見つけ、公式ドキュメントの料金ページ掲載を確認して第一報を出しました。正式発表よりも先に製品へ降ってくる——このリリースの順序は最近のAIモデルで増えているパターンです。性能の実測(当サイト恒例のマリオベンチ・JTLスコア)は、重みと正式版の条件が揃う7月27日以降に行い、結果は続報として公開します。
公式発表値のみという前提と自己申告表現の但し書き
- ベンチマークの数値はすべてMoonshot公式ブログの掲載値です(第三者検証はこれから)。「ほぼ全種目で上回る」は公式図に掲載された35種目のうち、GPT-5.5には31勝2分1敗、Opus 4.8には31勝4敗という意味で、全種目で勝ちか同点ではありません(2026-08-27修正、詳細は更新履歴参照)
- モデルの重み・技術レポートは2026年7月27日に公開済みです(本記事は7月17日の正式発表時点の記録として残しています。重み公開後の検証は別記事を参照)
- 「2.8兆=世界初のオープン3Tクラス」はMoonshot側の表現です
- 価格は2026年7月17日に公式ドキュメントで確認した時点のものです
- Claude Fable 5の価格($10/$50)は当サイト別記事の料金早見表に基づく数値で、この記事が挙げている5つの出典では確認できていません
- DeepSeekショックとの比較は筆者の考察です
更新履歴
- 2026-08-27: QA修正。「Opus 4.8とGPT-5.5に掲載全種目で勝ちか同点(同点は1種目のみ)」は不正確だったため訂正。公式ブログのベンチ表(35種目)を再集計した結果、Opus 4.8には31勝4敗(Toolathlon-Verified、Office QA Pro、HLE-Full、HLE-Full w/toolsで負け)、GPT-5.5には31勝2分1敗(Toolathlon-Verifiedで負け、GPQA-Diamond・ZeroBench_main w/pythonで同点)。また「GPUカーネル最適化でFable 5を上回る記録(+59.7%対+57.1%、15時間超)」は誤りで、公式ブログのkernel-arenaデータでは、DSAカーネルはFable 5(57.3%短縮)がK3(55.1%短縮)をわずかに上回り、15時間かけたAttnResカーネルは「K3とFable 5はほぼ同等」と明記されていた。59.7%/57.1%という数値は公式ブログのどこにも存在しない。さらに「社内業務ベンチ3種だけは首位2モデル不在」との記述も、実際には該当する種目が見当たらず削除した。
- 2026-07-17 昼: 正式発表版として記事を全面再構成(スペック表・ベンチ詳細・考察を追加)
- 2026-07-17 朝: 正式発表を受けて更新(2.8兆・公式ベンチ・重み公開7/27)。第一報のリーク値2.5Tは公式値2.8Tに訂正
- 2026-07-17 未明: 第一報公開(公式発表前に、公式APIドキュメントへの掲載とKimi Codeでの提供開始を確認して報道)
出典・参照資料
更新・訂正履歴
- 公式ブログのベンチ表(35種目)を再集計し不一致を修正。元の記述は「Opus 4.8とGPT-5.5に掲載全種目で勝ちか同点(同点は1種目のみ)」だったが、実際はOpus 4.8には31勝4敗(Toolathlon-Verified/Office QA Pro/HLE-Full/HLE-Full w-toolsで負け)、GPT-5.5には31勝2分1敗(Toolathlon-Verifiedで負け、GPQA-Diamond/ZeroBench_main w-pythonで同点)。また元の記述「GPUカーネル最適化でFable 5を上回る記録(高速化+59.7%対+57.1%、15時間超の自律作業)」も誤りで、公式ブログのkernel-arenaデータではDSAカーネルはFable 5(57.3%短縮)がK3(55.1%短縮)をわずかに上回り、15時間かけたAttnResカーネルは「K3とFable 5はほぼ同等」と明記されていた。59.7%/57.1%という数値は公式ブログのどこにも見つからなかった。さらに元の記述「社内業務ベンチ3種だけは比較相手がGPT-5.5とOpus 4.8のみ(首位2モデル不在)」も、実際には該当する種目が1つも見当たらなかったため削除した(欠損はDeepSearchQAのGPT-5.6 Sol値のみ)。Claude Fable 5の価格($10/$50)はこの記事の5つの出典では確認できないため、その旨を明記した。
- (承前)2件追加修正。(1) 重み・技術レポートを「未公開・7月27日予定」としていた箇所が4か所(冒頭注記・3行まとめ・スペック表・但し書き)残っていた。自サイトkimi-k3-open-weights-inside記事が2026年7月27日(日本時間28日未明)に重み1.56TB・47ページの技術レポートが実際に公開されたと確認済みのため、「2026年7月27日に公開済み」に訂正し、同記事へのリンクを追加した(excerptも同様に修正)。(2) 「入力$3/出力$15はClaude Sonnet 5の恒久価格(2026年9月以降)と同額」としていたが、2026-08-27にAnthropic公式pricingページをcurlで確認したところ「Sonnet 5, announced at launch as introductory pricing through August 31, 2026, is now the standard price. The previously scheduled increase to $3/$15... will not occur.」と明記されていた。9月の値上げは撤回され$2/$10が標準価格のため、本文を訂正した。
この記事の解説動画
YouTubeで見る ↗AIニュースの解説を動画でも
YouTubeでは注目ニュースの背景を解説し、Xでは新着記事をお知らせしています。
コメント
まだコメントはありません。最初のコメントを書いてみませんか?
AIについて聞きたいことはありますか?
質問箱で無料で受け付けています。回答は公開され、他の方の参考にもなります。
質問箱を見る →新しい記事をメールで受け取る
AIの新しい発表を、出典付きで整理して届けます。