AI時短ラボ
検索
検証

IBM「Granite 4.2」の作り方初の推論特化の密なモデル3B・8B・30B(Apache 2.0、日本語を含む12言語)。SFTの31.6%がエージェント軌跡(Codex・Gemini CLI等のハーネスで生成)、RLはRLVR→SWE→端末→検索→RLHFの階段で8B・30Bだけ実環境のエージェントRL。30BはSWE-Bench Verified 57.00

執筆:約8分で読めます

IBMのGraniteチームは2026年8月25日、初の密な推論LLM「Granite 4.2」(3B・8B・30B、Apache 2.0)の構築手順を公開した。Granite-4.1のベースモデル(約15兆トークン・文脈512K)から、思考の連鎖・推論・エージェント軌跡でSFTし、多段の強化学習で仕上げる。各モデルに思考/非思考の切替、低effortモード、ネイティブのツール呼び出しがある。SFTデータは約720万サンプルでエージェント31.6%(OpenHands・SWE-agent・Gemini CLI・Hermes・Codex・Gooseなどで生成)と非エージェント68.4%。RLはSFT→RLVR→スキル強化→SWE→端末→検索→RLHFの順に回し、8Bと30Bだけが実環境のエージェントRLを通る。30BはSWE-Bench Verified 57.00・Terminal-Bench 2.1 29.24・τ³-bench 62.00・AIME25 89.17・GPQA 66.41・MMLU-Pro 77.60・RULER 128K 81.38。対応言語は日本語を含む12。

IBM「Granite 4.2」の作り方──初の推論特化の密なモデル3B・8B・30B(Apache 2.0、日本語を含む12言語)。SFTの31.6%がエージェント軌跡(Codex・Gemini CLI等のハーネスで生成)、RLはRLVR→SWE→端末→検索→RLHFの階段で8B・30Bだけ実環境のエージェントRL。30BはSWE-Bench Verified 57.00
目次

2026年9月18日・日本時間時点の情報です。 Hugging FaceのIBMのブログ(8月25日)を読んだ。当サイトはオープンウェイトの整理でGraniteに触れていなかった。Hugging Faceの夏の報告が「IBM Graniteは小型で数億DL」と書いていた、その現行世代の中身。

3行まとめ

  1. 何が出たか。 Granite初の推論特化の密な(MoEでない)デコーダ専用LLMで、3B・8B・30B、Apache 2.0。Granite-4.1のベースモデル(約15兆トークン、5段階の学習で最後に文脈を512Kまで拡張)から、思考の連鎖・推論・エージェント軌跡でSFTし、多段の強化学習で仕上げた。全モデルに思考/非思考の切替、易しい問いに短い推論予算を使う低effortモード、ネイティブのツール呼び出し(vLLM等のOpenAI互換エンドポイントでfunction-calling形式を出し、ハーネスに接着剤なしで刺さる。SGLangも)。構造はGQA(40ヘッド・KV 8)・RoPE θ=1,000万・SwiGLU・RMSNorm・埋め込み非共有・bfloat16で、30Bは64層・MLP 32,768・系列長131,072。対応言語は英・独・西・仏・日・葡・アラビア・チェコ・伊・韓・蘭・中の12。
  2. どう作ったか。 SFTデータは約720万サンプル(約1,000億トークン、学習対象約650億)で、エージェント31.6%(内訳はSWE 69%・ツール呼び出し12.1%・端末8.0%・数学3.5%・検索0.8%・行動0.2%。OpenHands・OpenCode・Terminus-2・SWE-agent・OpenResearcher・MiniSWE・OpenSeeker・EnvScaler・Gemini CLI・Hermes・Codex・Gooseのハーネスで生成)と非エージェント68.4%(指示追従18.8%・コード18.8%・数学14.6%・多言語7.0%・科学5.4%・推論3.0%・安全0.8%)。RLはSFT→RLVR→スキル強化→SWEエージェント→端末→検索→RLHFの階段で、各段は1つの目的と報酬を持つ別の走行、終わると次の段のベースになる(8Bと30Bだけが後半のエージェントRLを通り、3Bは基礎RLと整合のみ)。報酬は検証可能(正解一致・単体テスト・形式)、報酬モデル/LLM判定(品質・選好・安全)、エージェント成果(実環境で本当に解けたか)の3種で、KLは報酬が客観なら0(RLVR・SWE 2)、選好や安全なら0.05。エージェント段は多ターン・実環境(模擬でない)・疎な成果報酬・GRPO。
  3. 数字。 30BでSWE-Bench Verified 57.00・SWE-Bench Pro 33.29・SWE-Bench Multilingual 41.89・Terminal-Bench 2.1 29.24、τ³-bench 62.00・BFCL v4 61.39・ProfBench 42.90、AIME25 89.17・HMMT Feb25 89.17・GPQA 66.41・LiveCodeBench v6 75.77、MMLU-Pro 77.60・Arena-Hard-V2 67.93・IFBench 77.17、RULER 64K 89.96・128K 81.38。8BはSWE-Bench Verified 47.67・AIME25 86.67、3BはAIME25 78.33・GPQA 54.80・MMLU-Pro 67.84。

エージェント軌跡の生成元と数字の限界

  • 「SFTの3割がエージェント軌跡で、その生成に他社のハーネス(Codex・Gemini CLI・Hermes・Goose)を使った」と明記している点が珍しい。ローカルで動く小型モデルにツール操作を教える材料がどこから来るかの一例
  • 30BのSWE-Bench Verified 57.00は、当サイトのSWE-Benchの監査で見たとおりベンチマーク自体に注意点があるが、密な30B・Apache 2.0で日本語対応、という条件ではLM Studio等でのローカル運用の候補に入る
  • 比較対象(他社モデル)の数字は本文の表にない。IBM自身の測定
  • 同じIBMのエージェントの一貫性の隙間は、この種のモデルを評価する側の研究

数値は原文で確認、実行はしていない

この記事の下調べで、筆者は9月18日にHugging FaceのIBMのブログを取得し、3サイズ・Apache 2.0・15兆トークン・512K・構造の数値・SFTの比率とハーネス一覧・RLの段階と報酬の種類・結果表の数字・対応言語がその原文にあることを確認した。GitHubとGranite Docsは開いていない。筆者はGranite 4.2を動かしていない。

比較表・計算量・言語別評価は無し

  • 他社モデルとの比較表
  • 学習に使った計算量とGPU時間
  • 日本語での評価値(MMLU-ProX liteは多言語版で3B 27.78・8B 61.06・30B 66.64だが言語別は不明)

出典はHugging FaceのIBMのブログ

関連記事

シェア: ポスト はてブ

出典・参照資料

AI時短ラボ

大きいニュースはYouTubeでも解説しています。Xでは新着記事をお知らせしています。

コメント

まだコメントはありません。最初のコメントを書いてみませんか?

AIについて聞きたいことはありますか?

質問箱で無料で受け付けています。回答は公開され、他の方の参考にもなります。

質問箱を見る →

関連記事

中国勢・オープンウェイト2026年上半期 ― DeepSeek V4、Qwen 3.6、MetaはLlama休止の記事画像

中国勢・オープンウェイト2026年上半期 ― DeepSeek V4、Qwen 3.6、MetaはLlama休止

業界
Your Agent Aced the Task. Will It Do It Again?(IBM Research・Hugging Faceブログの画像)

AIエージェントは同じ課題を5回やって全部成功するか IBM Researchが「Pass^k」で測ると、平均77.4%のエージェントの全回成功は53.0%。温度0でも起きる24.4ポイントの「一貫性ギャップ」を、自分の記録から作ったガイドラインで半減

研究
Google「autofinetune」──仕様書1枚を書いて寝ると、エージェントが一晩でLoRAのランク・学習率・バッチを探索し、改善したコミットだけGitに残す。TPU v5eでFunctionGemma 270MのSFTを20回、TPU v6eでGemma 3 1BのGRPOを40回回し報酬約10%改善。Tunix+Antigravity CLI+Gemini 3.7 Flashの記事画像

Google「autofinetune」 仕様書1枚を書いて寝ると、エージェントが一晩でLoRAのランク・学習率・バッチを探索し、改善したコミットだけGitに残す。TPU v5eでFunctionGemma 270MのSFTを20回、TPU v6eでGemma 3 1BのGRPOを40回回し報酬約10%改善。Tunix+Antigravity CLI+Gemini 3.7 Flash

検証(発表 9月11日)
LM Studioの使い方と料金【2026年9月版】──無料でローカルLLMを動かす手順(Mac M1〜M4・Windows・Linux、16GB推奨、4bit以上の量子化)、OpenAI互換API・MCP・文書チャット、新アプリ「Bionic」とBionic+ $20/Pro $100のクラウド(Kimi K3・GLM 5.3・DeepSeek V4 Flash、ZDR)の記事画像

LM Studioの使い方と料金【2026年9月版】 無料でローカルLLMを動かす手順(Mac M1〜M4・Windows・Linux、16GB推奨、4bit以上の量子化)、OpenAI互換API・MCP・文書チャット、新アプリ「Bionic」とBionic+ $20/Pro $100のクラウド(Kimi K3・GLM 5.3・DeepSeek V4 Flash、ZDR)

活用
Hugging Face「オープンモデルの現状・2026年夏」──中国ラボの月間最大モデル(754B〜2.78T)がほぼ毎月米国を上回る、米国で最多公開はAMDとNVIDIA、ダウンロード上位25と「いいね」上位25の重なりは1本だけ、Qwenの派生は151,448本で1日180〜210本、Hubを叩くエージェントはClaude Codeが7月44.4%・Codexが20.8%の記事画像

Hugging Face「オープンモデルの現状・2026年夏」 中国ラボの月間最大モデル(754B〜2.78T)がほぼ毎月米国を上回る、米国で最多公開はAMDとNVIDIA、ダウンロード上位25と「いいね」上位25の重なりは1本だけ、Qwenの派生は151,448本で1日180〜210本、Hubを叩くエージェントはClaude Codeが7月44.4%・Codexが20.8%

検証(発表 8月14日)
Hugging Face「funes」──Claude Code・Codex・pi・Hermesのセッション記録を1つの記憶にする単一バイナリ。`funes add claude`でエージェントにrecallとgetのツールが付き、完了したターンごとに自動で索引。埋め込みと再ランクは手元で動き、共有したければ自分のHugging Faceデータセット(既定で非公開)に。要約せず原文と出所を返すの記事画像

Hugging Face「funes」 Claude Code・Codex・pi・Hermesのセッション記録を1つの記憶にする単一バイナリ。`funes add claude`でエージェントにrecallとgetのツールが付き、完了したターンごとに自動で索引。埋め込みと再ランクは手元で動き、共有したければ自分のHugging Faceデータセット(既定で非公開)に。要約せず原文と出所を返す

検証(発表 9月3日)
Hugging Face、ICML 2026の論文をコーディングエージェントで再現するハッカソン──19日間で1,221人が6,816本の記録を公開し2,226本(会議の34%)を試み、35,908の主張を判定。51%で少なくとも1つの主張が検証、23%で少なくとも1つが反証または係争、242本は独立チームが正反対の判定。スポットライト論文の定理が崩れ、著者は当日確認の記事画像

Hugging Face、ICML 2026の論文をコーディングエージェントで再現するハッカソン 19日間で1,221人が6,816本の記録を公開し2,226本(会議の34%)を試み、35,908の主張を判定。51%で少なくとも1つの主張が検証、23%で少なくとも1つが反証または係争、242本は独立チームが正反対の判定。スポットライト論文の定理が崩れ、著者は当日確認

検証(発表 8月13日)
止まらないAIエージェント「Headlong」──LaudeとMITが1万行未満のBashで作ったの記事画像

止まらないAIエージェント「Headlong」 LaudeとMITが1万行未満のBashで作った

検証