IBM「Granite 4.2」の作り方初の推論特化の密なモデル3B・8B・30B(Apache 2.0、日本語を含む12言語)。SFTの31.6%がエージェント軌跡(Codex・Gemini CLI等のハーネスで生成)、RLはRLVR→SWE→端末→検索→RLHFの階段で8B・30Bだけ実環境のエージェントRL。30BはSWE-Bench Verified 57.00
IBMのGraniteチームは2026年8月25日、初の密な推論LLM「Granite 4.2」(3B・8B・30B、Apache 2.0)の構築手順を公開した。Granite-4.1のベースモデル(約15兆トークン・文脈512K)から、思考の連鎖・推論・エージェント軌跡でSFTし、多段の強化学習で仕上げる。各モデルに思考/非思考の切替、低effortモード、ネイティブのツール呼び出しがある。SFTデータは約720万サンプルでエージェント31.6%(OpenHands・SWE-agent・Gemini CLI・Hermes・Codex・Gooseなどで生成)と非エージェント68.4%。RLはSFT→RLVR→スキル強化→SWE→端末→検索→RLHFの順に回し、8Bと30Bだけが実環境のエージェントRLを通る。30BはSWE-Bench Verified 57.00・Terminal-Bench 2.1 29.24・τ³-bench 62.00・AIME25 89.17・GPQA 66.41・MMLU-Pro 77.60・RULER 128K 81.38。対応言語は日本語を含む12。

2026年9月18日・日本時間時点の情報です。 Hugging FaceのIBMのブログ(8月25日)を読んだ。当サイトはオープンウェイトの整理でGraniteに触れていなかった。Hugging Faceの夏の報告が「IBM Graniteは小型で数億DL」と書いていた、その現行世代の中身。
3行まとめ
- 何が出たか。 Granite初の推論特化の密な(MoEでない)デコーダ専用LLMで、3B・8B・30B、Apache 2.0。Granite-4.1のベースモデル(約15兆トークン、5段階の学習で最後に文脈を512Kまで拡張)から、思考の連鎖・推論・エージェント軌跡でSFTし、多段の強化学習で仕上げた。全モデルに思考/非思考の切替、易しい問いに短い推論予算を使う低effortモード、ネイティブのツール呼び出し(vLLM等のOpenAI互換エンドポイントでfunction-calling形式を出し、ハーネスに接着剤なしで刺さる。SGLangも)。構造はGQA(40ヘッド・KV 8)・RoPE θ=1,000万・SwiGLU・RMSNorm・埋め込み非共有・bfloat16で、30Bは64層・MLP 32,768・系列長131,072。対応言語は英・独・西・仏・日・葡・アラビア・チェコ・伊・韓・蘭・中の12。
- どう作ったか。 SFTデータは約720万サンプル(約1,000億トークン、学習対象約650億)で、エージェント31.6%(内訳はSWE 69%・ツール呼び出し12.1%・端末8.0%・数学3.5%・検索0.8%・行動0.2%。OpenHands・OpenCode・Terminus-2・SWE-agent・OpenResearcher・MiniSWE・OpenSeeker・EnvScaler・Gemini CLI・Hermes・Codex・Gooseのハーネスで生成)と非エージェント68.4%(指示追従18.8%・コード18.8%・数学14.6%・多言語7.0%・科学5.4%・推論3.0%・安全0.8%)。RLはSFT→RLVR→スキル強化→SWEエージェント→端末→検索→RLHFの階段で、各段は1つの目的と報酬を持つ別の走行、終わると次の段のベースになる(8Bと30Bだけが後半のエージェントRLを通り、3Bは基礎RLと整合のみ)。報酬は検証可能(正解一致・単体テスト・形式)、報酬モデル/LLM判定(品質・選好・安全)、エージェント成果(実環境で本当に解けたか)の3種で、KLは報酬が客観なら0(RLVR・SWE 2)、選好や安全なら0.05。エージェント段は多ターン・実環境(模擬でない)・疎な成果報酬・GRPO。
- 数字。 30BでSWE-Bench Verified 57.00・SWE-Bench Pro 33.29・SWE-Bench Multilingual 41.89・Terminal-Bench 2.1 29.24、τ³-bench 62.00・BFCL v4 61.39・ProfBench 42.90、AIME25 89.17・HMMT Feb25 89.17・GPQA 66.41・LiveCodeBench v6 75.77、MMLU-Pro 77.60・Arena-Hard-V2 67.93・IFBench 77.17、RULER 64K 89.96・128K 81.38。8BはSWE-Bench Verified 47.67・AIME25 86.67、3BはAIME25 78.33・GPQA 54.80・MMLU-Pro 67.84。
エージェント軌跡の生成元と数字の限界
- 「SFTの3割がエージェント軌跡で、その生成に他社のハーネス(Codex・Gemini CLI・Hermes・Goose)を使った」と明記している点が珍しい。ローカルで動く小型モデルにツール操作を教える材料がどこから来るかの一例
- 30BのSWE-Bench Verified 57.00は、当サイトのSWE-Benchの監査で見たとおりベンチマーク自体に注意点があるが、密な30B・Apache 2.0で日本語対応、という条件ではLM Studio等でのローカル運用の候補に入る
- 比較対象(他社モデル)の数字は本文の表にない。IBM自身の測定
- 同じIBMのエージェントの一貫性の隙間は、この種のモデルを評価する側の研究
数値は原文で確認、実行はしていない
この記事の下調べで、筆者は9月18日にHugging FaceのIBMのブログを取得し、3サイズ・Apache 2.0・15兆トークン・512K・構造の数値・SFTの比率とハーネス一覧・RLの段階と報酬の種類・結果表の数字・対応言語がその原文にあることを確認した。GitHubとGranite Docsは開いていない。筆者はGranite 4.2を動かしていない。
比較表・計算量・言語別評価は無し
- 他社モデルとの比較表
- 学習に使った計算量とGPU時間
- 日本語での評価値(MMLU-ProX liteは多言語版で3B 27.78・8B 61.06・30B 66.64だが言語別は不明)
出典はHugging FaceのIBMのブログ
- Granite 4.2 LLMs: How They're Built(IBM・2026年8月25日)
関連記事
出典・参照資料
大きいニュースはYouTubeでも解説しています。Xでは新着記事をお知らせしています。
コメント
まだコメントはありません。最初のコメントを書いてみませんか?
AIについて聞きたいことはありますか?
質問箱で無料で受け付けています。回答は公開され、他の方の参考にもなります。
質問箱を見る →