AI時短ラボ
検索
研究

SLM(小型言語モデル)とはNVIDIAの論文は「民生用電子機器に収まり、1ユーザーの要求に低レイテンシで推論できる言語モデル」と定義し、目安は100億パラメータ未満。Raspberry Pi 5で動くGemma 4 E2B、Macで86〜90トークン/秒のLing-3.0-tiny、350MのLFM2.5、3BのGranite 4.2──実例で「小さいモデルに何ができるか」を整理する

執筆:約9分で読めます

SLM(Small Language Model・小型言語モデル)は、LLMに対して、手元の機器で動かせる規模の言語モデルを指す語。NVIDIA Researchの論文「Small Language Models are the Future of Agentic AI」は作業上の定義として「一般的な民生用電子機器に収まり、1ユーザーのエージェント的リクエストに対応する上で実用的な低レイテンシで推論できるLM」と置き、「2025年時点では100億(10B)パラメータ未満のほとんどのモデルをSLMとみなす」という目安を示した。この記事は、その定義を起点に、当サイトが一次資料で確認してきた実例(Raspberry Pi 5で動くGemma 4 E2B、M4 Pro MacBookで86〜90トークン/秒のLing-3.0-tiny、Liquid AIの350Mモデル、IBM Granite 4.2の3B・8B・30B)を並べ、SLMが向く用途と向かない用途、量子化・投機的デコード・蒸留、Copilot+ PCやNPUとの関係を整理する。

SLM(小型言語モデル)とは──NVIDIAの論文は「民生用電子機器に収まり、1ユーザーの要求に低レイテンシで推論できる言語モデル」と定義し、目安は100億パラメータ未満。Raspberry Pi 5で動くGemma 4 E2B、Macで86〜90トークン/秒のLing-3.0-tiny、350MのLFM2.5、3BのGranite 4.2──実例で「小さいモデルに何ができるか」を整理する
目次

2026年9月22日時点の情報です。 「SLM」は、LLM(大規模言語モデル)の対義語のように使われるが、何パラメータからが「小型」なのかは決まっていない。この記事は、定義を明文化しているNVIDIA Researchの論文を起点に、当サイトが実際に記事にしてきた小さいモデルの実例を並べて、「小さいモデルに今何ができるか」を整理する。自分の機器で動かす入口はローカルLLMの記事、Windows側の受け皿はCopilot+ PCとNPUに。

3行まとめ

  1. 定義。 NVIDIA Researchの論文は、SLMを「一般的な民生用電子機器に収まり、1ユーザーのエージェント的リクエストに対応する上で実用的な低レイテンシで推論できるLM」、LLMを「SLMでないLM」と定義し、「2025年時点では100億(10B)パラメータ未満のほとんどのモデルをSLMとみなすことに抵抗はない」と目安を書く。
  2. 実例。 Raspberry Pi 5でGemma 4 E2Bがオフライン動作(プリフィル99トークン/秒・デコード9トークン/秒・ピークメモリ1,432MB)、M4 Pro MacBookでAnt GroupのLing-3.0-tinyが86〜90トークン/秒(7.9Bのうちアクティブは1.3B)、Liquid AIの350Mモデルを無料枠のColabでGRPO微調整、IBM Granite 4.2は3B・8B・30Bの密モデル。
  3. 向く用途と向かない用途。 論文は、エージェントが繰り返す専門特化タスクにはSLMが「本質的に適し、経済的にも有利」とする一方、汎用的な会話が要る場面ではLLMとSLMを混ぜる「異種混合」が自然だと書く。全部をSLMに置き換えろ、という主張ではない。

定義──「何パラメータ以下」ではなく「どこで動くか」

NVIDIAの論文の定義は、パラメータ数ではなく動作環境と応答速度で線を引いている。「一般的な民生用電子機器に収まる」(ノートPC・スマートフォン・シングルボードコンピュータ)、「1ユーザーの要求に実用的な低レイテンシで応える」の2つで、10Bという数字は2025年時点の目安として添えられているだけ。機器の性能が上がれば、同じ定義のままSLMの上限は上がる。当サイトの論文の記事は、この論文が「批判と議論を呼びかけるポジションペーパー」であり、断定的な実証研究ではないことも明記している。

実例──当サイトが記事にした小さいモデル

モデル 規模 動いた環境と数字(当サイトの記事)
Gemma 4 E2B(Google) E2B Raspberry Pi 5でオフライン実行。LiteRT-LMでプリフィル99トークン/秒・デコード9トークン/秒・ピークメモリ1,432MB。音声認識・物体検出と組み合わせたReachy Miniロボットの構成
Ling-3.0-tiny(Ant Group) 7.9B(アクティブ1.3B・MITライセンス) M4 Pro MacBookで86〜90トークン/秒
LFM2.5(Liquid AI) 350M〜 350MモデルをGRPOで100ステップ(無料枠のColab)微調整し、構造化出力の遵守率をIFStructで22.6%→29.7%。草稿モデル(約300M)の投機的デコードでM4 Maxで最大2.87倍
Granite 4.2(IBM) 3B・8B・30B(Apache 2.0・日本語含む12言語) 推論特化の密モデル。30BはSWE-Bench Verified 57.00、8B・30Bは実環境でのエージェントRL

それぞれの条件と限界は各記事(Gemma 4 E2B、Ling-3.0-tiny、LFM2.5、Granite 4.2)に。数字はいずれも各社の公開資料の値で、筆者が同じ機器で再現したものではない。

「7.9Bのうちアクティブ1.3B」のように、総パラメータと1回の推論で動く部分が違うのはMoE(Mixture of Experts)の構成で、SLMかどうかを見るときは「メモリに載る総量」と「速度を決めるアクティブ量」を分けて読む必要がある(MoEとは)。

向く用途・向かない用途(論文の立場)

論文がSLMに向くとするのは、エージェントシステムの中で繰り返し呼ばれる専門特化タスク(フォーマット変換、分類、決まった手順の実行など)で、根拠として、SLMが現在示している能力水準、エージェントシステムの一般的なアーキテクチャ(1つの仕事が多数の小さな呼び出しに分解される)、モデルを配備する際の経済性の3点を挙げる。向かないとするのは汎用的な会話能力が本質的に必要な場面で、そこではLLMとSLMを組み合わせる「異種混合(heterogeneous)」が自然な選択だ、と条件を付ける。LLMからSLMへ役割を移すための変換アルゴリズムの概要も論文にある。

周辺の語

  • 量子化:重みの精度を落としてメモリと速度を稼ぐ。Multiverse Computingの「Quantization-Aware Healing」では、120Bを60Bに圧縮して4ビット化したモデルが元のbf16版を9ベンチマーク中7で上回った(記事)。小さくすれば必ず落ちる、とは限らない例。
  • 投機的デコード:小さい草稿モデルで先に候補を出し、大きいモデルで検証して速度を上げる。LFM2.5のDSparkが例。
  • 蒸留:大きいモデルの出力で小さいモデルを訓練する。逆に、Microsoftは「蒸留を一切使わずに」推論モデルを作ったと技術報告書で主張している(記事)。
  • NPU:SLMを端末で動かす側の受け皿。Windowsでは40 TOPS以上のNPUを積んだPCが「Copilot+ PC」と呼ばれる(記事)。

この記事の範囲

筆者は2026年9月22日にNVIDIAの論文の定義部分(当サイトの記事で確認済みの訳)を起点に、当サイトの既存記事から実例を引いた。各モデルの数字は各社の公開値で、筆者の実測ではない。「SLM」という語自体の初出や、各社がどの規模までをSLMと呼んでいるかの網羅は扱っていない。

シェア: ポスト はてブ

出典・参照資料

AI時短ラボ

大きいニュースはYouTubeでも解説しています。Xでは新着記事をお知らせしています。

コメント

まだコメントはありません。最初のコメントを書いてみませんか?

AIについて聞きたいことはありますか?

質問箱で無料で受け付けています。回答は公開され、他の方の参考にもなります。

質問箱を見る →

関連記事

AIエージェントに必要なのは大きなモデルではない──NVIDIAが主張する『小型モデル本命論』の記事画像

AIエージェントに必要なのは大きなモデルではない NVIDIAが主張する『小型モデル本命論』

研究
Raspberry Pi 5でGemma 4 E2Bをオフライン実行──LiteRT-LMでプリフィル99トークン/秒・デコード9トークン/秒・ピークメモリ1,432MB、生成は約300語/分(人の会話の2倍)。GPUにYOLOの物体検出を逃がし、CPUでMoonshineの音声認識・Gemma・TTSを回すReachy Miniロボットの構成。pip install litert-cliで開始の記事画像

Raspberry Pi 5でGemma 4 E2Bをオフライン実行 LiteRT-LMでプリフィル99トークン/秒・デコード9トークン/秒・ピークメモリ1,432MB、生成は約300語/分(人の会話の2倍)。GPUにYOLOの物体検出を逃がし、CPUでMoonshineの音声認識・Gemma・TTSを回すReachy Miniロボットの構成。pip install litert-cliで開始

検証(発表 8月11日)
Ant GroupのLing-3.0-tinyがM4 Pro MacBookで86〜90トークン/秒──7.9BのうちアクティブなのはMITライセンスの1.3Bだけの記事画像

Ant GroupのLing-3.0-tinyがM4 Pro MacBookで86〜90トークン/秒 7.9BのうちアクティブなのはMITライセンスの1.3Bだけ

モデル
Liquid AIの小型モデルLFM2.5を「速く・正確に」する2本──①DSparkの草稿モデル(約300M)で投機的デコード、出力は同一のままH100で最大3.18倍・M4 Max MacBookで最大2.87倍、関数呼び出しの遅延を57%削減 ②350MモデルをGRPOで100ステップ(無料枠のColab)微調整し、構造化出力の遵守率をIFStructで22.6%→29.7%の記事画像

Liquid AIの小型モデルLFM2.5を「速く・正確に」する2本 ①DSparkの草稿モデル(約300M)で投機的デコード、出力は同一のままH100で最大3.18倍・M4 Max MacBookで最大2.87倍、関数呼び出しの遅延を57%削減 ②350MモデルをGRPOで100ステップ(無料枠のColab)微調整し、構造化出力の遵守率をIFStructで22.6%→29.7%

検証(発表 8月20日)
IBM「Granite 4.2」の作り方──初の推論特化の密なモデル3B・8B・30B(Apache 2.0、日本語を含む12言語)。SFTの31.6%がエージェント軌跡(Codex・Gemini CLI等のハーネスで生成)、RLはRLVR→SWE→端末→検索→RLHFの階段で8B・30Bだけ実環境のエージェントRL。30BはSWE-Bench Verified 57.00の記事画像

IBM「Granite 4.2」の作り方 初の推論特化の密なモデル3B・8B・30B(Apache 2.0、日本語を含む12言語)。SFTの31.6%がエージェント軌跡(Codex・Gemini CLI等のハーネスで生成)、RLはRLVR→SWE→端末→検索→RLHFの階段で8B・30Bだけ実環境のエージェントRL。30BはSWE-Bench Verified 57.00

検証(発表 8月25日)
ローカルLLMとは何か──自分のPCでAIを動かす仕組み・利点・始め方を解説の記事画像動画

ローカルLLMとは何か 自分のPCでAIを動かす仕組み・利点・始め方を解説

活用
Copilot+ PCとは──「40 TOPS以上のNPU」を積んだWindows 11 PCの区分。NPUとは何か、Snapdragon X/Core Ultra 200V/AMDのどれが該当するか、ネット無しで動く機能(リコール・スタジオエフェクト・ライブキャプション)とクラウドが要る機能の線引き、開発者向けはDirectMLからWindows MLへの記事画像

Copilot+ PCとは 「40 TOPS以上のNPU」を積んだWindows 11 PCの区分。NPUとは何か、Snapdragon X/Core Ultra 200V/AMDのどれが該当するか、ネット無しで動く機能(リコール・スタジオエフェクト・ライブキャプション)とクラウドが要る機能の線引き、開発者向けはDirectMLからWindows MLへ

活用
MoE(Mixture of Experts)とは──「総パラメータ」と「アクティブパラメータ」の読み分け方までの記事画像

MoE(Mixture of Experts)とは 「総パラメータ」と「アクティブパラメータ」の読み分け方まで

研究