SLM(小型言語モデル)とはNVIDIAの論文は「民生用電子機器に収まり、1ユーザーの要求に低レイテンシで推論できる言語モデル」と定義し、目安は100億パラメータ未満。Raspberry Pi 5で動くGemma 4 E2B、Macで86〜90トークン/秒のLing-3.0-tiny、350MのLFM2.5、3BのGranite 4.2──実例で「小さいモデルに何ができるか」を整理する
SLM(Small Language Model・小型言語モデル)は、LLMに対して、手元の機器で動かせる規模の言語モデルを指す語。NVIDIA Researchの論文「Small Language Models are the Future of Agentic AI」は作業上の定義として「一般的な民生用電子機器に収まり、1ユーザーのエージェント的リクエストに対応する上で実用的な低レイテンシで推論できるLM」と置き、「2025年時点では100億(10B)パラメータ未満のほとんどのモデルをSLMとみなす」という目安を示した。この記事は、その定義を起点に、当サイトが一次資料で確認してきた実例(Raspberry Pi 5で動くGemma 4 E2B、M4 Pro MacBookで86〜90トークン/秒のLing-3.0-tiny、Liquid AIの350Mモデル、IBM Granite 4.2の3B・8B・30B)を並べ、SLMが向く用途と向かない用途、量子化・投機的デコード・蒸留、Copilot+ PCやNPUとの関係を整理する。

2026年9月22日時点の情報です。 「SLM」は、LLM(大規模言語モデル)の対義語のように使われるが、何パラメータからが「小型」なのかは決まっていない。この記事は、定義を明文化しているNVIDIA Researchの論文を起点に、当サイトが実際に記事にしてきた小さいモデルの実例を並べて、「小さいモデルに今何ができるか」を整理する。自分の機器で動かす入口はローカルLLMの記事、Windows側の受け皿はCopilot+ PCとNPUに。
3行まとめ
- 定義。 NVIDIA Researchの論文は、SLMを「一般的な民生用電子機器に収まり、1ユーザーのエージェント的リクエストに対応する上で実用的な低レイテンシで推論できるLM」、LLMを「SLMでないLM」と定義し、「2025年時点では100億(10B)パラメータ未満のほとんどのモデルをSLMとみなすことに抵抗はない」と目安を書く。
- 実例。 Raspberry Pi 5でGemma 4 E2Bがオフライン動作(プリフィル99トークン/秒・デコード9トークン/秒・ピークメモリ1,432MB)、M4 Pro MacBookでAnt GroupのLing-3.0-tinyが86〜90トークン/秒(7.9Bのうちアクティブは1.3B)、Liquid AIの350Mモデルを無料枠のColabでGRPO微調整、IBM Granite 4.2は3B・8B・30Bの密モデル。
- 向く用途と向かない用途。 論文は、エージェントが繰り返す専門特化タスクにはSLMが「本質的に適し、経済的にも有利」とする一方、汎用的な会話が要る場面ではLLMとSLMを混ぜる「異種混合」が自然だと書く。全部をSLMに置き換えろ、という主張ではない。
定義──「何パラメータ以下」ではなく「どこで動くか」
NVIDIAの論文の定義は、パラメータ数ではなく動作環境と応答速度で線を引いている。「一般的な民生用電子機器に収まる」(ノートPC・スマートフォン・シングルボードコンピュータ)、「1ユーザーの要求に実用的な低レイテンシで応える」の2つで、10Bという数字は2025年時点の目安として添えられているだけ。機器の性能が上がれば、同じ定義のままSLMの上限は上がる。当サイトの論文の記事は、この論文が「批判と議論を呼びかけるポジションペーパー」であり、断定的な実証研究ではないことも明記している。
実例──当サイトが記事にした小さいモデル
| モデル | 規模 | 動いた環境と数字(当サイトの記事) |
|---|---|---|
| Gemma 4 E2B(Google) | E2B | Raspberry Pi 5でオフライン実行。LiteRT-LMでプリフィル99トークン/秒・デコード9トークン/秒・ピークメモリ1,432MB。音声認識・物体検出と組み合わせたReachy Miniロボットの構成 |
| Ling-3.0-tiny(Ant Group) | 7.9B(アクティブ1.3B・MITライセンス) | M4 Pro MacBookで86〜90トークン/秒 |
| LFM2.5(Liquid AI) | 350M〜 | 350MモデルをGRPOで100ステップ(無料枠のColab)微調整し、構造化出力の遵守率をIFStructで22.6%→29.7%。草稿モデル(約300M)の投機的デコードでM4 Maxで最大2.87倍 |
| Granite 4.2(IBM) | 3B・8B・30B(Apache 2.0・日本語含む12言語) | 推論特化の密モデル。30BはSWE-Bench Verified 57.00、8B・30Bは実環境でのエージェントRL |
それぞれの条件と限界は各記事(Gemma 4 E2B、Ling-3.0-tiny、LFM2.5、Granite 4.2)に。数字はいずれも各社の公開資料の値で、筆者が同じ機器で再現したものではない。
「7.9Bのうちアクティブ1.3B」のように、総パラメータと1回の推論で動く部分が違うのはMoE(Mixture of Experts)の構成で、SLMかどうかを見るときは「メモリに載る総量」と「速度を決めるアクティブ量」を分けて読む必要がある(MoEとは)。
向く用途・向かない用途(論文の立場)
論文がSLMに向くとするのは、エージェントシステムの中で繰り返し呼ばれる専門特化タスク(フォーマット変換、分類、決まった手順の実行など)で、根拠として、SLMが現在示している能力水準、エージェントシステムの一般的なアーキテクチャ(1つの仕事が多数の小さな呼び出しに分解される)、モデルを配備する際の経済性の3点を挙げる。向かないとするのは汎用的な会話能力が本質的に必要な場面で、そこではLLMとSLMを組み合わせる「異種混合(heterogeneous)」が自然な選択だ、と条件を付ける。LLMからSLMへ役割を移すための変換アルゴリズムの概要も論文にある。
周辺の語
- 量子化:重みの精度を落としてメモリと速度を稼ぐ。Multiverse Computingの「Quantization-Aware Healing」では、120Bを60Bに圧縮して4ビット化したモデルが元のbf16版を9ベンチマーク中7で上回った(記事)。小さくすれば必ず落ちる、とは限らない例。
- 投機的デコード:小さい草稿モデルで先に候補を出し、大きいモデルで検証して速度を上げる。LFM2.5のDSparkが例。
- 蒸留:大きいモデルの出力で小さいモデルを訓練する。逆に、Microsoftは「蒸留を一切使わずに」推論モデルを作ったと技術報告書で主張している(記事)。
- NPU:SLMを端末で動かす側の受け皿。Windowsでは40 TOPS以上のNPUを積んだPCが「Copilot+ PC」と呼ばれる(記事)。
この記事の範囲
筆者は2026年9月22日にNVIDIAの論文の定義部分(当サイトの記事で確認済みの訳)を起点に、当サイトの既存記事から実例を引いた。各モデルの数字は各社の公開値で、筆者の実測ではない。「SLM」という語自体の初出や、各社がどの規模までをSLMと呼んでいるかの網羅は扱っていない。
出典・参照資料
大きいニュースはYouTubeでも解説しています。Xでは新着記事をお知らせしています。
コメント
まだコメントはありません。最初のコメントを書いてみませんか?
AIについて聞きたいことはありますか?
質問箱で無料で受け付けています。回答は公開され、他の方の参考にもなります。
質問箱を見る →