Liquid AIの小型モデルLFM2.5を「速く・正確に」する2本①DSparkの草稿モデル(約300M)で投機的デコード、出力は同一のままH100で最大3.18倍・M4 Max MacBookで最大2.87倍、関数呼び出しの遅延を57%削減 ②350MモデルをGRPOで100ステップ(無料枠のColab)微調整し、構造化出力の遵守率をIFStructで22.6%→29.7%
Liquid AIはHugging Faceのブログで、小型モデル群LFM2.5の実用性を上げる2本を公開した。①DSpark(8月20日):LFM2.5-1.2B-Instruct・2.6B・8B-A1B向けの草稿モデル(各約300M)を公開。軽い草稿モデルが候補トークンを出し、本体が1回の順伝播でまとめて検証する投機的デコードで、貪欲デコードの出力は基準と同一のまま、H100(SGLang)で最大3.18倍、M4 Max MacBook Pro(llama.cpp・Metal)で最大2.87倍、2.6BはMATH500で61→137トークン/秒。関数呼び出しの遅延は平均57%減。llama.cppとSGLangに上流で対応。②GRPO微調整(9月3日):LFM2.5-350MをTRLのGRPOで、JSON形式・フィールド数・スキーマ検証の3つの報酬、約500サンプル・100ステップで無料枠の16GB GPUに収まる規模で学習し、構造化出力ベンチマークIFStruct(2,000問)で22.6%→29.7%。評価はM5 Max 36GBのMacBookでローカル実行。

2026年9月18日・日本時間時点の情報です。 Hugging FaceのLiquid AIのブログ2本(8月20日・9月3日)を読んだ。Hugging Faceの夏の報告で「米国で3番目に多くモデルを公開した」LiquidAIの、小型モデルを端末で速く・正確に使うための実務的な2本。ローカルLLMとはの補足として残す。
3行まとめ
- DSpark(8月20日):出力を変えずに速くする。 LLMの復号は計算より重みをDRAMからSRAMへ流す時間に縛られる。投機的デコードは、軽い草稿モデルが候補トークンを出し、本体が1回の順伝播でまとめて検証して重みの読み出し費用を分け合う。DSparkは、①本体の文脈特徴を条件にしたDFlash型の並列バックボーン(全草稿トークンの隠れ状態を1回で出す)、②隣接トークン間のマルコフ連鎖の頭(後ろの位置の受理率を上げる)、③各トークンの生存確率を予測し、検証の費用が節約を上回る低信頼の接尾辞を刈る検証器、の3部品。Liquid AIはLFM2.5-1.2B-Instruct・2.6B・8B-A1B向けの草稿モデル(各約300M、5層の注意のみ、ブロック9、15エポックから受理率最高の版を選択)を公開した。貪欲デコードでは受理トークンは本体の分布と一致し、却下時は本体のトークンに置き換わるので、出力列は基準と同一、ベンチマーク精度(pass@1・完全一致)は変わらない。
- DSparkの数字。 H100(SGLang・BF16・バッチ1・温度0)で最大3.18倍、M4 Max MacBook Pro(llama.cpp・Metal・FP16 GGUF)で最大2.87倍。LFM2.5-2.6BはMATH500でH100 326→1,000トークン/秒(3.06倍)・M4 Max 61→137(2.25倍)、HumanEvalで326→835・61→161(2.63倍)、受理は10個中4.5〜5.4個。MacBookでの2.6Bは「多くの商用クラウドモデルの約140トークン/秒を超える対話性」と書く。関数呼び出しの遅延は2.6Bで平均57%減で、端末内のエージェント推論に向く。llama.cpp(公式コードベースの上、実験的Metalカーネル)とSGLang(公式のDSpark実装の上)に初日対応し、上流にオープンソースで統合。
- GRPO微調整(9月3日):小さいモデルに形式を守らせる。 構造化出力(要求した形式・形のまま解析可能な出力を返すこと)は下流システムにつなげるかを決めるが、多くのベンチマークは推論や抽出の点数に埋もれている。LFM2.5-350MをTRLのGRPOで、JSON形式・フィールド数・スキーマ検証の3つの報酬(重み1.0・0.5・2.0)、約500サンプル・100ステップ・1プロンプト8生成という無料枠の16GB GPU(ColabやKaggle)に収まる規模で学習。評価はIFStruct(2,000問)をllama.cppのOpenAI互換サーバー経由で、M5 Max 36GBのMacBook Proでローカル実行し、22.6%→29.7%(ローカル基準22.6%はIFStructのブログの21.1%に近い)。IFStructの公式スコアの再現ではなく、「課題特化の軽い微調整で小さいモデルがはるかに大きいモデルに並ぶ」ことを示すのが目的、と注記。
自社測定の数字、29.7%はまだ低い
- DSparkの「出力は同一のまま速くなる」は、投機的デコードの性質で、品質と引き換えの量子化とは別の軸。当サイトのvLLMのDFlash2と同じ系統で、Liquid AIは端末側(llama.cpp・Metal)に初日で持ち込んだ点が違う
- GRPO側は「無料枠で100ステップ」という再現しやすさが価値で、報酬関数の3本立て(形式・件数・スキーマ)は他の小型モデルにも流用できる。Googleのautofinetuneのような探索ループの中身にそのまま入る型
- 29.7%は「7ポイント改善」であって高い遵守率ではない。本番でスキーマ遵守が要るなら、モデル側の改善と併せて出力側の検証・再試行は要る
- どちらも数字はLiquid AI(とHugging Face)の測定。M4/M5 Maxの数字は当サイトの読者のMacと条件が近い
原文の数字を突合、実機では未検証
この記事の下調べで、筆者は9月18日にHugging Faceのブログ2本を取得し、草稿モデルのサイズ・3部品・3.18倍/2.87倍・MATH500とHumanEvalの数字・57%・対応推論系・報酬の重み・500サンプル/100ステップ/8生成・22.6%→29.7%・評価環境がその原文にあることを確認した。GitHubのノートブックとモデルカードは開いていない。筆者は自分のMacでLFM2.5を動かしていない。
温度>0の速度と8B-A1Bの倍率は非公開
- DSparkの温度>0(サンプリング)時の速度と品質
- 8B-A1Bの各ベンチマークの倍率(表は一部のみ読めた)
- IFStructの29.7%が「はるかに大きいモデル」の何と並ぶのか(具体名なし)
出典はHugging Faceのブログ
- Up to 3.2x Faster Inference with LFM2.5-DSpark(Liquid AI・2026年8月20日)
- Fine-tuning a 350M Model for Better Structured Outputs in 100 GRPO Steps(Liquid AI・Hugging Face・2026年9月3日)
関連記事
出典・参照資料
大きいニュースはYouTubeでも解説しています。Xでは新着記事をお知らせしています。
コメント
まだコメントはありません。最初のコメントを書いてみませんか?
AIについて聞きたいことはありますか?
質問箱で無料で受け付けています。回答は公開され、他の方の参考にもなります。
質問箱を見る →