AI時短ラボ
検索
検証

Gemma 4 12BをMacのローカルで「エージェント用の土台」にするGoogle AI Edgeの手順。LiteRT-LM CLIの新コマンド`serve`でOpenAI互換のローカルサーバーを立て、OpenClaw・Hermes・OpenCode・Aiderをそのまま向ける。AI Edge GalleryのmacOS版はPythonを書いて実行、Eloquentは音声で書き換え

執筆:約7分で読めます

Google AI Edgeチームは2026年6月3日、Gemma 4 12Bを普通のノートPCで動かしエージェント的な用途に使う手順を公開した。①Google AI Edge GalleryがmacOSに対応し、Gemma 4 12Bが自然言語の指示からPythonを生成してその場で実行、2つのテキストファイルから比較グラフのPNGを描いた。②音声入力アプリEloquentのmacOS版は全機能が端末内で動き、ホットキーで任意のアプリに口述でき、新機能Voice Editで段落を選んで「経営向け要約に組み直して」と言えば書き換える。前モデル比で総合品質が60%超向上。③LiteRT-LM CLIに`serve`が加わり、`litert-lm import`でHugging Faceからモデルを取り込み、`litert-lm serve`でOpenAI互換のローカルサーバー(localhost:9379)を立てられる。OpenClaw・Hermes・OpenCode・Pi、Continue・Aiderのような既存の道具をそのまま向けられ、完全にローカルなエージェントの土台になる。

Gemma 4 12BをMacのローカルで「エージェント用の土台」にする──Google AI Edgeの手順。LiteRT-LM CLIの新コマンド`serve`でOpenAI互換のローカルサーバーを立て、OpenClaw・Hermes・OpenCode・Aiderをそのまま向ける。AI Edge GalleryのmacOS版はPythonを書いて実行、Eloquentは音声で書き換え
目次

2026年9月19日・日本時間時点の情報です。 Google Developersのブログ(6月3日)を読んだ。3か月前の記事だが、当サイトのEloquentの記事で扱わなかった**serveコマンド**(LiteRT-LMをOpenAI互換のローカルサーバーにする)は、LM StudioやOllamaの代わりにGoogle純正の経路でローカルエージェントを組める話なので残す。

3行まとめ

  1. Gallery(macOS)でコードを書いて実行。 Google AI Edge Gallery(ローカルAIの見本アプリ)がmacOSに対応し、Gemma 4 12Bが自然言語の指示からPythonを生成してその場で実行する。例は2つのテキストファイルを渡して「2024年と2025年の女児名トップ10を比べるグラフのPNGをPythonで描いて」→コード生成→ローカル実行→可視化。trimeshで.objファイルを描画する課題では、依存関係の指定・コード生成・自己修正を1ターンで行った。
  2. Eloquent(macOS)は完全オフラインの口述と書き換え。 全機能が端末内で動き、カスタマイズできるホットキーで任意のアプリに口述でき、音声・動画ファイルの書き起こしもローカル。新機能Voice Editは、段落を選んで「経営向けの要約に組み直して」「ヒンディー語に訳して」と声で指示すると書き換える。Gemma 4 12Bにより前モデル比で指示追従と範囲の遵守が改善し、総合品質が60%超向上した、と。
  3. serveでOpenAI互換のローカルサーバー。 LiteRT-LM CLIに**serveが加わり、litert-lm import --from-huggingface-repo=litert-community/gemma-4-12B-it-litert-lm …でモデルを取り込み、litert-lm serveでlocalhost:9379**にOpenAI互換のエンドポイントが立つ(モデル名をgemma4-12b,gpuのように指定してGPUで動かす)。OpenClaw・Hermes・OpenCode・Piのようなエージェント、Continue・Aiderのような拡張を、そのままローカルの端点に向けられる。「完全にローカルなエージェントの道具・ハーネス・作業の流れを動かす、能力と効率の高い選択肢」。

GoogleがOpenAI互換の入口も持つ意味

  • 「OpenAI互換のローカルサーバー」はLM Studio・Ollama・llama-serverで既にできることだが、Googleの公式ランタイム(LiteRT-LM)で同じ入口が付いた意味は、Gemma系の最適化と更新をGoogle側で追える点にある。Raspberry Pi 5の記事のLiteRT-LMと同じ系統
  • 「60%超の品質向上」はEloquentの内部評価で、指標は書かれていない
  • 12Bをノートで動かす要件(メモリ)はモデルカード参照とだけあり、本文に数字はない。筆者はM5 Max 64GBの環境で試していない
  • NVIDIA IFA 2026で見たHermes・OpenClawのワンクリック設定は同じアプリ群のNVIDIA側の入口で、Mac側はこのserveが対応する

コマンドは原文確認、自環境は未試行

この記事の下調べで、筆者は9月19日にGoogle Developersのブログを取得し、Gallery・Eloquentの機能・Voice Editの例・60%超・importとserveのコマンドとポート番号・対応する道具の一覧がその原文にあることを確認した。Gemma 4 12Bのモデルカードは開いていない。筆者は自分のMacでlitert-lm serveを試していない。

メモリ要件と対応OSは本文になし

  • 12Bをノートで動かす際のメモリ要件と速度
  • serveの対応OS(LinuxとWindows)
  • Eloquentの日本語での品質

出典はAI Edgeチームの記事1本

関連記事

シェア: ポスト はてブ

出典・参照資料

AI時短ラボ

大きいニュースはYouTubeでも解説しています。Xでは新着記事をお知らせしています。

コメント

まだコメントはありません。最初のコメントを書いてみませんか?

AIについて聞きたいことはありますか?

質問箱で無料で受け付けています。回答は公開され、他の方の参考にもなります。

質問箱を見る →

関連記事

話し言葉を整った文章に変換するGoogleの新AI「Eloquent」──サブスクなし・オフライン動作の音声入力アプリの記事画像

話し言葉を整った文章に変換するGoogleの新AI「Eloquent」 サブスクなし・オフライン動作の音声入力アプリ

プロダクト
Raspberry Pi 5でGemma 4 E2Bをオフライン実行──LiteRT-LMでプリフィル99トークン/秒・デコード9トークン/秒・ピークメモリ1,432MB、生成は約300語/分(人の会話の2倍)。GPUにYOLOの物体検出を逃がし、CPUでMoonshineの音声認識・Gemma・TTSを回すReachy Miniロボットの構成。pip install litert-cliで開始の記事画像

Raspberry Pi 5でGemma 4 E2Bをオフライン実行 LiteRT-LMでプリフィル99トークン/秒・デコード9トークン/秒・ピークメモリ1,432MB、生成は約300語/分(人の会話の2倍)。GPUにYOLOの物体検出を逃がし、CPUでMoonshineの音声認識・Gemma・TTSを回すReachy Miniロボットの構成。pip install litert-cliで開始

検証(発表 8月11日)
LM Studioの使い方と料金【2026年9月版】──無料でローカルLLMを動かす手順(Mac M1〜M4・Windows・Linux、16GB推奨、4bit以上の量子化)、OpenAI互換API・MCP・文書チャット、新アプリ「Bionic」とBionic+ $20/Pro $100のクラウド(Kimi K3・GLM 5.3・DeepSeek V4 Flash、ZDR)の記事画像

LM Studioの使い方と料金【2026年9月版】 無料でローカルLLMを動かす手順(Mac M1〜M4・Windows・Linux、16GB推奨、4bit以上の量子化)、OpenAI互換API・MCP・文書チャット、新アプリ「Bionic」とBionic+ $20/Pro $100のクラウド(Kimi K3・GLM 5.3・DeepSeek V4 Flash、ZDR)

活用
NVIDIA、IFA 2026でローカルAIの4本──Hermes Agent・OpenClaw・Perplexity Portable Computerがワンクリックでローカルモデル設定、llama.cppはRTX 5090で最大1.9倍、家庭内の遊休PCに推論を振り分ける無料OSS「PAIR」(Apple M4以降も)、10月にRTX Spark搭載Windows PCの記事画像

NVIDIA、IFA 2026でローカルAIの4本 Hermes Agent・OpenClaw・Perplexity Portable Computerがワンクリックでローカルモデル設定、llama.cppはRTX 5090で最大1.9倍、家庭内の遊休PCに推論を振り分ける無料OSS「PAIR」(Apple M4以降も)、10月にRTX Spark搭載Windows PC

検証(発表 9月3日)
ローカルLLMとは何か──自分のPCでAIを動かす仕組み・利点・始め方を解説の記事画像動画

ローカルLLMとは何か 自分のPCでAIを動かす仕組み・利点・始め方を解説

活用
Google「ADK for Kotlin 1.0」が正式版──Python版・Java版のADK 1.0と同じ機能に加え、Android向けの端末内エージェント(LiteRT-LM・ML Kitベータ)、Firebase AI Logicのハイブリッド、RoomとAppSearchで状態の保存。@Toolと@Paramでスキーマを自動生成、SKILL.mdで手順を段階的に読むの記事画像

Google「ADK for Kotlin 1.0」が正式版 Python版・Java版のADK 1.0と同じ機能に加え、Android向けの端末内エージェント(LiteRT-LM・ML Kitベータ)、Firebase AI Logicのハイブリッド、RoomとAppSearchで状態の保存。@Toolと@Paramでスキーマを自動生成、SKILL.mdで手順を段階的に読む

検証(発表 9月9日)
Google「A2UI+MCP Apps」──エージェントの画面を「宣言的なJSON(A2UI)」で描くか「iframeのWebアプリ(MCP Apps)」で描くかの二択を組み合わせる3つの型。①MCPサーバーがapplication/a2ui+jsonを返しホストがネイティブ描画②MCP AppをA2UI部品に埋めて要点だけ同期③MCP App内にA2UI描画器を入れて旧システムに生成UIの記事画像

Google「A2UI+MCP Apps」 エージェントの画面を「宣言的なJSON(A2UI)」で描くか「iframeのWebアプリ(MCP Apps)」で描くかの二択を組み合わせる3つの型。①MCPサーバーがapplication/a2ui+jsonを返しホストがネイティブ描画②MCP AppをA2UI部品に埋めて要点だけ同期③MCP App内にA2UI描画器を入れて旧システムに生成UI

検証(発表 6月17日)
Hugging Face「funes」──Claude Code・Codex・pi・Hermesのセッション記録を1つの記憶にする単一バイナリ。`funes add claude`でエージェントにrecallとgetのツールが付き、完了したターンごとに自動で索引。埋め込みと再ランクは手元で動き、共有したければ自分のHugging Faceデータセット(既定で非公開)に。要約せず原文と出所を返すの記事画像

Hugging Face「funes」 Claude Code・Codex・pi・Hermesのセッション記録を1つの記憶にする単一バイナリ。`funes add claude`でエージェントにrecallとgetのツールが付き、完了したターンごとに自動で索引。埋め込みと再ランクは手元で動き、共有したければ自分のHugging Faceデータセット(既定で非公開)に。要約せず原文と出所を返す

検証(発表 9月3日)