AI時短ラボ
検証· 約7分

Raspberry Pi 5でGemma 4 E2Bをオフライン実行──LiteRT-LMでプリフィル99トークン/秒・デコード9トークン/秒・ピークメモリ1,432MB、生成は約300語/分(人の会話の2倍)。GPUにYOLOの物体検出を逃がし、CPUでMoonshineの音声認識・Gemma・TTSを回すReachy Miniロボットの構成。pip install litert-cliで開始

GoogleとRaspberry Pi Ltd・Igaliaのエンジニアは2026年8月11日、Raspberry Pi 5でLiteRTとGemmaを使い、クラウドに依存しないエッジAIを組む手順を公開した。Gemmaの選択肢はGemma 3 270M・EmbeddingGemma 300M・Gemma 3 1B・Gemma 4 E2B・Gemma 4 E4B。Pi 5のCPUでLiteRT-LMがGemma 4 E2Bを動かすとプリフィル99トークン/秒・デコード9トークン/秒・ピークメモリ1,432MBで、約27.3文字/秒、約300語/分。GPUのVideoCore VIIはCPUより非力だが、WebGPU(Vulkan)経由のML Driftで視覚・音声モデルをGPUに逃がしCPUをLLMに残す。Reachy Miniのデモは、YOLOをGPU、Moonshineの音声認識・Gemma 4 E2B・TTSをCPUで並列に回す。LiteRT CLI(pip install litert-cli)で変換・量子化・ベンチ・推論を一括。

Raspberry Pi 5でGemma 4 E2Bをオフライン実行──LiteRT-LMでプリフィル99トークン/秒・デコード9トークン/秒・ピークメモリ1,432MB、生成は約300語/分(人の会話の2倍)。GPUにYOLOの物体検出を逃がし、CPUでMoonshineの音声認識・Gemma・TTSを回すReachy Miniロボットの構成。pip install litert-cliで開始
執筆・編集:
目次

2026年9月18日・日本時間時点の情報です。 Google Developersのブログ(8月11日)を読んだ。当サイトはRaspberry Piで動くオフラインの車載エージェントやローカルLLMの音声対話の実現性を扱ったが、Google公式の「Pi 5でGemmaを何トークン/秒で回せるか」の数字は書いていなかった。

3行まとめ

  1. どのGemmaを選ぶか。 記事はPi向けに5つを並べる。Gemma 3 270M(微調整前提の超小型。感情分析や抽出)、EmbeddingGemma 300M(端末内の埋め込み。RAG・検索・分類)、Gemma 3 1B(多言語のテキスト専用。要約・作文)、Gemma 4 E2B(メモリマップされた層別埋め込みで、RAM節約が最優先の常時監視・音声処理向け)、Gemma 4 E4B(推論力と大きさの均衡点。複数段の計画)。
  2. 数字。 Pi 5のCPUで、LiteRTの上のオーケストレーション層LiteRT-LM(XNNPACKでCPU加速)がGemma 4 E2Bをプリフィル99トークン/秒・デコード9トークン/秒・ピークメモリ1,432MBで動かす。E2Bのトークナイザは1トークン約4.2文字と効率がよく、Reachy Miniの音声デモでは約27.3文字/秒=約300語/分の生成で、人の会話(約150語/分)の2倍。GPU側は、CPU(Cortex-A76×4、約153.6 GFLOPS FP32/約2.0 TOPS INT8)に対しVideoCore VII(800MHz、約76.8 GFLOPS/約0.24 TOPS)と非力だが、LiteRTのWebGPU(Vulkan)バックエンド(ML Drift)で視覚・音声・埋め込みモデル(MediaPipe・Ultralytics YOLO・Moonshine等)をGPUに逃がし、CPUをLLMと全体の制御に残す異種並列の設計を勧める。
  3. Reachy Miniの構成とツール。 Pollen RoboticsのロボットReachy Miniのデモは、①カメラ映像のYOLO物体検出をGPUで常時、②発話の音声認識(Moonshine)をCPU、③Gemma 4 E2B(CPU)が書き起こしと最新の視覚メタデータから返答と身振りをストリーミング生成、④TTS(CPU)が音声にして返す、の4系統を並列に回す。開発はLiteRT CLI(pip install litert-cli)で変換・量子化・ベンチマーク・推論を1つのコマンド群にまとめ、LiteRT CLIのスキルをAntigravity等のコーディングエージェントに入れると、オフラインの音声翻訳機(Gemma Translator)のような多段の作業をエージェントに任せられる。IoT向けにバイナリの配布サイズも小さいとする(比較表は画像)。

遅い秒間トークンが速く感じる理由

  • 「デコード9トークン/秒」は文章生成としては遅い部類だが、E2Bのトークナイザが1トークンに多くの文字を詰めるため、体感の文字数は人の話速を上回る、という説明。日本語での文字/トークン比は本文にない
  • GPUが「CPUより弱い」と明記したうえで、負荷の分離(熱と優先度)のために使う、という整理は、当サイトの車載エージェントでも同じ悩みがあった
  • ロボット側の記事として読むと、ADK for Kotlinの端末内エージェントがAndroid、こちらがLinux SBC、と住み分けている
  • ベンチマークはGoogle側の測定で、温度や電源による変動は書かれていない

原文の数字は確認、実機未検証

この記事の下調べで、筆者は9月18日にGoogle Developersのブログを取得し、5モデルの説明・99/9トークン/秒・1,432MB・約4.2文字/トークン・約27.3文字/秒・GPUとCPUのFLOPS・Reachy Miniの4系統・CLIのインストール手順がその原文にあることを確認した。GitHubのサンプルは開いていない。筆者はRaspberry Pi 5でLiteRTを動かしていない。

E4Bの数字・日本語効率・電力は未記載

  • Gemma 4 E4Bの速度とメモリ
  • 日本語でのトークン効率
  • 消費電力と発熱

出典:Raspberry Pi向け技術記事

関連記事

シェア: ポスト はてブ

出典・参照資料

AIニュースの解説を動画でも

YouTubeでは注目ニュースの背景を解説し、Xでは新着記事をお知らせしています。

コメント

まだコメントはありません。最初のコメントを書いてみませんか?

AIについて聞きたいことはありますか?

質問箱で無料で受け付けています。回答は公開され、他の方の参考にもなります。

質問箱を見る →

新しい記事をメールで受け取る

AIの新しい発表を、出典付きで整理して届けます。

関連記事

車をチャットルームの一員にする──Raspberry Pi 5に35BのQwenを載せて完全オフラインで動かすCarWatchの記事画像
検証09.01読了16分

車をチャットルームの一員にする──Raspberry Pi 5に35BのQwenを載せて完全オフラインで動かすCarWatch

出典 ─ ThinkOffApp/CarWatch(G
ローカルLLMは音声対話に向かないのか──「1〜2秒」の壁をハードウェアごとに検証するの記事画像
活用09.01読了16分

ローカルLLMは音声対話に向かないのか──「1〜2秒」の壁をハードウェアごとに検証する

出典 ─ Build a Fully Offline
Google「ADK for Kotlin 1.0」が正式版──Python版・Java版のADK 1.0と同じ機能に加え、Android向けの端末内エージェント(LiteRT-LM・ML Kitベータ)、Firebase AI Logicのハイブリッド、RoomとAppSearchで状態の保存。@Toolと@Paramでスキーマを自動生成、SKILL.mdで手順を段階的に読むの記事画像
検証09.25読了6分

Google「ADK for Kotlin 1.0」が正式版──Python版・Java版のADK 1.0と同じ機能に加え、Android向けの端末内エージェント(LiteRT-LM・ML Kitベータ)、Firebase AI Logicのハイブリッド、RoomとAppSearchで状態の保存。@Toolと@Paramでスキーマを自動生成、SKILL.mdで手順を段階的に読む

出典 ─ Google for Developers(Guillaume Laforge・2026年9月9日・9月18日取得)
オンデバイスAIとは──iPhoneのApple IntelligenceとAndroidのGemini Nano、仕組みの違いの記事画像
モデル09.04読了13分

オンデバイスAIとは──iPhoneのApple IntelligenceとAndroidのGemini Nano、仕組みの違い

出典 ─ How to get Apple Intel
LM Studioの使い方と料金【2026年9月版】──無料でローカルLLMを動かす手順(Mac M1〜M4・Windows・Linux、16GB推奨、4bit以上の量子化)、OpenAI互換API・MCP・文書チャット、新アプリ「Bionic」とBionic+ $20/Pro $100のクラウド(Kimi K3・GLM 5.3・DeepSeek V4 Flash、ZDR)の記事画像
活用09.25読了11分

LM Studioの使い方と料金【2026年9月版】──無料でローカルLLMを動かす手順(Mac M1〜M4・Windows・Linux、16GB推奨、4bit以上の量子化)、OpenAI互換API・MCP・文書チャット、新アプリ「Bionic」とBionic+ $20/Pro $100のクラウド(Kimi K3・GLM 5.3・DeepSeek V4 Flash、ZDR)

出典 ─ LM Studio Docs(Welcome
Google「LiteRT.js」──.tfliteモデルをブラウザで動かすJavaScript版LiteRT。TensorFlow.jsのJSカーネルでなくネイティブのランタイムをWebAssemblyで提供し、CPU(XNNPACK)・GPU(WebGPU)・NPU(WebNN)を使い分け。他のWebランタイム比で最大3倍、CPU比でGPU/NPUは5〜60倍の記事画像
検証09.27読了6分

Google「LiteRT.js」──.tfliteモデルをブラウザで動かすJavaScript版LiteRT。TensorFlow.jsのJSカーネルでなくネイティブのランタイムをWebAssemblyで提供し、CPU(XNNPACK)・GPU(WebGPU)・NPU(WebNN)を使い分け。他のWebランタイム比で最大3倍、CPU比でGPU/NPUは5〜60倍

出典 ─ Google Developers Blog(Ping Yu・Marko Ristić・Matthew Soulanille・Chintan Parikh・2026年7月9日・9月18日取得)
Mac Studio 1台か、Mac mini 3台の分散推論か──exoのTB5 RDMAクラスタ機能を公式READMEで確認したの記事画像
検証09.07読了14分

Mac Studio 1台か、Mac mini 3台の分散推論か──exoのTB5 RDMAクラスタ機能を公式READMEで確認した

出典 ─ README (GitHub)
手元のメモリを99.998%まで使い切る量子化ツール「shoehorn」──プリセットGGUFをやめる発想の記事画像
検証09.07読了13分

手元のメモリを99.998%まで使い切る量子化ツール「shoehorn」──プリセットGGUFをやめる発想

出典 ─ make any language model fit your machine