AI時短ラボ
検証· 約6分

Google「LiteRT.js」──.tfliteモデルをブラウザで動かすJavaScript版LiteRT。TensorFlow.jsのJSカーネルでなくネイティブのランタイムをWebAssemblyで提供し、CPU(XNNPACK)・GPU(WebGPU)・NPU(WebNN)を使い分け。他のWebランタイム比で最大3倍、CPU比でGPU/NPUは5〜60倍

Googleは2026年7月9日、端末内推論ライブラリLiteRTのJavaScriptバインディング「LiteRT.js」を公開した。TensorFlow.jsが性能の劣るJavaScriptベースのカーネルに頼っていたのに対し、ネイティブのランタイムをWebAssembly経由で提供し、.tfliteモデルをブラウザ内で動かす(プライバシー・サーバー費用ゼロ・低遅延)。CPUはXNNPACK、GPUはML DriftによるWebGPU、NPUはChromeとEdgeで実験中のWebNN。PyTorchモデルはLiteRT Torchで1段階変換、AI Edge Quantizerで層ごとの量子化。他のWebランタイム比で最大3倍、CPU比でWebGPU/WebNNは5〜60倍(M4 MacBook Proでの測定)。npmパッケージとデモ(EmbeddingGemmaのベクトル検索、YOLO26の物体検出、Depth Anything V2の3D点群、Real-ESRGANの4倍アップスケール)を同時公開。

Google「LiteRT.js」──.tfliteモデルをブラウザで動かすJavaScript版LiteRT。TensorFlow.jsのJSカーネルでなくネイティブのランタイムをWebAssemblyで提供し、CPU(XNNPACK)・GPU(WebGPU)・NPU(WebNN)を使い分け。他のWebランタイム比で最大3倍、CPU比でGPU/NPUは5〜60倍
執筆・編集:
目次

2026年9月18日・日本時間時点の情報です。 Google Developersのブログ(7月9日)を読んだ。2か月前の記事だが、「ブラウザの中でモデルを動かす」道具の世代交代(TensorFlow.js→LiteRT.js)として日本語で扱われていなかったので残す。同じLiteRTの組み込み機側はRaspberry Pi 5の記事に。

3行まとめ

  1. 何か。 LiteRT.jsは、端末内推論ライブラリLiteRTのJavaScriptバインディング。従来のTensorFlow.jsが性能の劣るJavaScriptベースのカーネルに頼っていたのに対し、Android・iOS・デスクトップと共通のネイティブのランタイムをWebAssembly経由でそのまま提供し、.tfliteモデルをブラウザ内で動かす。利点はプライバシー(データが出ない)・サーバー費用ゼロ・低遅延で、既存の.tflite資産の移行先として「TensorFlow.jsからの進化形」と位置づける。共通スタックなので、モバイル向けに入った量子化やハードウェア最適化がWebにも自動で乗る。
  2. 性能の出し方。 CPUはXNNPACK(マルチスレッド・relaxed SIMD)、GPUはML DriftによるWebGPU、NPUはWebNN(ChromeとEdgeで実験中)。PyTorchモデルはLiteRT Torchで1段階変換、AI Edge Quantizerで層ごとに量子化方式を変えられる。測定では、古典的な視覚・音声モデルで他のWebランタイム比最大3倍、CPU実行に対してWebGPU/WebNN(Apple CoreML経由)は5〜60倍(2024年のM4 MacBook Pro、制御されたブラウザ環境。GPU・熱・ドライバで変動すると注記)。
  3. デモと周辺。 npmパッケージとデモを同時公開。EmbeddingGemmaによるブラウザ内ベクトル検索、Ultralytics YOLO26のリアルタイム物体検出、Depth Anything V2でWebカメラ映像を3D点群に、Real-ESRGANで画像を4倍アップスケール。UltralyticsのPythonパッケージに公式のLiteRTエクスポートが入り、モバイル・エッジ・ブラウザへ数行で出せる。

用途の範囲と倍率数字の前提条件

  • 「サーバーを持たずに視覚・音声モデルを配る」用途(社内ツール、デモ、教育)で、TensorFlow.jsを使っていた人の移行先が公式に示された、という話。LLMをブラウザで回す話ではなく、デモも視覚・埋め込み中心
  • 3倍・5〜60倍はGoogleの測定で、比較対象の「他のWebランタイム」の名前は本文にない。M4 MacBook Proの数字なので、Windowsの内蔵GPUやスマホでは別物になる
  • NPU(WebNN)は「実験中」で、Safariの対応は書かれていない
  • 端末内AIの全体像はGemini Nano対Appleの端末内AIに

バックエンドと倍率は確認、実行はせず

この記事の下調べで、筆者は9月18日にGoogle Developersのブログを取得し、3つのバックエンド・変換と量子化の道具・最大3倍・5〜60倍・測定環境の注記・4つのデモ・Ultralyticsのエクスポートがその原文にあることを確認した。npmパッケージとデモは開いていない。筆者はLiteRT.jsをブラウザで動かしていない。

Safari対応・サイズ・LLM対応は不明

  • 対応ブラウザの一覧(Safariを含む)
  • パッケージのサイズ
  • LLM(Gemma等)のブラウザ内実行への対応

出典:LiteRT.jsの技術記事

関連記事

シェア: ポスト はてブ

出典・参照資料

AIニュースの解説を動画でも

YouTubeでは注目ニュースの背景を解説し、Xでは新着記事をお知らせしています。

コメント

まだコメントはありません。最初のコメントを書いてみませんか?

AIについて聞きたいことはありますか?

質問箱で無料で受け付けています。回答は公開され、他の方の参考にもなります。

質問箱を見る →

新しい記事をメールで受け取る

AIの新しい発表を、出典付きで整理して届けます。

関連記事

Raspberry Pi 5でGemma 4 E2Bをオフライン実行──LiteRT-LMでプリフィル99トークン/秒・デコード9トークン/秒・ピークメモリ1,432MB、生成は約300語/分(人の会話の2倍)。GPUにYOLOの物体検出を逃がし、CPUでMoonshineの音声認識・Gemma・TTSを回すReachy Miniロボットの構成。pip install litert-cliで開始の記事画像
検証09.27読了7分

Raspberry Pi 5でGemma 4 E2Bをオフライン実行──LiteRT-LMでプリフィル99トークン/秒・デコード9トークン/秒・ピークメモリ1,432MB、生成は約300語/分(人の会話の2倍)。GPUにYOLOの物体検出を逃がし、CPUでMoonshineの音声認識・Gemma・TTSを回すReachy Miniロボットの構成。pip install litert-cliで開始

出典 ─ Google Developers Blog(Lu Wang・Terry Heo・Naushir Patuck/Raspberry Pi Ltd・José María Casanova/Igalia・2026年8月11日・9月18日取得)
オンデバイスAIとは──iPhoneのApple IntelligenceとAndroidのGemini Nano、仕組みの違いの記事画像
モデル09.04読了13分

オンデバイスAIとは──iPhoneのApple IntelligenceとAndroidのGemini Nano、仕組みの違い

出典 ─ How to get Apple Intel
LM Studioの使い方と料金【2026年9月版】──無料でローカルLLMを動かす手順(Mac M1〜M4・Windows・Linux、16GB推奨、4bit以上の量子化)、OpenAI互換API・MCP・文書チャット、新アプリ「Bionic」とBionic+ $20/Pro $100のクラウド(Kimi K3・GLM 5.3・DeepSeek V4 Flash、ZDR)の記事画像
活用09.25読了11分

LM Studioの使い方と料金【2026年9月版】──無料でローカルLLMを動かす手順(Mac M1〜M4・Windows・Linux、16GB推奨、4bit以上の量子化)、OpenAI互換API・MCP・文書チャット、新アプリ「Bionic」とBionic+ $20/Pro $100のクラウド(Kimi K3・GLM 5.3・DeepSeek V4 Flash、ZDR)

出典 ─ LM Studio Docs(Welcome
Google「ADK for Kotlin 1.0」が正式版──Python版・Java版のADK 1.0と同じ機能に加え、Android向けの端末内エージェント(LiteRT-LM・ML Kitベータ)、Firebase AI Logicのハイブリッド、RoomとAppSearchで状態の保存。@Toolと@Paramでスキーマを自動生成、SKILL.mdで手順を段階的に読むの記事画像
検証09.25読了6分

Google「ADK for Kotlin 1.0」が正式版──Python版・Java版のADK 1.0と同じ機能に加え、Android向けの端末内エージェント(LiteRT-LM・ML Kitベータ)、Firebase AI Logicのハイブリッド、RoomとAppSearchで状態の保存。@Toolと@Paramでスキーマを自動生成、SKILL.mdで手順を段階的に読む

出典 ─ Google for Developers(Guillaume Laforge・2026年9月9日・9月18日取得)
Qwen3.8-27Bが公開──1枚のGPUに収まる密モデルで動画も読める、ダウンロード330万回・likes 1.3万で中国勢8月最多の記事画像
モデル09.07読了18分

Qwen3.8-27Bが公開──1枚のGPUに収まる密モデルで動画も読める、ダウンロード330万回・likes 1.3万で中国勢8月最多

出典 ─ Hugging Face
Gemmaの累計ダウンロードが10億超──Google公式発表と「Awesome Gemma」の中身の記事画像
モデル09.02読了14分

Gemmaの累計ダウンロードが10億超──Google公式発表と「Awesome Gemma」の中身

出典 ─ Google Blog
Google「Credentio」──C2PAコンテンツ認証情報を検証するC++ライブラリをオープンソース化。約40のGoogle製品で数百億件の生成物を扱ってきたのと同じコードで、仕様2.2と2.4に対応。完全にローカルで検証(送信なし・即時判定)、数GBの動画でもメモリ消費は小さく、公式のC2PA Trust Listを渡せる。生成・埋め込みは今後の記事画像
検証09.27読了6分

Google「Credentio」──C2PAコンテンツ認証情報を検証するC++ライブラリをオープンソース化。約40のGoogle製品で数百億件の生成物を扱ってきたのと同じコードで、仕様2.2と2.4に対応。完全にローカルで検証(送信なし・即時判定)、数GBの動画でもメモリ消費は小さく、公式のC2PA Trust Listを渡せる。生成・埋め込みは今後

出典 ─ Google Developers Blog(Sherif Hanna・2026年8月13日・9月18日取得)
Google DeepMind「クライアントSDKの生成はオープンであるべき」──2026年5月、使っていたSDK生成ベンダーが買収され突然の終了。Interactions APIのGA直前に乗り換え、Speakeasyと組んでOpenAPI生成スイートをAGPLv3でオープンソース化。7言語のSDK・エージェント向けCLI・ドキュメントMCPサーバーを生成、6ターゲットを約1人で保守の記事画像
検証09.27読了6分

Google DeepMind「クライアントSDKの生成はオープンであるべき」──2026年5月、使っていたSDK生成ベンダーが買収され突然の終了。Interactions APIのGA直前に乗り換え、Speakeasyと組んでOpenAPI生成スイートをAGPLv3でオープンソース化。7言語のSDK・エージェント向けCLI・ドキュメントMCPサーバーを生成、6ターゲットを約1人で保守

出典 ─ Google Developers Blog(Amir Hardon・Philipp Schmid・2026年9月17日・9月18日取得)