Google「LiteRT.js」──.tfliteモデルをブラウザで動かすJavaScript版LiteRT。TensorFlow.jsのJSカーネルでなくネイティブのランタイムをWebAssemblyで提供し、CPU(XNNPACK)・GPU(WebGPU)・NPU(WebNN)を使い分け。他のWebランタイム比で最大3倍、CPU比でGPU/NPUは5〜60倍
Googleは2026年7月9日、端末内推論ライブラリLiteRTのJavaScriptバインディング「LiteRT.js」を公開した。TensorFlow.jsが性能の劣るJavaScriptベースのカーネルに頼っていたのに対し、ネイティブのランタイムをWebAssembly経由で提供し、.tfliteモデルをブラウザ内で動かす(プライバシー・サーバー費用ゼロ・低遅延)。CPUはXNNPACK、GPUはML DriftによるWebGPU、NPUはChromeとEdgeで実験中のWebNN。PyTorchモデルはLiteRT Torchで1段階変換、AI Edge Quantizerで層ごとの量子化。他のWebランタイム比で最大3倍、CPU比でWebGPU/WebNNは5〜60倍(M4 MacBook Proでの測定)。npmパッケージとデモ(EmbeddingGemmaのベクトル検索、YOLO26の物体検出、Depth Anything V2の3D点群、Real-ESRGANの4倍アップスケール)を同時公開。

2026年9月18日・日本時間時点の情報です。 Google Developersのブログ(7月9日)を読んだ。2か月前の記事だが、「ブラウザの中でモデルを動かす」道具の世代交代(TensorFlow.js→LiteRT.js)として日本語で扱われていなかったので残す。同じLiteRTの組み込み機側はRaspberry Pi 5の記事に。
3行まとめ
- 何か。 LiteRT.jsは、端末内推論ライブラリLiteRTのJavaScriptバインディング。従来のTensorFlow.jsが性能の劣るJavaScriptベースのカーネルに頼っていたのに対し、Android・iOS・デスクトップと共通のネイティブのランタイムをWebAssembly経由でそのまま提供し、.tfliteモデルをブラウザ内で動かす。利点はプライバシー(データが出ない)・サーバー費用ゼロ・低遅延で、既存の.tflite資産の移行先として「TensorFlow.jsからの進化形」と位置づける。共通スタックなので、モバイル向けに入った量子化やハードウェア最適化がWebにも自動で乗る。
- 性能の出し方。 CPUはXNNPACK(マルチスレッド・relaxed SIMD)、GPUはML DriftによるWebGPU、NPUはWebNN(ChromeとEdgeで実験中)。PyTorchモデルはLiteRT Torchで1段階変換、AI Edge Quantizerで層ごとに量子化方式を変えられる。測定では、古典的な視覚・音声モデルで他のWebランタイム比最大3倍、CPU実行に対してWebGPU/WebNN(Apple CoreML経由)は5〜60倍(2024年のM4 MacBook Pro、制御されたブラウザ環境。GPU・熱・ドライバで変動すると注記)。
- デモと周辺。 npmパッケージとデモを同時公開。EmbeddingGemmaによるブラウザ内ベクトル検索、Ultralytics YOLO26のリアルタイム物体検出、Depth Anything V2でWebカメラ映像を3D点群に、Real-ESRGANで画像を4倍アップスケール。UltralyticsのPythonパッケージに公式のLiteRTエクスポートが入り、モバイル・エッジ・ブラウザへ数行で出せる。
用途の範囲と倍率数字の前提条件
- 「サーバーを持たずに視覚・音声モデルを配る」用途(社内ツール、デモ、教育)で、TensorFlow.jsを使っていた人の移行先が公式に示された、という話。LLMをブラウザで回す話ではなく、デモも視覚・埋め込み中心
- 3倍・5〜60倍はGoogleの測定で、比較対象の「他のWebランタイム」の名前は本文にない。M4 MacBook Proの数字なので、Windowsの内蔵GPUやスマホでは別物になる
- NPU(WebNN)は「実験中」で、Safariの対応は書かれていない
- 端末内AIの全体像はGemini Nano対Appleの端末内AIに
バックエンドと倍率は確認、実行はせず
この記事の下調べで、筆者は9月18日にGoogle Developersのブログを取得し、3つのバックエンド・変換と量子化の道具・最大3倍・5〜60倍・測定環境の注記・4つのデモ・Ultralyticsのエクスポートがその原文にあることを確認した。npmパッケージとデモは開いていない。筆者はLiteRT.jsをブラウザで動かしていない。
Safari対応・サイズ・LLM対応は不明
- 対応ブラウザの一覧(Safariを含む)
- パッケージのサイズ
- LLM(Gemma等)のブラウザ内実行への対応
出典:LiteRT.jsの技術記事
- LiteRT.js, Google's high performance Web AI Inference(Google Developers・2026年7月9日)
関連記事
出典・参照資料
AIニュースの解説を動画でも
YouTubeでは注目ニュースの背景を解説し、Xでは新着記事をお知らせしています。
コメント
まだコメントはありません。最初のコメントを書いてみませんか?
AIについて聞きたいことはありますか?
質問箱で無料で受け付けています。回答は公開され、他の方の参考にもなります。
質問箱を見る →新しい記事をメールで受け取る
AIの新しい発表を、出典付きで整理して届けます。