AI時短ラボ
検索
モデル

Google「EmbeddingGemma 2」公開文字・画像・動画・音声を1つのベクトルにする7.4億パラメータのオープンモデル、手元のMacで日本語の検索を試した

執筆:約12分で読めます

Google DeepMindが2026年10月6日、文字・コード・画像・動画・音声を1つの埋め込み空間にまとめるオープンモデル「EmbeddingGemma 2」を公開した。7.4億パラメータ・Apache 2.0で、コード検索のMTEB Codeは初代の68.76から78.68に上がった。手元のMacでは日本語の言い換え検索8問・文から画像を探す10問がすべて1位で当たったが、公開直後の時点では公式の手順どおりに入れたライブラリでは動かなかった。

濃紺の背景に重なった薄い板と「EmbeddingGemma 2」の文字
画像:画像: Google(公式ブログのOG画像)
目次

Google DeepMind は2026年10月6日(日本時間7日午前1時)、埋め込みモデル「EmbeddingGemma 2(エンベディングジェマ2)」を公開した。文章だけでなく、コード・画像・動画・音声まで、同じ768次元の空間に置けるのが初代からの大きな変化だ。重みは Hugging Face と Kaggle で公開されていて、ライセンスは商用で使える Apache 2.0。筆者も手元の Mac に入れ、日本語の検索を小さく試した。結果は後半にまとめた(本記事の情報は2026年10月7日午前1時30分・日本時間時点)。

  • Google DeepMind が、文字・コード・画像・動画・音声を1つの埋め込み空間にまとめる EmbeddingGemma 2(7.4億パラメータ・Apache 2.0)を公開した
  • モデルカードによると、コード検索の MTEB Code は初代の 68.76→78.68。多言語の文章検索(MTEB多言語)は 61.15→61.36 でほぼ同じ
  • 筆者の Mac では日本語の言い換え検索8問・文から画像を探す10問がすべて1位で当たった。ただし公開直後は、公式の手順どおり pip install -U で入る transformers(5.18.0)では読み込めなかった

EmbeddingGemma 2 は何をするモデルか

埋め込みモデルは、文章や画像を「意味の近さを測れる数字の並び(ベクトル)」に変える道具だ。検索アプリの裏側や、AI に社内文書を読ませる RAG(検索拡張生成)の「探す」部分で使われる。

Google のブログによると、初代の EmbeddingGemma(2025年公開)は文章専用で、ダウンロードは2,000万回を超えた。2代目はここに画像・動画・音声を足した。ブログは使い道の例として「声のメモから特定の動画の場面を探す」「何時間もの録音を文字で検索する」を挙げている。それを1つのモデルで、端末の中だけで済ませられる、という説明だ。

公式に書かれている仕様を表にまとめた。

項目 EmbeddingGemma 2
パラメータ 合計7.4億(文字2.7億+画像1.7億+音声3億)
もとの設計 Gemma 4
ライセンス Apache 2.0
出力 768次元(512・256・128次元に縮められる)
文脈の長さ 8,192トークン(初代の4倍)。音声なら約5.5分、画像29枚、動画58コマまで
言語 100以上
必要なメモリ(Google の測定) Pixel 11 Pro・量子化ありで、文字だけ約191MB、全部入り約567MB
入手先 Hugging Face・Kaggle(Gemini Enterprise Agent Platform の Model Garden は「coming soon」)

部品を選んで読み込めるのが特徴で、モデルカードには「文字だけなら2.7億、文字+画像で4.4億、文字+音声で5.7億」と書かれている。どの組み合わせでも出力は同じ空間に入る。開発者ガイドによると、文字だけで作った検索の索引に、あとから画像を足しても作り直しは要らない。

モデルカードの数字

モデルカードの評価表(768次元・量子化なし)から抜き出した。初代との比較が載っているのは文章の2項目だけで、画像・動画・音声は初代が対応していないので「-」になっている。

分野 ベンチマーク EmbeddingGemma 2 初代
文章 MTEB(多言語 v2) 61.36 61.15
コード MTEB(Code v1) 78.68 68.76
画像 MIEB(lite) 64.64 -
画像 MMEB v2 Image 57.28 -
文書の画像 MMEB v2 VisDoc 67.84 -
動画 MMEB v2 Video 50.67 -
音声 MSEB(Retrieval) 69.54 -
音声 MAEB 49.39 -

伸びたのはコードで、ブログは「9.92ポイント改善」、モデルカードは「約14%改善」と書いている(78.68÷68.76=1.144なので、2つの表現は同じ数字を指している)。ブログはほかに「10億パラメータ未満の多モーダル埋め込みモデルの中で首位」「多くの大きなモデルと同等かそれ以上」「2倍以上大きい専門モデルの一部にも勝つ」と主張している。ただ、今回確認した資料(ブログ・モデルカード・開発者ブログ2本)には、他社モデルの名前を並べた比較表は無かった。

ベクトルを短くしたときの落ち方も載っている。モデルカードは「256次元までは品質への影響は小さい」としていて、MTEB多言語は 61.36→60.41、コードは 78.68→76.18 だった。128次元では、画像・動画を含む MMEB の総合が 59.01→45.65 と大きく下がる。モデルカードは「128次元は文章だけの用途向き」としている。

スマホではどう使えるのか

Google AI Edge チームのブログによると、スマホ向けのお試しアプリ「Google AI Edge Gallery」に、EmbeddingGemma 2 を使った2つの機能が入った。

  • Instant Media Search: 端末の写真・動画を、言葉や見本の画像で探す。打つたびに結果が変わる
  • Video Moments Finder: 動画の中の場面を、文字か音声で探す

同じブログは「今後数週間で Android の ML Kit からサービスとして使えるようにする」とも書いている。ブログの説明では、計算は端末の中で行い、ネット接続は要らない。

手元のMacで日本語の検索を試した

ここからは筆者の観測だ。2026年10月7日午前1時過ぎ(日本時間)、M5 Max(メモリ64GB)の Mac で、開発者ガイドの書き方どおり sentence-transformers から使った。読み込んだのは文字+画像の構成(4.4億パラメータ)で、Apple の GPU(MPS)で動いた。

最初は読み込めなかった

モデルカードの手順は pip install -U sentence-transformers transformers だ。この手順で入るのは、PyPI の最新版の transformers 5.18.0(9月30日公開)になる。ところがこれでは、モデルの種類を示す embedding_gemma2 を知らないというエラー(KeyError: 'embedding_gemma2')で止まった。GitHub の開発版(5.19.0.dev0)にも、この時点ではまだ入っていなかった。

対応するコードは、transformers の公式リポジトリ上のブランチから10月6日15時43分(UTC)に出されたプルリクエスト #49364 にあった。中身は32ファイル・6,571行の追加で、取得時点では未マージだった。このブランチを入れると動いた(sentence-transformers は 6.1.0)。正式版に入るまでは、公式の手順どおりに入れても動かないので、公開直後に試す人は注意がいる。

日本語の言い換え検索:8問とも1位

身の回りの話題の短文を8本用意した。料理・通勤費・ペット・確定申告・機種変更・梅雨の洗濯・自由研究・PCのバッテリーだ。それぞれを、本文と同じ単語をなるべく使わない質問で探した。たとえば「冷蔵庫に残っていた卵とネギで、10分でできるチャーハンを作った」を「余り物でささっと作れる夕飯」で探す、といった具合だ。

設定 1位で当たった数 1位と2位の点差(平均/最小)
768次元 8問中8問 0.120/0.050
128次元 8問中8問 0.073/0.019

128次元に縮めても当たりは変わらなかった。ただ、2位との差は平均で4割ほど縮んだ。いちばん際どかったのは「ペットのせいで寝不足」で、128次元では正解(猫の夜鳴き)と2位(PCのバッテリー)の差が0.019しかなかった。

文から画像を探す:10問とも1位

画像には、同じ日に Google AI Studio が Nano Banana 2.1 の発表で添えた作例4枚を使った。ハイランド牛をなでる男性・雪山の赤い小屋・水滴のついた甲虫・ピンクの建物の外階段を降りる女性の4枚だ。日本語8問と英語2問で探した。

  • 見たままの描写(「牛をなでているおじさん」「雪山にぽつんと建つ赤い小屋」など4問):4問とも1位
  • 写っている物の名前を出さない言い方(「スコットランドの高原」「夕日」「マクロ撮影」「アメリカのモーテル」):4問とも1位
  • 英語(「a man petting a highland cow」など2問):2問とも1位

際どかったのは「夕日」だ。正解の雪山の写真が0.640、2位のモーテルの写真が0.614で、差は0.026だった。モーテルの写真も夕方の斜めの光で撮られているので、近く出るのは自然に見える。

時間とメモリは次のとおりだった。

項目 実測
モデルの読み込み 1.02秒
文章16本をベクトルに 1.60秒(初回の準備込み)
画像4枚をベクトルに 1.05秒
処理全体の最大メモリ 約1.27GB

この試験で言えること・言えないこと

今回の試験は、文書8本・画像4枚・質問18問という小さなものだ。しかも質問は筆者が作った。ベンチマークの代わりにはならない。「日本語で普通に言い換えた程度なら、取り違えずに探せた」ところまでが言えることだ。

メモリの約1.27GB は、Python とライブラリを含めた処理全体の値で、量子化もしていない。Google が示した「全部入りで約567MB」(Pixel 11 Pro・量子化あり)とは条件が違うので、比べられない。音声と動画は今回試していない。

誰に関係がありそうか

  • 社内文書や手元のファイルを AI に探させたい人:文章だけなら2.7億パラメータで動く。ノートPCの中で完結する RAG の「探す」部分に使える
  • 写真や動画を言葉で探したい人:スマホの AI Edge Gallery で試せる。Google の予定どおり ML Kit に入れば、ほかの Android アプリからも使えるようになる
  • コード検索を自前で組みたい人:今回いちばん数字が伸びたのがコードで、Google は開発者ガイドで transformers のコード全体を索引にした実演を見せている

同じ10月6日には、画像生成の Nano Banana 2.1 も Google AI Studio と Gemini API で公開された。こちらは別途扱う。

出典と確認できていないこと

  • 仕様と数字は Google のブログ・モデルカード・開発者ブログ2本(いずれも2026年10月6日)による。「同じ大きさで首位」はブログの主張で、比べた相手の一覧は今回確認した4本の資料には無かった
  • 手元の試験は2026年10月7日午前1時過ぎ(日本時間)に筆者が行ったもの。transformers の正式版が出たあとは、PR のブランチを入れる手順は要らなくなるはず。出たら追記する
  • Model Garden での提供は、ブログの表現では「coming soon」
シェア: ポスト はてブ

出典・参照資料

AI時短ラボ

大きいニュースはYouTubeでも解説しています。Xでは新着記事をお知らせしています。

コメント

まだコメントはありません。最初のコメントを書いてみませんか?

AIについて聞きたいことはありますか?

質問箱で無料で受け付けています。回答は公開され、他の方の参考にもなります。

質問箱を見る →

関連記事

RAG(検索拡張生成)とは?仕組みと導入方法【2026年解説】の記事画像

RAG(検索拡張生成)とは?仕組みと導入方法【2026年解説】

活用
Gemma 4 12BをMacのローカルで「エージェント用の土台」にする──Google AI Edgeの手順。LiteRT-LM CLIの新コマンド`serve`でOpenAI互換のローカルサーバーを立て、OpenClaw・Hermes・OpenCode・Aiderをそのまま向ける。AI Edge GalleryのmacOS版はPythonを書いて実行、Eloquentは音声で書き換えの記事画像

Gemma 4 12BをMacのローカルで「エージェント用の土台」にする Google AI Edgeの手順。LiteRT-LM CLIの新コマンド`serve`でOpenAI互換のローカルサーバーを立て、OpenClaw・Hermes・OpenCode・Aiderをそのまま向ける。AI Edge GalleryのmacOS版はPythonを書いて実行、Eloquentは音声で書き換え

検証(発表 6月3日)
Gemmaの累計ダウンロードが10億超──Google公式発表と「Awesome Gemma」の中身の記事画像

Gemmaの累計ダウンロードが10億超 Google公式発表と「Awesome Gemma」の中身

モデル
Raspberry Pi 5でGemma 4 E2Bをオフライン実行──LiteRT-LMでプリフィル99トークン/秒・デコード9トークン/秒・ピークメモリ1,432MB、生成は約300語/分(人の会話の2倍)。GPUにYOLOの物体検出を逃がし、CPUでMoonshineの音声認識・Gemma・TTSを回すReachy Miniロボットの構成。pip install litert-cliで開始の記事画像

Raspberry Pi 5でGemma 4 E2Bをオフライン実行 LiteRT-LMでプリフィル99トークン/秒・デコード9トークン/秒・ピークメモリ1,432MB、生成は約300語/分(人の会話の2倍)。GPUにYOLOの物体検出を逃がし、CPUでMoonshineの音声認識・Gemma・TTSを回すReachy Miniロボットの構成。pip install litert-cliで開始

検証(発表 8月11日)
Nano Banana(ナノバナナ)とは──Googleの画像生成モデル4種(2 Lite・2・Pro・初代)の違い、API価格(1枚$0.034〜$0.24)、Geminiアプリでの使い方、参照画像14枚・4K・検索グラウンディング、初代の10月2日停止までの記事画像

Nano Banana(ナノバナナ)とは Googleの画像生成モデル4種(2 Lite・2・Pro・初代)の違い、API価格(1枚$0.034〜$0.24)、Geminiアプリでの使い方、参照画像14枚・4K・検索グラウンディング、初代の10月2日停止まで

モデル
Google「LiteRT.js」──.tfliteモデルをブラウザで動かすJavaScript版LiteRT。TensorFlow.jsのJSカーネルでなくネイティブのランタイムをWebAssemblyで提供し、CPU(XNNPACK)・GPU(WebGPU)・NPU(WebNN)を使い分け。他のWebランタイム比で最大3倍、CPU比でGPU/NPUは5〜60倍の記事画像

Google「LiteRT.js」 .tfliteモデルをブラウザで動かすJavaScript版LiteRT。TensorFlow.jsのJSカーネルでなくネイティブのランタイムをWebAssemblyで提供し、CPU(XNNPACK)・GPU(WebGPU)・NPU(WebNN)を使い分け。他のWebランタイム比で最大3倍、CPU比でGPU/NPUは5〜60倍

検証(発表 7月9日)
Qwen3.8-27Bが公開──1枚のGPUに収まる密モデルで動画も読める、ダウンロード330万回・likes 1.3万で中国勢8月最多の記事画像

Qwen3.8-27Bが公開 1枚のGPUに収まる密モデルで動画も読める、ダウンロード330万回・likes 1.3万で中国勢8月最多

モデル
派手な発表の裏で静かに公開された中国勢3モデル──文書検索・マルチモーダル埋め込み・動画編集パイプライン【2026年8月】の記事画像

派手な発表の裏で静かに公開された中国勢3モデル 文書検索・マルチモーダル埋め込み・動画編集パイプライン【2026年8月】

モデル