Google「EmbeddingGemma 2」公開文字・画像・動画・音声を1つのベクトルにする7.4億パラメータのオープンモデル、手元のMacで日本語の検索を試した
Google DeepMindが2026年10月6日、文字・コード・画像・動画・音声を1つの埋め込み空間にまとめるオープンモデル「EmbeddingGemma 2」を公開した。7.4億パラメータ・Apache 2.0で、コード検索のMTEB Codeは初代の68.76から78.68に上がった。手元のMacでは日本語の言い換え検索8問・文から画像を探す10問がすべて1位で当たったが、公開直後の時点では公式の手順どおりに入れたライブラリでは動かなかった。

目次
Google DeepMind は2026年10月6日(日本時間7日午前1時)、埋め込みモデル「EmbeddingGemma 2(エンベディングジェマ2)」を公開した。文章だけでなく、コード・画像・動画・音声まで、同じ768次元の空間に置けるのが初代からの大きな変化だ。重みは Hugging Face と Kaggle で公開されていて、ライセンスは商用で使える Apache 2.0。筆者も手元の Mac に入れ、日本語の検索を小さく試した。結果は後半にまとめた(本記事の情報は2026年10月7日午前1時30分・日本時間時点)。
- Google DeepMind が、文字・コード・画像・動画・音声を1つの埋め込み空間にまとめる EmbeddingGemma 2(7.4億パラメータ・Apache 2.0)を公開した
- モデルカードによると、コード検索の MTEB Code は初代の 68.76→78.68。多言語の文章検索(MTEB多言語)は 61.15→61.36 でほぼ同じ
- 筆者の Mac では日本語の言い換え検索8問・文から画像を探す10問がすべて1位で当たった。ただし公開直後は、公式の手順どおり
pip install -Uで入る transformers(5.18.0)では読み込めなかった
EmbeddingGemma 2 は何をするモデルか
埋め込みモデルは、文章や画像を「意味の近さを測れる数字の並び(ベクトル)」に変える道具だ。検索アプリの裏側や、AI に社内文書を読ませる RAG(検索拡張生成)の「探す」部分で使われる。
Google のブログによると、初代の EmbeddingGemma(2025年公開)は文章専用で、ダウンロードは2,000万回を超えた。2代目はここに画像・動画・音声を足した。ブログは使い道の例として「声のメモから特定の動画の場面を探す」「何時間もの録音を文字で検索する」を挙げている。それを1つのモデルで、端末の中だけで済ませられる、という説明だ。
公式に書かれている仕様を表にまとめた。
| 項目 | EmbeddingGemma 2 |
|---|---|
| パラメータ | 合計7.4億(文字2.7億+画像1.7億+音声3億) |
| もとの設計 | Gemma 4 |
| ライセンス | Apache 2.0 |
| 出力 | 768次元(512・256・128次元に縮められる) |
| 文脈の長さ | 8,192トークン(初代の4倍)。音声なら約5.5分、画像29枚、動画58コマまで |
| 言語 | 100以上 |
| 必要なメモリ(Google の測定) | Pixel 11 Pro・量子化ありで、文字だけ約191MB、全部入り約567MB |
| 入手先 | Hugging Face・Kaggle(Gemini Enterprise Agent Platform の Model Garden は「coming soon」) |
部品を選んで読み込めるのが特徴で、モデルカードには「文字だけなら2.7億、文字+画像で4.4億、文字+音声で5.7億」と書かれている。どの組み合わせでも出力は同じ空間に入る。開発者ガイドによると、文字だけで作った検索の索引に、あとから画像を足しても作り直しは要らない。
モデルカードの数字
モデルカードの評価表(768次元・量子化なし)から抜き出した。初代との比較が載っているのは文章の2項目だけで、画像・動画・音声は初代が対応していないので「-」になっている。
| 分野 | ベンチマーク | EmbeddingGemma 2 | 初代 |
|---|---|---|---|
| 文章 | MTEB(多言語 v2) | 61.36 | 61.15 |
| コード | MTEB(Code v1) | 78.68 | 68.76 |
| 画像 | MIEB(lite) | 64.64 | - |
| 画像 | MMEB v2 Image | 57.28 | - |
| 文書の画像 | MMEB v2 VisDoc | 67.84 | - |
| 動画 | MMEB v2 Video | 50.67 | - |
| 音声 | MSEB(Retrieval) | 69.54 | - |
| 音声 | MAEB | 49.39 | - |
伸びたのはコードで、ブログは「9.92ポイント改善」、モデルカードは「約14%改善」と書いている(78.68÷68.76=1.144なので、2つの表現は同じ数字を指している)。ブログはほかに「10億パラメータ未満の多モーダル埋め込みモデルの中で首位」「多くの大きなモデルと同等かそれ以上」「2倍以上大きい専門モデルの一部にも勝つ」と主張している。ただ、今回確認した資料(ブログ・モデルカード・開発者ブログ2本)には、他社モデルの名前を並べた比較表は無かった。
ベクトルを短くしたときの落ち方も載っている。モデルカードは「256次元までは品質への影響は小さい」としていて、MTEB多言語は 61.36→60.41、コードは 78.68→76.18 だった。128次元では、画像・動画を含む MMEB の総合が 59.01→45.65 と大きく下がる。モデルカードは「128次元は文章だけの用途向き」としている。
スマホではどう使えるのか
Google AI Edge チームのブログによると、スマホ向けのお試しアプリ「Google AI Edge Gallery」に、EmbeddingGemma 2 を使った2つの機能が入った。
- Instant Media Search: 端末の写真・動画を、言葉や見本の画像で探す。打つたびに結果が変わる
- Video Moments Finder: 動画の中の場面を、文字か音声で探す
同じブログは「今後数週間で Android の ML Kit からサービスとして使えるようにする」とも書いている。ブログの説明では、計算は端末の中で行い、ネット接続は要らない。
手元のMacで日本語の検索を試した
ここからは筆者の観測だ。2026年10月7日午前1時過ぎ(日本時間)、M5 Max(メモリ64GB)の Mac で、開発者ガイドの書き方どおり sentence-transformers から使った。読み込んだのは文字+画像の構成(4.4億パラメータ)で、Apple の GPU(MPS)で動いた。
最初は読み込めなかった
モデルカードの手順は pip install -U sentence-transformers transformers だ。この手順で入るのは、PyPI の最新版の transformers 5.18.0(9月30日公開)になる。ところがこれでは、モデルの種類を示す embedding_gemma2 を知らないというエラー(KeyError: 'embedding_gemma2')で止まった。GitHub の開発版(5.19.0.dev0)にも、この時点ではまだ入っていなかった。
対応するコードは、transformers の公式リポジトリ上のブランチから10月6日15時43分(UTC)に出されたプルリクエスト #49364 にあった。中身は32ファイル・6,571行の追加で、取得時点では未マージだった。このブランチを入れると動いた(sentence-transformers は 6.1.0)。正式版に入るまでは、公式の手順どおりに入れても動かないので、公開直後に試す人は注意がいる。
日本語の言い換え検索:8問とも1位
身の回りの話題の短文を8本用意した。料理・通勤費・ペット・確定申告・機種変更・梅雨の洗濯・自由研究・PCのバッテリーだ。それぞれを、本文と同じ単語をなるべく使わない質問で探した。たとえば「冷蔵庫に残っていた卵とネギで、10分でできるチャーハンを作った」を「余り物でささっと作れる夕飯」で探す、といった具合だ。
| 設定 | 1位で当たった数 | 1位と2位の点差(平均/最小) |
|---|---|---|
| 768次元 | 8問中8問 | 0.120/0.050 |
| 128次元 | 8問中8問 | 0.073/0.019 |
128次元に縮めても当たりは変わらなかった。ただ、2位との差は平均で4割ほど縮んだ。いちばん際どかったのは「ペットのせいで寝不足」で、128次元では正解(猫の夜鳴き)と2位(PCのバッテリー)の差が0.019しかなかった。
文から画像を探す:10問とも1位
画像には、同じ日に Google AI Studio が Nano Banana 2.1 の発表で添えた作例4枚を使った。ハイランド牛をなでる男性・雪山の赤い小屋・水滴のついた甲虫・ピンクの建物の外階段を降りる女性の4枚だ。日本語8問と英語2問で探した。
- 見たままの描写(「牛をなでているおじさん」「雪山にぽつんと建つ赤い小屋」など4問):4問とも1位
- 写っている物の名前を出さない言い方(「スコットランドの高原」「夕日」「マクロ撮影」「アメリカのモーテル」):4問とも1位
- 英語(「a man petting a highland cow」など2問):2問とも1位
際どかったのは「夕日」だ。正解の雪山の写真が0.640、2位のモーテルの写真が0.614で、差は0.026だった。モーテルの写真も夕方の斜めの光で撮られているので、近く出るのは自然に見える。
時間とメモリは次のとおりだった。
| 項目 | 実測 |
|---|---|
| モデルの読み込み | 1.02秒 |
| 文章16本をベクトルに | 1.60秒(初回の準備込み) |
| 画像4枚をベクトルに | 1.05秒 |
| 処理全体の最大メモリ | 約1.27GB |
この試験で言えること・言えないこと
今回の試験は、文書8本・画像4枚・質問18問という小さなものだ。しかも質問は筆者が作った。ベンチマークの代わりにはならない。「日本語で普通に言い換えた程度なら、取り違えずに探せた」ところまでが言えることだ。
メモリの約1.27GB は、Python とライブラリを含めた処理全体の値で、量子化もしていない。Google が示した「全部入りで約567MB」(Pixel 11 Pro・量子化あり)とは条件が違うので、比べられない。音声と動画は今回試していない。
誰に関係がありそうか
- 社内文書や手元のファイルを AI に探させたい人:文章だけなら2.7億パラメータで動く。ノートPCの中で完結する RAG の「探す」部分に使える
- 写真や動画を言葉で探したい人:スマホの AI Edge Gallery で試せる。Google の予定どおり ML Kit に入れば、ほかの Android アプリからも使えるようになる
- コード検索を自前で組みたい人:今回いちばん数字が伸びたのがコードで、Google は開発者ガイドで transformers のコード全体を索引にした実演を見せている
同じ10月6日には、画像生成の Nano Banana 2.1 も Google AI Studio と Gemini API で公開された。こちらは別途扱う。
出典と確認できていないこと
- 仕様と数字は Google のブログ・モデルカード・開発者ブログ2本(いずれも2026年10月6日)による。「同じ大きさで首位」はブログの主張で、比べた相手の一覧は今回確認した4本の資料には無かった
- 手元の試験は2026年10月7日午前1時過ぎ(日本時間)に筆者が行ったもの。transformers の正式版が出たあとは、PR のブランチを入れる手順は要らなくなるはず。出たら追記する
- Model Garden での提供は、ブログの表現では「coming soon」
出典・参照資料
- 一次資料Google「EmbeddingGemma 2 is a best-in-class open model for natively multimodal embeddings」(2026-10-06) ↗
- 一次資料Google AI for Developers「EmbeddingGemma 2 model card」 ↗
- 一次資料Google Developers Blog「EmbeddingGemma 2: The Developer Guide」(2026-10-06) ↗
- 一次資料Google Developers Blog「Bring multimodal semantic search to the edge with EmbeddingGemma 2」(2026-10-06) ↗
- 一次資料Hugging Face「google/embeddinggemma-2」 ↗
- 一次資料GitHub huggingface/transformers PR #49364(2026-10-07取得時点で未マージ) ↗
- 一次資料Google AI Studio 公式X(Nano Banana 2.1の発表・2026-10-06) ↗
大きいニュースはYouTubeでも解説しています。Xでは新着記事をお知らせしています。
コメント
まだコメントはありません。最初のコメントを書いてみませんか?
AIについて聞きたいことはありますか?
質問箱で無料で受け付けています。回答は公開され、他の方の参考にもなります。
質問箱を見る →