Google DeepMindはリリースしました EmbeddingGemma 2。これはテキスト、コード、画像、動画、音声を1つの768次元空間に埋め込むオープンなモデルです。740Mパラメータ、8Kトークンのコンテキストウィンドウを備え、Apache 2.0ライセンスで提供されます。オンデバイス検索、分類、プライバシー第一のRAGを狙いとしています。本記事では、 EmbeddingGemma 2 がこの分野にどう適合するかを分析、比較、紹介します。
今すぐデプロイ可能か? はい。重みはすでに Hugging Face と Kaggleで公開されており、 Ollama, llama.cpp GGUF および LiteRT ビルドも現在利用可能です。
埋め込みモデルの役割とは
埋め込みモデルは、コンテンツを意味を捉えた数値のベクトルに変換します。類似する項目は近くに配置されるため、検索や比較が容易になります。RAGパイプラインでは、これらのベクトルにより、LLMが学習していない新鮮な情報を取得できます。埋め込みをローカルで生成することで、データをデバイス内に留め、レイテンシを削減し、オフラインでも動作します。
すべてのモダリティに対応する1つのベクトル空間
EmbeddingGemma 2はGemma 4アーキテクチャを基盤としています。テキストクエリで写真を検索できます。音声メモで動画クリップを検索できます。テキスト、画像、デモ動画を含む商品リストのようなインターリーブされた入力は、単一の埋め込みを生成します。
この設計はモジュール式です。3つの部分で構成されています:
- テキストおよびコードのバックボーン: 270Mパラメータ(130Mのトランスフォーマーと140Mのエンベッダー)
- ビジョンエンコーダ: 170Mパラメータ、オプション
- オーディオエンコーダ: 300Mパラメータ、オプション
開発者は必要なものだけをロードできます:テキストのみなら270M、テキストとビジョンなら440M、テキストとオーディオなら570M、すべてなら740Mです。すべての構成で1つのベクトル空間を共有します。テキストのみの構成で埋め込まれたクエリは、フルモデルで埋め込まれたドキュメントと一致させることができます。
コンテキストウィンドウは8,192トークンで、バージョン1の4倍です。これにより、約29枚の画像、58フレームの動画、または5.5分の音声に対応します。
ベンチマーク
Googleの研究チームは、1B未満のマルチモーダル埋め込みモデルの中で、MTEB CodeとMAEBにおいて首位のスコアを報告しています。768次元でのフル精度の結果:
| ベンチマーク | EmbeddingGemma 2 | EmbeddingGemma 1 |
|---|---|---|
| MTEB multilingual v2 | 61.36 | 61.15 |
| MTEB Code v1 | 78.68 | 68.76 |
| MIEB lite (画像) | 64.64 | 該当なし |
| MMEB v2 全体 | 59.01 | 該当なし |
| MSEB retrieval (音声) | 69.54 | 該当なし |
| MAEB (オーディオ) | 49.39 | 該当なし |
コード検索は9.92ポイント向上し、およそ14%です。多言語テキストの品質は安定しています。より大きなモデルが依然として一部のランキングでは首位です。 Qwen3-VL-Embedding-2B は自身のMMEB-V2の実行で73.2を報告しており、約2.7倍のパラメータを持ち、オーディオ非対応です。
スマートフォンとノートパソコン向けに設計
Pixel 11 Pro での量子化では、テキストのみの重みに対するアクティブ RAM は約 191MB です。フルのマルチモーダルモデルには約 567MB が必要です。量子化認識トレーニングにより、重みは INT4 と INT8 に圧縮されます。 Google AI Edge チーム は、70 トークンのビジョン予算を使用して、MacBook M5 Pro GPU で画像あたり 37.3 ms を測定しました。
Matryoshka Representation Learning (MRL) により、開発者はベクトルを 512、256、または 128 次元に切り詰めることができます。768 次元から 128 次元への移行により、ストレージを最大 6 倍削減できます。256 次元では、MTEB 多言語は 61.36 から 60.41 へしか低下しません。128 次元では MMEB は 45.65 まで低下するため、Google は 128 次元を主にテキストのみのワークロード向けに推奨しています。
インタラクティブ解説
EmbeddingGemma 2 と最も近い競合の比較
| 機能 | EmbeddingGemma 2 | EmbeddingGemma 1 | Qwen3-VL-Embedding-2B | LCO-Embedding-Omni-3B | Gemini Embedding 2 |
|---|---|---|---|---|---|
| 開発元 | Google DeepMind | Google DeepMind | Alibaba Qwen | LCO-Embedding (研究) | |
| パラメータ数 | 740M (テキストのみ 270M) | 308M | 2B | 3B バックボーン (HF では 5B と記載) | 非公開 |
| テキスト / コード | はい | はい | はい | はい | はい |
| 画像 | はい | いいえ | はい | はい | はい |
| 動画 | はい | いいえ | はい | はい | はい |
| 音声 | はい | いいえ | いいえ | はい | はい |
| 出力次元 (MRL) | 768 (512, 256, 128) | 768 (128 まで対応) | 最大 2048 (64 から 2048) | 記載なし | 3072 (128 から 3072) |
| コンテキスト | 8,192 トークン | 2K トークン | 32K トークン | 記載なし | 8,192 トークン |
| 対応言語 | 100+ | 100+ | 30+ | 記載なし | 100+ |
| ライセンス / アクセス | Apache 2.0、オープンウェイト | オープンウェイト (Gemma 利用規約) | Apache 2.0、オープンウェイト | Apache 2.0、オープンウェイト | 有料APIのみ |
| 公開されているオンデバイスRAM | テキスト約191MB、フル約567MB | 200MB未満 | 非公開 | 非公開 | クラウドのみ |
| ソース | モデルカード | ドキュメント | HFカード | HFカード | APIドキュメント |
実行方法
動作環境は sentence-transformers v6.1.0+、Transformers、vLLM、SGLang、MLX、llama.cpp、Ollama、LM Studio、LiteRT、MediaPipe です。 Qdrant がベクトルストレージを担い、 Unsloth がファインチューニングを担います。NPUアクセラレーション対応のAndroid向けML Kitサポートは数週間以内に提供予定です。
コードをコピーpip install -U "sentence-transformers[image,audio,video]" transformers
from sentence_transformers import SentenceTransformer
model = SentenceTransformer("google/embeddinggemma-2")
q = model.encode("What causes the northern lights?", prompt_name="SearchQuery")
d = model.encode("Charged particles from the sun.", prompt_name="Document")
print(model.similarity(q, d))
Ollamaでは、 ollama pull embeddinggemma-2を実行します。タグは 270m (378MB)から 740m (1.3GB)まであります。デモは Google AI Edge Galleryにあります。詳細については 開発者ガイド を参照してください。
主なポイント
- ある740Mのオープンモデルは、テキスト、コード、画像、動画、音声を共有の768次元空間に埋め込みます。
- モジュール型エンコーダはフットプリントを270M(テキスト)から740M(フルマルチモーダル)へとスケールします。
- コード検索はMTEB Codeにおいて68.76から78.68に跳ね上がりました。
- 量子化を使用して、Pixel 11 Pro上で約191MB〜567MBのRAMで動作します。
FAQ
- EmbeddingGemma 2は商用利用できますか? はい。Apache 2.0 ライセンスの下でリリースされています。
- EmbeddingGemma 2 にはどれくらいのメモリが必要ですか? Pixel 11 Pro上で、テキストのみの利用時には約191MB、フルマルチモーダル利用時には567MBの使用中RAMを、量子化された状態でGoogleは報告しています。
チェックしてみてください: HF上のモデル重み および 技術的詳細。本プロジェクトの研究者に全ての功績があります。また、ぜひ私たちをフォローしてください Twitter そして、私たちの 150k以上のML SubReddit および登録する 弊社ニュースレター. 待って!Telegramやってますか? 「telegram でも参加できるようになりました。」
当該投稿 Google DeepMind、Gemma 4を基盤とする740Mのオープンなマルチモーダル埋め込みモデル「EmbeddingGemma 2」をリリース 最初に掲載されたのは MarkTechPost.