MarkTechPost

Google DeepMind、Gemma 4を基盤とする740Mパラメータのオープンなマルチモーダル埋め込みモデルEmbeddingGemma 2をリリース

Google DeepMindのEmbeddingGemma 2は、5つの入力タイプを1つの768d空間へマッピングし、本日Apache 2.0ライセンスで公開されました。この投稿「Google DeepMind Releases EmbeddingGemma 2, a 740M Open Multimodal Embedding Model Built on Gemma 4」はMarkTechPostに最初に掲載されました。

Google DeepMindはリリースしました EmbeddingGemma 2。これはテキスト、コード、画像、動画、音声を1つの768次元空間に埋め込むオープンなモデルです。740Mパラメータ、8Kトークンのコンテキストウィンドウを備え、Apache 2.0ライセンスで提供されます。オンデバイス検索、分類、プライバシー第一のRAGを狙いとしています。本記事では、 EmbeddingGemma 2 がこの分野にどう適合するかを分析、比較、紹介します。

今すぐデプロイ可能か? はい。重みはすでに Hugging Face と Kaggleで公開されており、 Ollama, llama.cpp GGUF および LiteRT ビルドも現在利用可能です。

埋め込みモデルの役割とは

埋め込みモデルは、コンテンツを意味を捉えた数値のベクトルに変換します。類似する項目は近くに配置されるため、検索や比較が容易になります。RAGパイプラインでは、これらのベクトルにより、LLMが学習していない新鮮な情報を取得できます。埋め込みをローカルで生成することで、データをデバイス内に留め、レイテンシを削減し、オフラインでも動作します。

すべてのモダリティに対応する1つのベクトル空間

EmbeddingGemma 2はGemma 4アーキテクチャを基盤としています。テキストクエリで写真を検索できます。音声メモで動画クリップを検索できます。テキスト、画像、デモ動画を含む商品リストのようなインターリーブされた入力は、単一の埋め込みを生成します。

この設計はモジュール式です。3つの部分で構成されています:

  • テキストおよびコードのバックボーン: 270Mパラメータ(130Mのトランスフォーマーと140Mのエンベッダー)
  • ビジョンエンコーダ: 170Mパラメータ、オプション
  • オーディオエンコーダ: 300Mパラメータ、オプション

開発者は必要なものだけをロードできます:テキストのみなら270M、テキストとビジョンなら440M、テキストとオーディオなら570M、すべてなら740Mです。すべての構成で1つのベクトル空間を共有します。テキストのみの構成で埋め込まれたクエリは、フルモデルで埋め込まれたドキュメントと一致させることができます。

コンテキストウィンドウは8,192トークンで、バージョン1の4倍です。これにより、約29枚の画像、58フレームの動画、または5.5分の音声に対応します。

ベンチマーク

Googleの研究チームは、1B未満のマルチモーダル埋め込みモデルの中で、MTEB CodeとMAEBにおいて首位のスコアを報告しています。768次元でのフル精度の結果:

ベンチマークEmbeddingGemma 2EmbeddingGemma 1
MTEB multilingual v261.3661.15
MTEB Code v178.6868.76
MIEB lite (画像)64.64該当なし
MMEB v2 全体59.01該当なし
MSEB retrieval (音声)69.54該当なし
MAEB (オーディオ)49.39該当なし

ソース: EmbeddingGemma 2 モデルカード

コード検索は9.92ポイント向上し、およそ14%です。多言語テキストの品質は安定しています。より大きなモデルが依然として一部のランキングでは首位です。 Qwen3-VL-Embedding-2B は自身のMMEB-V2の実行で73.2を報告しており、約2.7倍のパラメータを持ち、オーディオ非対応です。

スマートフォンとノートパソコン向けに設計

Pixel 11 Pro での量子化では、テキストのみの重みに対するアクティブ RAM は約 191MB です。フルのマルチモーダルモデルには約 567MB が必要です。量子化認識トレーニングにより、重みは INT4 と INT8 に圧縮されます。 Google AI Edge チーム は、70 トークンのビジョン予算を使用して、MacBook M5 Pro GPU で画像あたり 37.3 ms を測定しました。

Matryoshka Representation Learning (MRL) により、開発者はベクトルを 512、256、または 128 次元に切り詰めることができます。768 次元から 128 次元への移行により、ストレージを最大 6 倍削減できます。256 次元では、MTEB 多言語は 61.36 から 60.41 へしか低下しません。128 次元では MMEB は 45.65 まで低下するため、Google は 128 次元を主にテキストのみのワークロード向けに推奨しています。

インタラクティブ解説

EmbeddingGemma 2 と最も近い競合の比較

機能EmbeddingGemma 2EmbeddingGemma 1Qwen3-VL-Embedding-2BLCO-Embedding-Omni-3BGemini Embedding 2
開発元Google DeepMindGoogle DeepMindAlibaba QwenLCO-Embedding (研究)Google
パラメータ数740M (テキストのみ 270M)308M2B3B バックボーン (HF では 5B と記載)非公開
テキスト / コードはいはいはいはいはい
画像はいいいえはいはいはい
動画はいいいえはいはいはい
音声はいいいえいいえはいはい
出力次元 (MRL)768 (512, 256, 128)768 (128 まで対応)最大 2048 (64 から 2048)記載なし3072 (128 から 3072)
コンテキスト8,192 トークン2K トークン32K トークン記載なし8,192 トークン
対応言語100+100+30+記載なし100+
ライセンス / アクセスApache 2.0、オープンウェイトオープンウェイト (Gemma 利用規約)Apache 2.0、オープンウェイトApache 2.0、オープンウェイト有料APIのみ
公開されているオンデバイスRAMテキスト約191MB、フル約567MB200MB未満非公開非公開クラウドのみ
ソースモデルカードドキュメントHFカードHFカードAPIドキュメント

実行方法

動作環境は sentence-transformers v6.1.0+、Transformers、vLLM、SGLang、MLX、llama.cpp、Ollama、LM Studio、LiteRT、MediaPipe です。 Qdrant がベクトルストレージを担い、 Unsloth がファインチューニングを担います。NPUアクセラレーション対応のAndroid向けML Kitサポートは数週間以内に提供予定です。

コードをコピー
pip install -U "sentence-transformers[image,audio,video]" transformers

from sentence_transformers import SentenceTransformer
model = SentenceTransformer("google/embeddinggemma-2")
q = model.encode("What causes the northern lights?", prompt_name="SearchQuery")
d = model.encode("Charged particles from the sun.", prompt_name="Document")
print(model.similarity(q, d))

Ollamaでは、 ollama pull embeddinggemma-2を実行します。タグは 270m (378MB)から 740m (1.3GB)まであります。デモは Google AI Edge Galleryにあります。詳細については 開発者ガイド を参照してください。

主なポイント

  • ある740Mのオープンモデルは、テキスト、コード、画像、動画、音声を共有の768次元空間に埋め込みます。
  • モジュール型エンコーダはフットプリントを270M(テキスト)から740M(フルマルチモーダル)へとスケールします。
  • コード検索はMTEB Codeにおいて68.76から78.68に跳ね上がりました。
  • 量子化を使用して、Pixel 11 Pro上で約191MB〜567MBのRAMで動作します。

FAQ

  • EmbeddingGemma 2は商用利用できますか? はい。Apache 2.0 ライセンスの下でリリースされています。
  • EmbeddingGemma 2 にはどれくらいのメモリが必要ですか? Pixel 11 Pro上で、テキストのみの利用時には約191MB、フルマルチモーダル利用時には567MBの使用中RAMを、量子化された状態でGoogleは報告しています。


チェックしてみてください: HF上のモデル重み および 技術的詳細。本プロジェクトの研究者に全ての功績があります。また、ぜひ私たちをフォローしてください Twitter そして、私たちの 150k以上のML SubReddit および登録する 弊社ニュースレター. 待って!Telegramやってますか? 「telegram でも参加できるようになりました。」

[スポンサー] ウェブこそ、ほとんどのエージェントに欠けている唯一のAPIです。データベース、カレンダー、リポジトリにはAPIがあります。しかしオープンウェブにはほとんどありません。The TinyFish MCPサーバー 任意のMCPクライアントに4つのツールを提供します:TinySearch、TinyFetch(JavaScriptを含むページ全体をmarkdownで取得)、ログインやフォーム用のTinyBrowser、複数ステップのタスク用のTinyAgentです。Search と Fetch は無料です。

当該投稿 Google DeepMind、Gemma 4を基盤とする740Mのオープンなマルチモーダル埋め込みモデル「EmbeddingGemma 2」をリリース 最初に掲載されたのは MarkTechPost.

原文の出典

MarkTechPost

内容について

原文の公開と権利は出典元に帰属します。

機械翻訳 · 原文をご参照ください