MarkTechPost

Google DeepMind veröffentlicht EmbeddingGemma 2, ein offenes multimodales Embedding-Modell mit 740M, aufgebaut auf Gemma 4

Google DeepMinds EmbeddingGemma 2 bildet 5 Eingabetypen in einen einzigen 768d-Raum ab und erscheint heute unter Apache 2.0. Der Beitrag Google DeepMind veröffentlicht EmbeddingGemma 2, ein offenes multimodales…

Google DeepMind hat EmbeddingGemma 2veröffentlicht, ein offenes Modell, das Text, Code, Bilder, Video und Audio in einen einzigen 768-dimensionalen Raum einbettet. Es hat 740M Parameter, ein 8K-Token-Kontextfenster und eine Apache 2.0-Lizenz. Es zielt auf On-Device-Suche, Klassifizierung und Privacy-First-RAG ab. Dieser Artikel analysiert, vergleicht und zeigt, wie EmbeddingGemma 2 in dieses Umfeld passt.

Heute einsetzbar? Ja. Die Gewichte sind live auf Hugging Face und Kaggleverfügbar, mit Ollama, llama.cpp GGUF und LiteRT -Builds, die jetzt erhältlich sind.

Was ein Embedding-Modell tut

Ein Embedding-Modell wandelt Inhalte in einen Zahlenvektor um, der Bedeutung erfasst. Ähnliche Elemente liegen nahe beieinander, sodass sie sich leicht durchsuchen und vergleichen lassen. In einer RAG-Pipeline ermöglichen diese Vektoren einem LLM, frische Informationen abzurufen, mit denen es nicht trainiert wurde. Die lokale Erzeugung von Embeddings hält die Daten auf dem Gerät, reduziert die Latenz und funktioniert offline.

Ein Vektorraum für jede Modalität

EmbeddingGemma 2 basiert auf der Gemma 4-Architektur. Eine Textanfrage kann ein Foto abrufen. Eine Sprachnotiz kann einen Videoclip abrufen. Verschränkte Eingaben, wie ein Produktlisting mit Text, Bildern und einem Demo-Video, erzeugen ein einzelnes Embedding.

Das Design ist modular. Es besteht aus drei Teilen:

  • Text- und Code-Backbone: 270M Parameter (130M Transformer plus 140M Embedder)
  • Vision-Encoder: 170M Parameter, optional
  • Audio-Encoder: 300M Parameter, optional

Entwickler laden nur, was sie brauchen: 270M für Text, 440M für Text und Vision, 570M für Text und Audio oder 740M für alles. Alle Konfigurationen teilen sich einen Vektorraum. Eine Abfrage, die mit der Nur-Text-Konfiguration eingebettet wurde, kann Dokumente abgleichen, die vom vollständigen Modell eingebettet wurden.

Das Kontextfenster beträgt 8,192 Tokens, 4x größer als Version 1. Das reicht für etwa 29 Bilder, 58 Videoframes oder 5.5 Minuten Audio.

Benchmarks

Ein Google-Forschungsteam berichtet über führende Ergebnisse bei multimodalen Embeddern unter 1B auf MTEB Code und MAEB. Ergebnisse in voller Präzision bei 768 Dimensionen:

BenchmarkEmbeddingGemma 2EmbeddingGemma 1
MTEB multilingual v261.3661.15
MTEB Code v178.6868.76
MIEB lite (Bild)64.64n/a
MMEB v2 gesamt59.01n/a
MSEB retrieval (Klang)69.54n/a
MAEB (Audio)49.39n/a

Quelle: EmbeddingGemma 2 Modellkarte

Beim Code-Retrieval gibt es 9,92 Punkte Zuwachs, etwa 14 %. Die Qualität bei mehrsprachigem Text bleibt stabil. Größere Modelle führen bei einigen Bestenlisten weiterhin. Qwen3-VL-Embedding-2B meldet 73,2 in seinem eigenen MMEB-V2-Durchlauf, mit etwa dem 2,7-fachen der Parameter und ohne Audio-Unterstützung.

Gebaut für Smartphones und Laptops

Mit Quantisierung auf einem Pixel 11 Pro benötigt der aktive RAM etwa 191MB für rein-textliche Gewichte. Das vollständige multimodale Modell benötigt etwa 567MB. Quantisierungsbewusstes Training komprimiert die Gewichte auf INT4 und INT8. Das Google AI Edge team maß 37.3 ms pro Bild auf einer MacBook M5 Pro GPU, mit einem Vision-Budget von 70 Token.

Matryoshka Representation Learning (MRL) ermöglicht Entwicklern, Vektoren auf 512, 256 oder 128 Dimensionen zu kürzen. Der Wechsel von 768 auf 128 Dimensionen reduziert den Speicherbedarf um bis zu 6x. Bei 256 Dimensionen sinkt MTEB multilingual nur von 61.36 auf 60.41. Bei 128 Dimensionen fällt MMEB auf 45.65, daher empfiehlt Google 128d hauptsächlich für rein-textliche Workloads.

Interaktive Erklärung

EmbeddingGemma 2 im Vergleich zu den nächsten Konkurrenten

MerkmalEmbeddingGemma 2EmbeddingGemma 1Qwen3-VL-Embedding-2BLCO-Embedding-Omni-3BGemini Embedding 2
EntwicklerGoogle DeepMindGoogle DeepMindAlibaba QwenLCO-Embedding (Forschung)Google
Parameter740M (270M rein-textlich)308M2B3B Backbone (5B auf HF gelistet)Nicht offengelegt
Text / CodeJaJaJaJaJa
BilderJaNeinJaJaJa
VideoJaNeinJaJaJa
AudioJaNeinNeinJaJa
Ausgabedimensionen (MRL)768 (512, 256, 128)768 (herunter bis 128)Bis zu 2048 (64 bis 2048)Nicht angegeben3072 (128 bis 3072)
Kontext8,192 Tokens2K Tokens32K TokensNicht angegeben8,192 Tokens
Sprachen100+100+30+Nicht angegeben100+
Lizenz / ZugangApache 2.0, offene GewichteOffene Gewichte (Gemma-Bedingungen)Apache 2.0, offene GewichteApache 2.0, offene GewichteNur bezahlte API
On-Device-RAM veröffentlicht~191MB Text, ~567MB vollständigUnter 200MBNicht veröffentlichtNicht veröffentlichtNur Cloud
QuelleModel CardDokumentationHF-KarteHF-KarteAPI-Dokumentation

So führt man es aus

Es läuft auf sentence-transformers v6.1.0+, Transformers, vLLM, SGLang, MLX, llama.cpp, Ollama, LM Studio, LiteRT und MediaPipe. Qdrant deckt Vektorspeicherung ab und Unsloth deckt Fine-Tuning ab. ML-Kit-Unterstützung für Android mit NPU-Beschleunigung kommt in den nächsten Wochen.

Code kopieren
pip install -U "sentence-transformers[image,audio,video]" transformers

from sentence_transformers import SentenceTransformer
model = SentenceTransformer("google/embeddinggemma-2")
q = model.encode("What causes the northern lights?", prompt_name="SearchQuery")
d = model.encode("Charged particles from the sun.", prompt_name="Document")
print(model.similarity(q, d))

Auf Ollama führt man ollama pull embeddinggemma-2aus. Die Tags reichen von 270m (378MB) bis 740m (1.3GB). Demos finden sich in Google AI Edge Gallery. Siehe den Entwicklerleitfaden für mehr.

Kernpunkte

  • Ein offenes Modell mit 740M bettet Text, Code, Bilder, Video und Audio in einen gemeinsamen 768d-Raum ein.
  • Modulare Encoder skalieren die Größe von 270M (Text) bis 740M (voll multimodal).
  • Code-Retrieval steigt auf MTEB Code von 68.76 auf 78.68.
  • Läuft mit Quantisierung auf einem Pixel 11 Pro mit etwa 191MB bis 567MB RAM.

FAQ

  • Kann EmbeddingGemma 2 kommerziell genutzt werden? Ja. Es wird unter der Apache 2.0-Lizenz veröffentlicht.
  • Wie viel Speicher benötigt EmbeddingGemma 2? Google berichtet von etwa 191MB aktivem RAM für die reine Textnutzung und 567MB für die voll multimodale Nutzung, quantisiert, auf einem Pixel 11 Pro.


Schauen Sie sich die Modellgewichte auf HF und die Technischen Detailsan. Alle Anerkennung gebührt dem Forscher dieses Projekts. Folgen Sie uns außerdem gerne auf Twitter und vergessen Sie nicht, unserem 150k+ML SubReddit beizutreten und unseren Newsletterzu abonnieren. Moment! Sind Sie auf Telegram? jetzt können Sie uns auch auf Telegram beitreten.

[Gesponsert] Das Web ist die eine API, die den meisten Agents fehlt. Datenbanken, Kalender und Repositories haben APIs. Das offene Web meistens nicht. Der TinyFish MCP server bietet jedem MCP-Client vier Tools: TinySearch, TinyFetch (vollständige Seiten als Markdown, JavaScript inklusive), TinyBrowser für Logins und Formulare sowie TinyAgent für mehrstufige Aufgaben. Search und Fetch sind kostenlos.

Der Beitrag Google DeepMind veröffentlicht EmbeddingGemma 2, ein offenes multimodales Embedding-Modell mit 740M, das auf Gemma 4 basiert erschien zuerst auf MarkTechPost.

Originalquelle

MarkTechPost

Hinweise zum Inhalt

Originalveröffentlichung und Rechte liegen bei der Quelle.

Maschinelle Übersetzung · Original beachten