Google DeepMind hat EmbeddingGemma 2veröffentlicht, ein offenes Modell, das Text, Code, Bilder, Video und Audio in einen einzigen 768-dimensionalen Raum einbettet. Es hat 740M Parameter, ein 8K-Token-Kontextfenster und eine Apache 2.0-Lizenz. Es zielt auf On-Device-Suche, Klassifizierung und Privacy-First-RAG ab. Dieser Artikel analysiert, vergleicht und zeigt, wie EmbeddingGemma 2 in dieses Umfeld passt.
Heute einsetzbar? Ja. Die Gewichte sind live auf Hugging Face und Kaggleverfügbar, mit Ollama, llama.cpp GGUF und LiteRT -Builds, die jetzt erhältlich sind.
Was ein Embedding-Modell tut
Ein Embedding-Modell wandelt Inhalte in einen Zahlenvektor um, der Bedeutung erfasst. Ähnliche Elemente liegen nahe beieinander, sodass sie sich leicht durchsuchen und vergleichen lassen. In einer RAG-Pipeline ermöglichen diese Vektoren einem LLM, frische Informationen abzurufen, mit denen es nicht trainiert wurde. Die lokale Erzeugung von Embeddings hält die Daten auf dem Gerät, reduziert die Latenz und funktioniert offline.
Ein Vektorraum für jede Modalität
EmbeddingGemma 2 basiert auf der Gemma 4-Architektur. Eine Textanfrage kann ein Foto abrufen. Eine Sprachnotiz kann einen Videoclip abrufen. Verschränkte Eingaben, wie ein Produktlisting mit Text, Bildern und einem Demo-Video, erzeugen ein einzelnes Embedding.
Das Design ist modular. Es besteht aus drei Teilen:
- Text- und Code-Backbone: 270M Parameter (130M Transformer plus 140M Embedder)
- Vision-Encoder: 170M Parameter, optional
- Audio-Encoder: 300M Parameter, optional
Entwickler laden nur, was sie brauchen: 270M für Text, 440M für Text und Vision, 570M für Text und Audio oder 740M für alles. Alle Konfigurationen teilen sich einen Vektorraum. Eine Abfrage, die mit der Nur-Text-Konfiguration eingebettet wurde, kann Dokumente abgleichen, die vom vollständigen Modell eingebettet wurden.
Das Kontextfenster beträgt 8,192 Tokens, 4x größer als Version 1. Das reicht für etwa 29 Bilder, 58 Videoframes oder 5.5 Minuten Audio.
Benchmarks
Ein Google-Forschungsteam berichtet über führende Ergebnisse bei multimodalen Embeddern unter 1B auf MTEB Code und MAEB. Ergebnisse in voller Präzision bei 768 Dimensionen:
| Benchmark | EmbeddingGemma 2 | EmbeddingGemma 1 |
|---|---|---|
| MTEB multilingual v2 | 61.36 | 61.15 |
| MTEB Code v1 | 78.68 | 68.76 |
| MIEB lite (Bild) | 64.64 | n/a |
| MMEB v2 gesamt | 59.01 | n/a |
| MSEB retrieval (Klang) | 69.54 | n/a |
| MAEB (Audio) | 49.39 | n/a |
Quelle: EmbeddingGemma 2 Modellkarte
Beim Code-Retrieval gibt es 9,92 Punkte Zuwachs, etwa 14 %. Die Qualität bei mehrsprachigem Text bleibt stabil. Größere Modelle führen bei einigen Bestenlisten weiterhin. Qwen3-VL-Embedding-2B meldet 73,2 in seinem eigenen MMEB-V2-Durchlauf, mit etwa dem 2,7-fachen der Parameter und ohne Audio-Unterstützung.
Gebaut für Smartphones und Laptops
Mit Quantisierung auf einem Pixel 11 Pro benötigt der aktive RAM etwa 191MB für rein-textliche Gewichte. Das vollständige multimodale Modell benötigt etwa 567MB. Quantisierungsbewusstes Training komprimiert die Gewichte auf INT4 und INT8. Das Google AI Edge team maß 37.3 ms pro Bild auf einer MacBook M5 Pro GPU, mit einem Vision-Budget von 70 Token.
Matryoshka Representation Learning (MRL) ermöglicht Entwicklern, Vektoren auf 512, 256 oder 128 Dimensionen zu kürzen. Der Wechsel von 768 auf 128 Dimensionen reduziert den Speicherbedarf um bis zu 6x. Bei 256 Dimensionen sinkt MTEB multilingual nur von 61.36 auf 60.41. Bei 128 Dimensionen fällt MMEB auf 45.65, daher empfiehlt Google 128d hauptsächlich für rein-textliche Workloads.
Interaktive Erklärung
EmbeddingGemma 2 im Vergleich zu den nächsten Konkurrenten
| Merkmal | EmbeddingGemma 2 | EmbeddingGemma 1 | Qwen3-VL-Embedding-2B | LCO-Embedding-Omni-3B | Gemini Embedding 2 |
|---|---|---|---|---|---|
| Entwickler | Google DeepMind | Google DeepMind | Alibaba Qwen | LCO-Embedding (Forschung) | |
| Parameter | 740M (270M rein-textlich) | 308M | 2B | 3B Backbone (5B auf HF gelistet) | Nicht offengelegt |
| Text / Code | Ja | Ja | Ja | Ja | Ja |
| Bilder | Ja | Nein | Ja | Ja | Ja |
| Video | Ja | Nein | Ja | Ja | Ja |
| Audio | Ja | Nein | Nein | Ja | Ja |
| Ausgabedimensionen (MRL) | 768 (512, 256, 128) | 768 (herunter bis 128) | Bis zu 2048 (64 bis 2048) | Nicht angegeben | 3072 (128 bis 3072) |
| Kontext | 8,192 Tokens | 2K Tokens | 32K Tokens | Nicht angegeben | 8,192 Tokens |
| Sprachen | 100+ | 100+ | 30+ | Nicht angegeben | 100+ |
| Lizenz / Zugang | Apache 2.0, offene Gewichte | Offene Gewichte (Gemma-Bedingungen) | Apache 2.0, offene Gewichte | Apache 2.0, offene Gewichte | Nur bezahlte API |
| On-Device-RAM veröffentlicht | ~191MB Text, ~567MB vollständig | Unter 200MB | Nicht veröffentlicht | Nicht veröffentlicht | Nur Cloud |
| Quelle | Model Card | Dokumentation | HF-Karte | HF-Karte | API-Dokumentation |
So führt man es aus
Es läuft auf sentence-transformers v6.1.0+, Transformers, vLLM, SGLang, MLX, llama.cpp, Ollama, LM Studio, LiteRT und MediaPipe. Qdrant deckt Vektorspeicherung ab und Unsloth deckt Fine-Tuning ab. ML-Kit-Unterstützung für Android mit NPU-Beschleunigung kommt in den nächsten Wochen.
Code kopierenpip install -U "sentence-transformers[image,audio,video]" transformers
from sentence_transformers import SentenceTransformer
model = SentenceTransformer("google/embeddinggemma-2")
q = model.encode("What causes the northern lights?", prompt_name="SearchQuery")
d = model.encode("Charged particles from the sun.", prompt_name="Document")
print(model.similarity(q, d))
Auf Ollama führt man ollama pull embeddinggemma-2aus. Die Tags reichen von 270m (378MB) bis 740m (1.3GB). Demos finden sich in Google AI Edge Gallery. Siehe den Entwicklerleitfaden für mehr.
Kernpunkte
- Ein offenes Modell mit 740M bettet Text, Code, Bilder, Video und Audio in einen gemeinsamen 768d-Raum ein.
- Modulare Encoder skalieren die Größe von 270M (Text) bis 740M (voll multimodal).
- Code-Retrieval steigt auf MTEB Code von 68.76 auf 78.68.
- Läuft mit Quantisierung auf einem Pixel 11 Pro mit etwa 191MB bis 567MB RAM.
FAQ
- Kann EmbeddingGemma 2 kommerziell genutzt werden? Ja. Es wird unter der Apache 2.0-Lizenz veröffentlicht.
- Wie viel Speicher benötigt EmbeddingGemma 2? Google berichtet von etwa 191MB aktivem RAM für die reine Textnutzung und 567MB für die voll multimodale Nutzung, quantisiert, auf einem Pixel 11 Pro.
Schauen Sie sich die Modellgewichte auf HF und die Technischen Detailsan. Alle Anerkennung gebührt dem Forscher dieses Projekts. Folgen Sie uns außerdem gerne auf Twitter und vergessen Sie nicht, unserem 150k+ML SubReddit beizutreten und unseren Newsletterzu abonnieren. Moment! Sind Sie auf Telegram? jetzt können Sie uns auch auf Telegram beitreten.
Der Beitrag Google DeepMind veröffentlicht EmbeddingGemma 2, ein offenes multimodales Embedding-Modell mit 740M, das auf Gemma 4 basiert erschien zuerst auf MarkTechPost.