Google DeepMind

EmbeddingGemma 2 : un modèle d’embedding multimodale ouvert et léger

Nous avons introduit EmbeddingGemma l’an dernier afin de proposer une solution légère pour les embeddings de texte de haute qualité, permettant à vos applications d’organiser, de rechercher et de conn

Massive Text Embedding Benchmark (Code)
Source de l’image · Google DeepMind

Nous avons introduit EmbeddingGemma l’an dernier afin de proposer une solution légère pour les embeddings de texte de haute qualité, permettant à vos applications d’organiser, de rechercher et de connecter des informations directement sur du matériel consommable. La réaction de la communauté de développeurs a dépassé nos attentes. Avec plus de 20 millions de téléchargements, les développeurs l’ont utilisé pour alimenter des outils de recherche plus intelligents sur le dispositif et des pipelines de génération augmentée de recherche basés sur la confidentialité.

Aujourd’hui, nous lançons EmbeddingGemma 2, qui s’étend au-delà du texte pour unifier le code, les images, les vidéos et les audio dans un espace d’intégration partagé. Basé sur l’architecture Gemma 4 et disponible sous une licence Apache 2.0 commercialement permissive, EmbeddingGemma 2 dispose de 740 millions de paramètres, ce qui en fait le modèle idéal pour l’inférence sur le dispositif. Il peut aider à trouver un extrait de vidéo spécifique provenant d’une note vocale, ou à rechercher des heures de enregistrements audio en fonction d’une requête textuelle, tout cela traité par un seul modèle multimodal natif.

Conçu avec la même technologie que les modèles de Gemini Embedding, EmbeddingGemma 2 est :

  • La meilleure de son genre pour sa taille : Obtenir des scores leader parmi les modèles multimodaux sub-1B pour sa taille, dans des benchmarks tels que MTEB (Massive Text Embedding Benchmark) Code et MAEB (Massive Audio Embedding Benchmark), tout en correspondant ou surpassant de nombreux modèles plus grands dans les tâches de texte, de vision et d’audio.
  • Conçu en modules : N’a besoin que de 270M paramètres pour les tâches purement textuelles, avec des encodements optionnels pour la vision (170M) et l’audio (300M) pour un soutien multimodal complet.
  • Efficace en termes de stockage : En utilisant l’Apprentissage de Représentation de Matryoshka (MRL), les développeurs peuvent tronquer dynamiquement les vecteurs d’output de 768 dimensions vers 512, 256 ou 128 dimensions. Cela permet une réduction de stockage jusqu’à 6 fois et une diminution de l’utilisation de la mémoire pour les bases de données de vecteurs locales.
  • Optimisé pour les performances sur le appareil : Fonctionne efficacement dans des contraintes de ressources limitées. Grâce à la quantification, sur un Google Pixel 11 Pro, l’EmbeddingGemma 2 nécessite seulement ~191MB de RAM active pour les poids uniquement textuels et ~567MB pour le modèle multimodal complet.
  • Contexte étendu prêt : Il dispose d’un cadre de contexte de 8K (4 fois plus grand que EmbeddingGemma 1), permettant à l’outil de traiter jusqu’à 5,5 minutes de son, 29 images, 58 vidéos ou combinaisons intercalées de ces éléments directement sur le matériel local.

Obtenir une qualité de premier ordre pour le code, la vision et l’audio

EmbeddingGemma 2 conserve les performances exceptionnelles en langues multiples de EmbeddingGemma, tout en apportant une amélioration significative de 9,92 points en performance du code (dans MTEB Code, passant de 68,76 à 78,68), ce qui le rend parfait pour l’indexation des codeurs locaux, la recherche de code sémantique et la récupération d’agents de codage. Que ce soit pour des images, des vidéos, des documents ou de l’audio, il établit un nouveau standard en termes de qualité par paramètre pour les modèles sub-1B, et même dépasse certains modèles spécialisés deux fois plus grands.

Massive Text Embedding Benchmark (Code) Massive Image Embedding Benchmark (Lite) Massive Audio Embedding Benchmark

Trouvez les indicateurs d’évaluation complets et les informations sur le modèle dans la carte de modèle EmbeddingGemma 2.

Activer la recherche sémantique, le routage et la récupération, intégralement sur le appareil

EmbeddingGemma 2 offre des capacités robustes directement sur les matériels d’extrémité. La génération d’embeddings localement permet de garantir la confidentialité des données, réduit la latence du pipeline et permet aux développeurs de créer des systèmes de recherche et de récupération multimodale fonctionnant entièrement hors ligne.

Quand associé à des modèles génératifs tels que Gemma 4, EmbeddingGemma 2 permet des pipelines RAG sur appareil qui comprennent des données multimodales complexes. Comme EmbeddingGemma 2 est construit sur Gemma 4 et partage son tokenizer de texte et son encodeur audio, les développeurs peuvent exécuter les deux modèles ensemble dans un pipeline unifié, avec une consommation de mémoire totale réduite.

Utilisez du texte ou une image pour trouver les meilleurs correspondances dans votre bibliothèque de médias en fonction de la similarité sémantique. Essayez cela dans la recherche instantanée de médias de Google AI Edge Gallery.

Localisez des moments spécifiques dans la vidéo en utilisant des requêtes de texte ou d’audio. Essayez-le avec le Google AI Edge Gallery’s Video Moments Finder.

Couplage EmbeddingGemma 2 pour la récupération de fichiers locaux avec Gemma 4 pour le raisonnement contextuel. Essayez-le dans l’application Google AI Edge Foresight.

Créer des moteurs de décision en temps réel qui exploitent le contexte multimodal pour les classifications, les routages et les capacités prédictives via l’MediaPipe Decision Task API.

Pour apprendre à construire des systèmes de recherche sur le dispositif et des RAG avec LiteRT, lisez le article du blog Google AI Edge.

Démarrer avec EmbeddingGemma 2

Nous avons travaillé en étroite collaboration avec les partenaires suivants pour s’assurer que EmbeddingGemma 2 fonctionne immédiatement là où vous construisez.

  • Téléchargez les modèles : Trouvez les poids des modèles sur Hugging Face et Kaggle. Le jardin de modèles de Gemini Enterprise Agent Platform sera disponible prochainement. Visitez LiteRT Community sur Hugging Face pour les modèles optimisés pour l’on‑device.
  • Déploiement sur le dispositif : Développez des applications multiplateformes avec Google AI Edge MediaPipe pour l’intégration, la récupération et les tâches de décision, ou LiteRT pour l’intégration de modèles personnalisés. Construisez des applications pour le navigateur avec transformers.js ou WebGPU.
  • Utilisez vos outils de développement favoris : Servez le modèle efficacement en utilisant transformers, sentence-transformers, MLX, vLLM, llama.cpp, SGLang, Ollama et LMStudio. Stockez vos vecteurs d’embeddings avec Qdrant.
  • Fine-tuning : Suivez les instructions fournies par Unsloth pour savoir comment affiner EmbeddingGemma 2 en fonction de vos cas d’usage.

Explorez notre guide de développement, documentation, ainsi que les guides pour inference et fine-tuning.

Source originale

Google DeepMind

À propos du contenu

La publication originale et les droits appartiennent à la source.

Traduction automatique · Consultez l’original