MarkTechPost

Google DeepMind lanza EmbeddingGemma 2, un modelo de embeddings multimodal abierto de 740M construido sobre Gemma 4

El EmbeddingGemma 2 de Google DeepMind mapea 5 tipos de entrada en un único espacio de 768d y está disponible hoy bajo Apache 2.0. La publicación Google DeepMind lanza EmbeddingGemma 2, un modelo de embeddings multimodal…

Google DeepMind ha lanzado EmbeddingGemma 2, un modelo abierto que incrusta texto, código, imágenes, video y audio en un único espacio de 768 dimensiones. Tiene 740M de parámetros, una ventana de contexto de 8K tokens y licencia Apache 2.0. Está orientado a búsqueda en el dispositivo, clasificación y RAG con privacidad primero. Este artículo analiza, compara y muestra cómo EmbeddingGemma 2 se sitúa en este espacio.

¿Desplegable hoy? Sí. Los pesos están disponibles en Hugging Face y Kaggle, con builds de Ollama, llama.cpp GGUF y LiteRT disponibles ahora.

Qué hace un modelo de embeddings

Un modelo de embeddings convierte el contenido en un vector de números que captura el significado. Los elementos similares quedan cerca entre sí, por lo que son fáciles de buscar y comparar. En un pipeline RAG, estos vectores permiten a un LLM recuperar información reciente con la que no fue entrenado. Generar embeddings localmente mantiene los datos en el dispositivo, reduce la latencia y funciona sin conexión.

Un espacio vectorial para cada modalidad

EmbeddingGemma 2 está construido sobre la arquitectura Gemma 4. Una consulta de texto puede recuperar una foto. Una nota de voz puede recuperar un clip de video. Las entradas intercaladas, como un listado de producto con texto, imágenes y un video de demostración, producen un único embedding.

El diseño es modular. Tiene tres partes:

  • Backbone de texto y código: 270M de parámetros (130M de transformer más 140M de embedder)
  • Codificador de visión: 170M de parámetros, opcional
  • Codificador de audio: 300M de parámetros, opcional

Los desarrolladores cargan solo lo que necesitan: 270M para texto, 440M para texto y visión, 570M para texto y audio, o 740M para todo. Todas las configuraciones comparten un único espacio vectorial. Una consulta incrustada con la configuración solo de texto puede coincidir con documentos incrustados por el modelo completo.

La ventana de contexto es de 8,192 tokens, 4 veces mayor que la de la versión 1. Eso equivale a unas 29 imágenes, 58 fotogramas de video o 5.5 minutos de audio.

Benchmarks

El equipo de investigación de Google informa puntajes líderes entre los embedders multimodales de menos de 1B en MTEB Code y MAEB. Resultados en precisión completa a 768 dimensiones:

BenchmarkEmbeddingGemma 2EmbeddingGemma 1
MTEB multilingüe v261.3661.15
MTEB Code v178.6868.76
MIEB lite (imagen)64.64n/d
MMEB v2 general59.01n/d
MSEB recuperación (sonido)69.54n/d
MAEB (audio)49.39n/d

Fuente: Ficha del modelo EmbeddingGemma 2

La recuperación de código gana 9.92 puntos, aproximadamente un 14%. La calidad del texto multilingüe se mantiene estable. Los modelos más grandes aún lideran algunas tablas. Qwen3-VL-Embedding-2B reporta 73.2 en su propia ejecución de MMEB-V2, con aproximadamente 2.7 veces los parámetros y sin soporte de audio.

Diseñado para teléfonos y portátiles

Con cuantización en un Pixel 11 Pro, la RAM activa es de unos 191MB para pesos solo de texto. El modelo multimodal completo necesita unos 567MB. El entrenamiento con conciencia de cuantización comprime los pesos a INT4 e INT8. El equipo de Google AI Edge midió 37.3 ms por imagen en una GPU de MacBook M5 Pro, usando un presupuesto de visión de 70 tokens.

El Matryoshka Representation Learning (MRL) permite a los desarrolladores truncar los vectores a 512, 256 o 128 dimensiones. Pasar de 768 a 128 dimensiones reduce el almacenamiento hasta 6x. A 256 dimensiones, MTEB multilingual solo baja de 61.36 a 60.41. A 128 dimensiones, MMEB cae a 45.65, por lo que Google recomienda 128d principalmente para cargas de trabajo solo de texto.

Explicación interactiva

EmbeddingGemma 2 frente a competidores más cercanos

CaracterísticaEmbeddingGemma 2EmbeddingGemma 1Qwen3-VL-Embedding-2BLCO-Embedding-Omni-3BGemini Embedding 2
DesarrolladorGoogle DeepMindGoogle DeepMindAlibaba QwenLCO-Embedding (investigación)Google
Parámetros740M (270M solo de texto)308M2Bbackbone de 3B (5B listado en HF)No divulgado
Texto / códigoSíSíSíSíSí
ImágenesSíNoSíSíSí
VídeoSíNoSíSíSí
AudioSíNoNoSíSí
Dimensiones de salida (MRL)768 (512, 256, 128)768 (hasta 128)Hasta 2048 (de 64 a 2048)No indicado3072 (de 128 a 3072)
Contexto8,192 tokens2K tokens32K tokensNo indicado8,192 tokens
Idiomas100+100+30+No indicado100+
Licencia / accesoApache 2.0, pesos abiertosPesos abiertos (términos de Gemma)Apache 2.0, pesos abiertosApache 2.0, pesos abiertosSolo API de pago
RAM en dispositivo publicada~191MB texto, ~567MB completoMenos de 200MBNo publicadoNo publicadoSolo en la nube
Código fuenteModel cardDocumentaciónHF cardHF cardDocumentación de la API

Cómo ejecutarlo

Funciona con sentence-transformers v6.1.0+, Transformers, vLLM, SGLang, MLX, llama.cpp, Ollama, LM Studio, LiteRT y MediaPipe. Qdrant cubre el almacenamiento vectorial y Unsloth cubre el ajuste fino. El soporte de ML Kit para Android, con aceleración NPU, llegará en cuestión de semanas.

Copiar código
pip install -U "sentence-transformers[image,audio,video]" transformers

from sentence_transformers import SentenceTransformer
model = SentenceTransformer("google/embeddinggemma-2")
q = model.encode("What causes the northern lights?", prompt_name="SearchQuery")
d = model.encode("Charged particles from the sun.", prompt_name="Document")
print(model.similarity(q, d))

En Ollama, ejecute ollama pull embeddinggemma-2. Las etiquetas van desde 270m (378MB) hasta 740m (1.3GB). Las demos están en Google AI Edge Gallery. Consulte la guía para desarrolladores para más información.

Conclusiones clave

  • Un modelo abierto de 740M incrusta texto, código, imágenes, video y audio en un espacio compartido de 768d.
  • Los codificadores modulares escalan la huella desde 270M (texto) hasta 740M (multimodal completo).
  • La recuperación de código salta de 68.76 a 78.68 en MTEB Code.
  • Funciona en ~191MB a ~567MB de RAM en un Pixel 11 Pro con cuantización.

Preguntas frecuentes

  • ¿Se puede usar EmbeddingGemma 2 comercialmente? Sí. Se publica bajo la licencia Apache 2.0.
  • ¿Cuánta memoria necesita EmbeddingGemma 2? Google informa unos 191MB de RAM activa para uso solo de texto y 567MB para uso multimodal completo, cuantizado, en un Pixel 11 Pro.


Consulta los Model Weights on HF y Technical details. Todo el crédito va al investigador de este proyecto. Además, no dudes en seguirnos en Twitter y no olvides unirte a nuestro 150k+ML SubReddit y suscribirte a our Newsletter. ¡Espera! ¿estás en telegram? ahora también puedes unirte a nosotros en telegram.

[Patrocinado] La web es la única API que falta a la mayoría de los agentes. Las bases de datos, los calendarios y los repositorios tienen APIs. La web abierta, en su mayoría, no. El TinyFish MCP server ofrece a cualquier cliente MCP cuatro herramientas: TinySearch, TinyFetch (páginas completas como markdown, con JavaScript incluido), TinyBrowser para inicios de sesión y formularios, y TinyAgent para trabajos de varios pasos. Search y Fetch son gratuitos.

La entrada Google DeepMind lanza EmbeddingGemma 2, un modelo de embeddings multimodal abierto de 740M basado en Gemma 4 apareció primero en MarkTechPost.

Fuente original

MarkTechPost

Notas sobre el contenido

La publicación original y los derechos pertenecen a la fuente.

Traducción automática · Consulte el original