Google DeepMind

EmbeddingGemma 2: un modelo de incrustación multimodal abierto y ligero

Introdujimos EmbeddingGemma el año pasado para ofrecer una opción ligera para los embebidos de texto de alta calidad, con el fin de ayudar a tus aplicaciones a organizar, buscar y conectar información

Massive Text Embedding Benchmark (Code)
Fuente de la imagen · Google DeepMind

Introdujimos EmbeddingGemma el año pasado para ofrecer una opción ligera para los embebidos de texto de alta calidad, con el fin de ayudar a tus aplicaciones a organizar, buscar y conectar información directamente en el hardware de los consumidores. La respuesta de la comunidad de desarrolladores superó nuestras expectativas. Con más de 20 millones de descargas, los desarrolladores lo han utilizado para potenciar herramientas de búsqueda más inteligentes en el dispositivo y pipelines de generación aumentada con recuperación de datos centrada en la privacidad (RAG).

Hoy lanzamos EmbeddingGemma 2, que se extiende más allá del texto para unificar código, imágenes, videos y audios en un espacio de incrustación compartido. Construido sobre la arquitectura Gemma 4 y lanzado bajo una licencia Apache 2.0 comercialmente permisiva, EmbeddingGemma 2 cuenta con 740 millones de parámetros, lo que lo hace óptimo para la inferencia en el dispositivo. Puede ayudar a encontrar un clip de video específico de una grabación de voz, o buscar entre horas de grabaciones de audio basándose en una consulta de texto, todo procesado por un único modelo multimodal nativo.

Construido con la misma tecnología que los modelos de Embedding de Gemini, EmbeddingGemma 2 es:

  • El mejor en su categoría para su tamaño: Logra puntajes líderes entre los embeeders multimodales sub-1B para su tamaño en puntos de referencia como MTEB (Massive Text Embedding Benchmark) Code y MAEB (Massive Audio Embedding Benchmark), mientras que iguala o supera a muchos modelos más grandes en tareas de texto, visión y audio.
  • De diseño modular: Requiere tan solo 270M de parámetros para cargas de trabajo únicamente en texto, con codificadores opcionales de visión (170M) y audio (300M) para un soporte multimodal completo.
  • Eficiente en almacenamiento: Mediante el Aprendizaje de Representación de Matryoshka (MRL), los desarrolladores pueden truncar dinámicamente los vectores de salida desde 768 dimensiones hasta 512, 256 o 128 dimensiones. Esto permite una reducción del almacenamiento de hasta 6 veces y un uso de memoria menor en las bases de datos de vectores locales.
  • Optimizado para el rendimiento en el dispositivo: Funciona de manera eficiente dentro de restricciones estrictas de recursos. Con la cuantización, en un Google Pixel 11 Pro, EmbeddingGemma 2 requiere tan poco como ~191MB de RAM activa para pesos solo de texto y ~567MB para el modelo multimodal completo.
  • Contexto ampliado listo: Cuenta con un ventana de contexto de token de 8K (4 veces más grande que EmbeddingGemma 1), lo que le permite procesar hasta 5.5 minutos de audio, 29 imágenes, 58 fotogramas de video o combinaciones intercaladas de ellos directamente en hardware local.

Lograr una calidad de primera categoría para el código, la visión y el audio

EmbeddingGemma 2 coincide con el buen rendimiento en textos multilingües de EmbeddingGemma, mientras ofrece una mejora significativa de 9.92 puntos en el rendimiento del código (en MTEB Code, de 68.76 a 78.68), lo que lo hace muy adecuado para la indexación de código local, la búsqueda de código semántico y la recuperación de agentes de codificación. En imágenes, videos, documentos y audio, establece un nuevo estándar en calidad por parámetro para modelos sub-1B y incluso supera a algunos modelos especializados de más del doble su tamaño.

Massive Text Embedding Benchmark (Code) Massive Image Embedding Benchmark (Lite) Massive Audio Embedding Benchmark

Encuentre las métricas de evaluación completas y la información del modelo en el tarjeta de modelo EmbeddingGemma 2.

Habilitando búsqueda semántica, enrutamiento y recuperación, completamente en dispositivo

EmbeddingGemma 2 proporciona capacidades robustas directamente en hardware de borde. Generar embeddings localmente ayuda a garantizar la privacidad de los datos, reduce la latencia del proceso y permite a los desarrolladores crear búsquedas y recuperación multimodales que funcionan completamente sin conexión.

Cuando se utiliza junto con modelos generativos como Gemma 4, EmbeddingGemma 2 permite pipelines RAG en el dispositivo que comprenden datos multimodales complejos. Dado que EmbeddingGemma 2 está construido sobre Gemma 4 y comparte su tokenizer de texto y codificador de audio, los desarrolladores pueden ejecutar ambos modelos juntos en un pipeline unificado, con un impacto en la memoria total menor.

Utilice texto o una imagen para encontrar los mejores resultados en su biblioteca de medios basándose en la similitud semántica. Pruebe esto en la búsqueda de medios instantánea de Google AI Edge Gallery.

Encuentre momentos específicos en el video utilizando consultas de texto o audio. Pruebe en Google AI Edge Gallery’s Video Moments Finder.

Empaquetado en pareja de Gemma 2 para la recuperación de archivos locales con Gemma 4 para el razonamiento contextual. Prueba en la aplicación Google AI Edge Foresight.

Cree motores de decisión en tiempo real que aprovechan el contexto multimodal para clasificación, enrutamiento y capacidades predictivas a través de MediaPipe Decision Task API.

Para aprender cómo construir sistemas de búsqueda en el dispositivo y RAG con LiteRT, lea el artículo del blog de Google AI Edge.

Empezar con EmbeddingGemma 2

Trabajamos en estrecha colaboración con los siguientes socios para asegurar que EmbeddingGemma 2 funcione de inmediato en los lugares donde se construye:

  • Descarga los modelos: Busca las pesas del modelo en Hugging Face y Kaggle. El Jardín de modelos de la Plataforma de Agente Empresarial Gemini Enterprise estará disponible pronto. Visita LiteRT Community en Hugging Face para modelos optimizados para el dispositivo.
  • Despliegue en dispositivo: Desarrolla aplicaciones multiplataforma con Google AI Edge MediaPipe para integración rápida, recuperación y tareas de toma de decisiones, o LiteRT para integración de modelos personalizados. Construye aplicaciones para el navegador con transformers.js o WebGPU.
  • Usa tus herramientas de desarrollo favoritas: Sirve el modelo de manera eficiente utilizando transformers, sentence-transformers, MLX, vLLM, llama.cpp, SGLang, Ollama y LMStudio. Almacena tus vectores de embedding con Qdrant.
  • Afinoamiento: Siga las instrucciones de Unsloth para saber cómo afinar EmbeddingGemma 2 según sus casos de uso.

Explora nuestro guía para desarrolladores, documentación, y guías para inferencia y afineamiento.

Fuente original

Google DeepMind

Notas sobre el contenido

La publicación original y los derechos pertenecen a la fuente.

Traducción automática · Consulte el original