أصدرت Google DeepMind EmbeddingGemma 2، وهو نموذج مفتوح يضمّن النصوص والشيفرات والصور والفيديو والصوت في فضاء واحد ذي 768 بُعدًا. يضم 740M معاملًا، ونافذة سياق بحجم 8K من الرموز، وترخيص Apache 2.0. ويستهدف البحث على الجهاز والتصنيف وRAG المعتمدة على الخصوصية أولاً. تحلل هذه المقالة وتقارن وتستعرض كيف يتسرب EmbeddingGemma 2 في هذا المجال.
قابل للنشر اليوم؟ نعم. الأوزان متاحة على Hugging Face و Kaggle، مع Ollama, llama.cpp GGUF و LiteRT متوفرة الآن.
ماذا يفعل نموذج التضمين
يحوّل نموذج التضمين المحتوى إلى متجه من الأرقام يستوعب المعنى. تقع العناصر المتشابهة قريبة من بعضها، مما يسهل البحث عنها ومقارنتها. في خط أنابيب RAG، تتيح هذه المتجهات لنموذج LLM استرجاع معلومات حديثة لم يُدرَّب عليها. توليد التضمينات محليًا يحفظ البيانات على الجهاز، ويقلل زمن الاستجابة، ويعمل دون اتصال بالإنترنت.
فضاء متجه واحد لكل وسائط
تم بناء EmbeddingGemma 2 على معمارية Gemma 4. يمكن لاستعلام نصي استرجاع صورة. ويمكن لمذكرة صوتية استرجاع مقطع فيديو. والمدخلات المتداخلة، مثل قائمة منتج تتضمن نصوصًا وصورًا وفيديو تجريبيًا، تنتج تضمينًا واحدًا.
التصميم معياري. يتكون من ثلاثة أجزاء:
- العمود الفقري للنصوص والشيفرات: 270M معاملًا (130M محول ترانسموتر بالإضافة إلى 140M مضمّن)
- مُرمِّز الرؤية: 170M معاملًا، اختياري
- مُرمِّز الصوت: 300M معاملًا، اختياري
يقوم المطورون بتحميل ما يحتاجونه فقط: 270M للنصوص، و440M للنصوص والرؤية، و570M للنصوص والصوت، أو 740M لكل شيء. وتتشارك جميع الإعدادات فضاء متجه واحد. ويمكن لاستعلام مضمّن بالإعداد النصي فقط أن يطابق مستندات مضمّنة بواسطة النموذج الكامل.
نافذة السياق هي 8,192 رمزًا، أي أكبر بـ 4 أضعاف من الإصدار 1. يستوعب ذلك حوالي 29 صورة، أو 58 إطار فيديو، أو 5.5 دقيقة من الصوت.
المعايير القياسية
يقدم فريق بحثي في Google تقريرًا عن نتائج متصدرة بين أدوات التضمين متعددة الوسائط الأصغر من 1B على MTEB Code و MAEB. النتائج بدقة كاملة عند 768 أبعاد:
| المعيار القياسي | EmbeddingGemma 2 | EmbeddingGemma 1 |
|---|---|---|
| MTEB multilingual v2 | 61.36 | 61.15 |
| MTEB Code v1 | 78.68 | 68.76 |
| MIEB lite (صور) | 64.64 | غير متاح |
| MMEB v2 الإجمالي | 59.01 | غير متاح |
| MSEB retrieval (صوت) | 69.54 | غير متاح |
| MAEB (صوت) | 49.39 | غير متاح |
المصدر: بطاقة نموذج EmbeddingGemma 2
يحقق استرجاع الشيفرة مكاسب قدرها 9.92 نقطة، أي نحو 14%. وتظل جودة النصوص متعددة اللغات ثابتة. ولا تزال النماذج الأكبر تتصدّر بعض لوحات النتائج. Qwen3-VL-Embedding-2B يسجل 73.2 في تجربته الخاصة على MMEB-V2، بمعاملات تزيد بنحو 2.7 مرة ودون دعم للصوت.
مصمم للهواتف وأجهزة الكمبيوتر المحمولة
مع التكميم على جهاز Pixel 11 Pro، تبلغ ذاكرة RAM النشطة حوالي 191 ميغابايت لأوزان النص فقط. يحتاج النموذج متعدد الوسائط الكامل إلى حوالي 567 ميغابايت. يضغط التدريب الواعي بالتكميم الأوزان إلى INT4 وINT8. لقد فريق Google AI Edge قاس زمن 37.3 مللي ثانية لكل صورة على وحدة معالجة رسومات MacBook M5 Pro، باستخدام ميزانية بصرية من 70 رمزاً.
تتيح Matryoshka Representation Learning (MRL) للمطورين اقتطاع المتجهات إلى 512 أو 256 أو 128 بُعداً. الانتقال من 768 إلى 128 بُعداً يقلل التخزين حتى 6 مرات. عند 256 بُعداً، ينخفض MTEB متعدد اللغات فقط من 61.36 إلى 60.41. عند 128 بُعداً، ينخفض MMEB إلى 45.65، لذا توصي Google بـ 128 بُعداً بشكل أساسي لأحمال العمل النصية فقط.
شرح تفاعلي
EmbeddingGemma 2 مقابل أقرب المنافسين
| الميزة | EmbeddingGemma 2 | EmbeddingGemma 1 | Qwen3-VL-Embedding-2B | LCO-Embedding-Omni-3B | Gemini Embedding 2 |
|---|---|---|---|---|---|
| المطور | Google DeepMind | Google DeepMind | Alibaba Qwen | LCO-Embedding (بحثي) | |
| المعاملات | 740M (270M للنص فقط) | 308M | 2B | هيكل 3B (5B مذكور على HF) | غير معلن |
| النص / الشيفرة | نعم | نعم | نعم | نعم | نعم |
| الصور | نعم | لا | نعم | نعم | نعم |
| فيديو | نعم | لا | نعم | نعم | نعم |
| صوت | نعم | لا | لا | نعم | نعم |
| أبعاد المخرجات (MRL) | 768 (512, 256, 128) | 768 (حتى 128) | حتى 2048 (من 64 إلى 2048) | غير مذكور | 3072 (من 128 إلى 3072) |
| السياق | 8,192 رمزاً | 2K رمز | 32K رمز | غير مذكور | 8,192 رمزاً |
| اللغات | 100+ | 100+ | 30+ | غير مذكور | 100+ |
| الترخيص / الوصول | Apache 2.0، أوزان مفتوحة | أوزان مفتوحة (شروط Gemma) | Apache 2.0، أوزان مفتوحة | Apache 2.0، أوزان مفتوحة | واجهة برمجية مدفوعة فقط |
| ذاكرة عشوائية للجهاز المنشورة | ~191MB للنص، ~567MB للنسخة الكاملة | أقل من 200MB | غير منشورة | غير منشورة | السحابة فقط |
| المصدر | بطاقة النموذج | الوثائق | بطاقة HF | بطاقة HF | وثائق الـ API |
كيفية تشغيله
يعمل على sentence-transformers v6.1.0+، وTransformers، وvLLM، وSGLang، وMLX، وllama.cpp، وOllama، وLM Studio، وLiteRT، وMediaPipe. Qdrant يغطي التخزين المتجهي و Unsloth يغطي الضبط الدقيق. دعم ML Kit لأندرويد، مع تسريع NPU، سيصل خلال أسابيع.
نسخ الكودpip install -U "sentence-transformers[image,audio,video]" transformers
from sentence_transformers import SentenceTransformer
model = SentenceTransformer("google/embeddinggemma-2")
q = model.encode("What causes the northern lights?", prompt_name="SearchQuery")
d = model.encode("Charged particles from the sun.", prompt_name="Document")
print(model.similarity(q, d))
على Ollama، شغّل ollama pull embeddinggemma-2. تتراوح الوسوم من 270m (378MB) إلى 740m (1.3GB). توجد العروض التوضيحية في Google AI Edge Gallery. راجع دليل المطور لمزيد من المعلومات.
الخلاصات الرئيسية
- نموذج مفتوح بحجم 740M يدمج النص والشيفرة والصور والفيديو والصوت في فضاء مشترك بـ 768 بُعداً.
- المُشفِّرات المعيارية توسّع الحجم من 270M (نص) إلى 740M (متعدد الوسائط كاملاً).
- استرجاع الشيفرة يقفز من 68.76 إلى 78.68 على MTEB Code.
- يعمل بحوالي 191MB إلى 567MB من الذاكرة العشوائية على هاتف Pixel 11 Pro مع التكميم.
الأسئلة الشائعة
- هل يمكن استخدام EmbeddingGemma 2 تجارياً؟ نعم. تم إصداره بموجب ترخيص Apache 2.0.
- كم من الذاكرة يحتاج EmbeddingGemma 2؟ تذكر Google حوالي 191MB من الذاكرة العشوائية الفعّالة للاستخدام النصي فقط، و567MB للاستخدام متعدد الوسائط الكامل، مع التكميم، على هاتف Pixel 11 Pro.
اطلع على أوزان النموذج على HF و التفاصيل التقنية. كل الفضل للباحث في هذا المشروع. كما لا تترددوا في متابعتنا على تويتر ولا تنسوا الانضمام إلى مجتمع ML الفرعي الذي يضم أكثر من 150k عضو والاشتراك في نشرتنا البريدية. مهلاً! هل أنت على تيليجرام؟ يمكنك الآن الانضمام إلينا على تيليجرام أيضاً.
ظهر المنشور Google DeepMind تُطلق EmbeddingGemma 2، نموذج تضمين مفتوح متعدد الوسائط بحجم 740M مبني على Gemma 4 أولاً على MarkTechPost.