MarkTechPost

تطلق Google DeepMind إصدار EmbeddingGemma 2، وهو نموذج تضمين متعدد الوسائط مفتوح بحجم 740M مبني على Gemma 4

يقوم EmbeddingGemma 2 من Google DeepMind بتحويل 5 أنواع من المدخلات إلى فضاء واحد بأبعاد 768d، ويتوفر اليوم بموجب ترخيص Apache 2.0. ظهرت المقالة تطلق Google DeepMind إصدار EmbeddingGemma 2، وهو نموذج تضمين متعدد الوسائط…

أصدرت Google DeepMind EmbeddingGemma 2، وهو نموذج مفتوح يضمّن النصوص والشيفرات والصور والفيديو والصوت في فضاء واحد ذي 768 بُعدًا. يضم 740M معاملًا، ونافذة سياق بحجم 8K من الرموز، وترخيص Apache 2.0. ويستهدف البحث على الجهاز والتصنيف وRAG المعتمدة على الخصوصية أولاً. تحلل هذه المقالة وتقارن وتستعرض كيف يتسرب EmbeddingGemma 2 في هذا المجال.

قابل للنشر اليوم؟ نعم. الأوزان متاحة على Hugging Face و Kaggle، مع Ollama, llama.cpp GGUF و LiteRT متوفرة الآن.

ماذا يفعل نموذج التضمين

يحوّل نموذج التضمين المحتوى إلى متجه من الأرقام يستوعب المعنى. تقع العناصر المتشابهة قريبة من بعضها، مما يسهل البحث عنها ومقارنتها. في خط أنابيب RAG، تتيح هذه المتجهات لنموذج LLM استرجاع معلومات حديثة لم يُدرَّب عليها. توليد التضمينات محليًا يحفظ البيانات على الجهاز، ويقلل زمن الاستجابة، ويعمل دون اتصال بالإنترنت.

فضاء متجه واحد لكل وسائط

تم بناء EmbeddingGemma 2 على معمارية Gemma 4. يمكن لاستعلام نصي استرجاع صورة. ويمكن لمذكرة صوتية استرجاع مقطع فيديو. والمدخلات المتداخلة، مثل قائمة منتج تتضمن نصوصًا وصورًا وفيديو تجريبيًا، تنتج تضمينًا واحدًا.

التصميم معياري. يتكون من ثلاثة أجزاء:

  • العمود الفقري للنصوص والشيفرات: 270M معاملًا (130M محول ترانسموتر بالإضافة إلى 140M مضمّن)
  • مُرمِّز الرؤية: 170M معاملًا، اختياري
  • مُرمِّز الصوت: 300M معاملًا، اختياري

يقوم المطورون بتحميل ما يحتاجونه فقط: 270M للنصوص، و440M للنصوص والرؤية، و570M للنصوص والصوت، أو 740M لكل شيء. وتتشارك جميع الإعدادات فضاء متجه واحد. ويمكن لاستعلام مضمّن بالإعداد النصي فقط أن يطابق مستندات مضمّنة بواسطة النموذج الكامل.

نافذة السياق هي 8,192 رمزًا، أي أكبر بـ 4 أضعاف من الإصدار 1. يستوعب ذلك حوالي 29 صورة، أو 58 إطار فيديو، أو 5.5 دقيقة من الصوت.

المعايير القياسية

يقدم فريق بحثي في Google تقريرًا عن نتائج متصدرة بين أدوات التضمين متعددة الوسائط الأصغر من 1B على MTEB Code و MAEB. النتائج بدقة كاملة عند 768 أبعاد:

المعيار القياسيEmbeddingGemma 2EmbeddingGemma 1
MTEB multilingual v261.3661.15
MTEB Code v178.6868.76
MIEB lite (صور)64.64غير متاح
MMEB v2 الإجمالي59.01غير متاح
MSEB retrieval (صوت)69.54غير متاح
MAEB (صوت)49.39غير متاح

المصدر: بطاقة نموذج EmbeddingGemma 2

يحقق استرجاع الشيفرة مكاسب قدرها 9.92 نقطة، أي نحو 14%. وتظل جودة النصوص متعددة اللغات ثابتة. ولا تزال النماذج الأكبر تتصدّر بعض لوحات النتائج. Qwen3-VL-Embedding-2B يسجل 73.2 في تجربته الخاصة على MMEB-V2، بمعاملات تزيد بنحو 2.7 مرة ودون دعم للصوت.

مصمم للهواتف وأجهزة الكمبيوتر المحمولة

مع التكميم على جهاز Pixel 11 Pro، تبلغ ذاكرة RAM النشطة حوالي 191 ميغابايت لأوزان النص فقط. يحتاج النموذج متعدد الوسائط الكامل إلى حوالي 567 ميغابايت. يضغط التدريب الواعي بالتكميم الأوزان إلى INT4 وINT8. لقد فريق Google AI Edge قاس زمن 37.3 مللي ثانية لكل صورة على وحدة معالجة رسومات MacBook M5 Pro، باستخدام ميزانية بصرية من 70 رمزاً.

تتيح Matryoshka Representation Learning (MRL) للمطورين اقتطاع المتجهات إلى 512 أو 256 أو 128 بُعداً. الانتقال من 768 إلى 128 بُعداً يقلل التخزين حتى 6 مرات. عند 256 بُعداً، ينخفض MTEB متعدد اللغات فقط من 61.36 إلى 60.41. عند 128 بُعداً، ينخفض MMEB إلى 45.65، لذا توصي Google بـ 128 بُعداً بشكل أساسي لأحمال العمل النصية فقط.

شرح تفاعلي

EmbeddingGemma 2 مقابل أقرب المنافسين

الميزةEmbeddingGemma 2EmbeddingGemma 1Qwen3-VL-Embedding-2BLCO-Embedding-Omni-3BGemini Embedding 2
المطورGoogle DeepMindGoogle DeepMindAlibaba QwenLCO-Embedding (بحثي)Google
المعاملات740M (270M للنص فقط)308M2Bهيكل 3B (5B مذكور على HF)غير معلن
النص / الشيفرةنعمنعمنعمنعمنعم
الصورنعملانعمنعمنعم
فيديونعملانعمنعمنعم
صوتنعملالانعمنعم
أبعاد المخرجات (MRL)768 (512, 256, 128)768 (حتى 128)حتى 2048 (من 64 إلى 2048)غير مذكور3072 (من 128 إلى 3072)
السياق8,192 رمزاً2K رمز32K رمزغير مذكور8,192 رمزاً
اللغات100+100+30+غير مذكور100+
الترخيص / الوصولApache 2.0، أوزان مفتوحةأوزان مفتوحة (شروط Gemma)Apache 2.0، أوزان مفتوحةApache 2.0، أوزان مفتوحةواجهة برمجية مدفوعة فقط
ذاكرة عشوائية للجهاز المنشورة~191MB للنص، ~567MB للنسخة الكاملةأقل من 200MBغير منشورةغير منشورةالسحابة فقط
المصدربطاقة النموذجالوثائقبطاقة HFبطاقة HFوثائق الـ API

كيفية تشغيله

يعمل على sentence-transformers v6.1.0+، وTransformers، وvLLM، وSGLang، وMLX، وllama.cpp، وOllama، وLM Studio، وLiteRT، وMediaPipe. Qdrant يغطي التخزين المتجهي و Unsloth يغطي الضبط الدقيق. دعم ML Kit لأندرويد، مع تسريع NPU، سيصل خلال أسابيع.

نسخ الكود
pip install -U "sentence-transformers[image,audio,video]" transformers

from sentence_transformers import SentenceTransformer
model = SentenceTransformer("google/embeddinggemma-2")
q = model.encode("What causes the northern lights?", prompt_name="SearchQuery")
d = model.encode("Charged particles from the sun.", prompt_name="Document")
print(model.similarity(q, d))

على Ollama، شغّل ollama pull embeddinggemma-2. تتراوح الوسوم من 270m (378MB) إلى 740m (1.3GB). توجد العروض التوضيحية في Google AI Edge Gallery. راجع دليل المطور لمزيد من المعلومات.

الخلاصات الرئيسية

  • نموذج مفتوح بحجم 740M يدمج النص والشيفرة والصور والفيديو والصوت في فضاء مشترك بـ 768 بُعداً.
  • المُشفِّرات المعيارية توسّع الحجم من 270M (نص) إلى 740M (متعدد الوسائط كاملاً).
  • استرجاع الشيفرة يقفز من 68.76 إلى 78.68 على MTEB Code.
  • يعمل بحوالي 191MB إلى 567MB من الذاكرة العشوائية على هاتف Pixel 11 Pro مع التكميم.

الأسئلة الشائعة

  • هل يمكن استخدام EmbeddingGemma 2 تجارياً؟ نعم. تم إصداره بموجب ترخيص Apache 2.0.
  • كم من الذاكرة يحتاج EmbeddingGemma 2؟ تذكر Google حوالي 191MB من الذاكرة العشوائية الفعّالة للاستخدام النصي فقط، و567MB للاستخدام متعدد الوسائط الكامل، مع التكميم، على هاتف Pixel 11 Pro.


اطلع على أوزان النموذج على HF و التفاصيل التقنية. كل الفضل للباحث في هذا المشروع. كما لا تترددوا في متابعتنا على تويتر ولا تنسوا الانضمام إلى مجتمع ML الفرعي الذي يضم أكثر من 150k عضو والاشتراك في نشرتنا البريدية. مهلاً! هل أنت على تيليجرام؟ يمكنك الآن الانضمام إلينا على تيليجرام أيضاً.

[برعاية] الويب هو واجهة API الوحيدة التي تنقص معظم الوكلاء. قواعد البيانات والتقويمات والمستودعات لديها واجهات API. أما الويب المفتوح فمعظمه لا يملكها. خادم TinyFish MCP يمنح أي عميل MCP أربع أدوات: TinySearch، وTinyFetch (صفحات كاملة بصيغة ماركداون، مع دعم JavaScript)، وTinyBrowser لتسجيل الدخول والنماذج، وTinyAgent للمهام متعددة الخطوات. البحث والجلب مجانيان.

ظهر المنشور Google DeepMind تُطلق EmbeddingGemma 2، نموذج تضمين مفتوح متعدد الوسائط بحجم 740M مبني على Gemma 4 أولاً على MarkTechPost.

المصدر الأصلي

MarkTechPost

ملاحظات المحتوى

النشر الأصلي والحقوق تعود إلى المصدر.

ترجمة آلية · يُرجى الرجوع إلى الأصل