أصدرت Perplexity pplx-embed-v2-late، وهو زوج من نماذج التضمين متعددة الوسائط بأسلوب ColBERT. تأتي في 2 من الأحجام: 0.6B للاستعلامات السريعة والرخيصة و9B لأقصى جودة. كلا النموذجين يسترجع النصوص والصور وصفحات PDF المعروضة، ويشتركان في فضاء تضمين واحد.
هل يمكن نشره؟ نعم، إذا استضفته بنفسك. كلا النموذجين متاحان على Hugging Face بموجب رخصة MIT. نقطة نهاية مستضافة عبر Perplexity API مخطط لها لكنها غير متاحة بعد.
TL;DR
الأفضل
- يستخدم نموذج 0.6B نحو 340M معامل فعّال للصور ويبقى قريباً من منافسيه بحجم 8B.
- يمكن البحث في فهرس بحجم 9B باستخدام استعلامات بحجم 0.6B، مستعيداً نحو نصف فجوة الجودة بين 9B على النصوص بتكلفة استعلام 0.6B.
- متجهاته الرمزية ذات 128 بُعداً أضيق بـ 16x إلى 32x من المنافسين ذوي 2,048 إلى 4,096 بُعداً.
- رخصة MIT، مع السماح بالاستخدام التجاري.
الأسوأ
- يخزّن 1 متجه لكل رمز، لذا ينمو حجم الفهرس مع طول المستند.
- ليس في المرتبة #1 على استرجاع الصور في ViDoRe v3؛ فنموذج EVIE من Tencent يسجل نتائج أعلى.
- مدخل واحد لا يمكنه مزج النصوص والصور.
- جميع النتائج مُبلّغ عنها ذاتياً، والتقرير التقني لم يصدر بعد.
حجم النموذج وما يعمل عليه
| المقاييس | pplx-embed-v2-late-0.6b | pplx-embed-v2-late-9b |
|---|---|---|
| إجمالي المعاملات | 594M | 9B (يسرد Hugging Face 8B) |
| المعاملات الفعّالة | ~240M نص، 340M صورة | 7.4B |
| النموذج الأساسي | Qwen3.5-0.8B، مقلّص إلى 12 طبقة نصية | Qwen3.5 |
| المخرجات | 128 بُعدًا لكل رمز | 128 بُعدًا لكل رمز |
| الأوزان في الذاكرة (bf16، تقديرنا) | ~1.2 جيجابايت | ~16 إلى 18 جيجابايت |
| الجهاز المقصود | حاسوب محمول، أو جهاز طرفي، أو وحدة معالجة رسومات صغيرة | مركز بيانات أو وحدة معالجة رسومات عالية الذاكرة |
| الدور المقترح لـ Perplexity | مُرمِّز استعلامات مباشر، 100% محلي | بناء فهرس المستند |
صمّمت Perplexity نموذج 0.6B ك encoded خفيف للاستعلامات يمكن تشغيله أيضاً على الأجهزة الطرفية. كلا بطاقات النموذج تعرض استخدام وحدات معالجة الرسومات CUDA. إنها تحتاج إلى sentence-transformers >= 6.0.0 و transformers >= 5.4.0. أرقام الذاكرة هي تقديرنا عند 2 بايت لكل معامل، وللأوزان فقط. نقاط التحقق المنشورة مخزّنة بصيغة F32، مما يضاعف حجم التنزيل.
ما مدى أدائه: أفضل وأسوأ الدرجات
جميع الأرقام أدناه من شركة Perplexity إعلان:
| المعيار المرجعي | 0.6B | 9B | أين تقف الأمور |
|---|---|---|---|
| MADQA (أسئلة وأجوبة ذكية عن ملفات PDF بواسطة وكلاء، الدقة) | 90.1% | 92.4% (الأفضل) | يتفوق على أداة الاسترجاع من Mixedbread (88.9%)؛ لكنه يتأخر عن Mixedbread Agentic Search (93.4%) |
| نصوص متخصصة بمجال معين (72 مهمة، nDCG@10) | 78.0% | 81.3% | يتصدّر طراز 9B جميع الطرازات المختبرة بفارق 1.6 نقطة مئوية؛ بينما يتأخر 0.6B بفارق 0.3 نقطة مئوية خلف gemini-embedding-2 |
| Q2D-Web (Recall@1000) | 73.6% | 74.8% | كلاهما تفوق على أفضل نتيجة سابقة بلغت 69.3% |
| صورة ViDoRe v3 (nDCG@10) | 62.3% | 65.2% | 0.6B يقع ضمن 1.2 نقطة مئوية من nemotron-colembed-v2-8b؛ EVIE يتصدّر |
| ViDoRe v3 بنظام Markdown (nDCG@10) | 61.2% (الأسوأ) | 64.7% | كلاهما تفوق على كل النماذج الخارجية المُختبَرة |
| BrowseComp+ (الدقة) | غير معطى | 64.0% (الأدنى) | لا يزال أعلى بـ 4.9 نقطة مئوية من نموذج ColBERT التالي |
النتيجة الأقوى: 92.4% على MADQA، حققها نموذج 9B. أكبر فارق يكون على BrowseComp+، بفارق 8.7 نقطة مئوية عن أفضل نموذج كثيف.
النتيجة الأضعف: 61.2% على ViDoRe v3 Markdown، من نموذج 0.6B. وهي لا تزال الدرجة رقم 2 الأفضل على هذا المعيار. البحث في الصور هو الفجوة الحقيقية: Gemini Embedding 2 يتفوق على نموذج 9B على MIRACL-Vision وبفارق 2 نقطة مئوية على PPLX-Q2I.
مزج الأحجام: فهرس 9B استُعلم بواسطة نموذج 0.6B حقق 63.5% على استرجاع الصور في ViDoRe v3. وهذا يتفوق على 62.3% باستخدام 0.6B على الجانبين، وبكلفة استعلام واحدة.
كيف يعمل
النماذج الكثيفة تضغط المستند في متجه 1. أما pplx-embed-v2-late فيحتفظ بمتجه من 128 بُعدًا لكل رمز (token). ويحسب النتائج بأسلوب MaxSim: كل رمز في الاستعلام يجد أفضل رمز له في المستند، وتُجمع تلك القيم القصوى. تُرمَّز الصفحات كصور، فلا حاجة لخطوة OCR. قامت Perplexity بتقطير كلا النموذجين من معلّم بحجم 18B باستخدام LEAFوهو تدريب على مستوى الرموز على طريقة LEAF. هذا التدريب هو ما يُنشئ الفضاء المشترك.
أفضل حالات الاستخدام
- الاستخدام الأمثل هو البحث المرئي في المستندات مثل ملفات PDF والعروض التقديمية والتقارير الممسوحة ضوئيًا.
- البحث منخفض زمن الاستجابة: الفهرسة في السحابة باستخدام 9B، ثم الاستعلام على الجهاز باستخدام 0.6B.
- RAG الوكيلي على مجموعات كبيرة من ملفات PDF أو الويب.
شرح تفاعلي
كيف يقارن مع غيره
| الميزة | pplx-embed-v2-late | NVIDIA nemotron-colembed-vl-8b-v2 | TopK topk-embed-v1 | Google Gemini Embedding 2 |
|---|---|---|---|---|
| الحجم | 0.6B، 9B | ~8.8B | 0.8B، 2B مفتوح | غير مُعلن |
| عرض المتجه | 128 لكل رمز | 4,096 لكل رمز | 2,048 لكل رمز (صغير) | من 128 إلى 3,072، متجه 1 |
| المدخلات | نصوص وصور وعروض صفحات | استعلامات نصية وصور صفحات | نصوص وصور صفحات | نص وصور وفيديو وصوت وملفات PDF |
| يعمل على | معالج الرسوميات الخاص بك؛ 0.6B على الأجهزة الطرفية | NVIDIA A100/H100، Linux | معالج رسوميات CUDA (Ampere+) | واجهة Google API |
| مساحة مشتركة عبر الأحجام | نعم | غير مذكور | غير مذكور | غير منطبق |
| الرخصة | MIT | CC-BY-NC-4.0 | Apache 2.0 (الصغير) | مملوك |
الخلاصات الرئيسية
- يناسب نموذج 0.6B الأجهزة الطرفية؛ أما نموذج 9B فهو مبني لجودة وقت الفهرسة.
- أفضل نتيجة: 92.4% على MADQA. الأضعف: 61.2% على ViDoRe v3 Markdown.
- استعلامات 0.6B عبر فهرس 9B تفوقت على 0.6B على الجانبين.
- نمو التخزين والنتائج المبلّغ عنها ذاتيًا هي أبرز التحفظات.
اطّلع على أوزان النموذج على HF و التفاصيل التقنية. كل الفضل يعود إلى باحث هذا المشروع. كما لا تترددوا في متابعتنا على تويتر ولا تنسوا الانضمام إلى مجموعة ML الفرعية لدينا التي تضم أكثر من 150k+ مشترك و الاشتراك في نشريدنا البريدي. مهلًا! هل أنت على تيليجرام؟ يمكنك الآن الانضمام إلينا على تيليجرام أيضًا.
ظهر المقال Perplexity AI تطلق pplx-embed-v2-late: نموذج Edge بحجم 0.6B ونموذج بحجم 9B يحقق نسبة 92.4% على MADQA أول مرة على MarkTechPost.