MarkTechPost

تطلق Perplexity AI نموذج pplx-embed-v2-late: نموذج طرفي بحجم 0.6B ونموذج بحجم 9B يحقق 92.4% على MADQA

يأتي pplx-embed-v2-late من Perplexity في 2 من الأحجام: نموذج بحجم 0.6B مصمم للتشغيل على الأجهزة الطرفية، ونموذج بحجم 9B لبناء فهارس عالية الجودة. أفضل نتيجة له هي 92.4% على MADQA، وأضعفها 61.2% على ViDoRe v3 Markdown.…

أصدرت Perplexity pplx-embed-v2-late، وهو زوج من نماذج التضمين متعددة الوسائط بأسلوب ColBERT. تأتي في 2 من الأحجام: 0.6B للاستعلامات السريعة والرخيصة و9B لأقصى جودة. كلا النموذجين يسترجع النصوص والصور وصفحات PDF المعروضة، ويشتركان في فضاء تضمين واحد.

هل يمكن نشره؟ نعم، إذا استضفته بنفسك. كلا النموذجين متاحان على Hugging Face بموجب رخصة MIT. نقطة نهاية مستضافة عبر Perplexity API مخطط لها لكنها غير متاحة بعد.

TL;DR

الأفضل

  • يستخدم نموذج 0.6B نحو 340M معامل فعّال للصور ويبقى قريباً من منافسيه بحجم 8B.
  • يمكن البحث في فهرس بحجم 9B باستخدام استعلامات بحجم 0.6B، مستعيداً نحو نصف فجوة الجودة بين 9B على النصوص بتكلفة استعلام 0.6B.
  • متجهاته الرمزية ذات 128 بُعداً أضيق بـ 16x إلى 32x من المنافسين ذوي 2,048 إلى 4,096 بُعداً.
  • رخصة MIT، مع السماح بالاستخدام التجاري.

الأسوأ

  • يخزّن 1 متجه لكل رمز، لذا ينمو حجم الفهرس مع طول المستند.
  • ليس في المرتبة #1 على استرجاع الصور في ViDoRe v3؛ فنموذج EVIE من Tencent يسجل نتائج أعلى.
  • مدخل واحد لا يمكنه مزج النصوص والصور.
  • جميع النتائج مُبلّغ عنها ذاتياً، والتقرير التقني لم يصدر بعد.

حجم النموذج وما يعمل عليه

المقاييسpplx-embed-v2-late-0.6bpplx-embed-v2-late-9b
إجمالي المعاملات594M9B (يسرد Hugging Face 8B)
المعاملات الفعّالة~240M نص، 340M صورة7.4B
النموذج الأساسيQwen3.5-0.8B، مقلّص إلى 12 طبقة نصيةQwen3.5
المخرجات128 بُعدًا لكل رمز128 بُعدًا لكل رمز
الأوزان في الذاكرة (bf16، تقديرنا)~1.2 جيجابايت~16 إلى 18 جيجابايت
الجهاز المقصودحاسوب محمول، أو جهاز طرفي، أو وحدة معالجة رسومات صغيرةمركز بيانات أو وحدة معالجة رسومات عالية الذاكرة
الدور المقترح لـ Perplexityمُرمِّز استعلامات مباشر، 100% محليبناء فهرس المستند

صمّمت Perplexity نموذج 0.6B ك encoded خفيف للاستعلامات يمكن تشغيله أيضاً على الأجهزة الطرفية. كلا بطاقات النموذج تعرض استخدام وحدات معالجة الرسومات CUDA. إنها تحتاج إلى sentence-transformers >= 6.0.0 و transformers >= 5.4.0. أرقام الذاكرة هي تقديرنا عند 2 بايت لكل معامل، وللأوزان فقط. نقاط التحقق المنشورة مخزّنة بصيغة F32، مما يضاعف حجم التنزيل.

ما مدى أدائه: أفضل وأسوأ الدرجات

جميع الأرقام أدناه من شركة Perplexity إعلان:

المعيار المرجعي0.6B9Bأين تقف الأمور
MADQA (أسئلة وأجوبة ذكية عن ملفات PDF بواسطة وكلاء، الدقة)90.1%92.4% (الأفضل)يتفوق على أداة الاسترجاع من Mixedbread (88.9%)؛ لكنه يتأخر عن Mixedbread Agentic Search (93.4%)
نصوص متخصصة بمجال معين (72 مهمة، nDCG@10)78.0%81.3%يتصدّر طراز 9B جميع الطرازات المختبرة بفارق 1.6 نقطة مئوية؛ بينما يتأخر 0.6B بفارق 0.3 نقطة مئوية خلف gemini-embedding-2
Q2D-Web (Recall@1000)73.6%74.8%كلاهما تفوق على أفضل نتيجة سابقة بلغت 69.3%
صورة ViDoRe v3 (nDCG@10)62.3%65.2%0.6B يقع ضمن 1.2 نقطة مئوية من nemotron-colembed-v2-8b؛ EVIE يتصدّر
ViDoRe v3 بنظام Markdown (nDCG@10)61.2% (الأسوأ)64.7%كلاهما تفوق على كل النماذج الخارجية المُختبَرة
BrowseComp+ (الدقة)غير معطى64.0% (الأدنى)لا يزال أعلى بـ 4.9 نقطة مئوية من نموذج ColBERT التالي

النتيجة الأقوى: 92.4% على MADQA، حققها نموذج 9B. أكبر فارق يكون على BrowseComp+، بفارق 8.7 نقطة مئوية عن أفضل نموذج كثيف.

النتيجة الأضعف: 61.2% على ViDoRe v3 Markdown، من نموذج 0.6B. وهي لا تزال الدرجة رقم 2 الأفضل على هذا المعيار. البحث في الصور هو الفجوة الحقيقية: Gemini Embedding 2 يتفوق على نموذج 9B على MIRACL-Vision وبفارق 2 نقطة مئوية على PPLX-Q2I.

مزج الأحجام: فهرس 9B استُعلم بواسطة نموذج 0.6B حقق 63.5% على استرجاع الصور في ViDoRe v3. وهذا يتفوق على 62.3% باستخدام 0.6B على الجانبين، وبكلفة استعلام واحدة.

كيف يعمل

النماذج الكثيفة تضغط المستند في متجه 1. أما pplx-embed-v2-late فيحتفظ بمتجه من 128 بُعدًا لكل رمز (token). ويحسب النتائج بأسلوب MaxSim: كل رمز في الاستعلام يجد أفضل رمز له في المستند، وتُجمع تلك القيم القصوى. تُرمَّز الصفحات كصور، فلا حاجة لخطوة OCR. قامت Perplexity بتقطير كلا النموذجين من معلّم بحجم 18B باستخدام LEAFوهو تدريب على مستوى الرموز على طريقة LEAF. هذا التدريب هو ما يُنشئ الفضاء المشترك.

أفضل حالات الاستخدام

  • الاستخدام الأمثل هو البحث المرئي في المستندات مثل ملفات PDF والعروض التقديمية والتقارير الممسوحة ضوئيًا.
  • البحث منخفض زمن الاستجابة: الفهرسة في السحابة باستخدام 9B، ثم الاستعلام على الجهاز باستخدام 0.6B.
  • RAG الوكيلي على مجموعات كبيرة من ملفات PDF أو الويب.

شرح تفاعلي

كيف يقارن مع غيره

الميزةpplx-embed-v2-lateNVIDIA nemotron-colembed-vl-8b-v2TopK topk-embed-v1Google Gemini Embedding 2
الحجم0.6B، 9B~8.8B0.8B، 2B مفتوحغير مُعلن
عرض المتجه128 لكل رمز4,096 لكل رمز2,048 لكل رمز (صغير)من 128 إلى 3,072، متجه 1
المدخلاتنصوص وصور وعروض صفحاتاستعلامات نصية وصور صفحاتنصوص وصور صفحاتنص وصور وفيديو وصوت وملفات PDF
يعمل علىمعالج الرسوميات الخاص بك؛ 0.6B على الأجهزة الطرفيةNVIDIA A100/H100، Linuxمعالج رسوميات CUDA (Ampere+)واجهة Google API
مساحة مشتركة عبر الأحجامنعمغير مذكورغير مذكورغير منطبق
الرخصةMITCC-BY-NC-4.0Apache 2.0 (الصغير)مملوك

الخلاصات الرئيسية

  • يناسب نموذج 0.6B الأجهزة الطرفية؛ أما نموذج 9B فهو مبني لجودة وقت الفهرسة.
  • أفضل نتيجة: 92.4% على MADQA. الأضعف: 61.2% على ViDoRe v3 Markdown.
  • استعلامات 0.6B عبر فهرس 9B تفوقت على 0.6B على الجانبين.
  • نمو التخزين والنتائج المبلّغ عنها ذاتيًا هي أبرز التحفظات.


اطّلع على أوزان النموذج على HF و التفاصيل التقنية. كل الفضل يعود إلى باحث هذا المشروع. كما لا تترددوا في متابعتنا على تويتر ولا تنسوا الانضمام إلى مجموعة ML الفرعية لدينا التي تضم أكثر من 150k+ مشترك و الاشتراك في نشريدنا البريدي. مهلًا! هل أنت على تيليجرام؟ يمكنك الآن الانضمام إلينا على تيليجرام أيضًا.

[مُموّل] الويب هو واجهة API الوحيدة التي تفتقدها معظم الوكلاء. قواعد البيانات والتقويمات والمستودعات لديها واجهات API. أما الويب المفتوح فليس لديه في معظمه. إن TinyFish MCP server يمنح أي عميل MCP أربع أدوات: TinySearch وTinyFetch (صفحات كاملة بصيغة markdown، بما في ذلك JavaScript)، وTinyBrowser لتسجيل الدخول والنماذج، وTinyAgent للمهام متعددة الخطوات. البحث والجلب مجانيان.

ظهر المقال Perplexity AI تطلق pplx-embed-v2-late: نموذج Edge بحجم 0.6B ونموذج بحجم 9B يحقق نسبة 92.4% على MADQA أول مرة على MarkTechPost.

المصدر الأصلي

MarkTechPost

ملاحظات المحتوى

النشر الأصلي والحقوق تعود إلى المصدر.

ترجمة آلية · يُرجى الرجوع إلى الأصل