MarkTechPostآخر تحديث

Liquid AI تُطلق نموذجي d1-3B وd1-omni-600M مفتوحي الأوزان: نماذج قرار متعددة الوسائط بصفر رموز إخراج

أطلقت Liquid AI كلاً من Open d1، وهما نموذجان متعددا الوسائط مفتوحا الأوزان ضمن عائلة نماذج القرار d1 التابعة لها. يقرأ d1-3B النصوص والصور. ويقرأ d1-omni-600M النص مع صورة، أو النص مع الصوت. لا يكتب أي من النموذجين…

أطلقت Liquid AI كلاً من Open d1، وهما نموذجان متعددا الوسائط مفتوحا الأوزان ضمن عائلة نماذج القرار d1 التابعة لها. d1-3B يقرأ النصوص والصور. d1-omni-600M يقرأ النص مع صورة، أو النص مع الصوت. لا يكتب أي من النموذجين نصوصاً. يعيد كل منهما إجابات مُعايَرة ومحدَّدة النوع في تمريرة أمامية واحدة وبصفر رموز إخراج. الهدف هو القرارات في الوقت الفعلي على حزمة NVIDIA: خوادم DGX، ومحطات عمل RTX، ولوحات الحافة Jetson.

هل يمكن نشره؟ نعم. كلا النموذجين متاحان على Hugging Face، ويُحمَّلان عبر Transformers، ويدعمهما llama.cpp من اليوم الأول. و رخصة LFM Open License v1.0 تسمح بالاستخدام التجاري المجاني للشركات التي تقل إيراداتها السنوية عن 10 ملايين دولار. أما d1-omni-600M فهو إصدار بحثي مبكر دون أرقام زمن استجابة منشورة.

ما هو نموذج القرار؟

يكتب النموذج اللغوي التوليدي إجابته رمزاً بعد رمز، ثم يحللها كودك. أما نموذج القرار فيأخذ حالة ومجموعة من الأسئلة المسماة، ويقرأها مرة واحدة، ويعيد احتمالاً لكل إجابة مسموحة. تُعرِّف Liquid AI ثلاثة أنواع من الأسئلة:

  • noul: سؤال بنعم أو لا، يعاد على شكل P(yes).
  • choice: اختيار خيار واحد من بين خيارات مسماة، مع توزيع احتمالي كامل.
  • score: موقع موزون احتمالياً على مقياس مرتَّب من 2 إلى 10 مستويات.

يمكن لعدة أسئلة أن تتشارك حالة واحدة في استدعاء واحد. ويُبلَّغ في كل استجابة عن output_tokens: 0. توصي Liquid AI باستخدام d1 في التوجيه، والإشراف على المحتوى، وتصنيف النوايا، وإعادة الترتيب، والتقييم بنمط LLM-as-a-judge، وضوابط حماية الوكلاء، والفحص البصري. لا يمثل أي من النموذجين نموذج محادثة.

كيف بُني d1-3B وd1-omni-600M؟

يحتوي d1-3B يحتوي على 3.12B من المعاملات ويبدأ من LFM2.5-VL-3B، وهو نموذج فهم بصري-لغوي من نوع decoder-only. متوسطت Liquid AI أوزان LFM2.5-2.6B مع العمود الفقري النصي لهذا النموذج. ثم ضبطت بدقة عدة نماذج ببذور مختلفة وخلطات بيانات مختلفة، ودمجتها من جديد. يستخدم النموذج مُرمِّز رؤية 400M SigLIP2 NaFlex وسياقاً بطول 32,768 رمزاً. وكانت المدخلات الطويلة، وخلط خيارات الإجابة، ومعالجة الاختصارات في البيانات أهم من التقنيات المتقدمة.

d1-omni-600M يحتوي على 587M معامل ويبدأ من LFM2.5-Encoder-350M، وهو مشفّر ثنائي الاتجاه. يغطي ذلك جذعاً مشتركاً ورأس قرار بحجم 381M، ومشفّر رؤية بحجم 94M، ومشفّر صوت بحجم 112M. مشفّر الصوت هو FastConformer من 17 طبقة. السياق هو 16,384 رمزاً. المقاطع الصوتية محدودة بـ 30 ثانية. يحمل الطلب صوراً أو صوتاً، وليس الاثنين معاً أبداً. كان تدريب الصوت يشمل طلبات من متحدث إلى مساعد بالإنجليزية فقط.

أين يناسب Open d1 بشكل أفضل؟

  • فرز الدعم والتذاكر: استدعاء واحد لـ d1-3B يمكنه الإجابة على تحقق من الاسترداد بنعم أو لا، واختيار الفريق المسؤول، وتقييم مدى الإلحاح بنفس الرسالة، دون أي رموز إخراج لتحليلها.
  • الفحص البصري والإشراف في الوقت الفعلي عند الحافة: يقرأ d1-3B صورة بدقة 384px في 35 ms على Jetson AGX Thor، كما أن Liquid AI’s Open d1 Arcade يشغّله إطاراً بإطار على مدخل كاميرا مباشر للإشراف على المحتوى والتحكم بالإيماءات.
  • توجيه الأوامر الصوتية على الأجهزة الصغيرة: d1-omni-600M يتقبل ما يصل إلى 30 ثانية من الكلام مع النص ويعيد نية المتحدث أو الموضوع مباشرة. تذكر بطاقته توجيه الأوامر الصوتية وضوابط أمان الوكلاء ضمن استخداماته الموصى بها.

كيف يُظهر d1 أداءه على المعايير القياسية؟

على Decision Index v0.2.1، يسجل d1-3B نتيجة 48.57. متجاوزاً كل نموذج أقل من 10B ومتفوقاً بفارق ضئيل على Decider 35B-A3B (47.11). فقط Winnow-12B يسجل نتيجة أعلى بـ 50.02. Liquid AI شغّلت المقيّم الرسمي بنفسها، لذا نتائج d1 ليست ترشيحات على لوحة الصدارة. يتصدر d1-3B فئتي Tools (74.5) وArts (36.3) لكنه متأخر في Knowledge (23.8).

عبر سبعة معايير نصية عامة، يحقق d1-3B متوسط 82.9، متقدماً على Decider 4B عند 81.1. بينما يحقق d1-omni-600M متوسط 78.4 ويسجل أعلى نتائج في Civil Comments (95.8) وPAWS-X (79.5). على 11 معياراً للصور، يحقق d1-3B متوسط 74.1 مقابل 73.9 لنموذجه الأساسي. تصف Liquid AI معايير قرارات الصوت كمشكلة مفتوحة.

ما مدى سرعة d1-3B على أجهزة NVIDIA؟

قامت Liquid AI بقياس زمن الاستجابة من طرف إلى طرف، طلب دافئ واحد في كل مرة. يستغرق السؤال الواحد 8 مللي ثانية على RTX 4090 و9 مللي ثانية على AMD MI325X. على Jetson، يستغرق AGX Thor 16 مللي ثانية، وAGX Orin 26 مللي ثانية، وOrin Nano 50 مللي ثانية. على Jetson AGX Thor، تستغرق ثلاثة أسئلة عبر حالة واحدة 20 مللي ثانية مقابل 16 مللي ثانية لسؤال واحد. يستخدم رقم RTX 4090 model.compile(mode="reduce-overhead")وبدونه يستغرق السؤال الواحد 16 مللي ثانية. كما يستضيف Jetson AI Lab أدلة d1-3B أيضاً.

كيف يقارن Open d1 بنماذج القرار المفتوحة الأخرى؟

الميزةd1-3Bd1-omni-600MDecider 4BDecider 35B-A3BWinnow-12B
المصنّعLiquid AILiquid AIMapika (مستقل)Mapika (مستقل)EldanRing (مستقل)
عدد المعاملات3.12B587M4.2B34.7B إجمالياً، 3B نشطة12B
النموذج الأساسيLFM2.5-VL-3BLFM2.5-Encoder-350MQwen3.5-4B-BaseQwen3.5-35B-A3B-BaseGemma 4 12B IT
المدخلاتنصوص وصورنص + صورة، أو نص + صوتنصنصنص، صور
السياق32,76816,384حالة بحجم 32K رمز (token)حالة بحجم 32K رمز (token)65,536 (مُختبَر بدقة Q8)
Decision Index v0.2.148.5715.9540.7047.1150.02
الرخصةLFM Open v1.0LFM Open v1.0Apache 2.0Apache 2.0Apache 2.0
زمن الاستجابة المعلَن8 ms لكل سؤال، على RTX 4090غير منشور5.2 ms لكل طلب من 3 أسئلة، على B30047 ms لكل طلب من 3 أسئلة، على B300143 ms لطلب مخزَّن من 4 أسئلة قرب سياق 64K، على RTX 5070 Ti

المصادر: d1-3B, d1-omni-600M, Decider 4B, Decider 35B-A3B, Winnow-12B بطاقات النماذج. درجات الفهرس كما هي مذكورة على بطاقات d1. أزمنة الاستجابة تستخدم أجهزة وأحمال عمل مختلفة، لذا فهي غير قابلة للمقارنة مباشرة.

كيف تشغّل d1 محليًا؟

يحتاج d1-3B إلى transformers>=5.14 و trust_remote_code=True. يحتاج d1-omni-600M إلى transformers>=5.15. كلاهما يوفران system_one(state, questions) لحالة واحدة و system_one_batch للطلبات المجمّعة (packed). توصي Liquid AI باستخدام float16 لـ d1-omni-600M على GPU، لأن bfloat16 غيّرت بعض الإجابات الأعلى. يمكنك تجربة عشرة عروض توضيحية لـ d1-3B مدفوعة بالكاميرا في Open d1 Arcade الفضاء. وبالتعاون مع NVIDIA، استعرضت Liquid AI أيضًا d1-3B وهو يتنقل داخل Isaac Sim من جهاز Jetson.

الخلاصات الرئيسية

  • تُخرج نماذج d1 احتمالات عبر خيارات ثابتة في تمريرة واحدة، ولا تُولّد رموزًا (tokens) إطلاقًا.
  • تحقق d1-3B درجة 48.57 على Decision Index v0.2.1، وهو أفضل نتيجة تحت 10B.
  • تجيب d1-3B على سؤال واحد في 8 ms على RTX 4090.
  • يعالج d1-omni-600M النص مع الصور أو الصوت عند 587M معلمة.
  • الترخيص مجاني للاستخدام التجاري عند إيرادات سنوية أقل من $10M.


اطلع على d1-3B, d1-omni-600M و التفاصيل التقنية. كل الفضل يعود إلى الباحث في هذا المشروع. كما لا تترددوا في متابعتنا على Twitter ولا تنسوا الانضمام إلى 150k+ML SubReddit والاشتراك في نشريتنا البريدية. مهلًا! هل أنت على تيليجرام؟ يمكنك الآن الانضمام إلينا على تيليجرام أيضًا.

[مُموَّل] الويب هو الـ API الوحيد الذي تفتقده معظم الوكلاء. قواعد البيانات والتقويمات والمستودعات لديها واجهات API، لكن الويب المفتوح في معظمه لا يملكها. يوفر خادم TinyFish MCP لأي عميل MCP أربع أدوات: TinySearch، وTinyFetch (صفحات كاملة بصيغة markdown مع دعم JavaScript)، وTinyBrowser لتسجيل الدخول والنماذج، وTinyAgent للمهام متعددة الخطوات. البحث والجلب مجانيان.

ظهر المقال Liquid AI تطلق d1-3B وd1-omni-600M بأوزان مفتوحة: نماذج قرار متعددة الوسائط بدون أي رموز إخراج أول مرة على MarkTechPost.

المصدر الأصلي

MarkTechPost

ملاحظات المحتوى

النشر الأصلي والحقوق تعود إلى المصدر.

ترجمة آلية · يُرجى الرجوع إلى الأصل