MarkTechPost

مايكروسوفت للذكاء الاصطناعي تطلق Microsoft-Decision-1: نموذج تقييم قرارات مبني على Qwen3.5-9B

أطلقت مايكروسوفت Microsoft-Decision-1، وهو نموذج قرارات للتوجيه والتصنيف والتحقق والتحكم في الوكلاء. Microsoft-Decision-1 هو نموذج تقييم قرارات يعيد احتمالاً معايرياً لكل خيار إجابة ثابت بدلاً من النص المُولَّد. وهو…

أطلقت مايكروسوفت Microsoft-Decision-1، وهو نموذج قرارات للتوجيه والتصنيف والتحقق والتحكم في الوكلاء. Microsoft-Decision-1 هو نموذج تقييم قرارات يعيد احتمالاً معايرياً لكل خيار إجابة ثابت بدلاً من النص المُولَّد. وهو مدرَّب لاحقياً من Qwen3.5-9B من علي بابا ومتاح الآن في Microsoft Foundry و OpenRouter. .

TL;DR

  • الحجم: مبني على Qwen3.5-9B؛ لم يُكشف عدد المعاملات الدقيق. نافذة سياق تبلغ 32,768 رمزاً.
  • يعمل على: واجهة برمجية مستضافة فقط (Microsoft Foundry وOpenRouter عبر Azure). لا أوزان مفتوحة، ولا نُسخ مُكمَّمة، ولم يُكشف العتاد.
  • الأداء: أعلى متوسط دقة في مقارنة مايكروسوفت عبر 36 معياراً قياسياً، بزمن استجابة p50 يبلغ 85 مللي ثانية.
  • الأفضل: دقة متوسطة تبلغ 83.5% عبر 36 معياراً قياسياً، متقدماً على Quyet-1.0-Large الذي حقق 81.9%.
  • الأسوأ: معايرة بمقدار 92.2، متأخراً عن Quyet-1.0-Large الذي حقق 93.1. نص فقط، دون تفسيرات.
  • الخلاصة:
    • أفضل ميزة: قرارات سريعة ورخيصة ومعايرة بسعر $0.042 لكل مليون رمز إدخال مع إخراج مجاني.
      • أسوأ ميزة: أوزان مغلقة، وكل معيار قياسي من إدارة الشركة البائعة نفسها.

ما هو نموذج القرارات؟

يقرأ نموذج القرارات مدخلاً ويقيّم مجموعة مغلقة من الخيارات. فهو لا يكتب نصوصاً نثرية. مايكروسوفت تصف نماذج القرارات كفئة جديدة من الذكاء الاصطناعي، مصممة لمخرجات يمكن للبرمجيات التصرف بناءً عليها فوراً.

كيف يعمل Microsoft-Decision-1؟

مايكروسوفت دربت Qwen3.5-9B لاحقياً لتقييم القرارات في تمريرة واحدة. بالنظر إلى موقف معين وسؤال وخيارات ثابتة، يُعيد احتمالاً لكل خيار في استدعاء واحد. ويخطط لإعادة بناء الإصدارات المستقبلية على نماذج MAI وOpenAI.

The Foundry model card يسرد الصيغ المدعومة:

  • أسئلة نعم/لا، والاختيار من متعدد، والتقييم، والتصنيف، وأسئلة معايير التقييم (rubric)
  • تصحيح استجابات الذكاء الاصطناعي والإجراءات المقترحة للوكلاء
  • فحوصات الارتكاز على الأدلة المقدمة
  • خيارات امتناع صريحة مثل "لا يمكن الجزم"

استخدم التدريب مجموعات بيانات عامة ضمن عملية Microsoft’s Open Data بالإضافة إلى بيانات اصطناعية. والمخرجات بصيغة JSON. OpenRouter notes أن الأوزان تُحدَّث باستمرار بينما يبقى شكل الـ API ثابتاً.

ما مدى سرعته ودقته؟

قارنت Microsoft 9 أنظمة عبر 36 معيار تقييم يضم 147,137 سؤالاً. وتم إبقاء معايير التقييم مجهولة عن التدريب. تصدّر Microsoft-Decision-1 متوسط الدقة بنسبة 83.5%.

كان زمن الاستجابة عند p50 لديه 85 ms، وبحسب p95 بلغ 125 ms. وهذا يعني أنه أسرع بمقدار 4.5 مرة من Quyet-1.0-Large و35 مرة من GPT-6 Solالذي استغرق 3.01 s.

اختبرت Microsoft أيضاً المتانة. حيث تُطبِّق تغييراً على كل طلب بـ 8 طرق، بما في ذلك إعادة الصياغة وترتيب الخيارات. عكس النموذج قراره في 1.3% من التغييرات في المتوسط. ولم تحدث أي انقلابات عند إعادة صياغة الخيارات أو عكسها أو تبديلها.

وفيما يتعلق بالسلامة، شغّلت Microsoft 5,250 طلباً عبر 11 معيار تقييم. غطت هذه المحتوى الضار واختراقات الحواجز (jailbreaks) وحقن الأوامر. وتفيد Microsoft بأنها حصلت على رفض صحيح مع احتفاظ مرتفع بالفائدة، دون نشر درجة.

النتائج الداخلية التي تفيد بها Microsoft

  • Xbox Research: صنّفت أكثر من 10,000 عنصر ملاحظات، بسرعة أكبر 14 مرة وتكلفة أقل 200 مرة من GPT-6 Sol.
  • ضبط جودة Copilot: تنافسي مع GPT5.6 Luna وأسرع 100 مرة.
  • Microsoft Discovery: أكثر اتساقاً بـ 46 مرة من التقييم بواسطة نماذج اللغة الكبيرة، وبسرعة أكبر 3 مرات.

كيف يمكن مقارنته بنماذج القرار الأخرى؟

الميزةMicrosoft-Decision-1Quyet-1.0-LargeH2O-Lightning-4BGPT-6 Luna Decisions
المطوّرMicrosoftChinh NguyenH2O.aiOpenAI
النموذج الأساسيQwen3.5-9BGemma-4-31B-it (LoRA merged)Qwen3.5-4Bغير معلن
المعاملاتغير معلن31.3B4Bغير معلن
السياق / المدخلات32,768 رمزاً (tokens)موجّه من 8,000 رمزاً (6,000 لحالة)40,960 (إعداد vLLM serve)غير معلن
الترخيصواجهة برمجية احتكاريةApache-2.0Apache-2.0واجهة برمجية احتكارية
النمطية (Modality)نصنصالنص والصورنصوص وصور
الأجهزةمُستضاف (Azure)1 GPU سعة 80 GB، بدقة bf16وحدة معالجة رسومات بسعة 32 جيجابايت تم اختبارها؛ أوزان بحجم 9.1 جيجابايتمستضاف
الدقة (مايكروسوفت، 36 معيار قياس)83.5%81.9%77.2%79.4%
معايرة (Microsoft)92.293.191.889.9
الزمن المتوسط للاستجابة في مخطط مايكروسوفت85 ms380 مللي ثانية210 مللي ثانية300 ملي ثانية
السعر0.042 دولار لكل مليون رمز إدخال، والمخرجات مجانيةالاستضافة الذاتيةالاستضافة الذاتية0.10 دولار لكل مليون رمز إدخال، والإخراج مجاني

صفوف الدقة والمعايرة وزمن الاستجابة مأخوذة من مخطط مايكروسوفت.. تستخدم أزمنة الاستجابة للمنافسين هناك ال JevBench v1.6.1 الوسيط المعدّل.

هل مقارنة زمن الاستجابة عادلة ومكافئة؟

ليس بالكامل. قاست مايكروسوفت نموذجها الخاص من خلال Foundry. أما أرقام المنافسين فتستخدم الوسيط المعدَّل من JevBench، وليس التوقيتات الخام.

بطاقة نموذج H2O.ai يعارض هذا. ويذكر أن الرقم المعدّل من JevBench يضاعف الوقت المقاس ويضيف 0.15 ثانية. تقول H2O إن الوسيط المقاس لنموذجها هو 29 ملّي ثانية، وليس 210 ملّي ثانية. ولا يظهر Microsoft-Decision-1 على لوحة JevBench. وفي التركيبة الرسمية لتلك اللوحة، يحتل H2O-Lightning-4B المرتبة #1 بمعدل 72.5.

كيف ينشره المطوّرون؟

يمكن للمطورين استدعاءه من Microsoft Foundry كنموذج متاح بشكل عام بموجب فئة 'مباشر من Azure'. أما على OpenRouterفيعمل عبر واجهة Decisions API، وليس نقطة نهاية الدردشة. ولن تعمل مجموعات تطوير البرمجيات الخاصة بإكمال الدردشة.

التسعير هو 0.042 دولار لكل مليون رمز إدخال، مع مخرجات مجانية. أما نقطة نهاية Luna decisions من OpenAI تفرض رسماً قدره 0.10 دولار لكل مليون رمز إدخال.

ما هي القيود؟

بطاقة النموذج صريحة:

  • ليس لتوليد النصوص، أو الأسئلة والأجوبة المفتوحة، أو الدردشة، أو الترجمة أو التلخيص.
  • نصوص فقط. لا صور ولا صوت ولا فيديو.
  • لا تفسيرات ولا مبررات في الناتج.
  • غير مخصص لاتخاذ قرارات آلية مستقلة تتعلق بالائتمان أو التوظيف أو السكن أو الرعاية الصحية أو الحقوق القانونية.
  • يجب على التطبيقات تحديد الخيارات والحدود القصوى ومسارات التصعيد والإشراف البشري.

أبرز النقاط

  • يقوم Microsoft-Decision-1 بتقييم الخيارات الثابتة باحتمالات معايرة، وليس بالنص.
  • تم تدريبه بعد التدريب المسبق من Qwen3.5-9B، مع نافذة سياق تبلغ 32,768 رمزاً.
  • يتصدر مقارنة Microsoft عبر 36 معياراً بدقة 83.5% وزمن p50 قدره 85 مللي ثانية.
  • تكلفته 0.042 دولار لكل مليون رمز إدخال؛ ورموز الإخراج مجانية.
  • مقارنات زمن الاستجابة محل نزاع؛ ونتائج JevBench المستقلة لم تصدر بعد.


اطلع على الإعلان الرسمي، و بطاقة نموذج Foundry و قائمة OpenRouter. كل الفضل يعود إلى الباحث في هذا المشروع. كما يمكنكم متابعتنا على تويتر ولا تنسوا الانضمام إلى 150k+ SubReddit خاص بالتعلم الآلي (ML) والاشتراك في نشرتنا البريدية. مهلاً! هل أنت على تيليجرام؟ يمكنك الآن الانضمام إلينا على تيليجرام أيضاً.

ظهر المقال Microsoft تطلق Microsoft-Decision-1: نموذج تقييم قرارات مبني على Qwen3.5-9B أولاً على MarkTechPost.

المصدر الأصلي

MarkTechPost

ملاحظات المحتوى

النشر الأصلي والحقوق تعود إلى المصدر.

ترجمة آلية · يُرجى الرجوع إلى الأصل