أطلقت مايكروسوفت Microsoft-Decision-1، وهو نموذج قرارات للتوجيه والتصنيف والتحقق والتحكم في الوكلاء. Microsoft-Decision-1 هو نموذج تقييم قرارات يعيد احتمالاً معايرياً لكل خيار إجابة ثابت بدلاً من النص المُولَّد. وهو مدرَّب لاحقياً من Qwen3.5-9B من علي بابا ومتاح الآن في Microsoft Foundry و OpenRouter. .
TL;DR
- الحجم: مبني على Qwen3.5-9B؛ لم يُكشف عدد المعاملات الدقيق. نافذة سياق تبلغ 32,768 رمزاً.
- يعمل على: واجهة برمجية مستضافة فقط (Microsoft Foundry وOpenRouter عبر Azure). لا أوزان مفتوحة، ولا نُسخ مُكمَّمة، ولم يُكشف العتاد.
- الأداء: أعلى متوسط دقة في مقارنة مايكروسوفت عبر 36 معياراً قياسياً، بزمن استجابة p50 يبلغ 85 مللي ثانية.
- الأفضل: دقة متوسطة تبلغ 83.5% عبر 36 معياراً قياسياً، متقدماً على Quyet-1.0-Large الذي حقق 81.9%.
- الأسوأ: معايرة بمقدار 92.2، متأخراً عن Quyet-1.0-Large الذي حقق 93.1. نص فقط، دون تفسيرات.
- الخلاصة:
- أفضل ميزة: قرارات سريعة ورخيصة ومعايرة بسعر $0.042 لكل مليون رمز إدخال مع إخراج مجاني.
- أسوأ ميزة: أوزان مغلقة، وكل معيار قياسي من إدارة الشركة البائعة نفسها.
- أفضل ميزة: قرارات سريعة ورخيصة ومعايرة بسعر $0.042 لكل مليون رمز إدخال مع إخراج مجاني.
ما هو نموذج القرارات؟
يقرأ نموذج القرارات مدخلاً ويقيّم مجموعة مغلقة من الخيارات. فهو لا يكتب نصوصاً نثرية. مايكروسوفت تصف نماذج القرارات كفئة جديدة من الذكاء الاصطناعي، مصممة لمخرجات يمكن للبرمجيات التصرف بناءً عليها فوراً.
كيف يعمل Microsoft-Decision-1؟
مايكروسوفت دربت Qwen3.5-9B لاحقياً لتقييم القرارات في تمريرة واحدة. بالنظر إلى موقف معين وسؤال وخيارات ثابتة، يُعيد احتمالاً لكل خيار في استدعاء واحد. ويخطط لإعادة بناء الإصدارات المستقبلية على نماذج MAI وOpenAI.
The Foundry model card يسرد الصيغ المدعومة:
- أسئلة نعم/لا، والاختيار من متعدد، والتقييم، والتصنيف، وأسئلة معايير التقييم (rubric)
- تصحيح استجابات الذكاء الاصطناعي والإجراءات المقترحة للوكلاء
- فحوصات الارتكاز على الأدلة المقدمة
- خيارات امتناع صريحة مثل "لا يمكن الجزم"
استخدم التدريب مجموعات بيانات عامة ضمن عملية Microsoft’s Open Data بالإضافة إلى بيانات اصطناعية. والمخرجات بصيغة JSON. OpenRouter notes أن الأوزان تُحدَّث باستمرار بينما يبقى شكل الـ API ثابتاً.
ما مدى سرعته ودقته؟
قارنت Microsoft 9 أنظمة عبر 36 معيار تقييم يضم 147,137 سؤالاً. وتم إبقاء معايير التقييم مجهولة عن التدريب. تصدّر Microsoft-Decision-1 متوسط الدقة بنسبة 83.5%.
كان زمن الاستجابة عند p50 لديه 85 ms، وبحسب p95 بلغ 125 ms. وهذا يعني أنه أسرع بمقدار 4.5 مرة من Quyet-1.0-Large و35 مرة من GPT-6 Solالذي استغرق 3.01 s.
اختبرت Microsoft أيضاً المتانة. حيث تُطبِّق تغييراً على كل طلب بـ 8 طرق، بما في ذلك إعادة الصياغة وترتيب الخيارات. عكس النموذج قراره في 1.3% من التغييرات في المتوسط. ولم تحدث أي انقلابات عند إعادة صياغة الخيارات أو عكسها أو تبديلها.
وفيما يتعلق بالسلامة، شغّلت Microsoft 5,250 طلباً عبر 11 معيار تقييم. غطت هذه المحتوى الضار واختراقات الحواجز (jailbreaks) وحقن الأوامر. وتفيد Microsoft بأنها حصلت على رفض صحيح مع احتفاظ مرتفع بالفائدة، دون نشر درجة.
النتائج الداخلية التي تفيد بها Microsoft
- Xbox Research: صنّفت أكثر من 10,000 عنصر ملاحظات، بسرعة أكبر 14 مرة وتكلفة أقل 200 مرة من GPT-6 Sol.
- ضبط جودة Copilot: تنافسي مع GPT5.6 Luna وأسرع 100 مرة.
- Microsoft Discovery: أكثر اتساقاً بـ 46 مرة من التقييم بواسطة نماذج اللغة الكبيرة، وبسرعة أكبر 3 مرات.
كيف يمكن مقارنته بنماذج القرار الأخرى؟
| الميزة | Microsoft-Decision-1 | Quyet-1.0-Large | H2O-Lightning-4B | GPT-6 Luna Decisions |
|---|---|---|---|---|
| المطوّر | Microsoft | Chinh Nguyen | H2O.ai | OpenAI |
| النموذج الأساسي | Qwen3.5-9B | Gemma-4-31B-it (LoRA merged) | Qwen3.5-4B | غير معلن |
| المعاملات | غير معلن | 31.3B | 4B | غير معلن |
| السياق / المدخلات | 32,768 رمزاً (tokens) | موجّه من 8,000 رمزاً (6,000 لحالة) | 40,960 (إعداد vLLM serve) | غير معلن |
| الترخيص | واجهة برمجية احتكارية | Apache-2.0 | Apache-2.0 | واجهة برمجية احتكارية |
| النمطية (Modality) | نص | نص | النص والصور | نصوص وصور |
| الأجهزة | مُستضاف (Azure) | 1 GPU سعة 80 GB، بدقة bf16 | وحدة معالجة رسومات بسعة 32 جيجابايت تم اختبارها؛ أوزان بحجم 9.1 جيجابايت | مستضاف |
| الدقة (مايكروسوفت، 36 معيار قياس) | 83.5% | 81.9% | 77.2% | 79.4% |
| معايرة (Microsoft) | 92.2 | 93.1 | 91.8 | 89.9 |
| الزمن المتوسط للاستجابة في مخطط مايكروسوفت | 85 ms | 380 مللي ثانية | 210 مللي ثانية | 300 ملي ثانية |
| السعر | 0.042 دولار لكل مليون رمز إدخال، والمخرجات مجانية | الاستضافة الذاتية | الاستضافة الذاتية | 0.10 دولار لكل مليون رمز إدخال، والإخراج مجاني |
صفوف الدقة والمعايرة وزمن الاستجابة مأخوذة من مخطط مايكروسوفت.. تستخدم أزمنة الاستجابة للمنافسين هناك ال JevBench v1.6.1 الوسيط المعدّل.
هل مقارنة زمن الاستجابة عادلة ومكافئة؟
ليس بالكامل. قاست مايكروسوفت نموذجها الخاص من خلال Foundry. أما أرقام المنافسين فتستخدم الوسيط المعدَّل من JevBench، وليس التوقيتات الخام.
بطاقة نموذج H2O.ai يعارض هذا. ويذكر أن الرقم المعدّل من JevBench يضاعف الوقت المقاس ويضيف 0.15 ثانية. تقول H2O إن الوسيط المقاس لنموذجها هو 29 ملّي ثانية، وليس 210 ملّي ثانية. ولا يظهر Microsoft-Decision-1 على لوحة JevBench. وفي التركيبة الرسمية لتلك اللوحة، يحتل H2O-Lightning-4B المرتبة #1 بمعدل 72.5.
كيف ينشره المطوّرون؟
يمكن للمطورين استدعاءه من Microsoft Foundry كنموذج متاح بشكل عام بموجب فئة 'مباشر من Azure'. أما على OpenRouterفيعمل عبر واجهة Decisions API، وليس نقطة نهاية الدردشة. ولن تعمل مجموعات تطوير البرمجيات الخاصة بإكمال الدردشة.
التسعير هو 0.042 دولار لكل مليون رمز إدخال، مع مخرجات مجانية. أما نقطة نهاية Luna decisions من OpenAI تفرض رسماً قدره 0.10 دولار لكل مليون رمز إدخال.
ما هي القيود؟
بطاقة النموذج صريحة:
- ليس لتوليد النصوص، أو الأسئلة والأجوبة المفتوحة، أو الدردشة، أو الترجمة أو التلخيص.
- نصوص فقط. لا صور ولا صوت ولا فيديو.
- لا تفسيرات ولا مبررات في الناتج.
- غير مخصص لاتخاذ قرارات آلية مستقلة تتعلق بالائتمان أو التوظيف أو السكن أو الرعاية الصحية أو الحقوق القانونية.
- يجب على التطبيقات تحديد الخيارات والحدود القصوى ومسارات التصعيد والإشراف البشري.
أبرز النقاط
- يقوم Microsoft-Decision-1 بتقييم الخيارات الثابتة باحتمالات معايرة، وليس بالنص.
- تم تدريبه بعد التدريب المسبق من Qwen3.5-9B، مع نافذة سياق تبلغ 32,768 رمزاً.
- يتصدر مقارنة Microsoft عبر 36 معياراً بدقة 83.5% وزمن p50 قدره 85 مللي ثانية.
- تكلفته 0.042 دولار لكل مليون رمز إدخال؛ ورموز الإخراج مجانية.
- مقارنات زمن الاستجابة محل نزاع؛ ونتائج JevBench المستقلة لم تصدر بعد.
اطلع على الإعلان الرسمي، و بطاقة نموذج Foundry و قائمة OpenRouter. كل الفضل يعود إلى الباحث في هذا المشروع. كما يمكنكم متابعتنا على تويتر ولا تنسوا الانضمام إلى 150k+ SubReddit خاص بالتعلم الآلي (ML) والاشتراك في نشرتنا البريدية. مهلاً! هل أنت على تيليجرام؟ يمكنك الآن الانضمام إلينا على تيليجرام أيضاً.
ظهر المقال Microsoft تطلق Microsoft-Decision-1: نموذج تقييم قرارات مبني على Qwen3.5-9B أولاً على MarkTechPost.