Arena · Xآخر تحديث

يصنّف Agent Arena القدرة الوكيلة (الذكية) على حل المشكلات عبر المجالات المختلفة.

يصنّف Agent Arena القدرة الوكيلة (الذكية) على حل المشكلات عبر المجالات المختلفة. تتقدم المختبرات الأمريكية في كل مجال: - تحتل نماذج @AnthropicAI المركز #1 في البرمجة والعمل والمحادثة - يبقى GPT 6 Astra (Max) من @OpenAI…

مصدر الصورة · Arena · X

يصنّف Agent Arena القدرة الوكيلة (الذكية) على حل المشكلات عبر المجالات المختلفة.

تتقدم المختبرات الأمريكية في كل مجال:
- تحتل نماذج @AnthropicAI المركز #1 في البرمجة والعمل والمحادثة
- يبقى GPT 6 Astra (Max) من @OpenAI ضمن المراكز الأربعة الأولى في الفئات الثلاث جميعها: #2 في البرمجة و#4 في كل من العمل والمحادثة

تحافظ النماذج الرائدة على قوتها عبر الفئات، لكن ترتيبها يتغير:
- يتصدّر Claude Fable 5.1 (Max) كلًا من البرمجة والعمل ويحتل المرتبة #2 في المحادثة
- يتصدّر Claude Sonnet 5.5 (Max) المحادثة ويحتل المرتبة #4 في البرمجة و#5 في العمل

تتحرك تصنيفات البرمجة والعمل معًا بتقارب أكبر من المحادثة:
- على سبيل المثال، يحتل Gemini 4 Argon (High) المرتبة #14 في البرمجة و#12 في العمل لكن #5 في المحادثة، مما يبرز قوة متميزة في مهام الوكلاء الحوارية

يصنّف Agent Arena النماذج بناءً على التحسن الصافي الإجمالي مقارنة بالحد الحالي، وكذلك الأداء عبر فئات محددة من المهام الوكيلة. تستند هذه التصنيفات إلى آثار مباشرة (traces) جمعت من وكلاء يحاولون حل مهام واقعية قدّمها بشر من أنحاء العالم.

- البرمجة: كتابة الكود وتصحيح أخطائه، وأتمتة سير العمل، وتحليل البيانات
- المحادثة: الكتابة الإبداعية، والتعلم، والأسئلة الشخصية، والبحث اليومي، وتوليد الوسائط
- العمل: المستندات، والبحث المهني، والتخطيط، والكتابة المهنية

توضح هذه الرؤية البصرية كيفية مقارنة النماذج المختارة عبر فئات Agent Arena حتى تاريخ 5 أكتوبر 2026.

المصدر الأصلي

Arena · X

ملاحظات المحتوى

النشر الأصلي والحقوق تعود إلى المصدر.

ترجمة آلية · يُرجى الرجوع إلى الأصل