Arena · X

قمنا بتقييم جيف روتر من قبل @typesafeai في-Agent Arena.

قمنا بتقييم جيف روتر من قبل @typesafeai في أجنرة العملاء. تظهر اختباراتنا التي تمتد على أكثر من 4,700 جلسة عملية حقيقية أن: 1. جيف روتر لا يحسن من الحدود الحالية لـ Pareto. بالنسبة للأداء المماثل لـ DeepSeek V4.1 Flash…

مصدر الصورة · Arena · X

قمنا بتقييم جيف روتر من قبل @typesafeai في-Agent Arena.

تظهر اختباراتنا التي تمتد على أكثر من 4,700 جلسة عمليات واقعية للأجهزة، أن:

1. جيف روتر لا يحسن من الحدود الحالية لباريتو. بالنسبة للأداء المماثل لـ DeepSeek V4.1 Flash (Max)، تكلفة الحل أعلى بنسبة 38%، وطول التأخير في طلب النموذج الوسطي أعلى بـ 1.7 مرة.

2. ومع ذلك، فإنه في الغالب يستخدم نماذج فعالة وفق مبدأ باريتو. أشهر نموذج يتم اختياره هو DeepSeek V4.1 Flash، بينما تكون GPT-6.1 Sol وGPT-6 Luna أيضًا من الخيارات الشائعة.

3. قوة مفتاح جيف روتر تتمثل في القدرة على التوجيه. نقاطه البالغة +10% تتطابق تقريبًا مع نقاط كلود أوبوس 5.5 (عالي) (+10.48). هذا يبرز الفائدة من قدرته على توجيه البيانات بشكل فعال إلى نماذج LLM الأقوى استجابةً لتغذية رامي المستخدم.

مزيد من الأفكار في السلسلة أدناه.

المصدر الأصلي

Arena · X

ملاحظات المحتوى

النشر الأصلي والحقوق تعود إلى المصدر.

ترجمة آلية · يُرجى الرجوع إلى الأصل