Artificial Analysis Articlesآخر تحديث

أصدرت Anthropic إصدار Claude Haiku 5.5

أصدرت Anthropic إصدار Claude Haiku 5.5، محققًا درجة 43 على مؤشر Artificial Analysis للذكاء - بزيادة قدرها 26 نقطة بعد مرور عام على إطلاق آخر إصدار من Haiku انظر صفحة النموذج يُعد Haiku 5.5 أول نموذج H

مصدر الصورة · Artificial Analysis Articles

أصدرت Anthropic إصدار Claude Haiku 5.5، محققًا درجة 43 على مؤشر Artificial Analysis للذكاء - بزيادة قدرها 26 نقطة بعد مرور عام على إطلاق آخر إصدار من Haiku

انظر صفحة النموذج

يُعد Haiku 5.5 أول نموذج Haiku يتميز بإعدادات الجهد والتفكير التكيفي من Anthropic، كما قدمت Anthropic تسعيرًا متدرجًا.

Haiku 5.5 أرخص من سابقه - تكلفته 0.10 دولار/0.50 دولار لكل 1M توكن إدخال/إخراج للبرومبتات التي تصل إلى 100k توكن (نفس سعر GPT-6 Luna و10% من نموذج Haiku السابق). ومع ذلك، يرتفع هذا التسعير بمقدار 5x إلى 0.50 دولار/2.50 دولار فوق 100k. الموقع لا يعكس بعد التسعير المتدرج، لذا فإن أرقام التكلفة المبدئية لـHaiku 5.5 لا تشمل الزيادة في التكلفة. نحن نعمل على الدعم وسنواصل قريباً بتغطية Cost per Task.

أبرز النقاط:

➤ أداء رائد في فئة النماذج الصغيرة: عند أقصى جهد، تحتل Haiku 5.5 مكانة متقدمة قليلاً أمام نماذج مثل GLM-5.3 Flash (42) وGemini 3.8 Flash (41) وGPT-6 Luna (38). درجتها قابلة للمقارنة مع Kimi K3 (44)، وهو نموذج مفتوح الأوزان بـ2.8T معامل، وتتأخر عن Claude Sonnet 5.5 (max، 56) بـ13 نقطة

➤ استخدام كثيف للرموز مقارنة بـ GPT-6 Luna: Haiku 5.5 (max) تستخدم حوالي 162k توكن إخراج لكل مهمة في Intelligence Index، أي حوالي 3x من GPT-6 Luna (max، حوالي 50k). الانتقال من xhigh إلى max يضيف 2 نقطة مقابل حوالي 1.8x من التوكنات. عند مستوى ذكاء مماثل، تستخدم أيضاً توكنات أكثر من GPT-6 Luna: Haiku 5.5 (high) تحقق 38 بحوالي 55k توكن لكل مهمة مقابل 38 بحوالي 50k لـLuna (max)، وتتسع الفجوة عند إعدادات الجهد الأقل

➤ قدرات عالية في الأعمال المعرفية الوكيلة: على AA-Briefcase، تقييمنا الخاص للمهام المعرفية الواقعية، يصل Haiku 5.5 (max) إلى 1578 Elo، متقدمًا على نماذج تشمل Kimi K3 وGLM-5.3، ومماثلًا لـ Muse Spark 1.3 (max)

➤ تحسينات في استخدام الطرفية: على Terminal-Bench 4.0 يسجل 33%، بزيادة من 0% لـ Haiku 4.5. هذا يعادل GLM-5.3 Flash، ويتقدم على Gemini 3.8 Flash (20%) وGPT-6 Luna (13%)

➤ معرفة واقعية أقل، لكن هلوسات منخفضة نسبيًا: كما هو متوقع من نموذج أصغر حجمًا، يمتلك Haiku 5.5 معرفة واقعية أقل من نماذج عائلته. دقة AA-Omniscience تبلغ 36% مقابل 55% لـ Gemini 3.8 Flash و44% لـ GPT-6 Luna، لكن هذا يرجع جزئيًا إلى استعداده الأكبر للاعتراف عند عدم معرفته - فمعدل هلوساته أقل، إذ يبلغ 40% مقابل 55% و77%

➤ نتيجة AutomationBench-AA أقل من الحقيقة على الأرجح: يسجل Haiku 5.5 درجة 35% مقابل 53–60% لـ GPT-6 Luna وGemini 3.8 Flash وGLM-5.3 Flash. أثناء الاختبار قبل الإطلاق، تسببت مشكلة في الرفض لأسباب السلامة في قيام النموذج بالرفض بشكل مفرط. تعمل Anthropic على حل هذه المشكلة - وسنعيد إجراء هذا التقييم بعد الإصلاح، ونتوقع أن ترتفع هذه الدرجة

تفاصيل أخرى عن النموذج:

➤ نافذة السياق: 1 مليون توكن، مقارنة بـ200k لـClaude 4.5 Haiku

➤ التسعير: 0.10 دولار/0.50 دولار لكل 1M توكن إدخال/إخراج حتى 100k توكن، و0.50 دولار/2.50 دولار فوق ذلك. قراءات ذاكرة التخزين المؤقت 0.01 دولار (0.05 دولار فوق 100k)، وكتابات ذاكرة التخزين المؤقت لمدة 5 دقائق 0.125 دولار (0.625 دولار فوق 100k)

➤ تعدد الوسائط: إدخال نص وصور، مع إخراج نصي

Claude Haiku 5.5 (max) تستخدم حوالي 162k توكن إخراج لكل مهمة في Intelligence Index، أكثر من Opus 5.5 (max) وحوالي 3x من GPT-6 Luna (max). عبر إعدادات الجهد المختلفة، تستخدم Haiku 5.5 توكنات إخراج أكثر من GPT-6 Luna للوصول إلى درجات مماثلة في Intelligence Index

يحقق Claude Haiku 5.5 (max) درجة 1578 Elo على AA-Briefcase، تقييمنا الخاص للأعمال المعرفية المتطورة، ضمن فترات الثقة لـ GPT-6 Astra (max) وClaude Fable 5.1 (high)

التفصيل الكامل للتقييمات الفردية في مؤشر Artificial Analysis للذكاء لـ Claude Haiku 5.5 عبر إعدادات الجهد

المصدر الأصلي

Artificial Analysis Articles

ملاحظات المحتوى

النشر الأصلي والحقوق تعود إلى المصدر.

ترجمة آلية · يُرجى الرجوع إلى الأصل