منغ تشن، من معبد أو في سي
كيوتزميت (QbitAI) | الحساب الرسمي QbitAI
إطلاق Claude Haiku 5.5، انقلاب كبير للنماذج الصغيرة!
من حيث نتائج الاختبارات المعيارية وحدها، تجاوز مباشرةً خطَّي القتل السابقَين DeepSeek V4.1Flash وGLM-5.3-Flash، ليصبح حارس بوابة النماذج الصغيرة الجديد.
وبمجرد النظر إلى النتائج المعيارية الرسمية، ها هو ذا: هذا النموذج موجَّه خصيصًا نحو GPT-6 Luna، متغلبًا عليه بندًا بندًا.
ونظرًا لأن اختبار «البجع يركب الدراجة» أصبح شبه مشبع، فإن أحدث ما دخل ساحة المعركة هو اختبار «الحمار الوحشي الجارئ».
بل إن سعر Haiku 5.5 يتماشى تمامًا مع GPT-6 Luna.
أما الجيل السابق Haiku 4.5 فقد صدر قبل عام تمامًا، وكان سعره 10 أضعاف سعر 5.5.
لكن سعر Haiku 5.5 مشروط أيضًا: الطلبات التي تقل مطالباتها عن 100,000 توكن (التي تمثل 90% من طلبات Haiku 4.5) تحصل على تخفيض بنسبة 90% في أسعار الإدخال والإخراج؛ أما الجزء الذي يتجاوز 100,000 توكن فيُخفَّض بنسبة 50% فقط.
وبهذا، باستثناء بند الإدخال من مخزن مؤقت أصابه (cache hit)، أصبح سعر Haiku 5.5 أرخص أيضًا من DeepSeek-V4.1 Flash.
وبذلك أصبح Opus 5.5 مسؤولًا عن الاستدلال المعقد، وSonnet 5.5 عن التنفيذ العام، وHaiku 5.5 عن الحجم والسرعة، وقد اجتمع الأبرار، ولم يتبقَّ سوى Fable.
لا يمكن القول سوى إن شركة OpenAI المجاورة إن لم تبذل جهدًا إضافيًا، فلن تضطر Claude إلى عصر أنبوب معجون ضخم اسمه Fable 5.5.
وكأننا عدنا إلى أيام تنافس إنتل وAMD على المعالجات.
تغيير المُرمِّز (tokenizer) واستهلاك توكنات أكثر
Haiku 5.5 هو أول نموذج Haiku يدعم تعديل مستوى الجهد (effort)، وقد ورث من السلسلة الإعدادات الخمسة من low إلى max.
الجيل السابق Haiku 4.5 كان يكاد يحصل على صفر في تشغيل الحاسوب والبرمجة، أما هذا الجيل فقد تطور مباشرةً.
انظر نتائج OSWorld 2.1 (اختبار تشغيل الـagent لحاسوب حقيقي لإنجاز مهام متعددة الخطوات): المستوى Low بدقة 42.0% وتكلفة تصل إلى $0.07 للمهمة الواحدة؛ والمستوى Max بدقة 72.4% و$0.61. أما Haiku 4.5 فكان بمستوى Max فقط بدقة 15.7% و$1.45،
أي أن المستوى Low من 5.5 أدق من المستوى Max من 4.5، وأرخص أيضًا بمقدار النصف.
وGDPval-AA v2.1 (اختبار أعمال مهنية حقيقية في 44 مهنة) يُظهر منحنى مشابهًا: المستوى Low بنقاط Elo 1125 و$0.01؛ والمستوى Max بنقاط 1620 و$0.87. بينما حصل المستوى Max من 4.5 على 735 فقط و$0.24.
لكن Haiku 5.5 غيّر المُرمِّز (tokenizer) (وهو نفس المُرمِّز المستخدم في Sonnet 5.5 وOpus 5.5)، لذا تستهلك المهام نفسها توكنات أكثر، وبالتالي المال المُوفَّر فعليًا أقل قليلًا من الخصم المعلن.
خاصة أن تضخمالمحتوى غير الإنجليزيقد يكون أعلى.
في اختبار AA، رغم أن أسعار API لـHaiku 5.5 أصبحت أرخص، فإن «متوسط تكلفة إنجاز المهمة» لم يصل إلى النطاق المرجو.
لا يُغني عن Sonnet
توقُّع كثيرين من Haiku 5.5 هو أن يكون قادرًا على استبدال Sonnet 5.5 في بعض المهام، لخفض التكاليف أكثر.
لكن المعجزة لم يقع هذه المرة، فالكوب الصغير ما يزال كوبًا صغيرًا.
على Terminal-Bench 4.0 حقق Haiku 5.5 نسبة 39.2%، بينما حقق Sonnet 5.5 نسبة 70.6%. والفجوة واضحة جدًا في البرمجة المعقدة متعددة الخطوات، وإعادة البناء عبر الملفات، والتخطيط الذاتي طويل المدى.
وتوصي Anthropic نفسها أيضًا باستخدام Sonnet 5.5 أو Opus 5.5 أولاً للبرمجة المعقدة عبر الـagents.
تكمن قيمة Haiku 5.5 في طبقة التنفيذ: المهام التي سبق تقسيمها، ومعايير القبول واضحة، والمهام التي يمكن تشغيلها بالتوازي.
على سبيل المثال، يستخدم Devin من شركة Cognition نموذج Opus 5.5 كنموذج رئيسي وHaiku 5.5 كوكيل فرعي، وقد وصلت مجموعة FrontierCode إلى 66.2%، وهو أعلى من أداء كلٍّ من النموذجين على حدة.
إذا كان عملك السابق يعتمد على Haiku 4.5، فهذه المرة لا يكفي مجرد تغيير اسم النموذج لإطلاق الخدمة.
إعداد budget_tokens للتفكير اليدوي يُلقي خطأً مباشرةً، ويجب تغييره إلى التفكير التكيفي مع معامل effort.
تم قفل temperature وtop_p وtop_k جميعها على القيم الافتراضية، والتطبيقات التي تعتمد على معاملات أخذ العينات للتحكم الإبداعي أو التنويع في التوليد عليها تعديل منطقها.
تم إلغاء الحشو المسبق (prefill) لرسائل assistant، والأساليب التي كانت تعتمد سابقًا على الحشو المسبق لفرض بداية JSON يجب أن تتحول إلى استدعاءات الأدوات أو واجهة المخرجات المهيكلة.
أداة تشغيل الحاسوب تحدّثت أيضًا، من computer_20250124 إلى computer_toolset_20260801، وقد يختلف تنسيق الواجهة وهيكل الإرجاع.
إضافةً إلى ذلك، التفكير التكيفي مُفعّل افتراضيًا، وقد يكون أول كتلة محتوى في الاستجابة كتلة تفكير وليس النص الأساسي، لذا يجب أن يرشّح منطق التحليل حسب حقل type.
خمسة تغييرات، كل واحد منها قد يتسبب في خطأ مباشر في الطلب أو إرجاع هيكل غير متوقع.
وفّرت Anthropic دليل ترحيل، ويُنصح بمراجعته بالكامل قبل التبديل.
ومن الفرصتين التاليين خبرتان سارّتان
انخفض سعر قراءة التخزين المؤقت لـ Sonnet 5.5 من $0.20/M إلى $0.10/M، وتقول Anthropic إن معظم مهام الوكلاء (agents) ستنخفض تكلفتها بنحو 20% بفضل ذلك.
يمكن لمشتركي Max وTeam اعتماد رصيد API اعتبارًا من هذا الأسبوع، حيث يحصل Max 5x على $100 شهريًا، وMax 20x على $200 شهريًا، وتحصل Team على ما يصل إلى $500 شهريًا تُشارك داخل الفريق.
يمكن استخدام هذه الأرصدة للتجربة عبر استدعاء API لبناء أدوات وتطبيقات ووكلاء (agents)، وهي صالحة لجميع النماذج.
ماذا؟ تقول إن الشركة A أعادت لي أموال خطة Coding التي اشتريتها، وأتاحت لي استخدامها مرة أخرى على API؟
إذن ماذا يفعل OpenAI؟ OpenAI أرسل بطاقة إعادة تعيين أخرى.
روابط مرجعية:
[1]الرابط: https://www.anthropic.com/claude-haiku-5-5
[2]https://x.com/AI_Screening/status/2107906044915749274?s=20