المؤلف: تشنغ جيامي
تحرير:岑 فنغ
قبل قليل، أصدرت Anthropic إصدار Claude Haiku 5.5. وحجم هذه الترقية ليس صغيراً، خاصة في مجال تشغيل الحاسوب، إذ ارتفعت نتيجة تقييم OSWorld 2.1 من 15.7% في الجيل السابق إلى 72.4%. كما تحسّنت قدرات العمل المعرفي والاستدلال المعقد بشكل ملحوظ، ووفقاً للبيانات التي أعلنتها Anthropic، انخفض متوسط تكلفة تشغيل النموذج الجديد بنحو 75%. وإضافة إلى ذلك، أضاف Haiku 5.5 آلية استدلال تكيفية، ويدعم سياقاً يبلغ 1,000,000 رمز (Token). في السابق، كان Haiku يُستخدم بشكل رئيسي في المهام عالية التكرار مثل التلخيص والتصنيف واستخراج المعلومات، وكانت ميزته دائماً هي السرعة العالية والتكلفة المنخفضة. بعد هذا التحديث، أصبح قادراً على معالجة أعمال أكثر تعقيداً بوضوح، بل إن نتائجه في بعض التقييمات اقتربت من Sonnet 5.5. غير أن الفجوة بينهما تظل واضحة عند الانتقال إلى مهام البرمجة المعقدة. وبالنظر إلى آلية الاستدلال وقواعد التسعير في هذا التحديث، فإن أداء Haiku 5.5 في المهام المختلفة وتكلفته الفعلية في الاستخدام يتضمنان في الواقع تفاصيل كثيرة تحتاج إلى تفكيكها بعناية.
01
البرمجة المعقدة لا تزال تُظهر فجوة
ينصبّر نمو الأداء في Haiku 5.5 بشكل رئيسي في عدة اتجاهات: تشغيل الحاسوب، والعمل المعرفي، والاستدلال متعدد التخصصات، ويتضح التغيير بشكل خاص في تشغيل الحاسوب. على المجموعة الفرعية غير المتصلة من OSWorld 2.1، حقق Haiku 5.5 نسبة 72.4%، بينما حقق الجيل السابق 15.7% فقط، وبلغ Sonnet 5.5 نسبة 83.9%. يقيس OSWorld قدرة النموذج على إنجاز مهام طويلة السلسلة عبر واجهة الحاسوب، ويشمل فهم الواجهة، وتنفيذ العمليات، ومواصلة إتمام المهمة بناءً على تغذية بيئية راجعة. وبالمقارنة مع الأسئلة النصية العادية، يتضمن تشغيل الحاسوب اعتمادًا أكبر على الحالة. فبعد أن ينفذ النموذج نقرة واحدة أو إدخالًا ما، قد تتغير الصفحة، وتتقرر الخطوات اللاحقة وفق حالة الواجهة الجديدة. وإذا فشلت العملية، يجب على النموذج أيضًا أن يحكم ما إذا كانت البيئة الحالية لا تزال تلبي متطلبات المهمة. نمو Haiku 5.5 في هذا التقييم يشير إلى تحسن ملحوظ في قدرته على معالجة مهام العمليات المتسلسلة مقارنة بالجيل السابق. لكن نسبة 72.4% تمثل معدل الإنجاز في مجموعة اختبار معينة، ولا يمكن أن تمثل مباشرة معدل النجاح الفعلي في جميع مهام المتصفح أو سطح المكتب. فالصفحات الديناميكية، وقيود الصلاحيات، والحالات الاستثنائية في الأعمال الحقيقية لا تزال تحتاج إلى اختبار منفصل في البيئات المعنية. في جانب العمل المعرفي، حصل Haiku 5.5 على 1620 نقطة في GDPval-AA v2.1، مقابل 735 نقطة لـ Haiku 4.5 و1840 نقطة لـ Sonnet 5.5. يغطي هذا التقييم مهام عمل فعلية في 44 فئة مهنية، ويشمل تحليل المواد، وتجميع المعلومات، وتوليد مخرجات العمل. وفي تقييم آخر هو AA-Briefcase v1.1، ارتفع Haiku 5.5 من 614 نقطة في الجيل السابق إلى 1578 نقطة. أما في اختبار الاستدلال متعدد التخصصات Humanity's Last Exam، فقد بلغت النتيجة دون أدوات 45.9%، وبعد ربط الأدوات 57.4%، وهي أيضًا أعلى بوضوح من الجيل السابق. المهام التي تنطوي عليها هذه التقييمات أكثر تعقيدًا من استخراج المعلومات العادي. إذ يحتاج النموذج إلى فهم العلاقات بين مصادر معلومات متعددة، ومعالجة القيود الواردة في المواد، وتشكيل النتائج بناءً على المحتوى المتاح. كما أن إدخال الأدوات يضيف حلقات إضافية لجمع المعلومات ودمج النتائج. ومع ذلك، تُظهر تقييمات البرمجة صورة مختلفة. في الاختبار الرئيسي FrontierCode 1.1، حصل Haiku 5.5 على 46.4%، بفارق صغير عن 52.1% لـ Sonnet 5.5. لكن في Terminal-Bench 4.0، حصل Haiku 5.5 على 39.2%، بينما وصل Sonnet 5.5 إلى 70.6%. يتضمن Terminal-Bench مهامًا معقدة متعددة الخطوات في بيئة سطر الأوامر، وعادةً ما يحتاج النموذج إلى قراءة الملفات، وتنفيذ الأوامر، ومعالجة الأخطاء، وتعديل العمليات وفق تغذية الاختبارات الراجعة، وهو ما يتطلب مستوى عالٍ من التخطيط المستمر وصيانة حالة التنفيذ. كما أشارت Anthropic صراحة في مواد الإصدار إلى أن Sonnet 5.5 وOpus 5.5 لا يزالان أكثر ملاءمة لمهام البرمجة الوكيلية المعقدة، في حين يستهدف Haiku 5.5 بشكل رئيسي المهام الفرعية محددة النطاق، والتلخيص، وضغط السياق وغيرها من الأعمال. وقد قدمت الاختبارات المبكرة لدى الشركات بيانات إضافية أكثر تحديدًا. فأفادت Asana بأنه في الاختبارات المتعلقة بـ AI Teammates انخفض زمن تأخير إنجاز المهام لدى Haiku 5.5 بأكثر من 30% مقارنة بنموذجها المستخدم حاليًا، وارتفعت سرعة الاستدلال في الجولة الواحدة بما يصل إلى 2.5 مرة. وفي بيئة CRM محاكاة، قاست HubSpot متوسط 92.8% على ثلاثة تشغيلات، بينما حصلت AlphaSense في اختبار أسئلة وأجوبة على 400 مستند على نتيجة 0.84 لـ Haiku 5.5 مقابل 0.76 للجيل السابق. تأتي هذه النتائج من اختبارات داخلية لدى شركات مختلفة، معتمدة كل منها مهام ومعايير تقييم مختلفة، وهي مناسبة لفهم الأداء في سيناريوهات أعمال محددة، ولا يمكن اعتمادها مباشرة كترتيب موحد لقدرات النماذج.02
الاستدلال التكيفي يدخل Haiku
إلى جانب تغيرات الأداء، أصبح Haiku 5.5 أول نموذج من عائلة Haiku يدعم شدة استدلال قابلة للتعديل. سابقًا في Haiku 4.5، عند استخدام ميزة التفكير الموسع، كان على المطورين ضبط مسبقًا ميزانية استدلال داخلية ثابتة. فسواء كانت المهمة بحثًا بسيطًا عن معلومات أو تحليلًا معقدًا يتضمن شروطًا متعددة، كانت مساحة الاستدلال المتاحة للنموذج محدودة بقيمة مضبوطة مسبقًا. أما Haiku 5.5 فقد اعتمد Adaptive Thinking. إذ يستطيع النموذج أن يقرر بناءً على محتوى المهمة ما إذا كان سيستخدم الاستدلال الداخلي وكم من الحوسبة سيستثمر، بينما يضبط المطورون شدة الاستدلال الإجمالية عبر إعداد Effort. على سبيل المثال، استخراج التواريخ من مستند لا يحتاج عادةً إلى تحليل طويل، بينما مقارنة الاختلافات بين البنود في عدة نسخ من عقد يتطلب معالجة شروط ومعلومات مترابطة أكثر في الوقت ذاته. ويسمح الاستدلال التكيفي للنموذج باعتماد استثمار حوسبي مختلف في هذين النوعين من المهام. وتتعلق هذه الآلية أيضًا بتوزيع موارد الحوسبة وقت الاستدلال. ففي المهام المعقدة، تتيح زيادة الاستدلال الداخلي للنموذج معالجة خطوات وسيطة أكثر، لكن عملية الاستدلال الأطول تزيد أيضًا استهلاك التوكنات وزمن الاستجابة. وفي المهام البسيطة، يقلل تقليل الاستدلال الداخلي من التكاليف الحوسبية غير الضرورية. وقد عرضت Anthropic في صفحة الإصدار علاقة التكلفة والأداء لـ Haiku 5.5 عند شدات استدلال مختلفة في OSWorld وGDPval-AA وHumanity's Last Exam. مع ذلك، تختلف استجابة المهام المختلفة للحوسبة الاستدلالية الإضافية، ولا يمكن اعتبار رفع درجة الاستدلال مكافئًا مباشرة لتحسن أداء بمقدار ثابت. وعلى مستوى واجهة API هناك أيضًا عدة تغييرات تتطلب معالجة. أولًا، لم يعد Haiku 5.5 يعتمد طريقة الجيل السابق في التحديد اليدوي لعدد ثابت من توكنات التفكير، ما يستلزم تعديل إعدادات الاستدلال القديمة. ثانيًا، يحتل الاستدلال الداخلي من ميزانية توكنات المخرجات للنموذج. فإذا كان البرنامج الأصلي يضبط حد المخرجات بناءً على طول الإجابة النهائية فقط، قد يحدث بعد الترقية أن يستهلك الاستدلال الداخلي مساحة زائدة فلا يتم توليد النص الكامل بشكل كامل. إضافة إلى ذلك، بعد تفعيل الاستدلال التكيفي، قد تتضمن استجابة النموذج كتل بيانات تفكير مستقلة. وعلى التطبيقات أن تميز بشكل صحيح بين محتوى الاستدلال الداخلي والمخرجات النهائية، ولا يمكنها الاستمرار في افتراض أن بداية المحتوى المرجع هي بالضرورة الإجابة. أما بالنسبة للوكلاء الذين يستخدمون الأدوات بشكل متواصل، فهناك أيضًا متطلبات اتساق بين بيانات الاستدلال وسجل المحادثة. فإذا عدّل المطورون رسائل السجل الموجودة في الطلبات اللاحقة، قد يتأثر صحة حالة الاستدلال الأصلية. كما أضاف Haiku 5.5 قيودًا على بعض معاملات أخذ العينات، وعلى التطبيقات التي كانت تعتمد على هذه المعاملات لضبط سلوك المخرجات أن تتحقق من توافق الواجهة. تؤثر هذه التغييرات بشكل رئيسي على المشاريع التي تستخدم بالفعل ميزة التفكير الموسع في Haiku 4.5. وعند الترحيل، إضافة إلى استبدال إصدار النموذج، يجب إعادة فحص ميزانية الاستدلال، وتحليل الاستجابات، وطريقة معالجة الرسائل متعددة الأدوار.03
مليون توكن من السياق دون سعر منخفض موحد
يدعم Haiku 5.5 سياقاً يبلغ 1,000,000 رمز ومخرجات تصل إلى 128,000 رمز، ويمكنه معالجة المستندات الطويلة والأكواد البرمجية الضخمة وسجلات الأدوات التي تعمل بشكل متواصل. غير أن Anthropic لم تضع سعراً منخفضاً موحداً لكامل نافذة السياق. بالنسبة للمحفزات (Prompts) التي لا تتجاوز 100,000 رمز، تبلغ تكلفة كل مليون رمز إدخال 0.10 دولار، وكل مليون رمز إخراج 0.50 دولار. وعندما يتجاوز المحفز 100,000 رمز، يرتفع سعر الإدخال إلى 0.50 دولار، ويرتفع سعر الإخراج إلى 2.50 دولار. أما رسوم التخزين المؤقت فتعتمد أيضاً نظاماً متدرجاً؛ إذ يبلغ سعر قراءة الكاش لكل مليون رمز 0.01 دولار للمحفزات الأقصر، و0.05 دولار للمحفزات الأطول. ومقارنة بإعادة تمرير المحتوى الكامل بشكل متكرر، يُعد التخزين المؤقت مناسباً لإعادة استخدام تعليمات النظام وتعريفات الأدوات والمواد المشتركة. وذكرت Anthropic أن نحو 90% من طلبات Haiku 4.5 كان طولها ضمن 100,000 رمز. وقد حصل هذا الجزء من الطلبات على خفض سعري كبير بموجب التسعير الجديد، لكن التكلفة الفعلية تتأثر أيضاً بتغير حجم استخدام الرموز. فقد حدّث Haiku 5.5 المُجزّئ اللغوي (Tokenizer)، وقد يختلف عدد الرموز المقابل للمحتوى نفسه عن الجيل السابق. لذلك، حتى لو لم يتغير نص الإدخال، فقد يتغير عدد الرموز المُحاسَب عليه فعلياً بعد الترقية، مما يستلزم إعادة القياس. وبالنسبة للوكلاء الأذكياء الذين يعملون لفترات طويلة، تؤثر إدارة السياق تأثيراً إضافياً على التكلفة. فعلى سبيل المثال، قد تُنتج مهمة برمجية على التوالي نتائج استرجاع ملفات وسجلات تحليل أكواد وسجلات اختبارات. وإذا حمل كل استدعاء التاريخ الكامل، فإن طول الإدخال يزداد باستمرار مع تقدم المهمة. ويمكن لـ Prompt Caching خفض رسوم قراءة المحتوى المتكرر، بينما يمكن لـ Compaction تنظيم العمليات المنجزة في حالة مهمة أقصر، ما يقلل المعلومات التاريخية التي تحتاج الاستدعاءات اللاحقة إلى معالجتها. وقد أدرجت Anthropic ضغط السياق ضمن أبرز حالات الاستخدام لـ Haiku 5.5 في مواد الإصدار. وفيما يخص النشر الفعلي، أبلغت Rogo عن حالة استخدام لوكيل فرعي يعمل بـ Haiku لاستخراج بيانات الإيرادات من ملفات 10-K الخاصة بالشركات، بينما يتولى نموذج أكبر إعداد العروض التقديمية اللاحقة. أما Cognition فقد استخدمت Haiku 5.5 كنموذج مساعد لـ Devin Fusion، وفي إعداد يقوده Opus 5.5 بلغت درجة FrontierCode 66.2%، مع تقارير عن انخفاض التكلفة والزمن المستغرق. تعتمد هذه الحالات على أسلوب توزيع النماذج المختلفة على المهام المختلفة، لكن مواد الإصدار لم تقدم أعداد الاستدعاءات الكاملة ولا توزيع الرموز ولا تفاصيل التكاليف، لذا لا يمكن بناءً عليها حساب حجم التوفير عند تبني الأعمال العامة للمعمارية نفسها. كما خفضت Anthropic هذه المرة سعر قراءة الكاش لـ Sonnet 5.5 بنسبة 50%، من 0.20 دولار لكل مليون رمز إلى 0.10 دولار. ووفقاً لإحصاءات Anthropic، أدى ذلك إلى انخفاض تكلفة تشغيل Sonnet 5.5 بنحو 20% في معظم مهام الوكلاء. وهذا التعديل يقتصر على رسوم قراءة الكاش فقط، ولم تنخفض الأسعار القياسية لرموز الإدخال والإخراج بنفس النسبة بالتزامن.04
عند الترحيل لا يزال يتعين فحص الأداء في المهام الفعلية
أصبح طراز Claude Haiku 5.5 متاحًا عبر منصات مثل Claude API وAWS وGoogle Cloud وMicrosoft Azure، وفي الوقت نفسه بدأت Anthropic بتحديث حزمتي التطوير Python وTypeScript، مضيفة دعمًا نسخة تجريبية لعمليات تشغيل الحاسوب والمتصفح. وبحسب البيانات المعلنة حتى الآن، حقق Haiku 5.5 نتائج أعلى بوضوح من الجيل السابق في تقييمات تشغيل الحاسوب والعمل المعرفي والاستدلال متعدد التخصصات، لكنه ما زال يظهر فجوة كبيرة مقارنة بـ Sonnet 5.5 في البرمجة الطرفية المعقدة. أما من حيث السعر، فإن المطالبات الأقصر تحقق ميزة تكلفة أوضح، بينما تُطبَّق شريحة تسعير أخرى بعد تجاوز 100,000 توكن. وبالنسبة للتطبيقات القائمة على Haiku 4.5، تتضمن عملية الترحيل تعديلات محددة تتعلق بإعدادات الاستدلال وحساب التوكنات وتحليل الاستجابات. وإذا كان Sonnet يُستخدم سابقًا لمعالجة بعض المهام عالية التكرار، فيمكن أيضًا مقارنة معدل إنجاز Haiku 5.5 ووقت الاستجابة وتكلفة الاستدعاء باستخدام مجموعة الاختبار نفسها. لقد قدّمت Anthropic بالفعل معلومات عن قدرات النموذج وتغييرات الواجهة والأسعار، لكن تحسين التكلفة في الأعمال الفعلية ما زال يتطلب التحقق عبر أحمال العمل المقابلة. وخصوصًا في سيناريوهات الاستدعاء متعدد الأدوات، يجب أن يُحسب سعر الطلب الواحد للنموذج وعدد محاولات إعادة المحاولة بعد فشل المهمة ونمو السياق ضمن مهمة كاملة واحدة نفسها.انطلق معنا لاستكشاف خلاصة أفضل مؤتمرات الذكاء الاصطناعي حول العالم
استعراض حصري لـ:
عروض الخبراء التقديمية PPT
النصوص الكاملة لتقارير المؤتمرات
شروح الأوراق البحثية الأكثر رواجًا
مقابلات مع النجوم الأكاديميين الصاعدين
امسح رمز الاستجابة السريعة أعلاه
أو انقر «قراءة النص الأصلي» لمتابعة القسم المخصص.
مقالات Leiifengwang الأصلية، ويُمنع إعادة نشرها دون إذن. لمزيد من التفاصيل، راجعشروط إعادة النشر。