الإعلان عن Harvey LAB-AA v1.1: إضافة فحوصات الهلوسة لرفع سقف العمل القانوني الوكيلي
تعاونّا مع Harvey على Harvey LAB-AA v1.1، الذي يحدّث منهجية التقييم لدينا لمعيار Legal Agent Benchmark (LAB) لوكلاء الذكاء الاصطناعي الذين يقومون بعمل قانوني حقيقي ووكيلي. أصبحت كل مخرجات تُفحص الآن للكشف عن الهلوسة مقابل مستنداتها المصدرية، وتقيّم لجنة من ثلاثة قضاة كل معيار في سلّم التقييم، والمقياس الرئيسي الجديد، Hallucination-Gated All-Pass Rate، لا يمنح نقاطًا للمهمة إلا إذا استوفت المخرجات كل معيار في سلّم التقييم ولم تتضمن أي هلوسة جوهرية.
يعمل كل نموذج عبر 120 مهمة قانونية خاصة من إعداد فريق Harvey، بدءًا من عمليات الاندماج والاستحواذ والأسواق المالية في الشركات وصولًا إلى الضرائب والتقاضي والإفلاس. هذه هي الخطوة الأولى في تعزيز منهجية Harvey LAB-AA. في التحديثات المستقبلية، نعمل مع Harvey على مراعاة المجموعة الكاملة من العوامل التي يقدّرها المحامون بشكل أفضل، بما في ذلك ميزات سهولة الاستخدام مثل الأسلوب والنبرة.
الدرجة
Harvey LAB-AA v1.1: Hallucination-Gated All-Pass Rate
متوسط نسبة أعضاء لجنة التحكيم الذين يرون أن كل معيار في سلّم التقييم قد استُوفى عبر المهام، مع تصفير المهمة عند أي هلوسة جوهرية · تم تقييمه بشكل مستقل من قبل Artificial Analysisيتصدر Grok 4.7 (xhigh) Harvey LAB-AA v1.1 بمعدل Hallucination-Gated All-Pass Rate بلغ 9.4%، متقدمًا بفارق ضيق على Muse Spark 1.3 (max) بنسبة 8.9% وGPT-6 Astra (max) بنسبة 8.6%. يليه GPT-6.1 Sol (max) بنسبة 6.9%، ثم Claude Fable 5.1 (max, with fallback) بنسبة 6.4%، وKimi K3 (max) بنسبة 5.3%، وClaude Opus 5.5 (max, with fallback) بنسبة 4.2%. شُغّلت نماذج Claude مع تفعيل خيار fallback من Anthropic، لكنه لم يُستخدم مطلقًا.
إن أخذ الهلوسة في الحسبان يغيّر الترتيب على Harvey LAB-AA. فمن دون بوابة الهلوسة، كان Muse Spark 1.3 سيتصدر بوضوح بمعدل نجاح شامل (All-Pass Rate) يبلغ 26.7%، لكن ثلثي هذه النجاحات تتضمن هلوسة جوهرية. يحتفظ GPT-6 Astra بمعظم نجاحاته تقريبًا (من 8.9% إلى 8.6%) ويتقدم من المركز 10 المشترك في النجاح الشامل إلى المركز 3 في معدل النجاح الشامل بعد استبعاد الهلوسة (Hallucination-Gated All-Pass Rate). ويتراجع GPT-6.1 Sol بانخفاض نسبي طفيف، من 7.5% إلى 6.9%. وعبر جميع النماذج المختبرة، تحتوي أكثر من 60% من النتائج الناجحة لولا ذلك على هلوسة جوهرية، وتحصل عدة نماذج على 0% بعد أخذ الهلوسة في الحسبان.
تستوفي معظم النماذج الغالبية العظمى من معايير سلّم التقييم: 16 نموذجًا تجتاز 85.6-96.0% من المعايير. تقيّم سلالم التقييم كل مخرجات بشكل شمولي، وليس فقط من خلال معايير مختارة لصعوبتها. نعرض Criterion Pass Rate قبل بوابة الهلوسة إلى جانب عدد الهلوسات الجوهرية لكل مهمة لإظهار تغطية سلالم التقييم والاستناد إلى المصادر بشكل منفصل.
للاطلاع على النتائج المحدّثة راجع صفحة تقييم Harvey LAB-AA. يعرض هذا المقال البيانات كما في 8 أكتوبر 2026.
التغييرات في Harvey LAB-AA v1.1
تعاونّا مع Harvey لتحديث Harvey LAB-AA إلى v1.1. يغيّر هذا التحديث طريقة تقييم المعيار واحتساب درجاته، لذا فإن نتائج v1.1 غير قابلة للمقارنة المباشرة مع أرقام v1.0 المنشورة سابقًا:
- تدقيق الهلوسة. تُدقَّق الآن كل مخرجات يقدمها النموذج مقابل مستندات المصدر للمهمة في فحص من مرحلتين؛ وتحصل المهمة التي لا تقدّم فيها مخرجات قابلة للاستخدام على صفر ولا تُدقَّق. يحدد قاضٍ أول الهلوسات المحتملة عبر ثلاث فئات - التناقضات مع المواد المصدرية، والمحتوى المزعوم من المصادر، والتأكيدات المحددة التي لا سند لها في المصادر - ثم يعيد القاضٍ نفسه في مرحلة ثانية التحقق من كل إشارة مقابل مستندات المصدر لتلك المهمة، ويستبعد الإشارات غير الثابتة ويصنّف الباقي على أنه جوهري أو بسيط.
- المقياس الرئيسي Hallucination-Gated All-Pass Rate. أصبح المقياس الرئيسي الآن هو Hallucination-Gated All-Pass Rate: لا تُحتسب المهمة إلا إذا استوفت المخرجات كل معيار في سلّم التقييم ولم تتضمن أي هلوسة جوهرية.
- Criterion Pass Rate والهلوسات الجوهرية. نعرض نسبة معايير سلّم التقييم المستوفاة قبل بوابة الهلوسة، بمتوسط من القضاة الثلاثة ومجمَّعة على جميع المعايير، إلى جانب متوسط عدد الهلوسات الجوهرية لكل مهمة مُدقَّقة. يقارن المخطط الانتشاري بين هذين المقياسين مباشرة.
- لجنة تحكيم من ثلاثة قضاة. تُقيَّم الآن معايير سلّم التقييم من قبل لجنة من ثلاثة قضاة LLM - GPT-6 Sol وGrok 4.7 وClaude Opus 5.5 - مع متوسط الأحكام عبر اللجنة، بدلًا من القاضٍ الواحد المستخدم في v1.0. راجعنا هؤلاء القضاة ووجدنا تفضيلًا ذاتيًا ضئيلًا لعائلات النماذج الخاصة بهم، والمتوسط عبر الثلاثة جميعًا يخفف من أي تحيزات قد تظهر.
- تحديث مجموعة البيانات. تستخدم v1.1 أحدث مجموعة بيانات خاصة من Harvey (v1.1.0)، والتي تتضمن تحسينات على المهام والمعايير.
كيف يختلف Harvey LAB-AA عن LAB من Harvey
Harvey LAB-AA هو إعادة تنفيذ مستقلة لدينا لتقييم Harvey، وهناك عدة اختلافات رئيسية عن النسخة الأصلية:
- تُشغَّل النماذج على Stirrup منصتنا لوكلاء الذكاء الاصطناعي، مما يتيح ميزات مثل ضغط السياق بدلًا من الفشل عند بلوغ حدود السياق، مع مطالبات وكيل وقاضٍ مبسطة من تأليف Artificial Analysis
- لا نُضمّن أدوات Harvey المخصصة وسكربتات مهارات إنشاء المستندات (مثل pptx وdocx)، ونوفر بدلًا من ذلك أداة بسيطة لتنفيذ الأكواد لتعكس قدرة النموذج الخام
- يجب أن تطابق المخرجات اسم الملف المحدد بدقة، بدلًا من المطابقة المرنة عندما تنتج النماذج أسماء ملفات غير صحيحة
الهلوسات
في دراسات التفضيل البشري التي أجرتها Harvey، أشار الخبراء البشريون إلى الهلوسة كعامل حاسم أساسي في تحديد الإجابة التي يفضلونها من بين إجابتين شاملين على حد سواء. يركز فحص الهلوسة لدينا على الأخطاء التي قد تؤثر جوهريًا على العمل القانوني الفعلي، ويتبع نهجًا متحفظًا في وضع علامات عليها. وهو يميز بين الادعاءات الخاصة بالمهمة غير المدعومة والمعرفة القانونية العامة، ويضع الأخيرة خارج النطاق، حتى لا تُعاقب النماذج على الاستناد إلى أحكام قضائية أو قوانين خارج الملفات المصدرية.
يتم تدقيق كل مخرج يقدمه النموذج للتحقق من عدم وجود هلوسات مقابل المستندات المصدرية للمهمة. المهمة التي لا تحتوي على تسليم قابل للاستخدام تحصل على درجة صفر ولا يتم تدقيقها ولا استخدامها في حساب الهلوسات لكل مهمة. الهلوسة هي ادعاء في المنتج النهائي لا تدعمه المصادر، ويندرج كل منها ضمن إحدى ثلاث فئات:
- تناقض مع المواد المصدرية.
- محتوى مصدري مُفبرك.
- تأكيد محدد لا يحظى بأي دعم في السجل.
تُقيَّم كل هلوسة إما كجوهرية أو طفيفة. الهلوسة الجوهرية قد تضلل القارئ بشأن نقطة جوهرية، مثل تاريخ خاطئ يقتضيه العقد. الهلوسة الطفيفة هي خطأ حقيقي يُرجَّح ألا يؤثر بشكل ذي معنى على التفسير القانوني للمخرج. الهلوسات الجوهرية فقط هي التي تؤثر على الدرجات: وجود هلوسة جوهرية واحدة أو أكثر يُصفّر درجة المهمة في معدل النجاح الشامل المشروط بعدم الهلوسة. يقيس معدل النجاح لكل معيار تغطية سلم التقييم قبل بوابة الهلوسة. ويُبلَّغ عن أعداد الهلوسات الجوهرية والطفيفة لكل مهمة خضع لها الفحص؛ ولا تؤثر الهلوسات الطفيفة على الدرجات.
كيف يعمل فحص الهلوسة
يتم فحص كل مخرَج مقابل المستندات المصدرية للمهمة في ثلاث خطوات.
العثور على الهلوسات المحتملة
يقارن القاضي التسليم مع مصادر المهمة ويضع علامات على العبارات التي تستدعي المراجعة.
مراجعة الامتثال الضريبي · مقتطفات من التسليم3 أمثلةالمصدر الضريبي للمهمة · مقتطف من مسودة الإقرار الضريبي للشراكة
تمت سداد أقساط أصل الدين المجدولة بمبلغ 6,000,000 دولار خلال عام 2023، مما خفّض الرصيد القائم من 220,000,000 دولار (بداية العام، شاملاً 6,000,000 دولار مصنّفة كرصيد جارٍ) إلى 214,000,000 دولار (نهاية العام، شاملاً 6,000,000 دولار مصنّفة كرصيد جارٍ في السطر 15).
التسليم · قائمة مناقشة
«جدول الديون: قرض لأجل بقيمة $220M + سندات بقيمة $214M»
احتمال احتساب الدين مرتينالتسليم نفسه · جدول التعرض
“$6,400,000 *293/365 $5,136,986”
خطأ محتمل في الحساب التناسبيتسليم آخر، المهمة نفسها · مذكرة المشكلات
«تم إيداع الدفعة الزائدة البالغة 960,000 دولار لعام 2024»
تقول إن مبلغ 960,000 دولار قد أُودع بالفعل، لكن المصدر يطلب التأكيد قبل التقديم.يقيّم سلم التقييم وفحص الهلوسة جانبين مختلفين من التسليم.
مثال جوهري 1 1 طفيف · 1 غير مُثبَتمثال توضيحي للدرجات
معدل النجاح الشاملنسبة القضاة الذين يجتازون كل معيار67%67%اجتاز 2 من أصل 3 من القضاة كل معيار
معدل النجاح لكل معيارنسبة أحكام القضاة التي تعتبر نجاحًا90%90%كانت 27 من أصل 30 حكمًا من أحكام القضاة نجاحًا؛ ولا تتأثر بالهلوسات
تُحدث نماذج GPT-6 أقل قدر من الهلوسة: يبلغ متوسط GPT-6 Astra 0.03 هلوسة جوهرية لكل مهمة (4 هلوسات عبر جميع المهام الـ120) ومتوسط GPT-6 Sol 0.07 (8 هلوسات عبر جميع المهام الـ120)، بينما يسجل Gemini 3.8 Flash أعلى متوسط في مجموعة الإطلاق، بواقع 13.96 لكل مهمة. إكمال المعايير وعدم الهلوسة مهارتان مختلفتان: ينجح Muse Spark 1.3 في أكبر عدد من المعايير (96.0%) لكنه يبلغ متوسط 1.68 هلوسة جوهرية لكل مهمة، مقابل 0.03 لـ GPT-6 Astra. كل نموذج مفتوح الأوزان يبلغ متوسطه 2.09 هلوسة جوهرية على الأقل لكل مهمة. يعتمد معدل هلوسة النموذج على النموذج نفسه أكثر بكثير من اعتماده على المجال الممارسة.
Harvey LAB-AA v1.1: الهلوسات لكل مهمة
علامات الهلوسة المثبتة لكل مهمة، مقسمة حسب الخطورة · العلامات الجوهرية قد تضلل القارئ بشأن نقطة جوهرية، والعلامات الطفيفة هي أخطاء حقيقية يُرجَّح ألا تؤثر على التفسير القانوني، والعلامات الجوهرية فقط هي التي تؤثر على الدرجة الرئيسية · الأقل أفضلمتوسط عدد إشارات الهلوسة المؤكدة لكل مهمة Harvey LAB-AA تم التحقق منها، مقسمة حسب الخطورة. تُعتبر الإشارة جوهرية عندما تضلّل القارئ في نقطة جوهرية - كطرف خاطئ، أو مبلغ، أو تاريخ، أو التزام، أو حقيقة تُغيّر استنتاجاً - وتُعتبر بسيطة عندما تكون خطأً حقيقياً من غير المرجح أن تؤثر بشكل ملموس على التفسير القانوني للمُخرَج. الإشارات الجوهرية فقط هي التي تؤثر في النتيجة الرئيسية؛ أما الإشارات البسيطة فيتم الإبلاغ عنها لكنها لا تُحتسب أبداً.
كيف اخترنا مفتش الهلوسة
نستخدم GPT-6 Sol (high) لكلا المرورَين من فحص الهلوسة، بشكل منفصل عن لجنة التقييم المكونة من ثلاثة قضاة. قارنا ستة مرشحين لدور قاضي الهلوسة: GPT-6 Sol وGPT-6 Luna وGrok 4.7 وClaude Opus 5.5 وClaude Sonnet 5.5 وGemini 3.8 Flash، كل منها بجهد استدلال مرتفع، على نفس المجموعة المكوّنة من 20 مهمة ومُخرَجاً من ثمانية نماذج تم تقييمها.
عبر هذه المجموعة الفرعية من المهام، حدّد GPT-6 Sol وGPT-6 Luna عموماً حالات هلوسة جوهرية أكثر، بينما حدّد Claude Sonnet 5.5 وGemini 3.8 Flash حالات أقل بكثير. احتلّ Claude Opus 5.5 موقعاً بين Grok 4.7 وClaude Sonnet 5.5 في كل صف من صفوف النماذج. إجمالاً، أكّد Opus وجود 99 حالة هلوسة جوهرية، مقابل 219 لـ Grok، و57 لـ Sonnet، و470 لـ GPT-6 Sol. حدّد GPT-6 Sol حالات هلوسة جوهرية أكثر رغم النهج المتحفظ للفحص في الإبلاغ عن الأخطاء، والذي يستثني المعرفة القانونية العامة غير الواردة في المستندات المصدرية.
لم يجد جميع المفتشين الستة أي حالات هلوسة جوهرية في مخرجات GPT-6 Astra، بينما تراوح GPT-6 Sol بين 0 و0.20 لكل مهمة. وكلاهما كان بين النماذج ذات أقل عدد من الهلوسات الجوهرية في ظل كل مفتش.
Harvey LAB-AA v1.1: مقارنة نماذج قاضي الهلوسة
متوسط الهلوسات الجوهرية المؤكدة لكل مهمة · مجموعة فرعية من 20 مهمة و8 نماذج · الأقل أفضلمتوسط الهلوسات الجوهرية لكل مهمة0481217Harvey LAB-AA v1.1: مقارنة نماذج قاضي الهلوسة. متوسط الهلوسات الجوهرية المؤكدة لكل مهمة · مجموعة فرعية من 20 مهمة و8 نماذج · الأقل أفضل.| النموذج الذي يتم فحصه | قاضي الهلوسة | |||||
|---|---|---|---|---|---|---|
| GPT-6 Sol(high) | GPT-6 Luna(high) | Grok 4.7(high) | Claude Opus 5.5(high) | Claude Sonnet 5.5(high) | Gemini 3.8 Flash(high) | |
| GPT-6 Astra (max) | ||||||
| GPT-6 Sol (max) | ||||||
| Grok 4.7 (xhigh) | ||||||
| Claude Opus 5.5 (max with fallback) | ||||||
| Claude Fable 5.1 (max with fallback) | ||||||
| Muse Spark 1.3 (max) | ||||||
| Kimi K3 (max) | ||||||
| Gemini 3.8 Flash (high) | ||||||
| إجمالي الهلوسات الجوهرية لكل مهمة | 23.50 | 19.35 | 10.95 | 4.95 | 2.85 | 1.40 |
معدل النجاح القريب المقيّد بالهلوسة
السماح بالنجاحات القريبة من حيث المعايير يضع GPT-6 Astra وGPT-6.1 Sol في الصدارة. يرتفع GPT-6 Astra من معدل نجاح شامل مقيّد بالهلوسة بلغ 8.6% إلى معدل نجاح قريب مقيّد بالهلوسة بلغ 20.3% مع معيار واحد مفقود و31.7% مع معيارين مفقودين، ويصعد GPT-6.1 Sol من 6.9% إلى 20.3% و29.6%، مقابل 15.3% و23.1% لـ Grok 4.7. أكبر المكاسب التالية تذهب إلى GPT-6 Sol (من 3.6% إلى 18.1%) وClaude Sonnet 5.5 (من 2.8% إلى 16.9%). النماذج التي تتلاشى نجاحاتها بسبب الهلوسة تحقق مكاسب ضئيلة، إذ أن الهلوسة الجوهرية تُصفّر المهمة في كل فئة: لا يصل GLM-5.3 إلا إلى 2.2% حتى مع مُعيارين مفقودين، وتبقى Gemini 3.8 Flash عند 0%.Harvey LAB-AA v1.1: معدل النجاح القريب المقيّد بالهلوسة
متوسط نسبة لجنة القضاة التي لم تفوّت أي من المعايير (0) أو فوّتت <=1 أو <=2 من المعايير لكل مهمة · المهام التي تحتوي على 1 هلوسة جوهرية على الأقل تُحتسب بنسبة 0% · الأعلى أفضلترتيب حسب المعايير المفقودةالتكلفة
النماذج الحاصلة على أعلى الدرجات ليست الأكثر تكلفة. يتصدر Grok 4.7 بنحو $9.50 لكل مهمة، أي أقل من نصف تكلفة Claude Fable 5.1 (~$21.70)، النموذج الأكثر تكلفة. يمثل Muse Spark 1.3 أداءً قوياً مقابل تكلفته، إذ يحل في المركز الثاني بنحو $4.20 لكل مهمة.Harvey LAB-AA v1.1: التكلفة لكل مهمة
متوسط التكلفة لكل مهمة (بالدولار الأمريكي)، مقسمة حسب رموز المدخلات وإصابة ذاكرة التخزين المؤقت وكتابتها والاستدلال والإجابةمتوسط التكلفة لكل مهمة في التقييم. تُقسَّم التكاليف حسب أسعار رموز المدخلات وإصابة ذاكرة التخزين المؤقت وكتابتها والاستدلال والإجابة حيثما تتوفر أعداد الرموز المرجعية.
استخدام الرموز
توليد مزيد من رموز المخرجات لا يترجم بالضرورة إلى درجة أعلى. فنموذج GPT-6 Astra يحصل على 8.6% مع نحو 81k رمز مخرجات لكل مهمة، أي أقل من نصف نحو 180k لنموذج Grok 4.7، بينما تولّد نماذج Claude الثلاثة أكبر عدد من رموز المخرجات (نحو 202k إلى 562k لكل مهمة) وتحصل على درجات تتراوح بين 2.8% و6.4%.Harvey LAB-AA v1.1: رموز المخرجات لكل مهمة
رموز المخرجات المستخدمة لتشغيل مهمة واحدة، مقسمة حسب رموز الاستدلال ورموز الإجابةمتوسط عدد رموز الإجابة والاستدلال الناتجة لكل مهمة معيارية في هذا التقييم.
السرعة
تميل النماذج الأقوى إلى استغراق وقت أطول. يبلغ زمن فك التشفير المقدَّر حوالي 33 دقيقة لكل مهمة لكل من Grok 4.7 وClaude Fable 5.1. بينما يسجل Muse Spark 1.3 في المرتبة الثانية بحوالي 12 دقيقة لكل مهمة. تستثني هذه التقديرات الوقت حتى أول رمز والتكاليف الإضافية الأخرى.Harvey LAB-AA v1.1: الوقت لكل مهمة
متوسط مرجّح لزمن فك التشفير (بالدقائق) لكل مهمة؛ يستثني TTFT والوقت الإضافي · الأقل أفضلمتوسط مرجّح لزمن فك التشفير المقدَّر (بالدقائق) لكل مهمة. تُقسَّم رموز المخرجات لكل مهمة على سرعة المخرجات وتُحوَّل من الثواني إلى الدقائق. يستثني ذلك الوقت حتى أول رمز والوقت الإضافي الآخر.
الدورات
أعلى المتسجلين لا يُشغّلون أطول الحلقات. يبلغ متوسط Grok 4.7 حوالي 63 دورة لكل مهمة وGPT-6 Astra حوالي 54. ويُشغّل Claude Sonnet 5.5 الأطول بحوالي 179 دورة ويسجل 2.8%.Harvey LAB-AA v1.1: متوسط الدورات لكل مهمة
متوسط عدد دورات النموذج لكل مهمة من Harvey LAB-AA v1.1 · الأقل أفضليعرض هذا المخطط متوسط عدد الدورات التي يقوم بها الوكيل لكل مهمة. وهو مؤشر تقريبي لعدد الإجراءات ونداءات الأدوات ودورات التكرار التي يستخدمها الوكيل لإكمال المهام المعيارية.
حجم النموذج (نماذج الأوزان المفتوحة فقط)
Harvey LAB-AA v1.1: معدل النجاح الشامل المقيَّد بالهلوسة مقابل مؤشر الحوسبة
Harvey LAB-AA v1.1 معدل النجاح الشامل المقيَّد بالهلوسة · مؤشر الحوسبةالربع الأكثر جاذبيةخط باريتومؤشر نسبي للحوسبة المستخدمة، يُحسب كالتالي: المعلمات النشطة (بالمليارات) × (رموز المدخلات / 5 + رموز المخرجات) / 1,000,000. تُخفَّض أوزان رموز المدخلات لتعكس انخفاض تكلفة الحوسبة في التعبئة المسبقة مقارنةً بالتوليد. تشير القيم المنخفضة إلى نماذج أكثر كفاءة في الحوسبة. تحقق النماذج في أعلى يسار المخطط درجات عالية بحوسبة أقل.
الدرجة مقابل تاريخ الإصدار
Harvey LAB-AA v1.1: معدل النجاح الشامل المقيَّد بالهلوسة مقابل تاريخ الإصدار
المنطقة الأكثر جاذبيةمثال على المهام والاقتراحات
عرض مجموعة المهام على GitHubتصفح أمثلة لمهام Harvey LAB من مجموعة المهام العامة، والملفات المرجعية التي حصل عليها كل نموذج، والمخرجات التي أنتجها.
الاندماجات والاستحواذاتالتعليمات
راجع عقود غرفة بيانات الاستحواذ المرفقة والمذكرة الداخلية بخصوص أحكام تغيير السيطرة والتنازل، وأعد تقريراً شاملاً لفريق الصفقة.
المخرجات: coc-analysis-report.docx
التسليمات
المخرجات المتوقعة التي يجب أن ينتجها النموذج
- coc-analysis-report.docx تقرير شامل صادر عن فريق الصفقة يحلل أحكام تغيير السيطرة والتنازل في العقود الجوهرية للشركة المستهدفة.
ملفات مرجعية
مُقدَّم إلى النموذج
افتحمفتوحافتحافتحفتحمفتوحافتحافتحافتحفتحافتحفتحافتحافتحفتحافتحفتحافتحمفتوحتقديم النماذج
المخرجات التي ينتجها كل نموذج
Claude Opus 5.5 (max with fallback) - coc-analysis-report.docxفتحموارد Harvey LAB-AA
- تُنشر لوحة المتصدرين والنتائج الكاملة على صفحة تقييم Harvey LAB-AA، ويتم تحديثها مع إصدار نماذج جديدة
- ال صفحة المنهجية توثّق التنفيذ الكامل، بما في ذلك مطالبات تقييم الوكيل وسلّم التقدير
- إعلان Harvey الأصلي عن LAB يقدّم المعيار المرجعي وتصميمه
- تتوفر مجموعة عامة من المهام التمثيلية على GitHub
- يعمل Harvey LAB-AA بواسطة Stirrup، إطار عمل الوكلاء مفتوح المصدر الخاص بنا
اقرأ الأحدث

أصدرت Anthropic إصدار Claude Haiku 5.5
حصل Claude Haiku 5.5 على درجة 43 في مؤشر Artificial Analysis للذكاء، بزيادة قدرها 26 نقطة بعد مرور عام واحد على إصدار Haiku الأخير
7 أكتوبر 2026

أصدرت Mistral إصدار Mistral Large 4، لتصبح فرنسا موطناً للنموذج الأكثر ذكاءً خارج الولايات المتحدة والصين
أصدرت Mistral إصدار Mistral Large 4، محققاً درجة 38 في مؤشر Artificial Analysis للذكاء؛ وتعود فرنسا إلى امتلاك النموذج الأكثر ذكاءً من خارج الولايات المتحدة والصين
6 أكتوبر 2026
تطلق مختبرات Upstage الكورية للذكاء الاصطناعي إصدار Solar Mini 4
أصدر مختبر Upstage الكوري للذكاء الاصطناعي إصدار Solar Mini 4 الذي حصل على درجة 24 في مؤشر Artificial Analysis للذكاء، لكنه يكلف نحو 5 أضعاف التكلفة لكل مهمة مقارنة بـ GPT-6 Luna (max) رغم تشابه أسعار التوكن
30 سبتمبر 2026
