عندما قدّمنا GPT‑6 Astra، عرضنا مدى التقدم الذي حققته نماذجنا في استخدام الحواسيب للعمل المهني، من إعداد المستندات إلى اختبار المواقع الإلكترونية. هدفنا التالي هو جعل الوكلاء أكثر قدرة وكفاءة في استخدام البرمجيات المتخصصة لحل مشكلات الأعمال المعقدة. نستكشف كيفية تدريب النماذج على فهم قواعد العمل لدى الشركة، وتنفيذ سير عمل متعدد الخطوات، والتحقق من أن عملها يلبي المتطلبات الأصلية.
لتسريع هذا البحث، نتعاون مباشرة مع عدد صغير من شركات البرمجيات التي تفهم سير العمل هذا على أفضل وجه. معًا، نحدد مهام صعبة وعالية القيمة ونحوّلها إلى مسائل بحثية لتدريب نماذجنا وتقييمها، مما يجعل نماذجنا في نهاية المطاف أكثر قدرة وفائدة في تطبيقات الأعمال الواقعية.
شريكنا الأول هو Ironclad، الشركة الرائدة في التعاقدات بالذكاء الاصطناعي. من خلال العمل الوثيق مع فريق Ironclad، طوّرنا مهام تتطلب من الوكلاء إعداد الاتفاقيات والموافقات والمصطلحات القانونية القابلة لإعادة الاستخدام، وأظهرنا تقدمًا في سير العمل المعقد هذا. كانت خبرة Ironclad أساسية في تحديد شكل النجاح وإدخال احتياجات العملاء الحقيقية مباشرة في تطوير النماذج الرائدة. نحن ممتنون لشراكتهم ومتحمسون لمشاركة ما أنجزناه معًا.
GPT‑6 Astra هو أول نموذج رائد منّا يُدرَّب على مهام Ironclad. في تقييمنا البحثي، كان متوسط درجاته أعلى بنسبة 32% من GPT‑5.6 Sol، بينما كان الوقت المقدر لكل محاولة أقل بنسبة 48%.1
تحويل سير عمل التعاقدات إلى مهام تدريب
تخيّل فريق عمليات قانونية يُنشئ عملية لشراء برنامج. قد يحتاج قسم المالية إلى الموافقة على المشتريات التي تتجاوز مبلغًا معينًا، وقد يحتاج قسم الأمن إلى مراجعة طلبات معينة، وقد يحتاج القسم القانوني إلى مراجعة الشروط غير القياسية. وعلى الشخص الذي يُنشئ العملية أن يحوّل تلك القائمة المختصرة إلى نموذج استقبال طلبات، وقوالب مستندات، وقواعد موافقة، وسجل للاتفاقية النهائية.
أما وكيل الذكاء الاصطناعي الذي يقوم بالعمل نفسه فيجب أن يبقي تلك المتطلبات أمام عينه أثناء تنقله في البرنامج. على سبيل المثال، عليه إعداد موافقة المالية للإنفاق الذي يتجاوز الحد المسموح، والتحقق من أن الطلبات فوق هذا الحد وتحته تسلك المسارات الصحيحة. فالإصابة في الخطوات الفردية وحدها لا تكفي: يجب أن تعمل العملية المكتملة عبر الحالات التي صُممت للتعامل معها.
ساعد موظفو Ironclad والأشخاص الذين يستخدمون Ironclad في OpenAI باحثينا في تحديد 11 مهمة عبر العمل القانوني والتجاري والمشتريات. وشملت هذه المهام أمورًا مثل إعداد اتفاقيات عدم الإفصاح، وإنشاء عمليات موافقة للمشتريات، وتحديث بند قانوني قابل لإعادة الاستخدام بحيث يعكس الاختصاص القضائي الذي يختاره مقدم الطلب. نقدّر أن هذا العمل يستغرق من مستخدم متمرس حوالي 30 إلى 40 دقيقة لكل مهمة، في المتوسط.
قيّمنا كل مهمة وفقًا لـ 8 إلى 50 معيارًا، حسب مدى تعقيدها. وقد مكّننا ذلك من معرفة الأجزاء التي أصابتها النماذج والأجزاء التي قصّرت فيها. كما وفّرت Ironclad بيئات برمجية مستضافة لمنتجها حيث يمكن للنماذج التدرب على هذه المهام. وطوّر باحثونا مهام تدريب اصطناعية2 حول سير عمل تمثيلي واستخدموا التعلم المعزز لمساعدة النماذج على التحسن من خلال الممارسة والتغذية الراجعة. يضمن هذا المزيج—مهام مختارة بالتعاون مع أشخاص يعرفون العمل، ومعايير مفصلة، ومكان للنماذج للتدرب—أننا نُحسّن الأداء على مهام واقعية وهي الأهم لعملائنا.
أداء Astra
قارنّا بين Astra وGPT‑5.6 Sol باستخدام وضع الاستدلال Max لـ Astra ووضع High لـ Sol، وهما الإعدادان اللذان حققت فيهما كل نماذج أعلى الدرجات. عبر المهام البحثية الـ 11، بلغ متوسط درجات Astra 55.0%، مقارنة بـ 41.6% لـ GPT‑5.6 Sol، بينما انخفض متوسط الوقت المقدر لكل محاولة من 37.0 دقيقة لـ Sol إلى 19.2 دقيقة لـ Astra.3 حقق نموذج داخلي استُخدم في تطوير Astra نتيجة أقوى بلغت 63.7% في هذه المهام، ونحن نسعى لتحقيق هذه المكاسب الإضافية في النماذج المستقبلية.
المقياس | GPT‑5.6 Sol | GPT‑6 Astra |
متوسط درجات المعيار | 41.6% | 55.0% |
متوسط الوقت المقدر لكل محاولة | 37.0 دقيقة | 19.2 دقيقة |
استوفى Astra متطلبات المهمة أكثر مع وقت محاكاة أقل لكل محاولة. يوضح المقطعان أدناه كيف تعامل النموذجان مع المهمة البحثية نفسها. استوفى Astra (الأول) حوالي 94% من معايير المهمة في حوالي 20 دقيقة تقديرية؛ بينما استوفى GPT‑5.6 Sol (الثاني) حوالي 85% في حوالي 32 دقيقة تقديرية.
GPT‑6 Astra استوفى حوالي 94% من معايير المهمة في حوالي 20 دقيقة تقديرية.
GPT‑5.6 Sol استوفى حوالي 85% من معايير المهمة في حوالي 32 دقيقة تقديرية.
ما الذي يعنيه هذا التعاون لشركة Ironclad
يعكس دور Ironclad في هذا العمل تحديًا يعرفه عملاؤها جيدًا: يجب أن تكون عملية التعاقد قادرة على التعامل مع الاستثناءات مع الحفاظ على القواعد التي يعتمد عليها العمل. إذا أفقد أحد الوكلاء إحساسه بإحدى تلك القواعد في منتصف مهمة ما، فإن ذلك يحدّ من ما يمكن لشركة برمجيات أن تطلبه منه بثقة. وهذا يؤكد لماذا لا تزال الرقابة البشرية مهمة مع تحسّن الوكلاء في مهام التعاقد المعقدة، ولماذا تظل منصة تعاقد متكاملة أمرًا ضروريًا. ويمنح العمل مع باحثينا شركة Ironclad وسيلة لإدخال هذه المشكلات في تطوير النموذج الأساسي، حيث يمكننا دراستها معًا.
مع ازدياد قدرات النماذج، تتاح لشركة Ironclad فرصة استخدامها في المزيد من منتجاتها الخاصة. بالنسبة لفرق الشؤون القانونية والتجارية، قد يعني ذلك تولّي الذكاء الاصطناعي جزءًا أكبر من الجهد المبذول في التعاقدات المعقدة مع الحفاظ على الضوابط التي تعتمد عليها تلك الفرق.
"لكي يكون الذكاء الاصطناعي مفيدًا حقًا في المجالات المعقدة للتعاقد، يجب أن يفعل أكثر من مجرد تنفيذ إجراءات فردية. يحتاج الوكلاء إلى فهم دورة حياة التعاقد الكاملة، بما في ذلك كيفية ترابط سير العمل التجاري مع الحفاظ على الضوابط التي تعتمد عليها الفرق. إن تعاوننا مع OpenAI يُدخل هذه التحديات الواقعية إلى عملية البحث ويساعد على دفع التقنية إلى الأمام."
اعمل معنا لتطوير الذكاء الاصطناعي للأعمال المهنية المعقدة
ندعو عددًا صغيرًا من شركات البرمجيات للعمل مباشرة مع فرق البحث والهندسة لدينا على مهام مهنية مهمة لا تستطيع وكلاء اليوم إتمامها بشكل موثوق بعد. إذا كان لدى فريقكم واحدة من هذه المهام، فنودّ الاطلاع على مثال ملموس: ما تطلبونه من الوكيل القيام به، ودليل على مواضع تعثره، وكيفية تقديمكم لنتيجة ناجحة. ويجب أيضًا أن يكون الشركاء قادرين على إحضار أشخاص يعرفون العمل معرفة عميقة، وبيئة آمنة للاختبار، وبيانات يمكن استخدامها بأمان في البحث. يمنحنا ذلك نقطة انطلاق للتحقيق في سبب الفشل وقياس مدى تحسّن النموذج.
إذا كان هذا الوصف ينطبق على فريقكم، قدّموا طلبًا لاستكشاف تعاون بحثي.
