مع تشغيل GPT‑6 Astra في Codex للتجارب، قامت أسانا بتحسين سير عمل وكيل المتصفح لديها على GPT‑6.1 Sol ليصبح أرخص بنسبة 76 مرة وأسرع بنسبة 5 مرات.
تساعد أسانا العملاء على أتمتة العمل عبر تطبيقات الأعمال من خلال StackAI(يفتح في نافذة جديدة), وهي منصة قامت بالاستحواذ عليها(يفتح في نافذة جديدة). باستخدام StackAI، يمكن للعملاء بناء سير عمل يتنقل عبر المواقع الإلكترونية ويملأ النماذج ويجمع المعلومات دون كتابة تعليمات برمجية. وعلى نطاق أسانا، تتراكم حالات القصور الصغيرة في سير العمل هذا.
جرّر كبير مسؤولي التقنية في StackAI بأسانا، فرانك إيدالغو، الحاصل على درجة الدكتوراه، جعل وكيل المتصفح أسرع وأرخص في التشغيل. وجّه GPT‑6 Astra في Codex للتحقيق في الوكيل واختبار التحسينات ومقارنة النتائج. عمل يقدّر أنه كان سيستغرق شهرًا إلى شهرين يدويًا استغرق حوالي أسبوع واحد.
دراسة أسانا ذات 144 تشغيلًا(يفتح في نافذة جديدة) اختبرت GPT‑6.1 Sol وثلاثة نماذج رائدة أخرى، تُسمى هنا النموذج A والنموذج B والنموذج C. سير العمل المحسّن الذي ظهر على GPT‑6.1 Sol بلغ متوسطه 0.47 دولارًا في تكاليف النموذج المقدرة وحوالي أربع دقائق لكل تشغيل، أي أرخص بنسبة 76 مرة وأسرع بنسبة 5 مرات من إعداد الإنتاج الأصلي على النموذج B.
«هذا هو شكل فرق البشر والوكلاء في الممارسة العملية. مهندس حدد الاتجاه، وقام GPT-6 Astra بتشغيل التجارب، وتمت النتائج عبر Command إلى الإنتاج. هذا يوضح كيف تحيّي أسانا فرق البشر والوكلاء.»—أرناب بوز، كبير مسؤولي المنتجات في أسانا
تحديد حالات القصور في وكيل المتصفح باستخدام GPT‑6 Astra
وللتحرك بسرعة، بدأ إيدالغو باستخدام GPT‑6 Astra في Codex لرسم خريطة قاعدة التعليمات البرمجية وشرح كيفية بناء الوكيل لكل طلب نموذج. اكتشف GPT‑6 Astra أن الوكيل يخزن مؤقتًا تعليماته الثابتة وتعريفات أدواته، ولكن ليس السجل المتنامي لنصوص الصفحات ولقطات الشاشة التي يجمعها، لذا كان كل طلب يعيد إرسال ذلك السجل بسعر كامل.
كما كان الوكيل يحذف لقطات الشاشة الأقدم ويقلّص النصوص في كل خطوة تقريبًا. وكل تعديل كان يغيّر السجل، لذا فإن تخزين السجل مؤقتًا وحده لم يكن سيساعد، وفقدان تلك الحقائق قد يتطلب من الوكيل إعادة زيارة الصفحات التي قرأها بالفعل.
من شهرين مقدّرين من البحث إلى أسبوع واحد باستخدام GPT‑6 Astra
راجع إيدالغو الإصلاحات المقترحة من GPT‑6 Astra واختار ثلاثة لاختبارها:
توسيع التخزين المؤقت ليشمل سجل تصفح الوكيل
زيادة كمية النص الذي يمكنه الاحتفاظ به
إزالة لقطات الشاشة على دفعات بدلاً من كل خطوة
بدأ GPT‑6 Astra باختبارات سريعة لتحديد المتغيرات المهمة. ولأن التعليمات البرمجية لم تكن مصممة للتجارب المضبوطة، أعاد هيكلة الكود بحيث يدعم واجهة أمامية وخلفية واحدة سير عمل متعددة بالتوازي، لكل منها إعداداته الخاصة.
أجرى Astra الدراسة الكاملة: ميزانيات سجل بحجم 120,000 و480,000 حرف وست سياسات للتخزين المؤقت ولقطات الشاشة، وتم اختبار كل منها ثلاث مرات على كل من النماذج الأربعة (انظر الجدول أدناه). سمحت السياسة الأفضل أداءً للقطات الشاشة بالتراكم حتى 20 قبل الاقتصاص إلى الأحدث منها. هذا أبقى السجل الأقدم دون تغيير لفترات أطول بين عمليات الإزالة. وبالدمج مع ميزانية السجل الأكبر، أصبح سير العمل المحسّن. وأدى كل تكوين المهمة نفسها: جمع ستة حقول لكل كتاب من أصل 32 كتابًا من كتالوج تجريبي عام، بما يمثل ما يشغّله بعض عملاء أسانا في StackAI.
النموذج | الوصف | السعر |
|---|---|---|
النموذج A | نموذج أصغر وأقل تكلفة من مختبر رائد آخر، صدر في خريف 2025 | نصف سعر GPT‑6.1 Sol |
Model B | النموذج المستخدم أصلاً في الإنتاج، من نفس المختبر الخاص بـ Model A، أُصدر صيف 2026 | نفس سعر GPT‑6.1 Sol |
Model C | نسخة محدّثة من Model B، أُصدرت خريف 2026 | نفس سعر GPT‑6.1 Sol |
GPT‑6.1 Sol | نموذج OpenAI |
شغّل GPT‑6 Astra سير العمل وفحص الطلبات وسجلات الاستخدام والمخرجات، وراجعت جلسات نموذج منفصلة هذا العمل. وسُجلت طلبات كل جلسة وآثار بياناتها ونتائجها في Command(يفتح في نافذة جديدة)، منصة Asana لتسليم البرمجيات، حتى يتمكن الفريق من مراجعة الدراسة الكاملة لاحقًا. ومن Command تحولت النتائج إلى تذاكر، ثم طلبات سحب (pull requests)، ووصلت التغييرات إلى بيئة الإنتاج.
“كان هذا سيستغرق مني شهرًا إلى شهرين يدويًا. مع GPT-6 Astra في Codex، استغرق الأمر نحو أسبوع: كنت أضبط /goal قبل النوم وأراجع النتائج في الصباح.”—فرانك إيدالغو، دكتوراه، المدير التقني لـ StackAI في Asana
خفض تكلفة النموذج إلى أقل من 0.50 دولار لكل تشغيل
بالنسبة لـ Model B، خفّض التحسين تكلفة النموذج المقدرة من 36.21 دولارًا على الأقل (بلغت بعض التشغيلات الأصلية حد الخطوات قبل أن تنتهي) إلى 1.24 دولارًا لكل تشغيل، أي انخفاض بمقدار 29x. وكان سير العمل المُحسَّن على GPT‑6.1 Sol أرخص بنسبة 2.6x إضافية، عند 0.47 دولارًا. واكتملت المهمة وأعادت الإجابة الصحيحة في كل تشغيل من تشغيلات سير العمل المُحسَّن.
متوسطات 3 تشغيلات. ≥: يشمل خط الأساس تشغيلات محدودة السقف، لذا فإن متوسطه حد أدنى.
تقارن الطيّتان اليمنيان بـ Model B المُحسَّن. شُغّل Model B في المرحلة 1، وشُغّلا Model C وSol 6.1 في المرحلة 2 من الدراسة نفسها (خط منقّط).
على GPT‑6.1 Sol وحده، وبوجود ميزانية أكبر للسجل، خفّضت سياسة التخزين المؤقت ولقطات الشاشة الجديدة التكلفة بمقدار 4x، من 1.97 دولارًا إلى 0.47 دولارًا لكل تشغيل. وكانت كل مكالمة أرخص بنحو 3x، لأن 89% من المدخلات جاءت من ذاكرة التخزين المؤقت بسعر 5% من السعر غير المخزَّن. وأصبحت التشغيلات أسرع أيضًا: 22.5 دقيقة على الأقل في الإعداد الأصلي على Model B، ونحو أربع دقائق مع سير العمل المُحسَّن على GPT‑6.1 Sol.
متوسط 3 تشغيلات، مع أشرطة انحراف معياري. ≥: يشمل المتوسط تشغيلًا محدود السقف أو غير مكتمل، لذا فإن القيمة الحقيقية بهذا الحجم على الأقل.
تستخدم الأعمدة السمة الزرقاء. اقرأ تأثيرات التخزين المؤقت مقابل عمود الميزانية الأكبر 480k.
مؤشرات التشغيل وأشرطة الانحراف المعياري هي إعادة بناء تقريبية من الصورة الأصلية؛ ولم تتوفر قيم التشغيل الفردية والانحرافات المعيارية الأساسية.
متوسط 3 تشغيلات، مع أشرطة انحراف معياري. ≥: يشمل المتوسط تشغيلًا محدود السقف أو غير مكتمل، لذا فإن القيمة الحقيقية بهذا الحجم على الأقل.
تستخدم الأعمدة السمة الزرقاء. اقرأ تأثيرات التخزين المؤقت مقابل عمود الميزانية الأكبر 480k.
مؤشرات التشغيل وأشرطة الانحراف المعياري هي إعادة بناء تقريبية من الصورة الأصلية؛ ولم تتوفر قيم التشغيل الفردية والانحرافات المعيارية الأساسية.
كما أظهر التحقيق كيف أثّرت إدارة السجل في ما إذا كان الوكيل يُنتج إجابة أصلًا. فقد أدى منح GPT‑6.1 Sol مساحة أكبر للاحتفاظ بسجل التصفح الخاص به إلى زيادة عدد التشغيلات التي أنتجت إجابة من ثلاثة من أصل 18 بميزانية السجل الأصغر إلى جميع الـ 18 بميزانية السجل الأكبر، وكلها بالإجابة الصحيحة. وبالنسبة لإيدالغو، القيمة التجارية تكمن في منح العملاء إمكانية الوصول إلى نماذج أسرع وأكثر قدرة مع إبقاء تكاليف التشغيل مستدامة.
“كانت التكلفة تحدّ من النماذج التي يمكننا تقديمها للعملاء لأعباء العمل هذه. وبجعل الوكيل أكثر كفاءة، يمكننا أن نمنح العملاء نموذجًا أفضل وأسرع مع خفض تكاليف التشغيل لدينا.”—فرانك إيدالغو، دكتوراه، المدير التقني لـ StackAI في Asana
توسيع نطاق التجريب واختبار المنتجات
أصدرت Asana التغييرات على التنقل في المتصفح في StackAI، وتطوّر أدوات لتسهيل تكرار تجارب مماثلة. ومع مرور الوقت، تخطط الفريق لدمج هذا الاختبار في تقييمات المنصة، حتى يتمكن العملاء والفرق الداخلية من مقارنة التكلفة ووقت التشغيل وجودة الإجابة عند تهيئة وكلائهم.
“سرعة الشحن لم تعد هي عنق الزجاجة؛ بل الانتباه البشري هو ذلك. نحن قريبون من عالم يصبح فيه كل مهندس مدير منتج يقود أسطولًا من الوكلاء.”—فرانك إيدالغو، دكتوراه، المدير التقني لـ StackAI في Asana
تستخدم Asana الآن GPT‑6 Astra في Codex لاختبار ميزات المنتج قبل الإطلاق: يتنقل Astra في المنصة، ويجرّب مدخلات مختلفة ويُبلّغ عن الأخطاء لمراجعي ضمان الجودة البشريين. ويرى إيدالغو في ذلك أساسًا لدورة تطوير برمجيات جديدة، مع العديد من جلسات الوكلاء السحابية التي تختبر الميزات بالتوازي.
الدراسة الكاملة متاحة على Asana(يفتح في نافذة جديدة) و StackAI(يفتح في نافذة جديدة) المدونات.
