OpenAI Sitemapآخر تحديث

خفضت Asana تكاليف النموذج 76 مرة في اختبارات المتصفح باستخدام GPT-6.1 Sol

باستخدام GPT-6 Astra في Codex، جعلت Asana وكيل المتصفح لديها أرخص بـ 76 مرة وأسرع بـ 5 مرات في الاختبارات لتقديم نماذج أكثر قدرة للعملاء.

مصدر الصورة · OpenAI Sitemap

مع تشغيل تجارب GPT-6 Astra في Codex، قامت Asana بتحسين سير عمل وكيل المتصفح لديها على GPT-6.1 Sol ليصبح أرخص بـ 76 مرة وأسرع بـ 5 مرات.

تساعد Asana العملاء على أتمتة العمل عبر تطبيقات الأعمال من خلال StackAI⁠(يفتح في نافذة جديدة)، وهي منصة استحوذت عليها⁠(يفتح في نافذة جديدة). باستخدام StackAI، يمكن للعملاء بناء سير عمل يتنقل في المواقع الإلكترونية ويملأ النماذج ويجمع المعلومات دون كتابة كود. وعلى نطاق Asana، تتراكم أوجه القصور الصغيرة في سير العمل هذه.

شرع Frank Hidalgo، الحاصل على درجة الدكتوراه والرئيس التقني لـ StackAI في Asana، في جعل وكيل المتصفح أسرع وأرخص في التشغيل. وجّه GPT-6 Astra في Codex للتحقيق في الوكيل واختبار التحسينات ومقارنة النتائج. عمل قدّر أنه كان سيستغرق من شهر إلى شهرين يدويًا استغرق نحو أسبوع واحد.

دراسة Asana التي شملت 144 تشغيلًا⁠(يفتح في نافذة جديدة) اختبرت GPT-6.1 Sol وثلاثة نماذج رائدة أخرى، تُسمى هنا النموذج A وB وC. سير العمل المحسّن الذي ظهر على GPT-6.1 Sol حقق متوسط 0.47 دولار من التكاليف النموذجية المقدرة ونحو أربع دقائق لكل تشغيل، أي أرخص بـ 76 مرة وأسرع بـ 5 مرات من إعداد الإنتاج الأصلي على النموذج B.

“هذا هو شكل فرق البشر والوكلاء في الممارسة العملية. مهندس حدد الاتجاه، وشغّل GPT-6 Astra التجارب، ومرت النتائج عبر Command إلى الإنتاج. هذا يوضح كيف تجسّد Asana فرق البشر والوكلاء.”
—أرناب بوز، الرئيس التنفيذي للمنتج في Asana

تحديد أوجه قصور وكيل المتصفح باستخدام GPT-6 Astra

وللمضي بسرعة، بدأ Hidalgo باستخدام GPT-6 Astra في Codex لرسم خريطة قاعدة الكود وشرح كيف يبني الوكيل كل طلب نموذج. اكتشف GPT-6 Astra أن الوكيل يخزّن مؤقتًا تعليماته الثابتة وتعريفات أدواته، لكنه لا يخزّن التاريخ المتنامي لنصوص الصفحات ولقطات الشاشة التي يجمعها، لذا كان كل طلب يعيد إرسال ذلك التاريخ بالسعر الكامل.

كما كان الوكيل يحذف لقطات الشاشة الأقدم ويقتطع النصوص في كل خطوة تقريبًا. كل تعديل كان يغيّر التاريخ، لذا فإن تخزين التاريخ مؤقتًا وحده لم يكن سيساعد، وفقدان تلك الحقائق قد يتطلب من الوكيل إعادة زيارة الصفحات التي قرأها بالفعل.

من شهرين تقديريين من البحث إلى أسبوع واحد مع GPT-6 Astra

راجع Hidalgo الإصلاحات المقترحة من GPT-6 Astra واختار ثلاثة لاختبارها:

  • توسيع التخزين المؤقت ليشمل تاريخ تصفح الوكيل

  • زيادة كمية النص الذي يمكنه الاحتفاظ به

  • إزالة لقطات الشاشة على دفعات بدلاً من كل خطوة

بدأ GPT-6 Astra باختبارات سريعة لتحديد المتغيرات المهمة. ولأن الكود لم يكن مصممًا للتجارب المضبوطة، أعاد هيكلته بحيث يستطيع واجهة أمامية وخلفية واحدة دعم سير عمل متعدد بالتوازي، ولكل منها إعداداته الخاصة.

أجرت Astra الدراسة الكاملة: ميزانيات تاريخ من 120,000 و480,000 حرف وست سياسات للتخزين المؤقت ولقطات الشاشة، اختُبرت كل منها ثلاث مرات على كل من النماذج الأربعة (انظر الجدول أدناه). السلوك الأفضل أداءً سمح للقطات الشاشة بالتراكم حتى 20 قبل التقليص إلى الأحدث فقط. هذا أبقى التاريخ الأقدم دون تغيير لفترات أطول بين الإزالات. وبالاقتران مع ميزانية التاريخ الأكبر، أصبح سير العمل المحسّن. وأدى كل تكوين نفس المهمة: جمع ستة حقول لكل كتاب من أصل 32 كتابًا من كتالوج تجريبي عام، وهو ما يمثل ما يديره بعض عملاء Asana في StackAI.

النموذج

الوصف

السعر

النموذج A

نموذج أصغر وأقل تكلفة من مختبر رائد آخر، صدر في خريف 2025

نصف سعر GPT-6.1 Sol

الطراز B

الطراز المستخدم في الأصل في الإنتاج، ومن نفس المختبر الذي أنتج الطراز A، أُطلق في صيف 2026

نفس سعر GPT‑6.1 Sol

الطراز C

نسخة محدَّثة من الطراز B، أُطلقت في خريف 2026

نفس سعر GPT‑6.1 Sol

GPT‑6.1 Sol

نموذج OpenAI

شغّل GPT‑6 Astra سير العمل وفحص الطلبات وسجلات الاستخدام والمخرجات، وراجعت جلسات نماذج منفصلة هذا العمل. وسُجلت طلبات كل جلسة وآثار بياناتها ونتائجها في Command⁠(يفتح في نافذة جديدة)، منصة Asana لتسليم البرمجيات، حتى يتمكن الفريق من مراجعة الدراسة الكاملة لاحقًا. ومن Command، حُوّلت النتائج إلى تذاكر، ثم إلى طلبات سحب، ووصلت التغييرات إلى بيئة الإنتاج.

“كان هذا سيستغرق مني شهرًا إلى شهرين يدويًا. مع GPT-6 Astra في Codex، استغرق الأمر حوالي أسبوع: كنت أضبط /goal قبل النوم وأراجع النتائج في الصباح.”
—فرانك هيدالغو، دكتوراه، المدير التقني لـ StackAI في Asana

خفض تكلفة النموذج إلى أقل من $0.50 لكل تشغيل

بالنسبة إلى Model B، خفّض التحسين تكلفة النموذج المقدّرة من $36.21 على الأقل (وصلت بعض التشغيلات الأصلية إلى حد الخطوات قبل أن تنتهي) إلى $1.24 لكل تشغيل، أي انخفاضًا بمقدار 29x. وكان سير العمل المحسّن على GPT‑6.1 Sol أرخص بنسبة 2.6x إضافية، عند $0.47. واكتملت المهمة في كل تشغيل من سير العمل المحسّن وأعاد الإجابة الصحيحة.

متوسطات 3 تشغيلات. ≥: يتضمن خط الأساس تشغيلات مقيّدة، لذا فإن متوسطه حد أدنى.

الطيّتان اليمنيان تُقارنان مع Model B المحسّن. شغّل Model B في المرحلة 1، وModel C وSol 6.1 في المرحلة 2 من الدراسة نفسها (خط منقّط).

على GPT‑6.1 Sol وحده، مع ميزانية السجل الأكبر، خفّض التخزين المؤقت الجديد وسياسة لقطات الشاشة التكلفة بمقدار 4x، من $1.97 إلى $0.47 لكل تشغيل. وكانت كل استدعاء أرخص بحوالي 3x، لأن 89% من المدخلات جاءت من ذاكرة التخزين المؤقت بسعر 5% من السعر غير المخزّن. وأصبحت التشغيلات أيضًا أسرع: 22.5 دقيقة على الأقل في الإعداد الأصلي على Model B، وحوالي أربع دقائق مع سير العمل المحسّن على GPT‑6.1 Sol.

متوسط 3 تشغيلات، مع أشرطة الانحراف المعياري. ≥: يتضمن المتوسط تشغيلًا مقيّدًا أو غير مكتمل، لذا فإن القيمة الحقيقية على الأقل بهذا الحجم.

تستخدم الأشرطة السمة الزرقاء. اقرأ تأثيرات التخزين المؤقت مقارنةً بشريط الميزانية الأكبر 480k.

مؤشرات التشغيل وأشرطة الانحراف المعياري هي إعادة بناء تقريبية من الصورة المصدر؛ ولم تتوفر قيم التشغيلات والانحرافات المعيارية الأساسية.

متوسط 3 تشغيلات، مع أشرطة الانحراف المعياري. ≥: يتضمن المتوسط تشغيلًا مقيّدًا أو غير مكتمل، لذا فإن القيمة الحقيقية على الأقل بهذا الحجم.

تستخدم الأشرطة السمة الزرقاء. اقرأ تأثيرات التخزين المؤقت مقارنةً بشريط الميزانية الأكبر 480k.

مؤشرات التشغيل وأشرطة الانحراف المعياري هي إعادة بناء تقريبية من الصورة المصدر؛ ولم تتوفر قيم التشغيلات والانحرافات المعيارية الأساسية.

كما أظهر التحقيق كيف أثّرت إدارة السجل في ما إذا كان الوكيل ينتج إجابة من الأساس. فمنح GPT‑6.1 Sol مساحة أكبر للاحتفاظ بسجل تصفحه رفع عدد التشغيلات التي أنتجت إجابة من ثلاثة من أصل 18 بميزانية السجل الأصغر إلى 18 كاملة بميزانية السجل الأكبر، وكلها بالإجابة الصحيحة. وبالنسبة لهيدالغو، تكمن القيمة التجارية في منح العملاء إمكانية الوصول إلى نماذج أسرع وأكثر قدرة مع الحفاظ على استدامة تكاليف التشغيل.

“كانت التكلفة تحدّ من النماذج التي يمكننا تقديمها للعملاء لأعباء العمل هذه. بجعل الوكيل أكثر كفاءة، يمكننا أن نمنح العملاء نموذجًا أفضل وأسرع مع خفض تكاليف التشغيل لدينا.”
—فرانك هيدالغو، دكتوراه، المدير التقني لـ StackAI في Asana

توسيع نطاق التجريب واختبار المنتجات

أصدرت Asana التغييرات على التنقل في المتصفح في StackAI وتطوّر أدوات لتسهيل تكرار تجارب مماثلة. ومع مرور الوقت، يخطط الفريق لدمج هذا الاختبار في تقييمات المنصة، بحيث يمكن للعملاء والفرق الداخلية مقارنة التكلفة ووقت التشغيل وجودة الإجابة عند إعداد وكلائهم.

“لم تعد سرعة الإصدار هي العائق؛ بل انتباه الإنسان هو العائق. نحن قريبون من عالم يصبح فيه كل مهندس مدير منتج يقود أسطولًا من الوكلاء.”
—فرانك هيدالغو، دكتوراه، المدير التقني لـ StackAI في Asana

تستخدم Asana الآن GPT‑6 Astra في Codex لاختبار ميزات المنتج قبل الإصدار: يتنقل Astra في المنصة، ويجرّب مدخلات مختلفة ويبلّغ عن الأخطاء لمراجعي ضمان الجودة البشريين. ويرى هيدالغو في هذا أساسًا لدورة تطوير برمجيات جديدة، تُختبر فيها الميزات في جلسات وكلاء سحابية عديدة بالتوازي.

الدراسة الكاملة متاحة على Asana⁠(يفتح في نافذة جديدة) و StackAI⁠(يفتح في نافذة جديدة) blogs.

انضم إلى العصر الجديد للعمل

أكثر من 1 مليون شركة حول العالم تحقق نتائج ذات معنى مع OpenAI.تواصل مع المبيعات
المصدر الأصلي

OpenAI Sitemap

ملاحظات المحتوى

النشر الأصلي والحقوق تعود إلى المصدر.

ترجمة آلية · يُرجى الرجوع إلى الأصل