OpenAI SitemapMis à jour le

Asana réduit les coûts du modèle de 76 fois lors des tests dans le navigateur avec GPT-6.1 Sol

En utilisant GPT-6 Astra dans le Codex, Asana a rendu son agent navigateur 76 fois moins cher et 5 fois plus rapide lors des tests, afin de proposer aux clients des modèles plus performants.

Source de l’image · OpenAI Sitemap

Avec GPT‑6 Astra dans Codex en train de faire des expériences, Asana a optimisé le flux de travail de son agent navigateur sur GPT‑6.1 Sol, ce qui permet d’exécuter les tâches à 76 fois moins cher et 5 fois plus rapidement.

Asana aide les clients à automatiser leurs tâches dans différentes applications business via StackAI⁠>(ouvre dans une nouvelle fenêtre), une plateforme qu’elle a acquis⁠>(ouvre dans une nouvelle fenêtre). En utilisant StackAI, les clients peuvent créer des flux de travail qui naviguent sur des sites web, remplissent des formulaires et collectent des informations sans avoir à écrire de code. À l’échelle d’Asana, les petites inefficacités dans ces flux de travail se accumulent.

Le CTO de StackAI chez Asana, Frank Hidalgo, PhD, a cherché à rendre l’agent navigateur plus rapide et moins coûteux à exécuter. Il a chargé GPT‑6 Astra dans Codex d’enquêter sur l’agent, tester les améliorations et comparer les résultats. Le travail qu’il estimait avoir nécessité un à deux mois manuellement a été effectué en environ une semaine.

L’étude de 144 exécutions d’Asana⁠ (ouvre dans une nouvelle fenêtre) a testé GPT‑6.1 Sol et trois autres modèles de pointe, appelés ici Modèles A, B et C. Le flux de travail optimisé obtenu avec GPT‑6.1 Sol a coût en moyenne 0,47 $ en coûts de modèle estimés et prend environ quatre minutes par exécution, soit 76 fois moins cher et 5 fois plus rapide que la configuration de production originale sur le Modèle B.

C’est ainsi que fonctionnent en pratique les équipes composées d’humains et d’agents. Un ingénieur définissait la direction, GPT-6 Astra menait les expériences, et les résultats étaient transférés de Commande à production. Cela montre comment Asana met en œuvre les équipes composées d’humains et d’agents.
—Arnab Bose, CPO chez Asana

Identifier les inefficacités du agent navigateur avec GPT‑6 Astra

Pour se déplacer rapidement, Hidalgo a commencé par utiliser GPT‑6 Astra dans Codex pour cartographier le code source et expliquer comment l’agent construisait chaque demande de modèle. GPT‑6 Astra a constaté que l’agent stockait ses instructions fixes et les définitions des outils, mais pas l’historique croissant des textes de pages et des captures d’écran qu’il avait collectés, de sorte que chaque demande devait inclure cet historique à prix complet.

L’agent a également supprimé les anciens captures d’écran et a réduit le texte à presque chaque étape. Chaque modification a modifié l’histoire des modifications, de sorte que le stockage de cette histoire ne serait pas utile. De plus, perdre ces informations pourrait obliger l’agent à revoir des pages qu’il avait déjà lues.

De deux mois de recherche estimés à une semaine avec GPT‑6 Astra

Hidalgo a examiné les corrections proposées par GPT‑6 Astra et a choisi trois d’entre elles pour tester :

  • Étendant le stockage en mémoire au historique de navigation de l’agent

  • Augmenter la quantité de texte qu'il pouvait conserver

  • Supprimer les captures d'écran par groupes plutôt que à chaque étape

GPT‑6 Astra a commencé par des tests rapides afin de déterminer quelles variables étaient importantes. Comme le code n’était pas conçu pour des expériences contrôlées, il a ensuite été réfacté de manière à ce que un frontend et un backend puissent soutenir plusieurs workflows en parallèle, chacun avec ses propres paramètres.

Astra a mené l’étude complète : des budgets de historique de 120 000 et 480 000 caractères, ainsi que six politiques de stockage en cache et d’écran d’accueil, chacune testée trois fois pour chacun des quatre modèles (voir le tableau ci-dessous). La politique ayant le meilleur rendement permettait aux écrans d’accueil de s’accumuler jusqu’à 20 avant de passer à la version la plus récente. Cela permettait que l’historique antérieur reste inchangé pendant une longue période entre les suppressions. En combinaison avec le plus grand budget d’historique, cela devint le flux de travail optimisé. Chaque configuration effectuait la même tâche : collecter six champs pour chacun des 32 livres d’un catalogue de démonstration public, représentant ce que certains clients d’Asana utilisent dans StackAI.

Modèle

Description

Prix

Modèle A

Un modèle plus petit et moins cher provenant d’un autre laboratoire de recherche, sorti à l’automne 2025

Moitié du prix de GPT‑6.1 Sol

Modèle B

Le modèle utilisé initialement en production, provenant du même laboratoire que le Modèle A, sera lancé à l’été 2026

Même prix que le GPT‑6.1 Sol

Modèle C

Une version mise à jour du modèle B, sortie à l’automne 2026

Même prix que le GPT‑6.1 Sol

GPT‑6.1 Sol

Modèle d’OpenAI

GPT‑6 Astra a exécuté les workflows, a examiné les demandes, les enregistrements d’utilisation et les résultats, et les sessions de modèle distinctes ont étudié le travail. Les demandes, les traces de données et les résultats de chaque session ont été enregistrés. Commande⁠(ouvre dans une nouvelle fenêtre), La plateforme de livraison de logiciels d’Asana permet à l’équipe de revoir l’étude complète par la suite. Depuis Command, les résultats ont été transformés en tickets, puis en pull requests, et les modifications ont été intégrées dans la production.

« Cela m’aurait pris un à deux mois à la main. Avec GPT-6 Astra dans le Codex, cela a pris environ une semaine : je fixais un objectif avant de dormir et je revoyais les résultats le matin. »
—Frank Hidalgo, PhD, CTO de StackAI chez Asana

Coût du modèle inférieur à 0,50 $ par exécution

Pour le modèle B, l’optimisation a réduit le coût estimé du modèle de au moins 36,21 dollars (certaines exécutions originales ont atteint la limite d’étapes avant d’être terminées) à 1,24 dollars par exécution, soit une réduction de 29 fois. Le workflow optimisé sur GPT‑6.1 Sol est encore 2,6 fois moins cher, à 0,47 dollar. Chaque exécution dans le workflow optimisé a accompli la tâche et a fourni la réponse correcte.

Moyens de 3 runs. ≥ : la base inclut les runs couverts, donc leur moyenne représente une limite inférieure.

Les deux plis droits sont comparés à celui du modèle B optimisé. Le modèle B a été testé en phase 1, le modèle C et Sol 6.1 en phase 2 de la même étude (ligne pointillée).

Sur GPT‑6.1 Sol seul, avec le budget plus important pour l’histoire des données, la nouvelle politique de stockage en mémoire et d’ captures d’écran a réduit les coûts de 4 fois, passant de 1,97 $ à 0,47 $ par exécution. Chaque appel était environ 3 fois moins cher, car 89 % des données d’entrée provenaient du cache, soit 5 % du prix sans stockage en mémoire. Les exécutions sont également devenues plus rapides : au moins 22,5 minutes avec la configuration originale sur le modèle B, environ quatre minutes avec le workflow optimisé sur GPT‑6.1 Sol.

Moyenne de 3 runs, écart-type des whiskers. ≥ : la moyenne inclut un run limité ou inachevé, donc la valeur réelle est au moins aussi grande que celle-ci.

Les bars utilisent le thème bleu. Examinez les effets de mémorisation par rapport au bar à budget plus élevé de 480k.

Les marqueurs et les écarts-types sont des reconstructions approximatives basées sur l’image source ; les valeurs de déplacement et les écarts-types standard sous-jacents n’étaient pas disponibles.

Moyenne de 3 runs, écart-type des whiskers. ≥ : la moyenne inclut un run limité ou inachevé, donc la valeur réelle est au moins aussi grande que celle-ci.

Les bars utilisent le thème bleu. Examinez les effets de mémorisation par rapport au bar à budget plus élevé de 480k.

Les marqueurs et les écarts-types sont des reconstructions approximatives basées sur l’image source ; les valeurs de déplacement et les écarts-types standard sous-jacents n’étaient pas disponibles.

L’enquête a également montré comment la gestion de l’histoire affectait le fait que l’agent produisait une réponse ou non. En donnant à GPT‑6.1 Sol plus de place pour conserver son historique de navigation, le nombre de tentatives qui donnaient une réponse est passé de trois sur 18 avec un budget d’histoire plus faible à tous 18 avec un budget plus important, chaque fois avec la bonne réponse. Pour Hidalgo, la valeur commerciale réside dans le fait de permettre aux clients d’accéder à des modèles plus rapides et plus performants, tout en maintenant les coûts d’exploitation durables.

« Le coût a limité les modèles que nous pouvions proposer aux clients pour ces tâches. En rendant l’agent plus efficace, nous pouvons offrir aux clients un modèle meilleur et plus rapide, tout en réduisant nos coûts d’exploitation. »
—Frank Hidalgo, PhD, CTO de StackAI chez Asana

Échelle des expériences et tests de produit

Asana a publié les modifications apportées à la navigation dans le navigateur de StackAI, et développe des outils permettant de répéter facilement des expériences similaires. Avec le temps, l’équipe prévoit d’intégrer ces tests dans les évaluations de la plateforme, afin que les clients et les équipes internes puissent comparer le coût, le temps de traitement et la qualité des réponses lors de la configuration de leurs agents.

“La vitesse de livraison n’est plus le goulot d’étranglement ; c’est l’attention humaine qui en est un. Nous sommes proches d’un monde où chaque ingénieur est un responsable marketing dirigeant une flotte d’agents.”
—Frank Hidalgo, PhD, CTO de StackAI chez Asana

Asana utilise maintenant GPT‑6 Astra dans Codex pour tester les fonctionnalités du produit avant son lancement : Astra navigue la plateforme, teste différentes entrées et signalise les bugs aux réviseurs de qualité humains. Hidalgo considère cela comme la base d’un nouveau cycle de vie de développement logiciel, avec de nombreuses sessions d’agents cloud qui testent les fonctionnalités en parallèle.

Le document complet est disponible sur lesAsana⁠>(ouvre dans une nouvelle fenêtre) etStackAI⁠>(ouvre dans une nouvelle fenêtre) blogs.

Rejoignez l’ère nouvelle du travail

Plus de 1 million d'entreprises dans le monde obtiennent des résultats significatifs avec OpenAI.Contacter les ventes
Source originale

OpenAI Sitemap

À propos du contenu

La publication originale et les droits appartiennent à la source.

Traduction automatique · Consultez l’original