GPT‑6 Astra가 Codex에서 실험을 진행하는 동안, Asana는 GPT‑6.1 Sol을 이용하여 자바라 에이전트의 워크플로우를 최적화했으며, 비용은 76배 저렴하고 속도는 5배 빨라졌습니다.
Asana는 StackAI(새 창에서 열림)라는 플랫폼을 통해 고객이 비즈니스 애플리케이션 전반에서 작업을 자동화할 수 있도록 도와줍니다. 이 플랫폼은 Asana가 인수(새 창에서 열림)한 것입니다. StackAI를 사용하면 고객은 코드를 작성하지 않고 웹사이트를 탐색하거나 양식을 작성하거나 정보를 수집하는 워크플로우를 구축할 수 있습니다. Asana의 규모에서는 이러한 워크플로우에서 발생하는 작은 비효율이 누적됩니다.
Asana의 StackAI CTO인 프랭크 히달고 박사는 브라우저 에이전트를 더 빠르고 저비용으로 실행할 수 있도록 만들기로 했습니다. 그는 Codex에서 GPT‑6 Astra를 활용하여 에이전트를 조사하고 개선 사항을 테스트하며 결과를 비교했습니다. 손으로 해야 했던 작업이 한두 달이 걸리던 것을 약 일주일 만에 완료했습니다.
Asana의 144번 실행 연구(새 창에서 열림)는 GPT‑6.1 Sol과 다른 세 가지 최첨단 모델, 즉 모델 A, B, C를 테스트했습니다. GPT‑6.1 Sol에서 도출된 최적화된 워크플로우는 예상된 모델 비용이 $0.47이며, 한 실행에 약 4분이 걸렸습니다. 이는 모델 B의 원래 생산 설정보다 76배 저렴하고 5배 빠른 수치입니다.
“이것이 인간 팀과 에이전트 팀의 실제 모습입니다. 엔지니어가 방향을 설정하고, GPT-6 Astra가 실험을 진행하며, 결과는 Command을 통해 생산 환경으로 전달됩니다. 이를 통해 Asana가 인간 팀과 에이전트 팀을 어떻게 실제로 운용하는지 보여줍니다.”—아나브 보세, 아사나의 CPO
GPT-6 Astra를 이용하여 브라우저 에이전트의 비효율성을 파악하기
빠르게 움직이기 위해, 히달고는 코덱스에서 GPT-6 Astra를 사용하여 코드베이스를 매핑하고 에이전트가 각 모델 요청을 어떻게 구축하는지 설명했습니다. GPT-6 Astra는 에이전트가 고정된 지시와 도구 정의를 캐시해 두었지만, 수집한 페이지 텍스트와 스크린샷의 증가된 기록은 저장하지 않았다는 것을 발견했기 때문에, 모든 요청에 그 기록을 전체 비용으로 다시 제공해야 했습니다.
에이전트는 또한 오래된 스크린샷을 버리고 거의 모든 단계에서 텍스트를 잘라냈습니다. 각 편집은 역사적 기록을 바꾸었기 때문에, 그 역사적 기록만 캐시하는 것만으로는 도움이 되지 않았으며, 그 사실들을 잃어버리면 에이전트가 이미 읽은 페이지를 다시 살펴보아야 할 수도 있습니다.
추정된 2개월의 연구 기간이 GPT‑6 Astra를 사용한 1주일로 줄어들었습니다.
히달고는 GPT-6 아스트라가 제안한 수정 사항을 검토한 후 세 가지를 테스트하기로 선택했다.
에이전트의 브라우징 기록까지 캐싱을 확장하기
저장할 수 있는 텍스트의 양을 늘리는 것
단계별로가 아닌 여러 개를 한 번에 스크린샷을 제거하는 방법
GPT‑6 Astra는 어떤 변수가 중요한지 확인하기 위한 빠른 테스트로 시작되었습니다. 코드가 통제된 실험을 위해 설계되지 않았기 때문에, 코드를 리팩토링하여 하나의 프론트엔드와 백엔드가 각각 다른 설정으로 많은 워크플로우를 동시에 지원할 수 있도록 했습니다.
Astra는 전체 연구를 수행했습니다: 120,000자와 480,000자로 구성된 역사적 예산, 그리고 6가지 캐싱 및 스크린샷 정책을 각각 4가지 모델에서 세 번씩 테스트했습니다(아래 표 참조). 가장 우수한 정책은 스크린샷이 20개까지 축적된 후 가장 최신 정책으로 변경되도록 했습니다. 이로 인해 삭제 사이에 이전의 역사적 데이터가 오랫동안 변하지 않게 되었습니다. 더 큰 역사적 예산과 결합되어 최적화된 워크플로우가 되었습니다. 각 설정은 동일한 작업을 수행했습니다: StackAI에서 일부 Asana 고객이 사용하는 것과 유사한 공개 데모 카탈로그에서 32권의 책 각각에 대해 6개의 필드를 수집하는 것이었습니다.
모델 | 설명 | 가격 |
|---|---|---|
모델 A | 2025년 가을에 출시된 다른 첨단 연구소의 더 작고 저렴한 모델 | GPT-6.1 Sol의 절반 가격 |
모델 B | 제품화에 사용된 모델은 모델 A과 같은 연구실에서 제작되었으며, 2026년 여름에 출시될 예정입니다. | GPT‑6.1 Sol과 동일한 가격입니다. |
모델 C | 2026년 가을에 출시된 모델 B의 업데이트 버전 | GPT‑6.1 Sol과 동일한 가격입니다. |
GPT‑6.1 Sol | OpenAI의 모델 |
GPT‑6 Astra는 워크플로우를 실행하고 요청, 사용 기록 및 결과물을 검토했으며, 별도의 모델 세션도 작업을 확인했습니다. 각 세션의 요청, 데이터 추적 및 결과는 Command(새 창에서 열림)에 기록되었으며, 이는 Asana의 소프트웨어 배포 플랫폼입니다. 따라서 팀은 이후 전체 연구 결과를 검토할 수 있었습니다. Command에서 발견된 내용은 티켓으로 변환된 후 pull request로 전달되었고, 그 변경 사항은 프로덕션에 적용되었습니다.
“이 작업을 수동으로 하려면 한두 달이 걸렸을 것입니다. Codex에 있는 GPT-6 Astra를 사용하면 약 일주일이면 충분했습니다. 잠자리에 들기 전에 /goal을 설정하고 아침에 그 결과를 검토했습니다.”—프랭크 히다고, PhD, Asana의 StackAI CTO
실행당 모델 비용을 $0.50 이하로 낮추기
모델 B의 경우 최적화를 통해 예상 모델 비용이 최소 $36.21에서 한 회 실행당 $1.24로 감소했으며, 29배나 줄었습니다. GPT‑6.1 Sol에서 최적화된 워크플로우는 $0.47로 2.6배 더 저렴했으며, 모든 실행에서는 작업을 완료하고 올바른 답을 반환했습니다.
3번의 경기 수를 나타내는 방법. ≥: 기준값에는 한도가 적용된 경기 수가 포함되므로, 그 평균은 하한선이 됩니다.
두 개의 오른쪽 접기는 모델 B가 최적화된 것과 비교됩니다. 모델 B는 같은 연구의 1단계에서 실험되었고, 모델 C와 Sol 6.1은 2단계에서 실험되었습니다(점선).
GPT‑6.1 Sol 단독으로, 더 큰 역사 예산과 새로운 캐싱 및 스크린샷 정책 덕분에 비용이 4배 감소했으며, 각 실행당 비용은 $1.97에서 $0.47로 줄었습니다. 각 호출의 비용도 약 3배 저렴해졌는데, 이는 입력의 89%가 캐시에서 나왔기 때문이며, 캐시 사용 시 비용은 캐시를 사용하지 않는 경우의 5%에 불과합니다. 실행 시간도 더 빨라졌습니다: 모델 B의 원래 설정에서는 최소 22.5분이 걸렸지만, GPT‑6.1 Sol의 최적화된 워크플로우에서는 약 4분이 걸립니다.
3회 실행의 평균, 표준편차 위스커스. ≥: 평균은 마감되지 않거나 불완전한 실행을 포함하므로, 실제 값은 이보다 적어도 크다.
바들은 파란색 테마를 사용합니다. 480k 더 큰 예산의 바에 대한 캐싱 효과를 확인하세요.
실행 마커와 SD 휘슬러는 원본 이미지로부터 추정된 것일 뿐이며, 근간의 실행 값과 표준편차는 구할 수 없었습니다.
3회 실행의 평균, 표준편차 위스커스. ≥: 평균은 마감되지 않거나 불완전한 실행을 포함하므로, 실제 값은 이보다 적어도 크다.
바들은 파란색 테마를 사용합니다. 480k 더 큰 예산의 바에 대한 캐싱 효과를 확인하세요.
실행 마커와 SD 휘슬러는 원본 이미지로부터 추정된 것일 뿐이며, 근간의 실행 값과 표준편차는 구할 수 없었습니다.
조사 결과, 역사 관리가 에이전트가 답을 생성하는지에 미치는 영향도 확인되었습니다. GPT-6.1 Sol에 브라우징 기록을 저장할 수 있는 공간을 더 주면, 답을 생성한 실행 횟수가 18회 중 3회에서 더 큰 예산으로 18회로 증가했으며, 각각 정확한 답이 나왔습니다. 히달고에게는 고객들이 더 빠르고 더 강력한 모델에 접근할 수 있도록 하면서도 운영 비용을 지속 가능하게 유지하는 것이 비즈니스 가치입니다.
이 작업 부하에 대해 고객에게 제공할 수 있는 모델을 제한하는 데 사용된 비용입니다. 에이전트를 더 효율적으로 만드는 것으로, 고객에게 더 나은 속도의 모델을 제공하면서 운영 비용을 줄일 수 있습니다.—프랭크 히다고, PhD, Asana의 StackAI CTO
스케일링 실험 및 제품 테스트
Asana는 StackAI의 브라우저 내비게이션 변경 사항을 공개했으며, 유사한 실험을 더 쉽게 반복할 수 있도록 하는 도구를 개발하고 있습니다. 시간이 지나면 팀은 이 테스트를 플랫폼의 평가에 통합하여, 고객과 내부 팀이 에이전트를 설정할 때 비용, 실행 시간, 답변 품질을 비교할 수 있도록 할 계획입니다.
“운송 속도가 더 이상 병목 현상이 아닙니다. 인간의 주의력이죠. 모든 엔지니어가 에이전트들을 이끄는 PM이 되는 세상에 가까워졌습니다.”—프랭크 히다고, PhD, Asana의 StackAI CTO
Asana는 현재 Codex에서 GPT‑6 Astra를 사용하여 출시 전 제품 기능을 테스트하고 있습니다: Astra는 플랫폼을 운용하고 다양한 입력값을 시도하며 인간 QA 리뷰어에게 버그를 보고합니다. Hidalgo는 이를 새로운 소프트웨어 개발 라이프사이클의 기반으로 보고 있으며, 많은 클라우드 에이전트 세션을 통해 기능을 동시에 테스트하고 있습니다.
전체 연구 결과는 Asana(새 창에서 열림)과 StackAI(새 창에서 열림) 블로그에서 확인할 수 있습니다.
