OpenAI Sitemap수정일

Asana, GPT-6.1 Sol로 브라우저 테스트에서 모델 비용 76배 절감

Codex에서 GPT-6 Astra를 활용해 Asana는 브라우저 에이전트를 테스트에서 76배 저렴하고 5배 빠르게 만들어 고객에게 더 강력한 모델을 제공했습니다.

이미지 출처 · OpenAI Sitemap

Codex에서 GPT‑6 Astra로 실험을 진행하며 Asana는 GPT‑6.1 Sol에서 브라우저 에이전트의 워크플로를 최적화해 76배 저렴하고 5배 빠르게 실행되도록 만들었습니다.

Asana는 다음을 통해 고객이 비즈니스 애플리케이션 전반에서 업무를 자동화하도록 지원합니다 StackAI⁠(새 창에서 열림), Asana가 인수한⁠(새 창에서 열림)플랫폼입니다. StackAI를 사용하면 고객은 코드를 작성하지 않고도 웹사이트를 탐색하고, 양식을 작성하고, 정보를 수집하는 워크플로를 구축할 수 있습니다. Asana의 규모에서는 이러한 워크플로의 사소한 비효율성도 누적됩니다.

Asana의 StackAI CTO인 Frank Hidalgo, PhD는 브라우저 에이전트를 더 빠르고 저렴하게 실행할 방법을 찾고자 했습니다. 그는 Codex의 GPT‑6 Astra에게 에이전트를 조사하고, 개선 사항을 테스트하고, 결과를 비교하도록 지시했습니다. 수작업으로는 한두 달이 걸렸을 것으로 추정하는 작업이 약 일주일 만에 완료되었습니다.

Asana의 144회 실행 연구⁠(새 창에서 열림) 에서는 GPT‑6.1 Sol과 여기서 모델 A, B, C로 칭하는 세 가지 다른 프론티어 모델을 테스트했습니다. GPT‑6.1 Sol에서 도출된 최적화된 워크플로는 실행당 평균 추정 모델 비용 $0.47, 약 4분이 소요되어, 모델 B의 기존 프로덕션 설정보다 76배 저렴하고 5배 빨랐습니다.

“이것이 실제로 인간과 에이전트 팀이 함께하는 모습입니다. 엔지니어가 방향을 설정했고, GPT-6 Astra가 실험을 실행했으며, 그 결과가 Command를 거쳐 프로덕션에 반영되었습니다. 이는 Asana가 인간과 에이전트 팀을 어떻게 현실로 만드는지 보여줍니다.”
—Arnab Bose, Asana CPO

GPT‑6 Astra로 브라우저 에이전트의 비효율성 파악

신속하게 진행하기 위해 Hidalgo는 Codex의 GPT‑6 Astra를 사용해 코드베이스를 분석하고 에이전트가 각 모델 요청을 어떻게 구성하는지 설명받는 것부터 시작했습니다. GPT‑6 Astra는 에이전트가 고정된 지시문과 도구 정의는 캐싱하지만 수집한 페이지 텍스트와 스크린샷의 계속 늘어나는 기록은 캐싱하지 않아, 모든 요청이 해당 기록을 전액 비용으로 다시 전송한다는 사실을 발견했습니다.

또한 에이전트는 거의 모든 단계에서 오래된 스크린샷을 버리고 텍스트를 잘라냈습니다. 매번 편집할 때마다 기록이 변경되므로 기록만 캐싱하는 것은 도움이 되지 않았고, 해당 정보를 잃으면 에이전트가 이미 읽은 페이지를 다시 방문해야 할 수 있었습니다.

GPT‑6 Astra로 추정 2개월의 연구가 1주일로 단축

Hidalgo는 GPT‑6 Astra가 제안한 수정 사항을 검토하고 테스트할 세 가지를 선택했습니다:

  • 에이전트의 브라우징 기록으로 캐싱 확장

  • 보관할 수 있는 텍스트 양 증가

  • 매 단계가 아닌 일괄적으로 스크린샷 제거

GPT‑6 Astra는 어떤 변수가 중요한지 파악하기 위한 빠른 테스트로 시작했습니다. 코드가 통제된 실험을 위해 설계되지 않았기 때문에, 하나의 프론트엔드와 백엔드가 각자 자체 설정을 갖는 여러 워크플로를 병렬로 지원하도록 코드를 리팩터링했습니다.

Astra는 전체 연구를 수행했습니다: 120,000자 및 480,000자의 기록 예산과 6가지 캐싱 및 스크린샷 정책을 각 네 모델에서 세 번씩 테스트했습니다(아래 표 참조). 가장 우수한 성과를 낸 정책은 스크린샷이 20개까지 쌓이도록 허용한 후 가장 최근 것 하나만 남기고 잘라내는 것이었습니다. 이는 제거 사이의 더 긴 기간 동안 이전 기록을 변경되지 않은 상태로 유지했습니다. 더 큰 기록 예산과 결합되어 이것이 최적화된 워크플로가 되었습니다. 각 구성은 동일한 작업, 즉 공개 데모 카탈로그에서 32권의 각 도서에 대해 6개 필드를 수집하는 작업을 수행했으며, 이는 일부 Asana 고객이 StackAI에서 실행하는 작업을 대표합니다.

모델

설명

가격

모델 A

다른 프론티어 연구소의 더 작고 저렴한 모델, 2025년 가을 출시

GPT‑6.1 Sol 가격의 절반

Model B

Model A와 같은 연구실에서 나온, 원래 생산에 사용되던 모델로, 2026년 여름에 공개됨

GPT‑6.1 Sol과 동일한 가격

Model C

Model B의 업데이트 버전으로, 2026년 가을에 공개됨

GPT‑6.1 Sol과 동일한 가격

GPT‑6.1 Sol

OpenAI의 모델

GPT‑6 Astra가 워크플로를 실행하고 요청, 사용 기록 및 출력을 검토했으며, 별도의 모델 세션들이 이 작업을 검토하였습니다. 모든 세션의 요청, 데이터 흔적 및 결과는 Command⁠(새 창에서 열림), Asana의 소프트웨어 전달 플랫폼에 기록되어 팀이 연구 이후 전체 내용을 검토할 수 있었습니다. Command에서 발견된 내용은 티켓으로, 이어서 풀 리퀘스트로 전환되었고, 변경 사항은 프로덕션에 반영되었습니다.

“이 작업을 손으로 했다면 한두 달이 걸렸을 것입니다. Codex의 GPT-6 Astra를 사용하니 약 일주일이 걸렸습니다. 자기 전에 /goal을 설정하고 아침에 결과를 검토했습니다.”
—Frank Hidalgo, PhD, Asana StackAI CTO

실행당 모델 비용을 $0.50 미만으로 낮추기

Model B의 경우, 최적화를 통해 추정 모델 비용이 실행당 최소 $36.21(일부 원래 실행은 완료 전에 단계 한도에 도달했습니다)에서 $1.24로 29배 감소했습니다. GPT‑6.1 Sol에서의 최적화된 워크플로는 추가로 2.6배 저렴한 $0.47였습니다. 최적화된 워크플로의 모든 실행이 작업을 완료하고 정답을 반환했습니다.

3회 실행의 평균. ≥: 기준선에는 한도에 도달한 실행이 포함되어 있으므로 그 평균은 하한입니다.

오른쪽 두 개의 폴드는 Model B 최적화와 비교됩니다. Model B는 1단계에서, Model C와 Sol 6.1은 동일 연구의 2단계(점선)에서 실행되었습니다.

GPT‑6.1 Sol만 사용하고 더 큰 히스토리 예산을 적용했을 때, 새로운 캐싱 및 스크린샷 정책은 비용을 4배, 즉 실행당 $1.97에서 $0.47로 낮췄습니다. 입력의 89%가 미캐시 가격의 5%로 캐시에서 제공되었기 때문에 각 호출은 약 3배 저렴했습니다. 실행 속도도 빨라졌습니다: Model B의 원래 설정에서는 최소 22.5분이 걸렸지만, GPT‑6.1 Sol의 최적화된 워크플로에서는 약 4분이 걸렸습니다.

3회 실행의 평균, SD 오차 막대. ≥: 평균에 한도에 도달했거나 완료되지 않은 실행이 포함되어 있으므로 실제 값은 최소한 이만큼 큽니다.

막대는 파란색 테마를 사용합니다. 캐싱 효과는 480k 더 큰 예산 막대와 비교하여 읽으십시오.

실행 마커와 SD 오차 막대는 원본 이미지에서 근사적으로 재구성된 것입니다. 기반이 되는 실행 값과 표준편차는 제공되지 않았습니다.

3회 실행의 평균, SD 오차 막대. ≥: 평균에 한도에 도달했거나 완료되지 않은 실행이 포함되어 있으므로 실제 값은 최소한 이만큼 큽니다.

막대는 파란색 테마를 사용합니다. 캐싱 효과는 480k 더 큰 예산 막대와 비교하여 읽으십시오.

실행 마커와 SD 오차 막대는 원본 이미지에서 근사적으로 재구성된 것입니다. 기반이 되는 실행 값과 표준편차는 제공되지 않았습니다.

이 조사는 또한 히스토리 관리가 에이전트가 답변을 생성하는지 여부에 어떤 영향을 미치는지 보여주었습니다. GPT‑6.1 Sol에 브라우징 히스토리를 더 많이 유지할 여유를 주자, 작은 히스토리 예산에서는 18회 중 3회만 답변을 생성하던 것이 더 큰 예산에서는 18회 모두 정답과 함께 답변을 생성하는 것으로 늘어났습니다. Hidalgo에게 비즈니스 가치란 운영 비용을 지속 가능하게 유지하면서 고객에게 더 빠르고 더 강력한 모델에 대한 접근을 제공하는 것입니다.

“비용 때문에 이러한 워크로드에 고객에게 어떤 모델을 제공할 수 있는지가 제한되었습니다. 에이전트를 더 효율적으로 만들어 운영 비용을 낮추면서 고객에게 더 좋고 더 빠른 모델을 제공할 수 있습니다.”
—Frank Hidalgo, PhD, Asana StackAI CTO

실험 및 제품 테스트 확장

Asana는 브라우저 탐색 관련 변경 사항을 StackAI에 출시했으며, 유사한 실험을 더 쉽게 반복할 수 있게 해주는 도구를 개발 중입니다. 시간이 지나면 팀은 이 테스트를 플랫폼의 평가에 통합하여 고객과 내부 팀이 에이전트를 구성할 때 비용, 실행 시간 및 답변 품질을 비교할 수 있게 할 계획입니다.

“이제 병목은 출시 속도가 아니라 사람의 주의력입니다. 모든 엔지니어가 에이전트 함대를 이끄는 PM이 되는 세상에 우리는 가까이 다가가고 있습니다.”
—Frank Hidalgo, PhD, Asana StackAI CTO

Asana는 현재 Codex에서 GPT‑6 Astra를 사용하여 출시 전에 제품 기능을 테스트하고 있습니다. Astra는 플랫폼을 탐색하고 다양한 입력을 시도하며 사람이 하는 QA 검토자를 위해 버그를 보고합니다. Hidalgo는 이것을 많은 클라우드 에이전트 세션이 병렬로 기능을 테스트하는 새로운 소프트웨어 개발 수명 주기의 기반으로 봅니다.

전체 연구는 다음에서 확인할 수 있습니다. Asana⁠(새 창에서 열림) 및 StackAI⁠(새 창에서 열림) blogs.

일의 새로운 시대에 동참하세요

전 세계 100만 개 이상의 기업이 OpenAI와 함께 의미 있는 성과를 거두고 있습니다.영업팀에 문의
원문 출처

OpenAI Sitemap

내용 안내

원문 발행 및 권리는 출처에 있습니다.

기계 번역 · 원문을 참고하세요