우리가 GPT‑6 Astra를 소개했을 때, 문서 준비부터 웹사이트 테스트까지 전문 업무를 위해 컴퓨터를 사용하는 모델들의 발전 수준을 보여주었습니다. 다음 목표는 전문 소프트웨어를 사용하여 복잡한 비즈니스 문제를 해결하는 데 있어 에이전트를 더 유능하고 효율적으로 만드는 것입니다. 우리는 기업의 비즈니스 규칙을 이해하고, 다단계 워크플로우를 실행하며, 작업이 원래 요구사항을 충족하는지 검증하도록 모델을 학습시키는 방법을 연구하고 있습니다.
이 연구를 가속화하기 위해, 우리는 이러한 워크플로우를 가장 잘 이해하는 소수의 소프트웨어 회사들과 직접 파트너십을 맺고 있습니다. 함께 도전적이고 높은 가치를 지닌 작업들을 파악하고, 이를 모델을 학습시키고 평가하기 위한 연구 과제로 전환함으로써 궁극적으로 실제 비즈니스 응용 분야에서 우리 모델을 더 유능하고 유용하게 만들고 있습니다.
첫 번째 파트너는 AI 계약 분야의 선도 기업인 Ironclad입니다. Ironclad 팀과 긴밀히 협력하여 에이전트가 계약서, 승인 절차, 재사용 가능한 법적 조항을 구성하는 작업을 개발했고, 이러한 복잡한 워크플로우에서의 진전을 입증했습니다. Ironclad의 전문성은 성공의 기준을 정의하고 실제 고객의 요구를 프런티어 모델 개발에 직접 반영하는 데 중요한 역할을 했습니다. 그들의 파트너십에 감사드리며, 함께 이룬 성과를 공유하게 되어 기쁩니다.
GPT‑6 Astra는 Ironclad 작업으로 학습된 우리의 첫 번째 프런티어 모델입니다. 연구 평가에서 이 모델의 평균 점수는 GPT‑5.6 Sol보다 32% 높았고, 시도당 예상 시간은 48% 낮았습니다.1
계약 워크플로우를 학습 작업으로 전환하기
소프트웨어 구매 프로세스를 설정하는 법무 운영 팀을 생각해 보세요. 재무팀은 일정 금액 이상의 구매를 승인해야 할 수 있고, 보안팀은 특정 요청을 검토해야 할 수 있으며, 법무팀은 비표준 조항을 검토해야 할 수 있습니다. 프로세스를 설정하는 사람은 그 짧은 목록을 인테이크 양식, 문서 템플릿, 승인 규칙, 최종 계약 기록으로 전환해야 합니다.
같은 작업을 수행하는 AI 에이전트는 소프트웨어를 사용하는 동안 이러한 요구사항을 계속 염두에 두어야 합니다. 예를 들어, 지출 한도를 초과하는 재무 승인을 구성하고, 한도를 초과하거나 미달하는 요청이 올바른 경로를 따르는지 확인해야 합니다. 개별 단계를 올바르게 수행하는 것만으로는 충분하지 않습니다. 완성된 프로세스는 설계 의도된 상황 전반에서 작동해야 합니다.
Ironclad 직원들과 OpenAI에서 Ironclad를 사용하는 사람들이 우리 연구자들이 법무, 상업, 조달 업무 전반에 걸쳐 11개의 작업을 파악하도록 도왔습니다. 여기에는 비밀유지계약서 설정, 조달 승인 프로세스 생성, 요청자가 선택한 관할권을 반영하도록 재사용 가능한 법적 조항 업데이트와 같은 작업이 포함되었습니다. 이 작업은 숙련된 사용자가 작업당 평균 약 30~40분 정도 걸릴 것으로 추정합니다.
우리는 각 작업의 복잡도에 따라 8개에서 50개의 기준으로 작업을 평가했습니다. 이를 통해 모델이 어느 부분을 올바르게 수행했고 어디에서 미달했는지 확인할 수 있었습니다. Ironclad는 또한 모델이 이러한 작업을 연습할 수 있는 자사 제품의 호스팅 소프트웨어 환경을 제공했습니다. 우리 연구자들은 대표적인 워크플로우를 중심으로2 합성 학습 작업을 개발하고 강화 학습을 사용하여 모델이 연습과 피드백을 통해 개선하도록 도왔습니다. 이 조합—해당 업무를 아는 사람들과 함께 선정한 작업, 상세한 기준, 모델이 연습할 수 있는 환경—은 고객에게 가장 중요한 실제 업무에서 개선이 이루어지도록 보장합니다.
Astra의 성과
우리는 Astra에는 Max reasoning, Sol에는 High reasoning을 사용하여, 즉 각 모델이 가장 높은 점수를 낸 설정으로 Astra와 GPT‑5.6 Sol을 비교했습니다. 11개 연구 작업 전반에서 Astra의 평균 점수는 55.0%였고 GPT‑5.6 Sol은 41.6%였으며, 시도당 예상 평균 시간은 Sol의 37.0분에서 Astra의 19.2분으로 감소했습니다.3 Astra 개발에 사용된 내부 모델은 이러한 작업에서 더욱 높은 63.7%를 기록했으며, 우리는 이러한 추가 개선을 향후 모델에 반영하는 것을 목표로 합니다.
지표 | GPT‑5.6 Sol | GPT‑6 Astra |
평균 루브릭 점수 | 41.6% | 55.0% |
시도당 예상 평균 시간 | 37.0분 | 19.2분 |
Astra는 시도당 더 적은 시뮬레이션 시간으로 더 많은 작업 요구사항을 충족했습니다. 아래 두 클립은 모델들이 동일한 연구 작업을 어떻게 처리했는지 보여줍니다. Astra(첫 번째)는 예상 20분 만에 작업 기준의 약 94%를 충족했고, GPT‑5.6 Sol(두 번째)은 예상 32분 만에 약 85%를 충족했습니다.
GPT‑6 Astra 는 예상 20분 만에 작업 기준의 약 94%를 충족했습니다.
GPT‑5.6 Sol 은 예상 32분 만에 작업 기준의 약 85%를 충족했습니다.
이번 협업이 Ironclad에 의미하는 바
이번 작업에서 Ironclad가 맡은 역할은 고객들이 잘 아는 과제를 반영합니다. 계약 프로세스는 비즈니스가 의존하는 규칙을 지키면서도 예외를 처리할 수 있어야 합니다. 에이전트가 작업 도중 그러한 규칙 중 하나를 놓치게 되면, 소프트웨어 회사가 에이전트에게 안심하고 맡길 수 있는 일의 범위가 제한됩니다. 이는 에이전트가 복잡한 계약 업무를 더 잘 수행하게 되더라도 인간의 감독이 여전히 중요한 이유, 그리고 완전한 계약 플랫폼이 여전히 필수적인 이유를 잘 보여줍니다. 저희 연구진과의 협업을 통해 Ironclad는 이러한 문제들을 기반 모델 개발 과정에 반영하고, 함께 연구할 수 있게 됩니다.
모델이 더 강력해짐에 따라 Ironclad는 자사의 더 많은 제품에 이를 활용할 기회를 얻고 있습니다. 법무 및 비즈니스 팀에게 있어 이는 AI가 복잡한 계약 업무에 필요한 노력을 더 많이 담당하되, 해당 팀이 의존하는 통제 기능은 그대로 유지하는 것을 의미할 수 있습니다.
“AI가 계약의 복잡한 영역에서 진정으로 유용하려면 개별 작업을 수행하는 것 이상을 해야 합니다. 에이전트는 팀이 의존하는 통제 기능을 유지하면서 비즈니스 워크플로가 어떻게 연결되는지를 포함한 전체 계약 수명 주기를 이해해야 합니다. OpenAI와의 협력은 이러한 실제 과제를 연구 과정에 도입하고 기술을 앞으로 나아가게 하는 데 도움을 줍니다.”
복잡한 전문 업무를 위한 AI 발전에 함께 참여하세요
저희는 오늘날의 에이전트가 아직 안정적으로 완수하지 못하는 중요한 전문 업무에 대해 저희 연구 및 엔지니어링 팀과 직접 협력할 소수의 소프트웨어 회사를 모집하고 있습니다. 귀하의 팀에 그러한 업무가 있다면, 구체적인 사례를 보내주시기 바랍니다. 즉, 에이전트에게 요청하려는 작업이 무엇인지, 실패하는 지점에 대한 증거, 그리고 성공적인 결과를 어떻게 판단할 것인지입니다. 파트너는 해당 업무를 깊이 아는 인력, 테스트를 위한 보안 환경, 그리고 연구에 안전하게 사용할 수 있는 데이터를 확보할 수 있어야 합니다. 이를 통해 저희는 실패 원인을 조사하고 모델이 개선되는지 측정할 출발점을 얻게 됩니다.
귀하의 팀이 이에 해당한다면, 연구 협력 신청을 통해 탐색해 보세요.
