OpenAI Sitemap수정일

Ironclad와 함께 컴퓨터 사용의 발전

OpenAI와 Ironclad가 복잡한 계약 워크플로우에서 AI 에이전트를 학습·평가하여 전문 업무를 위한 컴퓨터 사용을 발전시키는 방법을 알아보세요.

이미지 출처 · OpenAI Sitemap

우리가 GPT‑6 Astra를 소개했을 때, 문서 작성부터 웹사이트 테스트까지 전문 업무를 위해 컴퓨터를 사용하는 데 있어 우리 모델이 얼마나 발전했는지 보여주었습니다. 다음 목표는 에이전트가 전문 소프트웨어를 사용하여 복잡한 비즈니스 문제를 해결하는 데 더 유능하고 효율적으로 만드는 것입니다. 우리는 회사의 비즈니스 규칙을 이해하고, 다단계 워크플로우를 실행하며, 자신의 작업이 원래 요구사항을 충족하는지 검증하도록 모델을 학습시키는 방법을 연구하고 있습니다.

이 연구를 가속화하기 위해, 우리는 이러한 워크플로우를 가장 잘 이해하는 소수의 소프트웨어 회사들과 직접 협력하고 있습니다. 함께 도전적이고 높은 가치를 지닌 작업을 파악하여 이를 모델을 학습하고 평가하기 위한 연구 과제로 전환함으로써, 궁극적으로 우리 모델이 실제 비즈니스 응용 분야에서 더 유능하고 유용해지도록 만들고 있습니다.

우리의 첫 번째 파트너는 AI 계약 분야의 선도 기업인 Ironclad입니다. Ironclad 팀과 긴밀히 협력하여 에이전트가 계약서, 승인 절차, 재사용 가능한 법률 조항을 구성하는 과제를 개발했으며, 이러한 복잡한 워크플로우에서의 진전을 보여주었습니다. Ironclad의 전문성은 성공의 기준을 정의하고 실제 고객의 요구를 프런티어 모델 개발에 직접 반영하는 데 중요한 역할을 했습니다. 그들의 협력에 감사드리며, 함께 이룬 성과를 공유하게 되어 기쁩니다.

GPT‑6 Astra는 Ironclad 과제로 학습된 우리의 첫 번째 프런티어 모델입니다. 우리의 연구 평가에서 평균 점수가 GPT‑5.6 Sol보다 32% 높았고, 시도당 예상 시간은 48% 낮았습니다.1

계약 워크플로우를 학습 과제로 전환하기

소프트웨어 구매 프로세스를 설정하는 법률 운영 팀을 생각해 봅시다. 재무팀은 일정 금액 이상의 구매를 승인해야 할 수 있고, 보안팀은 특정 요청을 검토해야 할 수 있으며, 법무팀은 비표준 조항을 검토해야 할 수 있습니다. 프로세스를 설정하는 사람은 그 짧은 목록을 인테이크 양식, 문서 템플릿, 승인 규칙, 그리고 최종 계약 기록으로 전환해야 합니다.

같은 작업을 수행하는 AI 에이전트는 소프트웨어를 진행하는 동안 이러한 요구사항을 계속 염두에 두어야 합니다. 예를 들어, 지출 한도를 초과하는 재무 승인을 구성하고, 한도 이상과 이하의 요청이 올바른 경로를 따르는지 확인해야 합니다. 개별 단계를 올바르게 수행하는 것만으로는 충분하지 않습니다. 완성된 프로세스는 그것이 처리하도록 설계된 모든 상황에서 작동해야 합니다.

Ironclad 직원들과 OpenAI에서 Ironclad를 사용하는 사람들이 우리 연구진이 법무, 상업 및 조달 업무 전반에 걸쳐 11개의 과제를 파악하도록 도왔습니다. 여기에는 비밀유지계약서 설정, 조달 승인 프로세스 생성, 그리고 요청자가 선택한 관할권을 반영하도록 재사용 가능한 법률 조항을 업데이트하는 등의 과제가 포함되었습니다. 우리는 이 작업에 숙련된 사용자가 평균 과제당 약 30~40분이 걸릴 것으로 추산합니다.

우리는 각 과제의 복잡도에 따라 8~50개의 기준으로 평가했습니다. 이를 통해 모델이 어느 부분을 올바르게 수행했고 어디에서 미달했는지 확인할 수 있었습니다. Ironclad는 또한 모델이 이러한 과제를 연습할 수 있도록 자사 제품의 호스팅 소프트웨어 환경을 제공했습니다. 우리 연구진은 대표적인 워크플로우를 중심으로 합성 학습 과제를 개발하고2 강화학습을 사용하여 모델이 연습과 피드백을 통해 개선하도록 도왔습니다. 이러한 조합—해당 업무를 아는 사람들과 함께 선정한 과제, 상세한 기준, 모델이 연습할 수 있는 공간—은 고객에게 가장 중요한 실제 과제에서 개선이 이루어지도록 보장합니다.

Astra의 성과

우리는 Astra에는 Max reasoning, Sol에는 High reasoning, 즉 각 모델이 가장 높은 점수를 낸 설정으로 Astra와 GPT‑5.6 Sol을 비교했습니다. 11개 연구 과제 전반에서 Astra의 평균 점수는 55.0%였고, GPT‑5.6 Sol은 41.6%였으며, 시도당 예상 평균 시간은 Sol의 37.0분에서 Astra의 19.2분으로 단축되었습니다.3 Astra 개발에 사용된 내부 모델은 이러한 과제에서 더욱 높은 63.7%를 달성했으며, 우리는 이러한 추가적인 향상을 미래 모델에 반영하고자 합니다.

지표

GPT‑5.6 Sol
High reasoning

GPT‑6 Astra
Max reasoning

평균 루브릭 점수

41.6%

55.0%

시도당 예상 평균 시간

37.0분

19.2분

Astra는 시도당 더 적은 시뮬레이션 시간으로 더 많은 과제 요구사항을 충족했습니다. 아래 두 클립은 모델들이 동일한 연구 과제를 어떻게 처리했는지 보여줍니다. Astra(첫 번째)는 예상 20분 만에 과제 기준의 약 94%를 충족했고, GPT‑5.6 Sol(두 번째)은 예상 32분 만에 약 85%를 충족했습니다.

GPT‑6 Astra 는 예상 20분 만에 과제 기준의 약 94%를 충족했습니다.

GPT‑5.6 Sol 은 예상 32분 만에 과제 기준의 약 85%를 충족했습니다.

이번 협업이 Ironclad에 의미하는 것

이번 작업에서 Ironclad의 역할은 고객들이 잘 아는 한 가지 과제를 반영합니다. 계약 프로세스는 비즈니스가 의존하는 규칙을 유지하면서 예외를 처리할 수 있어야 합니다. 에이전트가 작업 도중 그 규칙 중 하나를 놓치면, 소프트웨어 회사가 에이전트에게 안심하고 맡길 수 있는 일의 범위가 제한됩니다. 이는 에이전트가 복잡한 계약 작업을 더 잘 수행하게 되더라도 인간의 감독이 여전히 중요한 이유, 그리고 완전한 계약 플랫폼이 여전히 필수적인 이유를 잘 보여줍니다. 당사의 연구진과 협력함으로써 Ironclad는 이러한 문제들을 기반 모델의 개발 과정에 반영하고, 당사와 함께 이를 연구할 수 있게 됩니다.

모델이 더 강력해짐에 따라 Ironclad는 자사의 더 많은 제품에 이를 활용할 기회를 얻고 있습니다. 법무 및 비즈니스 팀에게 이는 복잡한 계약 작업에 수반되는 노력의 더 많은 부분을 AI가 맡으면서도 해당 팀이 의존하는 통제 기능은 유지한다는 것을 의미할 수 있습니다.

“AI가 계약의 복잡한 영역에서 진정으로 유용하려면 개별 작업을 수행하는 것 이상을 해야 합니다. 에이전트는 팀이 의존하는 통제 기능을 유지하면서 비즈니스 워크플로가 어떻게 연결되는지를 포함해 계약 라이프사이클 전반을 이해해야 합니다. OpenAI와의 협업은 이러한 실제 과제를 연구 과정에 도입하고 기술을 앞으로 나아가게 하는 데 도움을 줍니다.”
—Sunita Verma, Ironclad 최고기술책임자(CTO)

복잡한 전문 업무를 위한 AI 발전에 함께 참여하세요

저희는 오늘날의 에이전트가 아직 안정적으로 완수하지 못하는 중요한 전문 업무에 대해 저희 연구 및 엔지니어링 팀과 직접 협력할 소수의 소프트웨어 회사를 모집하고 있습니다. 귀하의 팀에 그런 업무가 있다면 구체적인 사례를 보여주시기 바랍니다. 에이전트에게 요청하는 작업이 무엇인지, 실패하는 지점에 대한 증거, 그리고 성공적인 결과를 어떻게 판단할지가 그것입니다. 파트너는 해당 업무를 깊이 이해하는 인력, 테스트를 위한 안전한 환경, 그리고 연구에 안전하게 사용할 수 있는 데이터를 확보할 수 있어야 합니다. 이를 통해 저희는 실패 원인을 조사하고 모델이 개선되는지 측정할 출발점을 얻게 됩니다.

귀하의 팀이 이에 해당한다면, 연구 협업 신청하기.

원문 출처

OpenAI Sitemap

내용 안내

원문 발행 및 권리는 출처에 있습니다.

기계 번역 · 원문을 참고하세요