当我们推出 GPT‑6 Astra时,我们展示了我们的模型在将计算机用于专业工作方面已取得的进展,从准备文档到测试网站。我们的下一个目标是让智能体在使用专业软件解决复杂业务问题方面更有能力、更高效。我们正在探索如何训练模型理解公司的业务规则、执行多步骤工作流,并验证其工作是否满足最初要求。
为了加速这项研究,我们正与少数几家最了解这些工作流的软件公司直接合作。我们共同识别具有挑战性、高价值的任务,并将其转化为用于训练和评估模型的研究问题,最终使我们的模型在真实世界商业应用中更有能力、更有用。
我们的第一个合作伙伴是 AI 合同领域的领导者 Ironclad。通过与 Ironclad 团队密切合作,我们开发了需要智能体配置协议、审批和可复用法律条款的任务,并在这些复杂工作流上展示了进展。Ironclad 的专业知识对于定义成功的标准以及将真实客户需求直接引入前沿模型开发起到了关键作用。我们感谢他们的合作,并很期待分享我们共同取得的成果。
GPT‑6 Astra 是我们第一个在 Ironclad 任务上训练的前沿模型。在我们的研究评估中,其平均得分比 GPT‑5.6 Sol 高 32%,而每次尝试的预计时间低 48%。1
将合同工作流转化为训练任务
设想一个法律运营团队正在为软件采购建立流程。财务可能需要审批超过一定金额的采购,安全部门可能需要审查某些请求,法务可能需要审查非标准条款。设置流程的人必须把这个简短的清单转化为一份登记表单、文档模板、审批规则以及最终协议的记录。
执行同样工作的 AI 智能体在操作软件时必须始终牢记这些要求。例如,它必须为超过支出阈值的采购配置财务审批,并检查高于和低于阈值的请求是否遵循正确的路径。仅仅把各个步骤做对是不够的:完成的流程必须在其设计所要应对的各种情形下都能正常运行。
Ironclad 的员工以及 OpenAI 内部使用 Ironclad 的人员帮助我们的研究人员识别了涵盖法律、商业和采购工作的 11 项任务。这些任务包括设置保密协议、创建采购审批流程,以及更新可复用的法律条款以反映请求者所选的司法管辖区。我们估计,有经验的用户平均完成每项任务大约需要 30 到 40 分钟。
我们根据任务的复杂程度,用 8 到 50 条标准对每项任务进行评估。这让我们能够看到模型哪些部分做对了,哪些地方还有欠缺。Ironclad 还提供了其产品的托管软件环境,供模型练习这些任务。我们的研究人员围绕具有代表性的工作流开发了合成训练任务2 并使用强化学习帮助模型通过练习和反馈不断改进。这种组合——与了解这项工作的人一起挑选的任务、详细的标准,以及供模型练习的场所——确保我们在对客户最重要的真实任务上取得改进。
Astra 的表现如何
我们比较了 Astra 和 GPT‑5.6 Sol,其中 Astra 使用 Max 推理,Sol 使用 High 推理,即各自得分最高的设置。在这 11 项研究任务中,Astra 的平均得分为 55.0%,而 GPT‑5.6 Sol 为 41.6%;每次尝试的预计平均时间从 Sol 的 37.0 分钟降至 Astra 的 19.2 分钟。3 在 Astra 开发过程中使用的一个内部模型在这些任务上取得了更强的 63.7% 成绩,我们的目标是将这些进一步的提升带入未来的模型。
指标 | GPT‑5.6 Sol | GPT‑6 Astra |
平均评分标准得分 | 41.6% | 55.0% |
每次尝试的预计平均时间 | 37.0 分钟 | 19.2 分钟 |
Astra 在每次尝试所用模拟时间更少的情况下,满足了更多任务要求。下面两个片段展示了两个模型如何处理同一研究任务。Astra(第一个)在约 20 分钟内满足了约 94% 的任务标准;GPT‑5.6 Sol(第二个)在约 32 分钟内满足了约 85%。
GPT‑6 Astra 在约 20 分钟内满足了约 94% 的任务标准。
GPT‑5.6 Sol 在约 32 分钟内满足了约 85% 的任务标准。
这次合作对 Ironclad 意味着什么
Ironclad 在这项工作中扮演的角色反映了其客户深有体会的一个挑战:合同流程必须在保留企业所依赖的规则的同时处理例外情况。如果智能体在任务中途遗漏了其中某条规则,这就会限制软件公司能够放心交给它去做的任务。这凸显了为什么随着智能体在复杂合同任务上的能力提升,人类监督依然重要,以及为什么一个完整的合同平台仍然不可或缺。与我们研究人员合作,让 Ironclad 能够将这些问题纳入底层模型的开发过程中,从而我们可以共同研究这些问题。
随着模型能力不断增强,Ironclad有机会在自己的更多产品中使用它们。对于法务和业务团队而言,这可能意味着AI承担复杂合同工作中更多的具体事务,同时保留这些团队所依赖的控制机制。
“要让AI在复杂的合同领域真正有用,它必须做的不仅仅是完成单个操作。智能体需要理解完整的合同生命周期,包括业务工作流之间如何衔接,同时保留团队所依赖的控制机制。我们与OpenAI的合作将这些现实世界的挑战带入研究过程,并有助于推动技术向前发展。”
与我们合作,推进复杂专业工作中的AI应用
我们诚邀少数软件公司与我们研究和工程团队直接合作,共同解决当今智能体仍无法可靠完成的重要专业任务。如果你的团队有这样的任务,我们希望看到一个具体示例:你要求智能体做什么、它失败之处的证据,以及你将如何判断结果是否成功。合作伙伴还应能够派出深入了解这项工作的人员,提供安全的测试环境,以及可以安全用于研究的数据。这为我们调查失败原因并衡量模型是否改进提供了起点。
如果这符合你的团队情况, 请申请探索研究合作.
