Cuando presentamos GPT‑6 Astra, demostramos hasta dónde han llegado nuestros modelos en el uso de computadoras para el trabajo profesional, desde preparar documentos hasta probar sitios web. Nuestro próximo objetivo es hacer que los agentes sean más capaces y eficientes en el uso de software especializado para resolver problemas empresariales complejos. Estamos explorando cómo entrenar modelos para que entiendan las reglas de negocio de una empresa, ejecuten flujos de trabajo de varios pasos y verifiquen que su trabajo cumpla con los requisitos originales.
Para acelerar esta investigación, nos estamos asociando directamente con un pequeño número de empresas de software que mejor entienden estos flujos de trabajo. Juntos, estamos identificando tareas desafiantes y de alto valor, y convirtiéndolas en problemas de investigación para entrenar y evaluar nuestros modelos, haciendo que en última instancia nuestros modelos sean más capaces y útiles en aplicaciones empresariales del mundo real.
Nuestro primer socio es Ironclad, un líder en contratos con IA. Trabajando en estrecha colaboración con el equipo de Ironclad, hemos desarrollado tareas que requieren que los agentes configuren acuerdos, aprobaciones y términos legales reutilizables, y hemos demostrado avances en estos flujos de trabajo complejos. La experiencia de Ironclad ha sido fundamental para definir cómo es el éxito y llevar las necesidades reales de los clientes directamente al desarrollo de modelos de frontera. Estamos agradecidos por su asociación y entusiasmados por compartir lo que hemos logrado juntos.
GPT‑6 Astra es nuestro primer modelo de frontera entrenado en tareas de Ironclad. En nuestra evaluación de investigación, su puntaje promedio fue un 32% más alto que el de GPT‑5.6 Sol, mientras que el tiempo estimado por intento fue un 48% menor.1
Convirtiendo flujos de trabajo contractuales en tareas de entrenamiento
Considere un equipo de operaciones legales que configura un proceso para comprar software. Finanzas puede necesitar aprobar compras por encima de cierto monto, Seguridad puede necesitar revisar ciertas solicitudes, y Legal puede necesitar revisar términos no estándar. La persona que configura el proceso tiene que convertir esa breve lista en un formulario de admisión, plantillas de documentos, reglas de aprobación y un registro del acuerdo final.
Un agente de IA que hace el mismo trabajo tiene que mantener esos requisitos a la vista mientras se mueve por el software. Por ejemplo, debe configurar la aprobación de Finanzas por encima del umbral de gasto y verificar que las solicitudes por encima y por debajo de él sigan los caminos correctos. Hacer bien los pasos individuales no es suficiente: el proceso terminado debe funcionar en las situaciones que fue diseñado para manejar.
Empleados de Ironclad y personas que usan Ironclad en OpenAI ayudaron a nuestros investigadores a identificar 11 tareas en trabajo legal, comercial y de adquisiciones. Estas incluían tareas como configurar acuerdos de confidencialidad, crear procesos de aprobación de adquisiciones y actualizar una cláusula legal reutilizable para que refleje la jurisdicción que selecciona el solicitante. Estimamos que este trabajo tomaría a un usuario experimentado unos 30 a 40 minutos por tarea, en promedio.
Evaluamos cada tarea contra 8 a 50 criterios, dependiendo de su complejidad. Esto nos permitió ver qué partes hizo bien un modelo y dónde quedó corto. Ironclad también proporcionó entornos de software alojados de su producto donde los modelos podían practicar estas tareas. Nuestros investigadores desarrollaron tareas de entrenamiento sintéticas2 en torno a flujos de trabajo representativos y usaron aprendizaje por refuerzo para ayudar a los modelos a mejorar mediante la práctica y la retroalimentación. Esta combinación—tareas seleccionadas con personas que conocen el trabajo, criterios detallados y un lugar para que los modelos practiquen—garantiza que estamos mejorando en tareas del mundo real que son las más importantes para nuestros clientes.
Cómo se desempeñó Astra
Comparamos Astra y GPT‑5.6 Sol usando razonamiento Max para Astra y razonamiento High para Sol, las configuraciones donde cada modelo obtuvo el puntaje más alto. En las 11 tareas de investigación, el puntaje promedio de Astra fue 55.0%, en comparación con 41.6% para GPT‑5.6 Sol, mientras que el tiempo promedio estimado por intento cayó de 37.0 minutos para Sol a 19.2 minutos para Astra.3 Un modelo interno utilizado en el desarrollo de Astra logró un aún más fuerte 63.7% en estas tareas, y nuestro objetivo es llevar estas mejoras adicionales a futuros modelos.
Métrica | GPT‑5.6 Sol | GPT‑6 Astra |
Puntaje promedio de rúbrica | 41.6% | 55.0% |
Tiempo promedio estimado por intento | 37.0 minutos | 19.2 minutos |
Astra cumplió con más requisitos de la tarea con menos tiempo simulado por intento. Los dos clips a continuación muestran cómo los modelos manejaron la misma tarea de investigación. Astra (primero) cumplió alrededor del 94% de los criterios de la tarea en unos 20 minutos estimados; GPT‑5.6 Sol (segundo) cumplió alrededor del 85% en unos 32 minutos estimados.
GPT‑6 Astra cumplió alrededor del 94% de los criterios de la tarea en unos 20 minutos estimados.
GPT‑5.6 Sol cumplió alrededor del 85% de los criterios de la tarea en unos 32 minutos estimados.
Lo que significa esta colaboración para Ironclad
El papel de Ironclad en este trabajo refleja un desafío que sus clientes conocen bien: un proceso de contratación debe manejar excepciones mientras preserva las reglas de las que depende una empresa. Si un agente pierde de vista una de esas reglas a mitad de una tarea, eso limita lo que una empresa de software puede pedirle con confianza. Esto subraya por qué la supervisión humana sigue siendo importante a medida que los agentes mejoran en tareas contractuales complejas, y por qué una plataforma de contratación completa sigue siendo esencial. Trabajar con nuestros investigadores le da a Ironclad una manera de llevar estos problemas al desarrollo del modelo subyacente, donde podemos estudiarlos juntos.
A medida que los modelos se vuelven más capaces, Ironclad tiene la oportunidad de utilizarlos en más de sus propios productos. Para los equipos legales y de negocios, esto podría significar que la IA asuma más del esfuerzo involucrado en la contratación compleja, preservando al mismo tiempo los controles en los que confían esos equipos.
“Para que la IA sea genuinamente útil en áreas complejas de la contratación, tiene que hacer más que completar acciones individuales. Los agentes necesitan comprender todo el ciclo de vida de la contratación, incluido cómo se conectan los flujos de trabajo de negocio, preservando al mismo tiempo los controles en los que confían los equipos. Nuestra colaboración con OpenAI incorpora estos desafíos del mundo real al proceso de investigación y ayuda a impulsar la tecnología hacia adelante.”
Trabaja con nosotros para avanzar en la IA para el trabajo profesional complejo
Invitamos a un pequeño número de empresas de software a trabajar directamente con nuestros equipos de investigación e ingeniería en tareas profesionales importantes que los agentes actuales todavía no pueden completar de manera fiable. Si tu equipo tiene una, nos gustaría ver un ejemplo concreto: lo que le estás pidiendo al agente que haga, evidencia de dónde falla y cómo juzgarías un resultado exitoso. Los socios también deben poder aportar personas que conozcan el trabajo a fondo, un entorno seguro para las pruebas y datos que puedan usarse de forma segura para la investigación. Esto nos da un punto de partida para investigar la falla y medir si el modelo mejora.
Si esto describe a tu equipo, postula para explorar una colaboración de investigación.
