OpenAI SitemapActualizado el

Impulsando el uso de computadoras con Ironclad

Conozca cómo OpenAI e Ironclad están entrenando y evaluando agentes de IA en flujos de trabajo contractuales complejos para impulsar el uso de computadoras en el trabajo profesional.

Fuente de la imagen · OpenAI Sitemap

Cuando presentamos GPT‑6 Astra, demostramos hasta dónde han llegado nuestros modelos en el uso de computadoras para el trabajo profesional, desde preparar documentos hasta probar sitios web. Nuestro siguiente objetivo es hacer que los agentes sean más capaces y eficientes al usar software especializado para resolver problemas comerciales complejos. Estamos explorando cómo entrenar modelos para entender las reglas de negocio de una empresa, ejecutar flujos de trabajo de varios pasos y verificar que su trabajo cumpla con los requisitos originales.

Para acelerar esta investigación, estamos asociándonos directamente con un pequeño número de empresas de software que mejor entienden estos flujos de trabajo. Juntos, estamos identificando tareas desafiantes y de alto valor, y convirtiéndolas en problemas de investigación para entrenar y evaluar nuestros modelos, haciendo en última instancia que nuestros modelos sean más capaces y útiles en aplicaciones comerciales del mundo real.

Nuestro primer socio es Ironclad, un líder en contratos con IA. Trabajando de cerca con el equipo de Ironclad, hemos desarrollado tareas que requieren que los agentes configuren acuerdos, aprobaciones y términos legales reutilizables, y hemos demostrado avances en estos flujos de trabajo complejos. La experiencia de Ironclad ha sido fundamental para definir cómo se ve el éxito y llevar las necesidades reales de los clientes directamente al desarrollo de modelos frontera. Estamos agradecidos por su asociación y entusiasmados por compartir lo que hemos logrado juntos.

GPT‑6 Astra es nuestro primer modelo frontera entrenado en tareas de Ironclad. En nuestra evaluación de investigación, su puntaje promedio fue 32% más alto que el de GPT‑5.6 Sol, mientras que el tiempo estimado por intento fue 48% menor.1

Convirtiendo flujos de trabajo contractuales en tareas de entrenamiento

Considere un equipo de operaciones legales que establece un proceso para comprar software. Finanzas puede necesitar aprobar compras por encima de cierto monto, Seguridad puede necesitar revisar ciertas solicitudes, y Legal puede necesitar revisar términos no estándar. La persona que configura el proceso tiene que convertir esa breve lista en un formulario de admisión, plantillas de documentos, reglas de aprobación y un registro del acuerdo final.

Un agente de IA que hace el mismo trabajo tiene que mantener esos requisitos a la vista mientras se mueve por el software. Por ejemplo, debe configurar la aprobación de Finanzas por encima del umbral de gasto y verificar que las solicitudes por encima y por debajo de él sigan los caminos correctos. Hacer bien los pasos individuales no es suficiente: el proceso terminado debe funcionar en las situaciones para las que fue diseñado.

Empleados de Ironclad y personas que usan Ironclad en OpenAI ayudaron a nuestros investigadores a identificar 11 tareas en el trabajo legal, comercial y de adquisiciones. Estas incluían tareas como configurar acuerdos de confidencialidad, crear procesos de aprobación de adquisiciones y actualizar una cláusula legal reutilizable para que refleje la jurisdicción que el solicitante selecciona. Estimamos que este trabajo le tomaría a un usuario experimentado unos 30 a 40 minutos por tarea, en promedio.

Evaluamos cada tarea contra 8 a 50 criterios, según su complejidad. Esto nos permitió ver qué partes hizo bien un modelo y dónde se quedó corto. Ironclad también proporcionó entornos de software alojados de su producto donde los modelos podían practicar estas tareas. Nuestros investigadores desarrollaron tareas de entrenamiento sintéticas2 en torno a flujos de trabajo representativos y usaron aprendizaje por refuerzo para ayudar a los modelos a mejorar mediante la práctica y la retroalimentación. Esta combinación—tareas seleccionadas con personas que conocen el trabajo, criterios detallados y un lugar donde los modelos pueden practicar—garantiza que estamos mejorando en tareas del mundo real que son más importantes para nuestros clientes.

Cómo se desempeñó Astra

Comparamos Astra y GPT‑5.6 Sol usando Max reasoning para Astra y High reasoning para Sol, las configuraciones donde cada modelo obtuvo el puntaje más alto. En las 11 tareas de investigación, el puntaje promedio de Astra fue 55.0%, en comparación con 41.6% para GPT‑5.6 Sol, mientras que el tiempo promedio estimado por intento cayó de 37.0 minutos para Sol a 19.2 minutos para Astra.3 Un modelo interno utilizado en el desarrollo de Astra logró un 63.7% aún más fuerte en estas tareas, y nuestro objetivo es llevar estas mejoras adicionales a futuros modelos.

Métrica

GPT‑5.6 Sol
High reasoning

GPT‑6 Astra
Max reasoning

Puntaje medio de rúbrica

41.6%

55.0%

Tiempo promedio estimado por intento

37.0 minutos

19.2 minutos

Astra cumplió con más requisitos de la tarea con menos tiempo simulado por intento. Los dos clips siguientes muestran cómo los modelos manejaron la misma tarea de investigación. Astra (primero) cumplió aproximadamente el 94% de los criterios de la tarea en unos 20 minutos estimados; GPT‑5.6 Sol (segundo) cumplió aproximadamente el 85% en unos 32 minutos estimados.

GPT‑6 Astra cumplió aproximadamente el 94% de los criterios de la tarea en unos 20 minutos estimados.

GPT‑5.6 Sol cumplió aproximadamente el 85% de los criterios de la tarea en unos 32 minutos estimados.

Lo que significa esta colaboración para Ironclad

El papel de Ironclad en este trabajo refleja un desafío que sus clientes conocen bien: un proceso de contratación debe manejar excepciones mientras preserva las reglas de las que depende una empresa. Si un agente pierde de vista una de esas reglas a mitad de una tarea, eso limita lo que una compañía de software puede pedirle con confianza. Esto subraya por qué la supervisión humana sigue siendo importante a medida que los agentes mejoran en tareas de contratación complejas, y por qué una plataforma de contratación completa sigue siendo esencial. Trabajar con nuestros investigadores le da a Ironclad una manera de llevar estos problemas al desarrollo del modelo subyacente, donde podemos estudiarlos juntos.

A medida que los modelos se vuelven más capaces, Ironclad tiene la oportunidad de usarlos en más de sus propios productos. Para los equipos legales y de negocios, eso podría significar que la IA asuma más del esfuerzo involucrado en la contratación compleja, preservando los controles en los que esos equipos confían.

«Para que la IA sea genuinamente útil en áreas complejas de la contratación, tiene que hacer más que completar acciones individuales. Los agentes necesitan comprender todo el ciclo de vida de la contratación, incluido cómo se conectan los flujos de trabajo del negocio, mientras se preservan los controles en los que los equipos confían. Nuestra colaboración con OpenAI lleva estos desafíos del mundo real al proceso de investigación y ayuda a hacer avanzar la tecnología».
—Sunita Verma, Directora de Tecnología, Ironclad

Trabaja con nosotros para avanzar en la IA para el trabajo profesional complejo

Invitamos a un pequeño número de empresas de software a trabajar directamente con nuestros equipos de investigación e ingeniería en tareas profesionales importantes que los agentes de hoy todavía no pueden completar de manera confiable. Si tu equipo tiene una, nos gustaría ver un ejemplo concreto: lo que le pides al agente que haga, evidencia de dónde falla y cómo juzgarías un resultado exitoso. Los socios también deben poder aportar personas que conozcan profundamente el trabajo, un entorno seguro para las pruebas y datos que puedan usarse de manera segura para la investigación. Esto nos da un punto de partida para investigar el fallo y medir si el modelo mejora.

Si eso describe a tu equipo, solicita explorar una colaboración de investigación.

Fuente original

OpenAI Sitemap

Notas sobre el contenido

La publicación original y los derechos pertenecen a la fuente.

Traducción automática · Consulte el original