TechCrunch AI

Las soluciones matemáticas de OpenAI aún no cumplen con los estándares del campo

La avalancha de demostraciones de OpenAI se desvió de las directrices establecidas por un grupo de investigadores matemáticos consultados por el laboratorio fronterizo.

Fuente de la imagen · TechCrunch AI

Cuando OpenAI publicó cientos de soluciones reclamadas a algunos de los problemas matemáticos más difíciles del mundo esta semana, el laboratorio fronterizo dijo que había consultado a un grupo asesor de matemáticos de élite para evitar la controversia que acompañó la última vez que uno de sus modelos resolvió un problema de larga data en el campo.

Pero OpenAI no estuvo a la altura de esos estándares, particularmente donde los matemáticos enfatizaron la necesidad de la comprensión humana de un resultado matemático. Eso es especialmente preocupante después de que un nuevo artículo destacara las brechas entre la solución en lenguaje natural y la expresada formalmente de un problema de un millón de dólares supuestamente resuelto por los modelos de OpenAI.

El Grupo Asesor sobre Matemáticas e Inteligencia Artificial, alojado por el Instituto de Estudios Avanzados de la Universidad de Princeton, está compuesto por nueve investigadores prominentes de instituciones de todo el mundo.

La organización publicó directrices para los laboratorios fronterizos que resuelven problemas matemáticos a finales de septiembre. En una declaración sobre el último conjunto de demostraciones, el AGMAI dijo que "en última instancia corresponde a la comunidad matemática evaluar hasta qué punto nuestras recomendaciones fueron seguidas con éxito".

Sin embargo, la primera solicitud de la organización fue "dejar de probar problemas matemáticos avanzados en modelos propietarios". La publicación de OpenAI dice explícitamente que está evaluando sus modelos propietarios usando problemas de investigación abiertos en matemáticas.

El grupo asesor no respondió cuando TechCrunch le pidió una evaluación más exhaustiva de la última publicación de demostraciones de OpenAI. El laboratorio claramente siguió algunos de sus principios, incluida la publicación de los resultados lo antes posible y la inclusión de información sobre cómo los modelos llegaron a sus conclusiones. Pero no en todos los casos: solo diez de los 719 manuscritos incluían la publicación de la cadena de razonamiento del modelo.

Para los artículos que las personas no entienden, los matemáticos sugirieron que las demostraciones deberían formalizarse — pero el 42% de las demostraciones publicadas por OpenAI no había pasado por este proceso.

En última instancia, todavía no está claro que OpenAI esté asumiendo "la responsabilidad de garantizar que la comprensión humana seguirá" al publicar sus demostraciones, de acuerdo con los principios del AGMAI. El AGMAI sugirió que OpenAI debería ayudar a financiar el trabajo de los matemáticos humanos que serán necesarios para que las soluciones del laboratorio sean significativas de algún modo real.

"Los problemas están siendo resueltos de forma autónoma por prompters de IA que no tienen interés en el campo más amplio en sí una vez que su objetivo inicial está 'resuelto', y no entienden la salida de la IA lo suficiente como para responder preguntas sobre el resultado, dar charlas o interactuar de otra manera con el resto del campo", escribió Terence Tao, un matemático prominentemente crítico con el enfoque de OpenAI, en redes sociales después de la publicación.

Ese problema queda ejemplificado por un artículo publicado esta semana por matemáticos de la Universidad de Cambridge y King's College en Londres que cuestiona la forma en que los laboratorios fronterizos abordan estos desafíos.

Cuando los modelos de IA resuelven problemas matemáticos, primero crean una explicación en "lenguaje natural", luego intentan expresar ese resultado en Lean, un lenguaje de programación que en teoría confirma la exactitud de la demostración al compilarla como código.

Sin embargo, puede haber problemas con la forma en que los modelos traducen sus demostraciones en lenguaje natural a código; este artículo documenta al menos dos discrepancias entre la demostración en lenguaje natural y el código Lean detrás de la solución que OpenAI ha ofrecido a un problema derivado de las ecuaciones de Navier-Stokes que describen el comportamiento complejo de los fluidos.

Estas discrepancias no necesariamente refutan ninguna de las dos soluciones, pero sí plantean preguntas sobre si podemos simplemente confiar en que los modelos formalicen sus propias soluciones sin intervención humana. Esa es una de las razones por las que el AGMAI pidió a OpenAI "incluir metadatos legibles por máquina que correlacionen los artefactos en lenguaje natural y formales", algo que el laboratorio fronterizo no hizo con estas publicaciones.

"Debido al fenómeno de las malas traducciones — como se destaca en este artículo — la demostración en NL de OpenAI y
otras demostraciones Lean autoformalizadas no deberían confiarse prima facie sin el mismo proceso de revisión por pares y
escrutinio al que se someten otras demostraciones", concluyen los autores del artículo "lost in translation".

Los matemáticos subrayan que cuando los humanos descubren nuevos resultados, asumen la responsabilidad de ellos y se comprometen con la comunidad más amplia a través de artículos, charlas y seminarios. Ese proceso aumenta la comprensión de las soluciones, encuentra estrategias que pueden usarse para resolver otros problemas y permite aplicar el nuevo conocimiento en campos prácticos.

Cuando se le pide a un modelo que resuelva un problema difícil y escupe una solución, "no existe comprensión humana de ellos en el momento de la publicación, y ahora comienza el trabajo", dijo Melanie Wood, profesora de matemáticas de la Universidad de Harvard, a TechCrunch.

Fuente original

TechCrunch AI

Notas sobre el contenido

La publicación original y los derechos pertenecen a la fuente.

Traducción automática · Consulte el original