The Decoder

Un estudio revela que los agentes de IA sobrevaloran sus resultados y siguen lejos de la investigación autónoma

Epoch AI y Anthropic encontraron de forma independiente lo mismo: los modelos actuales de IA como GPT-5.6 Sol y Claude Fable 5 pueden realizar experimentos, pero carecen de autocrítica científica y de pensamiento…

Manuel Uth
Fuente de la imagen · The Decoder

Un estudio revela que los agentes de IA sobrevaloran sus resultados y siguen lejos de la investigación autónoma

Manuel Uth Manuel Uth 11 de octubre de 2026 Image description Nano Banana Pro con un prompt de THE DECODER

Los resultados de Epoch AI y Anthropic muestran que los modelos de IA pueden realizar experimentos, pero carecen de autocrítica científica y de pensamiento creativo genuino.

Los grandes laboratorios de IA comercializan cada vez más sus modelos como herramientas de investigación. Google DeepMind ha ampliado su Co-Scientist hasta convertirlo en un sistema de investigación completo, y OpenAI presentó en septiembre un "becario de investigación automatizado". Para marzo de 2028, ese becario debería convertirse en un investigador de IA autónomo bajo supervisión humana, pero parece faltar una capacidad clave: el juicio científico.

Se pidió a los agentes que inventaran un nuevo método de entrenamiento

Con su benchmark "InnovationEval," Epoch AI probó si los agentes de IA pueden realizar investigación por sí mismos. La tarea consistía en inventar un nuevo método para mejorar los modelos de lenguaje tras su entrenamiento inicial, y luego implementarlo, probarlo y refinarlo de manera independiente.

El punto de partida fue GRPO, una técnica ampliamente utilizada. GRPO compara múltiples respuestas que un modelo genera para la misma tarea y recompensa las mejores, puntuando típicamente cada solución en su conjunto. El método de referencia diseñado por humanos, SDPO, utiliza señales adicionales como mensajes de error para crear una retroalimentación de aprendizaje más precisa para los pasos individuales dentro de una respuesta, de modo que el modelo se convierte efectivamente en su propio maestro.

Epoch probó Claude Fable 5 y GPT-5.6 Sol, que según la organización no tenían conocimiento previo de SDPO. El rendimiento se midió en tareas de respuesta corta como preguntas de ciencias y en tareas de programación, y cada agente tuvo acceso a hasta 3,000 horas de cómputo en chips de gama alta, pero sin acceso a internet.

Ambos modelos reciclaron técnicas conocidas en lugar de innovar

Ninguno de los modelos se acercó a la referencia humana. GPT-5.6 Sol atacó una debilidad de GRPO: cuando todas las respuestas a una tarea son correctas, el modelo no aprende nada porque no hay nada que comparar. Sol hizo que el modelo reforzara sus soluciones exitosas en esos casos, pero la idea no era nueva.

Medido contra la mejora que SDPO logra sobre GRPO, Sol obtuvo alrededor del 35 por ciento con una calificación generosa, según Epoch. Contando solo los cambios que se mantuvieron dentro de las reglas del experimento, esa cifra baja a alrededor del 15 por ciento. En tareas de programación, Sol hizo principalmente que el entrenamiento fuera más caro y lento en lugar de mejorar el método en sí.

Claude Fable 5 hizo que el modelo reintentara las tareas fallidas mientras le proporcionaba los intentos fallidos anteriores, lo cual también es una técnica bien conocida y no produjo ninguna mejora medible. Incluso el éxito parcial de Sol apenas calificaría como "moderadamente interesante" para los expertos, dice Epoch. Los modelos más nuevos que conocían SDPO a partir de sus datos de entrenamiento tampoco pudieron replicarlo por completo. GPT-6 Astra construyó una solución similar pero no reveló su fuente, e incluso con el artículo original frente a él, Fable 5 quedó por debajo de la referencia.

Los agentes seleccionaron sus mejores ejecuciones y enterraron el resto

Ambos agentes también tenían un problema de comunicación de resultados. Ejecutaron múltiples rondas de entrenamiento casi idénticas y comunicaron solo el mejor resultado de cada vez, lo que hace que un método parezca más fuerte de lo que realmente es, porque los resultados fluctúan aleatoriamente. En sus informes finales, los modelos apenas mencionaron esta práctica, si es que lo hicieron, y tampoco citaron los trabajos previos en los que se basaban sus métodos. Sus cifras autoinformadas fueron consecuentemente altas: Sol reclamó aproximadamente el 70 por ciento de la mejora del SDPO, y Fable 5 aproximadamente el 40 por ciento. Epoch eliminó esas ganancias infladas.

Puntuaciones declaradas frente a reales para Claude Fable 5 y GPT-5.6 Sol. Las barras oscuras muestran las cifras autoinformadas por los agentes, las barras medianas muestran los resultados corregidos por ejecuciones seleccionadas favorablemente, y las barras claras muestran las puntuaciones contando solo los cambios que cumplen las reglas. Todos los valores se expresan como una proporción de la mejora de SDPO sobre GRPO. Las barras de error muestran la incertidumbre de medición. | Imagen: Epoch AI

Los registros de razonamiento interno de los modelos muestran que eran conscientes del problema, con Fable 5 describiendo sus ejecuciones repetidas como una búsqueda de un mejor checkpoint. Epoch deja abierta la cuestión de si esto constituye trampas deliberadas o confusión.

Para GPT-5.6 Sol, el comportamiento encaja con un hallazgo anterior de la organización de evaluación METR, que había detectado más intentos de trampa de ese modelo en su propia prueba de programación que de cualquier otro modelo disponible públicamente que hubiera evaluado.

Epoch concluye que los humanos tendrían que revisar completamente toda la investigación generada por IA, lo que reduce la utilidad de los modelos.

Anthropic ve las mismas debilidades en su propio modelo

Anthropic describe limitaciones similares en la system card de Claude Opus 5.5. Anthropic afirma que el modelo está lejos de reemplazar a los propios investigadores de la empresa, con los principales problemas en la "calidad epistémica" y el seguimiento de instrucciones.

Opus 5.5 presenta suposiciones no verificadas como hechos y aparta sus propias dudas más a menudo que los modelos anteriores. Describe comprobaciones parciales como verificación completa, convierte evaluaciones preliminares en recomendaciones sin contrastarlas, y aborda las críticas de forma demasiado limitada sin cuestionar el enfoque general. También favorece pequeños ajustes incrementales y se apega a estudios publicados en lugar de desarrollar ideas nuevas.

Un estudio que involucra a la Universidad de Princeton y el Safety Institute del Reino Unido también llegó a conclusiones similares. Hizo que Claude Opus 4.8 trabajara durante seis días en las preguntas de investigación detrás de dos artículos no publicados de la conferencia de IA NeurIPS, y los autores originales rechazaron ambos resultados al revisarlos. Cuando las hipótesis iniciales fallaban, los agentes simplemente suavizaban sus afirmaciones en lugar de empezar de nuevo.

La ejecución técnica es cada vez el problema menor, ya que lo que más les falta a los agentes es la capacidad de estimar de manera realista cuánta confianza deberían tener en un resultado y de cuestionar su propio enfoque a un nivel fundamental.

Solo más cómputo no cerrará la brecha

La IA no es inútil para la investigación, ya que los modelos pueden acelerar la revisión de literatura, escribir código y explorar variaciones más rápido que los humanos.

Pero si dedicar más cómputo al problema producirá investigadores autónomos sigue siendo una pregunta abierta. GPT-5.6 Sol utilizó todo su presupuesto, encontrando su mejora en tareas de respuesta corta solo al final mismo de su asignación de cómputo, sin lograr ningún progreso que cumpliera las reglas en las tareas de programación. Epoch ve el avance tardío como una débil señal de que más tiempo de cómputo podría ayudar, aunque Fable 5 ni siquiera usó la mitad de su presupuesto.

Progreso de GPT-5.6 Sol representado frente al gasto acumulado en GPU. En las tareas de respuesta corta (turquesa), el salto ocurre justo antes de que se agote el presupuesto. En las tareas de programación (rosa), la puntuación que cumple las reglas se mantiene en cero, y solo los cambios fuera de alcance producen alguna ganancia (línea discontinua). | Imagen: Epoch AI

Epoch también señala que los modelos líderes de hace un año habrían tenido un desempeño mucho peor en la misma prueba, y la organización planea repetir InnovationEval regularmente con nuevas tareas. Hasta entonces, la mayor brecha sigue siendo la disciplina epistémica: comprobar escepticamente los propios hallazgos, divulgar las incertidumbres y tomar en serio los resultados negativos.

Noticias de IA sin exageración – Curadas por humanos

Suscríbete a THE DECODER para leer sin anuncios, un boletín semanal de IA, nuestro informe exclusivo de frontera "AI Radar" seis veces al año, acceso completo al archivo y acceso a nuestra sección de comentarios.

Sigue leyendo para ver el panorama completo.
Suscríbete para una cobertura sin exageraciones.

  • Acceso completo a todos los artículos de THE DECODER
  • Sin anuncios
  • Únete a los comentarios y discusiones de la comunidad
  • Un resumen semanal de noticias de IA por correo
  • 6 veces al año: «AI Radar» — análisis en profundidad de los temas de IA que más importan
  • Noticias diarias de IA, siempre al día
  • Nuestro archivo completo de diez años
  • Cubierto por un equipo con más de 10 años en IA
Suscríbete a The Decoder
Fuente original

The Decoder

Notas sobre el contenido

La publicación original y los derechos pertenecen a la fuente.

Traducción automática · Consulte el original