MarkTechPostActualizado el

El sistema de revisión por pares del LLM de Sakana AI captura el 73% de los errores en afirmaciones fundamentales

El artículo de TMLR de Sakana AI presenta Multi-Layered Review, un revisor basado en Claude con 3 agentes, y un benchmark de contradicciones con 1,164 errores. MLR detectó el 73.43% de los errores en afirmaciones clave…

Sakana AI ha publicado Beyond Imitation, un artículo de investigación TMLR sobre la revisión por pares asistida por LLM, centrada en la detección de errores. La mayoría de los revisores de IA se evalúan según qué tan estrechamente copian las revisiones humanas. Este trabajo plantea una pregunta más difícil: ¿puede un revisor de IA encontrar un error intencionado? El equipo de investigación presenta dos componentes: un Contradiction Benchmark y un sistema de Revisión Multicapa (MLR). Para los desarrolladores que construyen agentes de investigación, esta lección es práctica. Tanto el diseño del sistema como la elección del modelo contribuyen a la detección de errores.

TL;DR

  • Tamaño: 1,164 contradicciones insertadas en 257 artículos de 5 revistas. MLR puede leer hasta 10 páginas del texto principal.
  • Funciona con: Modelos de API disponibles en el mercado (Claude Sonnet 4, Claude Haiku 3.5). Sin GPU, sin ajuste fino. Alrededor de $0.47 por revisión.
  • Rendimiento: La mayor detección de errores entre los 4 sistemas probados, con puntajes alineados con los estándares humanos.
  • Mejor: Se detectaron el 73.43% de los errores en afirmaciones clave con 4 reseñas, en comparación con el 14.81% en el mejor nivel base.
  • Peor: Solo el 16.11% de coincidencias exactas en los artículos reales retraídos en arXiv.
  • Conclusión:
    • Mejor: lee antes de juzgar, y encuentra muchos errores más graves.
    • Peor: sigue cayendo ante la inyección de prompt oculta.

¿Qué es la Revisión Multicapa?

La Revisión Multicapa es un sistema de revisión de IA agentica de Sakana AI que comprende un artículo de investigación antes de criticarlo. Utiliza 3 agentes en modelos Claude disponibles comercialmente:

  • Apéndice Agente (Claude Haiku 3.5): resume los experimentos y los detalles de implementación del apéndice.
  • Agente de Revisión de Literatura (Claude Sonnet 4): utiliza búsqueda en la web para situar el artículo dentro del trabajo previo. Es opcional.
  • Agente de revisión (Claude Sonnet 4): ejecuta una cadena de prompts de 3 pasos inspirada en el enfoque de tres pasos de Keshav.

El Paso 1 escribe un esquema de alto nivel. El Paso 2 lee en detalle y señala debilidades, suposiciones y lagunas. El Paso 3 fusiona todas las salidas del agente en Fortalezas, Debilidades, Preguntas, Recomendaciones, Puntuación y una lista de tareas por hacer. El PDF se pasa directamente, por lo que las figuras y ecuaciones se conservan.

¿Cómo funciona el benchmark de contradicción?

Las plantas de prueba introducen errores en artículos reales y verifican si los revisores los detectan. El equipo de investigación recopiló 257 artículos con licencia CC-licensed de ACL, AISTATS, CVPR y ICML 2025, además de NeurIPS 2024.

Gemini 2.5 Pro crea un grafo de conocimiento de las afirmaciones, pruebas y métodos de cada artículo. La distancia entre los nodos desde la “afirmación principal” determina la severidad. Una distancia de 0 corresponde a una afirmación central; distancias mayores corresponden a detalles. GPT-4.1 luego reescribe 1 nodo por cada distancia en una contradicción, generando 1,164 puntos de datos.

Un juez O3 califica cada revisión 10 veces. En papeles limpios, alcanza una precisión del 99.9%. Mostró una sensibilidad del 86.8% en las capturas confirmadas manualmente, por lo que los puntajes reportados pueden ser conservadores.

¿Qué tan bien MLR detecta los errores?

MLR lideró cada línea base en el benchmark. Con 4 revisiones, identificó el 73.43% de las contradicciones a distancia 0 y el 40.95% en total. La mejor línea base, AgentReview, identificó el 14.81% a distancia 0. Una sola revisión de MLR también identificó el 60.79%.

La ablación separa el modelo del diseño. Al reemplazar GPT-4.1 por Claude Sonnet 4 dentro de LLM-Review, la detección de distancia-0 aumentó de 14.56% a 35.40%. El diseño de MLR añadió aproximadamente 25 puntos más en una sola revisión. La precisión disminuye a medida que aumenta la distancia del nodo, lo que respalda el scoring de severidad.

En los artículos realmente retraídos de WithdrarXiv-Check (211 artículos), el aumento disminuye. MLR obtuvo un 26.07% en coincidencias ‘similares’ y un 16.11% en coincidencias ‘exactas’. Las líneas base más fuertes obtuvieron un 18.48% y un 9.00%.

¿El MLR está de acuerdo con los revisores humanos?

En cuanto a las puntuaciones, en su mayoría, sí. En las presentaciones para ICLR 2025, las puntuaciones predichas por MLR alcanzaron una correlación de Pearson de 0.586 con las puntuaciones humanas. La referencia entre humanos y humanos fue de 0.742. En ICML 2025, el revisor de IA lo superó, con 0.439 frente a 0.429.

En el enfoque, no. MLR enfatiza la validez y los experimentos, mientras que los humanos valoran más la claridad y la novedad. Los autores lo presentan como una perspectiva complementaria, no como un reemplazo.

¿Cuánto cuesta el funcionamiento?

El MLR cuesta aproximadamente $0.47 por revisión, excluyendo el agente de literatura opcional. Utiliza 189,062 tokens de entrada, aproximadamente la mitad de los 403,654 del IA Reviewer. La variante con un solo prompt redujo el costo en aproximadamente dos tercios. Su detección disminuyó unos 3.5 puntos en un subconjunto del benchmark.

¿Cómo se compara MLR con otros revisores de IA?

CaracterísticaMLR (Sakana AI)LLM-ReviewRevisor de IAAgentReview
LLM utilizado en este estudioClaude Sonnet 4 + Haiku 3.5GPT-4.1o4-miniGPT-4o
Diseño3 agentes, cadena de 3 pasosPrompt único, texto truncado5-revisión de conjunto, meta-revisión, reflexiónRoles de revisor, autor y presidente de área
Punto de referencia de contradicción, completo40.95% (4 reseñas)6.39%6.50%5.95%
Errores en las afirmaciones centrales (distancia 0)73.43%14.56%11.17%14.81%
WithdrarXiv-Check, similar / exact26.07% / 16.11%5.21% / 2.37%13.74% / 9.00%18.48% / 5.69%
ICLR 2025 Pearson contra humano0.586-0.0130.5380.195
Tokenes de entrada por reseña189,0626,517403,654310,964
Costo por reseña~$0.47~$0.01~$0.49~$0.81
Abrir códigoPor solicitudSíSíSí

Todos los datos de referencia, correlaciones, tokens y costos provienen del artículo Beyond Imitation.

Conceptos Clave

  • Sakana AI evalúa a los revisores de IA en cuanto a la detección de errores, no en la copia de humanos.
  • MLR detectó el 73.43% de los errores en las afirmaciones clave, aproximadamente 5 veces más que el mejor umbral de referencia.
  • El intercambio de modelos y el diseño de 3 pasos aportan grandes ganaciones en detección.
  • Los errores en los artículos realmente retraídos siguen siendo difíciles: 16.11% de coincidencias exactas.
  • La inyección de prompts ocultos sigue afectando a todos los revisores de IA que se han probado.


Echa un vistazo al artículo aquí. Todo el crédito pertenece al investigador de este proyecto. Además, no dudes en seguirnos en Twitter y, por supuesto, únete a nuestro subreddit de 150k+ ML y suscríbete a nuestro boletín informativo. ¡Espera! ¿Estás en Telegram? Ahora puedes unirte a nosotros en Telegram también.

El artículo El sistema de revisión entre pares de LLM de Sakana AI detecta el 73% de los errores en las afirmaciones clave apareció primero en MarkTechPost.

Fuente original

MarkTechPost

Notas sobre el contenido

La publicación original y los derechos pertenecen a la fuente.

Traducción automática · Consulte el original