MarkTechPostMis à jour le

Le système de revue par les pairs basé sur LLM de Sakana AI détecte 73 % des erreurs de revendications principales

L’article de Sakana AI publié dans TMLR présente Multi-Layered Review, un évaluateur basé sur Claude à 3 agents, et un Contradiction Benchmark de 1,164 erreurs. MLR a détecté 73.43 % des erreurs de revendications…

Sakana AI a publié Beyond Imitation, un article de recherche dans TMLR sur la revue par les pairs assistée par LLM, centré sur la détection d’erreurs. La plupart des évaluateurs IA sont évalués selon la proximité de leurs critiques avec celles des humains. Ce travail pose une question plus difficile : un évaluateur IA peut-il trouver une erreur volontairement insérée ? L’équipe de recherche livre deux éléments : un Contradiction Benchmark et un système Multi-Layered Review (MLR). Pour les développeurs qui construisent des agents de recherche, la leçon est pratique. La conception du système comme le choix du modèle influencent la détection d’erreurs.

TL;DR

  • Taille : 1,164 contradictions insérées dans 257 articles issus de 5 conférences. MLR lit jusqu’à 10 pages de texte principal.
  • Fonctionne avec : des modèles d’API disponibles dans le commerce (Claude Sonnet 4, Claude Haiku 3.5). Pas de GPU, pas de fine-tuning. Environ 0,47 $ par revue.
  • Performance : la meilleure détection d’erreurs des 4 systèmes testés, avec des scores alignés sur ceux des humains.
  • Le meilleur : a détecté 73,43 % des erreurs de revendications principales avec 4 revues, contre 14,81 % pour le meilleur système de référence.
  • Le pire : seulement 16,11 % de correspondances exactes sur de vrais articles arXiv rétractés.
  • En résumé :
    • Le meilleur : lit avant de juger, et trouve bien plus d’erreurs sérieuses.
    • Le pire : tombe encore dans le piège des injections de prompt cachées.

Qu’est-ce que Multi-Layered Review ?

Multi-Layered Review est un système de revue par IA agentique de Sakana AI qui comprend un article de recherche avant de le critiquer. Il utilise 3 agents sur des modèles Claude disponibles dans le commerce:

  • Agent des annexes (Claude Haiku 3.5) : résume les expériences et les détails d’implémentation tirés des annexes.
  • Agent de revue de littérature (Claude Sonnet 4) : utilise la recherche web pour situer l’article dans les travaux antérieurs. Il est optionnel.
  • Agent d’évaluation (Claude Sonnet 4) : exécute une chaîne de prompts en 3 passes inspirée de l’approche des trois passes de Keshav.

La passe 1 rédige un plan général. La passe 2 lit en détail et signale les faiblesses, les hypothèses et les lacunes. La passe 3 fusionne les sorties de tous les agents en Points forts, Points faibles, Questions, Recommandation, Score et une liste de tâches à faire. Le PDF est transmis directement, si bien que les figures et les équations sont préservées.

Comment fonctionne le Contradiction Benchmark ?

Ce benchmark insère des erreurs dans de vrais articles et vérifie si les relecteurs les détectent. L'équipe de recherche a collecté 257 articles sous licence CC issus d'ACL, AISTATS, CVPR et ICML 2025, ainsi que de NeurIPS 2024.

Gemini 2.5 Pro construit un graphe de connaissances des affirmations, preuves et méthodes de chaque article. La distance d'un nœud par rapport à une « affirmation principale » définit la gravité. Une distance 0 touche une affirmation centrale ; des distances plus grandes touchent des détails. GPT-4.1 réécrit ensuite 1 nœud par distance en une contradiction, produisant 1,164 points de données.

Un juge o3 note chaque relecture 10 fois. Sur des articles propres, il a atteint une précision de 99.9%. Il a montré une sensibilité de 86.8% sur les détections confirmées manuellement, donc les scores rapportés peuvent être conservateurs.

Dans quelle mesure MLR détecte-t-il les erreurs ?

MLR a surpassé toutes les bases de référence sur le benchmark. Avec 4 relectures, il a détecté 73.43% des contradictions de distance 0 et 40.95% au global. La meilleure base de référence, AgentReview, a détecté 14.81% à distance 0. Une seule relecture de MLR a quand même détecté 60.79%.

Une ablation sépare le modèle de la conception. En remplaçant GPT-4.1 par Claude Sonnet 4 dans LLM-Review, la détection à distance 0 est passée de 14.56% à 35.40%. La conception de MLR a ajouté environ 25 points supplémentaires sur une seule relecture. La précision diminue à mesure que la distance des nœuds augmente, ce qui conforte le scoring de gravité.

Sur de vrais articles retirés de WithdrarXiv-Check (211 articles), les gains diminuent. MLR a obtenu 26.07% sur les correspondances « similar » et 16.11% sur les correspondances « exact ». Les meilleures bases de référence ont obtenu 18.48% et 9.00%.

MLR est-il en accord avec les relecteurs humains ?

Sur les notes, en grande partie oui. Sur les soumissions d'ICLR 2025, les notes prédites par MLR ont atteint une corrélation de Pearson de 0.586 avec les notes humaines. La référence humain-à-humain était de 0.742. Sur ICML 2025, l'AI Reviewer l'a légèrement dépassé, 0.439 contre 0.429.

Sur le focus, non. MLR insiste sur la validité et les expériences, tandis que les humains pèsent davantage la clarté et la nouveauté. Les auteurs présentent cela comme une perspective complémentaire, et non un remplacement.

Combien cela coûte-t-il à l'exécution ?

MLR coûte environ $0.47 par relecture, hors agent de littérature optionnel. Il utilise 189,062 tokens d'entrée, soit environ la moitié des 403,654 de l'AI Reviewer. Une variante à prompt unique a réduit le coût d'environ deux tiers. Sa détection a chuté d'environ 3.5 points sur un sous-ensemble du benchmark.

Comment MLR se compare-t-il aux autres réviseurs IA ?

CaractéristiqueMLR (Sakana AI)LLM-ReviewAI ReviewerAgentReview
LLM utilisé dans cette étudeClaude Sonnet 4 + Haiku 3.5GPT-4.1o4-miniGPT-4o
Conception3 agents, chaîne à 3 passesPrompt unique, texte tronquéEnsemble de 5 reviews, méta-review, réflexionRôles de relecteur, d'auteur et de président de zone (area chair)
Contradiction Benchmark, complet40.95% (4 reviews)6.39%6.50%5.95%
Erreurs sur les affirmations principales (distance 0)73.43%14.56%11.17%14.81%
WithdrarXiv-Check, similaire / exact26.07% / 16.11%5.21% / 2.37%13.74% / 9.00%18.48% / 5.69%
ICLR 2025 Pearson vs humain0.586-0.0130.5380.195
Tokens d'entrée par review189,0626,517403,654310,964
Coût par review~$0.47~$0.01~$0.49~$0.81
Code ouvertSur demandeOuiOuiOui

Toutes les figures de benchmark, de corrélation, de tokens et de coûts proviennent de l' article Beyond Imitation.

Points clés à retenir

  • Sakana AI évalue ses réviseurs IA sur la détection d'erreurs, pas sur l'imitation des humains.
  • MLR a détecté 73,43 % des erreurs de revendications principales, soit environ 5 fois mieux que la meilleure référence.
  • L'échange de modèle et la conception à 3 passes apportent chacun de gros gains de détection.
  • Les erreurs sur de vrais articles retirés restent difficiles : 16.11% de correspondances exactes.
  • L'injection de prompts cachée influence encore tous les évaluateurs IA testés.


Découvrez l'article ici. Tout le mérite revient au chercheur de ce projet. N'hésitez pas également à nous suivre sur Twitter et n'oubliez pas de rejoindre notre SubReddit ML de plus de 150k et de nous abonner à notre Newsletter. Attention ! êtes-vous sur telegram ? vous pouvez désormais nous rejoindre également sur telegram.

L'article Le système de peer review LLM de Sakana AI détecte 73% des erreurs de revendications principales est applué pour la première fois sur MarkTechPost.

Source originale

MarkTechPost

À propos du contenu

La publication originale et les droits appartiennent à la source.

Traduction automatique · Consultez l’original