Des agents d'IA surestiment leurs résultats et restent loin de la recherche autonome, selon une étude
Manuel Uth
11 oct. 2026
Nano Banana Pro sollicité par THE DECODER
Les résultats d'Epoch AI et d'Anthropic montrent que les modèles d'IA peuvent mener des expériences mais manquent d'autocritique scientifique et de véritable pensée créative.
Les grands laboratoires d'IA commercialisent de plus en plus leurs modèles comme des outils de recherche. Google DeepMind a étendu son Co-Scientist en un système de recherche complet, et OpenAI a présenté un «stagiaire de recherche automatisé» dès le mois de septembre. D'ici mars 2028, ce stagiaire est censé devenir un chercheur en IA autonome sous supervision humaine, mais une capacité clé semble encore manquer : le jugement scientifique.
Les agents ont été invités à inventer une nouvelle méthode d'entraînement
Avec son benchmark « InnovationEval » , Epoch AI a testé si des agents d'IA pouvaient mener des recherches de manière autonome. La tâche consistait à inventer une nouvelle méthode d'amélioration des modèles de langage après leur entraînement initial, puis à la mettre en œuvre, la tester et l'affiner de façon indépendante.
Le point de départ était GRPO, une technique largement utilisée. GRPO compare plusieurs réponses qu'un modèle génère pour une même tâche et récompense les meilleures, en notant généralement chaque solution dans son ensemble. La méthode de référence conçue par les humains, SDPO, utilise des signaux supplémentaires comme des messages d'erreur pour créer un retour d'apprentissage plus précis pour les étapes individuelles d'une réponse, si bien que le modèle devient en quelque sorte son propre enseignant.
Epoch a testé Claude Fable 5 et GPT-5.6 Sol, qui, selon l'organisation, n'avaient aucune connaissance préalable de SDPO. Les performances ont été mesurées sur des tâches à réponse courte comme des questions scientifiques et sur des tâches de codage, chaque agent ayant accès à jusqu'à 3,000 heures de calcul sur des puces haut de gamme, mais sans accès à Internet.
Les deux modèles ont recyclé des techniques connues au lieu d'innover
Aucun des deux modèles n'a approché la référence humaine. GPT-5.6 Sol a ciblé une faiblesse de GRPO : lorsque toutes les réponses à une tâche sont correctes, le modèle n'apprend rien parce qu'il n'y a rien à comparer. Sol a fait renforcer au modèle ses solutions réussies dans ces cas-là, mais l'idée n'était pas nouvelle.
Mesuré par rapport à l'amélioration que SDPO apporte à GRPO, Sol a obtenu environ 35 pour cent avec une notation généreuse, selon Epoch. En ne comptant que les changements respectant les règles de l'expérience, ce chiffre tombe à environ 15 pour cent. Sur les tâches de codage, Sol a surtout rendu l'entraînement plus coûteux et plus lent plutôt que d'améliorer la méthode elle-même.
Claude Fable 5 a fait réessayer au modèle les tâches échouées tout en lui fournissant les tentatives précédentes ayant échoué, ce qui est également une technique bien connue et n'a produit aucune amélioration mesurable. Même le succès partiel de Sol ne serait guère considéré comme « modérément intéressant » par les experts, selon Epoch. Les modèles plus récents qui connaissaient SDPO grâce à leurs données d'entraînement n'ont pas non plus pu le reproduire pleinement. GPT-6 Astra a construit une solution similaire mais n'a pas révélé sa source, et même avec l'article original sous les yeux, Fable 5 est resté en deçà de la référence.
Les agents ont trié sur le volet leurs meilleures exécutions et ont enterré le reste
Les deux agents avaient également un problème de reporting. Ils ont exécuté plusieurs cycles d'entraînement quasi identiques et n'ont signalé que le meilleur résultat à chaque fois, ce qui donne à une méthode l'apparence d'être plus performante qu'elle ne l'est réellement, car les résultats fluctuent de manière aléatoire. Dans leurs rapports finaux, les modèles ont à peine mentionné cette pratique, si tant est qu'ils l'aient fait, et ils ont également omis de citer les travaux antérieurs sur lesquels leurs méthodes s'appuyaient. Leurs chiffres auto-déclarés étaient en conséquence élevés : Sol revendiquait environ 70 pour cent de l'amélioration SDPO, Fable 5 environ 40 pour cent. Epoch a éliminé ces gains gonflés.

Les journaux de raisonnement interne des modèles montrent qu'ils étaient conscients du problème, Fable 5 décrivant ses exécutions répétées comme une recherche d'un meilleur checkpoint. Epoch laisse ouvert la question de savoir s'il s'agit de tricherie délibérée ou de confusion.
Pour GPT-5.6 Sol, le comportement correspond à une conclusion antérieure de l'organisation d'évaluation METR, qui avait détecté davantage de tentatives de triche de la part de ce modèle lors de son propre test de codage que de la part de tout autre modèle publiquement disponible qu'elle avait évalué.
Epoch conclut que les humains devraient examiner intégralement toutes les recherches générées par l'IA, ce qui réduit l'utilité des modèles.
Anthropic relève les mêmes faiblesses dans son propre modèle
Anthropic décrit des limitations similaires dans la fiche système de Claude Opus 5.5. Le modèle est loin de remplacer les chercheurs de l'entreprise elle-même, indique Anthropic, les principaux problèmes résidant dans la « qualité épistémique » et le suivi des instructions.
Opus 5.5 présente des hypothèses non vérifiées comme des faits et écarte ses propres doutes plus souvent que les modèles antérieurs. Il décrit des vérifications partielles comme des vérifications complètes, transforme des évaluations préliminaires en recommandations sans contre-vérification, et traite les critiques de manière trop étroite sans remettre en question l'approche globale. Il privilégie également de petits ajustements incrémentaux et s'en tient aux études publiées plutôt que de développer de nouvelles idées.
Une étude impliquant l'université de Princeton et le Safety Institute britannique est parvenue à des conclusions similaires. Elle a fait travailler Claude Opus 4.8 pendant six jours sur les questions de recherche sous-tendant deux articles non publiés de la conférence IA NeurIPS, et les auteurs originaux ont rejeté les deux résultats lors de leur révision. Lorsque les hypothèses initiales échouaient, les agents se contentaient d'adoucir leurs affirmations au lieu de recommencer à zéro.
L'exécution technique est de plus en plus le moindre problème, car ce qui manque le plus aux agents, c'est la capacité d'évaluer de manière réaliste le niveau de confiance qu'ils devraient avoir dans un résultat et de remettre en question leur propre approche à un niveau fondamental.
Plus de calcul seul ne comblera pas l'écart
L'IA n'est pas inutile pour la recherche, car les modèles peuvent accélérer la revue de littérature, écrire du code et explorer des variantes plus vite que les humains.
Mais savoir si injecter plus de calcul au problème produira des chercheurs autonomes reste une question ouverte. GPT-5.6 Sol a utilisé l'intégralité de son budget, ne trouvant son amélioration sur les tâches à réponse courte qu'à la toute fin de son allocation de calcul tout en ne réalisant aucun progrès conforme aux règles sur les tâches de codage. Epoch considère cette percée tardive comme un indice faible selon lequel plus de temps de calcul pourrait aider, bien que Fable 5 n'ait même pas utilisé la moitié de son budget.

Epoch note également que les meilleurs modèles d'il y a un an auraient obtenu des résultats bien pires au même test, et l'organisation prévoit de répéter régulièrement InnovationEval avec de nouvelles tâches. D'ici là, le plus grand écart demeure la discipline épistémique : vérifier ses propres conclusions avec scepticisme, divulguer les incertitudes et prendre au sérieux les résultats négatifs.
L'actualité de l'IA sans le battage – Sélectionné par des humains
Abonnez-vous à THE DECODER pour une lecture sans publicité, une newsletter IA hebdomadaire, notre rapport exclusif « AI Radar » sur la frontière six fois par an, un accès complet aux archives et l'accès à notre section de commentaires.
Lisez la suite pour une vue d'ensemble complète.
Abonnez-vous pour une couverture sans battage.
- Accès complet à chaque article de THE DECODER
- Aucune publicité
- Participez aux commentaires et aux discussions de la communauté
- Un récapitulatif hebdomadaire de l'actualité de l'IA par e-mail
- 6 fois par an : « AI Radar » — des analyses approfondies des sujets de l'IA qui comptent le plus
- Actualités IA quotidiennes, toujours à jour
- L'intégralité de nos archives de dix ans
- Couvertures réalisées par une équipe forte de plus de 10 ans d'expérience dans l'IA
