The Decoder

Les équipes d’agents IA gaspillent de nombreux tokens pour des améliorations de qualité à peine perceptibles, selon la recherche

Les équipes d’agents d’IA ne surpassent que faiblement les agents solos, mais coûtent jusqu’à 5,1 fois plus, selon Vals AI. Seulement un quart des tests avec GPT-6 Sol et Claude Opus 5,5 ont montré une amélioration…

Matthias Bastian
Source de l’image · The Decoder

Les équipes d’agents IA gaspillent de nombreux tokens pour des améliorations de qualité à peine perceptibles, selon la recherche

Matthias Bastian Matthias Bastian Voir le profil LinkedIn de Matthias Bastian 11 oct. 2026 Image description

Les équipes d’agents IA ne produisent presque aucun résultat meilleur que celui des agents individuels, selon la recherche.

L’entreprise Evals Vals AI a testé GPT-6 Sol et Claude Opus 5.5 sur le « Vibe Code Bench », tant seule que en équipe, à deux niveaux de raisonnement : effort moyen et effort maximal. Les équipes coûtent entre 1,8x et 5,1x plus que des agents individuels.

D’après quatre comparaisons entre équipes et agents indépendants, seule une montrait une amélioration statistiquement significative : GPT-6 Sol en raisonnement moyen, où l’équipe a obtenu 7,3 points de plus. En raisonnement maximal, la configuration d’équipe n’a donné aucune véritable avantage à Sol ou Opus de 5,5. Les résultats indiquent que le coût supplémentaire lié aux équipes d’agents ne vaut pas la peine dans la plupart des cas, en particulier lorsque les modèles sont déjà en fonctionnement à pleine puissance.

Les critères de mesure de Vals AI montrent le coût par application par rapport au score sur Vibe Code Bench. Les flèches indiquent le rôle du seul agent d’un modèle vers son équipe, avec le même effort de raisonnement. Les équipes coûtent beaucoup plus, mais ne améliorent que faiblement les scores. | Image : Vals AI
Anthropic a constaté que les gains en qualité diminuaient à mesure qu’elle ajoutait plus d’agents dans deux de ses propres tests avec Opus 5.5. Les équipes plus grandes atteignaient un niveau de performance donné plus rapidement, mais passer de dix à 100 agents ne a augmenté les scores que légèrement après 24 heures. Dans des tests ProgramBench distincts, les gains en vitesse étaient associés à une utilisation plus élevée de tokens.

Tâche avec Opus 5.5 1 agent 10 agents 30 agents 100 agents
Base de connaissances 0.53 0.70 0.71 0.74
Théorème de Lean de démonstration 0.39 0.66 0.66 0.68

Le Fable 5.1 a montré des gains de qualité plus importants dans l’épreuve de démonstration de théorèmes Lean avec plus de dix agents, mais reste inférieur à Opus 5.5 selon toutes les tests. Pour l’épreuve de base de connaissances, la note de Fable a en fait légèrement baissé lors de la passage de 30 à 100 agents.

Plus d’agents achètent de vitesse, mais pas de meilleure sortie

Le chercheur d’OpenAI Noam Brown a confirmé dans le podcast Dwarkesh que les systèmes à plusieurs agents privilégient principalement la vitesse, plutôt qu’une meilleure qualité. Quatre agents résolvent les tâches deux fois plus rapidement, mais coûtent également deux fois plus cher. Avec 16 agents, ce phénomène persiste, mais l’efficacité diminue légèrement.

L’effet dépend fortement de la tâche. La recherche en ligne et les mathématiques se bien parallèlent, mais écrire un roman ne le fait pas, a-t-il dit. Lancer 10 000 agents sur un roman serait tout aussi inutile que lancer 10 000 personnes sur lui. Brown a reconnu que la mise en œuvre avec de très grands nombreux agents reste largement inexplorée, car les coûts sont simplement trop élevés.

Le développeur d’OpenAI Eric Provencher a récemment averti contre l’utilisation de nuées d’agents pour exactement cette raison. Selon lui, il s’agit très probablement d’un gaspillage d’argent, car la coordination entre les agents se dégrade. Il a appelé cela le « coût de coordination ».

Nouvelles en IA Sans Hype – Sélectionnées par des humains

Abonnez-vous à THE DECODER pour une lecture sans publicités, un bulletin hebdomadaire sur l’IA, notre rapport exclusif « AI Radar » six fois par an, accès complet à l’archive et accès à notre section de commentaires.

Lisez plus haut pour obtenir une vue complète.
Abonnez-vous pour une couverture sans hype.

  • Accès complet à chaque article sur THE DECODER
  • Aucun annonce
  • Rejoignez les commentaires et les discussions communautaires
  • Rapport hebdomadaire sur les nouvelles IA par courrier
  • 6 fois par an : « AI Radar » – des analyses approfondies sur les sujets d’IA les plus importants
  • Actualités sur l’IA quotidiennes, toujours à jour
  • Notre archive complète sur dix ans
  • Couvert par une équipe ayant plus de 10 ans d’expérience en IA
。 S’abonner à The Decoder
Source originale

The Decoder

À propos du contenu

La publication originale et les droits appartiennent à la source.

Traduction automatique · Consultez l’original