Les équipes d’agents IA gaspillent de nombreux tokens pour des améliorations de qualité à peine perceptibles, selon la recherche
Matthias Bastian
Voir le profil LinkedIn de Matthias Bastian
11 oct. 2026

Les équipes d’agents IA ne produisent presque aucun résultat meilleur que celui des agents individuels, selon la recherche.
L’entreprise Evals Vals AI a testé GPT-6 Sol et Claude Opus 5.5 sur le « Vibe Code Bench », tant seule que en équipe, à deux niveaux de raisonnement : effort moyen et effort maximal. Les équipes coûtent entre 1,8x et 5,1x plus que des agents individuels.
D’après quatre comparaisons entre équipes et agents indépendants, seule une montrait une amélioration statistiquement significative : GPT-6 Sol en raisonnement moyen, où l’équipe a obtenu 7,3 points de plus. En raisonnement maximal, la configuration d’équipe n’a donné aucune véritable avantage à Sol ou Opus de 5,5. Les résultats indiquent que le coût supplémentaire lié aux équipes d’agents ne vaut pas la peine dans la plupart des cas, en particulier lorsque les modèles sont déjà en fonctionnement à pleine puissance.

| Tâche avec Opus 5.5 | 1 agent | 10 agents | 30 agents | 100 agents |
|---|---|---|---|---|
| Base de connaissances | 0.53 | 0.70 | 0.71 | 0.74 |
| Théorème de Lean de démonstration | 0.39 | 0.66 | 0.66 | 0.68 |
Le Fable 5.1 a montré des gains de qualité plus importants dans l’épreuve de démonstration de théorèmes Lean avec plus de dix agents, mais reste inférieur à Opus 5.5 selon toutes les tests. Pour l’épreuve de base de connaissances, la note de Fable a en fait légèrement baissé lors de la passage de 30 à 100 agents.
Plus d’agents achètent de vitesse, mais pas de meilleure sortie
Le chercheur d’OpenAI Noam Brown a confirmé dans le podcast Dwarkesh que les systèmes à plusieurs agents privilégient principalement la vitesse, plutôt qu’une meilleure qualité. Quatre agents résolvent les tâches deux fois plus rapidement, mais coûtent également deux fois plus cher. Avec 16 agents, ce phénomène persiste, mais l’efficacité diminue légèrement.
L’effet dépend fortement de la tâche. La recherche en ligne et les mathématiques se bien parallèlent, mais écrire un roman ne le fait pas, a-t-il dit. Lancer 10 000 agents sur un roman serait tout aussi inutile que lancer 10 000 personnes sur lui. Brown a reconnu que la mise en œuvre avec de très grands nombreux agents reste largement inexplorée, car les coûts sont simplement trop élevés.
Le développeur d’OpenAI Eric Provencher a récemment averti contre l’utilisation de nuées d’agents pour exactement cette raison. Selon lui, il s’agit très probablement d’un gaspillage d’argent, car la coordination entre les agents se dégrade. Il a appelé cela le « coût de coordination ».
Nouvelles en IA Sans Hype – Sélectionnées par des humains
Abonnez-vous à THE DECODER pour une lecture sans publicités, un bulletin hebdomadaire sur l’IA, notre rapport exclusif « AI Radar » six fois par an, accès complet à l’archive et accès à notre section de commentaires.
Lisez plus haut pour obtenir une vue complète.
Abonnez-vous pour une couverture sans hype.
- Accès complet à chaque article sur THE DECODER
- Aucun annonce
- Rejoignez les commentaires et les discussions communautaires
- Rapport hebdomadaire sur les nouvelles IA par courrier
- 6 fois par an : « AI Radar » – des analyses approfondies sur les sujets d’IA les plus importants
- Actualités sur l’IA quotidiennes, toujours à jour
- Notre archive complète sur dix ans
- Couvert par une équipe ayant plus de 10 ans d’expérience en IA
