Los equipos de agentes de IA desperdician cantidades masivas de tokens por mejoras en calidad apenas medibles, según los estudios.
Matthias Bastian
Ver el perfil de LinkedIn de Matthias Bastian
11 de octubre de 2026
Según las investigaciones, los equipos de agentes de IA casi no logran resultados mejores que los de un solo agente.
La empresa Evals Vals AI probó GPT-6 Sol y Claude Opus 5.5 en el “Vibe Code Bench”, tanto de forma individual como en equipos, en dos niveles de razonamiento: medio y máximo esfuerzo de razonamiento. Los equipos tienen un costo entre 1.8x y 5.1x más alto que los agentes individuales.
De cuatro comparaciones entre equipos y agentes individuales, solo una mostró una mejora estadísticamente significativa: GPT-6 Sol en razonamiento medio, donde el equipo obtuvo 7.3 puntos más. En razonamiento máximo, la configuración de equipo no proporcionó ninguna ventaja real ni a Sol ni a Opus 5.5. Los resultados sugieren que el costo adicional de los equipos de agentes no vale la pena en la mayoría de los casos, especialmente cuando los modelos ya están operando al máximo de su capacidad computacional.

| Tarea con Opus 5.5 | 1 agente | 10 agentes | 30 agentes | 100 agentes |
|---|---|---|---|---|
| Base de conocimientos | 0.53 | 0.70 | 0.71 | 0.74 |
| Teorema de Lean para la demostración | 0.39 | 0.66 | 0.66 | 0.68 |
La Fable 5.1 mostró mejoras en calidad en la tarea de demostración de teoremos Lean cuando había más de diez agentes, pero aún obtuvo un puntaje inferior al de Opus 5.5 en todos los tests. En la tarea de base de conocimientos, el puntaje de Fable disminuyó ligeramente al escalar de 30 a 100 agentes.
Más agentes compran velocidad, pero no una mejor salida
El investigador de OpenAI, Noam Brown, confirmó en el podcast Dwarkesh que los sistemas de múltiples agentes buscan principalmente la velocidad, no una mejor calidad. Cuatro agentes resuelven las tareas dos veces más rápido, pero también cuestan el doble. Con 16 agentes, este patrón se mantiene, pero la eficiencia disminuye ligeramente.
El efecto depende en gran medida de la tarea. La investigación en la web y las matemáticas se paralelan bien, pero escribir un novela no lo hace, dijo. Lanzar 10,000 agentes a una novela sería tan inútil como lanzar 10,000 personas a ella. Brown reconoció que escalar a números muy grandes de agentes sigue estando en gran medida por explorar, porque los costos son simplemente demasiado altos.
El desarrollador de OpenAI, Eric Provencher, advirtió recientemente contra el uso de enjambres de agentes por exactamente este motivo. Según él, es muy probable que se desperdicie dinero, ya que la coordinación entre los agentes falla. Lo llamó el “impuesto de coordinación”.
Noticias de IA Sin Eufemismos – Se seleccionan por humanos
Suscríbase a THE DECODER para leer sin anuncios, un boletín semanal sobre IA, nuestro informe exclusivo “AI Radar” seis veces al año, acceso completo al archivo y acceso a nuestra sección de comentarios.
Lea más para ver el panorama completo.
Suscríbase para una cobertura sin emoción.
- Acceso completo a todos los artículos en THE DECODER
- Sin anuncios
- Únete a los comentarios y a las discusiones de la comunidad
- Resumen semanal de noticias sobre IA por correo
- 6 veces al año: “AI Radar” — análisis profundos sobre los temas de IA que son más importantes
- Noticias diarias sobre IA, siempre actualizadas
- Nuestro archivo completo de diez años
- Cubierto por un equipo con más de 10 años en IA
