The Decoder

Los equipos de agentes de IA desperdician cantidades masivas de tokens por mejoras en calidad apenas medibles, según los estudios.

Los equipos de agentes de IA apenas superan a los agentes solos, pero cuestan hasta 5.1 veces más, según Vals AI. Solo uno de cuatro tests con GPT-6 Sol y Claude Opus 5.5 mostró un beneficio medible. Los propios datos de…

Matthias Bastian
Fuente de la imagen · The Decoder

Los equipos de agentes de IA desperdician cantidades masivas de tokens por mejoras en calidad apenas medibles, según los estudios.

Matthias Bastian Matthias Bastian Ver el perfil de LinkedIn de Matthias Bastian 11 de octubre de 2026 Image description

Según las investigaciones, los equipos de agentes de IA casi no logran resultados mejores que los de un solo agente.

La empresa Evals Vals AI probó GPT-6 Sol y Claude Opus 5.5 en el “Vibe Code Bench”, tanto de forma individual como en equipos, en dos niveles de razonamiento: medio y máximo esfuerzo de razonamiento. Los equipos tienen un costo entre 1.8x y 5.1x más alto que los agentes individuales.

De cuatro comparaciones entre equipos y agentes individuales, solo una mostró una mejora estadísticamente significativa: GPT-6 Sol en razonamiento medio, donde el equipo obtuvo 7.3 puntos más. En razonamiento máximo, la configuración de equipo no proporcionó ninguna ventaja real ni a Sol ni a Opus 5.5. Los resultados sugieren que el costo adicional de los equipos de agentes no vale la pena en la mayoría de los casos, especialmente cuando los modelos ya están operando al máximo de su capacidad computacional.

El benchmark de Vals AI muestra el costo por aplicación en comparación con la puntuación en Vibe Code Bench. Las flechas apuntan desde el agente individual de cada modelo hacia su equipo, con el mismo esfuerzo de razonamiento. Los equipos tienen un costo mucho mayor, pero apenas mejoran la puntuación. | Imagen: Vals AI
Anthropic observó que las mejoras en calidad disminuyeron al agregar más agentes en dos de sus propios tests con Opus 5.5. Los equipos más grandes alcanzaron un nivel de rendimiento determinado más rápido, pero pasar de diez a 100 agentes solo mejoró ligeramente las puntuaciones después de 24 horas. En los tests ProgramBench separados, las mejoras en velocidad surgieron con un mayor uso de tokens.

Tarea con Opus 5.5 1 agente 10 agentes 30 agentes 100 agentes
Base de conocimientos 0.53 0.70 0.71 0.74
Teorema de Lean para la demostración 0.39 0.66 0.66 0.68

La Fable 5.1 mostró mejoras en calidad en la tarea de demostración de teoremos Lean cuando había más de diez agentes, pero aún obtuvo un puntaje inferior al de Opus 5.5 en todos los tests. En la tarea de base de conocimientos, el puntaje de Fable disminuyó ligeramente al escalar de 30 a 100 agentes.

Más agentes compran velocidad, pero no una mejor salida

El investigador de OpenAI, Noam Brown, confirmó en el podcast Dwarkesh que los sistemas de múltiples agentes buscan principalmente la velocidad, no una mejor calidad. Cuatro agentes resuelven las tareas dos veces más rápido, pero también cuestan el doble. Con 16 agentes, este patrón se mantiene, pero la eficiencia disminuye ligeramente.

El efecto depende en gran medida de la tarea. La investigación en la web y las matemáticas se paralelan bien, pero escribir un novela no lo hace, dijo. Lanzar 10,000 agentes a una novela sería tan inútil como lanzar 10,000 personas a ella. Brown reconoció que escalar a números muy grandes de agentes sigue estando en gran medida por explorar, porque los costos son simplemente demasiado altos.

El desarrollador de OpenAI, Eric Provencher, advirtió recientemente contra el uso de enjambres de agentes por exactamente este motivo. Según él, es muy probable que se desperdicie dinero, ya que la coordinación entre los agentes falla. Lo llamó el “impuesto de coordinación”.

Noticias de IA Sin Eufemismos – Se seleccionan por humanos

Suscríbase a THE DECODER para leer sin anuncios, un boletín semanal sobre IA, nuestro informe exclusivo “AI Radar” seis veces al año, acceso completo al archivo y acceso a nuestra sección de comentarios.

Lea más para ver el panorama completo.
Suscríbase para una cobertura sin emoción.

  • Acceso completo a todos los artículos en THE DECODER
  • Sin anuncios
  • Únete a los comentarios y a las discusiones de la comunidad
  • Resumen semanal de noticias sobre IA por correo
  • 6 veces al año: “AI Radar” — análisis profundos sobre los temas de IA que son más importantes
  • Noticias diarias sobre IA, siempre actualizadas
  • Nuestro archivo completo de diez años
  • Cubierto por un equipo con más de 10 años en IA
Suscribirse a The Decoder
Fuente original

The Decoder

Notas sobre el contenido

La publicación original y los derechos pertenecen a la fuente.

Traducción automática · Consulte el original