Generar más tokens de salida no se traduce necesariamente en una puntuación más alta. GPT-6 Astra (max) obtiene un 8.6% con ~81k de tokens de salida por tarea, menos de la mitad de los ~180k de Grok 4.7 (xhigh). Tres modelos de Claude generaron la mayor cantidad de tokens de salida (~202k a ~562k por tarea) y obtienen entre un 2.8% y un 6.4%.

