La production de plus de tokens de sortie ne se traduit pas nécessairement par une note plus élevée. Les scores de GPT-6 Astra (max) sont de 8,6 % pour environ 81 000 tokens de sortie par tâche, soit moins de la moitié de ceux de Grok à 4,7 % (xhigh) avec 180 000 tokens. Trois modèles Claude ont produit le plus de tokens de sortie (~202 000 à ~562 000 par tâche) et obtiennent des scores de 2,8 % à 6,4 %.

