Die Erzeugung mehr Ausgabetoken führt nicht unbedingt zu einer höheren Punktzahl. Die GPT-6 Astra (max) erzielt eine Punktzahl von 8,6% bei etwa 81k Ausgabetoken pro Aufgabe, was weniger als die Hälfte der ~180k von Grok 4,7 (xhigh) ist. Drei Claude-Modelle erzeugten die meisten Ausgabetoken (~202k bis ~562k pro Aufgabe) und erzielten Punktzahlen zwischen 2,8% und 6,4%.

