出力トークンをより多く生成しても、必ずしも高いスコアにつながるわけではありません。GPT-6 Astra (max) はタスクあたり約81kの出力トークンで8.6%のスコアを記録しています。これは Grok 4.7 (xhigh) の約180kの半分以下です。3つの Claude モデルは最も多くの出力トークン(タスクあたり約202k〜約562k)を生成しましたが、スコアは2.8%〜6.4%にとどまっています。


出力トークンをより多く生成しても、必ずしも高いスコアにつながるわけではありません。GPT-6 Astra (max) はタスクあたり約81kの出力トークンで8.6%のスコアを記録しています。これは Grok 4.7 (xhigh) の約180kの半分以下です。3つの Claude モデルは最も多くの出力トークン(タスクあたり約202k〜約562k)を生成しましたが、スコアは2.8%〜6.4%にとどまっています。

原文の公開と権利は出典元に帰属します。
機械翻訳 · 原文をご参照ください