Artificial Analysis · X

生成更多输出标记并不一定能带来更高的分数。GPT-6 Astra(最高)在每项任务中约81k个输出标记时的得分为8.6%。

Artificial Analysis的基准数据显示,生成更多输出token并不必然带来更高得分:GPT-6 Astra (max)在每任务约81k输出token下得8.6%,低于Grok 4.7 (xhigh)的约180k;三个Claude模型输出token最多(每任务约202k至约562k)却仅得2.8%至6.4%。该结果为评估测试时算力投入的性价比提供了参考。

配图来源 · Artificial Analysis · X

生成更多的输出标记并不一定意味着得分更高。GPT-6 Astra(最高)在每项任务中约有81k个输出标记时得分为8.6%,仅为Grok 4.7 (xhigh)的约180k个标记的一半以下。三个Claude模型生成的输出标记最多(每项任务约202k到562k个),得分则在2.8%到6.4%之间。

原始出处

Artificial Analysis · X

内容说明

原始发布及相关权利归来源方。

机器翻译 · 请以原文为准