Artificial Analysis · X

今天,我们与 Harvey 合作发布 Harvey LAB-AA v1.1。此版本更新了 Legal Agent Benchmark 的评分方法……

Artificial Analysis与Harvey合作更新法律智能体基准计分方法,推出LAB-AA v1.1,新增幻觉门控指标,仅当交付物满足全部评分标准且无实质性幻觉时才计为通过。结果显示Grok 4.7以9.4%的门控全通率居首,且发布时测试模型中超过60%的表面通过结果含实质性幻觉;文末提要内容被截断。

配图来源 · Artificial Analysis · X

今天,我们与 Harvey 合作宣布 Harvey LAB-AA v1.1 的发布。该版本更新了 Legal Agent Benchmark (LAB) 的评分方法,增加了幻觉检测功能,并要求回答必须正确,不得包含任何实质性的错误表述。LAB-AA v1.1 的新核心指标“幻觉控制通过率”仅会在任务成果满足所有评估标准且不存在实质性幻觉时给予评分。

我们将材料幻觉定义为在实质性问题上误导读者的情况,例如错误的合同要求日期;而轻微幻觉则属于真实错误,不太可能对交付物的法律解释产生有意义的影响。轻微幻觉会被单独报告,不会影响标题得分。

Grok 4.7 (xhigh) 以 9.4% 的幻觉控制通过率领先,且在发布时测试的所有模型中,超过 60% 的其他通过结果都包含实质性幻觉。

这是改进 Harvey LAB-AA 方法论的第一步。在后续更新中,我们将与 Harvey 合作,更全面地考虑律师所重视的所有因素,包括风格和语气等易用性特性。

关键要点:

➤ 排行榜榜首:@SpaceXAI 的 Grok 4.7 (xhigh) 以 9.4% 的幻觉控制全通过率领先,紧随 @AIatMeta 的 Muse Spark 1.3 (max) 的 8.9% 以及 @OpenAI 的 GPT-6 Astra (max) 的 8.6% 之后。

➤ 幻觉改变了排行榜:如果没有幻觉门,Muse Spark 1.3 (最大) 将以 26.7% 的完全通过率明显领先,但其中三分之二的通过包含一个或多个实质性幻觉,因此幻觉门后的完全通过率为 8.9%。GPT-6 Astra (最大) 在经过幻觉门后几乎保留了所有通过(从 8.9% 降至 8.6%),并从第 10 位升至第 3 位。

➤ GPT-6 模型系列最为可靠:GPT-6 Astra(最高水平)在每项任务中平均出现 0.03 次物质幻觉(共 4 项,涵盖 120 项任务),而 GPT-6 Sol(最高水平)则平均出现 0.07 次。在比较六种检查器模型在 20 项任务子集上的表现时,GPT-6 Astra 在所有检查器下均没有出现任何物质幻觉,包括 Claude Opus 5.5(高水平)。相比之下,Gemini 3.8 Flash(高水平)在每项任务中平均出现 13.96 次物质幻觉。

➤ 得分最高的模型并非最昂贵:Grok 4.7 (xhigh) 在排行榜上位居首位,每任务成本约为 9.50 美元,仅为 Claude Fable 5.1 (max with fallback) 的约 21.70 美元的一半,后者是最昂贵的模型。Muse Spark 1.3 (max) 以较低成本展现出出色的性能,位列第二,每任务成本约为 4.20 美元。

感谢 @nikogrupen 和 @harvey 的 @ItsJulioPereyra 在 Harvey LAB 项目及合作中的付出。

原始出处

Artificial Analysis · X

内容说明

原始发布及相关权利归来源方。

机器翻译 · 请以原文为准