Artificial Analysis Articles更新于

发布 Harvey LAB-AA v1.1:引入幻觉检查,提升代理式法律工作的门槛

Artificial Analysis与Harvey将法律智能体基准升级到v1.1,对交付物审计幻觉并采用三评委制。结果显示超过60%的表面通过结果含实质性幻觉,且新分数与旧版不可直接比较。

配图来源 · Artificial Analysis Articles
Artificial Analysis

所有文章

2026年10月8日

发布 Harvey LAB-AA v1.1:引入幻觉检查,提升代理式法律工作的门槛

我们与 Harvey 合作开发了 Harvey LAB-AA v1.1,该版本更新了我们针对法律代理基准( Legal Agent Benchmark,LAB )的评分方法,该基准用于评估执行真实世界代理式法律工作的 AI 代理。现在,每一份交付物都会对照其源文档进行幻觉检查,由三名评审组成的评审小组对每一条评分标准进行打分,并且新的核心指标——幻觉门控全通过率( Hallucination-Gated All-Pass Rate )——只有当交付物满足全部评分标准且不含实质性幻觉时,才会给该任务记分。
每个模型都需要完成 120 项由 Harvey 团队构建的私密法律任务,涵盖公司并购与资本市场、税务、诉讼和破产等领域。这只是增强 Harvey LAB-AA 评分方法的第一步。在未来的更新中,我们将与 Harvey 合作,更好地纳入律师所重视的全部因素,包括风格和语气等易用性特性。

得分

Harvey LAB-AA v1.1:幻觉门控全通过率

各任务中评审小组认定全部评分标准通过的比例的平均值,任何任务若出现实质性幻觉则计为零分 · 由 Artificial Analysis 独立基准测试

Grok 4.7 (xhigh) 以 9.4% 的幻觉门控全通过率领跑 Harvey LAB-AA v1.1,略微领先于 Muse Spark 1.3 (max) 的 8.9% 和 GPT-6 Astra (max) 的 8.6%。GPT-6.1 Sol (max) 以 6.9% 紧随其后,然后是 Claude Fable 5.1 (max, with fallback) 的 6.4%、Kimi K3 (max) 的 5.3% 和 Claude Opus 5.5 (max, with fallback) 的 4.2%。这些 Claude 模型在运行时启用了 Anthropic 的回退机制,但从未实际使用。

纳入幻觉因素后,Harvey LAB-AA 的排名发生了变化。如果没有幻觉门控,Muse Spark 1.3 将以 26.7% 的全通过率明显领先,但其通过的任务中有三分之二包含实质性幻觉。GPT-6 Astra 几乎保留了其全部通过任务(8.9% 到 8.6%),从全通过率的并列第 10 名跃升至幻觉门控全通过率的第 3 名。GPT-6.1 Sol 降幅相对较小,从 7.5% 降至 6.9%。在受测模型中,超过 60% 的本可通过的结果包含实质性幻觉,若干模型在计入幻觉后得分为 0%。

大多数模型完成了绝大部分评分标准:16 个模型通过了 85.6-96.0% 的标准。评分标准对每份交付物进行整体评估,而不仅仅通过为难度而挑选的标准进行评估。我们同时报告幻觉门控之前的评分标准通过率以及每项任务的实质性幻觉数量,以便分别展示评分标准覆盖率和事实依据性。

最新结果请参见 Harvey LAB-AA 评估页面。本文数据截至 2026年10月8日。

Harvey LAB-AA v1.1 的变化

我们与 Harvey 合作将 Harvey LAB-AA 更新至 v1.1。此次更新改变了基准的评分和计分方式,因此 v1.1 的结果与此前发布的 v1.0 数据不具备直接可比性:

  • 幻觉审计。模型提交的每份交付物现在都会在两阶段检查中对照任务的源文档进行审计;没有可用提交的任务计零分且不进行审计。第一位评审会在三个类别中标记候选幻觉——与源材料相矛盾、捏造源内容、以及在源文件中毫无依据的具体断言——随后同一位评审进行第二遍检查,逐一对照该任务的源文档复核每个标记,驳回不成立的标记,并将其余标记分类为实质性或轻微。
  • 幻觉门控全通过率作为核心指标。核心指标现在是幻觉门控全通过率:只有当交付物满足全部评分标准且不含实质性幻觉时,该任务才计入。
  • 评分标准通过率与实质性幻觉。我们报告幻觉门控之前的评分标准通过比例(在三位评审间取平均,并汇总所有标准),同时报告每项受检任务的平均实质性幻觉数量。散点图直接比较这两个指标。
  • 三评审评分小组。评分标准现在由三个 LLM 评审组成的小组打分——GPT-6 Sol、Grok 4.7 和 Claude Opus 5.5——其结论在小组内取平均,取代 v1.0 中使用的单一评审。我们审查了这些评审,发现它们对自家模型家族几乎没有自我偏好,而且在三者间取平均可以缓解可能出现的任何偏差。
  • 数据集更新。v1.1 使用来自 Harvey 的最新私密数据集( v1.1.0 ),其中包含对任务和标准的改进。

Harvey LAB-AA 与 Harvey 的 LAB 有何不同

Harvey LAB-AA 是我们对 Harvey 评估方法的独立重新实现,与原始版本存在若干关键差异:

  • 模型在我们的 Stirrup 代理框架上运行,支持上下文压缩等特性,而非在达到上下文上限时失败,并使用经过简化的、由 Artificial Analysis 撰写的代理和评审提示词
  • 我们不包含 Harvey 的自定义工具和文档生成技能脚本(例如 pptx、docx),而是提供一个简单的代码执行工具,以反映模型的原始能力
  • 交付物必须与指定的确切文件名完全匹配,而非在模型产出错误文件名时进行模糊匹配

幻觉

在Harvey开展的人类偏好研究中,人类专家将幻觉标记为在两份同样全面的回答中决定其偏好哪一份的主要因素。我们的幻觉检查聚焦于可能对实际法律工作产生实质影响的错误,并采取保守的方式来标记这些错误。它将缺乏支持的任务特定论断与一般法律知识区分开来,并将后者排除在范围之外,因此模型不会因引用源文件之外的判例法或成文法而受到惩罚。

模型提交的每一份交付成果都会对照任务的源文件进行幻觉审计。没有可用提交的任务得分为零,不进行审计,也不计入每任务幻觉数的计算。幻觉是指工作成果中源文件不支持的论断,每个幻觉分为以下三类之一:

  • 与源材料相矛盾。
  • 捏造源文件内容。
  • 具体断言在记录中没有支持。

每个幻觉被评定为实质性或轻微。实质性幻觉会在实质要点上误导读者,例如错误的合同要求日期。轻微幻觉是一个真实存在的错误,但不太可能对交付成果的法律解释产生实质性影响。只有实质性幻觉会影响评分:出现一个或多个实质性幻觉将使任务在幻觉门控全通过率中的得分归零。准则通过率衡量幻觉门控之前的评分细则覆盖情况。实质性幻觉和轻微幻觉的数量按运行检查的每个任务报告;轻微幻觉不影响得分。

幻觉检查的工作原理

每份交付成果分三步对照任务的源文件进行检查。

找出可能的幻觉

评审模型将提交内容与任务源文件进行比较,并标记需审查的陈述。

税务合规审查 · 提交摘录3个示例

任务源文件 · 合伙企业申报草案摘录

2023年期间进行了6,000,000美元的预定本金摊销,使未偿余额从220,000,000美元(年初,含分类为流动性的6,000,000美元)降至214,000,000美元(年末,含在第15行中分类为流动性的6,000,000美元)。

提交内容 · 讨论列表

“债务时间表 220M美元定期贷款 + 214M美元票据”

可能存在债务重复计算

同一提交内容 · 敞口表

“$6,400,000 *293/365 $5,136,986”

按比例计算中可能存在错误

同一任务的另一份提交内容 · 问题备忘录

“该960,000美元的多缴税款已被抵扣至2024年”

声称960,000美元已被抵扣,但源文件要求在申报前先予以确认。

评分细则与幻觉检查评估的是提交内容的不同方面。

1个实质性示例1个轻微 · 1个不成立

示意性评分示例

全通过率通过所有准则的评审比例67%67%

3名评审中有2名通过了所有准则

准则通过率评审判定中通过的占比90%90%

30项评审判定中有27项为通过;不受幻觉影响

来自同一税务任务的三个已核实示例。实质性示例和轻微示例来自同一份提交内容;被驳回的示例来自另一份提交内容。这些摘录并非完整的任务审计。

GPT-6系列模型幻觉最少:GPT-6 Astra平均每任务0.03个实质性幻觉(全部120个任务中共4个幻觉),GPT-6 Sol为0.07(全部120个任务中共8个幻觉),而Gemini 3.8 Flash在发布模型集中幻觉最多,平均每任务13.96个。完成准则和不产生幻觉是不同的能力:Muse Spark 1.3通过最多准则(96.0%),但平均每任务1.68个实质性幻觉,而GPT-6 Astra为0.03。每个开源权重模型平均每任务至少2.09个实质性幻觉。模型的幻觉率更多取决于模型本身,而非业务领域。

Harvey LAB-AA v1.1:每任务幻觉数

每任务经核实的幻觉标记数量,按严重程度划分 · 实质性标记会在实质要点上误导读者,轻微标记是不太可能影响法律解释的真实错误,只有实质性标记会影响主评分 · 数值越低越好

每个被核查的 Harvey LAB-AA 任务中经确认的幻觉标记平均数量,按严重程度划分。当标记会在实质性要点上误导读者时——错误的当事方、金额、日期或义务,或改变结论的事实——即为重大标记;当它是真实错误但不太可能对交付成果的法律解释产生实质影响时,则为轻微标记。只有重大标记会影响 headline 得分;轻微标记会被报告但从不计分。

我们如何选择幻觉检查器

我们在幻觉检查的两轮中都使用 GPT-6 Sol (high),与三评委评分小组分开。我们为幻觉评委比较了六个候选者:GPT-6 Sol、GPT-6 Luna、Grok 4.7、Claude Opus 5.5、Claude Sonnet 5.5 和 Gemini 3.8 Flash,均采用高推理强度,基于来自八个被评估模型的相同 20 个任务和交付成果。

在这一任务子集中,GPT-6 Sol 和 GPT-6 Luna 通常识别出更多重大幻觉,而 Claude Sonnet 5.5 和 Gemini 3.8 Flash 识别出的要少得多。Claude Opus 5.5 在每一行模型中均介于 Grok 4.7 和 Claude Sonnet 5.5 之间。总计,Opus 确认了 99 个重大幻觉,相比之下 Grok 为 219 个,Sonnet 为 57 个,GPT-6 Sol 为 470 个。尽管该检查对标记错误采取了保守方法(排除源文档中未包含的一般法律知识),GPT-6 Sol 仍识别出更多重大幻觉。

所有六个检查器在 GPT-6 Astra 的输出中均未发现重大幻觉,而 GPT-6 Sol 每个任务介于 0 到 0.20 之间。在每位检查者下,两者都是重大幻觉最少的模型之一。

Harvey LAB-AA v1.1:幻觉评委模型比较

每个任务确认的重大幻觉平均值 · 20 个任务和 8 个模型的子集 · 越低越好每任务重大幻觉平均值0481217Harvey LAB-AA v1.1:幻觉评委模型比较。每个任务确认的重大幻觉平均值 · 20 个任务和 8 个模型的子集 · 越低越好。
被核查的模型幻觉评委
GPT-6 Sol(high)GPT-6 Luna(high)Grok 4.7(high)Claude Opus 5.5(high)Claude Sonnet 5.5(high)Gemini 3.8 Flash(high)
GPT-6 Astra (max)
GPT-6 Sol (max)
Grok 4.7 (xhigh)
Claude Opus 5.5 (max with fallback)
Claude Fable 5.1 (max with fallback)
Muse Spark 1.3 (max)
Kimi K3 (max)
Gemini 3.8 Flash (high)
每任务重大幻觉总数23.5019.3510.954.952.851.40
六个幻觉评委在固定的 20 个任务和八个模型子集上的比较。单元格显示每任务确认的重大幻觉平均值。此子集比较不会改变完整的 120 任务排行榜,后者使用 GPT-6 Sol (high) 作为幻觉检查器。

幻觉门槛下的近通过率

允许在标准上接近达标会使 GPT-6 Astra 和 GPT-6.1 Sol 领先。GPT-6 Astra 从 8.6% 的幻觉门槛全通过率上升到 20.3% 的幻觉门槛近通过率(漏掉一项标准)和 31.7%(漏掉两项标准),GPT-6.1 Sol 从 6.9% 上升到 20.3% 和 29.6%,而 Grok 4.7 为 15.3% 和 23.1%。接下来提升最大的是 GPT-6 Sol(3.6% 到 18.1%)和 Claude Sonnet 5.5(2.8% 到 16.9%)。通过被幻觉抵消的模型获益甚微,因为重大幻觉在每个档位仍会将任务清零:GLM-5.3 即使漏掉两项也仅达到 2.2%,Gemini 3.8 Flash 则保持 0%。

Harvey LAB-AA v1.1:幻觉门槛下的近通过率

评委小组漏掉 0、<=1 和 <=2 项标准的比例在任务上的平均值 · 至少有 1 个重大幻觉的任务计为 0% · 越高越好按漏掉标准数排序

成本

得分最高的模型并不是最昂贵的。Grok 4.7 以每任务约 $9.50 领先,不到最昂贵模型 Claude Fable 5.1(约 $21.70)成本的一半。Muse Spark 1.3 在其成本下表现出色,以每任务约 $4.20 位列第二。

Harvey LAB-AA v1.1:每任务成本

每个任务的平均成本(美元),按输入、缓存命中、缓存写入、推理和答案 token 细分

评估中每个任务的平均成本。在有标准 token 计数可用时,成本按输入、缓存命中、缓存写入、推理和答案 token 定价拆分。

Token 使用量

生成更多输出 token 不一定带来更高分数。GPT-6 Astra 每个任务约使用 81k 输出 token,得分 8.6%,不到 Grok 4.7 约 180k 的一半,而三个 Claude 模型生成的输出 token 最多(每个任务约 202k 至约 562k),得分仅为 2.8% 至 6.4%。

Harvey LAB-AA v1.1:每个任务的输出 Token

运行一个任务所使用的输出 token,按推理和答案 token 细分

本次评估中每个基准任务平均产生的答案 token 和推理 token 数量。

速度

更强的模型往往耗时更长。Grok 4.7 和 Claude Fable 5.1 的估计解码时间均为每个任务约 33 分钟。Muse Spark 1.3 排名第二,每个任务约 12 分钟。这些估计不包括首 token 时间和其他开销。

Harvey LAB-AA v1.1:每个任务的时间

每个任务的加权平均解码时间(分钟);不包括 TTFT 和开销时间 · 越低越好

每个任务的加权平均估计解码时间(分钟)。将每个任务的输出 token 除以输出速度,并将秒转换为分钟。这不包括首 token 时间和其他开销。

轮次

得分最高的模型并不运行最长的循环。Grok 4.7 平均每个任务约 63 轮,GPT-6 Astra 约 54 轮。Claude Sonnet 5.5 运行轮次最长,约 179 轮,得分为 2.8%。

Harvey LAB-AA v1.1:每个任务的平均轮次

每个 Harvey LAB-AA v1.1 任务的平均模型轮次数 · 越低越好

此图表显示智能体每个任务采取的平均轮次数。它大致反映了智能体为完成基准任务所使用的动作、工具调用和迭代循环的数量。

模型规模(仅限开放权重模型)

Harvey LAB-AA v1.1:幻觉门控全通过率与计算代理指标对比

Harvey LAB-AA v1.1 幻觉门控全通过率 · 计算代理指标最具吸引力的象限帕累托线

所用计算量的相对指数,计算方式为活跃参数量(十亿)×(输入 token / 5 + 输出 token)/ 1,000,000。输入 token 被降权,以反映预填充相对生成的较低计算成本。数值越低表示模型的计算效率越高。图表左上角的模型以更少的计算获得高分。

分数与发布日期对比

Harvey LAB-AA v1.1:幻觉门控全通过率与发布日期对比

最具吸引力的区域

示例任务与提交

在 GitHub 上查看任务集

浏览公共任务集中有代表性的 Harvey LAB 任务、每个模型获得的参考文件以及其生成的交付成果。

并购

说明

审阅随附的收购数据室合同和内部备忘录中的控制权变更与转让条款,并编写一份全面的交易团队报告。

输出: coc-analysis-report.docx

交付成果

模型必须生成的预期输出

  • coc-analysis-report.docx一份全面的交易团队报告,分析目标公司重要合同中的控制权变更与转让条款。

参考文件

提供给模型

打开打开打开打开打开打开打开打开打开打开打开打开打开打开打开打开打开打开打开

模型提交内容

每个模型生成的交付成果

Claude Opus 5.5 (max with fallback) - coc-analysis-report.docx打开

Harvey LAB-AA 资源

阅读最新内容

将可信访问模型引入 Artificial Analysis 网络指数

GPT-6 Sol(Daybreak Blue)现已领跑Cyber Index

2026年10月8日

Anthropic 已发布 Claude Haiku 5.5

Claude Haiku 5.5 在 Artificial Analysis 智能指数中得分为 43,较上一代 Haiku 发布一年后提升了 26 分

2026年10月7日

Mistral 发布了 Mistral Large 4,使法国拥有了美国和中国之外最智能的模型。

Mistral发布了Mistral Large 4,在Artificial Analysis智能指数上获得38分;法国重新拥有美国和中国之外最智能的模型。

2026年10月6日

原始出处

Artificial Analysis Articles

内容说明

原始发布及相关权利归来源方。

机器翻译 · 请以原文为准