在 Harvey 进行的人类偏好研究中,人类专家将幻觉视为他们在两种其他全面的回答中更倾向于哪种反应的主要决定因素。我们的新幻觉评估流程专注于那些可能实质性影响实际法律工作的错误,并在标记这些错误时采取保守的方法。 它将缺乏支持的特定任务相关主张与一般法律知识区分开来,并将后者排除在范围之外,因此模型不会仅仅因为引用超出源文件范围的判例法或法规而受到惩罚。
检查包含两个阶段,均使用 GPT-6 Sol(高级版)。首先,它会将每个交付成果与任务的相关源文档进行比对。如果没有可用的提交分数,该任务得零分,不会接受审核,也不计入每项任务的幻觉计数中。幻觉指的是工作成果中的说法,而源文件无法支持这些说法,这些幻觉分为三类之一:
- 与来源资料相矛盾。
- 编造的源内容。
- 一种在记录中无依据的具体断言。
然后,它再次对照该任务的原始文档检查每个标志,排除那些无法成立的标志,并将被确认出现的幻觉分为“重要”和“次要”两类。重要的幻觉是指会在关键问题上误导读者的幻觉;一个重要的幻觉会使任务在“幻觉控制下的全通过率”得分归零;次要的幻觉则会被单独记录,不会影响得分。
评分标准现在由 GPT-6 Sol、Grok 4.7 和 Claude Opus 5.5 组成的三人评审小组进行评分,取代了 v1.0 时的单一评审员。我们还在使用 Harvey 最新的私有数据集进行 v1.1 测试,该数据集对任务和评分标准进行了优化。我们对这些评分评审员进行了审查,发现他们对自己所在模型家族存在极少的偏好行为,因此将三人的结果平均计算,以消除可能出现的任何偏见。