Artificial Analysis · X更新于

我们在来自 20 个任务和八个模型的固定子集的相同交付成果上比较了六种幻觉检查器。我们运行了两阶段检查……

Artificial Analysis在20项任务的固定子集上比较六种幻觉检查器,GPT-6 Sol确认470项实质性幻觉,Sonnet仅57项。文章提醒计数差异只反映检查器行为不同,不能证明准确性或排除自我偏好。

配图来源 · Artificial Analysis · X

我们在来自 20 个任务和八个模型的固定子集的相同交付成果上比较了六种幻觉检查器。我们使用 GPT-6 Sol (high)、GPT-6 Luna (high)、Grok 4.7 (high)、Claude Opus 5.5 (high)、Claude Sonnet 5.5 (high) 和 Gemini 3.8 Flash (high) 运行了我们的两阶段检查,并选择了 GPT-6 Sol (high) 用于生产使用。

在这个 20 任务子集中,GPT-6 Sol 和 GPT-6 Luna 总体上识别出更多实质性幻觉,而 Claude Sonnet 5.5 和 Gemini 3.8 Flash 识别出的要少得多。Claude Opus 5.5 在每个模型行中都介于 Grok 4.7 和 Claude Sonnet 5.5 之间。总计,Opus 确认了 99 个实质性幻觉,而 Grok 为 219 个,Sonnet 为 57 个,GPT-6 Sol 为 470 个。尽管该检查在标记错误时采取保守方法——排除源文档中不包含的一般法律知识——GPT-6 Sol 仍识别出更多实质性幻觉。

所有六种检查器都在 GPT-6 Astra 的输出中未发现实质性幻觉,而 GPT-6 Sol 在每个任务中介于 0 到 0.20 之间。在每种检查器下,两者都是实质性幻觉最少的模型之一。这一比较显示了检查器行为的差异;仅凭这些数字并不能确定准确性或排除自我偏好。

原始出处

Artificial Analysis · X

内容说明

原始发布及相关权利归来源方。

机器翻译 · 请以原文为准