ハーヴェイが実施した人間の好みに関する研究で、人間の専門家たちは、他の包括的な回答の中からどちらを好むかということにおいて、幻覚を主要な決定要因として指摘した。私たちの新しい幻覚評価プロセスは、実際の法的業務に重大な影響を与える可能性のある誤りに焦点を当て、それらを指摘する際には保守的な方法を採っている。 支持されていないタスク特定の主張を、一般的な法律知識から区別し、後者を範囲外に置くため、モデルはソースファイル以外の判例法や法令を引用しただけで、単純にペナルティを受けない。
チェックには2つの段階があり、どちらもGPT-6 Sol(高)を使用します。まず、各成果物をタスクのソース文書と比較します。利用可能な提出スコアがないタスクは0であり、監査も行われず、 hallucination-per-taskの計算にも含まれません。hallucinationとは、作業成果における主張で、ソース文書では支持されないものを指し、それぞれ3つのカテゴリーに分類されます。
- 資料と矛盾する点があります。
- 作り話の情報です。
- 記録に根拠のない具体的な主張です。
その後、各フラグをそのタスクの原文文書と再確認し、問題がないフラグは却下し、確認された幻覚を「材料」または「軽微」に分類する。材料性の幻覚とは、読者を実質的な点で誤導するものである。一つの材料性幻覚は、そのタスクの「幻覚ガート・オールパス率」への貢献度をゼロにする。軽微な幻覚は別途報告され、スコアには影響しない。
評価基準は、v1.0の単一審査員を置き換えて、GPT-6 Sol、Grok 4.7、Claude Opus 5.5からなる3人の審査員チームによって採点される。また、Harveyが提供する最新のプライベートデータセットに対してv1.1を実行しており、これにはタスクと評価基準の改善が含まれている。これらの評価審査員を検討した結果、各モデルファミリーに対する自己優遇の傾向は最小限であり、3人の結果を平均することで生じる偏りを軽減している。