하비가 진행한 인간 선호도 연구에서, 인간 전문가들은 두 가지 다른 설명 중에서 어떤 반응을 선호하는지에 있어서 환각이 주요 결정 요인으로 지적했습니다. 우리의 새로운 환각 평가 프로세스는 실제 법률 업무에 실질적인 영향을 미칠 수 있는 오류에 초점을 맞추고 있으며, 이러한 오류를 식별하기 위해 보수적인 접근 방식을 취합니다. 지원되지 않은 작업별 주장을 일반 법률 지식과 구별하여 후자를 범위에서 제외하므로, 모델들은 원본 파일 외의 사례법이나 법규를 참조했다고 해서 처벌받지 않는다.
검사는 두 단계로 진행되며, 둘 다 GPT-6 Sol (고급)을 사용합니다. 먼저, 모든 결과물을 작업의 원본 문서와 비교합니다. 유용한 제출 점수가 없는 작업은 0점이 되며, 감사나 '환상당 단위' 계산에 포함되지 않습니다. 환상이란 작업 결과물에서 원본 문서가 뒷받침하지 않는 주장을 의미하며, 각각 세 가지 범주 중 하나에 속합니다.
- 출처 자료와 모순되는 내용.
- 조작된 출처 콘텐츠.
- 기록에 근거 없는 특정 주장.
그런 다음 각 플래그를 해당 작업의 원본 문서와 다시 검토하고, 적합하지 않은 플래그는 제거하며, 확인된 환각을 ‘중요한’ 또는 ‘경미한’으로 분류합니다. 중요한 환각이란 독자가 실질적인 점에서 오해할 수 있는 경우입니다. 하나의 중요한 환각은 작업의 ‘환각 기반 전체 통과율’에 0을 부여합니다; 경미한 환각은 별도로 보고되며 점수에 영향을 미치지 않습니다.
rubric 기준은 이제 GPT-6 Sol, Grok 4.7, Claude Opus 5.5로 구성된 세 명의 심사원단에 의해 평가됩니다. 이는 v1.0에서 단일 심사원이 담당하던 방식을 대체한 것입니다. 또한 Harvey가 제공한 최신 개인 데이터셋에 v1.1 버전을 적용하고 있으며, 이 데이터셋에는 과제와 기준에 대한 개선 사항도 포함되어 있습니다. 이러한 rubric 심사원들을 검토한 결과, 각 모델 계열에 대한 자의성이 거의 없으며, 세 심사원의 결과를 평균하여 발생할 수 있는 편향을 줄였습니다.