In den von Harvey durchgeführten Studien zur menschlichen Präferenz haben menschliche Experten Halluzinationen als Hauptfaktor angesehen, der bestimmt, welche Antwort sie bevorzugen – neben anderen umfassenden Antworten. Unser neuer System zur Bewertung von Halluzinationen konzentriert sich auf Fehler, die einen wesentlichen Einfluss auf reale juristische Arbeiten haben könnten, und verfolgt dabei eine konservative Vorgehensweise bei der Identifizierung dieser Fehler. Es unterscheidet ununterstützte, auf Aufgaben abgestellte Behauptungen von allgemeinem Rechtswissen und zieht letzteres aus dem Bereich der Analyse heraus, sodass Modelle nicht einfach bestraft werden, weil sie auf Rechtsprechung oder Gesetze verweisen, die über die Quelldateien hinausgehen.
Die Überprüfung hat zwei Phasen, wobei beide den GPT-6 Sol (hoch) verwenden. Zuerst vergleicht sie jedes Ergebnis mit den Quellendokumenten der Aufgabe. Eine Aufgabe mit keinen nutzbaren Bewertungen erhält null und wird weder überprüft noch in die Berechnung der Halluzinationen pro Aufgabe einbezogen. Eine Halluzination ist eine Behauptung im Arbeitsprodukt, die von den Quellen nicht unterstützt wird, und jede davon fällt in eine der drei Kategorien:
– Ein Widerspruch zu den Quellenmaterialien.
– Erfundener Quellinhalt.
– Eine spezifische Aussage ohne Unterstützung in den Aufzeichnungen.
Dann überprüft es jeden Flaggenwert erneut gegen die Quelldokumente der Aufgabe, verwirft die Flaggen, die nicht erfüllt sind, und klassifiziert die bestätigten Halluzinationen als „material“ oder „minor“. Eine materiale Halluzination ist eine, die den Leser in einem wesentlichen Punkt täuschen würde. Eine materiale Halluzination führt dazu, dass der Beitrag der Aufgabe zur Hallucination-Gated All-Pass-Rate auf null sinkt; die minoren Halluzinationen werden separat berichtet und beeinflussen das Ergebnis nicht.
Die Bewertungskriterien werden nun von einem dreiköpfigen Gremium aus GPT-6 Sol, Grok 4.7 und Claude Opus 5.5 bewertet, anstelle des einzelnen Richters in v1.0. Wir führen außerdem v1.1 auf dem neuesten privaten Datensatz von Harvey durch, der Verbesserungen an den Aufgaben und Kriterien enthält. Wir haben die Bewertungsrichter überprüft und festgestellt, dass es minimale Selbstbevorzugung bei ihren jeweiligen Modellfamilien gibt; die Ergebnisse aller drei Richter werden anschließend gemittelt, um mögliche Voreingenommenheiten zu vermeiden.