Artificial Analysis · X

Dans les études de préférence humaine menées par Harvey, des experts humains ont identifié l’hallucination comme le facteur principal qui…

Dans les études de préférence humaine menées par Harvey, les experts humains ont identifié les hallucinations comme facteur principal déterminant pour la réponse qu’ils préfèrent, parmi deux autres réponses complètes.…

Dans les études de préférence humaine menées par Harvey, les experts humains ont identifié les hallucinations comme facteur principal déterminant pour la réponse qu’ils préfèrent, parmi deux autres réponses complètes. Notre nouvelle pipeline de notation des hallucinations se concentre sur les erreurs qui peuvent affecter significativement le travail juridique réel, tout en adoptant une approche conservatrice pour les identifier. Il distingue les affirmations spécifiques aux tâches non soutenues des connaissances juridiques générales et exclut ces dernières du champ d’application, de sorte que les modèles ne sont pas pénalisés simplement pour utiliser la jurisprudence ou les textes législatifs en dehors des fichiers sources.

Le test comporte deux étapes, toutes utilisant GPT-6 Sol (haute). Premièrement, chaque produit livré est comparé aux documents source de la tâche. Une tâche sans score de soumission utilisable obtient zéro et n’est ni auditée ni incluse dans le calcul des hallucinations par tâche. Une hallucination est une affirmation contenue dans le produit de travail qui n’est pas soutenue par les sources, et chacune appartient à l’une des trois catégories suivantes :

- Une contradiction avec les sources.
- Contenu de source fabriqué.
- Une affirmation spécifique sans preuve dans les archives.

Il vérifie ensuite chaque étiquette à nouveau par rapport aux documents sources de la tâche, rejette les étiquettes qui ne conviennent pas, et classe les hallucinations confirmées en matérielles ou mineures. Une hallucination matérielle est celle qui pourrait induire en erreur un lecteur sur un point essentiel. Une hallucination matérielle fait passer la contribution de la tâche à la Rate d’Accès Universel Géré par les Hallucinations à zéro ; les hallucinations mineures sont rapportées séparément et n’affectent pas le score.

Les critères de la rubrique sont désormais évalués par un panel de trois juges : GPT-6 Sol, Grok 4.7 et Claude Opus 5.5, remplaçant le seul juge de v1.0. Nous utilisons également v1.1 sur le dernier jeu de données privé fourni par Harvey, qui comporte des améliorations concernant les tâches et les critères. Nous avons examiné ces juges de rubrique et constaté une faible préférence personnelle pour leurs propres familles de modèles, et nous sommes d’accord sur les résultats de tous les trois pour atténuer tout biais qui pourrait émerger.

Source originale

Artificial Analysis · X

À propos du contenu

La publication originale et les droits appartiennent à la source.

Traduction automatique · Consultez l’original