Artificial Analysis ArticlesMis à jour le

Annonce de Harvey LAB-AA v1.1 : ajout de contrôles d'hallucination pour élever le niveau du travail juridique agentique

Artificial AnalysisTous les articles 8 octobre 2026Annonce de Harvey LAB-AA v1.1 : ajout de contrôles d'hallucination pour élever le niveau du travail juridique agentique Nous avons collaboré avec Har

Source de l’image · Artificial Analysis Articles
Artificial Analysis

Tous les articles

8 octobre 2026

Annonce de Harvey LAB-AA v1.1 : ajout de contrôles d'hallucination pour élever le niveau du travail juridique agentique

Nous avons collaboré avec Harvey sur Harvey LAB-AA v1.1, qui met à jour notre méthodologie de notation du Legal Agent Benchmark (LAB) pour les agents IA effectuant un travail juridique agentique en conditions réelles. Chaque livrable est désormais vérifié pour détecter les hallucinations par rapport à ses documents sources, un jury de trois juges note chaque critère de rubrique, et la nouvelle métrique phare, le Hallucination-Gated All-Pass Rate, ne crédite une tâche que lorsque les livrables satisfont tous les critères de rubrique et ne contiennent aucune hallucination majeure.
Chaque modèle travaille sur 120 tâches juridiques privées construites par l'équipe de Harvey, allant du M&A d'entreprise et des marchés de capitaux à la fiscalité, au contentieux et aux faillites. C'est la première étape de l'amélioration de la méthodologie de Harvey LAB-AA. Dans les prochaines mises à jour, nous travaillons avec Harvey pour mieux prendre en compte l'ensemble des facteurs appréciés par les avocats, y compris les fonctionnalités d'utilisabilité telles que le style et le ton.

Score

Harvey LAB-AA v1.1 : Hallucination-Gated All-Pass Rate

Moyenne par tâche de la part du jury trouvant chaque critère de rubrique validé, avec une tâche ramenée à zéro en cas d'hallucination majeure · Évalué indépendamment par Artificial Analysis

Grok 4.7 (xhigh) domine Harvey LAB-AA v1.1 avec un Hallucination-Gated All-Pass Rate de 9.4 %, devançant de justesse Muse Spark 1.3 (max) à 8.9 % et GPT-6 Astra (max) à 8.6 %. GPT-6.1 Sol (max) suit à 6.9 %, puis Claude Fable 5.1 (max, avec repli) à 6.4 %, Kimi K3 (max) à 5.3 % et Claude Opus 5.5 (max, avec repli) à 4.2 %. Les modèles Claude ont été exécutés avec le mécanisme de repli d'Anthropic activé, mais ne l'ont jamais utilisé.

La prise en compte des hallucinations modifie le classement de Harvey LAB-AA. Sans le filtre d'hallucination, Muse Spark 1.3 mènerait clairement avec un All-Pass Rate de 26.7 %, mais les deux tiers de ces validations contiennent une hallucination majeure. GPT-6 Astra conserve presque toutes ses validations (8.9 % à 8.6 %) et passe d'une 10e place ex æquo en all-pass à la 3e place du Hallucination-Gated All-Pass Rate. GPT-6.1 Sol chute relativement peu, de 7.5 % à 6.9 %. Parmi les modèles testés, plus de 60 % des résultats qui sinon validaient contiennent une hallucination majeure, et plusieurs modèles obtiennent 0 % après prise en compte des hallucinations.

La plupart des modèles accomplissent la grande majorité des critères de rubrique : 16 modèles valident 85.6-96.0 % des critères. Les rubriques évaluent chaque livrable de manière globale, plutôt que uniquement à travers des critères choisis pour leur difficulté. Nous rapportons le Criterion Pass Rate avant le filtre d'hallucination aux côtés des hallucinations majeures par tâche afin de montrer séparément la couverture des rubriques et l'ancrage dans les sources.

Pour les résultats à jour, consultez la page d'évaluation Harvey LAB-AA. Cet article présente les données au 8 octobre 2026.

Changements dans Harvey LAB-AA v1.1

Nous avons collaboré avec Harvey pour mettre à jour Harvey LAB-AA en v1.1. La mise à jour modifie la manière dont le benchmark est évalué et noté, de sorte que les résultats de la v1.1 ne sont pas directement comparables aux chiffres de la v1.0 publiés précédemment :

  • Audit des hallucinations. Chaque livrable soumis par un modèle est désormais audité par rapport aux documents sources de la tâche lors d'une vérification en deux étapes ; une tâche sans soumission utilisable obtient la note zéro et n'est pas auditée. Un premier juge signale les hallucinations candidates dans trois catégories - contradictions des documents sources, contenu source fabriqué, et affirmations spécifiques sans aucun appui dans les sources - et une seconde passe du même juge revérifie chaque signalement par rapport aux documents sources de la tâche, écartant les signalements qui ne tiennent pas et classant les autres comme majeurs ou mineurs.
  • Métrique phare Hallucination-Gated All-Pass Rate. La métrique phare est désormais le Hallucination-Gated All-Pass Rate : une tâche ne compte que lorsque les livrables satisfont tous les critères de rubrique et ne contiennent aucune hallucination majeure.
  • Criterion Pass Rate et hallucinations majeures. Nous rapportons la part des critères de rubrique validés avant le filtre d'hallucination, moyennée sur les trois juges et regroupée sur tous les critères, aux côtés du nombre moyen d'hallucinations majeures par tâche vérifiée. Le nuage de points compare directement ces deux métriques.
  • Jury de trois juges pour les rubriques. Les critères de rubrique sont désormais notés par un jury de trois juges LLM - GPT-6 Sol, Grok 4.7 et Claude Opus 5.5 - avec des verdicts moyennés sur l'ensemble du jury, remplaçant le juge unique utilisé dans la v1.0. Nous avons examiné ces juges et constaté une auto-préférence minimale pour leurs propres familles de modèles, et la moyenne sur les trois atténue les biais qui pourraient émerger.
  • Mise à jour du jeu de données. La v1.1 utilise le dernier jeu de données privé de Harvey (v1.1.0), qui inclut des améliorations des tâches et des critères.

En quoi Harvey LAB-AA diffère du LAB de Harvey

Harvey LAB-AA est notre réimplémentation indépendante de l'évaluation de Harvey, et il existe plusieurs différences clés par rapport à la version originale :

  • Les modèles sont exécutés sur notre Stirrup harnais d'agent, permettant des fonctionnalités telles que la compaction de contexte plutôt qu'un échec lors de l'atteinte des limites de contexte, avec des prompts d'agent et de juge simplifiés rédigés par Artificial Analysis
  • Nous n'incluons pas les outils personnalisés de Harvey ni ses scripts de compétences de génération de documents (par ex. pptx, docx), et fournissons à la place un simple outil d'exécution de code pour refléter la capacité brute des modèles
  • Les livrables doivent correspondre au nom de fichier exact spécifié, plutôt qu'à une correspondance approximative lorsque les modèles produisent des noms de fichiers incorrects

Hallucinations

Dans des études de préférences humaines menées par Harvey, des experts humains ont signalé les hallucinations comme un facteur déterminant principal dans le choix de la réponse préférée entre deux réponses par ailleurs complètes. Notre contrôle des hallucinations se concentre sur les erreurs susceptibles d'affecter matériellement le travail juridique réel, et adopte une approche conservatrice pour les signaler. Il distingue les affirmations spécifiques à la tâche non étayées de la connaissance juridique générale et place cette dernière hors du périmètre, afin que les modèles ne soient pas pénalisés pour s'appuyer sur de la jurisprudence ou des textes de loi au-delà des fichiers sources.

Chaque livrable soumis par un modèle est audité pour détecter les hallucinations par rapport aux documents sources de la tâche. Une tâche sans soumission exploitable obtient un score de zéro et n'est ni auditée ni prise en compte dans le calcul des hallucinations par tâche. Une hallucination est une affirmation dans le travail produit que les sources ne soutiennent pas, et chacune relève de l'une des trois catégories suivantes :

  • Une contradiction des documents sources.
  • Un contenu source fabriqué.
  • Une affirmation spécifique sans aucun soutien dans le dossier.

Chaque hallucination est classée matérielle ou mineure. Une hallucination matérielle induirait un lecteur en erreur sur un point de fond, comme une date contractuellement requise erronée. Une hallucination mineure est une erreur réelle peu susceptible d'affecter de manière significative l'interprétation juridique d'un livrable. Seules les hallucinations matérielles affectent la notation : en avoir une ou plusieurs annule le score d'une tâche dans le Hallucination-Gated All-Pass Rate. Le Criterion Pass Rate mesure la couverture de la grille d'évaluation avant le filtre des hallucinations. Les nombres d'hallucinations matérielles et mineures sont signalés par tâche pour chaque contrôle exécuté ; les hallucinations mineures n'affectent pas les scores.

Fonctionnement du contrôle des hallucinations

Chaque livrable est vérifié par rapport aux documents sources de la tâche en trois étapes.

Trouver les hallucinations possibles

Le juge compare la soumission avec les sources de la tâche et signale les déclarations à examiner.

Revue de conformité fiscale · extraits de soumission3 exemples

Source de la tâche · extrait du brouillon de déclaration de partenariat

Un amortissement programmé du principal de 6 000 000 $ a été effectué au cours de 2023, réduisant le solde impayé de 220 000 000 $ (début d'exercice, y compris 6 000 000 $ classés comme courants) à 214 000 000 $ (fin d'exercice, y compris 6 000 000 $ classés comme courants à la ligne 15).

La soumission · liste de discussion

« échéancier de la dette prêt terme de 220 M$ + billets de 214 M$ »

Possible double comptage de la dette

La même soumission · calendrier d'exposition

“$6,400,000 *293/365 $5,136,986”

Erreur possible dans le calcul au prorata

Soumission distincte, même tâche · note sur les problèmes

« Le trop-perçu de 960 000 $ a été imputé sur 2024 »

Affirme que les 960 000 $ ont déjà été imputés, mais la source demande une confirmation avant le dépôt.

La grille d'évaluation et le contrôle des hallucinations évaluent des aspects différents de la soumission.

1 exemple matériel1 mineure · 1 non retenue

Exemple de notation illustratif

All-Pass RatePart des juges qui valident chaque critère67 %67 %

2 juges sur 3 ont validé chaque critère

Criterion Pass RatePart des verdicts de juges qui sont des validations90 %90 %

27 verdicts de juges sur 30 étaient des validations ; non affecté par les hallucinations

Trois exemples vérifiés de la même tâche fiscale. Les exemples matériel et mineur partagent une soumission ; l'exemple non retenu provient d'une autre soumission. Ces extraits ne constituent pas un audit complet de la tâche.

Les modèles GPT-6 hallucinent le moins : GPT-6 Astra affiche en moyenne 0.03 hallucination matérielle par tâche (4 hallucinations sur les 120 tâches) et GPT-6 Sol 0.07 (8 hallucinations sur les 120 tâches), tandis que Gemini 3.8 Flash affiche la moyenne la plus élevée de l'ensemble de lancement, à 13.96 par tâche. Compléter les critères et ne pas halluciner sont des compétences différentes : Muse Spark 1.3 valide le plus de critères (96.0 %) mais affiche en moyenne 1.68 hallucination matérielle par tâche, contre 0.03 pour GPT-6 Astra. Chaque modèle à poids ouverts affiche en moyenne au moins 2.09 hallucinations matérielles par tâche. Le taux d'hallucinations d'un modèle dépend bien plus du modèle que du domaine de pratique.

Harvey LAB-AA v1.1 : Hallucinations par tâche

Signalements d'hallucinations confirmés par tâche, répartis par gravité · Les signalements matériels induiraient un lecteur en erreur sur un point de fond, les signalements mineurs sont des erreurs réelles peu susceptibles d'affecter l'interprétation juridique, et seuls les signalements matériels affectent le score principal · Plus c'est bas, mieux c'est

Nombre moyen de signalements d'hallucinations confirmés par tâche Harvey LAB-AA vérifiée, répartis par gravité. Un signalement est matériel lorsqu'il induirait un lecteur en erreur sur un point substantiel - une partie, un montant, une date ou une obligation erronés, ou un fait qui change une conclusion - et mineur lorsqu'il s'agit d'une véritable erreur peu susceptible d'affecter de manière significative l'interprétation juridique d'un livrable. Seuls les signalements matériels déterminent le chiffre headline ; les signalements mineurs sont signalés mais jamais notés.

Comment nous avons choisi le vérificateur d'hallucinations

Nous utilisons GPT-6 Sol (high) pour les deux passes de la vérification des hallucinations, séparément du panel de notation à trois juges. Nous avons comparé six candidats pour le juge des hallucinations : GPT-6 Sol, GPT-6 Luna, Grok 4.7, Claude Opus 5.5, Claude Sonnet 5.5 et Gemini 3.8 Flash, chacun avec un effort de raisonnement élevé, sur les mêmes 20 tâches et livrables issus de huit modèles évalués.

Sur ce sous-ensemble de tâches, GPT-6 Sol et GPT-6 Luna ont généralement identifié davantage d'hallucinations matérielles, tandis que Claude Sonnet 5.5 et Gemini 3.8 Flash en ont identifié bien moins. Claude Opus 5.5 s'est située entre Grok 4.7 et Claude Sonnet 5.5 sur chaque ligne de modèle. Au total, Opus a confirmé 99 hallucinations matérielles, contre 219 pour Grok, 57 pour Sonnet et 470 pour GPT-6 Sol. GPT-6 Sol a identifié davantage d'hallucinations matérielles malgré l'approche conservatrice de la vérification en matière de signalement des erreurs, qui exclut les connaissances juridiques générales ne figurant pas dans les documents sources.

Les six vérificateurs n'ont trouvé aucune hallucination matérielle dans les sorties de GPT-6 Astra, tandis que GPT-6 Sol se situe entre 0 et 0.20 par tâche. Les deux figuraient parmi les modèles avec le moins d'hallucinations matérielles sous chaque vérificateur.

Harvey LAB-AA v1.1 : Comparaison des modèles de juge des hallucinations

Hallucinations matérielles confirmées en moyenne par tâche · Sous-ensemble de 20 tâches et 8 modèles · Plus bas est mieuxHallucinations matérielles en moyenne par tâche0481217Harvey LAB-AA v1.1 : Comparaison des modèles de juge des hallucinations. Hallucinations matérielles confirmées en moyenne par tâche · Sous-ensemble de 20 tâches et 8 modèles · Plus bas est mieux.
MODÈLE VÉRIFIÉJUGE DES HALLUCINATIONS
GPT-6 Sol(high)GPT-6 Luna(high)Grok 4.7(high)Claude Opus 5.5(high)Claude Sonnet 5.5(high)Gemini 3.8 Flash(high)
GPT-6 Astra (max)
GPT-6 Sol (max)
Grok 4.7 (xhigh)
Claude Opus 5.5 (max avec repli)
Claude Fable 5.1 (max avec repli)
Muse Spark 1.3 (max)
Kimi K3 (max)
Gemini 3.8 Flash (high)
Total d'hallucinations matérielles par tâche23.5019.3510.954.952.851.40
Six juges des hallucinations comparés sur un sous-ensemble fixe de 20 tâches et huit modèles. Les cellules indiquent la moyenne d'hallucinations matérielles confirmées par tâche. Cette comparaison sur sous-ensemble ne modifie pas le classement complet des 120 tâches, qui utilise GPT-6 Sol (high) comme vérificateur d'hallucinations.

Taux de quasi-réussite filtré par les hallucinations

Autoriser les quasi-erreurs en termes de critères place GPT-6 Astra et GPT-6.1 Sol en tête. GPT-6 Astra passe d'un taux de tout-réussite filtré par les hallucinations de 8.6% à un taux de quasi-réussite filtré par les hallucinations de 20.3% avec un critère manqué et 31.7% avec deux critères manqués, et GPT-6.1 Sol de 6.9% à 20.3% et 29.6%, contre 15.3% et 23.1% pour Grok 4.7. Les plus grands gains suivants reviennent à GPT-6 Sol (3.6% à 18.1%) et Claude Sonnet 5.5 (2.8% à 16.9%). Les modèles dont les réussites sont annulées par des hallucinations gagnent peu, car une hallucination matérielle met toujours la tâche à zéro dans toutes les tranches : GLM-5.3 n'atteint que 2.2% même avec deux manques et Gemini 3.8 Flash reste à 0%.

Harvey LAB-AA v1.1 : Taux de quasi-réussite filtré par les hallucinations

Moyenne par tâche de la part du panel de juges ayant manqué 0, <=1 et <=2 critères · Les tâches avec au moins 1 hallucination matérielle comptent pour 0% · Plus haut est mieuxTrier par critères manqués

Coût

Les modèles les mieux notés ne sont pas les plus chers. Grok 4.7 mène à ~9.50 $ par tâche, moins de la moitié du coût de Claude Fable 5.1 (~21.70 $), le modèle le plus cher. Muse Spark 1.3 représente une forte performance pour son coût, se classant deuxième pour ~4.20 $ par tâche.

Harvey LAB-AA v1.1 : Coût par tâche

Coût moyen par tâche (USD), ventilé par jetons d'entrée, de hit de cache, d'écriture de cache, de raisonnement et de réponse

Coût moyen par tâche dans l'évaluation. Les coûts sont ventilés par tarification des jetons d'entrée, de hit de cache, d'écriture de cache, de raisonnement et de réponse lorsque les comptes de jetons canoniques sont disponibles.

Utilisation des jetons

Générer davantage de jetons de sortie ne se traduit pas nécessairement par un score plus élevé. GPT-6 Astra obtient 8.6 % avec ~81k jetons de sortie par tâche, soit moins de la moitié des ~180k de Grok 4.7, tandis que les trois modèles Claude génèrent le plus de jetons de sortie (~202k à ~562k par tâche) et obtiennent entre 2.8 % et 6.4 %.

Harvey LAB-AA v1.1 : Jetons de sortie par tâche

Jetons de sortie utilisés pour exécuter une tâche, ventilés par jetons de raisonnement et de réponse

Nombre moyen de jetons de réponse et de raisonnement produits par tâche de benchmark dans cette évaluation.

Vitesse

Les modèles plus performants ont tendance à prendre plus de temps. Le temps de décodage estimé est d'environ 33 minutes par tâche pour Grok 4.7 et Claude Fable 5.1. Muse Spark 1.3 arrive deuxième avec ~12 minutes par tâche. Ces estimations excluent le délai jusqu'au premier jeton et autres frais généraux.

Harvey LAB-AA v1.1 : Temps par tâche

Temps de décodage moyen pondéré (minutes) par tâche ; exclut le TTFT et le temps de frais généraux · Plus bas est meilleur

Temps de décodage estimé moyen pondéré (minutes) par tâche. Les jetons de sortie par tâche sont divisés par la vitesse de sortie et convertis des secondes en minutes. Cela exclut le délai jusqu'au premier jeton et autres frais généraux.

Tours

Les meilleurs scorers ne font pas tourner les boucles les plus longues. Grok 4.7 effectue en moyenne ~63 tours par tâche et GPT-6 Astra ~54. Claude Sonnet 5.5 est le plus long, avec ~179 tours, et obtient 2.8 %.

Harvey LAB-AA v1.1 : Tours moyens par tâche

Nombre moyen de tours du modèle par tâche Harvey LAB-AA v1.1 · Plus bas est meilleur

Ce graphique montre le nombre moyen de tours que l'agent effectue par tâche. C'est un indicateur approximatif du nombre d'actions, d'appels d'outils et de cycles d'itération qu'un agent utilise pour accomplir les tâches du benchmark.

Taille du modèle (modèles à poids ouverts uniquement)

Harvey LAB-AA v1.1 : Taux de tout-réussite avec filtre d'hallucination vs. proxy de calcul

Taux de tout-réussite avec filtre d'hallucination Harvey LAB-AA v1.1 · Proxy de calculQuadrant le plus attractifLigne de Pareto

Un indice relatif du calcul utilisé, calculé comme Paramètres actifs (milliards) × (Jetons d'entrée / 5 + Jetons de sortie) / 1,000,000. Les jetons d'entrée sont sous-pondérés pour refléter le coût de calcul inférieur du prefill par rapport à la génération. Des valeurs plus faibles indiquent des modèles plus efficaces en calcul. Les modèles en haut à gauche du graphique obtiennent des scores élevés avec moins de calcul.

Score vs. date de sortie

Harvey LAB-AA v1.1 : Taux de tout-réussite avec filtre d'hallucination vs. date de sortie

Zone la plus attractive

Exemples de tâches & soumissions

Voir l'ensemble de tâches sur GitHub

Parcourez des tâches Harvey LAB représentatives de l'ensemble de tâches public, les fichiers de référence fournis à chaque modèle et les livrables qu'il a produits.

Fusions & Acquisitions

Instructions

Examinez les contrats de la data room d'acquisition joints et le mémo interne pour les dispositions de changement de contrôle et de cession, et préparez un rapport complet pour l'équipe de transaction.

Sortie : coc-analysis-report.docx

Livrables

Sorties attendues que le modèle doit produire

  • coc-analysis-report.docxUn rapport complet de l'équipe de transaction analysant les clauses de changement de contrôle et de cession dans les contrats importants de la cible.

Fichiers de référence

Fourni au modèle

OuvrirOuvrirOuvrirOuvrirOuvrirOuvrirOuvrirOuvrirOuvrirOuvrirOuvrirOuvrirOuvrirOuvrirOuvrirOuvrirOuvertOuvrirOuvrir

Soumissions de modèles

Livrables produits par chaque modèle

Claude Opus 5.5 (max avec repli) - coc-analysis-report.docxOuvrir

Ressources Harvey LAB-AA

  • Le classement et les résultats complets sont disponibles en direct sur le Page d'évaluation Harvey LAB-AA, mis à jour au fur et à mesure de la sortie de nouveaux modèles
  • Le page de méthodologie documente l'implémentation complète, y compris les invites d'évaluation de l'agent et de la grille de notation
  • annonce originale de LAB par Harvey présente le benchmark et sa conception
  • Un ensemble public de tâches représentatives est disponible sur GitHub
  • Harvey LAB-AA fonctionne sur Stirrup, notre framework d'agents open-source

Lisez les dernières actualités

Anthropic a publié Claude Haiku 5.5

Claude Haiku 5.5 obtient un score de 43 sur l'Artificial Analysis Intelligence Index, soit 26 points de plus un an après la dernière sortie d'un Haiku

7 octobre 2026

Mistral a publié Mistral Large 4, faisant de la France le domicile du modèle le plus intelligent hors des États-Unis et de la Chine

Mistral a publié Mistral Large 4, obtenant un score de 38 sur l'Artificial Analysis Intelligence Index ; la France retrouve le modèle le plus intelligent issu de l'extérieur des États-Unis et de la Chine

6 octobre 2026

Le laboratoire coréen d'IA Upstage publie Solar Mini 4

Le laboratoire coréen d'IA Upstage a publié Solar Mini 4 qui obtient un score de 24 sur l'Artificial Analysis Intelligence Index, mais coûte environ 5 fois plus cher par tâche que GPT-6 Luna (max), malgré des prix par token similaires

30 septembre 2026

Source originale

Artificial Analysis Articles

À propos du contenu

La publication originale et les droits appartiennent à la source.

Traduction automatique · Consultez l’original