Artificial Analysis ArticlesActualizado el

Anunciamos Harvey LAB-AA v1.1: añadimos comprobaciones de alucinaciones para elevar el listón del trabajo legal agéntico

Artificial AnalysisTodos los artículos 8 de octubre de 2026Anunciamos Harvey LAB-AA v1.1: añadimos comprobaciones de alucinaciones para elevar el listón del trabajo legal agéntico Colaboramos con Harv

Fuente de la imagen · Artificial Analysis Articles
Artificial Analysis

Todos los artículos

8 de octubre de 2026

Anunciamos Harvey LAB-AA v1.1: añadimos comprobaciones de alucinaciones para elevar el listón del trabajo legal agéntico

Colaboramos con Harvey en Harvey LAB-AA v1.1, que actualiza nuestra metodología de puntuación para el Legal Agent Benchmark (LAB) para agentes de IA que realizan trabajo legal agéntico del mundo real. Cada entregable ahora se comprueba contra sus documentos de origen en busca de alucinaciones, un panel de tres jueces califica cada criterio de la rúbrica, y la nueva métrica principal, la Hallucination-Gated All-Pass Rate, solo acredita una tarea cuando los entregables satisfacen todos los criterios de la rúbrica y no contienen alucinaciones materiales.
Cada modelo trabaja a través de 120 tareas legales privadas creadas por el equipo de Harvey, desde fusiones y adquisiciones corporativas y mercados de capitales hasta impuestos, litigios y quiebras. Este es el primer paso en la mejora de la metodología de Harvey LAB-AA. En futuras actualizaciones, trabajaremos con Harvey para tener mejor en cuenta el conjunto completo de factores que los abogados valoran, incluidas características de usabilidad como el estilo y el tono.

Puntuación

Harvey LAB-AA v1.1: Hallucination-Gated All-Pass Rate

Promedio sobre las tareas de la proporción del panel de jueces que encuentra todos los criterios de la rúbrica aprobados, con una tarea puesta a cero ante cualquier alucinación material · Benchmark independiente realizado por Artificial Analysis

Grok 4.7 (xhigh) lidera Harvey LAB-AA v1.1 con una Hallucination-Gated All-Pass Rate del 9.4%, apenas por delante de Muse Spark 1.3 (max) con 8.9% y GPT-6 Astra (max) con 8.6%. GPT-6.1 Sol (max) sigue con 6.9%, luego Claude Fable 5.1 (max, con fallback) con 6.4%, Kimi K3 (max) con 5.3% y Claude Opus 5.5 (max, con fallback) con 4.2%. Los modelos Claude se ejecutaron con el fallback de Anthropic habilitado, pero nunca lo usaron.

Tener en cuenta las alucinaciones cambia los rankings en Harvey LAB-AA. Sin la compuerta de alucinaciones, Muse Spark 1.3 lideraría claramente con una All-Pass Rate de 26.7%, pero dos tercios de esos aprobados contienen una alucinación material. GPT-6 Astra conserva casi todos sus aprobados (de 8.9% a 8.6%) y pasa del puesto 10 conjunto en all-pass al 3 en Hallucination-Gated All-Pass Rate. GPT-6.1 Sol cae relativamente poco, de 7.5% a 6.9%. Entre los modelos probados, más del 60% de los resultados que de otro modo aprobaban contienen una alucinación material, y varios modelos puntúan 0% tras tener en cuenta las alucinaciones.

La mayoría de los modelos completan la gran mayoría de los criterios de la rúbrica: 16 modelos aprueban entre el 85.6% y el 96.0% de los criterios. Las rúbricas evalúan cada entregable de forma holística, en lugar de solo mediante criterios seleccionados por su dificultad. Informamos la Criterion Pass Rate antes de la compuerta de alucinaciones junto con las alucinaciones materiales por tarea para mostrar por separado la cobertura de la rúbrica y el anclaje en las fuentes.

Para ver resultados actualizados consulte la página de evaluación de Harvey LAB-AA. Este artículo muestra datos al 8 de octubre de 2026.

Cambios en Harvey LAB-AA v1.1

Colaboramos con Harvey para actualizar Harvey LAB-AA a v1.1. La actualización cambia cómo se califica y puntúa el benchmark, por lo que los resultados de v1.1 no son directamente comparables con las cifras de v1.0 publicadas anteriormente:

  • Auditoría de alucinaciones. Cada entregable que un modelo presenta ahora se audita contra los documentos de origen de la tarea en una comprobación de dos etapas; una tarea sin presentación utilizable puntúa cero y no se audita. Un primer juez marca posibles alucinaciones en tres categorías -contradicciones de los materiales de origen, contenido de fuente fabricado y afirmaciones específicas sin respaldo en las fuentes- y una segunda pasada del mismo juez vuelve a verificar cada marca contra los documentos de origen de esa tarea, descartando las marcas que no se sostienen y clasificando el resto como materiales o menores.
  • Métrica principal Hallucination-Gated All-Pass Rate. La métrica principal es ahora la Hallucination-Gated All-Pass Rate: una tarea cuenta solo cuando los entregables satisfacen todos los criterios de la rúbrica y no contienen alucinaciones materiales.
  • Criterion Pass Rate y alucinaciones materiales. Informamos la proporción de criterios de la rúbrica aprobados antes de la compuerta de alucinaciones, promediada entre los tres jueces y agrupada sobre todos los criterios, junto con el número medio de alucinaciones materiales por tarea comprobada. El gráfico de dispersión compara directamente estas dos métricas.
  • Panel de tres jueces para las rúbricas. Los criterios de la rúbrica ahora son calificados por un panel de tres jueces LLM -GPT-6 Sol, Grok 4.7 y Claude Opus 5.5-, con veredictos promediados en todo el panel, en reemplazo del juez único usado en v1.0. Revisamos estos jueces y encontramos una auto-preferencia mínima por sus propias familias de modelos, y el promedio entre los tres mitiga cualquier sesgo que surja.
  • Actualización del conjunto de datos. v1.1 usa el último conjunto de datos privado de Harvey (v1.1.0), que incluye mejoras en las tareas y los criterios.

En qué se diferencia Harvey LAB-AA del LAB de Harvey

Harvey LAB-AA es nuestra reimplementación independiente de la evaluación de Harvey, y existen varias diferencias clave respecto a la versión original:

  • Los modelos se ejecutan en nuestro harness de agente Stirrup , lo que habilita funciones como la compactación de contexto en lugar de fallos al alcanzar los límites de contexto, con prompts de agente y juez simplificados escritos por Artificial Analysis
  • No incluimos las herramientas personalizadas de Harvey ni los scripts de habilidades de generación de documentos (por ejemplo, pptx, docx), y en su lugar proporcionamos una herramienta simple de ejecución de código para reflejar la capacidad bruta del modelo
  • Los entregables deben coincidir con el nombre de archivo exacto especificado, en lugar de una coincidencia difusa cuando los modelos producen nombres de archivo incorrectos

Alucinaciones

En estudios de preferencia humana realizados por Harvey, los expertos humanos señalaron las alucinaciones como un factor determinante principal al elegir qué respuesta prefieren entre dos respuestas por lo demás completas. Nuestra comprobación de alucinaciones se centra en errores que podrían afectar materialmente el trabajo legal real, y adopta un enfoque conservador al señalarlos. Distingue las afirmaciones específicas de la tarea sin respaldo del conocimiento legal general y deja este último fuera del alcance, de modo que los modelos no sean penalizados por recurrir a jurisprudencia o estatutos más allá de los archivos fuente.

Cada entregable que un modelo presenta se audita en busca de alucinaciones contra los documentos fuente de la tarea. Una tarea sin una presentación utilizable obtiene cero y no se audita ni se usa en el cálculo de alucinaciones por tarea. Una alucinación es una afirmación en el producto de trabajo que las fuentes no respaldan, y cada una cae en una de tres categorías:

  • Una contradicción de los materiales fuente.
  • Contenido fuente fabricado.
  • Una afirmación específica sin respaldo en el expediente.

Cada alucinación se califica como material o menor. Una alucinación material induciría a error a un lector en un punto sustantivo, como una fecha requerida contractualmente incorrecta. Una alucinación menor es un error real que es poco probable que afecte significativamente la interpretación legal de un entregable. Solo las alucinaciones materiales afectan la puntuación: tener una o más pone en cero la puntuación de una tarea en la Hallucination-Gated All-Pass Rate. La Criterion Pass Rate mide la cobertura de la rúbrica antes del filtro de alucinaciones. Los recuentos de alucinaciones materiales y menores se informan por cada tarea en la que se ejecutó la comprobación; las alucinaciones menores no afectan las puntuaciones.

Cómo funciona la comprobación de alucinaciones

Cada entregable se verifica contra los documentos fuente de la tarea en tres pasos.

Buscar posibles alucinaciones

El juez compara la presentación con las fuentes de la tarea y señala declaraciones para revisión.

Revisión de cumplimiento fiscal · extractos de la presentación, 3 ejemplos

Fuente de la tarea · extracto del borrador de la declaración de sociedad

Se realizó una amortización programada de capital de $6,000,000 durante 2023, reduciendo el saldo pendiente de $220,000,000 (inicio del año, incluidos $6,000,000 clasificados como corrientes) a $214,000,000 (fin del año, incluidos $6,000,000 clasificados como corrientes en la Línea 15).

La presentación · lista de discusión

“cronograma de deuda préstamo a plazo de $220M + notas de $214M”

Posible doble conteo de deuda

La misma presentación · cronograma de exposición

“$6,400,000 *293/365 $5,136,986”

Posible error en el cálculo prorrateado

Presentación separada, misma tarea · memorando de problemas

“El pago excedente de $960,000 se acredité a 2024”

Dice que los $960,000 ya fueron acreditados, pero la fuente pide confirmación antes de presentar.

La rúbrica y la comprobación de alucinaciones evalúan aspectos diferentes de la presentación.

1 ejemplo material, 1 menor · 1 no confirmado

Ejemplo ilustrativo de puntuación

All-Pass Rate — Porcentaje de jueces que aprueban todos los criterios 67% 67%

2 de 3 jueces aprobaron todos los criterios

Criterion Pass Rate — Porcentaje de veredictos de jueces que son aprobatorios 90% 90%

27 de 30 veredictos de jueces fueron aprobatorios; no afectado por alucinaciones

Tres ejemplos verificados de la misma tarea fiscal. Los ejemplos material y menor comparten una presentación; el ejemplo desestimado proviene de otra presentación. Estos extractos no constituyen una auditoría completa de la tarea.

Los modelos GPT-6 alucinan menos: GPT-6 Astra promedia 0.03 alucinaciones materiales por tarea (4 alucinaciones en las 120 tareas) y GPT-6 Sol 0.07 (8 alucinaciones en las 120 tareas), mientras que Gemini 3.8 Flash promedia la mayor cantidad del conjunto de lanzamiento, con 13.96 por tarea. Completar los criterios y no alucinar son habilidades diferentes: Muse Spark 1.3 aprueba la mayor cantidad de criterios (96.0%) pero promedia 1.68 alucinaciones materiales por tarea, frente a 0.03 para GPT-6 Astra. Todos los modelos de pesos abiertos promedian al menos 2.09 alucinaciones materiales por tarea. La tasa de alucinación de un modelo depende mucho más del modelo que del área de práctica.

Harvey LAB-AA v1.1: Alucinaciones por Tarea

Alertas de alucinación confirmadas por tarea, divididas por gravedad · Las alertas materiales inducirían a error a un lector en un punto sustantivo, las alertas menores son errores reales poco probables de afectar la interpretación legal, y solo las alertas materiales afectan la puntuación principal · Menor es mejor

Número promedio de alertas de alucinación confirmadas por tarea verificada de Harvey LAB-AA, dividido por gravedad. Una alerta es material cuando induciría a error a un lector sobre un punto sustantivo: una parte, monto, fecha u obligación incorrecta, o un hecho que cambia una conclusión; y es menor cuando es un error real improbable que afecte significativamente la interpretación legal de un entregable. Solo las alertas materiales determinan el resultado principal; las alertas menores se reportan pero nunca se puntúan.

Cómo elegimos el verificador de alucinaciones

Usamos GPT-6 Sol (high) para ambas pasadas de la verificación de alucinaciones, de forma separada del panel de jueces con rúbrica de tres miembros. Comparamos seis candidatos para el juez de alucinaciones: GPT-6 Sol, GPT-6 Luna, Grok 4.7, Claude Opus 5.5, Claude Sonnet 5.5 y Gemini 3.8 Flash, cada uno con alto esfuerzo de razonamiento, sobre las mismas 20 tareas y entregables de ocho modelos evaluados.

En este subconjunto de tareas, GPT-6 Sol y GPT-6 Luna generalmente identificaron más alucinaciones materiales, mientras que Claude Sonnet 5.5 y Gemini 3.8 Flash identificaron muchas menos. Claude Opus 5.5 quedó entre Grok 4.7 y Claude Sonnet 5.5 en cada fila de modelo. En total, Opus confirmó 99 alucinaciones materiales, en comparación con 219 para Grok, 57 para Sonnet y 470 para GPT-6 Sol. GPT-6 Sol identificó más alucinaciones materiales a pesar del enfoque conservador de la verificación para marcar errores, que excluye el conocimiento legal general no contenido en los documentos fuente.

Los seis verificadores no encontraron alucinaciones materiales en los resultados de GPT-6 Astra, mientras que GPT-6 Sol tuvo un rango de 0 a 0.20 por tarea. Ambos estuvieron entre los modelos con menos alucinaciones materiales bajo cada verificador.

Harvey LAB-AA v1.1: Comparación de modelos como jueces de alucinaciones

Media de alucinaciones materiales confirmadas por tarea · Subconjunto de 20 tareas y 8 modelos · Menor es mejorMedia de alucinaciones materiales por tarea0481217Harvey LAB-AA v1.1: Comparación de modelos como jueces de alucinaciones. Media de alucinaciones materiales confirmadas por tarea · Subconjunto de 20 tareas y 8 modelos · Menor es mejor.
MODELO VERIFICADOJUEZ DE ALUCINACIONES
GPT-6 Sol(high)GPT-6 Luna(high)Grok 4.7(high)Claude Opus 5.5(high)Claude Sonnet 5.5(high)Gemini 3.8 Flash(high)
GPT-6 Astra (max)
GPT-6 Sol (max)
Grok 4.7 (xhigh)
Claude Opus 5.5 (max with fallback)
Claude Fable 5.1 (max with fallback)
Muse Spark 1.3 (max)
Kimi K3 (max)
Gemini 3.8 Flash (high)
Total de alucinaciones materiales por tarea23.5019.3510.954.952.851.40
Seis jueces de alucinaciones comparados en un subconjunto fijo de 20 tareas y ocho modelos. Las celdas muestran la media de alucinaciones materiales confirmadas por tarea. Esta comparación de subconjunto no cambia la tabla de clasificación completa de 120 tareas, que usa GPT-6 Sol (high) como verificador de alucinaciones.

Tasa de casi aprobados con filtro de alucinaciones

Permitir casi aciertos en cuanto a criterios pone a GPT-6 Astra y GPT-6.1 Sol adelante. GPT-6 Astra sube de una Tasa de Todos los Criterios Aprobados con Filtro de Alucinaciones de 8.6% a una Tasa de Casi Aprobados con Filtro de Alucinaciones de 20.3% con un criterio incumplido y 31.7% con dos criterios incumplidos, y GPT-6.1 Sol de 6.9% a 20.3% y 29.6%, frente a 15.3% y 23.1% para Grok 4.7. Las siguientes mayores ganancias son para GPT-6 Sol (3.6% a 18.1%) y Claude Sonnet 5.5 (2.8% a 16.9%). Los modelos cuyas aprobaciones son anuladas por alucinaciones ganan poco, ya que una alucinación material sigue anulando la tarea en cada banda: GLM-5.3 alcanza solo 2.2% incluso con dos fallos y Gemini 3.8 Flash se mantiene en 0%.

Harvey LAB-AA v1.1: Tasa de casi aprobados con filtro de alucinaciones

Promedio por tarea de la proporción del panel de jueces que incumplió 0, <=1 y <=2 criterios · Las tareas con al menos 1 alucinación material cuentan como 0% · Mayor es mejorOrdenar por criterios incumplidos

Costo

Los modelos con mejores puntuaciones no son los más caros. Grok 4.7 lidera con ~$9.50 por tarea, menos de la mitad del costo de Claude Fable 5.1 (~$21.70), el modelo más caro. Muse Spark 1.3 representa un rendimiento sólido por su costo, quedando en segundo lugar con ~$4.20 por tarea.

Harvey LAB-AA v1.1: Costo por tarea

Costo promedio por tarea (USD), desglosado por tokens de entrada, acierto de caché, escritura de caché, razonamiento y respuesta

Costo promedio por tarea en la evaluación. Los costos se dividen por precios de tokens de entrada, acierto de caché, escritura de caché, razonamiento y respuesta donde hay recuentos canónicos de tokens disponibles.

Uso de tokens

Generar más tokens de salida no se traduce necesariamente en una puntuación más alta. GPT-6 Astra obtiene 8.6% con ~81k tokens de salida por tarea, menos de la mitad de los ~180k de Grok 4.7, mientras que los tres modelos Claude generan la mayor cantidad de tokens de salida (~202k a ~562k por tarea) y obtienen de 2.8% a 6.4%.

Harvey LAB-AA v1.1: Tokens de salida por tarea

Tokens de salida utilizados para ejecutar una tarea, desglosados por tokens de razonamiento y respuesta

El número promedio de tokens de respuesta y razonamiento producidos por tarea de referencia en esta evaluación.

Velocidad

Los modelos más potentes tienden a tardar más. El tiempo de decodificación estimado es de ~33 minutos por tarea tanto para Grok 4.7 como para Claude Fable 5.1. Muse Spark 1.3 obtiene el segundo lugar con ~12 minutos por tarea. Estas estimaciones excluyen el tiempo hasta el primer token y otras sobrecargas.

Harvey LAB-AA v1.1: Tiempo por tarea

Tiempo de decodificación promedio ponderado (minutos) por tarea; excluye TTFT y tiempo de sobrecarga · Menor es mejor

El tiempo de decodificación estimado promedio ponderado (minutos) por tarea. Los tokens de salida por tarea se dividen por la velocidad de salida y se convierten de segundos a minutos. Esto excluye el tiempo hasta el primer token y otras sobrecargas.

Turnos

Los de mejores puntuaciones no ejecutan los bucles más largos. Grok 4.7 promedia ~63 turnos por tarea y GPT-6 Astra ~54. Claude Sonnet 5.5 ejecuta el más largo, ~179 turnos, y obtiene 2.8%.

Harvey LAB-AA v1.1: Turnos promedio por tarea

Número promedio de turnos del modelo por tarea de Harvey LAB-AA v1.1 · Menor es mejor

Este gráfico muestra el número promedio de turnos que el agente realiza por tarea. Es un indicador aproximado de cuántas acciones, llamadas a herramientas y ciclos de iteración utiliza un agente para completar las tareas de referencia.

Tamaño del modelo (solo modelos de pesos abiertos)

Harvey LAB-AA v1.1: Tasa de todo-aprobado con filtro de alucinación vs. proxy de cómputo

Tasa de todo-aprobado con filtro de alucinación de Harvey LAB-AA v1.1 · Proxy de cómputoCuadrante más atractivoLínea de Pareto

Un índice relativo del cómputo utilizado, calculado como Parámetros activos (miles de millones) × (Tokens de entrada / 5 + Tokens de salida) / 1,000,000. Los tokens de entrada se ponderan a la baja para reflejar el menor costo de cómputo del prefill frente a la generación. Los valores más bajos indican modelos con mayor eficiencia de cómputo. Los modelos en la parte superior izquierda del gráfico logran puntuaciones altas con menos cómputo.

Puntuación vs. fecha de lanzamiento

Harvey LAB-AA v1.1: Tasa de todo-aprobado con filtro de alucinación vs. fecha de lanzamiento

Región más atractiva

Tareas y entregas de ejemplo

Ver el conjunto de tareas en GitHub

Explora tareas representativas de Harvey LAB del conjunto de tareas público, los archivos de referencia que se entregaron a cada modelo y los entregables que produjo.

Fusiones y adquisiciones

Instrucciones

Revisa los contratos de la sala de datos de la adquisición adjunta y el memorando interno en busca de disposiciones de cambio de control y cesión, y prepara un informe integral para el equipo de la operación.

Salida: coc-analysis-report.docx

Entregables

Salidas esperadas que el modelo debe producir

  • coc-analysis-report.docxUn informe completo del equipo de negociación que analiza las disposiciones de cambio de control y cesión en los contratos materiales de la empresa objetivo.

Archivos de referencia

Proporcionado al modelo

AbrirAbrirAbrirAbrirAbrirAbrirAbrirAbrirAbrirAbrirAbrirAbrirAbrirAbrirAbrirAbrirAbrirAbrirAbrir

Envío de modelos

Entregables producidos por cada modelo

Claude Opus 5.5 (max con respaldo) - coc-analysis-report.docxAbrir

Recursos Harvey LAB-AA

Lea lo último

Anthropic ha lanzado Claude Haiku 5.5

Claude Haiku 5.5 obtiene 43 puntos en el Artificial Analysis Intelligence Index, 26 puntos más un año después del último lanzamiento de Haiku

7 de octubre de 2026

Mistral ha lanzado Mistral Large 4, haciendo de Francia el hogar del modelo más inteligente fuera de EE. UU. y China

Mistral ha lanzado Mistral Large 4, que obtiene 38 puntos en el Artificial Analysis Intelligence Index; Francia vuelve a tener el modelo más inteligente de fuera de EE. UU. y China

6 de octubre de 2026

El laboratorio de IA coreano Upstage lanza Solar Mini 4

El laboratorio de IA coreano Upstage ha lanzado Solar Mini 4, que obtiene 24 puntos en el Artificial Analysis Intelligence Index, pero cuesta ~5 veces más por tarea que GPT-6 Luna (max) a pesar de precios similares por token

30 de septiembre de 2026

Fuente original

Artificial Analysis Articles

Notas sobre el contenido

La publicación original y los derechos pertenecen a la fuente.

Traducción automática · Consulte el original