Artificial Analysis · X

En los estudios de preferencia humana realizados por Harvey, los expertos humanos identificaron las alucinaciones como el factor principal…

En los estudios de preferencias humanas realizados por Harvey, los expertos humanos identificaron las alucinaciones como el factor principal que determina qué respuesta prefieren, entre dos respuestas de otro modo…

En los estudios de preferencias humanas realizados por Harvey, los expertos humanos identificaron las alucinaciones como el factor principal que determina qué respuesta prefieren, entre dos respuestas de otro modo completas. Nuestro nuevo sistema de clasificación de alucinaciones se centra en los errores que podrían afectar significativamente el trabajo legal real, mientras adopta un enfoque conservador para identificarlos. Distingue las afirmaciones específicas de tareas no respaldadas de el conocimiento legal general y excluye este último del alcance, por lo que los modelos no son sancionados simplemente por hacer uso de la jurisprudencia o los estatutos que van más allá de los archivos de origen.

La verificación tiene dos etapas, ambas utilizando GPT-6 Sol (de alto nivel). Primero, compara cada entrega con los documentos originales de la tarea. Una tarea que no tiene puntajes útiles en la presentación obtiene cero y no es auditada ni incluida en el cálculo de las alucinaciones por tarea. Una alucinación es una afirmación en el producto de trabajo que los fuentes no respaldan, y cada una pertenece a una de tres categorías:

- Una contradicción con los materiales originales.
- Contenido de fuente fabricado.
- Una afirmación específica sin respaldo en el registro.

Luego, revisa nuevamente cada bandera en comparación con los documentos de origen del tarea, descarta las banderas que no son válidas y clasifica las alucinaciones confirmadas como materiales o menores. Una alucinación material es aquella que podría engañar al lector en un punto sustancial. Una alucinación material hace que la contribución de la tarea a la tasa de paso total controlada por alucinaciones sea cero; las alucinaciones menores se reportan por separado y no afectan el puntaje.

Los criterios de la rúbrica ahora son evaluados por un panel de tres jueces compuesto por GPT-6 Sol, Grok 4.7 y Claude Opus 5.5, en lugar del único juez de v1.0. También estamos ejecutando v1.1 en el último conjunto de datos privado de Harvey, que incluye mejoras en las tareas y los criterios. Hemos revisado estos jueces de rúbrica y hemos encontrado una preferencia mínima por sus propias familias de modelos, y sumamos los resultados de los tres para mitigar cualquier sesgo que pueda surgir.

Fuente original

Artificial Analysis · X

Notas sobre el contenido

La publicación original y los derechos pertenecen a la fuente.

Traducción automática · Consulte el original