Harvey LAB-AA v1.1 공개: 환각 검사를 추가하여 에이전트형 법률 업무의 기준을 한 단계 높이다
우리는 Harvey와 함께 Legal Agent Benchmark(LAB)의 실제 세계에서 수행되는 에이전틱 법률 업무를 수행하는 AI 에이전트를 위한 채점 방법론을 업데이트한 Harvey LAB-AA v1.1을 공동으로 개발했습니다. 이제 모든 산출물이 원본 문서와 대조하여 환각 여부를 검사하고, 3인 패널이 모든 루브릭 기준을 평가하며, 새로운 핵심 지표인 Hallucination-Gated All-Pass Rate는 산출물이 모든 루브릭 기준을 충족하고 중대한 환각이 없는 경우에만 과제를 인정합니다.
모든 모델은 Harvey 팀이 구축한 기업 M&A 및 자본시장부터 세금, 소송, 파산에 이르기까지 120개의 비공개 법률 과제를 수행합니다. 이는 Harvey LAB-AA의 방법론을 개선하기 위한 첫 번째 단계입니다. 향후 업데이트에서는 스타일과 어조 같은 사용성 기능을 포함하여 변호사들이 중요하게 여기는 전체 요소 집합을 더 잘 반영하기 위해 Harvey와 협력하고 있습니다.
점수
Harvey LAB-AA v1.1: 환각 게이티드 올패스 비율(Hallucination-Gated All-Pass Rate)
각 작업에서 심사 패널이 루브릭의 모든 기준을 통과로 판정한 비율의 작업 평균치로, 중대한 환각이 발생한 작업은 0점 처리됨 · Artificial Analysis에 의해 독립적으로 벤치마킹됨Grok 4.7 (xhigh)가 9.4%의 Hallucination-Gated All-Pass Rate로 Harvey LAB-AA v1.1에서 선두를 차지했으며, 8.9%의 Muse Spark 1.3 (max)와 8.6%의 GPT-6 Astra (max)를 근소한 차이로 앞섰습니다. GPT-6.1 Sol (max)가 6.9%로 뒤이었고, 그 다음은 6.4%의 Claude Fable 5.1 (max, with fallback), 5.3%의 Kimi K3 (max), 4.2%의 Claude Opus 5.5 (max, with fallback)입니다. Claude 모델들은 Anthropic의 fallback이 활성화된 상태로 실행되었지만, 실제로 이를 사용한 적은 없습니다.
할루시네이션을 반영하면 Harvey LAB-AA의 순위가 달라집니다. 할루시네이션 게이트가 없다면 Muse Spark 1.3이 26.7%의 All-Pass Rate로 명확히 선두를 차지하겠지만, 그 통과 결과의 3분의 2에는 중대한 할루시네이션이 포함되어 있습니다. GPT-6 Astra는 자신의 통과 결과를 거의 모두 유지하면서(8.9%에서 8.6%로) 전체 통합 10위에서 Hallucination-Gated All-Pass Rate 3위로 올라섰습니다. GPT-6.1 Sol는 7.5%에서 6.9%로 상대적으로 조금밖에 떨어지지 않았습니다. 테스트된 모델 전반에서 통과했을 결과의 60% 이상이 중대한 할루시네이션을 포함하고 있으며, 할루시네이션을 반영하면 여러 모델이 0%를 기록합니다.
대부분의 모델이 루브릭 기준의 대다수를 충족합니다: 16개 모델이 기준의 85.6~96.0%를 통과합니다. 루브릭은 난이도를 위해 선정된 기준만이 아니라 각 산출물을 전체적으로 평가합니다. 루브릭 적용 범위와 근거 확보를 별도로 보여주기 위해, 환각 게이트 적용 전 기준 통과률(Criterion Pass Rate)을 작업당 실질적 환각 발생과 함께 보고합니다.
최신 결과는 다음을 참조하십시오. Harvey LAB-AA 평가 페이지. 본 기사는 2026년 10월 8일 기준 데이터를 보여줍니다.
Harvey LAB-AA v1.1의 변경 사항
우리는 Harvey와 협력하여 Harvey LAB-AA를 v1.1로 업데이트했습니다. 이번 업데이트는 벤치마크의 채점 및 점수 산정 방식을 변경하므로, v1.1 결과는 이전에 발표된 v1.0 수치와 직접 비교할 수 없습니다:
- 할루시네이션 감사. 모델이 제출하는 모든 산출물은 이제 2단계 검사를 통해 해당 과제의 원본 문서와 대조하여 감사됩니다. 사용 가능한 제출물이 없는 과제는 0점을 받으며 감사되지 않습니다. 1차 심사자가 세 가지 범주 - 원본 자료와의 모순, 조작된 원본 내용, 원본에서 뒷받침되지 않는 구체적 주장 - 에 걸쳐 후보 할루시네이션을 표시하고, 동일한 심사자의 2차 검토에서 각 표시를 해당 과제의 원본 문서와 다시 대조하여 근거가 없는 표시는 기각하고 나머지는 중대 또는 경미로 분류합니다.
- 할루시네이션 게이트 올패스 레이트 헤드라인. 이제 헤드라인 지표는 할루시네이션 게이트 올패스 레이트(Hallucination-Gated All-Pass Rate)입니다: 산출물이 모든 루브릭 기준을 충족하고 중대한 할루시네이션이 없을 때에만 과제가 통계에 포함됩니다.
- 기준 통과율과 중대 할루시네이션. 우리는 할루시네이션 게이트 이전에 통과한 루브릭 기준의 비율을 세 심사자에 대해 평균하고 모든 기준에 걸쳐 통합하여, 검사된 과제당 평균 중대 할루시네이션 수와 함께 보고합니다. 산점도는 이 두 지표를 직접 비교합니다.
- 3심사자 루브릭 패널. 루브릭 기준은 이제 GPT-6 Sol, Grok 4.7, Claude Opus 5.5의 3개 LLM 심사자 패널이 채점하며, 패널 전체의 평균 판정을 적용하여 v1.0에서 사용된 단일 심사자를 대체합니다. 우리는 이 심사자들을 검토하여 자신들의 모델 계열에 대한 최소한의 자기 선호만 있음을 확인했으며, 세 심사자 전체의 평균화는 발생할 수 있는 편향을 완화합니다.
- 데이터셋 업데이트. v1.1은 Harvey의 최신 비공개 데이터셋(v1.1.0)을 사용하며, 과제와 기준에 대한 개선 사항이 포함되어 있습니다.
Harvey LAB-AA와 Harvey의 LAB의 차이점
Harvey LAB-AA는 Harvey의 평가를 독립적으로 재구현한 것으로, 원래 버전과 몇 가지 주요 차이점이 있습니다:
- 모델은 당사의 Stirrup 에이전트 하네스에서 실행되며, 컨텍스트 한도 도달 시 실패하는 대신 컨텍스트 압축과 같은 기능을 지원하고, Artificial Analysis가 작성한 단순화된 에이전트 및 심사자 프롬프트를 사용합니다
- 당사는 Harvey의 사용자 정의 도구 및 문서 생성 스킬 스크립트(예: pptx, docx)를 포함하지 않고, 대신 순수 모델 능력을 반영하는 간단한 코드 실행 도구를 제공합니다
- 산출물은 모델이 잘못된 파일명을 생성할 때의 퍼지 매칭이 아닌, 지정된 정확한 파일명과 일치해야 합니다
할루시네이션
Harvey가 실시한 인간 선호도 연구에서 인간 전문가들은 나머지 측면에서는 포괄적인 두 답변 중 어느 쪽을 선호하는지 결정하는 주요 요소로 환각(hallucination)을 지목했습니다. 우리의 환각 검사는 실제 법률 업무에 실질적으로 영향을 미칠 수 있는 오류에 초점을 맞추며, 이를 표시하는 데 보수적인 접근 방식을 취합니다. 이 검사는 근거가 없는 과제별 주장과 일반적인 법률 지식을 구분하고 후자를 검사 범위에서 제외하므로, 모델이 원본 자료 외의 판례나 법령을 인용했다는 이유로 감점되지 않습니다.
모델이 제출하는 모든 산출물은 과제의 원본 문서를 기준으로 환각 여부가 감사됩니다. 사용 가능한 제출물이 없는 과제는 0점을 받으며, 감사되지 않고 과제당 환각 수 계산에도 사용되지 않습니다. 환각이란 산출물에 있는 주장 중 원본 자료가 뒷받침하지 않는 것을 의미하며, 각 환각은 세 가지 범주 중 하나에 해당합니다:
- 원본 자료와 모순되는 경우.
- 원본 내용을 조작한 경우.
- 기록에 근거가 없는 구체적 주장인 경우.
각 환각은 중대(material) 또는 경미(minor)로 등급이 매겨집니다. 중대 환각은 계약상 요구되는 날짜가 잘못된 것처럼 실질적인 사항에 대해 독자를 오도할 수 있는 환각입니다. 경미한 환각은 산출물의 법률 해석에 의미 있게 영향을 미칠 가능성이 낮은 실제 오류입니다. 점수에는 중대 환각만 영향을 미칩니다: 중대 환각이 하나 이상 있으면 Hallucination-Gated All-Pass Rate에서 해당 과제의 점수가 0이 됩니다. Criterion Pass Rate는 환각 게이트 이전의 루브릭 충족도를 측정합니다. 중대 및 경미 환각 수는 검사가 실행된 과제별로 보고되며, 경미한 환각은 점수에 영향을 주지 않습니다.
환각 검사의 작동 방식
모든 산출물은 세 단계를 거쳐 과제의 원본 문서와 대조하여 검사됩니다.
가능한 환각 찾기
판정자(judge)는 제출물을 과제 원본 자료와 비교하고 검토할 문장을 표시합니다.
세무 컴플라이언스 검토 · 제출 발췌3가지 예시과제 원본 · 파트너십 신고서 초안 발췌
2023년 동안 6,000,000달러의 계획된 원금 상환이 이루어져, 미상환 잔액이 220,000,000달러(연초 기준, 유동으로 분류된 6,000,000달러 포함)에서 214,000,000달러(연말 기준, 15행에 유동으로 분류된 6,000,000달러 포함)로 감소했습니다.
제출물 · 토론 목록
“부채 일정: $220M term loan + $214M notes”
부채 이중 계상 가능성동일한 제출물 · 익스포저 일정
“$6,400,000 *293/365 $5,136,986”
안분 계산 오류 가능성별도 제출물, 동일 과제 · 이슈 메모
“$960,000 과다 납부액이 2024년도로 대체되었다”
$960,000이 이미 대체되었다고 기술했으나, 원본 자료는 신고 전 확인을 요구합니다.루브릭과 환각 검사는 제출물의 서로 다른 측면을 평가합니다.
중대 예시 1건경미 1건 · 기각 1건점수 산정 예시(설명용)
All-Pass Rate모든 기준을 통과한 판정자 비율67%67%3명의 판정자 중 2명이 모든 기준을 통과
Criterion Pass Rate판정 결과 중 통과 비율90%90%30개 판정 결과 중 27개가 통과; 환각의 영향 없음
GPT-6 모델들이 환각이 가장 적습니다: GPT-6 Astra는 과제당 평균 0.03건의 중대 환각(전체 120개 과제에서 4건), GPT-6 Sol은 0.07건(전체 120개 과제에서 8건)인 반면, Gemini 3.8 Flash는 출시 세트에서 과제당 평균 13.96건으로 가장 많습니다. 기준을 충족하는 능력과 환각을 일으키지 않는 능력은 서로 다른 역량입니다: Muse Spark 1.3은 가장 많은 기준을 통과했지만(96.0%) 과제당 평균 1.68건의 중대 환각이 있으며, GPT-6 Astra는 0.03건입니다. 모든 오픈 웨이트(open-weights) 모델은 과제당 평균 최소 2.09건의 중대 환각을 보입니다. 모델의 환각률은 업무 분야보다 모델 자체에 훨씬 더 크게 좌우됩니다.
Harvey LAB-AA v1.1: 과제당 환각 수
과제당 인정된 환각 표시, 심각도별 구분 · 중대 표시는 실질적 사항에 대해 독자를 오도할 수 있는 것이고, 경미 표시는 법률 해석에 영향을 미칠 가능성이 낮은 실제 오류이며, 대표 점수에는 중대 표시만 영향을 미칩니다 · 낮을수록 좋음검증된 Harvey LAB-AA 작업당 승인된 환각 플래그의 평균 수를 심각도별로 나눈 것입니다. 플래그는 실질적인 사항에서 독자를 오도할 경우, 즉 잘못된 당사자, 금액, 날짜 또는 의무, 혹은 결론을 바꾸는 사실이 있을 때 중대(material)로 분류되며, 결과물의 법적 해석에 의미 있게 영향을 미칠 가능성이 낮은 실제 오류인 경우 경미(minor)로 분류됩니다. 중대 플래그만이 헤드라인 점수를 결정하며, 경미 플래그는 보고되지만 점수에 반영되지 않습니다.
환각 검사기 선정 방법
우리는 환각 검사의 두 단계 모두에 GPT-6 Sol (high)를 사용하며, 이는 3인 심사 위원단과는 별도입니다. 우리는 환각 심판 후보 6개, 즉 GPT-6 Sol, GPT-6 Luna, Grok 4.7, Claude Opus 5.5, Claude Sonnet 5.5, Gemini 3.8 Flash를 각각 높은 추론 강도에서, 평가된 8개 모델의 동일한 20개 작업과 결과물을 대상으로 비교했습니다.
이 작업 하위 집합 전반에서 GPT-6 Sol과 GPT-6 Luna는 일반적으로 더 많은 중대 환각을 식별한 반면, Claude Sonnet 5.5와 Gemini 3.8 Flash는 훨씬 적게 식별했습니다. Claude Opus 5.5는 모든 모델 행에서 Grok 4.7과 Claude Sonnet 5.5 사이에 위치했습니다. 전체적으로 Opus는 99건의 중대 환각을 승인한 반면, Grok은 219건, Sonnet은 57건, GPT-6 Sol은 470건이었습니다. GPT-6 Sol은 오류 플래깅에 대한 보수적 접근 방식, 즉 원본 문서에 포함되지 않은 일반 법률 지식을 제외하는 방식에도 불구하고 더 많은 중대 환각을 식별했습니다.
여섯 검사기 모두 GPT-6 Astra의 출력에서 중대 환각을 발견하지 못했으며, GPT-6 Sol은 작업당 0에서 0.20의 범위를 보였습니다. 두 모델 모두 모든 검사기에서 중대 환각이 가장 적은 모델에 속했습니다.
Harvey LAB-AA v1.1: 환각 심판 모델 비교
작업당 승인된 중대 환각 평균 · 20개 작업 및 8개 모델 하위 집합 · 낮을수록 좋음작업당 중대 환각 평균0481217Harvey LAB-AA v1.1: 환각 심판 모델 비교. 작업당 승인된 중대 환각 평균 · 20개 작업 및 8개 모델 하위 집합 · 낮을수록 좋음.| 검사 대상 모델 | 환각 심판 | |||||
|---|---|---|---|---|---|---|
| GPT-6 Sol(high) | GPT-6 Luna(high) | Grok 4.7(high) | Claude Opus 5.5(high) | Claude Sonnet 5.5(high) | Gemini 3.8 Flash(high) | |
| GPT-6 Astra (max) | ||||||
| GPT-6 Sol (max) | ||||||
| Grok 4.7 (xhigh) | ||||||
| Claude Opus 5.5 (max with fallback) | ||||||
| Claude Fable 5.1 (max with fallback) | ||||||
| Muse Spark 1.3 (max) | ||||||
| Kimi K3 (max) | ||||||
| Gemini 3.8 Flash (high) | ||||||
| 작업당 총 중대 환각 | 23.50 | 19.35 | 10.95 | 4.95 | 2.85 | 1.40 |
환각 게이트 근접 통과율
기준의 근접 통과를 허용하면 GPT-6 Astra와 GPT-6.1 Sol이 앞섭니다. GPT-6 Astra는 8.6%의 환각 게이트 전체 통과율에서 기준 1개 미달 시 20.3%, 기준 2개 미달 시 31.7%의 환각 게이트 근접 통과율로 상승하며, GPT-6.1 Sol은 6.9%에서 20.3%와 29.6%로 상승하는 반면 Grok 4.7은 각각 15.3%와 23.1%입니다. 다음으로 큰 상승폭을 보인 모델은 GPT-6 Sol(3.6%에서 18.1%)과 Claude Sonnet 5.5(2.8%에서 16.9%)입니다. 환각으로 인해 통과가 무산되는 모델은 큰 이득을 얻지 못하는데, 중대 환각이 있으면 모든 구간에서 작업 점수가 0이 되기 때문입니다. GLM-5.3은 기준 2개 미달에도 2.2%에 그치고 Gemini 3.8 Flash는 0%에 머뭅니다.Harvey LAB-AA v1.1: 환각 게이트 근접 통과율
심판 위원단이 기준을 0개, <=1개, <=2개 미달한 비율의 작업별 평균 · 중대 환각이 1건 이상인 작업은 0%로 계산 · 높을수록 좋음기준 미달 수로 정렬비용
최고 점수 모델이 가장 비싼 것은 아닙니다. Grok 4.7이 작업당 약 $9.50로 선두이며, 이는 가장 비싼 모델인 Claude Fable 5.1(약 $21.70) 비용의 절반 이하입니다. Muse Spark 1.3은 비용 대비 강력한 성능을 보여주며 작업당 약 $4.20으로 2위에 올랐습니다.Harvey LAB-AA v1.1: 작업당 비용
작업당 평균 비용(USD), 입력, 캐시 히트, 캐시 쓰기, 추론, 답변 토큰별 세분화평가에서 작업당 평균 비용. 표준 토큰 수가 제공되는 경우 비용은 입력, 캐시 히트, 캐시 쓰기, 추론, 답변 토큰 가격별로 세분화됩니다.
토큰 사용량
더 많은 출력 토큰을 생성하는 것이 반드시 더 높은 점수로 이어지지는 않습니다. GPT-6 Astra는 작업당 약 81k 출력 토큰으로 8.6%를 기록하며, Grok 4.7의 약 180k의 절반 이하인 반면, 세 개의 Claude 모델은 가장 많은 출력 토큰(작업당 약 202k에서 약 562k)을 생성하고 2.8%에서 6.4%를 기록합니다.Harvey LAB-AA v1.1: 작업당 출력 토큰
하나의 작업을 실행하는 데 사용된 출력 토큰, 추론 및 답변 토큰별 세분화이 평가에서 벤치마크 작업당 생성된 답변 및 추론 토큰의 평균 수.
속도
더 강력한 모델일수록 더 오래 걸리는 경향이 있습니다. 예상 디코딩 시간은 Grok 4.7과 Claude Fable 5.1 모두 작업당 약 33분입니다. Muse Spark 1.3은 작업당 약 12분으로 두 번째입니다. 이 추정치는 첫 토큰까지의 시간 및 기타 오버헤드는 제외합니다.Harvey LAB-AA v1.1: 작업당 시간
작업당 가중 평균 디코딩 시간(분); TTFT 및 오버헤드 시간 제외 · 낮을수록 좋음작업당 가중 평균 예상 디코딩 시간(분). 작업당 출력 토큰을 출력 속도로 나누고 초를 분으로 변환합니다. 첫 토큰까지의 시간 및 기타 오버헤드는 제외됩니다.
턴 수
최고 득점자들이 가장 긴 루프를 실행하지는 않습니다. Grok 4.7은 작업당 평균 약 63턴, GPT-6 Astra는 약 54턴입니다. Claude Sonnet 5.5가 약 179턴으로 가장 길며 2.8%를 기록합니다.Harvey LAB-AA v1.1: 작업당 평균 턴 수
Harvey LAB-AA v1.1 작업당 평균 모델 턴 수 · 낮을수록 좋음이 차트는 작업당 에이전트가 수행하는 평균 턴 수를 보여줍니다. 이는 벤치마크 작업을 완료하기 위해 에이전트가 사용하는 액션, 도구 호출 및 반복 주기의 수에 대한 대략적인 지표입니다.
모델 크기 (오픈 웨이트 모델만 해당)
Harvey LAB-AA v1.1: 환각 게이트 올패스율 대 컴퓨트 프록시
Harvey LAB-AA v1.1 환각 게이트 올패스율 · 컴퓨트 프록시가장 매력적인 사분면파레토 선사용된 컴퓨트의 상대적 지수로, 활성 파라미터(십억 단위) × (입력 토큰 / 5 + 출력 토큰) / 1,000,000으로 계산됩니다. 입력 토큰은 사전 채움(prefill)이 생성(generation)보다 컴퓨트 비용이 낮음을 반영하여 가중치가 낮게 적용됩니다. 값이 낮을수록 컴퓨트 효율이 높은 모델을 나타냅니다. 차트 왼쪽 상단의 모델들은 더 적은 컴퓨트로 높은 점수를 달성합니다.
점수 대 출시일
Harvey LAB-AA v1.1: 환각 게이트 올패스율 대 출시일
가장 매력적인 영역예시 작업 및 제출물
GitHub에서 작업 세트 보기공개 작업 세트의 대표적인 Harvey LAB 작업, 각 모델에 제공된 참조 파일, 그리고 모델이 산출한 결과물을 둘러보세요.
인수합병지시사항
첨부된 인수 데이터룸 계약서와 사내 메모를 검토하여 지배권 변경 및 양도 조항을 확인하고, 포괄적인 딜팀 보고서를 작성하십시오.
출력: coc-analysis-report.docx
결과물
모델이 산출해야 하는 기대 결과물
- coc-analysis-report.docx 대상의 주요 계약 전반에 걸친 지배권 변경 및 양도 조항을 분석하는 포괄적인 딜팀 보고서.
참조 파일
모델에 제공됨
열기열기열기열기열기열기열기열기열기열기열기열기열기열기열기열기열기열기열기모델 제출물
각 모델이 생성한 산출물
Claude Opus 5.5 (max with fallback) - coc-analysis-report.docx열기Harvey LAB-AA 리소스
- 리더보드와 전체 결과는 다음에서 확인할 수 있습니다 Harvey LAB-AA 평가 페이지, 새로운 모델이 출시될 때마다 업데이트됩니다
- The methodology 페이지 에이전트 및 루브릭(rubric) 채점 프롬프트를 포함한 전체 구현 내용을 문서화합니다
- Harvey의 최초 LAB 발표 벤치마크와 그 설계를 소개합니다
- 대표적인 과제 집합이 공개되어 있습니다: GitHub
- Harvey LAB-AA는 당사의 오픈소스 에이전트 프레임워크인 Stirrup위에서 구동됩니다
최신 소식 읽기

Anthropic이 Claude Haiku 5.5를 출시했습니다
Claude Haiku 5.5는 Artificial Analysis Intelligence Index에서 43점을 기록했으며, 이는 마지막 Haiku 출시 1년 후 26점 상승한 수치입니다
2026년 10월 7일

Mistral이 Mistral Large 4를 출시하여, 프랑스가 미국과 중국 외부에서 가장 지능적인 모델의 보유국이 되었습니다
Mistral이 Artificial Analysis Intelligence Index에서 38점을 기록한 Mistral Large 4를 출시했습니다. 프랑스가 미국과 중국 외부에서 가장 지능적인 모델을 보유한 지위를 되찾았습니다
2026년 10월 6일
한국 AI 기업 Upstage가 Solar Mini 4를 출시했습니다
한국 AI 기업 Upstage가 Artificial Analysis Intelligence Index에서 24점을 기록한 Solar Mini 4를 출시했지만, 토큰당 가격은 비슷함에도 불구하고 과제당 비용이 GPT-6 Luna(max)의 약 5배입니다
2026년 9월 30일
