Harvey LAB-AA v1.1 を発表:ハルシネーション(幻覚)チェックを追加し、エージェント型法律業務の基準を引き上げる
私たちは Harvey と協力し、現実世界のエージェント型法律業務を行う AI エージェント向けの Legal Agent Benchmark(LAB)のスコアリング手法を更新する Harvey LAB-AA v1.1 を開発しました。すべての成果物がソース文書に対してハルシネーションのチェックを受けるようになり、3人の審査員パネルがすべてのルーブリック基準を評価し、新しい主要指標である Hallucination-Gated All-Pass Rate は、成果物がすべてのルーブリック基準を満たし、かつ重大なハルシネーションを含まない場合にのみタスクを合格と認定します。
各モデルは、Harvey のチームが作成した 120 の非公開法律タスクに取り組みます。対象はコーポレート M&A や資本市場から税務、訴訟、破産まで多岐にわたります。これは Harvey LAB-AA の手法を強化するための第一歩です。今後のアップデートでは、文体やトーンといったユーザビリティ機能を含め、法律家が重視する要因の全範囲をより適切に反映できるよう、Harvey と協力して取り組んでいきます。
スコア
Harvey LAB-AA v1.1:Hallucination-Gated All-Pass Rate
すべてのルーブリック基準を合格と判断した審査員パネルの割合のタスク平均値。重大なハルシネーションがあったタスクは 0 とする · Artificial Analysis による独立ベンチマークGrok 4.7 (xhigh) が 9.4% の Hallucination-Gated All-Pass Rate で Harvey LAB-AA v1.1 の首位に立ち、8.9% の Muse Spark 1.3 (max) と 8.6% の GPT-6 Astra (max) をわずかな差で上回りました。以下、GPT-6.1 Sol (max) が 6.9%、Claude Fable 5.1 (max, with fallback) が 6.4%、Kimi K3 (max) が 5.3%、Claude Opus 5.5 (max, with fallback) が 4.2% と続きます。Claude モデルは Anthropic のフォールバックを有効にして実行されましたが、実際には使用されませんでした。
ハルシネーションを考慮すると、Harvey LAB-AA のランキングは変化します。ハルシネーションゲートがなければ、Muse Spark 1.3 が 26.7% の All-Pass Rate で明確に首位となりますが、その合格の 3 分の 2 には重大なハルシネーションが含まれています。GPT-6 Astra は合格のほとんどを維持し(8.9% から 8.6%)、オールパスでの同順位 10 位から Hallucination-Gated All-Pass Rate で 3 位に浮上しました。GPT-6.1 Sol の下落は比較的小さく、7.5% から 6.9% です。テストされたモデル全体では、ハルシネーションがなければ合格していた結果の 60% 以上に重大なハルシネーションが含まれており、ハルシネーションを考慮すると複数のモデルが 0% のスコアとなります。
ほとんどのモデルはルーブリック基準の大部分を達成しています。16 モデルが基準の 85.6〜96.0% を合格しています。ルーブリックは、難易度のために選ばれた基準のみではなく、各成果物を全体的に評価します。私たちは、ルーブリックのカバー率とグラウンディングを別々に示すため、ハルシネーションゲート前の Criterion Pass Rate をタスクあたりの重大なハルシネーション数と併せて報告しています。
最新の結果については Harvey LAB-AA 評価ページをご覧ください。本記事のデータは 2026年10月8日時点のものです。
Harvey LAB-AA v1.1 での変更点
私たちは Harvey と協力し、Harvey LAB-AA を v1.1 に更新しました。この更新によりベンチマークの採点・スコアリング方法が変わるため、v1.1 の結果は以前公開された v1.0 の数値と直接比較できません:
- ハルシネーション監査。モデルが提出するすべての成果物が、2 段階のチェックでタスクのソース文書と照合して監査されるようになりました。使用可能な提出物がないタスクは 0 点となり、監査は行われません。第一段階の審査員が、ソース資料との矛盾、捏造されたソース内容、ソースに裏付けのない具体的な主張の 3 カテゴリにわたってハルシネーションの候補をフラグ付けし、同一の審査員による第二段階で各フラグをそのタスクのソース文書と照合して再確認し、成立しないフラグを棄却し、残りを重大または軽微に分類します。
- Hallucination-Gated All-Pass Rate を主要指標に。主要指標が Hallucination-Gated All-Pass Rate になりました。成果物がすべてのルーブリック基準を満たし、かつ重大なハルシネーションを含まない場合にのみタスクが合格と認定されます。
- Criterion Pass Rate と重大なハルシネーション。ハルシネーションゲート前のルーブリック基準合格率を 3 人の審査員全体で平均し、すべての基準についてプールした値を、チェックされたタスクあたりの重大なハルシネーションの平均数と併せて報告します。散布図はこの 2 つの指標を直接比較したものです。
- 3 人の審査員によるルーブリックパネル。ルーブリック基準の評価が、3 つの LLM 審査員(GPT-6 Sol、Grok 4.7、Claude Opus 5.5)によるパネルで行われるようになり、判定はパネル全体で平均されます。これにより v1.0 で使用されていた単一審査員が置き換えられました。私たちはこれらの審査員を検証し、自身のモデルファミリーに対する自己選好は最小限であることを確認しており、3 人すべての平均を取ることで生じうるバイアスを軽減できます。
- データセット更新。v1.1 では Harvey の最新の非公開データセット(v1.1.0)を使用しており、タスクと基準の改善が含まれています。
Harvey LAB-AA と Harvey の LAB の違い
Harvey LAB-AA は Harvey の評価を私たちが独自に再実装したものであり、オリジナル版といくつかの重要な違いがあります:
- モデルは当社の Stirrup エージェントハーネス上で実行され、コンテキスト上限に達した際に失敗するのではなく、コンテキスト圧縮などの機能が有効になります。エージェントおよび審査員のプロンプトは Artificial Analysis が簡素化したものを使用します
- Harvey のカスタムツールやドキュメント生成スキルスクリプト(例:pptx、docx)は含めず、素のモデル能力を反映するためのシンプルなコード実行ツールを提供します
- 成果物は指定された正確なファイル名と一致しなければならず、モデルが誤ったファイル名を出力した場合のファジーマッチングは行いません
ハルシネーション
Harveyが実施した人間の選好調査では、人間の専門家は、他の点で同程度に包括的な2つの回答のどちらを選ぶかを決める主要因として、ハルシネーションを挙げました。当社のハルシネーション検査は、実際の法務業務に重大な影響を与えうる誤りに焦点を当て、それらのフラグ付けには保守的なアプローチを採用しています。ソースファイルに裏付けのないタスク固有の主張と一般的な法律知識を区別し、後者は対象外としているため、モデルはソースファイルを超えて判例法や法令に基づいてもペナルティを受けません。
モデルが提出するすべての成果物は、タスクのソース文書と照合してハルシネーションの監査を受けます。使用可能な提出物がないタスクはゼロ点となり、監査もされず、タスクあたりのハルシネーション数の計算にも使用されません。ハルシネーションとは、成果物におけるソースが裏付けない主張のことであり、それぞれ以下の3つのカテゴリーのいずれかに分類されます。
- ソース資料との矛盾。
- 捏造されたソース内容。
- 記録に裏付けのない具体的な断言。
各ハルシネーションは「重大」または「軽微」に格付けされます。重大なハルシネーションとは、契約上要求される誤った日付など、実質的な論点で読者を誤解させるものです。軽微なハルシネーションとは、成果物の法的解釈に意味のある影響を与える可能性が低い、実際の誤りです。スコアに影響するのは重大なハルシネーションのみです。1件でもあると、Hallucination-Gated All-Pass Rateにおけるそのタスクのスコアはゼロになります。Criterion Pass Rateは、ハルシネーションゲート前のルーブリックカバー率を測定します。重大および軽微のハルシネーション数は、検査が実行されたタスクごとに報告されます。軽微なハルシネーションはスコアに影響しません。
ハルシネーション検査の仕組み
すべての成果物は、3つのステップでタスクのソース文書と照合して検査されます。
可能性のあるハルシネーションを見つける
審査員は提出物をタスクのソースと比較し、確認すべき記述にフラグを立てます。
税務コンプライアンス審査 · 提出物抜粋3例タスクソース · パートナーシップ申告書草案の抜粋
2023年中に6,000,000ドルの計画的元本償還が行われ、未償還残高は220,000,000ドル(期首残高、流動負債と分類された6,000,000ドルを含む)から214,000,000ドル(期末残高、第15行で流動と分類された6,000,000ドルを含む)に減少しました。
提出物 · 討議リスト
「債務スケジュール $220M term loan + $214M notes」
債務の二重計上の可能性同一提出物 · エクスポージャー表
“$6,400,000 *293/365 $5,136,986”
按分計算の誤りの可能性別の提出物(同一タスク) · 論点メモ
「$960,000の過剰納付は2024年に充当された」
$960,000がすでに充当されたと述べているが、ソースは申告前に確認を求めている。ルーブリックとハルシネーション検査は、提出物の異なる側面を評価します。
重大の例1件、軽微1件 · 1件は棄却スコアリングの例(説明用)
All-Pass Rate 全基準をパスした審査員の割合 67% 67%3人の審査員のうち2人が全基準をパス
Criterion Pass Rate 審査員の判定のうちパスとされた割合 90% 90%30件の審査員判定のうち27件がパス。ハルシネーションの影響を受けない
GPT-6モデルはハルシネーションが最も少なく、GPT-6 Astraはタスクあたり平均0.03件の重大なハルシネーション(全120タスクで4件)、GPT-6 Solは0.07件(全120タスクで8件)であるのに対し、ローンチセットで最も多いのはGemini 3.8 Flashで、タスクあたり13.96件です。基準を満たすこととハルシネーションを起こさないことは別のスキルです。Muse Spark 1.3は最も多くの基準をパスしています(96.0%)が、タスクあたり平均1.68件の重大なハルシネーションがあり、GPT-6 Astraは0.03件です。オープンウェイトのモデルはすべて、タスクあたり平均2.09件以上の重大なハルシネーションを起こしています。モデルのハルシネーション率は、実務分野よりもモデルに大きく依存します。
Harvey LAB-AA v1.1: タスクあたりのハルシネーション数
深刻度別に分割したタスクあたりの承認済みハルシネーションフラグ数 · 重大なフラグは実質的な論点で読者を誤解させるもので、軽微なフラグは法的解釈に影響する可能性が低い実際の誤りであり、スコアに影響するのは重大なフラグのみです · 数値は低いほど良い検証対象のHarvey LAB-AAタスク1件あたりの、ハルシネーションフラグ(支持されたもの)の平均数を重大度別に分けたもの。フラグは、当事者、金額、日付、義務の誤りや結論を変える事実など、実質的な論点で読者を誤導する場合に「重大(material)」、成果物の法的解釈に実質的な影響を与える可能性が低い実際の誤りである場合に「軽微(minor)」とされる。重大なフラグのみがヘッドラインのスコアを左右し、軽微なフラグは報告されるが採点には決して含まれない。
ハルシネーションチェッカーの選び方
ハルシネーションチェックの両パスには、3人の審査員によるルーブリックパネルとは別に、GPT-6 Sol(high)を使用した。ハルシネーション審査員の候補6つ、GPT-6 Sol、GPT-6 Luna、Grok 4.7、Claude Opus 5.5、Claude Sonnet 5.5、Gemini 3.8 Flashを、いずれも高推論努力(high reasoning effort)で、評価対象8モデルによる同一の20タスクおよび成果物において比較した。
このタスクのサブセットにおいて、GPT-6 SolとGPT-6 Lunaは概してより多くの重大なハルシネーションを特定し、Claude Sonnet 5.5とGemini 3.8 Flashははるかに少なかった。Claude Opus 5.5はすべてのモデル行でGrok 4.7とClaude Sonnet 5.5の中間に位置した。合計で、Opusは99件の重大なハルシネーションを支持したのに対し、Grokは219件、Sonnetは57件、GPT-6 Solは470件だった。GPT-6 Solは、ソース文書に含まれない一般的な法律知識を除外するというこのチェックの保守的なエラー検出方針にもかかわらず、より多くの重大なハルシネーションを特定した。
6つのチェッカーすべてがGPT-6 Astraの出力に重大なハルシネーションを一切見出さなかった一方、GPT-6 Solはタスクあたり0から0.20の範囲だった。両者は、どのチェッカーでも重大なハルシネーションが最も少ないモデル群に含まれていた。
Harvey LAB-AA v1.1:ハルシネーション審査モデルの比較
タスクあたりの支持された重大ハルシネーションの平均 · 20タスクおよび8モデルのサブセット · 数値が低いほど良いタスクあたりの重大ハルシネーションの平均0481217Harvey LAB-AA v1.1:ハルシネーション審査モデルの比較。タスクあたりの支持された重大ハルシネーションの平均 · 20タスクおよび8モデルのサブセット · 数値が低いほど良い。| 検証対象モデル | ハルシネーション審査員 | |||||
|---|---|---|---|---|---|---|
| GPT-6 Sol(high) | GPT-6 Luna(high) | Grok 4.7(high) | Claude Opus 5.5(high) | Claude Sonnet 5.5(high) | Gemini 3.8 Flash(high) | |
| GPT-6 Astra (max) | ||||||
| GPT-6 Sol (max) | ||||||
| Grok 4.7 (xhigh) | ||||||
| Claude Opus 5.5 (max with fallback) | ||||||
| Claude Fable 5.1 (max with fallback) | ||||||
| Muse Spark 1.3 (max) | ||||||
| Kimi K3 (max) | ||||||
| Gemini 3.8 Flash (high) | ||||||
| タスクあたりの重大ハルシネーション合計 | 23.50 | 19.35 | 10.95 | 4.95 | 2.85 | 1.40 |
ハルシネーション・ゲート付きニアパス率
基準を「ニアミス」まで許容すると、GPT-6 AstraとGPT-6.1 Solが上位に躍り出る。GPT-6 Astraは、ハルシネーション・ゲート付きオールパス率8.6%から、基準1件未達で20.3%、基準2件未達で31.7%のハルシネーション・ゲート付きニアパス率に上昇し、GPT-6.1 Solは6.9%から20.3%および29.6%に上昇する。これに対しGrok 4.7は15.3%と23.1%である。次に大きな伸びを示したのは、GPT-6 Sol(3.6%から18.1%)とClaude Sonnet 5.5(2.8%から16.9%)である。ハルシネーションによってパスが無効化されるモデルはあまり伸びない。重大なハルシネーションが1件でもあれば、どのバンドでもタスクはゼロになるためである:GLM-5.3は基準2件未達でも2.2%にしか達せず、Gemini 3.8 Flashは0%のままである。Harvey LAB-AA v1.1:ハルシネーション・ゲート付きニアパス率
審査員パネルのうち基準を0件、<=1件、<=2件しか未達としなかった割合のタスク平均 · 重大なハルシネーションが1件以上あるタスクは0%として計算 · 数値が高いほど良い基準未達数で並べ替えコスト
高スコアのモデルが最も高価というわけではない。Grok 4.7がタスクあたり約$9.50で首位だが、最も高価なモデルであるClaude Fable 5.1(約$21.70)の半分以下である。Muse Spark 1.3はコスト対性能で優れており、タスクあたり約$4.20で2位につけている。Harvey LAB-AA v1.1:タスクあたりコスト
タスクあたり平均コスト(USD)。入力、キャッシュヒット、キャッシュ書き込み、推論、回答トークン別の内訳評価におけるタスクあたり平均コスト。正規化されたトークン数が取得可能な場合、コストは入力、キャッシュヒット、キャッシュ書き込み、推論、回答トークンの価格別に分割されます。
トークン使用量
より多くの出力トークンを生成しても、必ずしも高いスコアにはつながりません。GPT-6 Astra はタスクあたり約81kの出力トークンで8.6%をスコアしており、Grok 4.7 の約180kの半分以下です。一方、3つのClaudeモデルは最も多くの出力トークンを生成し(タスクあたり約202kから約562k)、スコアは2.8%から6.4%です。Harvey LAB-AA v1.1: タスクあたり出力トークン数
1タスクの実行に使用された出力トークン。推論トークンと回答トークン別の内訳この評価におけるベンチマークタスクごとに生成された回答トークンと推論トークンの平均数。
速度
より強力なモデルほど時間がかかる傾向があります。推定デコード時間は、Grok 4.7 と Claude Fable 5.1 の両方でタスクあたり約33分です。Muse Spark 1.3 がタスクあたり約12分で2位です。これらの推定値には、最初のトークンまでの時間およびその他のオーバーヘッドは含まれません。Harvey LAB-AA v1.1: タスクあたり時間
タスクあたりの重み付き平均デコード時間(分)。TTFTとオーバーヘッド時間は除く · 低いほど良いタスクあたりの推定デコード時間(分)の重み付き平均。タスクあたりの出力トークン数を出力速度で割り、秒から分に変換したものです。最初のトークンまでの時間およびその他のオーバーヘッドは含まれません。
ターン数
最もスコアの高いモデルが最も長いループを実行しているわけではありません。Grok 4.7 はタスクあたり平均約63ターン、GPT-6 Astra は約54ターンです。Claude Sonnet 5.5 が最も長く、約179ターンで、スコアは2.8%です。Harvey LAB-AA v1.1: タスクあたり平均ターン数
Harvey LAB-AA v1.1 タスクあたりの平均モデルターン数 · 低いほど良いこのチャートは、タスクあたりにエージェントが実行する平均ターン数を示しています。ベンチマークタスクを完了するためにエージェントが使用するアクション、ツール呼び出し、反復サイクルの数のおおよその指標となります。
モデルサイズ(オープンウェイトモデルのみ)
Harvey LAB-AA v1.1: ハルシネーションゲート付き全合格率 vs. 計算プロキシ
Harvey LAB-AA v1.1 ハルシネーションゲート付き全合格率 · 計算プロキシ最も魅力的な象限パレート線使用された計算量の相対指数。Active Parameters (billions) × (Input Tokens / 5 + Output Tokens) / 1,000,000 として計算されます。プリフィルは生成と比較して計算コストが低いため、入力トークンには低い重みが割り当てられます。値が低いほど、計算効率の高いモデルであることを示します。チャートの左上に位置するモデルは、より少ない計算量で高いスコアを達成しています。
スコア vs. リリース日
Harvey LAB-AA v1.1: ハルシネーションゲート付き全合格率 vs. リリース日
最も魅力的な領域タスクおよび提出物の例
GitHub でタスクセットを表示公開タスクセットからの代表的な Harvey LAB タスク、各モデルに提供されたリファレンスファイル、およびモデルが作成した成果物をご覧ください。
合併・買収指示
添付の買収データルーム契約書および内部メモを確認し、経営権移転および譲渡条項をレビューした上で、包括的なディールチームレポートを作成してください。
出力: coc-analysis-report.docx
成果物
モデルが出力しなければならない期待される成果物
- coc-analysis-report.docxターゲット企業の重要契約における支配権変更および契約譲渡条項を分析する、包括的なディールチームレポート。
参照ファイル
モデルに提供される資料
開く開く開く開く開く開く開く開く開く開く開く開く開く開く開く開く開く開く開くモデルの提出物
各モデルが作成した成果物
Claude Opus 5.5 (max with fallback) - coc-analysis-report.docx開くHarvey LAB-AA リソース
- リーダーボードと完全な結果は、以下のページで公開されています。 Harvey LAB-AA 評価ページ新しいモデルのリリースに合わせて更新されます
- The 方法论ページ エージェントおよびルーブリック評価用プロンプトを含む実装の全体を文書化しています
- HarveyによるLABの最初の発表 ベンチマークとその設計を紹介しています
- 公開されている代表的なタスクのセットは以下で入手可能です: GitHub
- Harvey LAB-AAは Stirrup(弊社のオープンソースエージェントフレームワーク)上で動作します
最新情報を読む

AnthropicがClaude Haiku 5.5をリリースしました
Claude Haiku 5.5はArtificial Analysis Intelligence Indexで43を記録し、前回のHaikuリリースから1年で26ポイント上昇しました
2026年10月7日

MistralがMistral Large 4をリリースし、フランスが米国と中国以外で最も知能の高いモデルの本場となりました
MistralがMistral Large 4をリリースし、Artificial Analysis Intelligence Indexで38を記録。フランスが再び米国と中国以外で最も知能の高いモデルを有することになりました
2026年10月6日
韓国のAI企業UpstageがSolar Mini 4をリリース
韓国のAI企業UpstageがSolar Mini 4をリリースしました。Artificial Analysis Intelligence Indexで24を記録しましたが、トークンあたりの価格は類似しているにもかかわらず、タスクあたりのコストはGPT-6 Luna (max)の約5倍です
2026年9月30日
