Wir kündigen Harvey LAB-AA v1.1 an: Halluzinationsprüfungen heben die Messlatte für agentische juristische Arbeit
Wir haben mit Harvey an Harvey LAB-AA v1.1 zusammengearbeitet, das unsere Bewertungsmethodik für den Legal Agent Benchmark (LAB) für KI-Agenten aktualisiert, die echte, agentische juristische Arbeit leisten. Jedes Ergebnis wird nun auf Halluzinationen gegen seine Quelldokumente geprüft, ein Gremium aus drei Richtern bewertet jedes Rubrik-Kriterium, und die neue Hauptmetrik, die Hallucination-Gated All-Pass Rate, schreibt eine Aufgabe nur gut, wenn die Ergebnisse jedes Rubrik-Kriterium erfüllen und keine wesentlichen Halluzinationen enthalten.
Jedes Modell durchläuft 120 private juristische Aufgaben, die vom Team bei Harvey erstellt wurden, vonCorporate M&A und Kapitalmärkten bis hin zu Steuerrecht, Prozessführung und Insolvenz. Dies ist der erste Schritt zur Verbesserung der Methodik für Harvey LAB-AA. In zukünftigen Updates arbeiten wir mit Harvey daran, die gesamte Bandbreite der Faktoren besser zu berücksichtigen, die Anwälte schätzen, einschließlich Benutzerfreundlichkeitsmerkmalen wie Stil und Ton.
Punktzahl
Harvey LAB-AA v1.1: Hallucination-Gated All-Pass Rate
Durchschnitt über die Aufgaben des Anteils des Richtergremius, der jedes Rubrik-Kriterium als bestanden findet, wobei eine Aufgabe bei jeder wesentlichen Halluzination auf null gesetzt wird · Unabhängig getestet von Artificial AnalysisGrok 4.7 (xhigh) führt Harvey LAB-AA v1.1 mit einer Hallucination-Gated All-Pass Rate von 9.4% an, knapp vor Muse Spark 1.3 (max) mit 8.9% und GPT-6 Astra (max) mit 8.6%. GPT-6.1 Sol (max) folgt mit 6.9%, dann Claude Fable 5.1 (max, with fallback) mit 6.4%, Kimi K3 (max) mit 5.3% und Claude Opus 5.5 (max, with fallback) mit 4.2%. Die Claude-Modelle liefen mit aktiviertem Fallback von Anthropic, nutzten ihn jedoch nie.
Die Berücksichtigung von Halluzinationen verändert die Rangliste bei Harvey LAB-AA. Ohne die Halluzinationssperre würde Muse Spark 1.3 klar mit einer All-Pass Rate von 26.7% führen, aber zwei Drittel dieser bestandenen Aufgaben enthalten eine wesentliche Halluzination. GPT-6 Astra behält fast alle seine bestandenen Aufgaben (8.9% zu 8.6%) und steigt von Platz 10 (geteilt) bei der All-Pass Rate auf Platz 3 bei der Hallucination-Gated All-Pass Rate. GPT-6.1 Sol fällt vergleichsweise wenig, von 7.5% auf 6.9%. Bei den getesteten Modellen enthalten mehr als 60% der ansonsten bestandenen Ergebnisse eine wesentliche Halluzination, und mehrere Modelle erreichen nach Berücksichtigung der Halluzinationen 0%.
Die meisten Modelle erfüllen die große Mehrheit der Rubrik-Kriterien: 16 Modelle bestehen 85.6-96.0% der Kriterien. Die Rubriken bewerten jedes Ergebnis ganzheitlich und nicht nur anhand von auf Schwierigkeit ausgewählten Kriterien. Wir berichten die Criterion Pass Rate vor der Halluzinationssperre zusammen mit den wesentlichen Halluzinationen pro Aufgabe, um Rubrik-Abdeckung und Erdung getrennt darzustellen.
Aktuelle Ergebnisse finden Sie auf der Harvey LAB-AA-Evaluationsseite. Dieser Artikel zeigt Daten vom Stand 8. Oktober 2026.
Änderungen in Harvey LAB-AA v1.1
Wir haben mit Harvey zusammengearbeitet, um Harvey LAB-AA auf v1.1 zu aktualisieren. Das Update ändert, wie der Benchmark benotet und bewertet wird, sodass die v1.1-Ergebnisse nicht direkt mit den zuvor veröffentlichten v1.0-Zahlen vergleichbar sind:
- Halluzinationsprüfung. Jedes von einem Modell eingereichte Ergebnis wird nun in einer zweistufigen Prüfung gegen die Quelldokumente der Aufgabe auditiert; eine Aufgabe ohne verwertbare Einreichung erhält null Punkte und wird nicht auditiert. Ein erster Richter markiert Kandidaten-Halluzinationen in drei Kategorien – Widersprüche zu den Quellmaterialien, erfundener Quellinhalt und spezifische Behauptungen ohne Unterstützung in den Quellen – und ein zweiter Durchlauf desselben Richters prüft jede Markierung gegen die Quelldokumente dieser Aufgabe, verwirft Markierungen, die nicht Bestand haben, und stuft die übrigen als wesentlich oder geringfügig ein.
- Hallucination-Gated All-Pass Rate als Hauptmetrik. Die Hauptmetrik ist nun die Hallucination-Gated All-Pass Rate: Eine Aufgabe zählt nur, wenn die Ergebnisse jedes Rubrik-Kriterium erfüllen und keine wesentliche Halluzination enthalten.
- Criterion Pass Rate und wesentliche Halluzinationen. Wir berichten den Anteil der vor der Halluzinationssperre bestandenen Rubrik-Kriterien, gemittelt über die drei Richter und zusammengefasst über alle Kriterien, zusammen mit der mittleren Anzahl wesentlicher Halluzinationen pro geprüfter Aufgabe. Das Streudiagramm vergleicht diese beiden Metriken direkt.
- Drei-Richter-Rubrik-Gremium. Rubrik-Kriterien werden nun von einem Gremium aus drei LLM-Richtern benotet – GPT-6 Sol, Grok 4.7 und Claude Opus 5.5 –, wobei die Urteile über das Gremium gemittelt werden, anstelle des in v1.0 verwendeten einzelnen Richters. Wir haben diese Richter überprüft und dabei minimale Selbstbevorzugung ihrer eigenen Modellfamilien festgestellt; die Mittelung über alle drei mildert etwaige entstehende Verzerrungen ab.
- Datensatz-Update. v1.1 verwendet den neuesten privaten Datensatz von Harvey (v1.1.0), der Verbesserungen an den Aufgaben und Kriterien enthält.
Wie sich Harvey LAB-AA von Harveys LAB unterscheidet
Harvey LAB-AA ist unsere unabhängige Neuimplementierung von Harveys Evaluation, und es gibt mehrere wesentliche Unterschiede zur Originalversion:
- Modelle werden auf unserem Stirrup -Agent-Harness ausgeführt, was Funktionen wie Kontextkompaktion statt eines Fehlers beim Erreichen von Kontextgrenzen ermöglicht, mit vereinfachten von Artificial Analysis verfassten Agenten- und Richter-Prompts
- Wir schließen Harveys benutzerdefinierte Tools und Skill-Skripte zur Dokumenterstellung (z. B. pptx, docx) nicht ein und stellen stattdessen ein einfaches Codeausführungstool bereit, um die rohe Modellfähigkeit widerzuspiegeln
- Ergebnisse müssen exakt dem angegebenen Dateinamen entsprechen, statt fuzzy matching, wenn Modelle falsche Dateinamen erzeugen
Halluzinationen
In Human-Preference-Studien, die von Harvey durchgeführt wurden, markierten menschliche Experten Halluzinationen als einen primären entscheidenden Faktor dafür, welche von zwei ansonsten gleichermaßen umfassenden Antworten sie bevorzugten. Unser Halluzinationscheck konzentriert sich auf Fehler, die die tatsächliche juristische Arbeit wesentlich beeinträchtigen könnten, und geht bei deren Markierung konservativ vor. Er unterscheidet nicht unterstützte aufgabenspezifische Behauptungen von allgemeinem juristischem Wissen und stellt Letzteres außerhalb des Geltungsbereichs, sodass Modelle nicht bestraft werden, wenn sie auf Rechtsprechung oder Gesetze über die Quelldateien hinaus zurückgreifen.
Jedes Arbeitsergebnis, das ein Modell einreicht, wird anhand der Quelldokumente der Aufgabe auf Halluzinationen geprüft. Eine Aufgabe ohne verwertbare Einreichung erhält null Punkte und wird weder geprüft noch in die Berechnung der Halluzinationen pro Aufgabe einbezogen. Eine Halluzination ist eine Behauptung im Arbeitsergebnis, die von den Quellen nicht gestützt wird, und jede fällt in eine von drei Kategorien:
- Ein Widerspruch zu den Quellmaterialien.
- Erfundener Quelleninhalt.
- Eine spezifische Behauptung ohne jede Unterstützung im Quellenmaterial.
Jede Halluzination wird als wesentlich (material) oder geringfügig (minor) eingestuft. Eine wesentliche Halluzination würde einen Leser in einem inhaltlichen Punkt in die Irre führen, etwa ein falscher vertraglich erforderliches Datum. Eine geringfügige Halluzination ist ein echter Fehler, der die juristische Interpretation eines Arbeitsergebnisses voraussichtlich nicht wesentlich beeinflusst. Nur wesentliche Halluzinationen wirken sich auf die Bewertung aus: Eine oder mehrere setzen die Punktzahl einer Aufgabe in der Hallucination-Gated All-Pass Rate auf null. Die Criterion Pass Rate misst die Abdeckung der Bewertungskriterien vor der Halluzinationssperre. Die Anzahl der wesentlichen und geringfügigen Halluzinationen wird pro geprüfter Aufgabe berichtet; geringfügige Halluzinationen beeinflussen die Punktzahl nicht.
Wie der Halluzinationscheck funktioniert
Jedes Arbeitsergebnis wird in drei Schritten anhand der Quelldokumente der Aufgabe geprüft.
Mögliche Halluzinationen finden
Der Richter vergleicht die Einreichung mit den Aufgabenquellen und markiert Aussagen zur Überprüfung.
Steuerrechtliche Prüfung · Auszüge aus der Einreichung3 BeispieleAufgabenquelle · Auszug aus dem Entwurf der Partnerschaftssteuererklärung
Im Jahr 2023 wurde eine planmäßige Tilgung des Kapitals in Höhe von $6,000,000 geleistet, wodurch sich der ausstehende Saldo von $220,000,000 (Jahresanfang, einschließlich $6,000,000, die als laufend eingestuft wurden) auf $214,000,000 (Jahresende, einschließlich $6,000,000, die in Position 15 als laufend eingestuft wurden) verringerte.
Die Einreichung · Diskussionsliste
„debt schedule $220M term loan + $214M notes“
Mögliche Doppelzählung von SchuldenDieselbe Einreichung · Exposure-Schema
“$6,400,000 *293/365 $5,136,986”
Möglicher Fehler in der anteiligen BerechnungSeparate Einreichung, dieselbe Aufgabe · Issues-Memo
„The $960,000 overpayment was credited to 2024“
Behauptet, die 960.000 $ seien bereits gutgeschrieben worden, aber die Quelle bittet vor der Einreichung um Bestätigung.Die Bewertungskriterien und der Halluzinationscheck bewerten unterschiedliche Aspekte der Einreichung.
1 wesentliches Beispiel1 geringfügig · 1 nicht aufrechterhaltenVeranschaulichendes Bewertungsbeispiel
All-Pass RateAnteil der Richter, die jedes Kriterium bestehen67%67%2 von 3 Richtern bestanden jedes Kriterium
Criterion Pass RateAnteil der Richterurteile, die Bestehensurteile sind90%90%27 von 30 Richterurteilen waren Bestehensurteile; unbeeinflusst von Halluzinationen
Die GPT-6-Modelle halluzinieren am wenigsten: GPT-6 Astra weist im Durchschnitt 0.03 wesentliche Halluzinationen pro Aufgabe auf (4 Halluzinationen über alle 120 Aufgaben) und GPT-6 Sol 0.07 (8 Halluzinationen über alle 120 Aufgaben), während Gemini 3.8 Flash im Launch-Set den höchsten Durchschnitt mit 13.96 pro Aufgabe aufweist. Das Erfüllen der Kriterien und das Nicht-Halluzinieren sind unterschiedliche Fähigkeiten: Muse Spark 1.3 erfüllt die meisten Kriterien (96.0 %), weist aber durchschnittlich 1.68 wesentliche Halluzinationen pro Aufgabe auf, gegenüber 0.03 bei GPT-6 Astra. Jedes Open-Weights-Modell weist durchschnittlich mindestens 2.09 wesentliche Halluzinationen pro Aufgabe auf. Die Halluzinationsrate eines Modells hängt weit stärker vom Modell selbst ab als vom Rechtsgebiet.
Harvey LAB-AA v1.1: Halluzinationen pro Aufgabe
Aufrechterhaltene Halluzinationsmarkierungen pro Aufgabe, aufgeschlüsselt nach Schwere · Wesentliche Markierungen würden einen Leser in einem inhaltlichen Punkt in die Irre führen, geringfügige Markierungen sind echte Fehler, die die juristische Interpretation voraussichtlich nicht beeinflussen, und nur wesentliche Markierungen wirken sich auf die zentrale Punktzahl aus · Niedriger ist besserDurchschnittliche Anzahl von bestätigten Halluzinations-Markierungen pro geprüfter Harvey LAB-AA-Aufgabe, aufgeschlüsselt nach Schweregrad. Eine Markierung ist materiell, wenn sie einen Leser in einem inhaltlichen Punkt irreführen würde – eine falsche Partei, ein falscher Betrag, ein falsches Datum oder eine falsche Verpflichtung oder eine Tatsache, die eine Schlussfolgerung ändert – und geringfügig, wenn es sich um einen echten Fehler handelt, der die rechtliche Interpretation eines Ergebnisses voraussichtlich nicht wesentlich beeinträchtigt. Nur materielle Markierungen fließen in die Kernbewertung ein; geringfügige Markierungen werden berichtet, aber nie gewertet.
Wie wir den Halluzinations-Prüfer ausgewählt haben
Wir verwenden GPT-6 Sol (high) für beide Durchgänge der Halluzinationsprüfung, getrennt von der Drei-Richter-Rubric-Jury. Wir haben sechs Kandidaten für den Halluzinationsrichter verglichen: GPT-6 Sol, GPT-6 Luna, Grok 4.7, Claude Opus 5.5, Claude Sonnet 5.5 und Gemini 3.8 Flash, jeweils mit hohem Reasoning-Aufwand, an denselben 20 Aufgaben und Ergebnissen von acht bewerteten Modellen.
In dieser Teilaufgabenmenge identifizierten GPT-6 Sol und GPT-6 Luna im Allgemeinen mehr materielle Halluzinationen, während Claude Sonnet 5.5 und Gemini 3.8 Flash deutlich weniger identifizierten. Claude Opus 5.5 lag in jeder Modellzeile zwischen Grok 4.7 und Claude Sonnet 5.5. Insgesamt bestätigte Opus 99 materielle Halluzinationen, verglichen mit 219 für Grok, 57 für Sonnet und 470 für GPT-6 Sol. GPT-6 Sol identifizierte mehr materielle Halluzinationen, trotz des konservativen Ansatzes der Prüfung beim Markieren von Fehlern, der allgemeines Rechtswissen, das nicht in den Quelldokumenten enthalten ist, ausschließt.
Alle sechs Prüfer fanden keine materiellen Halluzinationen in den Ergebnissen von GPT-6 Astra, während GPT-6 Sol zwischen 0 und 0.20 pro Aufgabe lag. Beide gehörten bei jedem Prüfer zu den Modellen mit den wenigsten materiellen Halluzinationen.
Harvey LAB-AA v1.1: Vergleich der Halluzinationsrichter-Modelle
Mittlere Anzahl bestätigter materieller Halluzinationen pro Aufgabe · Teilauswahl von 20 Aufgaben und 8 Modellen · Niedriger ist besserMittlere materielle Halluzinationen pro Aufgabe0481217Harvey LAB-AA v1.1: Vergleich der Halluzinationsrichter-Modelle. Mittlere Anzahl bestätigter materieller Halluzinationen pro Aufgabe · Teilauswahl von 20 Aufgaben und 8 Modellen · Niedriger ist besser.| GEPRÜFTES MODELL | HALLUZINATIONSRICHTER | |||||
|---|---|---|---|---|---|---|
| GPT-6 Sol(high) | GPT-6 Luna(high) | Grok 4.7(high) | Claude Opus 5.5(high) | Claude Sonnet 5.5(high) | Gemini 3.8 Flash(high) | |
| GPT-6 Astra (max) | ||||||
| GPT-6 Sol (max) | ||||||
| Grok 4.7 (xhigh) | ||||||
| Claude Opus 5.5 (max with fallback) | ||||||
| Claude Fable 5.1 (max with fallback) | ||||||
| Muse Spark 1.3 (max) | ||||||
| Kimi K3 (max) | ||||||
| Gemini 3.8 Flash (high) | ||||||
| Materielle Halluzinationen pro Aufgabe insgesamt | 23.50 | 19.35 | 10.95 | 4.95 | 2.85 | 1.40 |
Halluzinationsgefilterte Fast-Bestehensquote
Wenn Beinahe-Fehler bei den Kriterien zugelassen werden, liegen GPT-6 Astra und GPT-6.1 Sol vorn. GPT-6 Astra steigt von einer 8.6%igen Halluzinationsgefilterten Alles-Bestehensquote auf eine 20.3%ige Halluzinationsgefilterte Fast-Bestehensquote mit einem verpassten Kriterium und 31.7% mit zwei verpassten Kriterien, und GPT-6.1 Sol von 6.9% auf 20.3% und 29.6%, gegenüber 15.3% und 23.1% für Grok 4.7. Die größten weiteren Zuwächse erzielen GPT-6 Sol (3.6% auf 18.1%) und Claude Sonnet 5.5 (2.8% auf 16.9%). Modelle, deren Bestehensquoten durch Halluzinationen zunichtegemacht werden, profitieren kaum, da eine materielle Halluzination die Aufgabe in jeder Stufe weiterhin null setzt: GLM-5.3 erreicht selbst mit zwei Fehlern nur 2.2%, und Gemini 3.8 Flash bleibt bei 0%.Harvey LAB-AA v1.1: Halluzinationsgefilterte Fast-Bestehensquote
Durchschnitt über Aufgaben des Anteils der Richterjury, der 0, <=1 und <=2 Kriterien verfehlt hat · Aufgaben mit mindestens 1 materieller Halluzination zählen als 0% · Höher ist besserSortieren nach verpassten KriterienKosten
Die Modelle mit den höchsten Punktzahlen sind nicht die teuersten. Grok 4.7 führt mit ca. $9.50 pro Aufgabe, weniger als die Hälfte der Kosten von Claude Fable 5.1 (ca. $21.70), dem teuersten Modell. Muse Spark 1.3 bietet starke Leistung für seine Kosten und landet mit ca. $4.20 pro Aufgabe auf dem zweiten Platz.Harvey LAB-AA v1.1: Kosten pro Aufgabe
Durchschnittliche Kosten pro Aufgabe (USD), aufgeschlüsselt nach Eingabe-, Cache-Hit-, Cache-Write-, Reasoning- und Antwort-TokensDurchschnittliche Kosten pro Aufgabe in der Auswertung. Die Kosten sind aufgeschlüsselt nach Eingabe-, Cache-Hit-, Cache-Write-, Reasoning- und Antwort-Token-Preisen, sofern kanonische Token-Zahlen verfügbar sind.
Token-Verbrauch
Mehr Ausgabe-Tokens zu generieren führt nicht unbedingt zu einer höheren Punktzahl. GPT-6 Astra erzielt 8.6% mit ~81k Ausgabe-Tokens pro Aufgabe, weniger als die Hälfte von Grok 4.7s ~180k, während die drei Claude-Modelle die meisten Ausgabe-Tokens generieren (~202k bis ~562k pro Aufgabe) und 2.8% bis 6.4% erreichen.Harvey LAB-AA v1.1: Ausgabe-Tokens pro Aufgabe
Ausgabe-Tokens, die zur Ausführung einer Aufgabe verwendet werden, aufgeschlüsselt nach Reasoning- und Antwort-TokensDie durchschnittliche Anzahl an Antwort- und Reasoning-Tokens pro Benchmark-Aufgabe in dieser Auswertung.
Geschwindigkeit
Stärkere Modelle brauchen tendenziell länger. Die geschätzte Decode-Zeit beträgt ~33 Minuten pro Aufgabe sowohl für Grok 4.7 als auch für Claude Fable 5.1. Muse Spark 1.3 liegt mit ~12 Minuten pro Aufgabe auf dem zweiten Platz. Diese Schätzungen schließen die Zeit bis zum ersten Token und anderen Overhead aus.Harvey LAB-AA v1.1: Zeit pro Aufgabe
Gewichtete durchschnittliche Decode-Zeit (Minuten) pro Aufgabe; ohne TTFT und Overhead-Zeit · Niedriger ist besserDie gewichtete durchschnittliche geschätzte Decode-Zeit (Minuten) pro Aufgabe. Die Ausgabe-Tokens pro Aufgabe werden durch die Ausgabe-Geschwindigkeit geteilt und von Sekunden in Minuten umgerechnet. Dies schließt die Zeit bis zum ersten Token und anderen Overhead aus.
Durchläufe
Die besten Modelle führen nicht die längsten Schleifen aus. Grok 4.7 benötigt durchschnittlich ~63 Durchläufe pro Aufgabe und GPT-6 Astra ~54. Claude Sonnet 5.5 braucht am längsten, ~179 Durchläufe, und erreicht 2.8%.Harvey LAB-AA v1.1: Durchschnittliche Durchläufe pro Aufgabe
Durchschnittliche Anzahl an Modell-Durchläufen pro Harvey LAB-AA v1.1 Aufgabe · Niedriger ist besserDiese Grafik zeigt die durchschnittliche Anzahl an Durchläufen, die der Agent pro Aufgabe benötigt. Sie ist ein grober Anhaltspunkt dafür, wie viele Aktionen, Tool-Aufrufe und Iterationszyklen ein Agent zur Erledigung der Benchmark-Aufgaben verwendet.
Modellgröße (nur Modelle mit offenen Gewichten)
Harvey LAB-AA v1.1: Halluzinationsgefilterte All-Pass-Rate vs. Compute-Proxy
Harvey LAB-AA v1.1 Halluzinationsgefilterte All-Pass-Rate · Compute-ProxyAttraktivster QuadrantPareto-LinieEin relativer Index des verwendeten Compute, berechnet als Aktive Parameter (Milliarden) × (Eingabe-Tokens / 5 + Ausgabe-Tokens) / 1,000,000. Eingabe-Tokens werden abgewertet, um die geringeren Compute-Kosten von Prefill im Vergleich zur Generierung widerzuspiegeln. Niedrigere Werte zeigen compute-effizientere Modelle an. Modelle oben links in der Grafik erzielen hohe Punktzahlen mit weniger Compute.
Punktzahl vs. Veröffentlichungsdatum
Harvey LAB-AA v1.1: Halluzinationsgefilterte All-Pass-Rate vs. Veröffentlichungsdatum
Attraktivster BereichBeispielaufgaben & Einreichungen
Aufgabenset auf GitHub ansehenStöbern Sie durch repräsentative Harvey LAB-Aufgaben aus dem öffentlichen Aufgabenset, die Referenzdateien, die jedem Modell gegeben wurden, und die von ihm erstellten Ergebnisse.
Mergers & AcquisitionsAnweisungen
Überprüfen Sie die beigefügten Verträge des Datenraums zur Übernahme und das interne Memo auf Change-of-Control- und Abtretungsbestimmungen und erstellen Sie einen umfassenden Bericht für das Deal-Team.
Ausgabe: coc-analysis-report.docx
Ergebnisse
Erwartete Ausgaben, die das Modell erzeugen muss
- coc-analysis-report.docxEin umfassender Bericht des Deal-Teams, der Change-of-Control- und Abtretungsklauseln in den wesentlichen Verträgen des Zielunternehmens analysiert.
Referenzdateien
Dem Modell bereitgestellt
ÖffnenÖffnenÖffnenÖffnenÖffnenÖffnenÖffnenÖffnenÖffnenÖffnenÖffnenÖffnenÖffnenÖffnenÖffnenÖffnenÖffnenÖffnenÖffnenModellabgaben
Von jedem Modell erstellte Ergebnisse
Claude Opus 5.5 (max mit Fallback) - coc-analysis-report.docxÖffnenHarvey LAB-AA-Ressourcen
- Das Leaderboard und die vollständigen Ergebnisse befinden sich auf der Harvey LAB-AA-Evaluierungsseite, die aktualisiert wird, sobald neue Modelle veröffentlicht werden
- Die Methodik-Seite dokumentiert die vollständige Implementierung, einschließlich der Agent- und Rubric-Bewertungsprompts
- Harveys ursprüngliche LAB-Ankündigung stellt den Benchmark und sein Design vor
- Ein öffentliches Set repräsentativer Aufgaben ist verfügbar auf GitHub
- Harvey LAB-AA läuft auf Stirrup, unserem Open-Source-Agent-Framework
Lesen Sie das Neueste

Anthropic hat Claude Haiku 5.5 veröffentlicht
Claude Haiku 5.5 erzielt 43 Punkte auf dem Artificial Analysis Intelligence Index, ein Anstieg von 26 Punkten ein Jahr nach der letzten Haiku-Veröffentlichung
7. Oktober 2026

Mistral hat Mistral Large 4 veröffentlicht, womit Frankreich Standort des intelligentesten Modells außerhalb der USA und Chinas ist
Mistral hat Mistral Large 4 veröffentlicht, das 38 Punkte auf dem Artificial Analysis Intelligence Index erzielt; Frankreich hat wieder das intelligenteste Modell von außerhalb der USA und Chinas
6. Oktober 2026
Das koreanische KI-Labor Upstage veröffentlicht Solar Mini 4
Das koreanische KI-Labor Upstage hat Solar Mini 4 veröffentlicht, das 24 Punkte auf dem Artificial Analysis Intelligence Index erzielt, aber pro Aufgabe ~5x so viel kostet wie GPT-6 Luna (max), trotz ähnlicher Preise pro Token
30. September 2026
