Urteilsvermögen ist es, was erfahrene Fachkräfte von ihren jüngeren Kollegen unterscheidet. Der Aufbau von Urteilsvermögen erfordert tausende Stunden des Lernens im Beruf, meist durch mühsame, aber prägende Auseinandersetzung mit relativ routinemäßiger Arbeit, oft unter Anleitung erfahrener Kräfte. Doch KI verändert bereits wie das Lernen im Beruf funktioniert. Einerseits zeigen empirische Studien in der Radiologie, beim geschäftlichen Problemlösen, beim Schreiben von Bewerbernund in der juristischen Ausbildung , dass weniger erfahrene Arbeitskräfte ihre eigenständige Leistung verbessern können, wenn KI-Tools durchdacht in Schulungsabläufe eingebunden werden.
Andererseits zeigen jüngere Experimente mit Softwareentwicklern, Managementberatern, Schülern der Oberstufeund Klinikern , dass KI zwar als temporäres Exoskelett dient, das unmittelbare Ergebnisse steigert, diese Gewinne aber oft nicht bestehen bleiben, sobald das Werkzeug entfernt wird. Zu verstehen, wie KI Fachwissen untergraben oder stärken kann, erfordert drei Elemente, die selten zusammen vorkommen: (1) eine über Monate statt Stunden andauernde, in gewöhnliche Berufstätigkeit eingebettete KI-Nutzung, (2) eine glaubwürdige Bewertung des Urteilsvermögens ohne Unterstützung, wenn KI nicht verfügbar ist, und (3) eine verblindete Benotung durch Fachexperten.
In „Stärkt oder schwächt KI-Unterstützung Fachexpertise? Erkenntnisse aus einem dreimonatigen Feldexperiment zum Verfassen von Patentanmeldungen“, veröffentlicht vom National Bureau of Economic Research, beschreiben wir ein Feldexperiment, mit dem wir sowohl Veränderungen der kurzfristigen Produktivität als auch des längerfristigen Kompetenzaufbaus erfassen, die durch die Nutzung von KI im besonders fachwissensintensiven Berufsfeld des gewerblichen Rechtsschutzes entstehen. In unserem Experiment haben wir den Zugang zu einem damals noch nicht veröffentlichten KI-Patent-Assistenztool von Google Labs , das heute Teil von Gemini Notebookist, unter 133 Anwälten in elf auf gewerblichen Rechtsschutz spezialisierten Kanzleien, die in regelmäßiger, nicht exklusiver Geschäftsbeziehung zu Google stehen, randomisiert verteilt. Zwei Drittel der Anwälte jeder Kanzlei („Treatment“-Gruppe) erhielten frühzeitigen Zugang zum Tool, während der Rest („Kontroll“-Gruppe) zwar eine Schulung zur Nutzung von KI bekam, das Tool aber erst nach dem dreimonatigen Studienzeitraum nutzen durfte.
Bessere Arbeit mit KI
Nach 10 Tagen KI-Unterstützung schickten wir allen teilnehmenden Anwälten ein Paket mit Erfinderunterlagen zu einer hypothetischen Erfindung und baten sie, ein Patent zu entwerfen. Dasselbe taten wir nach 90 Tagen mit einem anderen Satz simulierter Erfinderunterlagen. Wir sahen den erwarteten KI-Leistungsschub bei beiden Zeitpunkten der Entwurfstasks. Nach 10 Tagen erhöhte der Zugang zum KI-Tool die Bewertungspunkte der Entwürfe (benotet anhand eines Schemas mit Likert-Skalen für fünf verschiedene Qualitätsaspekte durch unabhängige juristische Experten) um 0,34 Standardabweichungen, was einem Anstieg um 10 Prozentpunkte im Perzentilranking innerhalb der Punkte der Kontrollgruppe entspricht; nach 90 Tagen stieg diese Verbesserung auf 0,38 SD, was einem Anstieg um 11 Perzentilpunkte entspricht. Diese Verbesserungen traten mit bemerkenswerter Konsistenz über alle Qualitätsdimensionen hinweg auf. Aufschlussreich ist, dass die bessere Leistung aus einer geringeren Häufigkeit schlechter Punkte und einer höheren Häufigkeit guter Punkte resultierte, während sich die Häufigkeit ausgezeichneter Punkte nicht änderte. Formal ausgedrückt: Die Punkte der Anwälte mit KI-Zugang bewegten sich vom unteren in das untere mittlere und mittlere Quintil, doch die Zahl außergewöhnlicher Punktzahlen veränderte sich nicht erkennbar. Dieses Muster zeigte sich besonders deutlich bei Junioranwälten, deren Qualitätsverbesserungen auch mit erheblichen Zeitersparnissen einhergingen (beispielsweise 18 Minuten schneller als die Durchschnittsgeschwindigkeit der Kontrollgruppe von 124 Minuten bei der Aufgabe nach 10 Tagen).
Aber Patentanwälte verfassen nicht nur Patente; sie überprüfen auch gegenseitig ihre Arbeit auf kritische Fehler (manchmal als „Patent Profanity“ bezeichnet), die Patente vor Gericht un durchsetzbar machen können – etwa durch eine Überschätzung der Neuheit oder des Schutzumfangs einer Erfindung. Daher haben wir bei 90 Tagen eine weitere Aufgabe hinzugefügt, bei der die Probanden ein vorhandenes hypothetisches Patent mit zahlreichen Fehlern, sowohl inhaltlichen als auch stilistischen, redlinen sollten (also manuell markieren und korrigieren). Diese Testaufgabe spiegelt die Art professionellen Urteilsvermögens wider, das erfahrenere Anwälte routinemäßig anwenden und für das sie sich meist nicht auf die Hilfe von KI verlassen können. Entscheidend ist: Während die Anwälte der Behandlungsgruppe bei den Verfassungsaufgaben ermutigt wurden, das noch nicht veröffentlichte KI-Tool oder ein beliebiges anderes KI-Tool zu verwenden, durfte niemand KI für die Redlining-Aufgabe verwenden, wodurch ihre Ergebnisse bei dieser Aufgabe ein Maß dafür waren, wie gut sich ihre Fähigkeiten entwickelt hatten. Für alle Aufgaben, sowohl das Verfassen als auch das Redlining, arbeiteten wir mit externen Patentfachleuten zusammen, um die Einreichungen anhand von fünf Qualitätsdimensionen zu bewerten: (1) Durchsetzbarkeit, (2) Genauigkeit, (3) strategische Ambiguität (die taktische Fassung der Ansprüche), (4) Vollständigkeit und (5) Klarheit.
Geschätzte Auswirkung des KI-Zugriffs auf die Qualität der Patentverfassung und des Redlinings. Die Ergebnisse werden für alle Anwälte (schwarze Quadrate), Berufseinsteiger mit weniger als 7 Jahren Berufserfahrung (blaue Dreiecke) und erfahrene Anwälte mit 7 oder mehr Jahren Berufserfahrung (orange Rauten) berichtet. Alle Schätzungen berücksichtigen Unterschiede zwischen Kanzleien und passen sich an geringe Schwankungen in der Anzahl der Bewertungen an, die jeder Anwalt erhalten hat.
Wenn KI entfernt wird
Als die KI-Unterstützung für die Redlining-Aufgabe bei 90 Tagen entfernt wurde, verschwand der Nivellierungseffekt. Anwälte mit KI-Tool-Zugang übertrafen die Kontrollgruppe bei dieser unbegleiteten Aufgabe um 0.32 SD (ein Anstieg um 9 Prozentpunkte im Perzentilranking), aber dieser Effekt wurde vollständig von erfahrenen Anwälten getragen, die die Kontrollprobanden um 0.45 SD übertrafen (ein Anstieg um 13 Punkte), während Berufseinsteiger keine erkennbare Verbesserung zeigten. Stattdessen gingen die Ergebnisse der Berufseinsteiger auseinander: mehr sehr niedrige Ergebnisse, weniger mittelmäßige, mehr gute und keine ausgezeichneten.
Was bedeuten diese Ergebnisse für das Lernen? Erfahrene Anwälte, die Zugang zum KI-Tool erhalten hatten, zogen offensichtlich erheblichen Nutzen für ihr professionelles Urteilsvermögen aus der Nutzung des Tools in den vorangegangenen drei Monaten. Doch das Bild auf der Ebene der Berufseinsteiger ist nuancierter. Einige Ergebnisse verbesserten sich, was auf die Fähigkeit der KI hindeutet, Lernen zu überspringen. Andere Ergebnisse verteilten sich auf die unteren Bereiche der Verteilung, was zeigt, dass KI in manchen Szenarien Berufseinsteigern dabei helfen kann, ausreichende Arbeit zu liefern, aber ihre höhere maschinengestützte Leistung führt nicht zu einer schnelleren Aneignung der Expertise, die erfahrene Fachkräfte besonders wertvoll macht.
Verteilungen der durchschnittlichen Redlining-Bewertung für behandelte (orange) und Kontroll- (blaue) Probanden nach Erfahrung für alle Anwälte, Berufseinsteiger mit weniger als 7 Jahren Berufserfahrung und erfahrene Anwälte mit 7 oder mehr Jahren Berufserfahrung. Die Beobachtungen sind Einzelbewertungen, gemittelt über alle Qualitätsdimensionen.
Die Untersuchung qualitativer Bearbeitungsmuster liefert einige Einblicke, wie Fachkräfte verschiedener Erfahrungsstufen mit generativen KI-Tools umgehen. Sowohl in der Behandlungs- als auch in der Kontrollgruppe folgten die Einreichungen der Berufseinsteiger einem starren Formalismus: Sie arbeiteten sequenziell von oben nach unten und verbrauchten häufig ihre Zeit mit der redaktionellen Überarbeitung risikoarmer einleitender Abschnitte, bevor sie zu den eigentlichen Patentansprüchen gelangten. Berufseinsteiger konzentrierten sich zudem auf oberflächliche Synonymaustausche statt auf die Verbesserung des kommerziellen Schutzumfangs. Selbst wenn Berufseinsteiger ernsthafte Mängel entdeckten, hinterließen sie oft nur beschreibende Kommentare, die den Fehler diagnostizierten, statt die Korrektur auszuführen, um ihn zu beheben. Da diese „Diagnostizieren-ohne-Ausführen“-Haltung bei den unbegleiteten Berufseinsteigern der Kontrollgruppe gleichermaßen verbreitet war, stellt sie ein grundlegendes Defizit der Berufseinsteiger dar, das drei Monate der Abhängigkeit von KI zur Ausführung von Umschreibungen nicht behob.
Erfahrene Anwälte dagegen profitierten durchgehend von der KI-Erfahrung. Behandelte erfahrene Anwälte verbrachten mehr Zeit mit dem Redlining als Berufseinsteiger, übersprangen risikoarme Passagen, um die Ansprüche von Grund auf neu aufzubauen, entfernten Formulierungen, die gesetzliche Rechte unbeabsichtigt einschränken oder den Schutzumfang begrenzen könnten, und verknüpften viele Änderungen mit expliziten Rechtsdoktrinen. In Nachfolgeinterviews beschrieben erfahrene Anwälte, dass sie die KI-Ausgabe nicht als fertiges Produkt betrachteten, sondern als einen „Logik-Auditor“. Er schwächte die Bindung an bestehende Formulierungen und zwang sie, das Warum und Wie struktureller Änderungen zu artikulieren, wodurch ihre grundlegende Expertise aktiviert und geschärft wurde.
Weitere Richtungen
Leistung zu verbessern und dauerhaftes professionelles Urteilsvermögen aufzubauen sind unterschiedliche Ziele. Insbesondere für Berufseinsteiger können sie in Konflikt zueinander stehen. Grundlegende Expertise könnte das fehlende Bindeglied sein, das es ermöglicht, dass KI-gestützte Wiederholungen sich im Laufe einer Karriere in gereiftes professionelles Urteilsvermögen übersetzen. Ein solches Urteilsvermögen wird auch dann voraussichtlich wichtig bleiben, wenn sich die Modellfähigkeiten weiterentwickeln: Anwälte werden ihr Urteilsvermögen weiterhin in ihren Interaktionen mit Richtern, Mandanten und Kollegen einsetzen. Sie werden sich nicht in allen Situationen auf ein KI-Tool verlassen können. Eine zentrale Herausforderung dieses KI-Momentes besteht darin, sicherzustellen, dass Tools, die darauf ausgelegt sind, heute bessere Arbeit zu leisten, Berufseinsteiger nicht daran hindern, zu den Experten zu werden, die wir morgen brauchen.
Die Untersuchung von Fachleuten in ihrer Arbeitsumgebung ist eine Herausforderung für Forscher. Unser Experiment umfasst eine begrenzte Stichprobe von Patentanwälten, was den hohen Stundensatz von Top-Profis in diesem Bereich widerspiegelt. Wir beobachten sie nur über drei Monate hinweg – ein kurzes Zeitfenster im Vergleich zu den Jahren, die sie bräuchten, um dauerhafte Expertise zu entwickeln. Zudem könnte der schnelle Fortschritt sowohl bei den Modellfähigkeiten als auch bei der grundlegenden KI-Vertrautheit (sowie der Verbreitung KI-gestützter Produkte im juristischen Bereich) im vergangenen Jahr unsere Ergebnisse beeinflussen, wenn wir die Studie jetzt erneut durchführen würden. Diese Einschränkungen eröffnen Möglichkeiten für weitere Forschung, von der wir hoffen, einen Teil in den kommenden Monaten zu verfolgen. Nichtsdestotrotz ist eine klare Erkenntnis aus unserer Arbeit, dass das Verständnis der Auswirkungen von KI-Unterstützung auf professionelle Fähigkeiten Tests erfordert, die den Effekt der Werkzeugnutzung vom Effekt der Leistung ohne Unterstützung trennen.
Danksagungen
Ein riesiges Dankeschön an die Koautoren Josh Martin, Zanna Iscenko, Scott Strand, David Pearl und Melissa Ferere; an James Manyika, Ruth Porat, Kent Walker, Josh Woodward, Anu Madgavkar, Daniel Rock und Fabien Curto Millet für ihre Beratung und Unterstützung; an Tom Shane, Mauricio Carneiro, Johnny Jacobs, Victor Lavrenko, Yinghao Sun, Samuel Yang, Daniel Nishi, Eric Wang, Kevin Li, Hao Zheng und Franz Och von Google Labs für die Partnerschaft bei dem Experiment; an Kiera Russell für Produktzugang und Unterstützung als Trusted Tester; an Steve Gong und Taylor Montgomery für rechtliche Beratung und Rekrutierungsunterstützung; und an unsere Partner aus Kommunikation, Marketing und Research Blog, darunter Kerry McHugh, Zoe Ortiz, Emily Short, Joseph Mack, Esmeralda Cardenas und Leanne Trujillo, für die Begleitung des Launches.
