Le jugement est ce qui distingue les professionnels expérimentés de leurs confrères juniors. Développer ce jugement exige des milliers d'heures d'apprentissage sur le terrain, généralement par un engagement fastidieux mais formateur dans un travail relativement routinier, souvent sous la supervision encadrée de travailleurs expérimentés. Mais l'IA transforme déjà change la façon dont l'apprentissage en milieu professionnel fonctionne. D'une part, des études empiriques en radiologie, résolution de problèmes d'entreprise, rédaction pour chercheurs d'emploi, et formation juridique montrent que lorsque les outils d'IA sont intégrés de manière réfléchie dans les flux de formation, les travailleurs moins expérimentés peuvent améliorer leurs performances autonomes.
D'autre part, des expériences récentes menées auprès de ingénieurs logiciels, consultants en management, lycéens, et cliniciens démontrent que si l'IA agit comme un exosquelette temporaire qui accroît la production immédiate, ces gains ne persistent souvent pas une fois l'outil retiré. Comprendre comment l'IA peut éroder ou renforcer l'expertise exige trois éléments rarement réunis : (1) une utilisation soutenue de l'IA intégrée au travail professionnel ordinaire sur des mois plutôt que des heures, (2) une évaluation crédible du jugement sans assistance lorsque l'IA n'est pas disponible, et (3) une notation en aveugle par des experts du domaine.
Dans «L'assistance par l'IA renforce-t-elle ou érode-t-elle l'expertise ? Des résultats d'une expérience de terrain de trois mois sur la rédaction de brevets», publié par le National Bureau of Economic Research, nous décrivons une expérience de terrain conçue pour saisir les changements à court terme de la productivité et ceux à plus long terme du développement des compétences résultant de l'utilisation de l'IA dans la profession très gourmande en expertise du droit de la propriété intellectuelle. Dans notre expérience, nous avons randomisé l'accès à un outil d'assistance à la rédaction de brevets par IA alors non dévoilé de Google Labs , aujourd'hui intégré à Gemini Notebook, parmi 133 avocats de onze cabinets de propriété intellectuelle qui entretiennent des relations d'affaires régulières et non exclusives avec Google. Deux tiers des avocats de chaque cabinet (groupe « traitement ») ont bénéficié d'un accès anticipé à l'outil, tandis que les autres (groupe « contrôle ») ont reçu une formation à l'utilisation de l'IA mais n'ont pas eu accès à l'outil avant la fin des trois mois de l'étude.
Un meilleur travail avec l'IA
Après 10 jours d'assistance par l'IA, nous avons envoyé à tous les avocats participants un dossier de documents d'inventeur pour une invention hypothétique et leur avons demandé de rédiger un brevet. Nous avons fait de même après 90 jours, avec un autre ensemble de documents d'inventeur simulés. Nous avons observé le gain de performance attendu grâce à l'IA sur les tâches de rédaction aux deux périodes. À 10 jours, l'accès à l'outil d'IA a amélioré les scores de rédaction (notés selon une grille avec échelles de Likert pour cinq aspects différents de la qualité par des experts juridiques indépendants) de 0,34 écart-type, soit l'équivalent d'une progression de 10 points de centile parmi les scores du groupe contrôle ; à 90 jours, cette amélioration est passée à 0,38 écart-type, soit une progression de 11 points de centile. Ces améliorations se sont produites avec une remarquable constance sur toutes les dimensions de la qualité. Fait révélateur, la meilleure performance provenait d'une fréquence plus faible de mauvais scores et d'une fréquence plus élevée de bons scores, sans changement dans la fréquence des scores excellents. Formellement, les scores des avocats ayant bénéficié de l'IA sont passés des quintiles inférieurs aux quintiles inféro-médians et médians, mais on n'a observé aucun changement notable dans le nombre de scores exceptionnels. Ce schéma était particulièrement net pour les avocats juniors, dont les gains de qualité s'accompagnaient également d'économies de temps significatives (18 minutes plus rapidement que la vitesse moyenne de 124 minutes du groupe contrôle sur la tâche à 10 jours, par exemple).
Mais les avocats en brevets ne se contentent pas de rédiger des brevets ; ils examinent aussi le travail des autres pour détecter des erreurs critiques (parfois appelées « patent profanity ») qui peuvent rendre des brevets inapplicables devant les tribunaux — par exemple, en surestimant la nouveauté ou la portée d'une invention. Nous avons donc ajouté une autre tâche à 90 jours, qui demandait aux sujets de corriger (de marquer et corriger manuellement) un brevet hypothétique existant contenant de nombreuses erreurs, à la fois substantielles et stylistiques. Cette tâche de test reflète le type de jugement professionnel que les avocats plus expérimentés utilisent routinely et pour lequel ils n'ont le plus souvent pas le luxe de pouvoir compter sur l'IA. Point crucial : alors que les avocats du groupe de traitement étaient encouragés à utiliser l'outil d'IA non publié ou tout autre outil d'IA pour les tâches de rédaction, personne n'était autorisé à utiliser l'IA pour la tâche de correction, faisant de leurs scores sur cette tâche une mesure du développement de leurs compétences. Pour toutes les tâches, rédaction comme correction, nous avons travaillé avec des professionnels des brevets tiers pour noter les soumissions sur cinq dimensions de qualité : (1) l'applicabilité, (2) l'exactitude, (3) l'ambiguïté stratégique (la délimitation tactique des revendications), (4) l'exhaustivité et (5) la clarté.
Impact estimé de l'accès à l'IA sur la qualité de la rédaction et de la correction de brevets. Les résultats sont présentés pour tous les avocats (carrés noirs), les avocats juniors ayant moins de 7 ans d'expérience (triangles bleus) et les avocats seniors ayant 7 ans d'expérience ou plus (losanges orange). Toutes les estimations tiennent compte des différences entre cabinets d'avocats et ajustent les légères variations du nombre d'évaluations reçues par chaque avocat.
Quand l'IA est retirée
Lorsque l'assistant IA a été retiré pour la tâche de correction à 90 jours, l'effet de nivellement a disparu. Les avocats ayant eu accès à l'outil d'IA ont surpassé les témoins de 0,32 écart-type sur cette tâche sans assistance (une montée équivalente de 9 points dans les classements en centiles), mais cet effet était entièrement porté par les avocats seniors, qui ont surpassé les sujets témoins de 0,45 écart-type (une progression de 13 points), tandis que les juniors ne montraient aucune amélioration discernable. En revanche, les scores des juniors se sont polarisés : davantage de scores très bas, moins de scores médiocres, davantage de bons scores, et pas davantage de scores excellents.
Que signifient ces résultats pour l'apprentissage ? Les seniors ayant eu accès à l'outil d'IA ont clairement tiré une valeur significative en termes de jugement professionnel de leur utilisation de l'outil au cours des trois mois précédents. Mais le tableau au niveau junior est plus nuancé. Certains scores se sont améliorés, suggérant la capacité de l'IA à faire franchir des étapes d'apprentissage par bonds. D'autres scores se sont répandus vers les échelons inférieurs de la distribution, montrant que, dans certains scénarios, l'IA peut aider les juniors à produire un travail adéquat, mais que leur performance supérieure assistée par machine ne se traduit pas par une acquisition plus rapide de l'expertise qui confère aux professionnels seniors leur valeur distinctive.
Distributions du score moyen de correction pour les sujets traités (orange) et les sujets témoins (bleus) par niveau d'expérience pour tous les avocats, les avocats juniors ayant moins de 7 ans d'expérience et les avocats seniors ayant 7 ans d'expérience ou plus. Les observations sont des évaluations individuelles moyennées sur toutes les dimensions de qualité.
L'examen des modèles d'édition qualitatifs donne un aperçu de la manière dont les professionnels de différents niveaux d'expérience interagissent avec les outils d'IA générative. Dans les groupes de traitement comme dans les groupes témoins, les soumissions des juniors suivaient un formalisme rigide : les juniors travaillaient de manière séquentielle, de haut en bas, épuisant souvent leur temps à relire les sections introductives à faible enjeu avant d'atteindre les principales revendications du brevet. Les juniors se concentraient également sur le remplacement superficiel de synonymes plutôt que sur l'amélioration de la portée commerciale. Même lorsqu'ils repéraient des défauts graves, ils laissaient souvent des commentaires descriptifs diagnostiquant le défaut au lieu d'exécuter la correction pour le réparer. Comme cette posture de « diagnostic sans exécution » était tout aussi fréquente chez les juniors témoins non assistés, elle représente un déficit de base des juniors que trois mois de recours à l'IA pour exécuter les réécritures n'ont pas comblé.
Les avocats seniors, en revanche, ont bénéficié de manière constante de l'exposition à l'IA. Les seniors traités ont passé plus de temps sur la correction que les juniors, évitant les passages à faible enjeu pour reconstruire les revendications à partir de zéro, éliminer le langage susceptible de réduire par inadvertance les droits légaux ou de limiter la portée protectrice, et associer de nombreuses modifications à des doctrines juridiques explicites. Lors des entretiens de suivi, les seniors ont décrit le traitement des résultats de l'IA non pas comme un produit fini, mais comme un « auditeur logique ». Cela affaiblissait leur attachement au texte existant et les obligeait à articuler le pourquoi et le comment des modifications structurelles, activant et aiguisant leur expertise fondamentale.
Perspectives futures
Améliorer la performance et construire un jugement professionnel durable sont des objectifs différents. Pour les professionnels juniors en particulier, ils peuvent être en tension l'un avec l'autre. L'expertise fondamentale est peut-être le chaînon manquant qui permettrait à la répétition assistée par l'IA de se traduire, au fil d'une carrière, en jugement professionnel chevronné. Ce jugement restera probablement important même à mesure que les capacités des modèles progressent : les avocats continueront d'utiliser leur jugement dans leurs interactions avec les juges, les clients et les collègues. Ils ne pourront pas compter sur un outil d'IA pour les assister dans tous les contextes. Un défi crucial de ce moment de l'IA est de garantir que les outils conçus pour produire un meilleur travail aujourd'hui n'empêchent pas les professionnels juniors de devenir les experts dont nous aurons besoin demain.
Étudier des professionnels dans leur environnement de travail constitue un défi pour les chercheurs. Notre expérience porte sur un échantillon limité d'avocats en propriété intellectuelle, reflet du taux horaire élevé facturé par les professionnels de premier plan dans ce domaine. Nous ne les observons que pendant trois mois, une fenêtre réduite par rapport aux années qui leur seraient nécessaires pour développer une expertise durable. De plus, l'avancée rapide des capacités des modèles et de la familiarité de base avec l'IA (ainsi que la pénétration des produits dopés par l'IA dans le domaine juridique) au cours de l'année écoulée pourrait affecter nos résultats si nous reproduisions l'essai aujourd'hui. Ces limites ouvrent des opportunités de recherches complémentaires, dont nous espérons poursuivre certaines dans les mois à venir. Néanmoins, une conclusion claire de notre travail est que comprendre l'effet de l'assistance par l'IA sur les compétences professionnelles exige des tests qui séparent l'effet de l'utilisation des outils de l'effet de la performance non assistée des utilisateurs.
Remerciements
Un immense merci aux coauteurs Josh Martin, Zanna Iscenko, Scott Strand, David Pearl et Melissa Ferere ; à James Manyika, Ruth Porat, Kent Walker, Josh Woodward, Anu Madgavkar, Daniel Rock et Fabien Curto Millet pour leurs conseils et leur soutien ; à Tom Shane, Mauricio Carneiro, Johnny Jacobs, Victor Lavrenko, Yinghao Sun, Samuel Yang, Daniel Nishi, Eric Wang, Kevin Li, Hao Zheng et Franz Och de Google Labs pour leur partenariat avec nous dans cette expérience ; à Kiera Russell pour l'accès au produit et le soutien aux testeurs de confiance ; à Steve Gong et Taylor Montgomery pour les conseils juridiques et le soutien au recrutement ; ainsi qu'à nos partenaires Communication, Marketing et Blog de Recherche, dont Kerry McHugh, Zoe Ortiz, Emily Short, Joseph Mack, Esmeralda Cardenas et Leanne Trujillo, pour le lancement.
