Google Research

¿Trabajar mejor siempre significa mejores trabajadores?

El juicio es lo que distingue a los profesionales sénior de sus colegas junior. Desarrollar el juicio requiere miles de horas de aprendizaje en el trabajo, por lo general mediante una participación te

A set of forest plots showing the treatment effect standard deviation on drafting and redlining tasks for different experience levels.
Fuente de la imagen · Google Research

El juicio es lo que distingue a los profesionales sénior de sus colegas junior. Desarrollar el juicio requiere miles de horas de aprendizaje en el trabajo, por lo general mediante una participación tediosa pero formativa en trabajo relativamente rutinario, a menudo bajo la supervisión guiada de trabajadores con experiencia. Pero la IA ya está cambiando cómo funciona el aprendizaje en el trabajo. Por un lado, estudios empíricos en radiología, resolución de problemas empresariales, redacción de buscadores de empleo, y educación jurídica demuestran que, cuando las herramientas de IA se integran cuidadosamente en los flujos de trabajo de formación, los trabajadores con menos experiencia pueden mejorar su desempeño independiente.

Por otro lado, experimentos recientes con ingenieros de software, consultores de gestión, estudiantes de secundaria, y clínicos demuestran que, si bien la IA actúa como un exoesqueleto temporal que aumenta el rendimiento inmediato, esas ganancias a menudo no persisten una vez que se retira la herramienta. Comprender cómo la IA puede erosionar o potenciar la experiencia requiere tres elementos que rara vez se encuentran juntos: (1) un uso sostenido de la IA integrado en el trabajo profesional cotidiano durante meses en lugar de horas, (2) una evaluación creíble del juicio sin asistencia cuando la IA no está disponible, y (3) una calificación a ciegas por parte de expertos en el dominio.

En «¿La asistencia con IA potencia o erosiona la experiencia? Evidencia de un experimento de campo de tres meses sobre la redacción de patentes», publicado por la National Bureau of Economic Research, describimos un experimento de campo utilizado para capturar los cambios tanto en la productividad a corto plazo como en el desarrollo de habilidades a más largo plazo que se producen como resultado del uso de la IA en la profesión de derecho de propiedad intelectual, altamente intensiva en experiencia. En nuestro experimento, aleatorizamos el acceso a una entonces no lanzada herramienta de asistente de IA para redactar patentes de Google Labs , hoy parte de Gemini Notebook, entre 133 abogados de once firmas de propiedad intelectual que mantienen relaciones comerciales habituales y no exclusivas con Google. Dos tercios de los abogados de cada firma (grupo de «tratamiento») recibieron acceso anticipado a la herramienta, mientras que el resto (grupo de «control») recibió cierta formación sobre cómo usar la IA, pero se les impidió usar la herramienta hasta después del período de estudio de tres meses.

Mejor trabajo con IA

Después de 10 días de asistencia de IA, enviamos a todos los abogados participantes un paquete de materiales de inventores para una invención hipotética y les pedimos que redactaran una patente. Hicimos lo mismo después de 90 días, con un conjunto diferente de materiales de inventores simulados. Observamos el aumento esperado del rendimiento de la IA en las tareas de redacción en ambos períodos. A los 10 días, el acceso a la herramienta de IA elevó las puntuaciones de redacción (calificadas mediante una rúbrica con escalas Likert para cinco aspectos diferentes de la calidad por expertos jurídicos independientes) en 0.34 desviaciones estándar, lo que equivale a un ascenso de 10 puntos en el ranking percentil entre las puntuaciones del grupo de control; a los 90 días, esta mejora aumentó a 0.38 DE, lo que implica un incremento de 11 puntos percentiles. Estas mejoras se produjeron con notable consistencia en todas las dimensiones de calidad. Reveladoramente, el mejor rendimiento provino de una menor frecuencia de puntuaciones deficientes y una mayor frecuencia de puntuaciones buenas, sin cambios en la frecuencia de puntuaciones excelentes. En términos formales, las puntuaciones de los abogados con acceso a la IA pasaron del quintil inferior a los quintiles bajo-medio y medio, pero no hubo cambios notables en el número de puntuaciones excepcionales. Este patrón fue especialmente claro para los abogados junior, cuyas mejoras de calidad también se vieron acompañadas de importantes ahorros de tiempo (18 minutos más rápido que la velocidad media del grupo de control de 124 minutos en la tarea de 10 días, por ejemplo).

Pero los abogados de patentes no solo redactan patentes; también revisan el trabajo de los demás en busca de errores críticos (a veces llamados «profanidad de patentes») que pueden hacer que las patentes sean inaplicables en los tribunales — por ejemplo, al exagerar la novedad o el alcance de una invención. Por lo tanto, añadimos otra tarea a los 90 días, que requería que los participantes corrigieran (marcaran y corrigieran manualmente) una patente hipotética existente que contenía muchos errores, tanto sustantivos como estilísticos. Esta tarea de prueba refleja el tipo de juicio profesional que los abogados más experimentados utilizan habitualmente y para el que, en la mayoría de los casos, no tienen el lujo de poder confiar en la IA. De manera crítica, aunque se animaba a los abogados del grupo de tratamiento a usar la herramienta de IA aún no lanzada o cualquier otra herramienta de IA en las tareas de redacción, nadie tenía permiso para usar IA en la tarea de corrección, lo que convertía sus puntuaciones en esta tarea en una medida de cuánto habían desarrollado sus habilidades. Para todas las tareas, tanto de redacción como de corrección, trabajamos con profesionales de patentes externos para puntuar las entregas en cinco dimensiones de calidad: (1) aplicabilidad, (2) exactitud, (3) ambigüedad estratégica (la delimitación táctica de las reivindicaciones), (4) integridad y (5) claridad.

A set of forest plots showing the treatment effect standard deviation on drafting and redlining tasks for different experience levels.

Impacto estimado del acceso a la IA en la calidad de la redacción y la corrección de patentes. Los resultados se presentan para todos los abogados (cuadrados negros), abogados junior con menos de 7 años de experiencia (triángulos azules) y abogados senior con 7 o más años de experiencia (rombos naranjas). Todas las estimaciones tienen en cuenta las diferencias entre despachos de abogados y ajustan las ligeras variaciones en la cantidad de evaluaciones que recibió cada abogado.

Cuando se retira la IA

Cuando el asistente de IA se retiró para la tarea de corrección a los 90 días, el efecto de nivelación desapareció. Los abogados a los que se había dado acceso a herramientas de IA superaron a los del grupo de control por 0.32 SD en esta tarea sin asistencia (un aumento equivalente de 9 puntos en los rankings percentiles), pero este efecto se debió enteramente a los abogados senior, que superaron a los sujetos de control por 0.45 SD (un aumento de 13 puntos), mientras que los junior no mostraron una mejora discernible. En cambio, las puntuaciones de los junior se bifurcaron: más puntuaciones muy bajas, menos puntuaciones mediocres, más puntuaciones buenas y no más puntuaciones excelentes.

¿Qué significan estos resultados para el aprendizaje? Los senior a los que se había dado acceso a herramientas de IA claramente obtuvieron un valor significativo en términos de su juicio profesional gracias al uso de la herramienta durante los tres meses anteriores. Pero el panorama de los junior es más matizado. Algunas puntuaciones mejoraron, lo que insinúa la capacidad de la IA para acelerar el aprendizaje. Otras puntuaciones se distribuyeron hacia los escalones inferiores de la distribución, lo que demuestra que en algunos escenarios la IA puede ayudar a los junior a entregar un trabajo adecuado, pero su rendimiento superior asistido por la máquina no se traduce en una adquisición más rápida de la experiencia que hace que los profesionales senior sean especialmente valiosos.

Histograms comparing the density of average redlining scores between control and treatment groups for all, junior, and senior lawyers.

Distribuciones de la puntuación media de corrección para los sujetos del grupo de tratamiento (naranja) y del grupo de control (azul) por nivel de experiencia, para todos los abogados, los abogados junior con menos de 7 años de experiencia y los abogados senior con 7 o más años de experiencia. Las observaciones son evaluaciones individuales promediadas sobre todas las dimensiones de calidad.

El examen de los patrones de edición cualitativos ofrece cierta perspectiva sobre cómo los profesionales de distintos niveles de experiencia interactúan con las herramientas de IA generativa. En ambos grupos, el de tratamiento y el de control, las entregas de los junior siguieron un formalismo rígido: los junior trabajaban secuencialmente de arriba abajo y, con frecuencia, agotaban su tiempo corrigiendo secciones introductorias de bajo riesgo antes de llegar a las reivindicaciones principales de la patente. Los junior también se centraron en el simple intercambio de sinónimos en la superficie en lugar de en la mejora del alcance comercial. Incluso cuando los junior detectaban fallos graves, a menudo dejaban comentarios descriptivos que diagnosticaban el defecto en lugar de ejecutar la corrección para arreglarlo. Dado que esta postura de «diagnosticar sin ejecutar» era igual de común entre los junior del grupo de control sin asistencia, representa un déficit básico de los junior que tres meses de confiar en la IA para ejecutar reescrituras no corrigieron.

Los abogados senior, en cambio, se beneficiaron consistentemente de la exposición a la IA. Los senior del grupo de tratamiento dedicaron más tiempo a la corrección que los junior, pasando por alto la prosa de bajo riesgo para reconstruir las reivindicaciones desde cero, eliminar el lenguaje que pudiera reducir inadvertidamente los derechos legales o limitar el alcance de la protección, y acompañar muchas ediciones con doctrinas legales explícitas. En entrevistas de seguimiento, los senior describieron que trataban el resultado de la IA no como un producto terminado, sino como un «auditor de lógica». Esto debilitaba el apego a la prosa existente y les obligaba a articular el porqué y el cómo de las ediciones estructurales, activando y afinando su experiencia fundamental.

Direcciones futuras

Mejorar el rendimiento y construir un juicio profesional duradero son objetivos distintos. Para los profesionales junior en particular, pueden estar en tensión entre sí. La experiencia fundamental puede ser el eslabón perdido que permita que la repetición asistida por IA se traduzca, a lo largo de una carrera, en un juicio profesional experimentado. Ese juicio probablemente seguirá siendo importante a medida que avancen las capacidades de los modelos: los abogados seguirán usando su juicio en sus interacciones con jueces, clientes y colegas. No podrán confiar en una herramienta de IA que los asista en todos los contextos. Un desafío crítico de este momento de la IA es garantizar que las herramientas diseñadas para producir un mejor trabajo hoy no impidan que los profesionales junior se conviertan en los expertos que necesitaremos mañana.

Estudiar a profesionales en sus entornos de trabajo es un desafío para los investigadores. Nuestro experimento incluye una muestra limitada de abogados de patentes, un reflejo de la alta tarifa por hora de los profesionales de primer nivel en este campo. Solo los observamos durante tres meses, una ventana pequeña en comparación con los años que necesitarían para desarrollar una experiencia duradera. Además, el rápido avance tanto de las capacidades de los modelos como de la familiaridad básica con la IA (así como la penetración de productos habilitados por IA en el ámbito jurídico) durante el último año podría afectar nuestros resultados si repitiéramos el ensayo ahora. Estas limitaciones dan lugar a oportunidades para futuras investigaciones, algunas de las cuales esperamos llevar a cabo en los próximos meses. No obstante, una conclusión clara de nuestro trabajo es que comprender el efecto de la asistencia de la IA en la competencia profesional requiere pruebas que separen el efecto del uso de herramientas del efecto del rendimiento del usuario sin asistencia.

Agradecimientos

Un enorme agradecimiento a los coautores Josh Martin, Zanna Iscenko, Scott Strand, David Pearl y Melissa Ferere; a James Manyika, Ruth Porat, Kent Walker, Josh Woodward, Anu Madgavkar, Daniel Rock y Fabien Curto Millet por su orientación y apoyo; a Tom Shane, Mauricio Carneiro, Johnny Jacobs, Victor Lavrenko, Yinghao Sun, Samuel Yang, Daniel Nishi, Eric Wang, Kevin Li, Hao Zheng y Franz Och de Google Labs por asociarse con nosotros en el experimento; a Kiera Russell por el acceso al producto y el soporte como evaluador de confianza; a Steve Gong y Taylor Montgomery por la orientación legal y el apoyo en el reclutamiento; y a nuestros socios de Comunicaciones, Marketing y Research Blog, incluidos Kerry McHugh, Zoe Ortiz, Emily Short, Joseph Mack, Esmeralda Cardenas y Leanne Trujillo, por impulsar el lanzamiento.

Fuente original

Google Research

Notas sobre el contenido

La publicación original y los derechos pertenecen a la fuente.

Traducción automática · Consulte el original