Google Research

更好的工作成果是否总是意味着更好的工人?

判断力是资深专业人士区别于初级同行的关键。培养判断力需要在工作中经历数千小时的学习,通常是在有经验者的指导下,通过看似枯燥但塑造能力的工作,反复处理相对常规的任务。但AI已经在 改变 在职学习的运作方式。一方面,在 放射学, 商业问题解决, 求职者写作以及 法学教育 领域的实证研究表明,当AI工具有效地嵌入培训流程时,经验较少的工人能够提升其独立工作表现。 另一方面,针对 软件工程师, 管理咨询顾

A set of forest plots showing the treatment effect standard deviation on drafting and redlining tasks for different experience levels.
配图来源 · Google Research

判断力是资深专业人士区别于初级同行的关键。培养判断力需要在工作中经历数千小时的学习,通常是在有经验者的指导下,通过看似枯燥但塑造能力的工作,反复处理相对常规的任务。但AI已经在 改变 在职学习的运作方式。一方面,在 放射学, 商业问题解决, 求职者写作以及 法学教育 领域的实证研究表明,当AI工具有效地嵌入培训流程时,经验较少的工人能够提升其独立工作表现。

另一方面,针对 软件工程师, 管理咨询顾问, 高中生以及 临床医生的 近期实验表明,AI虽然像一个临时外骨骼,能提升即时产出,但这些收益在工具移除后往往难以持续。理解AI究竟会侵蚀还是增强专业能力,需要三个很少同时具备的要素:(1)在数月(而非数小时)的日常专业工作中持续使用AI;(2)在AI不可用时对独立判断力进行可信的评估;(3)由领域专家进行盲评。

在《AI辅助是增强还是侵蚀专业能力?来自专利撰写领域三个月实地实验的证据》一文中,我们由 美国国家经济研究局发表,描述了一项实地实验,用以捕捉在知识产权法这一高度依赖专业知识的职业中,AI的使用对短期生产力和长期技能培养所产生的影响。在我们的实验中,我们在133名来自十一家与谷歌保持经常性、非独家业务关系的知识产权律师事务所的律师中,随机分配了一款当时尚未发布的 Google Labs AI专利撰写辅助工具(现已并入 Gemini Notebook,涉及与谷歌保持经常性、非排他性业务往来的十一家知识产权律所的133名律师。每家律所三分之二的律师(“处理”组)获得了该工具的早期访问权限,其余律师(“对照组”)虽然接受了一些AI使用培训,但在三个月的研究期结束前无法使用该工具。

借助AI获得更好的工作成果

在AI辅助10天后,我们向所有参与研究的律师发送了一套关于某项假想发明的发明人材料,并请他们起草一份专利。90天后,我们用另一套模拟发明人材料重复了同样的操作。我们在两个时间点都看到了预期中AI带来的表现提升。在第10天时,获得AI工具使起草评分(由独立法律专家根据包含 李克特量表 的评分标准对五个不同质量维度进行评分)提高了0.34个标准差,相当于在对照组分数分布中的百分位排名上升10位;到第90天,这一提升增加到0.38个标准差,意味着百分位排名上升11位。这些提升在所有质量维度上都表现出惊人的一致性。值得注意的是,更好的表现来自较差评分的频率降低和良好评分的频率提高,而优秀评分的频率没有变化。严格来说,被分配AI使用权限的律师的分数从底部五分位区间上移到了中下和中部的五分位区间,但杰出评分的数量没有明显变化。这一模式在初级律师身上尤为明显,他们在质量提升的同时还显著节省了时间(例如,在10天任务中,比对照组124分钟的平均速度快了18分钟)。

但专利律师的工作不只是撰写专利;他们还要互相审阅工作,检查可能导致专利在法庭上无法执行的关键错误(有时被称为“专利亵渎语”),例如过度声称发明的新颖性或范围。因此我们在第90天增加了另一项任务,要求受试者对一份现存的包含许多实质性和格式性错误假设专利进行红线标注(即手动批注和修正)。这项测试任务反映了更资深的律师日常运用的那种专业判断,而他们通常无法依赖 AI 来完成这种判断。关键在于,虽然我们鼓励处理组律师在撰写任务中使用未发布的 AI 工具或任何其他 AI 工具,但任何人都不允许在红线标注任务中使用 AI,这使他们在该任务上的得分成为衡量其技能发展水平的指标。对于所有任务,包括撰写和红线标注,我们与第三方专利专业人士合作,从五个质量维度对提交的成果进行评分:(1) 可执行性,(2) 准确性,(3) 策略性模糊(权利要求的战术性范围界定),(4) 完整性,以及 (5) 清晰度。

A set of forest plots showing the treatment effect standard deviation on drafting and redlining tasks for different experience levels.

AI 使用权限对专利撰写和红线标注质量的估计影响。结果针对所有律师(黑色方块)、经验不足 7 年的初级律师(蓝色三角形)以及拥有 7 年以上经验的资深律师(橙色菱形)报告。所有估计均已考虑律所之间的差异,并调整了每位律师收到的评分数量的细微变化。

当 AI 被移除时

在第90天的红线标注任务中移除 AI 助手后,拉平效应消失了。获得 AI 工具使用权限的律师在这项无辅助任务中的表现比对照组高出 0.32 个标准差(相当于百分位排名上升 9 个百分点),但这一效应完全由资深律师驱动,他们比对照组受试者高出 0.45 个标准差(上升 13 个百分点),而初级律师没有表现出明显的进步。相反,初级律师的得分出现了分化:非常低的分数更多,平庸的分数更少,良好的分数更多,而优秀的分数并没有增加。

这些结果对学习意味着什么?获得 AI 工具使用权限的资深律师显然在之前三个月的工具使用中,在专业判断方面收获了显著的价值。但初级律师层面则更为复杂。一些分数有所提高,暗示了 AI 促进跨越式学习的能力。其他分数则分布到了较低的位置,表明在某些场景下,AI 可以帮助初级律师交付合格的工作,但他们更高的机器辅助表现并不能转化为更快地获得使资深专业人士具有独特价值的专业知识。

Histograms comparing the density of average redlining scores between control and treatment groups for all, junior, and senior lawyers.

按经验划分,处理组(橙色)与对照组(蓝色)受试者平均红线标注分数的分布,涵盖所有律师、经验不足 7 年的初级律师以及拥有 7 年以上经验的资深律师。观测值为在所有质量维度上取平均后的个人评分。

考察定性的编辑模式,可以为了解不同经验层次的专业人士如何与生成式 AI 工具互动提供一些见解。在处理组和对照组中,初级律师的提交稿都遵循僵化的形式主义:初级律师从上到下按顺序工作,经常在到达主要专利权利要求之前就把时间耗在编辑低重要性的引言部分上。初级律师还专注于表面上的同义词替换,而非商业范围的改进。即使初级律师发现了严重缺陷,他们往往也只留下诊断缺陷的描述性评论,而不是执行红线标注来修复它。由于这种“只诊断不执行”的姿态在无辅助的对照组初级律师中同样常见,它代表了一种初级律师的基础性短板,而三个月依赖 AI 执行重写并未弥补这一短板。

相比之下,资深律师从 AI 使用中持续获益。接受处理的资深律师在红线标注上花费的时间比初级律师更长,他们跳过低重要性的文字,从头重建权利要求,剔除可能无意中缩小法律权利或限制保护范围的语言,并将许多修改与明确的法律原则相配对。在后续访谈中,资深律师表示他们并不把 AI 输出当作成品,而是当作“逻辑审计员”。它削弱了对现有文字的执着,迫使他们阐明结构性修改的原因和方式,从而激活并磨炼了他们的基础专业知识。

进一步的方向

提高绩效和培养持久的专业判断是不同的目标。对于初级专业人士而言,这两个目标尤其可能相互冲突。基础专业知识可能是使 AI 辅助的重复练习在整个职业生涯中转化为成熟专业判断的缺失环节。即使模型能力不断进步,这种判断可能仍将保持重要:律师在法官、客户和同事的互动中将继续运用他们的判断。他们不可能在所有场合都依赖 AI 工具的协助。这个 AI 时刻的一个关键挑战是,确保旨在今天产出更好工作的工具,不会阻止初级专业人士成长为明天我们所需要的专家。

研究专业人员在其实际工作环境中的表现对研究人员来说是一项挑战。我们的实验仅包含数量有限的专利律师样本,这也反映了该领域顶尖专业人员高昂的小时计费费率。我们只观察了他们三个月,与培养持久专业技能所需的多年时间相比,这只是很短的一段窗口期。此外,过去一年中模型能力和基线AI熟悉度(以及AI产品在法律领域的渗透率)的快速进步,如果我们现在重新进行试验,可能会影响我们的结果。这些局限性为进一步研究提供了机会,我们希望在未来几个月中开展其中一些研究。尽管如此,我们工作的一个明确启示是:理解AI辅助对专业技能的影响,需要通过测试将使用工具的效果与用户无辅助表现的效果区分开来。

致谢

衷心感谢合著者Josh Martin、Zanna Iscenko、Scott Strand、David Pearl和Melissa Ferere;感谢James Manyika、Ruth Porat、Kent Walker、Josh Woodward、Anu Madgavkar、Daniel Rock和Fabien Curto Millet 给予的指导与支持;感谢Google Labs的Tom Shane、Mauricio Carneiro、Johnny Jacobs、Victor Lavrenko、Yinghao Sun、Samuel Yang、Daniel Nishi、Eric Wang、Kevin Li、Hao Zheng和Franz Och在实验中与我们合作;感谢Kiera Russell提供产品访问权限和受信任测试者支持;感谢Steve Gong和Taylor Montgomery提供法律指导和招募支持;并感谢我们的传播、营销和研究博客合作伙伴,包括Kerry McHugh、Zoe Ortiz、Emily Short、Joseph Mack、Esmeralda Cardenas和Leanne Trujillo推动此次发布。

原始出处

Google Research

内容说明

原始发布及相关权利归来源方。

机器翻译 · 请以原文为准