판단력이 고위 전문가를 초급 동료들과 구별 짓는 요소입니다. 판단력을 기르려면 실무를 통해 수천 시간의 학습이 필요하며, 대개 숙련된 실무자의 지도 아래 상대적으로 일상적인 업무에 지루하지만 역량을 형성하는 방식으로 몰입하는 과정을 거칩니다. 그러나 AI는 이미 직무 중 학습이 이루어지는 방식을 바꾸고 있습니다. 한편으로는 방사선과, 비즈니스 문제 해결, 구직자 글쓰기및 법학 교육 분야의 실증 연구들에 따르면, AI 도구가 훈련 워크플로우에 신중하게 통합될 때 경험이 적은 실무자들의 독립적 수행 능력이 향상될 수 있습니다.
다른 한편으로는 소프트웨어 엔지니어, 경영 컨설턴트, 고등학생및 임상의 대상의 최근 실험들은, AI가 즉각적인 산출량을 높이는 임시적인 외골격 역할을 하지만 도구를 제거하면 그 향상이 종종 지속되지 않음을 보여줍니다. AI가 전문성을 침식하는지 아니면 강화하는지 이해하려면 함께 발견되기 드문 세 가지 요소가 필요합니다: (1) 몇 시간이 아닌 수개월에 걸쳐 일상적인 전문 업무에 통합된 지속적인 AI 사용, (2) AI를 사용할 수 없을 때의 비보조 판단력에 대한 신뢰할 수 있는 평가, (3) 해당 분야 전문가에 의한 블라인드 채점.
‘AI 지원은 전문성을 강화하는가, 침식하는가? 특허 초안 작성 분야 3개월 현장 실험의 증거’라는 제목으로 전국경제연구소가 발표한 논문에서, 우리는 지식재산권 법률이라는 전문성 집약도가 매우 높은 직업에서 AI 사용의 결과로 나타나는 단기 생산성과 장기 역량 구축의 변화를 모두 포착하기 위해 수행한 현장 실험을 소개합니다. 우리 실험에서는 Google과 정기적이고 비독점적인 거래를 하는 11개 지식재산권 로펌의 133명 변호사를 대상으로, 당시 출시 전이던 Google Labs 의 AI 특허 작성 보조 도구(현재는 Gemini Notebook", among 133 lawyers at eleven intellectual property law firms that are engaged in regular, non-exclusive business with Google. Two-thirds of lawyers at each firm (“treatment” group) were given early access to the tool, while the remainder ("control" group) were given some training on how to use AI but were withheld from using the tool until after the three-month study period." ⬇️ ", Google과 정기적으로, 그러나 독점적이지 않게 거래하는 열한 곳의 지식재산권 전문 로펌에 소속된 133명의 변호사를 대상으로 진행되었습니다. 각 로펌의 변호사 중 3분의 2('처리' 집단)에게는 도구에 대한 조기 접근 권한이 주어졌고, 나머지('통제' 집단)에게는 AI 사용 방법에 대한 일부 교육이 제공되었지만 3개월 연구 기간이 끝날 때까지 도구 사용은 허용되지 않았습니다."
AI와 함께 더 나은 작업
10일간의 AI 지원 후, 우리는 참가한 모든 변호사들에게 가상의 발명에 대한 발명인 자료 꾸러미를 보내 특허 초안을 작성하도록 요청했습니다. 90일 후에도 다른 모의 발명인 자료로 동일한 작업을 수행했습니다. 우리는 두 시점 모두에서 초안 작성 과제의 수행에 대한 예상된 AI 향상 효과를 관찰했습니다. 10일 시점에서 AI 도구 접근은 초안 작성 점수(독립적인 법률 전문가들이 품질의 다섯 가지 측면에 대해 리커트 척도 로 채점)를 0.34 표준편차만큼 높였으며, 이는 통제 집단 점수 분포에서 백분위 순위가 10포인트 상승하는 것에 해당합니다. 90일 시점에는 이 향상이 0.38 표준편차로 증가하여 백분위 11포인트 상승을 의미했습니다. 이러한 개선은 모든 품질 차원에서 놀라울 정도로 일관되게 나타났습니다. 주목할 점은, 더 나은 수행이 낮은 점수의 빈도 감소와 좋은 점수의 빈도 증가에서 비롯되었고, 탁월한 점수의 빈도에는 변화가 없었다는 것입니다. 공식적으로 말하면, AI 접근 권한을 배정받은 변호사들의 점수는 하위 5분위에서 중하위 및 중위 5분위로 이동했지만, 예외적으로 뛰어난 점수의 수에는 뚜렷한 변화가 없었습니다. 이러한 패턴은 특히 초급 변호사들에게서 뚜렷했으며, 이들의 품질 개선은 상당한 시간 절감으로도 이어졌습니다(예를 들어, 10일차 과제에서 통제 집단의 평균 124분보다 18분 더 빨랐습니다).
하지만 특허 변호사들은 단순히 특허를 작성하기만 하는 것이 아니라, 법정에서 특허를 집행 불가능하게 만들 수 있는 중대한 실수(때때로 '특허 프로페인티(patent profanity)'라고 불림) — 예컨대 발명의 신규성이나 범위를 과도하게 주장하는 것 — 를 찾기 위해 서로의 작업을 검토하기도 합니다. 이에 우리는 90일차에 또 다른 과제를 추가했는데, 이는 실질적·문체적 오류가 다수 포함된 가상의 기존 특허를 수정 표시(직접 표시하고 정정하는 것, 즉 redline)하도록 요구하는 것이었습니다. 이 테스트 과제는 더 경력 많은 변호사들이 일상적으로 사용하고, 그들 대부분이 AI에 의존할 여유가 없는 종류의 전문적 판단을 반영합니다. 중요한 것은, 실험군 변호사들에게 초안 작성 과제에서는 미공개 AI 도구나 다른 어떤 AI 도구의 사용이 권장되었지만, 수정 표시 과제에서는 누구도 AI를 사용할 수 없었기 때문에, 이 과제에서의 점수는 그들의 실력이 얼마나 발전했는지를 측정하는 척도가 됩니다. 모든 과제, 즉 초안 작성과 수정 표시 모두에 대해, 우리는 특허 전문가 제3자와 협력하여 제출물을 다섯 가지 품질 차원에서 채점했습니다: (1) 집행 가능성, (2) 정확성, (3) 전략적 모호성(청구항의 전술적 범위 설정), (4) 완전성, 그리고 (5) 명확성.
AI 접근이 특허 초안 작성 및 수정 표시 품질에 미치는 추정 효과. 결과는 전체 변호사(검은색 사각형), 경력 7년 미만의 주니어 변호사(파란색 삼각형), 경력 7년 이상의 시니어 변호사(주황색 다이아몬드)에 대해 보고됩니다. 모든 추정치는 로펌 간의 차이를 고려하고 변호사별로 받은 평가 횟수의 약간의 변동을 조정합니다.
AI가 제거되었을 때
90일차 수정 표시 과제에서 AI 비서가 제거되자 균등화 효과는 사라졌습니다. AI 도구 접근 권한을 받은 변호사들은 이 비지원 과제에서 대조군보다 0.32 SD 높은 성과를 냈으며(백분위 순위로 9점 상승에 해당), 이 효과는 전적으로 시니어 변호사들에 의해 주도되었습니다. 시니어 변호사들은 대조군보다 0.45 SD 높은 성과(13점 상승)를 냈지만, 주니어들은 뚜렷한 개선을 보이지 않았습니다. 대신 주니어들의 점수는 양분되었습니다: 매우 낮은 점수는 더 많아지고, 평범한 점수는 줄었으며, 좋은 점수는 더 많아졌지만 훌륭한 점수는 더 늘어나지 않았습니다.
이러한 결과는 학습에 대해 무엇을 의미할까요? AI 도구 접근 권한을 받았던 시니어들은 지난 3개월간 도구를 사용하면서 전문적 판단 측면에서 상당한 가치를 명확히 얻었습니다. 하지만 주니어 수준의 상황은 더 미묘합니다. 일부 점수는 향상되어 AI가 학습을 도약시킬 수 있는 능력을 암시합니다. 다른 점수들은 분포의 하위 단계로 퍼져 있어, 일부 시나리오에서 AI는 주니어들이 적절한 수준의 작업을 수행하도록 도울 수 있지만, 기계 지원을 받은 그들의 더 높은 성과가 시니어 전문가를 특별히 가치 있게 만드는 전문 지식을 더 빨리 습득하는 것으로 이어지지는 않는다는 것을 보여줍니다.
전체 변호사, 경력 7년 미만의 주니어 변호사, 경력 7년 이상의 시니어 변호사별로 실험군(주황색)과 대조군(파란색) 경력별 피험자 대상: 전체 변호사, 경력 7년 미만의 초년 변호사, 그리고 경력 7년 이상의 베테랑 변호사. 관측치는 품질의 모든 차원에 대해 평균화된 개별 평가입니다.
질적 편집 패턴을 살펴보면, 서로 다른 경력 수준의 전문가들이 생성형 AI 도구와 어떻게 상호작용하는지에 대한 통찰을 얻을 수 있습니다. 실험군과 대조군 모두에서 주니어 제출물은 경직된 형식주의를 따랐습니다: 주니어들은 위에서 아래로 순차적으로 작업했으며, 주요 특허 청구항에 도달하기 전에 리스크가 낮은 서론 부분의 문장 교정에 시간을 소진하는 경우가 잦았습니다. 주니어들은 또한 상업적 범위 개선이 아닌 표면적인 유의어 교체에 집중했습니다. 주니어들은 심각한 결함을 발견했을 때조차 종종 결함을 진단하는 서술적 의견을 남기고 그것을 수정하는 redline을 실행하지 않았습니다. 이런 '실행 없는 진단' 태도가 AI 지원을 받지 않은 대조군 주니어들에게서도 똑같이 흔했기 때문에, 이는 3개월간 AI에 의존해 재작성을 실행했어도 해소되지 않은 주니어의 기본적인 결함을 나타냅니다.
반면 시니어 변호사들은 AI 노출로부터 지속적으로 이익을 얻었습니다. 실험군 시니어들은 주니어들보다 수정 표시에 더 오랜 시간을 들였고, 리스크가 낮은 문구는 건너뛰고 청구항을 처음부터 다시 작성하고, 법적 권리를 부주의하게 축소하거나 보호 범위를 제한할 수 있는 표현을 제거하며, 많은 수정에 명시적인 법리를 결합했습니다. 후속 인터뷰에서 시니어들은 AI 출력물을 완성된 결과물이 아닌 '논리 감사자(logic auditor)'로 취급했다고 설명했습니다. 이는 기존 문구에 대한 집착을 약화시키고 구조적 수정의 이유와 방법을 명확히 말하도록 강요함으로써, 그들의 기초 전문 지식을 활성화하고 날카롭게 만들었습니다.
향후 방향
성과 향상과 내구성 있는 전문적 판단의 구축은 서로 다른 목표입니다. 특히 주니어 전문가들에게 이 둘은 상충할 수 있습니다. 기초 전문 지식이야말로 AI 지원 반복 경험이 커리어 과정에서 베테랑의 전문적 판단으로 전환되도록 하는 결실의 고리일 수 있습니다. 모델 능력이 발전하더라도 그러한 판단은 계속 중요할 것입니다. 변호사들은 판사, 고객, 동료와의 상호작용에서 계속 자신의 판단을 사용할 것이며, 모든 상황에서 AI 도구에 의존할 수는 없을 것입니다. 이 AI 시대의 중요한 과제는 오늘 더 나은 작업을 만들어내도록 설계된 도구가 내일 우리가 필요로 하는 전문가가 되는 것을 주니어 전문가들에게 막지 않도록 하는 것입니다.
직업인들이 일하는 환경에서 그들을 연구하는 것은 연구자들에게 어려운 과제입니다. 저희 실험은 제한된 수의 특허 변호사 표본을 포함하고 있는데, 이는 해당 분야 최상위 전문가들의 높은 시간당 과금률을 반영한 것입니다. 저희는 이들을 단 3개월 동안만 관찰했으며, 이는 내구성 있는 전문성을 개발하는 데 필요한 수년에 비하면 짧은 기간입니다. 또한 지난 1년간 모델 능력과 기본적인 AI 활용 능력(그리고 법률 분야에서 AI 기반 제품의 침투)이 빠르게 발전함에 따라, 지금 실험을 다시 수행한다면 결과가 달라질 수 있습니다. 이러한 한계는 추가 연구의 기회를 만들어내며, 저희는 그중 일부를 앞으로 몇 달 안에 수행하고자 합니다. 그럼에도 불구하고 저희 연구에서 얻을 수 있는 명확한 교훈은, AI 지원이 전문가의 실력에 미치는 영향을 이해하려면 도구 사용의 효과와 지원 없이 사용자가 수행한 성과의 효과를 분리하는 테스트가 필요하다는 것입니다.
감사의 글
공동 저자인 Josh Martin, Zanna Iscenko, Scott Strand, David Pearl, Melissa Ferere에게 큰 감사를 전합니다. 또한 James Manyika, Ruth Porat, Kent Walker, Josh Woodward, Anu Madgavkar, Daniel Rock, Fabien Curto Millet에게 지도와 지원에 감사를 전하며, 실험에 함께해 준 Google Labs의 Tom Shane, Mauricio Carneiro, Johnny Jacobs, Victor Lavrenko, Yinghao Sun, Samuel Yang, Daniel Nishi, Eric Wang, Kevin Li, Hao Zheng, Franz Och에게, 제품 접근 권한과 신뢰할 수 있는 테스터 지원을 제공한 Kiera Russell에게, 법률 자문과 채용 지원을 해준 Steve Gong과 Taylor Montgomery에게, 그리고 출시를 이끌어준 Kerry McHugh, Zoe Ortiz, Emily Short, Joseph Mack, Esmeralda Cardenas, Leanne Trujillo를 포함한 커뮤니케이션, 마케팅, 연구 블로그 파트너들에게 감사를 전합니다.
