Jennifer Neville는 마이크로소프트의 파트너 연구 관리자로, 실제 세계에서의 AI 활용을 이해하고 발전시키는 데 역량을 쌓아왔습니다. 인간과 AI 간의 상호작용을 연구해온 것과 마찬가지로, 그녀의 초기 경력도 여러 분야를 거쳤습니다: 수학, 그 다음 물리학; 인지과학, 그 다음 직업; 그리고 마지막으로 컴퓨터 과학—비록 그녀가 그 분야를 피하려고 노력했음에도 불구하고 말입니다.
응용 과학자 교장 Chad Atalla와의 이 대화에서, 그녀는 사용자의 요구를 충족시키기 위해 오늘날의 AI 시스템의 성능 한계를 넓히는 데 있어 역할 평가가 어떤 역할을 하는지, 그리고 모델이 전통적인 벤치마크를 넘어서 테스트될 때 발생하는 “놀라운 실패”들에 대해 논의합니다. Neville은 현재의 AI 시스템과 함께 작업하는 데 대한 실용적인 조언도 공유하며, 결과가 예상과 다를 때 데이터를 면밀히 살펴보는 것이 왜 중요한지, 그리고 수십 년간의 AI 발전이 그녀에게 다음에 무엇이 올지 예측하는 방법에 대해 무엇을 가르쳐주었는지도 이야기합니다.
예상치 못한 경력의 전개에서 인공지능 상호작용과 학습의 최전선으로 이어지는 이 에피소드는 더 큰 질문을 제기합니다. 인간적이든 인공적이든 길이 우리가 예상하는 방식으로 진행되지 않을 때, 우리는 무엇을 배울 수 있을까?
Microsoft Research Podcast을 구독하세요:
녹취
[MUSIC]
제니퍼 네빌: 시간이 지나면서 제가 아무것도 성과를 내지 못하는 것처럼 느껴질 때가 있었습니다. 모든 것이 잘 되지 않았죠. 그럴 때 저는 약간 실망스러웠습니다. 하지만 그러다가 실제로 무언가를 배우게 되는 순간이 오면, 그 감정적인 흥분감이 바로 저를 끌어당겼습니다. 아직 다른 사람들이 이해하지 못하는 것을 조금이나마 이해할 수 있다는 것…
채드 아탈라: 물론이죠…
네빌: … 왜냐하면 그것은 우리가 알고 있는 것의 경계선에 위치하기 때문입니다.
표준 소개: 이는 Microsoft Research Podcast입니다. Microsoft 연구원들이 기초 과학 및 기술 연구를 통해 발전을 이끌며, 컴퓨팅과 AI 분야의 사람들, 방식, 그리고 다음 단계에 대해 탐구하는 프로그램입니다.
[MUSIC ENDS]
차드 아탈라: 안녕하세요, 환영합니다. 저는 마이크로소프트 리서치의 응용 과학자인 차드 아탈라입니다.
오늘은 마이크로소프트 리서치의 파트너 연구 관리자인 제니퍼 네빌과 푸에드라 대학의 컴퓨터 과학 및 통계학 교수인 새뮤얼 D. 콘테 교수와 함께합니다.
그녀의 연구는 대화형 분야와 구조화된 데이터에 대한 기계 학습 및 인공지능을 검토하며, 인공지능 시스템이 훈련하는 데이터 포인트가 그 시스템의 행동에 어떤 영향을 미치는지, 그리고 그것이 사용자들이 실제로 원하는 것과 어떻게 일치하는지를 조사합니다.
그 연구를 통해 그녀는 130편 이상의 논문을 발표했으며 10,000회 이상의 인용을 받았고, 국립과학재단 CAREER 상이나 등급 등의 영예도 받았다. IEEE의 AI 목록에 있는 “10 to Watch” (새 탭에서 열림), 그리고 최우수 논문상 수상작들 데이터 마이닝 국제 회의 (새 탭에서 열림) 그리고 학습 표현에 관한 국제 회의.
Jen의 작업에서 가장 놀라운 점은 그녀의 선견력과 AI 분야가 발전해도 일관된 전략을 유지하는 능력입니다. 그녀가 현재 이 자리에 도달한 과정을 더 알게 되어 기쁩니다.
Jen, 저와 함께해 주셔서 감사합니다.
젠필러 네빌: 저를 초대해 주셔서 감사합니다.
ATALLA: 멋지네요. 오늘 어떻게 여기까지 오게 되었는지 알고 싶어요. 그리고 다시 과거로 돌아가볼게요. 제가 어렸을 때, 천체물리학자가 되고 싶었지만, 당연히 지금은 컴퓨터과학 배경을 가지고 있죠. 당신은 언제부터 컴퓨터과학에 관심을 갖게 되었나요?
NEVILLE: 좋은 질문이에요. 저는… 어렸을 때 컴퓨터 과학은 전혀 원하지 않았어요. 아버지가 하는 일이거든요. 그리고 아버지가 하는 일도 전혀 원하지 않았죠. 그래서 대학에 갔을 때, 처음에는 수학을, 그 다음에는 물리학을 전공했지만, 정말로 그 전공들과는 맞지 않았어요.
그래서 저는 한동안 대학을 그만뒀고, 다시 대학에 돌아왔을 때는 인지과학을 전공하게 되었어요. 하지만 그것도 저에게 너무 부족했죠. 수학적인 내용이 충분하지 않았거든요. 그때 누군가 “AI는 인지과학과 수학, 계산적 사고를 결합한 것이니 해야 할 일이다”라고 말했다면, 저는 많은 시간을 절약할 수 있었을 거예요. [웃음] 하지만 그렇게 되지는 않았어요.
그래서 저는 한동안 일을 했습니다. 그 후 학교로 돌아왔을 때, 데이터를 다루고 처리하는 일에 관심이 있었기 때문에 컴퓨터 과학을 전공하기로 결정했습니다. 바로 그때 AI를 알게 되었습니다. 그냥 우연히 그랬던 것입니다. 그것이 컴퓨터 과학의 일부라는 것을 제대로 인식하지 못했습니다.
ATALLA: 멋지다. 컴퓨터 과학을 공부하고 데이터나 인공지능 분야에서 일하고 싶은 것은 한 가지 일이지만, 그 분야의 연구에 참여하고 싶은 것은 또 다른 일이다. 그렇다면 어떤 질문이나 큰 아이디어들이 당신의 연구 동기를 불러일으켰나요?
NEVILLE: 네, 사실 그도 흥미로운 이야기예요. 저는 컴퓨터 과학 학위의 우등 프로그램에 속해 있었기 때문에 연구에 참여하게 되었어요. 그리고 우등 프로그램의 일부로서, 가지 연구 프로젝트를 진행하는 것 [LAUGHTER].
ATALLA: 필수적이죠, 맞아요.
네빌: 그것은 필수입니다. 그래서 연구 프로젝트가 무엇이어야 하는지에 대해 교수들과 이야기했을 때, 그들은 “음, 당신이 어떤 주제에 집중하고 싶은지 결정해야 합니다.”라고 말했습니다.
그때 저는 데이터와 AI에 관심이 생겼고, 많은 생각을 했습니다. 많은 책도 읽었습니다. 그리고 제가 연구하고 싶다고 결정한 것은 상호 연결된 웹 데이터에서 데이터 마이닝을 어떻게 하는지였습니다… 그 질문을 연구하고 싶다고 결정했을 때, 한 교수님께서 저를 지목해 주셨습니다…
ATALLA: 멋지다.
NEVILLE: … 당시 막 시작된 ‘통계적 관계 학습’이라는 분야에서 일하기 시작한 사람입니다. 저희는 그 분야에서 프로젝트를 진행했으며, 워크숍에서 논문을 발표했고, 정말 매료되었습니다.
ATALLA: 맞아요.
네빌: 그래서 저는 대학원에 진학할 계획이 없었어요. 하지만 그 경험은…
ATALLA: 네.
네빌: … 나로 하여금 대학원에 진학하여 계속해 가고 싶게 만들었다.
ATALLA: 멋지네요. 무엇이 당신을 끌렸다고 생각하나요? 연구를 진행하는 흥미로움인가요? 아니면 컨퍼런스의 분위기와 학술 출판의 모습인가요?
NEVILLE: 정말로 연구를 진행하는 과정이 흥미진진했어요. 그래서 긴 프로젝트였죠. 때로는 아무것도 성과가 없어서 실망스러울 때도 있었어요. 하지만 제 조언자는 지지적이고 긍정적인 태도로 “아니요, 계속 해보세요. 우리는 무언가를 배우고 있잖아요”라고 말해주셨어요. 그러다 보면 어느 정도 성과가 나오는 단계에 도달하게 되죠. 했어 무언가를 배우는 것, 그리고 그 감정적인 흥분이 바로 나를 매혹시켰어요. 아직 아무도 이해하지 못하는 것을 조금이나마 이해할 수 있다는 것이요…
ATALLA: 네, 알겠습니다.
네빌: … 왜냐하면 그것은 우리가 알고 있는 것의 경계에 위치하기 때문이죠. 아, 거의 약과 같은 느낌이에요, 맞죠? [웃음] 그래서 그런 느낌을 계속 추구하며 오랫동안 연구를 지속하게 되었어요.
ATALLA: 알겠습니다. 좋아요. 네, 2021년에 학계에서 마이크로소프트에 합류했죠. 사실, 당신은 여전히 교수이며 20년 동안 강의와 조언을 해왔습니다. 전문적인 삶의 일부가 연구가 되도록 만든 동기는 무엇인가요? 산업 분야에서그리고 산업 연구와 학계 연구의 차이점을 어떻게 설명하시겠습니까?
NEVILLE: 제 연구는 이론과 응용 사이의 범위를 넘나드는 형태입니다. 제가 교수직을 얻고 첫 번째 휴직을 받았을 때, 같은 경력 단계에 있는 많은 동료들이 산업 연구소로 가서 휴직을 했고 퍼피던트로 돌아오지 않았습니다. 어떤 방향으로 나아가고 싶은지 고민했는데, 이론을 더 공부할지 아니면 응용을 더 공부할지에 대해서였습니다. 당시 제 경력상 이론 쪽을 탐구하는 것이 더 좋다고 생각했습니다. 그래야만 다시 퍼피던트로 돌아올 수 있을 테니까요.
그래서 저는 버클리의 시몬스 연구소에서 휴가를 보냈는데, 그곳은 매우 이론적인 환경이었습니다. 훌륭한 경험이었지만 학계로 돌아가는 과정이 순조롭게 진행되었습니다. 두 번째 휴가 때는 반대로, 마이크로소프트 리서치의 MSR에 가서 여기서 휴가를 보냈습니다. 그리고 물론, 이론상의 알고리즘이 실제 시스템과 실제 사용자, 실제 데이터에서 어떻게 작동하는지 보는 것이 어렵습니다. 실제로는 그 알고리즘이 어떻게 작동하는지를 확인하는 것은 쉽지 않습니다. 그래서 제가 여전히 여기에 있는 이유도 바로 그 때문입니다.
ATALLA: 알겠습니다.
NEVILLE: 따라서 학계와 산업계의 연구의 차이는… 연구가 목표하는 곳에 따라 달라진다고 생각해요. 근본적으로는 학계와 산업계에서 제기되는 질문들이 매우 유사하지만, 산업계에서는 실제 시스템과 실제 데이터를 활용하여 대규모로 적용하는 능력이 학계와는 매우 다르죠. 학계에서는 여러 다른 분야에 걸쳐 적용 가능한 추상적인 질문들을 제기하게 되는데, 바로 이런 방식으로 DARPA [방위고등연구기관]과 NSF [국립과학재단] 같은 기관에서 자금을 얻게 됩니다.
하지만 산업 분야에서는, 실제 시스템에서 손을 다룰 수 있는 일을 하는 것이 조금 더 쉽습니다. 그리고 그 다음으로는 제품과 회사의 이익이 목표가 됩니다. 그래서… 그러한 변화가 생기면, 질문이나 조사해야 할 내용도 바뀌게 됩니다. 제 생각에는… 그렇게 하는 것이 정말 좋은 일입니다.
ATALLA: 네.
NEVILLE: … 두 곳 모두에요, 맞죠? 두 곳 사이에는 많은 시너지가 있고, 산업에서 시작해 학계로 돌아오거나, 학계에서 시작해 산업으로 가는 등 다양한 선택의 기회가 있다고 생각해요. 하지만 지금은 AI 시스템에 관련된 작업을 하고 있다면, 산업이야말로 적합한 곳이라고 생각합니다.
ATALLA: 알겠어요. 네. 지금 직업에서 어떤 길을 선택할지 고민하는 사람들에게 유용한 조언일 거예요.
저는 마이크로소프트에서 6년이 조금 넘는 시간 동안 일해왔으며, 그동안 AI 평가 작업에 전념해왔습니다. 물론 이 분야에는 많은 어려운 기본적인 질문과 과제들이 존재합니다.
그리고 처음에 당신의 작업을 접했을 때, 당신의 작업이 이러한 문제들에 대한 해결책을 제시하고 그 문제들을 지적하는 데 도움을 준다는 것을 알게 되었습니다. 즉시 제 마음속에서 느낀 감정은, 당신과 같은 훌륭한 사람이 이런 일을 하고 있다는 것에 대한 안도감이었습니다. 그리고 당신이 AI 평가에 대한 비판과 함께 해결책을 제공하는 것을 어떻게 균형 있게 하는지 정말 감사합니다.
하지만 그것은 당신의 더 큰 연구 계획의 일부에 불과하다는 것을 이해합니다. 그렇다면 여기서 이끄는 팀의 현재 연구 기본 방침을 어떻게 설명하시겠습니까?
네빌: 우리 팀은 AI 상호작용 및 학습 팀입니다. 우리가 진정으로 중점을 두는 것은 실제 작업 환경에서 이러한 AI 시스템의 행동 범위를 더욱 확대하는 것입니다. 이를 위해 현재 시스템의 성능 한계가 어디인지, 사용자가 실제 워크플로우에서 어떻게 경험하는지 연구하고, 그 다음으로 이러한 복잡한 작업에 대한 모델의 성능을 향상시키는 방법을 찾는 것입니다.
우리가 평가에 집중하는 이유는, 머신러닝과 인공지능 전문가들이 평가하는 표준적인 방법이 실제 사용 방식과 관련해 상당히 간단한 벤치마크를 통해 이루어진다는 것을 알기 때문입니다. 그래서 우리가 가장 먼저 해야 할 일은, 이러한 시스템에서 우리가 무엇을 원하는지 물어보고, 그런 환경에서 시스템을 적용할 수 있는 실용적인 평가 방법을 설계하는 것입니다. 즉, 다중 회전 행동, 협업 환경, 사용자가 수행하는 장기적인 과제와 같은 것들이 그에 해당합니다.
그런 다음, 그 평가에서 발생하는 성능 차이나 문제들이 어디에 있는지 알 수 있게 되면, 이로써 우리는 이 시스템들을 어디에서, 이론적으로나 알고리즘적으로 개선해야 하는지에 대한 지식도 얻게 됩니다.
그래서 우리는 평가로 시작하지만, 결국 우리가 추구하는 것은 더 나은 알고리즘, 모델, 추정 방법을 개발하는 것입니다…
ATALLA: 네, 알겠습니다.
네빌: … 모델의 성능을 향상시키기 위해.
ATALLA: 네, 이는 이해로 가는 통로이며, 따라서 경계를 넓히고 이러한 시스템을 개선할 수 있게 해줍니다.
네빌: 네.
ATALLA: 멀티턴 상호작용과 협업 환경에 대해 언급하셨죠. 최근에 이러한 주제를 특별히 검토한 몇몇 논문들이 있습니다. 예를 들어 LLM이 멀티턴 대화에서 길을 잃을 수 있다는 것이나 이러한 에이전트적 지식 작업 시나리오에서 문서가 손상될 수 있다는 것 등입니다. 그 연구 프로젝트에 대해 좀 더 자세히 말해주실 수 있나요?
네빌: 물론입니다. 우리는… 그런 경우들이 바로 모델의 행동을 실제로 통제하고 테스트할 수 있도록 평가 방식을 설정하는 데 혁신적인 통찰이 필요했던 사례들입니다.
따라서 다중 회전 대화의 경우, 우리는 단일 회전 벤치마크를 사용했습니다. 실제로 사용자들을 관찰한 결과 중 하나는 그들이 무엇을 하려고 하는지 부족하게 명시한다는 것입니다. 그들은 처음부터 완전한 명세를 제시하는 방법을 모릅니다. 컴퓨터 과학자이자 소프트웨어 엔지니어로서 우리는 이를 잊곤 하지만, 일반 사용자들은 첫 번째 회전에서 모든 것을 완전히 명시하기 어려울 수 있습니다. 그래서 그들은 여러 회전을 거쳐 자신이 무엇을 하고 있는지 파악하고, 각 회전마다 조건과 명확화를 추가하게 됩니다.
그래서 우리가 한 일은 공개된 단일 회전 벤치마크 데이터셋을 사용하여, 완전히 명시된 단일 복잡한 회전 지시를 변경한 것입니다. 그리고 여러 회전을 통해 사용자가 그 설명을 제공하는 것을 시뮬레이션하는 모델들을 만들었으며, 현재 가지고 있는 모든 모델들이 이러한 종류의 과제가 여러 회전으로 주어졌을 때 어떻게 작동하는지 연구했습니다.
그리고 우리는 단일 턴 시나리오에서 관찰되는 성능이 매우 높다는 것을 발견했습니다. 물론 모델 제작자로서 우리는 그런 방향으로 최적화를 하고 있기 때문입니다. 하지만 여러 턴을 거치면 실제로 성능이 크게 저하됩니다. 그래서 이는 상당히 놀라운 발견이었습니다. 왜냐하면 아무도 이에 대해 평가한 적이 없었기 때문입니다…
ATALLA: 네, 알겠습니다.
네빌: … 그런 방식으로 이전에도 있었습니다. 하지만 그 연구 결과를 세상에 공개했을 때, 시스템 사용자들이 모두 공감했습니다…
ATALLA: 네… 맞아요.
NEVILLE: … “음, 그게 제 경험입니다. 그런 일이 일어나고 있다는 걸 알았어요. 어떻게, 우리가 어떻게 그 문제를 해결할 수 있을까요?” 그리고 … 그래서 우리는 강화 학습 방법을 사용하여 모델이 이런 환경에서 더 잘 배울 수 있도록 돕고, 그 행동 문제를 해결하려고 노력하고 있습니다.
하지만 우리가 논문에서 언급한 실용적인 해결책은, 모델을 얻게 되면 약간 혼란스러워질 수 있다는 것입니다. 여러 번의 대화를 통해 특정한 내용을 지정했을 경우, 채팅을 중단하고 모든 것을 지우고 다시 시작하세요. 그리고 이제 알고 있는 내용을 바탕으로 완전히 명확한 한 번의 대화를 해보세요…
ATALLA: 알겠어요, 네.
네빌: … 그리고 그러한 종류의 상호작용에서는 더 잘 작동할 것입니다.
그러므로 이는 우리가 본질적으로 모델의 알고리즘 개선을 추구한다고 하더라도, 때때로 이러한 프로젝트에서 사용자의 행동 방식을 어떻게 바꿀 수 있는지에 대한 통찰력을 얻게 된다는 것을 보여준다…
ATALLA: 네, 그렇습니다.
네빌: … 현재 모델에서 더 좋은 결과를 얻기 위해, 예를 들어, 지금 그들이 있는 곳에 대해서…
ATALLA: 네…
네빌: … 그들의 성능과 관련하여.
ATALLA: 맞아요. 우리 연구의 주제 중 하나는 사용자들이 실제로 원하는 것과 더 잘 일치하도록 이러한 시스템을 어떻게 개선할 수 있는지입니다. 당신은 “사용자들은 처음에 무엇을 원하는지 명확히 말하지 않는 경우가 많고, 긴 다중 회전 상호작용이 존재한다”는 예를 언급했어요. 그 논문을 발표한 후, 그들은 다중 회전 대화 속에서 길을 잃는다는 불편함에 공감했습니다.
사용자의 욕구와 필요, 경험을 이해하는 방법에 대해 어떻게 생각하시나요? 그리고 예를 들어 사용자를 시뮬레이션하여 더 긴 다중 역할 평가를 수행하는 것과 이에 대한 관계는 어떤가요?
NEVILLE: 네, 그건… 사용자들이 무엇을 시도하는지, 그리고 시스템에서 어떤 실패와 성공이 일어나는지를 대규모로 볼 수 있다는 것이죠. 이런 데이터를 대규모로 보게 되면 얻을 수 있는 장점 중 하나라고 생각합니다.
그래서 우리는 마이크로소프트 내부에서 제품 그룹에 대해 많은 작업을 수행했으며, 대규모의 소비자 로그를 분석하여 사용자들이 경험하는 주요 장애 패턴이 무엇인지 파악했습니다. 제공합니다 우리가 하는 많은 작업에 대한 통찰이나 동기부여입니다. 또한 사용자들이 성공한 부분을 분석하는 훌륭한 제품 그룹도 많아서, 그 결과로 사용자에게 어떻게… 현재 우리가 가진 시스템에서 성공적으로 수행할 수 있는 작업이 무엇인지 추천할 수 있게 됩니다.
검색 엔진이 처음 시작되었을 때를 생각해보면, 사람들은 검색 엔진과 어떻게 상호작용하는지 배워야 했습니다…
ATALLA: 네, 알겠습니다.
네빌: … 그들이 찾고 있는 정보를 효과적으로 얻을 수 있는 방식으로. 이제는 모든 사람이 AI 시스템이 등장하기 전에 했던 일의 일부였기 때문에 그런 일이 있었던 것을 잊었을지도 모릅니다. 하지만 이제는 검색 엔진에서 채팅 기반 시스템으로의 전환이 일어날 것으로 보입니다. 또한 사용자들로부터도 어떤 교훈을 얻어야 할 것 같습니다…
ATALLA: 맞아요, 그렇습니다.
네빌: … 이 새로운 환경에서. 그리고 사용자들이 하는 일 중 성공적인 것들을 분석하는 것이 추천을 하는 시작으로 훌륭한 방법이라고 생각해…
ATALLA: 네.
네빌: … 그리고 같은 방식으로 사용자들에게 튜토리얼이나 교육을 제공하는 것도 포함됩니다.
ATALLA: 실제 데이터를 살펴보는 것의 유용성을 지적하는 방식을 좋아하지만, 그게 정말 무슨 의미인가요? 진심으로 실제 데이터를 보고 있는 건가요? 개인정보는 어떻게 관련이 있나요? 실제 환경에서 데이터를 책임감 있게 활용하기 위한 절차는 어떤가요?
NEVILLE: 오, 그렇군요. 좋은 지적입니다. 말씀해 주셔서 감사합니다. 우리는 실제로 데이터를 보지는 않습니다. 데이터를 규모 있게 분석하여 개인정보 보호 방식으로 실패나 성공의 패턴을 파악하고 있습니다. 또한 많은 제한들이 있어서 데이터를 직접 볼 수 없습니다. 우리는 매우 제한된 환경에서 데이터를 처리하는 방법을 찾을 수밖에 없습니다. 그리고 그런 식으로 얻은 개인정보 보호가 보장된 고급적인 통찰들이야말로 나중에 알고리즘적으로 할 일을 촉진하는 데 사용됩니다.
그러니까 명확히 하자면, 우리는 당신의 데이터나 응답에 대해 미세 조정을 하는 것이 아닙니다. 하지만 당신이 응답에서 제공하는 세부 정보가 많을수록, 기부된 정보를 통해 제공하거나, '아니요'를 선택하고 그 내용을 설명하거나, 모델과의 대화에서 얻은 정보 등이 모여 결국 모델을 개선하는 데 도움이 될 수 있습니다. 이는 사람들이 실제로 당신이 한 일을 직접 확인하는 방식으로는 이루어지지 않습니다.
ATALLA: 당신은 검색이 주된 방식에서 다중 회전 채팅 상호작용으로의 변화를 지적했습니다. 하지만 이제는 에이전트 기반의, 그리고 협업적인 지식 작업 방식의 업무도 더욱 중요해지고 있습니다. 당신도 그 분야에 대한 연구를 했던 것 같습니다. 청취자들에게 공유하고 싶은 다른 흥미로운 점이 있나요?
NEVILLE: 네. 그래서 우리는 트랜스포머가 모델 내에서 계산하기 어려운 작업 유형을 특성화하려는 이론적 연구와, 시뮬레이션 기반 연구도 함께 진행하고 있습니다. 이 연구에서는 장기적인 작업 흐름을 통해 수행되는 복잡한 작업들을 다룹니다. 예를 들어, 문서를 받아 그 문서들에 반복적인 편집 작업을 수행하는 것이죠.
그ような 환경에서 모델이나 에이전트가 처리해야 할 과제의 복잡성은, 사용자가 이 장기적인 활동 동안 무엇을 하려는지뿐만 아니라 현재 상태가 어떤지, 어떤 정보가 관련된지, 어떤 정보가 관련이 없는지, 상황이 어떻게 변했는지를 파악하는 것입니다. 이러한 것들은 에이전트들이 점차 잘 해내고 있는 분야이지만, 특정 유형의 작업은 다른 작업보다 더 쉽습니다.
ATALLA: 네, 알겠습니다.
네빌: 우리가 살펴보는 것은 현재 에이전트들이 복잡한 작업을 처리하기에 부적합한 경우가 있는지, 그리고 그 문제를 어떻게 해결하는지입니다. 에이전트과 도구를 함께 사용하는 가장 좋은 방법은 무엇인가요? 인간을 참여시킬 것인가요? 무엇이 잘못되었는지 어떻게 알 수 있을까요? 그래서 에이전트들이 스스로를 모니터링하고, 자신이 올바르게 답했는지, 아니면 이전 상태로 돌아가야 하는지 평가할 수 있도록 하는 것이 필요합니다. 이 모든 것은 아직 열려 있는 질문들입니다.
하지만 우리는… 우리는 이러한 작업 흐름이 점점 더 길어질수록 다시 한 번 놀라운 실패가 발생한다는 것을 보여주는 몇 가지 데이터를 가지고 있습니다. 왜냐하면, 문제를 발견하지 않으면 누적될 수 있기 때문입니다…
ATALLA: 네.
네빌: … 그리고 반복적인 상호작용을 통해 작업을 수행해야 하므로, AI를 더욱 혼란스럽게 만듭니다.
ATALLA: 네, “놀라운 실패”라는 표현이 저에게 흥미롭습니다. 이는 “이것은 더 잘 되어야 하는데, 특정 방식으로 실패했다는 것이 놀랍다”는 기대를 내포합니다. 이러한 놀라운 오류들을 더 많이 보이는 것 같나요, 아니면 대부분의 오류들은 예상했던 대로 실패할 수밖에 없는 것인가요?
네빌: 네, 그곳에는 분명히 실패가 예상됩니다. 왜냐하면… 물론, 시스템을 점점 더 개선하기 위해 노력하는 만큼 예상되는 실패는 줄어들기 때문입니다.
ATALLA: 맞아요. 그들을 기대할 수 있다면, 그들을 고칠 수 있습니다.
네빌: 맞아요. 하지만 환각과 같은 현상들은 오랫동안 커뮤니티에서 특징으로 지적된 유형의 실패 사례이며, 이러한 현상을 줄이기 위한 구체적인 기준과 방법들이 존재합니다.
제 생각에 제 팀은 거의 놀랄 만한 실패로 나타나는 것들을 찾아내는 경향이 있습니다. 그런 실패는 전통적인 실패와는 다르며, 종종 구분하기 어렵고, 아주 미묘해서 수학 문제에 대한 잘못된 답이나 법률 문서에서 환상적인 사례처럼 단순히 나타나지 않습니다. 하지만 이는 문서 내의 의미적 내용이 미묘하게 손실되는 현상입니다. 그리고 제 생각에, 팀과 함께 조사했던 내용을 돌아보면, 인간에게 어려운 일이 모델에게도 어려운 일이 될 것이라는 가설이 있습니다. 하지만 실제로는 그렇지 않은 경우가 많습니다. 왜냐하면 트랜스포머가 계산하는 데 어려운 것, 그리고 그들의 검색 시스템이 찾아내는 데 어려운 것에 대해 고민해야 하기 때문입니다…
ATALLA: 맞아요.
네빌: … 기본 콘텐츠에서.
그래서 제 생각에 “놀라운” 점이 생기는 이유는, 인간으로서 우리가 매우 간단하게 할 수 있을 것 같은 일들 때문입니다. 또는 이전에 올바르게 완료된 작업이 있다면, 이제 같은 작업을 다시 올바르게 수행할 수 있을 것이라고 생각합니다. 하지만 실제로 LLM의 경우 반드시 그렇지는 않습니다. 그래서, 인간의 지능에 기반한 우리의 기대와 관련하여 어려운 것과 쉬운 것에 대한 예상이 나타나는 것이죠.
ATALLA: 네. 사용자들이 이러한 시스템이 어떤 성능을 가져다줄 것이라고 기대하는 것에 따라 생길 수 있는 혼란, 그리고 인간 지능을 반영하는 듯한 모든 과장과 마케팅 등을 고려할 때, 실제 사용자들이 이로부터 얻고 싶은 것은 무엇일까요? 혹은 여기서의 업무를 바탕으로 AI 시스템에 대한 그들의 능력과 기대치에 대해 어떻게 경고해야 할까요? 그들은 그런 소음을 어떻게 넘어서고 더 나은 기대를 가질 수 있을까요?
네빌: 오, 좋은 질문이에요. 제 생각에는 현재의 AI 시스템은 많은 능력을 가지고 있어서 현재 업무 환경에서 사람들에게 매우 유용할 것입니다. 우리 연구에서 얻은 결론은, 그 시스템들이 모든 면에서 100% 성공할 것이라고 기대해서는 안 된다는 것입니다. 받은 답변을 꼼꼼히 확인해야 합니다. 만약 잘못된 답이 나온다면, 모델이 전혀 할 수 없다고 단정해서는 안 됩니다. 대신 다시 질문하거나 다른 방식으로 물어보는 것을 고려해야 하며, 다음에 더 좋은 답을 얻을 수 있을 것입니다.
지금 우리가 하는 방식에 그걸 통합하는 것은 어렵습니다. 왜냐하면 그들은 아직 100% 위임될 준비가 되어 있지 않기 때문입니다. 하지만 감독과 검증이 함께되는 워크플로우에서 그들을 활용할 방법을 찾을 수 있다면, 일을 처리하고 생산성을 향상시키며 일을 수행하는 속도를 높이는 데 매우 유용할 것입니다.
그러니까… 그리고 아마도 말해야 할 또 다른 것은, 우리를 좀 참아주세요. 왜냐하면 우리는 이 시스템들을 실시간으로 개발하고 있기 때문입니다. 여러분의 사용은 우리가 모델의 한계를 넓히는 데 도움이 되는데, 무엇이 가능하고 불가능한지를 보여주는 예시를 제공하기 때문입니다.
아마도 제가 말하고 싶은 또 다른 점은, 사용자들이 이해하지 못할 수도 있는 것입니다. 과거에는 검색 기반 시스템이나 추천 시스템에서 사용자로부터 받을 수 있었던 피드백이 그저 ‘정상’ 또는 ‘불량’과 같은 단순한 표현에 불과했습니다. 하지만 이제는 훨씬 더 정확한 피드백을 제공할 수 있는 환경에 있기 때문에, 이를 통해 모델을 개선하는 데 매우 유용할 것입니다.
그러니 모델과 채팅 환경에서 작업을 하고 있다면, 일이 잘못되었을 때 어떻게 잘못되었는지 말하는 것이 실제로 도움이 된다는 점을 이해하세요. 텍스트나 대화를 통해 정확히 무엇이 잘못되었고, 원했던 것과 실제로 얻은 것에 대해 전달하는 것이죠. 왜냐하면 이 정보는 모델을 업데이트할 때 사용될 것이기 때문입니다. 그래서 사용자들에 대해 생각해보면, 당신의 역할은 모델을 훈련시켜 현재로서는 할 수 없는 일들을 할 수 있도록 하는 것입니다.
ATALLA: 멋지다. 흥미로운 행동 요청이네.
그리고 저는 그저 궁금합니다. 현재 우리가 사용하고 있는 변환자 패러다임에 대해 말씀하셨죠. 이러한 대규모 언어 시스템을 위한 패러다임입니다. 대규모 AI 시스템의 과학은 앞으로 어디로 나아갈 것으로 보십니까? 광범위하게 말하자면, 이는 정말 어려운 질문일 수 있지만, 적어도 여러분의 관심과 연구 방향에서 볼 때, 이러한 시스템의 과학은 앞으로 어디로 나아갈 것으로 보십니까?
네빌: 그건 정말 큰 질문이에요. [웃음] 저는 우리가… 연구 커뮤니티가 트랜스포머 아키텍처가 사용할 수 있는 적절한 기반 모델인지 알아내려고 노력하고 있다고 생각해요. 왜냐하면 트랜스포머에서 계산이 작동하는 방식에 알려진 한계들이 있기 때문입니다. 이러한 한계들 중 많은 것들은 현재 모델 주변에 있는 래퍼러와, 모델 뒤쪽에서 일어나는 추론을 통해 해결될 수 있습니다.
그래서 제 생각에는 열린 질문은, 이런 류의 래퍼링 기반을 통해 변환기 아키텍처의 한계를 어느 정도 극복할 수 있는지, 그리고 근본적으로 다른 방식으로 해결해야 할 문제가 무엇인지입니다.
ATALLA: 네, 알겠습니다.
네빌: … 사물을 지탱하는 구조인가요? 저는 현재의 모델들 주변에 더 복잡한 랩퍼가 생기고, 대체적인 아키텍처와 모델들이 급속히 발전할 것이라고 생각합니다.
다음 세대의 연구에서 모델과의 장기적인 상호작용에 집중해야 할 것이며, 모델이 자신이 작동하는 세계를 현재보다 훨씬 더 구체적으로 이해할 수 있도록 해야 할 것입니다. 하지만 현재 진행 중인 연구에 대해 매우 낙관적입니다. 우리는 분명히 이 일에서 성공할 것이라고 생각합니다.
아마 제가 시작했을 때로 돌아가보면, 제 첫 인턴십은 2000년에 AT&T Labs에서 했습니다. 인턴 당시 점심시간에 go 게임을 하며, AI 모델이 이 게임을 할 수 있게 되는 방법에 대해 이야기했던 것을 아주 선명하게 기억합니다. 체스보다 더 어렵다고 느꼈고, 우리가 무엇을 할 수 있을지도 고민했습니다.
그때 저는 고를 어떻게 두는지 배우고 있었습니다. 9x9 보드 위에서 배우고 있었죠. 여러분도 고를 어떻게 두는지 배운 적이 있는지 모르겠네요…
ATALLA: 저는 아직 없습니다.
네빌: … 하지만 큰 보드에서 어떻게 플레이하는지 배우지 못했어…
ATALLA: 와.
네빌: … 왜냐하면 그건 인간조차도 너무 어렵기 때문이죠, 맞죠? 그래서 9x9 보드부터 시작하죠.
그리고 저는 제가 어떻게 플레이하는 법을 배우는지, 알고리즘이 어떻게 플레이하는 법을 배우는지에 대해 생각하는 것을 지켜보고 있었습니다. 그동안 우리는 AI가 이를 수행하는 데 얼마나 시간이 걸릴지에 대해 추측하고 있었습니다. 그래서 돌아보면 재미있습니다. AT&T 랩스에서는 기계 학습과 AI 연구 분야의 많은 유명인들이 있었습니다. 사람들은 “이걸 할 수 있게 되는 데 50년이 걸릴 거예요”라고 말했습니다. 어떤 사람들은 100년이라고도 했습니다. 하지만 물론, 이제는 이미 해결된 문제입니다.
ATALLA: 네.
NEVILLE: 그래서 앞으로는 연구자로서 생각할 수 있는 것들이 있습니다. 현재 우리가 보는 행동의 이러한 경계를 넘어가는 것은 매우 어렵기 때문에, “오, 10년이 걸릴 거야”나 “25년이 걸릴 거야”라고 생각하는 경향이 있습니다.
하지만 연구의 속도와 이 분야에서 연구를 하는 사람들의 수, 그리고 이러한 모델들이 실행되는 규모를 고려할 때, 2000년의 그 새로운 AI 학생으로서 생각했던 것보다 훨씬 더 빠르게 그 일이 일어날 것이라고 생각합니다.
ATALLA: 와. 그런 의미에서 2000년을 되돌아보면, 너무 빠르게 변화하는 상황이라서 20년이나 10년만 앞으로 가는 상상을 해봅시다.
네빌: [웃음] 그래요.
ATALLA: 이 공간에서 연구에 남기고 싶은 표시는 무엇인가요?
네빌: 제 연구 경력에서 공통적으로 나타난 것은 복잡한 시스템에 대해 생각하고, AI와 머신러닝이 그러한 복잡한 시스템에서 어떻게 작동하는지 고민하는 것입니다. 지금도 우리는 협업을 통해 이를 중점으로 하고 있으며, 인간과 AI의 상호작용에 대해 생각하고 있습니다. 만약 과학소설 같은 결과를 생각한다면, 인간과 AI가 팀으로서 함께 일하며 목표를 달성하고 혁신을 이루는 환경에서 일한다면 성공할 수 있을 것입니다. 그렇게 제대로 작동한다면, 제 연구가 성공적이라고 느낄 수 있을 것입니다.
ATALLA: 멋지다. 자, 여기서 마무리할 때, 빠른 질문들을 하며 재미있게 진행하는 것도 좋을 것 같아요. 즉시 답변을 하거나, 머릿속에 떠오르는 대로 답하기만 하면 되죠. 괜찮은데요?
NEVILLE: 물론이죠.
ATALLA: 멋지네요. 당신에게 깊이 남은 또는 관점을 바꾼 한 가지 조언은 무엇인가요?
네빌: 음, 알겠어요. 하지만 당신은 간단한 답변을 말하라고 했죠. [웃음]
처음 컴퓨터 과학을 시작했을 때, 사실 Doina Precup (새 탭에서 열림)가 제 첫 번째 컴퓨터 과학 수업의 TA였어요. 저는 당황하고 다른 사람들 모두가 모든 것을 알고 있는 반면 저는 아무것도 모른다고 느꼈죠. 그녀는 이렇게 말했어요. “질문을 두려워하지 마세요. 어떤 사람들은 자신이 무슨 일인지 안다고 보일 수 있지만, 사실은 아무것도 모릅니다. 그리고 그들은 당신이 질문을 할 수 있는 용기가 있다는 점을 정말 고마워할 거예요. 아마도 그들도 같은 생각을 하고 있을 테니까요. 그리고 만약 당신이 질문을 한다면, 당신과 그들 모두에게 도움이 될 거예요.”
그래서 저는 제 경력 동안 그 점을 마음에 새겼습니다. 알다시피, 두려워하고 자신이 어리석어 보일 것 같은 느낌을 받을 때 질문을 하는 것이 매우 어렵습니다. 하지만 분명히, 그러한 두려움을 느끼면서도… 그럼에도 불구하고 질문을 할 용기를 낸다면, 사람들이 정말 고마워한다는 것을 알게 되었습니다. 그리고 나중에 사람들은 “아, 저도 같은 생각이었어요.”라고 말하곤 합니다. “당신이 그 질문을 한 것에 정말 기뻐요.” 그러니 용기를 내서 그 질문을 하세요.
ATALLA: 멋지네요. 어떤 교훈을 힘들게 배웠나요?
네빌: 데이터를 보세요. [라울러] 데이터를 보세요.
따라서 머신러닝에서는 이러한 경향이 있습니다—이는 벤치마크에도 해당됩니다. 우리는 테스트 세트를 가지고 있습니다. 모델을 실행하고 학습시킵니다. 그런 다음 이 테스트 세트에 적용합니다. 일반적으로 우리가 목표로 하는 지표인 숫자가 나옵니다. 숫자가 더 높아진다면 잘 하고 있다고 생각합니다. 하지만 숫자가 변동하지 않는다면 “아, 문제가 너무 어렵구나”라고 생각합니다.
하지만 여러 번의 어려운 경험을 통해 알게 되었습니다. 일이 제대로 작동하지 않을 때, 데이터를 자세히 살펴보면 실제로 데이터에 오류가 있다는 것을 발견할 수 있습니다. 데이터는 우리가 예상했던 그대로가 아닙니다. 데이터는 모델을 훈련시키는 분포와 다릅니다. 그래서 언제나… 아마도 그렇게 되면 나는 데이터 전문가가 된 것 같습니다. [웃음] 하지만 종종 일이 예상했던 대로 진행되지 않을 때, 우리는 데이터를 살펴보고 이해하려고 노력합니다.
ATALLA: 맞아요. 말이 되네요. 좋은 문제예요. 어려운 문제예요.
네빌: [웃음] 기억하기 어렵다.
ATALLA: 예.
네빌: 그리고 그게… 아마도 중요한 점은, 비록 나는 그 교훈을 배웠지만…
ATALLA: 네, 알겠습니다.
네빌: … 제 경력 동안 그 교훈을 적어도 반 다스 번이나 다시 배우는 수밖에 없었습니다.
ATALLA: 네. 그런데 반면에, 당신이 가장 자랑스러운 성과는 무엇인가요?
네빌: 저는 동시에 장기 근무 자격을 얻고 유아를 키울 수 있었던 사실이라고 말하고 싶어요.
ATALLA: 와, 맞아요.
네빌: 우리가 직위를 시작하기 직전에 아들을 낳았어요. 남편도 교수였죠. 그래서 교수직을 시작하기 전이었어요. 제가 정규직을 얻을 수 있었고, 아들이 건강하고 행복했으며, 결혼 생활도 유지할 수 있었어요 [웃음]…
ATALLA: 네, 정말 그렇습니다.
네빌: …는 아마도 가장 큰 성취일 거예요, 음…
ATALLA: 대단한 성과네요. 그런데 마지막 질문입니다. 예술이나 자연이 당신의 작품에 어떤 영향을 준 방법이 있나요?
네빌: 흠, 이게 정말 자연이라고 할 수 있을지 잘 모르겠어요. 하지만 AI로서 항상 관찰해온 것은 아이들, 사람들, 동물들, 곤충들이 세상과 환경에 대해 배우고 행동을 바꾸는 방식입니다. 그래서 저는 어린 아이를 둔 부모로서 매우 복잡한 상황이었음을 인정합니다. 기계 학습에서 얻은 아이디어들을 활용해 제 아들이 더 잘 배울 수 있도록 도와볼 수 있는지 시도해 보았습니다.
예를 들어, 그가 아기 때에 뒤집으려고 노력하는 법을 배우고 있다면, 저는 이렇게 말할 거예요. “좋아, 긍정적인 훈련 예시를 보여줄게요. [웃음] 여기서 다리를 잡고 이렇게 해보세요.”
ATALLA: 네, 맞아요.
네빌: … 그리고 그 후에 그가 배우는 과정을 보면서, 그가 어떻게 배우는지도 알 수 있고, 또한 그 과정이 우리가 개발한 알고리즘과 모델에 어떻게 적용될 수 있을지 생각해보는 것입니다. 아마도 제 경력 동안 계속해서 되돌아오는 가장 큰 주제가 바로 이 것입니다.
ATALLA: 멋지네요. 네.
네빌: 고마워요.
ATALLA: 자, Jen, 당신의 이야기와 통찰을 공유해 주셔서 감사합니다. 당신이 여기에 있어서 기쁩니다.
우리 청중 여러분, 시청해 주셔서 감사합니다. Microsoft에서 일하는 제 동료들의 연구에 대해 더 알고 싶으시다면, aka.ms/research의 Microsoft Research 페이지나 [MUSIC]을 통해 이 팟캐스트의 다른 에피소드를 확인해 보세요. 감사합니다.
[MUSIC ENDS]
더 알아보기:
- AI 상호작용 및 학습
홈페이지 - 위임할 때 LLM이 문서를 손상시킵니다
출판물 | 2026년 4월 - AI 위임 및 장기적인 신뢰성에 관한 우리의 최근 연구에 대한 추가 설명
- 마이크로소프트 리서치 블로그 | 2026년 5월
- LLM은 다중 회전 대화에서 사라진다
출판물 | 2025년 5월
AI가 잘못하는 것과 실패로부터 우리가 배우는 것라는 게시물은 Microsoft Research에 처음 등장했습니다.
