Jennifer Neville 是微软的一名合伙人研究经理,她的职业生涯一直围绕理解和推进面向现实世界应用的人工智能展开。正如她所研究的人机交互一样,她早期的职业道路也是多轮式的:先是数学,然后是物理学;先是认知科学,然后是工作;最后是计算机科学——尽管她曾竭尽全力想避开这个领域。
在与首席应用科学家的这次对话中 Chad Atalla她探讨了评估在推动当今 AI 系统突破性能边界以满足用户需求方面所发挥的作用,以及当模型在传统基准之外进行测试时出现的“令人惊讶的失败”。Neville 还分享了与当前 AI 系统打交道的实用指南,并讨论了为什么当结果与预期不符时仔细审视数据至关重要,以及数十年的 AI 进步教给她哪些关于预测未来走向的经验。
从一条出人意料的人生轨迹到人工智能交互与学习的前沿,本期节目提出了一个更大的问题:当道路——无论是人类的还是人工智能的——并未按我们预期的方式展开时,我们能学到什么?
订阅 微软研究院播客:
逐字稿
[音乐]
JENNIFER NEVILLE: 有些时候,我感觉自己在原地打转。事情不顺利,我会有点沮丧。然后我们会走到这样一个地步——我们 做了 学会一些东西,而正是那种情感上的兴奋感真正吸引了我。能够去理解一些当时还没有其他人理解的东西……
查德·阿塔拉(CHAD ATALLA): 当然……
NEVILLE: …因为它正处于我们对事物认知的最前沿。
标准介绍: 这是 微软研究院播客那里,微软研究人员通过基础科学与技术研究推动进步,探索计算与人工智能的谁、如何以及下一步是什么。
[音乐结束]
CHAD ATALLA: 大家好,欢迎收看。我是Chad Atalla,微软研究院的一名应用科学家。
今天,与我同座的是Jennifer Neville,她是微软研究院的合伙研究经理,也是普渡大学计算机科学与统计系的Samuel D. Conte讲席教授。
她的研究考察用于交互式领域和结构化数据的机器学习与人工智能,探讨AI系统训练所用的数据点如何影响其行为,以及这与用户实际需求之间的契合程度。
在这些研究中,她发表了超过130篇论文,引用次数超过10,000次,并获得了多项荣誉,例如美国国家科学基金会CAREER奖以及入选 IEEE的“10 to Watch”人工智能榜单(在新标签页中打开)以及来自该会议的最佳论文奖 国际数据挖掘会议(在新标签页中打开) 以及 国际学习表征会议.
Jen 的工作最让我惊叹的是她的远见,以及随着 AI 领域的发展始终保持一致的主线思路,我很期待听到更多关于她如何走到今天的经历。
Jen,感谢你参加这次访谈。
JENNIFER NEVILLE: 感谢你们的邀请。
ATALLA: 太好了。我很想了解你是如何走到今天的。让我们把时间拨回很久以前。我小时候想当天体物理学家,但当然,现在我从事的是计算机科学。你是什么时候知道 你 想进入计算机科学领域的?
NEVILLE: 这是个好问题。我……在我成长的过程中,我想做任何事,除了计算机科学,因为我父亲就是干这一行的,而我不想做任何我父亲做过的事。所以我上大学时,先主修了数学,后来又主修了物理,但我真的无法与这些专业产生共鸣。
所以我中途辍学了一段时间,当我重新回到大学时,我改学了认知科学专业,但这个专业对我来说也太过“软”了。其中的数学内容不够多。当时如果有人告诉我:“AI才是你应该做的事情,因为它把认知科学与数学和计算思维结合在了一起”,我想我会省下很多时间,[笑声]但这一切都没有发生。
于是我工作了一段时间。然后当我重新回到学校时,我决定主修计算机科学,因为我想做的是研究如何处理数据、应对数据。就在那时我发现了AI。纯属偶然。我甚至没有意识到它是计算机科学的一部分。
ATALLA: 很棒。进入计算机科学领域并想从事数据或AI的工作是一回事,而想参与这方面的研究则是另一回事。那么,什么样的问题或重大想法激发了你的研究动力?
NEVILLE: 嗯,这其实也是个有趣的故事。我之所以走上研究道路,只是因为我读的计算机科学学位是荣誉项目,而作为荣誉项目的一部分,你 必须 做一个研究项目[笑声]。
ATALLA: 这是强制性的,是的。
NEVILLE: 这是强制性的。 所以当我向教授们询问研究项目应该做什么时,他们实际上说:“嗯, 你 必须自己决定想研究什么主题。”
当时,我对数据感兴趣,也对AI感兴趣,我思考了很多,也做了大量阅读。我最终决定要研究的是如何对相互关联的网络数据进行数据挖掘,所以……当我确定这就是我想研究的问题时,有人把我引荐给了一位特定的教员……
ATALLA: 不错。
NEVILLE: ……他当时刚刚开始在一个新兴领域工作,那个领域叫做统计关系学习。我们在那个领域完成了我的项目,我在一个研讨会上发表了一篇论文,然后我算是被吸引住了。
ATALLA: 好的,嗯。
NEVILLE: 所以我原本没打算继续读研究生,但那段经历……
ATALLA: 嗯。
NEVILLE: ……让我想要继续读研究生并坚持下去。
ATALLA: 不错。你觉得是什么吸引了你?是做研究的那种兴奋感吗?还是会议的氛围以及学术出版的样子?
NEVILLE: 真的是做研究的兴奋感和过程。那是一个漫长的项目。有一段时间我感觉自己在原地打转。事情没有进展。我会有点沮丧。但我的导师总是给予支持和鼓励,说:“不,继续做下去。我们正在学到一些东西。”然后,我们就到了一个…… 做了 学到一些东西,而那种情感上的激动正是真正吸引我的地方。能够去理解一些当时还没有别人理解的东西……
ATALLA: 当然。
内维尔: ……因为它正处于我们对事物认知的前沿,呃,就是这样,它几乎就像一种毒品,对吧?[笑声] 所以正是这种同样的、同样的追逐那种感觉的感觉,让我在研究领域坚持了这么久。
ATALLA: 明白了。好,非常喜欢。是的,你于2021年从学术界加入微软。事实上,你至今仍是教授,并且已经从事教学和指导工作20年了。是什么促使你把部分职业生活转向研究的? 在行业中,您如何描述行业研究与学术研究之间的差异?
NEVILLE: 我的研究大致横跨从理论到应用的整个范畴。当我获得终身教职后进行第一次学术休假时,许多与我处于职业生涯同一阶段的同事去了工业界实验室休假,之后再也没有回到普渡大学。我思考过自己想往哪个方向发展——是更偏理论还是更偏应用——我认为在职业生涯的那个阶段,探索理论方向会更好,因为这样我才更有可能回到普渡大学。
于是我去伯克利的西蒙斯研究所休学术假,那段经历非常理论化。那是一次很棒的经历,但回到学术界的过程也算得上无缝衔接。在我的第二次学术假时,我走了相反的方向,来到 MSR(微软研究院)进行学术假。当然,能够亲眼看到理论中的算法如何在实践中、在真实系统里、与真实用户和真实数据打交道时“落到实处”,这种体验让人难以回头。所以这就是我至今仍留在这里的原因。
ATALLA: 明白了。
内维尔: 所以我认为学术界和工业界的研究之间的差异取决于……实际上受到你的研究目标指向何处的影响。所以我认为从根本上讲,两者感觉非常相似,你在学术界和工业界会提出的问题差不多,但在工业界,你可以在真实系统、真实数据上进行大规模应用的能力与学术界截然不同;而在学术界,我认为你最终会提出的问题更多是抽象层面的,能够同时涵盖许多不同领域的应用。这也是你能从DARPA(美国国防高级研究计划局)和NSF(美国国家科学基金会)等机构获得资助的方式。
但在工业界,其实更容易直接动手,在真实系统中进行实践。而且你的目标可以说是产品和公司的利益。因此,这或许会改变你要提出或研究的问题类型。所以我觉得这其实很棒……
ATALLA: 好的。
NEVILLE: ……在两个地方都是,对吧?就像,两者之间有很多协同效应,而且我认为有很多机会可以先去工业界再回到学术界,或者先从工业界开始再去学术界。但就目前而言,如果你在做AI系统方面的工作,我认为工业界才是真正应该待的地方。
ATALLA: 明白了。是的。对于现在正在决定职业方向该怎么走的人来说,这或许是有用的建议。
我在Microsoft已经待了六年多一点,其中大部分时间都在从事AI评估工作,当然,这个领域有许多令人生畏的根本性问题和挑战。
我最初接触到你的工作、开始了解你的工作,是因为你的部分工作为其中一些问题提出了一些解决方案,并帮助指出这些问题。我的第一反应是松了一口气:我们有像你这样出色的人在研究这些问题,你会替我们搞定它们。我非常欣赏你在批判AI评估的同时也提供解决方案的这种平衡方式。
但我知道这只是你更广泛研究议程中的一小部分。那么,你会如何描述你在这里所领导团队的当前研究章程呢?
NEVILLE: 我们的团队叫做 AI Interaction and Learning team。我们真正关注的是尝试在这些AI系统于真实工作环境中的行为方面推动前沿。这意味着要研究当前系统性能的边界在哪里,用户在实践中的真实工作流程中如何体验这一点,然后我们如何改进这一点,并推动模型在用户正在处理的这类任务——复杂任务——上的性能。
我们关注评估的原因在于,我们发现机器学习和AI领域的标准评估方式是通过基准测试,而这些基准测试相对于人们在实践中实际使用它们的方式来说相当简单。因此我们发现,你真正需要做的第一件事是问:我们想从这些系统中得到什么?并设计实用的评估来将系统置于那种环境中。也就是说,像多轮行为、协作环境、用户正在执行的长时间跨度任务等等。
而一旦我们能够看到这些评估中出现的性能差距或问题所在,这也就让我们了解在理论上或算法上需要从哪里改进这些系统。
所以我们从评估开始,但最终,我们想做的就是开发更好的算法、模型、估计方法……
ATALLA: 当然。
NEVILLE: ……来推动模型的性能。
ATALLA: 是的,它是通往理解的门户,因此能够推动边界并改进这些、这些系统。
NEVILLE: 是的。
ATALLA: 你提到了多轮交互和协作环境。你最近有几篇论文专门研究了这些内容,比如 LLMs may get lost in multiturn conversations 或 它们在这些智能体知识工作场景中可能如何损坏文档。你能多讲讲这些具体的研究项目吗?
NEVILLE: 当然。我们……那些是一些例子,在这些例子中,我们必须对如何设置评估有一些创新性的见解,才能真正控制和测试模型在这些场景中的行为。
所以对于多轮对话,我们所做的是采用单轮基准测试——也许我应该先退一步说,我们在实践中观察到的用户的一个特点是,他们常常 无法充分说明 他们想做什么。他们一开始并不知道如何给出一个完整的规范。作为计算机科学家和软件工程师,我们有时会忘记这一点,但普通用户可能无法在第一轮就完整地说明需求。因此,他们会在多轮对话中逐渐弄清楚自己在做什么,并在整个对话过程中不断补充条件和澄清。
所以我们所做的是采用公开的单轮基准数据集,我们把其中完全指明的单条复杂指令改写为由模拟用户的模型在多轮中提供那些澄清,然后研究模型——研究我们现有的所有模型——当任务以这种多轮方式被说明时,它们的表现如何。
我们发现,我们在单轮场景中看到的性能——这性能非常高,因为当然,作为模型构建者我们正是针对这一点进行优化的——在多轮场景中实际上会显著下降。所以这是一个相当令人惊讶的发现,因为之前没有人以那种方式……
ATALLA: 当然。
NEVILLE: ……以那种方式进行过评估。但当我们把这项研究发布出去后,系统的用户们都产生了共鸣,……
ATALLA: 对……是的。
NEVILLE: ……“嗯,这就是我的经历。我早就知道会发生这种情况。我们该怎么解决这个问题呢?”其中……所以我们正在研究强化学习方法,以真正帮助模型在这些环境中更好地学习,从而修复那种行为。
但我们在论文中谈到的一个实用解决方案是,如果你发现模型有点困惑——比如你在多轮对话中指定了某些内容——就直接停止聊天,清除所有内容,返回去,然后根据你已经知道的信息,给它一个完整指定的单轮提示……
ATALLA: 我明白了,是的。
NEVILLE: ……这样它在那种交互中就会有更好的表现。
所以也许这说明了,虽然从根本上说我们是在寻找模型的算法改进,但有时在这些项目中,我们最终会得出一些关于如何的洞见 用户 可以改变自己的行为……
ATALLA: 当然,是的。
NEVILLE: ……从而从模型中获得更好的结果,即使在它们目前的表现水平下……
ATALLA: 是的……
NEVILLE: ……就目前的表现而言。
ATALLA: 是的。我们注意到,你的研究主题之一是如何改进这些系统,使它们更好地与用户真正想要的东西保持一致。你提到了这里的一个案例:“嘿,我们知道用户实际上往往不会在第一轮就完整地说明他们想要什么,而且我们确实有这些漫长的多轮交互。”在这篇论文发表后,他们对这种在多轮对话中迷失方向的挫败感表示了共鸣。
你如何看待理解用户的需求、需要和体验?这又如何与你所说的模拟用户来运行这些更长的多轮评估的工作联系起来?
NEVILLE: 是的,这……能够大规模地看到用户想做什么,以及他们在系统中遇到的各种失败和成功,我认为这是在工业界实验室的优势之一,你能够看到那样大规模的数据。
所以我们与微软内部的许多产品团队合作,大规模分析消费者日志,以找出用户经历的主要失败模式。这就…… 提供 了我们许多工作的洞见或动机。还有很多优秀的产品团队也在分析用户的成功案例,这让你甚至可以向用户推荐……他们在我们现有的系统中能够成功完成哪些类型的任务。
我认为如果你回想一下搜索引擎刚起步的时候,人们必须学习如何与搜索引擎交互……
ATALLA: 当然。
NEVILLE: ……以便有效地获取他们正在寻找的信息。我们现在可能已经忘记了那段经历,因为在所有这些AI系统出现之前,那已经是每个人习以为常的事情了。但现在我认为正在经历一个从搜索引擎向这些基于聊天的系统的转变,我认为用户也需要进行一些学习……
ATALLA: 对,是的。
NEVILLE: ……在这个新环境中。而且我认为分析用户实际行为中成功的方面,是开始推荐的一个很好的方式……
ATALLA: 是的。
NEVILLE: ……并以同样的方式对用户进行辅导或教学。
ATALLA: 我很喜欢你指出了查看真实数据的实用性,但这实际上意味着什么?你们是真的在查看真实数据吗?隐私在这里是如何处理的?你们有哪些负责任地利用现实数据的流程?
NEVILLE: 哦,对,这是个好问题,谢谢你提出来。我们实际上并不查看数据。我们是以一种保护隐私的方式在大规模上分析数据,以提取失败或成功的模式。还有很多很多限制,使我们实际上无法亲眼看到数据。我们只能在某种程度上,把处理数据的方法推送到受到严格限制的环境中运行。然后,嗯,然后这些经过隐私保护的高层次洞察,就是之后驱动我们算法工作的东西。
所以澄清一下,我们并不会用你的数据或你的回应来做微调,但你在回应中给出的细节越多——无论是通过捐赠的信息,比如你点踩时给出的描述,还是你与模型进行的聊天互动——这些最终都会被提炼成能够改进模型的东西,而这并不是通过人们真正查看你的操作来实现的。
ATALLA: 你提到了从搜索作为主导模式向多轮聊天交互的转变。但现在我们也看到智能体式的、以及协作式知识工作风格的任务变得更加重要,并且提到你也在这方面做了一些工作。还有什么其他有趣的收获想与我们的听众分享吗?
NEVILLE: 是的。我们既有一些理论工作,试图刻画哪些类型的任务对于 transformer 来说在模型内部从根本上难以计算,也有更多 基于模拟的工作,我们研究在长时程工作流中执行的复杂任务,比如你拿到文档,然后对这些文档进行反复的编辑。
在这些环境中,模型或甚至智能体所面临任务的复杂性在于,不仅要追踪用户在这项长时程工作活动中打算做什么,还要了解当前的状态是什么,哪些信息是相关的,哪些是不相关的,情况发生了哪些变化。这些是智能体开始变得相当擅长的方面,但有特定类型的任务比其他任务更容易。
ATALLA: 好的。
NEVILLE: 因此我们研究的一个问题是,哪些类型的任务对当前的智能体来说复杂性变得过高,以及如何解决这个问题。智能体使用工具的最佳方式是什么?引入人类参与是否更好?我们如何知道事情已经出了差错?所以让……甚至让智能体自己进行监督,评估它们是否正确回答了问题,或者是否应该回滚到之前的状态。我认为这些都是目前悬而未决的问题。
但我们有……我们确实有一些工作表明, 再次地 随着我们在这些工作流程中走得越来越长,会出现令人惊讶的失败,因为错误如果未被捕获,就会不断累积……
ATALLA: 是的。
NEVILLE: … 并开始在它们必须通过反复交互执行任务时,进一步使AI更加困惑。
ATALLA: 是的,“令人惊讶的失败”这个说法让我很感兴趣。它暗示了一种预期,即“嘿,这个应该表现得更好,而我很惊讶它以这种特定方式失败了。”你是否觉得你看到更多这类令人惊讶的错误,还是说很多错误是意料之中的,你能理解它会以这样或那样的方式失败?
NEVILLE: 是的,我认为那里,我认为确实存在意料之中的失败,因为那些…… 嗯,当然,随着我们努力把系统做得越来越好,意料之中的失败会更少。
ATALLA: 没错。如果我们能够预料到它们,我们就能修复它们。
NEVILLE: 正是如此。但像幻觉这类失败是社区长期以来已经充分刻画的一类失败,并且有专门的基准测试和方法来尝试减少这些问题。
我认为我的团队最终寻找的是那些几乎表现为令人惊讶的失败的问题,因为它们不是传统的失败,而且往往难以被隔离并证明其正在发生,因为它们非常微妙,不会表现为比如对一个数学问题的错误答案,或者一份法律意见书中幻觉出的案例,而是文档中这种微妙的语义内容丢失。我认为,回顾我们与团队一起研究的内容,我们有一种假设,即我们作为人类认为对我们来说难的事情,对模型来说也会是难的事情。而事实上,情况往往并非如此,因为我们必须思考对transformers来说真正难以计算的是什么,对它们的检索系统来说难以从……
ATALLA: 对。
NEVILLE: ……底层内容中检索到的是什么。
所以我认为“令人惊讶”的来源是那些我们作为人类可能认为非常简单的事情, 或者 我们认为如果以前有一个任务被正确完成,我们就会认为现在再次执行同样的任务也应该被可靠地正确完成。但事实上,对于LLM来说情况未必如此。所以我认为,这种令人惊讶悄悄地源于我们自己基于人类智能对什么难、什么容易的预期。
ATALLA: 是的。那么,在用户基于对人类智能的反思而产生的对这些系统擅长什么的困惑,以及外界存在的各种炒作和营销之间,你希望真实用户从中得到什么启示?或者根据你在这里的工作,你会如何告诫他们思考对AI系统的能力和预期?他们如何才能穿过那些噪音,建立更好的预期?
NEVILLE: 哦,这是个好问题。我认为,我认为当前的AI系统具备很多能力,这些能力现在就会对工作环境中的人们非常有用。我认为我们这项工作带来的启示是,你不应该期望它们在所有方面都100%成功。你应该核查你得到的答案。而如果你得到一个你认为不正确的答案,你不一定要假定模型完全做不到这一点。但你可以考虑再问一次,或者换一种方式提问,下次你可能会得到更好的答案。
这很难融入我们目前的工作方式,因为我认为你不能……它们还没有准备好让事情100%托付给它们。但如果你能弄清楚如何在带有监督和验证的工作流程中与它们一起使用,我认为它们可以非常有用地帮助你提高生产力和完成工作的速度。
所以……也许另外要说的是,你知道,请多包容我们,因为[笑声]我们正在开发这些系统, 实时地 随着它们被发布。因此你的使用实际上帮助我们推动模型的边界,因为它为我们提供了哪些事情能做、哪些事情不能做的示例。
也许我还想说的是,用户可能没有理解的一点是,在过去,对于基于搜索的系统或推荐系统,我们作为用户能够给出的反馈只是一种点赞、点踩的形式。但现在我们处于一个可以给出高得多的精细度反馈的环境中,这种反馈对于下游改进模型可能超级有用。
所以,如果你在某种与模型对话的聊天环境中工作,要知道如果出了问题,说明问题是如何出现的实际上是有帮助的,也就是说,在你的文字交互或语音交互中,确切地传达哪里出了错、你期望得到什么、以及你实际得到了什么。因为这些信息会在我们更新模型时被使用。所以作为用户,你可以把自己的角色理解为:训练模型去做你本来希望它做、但它目前还做不到的事情。
ATALLA: 太棒了。那里有个很有意思的行动号召。
我也很好奇。你提到了我们目前所处的 Transformer 范式,用于这类大型语言系统。你认为大型 AI 系统的科学下一步会走向何方? 总体而言, 也许这是个很难回答的问题,但至少就你的兴趣和研究方向而言,你认为这些系统的科学接下来会走向何方?
内维尔: 这……这是个,这是个大问题。[笑声] 我认为我们……研究界正在同时努力弄清楚 transformer 架构是否是应该使用的正确底层模型,因为 transformer 在计算方式上存在某些已知的局限性。这些局限性中的许多可以通过模型外围的封装来解决——也就是我们目前围绕模型构建的智能体框架——以及在后端进行的推理。
所以我认为一个悬而未决的问题是,通过这种围绕它的包装层基础,我们能在多大程度上应对transformer架构的局限性,又有哪些问题需要通过一种根本不同的……来解决
ATALLA: 好的。
内维尔: ……架构基础?我认为我们将看到各类替代架构和模型的快速发展,以及围绕现有模型的复杂包装层。
我认为,在下一代工作中,我们将不得不专注于与模型进行更长周期的交互,并让模型以一种比现在具体得多的方式理解它们所处的世界。但我认为我对目前正在进行的研究非常乐观。我相信我们能够在这方面取得成功。
也许从我刚开始说起,我的第一份实习是在2000年的AT&T Labs。我非常清楚地记得,实习期间吃午饭时我坐在那里玩 去 并谈论我们如何能让AI模型玩这个游戏,以及它为什么比国际象棋更难,我们又能做些什么。
而且,我当时正在学习下 围棋 那时。而且我在9×9的棋盘上学习。我不知道你是否学过下 围棋, …
ATALLA: 我没学过。
NEVILLE: ……但你不会直接在大棋盘上学下棋……
ATALLA: 哇。
NEVILLE: ……因为那对人类来说都太难了,对吧。所以你要从9×9的棋盘开始。
我当时在观察自己如何学习下棋,并思考算法会如何学习下棋。在做这些的时候,我们还在猜测AI需要多久才能做到这一点。现在回想起来很有意思,因为在AT&T实验室,机器学习和AI研究领域的很多杰出人物都在那里。有人说:“哦,要做到这个需要50年。”也有人说100年。但当然,现在这 已经是一个被解决的问题(在新标签页中打开).
ATALLA: 是的。
NEVILLE: 所以展望未来,作为研究者,我可能会有一些想法,因为我们很难突破目前所见的行为边界,人们往往会想:“哦,这需要10年”,或者“这需要25年”。
但我认为,考虑到研究的速度、在这一领域从事研究的人数以及这些模型运行的规模,我认为这一切实际上会比我作为2000年那个AI新学生时想象的要快得多。所以……
ATALLA: 哇。本着这种精神,回顾2000年,让我们想象现在跳到20年后的未来,或者只跳10年,因为事情进展得太快了。
NEVILLE: [笑] 是的。
ATALLA: 你希望在这个领域的研究中留下什么样的印记?
NEVILLE: 我认为,贯穿我研究生涯的共同主线是思考复杂系统,以及如何让AI和机器学习在这些复杂系统中发挥作用。所以——即使现在,我们关注的就是协作,我们在思考多人类、多AI的交互。我认为……如果真的从科幻式的结果来看,我认为如果我们在工作环境中开始看到人类和AI组成的组织在团队中共同工作、完成事情并进行创新,并且我们能让这一切正确运转,那我就会觉得我的研究是成功的。
ATALLA: 太棒了。那么,在结束之际,我觉得做一个快问快答会很有趣,也就是说,快速提问、快速低风险回答,想到什么就说什么。可以吗?
NEVILLE: 当然。
ATALLA: 太好了。有什么建议让你印象深刻或改变了你的看法?
NEVILLE: 呃,好的。不过你说了要简短回答。[笑]
当我刚开始学习计算机科学的时候,我,呃,实际上, Doina Precup(在新标签页中打开) 是我第一门计算机科学课的助教,当时我有点不知所措,觉得好像……其他所有人都懂一切,而我什么都不懂,她对我说,你知道,不要、不要害怕提问,因为人们可能看起来知道是怎么回事,但实际上他们并不知道是怎么回事,而且他们其实会非常感激你有勇气提问,因为他们很可能也在想同样的事情。而且,如果你、如果你 会 提出问题,这对你和他们都有帮助。
所以在我的职业生涯中我一直把这一点记在心里。你知道,这很难,你可能会害怕,觉得提问会显得自己很蠢。但毫无疑问,在这一路上,每当我产生这种恐惧感……但还是有勇气提出问题时,我确实发现人们非常感激。而且,你知道,事后人们会说,“哦,我也在想同样的事情。你问了那个问题我真是太高兴了。”所以,勇敢地去提问吧。
ATALLA: 太好了。你从惨痛教训中学到的一课是什么?
NEVILLE: 看数据。[笑声] 看数据。
在机器学习中我们有一种倾向——这也适用于基准测试。我们有一个测试集。我们运行我们的模型。我们训练它。我们把它应用到这个测试集上。我们通常会得到一个数字,那是我们试图推高的指标。所以我们认为如果数字在上升,我们就做得很好。而如果数字没有变动,我们就想,“哦,那么这个问题太难了。”
但我已经多次惨痛地学到,当事情不顺利的时候,如果你花时间去看数据,你可能会发现数据里有错误。数据并不是你所期望的样子。数据与你训练模型所用的分布不同。所以任何时候……我想这也许让我成了一个数据人。[笑声] 但往往当事情的表现不符合我们的预期时,我们就去查看数据,试图弄明白。
ATALLA: 是的。有道理。这是个好教训。也是个难以做到的教训。
NEVILLE: [笑] 很难记住。
ATALLA: 是的。
NEVILLE: 而且……也许这本身就是很重要的一点,即使我已经学到了这个教训,……
ATALLA: 当然。
NEVILLE: ……我在整个职业生涯中 重新学习 这个教训至少已有五六次了。
ATALLA: 是的。那么,反过来说,你最引以为豪的成就是什么?
NEVILLE: 我想我会说,是我能够在获得终身教职的同时抚养一个幼儿。
ATALLA: 哇,是的。
NEVILLE: 我在开始之前刚生了儿子——我丈夫也是教职员工——就是在我们开始教职之前。所以我觉得,我不仅成功拿到了终身教职,儿子健康快乐,而且我的婚姻也维持住了[笑声]……
ATALLA: 是啊,确实。
NEVILLE: ……这可能就是我最大的成就了,呃,是啊……
ATALLA: 很大的成就,是的。最后一个问题。艺术或大自然对你的工作有什么影响?
NEVILLE: 嗯,我不确定这算不算大自然,但作为一个人工智能领域的人,我一直观察到的一点是,孩子、人、动物、昆虫似乎是如何了解世界和环境并改变自己的行为的。我完全承认,作为一个有幼儿的家长,我非常书呆子气。我会拿机器学习中的想法,试着看看能不能帮助我儿子学得更好。
比如,当他还是婴儿时学着翻身,我会说,我会说:“好,让我给你一个正面的训练样本。[笑声] 比如,来,把腿这样动,”然后……
ATALLA: 是的,是的。
NEVILLE: ……然后观察这对他学习的效果,同时也观察他学习的过程,然后思考如何把这一点融入到我们开发的算法和模型中。这可能是我职业生涯中不断回归思考的最大互动。
ATALLA: 这真美。是啊。
NEVILLE: 谢谢。
ATALLA: 那么,Jen,感谢你分享你的故事和见解。很高兴你能来到这里。
也感谢各位观众收听。如果你想了解更多我在微软的同事们的工作,请访问 Microsoft Research 页面: aka.ms/research 或者[音乐]收听本播客的其他节目。谢谢。
[音乐结束]
了解更多:
- AI 交互与学习
主页 - LLMs Corrupt Your Documents When You Delegate
Publication | 2026年4月 - 关于我们近期在 AI 委托与长程可靠性方面研究的进一步说明
- Microsoft Research 博客 | 2026年5月
- LLMs Get Lost In Multi-Turn Conversation
发表时间 | 2025年5月
该文章 What AI gets wrong and what failure teaches us 首发于 Microsoft Research.
