“惊人。”“压倒性。”“前所未有。”“超现实。”“纯粹的疯狂。”
这些是三十多位数学家在与交谈时使用的部分描述。 The Verge 因为他们试图理解 数学成果的洪流 OpenAI 本周突然在数学领域投下重磅炸弹。在对这场倾泻般成果之规模庞大所引发的敬畏、兴奋与不确定之中,还深藏着一层对其全部意义以及接下来会发生什么的深切焦虑。尽管研究者的反应各不相同,但他们一致认为,仅仅是理解 OpenAI 所发布的内容就可能需要数年时间,更遑论弄清数学家们自己在这个正在发生变化的领域中如今处于什么位置。许多人担心 OpenAI 不会等待那么久才会继续推进——或者发布更多成果。
OpenAI 总共发布了近 400 个 AI 生成的研究结果。这些结果分布在 700 多份手稿中,涵盖了数学学科的广泛领域,包括组合数学、几何学的多个分支、数论、理论计算机科学、代数、拓扑学、概率论与统计力学以及数学物理。该收藏规模如此庞大,以至于 OpenAI 觉得有必要 发布指南 关于如何在这个庞大的 GitHub 仓库中进行导航。
相关
大量工作使得仅仅对该公司究竟发布了什么进行初步评估都变得困难。在发布后的数小时乃至数天里,大多数数学家 The Verge 与我交谈的受访者表示,他们仍在努力消化所有内容;有几位说,仅仅浏览这份大约40页的目录和摘要就花了他们近一个小时。康涅狄格大学数学教授Álvaro Lozano-Robledo说:“光是看完整个摘要列表就让人应接不暇。”
数百份手稿中散布着用Lean编写的形式化证明,Lean是一种编程语言和证明助手,可对结果进行计算验证。这些形式化证明已被证明对于评估OpenAI此前的一些数学主张非常有用,让研究人员即使不完全理解其背后的论证,也能确信该主张在逻辑上是正确的。
“如果这些AI现在就消失,就好像曾有外星人来到地球然后又离开了一样,我们在接下来的10年里都会研究这件事,试图弄清一切。”
但每项结果被验证的程度差异巨大。在 GitHub 上,OpenAI 承认 研究结果“处于不同的验证阶段”,并且“许多但并非所有的手稿都已正式化”。截至撰写时,该合集中心怀正式描述的手稿不到一半。OpenAI表示,719份手稿中仅有300项顶层结果已完成正式化,约为42%,并表示“随着获得更多正式化结果,我们将更新该代码库”。
几位数学家向 The Verge 关于形式化不足的问题,尤其是考虑到结果数量庞大,并强调即使有Lean代码伴随结果,评估也并非瞬时完成。研究人员必须检查形式化是否真正证明了结果所声称的内容,这又是一个耗时的过程,而且几位深入研究论文的人士表示,即使在提供了计算机可验证证明的情况下,其质量也不一致,且所验证的命题并不总是能清晰地对应随附手稿中的结论。
伦敦帝国理工学院的数学教授Kevin Buzzard表示,他在自己的研究领域——代数数论——中发现大量定理,其中只有大约六个立刻“脱颖而出”。这些定理中似乎很少有(甚至没有)在Lean中得到正式验证。“因此,我要么必须阅读可能不正确的低质内容,要么等待其他人也去阅读,要么等待有人将其形式化,然后我才能确定这些结果是否正确。”Buzzard的担忧得到了许多其他研究人员的共鸣。
巴扎德远非唯一一个担心AI“垃圾内容”的人。这个词是对日益频繁出现在网上——以及该 现实世界 ——包括 学术论文。与其他领域一样,数学家们告诉 The Verge 近年来,他们发现使用 ChatGPT 和 Claude 等工具生成的此类材料大幅增加。其中很多内容令人困惑、难以阅读,并且几乎显示不出对相关主题的理解;在引用致谢其他研究者方面尤其粗劣。
OpenAI 之前的数学解答 是 广泛 批评 被专家批评其草率的本性,尤其是它们的 糟糕或不存在的归因。在与 The Verge 在发布之前,几位研究人员已经开始把即将涌来的大量论文称为“垃圾末日”(slopocalypse),或类似的主题变体。
人们所担心的“垃圾大崩溃”(slopocalypse)是否真的出现了,目前还很难说,这主要是因为发布材料的数量令人眼花缭乱。早期迹象表明,OpenAI 这次对论文更加小心了,或者至少对其中一部分论文是如此。几位数学家告诉 The Verge 他们表示,自己的第一印象远好于预期,不过他们也承认,考虑到该公司以往粗制滥造的出版物,这个标准本来就并不高。
“这是一场大混乱。它可能导致学术文化的巨大崩溃,并直接摧毁大部分院系。这是一个社会问题,而AI实验室似乎完全无视这一问题。”
但更好并不一定意味着好,更谈不上达到对提出如此重大论断的学术工作所通常要求的标准。由于OpenAI的许多论断缺乏形式化验证,随附论文的质量就显得尤为重要;这些论文是数学家们确认、理解、审视这些结果并将其置于背景中的主要途径。
即使在最好的情况下,撰写严谨的数学论文也是一项艰难的工作。要在这种规模上进行更是艰巨的任务。OpenAI 的模型正以令人目眩的速度、在广泛的专业领域产出数学成果,远远超出其人类员工的能力。该公司根本没有足够广泛的专业知识或资源来对其处于数学前沿的发现进行妥善审查。研究人员告诉 The Verge 它所显示的内容。
许多人描述说,这些论文难以理解,有时实际上根本无法读懂。“我所最熟悉的那篇问题的写作,快速读一遍后几乎毫无意义,”布朗大学的数学教授 Brendan Hassett 告诉 The Verge。“如果这是由人写的,我就不会再花时间去理解它了。当然,这样还剩下721篇其他预印本!”(Hassett是在OpenAI撤回三篇论文之前说这番话的)。
一些研究人员表示 The Verge 他们或其同事注意到的几篇论文似乎涉及其他数学家已经走过的领域,不过在他们有机会仔细审阅这些材料之前,他们不愿公开这么说。另一些人则指出这项工作异常简短,通常需要在数百页篇幅中展开的结果被压缩到几十页甚至更少。
相关内容
澳大利亚悉尼大学数学教授 Nalini Joshi 表示,快速检索这批发布内容后发现与她自己的研究几乎没有什么重合之处,但她指出,她查阅的部分论文“参考文献很短”。鉴于此前针对 OpenAI 署名做法的批评 ,她说她“担心论文中的署名可能没有呈现完整的情况。”
尽管存在种种粗制滥造和不确定性,但总体共识是,这批发布内容中确实包含一些真正令人印象深刻的工作。
许多研究人员在强调评估材料数量之困难——以及妥善验证结果的必要性——的同时 The Verge 与之交流过的人士表示,这项工作似乎质量非常高,尽管在呈现方式上存在不足。他们说,在AI出现之前的世界,OpenAI的许多成果显然足以在顶级期刊上发表,并足以为其作者赢得学术生涯。有少数几项成果被描述为那种能让数学家成为菲尔兹奖(Fields Medal)有力竞争者的工作,菲尔兹奖是该学科的最高荣誉之一。
“我要么只能去阅读可能有误的粗制滥造之作,要么等着其他人去读,要么等着有人将其正式发表后,我才能确定这些结果是否正确。”
斯坦福大学数学家 Jared Duker Lichtman 说,有"几十"项成果可以归入这一类别,包括在黎曼猜想上的进展、霍奇猜想的一个特例,以及四维挂谷猜想的一个解。这些都是数学中的重大问题。黎曼——可以说是 最臭名昭著的未解难题 整个学科领域——而Hodge都位列七大著名千禧年大奖 问题。它们分别涉及素数的分布,以及(非常粗略地说)如何在更简单的构建模块的意义上理解复杂几何形状。而挂谷问题则大致问的是,需要多小的空间才能 旋转一根针或铅笔 朝各个方向。Kakeya 问题三维版本的证明是纽约大学数学家王虹所取得的成就之一,她曾被 被授予 以及今年早些时候获得的菲尔兹奖。
数学家Scott Armstrong说:“这些并不是无人听闻的无聊问题。其中许多都是非常著名的问题,许多人已经为之努力了几十年。”
当尘埃渐渐落定,数学家们发现自己面对的是一片骤然改变的环境。他们中的许多人刚刚亲眼目睹多年的工作和精心制定的研究计划在一瞬间化为乌有,或者知道有同行经历了这样的遭遇。在整个领域,无论人们的反应中掺杂着兴奋、恐惧、绝望,还是介于两者之间的某种情绪,普遍弥漫着一种深深的迷失感。
到了第二天早上,那种情绪并没有太大变化。阿姆斯特朗在巴黎街头行走时通过电话表示,他想象如果索邦大学没有因持续的学生抗议而关闭,他的同事们围在平日那台咖啡机旁,气氛本会相当“庄重”。
相关
在苏格兰,圣安德鲁斯大学数学教授Colva Roney-Dougal描述了同事和学生中类似的悲观氛围。她说,这场洪流感觉有些“可怕”,但在数周的不确定之后,它的到来也带来了一些宽慰。“我有一大堆朋友和同事的科研经费申请就这样被抹掉了。”她说。
“我有一大堆朋友和同事的科研经费申请就这样被抹掉了。”
Armstrong说,他知道有一个研究小组的整个研究项目几乎因这次发布而被“抹掉”。曾在 OpenAI早前围绕Navier-Stokes问题的争端中心的纽约大学数学家Tristan Buckmaster则表示,他已经听说过“三个人整个研究项目被摧毁”。
类似的故事在 The Verge与数学家的交谈中反复出现,尽管这种冲击高度集中在该领域的某些方向。苏格兰赫瑞-瓦特大学数学教授Francesco Fournier-Facio表示,概率论、组合数学和理论计算机科学领域的研究者似乎“特别震惊”,并补充说,他所从事的群论领域的一些分支已被“推平”。
Armstrong和其他研究者表示,某些领域似乎是以近乎军事级的精度被瞄准的。“确实存在一些目标,”Armstrong说。他特别点名了Wang今年获得菲尔兹奖的那个领域的工作,以及几个千禧年大奖难题。他说,数学物理领域的一批研究成果清楚地表明,OpenAI正在攻坚 Yang-Mills理论 ——支撑现代粒子物理大部分内容的数学框架——以及其未解决的“质量间隙”问题,这是七个大奖难题之一。
在其他地方,研究人员对自己未受多少波及的工作表现出一种如释重负的惊讶。Roney-Dougal 表示,她自己所在的领域——主要围绕群论——似乎相对完好地躲过了这次风波。她开玩笑说,幸运的是她研究的是一个“非常不时髦的领域”,不过她后来发消息说,在发现自己被其中一篇论文引用后,她感到“不太确定”。
Joshi 同样发现自己的工作与其重叠很少,她的研究主要集中在可积系统——能够被精确求解的复杂系统。她推测,这可能是因为她的领域较少受长期存在的、正式陈述的猜想和定义驱动,而更多受随物理学进展而起伏的问题驱动。
截至10月8日,该记录已列出大量更正,包括对十几份以上手稿的修订,以及因一个据称使论证失效的“符号错误”而撤下的三篇论文。
无论他们自己的工作是否受到直接影响,大多数与我们 The Verge 交谈的数学家都共同感到,这个领域已经跨过了某种门槛,不再是一天之前的样子了。高等研究院的研究员 Constantin Kogler 称其为“数学史上最重要的单一时刻”,而伦敦数学科学研究所的研究员 Yang-Hui He 则回溯数千年,将今年 AI 驱动的进展与欧几里得《 Elements》(《几何原本》)的出版相提并论,后者是该学科最具影响力的著作之一。
很少有研究者的评价如此宏大,但大家普遍认同数学正在快速变化——数学家也必须随之改变。
OpenAI 知道此次发布将具有颠覆性,并已做出一些努力来减轻冲击并与数学界互动。在今年早些时候与研究人员发生数次不愉快交锋之后,该公司转而寻求数学家本身的帮助, 与 新成立的数学与人工智能咨询小组(AGMAI)合作,商讨如何负责任地发布这些成果。
AGMAI 已经 阐明 了它认为负责任的互动应当是什么样的。AI 实验室理想情况下应发布“人类能够理解”的论文,或提供必要的“支持,以开展额外所需的数学活动,使人类能够理解并消化其 AI 生成的数学成果,并识别其可能的应用”。他们表示,在可能的情况下,证明应当被形式化,公司应公开其用于创建证明的模型和提示词。该小组还敦促 AI 实验室停止将数学发布视为“推广其模型的营销工具”,并“停止在专有模型上测试高级数学问题”,因为这些模型是更广泛科学界无法接触到的。
“这些并不是那种从没人听说过的无聊问题。其中许多是非常著名的问题,几十年来很多人都在尝试解决。”
OpenAI 采纳了该小组的部分建议。它表示将围绕其在数学方面的工作资助一系列研讨会和会议,以帮助学界消化和理解其成果,但未提供这些活动可能的形式或时间的任何细节。该公司还披露了比以往发布时多得多的信息——研究人员再次表示这是一个很低的门槛——包括其模型尝试了超过 4,000 道问题,以及一个典型结果使用了约三小时的 ChatGPT Pro 思考算力。它还实施了“论文修订与引用协议”,并在 GitHub 上表示将“保留该集合的公开发布历史”。截至10月8日,该记录已列出大量更正,包括对十几份以上手稿的修订,以及因一个据称使论证失效的“符号错误”而撤下的三篇论文。OpenAI 没有在记录中回应 The Verge索取更多细节的请求。
这一变化解决了与数学家之间摩擦的一个关键来源,其中一些人在谈及该公司发布的主张时带着一种“偏执”情绪。该公司有一项 习惯 ,即在被批评后悄悄修改新闻稿和论文,而不清楚披露这些更改。
但 OpenAI 并未采纳该小组的所有建议——包括其中一些最重要的建议。它没有透露发布背后的模型,也没有披露所使用的提示词或模型尝试的全部问题集。OpenAI 似乎也承认其形式化工作有所欠缺——它表示会随着获得更多而补充——并承认论文质量欠佳,称“在未来的发布中,我们致力于通过引用、数学阐述以及结果的呈现来进一步提升论文质量,以便更好地理解”。
“对我最了解的那个问题的行文,快速读了一遍后几乎看不懂。”
与我们 The Verge 交谈的研究人员质问 OpenAI 为什么不能提高这些论文的质量,并对它似乎不屑于提前形式化——甚至检查(就撤回的论文而言)许多结果——表示失望。诸如所使用的提示词之类的信息,本可以极大减轻许多人所感受到的、评估该公司突然抛给他们的海量材料的负担。
最重要的是,该公司表示没有停止在数学问题上测试其模型的计划,甚至暗示它认为这样做是必要的。“我们希望以前沿的能力直接赋能科学家,并正在努力以负责任的方式发布产生这些结果的模型,”该公司在宣布其最新成果时表示。“这就是为什么继续在数学和其他科学领域评估我们内部的尖端模型非常重要,这样我们才能加速开发推动这些领域发展的工具。”
在OpenAI公布其结果后,AGMAI 将 这一发布描述为“第一步”,并重申了公平获取算力和研究工具的呼吁。更根本的是,该组织认为“数学研究的未来不能仅仅由理解AI实验室产生的结果构成”。
尽管OpenAI声称解决了数百个长期存在的问题,数学家们表示,仍有大量工作要做。许多人估计,要消化该公司刚刚发布的一切,可能需要整个学界花上数年时间。
Armstrong将如此多新数学成果的突然到来比作一次短暂的外星造访之后可能出现的骚动。“如果AI现在消失,就好像有外星人来到地球然后又离开了,我们将在接下来的10年里研究这些内容,试图理解所有东西。”
其中很多工作本身就令人兴奋。研究人员将不得不填补空白、提取有用的思想和联系,并将解答置于更广泛的数学背景之中,这些通常都是与为人类产出解答相伴而行的工作。“对于其中许多结果,相关专家非常关心这些解答,我相信他们将能够消化它们并向更广阔的世界展示,”Lichtman说。他认为,随着AI改变这些领域,涉及解释、验证和阐释结果的工作需要受到更多重视。“作为一个社会,我们应该更多地奖励这些消化工作。”
同样,还有很多数学工作留给人类去做。据Lichtman所知,所有这些结果尽管“令人惊叹”,都是“从现有的方法和技术中”产生的。它们填补了已知数学图景的某些部分,而不是创造全新的图景。“事实证明,还有比专家们以前所知道的更多的空间可以填补!”Lozano-Robledo也表达了同样的观点:“他们都在以非常巧妙的方式使用现有技术。”
而且现有的地图远非极限。“数学研究本质上是无限的,”Lozano-Robledo说。“研究会继续下去。”伦敦研究所的He说,他特别期待接下来会出现什么,并推测研究人员最终可能会创造出新的思想,“甚至可能是数学的新领域”。
这些公司似乎准备立刻转向下一步,早在学界有任何合理机会消化它们所产出的内容之前。
很少有数学家 The Verge 采访到的对象在原则上反对AI产生新的数学成果。事实上,许多人对此表示欢迎,并在不同程度上表示他们本身就是AI工具的热心用户。大部分不安指向的是那些构建这些工具的AI公司进入他们领域的方式。
看看OpenAI和其他AI实验室发布的数学成果,你很容易认为研究数学本质上就是对照清单核对问题。AI实验室揭晓结果的方式强化了这一印象:一份华丽的公告、一份初步报告,其余的则扔给数学家去弄清楚并进行阐释。多位研究人员告诉 The Verge ,这些公司似乎准备立刻转向下一步,早在学界有任何合理机会消化它们所产出的内容之前。
研究人员形容这是对数学研究实际运作方式的一种贫乏理解。解答固然重要,但在寻找解答的过程中发生的一切同样重要:发展思想、建立联系、发现新问题或开辟其他研究途径。当像OpenAI这样的公司只是找到答案而不做任何周边工作时,数学家们表示,做这些工作的负担就落回到了整个学界身上。
“有新结果当然很好,但这个规模是另一个层级的,”波兰波兹南亚当·密茨凯维奇大学的数学家Bartosz Naskręcki说。“这是一团大乱麻,”他说。“它可能导致学术文化的巨大崩溃,甚至直接杀死大部分院系。这是一个社会问题,而AI实验室似乎完全忽视了这个问题。”
需要数年才能理解的不仅仅是数学本身。研究人员也在努力理解这场剧变对他们意味着什么。许多人形容,当数学家们试图弄清自己在快速变化的领域中处于什么位置时,一种黯淡的、近乎生存危机的情绪笼罩着整个学界。而他们可能没有多少时间来想明白这一点。
数学家之间已经在流传关于OpenAI进一步发布的传言,而该公司没有回应 The Verge关于是否计划发布更多成果的提问。
Roney-Dougal说她害怕再次出现这样一批成果——或者Anthropic或另一个AI实验室加入这场角逐的前景。
这场冲击对博士生、初级研究员以及其他没有永久教职的人打击尤其严重。OpenAI 的模型正在攻克的那类未决问题,可能是学位论文、经费申请、求职申请以及多年规划研究的基石,而这些都只是学术生涯的重要组成部分。几位研究员描述了一种日益蔓延的焦虑:他们赖以建立职业的成果可能突然成为下一个目标,而 AI 模型在关闭其他方向的同时,几乎不产生未来的研究线索。“对于经费即将耗尽或正在找工作的人来说,这具有极大的破坏性,”正在加入法国国家科学研究中心(CNRS)的瑞士苏黎世联邦理工学院数学家 Simon Machado 说。
“数学研究本质上是无穷的。研究会继续下去。”
士气可能格外低落,因为一切都让人觉得没有喘息之机。OpenAI 的成果以越来越大的浪潮到来,其间几乎没有停顿,而且该公司频繁暗示还有更多成果在路上。“你会觉得他们其实并不在意这些个别结果,”Roney-Dougal 说。“这种感觉真的很糟糕。”
数学家们几乎还没时间消化一组结果,下一组更大的结果就又被抛了出来。“两个月后还会有什么东西把这一切都掀翻,”Armstrong 说。“就像是一场越来越大的炸弹的连续轰炸。”
Armstrong 说,他自认为是数学家中对 AI 最热情、最乐观的人之一。他在自己的研究中使用这项技术,并相信它有巨大潜力。但即便是他,也日益感到不安。“晚上有点难以入睡,”他坦承。
当被问及接下来打算做什么时,Armstrong 并不那么确定。他仍在巴黎的街道上走着去吃午饭,说他目前的首要任务是完成他一直在做的一些工作——有时借助 OpenAI 的 Codex——“赶在 OpenAI 抢在我们前面之前”。
除此之外,就连这位自称 AI 乐观派的人也不确定,并质疑自己在数学领域还能有什么样的未来。他尤其担心该领域的年轻研究员。“接下来几年,数学会非常奇怪,”他说。
关注此报道的主题和作者, 以便在您的个性化首页信息流中看到更多类似内容并接收邮件更新。