Andrej Karpathy · X

重新翻出这条四月的推文,因为这种对 LLM 能力共同认知的差距正在*扩大*。现在已不再是“两个群体各说各话……

Karpathy称对LLM能力的共同认知差距正在扩大,并以粗略估算描绘一个漏斗:约6B人几乎未接触LLM,约5,000人可内部使用前沿系统。这些数字属个人估算,未经独立核实。

重新翻出这条四月的推文,因为这种对 LLM 能力共同认知的差距正在*扩大*。现在已不再是“两个群体各说各话”,而更像一个陡峭的漏斗。

- 粗略估算,大约有 6B 人(约占人口的 75%)几乎没有接触过 LLM。
- 大约 1-2B 人(约 20%)是免费版 ChatGPT 类产品的偶尔使用者。这群人看到的是憨憨的聊天机器人,把它们当作更好用的 Google 搜索、写作助手之类。也许某个 agent 会试着帮你订机票。我有一些非科技界的朋友(在我看来很合理地)说他们完全没什么用处。甚至许多数学与代码领域之外的专业人士也属于这一层。例如,高管和许多其他职能的人花大量时间与其他人交谈,所以虽然他们在理智上理解正在发生什么,但仍然是二手的、有点抽象。
- 现在我们说到在数学与代码领域对前沿级 LLM 的专业使用。大约有 20M 人(0.2%)亲眼看到,过去需要数周/数月完成的大型复杂项目现在可以通过一个 prompt 由 agent 完成。构建应用、复制应用、翻译应用、从二进制文件反编译应用……这一切都发生得非常快且非常近——不到 1 年前,我还在手工编写代码,把背下来的计算机代码命令一个字符一个字符地敲进代码编辑器,偶尔按 Tab 键自动补全一小段代码。
- 最后我们说到那约 5,000 人(约 0.00006%),他们能在内部使用前沿级系统。外部世界看到的是预览。它看起来像是数千个 agent 在数周内协作完成软件超大工程:挖掘零日漏洞、以机器速度发起网络攻击与防御、发现新科学、推进数学前沿。这些本来需要业内顶尖专业人士数年的工作。与此同时,人类的审查和理解能力开始落后。例如,人们仍在进行许多个月前 OpenAI-HF 事件的“考古”。数学家们可能还会花一段时间钻研那 722 份关于前沿数学的手稿。

一个只需一段话回答的问题几乎不会给系统带来压力。你需要一个由你真正关心的大型难题组成的储备库。

这个漏斗由多种因素共同驱动:
1. 影响力随雄心、问题规模和时间跨度而扩展。一个只需一段话回答的问题几乎不会给系统带来压力。你需要一个由你真正关心的大型难题组成的储备库。这一方面驱动了漏斗的消费者/专业维度。
2. 系统的锯齿性(我已另行多次写过)。能力峰值出现在数字化的、可验证的且具有经济价值的领域。这是因为 LLM 能力源自以收入潜力驱动的精选环境混合中、基于可验证奖励的强化学习。这一方面主要驱动漏斗的领域(如数学与代码)维度。
3. 访问权限。免费层、付费层、内部。

所以这就是此刻的奇特之处。普通大众大多没有与这些系统互动过。当他们互动过时,它看起来像一个憨憨的聊天机器人。大多数专业人士仍然只看到适度的提升。而一小部分专业人士正在体验曲线走向垂直所带来的眩晕。而这一切都在同时发生。

原始出处

Andrej Karpathy · X

内容说明

原始发布及相关权利归来源方。

机器翻译 · 请以原文为准