
从算盘、齿轮、纸带与芯片走向神经网络和开放的地平线。原创 AI 概念插画,不是历史现场照片。
如果把一把算盘放在今天的电脑旁边,二者似乎没有什么共同语言。一个靠手指拨动珠子,一个能写代码、识别照片,甚至替人操作软件。但它们回答的是同一个问题:脑子里的工作,能不能搬到脑子外面去?
算盘把数的位值放到了器物上。计算机把规则交给机器执行。机器学习再往前走了一步:规则不必全部由人写好,机器可以从例子里学。到了大语言模型和 Agent,人们开始把任务也交出去——不只是问一个答案,而是让它查资料、写程序、改错,直到交出结果。
这条路并不笔直。它走过夸大的承诺、经费退潮和长期停滞,也靠一些不太上镜的工作继续前进:更好的统计方法、更大的数据集、更便宜的芯片、更可靠的软件。今天的突然加速,是这些积累挤到了一起。
本文写于 2026 年 10 月 9 日。前半部分讲已经发生的历史,后半部分展望 AGI 的未来,它的到达日期还没有统一共识。我们会大胆押一个年份,但不会把押注写成事实。
人类先学会把数放在外面
算盘值得成为故事的起点,但不宜被说成“人类最早发明进位制的地方”。古代计数板、算筹和珠算盘属于一大家族,产生和演变也不是同一件事。中国珠算盘大约在公元 1300 年前后逐渐取代算筹。它让个位、十位、百位各有位置,进位不再只靠记忆。这里的意义,是把位值运算做成看得见、摸得着的动作。[1]
二进制解决了另一个问题:如果只用两种状态,能不能表示所有数?莱布尼茨在 1703 年系统阐述了这种算术。后来的电子电路恰好擅长区分两种稳定状态,二进制于是成为现代计算的底座。不过,二进制本身不会思考;它提供的是一种便于机器存储和操作的表示方式。[2]
巴贝奇在 1834 年开始构思分析机,把运算、存储和程序控制放进同一个设计。机器没有在他生前完整建成,想法却留下了。1843 年,阿达·洛夫莱斯发表的注释进一步讨论了机器按步骤处理符号的可能性。机器能处理什么,不只取决于齿轮或电路,也取决于我们能否把问题表达成程序。[3] CHM

计算史分为古代、1703—1956、1957—2017和2022—2026四段;节点依年代排列,间距不代表时间长度。底部虚线区域是2031年的主观押注,观察窗口2028—2035,不是已经发生的事件。图内名称对应下文年表。
| 时间 | 里程碑 | 留下了什么 |
|---|---|---|
| 古代;约 1300 年 | 计数板、算筹与珠算盘 | 计算可以借助外部器物;位值和进位成为可操作的动作。[1] |
| 1703 年 | 莱布尼茨系统阐述二进制 | 用两种符号表达数,为后来的数字电路提供适合的表示方式。[2] |
| 1834 年;1843 年 | 分析机构想;洛夫莱斯注释 | 运算、存储与程序控制开始结合,程序的想象超出单次算术。[3] CHM |
| 1854 年 | 布尔代数 | 逻辑可以用代数表达,后来成为分析数字电路的重要思想工具。[4] |
| 1936 年 | 图灵提出抽象计算模型 | 图灵机把“按规则计算”形式化,也说明了计算存在边界。[5] |
| 1938 年 | Shannon 的开关电路论文 | 布尔逻辑与继电器电路接上了关系。原论文 |
| 1943 年 | McCulloch 与 Pitts 的人工神经元模型 | 神经活动与逻辑运算形成有影响力的数学连接。原论文 |
| 1950 年 | 图灵发表《计算机器与智能》 | 把机器能否思考的问题,转向可观察的交互表现。论文原文 |
| 1955 年;1956 年 | 达特茅斯提案;夏季研究项目 | “人工智能”成为研究计划的名称,随后成为一个领域。[6] |
| 1957 年;1958 年 | FORTRAN;Lisp | 前者推动科学计算,后者成为早期 AI 的重要编程语言。[7][8] |
图灵机不是一台现成的智能电脑。它是一种抽象模型,告诉我们什么叫作遵循有限规则执行计算。图灵在 1936 年的工作,也没有给出“任何问题最终都能算出来”的保证。理解这一点很重要:后来 AI 的每一次成功,都没有取消问题本身的边界。[5]
到了 1950 年代,研究者开始把机器的目标从“算得快”推向“表现得像有智能”。达特茅斯提案写于 1955 年,研究项目在 1956 年夏天举行。这里是现代 AI 的重要起点,而不是人类第一次想象人造智能。编程语言随后让研究者不必逐条摆弄底层指令,能够把更多精力放在符号、搜索和推理上。[6][7][8]
机器学会看、听,也学会猜
早期 AI 很相信规则。只要把专家的知识写进去,机器似乎就可以判断疾病、理解句子或控制设备。困难很快暴露:现实里的例外太多,常识又很难写全。规则系统并没有消失,但研究重心逐渐转向一个更务实的办法:给机器足够的例子,让它学会在不确定中判断。
图像识别研究怎样从像素里辨认物体;语音识别研究怎样把声音变成文字;自然语言处理,也就是 NLP,研究怎样处理语言的结构、意义和使用。这些方向长期各走各的路,后来才在深度学习和多模态模型中逐渐汇合。
| 时间 | 里程碑 | 留下了什么 |
|---|---|---|
| 1952 年 | 贝尔实验室 Audrey 数字语音识别系统 | 受限条件下,机器可以从声音里辨认数字;远非今天的自由对话。CHM 历史记录 |
| 1958 年 | Rosenblatt 的感知机论文 | 从训练样本调整参数,成为早期机器学习的重要路线。[10] |
| 1959 年 | Samuel 的跳棋机器学习论文 | 机器可以用经验改善表现;算法和学习目标仍需人来设计。[9] |
| 1966 年 | ELIZA | 简单的文本规则也能让人产生被理解的感觉;对话流畅不等于真正理解。[11] |
| 1966 年 | MIT 夏季视觉项目 | 研究者尝试把图像中的结构转成机器可处理的描述,后来发现远比预想困难。项目原文 |
| 1970—1980 年代 | AI 低潮与专家系统兴衰 | 预期、算力和现实能力失配;AI 的发展从来不是连续上涨的曲线。[12] CHM |
| 1986 年 | 反向传播的代表性论文 | 多层网络怎样有效学习有了更有影响力的训练方法;并非这一年才出现相关思想。[13] |
| 1980—1990 年代 | 统计语音识别与统计 NLP | 用概率处理含混和噪声,逐步替代“把所有规则写完”的期待。语音综述;统计翻译论文 |
| 1995 年 | Cortes 与 Vapnik 的支持向量机论文 | 在样本有限时构造稳健分类边界,成为机器学习的重要工具。[14] |
| 1997 年 | Deep Blue 战胜卡斯帕罗夫 | 专门系统可以超过顶尖棋手,但棋力不会自动变成通用能力。[15] |
| 1998 年 | LeNet 的代表性论文 | 卷积网络在手写数字和文档识别等任务中展示实用价值。[16] |
| 2000—2010 年代;2013 年 | 广告点击率预测规模化;Google 代表性论文 | 机器学习进入实时商业决策,在海量反馈中改进预测。[19] |
| 2009 年;2012 年 | ImageNet 数据集;AlexNet | 大数据、GPU 与深层网络汇合,图像识别迎来显著突破。[17][18] |
| 2012 年 | 深度神经网络语音识别综述 | 深度学习改变声学建模,语音系统进入新的改进阶段。研究综述 |
| 2014 年 | GAN | 对抗训练拓展了生成模型的路线。原论文 |
| 2016 年;2017 年 | AlphaGo 战胜李世石;战胜柯洁 | 深度网络、搜索与强化学习结合,攻克此前极难的围棋任务。[20] BGA |
| 2017 年 | Transformer | 注意力机制提供了更适合并行训练的架构,成为后来大语言模型的关键基础。[21] |
| 2018 年 | BERT | 双向预训练推动语言理解任务,模型开始共享更通用的语言表示。原论文 |
| 2020 年 | GPT-3 | 少样本提示展示大模型通过上下文完成多种任务的能力,仍有可靠性局限。[22] |
| 2020 年 | DDPM | 去噪扩散模型推进图像生成;不是所有扩散思想的起点。原论文 |
| 2020 年;2021 年 | AlphaFold 的 CASP14 突破;方法论文 | 蛋白质结构预测取得重大进展;结构预测不等于新药已经验证。原论文 |
支持向量机,也就是 SVM,很能代表那个时代的气质:没有今天这样的聊天窗口,机器学习仍然能解决认真、具体的问题。识别一封垃圾邮件,判断一张图片的类别,往往比宣称机器拥有思想更有用。[14]
广告点击率预测则把这种能力推向工业规模。系统估计的是“在这个上下文中,这次展示被点击的概率”,常写成 CTR。它不是读心术,更不能保证某个用户一定点击。概率需要校准,系统也会遇到分布变化、隐私约束和反馈偏差。它之所以重要,是因为机器学习在这里进入了持续运行、可以影响收入和信息分发的闭环。[19]
2012 年的图像识别突破,让很多人重新相信神经网络。2016 年的 AlphaGo 又把这种变化带进公众视野。那场 4:1 是与李世石的五番棋挑战赛,不是一个世界冠军赛事的冠军头衔;2017 年对柯洁的三番棋结果是 3:0。胜负足够惊人,无须再给它加一个不准确的“夺冠”。[18][20] BGA
ChatGPT 之后,问题从回答变成交付
2022 年 11 月 30 日,ChatGPT 向公众开放。它的重要性不只是模型更强,还在于普通人终于获得了一种极低门槛的入口:不用懂编程,直接说话,就能让机器解释、改写、翻译和生成程序。这让 AI 从许多产品背后的能力,变成了人们主动使用的对象。[23]
接下来的变化,很快越过聊天框。模型可以读取更多材料,也开始连接搜索、文件、代码执行器和浏览器。Agent 在这里指的是围绕模型组织起来的执行系统:它保存任务状态,调用工具,检查结果,再决定下一步。模型负责推断,执行系统负责把推断接到世界上;二者都可能出错。

2022—2026 年的近期时间轴使用线性年份坐标:ChatGPT、vibe coding、Claude Code、Manus 和 OpenClaw 的节点明显靠近。这里只收录本文选择的事件,节点数量不代表通用智能得分。 只知月份的节点放在月中,不表示已经确认具体日。
| 时间 | 里程碑 | 应该怎样理解 |
|---|---|---|
| 2022 年 11 月 30 日 | ChatGPT 公开推出 | 自然语言成为大众使用生成式 AI 的入口。[23] |
| 2025 年 2 月 | “vibe coding” 一词传播 | Karpathy 描述一种高度依赖生成代码、弱化逐行理解的实践;不是所有 AI 辅助开发的总称。原帖镜像 |
| 2025 年 2 月 24 日 | Claude Code 研究预览 | 编码助手进入终端,能够围绕代码库和工具展开工作。[24] |
| 2025 年 3 月 | Manus 首次公开亮相 | 面向多步骤任务交付的 Agent 产品,把“替我完成”推到前台。[25] |
| 2026 年 1 月 | OpenClaw 更名及公开传播 | 自管个人 Agent 的消息入口、持久状态和工具连接受到关注;它是执行系统,不是一个新基础模型。[26] |
Claude Code 与 vibe coding 经常被放在同一句话里,却不能画等号。前者是一种工具,后者是一种使用方式。专业开发者也可以借助同一工具认真读代码、检查差异、运行测试。让机器写得快,并不会让责任自动消失。[24] Karpathy 原帖镜像
Manus 和 OpenClaw 指向两种有代表性的产品选择:一种强调把多步骤任务交给服务完成,一种强调把常驻助手和自己的环境连接起来。它们让人看见自主执行的潜力,也暴露出新的麻烦:权限给多大,失败怎样发现,已经做错的操作如何恢复?这些问题不比模型答题能力次要。[25][26]
加速是真的,但得说清楚加速了什么
人类留下和传递知识用了漫长的时间,把规则交给电子机器用了几十年,而从大众聊天助手走到日常工具执行,只隔了几年。站在一生的尺度上看,这种压缩很强烈。过去,一个人可以在成年后用同一种工作方法过完职业生涯;现在,工作入口和能力边界可能在几年里反复变化。
我们可以说:许多认知工具的更新周期,已经从跨世代压缩到一代人之内,又从几十年压缩到几年。 但不能据此断言,最近几年“完成的进步总量”超过了此前几十年,或者此前几十年超过了整个人类生物进化。后两种比较没有共同的计量单位。石器、文字、农业、工业革命和语言模型,也不是一组可以直接相加的分数。

若干选定节点之间的间隔:1703—1936为233年、1936—1956为20年、1956—2012为56年、2012—2022为10年、2022—2025为3年、2025—2026为1年。柱长采用对数尺度,数值为整数年份之差;选择有偏且并非单调下降,不能据此推导智能增长率。
更扎实的加速证据来自具体指标。Stanford 的 2025 年 AI Index 记录:达到 GPT-3.5 水平的 MMLU 表现时,推理成本从 2022 年 11 月每百万 token 的 20 美元,降到 2024 年 10 月的 0.07 美元,降幅超过 280 倍。这是在特定能力门槛下比较成本,不是说所有模型都便宜了同样倍数。[28]
METR 在 2025 年发表的研究,则观察到一种更接近“能做多长任务”的变化:在其软件与推理任务集上,前沿 AI 以 50% 成功率完成的任务,其对应人类专家工作时长自 2019 年起大约每 7 个月翻倍。这里的时长是人做该任务所需的时间,成功一半也不是可靠交付。它提供了外推的理由,同时留下很大的现实推广限制。[27]
加速还会自己制造条件。更好的 AI 能帮助写软件、做实验和优化系统;这些工作又可能改善下一代 AI。不过,反馈存在不等于反馈无限。数据质量、能源、芯片、实验速度、可靠性和组织采用,都可能成为刹车。历史里的低潮提醒我们:曲线往上走过一段,不代表以后没有台阶和回撤。
我押 2031 年,但先把 AGI 的门槛写下来
AGI 通常译为通用人工智能,可“通用到什么程度”并没有统一答案。有人要求它覆盖大多数经济任务,有人强调学会陌生技能,还有人把自主性也算进去。关于 AGI 分级的研究,把能力水平、覆盖范围和自主程度拆开讨论,这比争论一个口号更有帮助。[29]
本文只讨论一种实用 AGI:在有明确权限的数字环境中,能够学会新任务,并以可接受的成本,稳定完成广泛的专业认知工作。它不要求有意识,不要求拥有人的身体,也不等于在一切领域超过所有人的超级智能。
为了让预测将来能够被检验,我们给它一个人为约定的门槛。这是本文的操作定义,不是行业标准,也不是安全认证:
| 验收项 | 本文采用的门槛 |
|---|---|
| 覆盖范围 | 软件工程、资料分析、科研辅助、多模态理解、规划、新工具学习这 6 类任务中,至少 5 类达到熟练人类的中位水平。 |
| 陌生任务 | 每类至少 100 个未公开任务;控制训练数据泄漏,允许合理的工具使用和新任务学习。 |
| 可靠性 | 在上述每个达标领域,任务成功率至少 90%;结果由事先确定的可审查标准判定。 |
| 长任务 | 测试包括需要人类专家至少 8 小时完成的任务;每项最多接受 2 次人工澄清,不能靠人不断救场。 |
| 成本 | 把推理、工具、复核和返工一起算进去,单位任务成本不高于采用同一验收标准的人类完成成本。 |
| 可重复性 | 至少 2 家独立评测机构复现;系统在 90 天持续评测中保有这些表现,不能只交一场漂亮演示。 |

AGI 的本文门槛示意:6类任务中至少5类,100个未公开任务,90%成功率,8人时长任务,最多2次澄清,90天复现。图中数字是人为验收要求,不是当前系统实测成绩或公认AGI标准。
这套标准仍有争议。任务怎样抽样、熟练人类怎样招募、科研辅助怎样验收,都必须事先公布;涉及人身安全的任务,还需要另外的监管与专业标准。它的用处,是把“感觉已经到了”换成一个可以质疑、重测、推翻的判断。
如果必须押一个年份,我押 2031 年。 我更愿意观察 2028—2035 年这个窗口,而不是猜某月某日。下面是截至本文日期的主观累计概率,表示按上述门槛首次获得独立确认的时间;没有统计模型校准,也不代表专家共识:
| 首次确认时间 | 我的主观累计概率 |
|---|---|
| 到 2028 年底 | 20% |
| 到 2031 年底 | 50% |
| 到 2035 年底 | 75% |
| 2035 年之后,或现有路线最终无法达到本文门槛 | 剩余 25% |
2031 年是这份主观分布的中位判断,不是一个技术期限。到 2035 年的 75% 已经包含前面的概率,不能把表内各行相加。剩余 25% 也不意味着 AGI 永远不会出现,它包含更晚到来和现有路线走不通两种情况。
我这样押,是因为语言、视觉、编程和工具使用正在汇合,长任务能力和成本也给出了值得认真看待的趋势。但最难的部分可能恰好藏在最后:稳定学习新技能、识别自己的错误、在陌生环境保持可靠,以及完成需要实验反馈的工作。这些困难若比想象中顽固,年份就得往后移。[27][28][29]
什么会让我改判?如果低人工干预的长任务成功率、陌生任务迁移和总成本持续改善,而且能被独立复现,我会提高较早到来的概率。如果榜单上涨主要来自熟悉题目,长任务仍靠人接力,或者成本下降停滞,我会降低它。更多发布会和更密集的演示,本身不足以让我改判。
AGI 的到达也可能没有一声清晰的钟响。一些人先在工作里发现它已经够用,另一些人仍被失败案例困扰;评测机构确认能力,社会随后才慢慢改变。技术上过线、产品被采用、制度完成调整,是不同的时间。
乐观的未来:人的能力不再那么稀缺

左侧为共享知识与医疗进步,中间为就业转型和日常磨合,右侧为权力集中与失业压力。原创 AI 概念插画,描绘有条件的三种未来,不表示它们的发生概率。
乐观情景成立的前提,是能力能够广泛获得,部署保持可靠,社会愿意把生产率收益分给更多人。如果只有少数机构能负担最好的系统,这个故事从开头就会变样。
在科学上,AGI 可以帮助研究者阅读文献、设计候选实验、分析结果,减少试错中的重复劳动。一个小团队可能拥有过去大团队才具备的计算和分析能力。药物、材料和能源研究因此可能加快,但候选分子仍要验证,临床试验仍需要时间,实验设备也不能靠文字生成出来。乐观的变化是提高找到可靠结果的速度,而不是许诺疾病一夜消失。
在教育和医疗服务中,个人可以更便宜地获得持续、耐心的帮助。老师有更多时间照顾学生差异,医生有更多时间理解患者处境。偏远地区首先得到的,可能是质量更稳定的信息整理、初步筛查和远程支持。要把这件事变成公平的改善,必须有可及的网络、当地语言、隐私保护,以及负责最后决策的人。
工作也可能变得更有余地。大量重复的文书、核对和协调任务减少,人们把时间转向沟通、判断、照护和创造。小企业可以做过去请不起专业团队的事情,普通人更容易把一个想法变成产品。生产率提高若转成更低的生活成本、更短的工时和更好的公共服务,多数人的生活会改善。
这不会自动发生。工资、税制、竞争政策和公共投入决定收益如何分配。更好的技术只负责扩大可以分的东西,不能替社会决定怎么分。在这个情景里,人的价值从“我能做多少标准化工作”,逐渐转向“我想做什么、愿意承担什么责任、怎样与别人相处”。
乐观也不要求人停止学习。基础知识让人判断机器是否胡说,专业经验让人知道结果是否值得采用。变化在于学习不再只为跟上每一个工具,而是为了提出更好的问题,保持自己的判断。
悲观的未来:机器很强,社会却接不住
悲观情景不需要机器先拥有恶意。只要替代劳动的速度快于转岗速度,收益又集中在算力、资本、数据和分发入口的所有者手里,很多人就可能先失去收入,后看到宏观统计里的生产率提高。
最先承压的可能是任务容易数字化、成果容易验收的岗位。这里不能给整个职业判死刑:一个职业包含许多不同任务。但如果初级文案、基础分析、简单开发和常规客服的需求大幅减少,年轻人会遇到一个尤其棘手的问题——过去用来积累经验的入门工作没了,更高阶的判断力却仍要求经验。企业少招新人,社会就会慢慢失去培养专家的梯子。
权力集中会把这种压力放大。若少数组织控制最好的模型、算力和执行入口,它们不只决定价格,也可能影响谁能获得知识、怎样被评价、什么内容被看见。监控、欺诈和定向说服都可以因更便宜的智能而扩大。信息量增加,却可能让公共讨论更难确认什么是真的。
安全风险还有另一层:能力强的系统,如果目标设错、授权过宽、核查缺失,可能把错误连续执行下去。它可以误发消息、泄漏资料、制造有缺陷的软件,甚至在高风险环境造成实际损害。更极端的失控情景涉及欺骗、规避监督或获取更多资源;这些是需要研究和防范的可能机制,不能仅凭历史时间轴给出可信的发生概率。
国家之间也可能把先进 AI 看成不能落后的战略资源。竞赛压力促使机构缩短评测、隐瞒失败,或者把系统接入关键设施。这时危险并不来自某一次答错题,而来自很多组织同时接受了过大的风险。军备、网络攻击和关键系统部署,尤其需要把授权、审计、隔离和人为责任写进制度。
个人层面的损失更安静。长期让机器替自己判断,可能削弱写作、推理、导航和社交能力。人在方便中逐渐失去独立性;一旦服务停用、价格上涨或答案被操纵,才发现自己没有替代办法。这个未来里,即使技术越来越强,人也未必越来越自由。
中性的未来:巨大的改变,漫长的磨合
我更容易想象的日常,是三种情景混在一起。某些任务迅速变便宜,某些职业缓慢转型,少数领域因安全和责任问题继续由人主导。会有成功的公司,也会有失败的部署;有人获得时间,有人失去议价能力。
AGI 若先在数字工作中达到本文门槛,不代表它马上能修水管、照顾老人或建设电网。真实世界有身体、材料、场地和责任链。机器人制造、基础设施更新、审批和组织流程,都需要另外的时间。认知劳动的成本可能先变化,住房、能源和医疗等价格却不一定同步下降。
就业上的结果很可能首先表现为任务重组。一个团队减少做初稿的人,增加验收和协调的工作;一个人管理更多项目,也承担更多出错责任。生产率与工作强度甚至可能同时上升。ILO 关于生成式 AI 的职业暴露研究也提醒,任务受到影响并不等于岗位必然被全部替代。这个判断不能直接升级为对 AGI 就业后果的预测,却是分析时应保留的区分。[30]
制度会追着现实补课。学校调整考核,企业重新安排权限,法院和监管机构处理责任,保险和审计开始定价。许多地方会用“默认可以做、关键节点由人签字”的方式过渡。过程大概不像一次全社会升级,更像一连串带着争执的修补。
人们的心理变化也会落后于工具变化。熟练掌握的技能忽然失去稀缺性,会带来不甘和不安;新的能力让人兴奋,也可能让人厌倦永远追赶。身份感不会因为效率提高自动得到安放。照护、友谊、身体经验、审美和公共参与,仍然会是人安排生活的重要依据。
因此,即便我押 2031 年,也不会押“从那一年起人人失业”,更不会押“从那一年起人人富足”。技术突破可能集中出现,社会后果却会分地区、分行业、分人群展开。中性的未来不是改变很小,而是改变很大,结果不均,调整很慢。
真正需要准备的,是判断和选择
这段历史让人振奋,也让人有一点眩晕。算盘只在手指拨动时计算;今天的机器已经能接住一句含糊的要求,开始寻找完成它的办法。我们把越来越多的认知工作搬到了外面,却还在学习怎样验收、怎样负责、怎样分配收益。
对个人,值得保留的是专业基础、核查习惯、可迁移的技能,以及不依赖单一服务的工作方式。对企业,值得投入的是可审查的流程、真实任务评测、清楚的权限和能够恢复的操作。对社会,最难的事情是让生产率增长不只变成少数人的优势,让安全要求不只停在声明里。
AGI 的年份可以押错。更不该押错的是:只要机器足够聪明,人类就会自动得到一个好未来。从算盘到今天,工具一直在扩大人的力量。接下来要回答的,是这份力量由谁掌握、怎样使用,以及我们希望用它过什么样的生活。