把 AlphaGo 放回原位:全世界狂欢时的一盆冷静
一句话
AlphaGo 击败柯洁、举世惊呼「AI 要来了」的那一周,卡帕西写下这篇文章泼了盆精确的冷水:AlphaGo 是杰出的工程,不是算法上的根本突破——它赢在围棋恰好是一个对 AI「无限友好」的领域,而这些友好条件在真实世界里一条都不成立。
文章讲了什么
文章先承认精彩之处:AlphaGo 把行为克隆、强化学习、价值函数、蒙特卡洛树搜索这几件「都是已有」的武器组合得漂亮至极。但重点在后半——他列出围棋这个领域享有的七个便利条件:
- 完全确定:规则没有任何随机性;
- 完全可观测:双方信息全部摆在棋盘上;
- 离散动作空间:可落子点有限且清晰;
- 有完美模拟器:每步棋的后果可以精确推演;
- 回合较短:一局约 200 步就能结束;
- 评估清晰快速:胜负明确,可以海量试错;
- 人类数据充足:有大量历史棋谱可供模仿起步。
然后他举了个反例——亚马逊分拣挑战赛那样的机器人任务:电机有噪声、视野被遮挡、动作是连续的、物理模拟不准、试错成本高昂、演示数据稀缺——围棋满足的假设几乎每一条都被现实违反。所以结论很干脆:
"AlphaGo is a narrow AI system that can play Go and that's it." ——Andrej Karpathy,2017 · 原文 →
文末他补了一句公道话:这场胜利真正证明的,是 Alphabet 在人才、算力和组织决心上的可怕实力——但它不预示通用智能即将到来。
写作背景
2017 年 5 月,AlphaGo 在乌镇 3:0 击败世界第一柯洁,媒体叙事一边倒地滑向「AI 超越人类」。卡帕西当时刚从 OpenAI 离开、即将出任特斯拉 AI 总监——一个每天要跟「真实世界不配合」搏斗的岗位。这篇文章既是给公众的科普,也像是他给自己的备忘:深度强化学习在完美沙盒里的胜利,搬到马路上要打多少折扣。同期他自己写的 《从像素玩转 Pong》正是深度 RL 的入门名篇,所以这盆冷水泼得格外有分量——他不是外行唱衰,是行家指界。
十年后再看
这篇文章的判断几乎全中,但方式出人意料。「窄领域 AI 不会自动泛化」——对:AlphaGo 一系确实止步于游戏和少数封闭问题(AlphaFold 是找到了另一个满足类似条件的领域,而非推翻了他的框架)。真正走向通用的反而是另一条路:下一个词预测 + 海量互联网文本,即 他 2015 年就埋下伏笔、后来在《软件 2.0》里升维的那条路。更妙的是他对 RL 的保留态度一以贯之:2024 年他又发出「RLHF 勉强算 RL」的著名论断——真实世界没有围棋那样干净的奖励信号,这个 2017 年的洞察,十年后仍是 agent 领域最硬的约束。
对你意味着什么
- 做 agent 的开发者:把七个条件当成一张体检表。你的任务离「确定、可观测、离散、可模拟、短回合、易评估、有数据」越近,RL 和自动优化就越可行;离得越远,越要靠人类数据和工程兜底。
- 判断 AI 新闻:每逢「某 AI 在 X 上超越人类」的头条,先问一句「X 满足几条围棋条件」——这是过滤炒作的最快滤镜,2017 年管用,现在还管用。
- 学习路径上:这篇和《从像素玩转 Pong》配套读——一篇教你 RL 怎么工作,一篇告诉你它在哪儿失灵,合起来才是完整的一课。
延伸阅读
- 英文原文
- 导读:《从像素玩转 Pong》 —— 他自己写的深度 RL 入门
- 解读:RLHF 勉强算 RL —— 七年后同一怀疑的续篇
- 导读:《软件 2.0》 —— 同年他给出的另一条通往通用的路