卡帕西中文站 / 文章导读 / 可验证性

可验证性:判断 AI 会先自动化什么的一把新尺子

原文发表:2025-11 · 导读更新:2026-08
这是导读,不是翻译。目标是让你 5 分钟拿到文章的思想地图;值得的话,带着地图去读 英文原文 →

一句话

上一代计算机自动化的是「你能写清楚步骤」的工作,AI 自动化的是「你能自动打分」的工作——一个任务能不能被 AI 拿下,关键看它的可验证性,而不是它看起来难不难。

文章讲了什么

"Software 2.0 easily automates what you can verify." —— Andrej Karpathy,《Verifiability》 · 原文 →

写作背景

2025 年,RLVR(基于可验证奖励的强化学习)成了各大实验室的主训练手段,推理模型在数学和代码上狂飙,但公众仍在用「AGI 什么时候到」这种笼统问题理解进展。这篇文章是他给出的解释框架:把「AI 会取代什么工作」从玄学变成一个可以逐项检查的工程判断,也顺手回应了对进展不均衡的普遍困惑。它与他 2017 年的 Software 2.0、2025 年的 Software 3.0 演讲一脉相承。

影响与回响

「可指定 vs 可验证」迅速成为讨论 AI 就业影响时的标准引用,也被创投圈拿去当选题筛子——2026 年不少 RL 环境创业公司在融资材料里直接引用这个框架。他本人在 12 月的《2025 年度回顾》里把 RLVR 列为年度第一变化,在 2026 年 4 月的红杉对谈中又把「找到有价值、可验证、实验室还没卷到的领域」明确说成创业机会。批评者则提醒:过度追求可验证会让模型「刷分」(benchmaxxing),验证器本身也可能被钻空子。

对你意味着什么

  1. 选自动化目标先问三个条件:想用 agent 赚钱,先检查任务是否可重置、试错是否便宜、结果能否自动判分。三项全中的领域(代码、数据清洗、报表核对)今天就能做出可靠产品;缺一项的要靠人工兜底设计。
  2. 给自己的技能做个体检:你的工作越接近「结果可自动打分」,被模型追上的速度越快。往「定义问题、验收结果、承担责任」的方向移动,这些恰恰是验证器写不出来的部分。
  3. 验证器本身是生意:谁能把一个模糊领域(文案质量、教学效果、法律文书)变得可验证,谁就为 AI 打开了一个新市场。做评测和 RL 环境,是独立开发者少有的上游位置。

延伸阅读