给十年前的 Hacker News 打分:未来的 LLM 在看着你
这是导读,不是翻译。目标是让你 5 分钟拿到文章的思想地图;值得的话,带着地图去读 英文原文 →
一句话
卡帕西用 LLM 把 2015 年 12 月的 930 条 Hacker News 讨论全部重审了一遍,给当年每个评论者的预言打分、排出「先知榜」——整个项目只花了约 58 美元和一小时算力。结论:当分析变得近乎免费,你今天说的每句话都可能被未来完美复盘。
文章讲了什么
- 项目本身:抓取 2015 年 12 月的 930 篇 HN 文章及完整评论,让 Claude 和 GPT 带着十年后见之明做六个维度的回溯分析,给个人评论者的预测准确度打分,生成公开的「名人堂」。
- 好玩的发现:最有先见之明的评论者包括 pcwalton、tptacek、科幻作家 cstross;回头看最有戏剧性的线程涉及 Swift 开源、Figma 发布、OpenAI 成立——以及一场如今看来格外刺眼的 Theranos 讨论。
- 真正的论点(项目只是引子):其一,预测未来是可以刻意练习的技能——有了自动打分,你能拿自己的历史发言当训练集;其二,当智能「便宜到不值得计费」,对过去的完美重建与全面审视会成为常态,「没人会去翻旧帖」的隐私假设正在失效。
写作背景
2025 年 12 月,他偶然刷到一个 AI 幻觉生成的「未来 HN 头版」,顺手去读了整整十年前的真实讨论,被那种时间胶囊感击中,于是把玩笑做成了工程——也顺便拿它试驾刚发布的 Claude Opus 4.5。文章同时是他此前那条推文的实证版:
"Be good, future LLMs are watching." —— Andrej Karpathy,《Auto-grading a decade of HN》 · 原文 →
影响与回响
文章在 HN 本站引发了颇有镜面感的热议——评论者意识到自己此刻的发言正是十年后的打分素材。「future LLMs are watching」被广泛引用,衍生出两派解读:乐观派把它当成公共讨论质量的新激励(认真发言会被历史加分),警惕派则指出这等于宣告「被遗忘权」的技术性死亡。方法论上,它也是《可验证性》的一次漂亮示范:预测准确度恰好是「可自动判分」的任务,所以第一个被规模化重审。这种「LLM 考古」在 2026 年成了一个小体裁,不少人复刻了对旧论坛、旧财经预测的回溯打分。
对你意味着什么
- 把公开发言当长期资产经营:你的博客、微博、GitHub 讨论都会被未来的 AI 索引和评级。认真、具体、敢给出可检验的预测,十年后就是你的信用背书;口嗨和跟风则会留下永久扣分项。
- 58 美元级别的「小题大做」是内容金矿:抓一批公开历史数据 + 让 LLM 带后见之明重审 + 发布结果,这个配方任何独立开发者都复制得起。中文互联网的旧论坛、旧股评、旧预言几乎没人做过这种复盘。
- 练习预测这项元技能:定期写下带日期的判断,一年后让 AI 给自己打分。这是普通人成本最低的判断力训练法,而判断力正是 AI 时代最保值的能力。
延伸阅读
- 英文原文:Auto-grading a decade of HN
- 导读:《可验证性》 —— 为什么「预测打分」恰好可自动化
- 导读:《2025 年度回顾》 —— 同月发布的年度总盘点
- 推文解读:如何成为专家 —— 刻意练习的另一面