卡帕西中文站 / 文章导读 / 量化 Hacker News

量化 Hacker News:把一个社区当数据集

原文发表:2013-11 · 导读更新:2026-08
这是导读,不是翻译。目标是让你 5 分钟拿到文章的思想地图;值得的话,带着地图去读 英文原文 →

一句话

每个泡 Hacker News 的人都有自己的玄学:几点发帖容易上首页?什么标题能火?卡帕西的做法是写个 Python 脚本,每分钟抓一次首页和新帖页,连续跑了近 50 天,然后用数据回答这些问题——这是 2013 年版的「用工程手段消灭玄学」。

文章讲了什么

写作背景

2013 年底,HN 还没有官方 API(Firebase API 次年才出现),想研究这个社区只能硬抓。当时「data science」正是硅谷热词,但多数人止步于转发别人的图表;博士生卡帕西的习惯是自己动手:对社区好奇就抓社区(本篇),对自己好奇就抓自己(次年的《量化生产力》)。爬取、清洗、Notebook 分析、开源、写博客——这条流水线贯穿了他博士期间的多个周末项目。

十年后再看

文章的具体结论(哪个域名最火、几点发帖最好)早已过时,但它的方法论生命力很强:今天 HN 有了开放 API 和现成数据集,当年最苦的「每分钟抓页面」环节已经不必要,而「把社区行为当数据看」的视角成了增长黑客和内容运营的标配。更有意思的是这个数据集的后续:十二年后,卡帕西本人用 LLM 给 HN 帖子自动评分打标签(见《自动批改 Hacker News》)——2013 年他需要 BeautifulSoup 和几十行解析代码才能回答的问题,如今一句 prompt 就能问。同一个人、同一个社区、相隔十二年的两次「量化」,恰好丈量了工具的代际跃迁。

对你意味着什么

  1. 学数据分析的人:这是一份完整的小型数据项目模板——采集、存储、清洗、分析、发布,每一环都不复杂,合在一起就是一个能写进简历的作品。今天可以直接用 HN 官方 API 复刻,把精力花在提问上。
  2. 内容创作者与独立开发者:「发帖时机与标题规律」这类问题,答案会变,但「先抓数据再下结论」的姿势永远适用于你运营的任何平台。
  3. 做 AI 应用的人:对照他 2025 年的 HN 项目看:当年管线里最费力的「理解非结构化文本」环节,正是今天 LLM 吃掉的部分。找到你所在领域的同款环节,就是产品机会。

延伸阅读