量化 Hacker News:把一个社区当数据集
这是导读,不是翻译。目标是让你 5 分钟拿到文章的思想地图;值得的话,带着地图去读 英文原文 →
一句话
每个泡 Hacker News 的人都有自己的玄学:几点发帖容易上首页?什么标题能火?卡帕西的做法是写个 Python 脚本,每分钟抓一次首页和新帖页,连续跑了近 50 天,然后用数据回答这些问题——这是 2013 年版的「用工程手段消灭玄学」。
文章讲了什么
- 采集:脚本从 2013 年 8 月下旬开始运行,每分钟各抓 30 条首页和新帖条目,原始 HTML 压缩存档,每天约 10MB;中间因故障有一些数据缺口,他也如实标注。
- 解析:用 BeautifulSoup 把 HN 那套没有规整结构的 HTML 表格啃成 JSON(域名、标题、评论数、排名、得分、用户、时间戳、故事 ID),他吐槽这一步远比想象中难,一路踩了不少奇怪的边角情况。
- 分析:完整结果放在一份渲染成网页的 IPython Notebook 里,覆盖的问题包括:帖子一天内的得分轨迹、最热门的域名和用户、几点发帖效果最好、标题高频词、得分的分布形态等。
- 坦率的后记:数据集和部分代码后来因为托管空间原因下线了——这也算数据项目的一课:分析会过期,管线才是可复用的资产。
写作背景
2013 年底,HN 还没有官方 API(Firebase API 次年才出现),想研究这个社区只能硬抓。当时「data science」正是硅谷热词,但多数人止步于转发别人的图表;博士生卡帕西的习惯是自己动手:对社区好奇就抓社区(本篇),对自己好奇就抓自己(次年的《量化生产力》)。爬取、清洗、Notebook 分析、开源、写博客——这条流水线贯穿了他博士期间的多个周末项目。
十年后再看
文章的具体结论(哪个域名最火、几点发帖最好)早已过时,但它的方法论生命力很强:今天 HN 有了开放 API 和现成数据集,当年最苦的「每分钟抓页面」环节已经不必要,而「把社区行为当数据看」的视角成了增长黑客和内容运营的标配。更有意思的是这个数据集的后续:十二年后,卡帕西本人用 LLM 给 HN 帖子自动评分打标签(见《自动批改 Hacker News》)——2013 年他需要 BeautifulSoup 和几十行解析代码才能回答的问题,如今一句 prompt 就能问。同一个人、同一个社区、相隔十二年的两次「量化」,恰好丈量了工具的代际跃迁。
对你意味着什么
- 学数据分析的人:这是一份完整的小型数据项目模板——采集、存储、清洗、分析、发布,每一环都不复杂,合在一起就是一个能写进简历的作品。今天可以直接用 HN 官方 API 复刻,把精力花在提问上。
- 内容创作者与独立开发者:「发帖时机与标题规律」这类问题,答案会变,但「先抓数据再下结论」的姿势永远适用于你运营的任何平台。
- 做 AI 应用的人:对照他 2025 年的 HN 项目看:当年管线里最费力的「理解非结构化文本」环节,正是今天 LLM 吃掉的部分。找到你所在领域的同款环节,就是产品机会。
延伸阅读
- 英文原文
- 导读:《自动批改 Hacker News》 —— 十二年后他用 LLM 重做这件事
- 导读:《量化生产力》 —— 次年,镜头转向他自己
- 导读:《Chrome 扩展编程》 —— 同期的另一个「顺手改造互联网」小项目