卡帕西中文站 / 文章导读 / 机器学习趋势一瞥

机器学习趋势一瞥:用数据给 2017 年的 AI 拍 X 光

原文发表:2017-04 · 导读更新:2026-08
这是导读,不是翻译。目标是让你 5 分钟拿到文章的思想地图;值得的话,带着地图去读 英文原文 →

一句话

卡帕西把自己五年间抓取的 28303 篇 arxiv 机器学习论文全文拿来数关键词,画出一组曲线:哪个框架在涨、哪个架构在爆发、哪个优化器一统江湖、哪些方向在悄悄退场。一篇不靠观点、全靠数据说话的领域体检报告。

文章讲了什么

数据来自 arxiv 六个分类(cs.AI、cs.LG、cs.CV、cs.CL、cs.NE、stat.ML)。他统计每个月提到某关键词的论文比例,几组结论至今读来仍很有画面感:

文章结尾是他式的幽默:照这个趋势,2017 年最「前沿」的论文配方就是 ResNet + GAN + BatchNorm + Adam 一锅炖。玩笑背后是一个严肃观察——这个领域的研究行为高度趋同,跟风是可以量化的。

写作背景

这些数据不是为写文章临时爬的——它来自卡帕西的业余项目 arxiv-sanity,一个他为「论文太多读不过来」造的检索与推荐工具。2017 年春天正值深度学习论文产量的第一波指数增长,社区里人人喊「跟不上了」,他的回应方式很典型:不抱怨,写代码,让数据自己开口。这也是他一贯的公共写作路数——和 《RNN 的不合理有效性》一样,用展示代替论证。

十年后再看

这篇文章最有趣的地方在于它拍下了Transformer 前夜的最后一张全景照:文中风头无两的是 ResNet 和 GAN,而两个月后《Attention Is All You Need》发布,随后十年整个领域向 Transformer 收敛。框架战争的结局也戏剧性反转——当时 0.2% 的 PyTorch 后来成了研究界的绝对主流,TensorFlow 反而式微,提醒我们曲线的斜率比高度重要。倒是两条「无聊」的曲线活得最久:Adam 至今仍是默认优化器之一,论文洪水则愈演愈烈——今天连 arxiv-sanity 也救不动了,读论文这件事最终交给了 LLM。用数据自我诊断领域的做法,后来被无数「AI 趋势报告」模仿,但很少有人做得这么轻、这么快。

对你意味着什么

  1. 选技术栈时看斜率不看存量:2017 年按「谁被提得多」选框架会选 TensorFlow,按增长率看才能押中 PyTorch。今天选 agent 框架、推理引擎,同样的方法论适用。
  2. 信息过载的正确姿势:读不过来就写工具。arxiv-sanity 只是个周末项目,却让他比整个社区更早看清趋势——独立开发者做「给自己用的信息工具」,往往就是最好的选题。
  3. 警惕配方化研究:「ResNet+GAN+Adam 一锅炖」的玩笑今天换了原料照样成立(RAG+Agent+微调一锅炖)。数据能告诉你大家在做什么,做别人没做的才有超额收益。

延伸阅读