机器学习趋势一瞥:用数据给 2017 年的 AI 拍 X 光
一句话
卡帕西把自己五年间抓取的 28303 篇 arxiv 机器学习论文全文拿来数关键词,画出一组曲线:哪个框架在涨、哪个架构在爆发、哪个优化器一统江湖、哪些方向在悄悄退场。一篇不靠观点、全靠数据说话的领域体检报告。
文章讲了什么
数据来自 arxiv 六个分类(cs.AI、cs.LG、cs.CV、cs.CL、cs.NE、stat.ML)。他统计每个月提到某关键词的论文比例,几组结论至今读来仍很有画面感:
- 论文洪水:到 2017 年 3 月,每月投稿已近 2000 篇,峰值和 NIPS、ICML 截稿日精确对齐——「赶 deadline」是可以从数据里看出来的。
- 框架战争:TensorFlow 问世仅 16 个月就被 9.1% 的论文提及,把曾经的王者 Caffe 甩在身后;而当时的 PyTorch 只有 0.2%——排在「其他」栏里的小字。
- 架构爆发:ResNet 一年内增长 8 倍多、出现在约 9% 的论文里;GAN 和全卷积网络也在陡峭上升。他还顺手算了人名——Hinton 被超过 30% 的新论文引用提及。
- 优化器大一统:约 23% 的论文用 Adam——训练神经网络的「默认答案」已经形成。
- 退潮的方向:贝叶斯非参数、小波变换等经典话题的提及率明显下滑。
文章结尾是他式的幽默:照这个趋势,2017 年最「前沿」的论文配方就是 ResNet + GAN + BatchNorm + Adam 一锅炖。玩笑背后是一个严肃观察——这个领域的研究行为高度趋同,跟风是可以量化的。
写作背景
这些数据不是为写文章临时爬的——它来自卡帕西的业余项目 arxiv-sanity,一个他为「论文太多读不过来」造的检索与推荐工具。2017 年春天正值深度学习论文产量的第一波指数增长,社区里人人喊「跟不上了」,他的回应方式很典型:不抱怨,写代码,让数据自己开口。这也是他一贯的公共写作路数——和 《RNN 的不合理有效性》一样,用展示代替论证。
十年后再看
这篇文章最有趣的地方在于它拍下了Transformer 前夜的最后一张全景照:文中风头无两的是 ResNet 和 GAN,而两个月后《Attention Is All You Need》发布,随后十年整个领域向 Transformer 收敛。框架战争的结局也戏剧性反转——当时 0.2% 的 PyTorch 后来成了研究界的绝对主流,TensorFlow 反而式微,提醒我们曲线的斜率比高度重要。倒是两条「无聊」的曲线活得最久:Adam 至今仍是默认优化器之一,论文洪水则愈演愈烈——今天连 arxiv-sanity 也救不动了,读论文这件事最终交给了 LLM。用数据自我诊断领域的做法,后来被无数「AI 趋势报告」模仿,但很少有人做得这么轻、这么快。
对你意味着什么
- 选技术栈时看斜率不看存量:2017 年按「谁被提得多」选框架会选 TensorFlow,按增长率看才能押中 PyTorch。今天选 agent 框架、推理引擎,同样的方法论适用。
- 信息过载的正确姿势:读不过来就写工具。arxiv-sanity 只是个周末项目,却让他比整个社区更早看清趋势——独立开发者做「给自己用的信息工具」,往往就是最好的选题。
- 警惕配方化研究:「ResNet+GAN+Adam 一锅炖」的玩笑今天换了原料照样成立(RAG+Agent+微调一锅炖)。数据能告诉你大家在做什么,做别人没做的才有超额收益。
延伸阅读
- 英文原文 · arxiv-sanity-lite
- 导读:两份会议数据小考 —— 同一套数据功夫用在 ICML/ICLR 上
- 解读:一切向 Transformer 收敛 —— 这张快照两个月后开始的剧变
- 导读:《RNN 的不合理有效性》 —— 同样「让证据自己说话」的名篇