卡帕西中文站 / 文章导读 / 两份会议数据小考

两份会议数据小考:谁在发论文,评审可信吗

原文发表:2017-03/05 · 导读更新:2026-08
这是合并导读,不是翻译。本页同时导读卡帕西 2017 年的两篇会议数据分析短文;值得的话,带着地图去读英文原文:ICML 机构统计 → · ICLR vs arxiv-sanity →

一句话

2017 年春夏,卡帕西用几小时的爬虫和正则,对 AI 学术圈做了两次「快检」:一次数 ICML 录用论文都来自哪些机构,一次拿 arxiv-sanity 的社区数据对照 ICLR 的评审结果。两篇都短,但合起来问出了一个大问题——学术圈的权力结构和评审机制,经得起数据检验吗?

文章讲了什么

第一篇(2017-05):ICML 录用论文机构统计。他用 Jupyter Notebook 加正则解析 ICML 2017 录用名单的机构署名,合并同类项(如 Google Brain 并入 Google),共得到 961 次机构提及、420 家机构。前几名:Google 44 次、Microsoft 33、CMU 32、DeepMind 25、MIT 23、Berkeley 与 Stanford 各 22。两个反直觉的发现:其一,Google 加 DeepMind(同属 Alphabet)也只占全部论文的 6.3%;其二,有产业界参与的论文约占 20–25%——也就是说约四分之三的论文仍纯出自学术界。在「产业界抢走一切」的叙事最盛的年份,数据说事情没那么夸张。

第二篇(2017-03):ICLR 2017 vs arxiv-sanity。他把 491 篇 ICLR 投稿的官方结果(口头报告/海报/工作坊/拒稿)与这些论文在 arxiv-sanity 上被用户加入个人文库的次数做对照。结论微妙:海报级别的判断两边相当一致,口头报告的重合度却很低;有的被拒论文(如 The Predictron)在社区端热度极高,有的录用论文却几乎无人收藏。他算了一笔成本账:正式评审动用数百位评审员、耗时数月;而社区信号来自 3195 个用户的自然使用,外加他每月约两小时的维护——几乎是免费涌现的。于是他问出了那个敏感的问题:

"It's a battle between top down and bottom up." ——Andrej Karpathy,2017 · 原文 →

他也诚实列出了混杂因素——时间偏差、名人效应、曝光位置——但结论倾向明确:自下而上的社区信号里有货真价实的判断力,传统评审至少「有巨大的改进空间」。

写作背景

这两篇是 《机器学习趋势一瞥》的姊妹篇,同属他 2017 年上半年的「数据考据」系列,工具都源于业余项目 arxiv-sanity。彼时深度学习论文爆炸、会议评审不堪重负,「评审彩票」的抱怨四起;产业实验室高薪挖人也让「学术界被掏空」成为焦点话题。别人在推特上吵,他的习惯是花一个周末把数据拉下来看看。

十年后再看

两篇的后续都很有戏剧性。机构统计那篇:产业界占比在此后几年确实继续攀升,但学术界至今仍是论文产出的主体——真正的变化是前沿能力研究(而非论文数量)向少数实验室集中,这层区分是 2017 年的统计方法看不到的。评审那篇更是预言成真:openreview 公开评审、社交媒体热度、GitHub star、HuggingFace 下载量,如今都成了与同行评审并行的「自下而上」信号,而评审危机只增未减——用 LLM 辅助甚至代写评审的争议,恰是他当年问题的最新版本。他本人后来也把这套「不争论、跑数据」的习惯延续到了 用 LLM 给 Hacker News 评论打分等实验里。

对你意味着什么

  1. 判断「圈内共识」之前先拉数据:两篇文章的全部工作量不过是爬虫加正则加一个下午,却足以校正「产业界垄断研究」这样的流行叙事。今天用 LLM 做这类考据,成本更是趋近于零。
  2. 筛论文别只信榜单:口头报告与社区热度重合度低这个发现至今成立——真正值得读的工作,往往要同时看评审结果和社区信号两个维度。
  3. 给独立开发者的暗示:arxiv-sanity 这样「给自己挠痒」的小工具,攒下的数据本身会变成独一份的资产——他能做这两篇分析,正因为只有他有这份数据。

延伸阅读