卡帕西中文站 / 文章导读 / 卷积网络评自拍

卷积网络如何评价你的自拍:一堂伪装成八卦的实战课

原文发表:2015-10 · 导读更新:2026-08
这是导读,不是翻译。目标是让你 5 分钟拿到文章的思想地图;值得的话,带着地图去读 英文原文 →

一句话

抓取 500 万张 #selfie,训练一个卷积网络判断自拍的「好坏」,得出「切掉额头」「脸占画面三分之一」等爆笑结论——但别被段子骗了:这篇其实是一堂完整的 ConvNet 实战课,从数据清洗、标签设计、微调训练到 t-SNE 可视化和产品化部署,一个环节不少。娱乐是糖衣,工程方法论才是药。

文章讲了什么

最见功力的是标签设计:什么叫「好自拍」?直接用点赞数会被粉丝量污染,于是他按粉丝数给用户分组,在每组内部取赞数最高的 50 张为正例、最低的 50 张为负例——用分组归一化剥离受众规模的影响。数据从 500 万张过滤到 200 万张有人脸的图,用 Caffe 在一块 K40 上微调 ImageNet 预训练的 VGGNet,一夜训完,验证准确率 60%(瞎猜是 50%)。

然后是欢乐的结论部分。网络偏爱的「好自拍」配方:女性、脸占约三分之一画面、微微倾斜居中、切掉额头、长发披肩、过饱和或做旧滤镜加白边框;反面教材:光线太暗、头太大、拍成合影。男性自拍则是另一套审美:露全头带肩膀,最好有上梳的发型。接着他把玩法层层加码:用 t-SNE 把网络眼中「相似」的自拍聚在一起(合影一片、墨镜一片、镜子全身照一片);穷举随机裁剪让网络挑最优构图——其中一次网络把人整个裁掉了,他吐槽说这属于没抓住自拍的重点;最后用约 150 行 Python 包了个推特机器人 @deepselfie,任何人发图就能拿到评分。文中金句至今常被引用:

"ConvNets are a very powerful hammer, and Computer Vision problems are very nails." ——Andrej Karpathy,2015 · 原文 →

写作背景

2015 年正是 ConvNet 横扫视觉任务的年份,卡帕西刚写完技术向的 char-rnn 神文,又在主讲 CS231n。这篇的目标读者显然是圈外人:用一个人人有体感的题目(自拍好不好看),把「深度学习能做什么、怎么做」演示给大众看,文末还贴心附上入门资源清单。这也是他「不争论、放 demo」传播哲学的又一次演练——顺带自嘲一句:正事待会儿再干,先发张自拍。

十年后再看

技术栈全体退役:Caffe 停止维护、K40 进了博物馆、微调 VGGNet 的活儿如今一句 prompt 就能替代。但三样东西越陈越香。其一,标签设计的手艺——「按粉丝数分组再取极端」这种对抗混杂变量的巧思,在今天做偏好数据、RLHF 标注时依然是核心技能。其二,模型审视方法——用 t-SNE 看模型把什么当作「相似」、用穷举裁剪反推模型偏好,正是可解释性分析的朴素形态。其三,也是最微妙的:模型学到的不是「美」,而是社交平台工程化过的流行样式——切额头、加滤镜都是流量套路的镜像。「模型从数据里学到的是分布,不是价值」这个教训,在推荐系统和 LLM 对齐的时代只会更加重要。

对你意味着什么

  1. 做 AI 应用的独立开发者:这是「边角料数据 + 预训练模型 + 巧妙标签 = 有趣产品」的原型案例。今天用 VLM API 复刻全流程可能只要一个下午,值得当练手项目。
  2. 数据工作者:重点研读标签构造那一段——如何用分组归一化对抗混杂变量,这个思路可直接搬到你的用户行为数据上。
  3. 内容创作者:学他的包装术——最硬核的教学内容配最没有门槛的题目。技术传播的天花板,往往取决于选题而非文笔。

延伸阅读