AI 'Distillation Storm': How Model Compression Became a Flashpoint
A LatePost investigation examines the rising controversy over AI model distillation, a technique where a student model learns from a teacher model's outputs. The report traces its origins to 2015 research by Geoffrey Hinton and colleagues, and highlights recent disputes including accusations against Chinese firms and a $1.5 billion lawsuit settlement.
Coverage timeline
晚点 LatePost程曼祺
所有人都不愿意公开谈论它,但所有人都在默默地关注它。 有人认为,这是一种不体面的偷窃行为。也有人认为,这是少数领先者为了自身利益而污名化的对象,它本身只是一种优化手段。 过去数月,AI 领域的诸多线头指向同一个节点——蒸馏。 和它相关的变化与事件有:开源模型逼近最强闭源模型;美国 77 家公司签署公开信,反对仓促限制开源模型;Anthropic 两次指责中国公司以大量欺诈账户套取数据;15 亿美元的侵权诉讼和解;张一鸣在字节 Seed 全员会上关于 “不蒸馏” 的正面回应…… 这种诞生多年的技术,在 2026 年反复被提及、讨论,也被误解和曲解。蒸馏到底是什么?大规模蒸馏如何实现?蒸馏能否成为一个模型研发团队的壁垒?它的代价又是什么? 我们访谈了来自不同公司的近十位模型领域研究员、从业者,也结合公开研究和技术报告,还原蒸馏的过去、现状,和它正在带来的更多改变。 蒸馏的起点:为了压缩,而非为了变强 蒸馏不是抄袭,不是窃取软件代码,它也无法直接获得另一个模型的权重和完整训练数据。 现在处于争议中的那种蒸馏,即让模型变强的蒸馏,技术上是一种获得高质量数据的方式:即反复向一个更强的 “教师模型” 提问,得到回答,再用这些 “题目—回答” 数据对训练另一个 “学生模型”,让后者达到相近的表现。 蒸馏的想法由来已久。2015 年,刚加入 Google Brain 不久的 Geoffrey Hinton,与当时 Google Brain 的负责人 Jeff Dean 和年轻研究员 Oriol Vinyals 一起发表了《神经网络中的知识蒸馏》 ( Distilling the Knowledge in a Neural Network ) ,第一次把之前出现的模型压缩 ( Model Compression,2006 ) 等思路总结为蒸馏,Distillation。 那时距离 Google 提出 Transformer (如今大语言模型的架构基础) 还有将近 2 年半,Hinton 他们把蒸馏的思路用到了图像识别模型:方法是,让学生模型学习教师模型输出的概率分布。比如识别猫是猫,这对深度学习是一个统计过程:0.7 是猫,0.2 是狐狸,0.1 是狗→ 是猫。 学生模型能看到教师输出的这组概率分布,这便是学到 “logits”,即所谓 “软蒸馏” (logits 是一组原始分数,经
