蒸馏不是原罪。它只是突然变成了别人最赚钱的那把刀。
9 月 2 日,Anthropic 改了 API 规则,锁死了模型的「思考块」——谁要是偷偷篡改上下文,想套出 Claude 的推理过程,API 直接报错拒绝服务。 这消息一出来,很多号在喊「蒸馏时代结束了」。 我理解这种判断,但我觉得它只说对了一半。 因为就在差不多同一时间,彭博社曝出另一条消息:Meta 正在研发的新模型「牛油果」,蒸馏了谷歌 Gemma、OpenAI 的 gpt-oss,以及阿里的通义千问。 一边封杀别人蒸馏自己,一边自己在蒸馏别人。 这不叫蒸馏时代结束。这叫蒸馏被重新划了条线。
我们先把时间拨回十年前。
2015 年,Geoffrey Hinton、Oriol Vinyals 和 Jeff Dean 发了那篇著名的论文《Distilling the Knowledge in a Neural Network》。核心想法特别朴素:让一个小的「学生模型」去模仿大的「教师模型」。
妙处在于,学生学的不是标准答案,而是老师的概率分布。比如一张图,老师判断 85% 是猫、10% 是狗、5% 是狐狸——这串数字里藏着的"为什么像猫而不像狗"的信息量,比单纯告诉学生"这是猫"大得多。Hinton 管这叫"暗知识"。
这项技术本来是要解决一个特别实在的问题:大模型太贵、太慢、跑不动。把它压缩成小模型,塞进手机、塞进工厂的边缘设备,让没有网的地方也能用上 AI。
再往前追,2006 年 Rich Caruana 他们提出的"模型压缩",就是它的雏形。
所以蒸馏从出生那天起,就不是什么灰色手段。它是让 AI 变便宜、变普及的正经技术。
转折点出在 2025 年 1 月。
DeepSeek 发布了 R1,训练成本据报只有 560 万美元,性能却能对标 OpenAI 的 o1。这个性价比太扎眼了,扎眼到 OpenAI 很快就公开质疑:你是不是用我们的模型输出训练了你自己的模型?
到了 2026 年 2 月,争议升级。Anthropic 发布了一份报告,说他们检测到大约 24,000 个欺诈账户,产生了 1600 万次和 Claude 的对话,模式高度符合"大规模提取",关联方包括 DeepSeek、月之暗面和 MiniMax。同期 OpenAI 也向美国众议院相关委员会提交了备忘录。
4 月,白宫一份备忘录用了"蓄意的、工业规模的提取行动"这样的措辞。
到这里,"蒸馏"这个词就彻底变味了——它从一项中性的机器学习技术,变成了地缘政治叙事里的"窃取"。
但我必须补一个很多人没提的关键事实:Anthropic 自己在官方博客里也承认,蒸馏是"一种被广泛使用且合法的训练方法"。南华早报的分析也指出,Anthropic 承认"蒸馏技术本身并不违法"。
既然技术本身合法,那争议的是什么?是服务条款。是你用了人家的 API,却把输出拿去训练竞品——这违反了你当初点同意的那份合同。
这是合同纠纷,不是盗窃。这两者的差别很大。
我把蒸馏按合法性分成三层,你一看就明白边界在哪。
第一层:开源 → 开源,完全正当。
拿 Llama 3 70B 的输出,去训练一个 Llama 3 7B。Meta 的许可证明确允许这么做,只要求你声明模型来源。Qwen、Mistral 的许可证也有类似条款。 打个比方:就像读了一本公开出版的教科书,然后自己整理笔记。知识是公开的,笔记是你的。
第二层:闭源 API → 自己的模型,违反 ToS。
技术流程和第一层一模一样,但你用的是 Claude 或 GPT-4 的输出,而服务条款禁止拿这些输出去训练竞争模型。 DeepSeek、月之暗面、MiniMax 被指控的行为,就落在这一层。
第三层:偷权重,这才是真的犯罪。
通过入侵、内鬼、逆向工程拿到模型权重直接用。这是知识产权盗窃,可能要负刑事责任。
中国律师事务所在分析这个案子时给了三个角度,我觉得挺清醒:从著作权法看,AI 生成内容通常缺乏足够的人类智力贡献,很难被认定受版权保护,而且 OpenAI 的使用条款已经把输出内容的权利转让给了用户,所以主张著作权侵权很勉强;从不正当竞争看,如果 DeepSeek 只是通过公开 API 获取输出、没有窃取参数或源代码,很难认定存在欺骗手段。
反过来说,如果把合法的蒸馏技术一律禁止,掌握市场支配地位的一方,反而可能被质疑是在滥用优势、阻碍创新。
聊到这儿,得说说那些很少被放在一起看的事实。
所有头部大厂都在蒸馏,包括正在封杀蒸馏的那家。
OpenAI 蒸馏出了 GPT-4o-mini;Google 把 Gemini Ultra 蒸馏成 Flash;Anthropic 自己也在做内部蒸馏,才有了更便宜的 Haiku 系列(输入约 1 美元、输出约 5 美元每百万 token)。
换句话说,Anthropic 反对的不是"蒸馏",而是"不付钱就蒸馏我的"。
这个立场完全合理——花了上千万美元做 RLHF 和安全对齐,凭什么让别人白拿?但把它包装成"蒸馏是窃取",就偷换了概念。
还有一条更少被提起的信息:中科院深圳先进院和清华的团队做过一个蒸馏程度评估框架,测了 Claude、DeepSeek-V3、Llama 3.1、Gemini 这些主流模型。结果是——除了 Claude、豆包和 Gemini,其他被测模型都呈现出较高的蒸馏程度。
这说明什么?说明蒸馏不是某一家公司的"原罪",它是整个行业的通用做法。
回到开头那条消息。
Meta 蒸馏阿里 Qwen,这件事的意义比很多人想的大。要知道 Meta 是 Llama 的开发者,曾经是开源世界最大的旗手。而扎克伯格此前多次公开呼吁要支持美国模型。
现在,旗手开始用别人的开源模型训练自己的闭源模型。
数据也能印证这个转向:2024 年 8 月,Qwen 的衍生模型数首次超过 Llama;2025 年 10 月,全球下载量也完成了反超,Qwen 取代 Llama 登顶全球第一开源模型。截至目前衍生模型超 18 万个、下载量超 7 亿次。 不止 Meta——亚马逊、Airbnb 都在用 Qwen,英伟达、微软基于它开发衍生模型,斯坦福李飞飞团队、艾伦 AI 研究所也在它上面做研究。
Airbnb 的 CEO 布莱恩·切斯基甚至公开说过,公司"大量依赖阿里的通义千问",理由很直白:比 OpenAI 更快、更便宜,而且完全满足需求。
还有个容易被忽略的细节:DeepSeek 当年发布 R1 时,一并开源的 6 个小尺寸模型里,有 4 个是用 Qwen 做底座蒸馏出来的。
所以"中国蒸馏美国"这个叙事,其实只讲了半段。真实的情况是:蒸馏是全球性的、双向的、普遍的。
第一,成本结构的分化会加剧。
开放权重的模型(Qwen、Llama、DeepSeek)因为允许合法蒸馏,会继续成为生态的养分,衍生出海量小模型。闭源前沿模型则越来越像"奢侈品"——贵、强、但只用来处理最值钱的少数任务。 未来的主流架构大概是混合的:简单任务走便宜的蒸馏模型,复杂判断才调用前沿模型。有测算显示,一个日处理千万 token 的客服场景,走前沿模型约 150 美元/天,换成调优过的蒸馏模型约 1.5 美元/天——差不多 100 倍的成本差。
第二,反蒸馏会变成一门生意。
输出水印、"金丝雀"陷阱短语、调用行为指纹、以及 Anthropic 这次的上下文一致性校验——检测和反制的技术栈会快速成熟。这场攻防才刚开始。
第三,立法正在跟上。
2025 年 12 月,纽约州签署的《负责任 AI 安全与教育法案》(RAISE Act),成为首个明确把知识蒸馏纳入规制的立法文本。这大概率不会是最后一个。
第四,开源的价值被重新定价。
当闭源 API 的蒸馏通道被堵死,开放的权重就成了唯一合法的"养料来源"。这会进一步推高开源模型的战略地位——阿里开源 300 多款模型换来的生态位,现在看是很有远见的一步。
我愿意赌三个判断:
1. 蒸馏不会消失,只会分层。开源→开源的蒸馏会越来越繁荣,因为合法、便宜、可私有化部署。被堵死的是"白嫖闭源 API 做竞品"这条路。
2. "蒸馏"这个词会慢慢去污名化。等大家反应过来自己手机里跑的小模型、公司内网部署的私有模型,全都是蒸馏的产物,这件事的道德色彩就会淡很多。
3. 中国 AI 的角色会继续反转。从"被指控蒸馏的一方",变成"被别人蒸馏的一方"。这个转变在过去一年已经发生了,只是很多人还没注意到。
如果你是开发者: 开源蒸馏是你最好的朋友。它合法(看清楚许可证)、便宜、还能部署进自己的 VPC,让敏感数据不出内网。别再把"接闭源 API"当唯一选项。
如果你是企业负责人: 别再迷信"一个模型解决所有问题"。混合架构才是正解——简单高频的任务用蒸馏小模型,把预算留给真正需要前沿能力的少数决策。同样的活,成本能差两个数量级。
如果你只是个普通用户: 你其实是蒸馏最大的受益者,只是你不知道。手机上的离线 AI、不联网也能用的功能、越来越便宜的会员——这些背后都是蒸馏。它不是什么灰色手段,它是让 AI 从实验室走进你口袋的那座桥。
蒸馏就像"学习"本身—— 看别人的书是学习,抄别人的卷子也是学习。 技术从来不分辨对错,划线的永远是规则。