首页
学习
活动
专区
圈层
工具
发布
社区首页 >专栏 >Anthropic 封杀蒸馏那天,Meta 正在蒸馏阿里

Anthropic 封杀蒸馏那天,Meta 正在蒸馏阿里

作者头像
瑭宋元
发布于 2026-09-17 21:38:42
发布于 2026-09-17 21:38:42
1380
举报

蒸馏不是原罪。它只是突然变成了别人最赚钱的那把刀。

9 月 2 日,Anthropic 改了 API 规则,锁死了模型的「思考块」——谁要是偷偷篡改上下文,想套出 Claude 的推理过程,API 直接报错拒绝服务。 这消息一出来,很多号在喊「蒸馏时代结束了」。 我理解这种判断,但我觉得它只说对了一半。 因为就在差不多同一时间,彭博社曝出另一条消息:Meta 正在研发的新模型「牛油果」,蒸馏了谷歌 Gemma、OpenAI 的 gpt-oss,以及阿里的通义千问。 一边封杀别人蒸馏自己,一边自己在蒸馏别人。 这不叫蒸馏时代结束。这叫蒸馏被重新划了条线。

先搞清楚:蒸馏原本是个好东西

我们先把时间拨回十年前。

2015 年,Geoffrey Hinton、Oriol Vinyals 和 Jeff Dean 发了那篇著名的论文《Distilling the Knowledge in a Neural Network》。核心想法特别朴素:让一个小的「学生模型」去模仿大的「教师模型」。

妙处在于,学生学的不是标准答案,而是老师的概率分布。比如一张图,老师判断 85% 是猫、10% 是狗、5% 是狐狸——这串数字里藏着的"为什么像猫而不像狗"的信息量,比单纯告诉学生"这是猫"大得多。Hinton 管这叫"暗知识"。

这项技术本来是要解决一个特别实在的问题:大模型太贵、太慢、跑不动。把它压缩成小模型,塞进手机、塞进工厂的边缘设备,让没有网的地方也能用上 AI。

再往前追,2006 年 Rich Caruana 他们提出的"模型压缩",就是它的雏形。

所以蒸馏从出生那天起,就不是什么灰色手段。它是让 AI 变便宜、变普及的正经技术。

那它怎么就变成"原罪"了

转折点出在 2025 年 1 月。

DeepSeek 发布了 R1,训练成本据报只有 560 万美元,性能却能对标 OpenAI 的 o1。这个性价比太扎眼了,扎眼到 OpenAI 很快就公开质疑:你是不是用我们的模型输出训练了你自己的模型?

到了 2026 年 2 月,争议升级。Anthropic 发布了一份报告,说他们检测到大约 24,000 个欺诈账户,产生了 1600 万次和 Claude 的对话,模式高度符合"大规模提取",关联方包括 DeepSeek、月之暗面和 MiniMax。同期 OpenAI 也向美国众议院相关委员会提交了备忘录。

4 月,白宫一份备忘录用了"蓄意的、工业规模的提取行动"这样的措辞。

到这里,"蒸馏"这个词就彻底变味了——它从一项中性的机器学习技术,变成了地缘政治叙事里的"窃取"。

但我必须补一个很多人没提的关键事实:Anthropic 自己在官方博客里也承认,蒸馏是"一种被广泛使用且合法的训练方法"。南华早报的分析也指出,Anthropic 承认"蒸馏技术本身并不违法"。

既然技术本身合法,那争议的是什么?是服务条款。是你用了人家的 API,却把输出拿去训练竞品——这违反了你当初点同意的那份合同。

这是合同纠纷,不是盗窃。这两者的差别很大。

三层级:同样是蒸馏,性质天差地别

我把蒸馏按合法性分成三层,你一看就明白边界在哪。

第一层:开源 → 开源,完全正当。

拿 Llama 3 70B 的输出,去训练一个 Llama 3 7B。Meta 的许可证明确允许这么做,只要求你声明模型来源。Qwen、Mistral 的许可证也有类似条款。 打个比方:就像读了一本公开出版的教科书,然后自己整理笔记。知识是公开的,笔记是你的。

第二层:闭源 API → 自己的模型,违反 ToS。

技术流程和第一层一模一样,但你用的是 Claude 或 GPT-4 的输出,而服务条款禁止拿这些输出去训练竞争模型。 DeepSeek、月之暗面、MiniMax 被指控的行为,就落在这一层。

第三层:偷权重,这才是真的犯罪。

通过入侵、内鬼、逆向工程拿到模型权重直接用。这是知识产权盗窃,可能要负刑事责任。

中国律师事务所在分析这个案子时给了三个角度,我觉得挺清醒:从著作权法看,AI 生成内容通常缺乏足够的人类智力贡献,很难被认定受版权保护,而且 OpenAI 的使用条款已经把输出内容的权利转让给了用户,所以主张著作权侵权很勉强;从不正当竞争看,如果 DeepSeek 只是通过公开 API 获取输出、没有窃取参数或源代码,很难认定存在欺骗手段。

反过来说,如果把合法的蒸馏技术一律禁止,掌握市场支配地位的一方,反而可能被质疑是在滥用优势、阻碍创新。

最讽刺的部分:大家其实都在蒸馏

聊到这儿,得说说那些很少被放在一起看的事实。

所有头部大厂都在蒸馏,包括正在封杀蒸馏的那家。

OpenAI 蒸馏出了 GPT-4o-mini;Google 把 Gemini Ultra 蒸馏成 Flash;Anthropic 自己也在做内部蒸馏,才有了更便宜的 Haiku 系列(输入约 1 美元、输出约 5 美元每百万 token)。

换句话说,Anthropic 反对的不是"蒸馏",而是"不付钱就蒸馏我的"。

这个立场完全合理——花了上千万美元做 RLHF 和安全对齐,凭什么让别人白拿?但把它包装成"蒸馏是窃取",就偷换了概念。

还有一条更少被提起的信息:中科院深圳先进院和清华的团队做过一个蒸馏程度评估框架,测了 Claude、DeepSeek-V3、Llama 3.1、Gemini 这些主流模型。结果是——除了 Claude、豆包和 Gemini,其他被测模型都呈现出较高的蒸馏程度。

这说明什么?说明蒸馏不是某一家公司的"原罪",它是整个行业的通用做法。

方向早就反过来了

回到开头那条消息。

Meta 蒸馏阿里 Qwen,这件事的意义比很多人想的大。要知道 Meta 是 Llama 的开发者,曾经是开源世界最大的旗手。而扎克伯格此前多次公开呼吁要支持美国模型。

现在,旗手开始用别人的开源模型训练自己的闭源模型。

数据也能印证这个转向:2024 年 8 月,Qwen 的衍生模型数首次超过 Llama;2025 年 10 月,全球下载量也完成了反超,Qwen 取代 Llama 登顶全球第一开源模型。截至目前衍生模型超 18 万个、下载量超 7 亿次。 不止 Meta——亚马逊、Airbnb 都在用 Qwen,英伟达、微软基于它开发衍生模型,斯坦福李飞飞团队、艾伦 AI 研究所也在它上面做研究。

Airbnb 的 CEO 布莱恩·切斯基甚至公开说过,公司"大量依赖阿里的通义千问",理由很直白:比 OpenAI 更快、更便宜,而且完全满足需求。

还有个容易被忽略的细节:DeepSeek 当年发布 R1 时,一并开源的 6 个小尺寸模型里,有 4 个是用 Qwen 做底座蒸馏出来的。

所以"中国蒸馏美国"这个叙事,其实只讲了半段。真实的情况是:蒸馏是全球性的、双向的、普遍的。

对整个行业意味着什么

第一,成本结构的分化会加剧。

开放权重的模型(Qwen、Llama、DeepSeek)因为允许合法蒸馏,会继续成为生态的养分,衍生出海量小模型。闭源前沿模型则越来越像"奢侈品"——贵、强、但只用来处理最值钱的少数任务。 未来的主流架构大概是混合的:简单任务走便宜的蒸馏模型,复杂判断才调用前沿模型。有测算显示,一个日处理千万 token 的客服场景,走前沿模型约 150 美元/天,换成调优过的蒸馏模型约 1.5 美元/天——差不多 100 倍的成本差。

第二,反蒸馏会变成一门生意。

输出水印、"金丝雀"陷阱短语、调用行为指纹、以及 Anthropic 这次的上下文一致性校验——检测和反制的技术栈会快速成熟。这场攻防才刚开始。

第三,立法正在跟上。

2025 年 12 月,纽约州签署的《负责任 AI 安全与教育法案》(RAISE Act),成为首个明确把知识蒸馏纳入规制的立法文本。这大概率不会是最后一个。

第四,开源的价值被重新定价。

当闭源 API 的蒸馏通道被堵死,开放的权重就成了唯一合法的"养料来源"。这会进一步推高开源模型的战略地位——阿里开源 300 多款模型换来的生态位,现在看是很有远见的一步。

接下来会发生什么

我愿意赌三个判断:

1. 蒸馏不会消失,只会分层。开源→开源的蒸馏会越来越繁荣,因为合法、便宜、可私有化部署。被堵死的是"白嫖闭源 API 做竞品"这条路。

2. "蒸馏"这个词会慢慢去污名化。等大家反应过来自己手机里跑的小模型、公司内网部署的私有模型,全都是蒸馏的产物,这件事的道德色彩就会淡很多。

3. 中国 AI 的角色会继续反转。从"被指控蒸馏的一方",变成"被别人蒸馏的一方"。这个转变在过去一年已经发生了,只是很多人还没注意到。

对不同人的启发

如果你是开发者: 开源蒸馏是你最好的朋友。它合法(看清楚许可证)、便宜、还能部署进自己的 VPC,让敏感数据不出内网。别再把"接闭源 API"当唯一选项。

如果你是企业负责人: 别再迷信"一个模型解决所有问题"。混合架构才是正解——简单高频的任务用蒸馏小模型,把预算留给真正需要前沿能力的少数决策。同样的活,成本能差两个数量级。

如果你只是个普通用户: 你其实是蒸馏最大的受益者,只是你不知道。手机上的离线 AI、不联网也能用的功能、越来越便宜的会员——这些背后都是蒸馏。它不是什么灰色手段,它是让 AI 从实验室走进你口袋的那座桥。

蒸馏就像"学习"本身—— 看别人的书是学习,抄别人的卷子也是学习。 技术从来不分辨对错,划线的永远是规则。

本文参与 腾讯云自媒体同步曝光计划,分享自微信公众号。
原始发表:2026-09-06,如有侵权请联系 cloudcommunity@tencent.com 删除
目录
  • 先搞清楚:蒸馏原本是个好东西
  • 那它怎么就变成"原罪"了
  • 三层级:同样是蒸馏,性质天差地别
  • 最讽刺的部分:大家其实都在蒸馏
  • 方向早就反过来了
  • 对整个行业意味着什么
  • 接下来会发生什么
  • 对不同人的启发
问题归档专栏文章快讯文章归档关键词归档开发者手册归档开发者手册 Section 归档