首页
学习
活动
专区
圈层
工具
发布

模型越大越好吗?Qwen3.8-27B 给出了另一种答案

好像进入了后训练时代,大家已经不太关心模型是 MoE(稀疏模型)还是 Dense(稠密模型)了。

在 2020 年、2021 年的时候,这个话题还是很火热的。因为当时 Dense 模型和 MoE 模型对于世界知识的理解程度相差很大。这就跟人的大脑一样,脑子大、脑容量大,理论上能记住的知识就越多。

但在后训练阶段,情况就有点不一样了。从 Qwen 3.8-27B 这个模型的性能卡上来看,它作为一个 27B 的模型,在一些任务上的性能甚至可以比肩比它大几十倍的模型。这在以前还在预训练的那个时代,其实是不可想象的。

特别是这个性能图里面的千问 3.7 Plus 以及 Opus 4.6 这两个模型,虽然说没有公开参数,但大家猜测至少是在 500B 以上。这就意味着这两个模型都比它要大将近 20 倍,甚至更多,但在一些性能上面,它甚至要超过这种大模型。

其实我觉得,主要的原因就来自于 MOE 模型。对于 MOE 模型来说,

对于一个具体 token,真正参与主要前馈计算的是被路由激活的专家参数;未被激活的专家不会直接影响当前 token 的输出。但这些未激活参数并不是无用的,它们构成了模型面对其他 token 时可以调用的能力储备。

你看这几个目前最为极致的案例:

DeepSeek-V4-pro:一共 1.6T 的模型,每次只激活 49B。这个激活参数比 Qwen3.8-27B(27B)其实大不了很多

你会发现,它们的激活参数往往都在几十 B 左右。因为这种如此巨大的模型要运行的话,如果全量运行,那它的生成速度会惨不忍睹。只有这种形式,才能够保证性能和成本的平衡。

而我的猜想就是,因为现在测试或衡量模型能力的主要维度其实就是 Agent(Agent 其实就变成了之前的“做题”)。如果这个 Agent 的任务局限在某一个领域的话,那么对于这种巨大模型来说,每一次做任务时,真正执行并生成参数的那块神经网络集群其实是高度固定的。

因为你要是做代码任务,极不可能会用到写诗或者法律等方面的能力,极大可能只会用到代码能力以及调用工具的能力。在每次所使用的能力属性都差不多的前提下,其实这种特别小的模型是有优势的。因为特别小的模型可以把数据链彻底集中在 Agent 和 Coding 这类做事能力上,把其他方面的能力舍弃掉。

那是不是也有可能,大家在运行这种 Dense 模型和 MoE 模型时,在相对窄的任务中,模型的路由分布可能更加集中,代码、规划、工具调用等相关专家被反复调用的概率更高。但这仍然是一种任务相关的统计倾向,而不是固定不变的参数子网络,所以产生的性能差距并不会像模型参数本身的差距那么大?也就是说,几十倍的模型参数差距,并不能带来几十倍的性能提升,实际的提升幅度相对来说是比较一般的?

因此,上一个阶段的测试纯粹就是大模型的个人实力;而现在的测试,其实并不是一个单独的模型就能够实现的,它是一套

模型 + 工具 + harness + 推理预算 + 验证机制。

这也是为什么小模型有机会在某个方向上跑出来。它可以放弃一部分冷门知识和泛化能力,把训练数据集中到代码、终端、浏览器、办公软件或某个行业流程里。

只要任务本身比较稳定,外部环境又能提供足够反馈,这种取舍就有可能换来更低的成本和更快的响应。

小模型在局部领域加特定任务,是有可能在后训练Agent时代异军突起的

  • 发表于:
  • 原文链接https://page.om.qq.com/page/OppNPVisFI2m0BO_nptkcp5w0
  • 腾讯「腾讯云开发者社区」是腾讯内容开放平台帐号(企鹅号)传播渠道之一,根据《腾讯内容开放平台服务协议》转载发布内容。
  • 如有侵权,请联系 cloudcommunity@tencent.com 删除。

相关快讯

领券