随着智能体(Agent)应用的落地,如何在本地环境中高效部署大模型成为开发者关注的焦点。
近期一项针对Qwen3.5全系列模型的严格测试显示,在Agent核心的工具调用能力上,参数规模为27B的稠密模型(Dense)表现优于参数量高达397B的混合专家模型(MOE)。
01测试背景与框架设计
为了准确评估不同参数量级模型在Agent场景下的实际表现,测试者构建了一套标准化的评估框架。该框架设定了15个具体场景,配置了12种不同的工具,并严格控制温度为0,使用模拟响应。这种设计消除了随机性,确保了实验结果的稳定与可复现,专门用于测试本地模型的工具调用准确性。
02实测结果:27B模型通过率最高
Qwen3.5系列模型工具调用测试结果对比
测试结果显示,参数较小的27B稠密模型是唯一通过全部测试的型号。相比之下,参数量更大的MOE模型(35B、122B、397B)均出现了不同程度的失误。部分参数更小的模型甚至出现了死循环超时的情况。
03失败案例分析:工具调用的信任危机
导致所有大参数MOE模型“全军覆没”的关键测试题为:“搜索冰岛的人口并计算其中2%是多少”。在这个简单的计算任务中,35B、122B和397B模型均无视了搜索工具返回的精确数据,转而调用记忆中的概略数字进行计算。这表明大模型虽然调用了工具,却并不信任工具的输出。
模型表现对比
27B Dense模型
倾向于编造数据(幻觉)
能够忠实地传递工具数据
将实际搜索结果展示给用户
大参数MOE模型
倾向于无视工具数据
过度依赖内部记忆数据
使用概略数字替代精确结果
04技术原理:MOE与Dense的结构差异
测试结果的核心原因在于模型架构的差异。Qwen3.5系列分为Dense(稠密)和MOE(混合专家)两种架构。Dense模型在生成每个Token时,全部参数都会参与计算;而MOE模型虽然总参数量巨大,但每次推理只激活其中一小部分专家网络。
Dense与MOE架构关键参数对比
虽然397B的MOE模型参数量惊人,但实际参与推理的参数仅约17B。在需要精确追踪上下文和数据传递的Agent场景中,若关键时刻所需专家未被激活,就会导致错误。相比之下,27B的Dense模型“全员出动”,实际参与计算的参数量更多,且层数更深、注意力机制占比更大,天然在追踪上下文方面具有结构性优势。
05选购建议:复杂任务首选稠密模型
MOE模型优势:生成速度更快,推理更省算力,适合日常简单任务。
Dense模型优势:在指令识别、上下文保持和数据传递准确性上表现更好,适合执行复杂的Agent任务。
目前公认在Agent领域表现最强的闭源模型Claude以及本次测试中表现最好的开源模型,均采用的是Dense稠密架构。这表明在处理复杂逻辑和工具调用时,稠密模型具有不可忽视的结构性优势。
附录:Agent背景下几个DS比较
简单尝试几个DeepSeek本地模型,效果都不好
结合自己的硬件性能
网上推荐Agent模型
Qwen3.6技术选型:27B稠密对比35B MoE怎么选?
在复杂编程与 Agent 场景,27B 稠密模型依然是首选;如果更看重本地硬件利用率和响应速度,35B-A3B MoE 用极低的激活参数就逼近了前者的表现,效率非常出众。
架构差异:两种计算哲学的体现
要理解这两款模型,得先看它们的参数调度方式。
Qwen3.6-27B 是标准的稠密结构,270 亿参数在每一次前向计算时全量参与。可以想象成一支满编乐团,不论演奏什么曲目,所有乐手都会协同发声。好处是任何知识、推理路径随时可用,不存在“没叫到”的专家。
Qwen3.6-35B-A3B 则走了 MoE 路线。总参数量有 350 亿,但每次推理仅激活大约 30 亿参数。内部包含 256 个专家模块,每个 token 只路由到其中 8 个外加一个共享专家。这好比一个庞大的专家顾问池,每次任务只按需调配几位核心成员,大幅降低了计算开销。
稠密模型的强项在于参数利用效率极高,稠密激活让模型在各种陌生任务上表现更稳。MoE 的精髓不在于单次更强,而在于用更少的实际算力实现了丰富的多能力组合——用约 30 亿激活参数就跑出了接近 270 亿稠密模型的性能,这才是它最吸引人的地方。
基准评测:能力差距反映在哪些任务上
光看架构还不够,直接拉官方及社区基准数据。
编程与 Agent 能力
这一块是两款模型拉开距离的核心区域。复杂编程和工具调用要求模型兼具意图理解、路径规划和长程执行能力,稠密模型的优势很明显。
SWE-bench Verified:27B 拿到 77.2%,35B-A3B 为 73.4%,差距 3.8 个百分点。
Terminal-Bench 2.0:27B 达 59.3%,35B-A3B 为 51.5%,差距 7.8 个百分点。
SkillsBench 平均分:27B 为 48.2%,35B-A3B 仅 28.7%,差距近 20 个百分点,说明在强 Agent 任务上稠密模型的规划与工具编排能力更为扎实。
Claw-Eval Pass³:27B 取得 60.6%,35B-A3B 停留在 50.0%。
显然,越需要深度推理和复杂操作的场景,27B 越能站住脚。
知识与推理
在语言理解、学科知识及数学推理等任务上,两者差距缩小,但 27B 依然小幅领先。
MMLU-Pro:27B 86.2% 对 35B-A3B 85.2%
C-Eval:91.4% 对 90.0%
GPQA Diamond:87.8% 对 86.0%
AIME 2026:94.1% 对 92.7%
LiveCodeBench v6:83.9% 对 80.4%
第三方综合评测平台给出的分数也印证了这一点:27B 综合得分 73,35B-A3B 为 67,约 6 分的整体差距。差距主要集中在 Agent 和编码维度,多模态能力则旗鼓相当。
实测速度:量化部署后的真实体感
对于把模型跑在本地的开发者,生成速度直接决定使用体验。基于 4-bit 量化(如 Q4_K_M),两张卡都能塞进 24GB 显存,但出字速率完全不同。
在 RTX 3090 上:
35B-A3B Q4 量化模型生成速度约 50–65 tok/s,经优化参数可拉到 90 tok/s 以上,显存占用约 21 GB。
27B Q4 量化约 32–40 tok/s,显存占用约 17 GB。
升级到 RTX 4090:
35B-A3B Q4 速度普遍落在 100–122 tok/s,仍约 21 GB 显存。
27B Q4 约 32 tok/s 左右。
RTX 5090 凭借更大带宽,27B Q4 可跑到约 80 tok/s,但 35B-A3B 的响应依然快出一大截。
总体来看,同等条件下 MoE 模型的推理速度大约是稠密模型的三倍,这与它每次只激活 30 亿参数直接相关。速度优势在日常交互、批量任务场景感受极其明显。
选型建议与便捷接入
基于以上对比,选择并不复杂:
侧重 27B 稠密模型 的场景:
重型编程、多步 Agent 工作流
需要深层推理和精确规划
对生成延迟容忍度较高,更看重输出质量
侧重 35B-A3B MoE 模型 的场景:
需要快速实时交互
任务相对标准化、轻量级
硬件资源有限,想在消费级显卡甚至 MacBook 上流畅运行
优先考虑吞吐量而非极限质量
有社区反馈印证了这一取向:从 35B 换到 27B 的开发者提到,“35B 任务完成更快,但 27B 对项目结构的理解明显更深”;反之,追求日常查询响应速度的用户则认为 35B 完全够用。本质上就是在“6 分的综合能力差”和“约 3 倍速度差”之间做权衡。
Qwen本地模型选型
最佳模型
fuliucansheng/qwen3.6-27b-bf16:latest
适合Mac
最佳上下文
satgeze/qwen36-35b-uncensored-1m:q4_k_m-no-mtp
通用官方版本
gngai8/qwen3.6-27b-instruct:latest
Qwen 官方发布的通用版本。虽然可以使用,但它的推荐参数(如温度、top_p)和上下文窗口设置可能需要你根据自己的硬件手动调整,以确保在24GB显存上稳定运行。
最佳适配显卡
这是一个“懒人包”。作者专门为24GB显存的RTX 4090调整了最佳实践参数,它的目标就是让你开箱即用,无需自己调参。
ollama run odytrice/qwen3.6:4090-27b
移除限制
Jarcgon/qwen3.6-abliterated-27b:latest
和通用官方的主要区别是
fredrezones55/Qwen3.6-27B-Uncensored-HauhauCS-Balanced:IQ4_XS
纯文本
science, instruction-following, and mathematics.
Qwen3.5-27B-Claude-4.6-Opus-Reasoning-Distilled-GGUF:latest
Q — 质量递增
richardyoung/qwen3.6-27b-abliterated:Q8_0
去除审查
its_the_jisoo/qwen3.6-27b-uncensored-hauhaucs-aggressive:latest
its_the_jisoo/qwen3.6-27b-uncensored-hauhaucs-balanced:latest
VladimirGav/Qwen3.6-27B-16GB-VRAM-Uncensored:latest
——The End——
记得点赞、分享,让更多的朋友一起探索这个IT世界的新篇章!
AIGC周边正在发布,关注生活,冻龄青春
推荐阅读
【Agent】医院agent:具有可进化医疗agent的医院模拟器
【Agent】COZE应用的灵魂,90+高质量prompt,一次带走
【Agent】AI智能体(Agent)能力定义与分级:L0-L5,揭秘AI智能体的进化之路
【Agent】Coze(扣子)一个国内版的类GPTs,使用指南(入门篇)