
2.8 万亿参数是 Kimi K3 最醒目的数字,但 896 个专家中每个 Token 只选择 16 个,才是更值得关注的架构跃迁。它意味着开放模型第一次把 MoE 推进到接近千专家的公开规模,并围绕路由、通信、低精度、缓存和 Agent 运行时完成系统级协同。K3 的真正目标,不是让一次回答更便宜,而是让模型能够以可接受的成本完成更长、更复杂、更有商业价值的任务。

一页看懂 Kimi K3 的六个突破:2.8T 参数、896 个专家选择 16 个、百万上下文、2.5 倍扩展效率、MXFP4 与 MXFP8 低精度共设计、64 个以上加速器超节点
这六个突破不是并列的功能清单,而是一条因果链:长任务需要更长上下文,更长上下文要求更低的计算与缓存成本;更大能力容量需要高稀疏 MoE,高稀疏 MoE 又要求更稳定的路由、更大的通信域和更早介入的低精度设计;最后,所有优化都必须在 Agent 工作流中转化为任务完成率和单位任务成本。

Kimi K3 官方总体架构:Stable LatentMoE、KDA、Gated MLA 与 Block Attention Residuals
左侧展开 Stable LatentMoE 与 KDA,右侧展示 KDA、Gated MLA 以及跨层 Block Attention Residuals。来源:Kimi K3 官方技术博客。
K3 最有辨识度的架构数字不是 2.8T,而是 896/16:模型拥有 896 个路由专家,但每个 Token 只选择其中 16 个。按专家数量计算,单次选择比例约为 **1.8%**。这不是“全模型参数激活率”,但它直观反映了 K3 的专家稀疏度。
把 K3 放进几代代表性开放 MoE 中,量级跃迁会更清楚:
模型 | 路由/模型专家数 | 每 Token 选择专家数 | 专家数量相对 K3 |
|---|---|---|---|
Qwen3-235B-A22B | 128 | 8 | K3 为 7× |
DeepSeek-V3 | 256 | 8 | K3 为 3.5× |
Kimi K2 | 384 | 8 | K3 为 2.33× |
Kimi K3 | 896 | 16 | — |
数据来源:Qwen3-235B-A22B 官方配置、DeepSeek-V3-0324 官方配置、Kimi K2 官方模型卡与 Kimi K3 官方技术博客。不同模型对共享专家、路由专家的定义并不完全相同,因此该表用于比较公开架构量级,不用于推导模型能力高低。
从官方可核验的公开架构看,K3 把 K2 的 384 个专家提高到了 896 个,并显著超过 DeepSeek-V3 与 Qwen3 的公开配置。由此可以把 K3 视为公开主流 MoE 首次进入接近千专家的规模:这不仅刷新了专家数量,也把 MoE 的路由与并行问题推进到了一个新的工程量级。
但边界也要说清:月之暗面官方目前明确宣称的是“首个达到 2.8T 参数的开放模型”,并未把“896 专家全球第一”写成经过统一口径审计的世界纪录;K3 完整技术报告也尚未发布。因此,“业界第一次进入这一规模”更准确地说是基于公开主流架构比较形成的行业结论,而不是官方认证纪录。
专家数量从 384 增加到 896,并非简单扩容。MoE 的收益来自“总容量大、单次激活少”,代价则是三个系统问题被同步放大:
K3 不是只给出 896 这个数字,而是配套引入 Stable LatentMoE、Quantile Balancing 和全平衡专家并行。Quantile Balancing 直接从路由分数的分位点推导专家分配,减少启发式更新和敏感平衡超参数;训练侧使用静态形状,并让关键路径避免主机同步。Per-Head Muon、SiTU 与 Gated MLA 则进一步服务于超大规模下的训练稳定和选择性控制。
这才是 896 个专家的突破所在:它把近千专家从理论容量变成了能够被训练、路由、通信和部署的系统容量。
业务上也不应把 896 个专家机械理解为 896 个行业岗位。专家通常是训练中涌现的计算子网络,并不会天然一一对应“医疗专家”“金融专家”或“代码专家”。它真正提供的是更大的能力容量池,以及让不同 Token 走不同计算路径的空间。能否形成垂直行业价值,仍然取决于企业数据、Agent 流程、评估体系和持续运营。
高稀疏 MoE 节省的是每次都计算全部参数的成本,却会增加跨设备搬运数据的成本。专家越多,系统越容易从“算不动”变成“搬不动”。
K3 官方建议使用 64 个以上加速器组成的大通信域超节点。这不是普通部署建议,而是一个架构信号:模型的设计边界已经从单颗芯片扩展到整套互联拓扑。
这代表了一种重要的竞争逻辑变化:面对受限算力,竞争焦点可以从单卡能力转向超节点效率。随着专家数量增加,K3 的主要瓶颈也从单纯的 FLOPs 扩展到通信、存储和调度。具体的 FLOPs、通信与存储占比目前没有官方消融数据支撑,不宜做精确量化;但这种“瓶颈迁移”的方向,与全平衡专家并行和 64+ 加速器的官方建议高度一致。K3 的意义,正在于把模型、硬件拓扑和推理系统连接起来,跑通超大 MoE 从训练到服务的工程闭环。
这对产业竞争有三层影响:
因此,K3 的开放不是把全部商业价值交给权重文件,而是把价值边界从“有没有模型”推向“能不能把模型高效跑起来”。
Agent 的上下文不是一篇长文章,而是不断增长的工作现场:代码、终端输出、网页、图像、工具调用、失败记录和历史思考会持续累积。上下文窗口达到 100 万 Token,如果每一步都要付出接近全注意力的计算和缓存成本,产品上仍然很难长时间使用。
K3 用两条相互补充的路径改造信息流:

Kimi Linear 的性能与解码效率对比
Kimi Linear 研究模型的性能—速度权衡。右图报告其在 100 万 Token 场景相对 MLA 达到 6.3× 的 TPOT 改善。来源:Kimi Linear 官方论文与仓库。该结果解释 KDA 路线的效率潜力,但不能直接等同于 K3 线上服务的端到端加速。

标准残差、完整 Attention Residuals 与 Block Attention Residuals 对比
红色路径表示当前层可选择性聚合更早的深度表示。来源:Attention Residuals 官方论文与仓库。
从业务直觉看,长任务的关键是让第一个 Token 与最后一个 Token 之间仍能保持有效联系:模型既要把更长历史装进来,也要让深层网络真正使用这些信息。但从技术证据看,不能把 AttnRes 单独等同于“解决百万上下文记忆漂移”。更准确的说法是:KDA 主要处理序列效率,AttnRes 主要处理深度信息聚合,两者共同为长任务提供更好的成本和表示基础。
对业务而言,这意味着模型可以少做“为了省上下文而摘要上下文”的工作,让更多原始代码、文档和执行记录留在现场。长上下文由此从营销参数转化为三种生产能力:
传统模型流程通常先以较高精度完成训练,再在部署阶段做量化。对于 2.8T 参数模型,这种顺序的风险很高:如果模型训练完成后才发现低精度损失过大,部署成本可能从一开始就不可接受。
K3 从 SFT 阶段开始进行量化感知训练,使用 MXFP4 权重与 MXFP8 激活。这说明硬件兼容性、内存占用和通信成本不再是模型完成后的工程收尾,而是提前进入后训练目标。
它带来的架构变化是:
因此,K3 更多是一项系统创新:任何一个单点都不足以解释约 2.5× 的整体扩展效率,真正的增益来自模型结构、训练方法、硬件形态、缓存与推理系统的组合。可以从模型层、推理硬件和缓存系统三个方向理解其效率来源,但目前并没有官方归因数据,不能把各部分贡献写成精确比例。
长任务会反复读取相同的代码库、文档和历史状态。如果每轮请求都重新 Prefill,100 万上下文很快会变成成本负担。
K3 针对 KDA 与传统前缀缓存的不兼容问题,为 vLLM 提供 KDA Prefill Cache 实现;服务侧则延续 Mooncake 的 KVCache 中心化分离式架构,把 Prefill 与 Decode 拆分到不同资源池,并利用 CPU、DRAM、SSD 和高速网络形成分级缓存。

Mooncake KVCache 中心化分离式推理架构
Prefill 与 Decode 使用不同资源池,并通过分布式 KVCache Pool 复用状态。来源:Mooncake 官方论文与仓库。
K3 官方披露,其 API 编程负载的缓存命中率超过 90%,缓存命中输入价格为 0.30 美元/百万 Token,未命中输入为 3 美元,输出为 15 美元。90% 不能外推到所有工作负载,但 10 倍的命中/未命中输入价差已经表明:缓存命中率被直接写进了产品单位经济性。
这会改变企业使用模型的最佳方式。企业不再只是压缩单次 Prompt,而是要经营可复用上下文:稳定的代码仓库前缀、标准化行业资料、长期项目空间和连续 Agent 会话,都可能成为降低成本、提高一致性的资产。
K3 官方展示的 Kimi Code Bench V2,不只比较模型得分,也比较完成单个任务的成本。这比“每百万 Token 多少钱”更接近 Agent 产品的真实商业指标。

Kimi Code Bench V2:模型得分与单任务成本对比
来源:Kimi K3 官方技术博客。该图来自 Kimi 内部评测,且不同模型采用的 Agent Harness 并不完全一致,不应视为独立第三方排名。
在对话产品中,成本大致等于输入 Token 加输出 Token;在 Agent 产品中,真实成本还包括失败重试、工具调用、环境执行、上下文重建、人类接管和返工。一个 Token 单价较低但经常失败的模型,完成任务的总成本可能更高。
因此,K3 的商业闭环可以被概括为:

Kimi K3 的商业闭环:开放权重、生态分发、官方运行时、企业工作流与商业变现,由系统架构引擎共同驱动
这套商业逻辑并不复杂:开放权重先吸引用户和生态,但企业未必能自行复现最佳部署效果;真正的收入机会更可能来自 Kimi Code、Kimi Work、API、企业数据与 Agent 工作流。由此看,B 端的业务流程改造与企业服务,比单纯依靠 C 端订阅更关键。
这并不意味着权重不重要,而是价值栈变长了:
开放权重负责分发,模型架构负责能力,推理系统负责成本,Agent 运行时负责完成任务,企业工作流负责创造收入。
896 个专家的价值不在“多”,而在于 16 个专家能否被稳定选中、及时通信、低成本执行。未来的大模型规模竞争,会越来越关注有效容量、路由质量和系统吞吐,而不是只看参数总量。
当高稀疏 MoE 把瓶颈推向通信和存储,单卡峰值 FLOPs 的解释力下降,互联拓扑、内存系统、专家调度和低精度内核成为新的护城河。
K3 官方提醒,模型依赖完整思考历史;如果 Agent 框架不能按要求回传历史内容,或在会话中途切换模型,质量可能波动。这首先是限制,却也说明前沿模型正在从无状态 API 变成与上下文协议、工具运行时和缓存系统深度耦合的生产系统。
企业最终购买的不是 Token,而是代码被合并、报告被验证、设计被完成、流程被自动化。模型得分、工具成功率、缓存命中率、任务时长和人类返工需要进入同一张经营报表。
K3 的突破值得 Highlight,但不应把发布材料扩大成尚未证实的结论。截至 2026 年 7 月 21 日:
2.8T 证明开放模型仍在扩大规模,896/16 则揭示了规模扩张的新方式:让总容量继续增长,但让每次计算保持稀疏;用更复杂的路由换取更高的能力上限,再用全平衡专家并行、超节点、低精度和缓存把复杂性重新压回可交付的系统成本。
这就是 K3 最值得重视的突破。
从架构视角看,它把 KDA、AttnRes、近千专家 MoE、量化感知训练和分离式推理组织成一套面向长任务的技术栈;从业务视角看,它试图把开放模型、官方运行时和企业工作流连接起来,把竞争单位从 Token 升级为任务。
“更多是一项系统创新”,比任何单一指标都更接近 K3 的本质:未来的大模型领先,不只取决于谁拥有更大的模型,而取决于谁能把模型、算力、通信、缓存和产品组织成一套更高效的智能生产系统。
从全球竞争格局看,一款 K3 还不足以终结美国在 AI 产业中的系统性主导。美国的优势不只来自模型能力,还建立在高端芯片、先进制造、云计算平台、资本投入、开发者工具和全球企业入口之上。月之暗面也明确承认,K3 的整体能力仍落后于最强的美国闭源模型。因此,把一次模型发布直接等同于“打破美国 AI 垄断”,既低估了全栈竞争的复杂性,也会掩盖 K3 真正重要的地方。
K3 首先改变的是前沿模型只能由美国闭源体系定义的认知。斯坦福大学《2026 AI Index》认为,中美头部模型的性能差距已经实质性收敛;K3 又进一步证明,中国团队不仅能够在单项基准上追赶,也能把 2.8T 开放模型、近千专家 MoE、百万上下文和超节点推理组织成一套完整技术体系。
其次,K3 提供了美国闭源 API 之外的另一种全球供给方式。开放权重允许开发者研究、部署和二次优化模型,企业也可以围绕数据主权、成本和本地化选择自己的技术路径。它未必立即取代最强闭源模型,却会削弱前沿能力的稀缺性与价格溢价,让更多国家和企业不必把智能基础设施完全绑定在少数美国平台上。
更重要的是,K3 展示了一条不同于单纯堆叠最先进芯片的竞争路线:在单卡资源受限时,通过高稀疏 MoE、低精度训练、全平衡专家并行、缓存和超节点互联提升整套系统的效率。这条路线能否最终形成独立、可持续的技术生态,仍取决于芯片、软件栈、云平台和企业应用的持续建设。
资本与基础设施差距也不能忽略。《2026 AI Index》统计的 2025 年私人 AI 投资中,美国约为 2859 亿美元,中国约为 124 亿美元。模型性能差距的缩小,并不意味着产业资源差距已经消失。真正改变全球格局,需要连续多代模型、国产计算平台、开源工具链和商业应用共同形成正循环,而不是依靠一次发布完成。
因此,K3 的全球意义不是“一个模型击败美国”,而是证明全球 AI 竞争已经出现第二套可行路径:
美国仍然拥有强大的全栈优势,但前沿智能不再只有美国闭源模型这一种答案。中国正在用开放权重、系统效率和超节点架构,争夺下一代 AI 技术体系的定义权。