首页
学习
活动
专区
圈层
工具
发布
社区首页 >专栏 >美国掌握芯片,中国争夺开放生态: Kimi K3 把大模型竞争推向系统架构时代

美国掌握芯片,中国争夺开放生态: Kimi K3 把大模型竞争推向系统架构时代

作者头像
anzhsoft
发布2026-07-23 20:58:23
发布2026-07-23 20:58:23
1130
举报

2.8 万亿参数是 Kimi K3 最醒目的数字,但 896 个专家中每个 Token 只选择 16 个,才是更值得关注的架构跃迁。它意味着开放模型第一次把 MoE 推进到接近千专家的公开规模,并围绕路由、通信、低精度、缓存和 Agent 运行时完成系统级协同。K3 的真正目标,不是让一次回答更便宜,而是让模型能够以可接受的成本完成更长、更复杂、更有商业价值的任务。

一页看懂 K3 的六个突破

一页看懂 Kimi K3 的六个突破:2.8T 参数、896 个专家选择 16 个、百万上下文、2.5 倍扩展效率、MXFP4 与 MXFP8 低精度共设计、64 个以上加速器超节点

这六个突破不是并列的功能清单,而是一条因果链:长任务需要更长上下文,更长上下文要求更低的计算与缓存成本;更大能力容量需要高稀疏 MoE,高稀疏 MoE 又要求更稳定的路由、更大的通信域和更早介入的低精度设计;最后,所有优化都必须在 Agent 工作流中转化为任务完成率和单位任务成本。

Kimi K3 官方总体架构:Stable LatentMoE、KDA、Gated MLA 与 Block Attention Residuals

左侧展开 Stable LatentMoE 与 KDA,右侧展示 KDA、Gated MLA 以及跨层 Block Attention Residuals。来源:Kimi K3 官方技术博客。

突破一:896 个专家,MoE 第一次走到“近千专家”公开规模

K3 最有辨识度的架构数字不是 2.8T,而是 896/16:模型拥有 896 个路由专家,但每个 Token 只选择其中 16 个。按专家数量计算,单次选择比例约为 **1.8%**。这不是“全模型参数激活率”,但它直观反映了 K3 的专家稀疏度。

把 K3 放进几代代表性开放 MoE 中,量级跃迁会更清楚:

模型

路由/模型专家数

每 Token 选择专家数

专家数量相对 K3

Qwen3-235B-A22B

128

8

K3 为 7×

DeepSeek-V3

256

8

K3 为 3.5×

Kimi K2

384

8

K3 为 2.33×

Kimi K3

896

16

数据来源:Qwen3-235B-A22B 官方配置、DeepSeek-V3-0324 官方配置、Kimi K2 官方模型卡与 Kimi K3 官方技术博客。不同模型对共享专家、路由专家的定义并不完全相同,因此该表用于比较公开架构量级,不用于推导模型能力高低。

从官方可核验的公开架构看,K3 把 K2 的 384 个专家提高到了 896 个,并显著超过 DeepSeek-V3 与 Qwen3 的公开配置。由此可以把 K3 视为公开主流 MoE 首次进入接近千专家的规模:这不仅刷新了专家数量,也把 MoE 的路由与并行问题推进到了一个新的工程量级。

但边界也要说清:月之暗面官方目前明确宣称的是“首个达到 2.8T 参数的开放模型”,并未把“896 专家全球第一”写成经过统一口径审计的世界纪录;K3 完整技术报告也尚未发布。因此,“业界第一次进入这一规模”更准确地说是基于公开主流架构比较形成的行业结论,而不是官方认证纪录。

896 的难点,不是把更多专家写进配置文件

专家数量从 384 增加到 896,并非简单扩容。MoE 的收益来自“总容量大、单次激活少”,代价则是三个系统问题被同步放大:

  1. 路由稳定性:Token 如果持续拥向少数专家,会造成热点、排队和训练失衡;
  2. 通信开销:16 个被选专家可能分散在不同设备上,All-to-All 通信开始主导时延;
  3. 硬件利用率:不同专家负载不均,会让一部分设备繁忙、另一部分设备空转。

K3 不是只给出 896 这个数字,而是配套引入 Stable LatentMoE、Quantile Balancing 和全平衡专家并行。Quantile Balancing 直接从路由分数的分位点推导专家分配,减少启发式更新和敏感平衡超参数;训练侧使用静态形状,并让关键路径避免主机同步。Per-Head Muon、SiTU 与 Gated MLA 则进一步服务于超大规模下的训练稳定和选择性控制。

这才是 896 个专家的突破所在:它把近千专家从理论容量变成了能够被训练、路由、通信和部署的系统容量。

业务上也不应把 896 个专家机械理解为 896 个行业岗位。专家通常是训练中涌现的计算子网络,并不会天然一一对应“医疗专家”“金融专家”或“代码专家”。它真正提供的是更大的能力容量池,以及让不同 Token 走不同计算路径的空间。能否形成垂直行业价值,仍然取决于企业数据、Agent 流程、评估体系和持续运营。

突破二:从“比单卡”到“比超节点”,硬件拓扑成为模型架构的一部分

高稀疏 MoE 节省的是每次都计算全部参数的成本,却会增加跨设备搬运数据的成本。专家越多,系统越容易从“算不动”变成“搬不动”。

K3 官方建议使用 64 个以上加速器组成的大通信域超节点。这不是普通部署建议,而是一个架构信号:模型的设计边界已经从单颗芯片扩展到整套互联拓扑。

这代表了一种重要的竞争逻辑变化:面对受限算力,竞争焦点可以从单卡能力转向超节点效率。随着专家数量增加,K3 的主要瓶颈也从单纯的 FLOPs 扩展到通信、存储和调度。具体的 FLOPs、通信与存储占比目前没有官方消融数据支撑,不宜做精确量化;但这种“瓶颈迁移”的方向,与全平衡专家并行和 64+ 加速器的官方建议高度一致。K3 的意义,正在于把模型、硬件拓扑和推理系统连接起来,跑通超大 MoE 从训练到服务的工程闭环。

这对产业竞争有三层影响:

  • 模型竞争变成系统竞争:芯片峰值算力不再足以解释真实吞吐,互联带宽、内存层级和调度软件同样关键;
  • 国产算力出现新的追赶维度:当单卡性能受限时,可以通过超节点通信域、低精度和系统软件提高整机效率;
  • 企业私有化门槛重新定义:拿到开放权重不等于复现官方效果,部署团队还必须掌握专家并行、缓存、内核和集群调优。

因此,K3 的开放不是把全部商业价值交给权重文件,而是把价值边界从“有没有模型”推向“能不能把模型高效跑起来”。

突破三:100 万上下文不再只是窗口参数,而是长任务基础设施

Agent 的上下文不是一篇长文章,而是不断增长的工作现场:代码、终端输出、网页、图像、工具调用、失败记录和历史思考会持续累积。上下文窗口达到 100 万 Token,如果每一步都要付出接近全注意力的计算和缓存成本,产品上仍然很难长时间使用。

K3 用两条相互补充的路径改造信息流:

  • KDA 改造序列的时间维度:以线性注意力状态降低长序列计算和 KV Cache 压力,再用 Gated MLA 保留选择性的全局注意力能力;
  • Attention Residuals 改造网络的深度维度:让当前层可以自适应选择此前层的表示,而不是沿固定残差路径不断累加。

Kimi Linear 的性能与解码效率对比

Kimi Linear 研究模型的性能—速度权衡。右图报告其在 100 万 Token 场景相对 MLA 达到 6.3× 的 TPOT 改善。来源:Kimi Linear 官方论文与仓库。该结果解释 KDA 路线的效率潜力,但不能直接等同于 K3 线上服务的端到端加速。

标准残差、完整 Attention Residuals 与 Block Attention Residuals 对比

红色路径表示当前层可选择性聚合更早的深度表示。来源:Attention Residuals 官方论文与仓库。

从业务直觉看,长任务的关键是让第一个 Token 与最后一个 Token 之间仍能保持有效联系:模型既要把更长历史装进来,也要让深层网络真正使用这些信息。但从技术证据看,不能把 AttnRes 单独等同于“解决百万上下文记忆漂移”。更准确的说法是:KDA 主要处理序列效率,AttnRes 主要处理深度信息聚合,两者共同为长任务提供更好的成本和表示基础。

对业务而言,这意味着模型可以少做“为了省上下文而摘要上下文”的工作,让更多原始代码、文档和执行记录留在现场。长上下文由此从营销参数转化为三种生产能力:

  1. 更少的信息切片与上下文重建;
  2. 更低的历史状态丢失和重复检索成本;
  3. 更长时间保持任务目标、约束和错误修正链路。

突破四:低精度从部署补丁,变成训练目标

传统模型流程通常先以较高精度完成训练,再在部署阶段做量化。对于 2.8T 参数模型,这种顺序的风险很高:如果模型训练完成后才发现低精度损失过大,部署成本可能从一开始就不可接受。

K3 从 SFT 阶段开始进行量化感知训练,使用 MXFP4 权重与 MXFP8 激活。这说明硬件兼容性、内存占用和通信成本不再是模型完成后的工程收尾,而是提前进入后训练目标。

它带来的架构变化是:

  • 模型团队必须在能力与低精度稳定性之间联合优化;
  • 系统团队可以围绕更小的权重与激活设计通信和显存方案;
  • 产品团队可以更早估算真实服务成本,而不是只看训练跑分。

因此,K3 更多是一项系统创新:任何一个单点都不足以解释约 2.5× 的整体扩展效率,真正的增益来自模型结构、训练方法、硬件形态、缓存与推理系统的组合。可以从模型层、推理硬件和缓存系统三个方向理解其效率来源,但目前并没有官方归因数据,不能把各部分贡献写成精确比例。

突破五:缓存成为产品定价层,而不是后台优化

长任务会反复读取相同的代码库、文档和历史状态。如果每轮请求都重新 Prefill,100 万上下文很快会变成成本负担。

K3 针对 KDA 与传统前缀缓存的不兼容问题,为 vLLM 提供 KDA Prefill Cache 实现;服务侧则延续 Mooncake 的 KVCache 中心化分离式架构,把 Prefill 与 Decode 拆分到不同资源池,并利用 CPU、DRAM、SSD 和高速网络形成分级缓存。

Mooncake KVCache 中心化分离式推理架构

Prefill 与 Decode 使用不同资源池,并通过分布式 KVCache Pool 复用状态。来源:Mooncake 官方论文与仓库。

K3 官方披露,其 API 编程负载的缓存命中率超过 90%,缓存命中输入价格为 0.30 美元/百万 Token,未命中输入为 3 美元,输出为 15 美元。90% 不能外推到所有工作负载,但 10 倍的命中/未命中输入价差已经表明:缓存命中率被直接写进了产品单位经济性。

这会改变企业使用模型的最佳方式。企业不再只是压缩单次 Prompt,而是要经营可复用上下文:稳定的代码仓库前缀、标准化行业资料、长期项目空间和连续 Agent 会话,都可能成为降低成本、提高一致性的资产。

突破六:从 Token 经济学转向任务经济学

K3 官方展示的 Kimi Code Bench V2,不只比较模型得分,也比较完成单个任务的成本。这比“每百万 Token 多少钱”更接近 Agent 产品的真实商业指标。

Kimi Code Bench V2:模型得分与单任务成本对比

来源:Kimi K3 官方技术博客。该图来自 Kimi 内部评测,且不同模型采用的 Agent Harness 并不完全一致,不应视为独立第三方排名。

在对话产品中,成本大致等于输入 Token 加输出 Token;在 Agent 产品中,真实成本还包括失败重试、工具调用、环境执行、上下文重建、人类接管和返工。一个 Token 单价较低但经常失败的模型,完成任务的总成本可能更高。

因此,K3 的商业闭环可以被概括为:

Kimi K3 的商业闭环:开放权重、生态分发、官方运行时、企业工作流与商业变现,由系统架构引擎共同驱动

这套商业逻辑并不复杂:开放权重先吸引用户和生态,但企业未必能自行复现最佳部署效果;真正的收入机会更可能来自 Kimi Code、Kimi Work、API、企业数据与 Agent 工作流。由此看,B 端的业务流程改造与企业服务,比单纯依靠 C 端订阅更关键。

这并不意味着权重不重要,而是价值栈变长了:

开放权重负责分发,模型架构负责能力,推理系统负责成本,Agent 运行时负责完成任务,企业工作流负责创造收入。

K3 对行业真正改变了什么?

1. 模型规模的含义,从参数总量变成可调度容量

896 个专家的价值不在“多”,而在于 16 个专家能否被稳定选中、及时通信、低成本执行。未来的大模型规模竞争,会越来越关注有效容量、路由质量和系统吞吐,而不是只看参数总量。

2. 算力竞争的单位,从芯片变成超节点

当高稀疏 MoE 把瓶颈推向通信和存储,单卡峰值 FLOPs 的解释力下降,互联拓扑、内存系统、专家调度和低精度内核成为新的护城河。

3. 模型与 Agent Harness 不再完全可分

K3 官方提醒,模型依赖完整思考历史;如果 Agent 框架不能按要求回传历史内容,或在会话中途切换模型,质量可能波动。这首先是限制,却也说明前沿模型正在从无状态 API 变成与上下文协议、工具运行时和缓存系统深度耦合的生产系统。

4. 商业比较单位,从 Token 单价变成任务完成成本

企业最终购买的不是 Token,而是代码被合并、报告被验证、设计被完成、流程被自动化。模型得分、工具成功率、缓存命中率、任务时长和人类返工需要进入同一张经营报表。

必须保留的事实边界

K3 的突破值得 Highlight,但不应把发布材料扩大成尚未证实的结论。截至 2026 年 7 月 21 日:

  • 完整技术报告尚未发布,层级比例、训练数据、消融实验和详细路由机制仍待披露;
  • 完整权重计划于 7 月 27 日前发布,第三方部署表现、许可证细节与实际硬件效率仍待验证;
  • “896 个专家是全球最多、业内第一次”是基于当前公开主流架构比较形成的行业结论;官方可以确认的是 896/16 和首个 2.8T 开放模型;
  • 关于路由是否会结合长期历史状态,以及 FLOPs 占比和不同技术的贡献比例,目前缺少官方材料印证,不应写成确定机制;
  • 官方基准由厂商执行,部分对比模型使用不同 Agent Harness,不能据此简单得出统一的全球排名;
  • 月之暗面也承认,K3 整体能力与最强闭源模型仍有差距,并存在思考历史敏感、行动过于主动和体验仍需改进等问题。

结语:K3 的标志性数字是 896,不只是 2.8T

2.8T 证明开放模型仍在扩大规模,896/16 则揭示了规模扩张的新方式:让总容量继续增长,但让每次计算保持稀疏;用更复杂的路由换取更高的能力上限,再用全平衡专家并行、超节点、低精度和缓存把复杂性重新压回可交付的系统成本。

这就是 K3 最值得重视的突破。

从架构视角看,它把 KDA、AttnRes、近千专家 MoE、量化感知训练和分离式推理组织成一套面向长任务的技术栈;从业务视角看,它试图把开放模型、官方运行时和企业工作流连接起来,把竞争单位从 Token 升级为任务。

“更多是一项系统创新”,比任何单一指标都更接近 K3 的本质:未来的大模型领先,不只取决于谁拥有更大的模型,而取决于谁能把模型、算力、通信、缓存和产品组织成一套更高效的智能生产系统。

放到全球竞争格局中:K3 打破的不是垄断,而是单一路径

从全球竞争格局看,一款 K3 还不足以终结美国在 AI 产业中的系统性主导。美国的优势不只来自模型能力,还建立在高端芯片、先进制造、云计算平台、资本投入、开发者工具和全球企业入口之上。月之暗面也明确承认,K3 的整体能力仍落后于最强的美国闭源模型。因此,把一次模型发布直接等同于“打破美国 AI 垄断”,既低估了全栈竞争的复杂性,也会掩盖 K3 真正重要的地方。

K3 首先改变的是前沿模型只能由美国闭源体系定义的认知。斯坦福大学《2026 AI Index》认为,中美头部模型的性能差距已经实质性收敛;K3 又进一步证明,中国团队不仅能够在单项基准上追赶,也能把 2.8T 开放模型、近千专家 MoE、百万上下文和超节点推理组织成一套完整技术体系。

其次,K3 提供了美国闭源 API 之外的另一种全球供给方式。开放权重允许开发者研究、部署和二次优化模型,企业也可以围绕数据主权、成本和本地化选择自己的技术路径。它未必立即取代最强闭源模型,却会削弱前沿能力的稀缺性与价格溢价,让更多国家和企业不必把智能基础设施完全绑定在少数美国平台上。

更重要的是,K3 展示了一条不同于单纯堆叠最先进芯片的竞争路线:在单卡资源受限时,通过高稀疏 MoE、低精度训练、全平衡专家并行、缓存和超节点互联提升整套系统的效率。这条路线能否最终形成独立、可持续的技术生态,仍取决于芯片、软件栈、云平台和企业应用的持续建设。

资本与基础设施差距也不能忽略。《2026 AI Index》统计的 2025 年私人 AI 投资中,美国约为 2859 亿美元,中国约为 124 亿美元。模型性能差距的缩小,并不意味着产业资源差距已经消失。真正改变全球格局,需要连续多代模型、国产计算平台、开源工具链和商业应用共同形成正循环,而不是依靠一次发布完成。

因此,K3 的全球意义不是“一个模型击败美国”,而是证明全球 AI 竞争已经出现第二套可行路径:

美国仍然拥有强大的全栈优势,但前沿智能不再只有美国闭源模型这一种答案。中国正在用开放权重、系统效率和超节点架构,争夺下一代 AI 技术体系的定义权。

希望中国的模型团队雄起,打破,引导,造福全世界

资料来源

  • Moonshot AI:Kimi K3: Open Frontier Intelligence,2026-07-16
  • Moonshot AI:Kimi K2 官方模型卡
  • DeepSeek AI:DeepSeek-V3-0324 官方模型配置
  • Qwen Team:Qwen3-235B-A22B 官方模型配置
  • Kimi Team:Kimi Linear
  • Kimi Team:Attention Residuals
  • Moonshot AI / 清华大学:Mooncake
  • Stanford HAI:2026 AI Index — Technical Performance
  • Stanford HAI:2026 AI Index — Economy
本文参与 腾讯云自媒体同步曝光计划,分享自微信公众号。
原始发表:2026-07-21,如有侵权请联系 cloudcommunity@tencent.com 删除

本文分享自 训推工坊 微信公众号,前往查看

如有侵权,请联系 cloudcommunity@tencent.com 删除。

本文参与 腾讯云自媒体同步曝光计划  ,欢迎热爱写作的你一起参与!

评论
登录后参与评论
0 条评论
热度
最新
推荐阅读
目录
  • 一页看懂 K3 的六个突破
  • 突破一:896 个专家,MoE 第一次走到“近千专家”公开规模
    • 896 的难点,不是把更多专家写进配置文件
  • 突破二:从“比单卡”到“比超节点”,硬件拓扑成为模型架构的一部分
  • 突破三:100 万上下文不再只是窗口参数,而是长任务基础设施
  • 突破四:低精度从部署补丁,变成训练目标
  • 突破五:缓存成为产品定价层,而不是后台优化
  • 突破六:从 Token 经济学转向任务经济学
  • K3 对行业真正改变了什么?
    • 1. 模型规模的含义,从参数总量变成可调度容量
    • 2. 算力竞争的单位,从芯片变成超节点
    • 3. 模型与 Agent Harness 不再完全可分
    • 4. 商业比较单位,从 Token 单价变成任务完成成本
  • 必须保留的事实边界
  • 结语:K3 的标志性数字是 896,不只是 2.8T
  • 放到全球竞争格局中:K3 打破的不是垄断,而是单一路径
  • 希望中国的模型团队雄起,打破,引导,造福全世界
  • 资料来源
领券
问题归档专栏文章快讯文章归档关键词归档开发者手册归档开发者手册 Section 归档