
前不久智谱刚认领 Ox Alpha,宣布正式发布GLM-5.3-Flash,价格比 DeepSeek V4 Flash 还要低。9月10日 DeepSeek 就发布 V4.1 Flash,依旧是低调发布,只是邮件通知。
大致意思是 V4.1 Flash 性能、费用、速度、总用时等各项指标上全面超越 V4 Pro。V4.1 Flash 正式上线之后 V4.1 Pro 上线之前,V4 Pro 的请求会全部路由到 V4.1 Flash,按 V4.1 Flash 单价计费。

552B 骨干参数 MoE,1M token 上下文,原生多模态,HF 上的 pipeline 标记是 image-text-to-text。官方口径里的 552B 不含另一个 196B 参数的 Engram 记忆模块,那个是稀疏访问的。
架构细节:
项目 | V4-Flash | V4-Pro | V4.1-Flash |
|---|---|---|---|
骨干参数 | 284B | 1.6T | 552B |
每 token 激活 | 13B | 49B | 8B(prefill) / 16B(decode) |
上下文 | 1M | 1M | 1M |
License | MIT | MIT | MIT |
V4.1 Flash 总参数比 V4-Flash 大了近一倍,单次激活量反而更小,价格能降下来就是因为这个。
基准 | Opus-5.0 | GPT-5.6 Sol | K3 | GLM-5.3 | V4-Pro | V4.1-Flash |
|---|---|---|---|---|---|---|
GPQA Diamond | 93.4 | 94.1 | 92.9 | 88.1 | 92.4 | 90.9 |
HLE | 56.3 | 44.5 | 43.5 | 42.0† | 42.7† | 36.8(39.1†) |
Codeforces | — | — | — | — | 3348 | 3471 |
Terminal-Bench 2.1 | 89.1 | 88.8 | 88.3 | 88.2 | 87.9 | 90.6 |
Terminal-Bench 3.0 | 43.3 | 34.4 | 17.7 | 28.3 | 11.8 | 30.0 |
DeepSWE v1.1 | 74.0 | 73.0 | 67.5 | 66.9 | 62.7 | 74.2 |
CyberGym | — | 84.5 | 80.0 | 84.5 | 83.3 | 88.1 |
AutomationBench | 50.3 | 45.8 | 46.7 | 48.8 | 43.2 | 54.8 |
Agent's Last Exam | 28.6 | 26.7 | 27.6 | 28.5 | 25.7 | 31.8 |
HLE w/ tools | 63.6 | — | 59.8 | 62.5 | 60.0 | 63.9 |
† 表示 HLE 的纯文本子集。推理档统一用 reasoning_effort=100。
DeepSeek 官方口径是「性能、费用、速度、总用时全面超越 V4 Pro」。分项看,Agentic 和代码类确实领先:DeepSWE 74.2 对 62.7,Terminal-Bench 2.1 90.6 对 87.9,CyberGym 88.1 对 83.3,AutomationBench 54.8 对 43.2。
但纯推理和知识类反过来落后。HLE 36.8 对 42.7,SimpleQA-Verified 42.3 对 55.2,都是 V4.1 Flash 更低。国盛证券复述官方数据,19 项测评里 14 项超过 Pro,约 74%,不是全部。
这些分数全部来自官方自测,没有中立第三方复核。 技术报告自己的表 4 显示,只是换 scaffold,DeepSWE v1.1 的分数就在 65.5 到 74.2 之间波动;官方多 Agent 的结果也标注为 preliminary。Artificial Analysis、LMArena 目前都还没有 V4.1 Flash 的独立评分。
社区实测的生成速度分布很散,160 / 284 / 287 / 300+ / 355–427 / 507 t/s 都有人报,差异来自任务类型、上下文长度、并发、是否含工具调用。官方没有公布统一的吞吐数字。
9 月 10 日 12:00 生效,单位人民币 / 百万 tokens。闲时缓存命中 ¥0.02、未命中 ¥1.0、输出 ¥4.0;高峰价翻倍,也就是 ¥0.04 / ¥2.0 / ¥8.0。高峰时段是周一至周五 9:00–12:00、14:00–18:00,其余含周末全天算空闲。
和旧价比,降幅差别很大。缓存命中从 0.05 砍到 0.02,降 60%;未命中 1.5→1.0,降 33%;输出只从 4.5 动到 4.0,降 11%。缓存命中降幅最大,因为 Agent 场景里系统提示词、历史对话、RAG 前缀常占输入 90% 以上,缓存命中率能到 99%+,账单大头就在这一项。
GLM-5.3-Flash 国内站标准价是 ¥0.8 输入 / ¥2.8 输出 / ¥0.23 缓存命中,没有峰谷。
口径 | DeepSeek 闲时 | GLM-5.3-Flash | 谁便宜 |
|---|---|---|---|
缓存命中输入 | ¥0.02 | ¥0.23 | DeepSeek 便宜约 10 倍 |
未命中输入 | ¥1.0 | ¥0.8 | GLM 略便宜 |
输出 | ¥4.0 | ¥2.8 | GLM 便宜,DeepSeek 贵 43% |
峰值全项 ×2 | ×2 | 无峰谷 | DeepSeek 明显更贵 |
缓存命中这一项 DeepSeek 便宜约 10 倍,但未命中输入和输出两项都比 GLM 贵,峰值时段还要再翻倍。整体谁更便宜,取决于缓存命中率和调用时段。
白天工时正好压在高峰上,批量任务、后台任务挪到晚间和周末能直接省一半。美洲团队要反过来算,01:00–04:00 UTC 等于美东 21:00–24:00,正是批处理时段,反而落在高峰里。
总用时由多轮推理、工具调用、文件读写一起决定,单价低的模型未必更快。实测里 V4.1 Flash 做 3D 城市生成器,LLM 推理只花 18 分钟,工具调用花了 83 分钟,总时几乎全被工具调用吃掉。
DeepSeek 把「总用时」和性能、费用、速度并列,盯的是工具调用正确率和步数。对 Agent 用户,总用时比 token 单价更影响体感。
DeepSeek 计划 9 月 14 日 12:00 下线 V4 Pro。届时 deepseek-v4-pro 的请求会自动路由到 V4.1 Flash,并按 Flash 单价计费。
争议的起点是一条推文:DeepSeek Harness 团队崔添翼 9 月 9 日在 X 上发消息,浏览量 70 万+,很多开发者是刷到这条推文才知道自己调用的 V4 Pro 要被换掉。
具体问题有三个:通知不到 48 小时、没有并行迁移期、消息通过社区群发布而不是 API changelog。
官方解释是「继续以更高价、更慢速度提供更弱的 V4 Pro 已不合适」。这个说法社区认,但接受不了执行方式。对比来看,OpenAI 关停 Sora API 提前 6 个月发了正式 deprecation notice,DeepSeek 只给了不到 48 小时。
也有人觉得这是免费升级还降价了,分歧在于手上有没有已经验证过的生产工作流。
内测期还有两个已知 bug:英文提问偶尔返回中文;开联网搜索时语言不一致,搜到什么语言就用什么语言回答。
WorkBuddy 国内版已全量接入,两周限时折扣。据用户实拍,模型列表里 Deepseek-V4.1-Flash 的倍率是 0.03x,带独家优惠标签,GLM-5.3-Flash 是 0.06x。0.03x 是平台积分倍率不是 API 单价,换算不出「便宜一半」,以客户端实际显示为准。同一列表里的 Hy3、Hy4 preview 是腾讯混元,跟 DeepSeek 无关。
腾讯云 TokenHub、ima、CodeBuddy、OpenCode 同步接入,OpenCode Go 套餐提供 4 倍额度。
API 的 base_url 不变,还是 https://api.deepseek.com,保持 OpenAI 兼容。正式模型名简化为 deepseek-flash,旧名 deepseek-v4-flash、deepseek-v4-flash-vision-exp 会自动路由过来。
权重已按 MIT 协议开源,HF 和 ModelScope 都发了,48 个分片,技术报告一并放出。官方原话是自部署需要约 2000 张 GPU 加存储集群,对多数团队来说,552B MoE 是「能下载」而不是「能跑」。
9 月 14 日之前,拿真实流量跑一遍回归测试,重点看结构化输出的格式漂移,JSON 和函数调用最容易出问题。还没在 V4 Pro 上验证过的非 Agent 场景,直接切生产有风险。跑分也都是官方自测,第三方评分还没出。
参考文献:
Hugging Face 模型卡:https://huggingface.co/deepseek-ai/DeepSeek-V4.1-Flash (2026-09-10,含完整评测表与架构说明)
技术报告:https://huggingface.co/deepseek-ai/DeepSeek-V4.1-Flash/blob/main/DeepSeek_V41_Tech_Report.pdf
官方公告《DeepSeek V4.1 Flash:更强、更快、更普惠》:https://www.deepseek.com/news/deepseek-v4-1-flash/ (2026-09-10)
DeepSeek API 定价页:https://api-docs.deepseek.com/quick_start/pricing
智东西/凤凰网科技(架构与生态最全):https://tech.ifeng.com/c/8wJ8zIXEntx (2026-09-10)
36氪·InfoQ(V4 Pro 静默路由争议):https://www.36kr.com/p/3977115918840065 (2026-09-10)
潮新闻/钱江晚报(WorkBuddy 全量接入与两周优惠):https://www.toutiao.com/article/7683819834974503443/ (2026-09-10)