首页
学习
活动
专区
圈层
工具
发布

简单聊一聊DeepSeek-V4-Flash正式版

没有做架构上的调整,只是进行后训练,它的Agent 能力明显提升,而且效果提升的同时,百万上下文与超低价格同时保留,只能称之为“开源界的神”

一、Agent 能力是本次升级核心,直接把GLM-5.2给超过了

新版 Flash 的 Agent 评测已经大幅超过此前的 V4-Pro Preview。而且最主要的是,DS已经把之前智谱发布的GLM-5.2给超过了,目前比较接近Opus-4.8模型。要知道这个只是Flash模型,如果Pro模型正式版发布,我都不敢想象会有多强,是不是真的可以追上GPT-5.6和Fable 5,我真的越来越期待了。

这次训练官方称并没有没有扩大模型,主要靠后训练提升。V4-Flash-0731 仍然保持预览版的架构和参数规模:

1.总参数量 284B

2.每个 Token 激活约 13B

3.MoE 架构

4.上下文长度 100 万 Token

这说明了 Agent 能力未必只能依靠扩大模型,高质量轨迹数据、环境交互、工具调用强化学习、错误恢复训练和 Harness 优化,同样可以带来巨大提升。验证了那一句话,模型不重要,数据更加重要

二、token价格还是性价比拉满

不知道是不是OpenAI提前知道DS要发布正式版了,所以GPT-5.6 Luna开始降价。但是就算是降价,DS的性价比还是拉满。DS的缓存命中输入和输出只需要$0.0028和$0.28,简直就是价格屠夫。

正式版依然支持 1M 上下文,最大输出长度达到 384K Token,同时支持思考和非思考模式。

三、总结一下

目前V4-flash的架构没有大的变化下,模型的效果就这么炸裂,给我感觉就是DS还在藏东西。

它最可怕的地方,已经不只是性价比,而是它每一次更新,都在用远低于同行的成本,快速缩短与最强闭源模型之间的距离。

Flash 已经做到这个程度了,接下来就看 V4 Pro,究竟还能把上限推到哪里。

  • 发表于:
  • 原文链接https://page.om.qq.com/page/OfL4bSqnZhdPHF_EZlmOp82A0
  • 腾讯「腾讯云开发者社区」是腾讯内容开放平台帐号(企鹅号)传播渠道之一,根据《腾讯内容开放平台服务协议》转载发布内容。
  • 如有侵权,请联系 cloudcommunity@tencent.com 删除。
领券