今天凌晨,DeepSeek 悄悄把 V4 Pro 正式版推上去了。没开发布会,没发通稿,就这么上了。
模型号叫 DeepSeek-V4-Pro-0813。
我早上刷到这消息,本来以为又是常规升级。结果翻到数据那栏,直接愣住了。
先给大家看个数字。
有个专门测 AI 写代码能力的考试,叫 DeepSWE。V4 Pro 这次的成绩,从 7.3 分,涨到了 62.7 分。
你没看错,8 倍多。从不及格直接蹦到全班前三。
关键是,这个分数,超过了 Claude Opus 4.8。
不懂的朋友我解释下。Claude 是美国 Anthropic 公司的,现在全世界公认写代码最强的就是它家。Opus 是旗舰里的旗舰。一家中国公司,在 AI 写代码这个最硬的考试上,把人家旗舰给超了。
不光这一个。还有两个考试,一个叫 Cybergym,一个叫 AutomationBench,测的都是 AI 自己干活的能力。这两项上,V4 Pro 超过的是 Claude Fable 5,Anthropic 现在最贵最强的模型。全超了。
那有人要问了,这跟我有啥关系?
我跟你讲,这次变强的不是聊天能力。你要拿它问菜谱、写请假条,可能感觉不出来。真正质变的,是它"替人干活"的能力。
以前 AI 就是陪聊,你问它答。现在不一样了,AI 行业在抢的新山头是,让 AI 自己去完成一整件事。你给它个任务,它自己看代码、找问题、改完、跑测试、确认弄好了。这叫智能体能力。
7.3 分说明以前的 V4 Pro 干不了这活儿。62.7 分说明它现在能像模像样干起来了。从陪聊变干活,这是质变。
还有个细节大家可能没注意。这次它支持了 Responses API 和 Codex 接入。这俩是 OpenAI 搞的。意思就是,程序员以前用 GPT 写代码的那套工具,现在能直接换成 DeepSeek,几乎零成本。
OpenAI 的饭碗,被人摸了。以前大家用 GPT、用 Claude 是因为生态在。现在 DeepSeek 接口兼容、能力追上来了、还便宜。换不换?肯定有人动心。
再说个更实在的,它要涨价了。
DeepSeek 以前靠啥打天下?白菜价。便宜到离谱。这次正式版价格没怎么变,缓存命中输入每百万 token 才 0.025 元,没命中 3 元,输出 6 元。
但官方放了句话:计划近期整体涨价,幅度还不小。
一家靠低价横扫市场的公司,现在敢说要大涨价。底气哪来的?就是前面那些数据。能力追上 Claude 旗舰了,它觉得自个儿不再是便宜货,值更高的价了。
这其实是中国大模型的一个大转折。从打价格战抢市场,变成我有本事我卖贵点。对咱们用的人来说,以后可能要多花钱了。但对整个行业来说,说明国产 AI 真硬起来了。
对咱普通人到底有啥影响?我总结了三条。
第一,AI 替人干活的坎儿,可能就这么过去了。第一批真能甩开手自己干活的 AI 要来了。最先受影响的,是那些干基础编程、重复性技术活的人。
第二,国产 AI 头一次在最硬核的能力上站到了世界第一档。不是便宜里挑个强的,是最强那拨里也有咱了。搁一年前想都不敢想。
第三,这能力很快就渗进你天天用的东西里。你用的 AI 助手、写作软件、办公工具,底下大概率会陆续换上 V4 Pro。你感觉不到,但东西变好用了、变快了。
不过我得泼盆冷水。跑分是一回事,真用起来是另一回事。Claude 被全球程序员拿真金白银的项目练了一年多,稳定性不是跑分能比的。V4 Pro 这能力今天刚放出来,到底行不行,得用上一两个月才知道。
我就说一句,今天凌晨这一下,值得记住。不是因为它发了新模型,是因为中国大模型在 AI 真正干活这件事上,头一回摸到了最高的那条线。
至于站不站得住,让子弹飞一会儿。