首页
学习
活动
专区
圈层
工具
发布
社区首页 >专栏 >腾讯混元Hy3正式上线,一个被低估的国产模型正在改写规则

腾讯混元Hy3正式上线,一个被低估的国产模型正在改写规则

作者头像
不惑
发布2026-07-10 21:23:11
发布2026-07-10 21:23:11
3910
举报

7月6号下午,腾讯混元团队丢出一颗炸弹。

Hy3正式版来了。不是preview,不是测试版,是直接开源上架、全面对外。消息一出,国内的AI圈子直接炸了锅。但有意思的是,海外那帮人却安静得有点反常。

这不对劲。

Hy3 Logo
Hy3 Logo

Hy3 Logo

说实话,我第一次看到Hy3的数据时,正在喝咖啡。那口咖啡差点喷到屏幕上。

2950亿总参数,激活参数只有210亿。256K的上下文长度,能一次性吞下一整本长篇小说。幻觉率从12.5%砍到5.4%,常识错误率从25.4%降到12.7%。这些数字什么概念,后面细说。

先聊个更魔幻的。腾讯内部搞了场盲测,找了270个不同领域的专家,在真实工作流里让Hy3和GLM-5.1 PK。结果Hy3得分2.67/4,GLM-5.1只有2.51。前端开发、数据存储这些场景,Hy3的优势特别明显。

注意,这不是刷榜,是盲测。专家连自己测的是哪个模型都不知道。

Benchmark
Benchmark

Benchmark

但海外社交平台上的画风,和国内完全不一样。

X上有几个科技博主转了Hy3的消息,评论区里两极分化特别明显。一部分人带着惯性偏见,把中国模型直接划进二等舱,连参数都懒得看。另一批人却在疯狂讨论一个细节,Hy3从1月底开始训练,到4月就开源了preview版本,满打满算不到三个月。这是什么速度,冷启动到开源,通常大厂要走半年的流程,腾讯这次直接压缩到一季度。

有个叫fsnn的海外科技媒体写了一篇长文,标题很直接,腾讯的Hy3是最被忽视的高效中文大模型。文章里提到一个点,295B的MoE架构,激活参数却只有21B,这意味着什么,意味着跑起来比很多旗舰模型便宜得多,但实际效果却能跟那些参数规模大2到5倍的模型掰手腕。

换句话说,花更少的钱,干更多的活。

这里得插一段背景,不然很多人看不懂腾讯这波操作的含金量。

Hy3的灵魂人物叫姚顺雨,前OpenAI的研究员,现在直接向腾讯总裁刘炽平汇报。这个人2026年初才加入腾讯,一上来就干了一件狠事,把混元的预训练基础设施全部推倒重建。

你没看错,全部重建。

以前混元的模型架构是上一代的设计思路,堆砌参数,狂刷榜单,但实际用起来各种问题。姚顺雨团队定了几条铁律,第一,真实能力优先于榜单分数,第二,模型设计和推理成本必须一起考虑,第三,所有训练都要围绕实际业务场景来。

这三条听起来简单,但做起来等于让整个团队换了一种活法。不再看榜单排名吃饭,而是看产品反馈说话。

所以Hy3 preview在4月发布时,腾讯内部50多个产品团队同时接入,元宝、ima、QQ浏览器、腾讯文档、甚至微信读书和游戏业务,全都在测。两个多月的反馈攒下来,正式版直接修复了一大堆真实场景里的硬伤。

这不是实验室里打磨出来的模型,是战场上血拼出来的。

现在来聊聊那个最让人意外的数据,幻觉率。

5.4%,放在半年前,这是顶级闭源模型才敢吹的数字。Hy3 preview版本还有12.5%,正式版直接腰斩。常识错误率也从25.4%降到12.7%。

很多外行不懂这有啥了不起的。这么说吧,大模型最烦人的不是它不会,是它乱说。你问它一个专业问题,它给你编得有鼻子有眼,还配假数据假链接,你一不小心就信了。这就是幻觉。

腾讯内部给Hy3定了一条行为准则,有证据就回答,没证据就说不知道,别把不同的信息源混在一起编,更不能凭空捏造数据。为了做到这一点,团队做了细粒度的数据清洗,还加了专门的训练约束。

效果怎么样,在WorkBuddy这类生产力工具里,任务解决率从72%跳到90%,平均耗时还缩短了34%。不是快了一点点,是快了一个量级。

但海外也不是一边倒的唱衰。

有个挺有意思的现象,国外评测机构Artificial Analysis给Hy3-preview打分的时候,在某些基准上把它排在了DeepSeek V4 Flash和Qwen3.6后面。当时X上就有人开嘲讽,腾讯也就这水平。

可这些人忽略了一件事,Hy3的主战场从来都不是刷榜。

SWE-bench Verified这个测试,考的是模型能不能真正修复GitHub上的真实Bug,不是做题,是实战。Hy3拿了74.4分。作为对比,前代Hy2只有53%,这一代提升了超过40%。在复杂Agent工作流里,Hy3能稳定支撑495步的操作,覆盖文档处理、数据分析、知识检索、MCP工具链编排。

这些能力,榜单上根本体现不出来。

Benchmark Appendix
Benchmark Appendix

Benchmark Appendix

价格方面,腾讯这次也狠得离谱。

输入1块钱/百万tokens,输出4块钱/百万tokens,缓存命中只要0.25元。这是什么概念,你写一篇一万字的长文,调用API的成本可能不到几毛钱。

个人开发者有个28块钱的月费套餐,就能在OpenClaw这类Agent开发平台里随便调用。对学生党和独立开发者来说,这基本是白送。

海外API平台也在陆续接入。OpenRouter上已经有Hy3的接口,而且preview版本还限免了两周。一些原本持怀疑态度的开发者试完之后,态度明显软化,讨论的焦点从质疑转向了怎么部署和微调。

说到底,Hy3真正让我意外的,不是某个技术指标,而是腾讯整个AI战略的气质变了。

以前混元给人的感觉是,跟着别人跑,OpenAI做什么它做什么,DeepSeek火了又跟着卷价格。但这次不一样,Hy3从设计之初就在回答一个问题,用户真正需要模型干什么。

答案不是更聪明的聊天机器人,是一个能干活、不瞎说、用得起的数字员工。

270个专家的盲测,50多个产品的反馈,495步的Agent工作流,这些数字背后是一套全新的逻辑。模型不再是为了发布会上的PPT而存在,是为了让写代码的人少熬一个夜,让做数据分析的人少点一次刷新,让普通用户少被幻觉骗一次。

这种转变,比任何一个单一的 benchmark 分数都更有意思。

当然,Hy3也不是没有短板。

多模态能力还没上,目前主要是文本和代码。视觉、音频这些领域,腾讯肯定也在搞,但Hy3这个版本还没覆盖。另外,海外生态的渗透还需要时间,虽然开源了,但国际开发者社区对中国模型的接受度,仍然是个慢功夫。

还有一个更深层的问题,当所有人都开始卷Agent能力、卷性价比、卷真实场景体验的时候,大模型的竞争逻辑已经彻底变了。不再是参数军备竞赛,而是工程化落地能力的比拼。

从这个角度看,Hy3可能不是最耀眼的那个,但它或许是最务实的一个。

而务实,有时候比耀眼更可怕。

image
image

image

今天下午,我又打开GitHub看了一眼Hy3的仓库。星标数在涨,Issue区有人在问怎么微调,有人在晒部署成功的截图,还有人直接提交了PR。

这就是开源的力量。代码放在那里,任何人都能验证,好用就是好用,拉胯就是拉胯,骗不了人。

腾讯这次把Hy3以Apache 2.0协议完全开源,权重上传到Hugging Face、ModelScope、GitCode,连FP8量化版本都给了。vLLM和SGLang的部署方案也写得很细,8张H20就能跑起来。

这意味着什么,意味着中小企业和个人开发者,第一次有机会零门槛用上顶级 MoE 模型。不需要动辄几百万的算力投入,不需要等API审核,下载下来就能用。

这才是真正的技术平权。不是喊口号,是把代码和权重拍在桌上,说,拿去用。

image
image

image

写到这里,我想起X上那些带着偏见的眼光,把中国模型直接划进二等舱的人。

我想对他们说,你可以不看。但你的竞争对手会看,而且看得很认真。

Hy3不是终点,它是一个信号。国产大模型正在从追随者变成规则的改写者。不是靠更大的参数,不是靠更贵的算力,是靠对真实需求的理解,和对工程细节的极致打磨。

这场游戏,才刚刚开始。

本文参与 腾讯云自媒体同步曝光计划,分享自微信公众号。
原始发表:2026-07-07,如有侵权请联系 cloudcommunity@tencent.com 删除

本文分享自 技术人说 微信公众号,前往查看

如有侵权,请联系 cloudcommunity@tencent.com 删除。

本文参与 腾讯云自媒体同步曝光计划  ,欢迎热爱写作的你一起参与!

评论
登录后参与评论
0 条评论
热度
最新
推荐阅读
领券
问题归档专栏文章快讯文章归档关键词归档开发者手册归档开发者手册 Section 归档