刚刚,千问AI平台上线Qwen3.8-Flash
在编程、Agent等真实任务中达到极致性价比
最新价格如下
输入每百万Tokens 0.8元
输出每百万Tokens 2.7元
缓存命中每百万Tokens 0.1元
Qwen3.8-Flash是一个多模态混合专家(MoE)模型,采用了下一代(Next)模型架构,千亿总参数仅激活60亿(6B),创下模型效率的全球新基准。
模型采用了与此前所有千问大模型完全不同的全新架构:
在注意力方面,引入独特的QSA(Qwen Sparse Attention)机制,形成与GDN高效融合的混合注意力架构,可显著降低计算开销,在高缓存命中的1M Tokens长上下文实际场景中可提速8倍以上,又准又快;
在模型内部分层通信方面,引入自研的Gated Residual方法,将传统Transformer的1条信息主通道拆分并拓展为4条,让模型可根据需求动态决定读写信息,信息传递更高效,训练也更稳定;
在模型参数扩展方面,引入51B的N-gram Embedding参数,为模型Transformer参数提供更高效的查表寻址,在每次token计算时无需参与,以极少的资源消耗“外挂”了一个大规模的 “记忆指南手册”,模型参数扩展效率更高;
在模型调参方面,模型结构和后期优化协同进行,收敛效率和训练吞吐大幅提升。
Qwen3.8系列技术创新,直接带来了训练和推理的成本大幅下降,模型的API服务已首发上线千问AI平台,开发者可直接调用API或Token Plan,以普惠价格获取前沿性能。
推理时,Qwen3.8-Flash每百万Tokens输入低至0.8元,输出2.7元;国际站每百万Tokens输入0.15美元、输出0.47美元。
在真实任务中,Agent工作需长输入(Input),缓存命中价格对综合成本影响大,Qwen3.8-Flash缓存命中价格低至每百万Tokens 0.1元、国际站0.016美元,特别适合大量、频繁的日常智能体任务,开发者可以极致性价比获取前沿性能。
目前,千问办公“标准模式”也已内置Qwen3.8-Flash,可完成95%的日常办公任务。
Next新架构将是全新一代千问大模型Qwen4的雏形,Qwen3.8-Flash-Next模型权重已在Hugging Face、魔搭社区全面开源,交由全球AI开源社区检验,以更好打造Qwen4模型。截至目前,Qwen3.8已开源发布的2.4T参数量的Qwen3.8-Max、Qwen3.8-27B及Qwen3.8-Flash三大尺寸模型,均已上线千问AI平台对外提供API服务。
Qwen3.8-Flash模型体验地址:
千问AI平台:
https://www.qianwenai.com/models/qwen3.8-flash
QwenCloud:
https://www.qwencloud.com/models/qwen3.8-flash