IT时代网8月11日消息,蚂蚁百灵8月11日开源Ling-3.0-tiny模型。该模型属于轻量级混合推理MoE架构,总参数7.9B,每Token激活1.3B参数,官方同时提供BF16、FP8和INT4权重版本,用于适配不同平台的部署需求。
按官方介绍,Ling-3.0-tiny主打低成本推理,采用高效混合线性架构,把KDA(Kimi Delta Attention)与MLA(多头潜在注意力)按3比1的比例交替堆叠,前馈网络则使用含128个路由专家的稀疏MoE结构,在上下文处理能力与计算成本之间做取舍。
该模型支持快速响应模式与多步骤推理模式,专为本地部署设计。官方已在英伟达DGX Spark、Apple Silicon MacBook以及Mac mini等设备上完成验证。在搭载M4 Pro的MacBook上,推理速度约为每秒86至90个Token;8K上下文长度下,峰值内存占用约8.34GiB。
注:本文中包含AI辅助创作的内容。