Alexandr Wang刚刚宣布了一件大事:Muse Spark 1.2将以开源形式发布,具体时间待定。Meta重走来时路要开源了?
同时小札写了一份长信《The Future is for Everyone》,核心主张:超级智能即将到来,这个时代的关键问题不是技术本身,而是谁能使用它、用它做什么,是集中在少数机构手里,还是赋能每一个人。
信:
https://www.meta.com/thefutureisforeveryone/
同时,Meta还宣布了另一件事,
Muse Glimmer,一个300亿参数的开源Agent模型,Apache 2.0协议,权重直接挂到了Hugging Face。
这个模型最核心的一点:24GB显存就能跑,而且Agent能力不打折。跑分如下:
30B放进24GB,怎么做到的
30B参数的模型,如果是全精度,光权重就要占超过55GB内存,普通消费级显卡根本装不下。
Meta的解法是量化。把权重压缩到约4bit精度,语言模型主体缩减到20GB以下,剩余空间留给KV缓存、感知编码器和推测解码的Drafter模型,全部塞进24GB或32GB的显存范围内。
Meta做过验证:这种压缩对Agent任务几乎没有性能损失。
速度也是个问题。大模型一个token一个token地生成,遇到长推理链或者多步工具调用,会明显感觉卡顿。Muse Glimmer的解法是搭配一个轻量级Drafter模型,技术基于DFlash,这个小模型一次性提出一批token,主模型并行验证,接受正确的、纠正错误的。生成速度大幅提升,输出质量和逐token生成完全一致。
实测数据覆盖了MacBook M4 Max、M5 Max以及RTX 5090,速度足够支撑流畅对话和实时Agent交互,全程在本地跑,不需要联网。
专门为Agent设计
Muse Glimmer不是一个通用模型拿来做Agent,它从一开始就是为Agent场景设计和训练的。
几个核心能力:
端到端任务完成。模型在DeepSearch QA、MCP-Atlas、τ-Bench、SWE-Bench等Agent基准测试上取得了强劲成绩,覆盖代码编写调试、多轮任务处理等场景。
工具调用。能处理大范围的函数调用,在长流程中精准使用工具。
多步推理。跨越长时间跨度持续推理,在复杂工作流中保持连贯计划。
失败恢复。工具调用失败或返回意外结果时,模型会自己诊断错误并重试,而不是直接停下来。
多模态理解。带有专属感知编码器,支持文本和图片交替输入,能理解截图、图表、文档。
此外,支持OpenClaw等主流Agent编排框架,支持可调节推理强度,覆盖100多种语言。
训练方式
整个训练分三个阶段。
预训练阶段,以Muse Spark的输出为基础,用Logit蒸馏方式训练,数据配比参照教师模型。
中训练阶段,喂入更长上下文、更密集的Agent场景数据,配合更丰富的推理轨迹,同时混入有机数据。
后训练阶段,结合监督微调、在线蒸馏和强化学习,覆盖通用、推理、代码、Agent四大方向。
模型在Meta发布的高级AI扩展框架下完成评估,通过了开源发布的全部审核。
现在怎么用
权重现在就在Hugging Face上,直接下载。
本周内陆续上线Ollama、LM Studio、vLLM、SGLang、Together AI、Fireworks AI、OpenRouter。llama.cpp、MLX、ExecuTorch的优化适配也将在未来几天到位。
想定制的,可以用PyTorch的TorchTitan做进一步微调。
AMD、Arm、Dell、Intel、NVIDIA正在和Meta合作,针对各类设备做性能优化。开发者文档和脚手架搭建指南同步开放,内容包括如何快速部署个人Agent。
更多信息和资源可以在Meta AI Developer Center查到,模型地址和文档链接见文末。
模型下载:
https://huggingface.co/meta-models/Muse-Glimmer-30B
开发者文档:https://dev.meta.ai/docs
--end--
最后记得⭐️我,每天都在更新:如果觉得文章还不错的话可以点赞转发推荐评论
/...@作者:你说的完全正确(YAR师)