Muse Glimmer 介绍:一款可在你的设备上运行的开源智能体模型
Key takeaway: Meta AI Research 正式发布了名为 Muse Glimmer 的开源智能体模型,并将其权重在 Apache 2.0 许可下开源。Muse Glimmer 是一个拥有 300 亿参数的模型,专门为始终在线的本地智能体工作流优化,设计目标是能在搭载单个消费级 GPU 的 Mac 或 PC 上运行。该模型旨在实现本地智能体、函数调用、本地编码及 LLM 作为评估器等用例。在训练层面,Meta 采用了紧凑的架构设计,通过基于 Muse Spark 输出的逻辑蒸馏进行预训练,并在中期训练阶段引入更长上下文和带有丰富推理痕迹的数据,最后结合监督微调、在线策略蒸馏和强化学习进行后训练。在性能上,Meta 宣称 Muse Glimmer 在同尺寸模型中表现强劲,与 Gemma4-31B 和 Qwen3.6-27B 等模型相比,具备可靠的端到端任务完成、多步推理、失败恢复及多模态输入输出能力。为了在消费级硬件上实现实用的运行速度,Meta 采用了约 4-bit 的量化技术压缩权重,并引入基于 DFlash 的轻量级推测解码起草模型,能在无损质量的前提下显著提升生成速度。该模型目前在 Hugging Face 提供下载,并将通过 Ollama、LM Studio 等合作伙伴集成,支持 llama.cpp、MLX 和 ExecuTorch 等边缘框架,同时正与 AMD、Arm、Dell、Intel 和 NVIDIA 等硬件厂商合作优化全设备性能。
- Muse Glimmer 是 Meta Superintelligence Labs 推出的 300 亿参数开源 agentic 模型,基于 Apache 2.0 许可发布,专门针对消费级设备上的本地部署场景优化。
- 模型训练结合了基于 Muse Spark 的 Logit 蒸馏(预训练)、长上下文 agent 数据训练(中期训练)以及监督微调与强化学习(后训练)三阶段流程。
- 为了实现本地实时响应,模型采用 4-bit 量化将内存占用压缩至 20GB 以下,并首次引入了基于 DFlash 的轻量级推测解码起草模型以加速生成。
- Muse Glimmer 支持多模态输入(文本与图像)、100 多种语言,并在 DeepSearch QA、SWE-Bench、𝛕-Bench 等权威智能体基准测试中展现了同尺寸级别下的强大性能。
- 该模型通过 Hugging Face 发布,并与 NVIDIA、AMD 等硬件厂商以及 Ollama、vLLM 等推理框架建立合作,构建了从边缘端到服务器端的部署生态。
在云端大模型竞赛白热化的当下,Meta 反其道而行之,通过开源 Muse Glimmer 将智能体(Agent)的能力直接“压缩”进个人电脑。这款 300 亿参数的模型不只是一次简单的开源发布,它清晰地指出了 AI 落地的下一个重要方向:从云端回归端侧。文章中最具实操价值的并非冰冷的基准测试分数,而是其工程师们如何通过“蒸馏+量化+推测解码”这三位一体的技术组合拳,攻克了消费级显卡运行动辄占用几十 GB 智能体的硬件桎梏。对于正在寻找高性能、强隐私保护的 AI 前沿部署(AIFDE)工程师而言,这份代码和详细文档无疑是一份极具分量的工业级技术蓝图。
Muse Glimmer 是 Meta Superintelligence Labs 推出的 300 亿参数开源 agentic 模型,基于 Apache 2.0 许可发布,专门针对消费级设备上的本地部署场景优化。
—— 络石智能编辑部 · Editor's PickMuse Glimmer 介绍:一款可在你的设备上运行的开源智能体模型
今天,我们推出 Muse Glimmer,这是 Meta 超级智能实验室的最新模型,并在 Apache 2.0 许可下开源模型权重。
Muse Glimmer 是一个 300 亿参数的模型,针对始终在线的本地智能体工作流程进行了优化。它足够小,可以在配备单个消费级 GPU 的 Mac 或 PC 上运行,支持从本地智能体和函数调用,到本地编码和 LLM-as-a-judge 评估等用例。与同类领先模型相比,Muse Glimmer 在关键的智能体用例和基准测试中表现出强劲性能。
基础模型在推理、代码生成和工具使用方面已取得显著能力——然而大多数部署仍依赖云基础设施和网络访问。在本地运行模型意味着你可以在任何时间、任何地点使用 AI,无论是否有互联网连接。这变得越来越可行:开源社区已经证明,较小的模型如果经过有效训练,可以在特定任务上接近前沿性能。Muse Glimmer 正是针对这些本地用例进行了优化。
秉承我们长期分享基础 AI 研究的传统,我们今天在 Hugging Face 上发布 Muse Glimmer 开源权重,同时提供开发者文档,帮助您开始构建和运行自己的智能体。Muse Glimmer 设计为与开发者已使用的工具兼容。在接下来的几天内,将推出针对 llama.cpp、MLX 和 ExecuTorch 的优化集成,以便您可以在几分钟内从下载到运行智能体。
我们如何训练 Muse Glimmer
一个能够管理日程、起草消息、整理文件并学习你工作方式的智能体需要深度访问个人上下文。它还需要多种能力协同工作:长周期执行、精确工具调用、多模态理解、长上下文记忆和指令遵循。
我们设计了 Muse Glimmer,以在能力与本地硬件的内存和计算限制之间取得平衡。这需要紧凑的架构、一种新颖的蒸馏方案——将智能体推理从更大的教师模型迁移过来——以及推理优化(包括量化),以满足延迟预期。我们通过以下阶段实现了这一目标:
- 预训练。我们使用 logit 蒸馏在 Muse Spark 的输出上训练 Muse Glimmer,利用了与教师模型相似的数据混合。
- 中期训练。我们在更长上下文、更多智能体相关数据(包含更丰富的推理轨迹)以及有机数据上训练模型。
- 后训练。我们将监督微调与在策略蒸馏和强化学习相结合,涵盖通用、推理、编码和智能体领域。
Muse Glimmer 按照 Meta 先进 AI 扩展框架设定的标准进行评估,并在所有相关类别中针对开源权重发布进行了评估。
专为智能体打造:Muse Glimmer 能做什么
构建有效的智能体需要关键能力协同工作,以实现用户的目标。Muse Glimmer 在以下每个方面都经过了训练和评估:
- 端到端智能体任务完成。Muse Glimmer 在包括 DeepSearch QA、MCP-Atlas、𝛕-Bench 和 SWE-Bench 在内的完整任务基准测试中取得了较高的成功率,这些基准衡量其在框架内工作、编写和调试代码以及从头到尾解决多轮请求的能力。
- 可靠的工具使用。该模型处理广泛的函数调用,在扩展工作流程中使用精确的模式调用工具。
- 多步推理。Muse Glimmer 在长周期内进行链式推理,在复杂、扩展的工作流程中维持连贯的计划。
- 故障恢复。当工具调用失败或返回意外结果时,模型被训练为诊断错误并重试,而不是停止。
- 多模态输入与推理。通过专用的感知编码器,模型接受交错文本和图像。这使得智能体能够解释截图、图表和文档以及对话。
- 框架兼容性。Muse Glimmer 可在 OpenClaw 和其他智能体编排模式上工作。
- 可控努力。Muse Glimmer 支持不同的推理强度,以便在质量和速度之间选择合适的平衡。
- 多语言。Muse Glimmer 在超过 100 种语言的数据上进行训练。
性能
我们在一系列广泛的基准测试上评估了 Muse Glimmer,以评估有效自主智能体行为所需的各种能力。与 Gemma4-31B 和 Qwen3.6-27B 相比,Muse Glimmer 在多个广泛使用的 LLM 基准测试中,在其尺寸类别中表现强劲。
有关我们评估的更多详细信息,请参阅我们的报告。
针对本地部署优化
一个本地智能体只有在响应速度快到让人感觉自然时才能真正有用。一个需要数分钟才能回复或规划下一步的智能体会打断实际工作的流程。我们应用了两种优化措施,使 Muse Glimmer 在消费级硬件上以实用速度运行,同时不牺牲质量。
让模型适配你的设备。
在全精度下,一个 300 亿参数的模型需要超过 55 GB 的内存——远超任何消费级 GPU 的容量。我们使用量化技术将模型权重压缩到大约 4 位精度,将语言模型缩小到低于 20 GB。这为模型的工作内存(其“KV 缓存”)、用于图像理解的感知编码器以及推测解码起草器留下了足够的空间,可以在 24 GB 或 32 GB 的内存范围内同时运行。我们验证了这种压缩对智能体任务几乎没有或完全没有性能下降。
通过推测解码实现更快的生成。
语言模型通常一次生成一个 token,这在长推理链或多步工具调用期间可能会感觉缓慢。Muse Glimmer 配备了一个基于 DFlash 的轻量级“起草器”模型——一个小的伴生网络,一次性提出整个 token 块。然后主模型并行验证这些提议,接受正确的 token 并纠正错误的 token。这种技术让 Muse Glimmer 的文本生成速度显著快于标准的逐 token 生成,同时产生相同的输出质量。我们在发布中提供了量化起草器版本,以占用更小的内存开销。
结果:
我们在 MacBook M4-Max、M5-Max 以及 RTX-5090 上测量了 K-Quant-17GB 模型以及量化 DFlash 起草器的速度。该模型足够快,可以实现流畅的对话和实时智能体交互,完全在您的设备上运行。
立即开始使用 Muse Glimmer
Muse Glimmer 现已可用,您可以在 Hugging Face 上下载权重。在接下来的几天内,您可以通过 Ollama、LM Studio 和 Unsloth 等合作伙伴在本地运行它,使用 llama.cpp、ExecuTorch 和 MLX 等边缘框架进行部署,通过 vLLM 和 SGLang 进行大规模服务,或者通过 Together AI、Fireworks AI 和 OpenRouter 等合作伙伴快速上手。您甚至可以利用 PyTorch 的 TorchTitan 训练功能进一步微调模型,以适应您的用例。
我们也在与 AMD、Arm、Dell、Intel 和 NVIDIA 等合作伙伴合作,以优化跨设备的性能。此外,我们正在发布文档,以便开发者拥有开始使用并以负责任的方式使用 Muse Glimmer 构建所需资源。这包括关于设置自定义框架的指南,使得从一开始就更容易构建和部署个人智能体。您可以了解更多信息并查找资源,以在 Meta 的 AI 开发者中心进行构建。
这项工作建立在 Meta 长期开源 AI 研究的基础上,将其扩展到智能体 AI,并为开发者提供本地智能体能力。一如既往,我们欢迎社区的反馈,并迫不及待地想看到开发者使用这个开源权重模型构建的成果。
下载 Hugging Face 上的模型 开发者文档
Tags
Related Topics
Expert Comment
This article is curated by the editorial team from public sources for reference only.