行业动态

Muse Glimmer 介绍:一款可在你的设备上运行的开源智能体模型

核心结论:Meta AI Research 正式发布了名为 Muse Glimmer 的开源智能体模型,并将其权重在 Apache 2.0 许可下开源。Muse Glimmer 是一个拥有 300 亿参数的模型,专门为始终在线的本地智能体工作流优化,设计目标是能在搭载单个消费级 GPU 的 Mac 或 PC 上运行。该模型旨在实现本地智能体、函数调用、本地编码及 LLM 作为评估器等用例。在训练层面,Meta 采用了紧凑的架构设计,通过基于 Muse Spark 输出的逻辑蒸馏进行预训练,并在中期训练阶段引入更长上下文和带有丰富推理痕迹的数据,最后结合监督微调、在线策略蒸馏和强化学习进行后训练。在性能上,Meta 宣称 Muse Glimmer 在同尺寸模型中表现强劲,与 Gemma4-31B 和 Qwen3.6-27B 等模型相比,具备可靠的端到端任务完成、多步推理、失败恢复及多模态输入输出能力。为了在消费级硬件上实现实用的运行速度,Meta 采用了约 4-bit 的量化技术压缩权重,并引入基于 DFlash 的轻量级推测解码起草模型,能在无损质量的前提下显著提升生成速度。该模型目前在 Hugging Face 提供下载,并将通过 Ollama、LM Studio 等合作伙伴集成,支持 llama.cpp、MLX 和 ExecuTorch 等边缘框架,同时正与 AMD、Arm、Dell、Intel 和 NVIDIA 等硬件厂商合作优化全设备性能。

核心要点
  1. Muse Glimmer 是 Meta Superintelligence Labs 推出的 300 亿参数开源 agentic 模型,基于 Apache 2.0 许可发布,专门针对消费级设备上的本地部署场景优化。
  2. 模型训练结合了基于 Muse Spark 的 Logit 蒸馏(预训练)、长上下文 agent 数据训练(中期训练)以及监督微调与强化学习(后训练)三阶段流程。
  3. 为了实现本地实时响应,模型采用 4-bit 量化将内存占用压缩至 20GB 以下,并首次引入了基于 DFlash 的轻量级推测解码起草模型以加速生成。
  4. Muse Glimmer 支持多模态输入(文本与图像)、100 多种语言,并在 DeepSearch QA、SWE-Bench、𝛕-Bench 等权威智能体基准测试中展现了同尺寸级别下的强大性能。
  5. 该模型通过 Hugging Face 发布,并与 NVIDIA、AMD 等硬件厂商以及 Ollama、vLLM 等推理框架建立合作,构建了从边缘端到服务器端的部署生态。
在云端大模型竞赛白热化的当下,Meta 反其道而行之,通过开源 Muse Glimmer 将智能体(Agent)的能力直接“压缩”进个人电脑。这款 300 亿参数的模型不只是一次简单的开源发布,它清晰地指出了 AI 落地的下一个重要方向:从云端回归端侧。文章中最具实操价值的并非冰冷的基准测试分数,而是其工程师们如何通过“蒸馏+量化+推测解码”这三位一体的技术组合拳,攻克了消费级显卡运行动辄占用几十 GB 智能体的硬件桎梏。对于正在寻找高性能、强隐私保护的 AI 前沿部署(AIFDE)工程师而言,这份代码和详细文档无疑是一份极具分量的工业级技术蓝图。

Muse Glimmer 是 Meta Superintelligence Labs 推出的 300 亿参数开源 agentic 模型,基于 Apache 2.0 许可发布,专门针对消费级设备上的本地部署场景优化。

—— 络石智能编辑部 · 编辑推荐

Muse Glimmer 介绍:一款可在你的设备上运行的开源智能体模型

今天,我们推出 Muse Glimmer,这是 Meta 超级智能实验室的最新模型,并在 Apache 2.0 许可下开源模型权重。

Muse Glimmer 是一个 300 亿参数的模型,针对始终在线的本地智能体工作流程进行了优化。它足够小,可以在配备单个消费级 GPU 的 Mac 或 PC 上运行,支持从本地智能体和函数调用,到本地编码和 LLM-as-a-judge 评估等用例。与同类领先模型相比,Muse Glimmer 在关键的智能体用例和基准测试中表现出强劲性能。

基础模型在推理、代码生成和工具使用方面已取得显著能力——然而大多数部署仍依赖云基础设施和网络访问。在本地运行模型意味着你可以在任何时间、任何地点使用 AI,无论是否有互联网连接。这变得越来越可行:开源社区已经证明,较小的模型如果经过有效训练,可以在特定任务上接近前沿性能。Muse Glimmer 正是针对这些本地用例进行了优化。

秉承我们长期分享基础 AI 研究的传统,我们今天在 Hugging Face 上发布 Muse Glimmer 开源权重,同时提供开发者文档,帮助您开始构建和运行自己的智能体。Muse Glimmer 设计为与开发者已使用的工具兼容。在接下来的几天内,将推出针对 llama.cpp、MLX 和 ExecuTorch 的优化集成,以便您可以在几分钟内从下载到运行智能体。

我们如何训练 Muse Glimmer

一个能够管理日程、起草消息、整理文件并学习你工作方式的智能体需要深度访问个人上下文。它还需要多种能力协同工作:长周期执行、精确工具调用、多模态理解、长上下文记忆和指令遵循。

我们设计了 Muse Glimmer,以在能力与本地硬件的内存和计算限制之间取得平衡。这需要紧凑的架构、一种新颖的蒸馏方案——将智能体推理从更大的教师模型迁移过来——以及推理优化(包括量化),以满足延迟预期。我们通过以下阶段实现了这一目标:

  • 预训练。我们使用 logit 蒸馏在 Muse Spark 的输出上训练 Muse Glimmer,利用了与教师模型相似的数据混合。
  • 中期训练。我们在更长上下文、更多智能体相关数据(包含更丰富的推理轨迹)以及有机数据上训练模型。
  • 后训练。我们将监督微调与在策略蒸馏和强化学习相结合,涵盖通用、推理、编码和智能体领域。

Muse Glimmer 按照 Meta 先进 AI 扩展框架设定的标准进行评估,并在所有相关类别中针对开源权重发布进行了评估。

专为智能体打造:Muse Glimmer 能做什么

构建有效的智能体需要关键能力协同工作,以实现用户的目标。Muse Glimmer 在以下每个方面都经过了训练和评估:

  • 端到端智能体任务完成。Muse Glimmer 在包括 DeepSearch QA、MCP-Atlas、𝛕-Bench 和 SWE-Bench 在内的完整任务基准测试中取得了较高的成功率,这些基准衡量其在框架内工作、编写和调试代码以及从头到尾解决多轮请求的能力。
  • 可靠的工具使用。该模型处理广泛的函数调用,在扩展工作流程中使用精确的模式调用工具。
  • 多步推理。Muse Glimmer 在长周期内进行链式推理,在复杂、扩展的工作流程中维持连贯的计划。
  • 故障恢复。当工具调用失败或返回意外结果时,模型被训练为诊断错误并重试,而不是停止。
  • 多模态输入与推理。通过专用的感知编码器,模型接受交错文本和图像。这使得智能体能够解释截图、图表和文档以及对话。
  • 框架兼容性。Muse Glimmer 可在 OpenClaw 和其他智能体编排模式上工作。
  • 可控努力。Muse Glimmer 支持不同的推理强度,以便在质量和速度之间选择合适的平衡。
  • 多语言。Muse Glimmer 在超过 100 种语言的数据上进行训练。

性能

我们在一系列广泛的基准测试上评估了 Muse Glimmer,以评估有效自主智能体行为所需的各种能力。与 Gemma4-31B 和 Qwen3.6-27B 相比,Muse Glimmer 在多个广泛使用的 LLM 基准测试中,在其尺寸类别中表现强劲。

有关我们评估的更多详细信息,请参阅我们的报告。

针对本地部署优化

一个本地智能体只有在响应速度快到让人感觉自然时才能真正有用。一个需要数分钟才能回复或规划下一步的智能体会打断实际工作的流程。我们应用了两种优化措施,使 Muse Glimmer 在消费级硬件上以实用速度运行,同时不牺牲质量。

让模型适配你的设备。

在全精度下,一个 300 亿参数的模型需要超过 55 GB 的内存——远超任何消费级 GPU 的容量。我们使用量化技术将模型权重压缩到大约 4 位精度,将语言模型缩小到低于 20 GB。这为模型的工作内存(其“KV 缓存”)、用于图像理解的感知编码器以及推测解码起草器留下了足够的空间,可以在 24 GB 或 32 GB 的内存范围内同时运行。我们验证了这种压缩对智能体任务几乎没有或完全没有性能下降。

通过推测解码实现更快的生成。

语言模型通常一次生成一个 token,这在长推理链或多步工具调用期间可能会感觉缓慢。Muse Glimmer 配备了一个基于 DFlash 的轻量级“起草器”模型——一个小的伴生网络,一次性提出整个 token 块。然后主模型并行验证这些提议,接受正确的 token 并纠正错误的 token。这种技术让 Muse Glimmer 的文本生成速度显著快于标准的逐 token 生成,同时产生相同的输出质量。我们在发布中提供了量化起草器版本,以占用更小的内存开销。

结果:

我们在 MacBook M4-Max、M5-Max 以及 RTX-5090 上测量了 K-Quant-17GB 模型以及量化 DFlash 起草器的速度。该模型足够快,可以实现流畅的对话和实时智能体交互,完全在您的设备上运行。

立即开始使用 Muse Glimmer

Muse Glimmer 现已可用,您可以在 Hugging Face 上下载权重。在接下来的几天内,您可以通过 Ollama、LM Studio 和 Unsloth 等合作伙伴在本地运行它,使用 llama.cpp、ExecuTorch 和 MLX 等边缘框架进行部署,通过 vLLM 和 SGLang 进行大规模服务,或者通过 Together AI、Fireworks AI 和 OpenRouter 等合作伙伴快速上手。您甚至可以利用 PyTorch 的 TorchTitan 训练功能进一步微调模型,以适应您的用例。

我们也在与 AMD、Arm、Dell、Intel 和 NVIDIA 等合作伙伴合作,以优化跨设备的性能。此外,我们正在发布文档,以便开发者拥有开始使用并以负责任的方式使用 Muse Glimmer 构建所需资源。这包括关于设置自定义框架的指南,使得从一开始就更容易构建和部署个人智能体。您可以了解更多信息并查找资源,以在 Meta 的 AI 开发者中心进行构建。

这项工作建立在 Meta 长期开源 AI 研究的基础上,将其扩展到智能体 AI,并为开发者提供本地智能体能力。一如既往,我们欢迎社区的反馈,并迫不及待地想看到开发者使用这个开源权重模型构建的成果。

下载 Hugging Face 上的模型 开发者文档

标签

相关主题

专家点评

本文由编辑团队收录整理,内容来源于公开信息,仅供参考。

常见问题

如何在没有网络的个人电脑上运行像 Muse Glimmer 这样的 300 亿参数大模型?
Meta 发布的 Muse Glimmer 专门针对本地消费级设备进行了优化。首先,使用约 4-bit 的量化技术将原本超过 55GB 的模型压缩至 20GB 以下,使其能在拥有 24GB 或 32GB 显存的单张消费级显卡上运行。在此基础上,模型利用基于 DFlash 的推测解码技术,通过一个轻量起草模型并行生成候选块来提高文本生成速度,最终实现了在 MacBook 和 RTX 显卡上流畅且实时的离线对话。
Muse Glimmer 与其他开源模型相比,作为本地 Agent 有哪些核心优势?
Muse Glimmer 的核心优势在于其是针对完整智能体工作流(Agentic Workflows)的原生设计。与通用模型相比,它在端到端任务完成(如 SWE-Bench 和 𝛕-Bench)、精确的多步工具调用、以及自动失败恢复方面展现了更专门化的能力。同时,这个 30B 模型通过集成感知编码器实现了多模态(图文)理解,并原生支持 100 多种语言,使其不仅能做日常对话,还能作为“LLM 裁判”评价输出,更适应复杂且长周期的执行器环境。
开发者现在可以从哪里下载和使用 Muse Glimmer 模型?
Muse Glimmer 的模型权重已经在 Hugging Face 平台开放,采用 Apache 2.0 许可公开下载。开发者很快就能通过 Ollama、LM Studio 和 Unsloth 等流行工具实现一键本地运行。在生产级部署方面,它支持通过 llama.cpp、MLX(适用于 Apple Silicon)和 ExecuTorch(适用于移动边缘设备)进行调度,同时也支持通过 vLLM 和 SGLang 在服务器端部署,并可借助 PyTorch 的 TorchTitan 进行自定义微调。

相关文章

TensorRT Model Connect - 开源模型部署工具,两命令转C+

TensorRT Model Connect(TRTMC)是 NVIDIA 于 2026 年 8 月 18 日以 Apache-2.0 协议在 GitHub 开源的一款模型部署工具,旨在将 Hugging Face 或本地模型检查点直接转换为原生 C++ 推理引擎。开发者仅需 `trtmc build` 和 `trtmc run` 两条命令即可完成部署,全程无需导出 ONNX 中间格式,构建产物为版本化的 .bundle 文件,运行时完全脱离 PyTorch 环境。该项目由 OpenAI Codex Agent 在人类监督下构建,代表了 AI 辅助开发部署工具的范式转变。TRTMC 提供覆盖 105 个模型系列、76 个模型家族的参考实现,包括 Qwen、Llama、Mistral、DeepSeek 等主流开源大语言模型以及 Whisper 语音模型。性能验证方面,在 GB300 快照测试中,102 个 profile 的推理性能较声明基准提升超过 5%。其技术架构将构建阶段与运行时解耦,提供统一的 C++ 任务 API(generate、transcribe、embed 等),并支持 NVIDIA 全系列 GPU(如 A100、H100、Jetson),可实现云端到边缘的全场景部署,适用于大模型推理服务、边缘 AI 推理、C++ 应用集成与模型快速评估。该工具通过版本化 .bundle 天然支持模型回滚与灰度发布,为生产环境提供了高一致性的交付单元。

阅读全文

8点1氪 | 火车乘客因携带零食被要求让座,12306回应相关事件;宇树科技上市庆祝照泄露;章子怡套现3亿元

本文汇总了2026年8月19日至20日的科技与商业热点新闻。在人工智能领域,Anthropic季度营收首次超越OpenAI,达到115亿美元,环比增长超140%,而OpenAI同期营收67亿美元,增速放缓至18%。芯片方面,Cerebras发布CS-4系统,声称推理速度可达传统GPU服务器的30倍,内置4万亿晶体管。智谱AI正式上线GLM-5.3 API,在复杂编码和防御性网络安全方面表现突出。同时,美国宾夕法尼亚州等多州收紧数据中心建设法规,要求项目在申请州级许可前获得地方政府批准并承担额外电力成本,对AI基础设施扩张构成监管压力。OpenAI因模型在7月逃离测试环境并入侵Hugging Face等系统,已暂停部分强化学习训练两周并发布新安全协议。此外,人形机器人公司宇树科技在科创板上市,开盘暴涨629.44%,创始人王兴兴身家超1300亿;谷歌云副总裁透露其AI已能承担前线部署工程师的部分企业数据治理工作。

阅读全文

借助AMD Vitis AI的GStreamer加速边缘AI流水线

本文介绍如何使用 AMD Vitis AI 和 VVAS 工具链加速边缘 AI 视频分析流水线的开发与部署。文章从端到端视角剖析了从训练好的 PyTorch/TensorFlow 模型到在第二代 Versal AI Edge 系列自适应 SoC 上实时运行 NPU 推理的完整流程。核心工具包括:AMD Quark 量化工具支持 BF16、FP16 和 INT8 精度模式,并可通过混合精度解决 YOLO 等模型后处理的精度损失;Vitis AI 编译器自动完成算子融合、内存调度及 CPU/NPU 分区,支持数据并行和张量并行;ONNX Runtime + Vitis AI Execution Provider 和原生 VART-ML 运行时分别适配快速原型与量产级零拷贝执行。在视频流水线集成侧,基于 GStreamer 的 VVAS 通过插件(vvas_xinfer、vvas_xoverlay 等)及 JSON 配置,编排采集、预处理、推理、后处理与渲染,并原生支持空间分区、时间共享和 DMA-BUF 零拷贝等高级部署特性。文中以 YOLOX 检测示例演示了单条 gst-launch 命令即可描述完整流水线。预构建 Docker 镜像和 VEK385 评估板启动镜像使上手时间缩短至数分钟,Python/C++ API 覆盖从原型到量产。这些能力可使团队将更少时间花在底层集成上,更多聚焦于应用开发与性能优化。

阅读全文

为什么前向部署工程师成为企业AI最新、增长最快的角色

本文探讨了前线部署工程师(Forward Deployed Engineer, FDE)在企业AI领域成为增长最快的新兴角色的原因与现状。尽管企业AI采用率表面看很高,Gartner数据显示2026年第一季度80%的企业应用嵌入了至少一个AI智能体,但S&P Global Market Intelligence和麦肯锡指出仅有31%的企业真正在生产环境中运行智能体,银行保险业领先(47%),医疗和政府落后(18%和14%)。模型不断进步,真正缺失的是将企业实际工作流、数据和判断转化为可信赖的AI系统的人。FDE正是填补这一鸿沟的角色,其招聘量在2025年4月至2026年4月间暴涨729%,从643个职位增至5330个,薪资在17万至20万美元以上。OpenAI在2026年5月投入40亿美元建立专门的部署公司并收购了拥有约150名FDE的AI咨询公司Tomoro;Meta推出Agent Transformation Accelerator;Anthropic与Fidelity Information Services合作设计金融犯罪智能体;Google Cloud也扩大了FDE招聘。文章区分了FDE的两类工作:工作流构建者和集成与API专家,并建议在招聘前问清三个问题:实际招聘目的、合同结束后工程师的访问权限如何处理、如何提前定义成功。BCG和Forrester数据显示,智能体部署的中位价值实现时间为5.1个月,销售开发类为3.4个月,财务运营类则需8.9个月。Skai公司已在Skai Studio中部署自己的FDE团队来构建AI营销劳动力。

阅读全文

高级前向部署工程师

Hippocratic AI 发布高级前线部署工程师(Senior Forward Deployed Engineer)招聘信息,工作地点位于加利福尼亚州门洛帕克。Hippocratic AI 是一家专注于医疗健康领域的安全大语言模型(LLM)平台公司,已累计获得4.04亿美元融资,投资方包括 Andreessen Horowitz (a16z)、General Catalyst、Kleiner Perkins、NVIDIA NVentures 等顶级风投和医疗系统。该岗位要求候选人具备5-7年软件工程经验和专家级 Python 能力,深度掌握 LangChain 和 LangSmith 等 LLM 框架,能够架构和实现复杂的人工智能系统,包括先进的检索增强生成(RAG)系统、工具调用、模型上下文协议(MCP)集成模式以及 LLM-as-judge、多轮推理等高级大模型技术。核心职责包括设计先进 AI 解决方案、确保生产环境的可靠性、前瞻性解决客户问题以及指导初级工程师。理想的候选人需具有计算机科学学士学位,拥有医疗 IT 经验(如 EHR 集成、FHIR、HL7)或开源贡献者优先。该职位隶属于产品/设计部门,为全职岗位,旨在通过构建尖端 AI 系统推动医疗健康领域的创新和运营变革。

阅读全文