
Meta发布Muse Glimmer:开源本地多模态Agent模型

Meta 今天发布了 Muse Glimmer,一个 30B 参数的多模态模型,基于 Apache 2.0 许可开源。模型专为本地 agent 场景设计,强调隐私、低成本和可 hack 性,适合编码、文档分析、个人助手等应用。
架构上,Muse Glimmer 是密集模型,包含 2B 参数的 ViT 风格图像编码器(Perception Encoder)和 28B 参数的文本解码器。文本解码器采用混合注意力机制:每四个层中前三个是滑动窗口注意力(窗口大小 2048 tokens,使用 RoPE),第四个是全注意力(无位置编码),共 52 层。注意力使用门控分组查询(GQA),每 16 个查询头共享一个 KV 头,KV 缓存减少 16 倍。此外实现 Q-K 归一化加额外查询缩放,稳定注意力 logits。还有一个可选的推测解码 drafter(基于 DFlash),特别适合结构化内容生成。
基准测试方面,Muse Glimmer 在多个 agentic 和编码基准上表现突出。在 MCP Atlas 上得分 75.5(Gemma4-31B 思考模式 54.2,Qwen3.6-27B 思考模式 62.5),在 DeepSearch QA 上 74.6(对比 61.7 和 71.1),在 SWE-Bench Verified 上 76.0(对比 66.6 和 77.2),在 OSWorld-Verified 上 65.9(对比 58.5 和 75.6)。多模态基准如 Charxiv Reasoning 上 78.8,与对比模型接近。安全方面,CI Memories violation 率 26.4(低于 Qwen3 的 53.4),Siren AgentDojo 攻击成功率 28.4(低于 Qwen3 的 40.3),但高于 Gemma4 的 12.1。
集成方面,Muse Glimmer 在发布当天即获得 transformers、llama.cpp、vLLM(transformers 后端)、Inference Endpoints 和 TRL 的原生支持。代码示例展示了纯文本、图像、视频推理、多模态工具调用和开放目标检测。微调方面支持从 SFT 到 Async GRPO 的多种方法,并提供了在 MolmoWeb 和 OpenCode 上的实验示例。
一个有趣的演示是模型可以自主操作:通过 HFace MCP 和 AGENTS.md 提示,Muse Glimmer 能搜索并运行自己的量化版本(自量化),部署到 HFace Inference Endpoints(自部署),优化自己的推理吞吐量(自优化),以及作为研究代理探索 Hub。这些功能展示了模型在本地 agent 场景中的实用性和自主性。


