作者: Meta Superintelligence Lab
模型发布日期: 2026年8月
许可证: Apache 2.0
Muse Glimmer 是一款拥有300亿参数的因果语言模型,配备专用感知编码器。该模型从 Muse Spark 蒸馏而来,专为消费级硬件上的自主智能体任务而设计。它将多步推理、可靠工具使用、多模态理解和故障恢复等功能集成到单一模型中,可在本地运行,无需云基础设施或网络访问。
构建高效智能体需要多种关键能力协同工作,以实现用户目标。Muse Glimmer 针对以下能力进行了训练和评估:
| 模型架构 | 带感知编码器的密集因果 Transformer |
|---|---|
| 总参数 | ~29.6B |
| 语言模型 | |
| 架构 | 密集因果 Transformer |
| 参数数量 | 29.6B(含视觉编码器) |
| 隐藏维度 | 6656 |
| 层数 | 52 |
| 注意力模式 |
重复 | | 滑动窗口大小 | 2048 | | 门控注意力 | 是 | | 注意力头(Q / KV) | 32 / 2(GQA 比例 16:1) | | 头维度 | 128 | | FFN 类型 | SwiGLU | | FFN 中间维度 | 19,968 | | 位置编码 | RoPE(θ = 500,000),仅局部层 | | 感知 编码器 | ~1.8B 参数 ViT-G/14,50 层,宽度 1536, patch 大小 14 | | 词汇表大小 | 202,048 | | 分词器 | 200,000 BPE 令牌 + 2,048 特殊令牌 | | 每张图像的最大视觉令牌数 | 4,096 | | 上下文长度 | 131,072+ | | 支持的模态 | 输入:文本 + 图像,输出:文本 | | 训练数据 | 多模态内容来源于公开可用数据、第三方提供的数据以及 Meta 产品和服务的信息,由外部供应商网络和 Meta 人员进行整理和丰富。 | | 知识截止日期 | 2026 年 1 月 4 日 |
Muse Glimmer 针对本地部署进行了优化,旨在在消费级硬件上以实用速度运行,同时不牺牲质量。
让模型适配您的设备。 我们采用量化技术将模型权重压缩至约 4 位精度,将语言模型缩减至 20 GB 以下。这为模型的 KV 缓存、用于图像理解的感知编码器以及推测解码草稿模型留下了足够的空间,使其能够在 24 GB 或 32 GB 的内存范围内同时运行。至关重要的是,我们已验证这种压缩在智能体任务上只会导致极小甚至无性能下降。
| 全精度 | K-Quant-Dynamic | K-Quant-17GB | |
|---|---|---|---|
| 性能下降百分比* | - | 0.2% | 1.0% |
| 目标硬件 | 64GB VRAM | 32GB VRAM | 24GB VRAM |
* 性能下降是通过 15 个常见基准测试的准确度指标平均值来衡量的
通过推测解码实现更快生成 Muse Glimmer 附带了一个基于 DFlash 的轻量级“草稿”模型,这是一个小型辅助网络,可一次性提议整个令牌块。DFlash 块扩散模型在单次前向传递中预测整个 16 个令牌的块。主模型随后并行验证这些提议,接受正确的令牌并纠正错误的令牌。这种技术使 Muse Glimmer 能够比标准的逐令牌生成显著更快地生成文本,同时保持相同的输出质量。在发布版本中,我们提供了量化的草稿模型版本,以减少内存开销。
| 组件 | 设置 |
|---|---|
| 草稿层层数 | 5 |
| 块大小 | 16 |
| 注意力 | 滑动窗口,2048,所有层 |
| 注意力头 | 32 个查询 / 8 个 KV(GQA) |
| 序列长度 | 131,072 |
| 隐藏特征层 | 5,均匀分布在目标层:52 层中的 {1, 13, 25, 37, 49} |
我们在 MacBook M4-Max、M5-Max 以及 Nvidia RTX-5090 上测量了 K-Quant-17GB 模型与量化 DFlash 草稿模型的速度。该模型速度足以支持流畅的对话和实时智能体交互,所有这些都完全在您的设备上运行。
| GPU | 无推测基准(令牌/秒) | 使用 DFlash 推测的平均值*(令牌/秒) | 加速比 |
|---|---|---|---|
| Nvidia RTX 5090 | 74.9 | 233.4 | 3.1 倍 |
| Apple M4 Max | 23.7 | 37.8 | 1.5 倍 |
| Apple M5 Max | 26.6 | 50.2 | 1.8 倍 |
* 在多样化提示集上的平均值。测量使用批大小 1 和贪婪解码。M4/M5 测量使用 ExecuTorch,RTX 使用 llama.cpp。
我们在广泛的基准测试中对Muse Glimmer进行了评估,以衡量其实现有效自主智能体行为所需的多种能力。与Gemma4-31B和Qwen3.6-27B相比,Muse Glimmer在其规模级别中,在多个广泛使用的LLM基准测试中表现出色。
| 类别 | 基准测试 | Muse Glimmer-30BHigh Reasoning | Gemma4-31B Thinking Mode | Qwen3.6-27B Thinking Mode |
|---|---|---|---|---|
| 通用智能体 | MCP Atlas (Public) | 75.5 | 54.2 | 62.5 |
| DeepSearch QA | 74.6 | 61.7 | 71.1 | |
| 𝛕3-Banking | 23.5 | 15.1 | 16.7 | |
| WildClawBench | 47.6 | 37.6 | 43.2 | |
| GDPVal-AA v2 | 953 | 811 | 1141 | |
| Gaia2 | 43.3 | 36.4 | 40.0 | |
| SkillsBench (with skills) | 44.3 | 32.4 | 46.6 | |
| OSWorld-Verified | 65.9 | 58.5 | 75.6 | |
| 智能体编码 | SWE-Bench Pro | 51.2 | 36.9 | 50.2 |
| SWE-Bench Verified | 76.0 | 66.6 | 77.2 | |
| TerminalBench 2.1 (with terminus2) | 51.7 | 43.4 | 60.7 | |
| SciCode | 43.6 | 43.4 | 39.8 | |
| 多模态 | Charxiv Reasoning | 78.8 | 77.7 | 78.4 |
| ScreenSpot Pro | 75.4 | 75.9 | 76.1 | |
| OmniDocBench v1.5 | 75.8 | 72.5 | 77.8 | |
| MMMU Pro | 74 | 73 | 75 | |
| 安全与隐私 | CI Memories | 违规率 (↓): 26.4 覆盖率: 64.8 | 违规率 (↓): 12.1 覆盖率: 53.0 | 违规率 (↓): 53.4 覆盖率: 66.9 |
| Siren AgentDojo | 攻击成功率 (↓): 28.4 实用性: 94.2 | 攻击成功率 (↓): 25.6 实用性: 90.8 | 攻击成功率 (↓): 40.3 实用性: 92.7 | |
| 通用能力与推理 | IFBench | 77.0 | 76.0 | 70.8 |
| AIME 2026 | 94.7 | 89.2 | 94.1 | |
| GPQA Diamond (AA) | 83.5 | 85.7 | 84.2 | |
| HLE Text (AA) | 22.0 | 23.6 | 23.1 | |
| AA-LCR | 80.0 | 68.3 | 73.3 | |
| Beam128K | 65.1 | 58.2 | 63.0 |
有关我们评估的更多详细信息,请参阅我们的报告。
为实现最佳性能,我们建议采用以下设置:
采样参数:使用以下配置:
推理强度:推理强度控制模型在响应提示前的思考深度。可在系统提示中通过 Reasoning strength: <value> 来定义推理强度。Muse Glimmer 支持以下级别:low / medium / high / xhigh。对于复杂问题解决、编码和智能体任务,建议使用 high 或 xhigh。
与对待其他大型语言模型一样,我们强烈建议 Muse Glimmer 不应作为独立端点部署,而应作为整体 AI 系统的一部分,并根据其部署的使用场景和上下文,配备必要或适当的额外防护措施。系统保护是实现恰当的有用性-安全性平衡、缓解系统固有的安全风险以及将模型或系统与外部工具集成的关键。
评估
我们针对常见使用场景以及特定能力对 Muse Glimmer 进行了评估。常见使用场景评估衡量系统在构建最常见应用(包括聊天机器人、视觉应用、问答系统)时的安全风险。我们构建了专门的对抗性评估数据集,并对由 Muse Glimmer 模型及用于过滤输入提示和输出响应的防护措施组成的系统进行了评估。在具体情境中评估应用至关重要,因此我们建议为您的特定使用场景构建专门的评估数据集。
能力评估衡量模型在特定能力方面的固有脆弱性,并为此设计了专门的基准。我们还在适当情况下使用了行业标准的安全和能力基准。
Muse Glimmer 的评估主要围绕四个风险维度展开:
根据Meta的高级AI扩展框架(AAISF)的定义,Muse-Glimmer-30B不属于“前沿AI”,因为其整体能力通常弱于Muse Spark。但出于谨慎考虑,我们的准备团队对Muse-Glimmer-30B的风险概况进行了评估,并确定其风险等级如下:
网络安全和失控风险等级被推断为中等或更低,因为Muse-Glimmer-30B的整体性能弱于Muse Spark 1.0,而后者在这些领域也获得了相同的风险等级。
在化学/生物领域,我们通过一系列科学知识和湿实验室调试基准对Muse-Glimmer-30B进行了评估(在Muse-Glimmer-30B同尺寸模型中性能最佳的结果以粗体显示;性能第二的结果以下划线显示——为便于参考,同时包含Kimi K3的结果):
| 基准测试 | Muse-Glimmer-30B | Gemma4-31B | Qwen3.6-27B | Kimi K3 |
|---|---|---|---|---|
| MBCT | 41.5% | 50.6% | 45.9% | 58.9% |
| HPCT | 52.3% | 54.0% | 48.7% | 59.6% |
| VCT | 37.0% | 43.5% | 33.7% | 48.0% |
| WMDP(生物) | 86.5% | 85.9% | 84.8% | 89.1% |
| WMDP(化学) | 75.2% | 80.5% | 74.8% | 84.2% |
| 实验室基准(ProtocolQA) | 80.2% | 75.8% | 69.1% | 81.9% |
我们发现,Muse-Glimmer-30B的能力与同尺寸的其他模型大致相当,但其性能明显低于更大规模的开源模型,这表明该模型发布后不太可能实质性地产生新的威胁。我们还通过专门针对现实世界威胁行为者面临的独特瓶颈(这些瓶颈会阻碍或限制其成功)的评估套件对其进行了评估,结果显示其风险等级同样为中等或更低。有关上述评估及其方法的详细说明,请参见《Muse Spark安全与准备情况报告》。
预期使用场景:Muse Glimmer 旨在用于商业和研究用途。该模型针对自主智能体任务进行了优化,包括:
超出范围:以任何违反适用法律法规(包括贸易合规法律)的方式使用。以 Apache 2.0 许可条款禁止的任何其他方式使用。不支持音频输入/输出。
Muse Glimmer 是一项存在已知和未知风险的技术。迄今为止进行的测试尚未也无法覆盖所有场景。
局限性:
负责任使用:开发人员应针对其特定应用和拟用语言进行自己的安全测试和调优。我们的使用政策可在此处找到
。在智能体环境中部署模型以执行现实世界操作时,建议实施额外的防护措施(例如不可逆操作的人工确认环节)。
所有产物均基于 Apache 2.0 协议发布:
| 产物 | 描述 |
|---|---|
| 全精度权重(BF16) | 用于微调与研究的完整模型权重 |
| 4 位量化权重(2 种变体) | 针对 24/32 GB 消费级硬件推理进行优化 |
| DFlash 草稿头 | 用于加速生成的推测解码配套组件 |
| 感知编码器 | 冻结的 ViT-G/14 视觉编码器(约 1.8B 参数) |
关于模型的问题或意见反馈渠道: 请通过 Hugging Face 页面 https://huggingface.co/meta-models/ 提供有关模型的任何反馈、意见或错误报告。有关生成参数的更多技术信息以及在应用中使用 Muse Glimmer 的方法,请参阅开发者文档。