HuggingFace镜像/Muse-Glimmer-30B
模型介绍
文件和版本
分析

Muse Glimmer 模型卡片

作者: Meta Superintelligence Lab
模型发布日期: 2026年8月
许可证: Apache 2.0

Muse Glimmer 是一款拥有300亿参数的因果语言模型,配备专用感知编码器。该模型从 Muse Spark 蒸馏而来,专为消费级硬件上的自主智能体任务而设计。它将多步推理、可靠工具使用、多模态理解和故障恢复等功能集成到单一模型中,可在本地运行,无需云基础设施或网络访问。

构建高效智能体需要多种关键能力协同工作,以实现用户目标。Muse Glimmer 针对以下能力进行了训练和评估:

  • 端到端智能体任务完成。 Muse Glimmer 在全任务基准测试(包括 DeepSearch QA、MCP-Atlas、𝛕3-Bench 和 SWE-Bench)上取得了较高的成功率。这些基准测试用于衡量其在框架内工作、编写和调试代码以及从头至尾解决多轮请求的能力。
  • 可靠工具使用。 该模型能够处理各种函数调用,并在扩展工作流中使用精确的模式调用工具。
  • 多步推理。 Muse Glimmer 能在较长时间范围内进行链式推理,在复杂、扩展的工作流中维持连贯的计划。
  • 故障恢复。 当工具调用失败或返回意外结果时,模型会诊断错误并重试,而非停止运行。
  • 多模态输入与推理。 通过专用感知编码器,该模型可接受交错的文本和图像输入。这使智能体能够在对话过程中同时解读截图、图表和文档。
  • 框架兼容性。 Muse Glimmer 可与 OpenClaw、Hermes Agent 及其他智能体编排模式协同工作。
  • 可控推理力度。 该模型支持不同的推理强度,以在质量和速度之间选择适当的平衡。
  • 多语言支持。 Muse Glimmer 基于超过100种语言的数据进行训练。

Muse Glimmer-30B 模型概述

模型架构带感知编码器的密集因果 Transformer
总参数~29.6B
语言模型
架构密集因果 Transformer
参数数量29.6B(含视觉编码器)
隐藏维度6656
层数52
注意力模式

局部,局部,局部,全局局部, 局部, 局部, 全局局部,局部,局部,全局

重复 | | 滑动窗口大小 | 2048 | | 门控注意力 | 是 | | 注意力头(Q / KV) | 32 / 2(GQA 比例 16:1) | | 头维度 | 128 | | FFN 类型 | SwiGLU | | FFN 中间维度 | 19,968 | | 位置编码 | RoPE(θ = 500,000),仅局部层 | | 感知 编码器 | ~1.8B 参数 ViT-G/14,50 层,宽度 1536, patch 大小 14 | | 词汇表大小 | 202,048 | | 分词器 | 200,000 BPE 令牌 + 2,048 特殊令牌 | | 每张图像的最大视觉令牌数 | 4,096 | | 上下文长度 | 131,072+ | | 支持的模态 | 输入:文本 + 图像,输出:文本 | | 训练数据 | 多模态内容来源于公开可用数据、第三方提供的数据以及 Meta 产品和服务的信息,由外部供应商网络和 Meta 人员进行整理和丰富。 | | 知识截止日期 | 2026 年 1 月 4 日 |

针对本地部署优化

Muse Glimmer 针对本地部署进行了优化,旨在在消费级硬件上以实用速度运行,同时不牺牲质量。

让模型适配您的设备。 我们采用量化技术将模型权重压缩至约 4 位精度,将语言模型缩减至 20 GB 以下。这为模型的 KV 缓存、用于图像理解的感知编码器以及推测解码草稿模型留下了足够的空间,使其能够在 24 GB 或 32 GB 的内存范围内同时运行。至关重要的是,我们已验证这种压缩在智能体任务上只会导致极小甚至无性能下降。

全精度K-Quant-DynamicK-Quant-17GB
性能下降百分比*-0.2%1.0%
目标硬件64GB VRAM32GB VRAM24GB VRAM

* 性能下降是通过 15 个常见基准测试的准确度指标平均值来衡量的

通过推测解码实现更快生成 Muse Glimmer 附带了一个基于 DFlash 的轻量级“草稿”模型,这是一个小型辅助网络,可一次性提议整个令牌块。DFlash 块扩散模型在单次前向传递中预测整个 16 个令牌的块。主模型随后并行验证这些提议,接受正确的令牌并纠正错误的令牌。这种技术使 Muse Glimmer 能够比标准的逐令牌生成显著更快地生成文本,同时保持相同的输出质量。在发布版本中,我们提供了量化的草稿模型版本,以减少内存开销。

组件设置
草稿层层数5
块大小16
注意力滑动窗口,2048,所有层
注意力头32 个查询 / 8 个 KV(GQA)
序列长度131,072
隐藏特征层5,均匀分布在目标层:52 层中的 {1, 13, 25, 37, 49}

我们在 MacBook M4-Max、M5-Max 以及 Nvidia RTX-5090 上测量了 K-Quant-17GB 模型与量化 DFlash 草稿模型的速度。该模型速度足以支持流畅的对话和实时智能体交互,所有这些都完全在您的设备上运行。

GPU无推测基准(令牌/秒)使用 DFlash 推测的平均值*(令牌/秒)加速比
Nvidia RTX 509074.9233.43.1 倍
Apple M4 Max23.737.81.5 倍
Apple M5 Max26.650.21.8 倍

* 在多样化提示集上的平均值。测量使用批大小 1 和贪婪解码。M4/M5 测量使用 ExecuTorch,RTX 使用 llama.cpp。

基准测试

我们在广泛的基准测试中对Muse Glimmer进行了评估,以衡量其实现有效自主智能体行为所需的多种能力。与Gemma4-31B和Qwen3.6-27B相比,Muse Glimmer在其规模级别中,在多个广泛使用的LLM基准测试中表现出色。

类别基准测试Muse Glimmer-30B High ReasoningGemma4-31B Thinking ModeQwen3.6-27B Thinking Mode
通用智能体MCP Atlas (Public)75.554.262.5
DeepSearch QA74.661.771.1
𝛕3-Banking23.515.116.7
WildClawBench47.637.643.2
GDPVal-AA v29538111141
Gaia243.336.440.0
SkillsBench (with skills)44.332.446.6
OSWorld-Verified65.958.575.6
智能体编码SWE-Bench Pro51.236.950.2
SWE-Bench Verified76.066.677.2
TerminalBench 2.1 (with terminus2)51.743.460.7
SciCode43.643.439.8
多模态Charxiv Reasoning78.877.778.4
ScreenSpot Pro75.475.976.1
OmniDocBench v1.575.872.577.8
MMMU Pro747375
安全与隐私CI Memories违规率 (↓): 26.4
覆盖率: 64.8
违规率 (↓): 12.1
覆盖率: 53.0
违规率 (↓): 53.4
覆盖率: 66.9
Siren AgentDojo攻击成功率 (↓): 28.4
实用性: 94.2
攻击成功率 (↓): 25.6
实用性: 90.8
攻击成功率 (↓): 40.3
实用性: 92.7
通用能力与推理IFBench77.076.070.8
AIME 202694.789.294.1
GPQA Diamond (AA)83.585.784.2
HLE Text (AA)22.023.623.1
AA-LCR80.068.373.3
Beam128K65.158.263.0

有关我们评估的更多详细信息,请参阅我们的报告。

最佳实践

为实现最佳性能,我们建议采用以下设置:

采样参数:使用以下配置:

  • temperature = 1.0
  • top_p = 0.95
  • top_k = 64

推理强度:推理强度控制模型在响应提示前的思考深度。可在系统提示中通过 Reasoning strength: <value> 来定义推理强度。Muse Glimmer 支持以下级别:low / medium / high / xhigh。对于复杂问题解决、编码和智能体任务,建议使用 high 或 xhigh。

信任与安全

与对待其他大型语言模型一样,我们强烈建议 Muse Glimmer 不应作为独立端点部署,而应作为整体 AI 系统的一部分,并根据其部署的使用场景和上下文,配备必要或适当的额外防护措施。系统保护是实现恰当的有用性-安全性平衡、缓解系统固有的安全风险以及将模型或系统与外部工具集成的关键。

评估
我们针对常见使用场景以及特定能力对 Muse Glimmer 进行了评估。常见使用场景评估衡量系统在构建最常见应用(包括聊天机器人、视觉应用、问答系统)时的安全风险。我们构建了专门的对抗性评估数据集,并对由 Muse Glimmer 模型及用于过滤输入提示和输出响应的防护措施组成的系统进行了评估。在具体情境中评估应用至关重要,因此我们建议为您的特定使用场景构建专门的评估数据集。

能力评估衡量模型在特定能力方面的固有脆弱性,并为此设计了专门的基准。我们还在适当情况下使用了行业标准的安全和能力基准。

Muse Glimmer 的评估主要围绕四个风险维度展开:

  1. 内容安全 — 对有害请求的标准拒绝对齐,以及对边界提示的校准响应。
  2. 智能体风险 — 不可逆操作确认政策、数据最小化原则、框架边界尊重以及对间接提示注入的抵抗能力。
  3. 隐私(适当信息流) — 受情境完整性(CI)理论启发,在代表个人与第三方交互时,尊重信息的情境完整性。
  4. 防范准备 — 化学与生物风险、网络风险以及失控风险。

准备情况

根据Meta的高级AI扩展框架(AAISF)的定义,Muse-Glimmer-30B不属于“前沿AI”,因为其整体能力通常弱于Muse Spark。但出于谨慎考虑,我们的准备团队对Muse-Glimmer-30B的风险概况进行了评估,并确定其风险等级如下:

  • 化学/生物领域:中等或更低风险;
  • 网络安全领域:中等或更低风险(推断);
  • 失控风险:中等或更低风险(推断)。

网络安全和失控风险等级被推断为中等或更低,因为Muse-Glimmer-30B的整体性能弱于Muse Spark 1.0,而后者在这些领域也获得了相同的风险等级。

在化学/生物领域,我们通过一系列科学知识和湿实验室调试基准对Muse-Glimmer-30B进行了评估(在Muse-Glimmer-30B同尺寸模型中性能最佳的结果以粗体显示;性能第二的结果以下划线显示——为便于参考,同时包含Kimi K3的结果):

基准测试Muse-Glimmer-30BGemma4-31BQwen3.6-27BKimi K3
MBCT41.5%50.6%45.9%58.9%
HPCT52.3%54.0%48.7%59.6%
VCT37.0%43.5%33.7%48.0%
WMDP(生物)86.5%85.9%84.8%89.1%
WMDP(化学)75.2%80.5%74.8%84.2%
实验室基准(ProtocolQA)80.2%75.8%69.1%81.9%

我们发现,Muse-Glimmer-30B的能力与同尺寸的其他模型大致相当,但其性能明显低于更大规模的开源模型,这表明该模型发布后不太可能实质性地产生新的威胁。我们还通过专门针对现实世界威胁行为者面临的独特瓶颈(这些瓶颈会阻碍或限制其成功)的评估套件对其进行了评估,结果显示其风险等级同样为中等或更低。有关上述评估及其方法的详细说明,请参见《Muse Spark安全与准备情况报告》。

训练时缓解措施

  1. 安全指令微调(Safety SFT):精心筛选的示例,用于展示正确的安全行为,包括智能体安全场景,涵盖工具使用边界、提示词注入抵抗以及权限处理。
  2. 安全强化学习(Safety RL):结合特定安全奖励信号的强化学习,对违反策略的行为进行惩罚,同时奖励对合法请求的有帮助响应。
  3. 适当的信息流:通过专用的合成训练数据,将数据敏感性识别、最小化和本地优先执行等原则直接嵌入模型权重中。

预期用途

预期使用场景:Muse Glimmer 旨在用于商业和研究用途。该模型针对自主智能体任务进行了优化,包括:

  • 本地 AI 智能体:完全在消费类设备上运行的多步骤规划、顺序工具调用、故障恢复和长周期任务执行。
  • 编码智能体:编写、调试和解决现实世界软件工程任务(例如 SWE-Bench 风格的工作流)。
  • 工具使用和函数调用:在扩展的多轮工作流中,基于可靠的模式进行工具调用。
  • 多模态推理:在智能体环境和信息丰富的环境中,结合对话来解释截图、图表、文档和图像。
  • 合成数据生成:为下游模型开发生成高质量的训练数据。
  • LLM 评估器:作为评估其他模型输出的评估器。

超出范围:以任何违反适用法律法规(包括贸易合规法律)的方式使用。以 Apache 2.0 许可条款禁止的任何其他方式使用。不支持音频输入/输出。

注意事项和局限性

Muse Glimmer 是一项存在已知和未知风险的技术。迄今为止进行的测试尚未也无法覆盖所有场景。

局限性:

  • 模型可能对用户提示产生不准确、有偏见或令人反感的响应。
  • 尽管针对智能体任务进行了优化,但模型在多步骤推理中仍可能出错,尤其是在训练数据中未充分表示的新场景中。
  • 模型未针对视频进行明确优化;视频输入将作为单独的帧进行处理。
  • 模型尚未对预训练数据中包含的所有语言进行评估。对于不在强支持范围内的语言,性能可能会下降。
  • 量化推理在边缘情况下可能与全精度推理存在轻微质量差异。
  • 模型不面向 18 岁以下个人下载或使用。在可能被 18 岁以下个人使用的系统中部署时,部署者有责任确保已充分评估并适当缓解此类使用相关的风险,并遵守所有适用法律。

负责任使用:开发人员应针对其特定应用和拟用语言进行自己的安全测试和调优。我们的使用政策可在此处找到

[链接](https://huggingface.co/meta−models/Muse−Glimmer−30B/blob/main/USAGEPOLICY.md)[链接](https://huggingface.co/meta-models/Muse-Glimmer-30B/blob/main/USAGE_POLICY.md)[链接](https://huggingface.co/meta−models/Muse−Glimmer−30B/blob/main/USAGEP​OLICY.md)

。在智能体环境中部署模型以执行现实世界操作时,建议实施额外的防护措施(例如不可逆操作的人工确认环节)。

发布的产物

所有产物均基于 Apache 2.0 协议发布:

产物描述
全精度权重(BF16)用于微调与研究的完整模型权重
4 位量化权重(2 种变体)针对 24/32 GB 消费级硬件推理进行优化
DFlash 草稿头用于加速生成的推测解码配套组件
感知编码器冻结的 ViT-G/14 视觉编码器(约 1.8B 参数)

关于模型的问题或意见反馈渠道: 请通过 Hugging Face 页面 https://huggingface.co/meta-models/ 提供有关模型的任何反馈、意见或错误报告。有关生成参数的更多技术信息以及在应用中使用 Muse Glimmer 的方法,请参阅开发者文档。