Xiaomi MiMo/MiMo-V2.5-Pro-FP4-DFlash
模型介绍文件和版本Pull Requests讨论分析
下载使用量0



Xiaomi-MiMo

🤗 HuggingFace  |  📰 博客

🎨 小米MiMo API平台(申请访问)  |  🗨️ 小米MiMo Studio(免费试用)


社区
微信群  |  Discord  |  Telegram  |  Reddit

MiMo-V2.5-Pro-FP4-DFlash

MiMo-V2.5-Pro-FP4-DFlash 是驱动 MiMo-V2.5-Pro-UltraSpeed 的底层模型:

  • FP4 量化骨干网络:对 MoE 专家采用 MXFP4 量化,同时保持模型其他部分的更高精度,在几乎无损质量的前提下,显著减小模型体积并降低内存带宽压力。
  • BF16 DFlash 草稿生成器:用于块扩散推测解码,每次前向传播可生成一整个块的 tokens,并让骨干网络一步完成验证。

两者协同作用,既降低了每参数的位宽,又减少了骨干网络前向传播的次数,而这两者正是万亿参数模型解码过程中的两大主要成本来源。

1. 引言

在万亿参数(1T)规模下,即便是8位(FP8/INT8)推理也会带来巨大的内存占用和内存带宽成本。降低参数位宽可直接加快解码速度。因此,我们采用FP4量化和块扩散推测解码技术。本版本的主要特点如下:

  • 仅专家层FP4量化:对整个模型进行全面的FP4转换往往会降低在复杂推理和代码任务上的准确性和泛化能力。鉴于MiMo-V2.5-Pro的MoE架构中,专家层持有绝大多数参数且对量化的容忍度最高,我们仅将MoE专家层量化为FP4(MXFP4),而将其他模块保持其原始精度。通过FP4 QAT,模型在大幅减小体积和充分利用硬件带宽的同时,保留了近乎无损的性能。
  • DFlash推测解码:轻量级块扩散草稿模型可在单次前向传播中填充整个掩码位置块,消除了传统推测解码中串行草稿自回归的瓶颈,同时骨干模型的验证过程确保了输出质量。

2. FP4量化

我们仅将MoE专家层量化为MXFP4(块大小32),并将注意力投影层和其他模块保持在更高精度(每层的注意力o_proj不进行FP4量化)。通过FP4 QAT,模型质量接近FP8基准:

fp4 compare
基准测试MiMo-V2.5-Pro-FP8MiMo-V2.5-Pro-MXFP4差异
通用智能体
Claw-Eval (pass^3)63.867.8+6.27%
Humanity's Last Exam48.047.0-2.08%
Humanity's Last Exam (without tool)34.033.0-2.94%
代码智能体
SWE-Bench Pro57.258.8+2.80%
SWE-bench Verified78.977.4-1.90%

3. 块扩散推测解码(DFlash)

传统推测解码依赖小型草稿模型猜测下一个标记,然后由大型模型进行验证;拒绝采样验证确保输出无损。其瓶颈在于草稿质量限制了接受率,而更强的草稿模型会消耗更多计算资源。

为打破这种权衡,我们采用块级掩码并行预测方法DFlash:草稿模型在一次前向传播中填充整个掩码位置块。我们在MiMo-V2.5-Pro上实现了这一方法,并针对万亿规模MoE和长上下文服务进行了自定义优化,使用Muon二阶优化器和模型自蒸馏技术,使得即使是小掩码块也能保持较高的接受率,同时将草稿阶段的成本降至接近极限:

  • 草稿模型全程使用滑动窗口注意力(SWA),与MiMo-V2系列的SWA设计自然契合。草稿不再依赖完整前缀,因此每次预测的计算量从与上下文长度呈线性关系变为常数。
  • 训练期间,掩码信号在本地GPU分片上采样,因此单个序列在一步中即可产生数万个独立的训练信号,覆盖不同上下文长度的位置,这与MiMo-V2系列的长上下文能力相匹配,同时避免了跨设备通信开销。

在实际应用中,我们进一步将掩码块大小限制为8,以降低验证开销并提高并发性。

场景接受长度
WebDev6.30
Math5005.56
HumanEval4.54
MT-Bench3.18
SWE-Bench4.29

4. 模型摘要

组件主干网络DFlash 草稿生成器
架构MiMoV2ForCausalLMDFlashDraftModel
总参数/激活参数1.02T / 42B5层草稿网络
隐藏层维度61446144
层数705
注意力头数128128
KV头数8(GQA)8(GQA)
头维度(QK / V)192 / 128128 / 128
SWA窗口大小1281024
块大小—8
捕获的主干网络层—[0, 15, 31, 47, 69]
主干网络RoPE基数5,000,0005,000,000
精度MXFP4(专家)混合精度BF16
最大上下文长度1M—

5. 部署

SGLang支持采用FP4主干网络的DFlash推理。草稿生成器通过推测解码标志与主干网络一同启动,并继承主干网络的张量/专家并行拓扑结构。

SGLang部署

以下是使用SGLang运行模型的示例。将--model指向此仓库,并将--speculative-draft-model-path指向其dflash/子目录。

python3 -m sglang.launch_server \
    --model MiMo-V2.5-Pro-FP4-DFlash \
    --speculative-algorithm DFLASH \
    --speculative-draft-model-path MiMo-V2.5-Pro-FP4-DFlash/dflash \
    --speculative-num-draft-tokens 8 \
    --ep-size 16 \
    --tensor-parallel-size 16 \
    --data-parallel-size 2 \
    --enable-dp-attention \
    --enable-dp-lm-head \
    --quantization fp8 \
    --attention-backend fa3 \
    --moe-dense-tp-size 1 \
    --dtype bfloat16 \
    --mem-fraction-static 0.65 \
    --context-length 65536 \
    --page-size 1 \
    --trust-remote-code \
    --disable-overlap-schedule \
    --skip-server-warmup \
    --dist-init-addr ${MASTER_ADDR}:20000 \
    --nnodes ${WORLD_SIZE} \
    --node-rank ${RANK} \
    --host 0.0.0.0 \
    --port 29999

引用

@misc{mimo2026v25pro_fp4dflash,
  title={MiMo-V2.5-Pro-FP4-DFlash},
  author={{Xiaomi MiMo Team}},
  year={2026},
  howpublished={\url{https://huggingface.co/collections/XiaomiMiMo/mimo-v25}},
}

联系方式

如有任何问题或反馈,请通过 mimo@xiaomi.com 与我们联系,或加入我们的社区:

  • 微信群
  • Discord
  • Telegram
  • Reddit