MiMo-V2.5-Pro-FP4-DFlash 是驱动 MiMo-V2.5-Pro-UltraSpeed 的底层模型:
两者协同作用,既降低了每参数的位宽,又减少了骨干网络前向传播的次数,而这两者正是万亿参数模型解码过程中的两大主要成本来源。
在万亿参数(1T)规模下,即便是8位(FP8/INT8)推理也会带来巨大的内存占用和内存带宽成本。降低参数位宽可直接加快解码速度。因此,我们采用FP4量化和块扩散推测解码技术。本版本的主要特点如下:
我们仅将MoE专家层量化为MXFP4(块大小32),并将注意力投影层和其他模块保持在更高精度(每层的注意力o_proj不进行FP4量化)。通过FP4 QAT,模型质量接近FP8基准:
| 基准测试 | MiMo-V2.5-Pro-FP8 | MiMo-V2.5-Pro-MXFP4 | 差异 |
|---|---|---|---|
| 通用智能体 | |||
| Claw-Eval (pass^3) | 63.8 | 67.8 | +6.27% |
| Humanity's Last Exam | 48.0 | 47.0 | -2.08% |
| Humanity's Last Exam (without tool) | 34.0 | 33.0 | -2.94% |
| 代码智能体 | |||
| SWE-Bench Pro | 57.2 | 58.8 | +2.80% |
| SWE-bench Verified | 78.9 | 77.4 | -1.90% |
传统推测解码依赖小型草稿模型猜测下一个标记,然后由大型模型进行验证;拒绝采样验证确保输出无损。其瓶颈在于草稿质量限制了接受率,而更强的草稿模型会消耗更多计算资源。
为打破这种权衡,我们采用块级掩码并行预测方法DFlash:草稿模型在一次前向传播中填充整个掩码位置块。我们在MiMo-V2.5-Pro上实现了这一方法,并针对万亿规模MoE和长上下文服务进行了自定义优化,使用Muon二阶优化器和模型自蒸馏技术,使得即使是小掩码块也能保持较高的接受率,同时将草稿阶段的成本降至接近极限:
在实际应用中,我们进一步将掩码块大小限制为8,以降低验证开销并提高并发性。
| 场景 | 接受长度 |
|---|---|
| WebDev | 6.30 |
| Math500 | 5.56 |
| HumanEval | 4.54 |
| MT-Bench | 3.18 |
| SWE-Bench | 4.29 |
| 组件 | 主干网络 | DFlash 草稿生成器 |
|---|---|---|
| 架构 | MiMoV2ForCausalLM | DFlashDraftModel |
| 总参数/激活参数 | 1.02T / 42B | 5层草稿网络 |
| 隐藏层维度 | 6144 | 6144 |
| 层数 | 70 | 5 |
| 注意力头数 | 128 | 128 |
| KV头数 | 8(GQA) | 8(GQA) |
| 头维度(QK / V) | 192 / 128 | 128 / 128 |
| SWA窗口大小 | 128 | 1024 |
| 块大小 | — | 8 |
| 捕获的主干网络层 | — | [0, 15, 31, 47, 69] |
| 主干网络RoPE基数 | 5,000,000 | 5,000,000 |
| 精度 | MXFP4(专家)混合精度 | BF16 |
| 最大上下文长度 | 1M | — |
SGLang支持采用FP4主干网络的DFlash推理。草稿生成器通过推测解码标志与主干网络一同启动,并继承主干网络的张量/专家并行拓扑结构。
以下是使用SGLang运行模型的示例。将--model指向此仓库,并将--speculative-draft-model-path指向其dflash/子目录。
python3 -m sglang.launch_server \
--model MiMo-V2.5-Pro-FP4-DFlash \
--speculative-algorithm DFLASH \
--speculative-draft-model-path MiMo-V2.5-Pro-FP4-DFlash/dflash \
--speculative-num-draft-tokens 8 \
--ep-size 16 \
--tensor-parallel-size 16 \
--data-parallel-size 2 \
--enable-dp-attention \
--enable-dp-lm-head \
--quantization fp8 \
--attention-backend fa3 \
--moe-dense-tp-size 1 \
--dtype bfloat16 \
--mem-fraction-static 0.65 \
--context-length 65536 \
--page-size 1 \
--trust-remote-code \
--disable-overlap-schedule \
--skip-server-warmup \
--dist-init-addr ${MASTER_ADDR}:20000 \
--nnodes ${WORLD_SIZE} \
--node-rank ${RANK} \
--host 0.0.0.0 \
--port 29999@misc{mimo2026v25pro_fp4dflash,
title={MiMo-V2.5-Pro-FP4-DFlash},
author={{Xiaomi MiMo Team}},
year={2026},
howpublished={\url{https://huggingface.co/collections/XiaomiMiMo/mimo-v25}},
}如有任何问题或反馈,请通过 mimo@xiaomi.com 与我们联系,或加入我们的社区: