HuggingFace镜像/MobileMoE-M-Base
模型介绍
文件和版本
分析

MobileMoE-M(Base)模型卡片

MobileMoE 是一族端侧 Mixture-of-Experts(MoE)语言模型,具有低于十亿激活参数,旨在推动端侧 LLM 的质量—效率帕累托前沿,包含三个模型规模(S/M/L):0.3B/0.5B/0.9B 激活参数(1.3B/2.8B/5.3B 总参数),并具备小于 3 GB 的 INT4 权重占用,以适配移动端 DRAM。每个规模均发布三种变体:Base 模型(预训练 + 中期训练)、SFT 模型(监督微调)和 QAT 模型(量化感知训练)。您当前位于 MobileMoE-M-Base 仓库——预训练的 0.5B 激活参数基础模型。

SML
激活 / 总参数272M / 1.3B528M / 2.8B922M / 5.3B
层数202632
模型维度76810241280
注意力头(Q / KV)12 / 416 / 420 / 4
路由专家606060
Top-k444
INT4 权重占用0.68 GB1.48 GB2.75 GB
BaseMobileMoE-S-BaseMobileMoE-M-BaseMobileMoE-L-Base
SFTMobileMoE-S-SFTMobileMoE-M-SFTMobileMoE-L-SFT
QAT (INT4)MobileMoE-S-QATMobileMoE-M-QATMobileMoE-L-QAT

如需详细技术报告:📝 MobileMoE:扩展端侧 Mixture of Experts

如需查看更多版本,请访问 🤗 MobileMoE 合集

MobileMoE 为端侧 LLM 建立了新的帕累托前沿

MobileMoE 为端侧 LLM 建立了新的帕累托前沿。 在 14 项涵盖常识、知识、科学、理解与推理的基准上计算的平均基准精度,分别与(a)单 token 推理计算量 Finf = 2Nact(GFLOPs)和(b)总参数量 Ntotal(B)作图;在(b)中,x 轴刻度标签显示总参数量(B) | 预计 INT4 内存占用(GB)。

核心特性

  • 面向端侧 LLM 的新帕累托前沿。 在 14 项基础基准测试中,MobileMoE 以低 2–4 倍的推理 FLOPs,匹配或超越领先的端侧稠密 LLM,并以最多减少 60% 的参数量,匹配或超越最先进的 MoE OLMoE-1B-7B。
  • 源自缩放定律的架构。 该架构源自端侧 MoE 缩放定律,在移动设备 内存 与 计算 约束下联合优化,定位端侧最佳区间:适度稀疏性,配合细粒度专家与共享专家。
  • 四阶段训练流程。 预训练 → 中期训练 → 指令微调 → INT4 量化感知训练,全部基于开源数据集。

模型信息

模型: MobileMoE-M-Base(预训练 + 中期训练)
激活参数: 528M
总参数: 2.8B
层数: 26
模型维度: 1024
注意力头: 16
KV 头: 4(GQA)
头维度: 64
路由专家: 60(细粒度,每个 FFN 隐藏维度 512)
每 token 激活专家数: 4(top-k sigmoid 路由,带归一化)
共享专家: 1,始终开启(FFN 隐藏维度 2048)
词汇表大小: 128,256
其他特性: QK-Norm、输入/输出嵌入绑定、RoPE(θ = 500,000)
输入模态: 文本
输出模态: 文本
语言: 英语
训练阶段: 预训练 → 中期训练
上下文长度: 8,192 tokens
精度: BF16
模型开发者: Meta
模型发布日期: 2026 年 8 月
许可证: MobileMoE 采用 FAIR NC 许可

结果

以下所有数值均对应 基础(预训练) 模型,并使用 lm-eval 在相同设置下通过贪心解码重新评测;少样本数量以括号形式标注在基准测试名称之后,未标注的基准测试采用 0-shot 评测。

基础基准测试

能力基准测试Gemma 3 270MSmolLM2 360MMobileMoE-SQwen3.5 0.8BMobileMoE-M
激活 / 总参数270M362M272M / 1.3B749M528M / 2.8B
常识推理HellaSwag41.456.558.954.968.3
PIQA68.371.775.471.377.5
SIQA40.240.746.842.150.2
WinoGrande53.759.058.659.961.6
知识MMLU (5-shot)26.725.243.748.254.7
NaturalQuestions (5-shot)4.17.412.66.220.9
TriviaQA (5-shot)14.326.833.219.549.0
科学ARC-Challenge (25-shot)29.440.546.544.051.0
ARC-Easy56.868.173.967.679.4
OpenBookQA30.437.634.636.039.4
阅读理解BoolQ58.361.860.274.675.1
DROP (3-shot)14.217.939.039.658.5
推理BIG-Bench Hard (3-shot)29.531.731.840.937.7
GSM8K (8-shot)1.85.336.244.151.6
平均33.539.346.546.455.4

训练

MobileMoE 采用四阶段训练流程。该 checkpoint 是阶段 2(mid-training)的输出。

Pre-trainingMid-trainingSFTQAT
上下文长度2,0488,1928,1928,192
总词元数~6T~500B~126B~21B
峰值学习率4×10-44×10-54×10-64×10-6
LR scheduleCosineLinearCosineCosine
Token dispatchdrop-and-paddrop-and-paddroplessdropless

如何使用

MobileMoE 采用自定义架构(model_type: mobilemoe),该架构尚未纳入上游 transformers,因此需要设置 trust_remote_code=True。建模代码随本仓库提供(configuration_mobilemoe.py、modeling_mobilemoe.py)。

依赖要求

pip install "torch>=2.1" "transformers>=4.57" "safetensors>=0.4" "accelerate>=1.0"

已在以下版本中验证:

包版本
torch2.8.0 (cu128)
transformers4.57.6
tokenizers0.22.2
safetensors0.7.0
accelerate1.13.0

批量评估时,推荐使用 vLLM(≥ 0.10.2),并设置 enforce_eager=True。

文本生成

这是一个基础模型——没有聊天模板,也未经过指令微调。请以纯文本续写的方式进行提示:

import torch
from transformers import AutoTokenizer, AutoModelForCausalLM

MODEL_ID = "facebook/MobileMoE-M-Base"

tokenizer = AutoTokenizer.from_pretrained(MODEL_ID)
model = AutoModelForCausalLM.from_pretrained(
    MODEL_ID,
    trust_remote_code=True,
    dtype=torch.bfloat16,
)
model.to("cuda" if torch.cuda.is_available() else "cpu")
model.eval()

prompt = "Why are open-source on-device language models great?"
inputs = tokenizer(prompt, return_tensors="pt").to(model.device)

outputs = model.generate(
    input_ids=inputs["input_ids"],
    attention_mask=inputs["attention_mask"],
    max_new_tokens=64,
    do_sample=False,
    temperature=None,
    top_p=None,
    pad_token_id=tokenizer.eos_token_id,
)
print(tokenizer.decode(outputs[0], skip_special_tokens=True))

已知问题。 在 transformers 4.57.6 中加载 tokenizer 时,会打印 fix_mistral_regex=True 警告。请忽略该警告,不要设置该标志,因为 MobileMoE 使用的是 Llama-3 tokenizer,其默认分词已经正确。

引用

@article{chen2026mobilemoe,
  title={MobileMoE: Scaling On-Device Mixture of Experts},
  author={Chen, Yanbei and Huang, Hanxian and Chang, Ernie and Szwejbka, Jacob and Desai, Digant and Liu, Zechun and Chandra, Vikas and Krishnamoorthi, Raghuraman},
  journal={arXiv preprint arXiv:2605.27358},
  year={2026}
}

许可证

MobileMoE 依据 FAIR Noncommercial Research License 发布。