Xiaomi MiMo/MiMo-Embodied-7B
模型介绍
文件和版本
Pull Requests
讨论
分析

| 🤗 HuggingFace  | 📔 技术报告  |

一、引言

MiMo-Embodied 是一款功能强大的跨具身视觉语言模型,在自动驾驶和具身智能任务中均展现出最先进的性能。它是首个融合这两个关键领域的开源视觉语言模型(VLM),显著提升了在动态物理环境中的理解与推理能力。

二、模型能力

三、模型详情

四、评估结果

MiMo-Embodied 在具身智能三大核心能力(任务规划、可及性预测、空间理解)的17项基准测试中均表现卓越,显著超越现有开源具身视觉语言模型,且可与闭源模型相媲美。

此外,MiMo-Embodied 在自动驾驶三大核心能力(环境感知、状态预测、驾驶规划)的12项基准测试中同样表现出色——不仅显著优于现有开源和闭源视觉语言模型,还超越了专有视觉语言模型。

同时,在8项通用视觉理解基准测试上的评估证实,MiMo-Embodied 保留甚至增强了其通用能力,表明领域专业化训练不仅不会削弱模型的整体性能,反而能提升其综合水平。

具身智能基准测试

可及性与规划

空间理解

自动驾驶基准测试

单视图图像与多视图视频

多视图图像与单视图视频

通用视觉理解基准测试

标有*的结果通过我们的评估框架获得。

V. 案例可视化

具身智能

可操作性预测

任务规划

空间理解

自动驾驶

环境感知

状态预测

驾驶规划

现实世界任务

具身导航

具身操作

VI. 引用

@misc{hao2025mimoembodiedxembodiedfoundationmodel,
      title={MiMo-Embodied: X-Embodied Foundation Model Technical Report}, 
      author={Xiaomi Embodied Intelligence Team},
      year={2025},
      eprint={2511.16518},
      archivePrefix={arXiv},
      primaryClass={cs.RO},
      url={https://arxiv.org/abs/2511.16518}, 
}