MiMo-Embodied 是一款功能强大的跨具身视觉语言模型,在自动驾驶和具身智能任务中均展现出最先进的性能。它是首个融合这两个关键领域的开源视觉语言模型(VLM),显著提升了在动态物理环境中的理解与推理能力。
MiMo-Embodied 在具身智能三大核心能力(任务规划、可及性预测、空间理解)的17项基准测试中均表现卓越,显著超越现有开源具身视觉语言模型,且可与闭源模型相媲美。
此外,MiMo-Embodied 在自动驾驶三大核心能力(环境感知、状态预测、驾驶规划)的12项基准测试中同样表现出色——不仅显著优于现有开源和闭源视觉语言模型,还超越了专有视觉语言模型。
同时,在8项通用视觉理解基准测试上的评估证实,MiMo-Embodied 保留甚至增强了其通用能力,表明领域专业化训练不仅不会削弱模型的整体性能,反而能提升其综合水平。
标有*的结果通过我们的评估框架获得。
@misc{hao2025mimoembodiedxembodiedfoundationmodel,
title={MiMo-Embodied: X-Embodied Foundation Model Technical Report},
author={Xiaomi Embodied Intelligence Team},
year={2025},
eprint={2511.16518},
archivePrefix={arXiv},
primaryClass={cs.RO},
url={https://arxiv.org/abs/2511.16518},
}