tencent_hunyuan/Hy-Embodied-VLM-1.0
模型介绍文件和版本Pull Requests讨论分析

Hy-Embodied-VLM-1.0

高效物理世界智能体

腾讯Robotics X × 混元视觉团队 × 福田实验室

arXiv Tech Report Models GitHub License

🔥 更新动态

  • [2026-07-15] 🚀 我们正式发布 Hy-Embodied-VLM-1.0!这是一款面向物理世界具身智能体的高效混合专家视觉-语言基础模型,每个token仅激活约30亿参数(总参数量约300亿),实现了极高的推理效率。模型权重已在Hugging Face开放,同时提供基于HuggingFace transformers和vLLM的推理代码。
    • [2026-06-15] 🤖 我们发布了 HY-VLA-0.5!官方代码、经UMI训练的模型权重以及2000多小时的高保真UMI数据集现已开放。
    • [2026-04-09] 🚀 我们发布了 HY-Embodied-0.5,开源的HY-Embodied-0.5 MoT-2B模型权重已在Hugging Face上线,并同步提供官方推理代码!

📖 摘要

构建具备能力的具身智能体不仅需要多模态感知与理解能力,还需要用于行动推理、适应不断变化的情境以及与物理世界交互的智能体能力。在本报告中,我们介绍Hy-Embodied-VLM-1.0,这是一款高效且功能强大的具身基础模型,专为在物理世界中运行的具身智能体设计。

为了从预训练阶段开始培养此类能力,我们定义了一个以行动为中心的能力分类体系,该体系包含三个递进维度:行动相关状态理解、行动-转换推理以及序列与自适应推理。在这一分类体系的指导下,我们开发了系统化的数据处理流程,并精心构建了涵盖预训练和后训练阶段的数据混合集。

为了提供强大的物理世界理解与交互能力,同时支持对延迟敏感的部署,我们基于Hy3-A3B语言主干和Hy-ViT2视觉编码器构建了我们的模型。其高效的混合专家(Mixture-of-Experts)架构将强大的模型容量与高推理效率相结合。我们在包含38项基准测试的综合套件上对Hy-Embodied-VLM-1.0进行了评估,这些测试涵盖具身感知、物理世界理解和具身推理。该模型在38项基准测试中的19项上取得了同规模模型中的最佳性能,并显著优于强大的竞争对手,包括Qwen3.6-A3B和Cosmos 3。与上一代Hy-Embodied-0.5 MoT-2B相比,Hy-Embodied-VLM-1.0的平均性能提升了8.4%。尽管仅激活30亿参数,但其性能已接近上一代激活320亿参数的模型。除了静态基准测试评估外,Hy-Embodied-VLM-1.0在需要多轮交互和长程推理的具身智能体任务上也表现出强大的性能。

Hy-Embodied-VLM-1.0 Performance

⭐️ 核心特性

  • 🧠 高效混合专家模型,约30亿激活参数 — 将Hy3-A3B语言主干与Hy-ViT2视觉编码器相结合,采用混合专家(Mixture-of-Experts)架构。每个token仅激活约30亿参数,约为上一代A32B系统激活参数的十分之一,同时整体性能接近相当水平。
    • 🌏 以行动为中心的能力分类体系 — 我们定义了三个递进的具身智能水平:(i) 行动相关状态理解,用于准确理解智能体及其环境的状态;(ii) 行动-转换推理,用于理解行动、规划行动并推理其后果;(iii) 序列与自适应推理,用于长周期规划、反思、修正和恢复。数据与训练均围绕此分类体系进行系统性设计。
    • 🔁 自进化后训练 — 通过自进化循环培养具身智能体推理能力,该循环将强化学习与拒绝采样微调相结合,并从少量精心挑选的高质量思维轨迹中汲取灵感。最终的奖励专门化阶段分别训练连续奖励和离散奖励RL策略并将其融合,在提供敏锐几何精度的同时,确保稳健的决策制定、规划和反思质量。
    • 🏆 具身智能基准测试的最先进水平 — 在38项基准测试中的19项排名第一,另有11项排名第二,性能超越Qwen3.6-A3B(平均提升4.4%)、Cosmos 3-8B和Embodied-R1.5-8B。在R2R-CE视觉与语言导航(仅RGB设置)方面达到最先进水平,并在Matterport3D物体目标导航任务上展现出强大的零样本性能。
Hy-Embodied-VLM-1.0 Capability Taxonomy

🧱 模型卡片

字段值
架构HYV3VLForConditionalGeneration(基于HYV3ForCausalLM MoE LLM + Hy-ViT2视觉编码器的视觉-语言封装器)
模型类型hy_v3_vl
总参数~300亿
每token激活参数~30亿(128个专家中的8个 + 1个共享专家)
上下文长度32,768 tokens
精度BF16
视觉输入图像(每个提示最多128张);原生宽高比
对话模板与权重捆绑的统一chat_template.jinja(支持enable_thinking关键字参数)

🛠️ 依赖项与安装

前提条件

  • 🖥️ 操作系统:Linux(推荐)
  • 🐍 Python:3.10 及以上版本
  • ⚡ CUDA:12.x(已在 H100 / H20 / A100 上测试)
  • 🔥 PyTorch:2.4 及以上版本
  • 🎮 GPU:NVIDIA GPU。完整的 BF16 模型需要跨 GPU 共约 86 GB 显存;单个 8×80 GB 节点即可满足需求。

安装

我们将依赖项固定为经过端到端验证的版本(vllm==0.14.1 + transformers==4.57.6 + torch==2.9.1)。安装这些依赖项最简洁的方式(确保 CUDA 构建版本与您的驱动匹配)是使用 uv:

# Install uv once (skip if you already have it)
curl -LsSf https://astral.sh/uv/install.sh | sh

# Create a fresh venv (Python 3.10+)
uv venv --python 3.12
source .venv/bin/activate

# Clone the repo (provides the vLLM plugin and example scripts)
git clone https://github.com/Tencent-Hunyuan/HY-Embodied
cd HY-Embodied

🚀 使用 vLLM 快速开始(推荐)

vLLM 是部署 Hy-Embodied-VLM-1.0 的推荐方式。安装 vLLM 及其匹配的 torch/transformers 库,然后安装本仓库的插件(用于注册 HYV3VL 模型以及推理/工具调用解析器):

# One-shot install: vllm + torch + torchvision + transformers at matching
# versions, with the CUDA build picked from your driver.
uv pip install vllm==0.14.1 --torch-backend auto

# Install this repo's vLLM plugin (registers HYV3VL model + parsers)
uv pip install -e Hy-Embodied-VLM-1.0/inference/vllm/

启动服务器

serve.sh 脚本封装了 vllm serve 命令,并附带了必要的参数(--reasoning-parser hunyuan_v3、--tool-call-parser hy_v3、--trust-remote-code、图像大小限制、聊天模板)。默认使用 Hub 模型 ID tencent/Hy-Embodied-VLM-1.0,因此无需手动下载模型:

# TP=4 by default; override MODEL_PATH / TP / PORT via env vars.
bash Hy-Embodied-VLM-1.0/inference/vllm/serve.sh

查询 OpenAI 兼容端点

curl http://127.0.0.1:8080/v1/chat/completions \
  -H "Content-Type: application/json" \
  -d '{
    "model": "hy_a3b",
    "messages": [{"role": "user", "content": "Describe how to grasp a cup."}],
    "max_tokens": 512,
    "chat_template_kwargs": {"enable_thinking": true}
  }'

Python(OpenAI SDK)— 文本、图像和流式传输

import base64
from pathlib import Path
from openai import OpenAI  # pip install "openai>=1.30" pillow

client = OpenAI(base_url="http://127.0.0.1:8080/v1", api_key="EMPTY")

# --- text-only ---
resp = client.chat.completions.create(
    model="hy_a3b",
    messages=[{"role": "user", "content": "How do you open a fridge?"}],
    max_tokens=512,
    temperature=0.7,
    extra_body={"chat_template_kwargs": {"enable_thinking": True}},
)
msg = resp.choices[0].message
if getattr(msg, "reasoning_content", None):
    print("[thinking]", msg.reasoning_content)
print("[answer]  ", msg.content)

# --- image + text ---
def encode_image(path):
    mime = "image/jpeg" if path.lower().endswith((".jpg", ".jpeg")) else "image/png"
    return f"data:{mime};base64,{base64.b64encode(Path(path).read_bytes()).decode()}"

resp = client.chat.completions.create(
    model="hy_a3b",
    messages=[{
        "role": "user",
        "content": [
            {"type": "image_url", "image_url": {"url": encode_image("example.jpg")}},
            {"type": "text", "text": "Describe the image in detail."},
        ],
    }],
    max_tokens=1024,
    temperature=0.7,
    extra_body={"chat_template_kwargs": {"enable_thinking": True}},
)
print(resp.choices[0].message.content)

有关完整的服务选项,请参见 Hy-Embodied-VLM-1.0/inference/vllm/README.md;完整客户端(包括流式传输)请参见 example_client.py。

🤗 替代方案:HuggingFace transformers(单实例)

适用于无需服务器的单实例/离线推理:

uv pip install torch==2.9.1 torchvision==0.24.1 --torch-backend auto
uv pip install transformers==4.57.6 accelerate pillow

# Run the demo (single image + a small batch; thinking and non-thinking modes)
cd Hy-Embodied-VLM-1.0/inference/transformers
python infer_hf.py

🧠 推理模式切换

Hy-Embodied-VLM-1.0 是一种混合推理模型。两种模式均训练到相同权重中;可通过聊天模板关键字参数按请求进行选择。

enable_thinking提示词后缀使用场景
True(默认)</think>复杂空间推理、规划、多步骤任务
False</think>superscript:直接回答、低延迟单轮问答

我们特意使用 enable_thinking(遵循 Qwen3 约定)而非 reasoning_effort。v0.22 之前的 vLLM 版本存在顶层 request.reasoning_effort 字段,会静默覆盖 chat_template_kwargs["reasoning_effort"](已由 vllm-project/vllm#43401 修复);enable_thinking 可避免此覆盖问题,且兼容所有 vLLM 版本。

🖥️ 硬件要求

  • 全精度推理:单节点 8×80 GB GPU(H100 / H20 / A100 80G)。模型权重为 BF16 格式(约 86 GB);建议张量并行度设为 4–8。
  • 服务部署:推荐每副本配置 4 张 80 GB GPU(tp=4)以实现最大吞吐量。
  • 开发/调试:任何 CUDA GPU。较小显存的 GPU 可能需要启用卸载或增加张量并行度。
  • 磁盘空间:约 120 GB(含缓存)用于存储模型权重,首次运行时会从 Hub 自动下载。

📊 评估

注:我们在 38 个具身相关基准上对 Hy-Embodied-VLM-1.0 A3B 进行了评估,并与参数规模相当的最先进模型进行了对比。详细方法请参考我们的技术报告。

动作相关状态理解

基准测试Hy-Embodied 0.5 MoT-2BQwen3.6-A3BEmbodied-R1.5 8BCosmos3-Nano 8BHy-Embodied VLM-1.0 A3B
BLINK82.787.977.882.487.3
CV-Bench89.288.686.888.089.7
PixMo-Points51.457.557.159.864.6
PointBench69.035.159.139.271.7
Depth-InHouse45.763.052.047.067.6
3DSRBench57.049.942.631.952.6
All-Angles-Bench55.164.048.451.963.4
DA-2K92.381.480.582.883.2
ERQA54.557.537.345.060.8
EmbSpatial-Bench82.883.276.080.082.7
MMSI-Bench33.241.929.834.041.8
MindCube66.355.027.932.870.0
SAT76.780.760.754.078.0
SIBench-mini58.260.951.952.564.5
SITE-Bench-Image62.771.760.359.672.3
ViewSpatial-Bench53.149.043.752.053.3
OpenEQA54.473.253.953.863.1
PartAfford30.125.582.632.263.7
RoboAfford73.566.760.676.271.5
RoboRefIt82.878.577.255.488.2
RefSpatial-Bench45.853.152.444.453.4
RoboSpatial-Home55.770.969.158.369.4
Where2Place68.070.073.071.065.0

动作-过渡推理

基准测试Hy-Embodied 0.5 MoT-2BQwen3.6-A3BEmbodied-R1.5 8BCosmos3-Nano 8BHy-Embodied VLM-1.0 A3B
FineBench56.976.967.163.580.3
CrossHOI-Bench40.758.055.151.063.2
PIO54.647.961.654.465.3
VABench-Point26.050.561.445.259.7
VABench-Visual-Trace75.080.389.881.679.7
ShareRobot-Bench-Affordance26.828.225.223.026.7
ShareRobot-Bench-Trajectory73.368.969.265.576.7
RoboBench-MCQ49.259.141.143.561.2

序列与自适应推理

基准测试Hy-Embodied 0.5 MoT-2BQwen3.6-A3BEmbodied-R1.5 8BCosmos3-Nano 8BHy-Embodied VLM-1.0 A3B
SITE-Bench-Video63.571.159.157.669.2
VSIBench60.557.559.250.458.9
EgoPlan245.549.961.042.649.6
Cosmos54.367.868.667.166.9
VLABench16.249.939.448.951.1
RoboBench-Planning54.253.939.441.554.9
RoboFAC35.641.443.934.451.0

注:Hy-Embodied 变体和 Qwen3.6-A3B 在思考模式下进行评估;Embodied-R1.5-8B 仅支持其指令配置;Cosmos3-Nano-8B 以非思考模式报告(启用思考模式会显著降低其性能)。

📜 旧版本

Hy-Embodied 系列的先前版本仍然完全可用:

版本描述位置
Hy-Embodied-0.5 (MoT-2B)首个版本:MoT 架构,20 亿激活参数,针对边缘部署优化Hy-Embodied-0.5/
Hy-Embodied-0.5-VLA经 UMI 训练的真实机器人操作 VLATencent-Hunyuan/Hy-Embodied-0.5-VLA
Hy-Embodied-0.5-X经过额外后训练的扩展变体Tencent-Hunyuan/HY-Embodied-0.5-X

📄 许可协议

本项目基于 Apache License 2.0 许可协议发布。详情请参见 LICENSE。

🏷️ 引用说明

如果您认为我们的研究成果对您的研究和应用有所帮助,请使用以下 BibTeX 格式引用我们的技术报告:

@article{tencent2026hyembodiedvlm10,
  title         = {Hy-Embodied-VLM-1.0: Efficient Physical-World Agents},
  author        = {Wang, Ziyi and Yu, Xumin and Rao, Yongming and Ling, Yonggen and Li, Yunheng and Wang, Oran and Gao, Mingqi and Zhou, Yuchen and Liang, Yves and Liu, Zuyan and others},
  year          = {2026},
  eprint        = {2607.12894},
  archivePrefix = {arXiv},
  url           = {https://arxiv.org/abs/2607.12894}
}

@article{tencent2026hyembodied05,
  title         = {HY-Embodied-0.5: Embodied Foundation Models for Real-World Agents},
  author        = {Team, HY and Yu, Xumin and Liu, Zuyan and Wang, Ziyi and Zhang, He and Rao, Yongming and Liu, Fangfu and Zhang, Yani and Zhao, Ruowen and Wang, Oran and others},
  year          = {2026},
  eprint        = {2604.07430},
  archivePrefix = {arXiv},
  url           = {https://arxiv.org/abs/2604.07430}
}

🙏 致谢

本项目基于 Hy3 MoE LLM 骨干网络和 Hy-ViT2 视觉编码器构建。感谢腾讯混元及 Robotics X 社区提供的基础设施、评估资源和设计反馈。