我们在官方博客中分享了 UI-TARS-1.5 模型的最新进展,该模型在游戏操作和图形界面任务处理方面表现卓越。
UI-TARS-1.5 是基于强大视觉语言模型构建的开源多模态智能体,能够高效执行虚拟世界中的多样化任务。
依托我们近期论文提出的基础架构,UI-TARS-1.5 融合了强化学习赋能的高级推理能力。这种设计使得模型在采取行动前能够进行思维推演,显著提升了其性能表现与适应能力,尤其在推理时扩展方面表现突出。全新的 1.5 版本在多项标准基准测试中取得了最先进的成果,展现出强大的推理能力,并较先前模型实现了显著提升。
代码仓库:https://github.com/bytedance/UI-TARS
桌面应用:https://github.com/bytedance/UI-TARS-desktop
在线基准评估
| 基准类型 | 基准测试 | UI-TARS-1.5 | OpenAI CUA | Claude 3.7 | 先前最佳模型 |
|---|---|---|---|---|---|
| 计算机操作 | OSworld (100步) | 42.5 | 36.4 | 28 | 38.1 (200步) |
| Windows Agent Arena (50步) | 42.1 | - | - | 29.8 | |
| 浏览器操作 | WebVoyager | 84.8 | 87 | 84.1 | 87 |
| Online-Mind2web | 75.8 | 71 | 62.9 | 71 | |
| 手机操作 | Android World | 64.2 | - | - | 59.5 |
视觉定位能力评估
| 基准测试 | UI-TARS-1.5 | OpenAI CUA | Claude 3.7 | 先前最佳模型 |
|---|---|---|---|---|
| ScreensSpot-V2 | 94.2 | 87.9 | 87.6 | 91.6 |
| ScreenSpotPro | 61.6 | 23.4 | 27.7 | 43.6 |
Poki 游戏测试
| 模型 | 2048 | cubinko | energy | free-the-key | Gem-11 | hex-frvr | Infinity-Loop | Maze:Path-of-Light | shapes | snake-solver | wood-blocks-3d | yarn-untangle | laser-maze-puzzle | tiles-master |
|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|
| OpenAI CUA | 31.04 | 0.00 | 32.80 | 0.00 | 46.27 | 92.25 | 23.08 | 35.00 | 52.18 | 42.86 | 2.02 | 44.56 | 80.00 | 78.27 |
| Claude 3.7 | 43.05 | 0.00 | 41.60 | 0.00 | 0.00 | 30.76 | 2.31 | 82.00 | 6.26 | 42.86 | 0.00 | 13.77 | 28.00 | 52.18 |
| UI-TARS-1.5 | 100.00 | 0.00 | 100.00 | 100.00 | 100.00 | 100.00 | 100.00 | 100.00 | 100.00 | 100.00 | 100.00 | 100.00 | 100.00 | 100.00 |
我的世界测试
| 任务类型 | 任务名称 | VPT | DreamerV3 | 先前最佳模型 | UI-TARS-1.5 无思维链 | UI-TARS-1.5 含思维链 |
|---|---|---|---|---|---|---|
| 挖掘方块 | (橡木原木) | 0.8 | 1.0 | 1.0 | 1.0 | 1.0 |
| (黑曜石) | 0.0 | 0.0 | 0.0 | 0.2 | 0.3 | |
| (白色床) | 0.0 | 0.0 | 0.1 | 0.4 | 0.6 | |
| 200任务平均 | 0.06 | 0.03 | 0.32 | 0.35 | 0.42 | |
| 击杀生物 | (哞菇) | 0.0 | 0.0 | 0.1 | 0.3 | 0.4 |
| (僵尸) | 0.4 | 0.1 | 0.6 | 0.7 | 0.9 | |
| (鸡) | 0.1 | 0.0 | 0.4 | 0.5 | 0.6 | |
| 100任务平均 | 0.04 | 0.03 | 0.18 | 0.25 | 0.31 |
本表格对比了不同参数量级的 UI-TARS 模型在 OSworld 基准测试中的性能表现。
| 基准测试类型 | 基准测试 | UI-TARS-72B-DPO | UI-TARS-1.5-7B | UI-TARS-1.5 |
|---|---|---|---|---|
| 计算机使用 | OSWorld | 24.6 | 27.5 | 42.5 |
| 图形界面定位 | ScreenSpotPro | 38.1 | 49.6 | 61.6 |
本次发布的 UI-TARS-1.5-7B 主要侧重于增强通用计算机使用能力,未针对游戏场景进行专门优化,在该领域 UI-TARS-1.5 仍保持显著优势。
我们将为顶级性能模型 UI-TARS-1.5 提供早期研究访问权限,以促进合作研究。感兴趣的研究人员可通过 TARS@bytedance.com 联系我们。
如果您在研究中认为我们的论文与模型具有参考价值,欢迎引用我们的工作。
@article{qin2025ui,
title={UI-TARS: Pioneering Automated GUI Interaction with Native Agents},
author={Qin, Yujia and Ye, Yining and Fang, Junjie and Wang, Haoming and Liang, Shihao and Tian, Shizuo and Zhang, Junda and Li, Jiahao and Li, Yunxin and Huang, Shijue and others},
journal={arXiv preprint arXiv:2501.12326},
year={2025}
}