计算机使用(CU)代理是一种人工智能系统,能够代表用户与真实应用程序(包括网页、桌面和移动应用)进行交互。它们可以导航界面、操作元素并回答有关内容的问题,从而构建强大的自动化和生产力工具。随着CU代理能够让人类安全高效地委托复杂数字任务,其重要性日益凸显。
我们的Holo1.5系列提供了构建此类代理的最先进基础模型。Holo1.5模型在网页、计算机和移动环境中,在用户界面(UI)定位和基于UI的问答(QA) 方面表现卓越,并在多项基准测试中取得了优异成绩,包括Screenspot-V2、Screenspot-Pro、GroundUI-Web、Showdown以及我们新推出的WebClick。
Holo1.5系列提供三种模型规模,以满足不同的部署需求:
这些模型旨在为下一代CU代理(如Surfer-H)提供可靠、准确且高效的基础,使其能够以前所未有的能力操作真实应用程序。
我们的模型采用高质量专有数据进行UI理解和动作预测训练,遵循多阶段训练流程。训练数据集是精心挑选的开源数据集、大规模合成数据和人工标注样本的混合体。
训练分为两个阶段:大规模监督微调,随后是在线强化学习(GRPO)。由此产生的Holo1.5模型原生支持高分辨率(高达3840 × 2160像素),能够准确高效地在大型复杂屏幕上解读UI并执行操作。
UI定位指智能体找到用户界面上元素(按钮、文本框、图像等)确切位置的能力。这一能力对计算机使用(CU)智能体至关重要,因为要与应用程序交互——点击按钮、填写表单或读取信息,智能体必须知道元素在屏幕上的位置。
我们的Holo1.5模型在多个标准UI定位基准测试集(Screenspot-V2、Screenspot-Pro、GroundUI-Web、Showdown以及我们新推出的WebClick)上进行了评估,以衡量其预测这些坐标的准确性。
结果如下:
这些结果在开源UI定位领域建立了新的帕累托前沿:实现了模型大小与定位 accuracy 之间迄今为止最佳的权衡,为CU智能体树立了新标准。
UI定位准确率与模型大小的帕累托前沿
我们的模型与竞争对手模型在UI定位基准测试集上的准确率。
| WebClick | Showdown | ScreenSpot-v2 | ScreenSpot-Pro | Ground-UI-1K | OSWorld-G | 平均 | |
|---|---|---|---|---|---|---|---|
| Holo1.5-3B | 81.45 | 67.50 | 91.66 | 51.49 | 83.20 | 61.57 | 72.81 |
| Holo1.5-7B | 90.24 | 72.17 | 93.31 | 57.94 | 84.00 | 66.27 | 77.32 |
| Holo1.5-72B | 92.43 | 76.84 | 94.41 | 63.25 | 84.50 | 71.80 | 80.54 |
| Qwen2.5-VL-3B | 71.20 | 50.30 | 80.00 | 29.30 | 76.40 | 34.31 | 56.92 |
| Qwen2.5-VL-7B | 76.51 | 52.00 | 85.60 | 29.00 | 80.70 | 40.59 | 60.73 |
| Qwen2.5-VL-72B | 88.29 | 41.00 | 93.30 | 55.60 | 85.40 | 61.96 | 70.93 |
| UI-TARS-1.5-7B | 86.10 | 58.00 | 94.00 | 39.00 | 84.20 | 61.40 | 70.45 |
| Holo1-7B | 84.04 | 64.27 | 89.85 | 26.06 | 78.50 | 47.25 | 65.00 |
| Holo1-3B | 79.35 | 59.96 | 88.91 | 23.66 | 74.75 | 42.16 | 61.47 |
| UI-Venus-7B | 84.44 | 67.32 | 94.10 | 50.80 | 82.30 | 58.80 | 72.96 |
| UI-Venus-72B | 77.00 | 75.58 | 95.30 | 61.90 | 75.50 | 70.40 | 75.95 |
| Sonnet 4 | 93.00 | 72.00 | 93.00 | 19.10 | 84.00 | 59.60 | 70.12 |
表1:主流模型的定位基准测试得分。粗体值表示最先进性能,斜体得分来自先前报告的来源,非斜体得分由内部复现获得
精确的定位对于GUI智能体至关重要,而模型理解用户界面的结构和功能以实现有效交互也同样重要。为评估这些能力,我们在多个聚焦GUI的问答(QA)基准测试集上对Holo1.5模型进行了测试,包括ScreenQA Short、ScreenQA Complex、VisualWebBench和WebSRC。这些基准测试集用于衡量模型理解UI并进行推理的能力,确保模型能够在各种应用中准确执行任务。
UI问答性能与模型大小的帕累托前沿
UI理解与视觉问答性能
| 模型 | VisualWebBench | WebSRC | ScreenQAShort | ScreenQAComplex | 平均值 |
|---|---|---|---|---|---|
| Holo1.5-3B | 78.50 | 94.80 | 87.90 | 81.40 | 85.65 |
| Holo1.5-7B | 82.60 | 95.90 | 91.00 | 83.20 | 88.17 |
| Holo1.5-72B | 83.80 | 97.20 | 91.90 | 87.10 | 90.00 |
| Qwen2.5-VL-3B | 58.00 | 93.00 | 86.00 | 76.00 | 78.25 |
| Qwen2.5-VL-7B | 69.00 | 95.00 | 87.00 | 81.10 | 83.02 |
| Qwen2.5-VL-72B | 76.30 | 97.00 | 87.90 | 83.20 | 86.10 |
| UI-TARS-1.5-7B | 79.70 | 92.90 | 88.70 | 79.20 | 85.12 |
| Holo1-3B | 54.10 | 93.90 | 78.30 | 53.50 | 69.95 |
| Holo1-7B | 38.10 | 95.30 | 83.30 | 65.10 | 70.45 |
| UI-Venus-7B | 60.90 | 96.60 | 86.30 | 82.30 | 81.52 |
| UI-Venus-72B | 74.10 | 96.70 | 88.60 | 83.30 | 85.67 |
| Claude-Sonnet-4 | 58.90 | 96.00 | 87.00 | 75.70 | 79.40 |
表2:主流模型的屏幕内容QA基准测试得分。粗体数值表示当前最先进(state-of-the-art)性能
Holo1.5模型在GUI QA任务中展现出令人印象深刻的能力,较当前最先进模型提升了3.9%。这表明其在网页和桌面环境中具备强大的视觉感知能力,这对于计算机使用智能体而言至关重要。
观看在计算机使用场景下如何提示模型的演示:
该演示也可在我们的 Hugging Face Space 上实时体验。
我们的目标是打造经济高效且可靠的计算机使用智能体。随着 Holo1.5 的发布,我们在促进该技术的信任度和 adoption 方面迈出了重要一步。
这一里程碑仅仅是开始——在未来几周内,我们将推出由 Holo 模型驱动的新工具和智能体。
敬请关注——我们才刚刚开始!
@misc{hai2025holo15modelfamily,
title={Holo1.5 - Open Foundation Models for Computer Use Agents},
author={H Company},
year={2025},
url={https://huggingface.co/collections/Hcompany/holo15-68c1a5736e8583a309d23d9b},
}