HuggingFace镜像/Holo1.5-3B
模型介绍文件和版本分析

Holo1.5:计算机使用代理基础模型

GitHub Space

模型描述

计算机使用(CU)代理是一种人工智能系统,能够代表用户与真实应用程序(包括网页、桌面和移动应用)进行交互。它们可以导航界面、操作元素并回答有关内容的问题,从而构建强大的自动化和生产力工具。随着CU代理能够让人类安全高效地委托复杂数字任务,其重要性日益凸显。

我们的Holo1.5系列提供了构建此类代理的最先进基础模型。Holo1.5模型在网页、计算机和移动环境中,在用户界面(UI)定位和基于UI的问答(QA) 方面表现卓越,并在多项基准测试中取得了优异成绩,包括Screenspot-V2、Screenspot-Pro、GroundUI-Web、Showdown以及我们新推出的WebClick。

Holo1.5系列提供三种模型规模,以满足不同的部署需求:

  • 3B: 继承自Qwen的许可证
  • 7B: 完全开放,基于Apache 2.0许可证
  • 72B: 仅限研究用途的许可证(非商业)。如需商业用途,请联系我们。

这些模型旨在为下一代CU代理(如Surfer-H)提供可靠、准确且高效的基础,使其能够以前所未有的能力操作真实应用程序。

  • 开发机构: H Company
  • 模型类型: 用于计算机使用代理的视觉语言模型(VLM)
  • 微调基础模型: Qwen/Qwen2.5-VL-3B-Instruct
  • 博客文章: https://www.hcompany.ai/blog/holo-1-5
  • 许可证: Qwen研究许可证

训练策略

我们的模型采用高质量专有数据进行UI理解和动作预测训练,遵循多阶段训练流程。训练数据集是精心挑选的开源数据集、大规模合成数据和人工标注样本的混合体。

训练分为两个阶段:大规模监督微调,随后是在线强化学习(GRPO)。由此产生的Holo1.5模型原生支持高分辨率(高达3840 × 2160像素),能够准确高效地在大型复杂屏幕上解读UI并执行操作。

结果

Holo1.5:SOTA UI定位

UI定位指智能体找到用户界面上元素(按钮、文本框、图像等)确切位置的能力。这一能力对计算机使用(CU)智能体至关重要,因为要与应用程序交互——点击按钮、填写表单或读取信息,智能体必须知道元素在屏幕上的位置。

我们的Holo1.5模型在多个标准UI定位基准测试集(Screenspot-V2、Screenspot-Pro、GroundUI-Web、Showdown以及我们新推出的WebClick)上进行了评估,以衡量其预测这些坐标的准确性。

结果如下:

  • 我们的7B和72B模型性能超越所有先前模型,定位准确率平均提升4.5%。
  • 我们的3B模型虽然规模较小,但仍能与先前的7B模型相媲美,即使资源较少也展现出强大能力。

这些结果在开源UI定位领域建立了新的帕累托前沿:实现了模型大小与定位 accuracy 之间迄今为止最佳的权衡,为CU智能体树立了新标准。

UI定位准确率与模型大小的帕累托前沿

我们的模型与竞争对手模型在UI定位基准测试集上的准确率。

WebClickShowdownScreenSpot-v2ScreenSpot-ProGround-UI-1KOSWorld-G平均
Holo1.5-3B81.4567.5091.6651.4983.2061.5772.81
Holo1.5-7B90.2472.1793.3157.9484.0066.2777.32
Holo1.5-72B92.4376.8494.4163.2584.5071.8080.54
Qwen2.5-VL-3B71.2050.3080.0029.3076.4034.3156.92
Qwen2.5-VL-7B76.5152.0085.6029.0080.7040.5960.73
Qwen2.5-VL-72B88.2941.0093.3055.6085.4061.9670.93
UI-TARS-1.5-7B86.1058.0094.0039.0084.2061.4070.45
Holo1-7B84.0464.2789.8526.0678.5047.2565.00
Holo1-3B79.3559.9688.9123.6674.7542.1661.47
UI-Venus-7B84.4467.3294.1050.8082.3058.8072.96
UI-Venus-72B77.0075.5895.3061.9075.5070.4075.95
Sonnet 493.0072.0093.0019.1084.0059.6070.12

表1:主流模型的定位基准测试得分。粗体值表示最先进性能,斜体得分来自先前报告的来源,非斜体得分由内部复现获得

Holo1.5:通过问答实现SOTA屏幕内容理解

精确的定位对于GUI智能体至关重要,而模型理解用户界面的结构和功能以实现有效交互也同样重要。为评估这些能力,我们在多个聚焦GUI的问答(QA)基准测试集上对Holo1.5模型进行了测试,包括ScreenQA Short、ScreenQA Complex、VisualWebBench和WebSRC。这些基准测试集用于衡量模型理解UI并进行推理的能力,确保模型能够在各种应用中准确执行任务。

UI问答性能与模型大小的帕累托前沿

UI理解与视觉问答性能

模型VisualWebBenchWebSRCScreenQAShortScreenQAComplex平均值
Holo1.5-3B78.5094.8087.9081.4085.65
Holo1.5-7B82.6095.9091.0083.2088.17
Holo1.5-72B83.8097.2091.9087.1090.00
Qwen2.5-VL-3B58.0093.0086.0076.0078.25
Qwen2.5-VL-7B69.0095.0087.0081.1083.02
Qwen2.5-VL-72B76.3097.0087.9083.2086.10
UI-TARS-1.5-7B79.7092.9088.7079.2085.12
Holo1-3B54.1093.9078.3053.5069.95
Holo1-7B38.1095.3083.3065.1070.45
UI-Venus-7B60.9096.6086.3082.3081.52
UI-Venus-72B74.1096.7088.6083.3085.67
Claude-Sonnet-458.9096.0087.0075.7079.40

表2:主流模型的屏幕内容QA基准测试得分。粗体数值表示当前最先进(state-of-the-art)性能

Holo1.5模型在GUI QA任务中展现出令人印象深刻的能力,较当前最先进模型提升了3.9%。这表明其在网页和桌面环境中具备强大的视觉感知能力,这对于计算机使用智能体而言至关重要。

演示

观看在计算机使用场景下如何提示模型的演示:

该演示也可在我们的 Hugging Face Space 上实时体验。

后续计划

我们的目标是打造经济高效且可靠的计算机使用智能体。随着 Holo1.5 的发布,我们在促进该技术的信任度和 adoption 方面迈出了重要一步。

这一里程碑仅仅是开始——在未来几周内,我们将推出由 Holo 模型驱动的新工具和智能体。

敬请关注——我们才刚刚开始!

引用

@misc{hai2025holo15modelfamily,
      title={Holo1.5 - Open Foundation Models for Computer Use Agents}, 
      author={H Company},
      year={2025},
      url={https://huggingface.co/collections/Hcompany/holo15-68c1a5736e8583a309d23d9b}, 
}