内容提要
Holo4发布27B与35B-A3B模型,主打通用电脑操作。文章解析GUI Agent坐标离散化:将像素位置压缩到0—999符号,执行器再映射回真实像素,精度受截图裁剪、缩放、滚动与延迟影响。作者提供坐标往返误差检测代码,并提醒常见误区:动作后需再观察、多分辨率测试、注意CC BY-NC许可、榜单成功率不等于业务成功率。建议记录截图与视口参数,建立坐标回归集,高风险任务需二次确认与回滚。
延伸解读
坐标离散化的精度边界
文章指出,将像素位置压缩到0—999的符号集,再反映射回真实像素,会引入误差。误差大小受截图裁剪、高分屏缩放、滚动偏移与执行延迟影响。作者提供的往返误差检测代码在1920×1080下最大误差为0像素,但这仅验证坐标数学,未验证真实GUI定位。读者需注意,模型输出坐标正确不代表点击成功,实际精度还取决于执行环境。
常见误区与许可风险
文章提醒四个常见误区:一是把模型输出坐标当成已点对,动作后必须再观察;二是只在一个分辨率测试,系统缩放、浏览器缩放和远程桌面编码都可能改变映射;三是认为开源权重等于任意商用,Holo4-27B标注CC BY-NC 4.0,商业项目需核对许可;四是把榜单成功率当成业务成功率,真实任务中的弹窗、权限、网络抖动和数据变化都不在一个数字里。
工程实践:记录与回归
作者建议执行器保存截图尺寸、实际视口尺寸、裁剪偏移、缩放比和时间戳,与每个动作一起记录,以便区分模型定位错误和坐标转换错误。测试数据应包含小按钮、边缘位置、黑暗模式、不同语言、弹窗遮挡、界面动画和慢加载,并在100%、125%和150%系统缩放下重放,分别统计元素定位命中率、真实点击命中率和任务最终成功率。
高风险任务的安全清单
对于付款、删除、发布和权限变更等高风险任务,文章建议不应仅依赖视觉点击,至少需要二次确认、幂等键、可回滚日志和最小权限。一个可执行的清单是:动作前重新截图,核对目标文本与周边上下文;执行前将点击坐标与截图绑定;执行后检查预期状态变化;任何一步超时就停止,而不是连续盲点。这些机制比提示词更能决定真实安全。
Q&A
Holo4模型是什么?它有哪些版本和特点?
Holo4是H Company于9月28日发布的通用电脑操作模型,包含27B稠密模型和35B-A3B混合专家模型,权重有BF16、FP8、NVFP4和4-bit GGUF等形式。它能看截图点击、输入,也能写代码、调用API或MCP工具,配置上下文为262,144 token。
GUI Agent中的坐标离散化是什么?为什么需要它?
坐标离散化是将连续的像素位置映射为有限符号集(如0-999),以便自回归模型像生成文字一样生成动作。执行器再根据当前视口尺寸反映射为像素。这样模型不必背下每个像素,但精度受截图裁剪、高分屏缩放、滚动偏移与执行延迟影响。
如何检查GUI Agent的坐标往返误差?
可以编写一个简单的Python程序,定义encode和decode函数,将像素坐标归一化到1000个桶再还原,计算最大误差。文章提供了示例代码,在1920x1080分辨率下测试4个点,最大误差为0像素。
使用GUI Agent时有哪些常见误区?
常见误区包括:把模型说要点哪里当成已经点对,动作后必须再观察;只在一个分辨率测试,系统缩放、浏览器缩放等会改变映射;认为开源权重等于任意商用,Holo4-27B是CC BY-NC 4.0许可;把榜单成功率当成业务成功率,真实任务有弹窗、权限等变量。
GUI Agent适合和不适合哪些场景?
适合没有稳定API、但能通过界面完成的低风险流程,如内部系统搜索、录入草稿、整理报表。不适合付款、删除、发布和权限变更等高风险任务,这些至少需要二次确认、幂等键、可回滚日志和最小权限。
如何为GUI Agent建立有效的测试和保障机制?
建议建立不同分辨率的坐标回归集,单独统计定位正确但执行失败的比例。测试数据要包含小按钮、边缘位置、黑暗模式、不同语言、弹窗遮挡等,并在100%、125%、150%缩放下重放。记录元素定位命中率、真实点击命中率和任务最终成功率。高风险任务需动作前重新截图、执行前绑定坐标、执行后检查状态变化,超时停止。