何恺明团队发布多模态Harness框架

何恺明团队发布多模态Harness框架

💡 原文中文,约3900字,阅读约需10分钟。
📝

内容提要

何恺明团队提出视觉原生框架VISTA,使多模态模型能直接保存原始画面,并在推理时随时回看、放大和检查细节,无需重新训练。在该框架下,Claude Opus 5.0通关ARC-AGI-3全部25个公开游戏,动作效率得分满分100,动作数比人类基线少57.4%;GPT-5.6 Sol同样全部通关,得分99。团队还在浏览器游戏、迷宫和连线题中验证了该方法,并将具身任务列为后续方向。

🔎

延伸解读

VISTA 的核心机制:视觉档案与主动检查

VISTA 将环境返回的每一帧原样保存到上下文之外,包括动画中间帧,并按回合号和帧号建立索引。模型通过 inspect 工具可随时调取历史画面、裁剪放大局部或对比多帧变化。这种设计让视觉经验成为可反复检查的上下文,而无需将所有图片塞入模型上下文,既保留完整信息又避免上下文过载。

评测表现:动作效率与跨任务泛化

在 ARC-AGI-3 全部 25 个公开游戏中,Claude Opus 5.0 搭配 VISTA 相对人类动作效率得分满分 100,动作数比人类基线少 57.4%;GPT-5.6 Sol 同样全部通关,得分 99。在 GameWorld、AI GameStore 和 BabyVision 上,VISTA 也显著提升成功率或得分,表明同一框架经少量适配即可用于多种视觉任务。

无需重训模型:Harness 改变的是信息使用方式

VISTA 不额外训练基础模型,环境理解、行动规划和推理仍由现成多模态模型完成。Harness 负责工具调用、保存视觉历史并在需要时提供证据。这意味着提升来自模型获取、保存和使用视觉信息的方式,而非模型本身的能力变化,为现有模型在交互式视觉任务中的表现提供了新的优化路径。

局限与后续方向:从游戏谜题到具身任务

当前验证集中在 ARC-AGI-3、浏览器游戏、迷宫和连线题等数字环境,这些任务虽涉及视觉推理,但物理世界的动态变化和具身交互更为复杂。团队将具身任务列为后续研究方向,旨在让模型在持续变化的环境中保存、复查并利用视觉经验决定行动,其实际效果仍需进一步验证。

❓

Q&A

VISTA框架是什么?它主要解决什么问题?

VISTA是何恺明团队提出的视觉原生Harness框架,旨在让多模态模型在持续交互中直接观察环境、保存原始画面,并在推理时随时回看、放大和检查细节,无需重新训练模型。它解决了传统方法将环境抽象为文字或代码时,视觉信息难以完整保留和利用的问题。

VISTA在ARC-AGI-3基准上的表现如何?

搭配VISTA,Claude Opus 5.0完成了ARC-AGI-3全部25个公开游戏,相对人类动作效率得分达到满分100,所用动作数比首次游玩的人类基线少57.4%。GPT-5.6 Sol同样全部通关,得分达到99。

VISTA的三个核心组件分别是什么?各自的作用是什么?

VISTA包含三个核心组件:视觉观测,负责将环境画面提供给模型;无损视觉记忆,负责完整保存模型看到的画面,包括动画中间帧,并按回合号和帧号索引;主动视觉检查,通过inspect工具让模型按需回看历史画面、裁剪放大局部区域或对比多帧变化。

VISTA如何管理上下文,避免历史图片占用过多空间?

VISTA完整保存历史画面,但不会将所有图片都塞入模型上下文。每次执行动作后,框架默认只向模型展示最后一帧,中间画面保存在视觉档案中,等模型需要时再主动调取。同时,当上下文接近上限时,模型会整理交接摘要并进入新窗口,保留文字笔记、动作历史和视觉档案。

VISTA需要额外训练模型吗?它的工作方式是什么?

VISTA不需要额外训练新模型。环境理解、行动规划和推理仍由现成的多模态模型完成,Harness负责执行工具调用、保存视觉历史,并在模型需要时提供证据。它改变的是模型获取、保存和使用视觉信息的方式,而非模型本身。

除了ARC-AGI-3,VISTA还在哪些任务上验证了效果?结果如何?

VISTA还在GameWorld、AI GameStore和BabyVision三个基准上测试,覆盖浏览器游戏、迷宫和连线等任务。使用GPT-5.6 Sol,相比官方基础框架,VISTA在GameWorld的170项任务中将成功率从40.0%提高到63.3%;在AI GameStore的10个游戏中综合得分从47.3升至140.3;在BabyVision的39道迷宫与连线题上准确率从41.0%提高到63.2%。

VISTA未来的研究方向是什么?

研究将未来的验证方向指向更接近物理世界的具身任务,让模型在持续变化的环境中保存、复查并利用自己的视觉经验,决定下一步行动。

🏷️

标签

➡️

继续阅读