综合
7*24 快讯
AI科普
合作
全部
英雄令
项目方
开发者
产品方
投资者
近日,何恺明团队发布最新论文,提出视觉原生的多模态Harness框架VISTA。该框架无需从头训练,即可让现有多模态模型直接观察环境、无损保存原始画面,并在推理时随时回看、放大检查细节,将视觉经验转化为可随时调用的上下文。在ARC-AGI-3评测中,搭配VISTA的Claude Opus 5.0以满分通关全部25个游戏,动作数比人类基线少57.4%;GPT-5.6 Sol也近乎满分通关。此外,在浏览器游戏、迷宫等任务中,VISTA均显著提升了模型成功率。未来,团队将向更接近物理世界的具身任务拓展,持续探索视觉经验的深度利用。
原文链接
加载更多
暂无内容