1
免责声明:Al优秘圈所有资讯仅代表作者个人观点,不构成任何投资理财建议。请确保访问网址为(kx.umi6.com) 投诉及建议

大模型首次拥有“脖子”!纽大团队实现360度类人视觉搜索

纽约大学研究团队在论文《Thinking in 360°: Humanoid Visual Search in the Wild》中,提出了一种全新的“类人视觉搜索”(Humanoid Visual Search, HVS)任务,让大模型能够像人类一样环顾四周,进行360度的主动视觉推理。他们还构建了全新基准测试H*Bench,涵盖交通枢纽、购物中心等复杂场景,突破了传统测试仅聚焦简单家庭环境的局限。

研究核心是赋予智能体“交互性”和“具身性”,通过模拟头部转动改变视角,结合物理动作完成视觉推理。具体任务包括两类:类人物体搜索(HOS),定位目标物体;类人路径搜索(HPS),识别可通行路径并调整朝向。这些任务被形式化为多模态推理问题,利用策略网络实现工具使用与头部旋转,无需依赖3D模拟器或硬件。

为支持研究,团队创建了H*数据集,包含约3000个标注任务实例,覆盖纽约、巴黎等全球大都市的真实场景,如零售环境、交通枢纽等。通过监督微调和多轮强化学习,团队将多模态大模型转化为高效视觉搜索智能体。实验基于Qwen2.5-VL-3B-Instruct模型展开,结果显示其在目标搜索和路径搜索任务中的准确率分别从14.83%提升至47.38%、6.44%提升至24.94%。

然而,研究也暴露了高级推理的瓶颈,例如物理常识和社会空间规则的理解不足。此外,模型尺寸并非性能的唯一决定因素,较小模型在某些任务中表现优于更大模型。

这项研究由纽约大学李一鸣团队完成,他目前在英伟达从事物理人工智能研究,并将于2026年入职清华大学人工智能学院担任助理教授。研究为视觉空间推理从“被动范式”向“主动范式”的转型奠定了基础,推动了具身智能的发展。

参考链接:
[1] https://yimingli-page.github.io/
[2] https://arxiv.org/pdf/2511.20351

原文链接
本文链接:https://kx.umi6.com/article/29275.html
转载请注明文章出处
分享至
打开微信扫一扫
内容投诉
生成图片
相关推荐
换一换
拓元智慧完成近亿元人民币Pre-A轮融资
2024-12-31 17:46:35
阶跃星辰 CEO 姜大昕:智能终端可能成为未来的 AI 入口
2025-11-16 15:39:12
李飞飞谢赛宁新作「空间推理」:多模态大模型性能突破关键所在
2024-12-23 12:52:12
上海人工智能实验室开源多模态大模型“书生・万象 3.0”:能同时处理文本和多模态输入
2025-04-17 13:36:40
当下,阿里国际某个指标每两个月就翻一倍
2024-07-20 14:13:21
SFT别急着接RL!你的多模态大模型可能一直在“带伤训练”
2026-05-17 12:36:43
多模态大模型不会画辅助线?最新评估得分:o3仅25.8%,远低于人类82.3% | 清华腾讯斯坦福联合
2025-05-28 16:33:14
哈工深聂礼强:多模态大模型是具身智能发展的关键动力丨具身智能十人谈
2024-08-02 18:26:27
多模态大模型崛起:IP和创作者的新时代
2025-04-17 18:47:50
事关下一代大模型!斯坦福顶尖1%科学家许主洪加盟阿里通义
2025-09-30 12:26:16
北大王选所彭宇新团队:让多模态大模型学会「看懂物种关系」丨CVPR 2026
2026-03-18 15:28:55
多模态实力领跑开源大模型!阶跃星辰与吉利宣布联合开源两款多模态大模型
2025-02-18 10:16:14
多模态大模型事实正确性评估:o1最强,模型普遍过于自信,最擅长现代建筑/工程技术/科学
2025-02-23 14:57:45
24小时热文
更多
扫一扫体验小程序