1
免责声明:Al优秘圈所有资讯仅代表作者个人观点,不构成任何投资理财建议。请确保访问网址为(kx.umi6.com) 投诉及建议

大模型掌握人类空间思考能力!三阶段训练框架学会“边画边想”,5个基准平均提升18.4%

“边看边画,边画边想”,让大模型掌握空间思考能力,实现空间推理任务新SOTA。

蚂蚁技术研究院自然语言组联合中科院自动化所和香港中文大学开源ViLaSR-7B。它在迷宫导航、静态图像理解、视频空间推理等5个基准上平均提升18.4%,在VSI-Bench上达45.4%,全面超越现有方法。模型展现了类似人类的空间推理策略和反思能力,迈向视觉智能的重要一步。

团队设计三阶段训练框架:冷启动训练建立基础视觉操作能力;反思拒绝采样筛选高质量推理路径;强化学习优化任务目标。

视觉推理从“视觉转文本”转向“Thinking with Images”。传统范式易丢关键信息,“Thinking with Images”通过图像操作增强推理能力。ViLaSR-7B通过“Drawing to Reason in Space”范式,让模型“边画边想”,显著提升推理效率与可解释性。

实验显示,ViLaSR-7B在多个基准上表现优异,尤其在VSI-Bench上领先Qwen2.5-VL-7B 12.7%。消融实验验证了各阶段的重要性,强化学习优化绘图操作效率,模型具备类人空间推理策略。

原文链接
本文链接:https://kx.umi6.com/article/20587.html
转载请注明文章出处
分享至
打开微信扫一扫
内容投诉
生成图片
相关推荐
换一换
微博CEO吐槽Manus能力拉跨:后悔买大模型年费包
2026-08-29 00:36:54
阿里Qwen3.8正式发布,编程与办公再进化,推理更快更稳定
2026-08-03 13:59:45
中国企业调用大模型日均达37万亿tokens
2026-02-24 13:54:18
长三角一体化大模型发布 AI将为区域发展提供决策支撑
2026-01-12 09:40:07
Show me《指环王》!卡帕西强推大模型评测新基准
2026-08-07 10:13:44
鏖战2025年,大模型围着开源转
2025-12-25 18:55:44
MiniMax M3一手实测:老黄PPT上74个Logo,我以为能难住它
2026-06-03 00:53:27
硅谷巨头集体掉队!DeepSeek登顶全球大模型调用榜:国产AI包揽前五
2026-08-03 18:12:04
大模型“吃”了全网的语料 “合理使用”与侵权的边界如何划清?
2026-08-28 17:20:10
独家专访|苏炜杰加入OpenAI:Scaling Law撞墙后为什么需要数学家出手?
2026-06-29 15:36:01
智谱首份业绩报告:商业化全面爆发,Maas平台ARR达17亿元提升60倍
2026-03-31 18:02:15
马斯克、黄仁勋同天发声:力挺中国AI
2026-07-27 16:19:12
10万国产卡支持!智谱发布轻量级旗舰模型对标DeepSeek
2026-08-27 00:50:13
24小时热文
更多
扫一扫体验小程序