1
免责声明:Al优秘圈所有资讯仅代表作者个人观点,不构成任何投资理财建议。请确保访问网址为(kx.umi6.com) 投诉及建议

密室逃脱成AI新考场,通关率不足50%,暴露空间推理短板丨清华ICCV25

清华大学团队受密室逃脱游戏启发,提出EscapeCraft——一个3D密室逃脱环境,用于评估多模态大模型(MLLMs)在复杂任务中的推理和决策能力。该研究已入选ICCV 2025。

EscapeCraft是一个沉浸式互动环境,模型需通过自由探索寻找道具、解密码、逃出房间,每一步都涉及视觉、空间和逻辑推理。任务支持多种难度配置,线索位置可灵活调整,例如从箱子移到墙上,以测试模型对环境信息的处理能力。实验发现,GPT-4o在简单场景中表现良好,但当线索远离出口时,常重复错误路径导致失败。

研究还设计了多项创新指标,如“意图与结果一致性”和“道具获取率”,以全面评估模型的推理过程。结果显示,GPT-4o在高难度任务中仅26.5%的子目标是“真正理解后完成”,其余多为偶然成功。此外,Claude 3.5的错误中,61.1%源于推理问题,38.9%为视觉感知问题,表明“看到”并不等于“理解”。

评测涵盖GPT-4o、Gemini-1.5 Pro、Claude 3.5等模型。尽管GPT-4o成功率最高,但在复杂任务中仍频繁出错;国产模型Doubao 1.5 Pro在简单关卡中表现亮眼,交互成功率甚至超越GPT-4o。Gemini和Claude常因方向判断失误而“卡住”,多数模型存在“反复抓错”或“认错道具”等问题。

EscapeCraft不仅关注最终结果,更注重模型的探索和推理过程,为未来智能体研究提供了灵活的基础平台。

项目主页: https://thunlp-mt.github.io/EscapeCraft
GitHub地址: https://github.com/THUNLP-MT/EscapeCraft
论文原文: https://arxiv.org/abs/2503.10042v4

原文链接
本文链接:https://kx.umi6.com/article/21691.html
转载请注明文章出处
分享至
打开微信扫一扫
内容投诉
生成图片
相关推荐
换一换
阶跃星辰两款开源模型均位列 Hugging Face榜单Top 5
2025-02-25 12:57:29
前微软亚研院视觉专家胡瀚加入腾讯 负责混元多模态大模型
2025-01-08 15:42:57
让「GPT-4V」跑在手机上,这家中国大模型公司做到了
2024-08-07 11:18:02
张宏江消除“Scaling Law放缓”恐惧,直言未来将迎来“自主智能”的世界
2024-12-07 17:49:03
当下,阿里国际某个指标每两个月就翻一倍
2024-07-20 14:13:21
西部证券:具有视觉能力的多模态大模型将对视觉 SoC和存储带来新需求
2024-12-16 10:00:06
上海人工智能实验室开源多模态大模型“书生・万象 3.0”:能同时处理文本和多模态输入
2025-04-17 13:36:40
MiniMax刘华:构建多模态开源生态,研发不再围绕稠密架构
2025-02-23 16:00:51
超越Gemini3、GPT5.1,阿里千问登顶空间推理全球冠军
2025-11-26 15:49:46
精准锁定「硬骨头」:难样本筛选破局SFT依赖,GRPO-only斩获感知推理双最优
2025-11-28 12:26:14
腾讯微信正式发布多模态大模型 POINTS 1.5
2024-12-16 09:34:39
事关下一代大模型!斯坦福顶尖1%科学家许主洪加盟阿里通义
2025-09-30 12:26:16
阶跃星辰联合吉利首次开源 Step 系列多模态大模型,包含视频、语音两款模型
2025-02-18 11:13:42
24小时热文
更多
扫一扫体验小程序