1
免责声明:Al优秘圈所有资讯仅代表作者个人观点,不构成任何投资理财建议。请确保访问网址为(kx.umi6.com) 投诉及建议

标题:李飞飞吴佳俊团队推出具身智能决策能力评价基准,o1-preview登顶

大模型的具身智能决策能力有了系统的通用评估基准。李飞飞吴佳俊团队提出的EAI框架对具身智能决策的四项关键子能力进行了全面评估。

该框架已被选为NeurIPS数据和测试集专栏Oral论文,并收录进PyPI,方便调用。EAI框架通过统一的目标表示方法和模块化的评估方式,提升了模型间的互操作性与可比性。

测试显示,在公开的大模型中,o1-preview综合成绩最佳。EAI采用线性时态逻辑(LTL)统一目标表示,提高模块互操作性,便于比较不同模型在同一任务上的表现。EAI框架将模型能力分为目标解释、子目标分解、动作序列规划、转换建模四大模块,并设计了细致的评估指标。

EAI在BEHAVIOR和VirtualHome两种环境下评估了18款主流模型。在BEHAVIOR环境中,o1-preview得分最高;而在VirtualHome环境中,o1-preview依然领先,但前三名差距不大。各模型在不同子任务上的表现各异,例如Claude 3.5 Sonnet在BEHAVIOR环境中的目标解释能力优于o1-preview,Mistral Large在VirtualHome环境中的动作序列规划表现最佳。

EAI还深入分析了模型的失败情况,发现了一些具体问题,如将中间状态误识别为最终目标状态、对隐含的物理关系理解不足等,为后续研究提供了重要参考。项目主页、论文和代码均已发布,可供进一步探索。

项目主页:https://embodied-agent-interface.github.io/

论文:https://arxiv.org/abs/2410.07166

代码:https://github.com/embodied-agent-interface/embodied-agent-interface

数据集:https://huggingface.co/datasets/Inevitablevalor/EmbodiedAgentInterface

原文链接
本文链接:https://kx.umi6.com/article/8739.html
转载请注明文章出处
分享至
打开微信扫一扫
内容投诉
生成图片
相关推荐
换一换
打造“真机数据引擎”,睿尔曼智能摘得“2025年度中国商业创新金鼎典范企业”
2025-12-31 17:32:30
狂欢下的三大AI赛道
2026-01-05 18:22:46
中国科学院院士姚期智:具身智能要从模仿走向推理
2025-12-13 11:47:24
资本不断涌入 具身智能赛道加速发展
2025-12-12 07:38:24
北京人工智能产业白皮书:各类AI Agent将迎来爆发式增长
2025-11-29 16:28:02
对话顾嘉唯:AI正在从虚拟世界,开始进入物理世界
2025-11-19 12:16:56
具身智能大算力开发平台S600重磅亮相,地瓜机器人引领新范式
2025-11-21 18:34:20
李飞飞的World Labs联手光轮智能,具身智能进入评测驱动时代!
2026-01-19 12:53:33
硅基生命的「成年礼」:上海具身智能的入世大考与万亿生态突围
2025-12-18 14:57:22
一年融四轮,首形科技完成新一轮融资
2025-12-12 18:00:48
对话范浩强:10亿融资之前,我们手搓了5000元“丐版硬件”
2025-11-21 17:31:46
微分智飞高飞:我们正处于通用飞行智能爆发前夜丨GAIR 2025
2025-12-31 16:37:49
对话微分智飞高飞:看具身智能如何引发飞行认知革命 | GAIR 2025
2025-12-31 16:33:34
24小时热文
更多
扫一扫体验小程序