1
免责声明:Al优秘圈所有资讯仅代表作者个人观点,不构成任何投资理财建议。请确保访问网址为(kx.umi6.com) 投诉及建议

标题:李飞飞吴佳俊团队推出具身智能决策能力评价基准,o1-preview登顶

大模型的具身智能决策能力有了系统的通用评估基准。李飞飞吴佳俊团队提出的EAI框架对具身智能决策的四项关键子能力进行了全面评估。

该框架已被选为NeurIPS数据和测试集专栏Oral论文,并收录进PyPI,方便调用。EAI框架通过统一的目标表示方法和模块化的评估方式,提升了模型间的互操作性与可比性。

测试显示,在公开的大模型中,o1-preview综合成绩最佳。EAI采用线性时态逻辑(LTL)统一目标表示,提高模块互操作性,便于比较不同模型在同一任务上的表现。EAI框架将模型能力分为目标解释、子目标分解、动作序列规划、转换建模四大模块,并设计了细致的评估指标。

EAI在BEHAVIOR和VirtualHome两种环境下评估了18款主流模型。在BEHAVIOR环境中,o1-preview得分最高;而在VirtualHome环境中,o1-preview依然领先,但前三名差距不大。各模型在不同子任务上的表现各异,例如Claude 3.5 Sonnet在BEHAVIOR环境中的目标解释能力优于o1-preview,Mistral Large在VirtualHome环境中的动作序列规划表现最佳。

EAI还深入分析了模型的失败情况,发现了一些具体问题,如将中间状态误识别为最终目标状态、对隐含的物理关系理解不足等,为后续研究提供了重要参考。项目主页、论文和代码均已发布,可供进一步探索。

项目主页:https://embodied-agent-interface.github.io/

论文:https://arxiv.org/abs/2410.07166

代码:https://github.com/embodied-agent-interface/embodied-agent-interface

数据集:https://huggingface.co/datasets/Inevitablevalor/EmbodiedAgentInterface

原文链接
本文链接:https://kx.umi6.com/article/8739.html
转载请注明文章出处
分享至
打开微信扫一扫
内容投诉
生成图片
相关推荐
换一换
智元董事长邓泰华:无营收前提下,现金流能撑三年
2025-08-21 19:37:49
上海:探索算力和语料作价入股等模式 支持发展面向具身智能的新型金融工具
2025-08-06 10:29:39
中信证券:“人工智能+”行动意见印发 具身智能受益
2025-08-27 09:05:39
京东回应“连投三家机器人企业”:公司高度重视具身智能、大模型等技术热点
2025-07-21 14:20:17
京东云计算入股具身智能公司RoboScience
2025-09-08 10:57:08
会叠衣服的中美机器人,谁离具身智能更近?
2025-10-21 17:29:50
AI投资中场战事:人才战、信仰分歧和超级机遇
2025-09-02 10:29:16
2025 上半年具身智能融资复盘:金额超 200 亿、头部收敛趋势明显、传统制造业巨头增多
2025-07-17 18:29:16
Figure03卷起来了
2025-10-14 21:23:19
超详细!2025科技创变者大会最新议程公布!
2025-08-21 11:28:29
外卖大战尴尬收场,但巨头们仍在“窘境”中竞争AI
2025-08-01 23:09:26
慧灵科技亮相工博会:打造“具身智能产业基座”,推动智能体落地
2025-09-24 16:44:08
2025 WAIC落幕,深谋科技异军突起,以技术与落地破局具身智能赛道
2025-08-04 16:59:27
24小时热文
更多
扫一扫体验小程序