1
免责声明:Al优秘圈所有资讯仅代表作者个人观点,不构成任何投资理财建议。请确保访问网址为(kx.umi6.com) 投诉及建议
综合
7*24 快讯
AI科普
合作
全部
英雄令
项目方
开发者
产品方
投资者
具身智能“高考”难疯了!人类100分,最强模型12.8
近日,原RoboTwin团队重磅推出全新具身智能评测基准RoboDojo,为通用机器人设立“珠峰”级考验。该基准涵盖42个仿真与18个真实世界任务,全面考察泛化、记忆、精细操作等五大能力。榜单结果十分残酷:当前最强模型在仿真和真实世界的平均成功率仅8.80%和12.8%,而人类专家真机成功率高达100%!由学术联盟发起的RoboDojo不仅提供统一接入层XPolicyLab,更打破“唯Demo论”,用标准化赛道暴露出当前模型在开放语义与物理部署上的明显短板,为具身智能迈向通用操作提供了一把精准的“海拔尺”。
电子诗篇
07-08 21:28:09
分享至
打开微信扫一扫
内容投诉
生成图片
阿里斩获国际AI顶会最佳资源论文奖,提出Agent评测新范式
7月8日,国际AI顶会ACL 2026公布最佳论文奖,阿里团队凭借Deep Research Agent研究斩获最佳资源论文奖,系国内唯一获奖的中国公司。该论文首次揭示当前Agent在真实复杂规则推理中的缺陷,并提出全新专家评测基准HSCodeComp。测试显示,主流Agent准确率仅约45%,远低于人类专家的95%,且单纯堆算力无法突破此架构瓶颈。基于此,阿里设计了以Qwen为核心的Agent框架,准确率达65%居AI系统首位。目前数据集与代码已开源,该成果为跨境贸易、法律医疗等领域的专业AI系统构建提供了科学评测标杆。
E-Poet
07-08 16:19:01
分享至
打开微信扫一扫
内容投诉
生成图片
中国信通院牵头,首个智算运维智能体评测基准正式落地,覆盖 5 款主流国产芯片
6月29日,在2026“众智”大模型开放智算生态协同高级别研讨会上,中国信通院正式发布AISHPerf人工智能软硬件基准体系3.0版本。该体系包含智算运维智能体与算子生成智能体两项核心评测基准,由无问芯穹及清华大学团队提供技术支持。其中,智算运维智能体评测基准是首个面向AI Infra的运维评测基准,依托百亿级真实数据构建,率先覆盖5款主流国产芯片集群运维场景。此举填补了国产智算运维智能体评测领域的空白,为国产算力集群从“能用”迈向“好用”提供标准基础,助力AI基础设施向自主自治的“Token工厂”升级,推动我国智算产业高质量发展。
蝶舞CyberSwirl
06-30 22:42:25
分享至
打开微信扫一扫
内容投诉
生成图片
中国信通院发布AI Infra运维领域首个评测基准
6月29日,中国信通院在2026“众智”大模型研讨会上正式发布AISHPerf人工智能软硬件基准体系3.0版,推出智算运维与算子生成两项AI Infra核心评测基准。其中,智算运维智能体评测基准是业内首个面向该领域的权威体系。它依托近百亿条真实数据,率先纳入5种国产芯片集群运维场景,填补了国产智算运维评测的标准空白。该基准不仅为国产算力从“能用”到“好用”提供量化标尺,更将指引AI基础设施向自主自治的“Token工厂”演进,全面助力我国智算产业的高质量与自主可控发展。
星际Code流浪者
06-30 16:28:03
分享至
打开微信扫一扫
内容投诉
生成图片
加载更多
暂无内容
AI热搜
更多
扫一扫体验小程序