综合
7*24 快讯
AI科普
合作
全部
英雄令
项目方
开发者
产品方
投资者
近日,原RoboTwin团队重磅推出全新具身智能评测基准RoboDojo,为通用机器人设立“珠峰”级考验。该基准涵盖42个仿真与18个真实世界任务,全面考察泛化、记忆、精细操作等五大能力。榜单结果十分残酷:当前最强模型在仿真和真实世界的平均成功率仅8.80%和12.8%,而人类专家真机成功率高达100%!由学术联盟发起的RoboDojo不仅提供统一接入层XPolicyLab,更打破“唯Demo论”,用标准化赛道暴露出当前模型在开放语义与物理部署上的明显短板,为具身智能迈向通用操作提供了一把精准的“海拔尺”。
原文链接
7月8日,国际AI顶会ACL 2026公布最佳论文奖,阿里团队凭借Deep Research Agent研究斩获最佳资源论文奖,系国内唯一获奖的中国公司。该论文首次揭示当前Agent在真实复杂规则推理中的缺陷,并提出全新专家评测基准HSCodeComp。测试显示,主流Agent准确率仅约45%,远低于人类专家的95%,且单纯堆算力无法突破此架构瓶颈。基于此,阿里设计了以Qwen为核心的Agent框架,准确率达65%居AI系统首位。目前数据集与代码已开源,该成果为跨境贸易、法律医疗等领域的专业AI系统构建提供了科学评测标杆。
原文链接
6月29日,在2026“众智”大模型开放智算生态协同高级别研讨会上,中国信通院正式发布AISHPerf人工智能软硬件基准体系3.0版本。该体系包含智算运维智能体与算子生成智能体两项核心评测基准,由无问芯穹及清华大学团队提供技术支持。其中,智算运维智能体评测基准是首个面向AI Infra的运维评测基准,依托百亿级真实数据构建,率先覆盖5款主流国产芯片集群运维场景。此举填补了国产智算运维智能体评测领域的空白,为国产算力集群从“能用”迈向“好用”提供标准基础,助力AI基础设施向自主自治的“Token工厂”升级,推动我国智算产业高质量发展。
原文链接
6月29日,中国信通院在2026“众智”大模型研讨会上正式发布AISHPerf人工智能软硬件基准体系3.0版,推出智算运维与算子生成两项AI Infra核心评测基准。其中,智算运维智能体评测基准是业内首个面向该领域的权威体系。它依托近百亿条真实数据,率先纳入5种国产芯片集群运维场景,填补了国产智算运维评测的标准空白。该基准不仅为国产算力从“能用”到“好用”提供量化标尺,更将指引AI基础设施向自主自治的“Token工厂”演进,全面助力我国智算产业的高质量与自主可控发展。
原文链接
加载更多
暂无内容