7月8日,国际AI顶会ACL 2026公布最佳论文奖,阿里团队凭借Deep Research Agent研究斩获最佳资源论文奖,系国内唯一获奖的中国公司。该论文首次揭示当前Agent在真实复杂规则推理中的缺陷,并提出全新专家评测基准HSCodeComp。测试显示,主流Agent准确率仅约45%,远低于人类专家的95%,且单纯堆算力无法突破此架构瓶颈。基于此,阿里设计了以Qwen为核心的Agent框架,准确率达65%居AI系统首位。目前数据集与代码已开源,该成果为跨境贸易、法律医疗等领域的专业AI系统构建提供了科学评测标杆。
原文链接
本文链接:https://kx.umi6.com/article/36888.html
转载请注明文章出处
相关推荐
换一换
龙虾养不动了?周鸿祎给虾搭了个云端办公室,专业私教在线炼虾
2026-05-22 23:07:18
Skills刚火,就有零Skill的Agent来了…
2026-01-26 23:39:22
给龙虾定MBTI、发工牌,还让龙虾偷技能…打工人得适应新环境了
2026-03-10 17:36:58
2025WAIC后,谁能把Agent做成现金牛?
2025-07-30 20:53:34
苹果AI选Mamba:Agent任务比Transformer更好
2025-10-21 14:27:27
网易有道发布中国版“OpenClaw”,推出全场景个人助理Agent“LobsterAI”
2026-02-11 12:18:17
阿里亲身入局具身智能!Qwen内部组团,通义千问技术负责人带队
2025-10-11 09:17:58
Skill vs App:一场入口范式的争夺
2026-04-08 12:53:31
浏览器,又“性感”了?
2025-08-26 09:41:12
当AI Agent遇到资本,为什么Genspark 能突出重围
2026-01-29 12:17:32
5.20 明天见!拿好这份参会指南|AIGC2026峰会
2026-05-19 12:29:51
阿里发布Wan2.7-Video视频生成模型
2026-04-03 15:10:27
阿里闪电入局Agent Infra!智能体新基建亮相WAIC,“超级大脑”开箱即用
2025-08-01 08:59:54
784 文章
820275 浏览
24小时热文
更多
-
2026-07-11 02:19:28 -
2026-07-10 23:14:42 -
2026-07-10 23:13:03