正文:2025年7月,上海交大与深势科技团队发布新研究,在“人类最后的考试”(HLE)中取得32.1分,首次突破30分大关,刷新纪录。该测试集由AI安全中心和Scale AI发起,以研究生难度著称,涵盖数学、物理、生物医药等多学科,题目难以检索且需明确答案。团队推出工具增强推理智能体X-Master及多智能体工作流系统X-Masters,并开源方案。实验显示,X-Masters在HLE纯文本子集表现优于现有模型,尤其在生物学/医学领域达27.6%正确率,超越Biomni和STELLA。研究使用DeepSeek-R1-0528作为推理模型,通过分散-堆叠架构显著提升性能。
原文链接
本文链接:https://kx.umi6.com/article/21428.html
转载请注明文章出处
相关推荐
换一换
支持 API 调用,国家超算互联网平台上线 DeepSeek-R1 满血版
2025-02-09 22:53:25
易点天下宣布AI技术中台已完成DeepSeek-R1私有化部署
2025-02-05 15:17:50
三星生活助手 App 智能体中心接入 DeepSeek-R1
2025-02-28 20:25:28
攻略在手,轻松玩转 DeepSeek
2025-02-08 21:33:12
手机端接入DeepSeek-R1:纯小白教程 三分钟搞定
2025-02-18 18:29:35
DeepSeek-R1联网搜索测评公布 腾讯元宝位列第一
2025-03-11 18:45:49
AI的胡编乱造,正在淹没中文互联网
2025-03-05 16:10:58
成本仅国外三十分之一,中国大模型已经追上美国了?
2025-01-26 08:08:30
Nature封面文章: DeepSeek-R1通过强化学习激励的LLM推理
2025-09-18 08:48:39
DeepSeek全尺寸模型上线阿里云百炼
2025-02-09 14:48:13
硅基流动助力华为小艺接入 DeepSeek-R1 模型
2025-02-08 00:09:00
DeepSeek-R1 模型全面上线亚马逊云科技
2025-02-01 00:06:30
海外用户也有份,传音 Infinix AI 接入 DeepSeek-R1 满血版
2025-02-24 00:07:55
754 文章
811228 浏览
24小时热文
更多
-
2026-07-24 00:15:46 -
2026-07-24 00:14:08 -
2026-07-24 00:12:30