近日,由谢赛宁领衔的华人团队推出全新编程竞赛基准LiveCodeBench Pro,测试中顶级大模型全军覆没,无一得分。该基准题库每日更新,涵盖IOI、Codeforces和ICPC竞赛题,防止模型刷题。测试显示,模型在知识密集型和逻辑密集型问题上有一定表现,但在观察密集型问题上表现欠佳。表现最佳的模型在中等难度题上的通过率仅为53%,难题通过率为0。即使工具调用被屏蔽,顶级模型的Elo评分仍低于人类大师级水平。团队成员多为奥林匹克竞赛获奖者,超半数为华人,且团队年轻化,成员来自顶尖学府。该项目旨在持续评估大模型算法逻辑深度,每个季度将发布全新评估集。
原文链接
本文链接:https://kx.umi6.com/article/20456.html
转载请注明文章出处
相关推荐
换一换
张亚勤谈大模型的未来:全球不超10个 且中美将各占三四个
2026-03-18 11:06:09
中国AI云,开始「抢座次」了
2025-11-20 11:17:00
雷军宣布:小米AI人才招聘专项正式启动!
2026-03-30 16:59:23
消息称腾讯大模型团队架构调整:前 OpenAI 研究员姚顺雨任要职,校招最高 2 倍薪资挖 AI 人才
2025-12-17 17:57:42
中信建投:持续推荐AI算力板块
2025-10-28 08:39:40
花3000元让AI改口,大模型的尽头是广告?
2026-01-06 19:29:29
豆包们,开始「上链接」
2025-10-27 10:54:08
亚马逊云科技发布多款大模型
2025-12-03 14:25:54
长三角一体化大模型发布 AI将为区域发展提供决策支撑
2026-01-12 09:40:07
WAIC信息爆炸!大佬们都在说什么,笔记看这里
2026-07-18 12:23:17
真正面向大模型的AI Infra,必须同时懂模型、系统、产业|商汤大装置宣善明@MEET2026
2025-12-22 10:35:49
Ilya罕见发声:大模型「大力出奇迹」到头了
2025-11-26 09:32:32
中金:2026年大模型在强化学习、模型记忆、上下文工程等方面将取得更多突破
2026-02-05 08:39:59
803 文章
845181 浏览
24小时热文
更多
-
2026-07-24 00:15:46 -
2026-07-24 00:14:08 -
2026-07-24 00:12:30