2025年8月,OpenAI因GPT-5编程能力测试问题引发争议。官方使用的SWE-bench Verified基准本应包含500道题,但OpenAI自行删减23道,仅用477道题评估,导致结果存疑。若将删减题目默认为零分,GPT-5得分甚至低于Claude Opus 4.1,两者差距仅为0.4%。这一操作延续了GPT-4.1发布时的做法,理由是部分题目无法在其基础设施运行。更讽刺的是,SWE-bench Verified本身是OpenAI提出并优化的基准。与此同时,Anthropic明确指出其Claude 4系列模型基于完整500题测试,表现优于GPT-5。目前,最原始的SWE-bench榜单中,Claude 4 Opus仍居首位。
原文链接
本文链接:https://kx.umi6.com/article/23424.html
转载请注明文章出处
相关推荐
换一换
GPT-5为量子计算提供关键思路!大牛盛赞:不到半小时给出“灵魂一击”
2025-09-29 13:08:15
真·博士水平!GPT-5首次给出第四矩定理显式收敛率,数学教授只点拨了一下
2025-09-10 17:40:34
微软 Copilot(Win10/11)支持 GPT - 5 智能模式,限制比 ChatGPT 更宽松
2025-08-11 07:57:19
GPT-5测试被质疑作弊,故意避开难题刷高分?
2025-08-12 12:18:06
GPT-5“变笨”实锤,退休教授出了道井字棋送分题,结果它真送了
2025-09-01 16:18:53
OpenAI:正在让 GPT-5 变得“更温暖、更友好、不奉承”
2025-08-16 12:24:21
OpenAI 奥尔特曼:GPT-5 有点搞砸了,未来公司 CEO 或是 AI
2025-08-17 16:39:08
重新体验GPT-5后,我想它比GPT-4o 更需要一场葬礼
2025-08-11 19:06:36
OpenAI今年预计通过ChatGPT实现近100亿美元收入,机构称GPT-5将给硬件和应用端这些企业带来机遇
2025-09-06 16:37:17
OpenAI的GPT-5会否开启人工智能界的价格大战?
2025-08-11 16:09:01
OpenAI惊人自曝:GPT-5真「降智」了!但重现「神之一手」,剑指代码王座
2025-08-11 15:02:10
最强AI也跌落神坛 Claude Opus 4.7被指负升级:国内外都在喷
2026-04-17 15:06:53
GPT-5“变笨”,实锤了?
2025-09-01 17:22:41
737 文章
855640 浏览
24小时热文
更多
-
2026-07-24 00:15:46 -
2026-07-24 00:14:08 -
2026-07-24 00:12:30