2025年9月,Scale AI发布新基准SWE-BENCH PRO,测试显示顶级AI模型编程能力普遍‘不及格’。GPT-5、Claude Opus 4.1和Gemini 2.5解决率分别为23.3%、22.7%和13.5%,但深入分析发现,GPT-5在已提交任务中准确率达63%,远超Claude的31%。新基准严格避免数据污染,涵盖1865个商业代码库问题,强调复杂多文件修改,对比旧版难度显著提升。研究指出,Go和Python任务表现较好,而JavaScript波动大;失败原因因模型而异,如Claude语义理解不足,GPT-5工具使用需优化。整体来看,当前AI模型在真实商业场景中的编程能力仍有限,突破30%解决率成新目标。
原文链接
本文链接:https://kx.umi6.com/article/25666.html
转载请注明文章出处
相关推荐
换一换
GPT-5“变笨”,实锤了?
2025-09-01 17:22:41
已切换至 GPT-5:OpenAI ChatGPT AI 聊天机器人告别 4o / 4.5/4.1 等混乱模型
2025-08-08 08:07:20
GPT-5发布,槽点竟多过亮点
2025-08-08 09:12:32
OpenAI旧版回归,年度最失望AI 留下了什么
2025-08-13 15:41:58
OpenAI 研究人员夸大 GPT-5 数学能力后删帖,遭杨立昆等业界人士批评
2025-10-19 08:45:17
GPT-5与Transformer共同发明人Lukasz Kaiser重磅加盟,2025 全球机器学习技术大会全日程官宣!
2025-09-18 16:55:56
研究称 GPT-5“有害回答”比 GPT-4o 更多,不回避“自杀”相关话题
2025-10-17 12:15:56
GPT-5系统提示词被泄露,ChatGPT自己也「承认」了
2025-08-25 18:32:20
首个接入GPT-5的视频Agent!一句话生成广告大片,分镜配音全包了
2025-08-26 16:47:05
深聊GPT-5发布:过度营销的反噬与AI技术困局
2025-08-12 12:16:52
GPT-5通关《宝可梦水晶》创纪录!9517步击败赤爷,效率碾压o3三倍!
2025-08-26 17:48:25
OpenAI 申请 GPT-5 中国商标遇挫,相关申请均被驳回
2025-08-11 15:02:44
OpenAI GPT-5 编程成绩有猫腻:自删 23 道测试题,关键基准还是自己提的
2025-08-12 13:18:21
816 文章
1067935 浏览
24小时热文
更多
-
2026-10-07 20:47:29 -
2026-10-07 17:37:56 -
2026-10-07 16:36:22