2025年9月,Scale AI发布新基准SWE-BENCH PRO,显示GPT-5、Claude Opus 4.1和Gemini 2.5等顶级模型编程任务解决率均未超25%。然而,深入分析发现,GPT-5在已提交任务中准确率达63%,远高于Claude的31%。新测试集严格规避数据污染问题,包含多元化代码库与复杂任务,强调真实工业场景挑战。尽管如此,即使是表现最佳的GPT-5,在商业场景中的解决率也低于20%。研究人员指出,编程语言难度、代码库特性及模型种类显著影响结果,而各模型失败原因各异,如语义理解不足或上下文管理局限。未来谁能突破30%解决率仍是未知数。
原文链接
本文链接:https://kx.umi6.com/article/25793.html
转载请注明文章出处
相关推荐
换一换
OpenAI 奥尔特曼:GPT-5 有点搞砸了,未来公司 CEO 或是 AI
2025-08-17 16:39:08
OpenAI 今年推出 GPT - 6?员工否认
2025-10-19 07:43:54
OpenAI推出GPT-5模型 机构称AI应用落地与政策支持共振加速
2025-08-08 08:12:16
OpenAI今年预计通过ChatGPT实现近100亿美元收入,机构称GPT-5将给硬件和应用端这些企业带来机遇
2025-09-06 16:37:17
可调节思考时长,ChatGPT 网页端新增 GPT-5 Thinking 调整功能
2025-09-18 10:48:18
GPT-5之后,奥特曼向左,梁文锋向右
2025-08-15 17:17:56
真·博士水平!GPT-5首次给出第四矩定理显式收敛率,数学教授只点拨了一下
2025-09-10 17:40:34
奥特曼神秘晚宴讲话曝出!OpenAI的CEO或将是个AI,Chrome我也想买
2025-08-17 15:36:36
微软 Visual Studio 上线 GPT-5,复杂任务推理决策能力“大幅”提升
2025-08-13 08:31:33
OpenAI首个GPT-5找Bug智能体:全自动读代码找漏洞写修复
2025-10-31 13:33:18
GPT-5发布,槽点竟多过亮点
2025-08-08 09:12:32
“苹果牌 AI”拥抱 GPT-5,预计下月登陆 iOS / iPadOS / macOS 26
2025-08-09 09:25:46
GPT-5编程测评大反转
2025-09-23 15:19:23
767 文章
826532 浏览
24小时热文
更多
-
2026-07-24 23:04:32 -
2026-07-24 23:02:56 -
2026-07-24 23:01:12