1
免责声明:Al优秘圈所有资讯仅代表作者个人观点,不构成任何投资理财建议。请确保访问网址为(kx.umi6.com) 投诉及建议

2025年9月,Scale AI发布新基准SWE-BENCH PRO,显示GPT-5、Claude Opus 4.1和Gemini 2.5等顶级模型编程任务解决率均未超25%。然而,深入分析发现,GPT-5在已提交任务中准确率达63%,远高于Claude的31%。新测试集严格规避数据污染问题,包含多元化代码库与复杂任务,强调真实工业场景挑战。尽管如此,即使是表现最佳的GPT-5,在商业场景中的解决率也低于20%。研究人员指出,编程语言难度、代码库特性及模型种类显著影响结果,而各模型失败原因各异,如语义理解不足或上下文管理局限。未来谁能突破30%解决率仍是未知数。

原文链接
本文链接:https://kx.umi6.com/article/25793.html
转载请注明文章出处
分享至
打开微信扫一扫
内容投诉
生成图片
相关推荐
换一换
OpenAI 奥尔特曼爆料:GPT-5 重构一切,一人顶五个团队
2025-09-17 22:38:26
OpenAI 今年推出 GPT - 6?员工否认
2025-10-19 07:43:54
GPT-5“变笨”实锤,退休教授出了道井字棋送分题,结果它真送了
2025-09-01 16:18:53
OpenAI惊人自曝:GPT-5真「降智」了!但重现「神之一手」,剑指代码王座
2025-08-11 15:02:10
GPT-5“让人失望”,AI“撞墙”了吗?
2025-08-17 19:40:29
ChatGPT 为何退回了 4o ?
2025-08-10 15:48:45
GPT-5的拙劣发布,戳破了AI取代公关的谎言
2025-08-12 19:23:40
OpenAI最新测试:GPT-5与Claude在部分工作中可媲美人类专家
2025-09-26 04:16:50
快来看看GPT-5第一波实测
2025-08-08 19:17:41
研究称 GPT-5“有害回答”比 GPT-4o 更多,不回避“自杀”相关话题
2025-10-17 12:15:56
OpenAI首个GPT-5找Bug智能体:全自动读代码找漏洞写修复
2025-10-31 13:33:18
GPT-5发威,逼得马斯克 「放大招」?
2025-08-12 11:17:40
GPT-5≈o3.1!OpenAI首次详解思考机制:RL+预训练才是AGI正道
2025-10-20 16:09:01
24小时热文
更多
扫一扫体验小程序