1
免责声明:Al优秘圈所有资讯仅代表作者个人观点,不构成任何投资理财建议。请确保访问网址为(kx.umi6.com) 投诉及建议

2025年9月,Scale AI发布新基准SWE-BENCH PRO,测试显示顶级AI模型编程能力普遍‘不及格’。GPT-5、Claude Opus 4.1和Gemini 2.5解决率分别为23.3%、22.7%和13.5%,但深入分析发现,GPT-5在已提交任务中准确率达63%,远超Claude的31%。新基准严格避免数据污染,涵盖1865个商业代码库问题,强调复杂多文件修改,对比旧版难度显著提升。研究指出,Go和Python任务表现较好,而JavaScript波动大;失败原因因模型而异,如Claude语义理解不足,GPT-5工具使用需优化。整体来看,当前AI模型在真实商业场景中的编程能力仍有限,突破30%解决率成新目标。

原文链接
本文链接:https://kx.umi6.com/article/25666.html
转载请注明文章出处
分享至
打开微信扫一扫
内容投诉
生成图片
相关推荐
换一换
OpenAI 今年推出 GPT - 6?员工否认
2025-10-19 07:43:54
OpenAI首个GPT-5找Bug智能体:全自动读代码找漏洞写修复
2025-10-31 13:33:18
OpenAI以为GPT-5搞出了数学大新闻,结果…哈萨比斯都觉得尴尬
2025-10-20 11:03:26
微软 Visual Studio 上线 GPT-5,复杂任务推理决策能力“大幅”提升
2025-08-13 08:31:33
苹果发布 Xcode 26 Beta 7:新增 GPT-5 支持并集成 Claude
2025-08-29 07:32:56
硅谷画饼王“塌房”:奥特曼撒谎微表情被扒光,网友集体喊下台
2025-08-16 18:29:48
GPT-5为量子计算提供关键思路!大牛盛赞:不到半小时给出“灵魂一击”
2025-09-29 13:08:15
GPT-5能让普通人变成博士,但魔法依旧没有
2025-08-08 12:10:14
GPT-5 没有惊喜,但信号拉满
2025-08-11 13:00:45
每天都和 AI 聊天,你可能已经是个「神经病」
2025-11-03 13:20:42
OpenAI 宣布 ChatGPT-4o 面向 Plus 和 Team 用户重新上线,下周推出迷你版 GPT-5
2025-08-09 16:33:15
陶哲轩用GPT-5解决数学难题:仅29行Python代码
2025-10-04 12:59:43
OpenAI首份大模型“心理报告”出炉:每周有百万人询问敏感问题
2025-10-28 10:47:35
24小时热文
更多
扫一扫体验小程序