OpenAI公司于8月13日发布新闻稿,宣布推出SWE-bench Verified基准,以更精确地评估AI模型在代码生成任务中的表现。SWE-bench是一个用于评估大型语言模型(LLM)解决GitHub上实际软件问题能力的数据集,包含来自12个流行Python仓库的2294个Issue-Pull Request对。然而,原版SWE-bench存在三个主要问题:单元测试过于严格、问题描述不清晰及开发环境设置困难。SWE-bench Verified通过引入容器化Docker环境,解决了这些问题,提高了评估过程的一致性和可靠性。结果显示,GPT-4在新基准上解决问题的比例显著提升至33.2%,而最佳开源代理框架Agentless的得分则从之前的8%增加到16%,这表明SWE-bench Verified更全面地评估了AI模型在软件工程任务中的实际能力。
原文链接
本文链接:https://kx.umi6.com/article/5048.html
转载请注明文章出处
相关推荐
换一换
马斯克称OpenAI是自己的创意 现任CEO奥尔特曼是“小偷”
2026-04-29 14:26:51
OpenAI完成1220亿美元融资 投后估值8520亿美元
2026-04-01 08:34:25
从哈佛辍学的前OpenAI研究员踏足AI制药,拿下20亿美元估值:VC在赌什么?
2026-07-17 17:44:20
Sora负责人离职
2026-04-18 07:48:11
OpenAI被揭露惊天内幕:要挑拨大国竞争 像核技术那样发横财
2026-04-07 13:58:20
独家专访|苏炜杰加入OpenAI:Scaling Law撞墙后为什么需要数学家出手?
2026-06-29 15:36:01
OpenAI计划为ChatGPT广告定价新方案 探讨其他升级方案
2026-04-15 21:24:20
降价50% OpenAI开打价格战:顶级套餐仅需100美元/月
2026-04-10 09:58:34
OpenAI落子新加坡 首设海外人工智能实验室
2026-05-20 15:45:11
OpenAI疯狂挖苹果墙角 苹果砸重金留人防跳槽
2026-03-27 20:18:27
OpenAI关停Sora 奥尔特曼坦言:为了下一代AI 集中计算资源
2026-04-07 20:16:56
欧盟委员会对OpenAI开放新型ChatGPT模型访问权限表示欢迎
2026-05-11 20:28:29
马斯克破大防了:私信求和遭拒,怒喷奥特曼Brockman「全美最恶人」
2026-05-06 12:44:44
757 文章
826773 浏览
24小时热文
更多
-
2026-07-24 00:15:46 -
2026-07-24 00:14:08 -
2026-07-24 00:12:30