2026年3月,编程工具Cursor发布全新AI代码评测基准CursorBench,重点评估模型在真实开发场景中高效执行复杂任务的能力。与传统基准如SWE-Bench不同,CursorBench强调任务的真实性、规模和模糊性,避免数据污染问题,并采用线上+线下混合评估方式。结果显示,此前在SWE-Bench表现优异的Claude Haiku 4.5和Sonnet 4.5分数大幅下降,而Cursor自研模型Composer表现突出。CursorBench不仅提升了模型区分度,其排名也更贴近真实用户体验。未来,Cursor计划进一步优化评测体系,以适配长时运行的智能体开发需求。
原文链接
本文链接:https://kx.umi6.com/article/33733.html
转载请注明文章出处
相关推荐
换一换
老黄唱衰编程,GitHub CEO硬刚:放弃写代码等于放弃智能体话语权
2025-05-19 19:21:32
中信证券:AI Coding应用落地第一站 编程智能体打开千亿空间
2025-12-10 09:38:44
陶哲轩吐槽GPT-6孪生素数新突破:令人无语的一幕
2026-09-05 13:13:13
还有人用吗 本年最火的AI产品小龙虾OpenClaw 2.0史诗级更新
2026-08-31 18:55:52
黄仁勋140亿美元豪赌一只鸭
2026-09-04 17:33:09
GitHub最热架构图Agent,开发者故事看哭了
2026-09-01 16:48:05
3秒出片比播放还快,MiniMax打开了AI视频的实时商业化路径
2026-09-01 20:55:02
今年最难的机器人Demo,“机器人含量”为0
2026-09-03 10:15:24
马斯克:AI将令全球经济规模增长20%-30% 十年内人形机器人达10亿台
2026-09-02 10:27:24
阿里更新旗舰模型Qwen3.8-Max,前端编程能力跃居全球第一
2026-09-02 14:34:23
7天长不出头发赔1万元!一洗发水AI广告宣传涉嫌违法被投诉
2026-08-31 07:26:59
去年归国的徐梦迪,成了清华姚班班主任
2026-08-29 21:22:18
「GPT-6」灰测demo刷屏!周四发布在即
2026-08-31 13:40:55
752 文章
990345 浏览
24小时热文
更多
-
2026-09-06 21:14:00 -
2026-09-06 20:12:34 -
2026-09-06 20:10:47