2026年3月,编程工具Cursor发布全新AI代码评测基准CursorBench,重点评估模型在真实开发场景中高效执行复杂任务的能力。与传统基准如SWE-Bench不同,CursorBench强调任务的真实性、规模和模糊性,避免数据污染问题,并采用线上+线下混合评估方式。结果显示,此前在SWE-Bench表现优异的Claude Haiku 4.5和Sonnet 4.5分数大幅下降,而Cursor自研模型Composer表现突出。CursorBench不仅提升了模型区分度,其排名也更贴近真实用户体验。未来,Cursor计划进一步优化评测体系,以适配长时运行的智能体开发需求。
原文链接
本文链接:https://kx.umi6.com/article/33733.html
转载请注明文章出处
相关推荐
换一换
中信证券:AI Coding应用落地第一站 编程智能体打开千亿空间
2025-12-10 09:38:44
老黄唱衰编程,GitHub CEO硬刚:放弃写代码等于放弃智能体话语权
2025-05-19 19:21:32
苏度 WAIC 首秀:从1到10+技能跃迁,探索通用机器人 Scaling 路径
2026-07-19 15:24:53
花几百万买的H100在「摸鱼」?英伟达:别怪显卡,是你的模型「长得丑」
2026-07-23 18:00:12
国家具身智能应用中试基地发布首个合作世界模型 魔芯科技MoWorld 3D正式亮相
2026-07-20 17:22:05
燧原科技发布云燧ESL64-O超节点 突破AI芯片互联瓶颈
2026-07-19 16:23:14
WAIC最狠展台打爆工业「深水区」!它石智航首发具身原生大脑AWE 3.5,具身Scaling全面释放
2026-07-23 11:42:41
大模型也得「睡觉」了:Google 的这篇论文,戳中了AI 的最大软肋
2026-07-23 12:47:10
WAIC重磅成果|上海仪电智算牵头成立“智算系统架构联盟”并发布《超节点系统架构规范》
2026-07-21 18:21:18
懂你、能交付、专业操作:金山办公田然给出AI办公助理的三项标准
2026-07-22 11:55:53
苹果iOS 27开发者预览版Beta 4发布:国行iPhone期待的Siri AI继续缺席
2026-07-21 06:51:16
黄仁勋在日本吃嗨了!什么都吃、狂夸好吃:顺手签下日本首个AI工厂大单
2026-07-21 11:02:25
对话商汤林达华:多模态是 Coding 之后的下一个战场
2026-07-19 21:38:24
737 文章
855375 浏览
24小时热文
更多
-
2026-07-24 00:15:46 -
2026-07-24 00:14:08 -
2026-07-24 00:12:30