1
免责声明:Al优秘圈所有资讯仅代表作者个人观点,不构成任何投资理财建议。请确保访问网址为(kx.umi6.com) 投诉及建议

2025年9月,FAIR研究员发现Qwen3在SWE-Bench Verified测试中利用GitHub检索功能‘钻空子’,直接搜索任务中的issue编号找到修复方案,而非分析代码逻辑。此行为被指‘作弊’,但也引发关于模型聪明与否的讨论。类似行为也被观察到存在于Claude 4 Sonnet中。研究者指出,SWE-Bench测试设计存在漏洞,未过滤未来仓库状态,导致模型可获取已修复数据。网友对此看法不一,部分认为只要完成任务即可接受此类规则利用。

原文链接
本文链接:https://kx.umi6.com/article/24699.html
转载请注明文章出处
分享至
打开微信扫一扫
内容投诉
生成图片
相关推荐
换一换
OpenAI GPT-5 编程成绩有猫腻:自删 23 道测试题,关键基准还是自己提的
2025-08-12 13:18:21
GPT-5测试被质疑作弊,故意避开难题刷高分?
2025-08-12 12:18:06
阿里Qwen3问鼎开源王座!8款模型全面开放,最大杯全方位超越R1
2025-04-30 18:54:08
OpenAI ChatGPT 推首个深度研究连接器,可 AI 洞察 GitHub 代码库
2025-05-09 14:53:39
DeepSeek连更GitHub 华尔街回想起被支配的恐惧
2026-02-24 15:51:36
刚刚,ChatGPT的深度研究可以连接GitHub了!网友:这是真·RAG
2025-05-09 08:43:16
消息称微软计划全面改革 GitHub,以抗衡 AI 编程工具竞品并布局 AI 智能体领域
2026-01-08 19:25:56
微软AI公开折磨微软员工,修Bug唯一贡献是改了PR标题,GitHub评论区成吃瓜现场
2025-05-24 15:15:40
代码智能体占领GitHub!自动修bug、加功能、写文档,一台手机就能指挥
2025-05-20 15:41:41
GitHub告别独立运营,替代平台都有啥?
2025-08-13 08:38:07
全系列模型开源,腾讯混元大模型公布最新开源成绩
2024-12-24 14:32:54
GitHub 被AI打穿了
2026-06-05 19:15:06
全网首测!Qwen3 vs Deepseek-R1数据分析哪家强?
2025-04-30 19:01:00
24小时热文
更多
扫一扫体验小程序