大模型榜单风波:Reflection 70B,曾被誉为开源新王,仅用3周由两人团队打造,宣称在各项基准测试中超越GPT-4o、Llama 3.1等。然而,经过深入调查,发现其存在数据造假与API欺骗行为,真相令人震惊。评测结果显示,模型性能与宣称不符,甚至与Claude 3.5回复内容一致,且刻意屏蔽提及Claude的对话。此事件揭示了AI领域榜单存在的问题——刷榜现象严重,榜单可信度堪忧。随着更多质疑声浪,大模型评测体系的透明度与公正性成为业界关注焦点。这一事件提醒我们,AI技术发展应以真实性能与创新为本,而非仅追求表面的排名与声量。
原文链接
本文链接:https://kx.umi6.com/article/6163.html
转载请注明文章出处
相关推荐
换一换
港科大教授实测AI眼镜“作弊”:30分钟碾压95%的学生,把传统教学评估体系整破防了
2026-01-06 16:11:38
豆包、Kimi 等国内多款 AI 工具高考期间暂停图片识别问答功能
2025-06-09 23:35:26
防不胜防:“AI 作弊”泛滥,全球最大会计职业组织 ACCA 叫停线上考试
2025-12-29 18:35:33
“作弊幽灵”就是AI超级入口
2025-07-26 00:33:19
AI助力!暴雪5天狂封1.9万个账号:玩家称仍被作弊主导
2024-11-27 12:53:13
00后辍学生打造“作弊神器”,被停学却获千万投资
2025-09-30 16:32:45
韩博主实测AI眼镜30秒出高考试卷答案:18分钟做完正确率惊人
2026-06-29 18:46:04
教育部发布 2025 年高考预警信息:靠 AI 或所谓“专家”押中题目可能性极小
2025-05-29 22:41:56
自进化WAM来了!清华AIR联手域变换提出具身In-Context Causal Learning
2026-09-01 13:36:24
SkyProduction天工工作台:从剧本到成片,一套工作台把精品短剧创作真正跑起来
2026-09-02 17:38:53
磁带没死还活得好好的!AI催生160EB出货量:2026Q1同比暴增57%
2026-09-03 15:28:35
横扫最难赛场,复核满分,银河通用无遥操出战100%夺冠
2026-08-31 17:51:10
互联网最古老的恐惧 被AI复活了
2026-09-06 15:01:29
722 文章
889027 浏览
24小时热文
更多
-
2026-09-07 13:49:31 -
2026-09-07 12:47:55 -
2026-09-07 10:44:22