大模型权威测试MMLU-Pro被曝存在问题,评测方法被指偏向GPT-4等闭源模型。测试者发现采样参数、系统提示和答案提取存在不公平,仅通过修改提示词就使Llama-3-8b-q8性能提升10分。官方回应称,尽管影响小于1%,但仍承认答案提取regex需要改进。MMLU-Pro原定于今年5月更新,但其数学主导的特性引发争议,质疑其是否能全面评估知识和推理能力。这一事件引发行业讨论,对大模型性能评估的可信度提出了质疑。
原文链接
本文链接:https://kx.umi6.com/article/3175.html
转载请注明文章出处
相关推荐
换一换
Meta全力转向闭源模型 新模型Avocado或于明年春季推出
2025-12-10 23:15:05
大模型行业,根本没有什么“真”开源?
2024-08-01 11:04:31
美国开源AI实验室Arcee表示:中国模型没有危险性 但会威胁美国闭源模型的利润空间
2026-07-23 15:52:51
开源模型是智商税?这话真的就一定对吗
2024-07-16 08:32:54
李彦宏:开源模型是智商税!傅盛:付费的闭源大模型才是!
2024-07-10 17:10:42
阿里通义千问发布 Qwen3-Coder-Flash 模型,AI 智能体编程 / 操控浏览器等领域媲美 GPT-4.1 等领先闭源模型
2025-08-01 09:07:59
百度李彦宏:开源模型是智商税,闭源模型更强大、推理成本更低
2024-07-06 04:31:29
陈大年复出,入局大模型
2026-09-03 18:32:42
中美AI竞赛白热化!黄仁勋、马斯克罕见同声:过度监管AI就是在帮中国赢
2026-09-04 19:37:22
马斯克:AI将令全球经济规模增长20%-30% 十年内人形机器人达10亿台
2026-09-02 10:27:24
全国第三,公司第二,“初创黑马”灵犀智涌用ROSS Harness把机器人送进工业具身智能第一梯队
2026-08-31 11:36:37
金融AI的年度大考交卷了:2万名选手、30+家机构、百亿级数据开源
2026-09-04 15:25:38
巨简单,更懂家!海信JUOS正式发布:行业首个家庭智能伴侣级AIOS
2026-09-02 10:24:20
842 文章
1014270 浏览
24小时热文
更多
-
2026-09-06 20:12:34 -
2026-09-06 20:10:47 -
2026-09-06 15:01:29