斯坦福大学的一项最新研究表明,大模型在数学推理能力上可能并未真正掌握解题逻辑,而只是检索已存储的题目。研究团队提出了一种新的Putnam-AXIOM基准测试集,涵盖1985年至2023年的William Lowell Putnam数学竞赛题目,以更严格地评估模型能力。
结果显示,即使只是更换题目中的变量名称和取值范围,模型的准确率就会大幅下降。例如,表现最好的o1-preview模型在原始数据集上的准确率为50%,但在变异数据集中降至33.96%。其他模型如GPT-4o、Claude、Deepseek和Qwen等也表现不佳。
这项研究揭示了当前大模型在数学推理方面的局限性,需要进一步提升其逻辑推理和数学严谨性。Putnam-AXIOM基准不仅提高了评估难度,还通过自动化评估和多样化变体数据集,为未来的研究提供了有力支持。
原文链接
本文链接:https://kx.umi6.com/article/11194.html
转载请注明文章出处
相关推荐
换一换
斯坦福423页AI报告:中美模型差距仅2.7%!
2026-04-14 20:17:31
我国大模型密集落地 新技术加速普惠应用
2026-02-14 12:17:30
杨植麟当主持人的大模型圆桌:张鹏罗福莉夏立雪都放开说了
2026-03-27 23:23:11
智谱、MiniMax争夺「大模型第一股」
2025-12-24 10:30:23
终于用上AI的公司 发现业务被大模型公司抢了
2026-07-19 14:15:02
GPT-5.6首批实测来了!精准狙击Mythos
2026-06-10 15:15:36
阶跃星辰杀入季后赛,强势跻身AI“新六小虎”第一梯队
2026-02-27 15:48:37
刚刚,阿里Qwen3.8-Max来了!冲进全球第一梯队,模型表现直逼Claude
2026-08-03 14:01:23
郑州:在医疗、教育、物流、防灾减灾等领域打造一批大模型典型示范 形成“AI+千行百业”全场景体系
2026-05-09 20:36:41
大模型也得「睡觉」了:Google 的这篇论文,戳中了AI 的最大软肋
2026-07-23 12:47:10
刚刚,港股AGI第一股杀疯了!Agent业务半年进账近5亿,Token收入Q2暴涨500%
2026-08-28 18:21:32
全球首份大模型业绩报!MiniMax预判2026三大超级PMF,AI平台公司启程了
2026-03-03 11:54:49
「说 Harness 会被淘汰的,肯定没做过工程」,Kimi 前 CLI 负责人戳破了 AI 圈最大的误解
2026-08-31 16:51:39
778 文章
957397 浏览
24小时热文
更多
-
2026-09-06 21:14:00 -
2026-09-06 20:12:34 -
2026-09-06 20:10:47