斯坦福大学的一项最新研究表明,大模型在数学推理能力上可能并未真正掌握解题逻辑,而只是检索已存储的题目。研究团队提出了一种新的Putnam-AXIOM基准测试集,涵盖1985年至2023年的William Lowell Putnam数学竞赛题目,以更严格地评估模型能力。
结果显示,即使只是更换题目中的变量名称和取值范围,模型的准确率就会大幅下降。例如,表现最好的o1-preview模型在原始数据集上的准确率为50%,但在变异数据集中降至33.96%。其他模型如GPT-4o、Claude、Deepseek和Qwen等也表现不佳。
这项研究揭示了当前大模型在数学推理方面的局限性,需要进一步提升其逻辑推理和数学严谨性。Putnam-AXIOM基准不仅提高了评估难度,还通过自动化评估和多样化变体数据集,为未来的研究提供了有力支持。
原文链接
本文链接:https://kx.umi6.com/article/11194.html
转载请注明文章出处
相关推荐
换一换
Kimi春节档挣超一年钱!这口“龙虾肉”大厂开始抢吃了
2026-02-26 01:05:27
腾讯混元大模型品牌 Hunyuan 更名为 HY
2025-12-10 15:53:58
独家|百度成立模型委员会(BMC) 加强人工智能技术优势
2026-05-15 10:39:37
国产AI又一轮爆发 MiniMax M3大模型要来了:10-15倍性能改善
2026-05-27 12:26:00
花3000元让AI改口,大模型的尽头是广告?
2026-01-06 19:29:29
GPT-5.6首批实测来了!精准狙击Mythos
2026-06-10 15:15:36
几乎都在挂羊头卖狗肉!AI Agent泡沫实在太大了
2025-10-20 11:04:42
备案平均时长缩至2个月 目前已有216款大模型在京完成备案
2026-02-28 19:46:01
啊?微博7800美元训的大模型,数学能力超了DeepSeek-R1
2025-11-18 14:20:39
把12个AI凑到一起打工,它们竟然搞起“小团体”?
2025-10-16 22:02:39
中国企业调用大模型日均达37万亿tokens
2026-02-24 13:54:18
智谱上市后首份财报:超7.24亿元!国内收入最高大模型公司,MaaS发力了
2026-03-31 21:04:07
大模型收入暴涨1076%,港股AGI第一股首份年报:一年狂揽12亿,属实把商业化玩明白了
2026-03-27 17:08:13
762 文章
825051 浏览
24小时热文
更多
-
2026-07-24 00:15:46 -
2026-07-24 00:14:08 -
2026-07-24 00:12:30