标题:o3挑战ARC-AGI,英国工程师:大模型在大规模网格面前表现不佳
正文: o3在超难推理任务ARC-AGI上表现出色,但英国工程师Mikel Bober-Irizar的研究发现,其表现可能与题目规模有关。米哥观察到,网格规模越大,大模型如o3、o1、o1 mini及Claude的表现越差。
米哥的研究引发了对大模型工作原理的广泛讨论。世界首位全职提示词工程师Riley Goodside也认为这是一项重要研究。
米哥发现,在ARC挑战中,随着网格数量增加,大模型表现显著下降。尤其在网格数量达到1024个时,o3的表现开始明显下滑。通过对比不同规模的题目,米哥证实了这一现象。此外,ARC数据集中规模为1024个像素的题目数量最多,这也解释了o3在此类题目的优异表现。
米哥认为,ARC挑战不能完全反映大模型的真实推理能力,很多模型被低估,而o3则被高估。
为何大模型在规模较大时表现不佳?米哥引用纽约大学的研究指出,人类不会出现类似问题,且在规模较小时o3表现优于人类,规模较大时则反之。这表明大模型的思考方式与人类有差异。
大模型处理的是数字矩阵而非图像,需跨行和列推理。随着网格变大,模型需要处理更长的上下文信息,这对大模型构成挑战。米哥建议通过旋转矩阵,使模型分别基于行和列进行推理,可以显著提高成绩。
米哥认为,ARC任务不适合大模型,将其视为四维空间中的推理任务。视觉能力是关键,但模型的视觉处理方式与人类不同。
原文链接
本文链接:https://kx.umi6.com/article/10796.html
转载请注明文章出处
相关推荐
换一换
2025WAIC:大厂回归,医疗AI爆火出圈
2025-07-30 15:47:42
Scaling Law再遭质疑:“退化式AI”竟成终局?
2025-08-04 21:03:25
阿里、智谱等扎堆发布大模型 编程、金融等方向成焦点
2025-07-30 20:55:52
Karpathy 最新发文:别把 AI 当人看,它没欲望也不怕死
2025-11-22 19:29:36
阿里字节腾讯,集体重仓新风口
2025-10-17 14:18:54
智谱与市城投集团合作发布杭州城投人工智能产业大模型项目(一期)建设成果
2025-09-15 20:01:43
大模型“记性差一点”反而更聪明!金鱼损失随机剔除token,让AI不再死记硬背
2025-09-03 17:49:26
两部门:到2027年推动五个以上专业大模型在电网、发电、煤炭、油气等行业深度应用
2025-09-08 10:56:26
王兴一鸣惊人!美团首个开源大模型追平DeepSeek-V3.1
2025-09-01 13:16:16
豆包们,开始「上链接」
2025-10-27 10:54:08
百度生成式AI和大模型专利中国第一,全栈创新驱动AI应用领先
2025-07-18 16:41:37
DeepSeek删豆包冲上热搜,大模型世子之争演都不演了
2025-08-21 13:31:42
中国AI云,开始「抢座次」了
2025-11-20 11:17:00
646 文章
401472 浏览
24小时热文
更多
-
2025-12-08 23:53:52 -
2025-12-08 22:52:38 -
2025-12-08 22:51:57