1
免责声明:Al优秘圈所有资讯仅代表作者个人观点,不构成任何投资理财建议。请确保访问网址为(kx.umi6.com) 投诉及建议

标题:o3挑战ARC-AGI,英国工程师:大模型在大规模网格面前表现不佳

正文: o3在超难推理任务ARC-AGI上表现出色,但英国工程师Mikel Bober-Irizar的研究发现,其表现可能与题目规模有关。米哥观察到,网格规模越大,大模型如o3、o1、o1 mini及Claude的表现越差。

米哥的研究引发了对大模型工作原理的广泛讨论。世界首位全职提示词工程师Riley Goodside也认为这是一项重要研究。

米哥发现,在ARC挑战中,随着网格数量增加,大模型表现显著下降。尤其在网格数量达到1024个时,o3的表现开始明显下滑。通过对比不同规模的题目,米哥证实了这一现象。此外,ARC数据集中规模为1024个像素的题目数量最多,这也解释了o3在此类题目的优异表现。

米哥认为,ARC挑战不能完全反映大模型的真实推理能力,很多模型被低估,而o3则被高估。

为何大模型在规模较大时表现不佳?米哥引用纽约大学的研究指出,人类不会出现类似问题,且在规模较小时o3表现优于人类,规模较大时则反之。这表明大模型的思考方式与人类有差异。

大模型处理的是数字矩阵而非图像,需跨行和列推理。随着网格变大,模型需要处理更长的上下文信息,这对大模型构成挑战。米哥建议通过旋转矩阵,使模型分别基于行和列进行推理,可以显著提高成绩。

米哥认为,ARC任务不适合大模型,将其视为四维空间中的推理任务。视觉能力是关键,但模型的视觉处理方式与人类不同。

原文链接
本文链接:https://kx.umi6.com/article/10796.html
转载请注明文章出处
分享至
打开微信扫一扫
内容投诉
生成图片
相关推荐
换一换
北京备案大模型达225款 占全国总量约三成
2026-04-22 20:27:12
美国公司又吹牛!首例AI自主勒索攻击被拆穿:人类幕后操盘、AI只配敲键盘
2026-07-07 17:39:23
马斯克、黄仁勋同天发声:力挺中国AI
2026-07-27 16:19:12
至知研究院提出大模型可解释性新路线:拆权重,数据成本不到1%
2026-08-15 15:15:17
赛博朋克修车!网友用笔记本跑大模型查故障:不如200元买OBD
2026-09-02 19:47:51
智谱首份业绩报告:商业化全面爆发,Maas平台ARR达17亿元提升60倍
2026-03-31 18:02:15
百度推动大模型与搜推业务融合
2026-03-18 15:35:09
潞晨尤洋:日常办公没必要上私有模型,这三类企业才需要 | MEET2026
2025-12-22 10:34:39
Kimi即将推出新一代万亿大模型:开源王者刷新 去年已超GPT5
2026-01-20 22:33:50
智谱AI今日正式上市,一文讲透你想知道的6件事
2026-01-09 21:35:10
美国封杀对华AI芯片适得其反 老外担心2种最坏情况即将出现
2026-08-29 19:13:22
上海已发布超150款备案大模型
2026-03-28 20:16:44
大模型的尽头 怎么是费大厨辣椒炒肉?
2026-05-24 15:42:37
24小时热文
更多
扫一扫体验小程序