o3-pro通关“推箱子”,人类怀旧小游戏成大模型新基准
推箱子、俄罗斯方块等经典怀旧小游戏,如今成为大模型的新基准。o3-pro近期挑战了这两款游戏,均突破了现有基准上限。在推箱子游戏中,o3-pro完成了难度更高的第六关,而俄罗斯方块则因模型不停止操作而提前终止。
相较于前SOTA模型o3,o3-pro的成绩直接翻倍。这套名为Lmgame的基准测试包括推箱子、俄罗斯方块、2048、糖果传奇、马里奥兄弟及逆转裁判六款游戏。测试采用迭代交互循环模式,模型根据游戏状态生成动作,动作被执行后依据结果计算奖励并更新状态,进行新一轮决策。
Lmgame引入智能体框架,包含感知、记忆、推理等模块,并实施提示标准化以减少性能波动。各游戏评估方式不同,如推箱子以推动到目标位置的箱子总数计分,俄罗斯方块则结合放置方块数量与清除行数计算得分。此外,该基准开源且无时间限制考量,支持自行下载测试。
Lmgame由UCSD的Hao AI Lab开发,负责人张昊曾在多所顶尖学府深造,并参与创立LMSYS,该组织负责研发大模型竞技场及SGLang、vLLM等知名模型框架。Hao AI Lab的GitHub项目FastVideo获1.5k星标,实验室还接受谷歌和英伟达资助。
原文链接
本文链接:https://kx.umi6.com/article/20308.html
转载请注明文章出处
相关推荐
换一换
MiniMax M3一手实测:老黄PPT上74个Logo,我以为能难住它
2026-06-03 00:53:27
马斯克直呼完了:Anthropic 73页论文刷屏,全球大模型中招思想病毒!
2026-08-20 16:35:22
Kimi春节档挣超一年钱!这口“龙虾肉”大厂开始抢吃了
2026-02-26 01:05:27
雷军宣布:小米AI人才招聘专项正式启动!
2026-03-30 16:59:23
上海已发布超150款备案大模型
2026-03-28 20:16:44
阿里千问大模型换将,32岁林俊旸官宣告别
2026-03-04 10:27:38
10万国产卡支持!智谱发布轻量级旗舰模型对标DeepSeek
2026-08-27 00:50:13
Kimi上去了 Anthropic换锚了?
2026-08-03 16:09:46
马斯克、黄仁勋同天发声:力挺中国AI
2026-07-27 16:19:12
大模型的尽头 怎么是费大厨辣椒炒肉?
2026-05-24 15:42:37
月之暗面近20天收入超去年全年
2026-02-23 19:11:04
GPT-5.6首批实测来了!精准狙击Mythos
2026-06-10 15:15:36
刚刚,智谱港交所敲钟!市值528亿港元
2026-01-08 11:04:01
809 文章
1009216 浏览
24小时热文
更多
-
2026-09-06 21:14:00 -
2026-09-06 20:12:34 -
2026-09-06 20:10:47