1
免责声明:Al优秘圈所有资讯仅代表作者个人观点,不构成任何投资理财建议。请确保访问网址为(kx.umi6.com) 投诉及建议

o3-pro通关“推箱子”,人类怀旧小游戏成大模型新基准

推箱子、俄罗斯方块等经典怀旧小游戏,如今成为大模型的新基准。o3-pro近期挑战了这两款游戏,均突破了现有基准上限。在推箱子游戏中,o3-pro完成了难度更高的第六关,而俄罗斯方块则因模型不停止操作而提前终止。

相较于前SOTA模型o3,o3-pro的成绩直接翻倍。这套名为Lmgame的基准测试包括推箱子、俄罗斯方块、2048、糖果传奇、马里奥兄弟及逆转裁判六款游戏。测试采用迭代交互循环模式,模型根据游戏状态生成动作,动作被执行后依据结果计算奖励并更新状态,进行新一轮决策。

Lmgame引入智能体框架,包含感知、记忆、推理等模块,并实施提示标准化以减少性能波动。各游戏评估方式不同,如推箱子以推动到目标位置的箱子总数计分,俄罗斯方块则结合放置方块数量与清除行数计算得分。此外,该基准开源且无时间限制考量,支持自行下载测试。

Lmgame由UCSD的Hao AI Lab开发,负责人张昊曾在多所顶尖学府深造,并参与创立LMSYS,该组织负责研发大模型竞技场及SGLang、vLLM等知名模型框架。Hao AI Lab的GitHub项目FastVideo获1.5k星标,实验室还接受谷歌和英伟达资助。

原文链接
本文链接:https://kx.umi6.com/article/20308.html
转载请注明文章出处
分享至
打开微信扫一扫
内容投诉
生成图片
相关推荐
换一换
特想聊聊快手这次的变化
2025-06-25 08:43:51
大模型开始打王者荣耀了
2025-09-02 12:31:33
WAIC 2025倒计时30天!40+大模型、50+AI终端、60+智能机器人即将重磅登场
2025-06-26 17:24:23
DeepSeek删豆包冲上热搜,大模型世子之争演都不演了
2025-08-21 13:31:42
大模型首次直接理解代码图:不用Agent修bug,登顶SWE-Bench开源榜
2025-06-27 15:08:34
训练大模型烧了那么多钱,商业价值到底在哪?
2025-07-04 09:39:31
我国大模型数量超1500个
2025-07-27 23:04:18
大模型低调出展,机器人各出奇招
2025-07-26 22:49:04
上海累计82款大模型通过备案
2025-07-10 11:28:53
OpenAI:智谱在海外市场取得了显著进展,是大模型领域的新锐代表
2025-06-30 19:46:02
高性能计算群星闪耀时
2025-08-21 12:35:24
Scaling Law再遭质疑:“退化式AI”竟成终局?
2025-08-04 21:03:25
商汤需要「网感」
2025-07-09 13:03:03
24小时热文
更多
扫一扫体验小程序