17款大模型PK八款棋牌游戏,o3-mini胜出,DeepSeek R1输在中间步骤
AI社区掀起用大模型玩游戏的热潮!例如,国外博主让DeepSeek和Chatgpt下国际象棋的视频在YouTube上收获百万播放量,ARC Prize也发布了贪吃蛇LLM评测基准SnakeBench。
港大、剑桥和北大的研究人员推出了更全面的LLM评测基准GameBoT,让大模型在8个游戏中PK,评测推理能力。GameBoT不仅关注输赢,还评估中间步骤,避免模型“背答案”。
传统LLM评测面临性能饱和和数据污染问题,而游戏评测能动态避免这些问题。GameBoT的独特之处在于评估中间步骤,将复杂决策分解为逻辑子问题,并设定明确答案,提高评测的细粒度和客观性。
GameBoT评测了17款大模型,包括GPT-4o、Claude-35-Sonnet等。最终,o3-mini-high以F1分数0.873排名第一,DeepSeek R1因中间步骤繁琐仅获0.176分。
实战中,o3-mini和DeepSeek R1各有亮点,但都存在不足。o3-mini表现更优,但在Connect4等游戏中仍有盲点。总体来看,最先进的大模型虽显智能,但仍需改进思考深度和中间步骤的可控性。
论文: https://arxiv.org/abs/2412.13602
项目主页: https://visual-ai.github.io/gamebot/
代码: https://github.com/Visual-AI/GAMEBoT
原文链接
本文链接:https://kx.umi6.com/article/16383.html
转载请注明文章出处
相关推荐
换一换
27个大模型混战电商领域,DeepSeek-R1&V3仍是最强
2025-03-15 23:19:30
给AI打个分,结果搞出17亿估值独角兽???
2026-01-07 18:23:47
AI 读过一切,却没经历过任何事:Ropedia 发布 HOMIE Gen2,给具身智能补「经验」这一课
2026-09-01 13:39:02
「说 Harness 会被淘汰的,肯定没做过工程」,Kimi 前 CLI 负责人戳破了 AI 圈最大的误解
2026-08-31 16:51:39
B站首届AI创造公开赛收官,超八成参赛者为一人团队
2026-09-06 13:57:08
横扫最难赛场,复核满分,银河通用无遥操出战100%夺冠
2026-08-31 17:51:10
吴恩达开源的OpenWorker,为什么「不 Work」了?
2026-09-01 16:49:39
打穿 AI 智商测试!GPT-6 Astra 的符号世界模型,是突破还是钞能力刷分?
2026-09-04 19:40:20
具身大脑进了真实世界,难题才刚刚开始
2026-09-04 13:17:29
刚刚,GPT-6正式发布!OpenAI:欢迎来到AGI时代
2026-09-04 06:01:21
2026 上半年智能眼镜竞争加剧,雷鸟创新五榜登顶实现全品类销量领先
2026-09-04 14:21:28
DeepSeek V4 多模态开源,我们把它的视觉链路拆了一遍
2026-09-01 18:52:06
我们用 Qwen 3.8-Max 做了一个 AI 大模型宇宙:效果竟然胜过 GPT5.6?
2026-09-01 16:57:36
748 文章
906996 浏览
24小时热文
更多
-
2026-09-06 21:14:00 -
2026-09-06 20:12:34 -
2026-09-06 20:10:47