8月7日,Anthropic大神卡帕西提出大模型评测新基准,用《指环王》文本让模型生成3D世界,接替“鹈鹕骑自行车”测试。卡帕西将小说开头输入Opus 5,模型耗时2小时、消耗100万token及5500行代码,用Three.js搭建出可运行的“中土世界”3D场景。网友纷纷效仿,用AI生成旧金山、纽约甚至虚拟演唱会。新基准深度考察了模型的空间理解与复杂代码生成能力,同时也暴露出大模型能搭建场景却无法真正“看懂”和体验生成内容的短板。这为评估大模型推理能力向三维世界延伸提供了新视角。
原文链接
本文链接:https://kx.umi6.com/article/37358.html
转载请注明文章出处
相关推荐
换一换
GPT-4o能拼好乐高吗?首个多步空间推理评测基准:闭源模型领跑
2025-04-23 11:52:51
密室逃脱成AI新考场,通关率不足50%,暴露空间推理短板丨清华ICCV25
2025-07-14 14:19:19
OpenAI最强竞对Anthropic:正确的大模型评测应该是怎样的?
2024-11-20 16:13:21
大模型掌握人类空间思考能力!三阶段训练框架学会“边画边想”,5个基准平均提升18.4%
2025-06-21 15:10:12
AI帮我读论文,哪家强?
2025-01-03 15:50:44
太可怕了!AI大模型已学会人类空间思考能力
2025-06-22 22:18:27
李飞飞谢赛宁新作「空间推理」:多模态大模型性能突破关键所在
2024-12-23 12:52:12
谷歌最强具身大脑发布!波士顿机器狗瞬间人模人样
2026-04-17 16:07:31
专治大模型“刷题”,贾佳亚团队新基准让模型只挑错不做题,GPT-4得分不到50
2024-07-18 17:06:23
超越Gemini3、GPT5.1,阿里千问登顶空间推理全球冠军
2025-11-26 15:49:46
连尚集团入选上海市首批算力生态合作伙伴名单
2026-09-03 11:19:32
世界生成模型来了3D头部玩家,可进入生产管线的场景级生成时代来临!
2026-09-03 18:34:09
浏览破亿!Anthropic对齐负责人亲认:十年内AI灭绝人类概率超10%
2026-09-10 11:22:52
738 文章
930416 浏览
24小时热文
更多
-
2026-09-10 18:41:51 -
2026-09-10 16:41:44 -
2026-09-10 16:40:09