8月7日,Anthropic大神卡帕西提出大模型评测新基准,用《指环王》文本让模型生成3D世界,接替“鹈鹕骑自行车”测试。卡帕西将小说开头输入Opus 5,模型耗时2小时、消耗100万token及5500行代码,用Three.js搭建出可运行的“中土世界”3D场景。网友纷纷效仿,用AI生成旧金山、纽约甚至虚拟演唱会。新基准深度考察了模型的空间理解与复杂代码生成能力,同时也暴露出大模型能搭建场景却无法真正“看懂”和体验生成内容的短板。这为评估大模型推理能力向三维世界延伸提供了新视角。
原文链接
本文链接:https://kx.umi6.com/article/37358.html
转载请注明文章出处
相关推荐
换一换
太可怕了!AI大模型已学会人类空间思考能力
2025-06-22 22:18:27
专治大模型“刷题”,贾佳亚团队新基准让模型只挑错不做题,GPT-4得分不到50
2024-07-18 17:06:23
李飞飞谢赛宁新作「空间推理」:多模态大模型性能突破关键所在
2024-12-23 12:52:12
谷歌最强具身大脑发布!波士顿机器狗瞬间人模人样
2026-04-17 16:07:31
GPT-4o能拼好乐高吗?首个多步空间推理评测基准:闭源模型领跑
2025-04-23 11:52:51
超越Gemini3、GPT5.1,阿里千问登顶空间推理全球冠军
2025-11-26 15:49:46
大模型掌握人类空间思考能力!三阶段训练框架学会“边画边想”,5个基准平均提升18.4%
2025-06-21 15:10:12
OpenAI最强竞对Anthropic:正确的大模型评测应该是怎样的?
2024-11-20 16:13:21
密室逃脱成AI新考场,通关率不足50%,暴露空间推理短板丨清华ICCV25
2025-07-14 14:19:19
AI帮我读论文,哪家强?
2025-01-03 15:50:44
摆脱算力依赖!Anthropic组建自研芯片团队 专为Claude打造AI芯片
2026-08-06 07:21:29
苏神复盘 Kimi K3:896 个专家背后,藏着哪些关键技术取舍?
2026-08-06 21:51:10
Google 牺牲了图片分辨率、编辑能力和准确性换取了 「它」 的极致性价比!
2026-08-03 10:54:00
728 文章
843697 浏览
24小时热文
更多
-
2026-08-07 12:21:41 -
2026-08-07 12:20:06 -
2026-08-07 12:18:09