1
免责声明:Al优秘圈所有资讯仅代表作者个人观点,不构成任何投资理财建议。请确保访问网址为(kx.umi6.com) 投诉及建议

标题:不是视频模型“学习”慢,而是LLM走捷径|18万引大牛Sergey Levine

闻乐 发自 凹非寺
量子位 | 公众号 QbitAI

为什么语言模型能从预测下一个词中学到很多,而视频模型却从预测下一帧中学到很少?UC伯克利大学计算机副教授Sergey Levine提出了这一疑问。他曾参与Google知名机器人大模型PALM-E、RT1和RT2等项目,谷歌学术被引用次数高达18万次。

Levine以《柏拉图洞穴中的语言模型》为题,探讨AI的局限性。“柏拉图洞穴”比喻揭示了人类认知的局限性。AI若能复现单一终极算法,就可能获得类似人类的灵活推理能力。语言模型通过“下一词预测+强化学习微调”取得了显著成功,但视频模型未能达到同样的效果。

尽管视频数据信息更丰富,视频模型却无法在复杂推理中胜过语言模型。例如,LLMs可以通过文本总结回答问题,而视频模型难以归纳物理规律。这种现象表明,语言模型只是模仿了人类的认知成果,而非真正理解世界。

Levine将互联网比作洞穴,真实世界为洞穴外的阳光,指出AI通过语言模型学习的是人类智慧的间接映射。长远来看,AI应摆脱对文本的依赖,通过传感器直接与物理世界交互,实现自主探索。跨模态连接成为关键挑战,需构建统一方法连接不同感知模式。

— 完 —

原文链接
本文链接:https://kx.umi6.com/article/19997.html
转载请注明文章出处
分享至
打开微信扫一扫
内容投诉
生成图片
相关推荐
换一换
OpenAI 官宣将发布自 GPT-2 以来的首个开放权重语言模型,并具有推理功能
2025-04-01 08:14:11
被AI脸包围的我 已经快看吐了
2026-06-16 07:35:06
o3/o4-mini幻觉暴增2-3倍!OpenAI官方承认暂无法解释原因
2025-04-21 13:38:37
LeCun最新万字演讲:纯语言模型到不了人类水平,我们基本已放弃
2024-10-18 09:36:11
为什么DeepSeek回答前总先“嗯”一下
2025-04-30 20:17:08
视频后期,危!MiniMax H3手绘即特效,多模态的「Coding时刻」来了
2026-07-31 16:36:19
通义千问系列最强大的语言模型:Qwen3-Max-Preview 上线
2025-09-06 00:26:52
Claude团队新研究:为什么有的模型假装对齐有的不会
2025-07-09 18:06:47
我和「二次元老公」约上会了!全球首个可以玩的实时交互模型,Xmax X2.0发布
2026-07-15 17:03:43
阿里发布电影级视频模型万相2.6
2025-12-16 13:40:51
字节跳动发布新一代视频模型:30秒一次生成 还能去油腻感
2026-07-31 16:39:32
AI视觉基础:学习压缩图像
2024-06-14 17:36:22
OpenAI 改进 ChatGPT 语言模型,提早识别心理压力与风险话题
2025-11-03 15:27:43
24小时热文
更多
扫一扫体验小程序