标题:Ilya观点得证!仅靠预测下一个token统一图像文本视频,智源发布原生多模态世界模型Emu3
2024年10月21日,智源研究院发布了原生多模态世界模型Emu3,该模型基于预测下一个token的技术,无需扩散模型或组合方法,即可实现文本、图像和视频的理解与生成。Emu3在图像生成、视频生成和视觉语言理解等任务中表现优异,超过了一些知名开源模型。
Emu3通过强大的视觉tokenizer将视频和图像转换为离散token,这些token可以与文本tokenizer输出的离散token一起送入模型。模型输出的离散token可以转换为文本、图像和视频,为Any-to-Any任务提供了统一的研究范式。此外,Emu3利用直接偏好优化(DPO)技术,使模型与人类偏好保持一致。
Emu3研究结果显示,下一个token预测可以作为多模态模型的强大范式,实现大规模多模态学习并在多模态任务中达到先进性能。该模型已开源关键技术与模型,吸引了广泛关注。
Emu3的统一方法简化了多模态AI的开发和应用,为各行各业提供了新可能,也推动了多模态AI领域的变革。未来,Emu3有望在自动驾驶、机器人大脑、智能眼镜助手、多模态对话和推理等领域发挥重要作用。
原文链接
本文链接:https://kx.umi6.com/article/7602.html
转载请注明文章出处
相关推荐
换一换
比扩散模型快50倍!OpenAI发布多模态模型实时生成进展,作者还是清华校友,把休假总裁Greg都炸出来了
2024-10-24 14:09:29
32B本地部署!阿里开源最新多模态模型:主打视觉语言,数学推理也很强
2025-03-25 09:39:46
全球最大开源视频模型,现在也Created in China了,阶跃出品
2025-02-18 13:15:12
全新创作平台SkyReels来了!一张画布+对话框包办AI视频创作流程
2025-11-04 13:13:09
谷歌年度大招:所有AI模型全升级一遍!Gemini2.5大杯中杯霸榜前二,新版视频/图像模型亮相
2025-05-21 05:52:42
实测Gemini 3 Pro - ,未来已来?
2025-11-19 10:08:03
多模态都是假的:最强模型数不清手指、认不出雷碧
2025-07-22 15:38:55
视觉模型智能涌现后, Scaling Law 不会到头
2024-11-22 12:00:19
实测商汤实时音视频交互模型5o:“造假”齐白石《虾》一眼识破!
2025-01-23 16:19:50
刚刚,智谱和华为搞波大的:中国首个国产芯片训练出的SOTA多模态模型!
2026-01-14 15:40:11
多模态模型挑战北京杭州地铁图!o3成绩显著,但跟人类有差距
2025-06-07 13:49:19
智谱首个免费多模态模型 GLM-4V-Flash 上线,支持图像描述生成、视觉问答等
2024-12-09 22:35:42
阶跃星辰开源 10B 多模态模型 Step3-VL-10B,性能媲美千亿级大模型
2026-01-20 19:24:31
700 文章
477411 浏览
24小时热文
更多
-
2026-03-10 10:03:26 -
2026-03-10 10:02:35 -
2026-03-10 09:02:22