1
免责声明:Al优秘圈所有资讯仅代表作者个人观点,不构成任何投资理财建议。请确保访问网址为(kx.umi6.com) 投诉及建议

标题:Ilya观点得证!仅靠预测下一个token统一图像文本视频,智源发布原生多模态世界模型Emu3

2024年10月21日,智源研究院发布了原生多模态世界模型Emu3,该模型基于预测下一个token的技术,无需扩散模型或组合方法,即可实现文本、图像和视频的理解与生成。Emu3在图像生成、视频生成和视觉语言理解等任务中表现优异,超过了一些知名开源模型。

Emu3通过强大的视觉tokenizer将视频和图像转换为离散token,这些token可以与文本tokenizer输出的离散token一起送入模型。模型输出的离散token可以转换为文本、图像和视频,为Any-to-Any任务提供了统一的研究范式。此外,Emu3利用直接偏好优化(DPO)技术,使模型与人类偏好保持一致。

Emu3研究结果显示,下一个token预测可以作为多模态模型的强大范式,实现大规模多模态学习并在多模态任务中达到先进性能。该模型已开源关键技术与模型,吸引了广泛关注。

Emu3的统一方法简化了多模态AI的开发和应用,为各行各业提供了新可能,也推动了多模态AI领域的变革。未来,Emu3有望在自动驾驶、机器人大脑、智能眼镜助手、多模态对话和推理等领域发挥重要作用。

原文链接
本文链接:https://kx.umi6.com/article/7602.html
转载请注明文章出处
分享至
打开微信扫一扫
内容投诉
生成图片
相关推荐
换一换
阶跃星辰首届开放日:多模领先,智能终端等Agent应用全面涌现
2025-02-21 18:55:11
谷歌年度大招:所有AI模型全升级一遍!Gemini2.5大杯中杯霸榜前二,新版视频/图像模型亮相
2025-05-21 05:52:42
阿里云栖大会一口气发布千问 3-VL、万相 2.5 等六大模型 + 通义百聆新品牌,覆盖文本、视觉、语音、视频、代码、图像全场景
2025-09-24 14:42:04
独家丨前阿里通义视觉负责人薄列峰,已加入腾讯混元团队
2025-07-27 19:02:28
全球顶级AI科学家许主洪加盟阿里!IEEE Fellow,五万被引论文数,曾任Salesforce集团副总裁
2025-02-08 14:22:14
DeepSeek 深夜再放大招:7B 参数人人可用的视觉多模态模型 Janus-Pro-7B 开源
2025-01-28 01:38:40
智源研究院发布世界模型Emu3 多模态AGI渐行渐近?
2024-10-22 11:06:09
阶跃星辰推出开源 SOTA 图像编辑模型,一个月连发三款多模态模型
2025-04-27 15:20:13
浙大团队破解多模态模型「盲目自信」:先校准置信度,再分配算力丨CVPR’26
2026-03-22 15:55:17
Kimi最新多模态模型K2-VL提前现身
2026-01-05 15:13:56
空间智能版ImageNet来了!李飞飞吴佳俊团队出品
2024-11-11 16:11:01
Nano Banana Pro 新对手,智谱联合华为开源首个国产芯片训练的多模态 SOTA 模型 GLM-Image
2026-01-14 10:24:53
全球最大开源视频模型,现在也Created in China了,阶跃出品
2025-02-18 13:15:12
24小时热文
更多
扫一扫体验小程序