1
免责声明:Al优秘圈所有资讯仅代表作者个人观点,不构成任何投资理财建议。请确保访问网址为(kx.umi6.com) 投诉及建议

10月21日,智源研究院发布了原生多模态世界模型Emu3,该模型无需扩散模型或组合方法,即可实现对文本、图像、视频三种模态数据的理解和生成。Emu3在多项基准测试中表现出色,包括图像生成、视觉语言理解和视频生成任务,均优于现有模型。例如,在图像生成任务中,Emu3优于SD-1.5与SDXL;在视觉语言理解任务中,Emu3优于LlaVA-1.6;在视频生成任务中,Emu3优于OpenSora 1.2。Emu3提供了一个强大的视觉tokenizer,能够将视频和图像转换为离散token,这些token与文本tokenizer输出的离散token一同送入模型中,从而实现Any-to-Any的任务处理。目前,Emu3的关键技术和模型已开源,相关链接已公布。这一突破性的进展为大规模多模态学习提供了新的研究范式。

原文链接
本文链接:https://kx.umi6.com/article/7635.html
转载请注明文章出处
分享至
打开微信扫一扫
内容投诉
生成图片
相关推荐
换一换
「AI掉队者联盟」谋求改命
2025-06-11 16:13:17
智谱发布首个多模态Coding基座模型 OpenClaw龙虾获视觉能力
2026-04-02 08:48:17
世界模型有了开源基座Emu3.5!拿下多模态SOTA,性能超Nano Banana
2025-10-31 10:25:44
国产新一代大模型MiniMax 3上半年发布:多模态、全球顶级性能
2026-03-03 22:38:04
别听模型厂商的,“提示”不是功能,是bug
2025-08-10 10:44:56
中国AI凭什么逆袭美国?
2025-06-26 13:58:23
寻找 AI 的「第三语言」:中间表示如何打通多模态鸿沟 | CVPR 2026
2026-05-22 12:46:56
文生视频模型为何迟迟没有“aha moment”?
2025-04-14 15:40:26
谷歌推出Gemini 3.5系列模型
2026-05-20 08:24:34
Gemini负责人爆料!多模态统一token表示,视觉至关重要
2025-07-03 15:27:24
黄仁勋发Token当工资!硅谷兴起刷量大赛,一人烧掉33个维基百科
2026-03-23 12:09:35
从Token到词元:全模态时代的基模与交互入口
2026-03-27 12:58:21
神秘「牛来」模型果然是智谱!GLM首个原生多模态,还用的国产卡
2026-08-27 01:50:21
24小时热文
更多
扫一扫体验小程序