阿里通义团队于3月11日推出R1-Omni模型,该模型结合了强化学习(RLVR)与多模态技术,尤其适用于复杂全模态场景。R1-Omni通过增强透明性,使得音频和视频信息的作用更加清晰可见。在情绪识别等任务中,R1-Omni能明确展示哪些模态信息对特定判断至关重要。实验结果显示,相比原始基线模型,R1-Omni在同分布测试集上的表现提升了超过35%,而在不同分布测试集上,其泛化能力同样出色。R1-Omni开源地址已公布,包括论文、Github及模型下载链接。
原文链接
本文链接:https://kx.umi6.com/article/15251.html
转载请注明文章出处
相关推荐
换一换
Agent、多模态、应用、算力一天看尽,峰会亮点在此|5.20日,来现场一起AI
2026-05-17 17:46:55
智源研究院发布“悟界”系列大模型,含全球首个原生多模态世界模型 Emu3
2025-06-06 12:30:15
GPT-5超越人类医生!推理能力比专家高出24%,理解力强29%
2025-08-15 16:18:18
520当天400万AI人,都在量子位听这近20场演讲&对谈|第四届中国AIGC产业峰会
2026-05-21 14:43:04
是个公司都在用AI Agent,但大家真的用明白了吗| MEET2026圆桌论坛
2025-12-17 13:42:24
阿里通义千问 2.5-Omni-3B AI 全模态登场:7B 版 90% 性能,显存占用减少 53%
2025-05-01 11:20:52
阶跃星辰姜大昕:多模态目前还没有出现GPT-4时刻
2025-05-08 20:39:27
图像编辑开源新SOTA,来自多模态卷王阶跃!大模型行业正步入「多模态时间」
2025-04-28 12:48:54
Meta发布最强开源Llama 4,超越DeepSeek V3
2025-04-06 10:58:02
全球最大开源视频模型,现在也Created in China了,阶跃出品
2025-02-19 14:50:40
字节把GPT-4o级图像生成能力开源了!
2025-05-24 16:24:01
视频理解霸榜!快手Keye-VL旗舰模型重磅开源,多模态视频感知领头羊
2025-11-28 17:39:28
谷歌Gemma 3n实测
2025-07-07 11:27:31
748 文章
867510 浏览
24小时热文
更多
-
2026-07-24 00:15:46 -
2026-07-24 00:14:08 -
2026-07-24 00:12:30