11月3日,美团发布并开源LongCat-Flash-Omni模型,支持实时音视频交互,达到SOTA水平。该模型基于Shortcut-Connected MoE架构,参数规模达5600亿(激活参数270亿),在文本、图像、音频和视频理解等多模态任务中表现优异,首次实现全模态覆盖与大参数量高效推理。其音频能力在LibriSpeech等数据集上优于Gemini-2.5-Pro,视频理解性能比肩顶级闭源模型。此外,团队构建了一套端到端评测方案,用户评分显示其流畅度领先开源模型Qwen3-Omni。模型已在Hugging Face和GitHub同步开源。
原文链接
本文链接:https://kx.umi6.com/article/27676.html
转载请注明文章出处
相关推荐
换一换
刚刚,商汤发布第六代大模型:6000亿参数多模态MoE,中长视频直接可推理
2025-04-10 22:10:27
阿里云通义千问发布新一代端到端多模态旗舰模型 Qwen2.5-Omni 并开源,看听说写样样精通
2025-03-27 07:33:35
谷歌推出Gemini 3.5系列模型
2026-05-20 08:24:34
月之暗面推出Kimi K2.5模型,全面升级多模态能力
2026-01-27 14:20:13
谷歌最强 AI 开放翻译模型:TranslateGemma 登场,手机也能跑
2026-01-16 07:19:49
GPT-5泄露!首次统一GPT和o系列,实测demo抢先曝光,下周发布?
2025-08-01 08:52:52
字节把GPT-4o级图像生成能力开源了!
2025-05-24 16:24:01
谢赛宁李飞飞LeCun搞的寒武纪,究竟是个啥?
2025-11-24 15:02:36
截胡 OpenAI,谷歌全模态模型首次解禁!Gemini 2.0 中文唠嗑式 P 图引动漫游戏圈关注
2025-03-13 15:23:45
字节 Seed 开源统一多模态理解和生成模型 BAGEL
2025-06-03 19:01:17
「AI掉队者联盟」谋求改命
2025-06-11 16:13:17
商汤坐上大模型核心牌桌
2025-05-09 11:48:13
文生视频模型为何迟迟没有“aha moment”?
2025-04-14 15:40:26
733 文章
797561 浏览
24小时热文
更多
-
2026-07-24 00:15:46 -
2026-07-24 00:14:08 -
2026-07-24 00:12:30