综合
7*24 快讯
AI科普
合作
全部
英雄令
项目方
开发者
产品方
投资者
2025年11月,美团发布全新独立APP LongCat及开源模型LongCat-Flash-Omni,主打多模态能力,支持文本、语音、图像和视频交互。该模型在全模态基准测试中表现优异,超越Qwen3-Omni等模型,达到开源SOTA水准,并与闭源模型Gemini-2.5-Pro媲美。其采用‘大总参小激活’MoE架构,参数达560B,推理效率极高,实现全模态实时交互。实测显示,无论是复杂任务还是流式音视频处理,模型均表现出‘快’与‘稳’的特点。此外,美团通过软硬件结合布局‘世界模型+具身智能’,目标连接数字与物理世界。目前,LongCat APP和Web端已开放免费体验,未来将拓展更多功能,助力零售与科技融合。
原文链接
11月3日,美团发布并开源LongCat-Flash-Omni模型,支持实时音视频交互,达到SOTA水平。该模型基于Shortcut-Connected MoE架构,参数规模达5600亿(激活参数270亿),在文本、图像、音频和视频理解等多模态任务中表现优异,首次实现全模态覆盖与大参数量高效推理。其音频能力在LibriSpeech等数据集上优于Gemini-2.5-Pro,视频理解性能比肩顶级闭源模型。此外,团队构建了一套端到端评测方案,用户评分显示其流畅度领先开源模型Qwen3-Omni。模型已在Hugging Face和GitHub同步开源。
原文链接
加载更多
暂无内容