1
免责声明:Al优秘圈所有资讯仅代表作者个人观点,不构成任何投资理财建议。请确保访问网址为(kx.umi6.com) 投诉及建议

7月4日,阿里通义实验室宣布开源首个音频生成模型ThinkSound。该模型首次将思维链(CoT)技术应用于音频生成领域,能够像专业音效师一样“听懂画面”,实现高保真、强同步的空间音频生成。研究团队构建了支持链式推理的多模态音频数据集AudioCoT,包含2531.8小时高质量样本,覆盖动物鸣叫、机械运转等真实场景,并通过严格筛选保障数据质量。ThinkSound由多模态大语言模型和统一音频生成模型组成,分三阶段解析画面内容并生成精准音频效果。这一技术突破解决了传统视频到音频生成中动态细节与空间关系不足的问题,满足专业创意需求。项目已开源,详情可参考GitHub、Hugging Face及ModelScope平台。

原文链接
本文链接:https://kx.umi6.com/article/21227.html
转载请注明文章出处
分享至
打开微信扫一扫
内容投诉
生成图片
相关推荐
换一换
阿里通义开源旗下首个音频生成模型 ThinkSound:可像“专业音效师”一样思考
2025-07-04 18:49:52
Stable Audio Open 开源 AI 模型发布:48.6 万个样本训练,可创建 47 秒短音频 / 音效等
2024-06-06 15:01:19
Stability AI重磅更新:一键无痕P图抠图,3分钟整首歌曲直接生成
2024-07-11 19:39:30
OpenAI 深夜炸场:家族最强视频生成模型 Sora 2 发布,还能同步生成音频
2025-10-01 08:39:42
全球消费,进入「中国定义」时间
2026-01-22 13:54:12
九骏踏浪,海淀这片“创新深海”做了啥?
2026-01-23 19:08:58
知名游戏女主播怒斥AI修图 花大手笔清除不雅照
2026-01-22 08:43:34
苹果正在研发一款可穿戴AI别针 最早可能于2027年发布
2026-01-23 20:15:45
NVIDIA黄仁勋:未来的电脑比现在强10亿倍
2026-01-21 23:29:50
成都国资开年「闪击战」背后的产业野望
2026-01-21 20:24:37
高通砸钱、雷军入股!刚刚,上海诞生一个183亿手机代工巨头
2026-01-22 18:04:11
国家知识产权局:我国人工智能专利有效量居全球前列
2026-01-23 10:49:16
Mobileye势头强劲,2025财年全年营收同比增长15%
2026-01-23 11:47:43
24小时热文
更多
扫一扫体验小程序