Meta近日开源了一款名为Spirit LM的7B参数规模的多模态语言模型,能够同时处理语音和文本数据,不仅支持语音转文本和文本转语音任务,还能捕捉和再现语音中的情感和风格。这款模型通过交错使用文本和语音数据进行训练,使得模型能在两种模式间自由转换。与现有模型相比,Spirit LM在处理多种模态数据和任务时具有更强的泛化能力。该模型有两个版本:基础版和表达版。表达版额外引入音高和风格token,使其在生成语音时能更丰富地表达情感。实验结果显示,Spirit LM在自动语音识别和文本转语音任务中表现出色,尤其是在少量样本的情况下也能跨模态学习新任务。不过,该模型也可能生成不安全的内容,需要额外的安全测试。Meta开源该项目旨在推动语音和文本结合的语言模型的发展。
原文链接
本文链接:https://kx.umi6.com/article/9136.html
转载请注明文章出处
相关推荐
换一换
「AI掉队者联盟」谋求改命
2025-06-11 16:13:17
“AI掉队者联盟”谋求改命
2025-06-11 19:17:32
我们扒完了GPT-5全网爆料,奥特曼和OpenAI 这次的饼真不好画了
2025-08-05 19:18:01
匆匆发布的Llama4
2025-04-06 16:09:03
「阶跃星辰」的一次豪赌
2025-05-21 08:55:53
商汤日日新 SenseNova V6 多模态融合大模型发布
2025-04-10 17:00:13
4位图灵奖得主布道,2大冠军机器人登台,“AI春晚”果然又高又硬
2025-06-06 22:39:37
腾讯混元图像2模型发布 支持文本、语音、草图等交互方式
2025-05-16 17:13:07
Grok 4宣布全球免费使用
2025-08-11 11:04:47
大模型呼唤开源多模态 AI加速冲刺物理世界
2025-06-07 14:50:49
中国移动“九天”通用基础大模型 3.0 发布,核心技术开源
2025-07-26 22:47:54
什么是真正好用的推理模型?阶跃Step 3:开源的,多模态的,低成本的,国产芯片适配的
2025-07-28 10:09:36
消息称百度今年下半年将发布新一代 AI 大模型文心 5.0,提升多模态能力
2025-02-12 13:31:41
522 文章
246742 浏览
24小时热文
更多
-
2025-10-24 09:34:47 -
2025-10-24 09:33:43 -
2025-10-24 09:32:35