标题:AI说书媲美真人!豆包语音大模型升级长上下文理解
市面上许多语音模型虽已实现自然合成,但在音质、韵律及情感表达方面仍有待提升。尤其在小说演播中,需细腻区分旁白与角色、准确传达情感及不同角色间的差异。
传统方法需预先标记对话、情感和角色,而豆包语音模型可实现端到端合成,无需额外标签。为提升小说演播效果,豆包团队改进了Seed-TTS技术。具体改进包括:
- 数据处理:按章节处理小说音频,确保长文连贯性。
- 特征融合:结合音素、音调、韵律信息与原始文本,提升发音和韵律,保留语义。
- 结构调整:将speech tokenizer改为speaker embedding,使同一发音人在不同角色间更具表现力。
- 上下文增强:加入更多上下文信息,提升模型对更大范围语义的理解能力。
经评测,优化后的豆包模型在小说演播场景下,CMOS评分已达一流主播的90%以上。该模型已应用于番茄小说,合成千部有声书,涵盖多种热门题材。未来,豆包将继续探索前沿科技,提升用户体验。
原文链接
本文链接:https://kx.umi6.com/article/14373.html
转载请注明文章出处
相关推荐
换一换
偷走配音员声音判赔5万 上海首例AI语音合成侵权案宣判
2026-09-29 18:39:15
新豆包模型让郭德纲喊出发疯文学:(这班)不上了!不上了!不上了!!!
2025-10-16 14:53:40
新豆包模型让郭德纲喊出发疯文学:(这班)不上了!不上了!不上了!!!
2025-10-16 14:53:40
华为大模型双子星联手创业,要找物理世界的Scaling Law
2026-09-25 15:19:31
岳麓大会观察:当别处还在拼具身全栈,湖南选择了一条更“重”的路
2026-09-29 16:31:39
HC归来,华为正重新定义AIDC基础设施
2026-09-28 20:22:48
ChatGPT版Grok Bot代码曝光!OpenAI也要为你造不下班的AI同事
2026-09-23 10:26:09
让Token生产更高效:异构混推的关键技术演进与创新实践
2026-09-23 18:54:36
Yann LeCun 万字演讲:「预测像素」是伪命题,JEPA 也并非凭空而来 | ECCV 2026
2026-09-23 10:29:08
高通All in 智能体!CEO安蒙:我们已处在智能体时代的开端
2026-09-29 01:37:41
“AlphaGo”杀进足球场!自我对弈140年,机器人成“梅西终结者”
2026-09-25 21:35:27
精准揪出RL训练数据Bug,Prompt直出小游戏,IQuest-Q1夯爆了!
2026-09-29 16:28:57
OpenAI突发急刹车!AI竟在全网植入自我复制代码,血洗联合国内网
2026-09-28 10:54:55
732 文章
968212 浏览
24小时热文
更多
-
2026-09-29 19:43:38 -
2026-09-29 19:42:19 -
2026-09-29 19:39:58