字节跳动Seed Audio 1.0:从语音到完整音景
字节跳动正式发布了Seed Audio 1.0,这是一款音频生成模型,标志着从简单的语音合成向完整的音景创作转变。该模型现已通过火山方舟体验中心开放,供创作者测试。
多年来,制作电影级音频意味着要同时处理多个模型——一个用于人声,另一个用于音效,再一个用于环境噪音——然后手动同步和混音。这个过程缓慢、繁琐,且往往导致最终产品不连贯。Seed Audio 1.0改变了这一点。它不是将独立片段拼接在一起,而是在一个统一框架下对所有音频元素进行建模,生成从头到尾服务于故事的完整声音作品。

据字节跳动介绍,该模型具备三大核心能力。首先,精确的时空控制:你可以沿时间轴以100毫秒的精度提示对话和音效——非常适合视频配音或广告制作。其次,稳定的语音表现:支持零样本生成和长音频扩展,在表达愤怒或喜悦等情绪时保持角色语音一致性。同一语音甚至可扮演多个角色。第三,流畅的多语言支持:覆盖包括中文、英文和日文在内的20多种语言,模型能适应当地节奏和重音模式。
评估数据显示,在九种常见创作场景中,模型的音频可用性超过90%。其多语言生成的自然度MOS评分普遍在4分以上——属于优秀水平。

从“能说话”到“能创作”,Seed Audio 1.0降低了制作高质量音频内容的门槛。团队计划进一步整合多模态输入(如视频参考),并探索可控翻译技术,持续优化长音频和音轨生成能力。目标:帮助创作者高效地将脑海中的音景转化为可听的作品。
关键点
- 统一框架:Seed Audio 1.0一次性生成对话、音效和环境音,而非分别生成。
- 精确计时:以100毫秒精度控制音频输入。
- 一致语音:在不同情绪甚至多个角色间保持角色语音一致性。
- 多语言:支持20多种语言,自然本地化表达。
- 高质量:常见场景可用性超过90%;MOS评分4分以上。
- 现已可用:在火山方舟体验中心进行测试。