跳转到主要内容

Fish Audio周年庆:S2.1Pro模型带来实时语音与情感控制

Fish Audio正在庆祝其周年纪念,发布了S2.1Pro,这是其迄今为止最先进的生产级语音模型。与传统的文本转语音系统不同,后者坚持脚本化叙述,而这款模型专为实时对话而构建。现在可通过Fish Audio API使用,并且有一个带有合理限制的免费版本供开发者测试和尝试。

Image

性能与特点

在技术方面,S2.1Pro在约90毫秒内提供首帧音频播放——足够快以实现自然、流畅的来回对话。它在统一的语音识别架构下支持83种语言。但真正让它与众不同的是语音控制的灵活性。忘记预设的情感菜单;你可以直接在文本中嵌入自由形式的括号标签,以实时触发耳语、紧张的笑声或其他精细指令。

该模型还原生支持多说话人对话生成。需要克隆声音?只需10到30秒的参考音频即可准确复制目标语调和说话风格,无需额外的微调。

意义

S2.1Pro标志着语音AI的转变——从僵化的、基于脚本的合成转向实时、高保真的交互。它降低了开发者的门槛,并为在全球部署智能语音应用提供了坚实的计算基础。

关键点

  • 首帧延迟约90ms,实现实时对话
  • 支持83种语言,统一语音识别
  • 通过内联括号标签进行情感控制(例如,耳语、笑声)
  • 多说话人生成和从10-30秒音频中克隆声音
  • 通过Fish Audio API提供,带有免费测试层级