跳转到主要内容

谷歌推出全新TTS模型:用自然语言设计语音,30秒克隆声音

谷歌推出全新TTS模型:用自然语言设计语音,30秒克隆声音

语音合成刚刚变得个性化了许多。9月23日,谷歌发布了两款新的文本转语音模型——Gemini 3.8 Flash TTS和Gemini 3.8 Flash-Lite TTS——旨在让开发者和创作者对角色声音拥有前所未有的控制权。

两个模型,两种截然不同的任务

把Gemini 3.8 Flash TTS想象成你的数字配音演员。它让你只需用日常语言描述,就能变出一个声音。想要一个温暖、沙哑、语速缓慢的叙述者?直接输入描述就行。你可以逐句调整音调、语速和口音,获得过去需要数小时录音棚工作才能实现的精细控制。

但最厉害的是:它还能仅凭30秒音频样本克隆声音。没错——半分钟的语音,你就能得到一个听起来和原声一模一样的数字替身。

与此同时,Gemini 3.8 Flash-Lite TTS则是主力干将。它专为批量音频生成和高效配音而打造——比如自动化有声书、大批量旁白,或任何需要快速生成大量语音的场景。

全球化工具包

这两款模型都能说你的语言——字面意义上的。谷歌表示,它们支持超过100种语言和方言,并附带2000种预制语音库。对于任何构建语音应用或为全球受众创作内容的人来说,这都是一个巨大的先发优势。

这对创作者意味着什么

如果你曾尝试制作游戏、动画或播客,你就知道获得一致、高质量的配音有多痛苦。聘请配音演员既昂贵又缓慢。DIY工具往往听起来很机械。这些新模型有望弥合这一差距。

想象一下,在几分钟内原型化一个角色的声音,然后逐行调整直到完美。或者克隆主持人的声音用于每日新闻简报,而无需他们录制一个字。可能性巨大——甚至有点让人脑洞大开。

细则

当然,能力越大,责任越大。声音克隆技术引发了关于同意和滥用的伦理问题。谷歌尚未详细说明其保障措施,但随着这些工具触及更多人,相关讨论预计会升温。

目前,重点在于赋能。开发者可以开始试用这些模型,而我们其他人则可以期待在我们使用的应用和媒体中,获得更自然、更个性化的语音体验。

要点

  • Gemini 3.8 Flash TTS让你使用自然语言描述设计语音,并从30秒样本中克隆。
  • Gemini 3.8 Flash-Lite TTS针对大规模音频生成进行了优化。
  • 两者都支持超过100种语言,并附带2000种预制语音。
  • 这些模型旨在为开发者和创作者简化语音创作。
  • 围绕声音克隆的伦理考量仍然是一个热门话题。