跳转到主要内容

StepZen 的 StepAudio 3 语音模型声称多项全球第一

StepZen 推出 StepAudio 3 系列,承诺在语音 AI 领域取得突破

9 月 15 日,StepZen 推出了其新的 StepAudio 3 系列语音大模型,这是一组针对不同音频任务的五款产品。该系列包括 StepAudio3Realtime、StepAudio3ASR、StepAudio3TTS、StepAudio3Gen 和 StepAudio3Music。据该公司称,其中几款模型已在权威的 Artificial Analysis 排行榜上占据首位。所有五款模型现已在 StepZen 开放平台上提供。

该系列针对五个核心场景:逼真的语音生成、全面的音频内容创作、实时语音交互、复杂的语音理解和音乐创作。

实时对话获得重大升级

StepAudio3Realtime 专为全双工、原生实时对话而构建。它在 Artificial Analysis 对话动态排名中得分 98.9%,位居全球第一,并以 99.7% 的准确率在语音推理排名中名列前茅。该模型可以处理打断、持续反馈,并且不仅理解词语,还理解语气、情感、副语言和背景声音。它并行运行推理和语音生成,并异步管理工具调用和长任务,因此对话不会停滞。

超越转录的语音识别

StepAudio3ASR 将高精度语音识别与大语言模型的推理能力相结合。它处理中文、英文、方言、混合语言、长音频以及医学、法律、金融、汽车和编程等专业领域。即使是棘手的输入——低音量、快速语音、发音不清、唱歌或背景音乐——也不在话下。其非流式词错误率仅为 1.7%,并列全球第一。

听起来像人类的语音生成

StepAudio3TTS 专为实时交互中的逼真语音生成而设计。它模仿自然的语音模式,包括语调、节奏和停顿。它可以再现笑声、犹豫、口吃、重复和自我纠正,甚至根据上下文调整情感语气。流式架构允许生成和播放同时进行。

一次性音频内容创作

StepAudio3Gen 简化了音频制作。用户无需进行漫长的录制、编辑和混音链,只需提供自然语言描述和参考音频。然后,该模型一次性生成人声、音效、环境声和背景音乐。它提供对角色声音、说话风格、情感、方言和笑声的精细控制,并可以指定对话、效果和音乐的时间与顺序,本质上充当整个作品的音效设计师。

音乐创作变得触手可及

StepAudio3Music 支持零样本生成和使用 ABC 记谱法的多轮交互创作。用户可以输入歌词、无伴奏合唱、参考歌曲或记谱,并通过自然语言控制流派、人声、旋律、节奏、乐器和情感。该模型深入理解歌曲结构、跨段落旋律发展和能量变化。在无伴奏合唱模式下,单个人声轨道可以自动生成和声、节奏、乐器和完整编曲——进入真正的音乐制作领域。

关键要点

  • StepZen 的 StepAudio 3 系列包括五款模型,分别用于实时对话、语音识别、语音生成、音频内容创作和音乐。
  • StepAudio3Realtime 和 StepAudio3ASR 在 Artificial Analysis 排行榜上均位列全球第一。
  • 这些模型现已在 StepZen 开放平台上提供。
  • 它们旨在使语音交互更自然,音频制作更易于使用。