跳转到主要内容

StepAudio3:五款新语音模型登顶全球排行榜

StepAudio3 系列:五款模型,语音 AI 的巨大飞跃

StepZenith 揭晓了其最新创新:StepAudio3 系列,一套包含五款音频模型的套件,已在 AI 社区掀起波澜。这些模型在 StepZenith 开放平台发布,涵盖从类人语音生成到实时交互的一切,它们不仅令人印象深刻——更是破纪录的。

认识这些模型

StepAudio3Realtime 以原生全双工实时对话领先群雄。它不仅能听到词语;还能理解语义、语调、情感,甚至背景声音。它可以同时推理和生成语音,处理工具调用,并异步处理长任务。在 Artificial Analysis 对话动态排名中,它获得了惊人的 98.9%,位居全球第一。其语音推理准确率?近乎完美的 99.7%,同样排名第一。

然后是 StepAudio3ASR,它将语音识别与大模型上下文理解相结合。它处理中文、英文、方言、混合语言、长音频以及医疗、法律和金融等专业领域——词错误率仅为 1.7%,并列全球第一。

StepAudio3TTS 将语音合成提升了一个档次。它捕捉声调、语调、节奏、停顿,甚至笑声、犹豫和口吃等副语言。此外,它支持流式生成,非常适合实时交互。

但等等,还有更多。StepAudio3Gen 可以一次性生成角色声音、音效、环境音和背景音乐。它甚至支持多角色对话和语音时序控制。对于音乐人来说,StepAudio3Music 让你使用 ABC 记谱法创作歌曲、无伴奏合唱、翻唱和多轮作曲。你可以用自然语言控制风格、旋律、节奏、乐器和情感。

Image

为何重要

StepAudio3 系列不仅仅是渐进式改进。它是从单一功能语音模型到完整音频内容制作和实时智能交互的飞跃。无论你是在构建虚拟助手、创建沉浸式音频体验,还是作曲,这些模型都旨在处理一切。

StepZenith 的举动标志着语音 AI 的新时代——在这个时代,机器不仅能识别或生成语音,还能以感觉非常人性化的方式理解和交互世界。

Image

关键要点

  • 发布五款模型: StepAudio3Realtime、StepAudio3ASR、StepAudio3TTS、StepAudio3Gen 和 StepAudio3Music。
  • 全球排名领先: Realtime 和 ASR 模型在 Artificial Analysis 的对话动态和语音推理中排名第一。
  • 多功能能力: 从实时对话到音乐创作,该系列涵盖广泛的音频任务。
  • 高准确率: ASR 达到 1.7% 的 WER,而 Realtime 的语音推理准确率达到 99.7%。
  • 现已可用: 所有模型均在 StepZenith 开放平台上。