跳转到主要内容

Qwen3.8-LiveTranslate 将实时翻译延迟降至 2.3 秒

Qwen3.8-LiveTranslate 将实时翻译延迟降至 2.3 秒

想象一下观看一场国际直播,演讲者的话语几乎即时地以你的语言流入你的耳朵——而且是用他们自己的声音。这就是阿里巴巴最新实时翻译模型 Qwen3.8-LiveTranslate 的承诺,它刚刚获得了一次重大升级。

新版本解决了四个关键领域:翻译质量、延迟、说话人识别和语音合成。在底层,它使用了一种 音频-文本交错架构,将流式理解、文本输出和语音生成合并为一个单一的因果序列。结果如何?平均延迟从上一代的 2.8 秒降至 2.3 秒——当你试图跟上快节奏的对话时,这是一个明显的改进。

Image

三个新技巧让它感觉像真人

首先,实时说话人分离 在多人的交流中清晰地识别出谁在说话。更棒的是,翻译后的语音保留了原始说话人的音色,所以你听到的是同一个人,只是换了一种语言。其次,该模型同时显示源文本和目标文本——如果你想核对某个短语或边听边学,这会很方便。第三,长上下文消歧 利用跨轮次上下文来解决专有名词和代词带来的歧义,减少那些尴尬的误译。

Image

内部机制:Thinker 和 Talker

该模型依赖于 混合 MoE Thinker–Talker 双模块设计。Thinker 负责理解和翻译,而 Talker 则用原始音色生成翻译后的语音。在 Omnilingua-MSpeaker 多说话人长音频评估集上——覆盖 14 个语言方向——该模型在翻译保真度、流畅度、简洁度和说话人分离错误率方面均优于当前主流的实时翻译系统。

目前,Qwen3.8-LiveTranslate 支持 60 种语言,并且 API 已在 Qwen AI 平台上提供。团队表示,下一步将专注于进一步降低端到端延迟、增加跨对话长期记忆以及扩展语言支持。

那么,这对普通用户意味着什么?如果你曾经被那些听起来像机器人的笨拙翻译工具困扰过,这次升级让我们更接近跨语言的无缝、自然交流。它还不完美,但这是朝着实时打破语言障碍迈出的一大步。

关键要点

  • 延迟从上一代的 2.8 秒降至 2.3 秒
  • 实时说话人分离 识别谁在说话,并在翻译中保留其音色。
  • 同时显示源文本和目标文本,便于核对。
  • 长上下文消歧 减少专有名词和代词带来的错误。
  • 混合 MoE Thinker–Talker 设计 为理解、翻译和语音合成提供支持。
  • 支持 60 种语言;API 现已在 Qwen AI 平台上提供。
  • 下一步: 更低延迟、跨对话记忆和更多语言。