跳转到主要内容

Qwen3.8-LiveTranslate将翻译延迟降至每字符2.3秒

Qwen3.8-LiveTranslate:终于感觉像直播的实时翻译

你是否曾尝试通过口译员跟上现场演讲,却总感觉慢了一拍?阿里巴巴的Qwen团队刚刚将这个差距大大缩小。他们的新模型Qwen3.8-LiveTranslate将每个字符的平均延迟(LAAL)从2.8秒削减至2.3秒。半秒听起来可能不多,但在同声传译中,这是自然流畅与令人沮丧的延迟之间的区别。

不仅仅是速度

此次更新不仅仅是削减毫秒。该模型已支持60种语言,现在还增加了三个实用功能,使实时翻译真正可用。

首先,它处理实时说话人分离。不再需要猜测谁说了什么——每个句子都被分配给正确的人,语音复制也更加稳定。这意味着不再有串音或令人困惑的说话人切换。

其次,它同时显示原文和译文。你可以在听的同时阅读,这对于任何试图即时捕捉姓名、数字或技术术语的人来说都是救命稻草。

第三,它改进了长上下文消歧。该模型利用先前的上下文来理解当前所说的内容,这大大减少了专有名词和术语的错误——这些通常是现场翻译的绊脚石。

Image

内部机制:Thinker和Talker

该架构基于混合MoE设计,包含两个模块:Thinker和Talker。Thinker接收视频、音频、原文和翻译,将它们排列在一个因果序列中,并端到端生成结果。简单来说:它一次性理解和翻译。然后Talker接收翻译后的文本和原始音频,合成保留说话者自己声音的语音。所以你听到的不是通用的机器人声音——你听到的是实际说话者,只是用另一种语言。

Image

为什么重要

现场口译一直是在速度和准确性之间的权衡。你要么得到快速但粗糙的翻译,要么得到精确但来得太晚的翻译。Qwen3.8-LiveTranslate试图弥合这一差距。每个字符提高0.5秒,聆听体验变得更加流畅。而说话人分离和同步文本显示等功能解决了任何使用过实时翻译的人都会认识到的真正痛点。

对于开发者来说,这为将实时翻译构建到应用程序、会议和流媒体平台中开辟了新的可能性。对于普通用户来说,这意味着向跨语言无缝沟通又迈进了一步。

关键点

  • 延迟降低:从每字符2.8秒降至2.3秒——提高了0.5秒。
  • 支持60种语言,新功能包括:实时说话人分离、原文/译文同步显示以及改进的长上下文消歧。
  • 混合MoE架构,包含Thinker(理解+翻译)和Talker(语音合成)模块。
  • 语音保留:输出语音保留原始说话者的声音。
  • 实际影响:更流畅的现场口译,减少姓名和术语错误,并为开发者和最终用户提供更好的可用性。