跳转到主要内容

谷歌AI现已支持300多种语言,覆盖71亿人

谷歌的大语言推进:300多种语言,71亿人

谷歌最近公布了其全球语言智能的重大更新:其AI现在支持300多种语言,覆盖71亿人——约占全球人口的86%。但该公司表示,真正的语言AI不应只是翻译文字。它需要理解语气、情感和文化微妙之处,这些才是人类对话真实的原因。

从机械管道到原生音频

传统的语音识别通常遵循僵化的多步骤流程:音频转文本,文本处理,然后再转回音频。这种方法剥离了语调、节奏和上下文。谷歌正在改变这一点,转向原生音频智能,让Gemini等模型直接处理声音。

Image

Gemini 3.5 Live Translate 支持70种语言和2000多种语言对的实时口语翻译,自然捕捉语码转换和情感线索。Gemini 3.5 Transcribe 提供高精度语音转文本,即使在嘈杂环境或复杂术语下也能胜任。它还为Gboard的Rambler功能提供支持,该功能可以去除填充词、纠正语法,并允许您通过语音命令重写——以及无缝语言切换。

触及未被听到的声音:1000种语言计划

为了将AI带给低资源语言,谷歌启动了1000种语言计划,旨在支持全球前1000种语言。通用语音模型(USM)1200万小时音频上训练,使用跨语言迁移学习,将高资源语言的模式应用于数据稀缺的语言。这建立在25年的开放研究和400多篇同行评审语音论文的基础上。

有文化根基的数据

互联网内容自然偏向主流语言,因此谷歌放弃了单一来源爬取。相反,它与当地合作获取真实的文化背景。例子包括:

  • WAXAL:一个大型开源语音数据集,涵盖27种撒哈拉以南非洲语言
  • Project Vaani:与印度科学研究所和Bhashini合作,收集了109种语言的超过30,000小时语音。
  • Amplify Initiative:从四大洲的1600多名本地专家20所大学收集多模态数据。

谷歌还推出了Language Explorer,这是一个交互式工具,可视化其包含7000多种语言LinguaMeta数据仓库。这些努力支持数字语言包容中心等公共项目,帮助农民、医护人员和教师。

离线和功能手机解决方案

由于仍有超过30亿人缺乏稳定互联网,谷歌开发了TranslateGemma——一个轻量级开源翻译模型系列,可在边缘设备上运行,支持55种语言,无需云。对于低资源地区的功能手机用户,谷歌与Viamo在卢旺达试点“Ask Viamo Anything”(AVA),使用Gemini回答了超过200万个问题

可访问性和文化尊重

传统工具通常迫使非标准使用者适应。谷歌从头设计可访问的交互,推出了手语转文本(SL2T)——在50多种手语上训练,支持美国手语到英语的转换。它为Gboard和Pixel 11上的实时转录提供支持。在新西兰,谷歌与毛利专家合作,优化了Maps中地名和街道的本地化发音,将真实的文化背景嵌入文本转语音。

关键要点

  • 谷歌的AI现在支持300多种语言,覆盖全球86%的人口
  • Gemini 3.5 Live Translate 实时处理70种语言2000多种语言对
  • 1000种语言计划USM(1200万小时音频)针对低资源语言。
  • 本地数据项目如WAXALProject VaaniAmplify确保文化真实性。
  • TranslateGemma在边缘设备上离线运行,支持55种语言AVA服务于功能手机用户。
  • SL2T支持50多种手语;与毛利合作改进了Maps发音。

经过20年的AI语言开发,谷歌的技术现已嵌入九个核心平台,包括Search、Android、Chrome、YouTube和Google Play。谷歌表示,目标不是减少人类表达,而是扩展它,帮助更多人参与、发声并被理解。