近日,谷歌发布了关于全球语言智能的最新技术成果,宣布其各项 AI 技术与产品已能够支持超过300种语言、覆盖全球71亿人口及86% 的人口比例。谷歌表示,真正的语言大模型不仅要完成简单的文本翻译,更要深入理解人类在真实世界中充满语气、情感与文化细微差别的交流方式。

在技术架构上,传统的语音识别通常采用将音频转为文本、处理文本再转回音频的多步刚性管线,这会剥离掉人类对话中至关重要的语调、节奏、情感与上下文。为了还原真实的交流质感,谷歌推动了向原生音频智能的跃迁,让诸如 Gemini 等模型能够直接处理和理解音频本身。

image.png

其中,Gemini3.5Live Translate 实现了跨70种语言、2000多个语言对的实时口语翻译,并自然捕捉语码转换和情感线索;Gemini3.5Transcribe 作为高精度语音转文本模型,可在嘈杂环境或复杂专业术语下输出规整文本,同时它也赋能了安卓键盘 Gboard 上的 Rambler 功能,支持去除口语赘词、修正语法并用语音指令直接进行重写与跨语种无缝切换。

为了将 AI 的能力延伸至全球更多低资源语种,谷歌正式推进了“1,000种语言计划”,旨在支持全球使用最广泛的1000种语言。在此背景下,依托1200万小时音频训练而成的通用语音模型(USM)利用跨语言迁移学习技术,将高资源语言中学到的模式应用到训练数据稀缺的语种中。这些研究建立在过去25年开放研究和400多篇同行评审语音论文的基础之上。

在语言数据的采集上,由于互联网内容天然偏向少数主导语种,谷歌放弃了传统的单一爬取模式,转而通过在地基层的开源数据合作来获取真实的文化语境。

其中包括与多个机构合作打造、覆盖27种撒哈拉以南非洲语言的 WAXAL 大规模开源语音数据集;与印度科学研究所及 Bhashini 合作、采用区域锚定方式收集了109种语言超3万小时语音的“瓦尼计划”(Project Vaani);以及汇聚全球四大洲1600多名本地专家与20所大学共同贡献多模态数据点的“放大计划”(Amplify Initiative)。

此外,谷歌还推出了互动式语言探索工具 Language Explorer,用于持续可视化映射全球超过7000种语言的 LinguaMeta 数据仓库。这些技术成果正通过数字语言包容中心等公益项目赋能全球的农民、医护人员与教师。

针对全球仍有超过30亿人无法获得稳定互联网连接的现实痛点,谷歌打造了 TranslateGemma 轻量级开源翻译模型家族。该系列模型针对55种语言在端侧设备上高效运行,无需连接云端即可实现高质量翻译。同时,针对低资源地区广泛使用功能机的群体,谷歌通过支持 Viamo 等机构在卢旺达试点推出“询问 Viamo 任何事”(AVA)语音人工智能助手,借助 Gemini 模型已成功为功能机用户解答了超过200万个问题。

在无障碍设计与文化地标发音的细节打磨上,传统工具往往迫使非标准发音人群去适应技术。谷歌通过从头设计无障碍交互,推出了基于50多种手语训练、支持美式手语转英文的“手语转文本”(SL2T)技术,赋能 Gboard 与 Pixel11的实时转录。同时,谷歌深入新西兰与毛利语专家合作,优化了地图中地名与街道的本地化发音,将真正地道的文化语境与准确读音内嵌至文本转语音模型中。

历经20年的 AI 语言研发,谷歌的语言技术已深度嵌入搜索、安卓、Chrome、YouTube 和谷歌 Play 等九大核心平台。谷歌强调,技术的核心意义绝不是削减人类表达的多样性,而是拓展表达的边界,在尊重地方文化与真实语境的前提下,帮助更多人以自己的方式参与、表达并被世界理解。