当地时间8月26日,谷歌发布最新语音转文本模型Gemini 3.5 Transcribe,该模型不仅主打更高的识别准确率,更将能力边界从逐字记录延伸至理解说话人意图并自动整理输出结果,标志着语音识别技术向更深层的语言理解迈进。
与传统语音识别工具不同,Gemini 3.5 Transcribe能够识别说话人的自我修正、自动删除口头禅,并直接将非结构化口语转换为格式化文本。
谷歌称其为迄今"最精准"的语音转文本模型,并已将其引入Android版Gboard及Mac版Gemini应用,同时通过Gemini API向开发者开放预览。
此次发布与Gemini 3.5 Live及Gemini 3.5 Live Experimental同日推出,共同构成谷歌新的Gemini Audio系列。
分析人士指出,随着语音入口加速渗透谷歌旗下Chrome、Gboard等高频产品,语音交互有望逐步替代键盘输入,成为用户与AI系统的主要连接方式。
截至发稿,谷歌股价周四盘中下跌1.37%。

从"逐字记录"到"意图理解"
Gemini 3.5 Transcribe的核心升级在于对自然语言的语境理解能力。分析指出,此次发布的关键不仅是提升传统意义上的识别准确率,而是让模型能够在转录过程中理解说话人意图,并对原始语音进行"编辑"。
具体而言,当用户说出"周二——不,周三见面"时,模型可识别出这是一次自我修正,而非将两种表述全部记录下来。
与此同时,模型会自动删除"um""uh"等口头禅,并完成标点符号和文本格式的整理。该模型能够将凌乱、非结构化的口述内容直接转化为格式化文本。
在语言覆盖方面,该模型支持超过85种语言,具备自动语言识别能力,并能处理多语言混说场景。谷歌还允许用户添加自定义词汇,使模型更准确地识别专业术语、特殊拼写及订单号、邮编等字母数字组合。对于预录音频,模型还支持说话人识别和逐词时间戳。
开发者接口与产品落地双线推进
在面向开发者的能力开放层面,Gemini 3.5 Transcribe已通过Gemini API进入预览阶段,支持实时语音流与录制音频文件两种处理场景。
据谷歌官方文档,文件转录最长支持1小时,实时转录则面向低延迟应用场景。开发者可调用低延迟转录、自定义词汇及智能格式化等功能,将语音识别能力嵌入自有应用。
在产品端,Gemini 3.5 Transcribe已落地Android平台的Gboard Rambler语音输入功能及Mac版Gemini应用。
谷歌还计划将其引入Chrome浏览器,届时用户可在网页文本输入框内直接通过语音输入内容,涵盖回复消息、撰写帖子及向Gemini发出指令等场景。
语音入口之争背后的商业逻辑
此次发布是谷歌系统性推进Gemini"语音入口"战略的组成部分。
谷歌正将Gemini的能力从文本和图像进一步延伸至实时对话、语音翻译和语音输入等场景,Gemini 3.5 Transcribe、Gemini 3.5 Live及Gemini 3.5 Live Experimental共同构成其Gemini Audio系列。
从商业化视角看,语音转文本正从单纯的后台基础能力演变为AI应用的重要交互入口。随着模型具备"听懂—理解—整理—执行"的一体化能力,用户与AI的交互方式有望从键盘输入向语音指令转移。
对谷歌而言,将Gemini 3.5 Transcribe嵌入Chrome、Gboard、Docs、Gmail等高频产品,有望进一步扩大Gemini在日常生产力场景中的渗透深度,并在语音交互这一新兴入口上巩固其竞争地位。




