谷歌将文本转语音并入Gemini模型家族:Flash TTS主打创意场景,轻量版瞄准实时语音

谷歌推出Gemini 3.8 Flash TTS和Flash-Lite TTS两款文本转语音模型,支持超过100种语言,可自定义声音、复制声音并控制语气、节奏和情绪;前者在声音设计基准测试中排名第一,后者主攻低成本实时场景。据谷歌8月披露,Gemini月活已破10亿,其中63%用户以语音交互为主。

谷歌正将文本转语音能力从独立功能收编进Gemini统一模型体系,以"模型化+生态整合"的方式重新定义AI语音竞争的边界。

周三,谷歌发布Gemini 3.8 Flash TTS与Gemini 3.8 Flash-Lite TTS两款文本转语音模型,前者主打声音设计与创意场景,后者针对大规模、低成本应用进行优化。

此次发布使语音合成正式进入与文本、多模态并列的Gemini模型序列,"听—想—说"的语音闭环由此在Gemini体系内完成。

对投资者而言,此次更新的核心信号并非两款模型本身的参数表现,而是谷歌将语音能力深度整合进Gemini生态的战略意图。

谷歌上个月披露,Gemini月活跃用户已突破10亿,其中63%选择直接通过语音与Gemini交互——在这一以语音为基本盘的生态中,TTS能力的成本与规模化覆盖能力,直接关乎语音入口能否持续扩大。

谷歌周三收跌3.6%。

主力与轻量双线并进,延续"Flash双发"惯例

Gemini 3.8 Flash TTS与Flash-Lite TTS同属Gemini 3.8 Flash序列,但定位有所分工。

Flash TTS面向创意与高表现力场景,支持有声书、播客、游戏角色和互动媒体等应用,用户可通过自然语言提示词从零设计声音,包括角色设定、口音与声音特征,并支持根据约30秒音频样本复制声音。

该模型在Hume AI的Voice Design Benchmark中取得71.4分,在声音设计综合指标中排名第一;Flash TTS与Flash-Lite TTS在Hume AI Overall Quality Index中分别位列第一和第二。

Flash-Lite TTS则主攻大规模、低成本的语音生成,应用场景包括内容配音、音频制作以及实时语音代理,指向对响应速度与单位调用成本高度敏感的实时交互场景。

"主力+轻量"的搭配并非谷歌首次采用。此前谷歌已发布Gemini 3.5 Flash-Lite,并于7月推出Gemini 3.6 Flash。将TTS纳入同一命名与迭代节奏,意味着语音合成与文本模型共享发布管线,不再作为孤立功能单独维护。

语音已成Gemini最主流交互方式,TTS补齐出口环节

谷歌将TTS纳入Gemini体系,背后有明确的用户行为数据支撑。

Gemini已是谷歌增速最快的产品,月活跃用户突破10亿。谷歌披露,63%的用户选择直接通过语音与Gemini交互,纯语音用户占比持续上升。语音由此从辅助入口演变为Gemini与用户之间最主要的触达方式。

在此背景下,TTS作为语音交互"出口"的另一半,其成本结构与覆盖能力直接影响整套交互体验能否在更大规模上维持。此前谷歌已具备语音识别与生成能力,此番补齐TTS,使语音闭环在Gemini体系内正式完整。

两款模型在语言覆盖上同样提供差异化支持:Flash TTS支持130种语言,Flash-Lite TTS支持101种语言,均涵盖墨西哥西班牙语、魁北克法语和苏格兰英语等地区性语言变体,谷歌目前提供超过2000种可直接使用的声音。

声音"设计"与"表演":从固定音色向可定制角色扩展

此次更新的产品逻辑,不止于提升语音合成的自然度,而是试图将语音生成从固定音色选择,扩展为可定制的角色、场景与多角色对话。

两款模型均支持对每一句台词进行单独控制,用户可通过脚本指令调整语气、节奏、情绪与停顿。

模型还支持双人对话,并能在同一脚本中保持不同角色的声音区分,同时可生成笑声、叹气等非语言声音,以及对话中的语气回应,以使生成语音更接近真实交流。

在声音复制功能上,谷歌表示进行声音复制时需获得声音所有者同意并通过相应验证机制,生成音频将嵌入不可感知的SynthID水印,以帮助识别AI生成的语音内容。

竞争焦点转向成本与生态,而非单一语音质量

AI语音赛道上,OpenAI、亚马逊等厂商均已布局语音合成方案。谷歌此次的关键差异,在于将TTS纳入Gemini统一品牌,使其与文本理解、推理、多模态能力在同一生态内协同,而非作为独立API单品推出。

这一选择将竞争维度从单一语音合成产品的质量对比,推向更综合的层面:谁能在完整语音交互链路上以更低成本提供实时可用的体验。

轻量版Flash-Lite TTS的推出,意味着谷歌可在可控成本下将实时语音能力下沉至车载系统、IoT设备等此前大参数模型难以覆盖的终端场景。

目前,两款模型均已通过Gemini API和Google AI Studio向开发者开放。Flash TTS还可用于Gemini Notebook,Flash-Lite TTS已接入Google Vids,面向企业的Gemini Enterprise API支持将于后续推出。

相关文章