谷歌把旗下Gemini模型的战场从文字和代码推进到了实时语音。
当地时间9月15日,谷歌宣布推出Gemini 3.8 Live和Gemini 3.8 Live Extended Thinking两款实时音频模型,并称这是其目前最先进的实时对话模型。两款模型不仅可以进行更加自然、流畅的语音交流,还能在对话不中断的情况下调用工具、处理视觉信息和执行复杂任务。
其中,Gemini 3.8 Live主打大规模、低成本的自然语音应用,支持实时视觉理解和多语言对话;Gemini 3.8 Live Extended Thinking则进一步加入深度推理能力,可以一边“思考”一边说话,在用户继续交流的同时于后台完成多步骤任务。谷歌表示,后者在Artificial Analysis的Speech to Speech Quality Index中排名第一,得分82.6。
这意味着,谷歌正在尝试让实时语音AI从此前的“语音版聊天机器人”,进一步变成能够听懂、思考、调用工具并把事情做完的语音智能体(Agent)。
从“语音聊天”到“边聊边办事”,实时音频能力大升级
Gemini 3.8 Live的核心变化,是让语音交互不再只是“你说一句、AI回答一句”。
谷歌表示,新模型可以在保持连续对话的同时,在后台异步执行工具和API调用。用户无需等待任务完成后再继续说话,模型可以一边继续交流,一边让相关任务在后台运行。
例如,在多步骤任务中,模型可以先回应用户,再在后台调用相关工具;任务完成后,再将结果融入当前对话。
这种能力尤其适合语音智能体。传统语音应用往往需要把语音识别、语言模型和语音合成多个环节串联起来,任何一个环节的延迟都会影响用户体验。谷歌此次则强调,Gemini 3.8 Live属于原生的speech-to-speech模型,可以直接围绕实时语音交互完成推理和任务执行。谷歌开发者博客称,这种架构能够减少传统“级联式”语音系统的复杂性。
与此同时,新模型支持实时视觉上下文。用户不仅可以通过声音提问,还可以让模型理解正在看到的内容,从而实现更具上下文的语音交互。谷歌展示的场景包括实时员工培训、故障排查以及让AI通过视觉信息参与棋局等。
97种语言无缝切换,瞄准全球化语音应用
多语言能力也是Gemini 3.8 Live的一大卖点。
谷歌表示,3.8 Live支持97种语言,并能够在对话过程中自动识别并切换语言,同时保持一致的语音表现。
谷歌AI Studio软件主管Logan Kilpatrick也表示,新模型支持97种语言,并加入异步工具调用等能力。
对于企业而言,这意味着开发者可以用一套模型构建覆盖不同市场的语音智能体,而无需针对不同语言分别设计复杂的语音处理系统。
谷歌开发者博客还特别强调了新模型对字母数字信息的处理能力,包括确认码、索赔编号和技术数据等。这类信息对于客服、金融、医疗和企业服务等语音场景尤其重要,因为传统语音系统往往容易在数字、字母和专业术语识别上出现错误。
价格方面,谷歌将Gemini 3.8 Live和3.8 Live Extended Thinking定位为具有竞争力的前沿模型。开发者通过Live API调用时,音频输入价格为每分钟0.005美元,音频输出为每分钟0.018美元。
Extended Thinking让AI“边说边想”,复杂任务也不必打断对话
如果说3.8 Live解决的是“如何让AI更自然地说话”,那么3.8 Live Extended Thinking解决的则是“如何让AI在说话的同时完成复杂工作”。
谷歌称,Extended Thinking可以在保持实时对话的情况下进行更深层次的推理。模型甚至可以通过“让我查一下……”之类的语音提示,让用户知道它已经开始处理任务,而不是陷入长时间的无声等待。
更重要的是,模型能够在后台执行多步骤任务,同时维持前台对话。
谷歌展示的案例包括:通过异步函数调用完成多步骤预订、根据用户的语音和草图实时生成React组件,以及直接通过自然语言完成商业计划和营销工具包的制作。
这实际上进一步强化了谷歌此前不断强调的Agentic路线——AI的价值不再只是给出答案,而是能够在理解用户意图之后,调用工具、处理信息并最终完成任务。
独立评测排名第一,3.8 Live瞄准生产级语音智能体
谷歌此次也拿出了第三方评测成绩为新模型背书。
根据谷歌披露的数据,Gemini 3.8 Live Extended Thinking在Artificial Analysis的Speech to Speech Quality Index中排名第一,得分82.6;在τ-Voice智能体任务测试中,完成率达到68.6%,在Sierra的τ-Voice-banking测试中达到35.1%;在Big Bench Audio测试中得分97.7%。

普通版Gemini 3.8 Live则在Speech Agent Arena中排名第二,同时强调成本效率和规模化部署能力。谷歌表示,这款模型尤其适合开发者和企业构建生产级语音智能体。
谷歌并没有将两款模型简单定位为消费者聊天产品,而是同时瞄准开发者和企业市场。
目前,两款模型均已经通过Gemini API和谷歌AI Studio向开发者开放;企业用户可以在Gemini Enterprise中参与私有预览。普通用户则可以通过Search Live和Gemini Live使用相关能力。
与此同时,Gemini 3.8 Live Extended Thinking还被引入Google Workspace,可用于Docs、Gmail和Keep等产品。
AI语音全面落地,但谷歌也强调“可检测”
随着生成式AI开始越来越多地进入语音通话、客服、搜索和办公场景,AI生成声音的透明度也成为谷歌此次发布中特别强调的一环。
谷歌表示,其所有AI产品生成的音频均会加入SynthID不可见水印。这一水印直接嵌入音频输出,帮助识别AI生成内容,并降低生成式AI被用于传播虚假信息的风险。
这也意味着,谷歌在推动语音AI进入更广泛生产环境的同时,试图同步解决“用户是否知道自己正在与AI交互、这段声音是否由AI生成”等问题。
从搜索到Workspace,再到开发者API和企业智能体平台,Gemini 3.8 Live的覆盖范围已经明显超越单纯的语音助手。
对于谷歌而言,这一轮升级的意义或许并不只是推出两款新的音频模型,而是进一步完善Gemini从文本、图像、视频、代码到实时语音的多模态能力,并将语音直接连接到工具调用和智能体执行。
换句话说,谷歌正在押注的下一阶段AI交互方式,可能不再是“打开一个聊天窗口提问”,而是像与真人同事交流一样说话,同时让AI在后台把事情做完。




