谷歌发布Gemini 3.8 Live和Gemini 3.8 Live Extended Thinking实时音频模型,支持97种语言与异步工具调用,后者语音质量指数得分82.6,已通过API和AI Studio开放
本文是 24TopNews 对公开财经信息完成重复合并后的事件分析,不是原始采访或证券推荐。
2026年9月15日,谷歌发布Gemini 3.8 Live和Gemini 3.8 Live Extended Thinking两款实时音频模型。两款模型均为原生端到端语音模型,可在对话不中断的情况下调用工具、处理视觉信息和执行复杂任务。谷歌公布的信息显示,Gemini 3.8 Live支持实时视觉上下文和多语言对话,Gemini 3.8 Live Extended Thinking增加深度推理能力,在用户继续交流的同时于后台完成多步骤任务。
Gemini 3.8 Live支持97种语言,能够在对话过程中自动识别并切换语言,同时保持一致的语音表现。谷歌AI Studio软件主管Logan Kilpatrick表示,新模型支持97种语言,并加入异步工具调用等能力。该模型可在保持连续对话的同时,在后台异步执行工具和API调用;用户无需等待任务完成后再继续说话,模型可一边继续交流,一边让相关任务在后台运行,任务完成后再将结果融入当前对话。该模型还支持实时视觉上下文,用户可通过声音提问,并让模型理解正在看到的内容。谷歌展示的场景包括实时员工培训、故障排查以及让AI通过视觉信息参与棋局。谷歌表示,新模型加强了对字母数字信息的处理,包括确认码、索赔编号和技术数据。
开发者通过Live API调用时,音频输入价格为每分钟0.005美元,音频输出为每分钟0.018美元。
Gemini 3.8 Live Extended Thinking可在保持实时对话的情况下进行更深层推理,具备“边说边想”的后台扩展推理能力。模型可通过“让我查一下”等语音提示告知用户已开始处理任务,并在后台执行多步骤任务,同时维持前台对话。谷歌展示的案例包括通过异步函数调用完成多步骤预订、根据用户语音和草图实时生成React组件,以及通过自然语言完成商业计划和营销工具包的制作。
谷歌公布的数据显示,Gemini 3.8 Live Extended Thinking在Artificial Analysis的Speech to Speech Quality Index中排名第一,得分82.6;在τ-Voice智能体任务测试中完成率为68.6%,在Sierra的τ-Voice-banking测试中为35.1%;在Big Bench Audio测试中得分97.7%。普通版Gemini 3.8 Live在Speech Agent Arena中排名第二。
Gemini 3.8 Live Extended Thinking还被引入Google Workspace,可用于Docs、Gmail和Keep等产品。谷歌表示,其AI产品生成的音频均会加入SynthID不可见水印,该水印直接嵌入音频输出,用于识别AI生成内容。