Google发布Gemini 3.5 Transcribe语音转文字模型,流式词错误率4.0%,支持85种语言
本文是 24TopNews 对公开财经信息完成重复合并后的事件分析,不是原始采访或证券推荐。
Google近日发布Gemini系列最新语音转文字模型Gemini 3.5 Transcribe,面向开发者、企业及普通用户开放。该模型重点提升嘈杂环境、复杂专业术语及自然口语表达下的转写能力,并已应用于macOS平台Gemini应用及Android平台Gboard键盘的Rambler功能。开发者可借助该模型构建语音智能体、实时字幕工具及通话后分析流程等应用。
新模型加入多项优化功能,包括自动自我修正、删除“嗯”“啊”等口语填充词,以及对输出文本进行自动格式化。它还能将文件分析、图像生成等复杂任务委派给其他Gemini模型处理,形成多模型协作体验。在准确率方面,Gemini 3.5 Transcribe在流式语音识别场景中的平均词错误率为4.0%,在非流式场景中可降至2.6%。该模型在噪声较多环境中具备更好的转写表现,并能更准确识别订单编号、邮政编码等由字母和数字组成的关键信息。
语言支持方面,Gemini 3.5 Transcribe覆盖85种语言,支持地区口音和不同方言。对于预先录制的音频,它可为最多三名说话者进行带时间戳的语音归属识别。模型还能适应用户自定义词汇表,识别专业术语、特殊拼写及行业专有名称。开发者可通过Google AI Studio和Google Antigravity中的Gemini API,以公开预览形式使用该模型。普通用户可在Android和macOS平台体验相关功能,Google计划将其引入Chrome浏览器,届时用户可在任意网页输入框中直接通过语音输入文字。
近期,Google持续加快Gemini产品线推进。公司此前推出Gemini 3.7 Flash,加入AI模型价格竞争。Gemini in Chrome for Android已向美国所有用户开放,Gemini助手也进入Waymo新一代自动驾驶出租车。