问小创
告诉我你的需求,我帮你从站内挑最合适的 AI 工具。
2026年8月27日,谷歌正式推出Gemini系列全新语音转文字模型Gemini 3.5 Transcribe,定位为该系列迄今识别精度最高的语音识别产品,针对嘈杂环境噪声、专业领域术语、自然口语表达等长期存在的行业痛点做了专项优化,目前已率先落地谷歌旗下C端应用,同时面向开发者、企业及普通用户全面开放。

从谷歌公开的测试结果来看,Gemini 3.5 Transcribe在60分贝的嘈杂公共场所场景下,识别准确率相比上一代同类型产品提升了37%,即便是多人同时交谈的混杂场景,也能精准锁定目标声源的语音内容,大幅降低了后期人工校正的时间成本。
长期以来,语音转文字技术的落地一直受限于场景适配能力不足的问题:普通消费级产品大多只能在安静环境下保持较高准确率,一旦进入地铁、咖啡馆、办公开放区等有背景噪声的场景,错漏率就会大幅上升;而面向垂直行业的专用模型,不仅训练成本高,泛化能力也普遍偏弱,遇到跨领域的专业术语或者口语化的省略表达、口音变体,识别效果往往不达预期。无论是普通用户记录会议、采访,还是企业做客服质检、内容生产,都长期被这些问题困扰。
作为谷歌Gemini系列语音技术的最新迭代,Gemini 3.5 Transcribe首次实现了消费级模型的全场景高精度覆盖。一方面,模型新增的噪声过滤模块能够动态识别并过滤环境中的非人声信号,即便是在有背景音乐、交通工具轰鸣的场景下,也能清晰提取说话人的语音内容;另一方面,模型训练时加入了覆盖200余个细分行业的专业语料库,对医疗、法律、科技等领域的复杂术语识别准确率提升超过50%。
目前该模型已经率先完成了谷歌旗下C端产品的适配:macOS平台的Gemini应用语音输入功能、Android平台Gboard键盘的Rambler功能,在升级后识别错误率下降超过40%。对于开发者群体,谷歌也开放了对应的API接口,开发者可以快速基于该模型搭建语音智能体、实时字幕工具、通话后自动分析系统等应用,大幅降低语音交互产品的开发门槛。
随着大模型多模态能力的持续迭代,语音作为最符合人类使用习惯的交互方式,此前一直受限于识别精度的天花板,难以在复杂场景大规模落地。Gemini 3.5 Transcribe的推出,相当于把高精度语音转写的调用成本降到了普通开发者和中小企业也能承受的区间,除了常见的会议记录、客服质检等场景,未来还可以延伸到无障碍实时字幕、智能家居语音控制、跨境实时翻译等更多领域。
据了解,谷歌后续还计划将该模型的能力整合到Google Meet、YouTube等更多生态产品中,进一步提升全系产品的语音交互体验。
本文基于公开信息分析整理,仅供参考。更多AI工具动态与行业解读,请持续关注本站更新。