AI 问小创

你好,我是问小创 AI 助手

告诉我你的需求,我帮你从站内挑最合适的 AI 工具。

推荐结果基于站内收录,仅供参考,请以实际工具信息为准。
猜你想问
推荐一些AI写作工具 有什么AI绘画工具? 推荐视频剪辑AI工具
AI
问小创: 告诉我你的需求,我帮你从站内挑最合适的 AI 工具。

谷歌发布Gemini 3.5实时翻译模型 覆盖70余种语言可还原语音特征

2026年6月9日谷歌正式发布Gemini 3.5实时翻译模型,作为其在语音到语音翻译领域的最新成果,该模型支持全球70余种语言自动识别,可在保障翻译准确率的前提下同步还原说话者的语调、语速、音高等特征,目前已进入落地阶段,将为多场景跨语言即时沟通提供全新解决方案。

配图

对于经常参与跨国会议、跨境出行的人群来说,传统翻译工具的使用痛点始终存在:语音转文字的延迟经常打断对话节奏,机械的电子音无法传递说话者的情绪,遇上小语种更是经常出现识别错误,这些问题都极大限制了跨语言交流的效率。

随着全球跨境流动恢复,跨语言交流的需求正在快速攀升:2025年全球国际出行人次恢复至疫情前的121%,超过4成企业采用跨国远程办公模式,跨境电商实时客服需求年增速达62%。但传统翻译工具的短板十分明显:文字翻译无法应对实时对话场景,普通语音翻译延迟高、准确率不足,且机械的电子音经常丢失说话者的情绪信息,容易造成沟通误会,而专业同传服务成本高昂,普通中小商家和个人消费者根本无力承担。

本次推出的Gemini 3.5实时翻译模型,是谷歌在语音交互领域的最新研发成果,核心能力相比前代产品有了质的提升。首先是语言覆盖范围大幅扩展,支持70余种语言自动识别,覆盖全球95%以上的使用人口,其中包含十多种此前少有翻译工具支持的小众语种,满足了更多场景的使用需求。

区别于传统翻译工具“语音转文字-文字翻译-文字转语音”的三步处理流程,Gemini 3.5采用了端到端语音到语音翻译架构,直接实现输入语音到输出翻译语音的处理,将日常对话场景下的翻译延迟控制在300毫秒以内,几乎和正常对话的反应速度一致,完全不会打断交流节奏。

该模型最大的亮点在于其超强的语音感知与还原能力:在翻译过程中,模型可以精准捕捉说话者的语调、语速、音高甚至停顿习惯,翻译输出的语音会同步还原这些特征,甚至可以传递出说话者的情绪起伏,让跨语言交流不再是生硬的内容转译,更接近带有人情味的真实对话。

目前Gemini 3.5实时翻译模型已经进入正式落地阶段,谷歌正在优先将其集成到Google Meet的跨国会议实时翻译功能中,面向企业用户的API服务预计将于2026年第三季度正式上线,后续还将逐步开放给谷歌翻译APP的个人用户。

据了解,谷歌还在和多家智能硬件厂商对接,未来这项翻译能力将逐步适配无线智能耳机、车载智能系统、便携翻译机等多个终端,普通消费者最快今年下半年就能在日常场景中体验到这项功能。行业人士预计,随着这类高水准实时翻译技术的普及,跨语言交流的门槛将大幅降低,全球不同地区人群的沟通效率也将迎来质的提升。

本文基于公开信息分析整理,仅供参考。更多AI工具动态与行业解读,请持续关注本站更新。