问小创
告诉我你的需求,我帮你从站内挑最合适的 AI 工具。
当地时间2026年6月24日,AI企业Gradium正式推出两款实时语音翻译模型stt-translate与s2s-translate,支持5种主流语言的互译场景。实测显示,两款模型的翻译精度、响应延迟两项核心指标均优于OpenAI旗下gpt-realtime-translate,为跨境沟通、实时字幕等场景提供了更具竞争力的技术选择。

过去几年实时语音翻译一直是AI落地的热门赛道,跨境会议、直播同传、多语言社交等场景的需求持续暴涨,但行业长期面临“精度够就延迟高,延迟低就错漏多”的两难困境。此前OpenAI推出的gpt-realtime-translate一度被认为是行业标杆,大部分玩家的产品都难以在两项核心指标上同时实现超越。
此次Gradium推出的两款模型定位清晰,stt-translate主打语音转文字的实时翻译,可直接应用于直播实时字幕、会议记录转译等场景;s2s-translate则支持端到端的语音转语音翻译,能够为跨境通话、同传设备提供技术支持,两款产品均覆盖中、英、西、法、阿五种全球使用人数最多的主流语言。
根据官方公布的实测数据,两款模型的翻译准确率较gpt-realtime-translate高出4.2%,平均响应延迟缩短27%,在有口音、背景噪音的复杂场景下,性能优势更为明显。Gradium研发团队透露,产品突破的核心在于采用了端到端的轻量化模型架构,跳过了传统语音翻译“语音识别-文本翻译-语音合成”的三步流程,直接在语音特征层完成语义转译,既减少了多步流程带来的误差累积,也大幅压缩了处理耗时。
据了解,Gradium此次发布的两款模型均对外开放商用API调用接口,定价较GPT同类产品低30%左右,进一步降低了中小开发者的接入门槛。
业内分析认为,这两款产品的落地有望打破海外巨头在实时语音翻译赛道的技术垄断,推动实时同传、多语言直播、跨境客服等场景的普适性落地,未来Gradium还计划在年内把支持语言扩展到20种以上,覆盖更多小众语系的使用需求。
AI创作导航,创作与探索并重。聚合全球优质AI工具,覆盖短视频、图文、写作、设计等创作场景,以及办公、学习、编程、生活等全品类需求。从创作出发,探索AI的无限可能,为创作者、学生、教师、职场人提供一站式AI工具导航与场景化应用指南。