我可以帮您推荐合适的AI工具,有什么需要帮忙的吗?
语音AI厂商Gradium AI于近期发布新一代默认文本转语音(TTS)模型,该模型在行业通用的高难度测试用例集上通过率达81.0%,首音频生成时延(TTFA)仅216毫秒,两项核心指标均优于当前市场主流竞品Cartesia、ElevenLabs的同类型产品,有望重构实时语音交互场景的技术选型标准。

过去两年,TTS技术的落地边界不断拓宽,已经覆盖AI语音助手、数字人直播、实时同传、有声内容生成等多个场景。但行业始终面临一个共性难题:如果要保障复杂场景下的发音准确率、情感自然度,往往需要更长的推理时间,导致首句响应时延超过500毫秒,用户能明显感知到卡顿;如果优先压缩时延,又会导致生僻词、多语种混读、多音字歧义等“硬场景”下的错误率飙升,不少虚拟主播、AI客服频频出现读错专业术语、语气违和的翻车事故。
Gradium AI本次发布的新模型,直接瞄准了“效果和时延不可兼得”的行业痛点。官方披露的测试数据显示,该模型在包含生僻词、跨语种混排、情感标注、歧义多音字的行业通用硬案例测试集上,通过率达到81.0%,而此前Cartesia、ElevenLabs等头部厂商的同类型商用模型,硬案例通过率普遍在72%-78%区间。
同时该模型的首音频生成时延仅为216毫秒,比行业平均300毫秒以上的水平低了近30%,远低于人类正常对话感知卡顿的300毫秒阈值。这也是全球范围内首次有商用TTS模型,同时在效果上限和响应速度两个核心指标上做到行业顶尖水平,打破了此前TTS技术“偏科”的行业现状。
目前Gradium AI已经将该模型设为平台默认调用的TTS模型,开发者无需额外申请即可接入使用。对于实时交互场景来说,双指标的同步提升意味着用户体验的大幅升级:AI客服应对包含专业术语的用户咨询时,既能准确发音又不会出现明显停顿,实时同传场景下的语音输出可以做到和原说话人节奏基本同步,虚拟主播也能适配更复杂的直播台词,减少翻车概率。
据了解,Gradium AI后续还将开放该模型的行业微调接口,支持医疗、法律、金融等专业领域的术语库定制,进一步降低垂直场景的硬案例错误率。随着该模型的普及,实时语音交互的行业体验标准有望被拉升到新的水平。
AI创作导航,创作与探索并重。聚合全球优质AI工具,覆盖短视频、图文、写作、设计等创作场景,以及办公、学习、编程、生活等全品类需求。从创作出发,探索AI的无限可能,为创作者、学生、教师、职场人提供一站式AI工具导航与场景化应用指南。