AI小创

您好,我是AI助手

我可以帮您推荐合适的AI工具,有什么需要帮忙的吗?

我会根据您的需求,智能推荐站内收录的AI工具
猜您想问
推荐一些AI写作工具 有什么AI绘画工具? 推荐视频剪辑AI工具
AI助手: 我可以帮您推荐合适的AI工具,有什么需要帮忙的吗?

Gradium AI发布新一代TTS模型 硬场景通过率达81%时延216ms

语音AI厂商Gradium AI于近期发布新一代默认文本转语音(TTS)模型,该模型在行业通用的高难度测试用例集上通过率达81.0%,首音频生成时延(TTFA)仅216毫秒,两项核心指标均优于当前市场主流竞品Cartesia、ElevenLabs的同类型产品,有望重构实时语音交互场景的技术选型标准。

配图

过去两年,TTS技术的落地边界不断拓宽,已经覆盖AI语音助手、数字人直播、实时同传、有声内容生成等多个场景。但行业始终面临一个共性难题:如果要保障复杂场景下的发音准确率、情感自然度,往往需要更长的推理时间,导致首句响应时延超过500毫秒,用户能明显感知到卡顿;如果优先压缩时延,又会导致生僻词、多语种混读、多音字歧义等“硬场景”下的错误率飙升,不少虚拟主播、AI客服频频出现读错专业术语、语气违和的翻车事故。

Gradium AI本次发布的新模型,直接瞄准了“效果和时延不可兼得”的行业痛点。官方披露的测试数据显示,该模型在包含生僻词、跨语种混排、情感标注、歧义多音字的行业通用硬案例测试集上,通过率达到81.0%,而此前Cartesia、ElevenLabs等头部厂商的同类型商用模型,硬案例通过率普遍在72%-78%区间。

同时该模型的首音频生成时延仅为216毫秒,比行业平均300毫秒以上的水平低了近30%,远低于人类正常对话感知卡顿的300毫秒阈值。这也是全球范围内首次有商用TTS模型,同时在效果上限和响应速度两个核心指标上做到行业顶尖水平,打破了此前TTS技术“偏科”的行业现状。

目前Gradium AI已经将该模型设为平台默认调用的TTS模型,开发者无需额外申请即可接入使用。对于实时交互场景来说,双指标的同步提升意味着用户体验的大幅升级:AI客服应对包含专业术语的用户咨询时,既能准确发音又不会出现明显停顿,实时同传场景下的语音输出可以做到和原说话人节奏基本同步,虚拟主播也能适配更复杂的直播台词,减少翻车概率。

据了解,Gradium AI后续还将开放该模型的行业微调接口,支持医疗、法律、金融等专业领域的术语库定制,进一步降低垂直场景的硬案例错误率。随着该模型的普及,实时语音交互的行业体验标准有望被拉升到新的水平。

本文基于公开信息分析整理,仅供参考。更多AI工具动态与行业解读,请持续关注本站更新。