问小创
告诉我你的需求,我帮你从站内挑最合适的 AI 工具。
AI初创公司Interfaze于近期正式推出开源语音识别模型diffusion-gemma-asr-small,这是全球首个基于扩散技术的开源多语言自动语音识别(ASR)模型,依托DiffusionGemma架构的并行降噪解码器能力,可实现6种主流语言的高准确率语音转写,为下游语音类AI应用开发者提供了新的低成本、高灵活度的方案选择。
对于多语言语音应用开发者而言,长期以来都面临两难选择:调用谷歌、亚马逊等大厂的闭源ASR接口,成本随调用量飙升的同时数据安全存在隐患;使用现有开源ASR方案,又往往面临多语言支持不全、转写准确率不足、推理速度慢等问题。而Interfaze本次推出的新模型,恰好填补了这一市场空白。
据近期AI开发工具调研机构的统计数据显示,在涉及跨境业务的AI应用开发者中,有68%的受访者表示需要用到多语言语音转写能力,但其中仅32%的开发者选择使用开源ASR方案,剩下的开发者不得不支付高昂的闭源接口费用。
此前开源ASR领域的主流方案多基于CTC、Transformer架构,这类架构的多语言适配往往需要针对单语种做大量微调,边际成本极高,而扩散技术此前已经在图像生成、音频生成领域验证了并行处理的优势,但在ASR领域的落地尤其是开源多语言方案始终处于空白状态。
本次发布的diffusion-gemma-asr-small核心优势,来自DiffusionGemma架构的并行降噪解码器:和传统ASR需要逐帧处理音频信号的逻辑不同,扩散架构的降噪过程可以同时处理整段音频的所有帧,在相同硬件条件下,转写速度比同参数量的开源Transformer ASR模型快42%,字错误率降低11%。
目前该模型已支持英语、西班牙语、法语、中文、日语、韩语6种主流语言,覆盖全球超70%的互联网活跃用户使用的语种,1.2B的参数量也足够轻量化,可直接在普通服务器甚至是中端智能硬件上离线部署。目前模型权重、训练和推理代码已完全开放,无额外商用授权限制。
Interfaze团队透露,本次发布的small版本只是该系列的第一个落地产品,后续还将推出3B、7B参数量的更大版本,支持的语种也将拓展至20种以上,同时会针对小语种、方言等低资源场景做定向优化。
行业分析认为,扩散ASR的成熟有望重构现有语音AI的技术栈:相比传统架构,扩散架构的通用性更强,更容易和大语言模型实现端到端打通,未来可直接应用于多语言同声传译、智能硬件语音交互、跨境内容生产等多个场景,进一步降低语音类AI应用的开发门槛。
AI创作导航,创作与探索并重。聚合全球优质AI工具,覆盖短视频、图文、写作、设计等创作场景,以及办公、学习、编程、生活等全品类需求。从创作出发,探索AI的无限可能,为创作者、学生、教师、职场人提供一站式AI工具导航与场景化应用指南。