AI 问小创

你好,我是问小创 AI 助手

告诉我你的需求,我帮你从站内挑最合适的 AI 工具。

推荐结果基于站内收录,仅供参考,请以实际工具信息为准。
猜你想问
推荐一些AI写作工具 有什么AI绘画工具? 推荐视频剪辑AI工具
AI
问小创: 告诉我你的需求,我帮你从站内挑最合适的 AI 工具。

Interfaze推出首个开源多语言Diffusion ASR模型 支持6种语言转写

AI初创公司Interfaze于近期正式推出开源语音识别模型diffusion-gemma-asr-small,这是全球首个基于扩散技术的开源多语言自动语音识别(ASR)模型,依托DiffusionGemma架构的并行降噪解码器能力,可实现6种主流语言的高准确率语音转写,为下游语音类AI应用开发者提供了新的低成本、高灵活度的方案选择。

对于多语言语音应用开发者而言,长期以来都面临两难选择:调用谷歌、亚马逊等大厂的闭源ASR接口,成本随调用量飙升的同时数据安全存在隐患;使用现有开源ASR方案,又往往面临多语言支持不全、转写准确率不足、推理速度慢等问题。而Interfaze本次推出的新模型,恰好填补了这一市场空白。

据近期AI开发工具调研机构的统计数据显示,在涉及跨境业务的AI应用开发者中,有68%的受访者表示需要用到多语言语音转写能力,但其中仅32%的开发者选择使用开源ASR方案,剩下的开发者不得不支付高昂的闭源接口费用。

此前开源ASR领域的主流方案多基于CTC、Transformer架构,这类架构的多语言适配往往需要针对单语种做大量微调,边际成本极高,而扩散技术此前已经在图像生成、音频生成领域验证了并行处理的优势,但在ASR领域的落地尤其是开源多语言方案始终处于空白状态。

本次发布的diffusion-gemma-asr-small核心优势,来自DiffusionGemma架构的并行降噪解码器:和传统ASR需要逐帧处理音频信号的逻辑不同,扩散架构的降噪过程可以同时处理整段音频的所有帧,在相同硬件条件下,转写速度比同参数量的开源Transformer ASR模型快42%,字错误率降低11%。

目前该模型已支持英语、西班牙语、法语、中文、日语、韩语6种主流语言,覆盖全球超70%的互联网活跃用户使用的语种,1.2B的参数量也足够轻量化,可直接在普通服务器甚至是中端智能硬件上离线部署。目前模型权重、训练和推理代码已完全开放,无额外商用授权限制。

Interfaze团队透露,本次发布的small版本只是该系列的第一个落地产品,后续还将推出3B、7B参数量的更大版本,支持的语种也将拓展至20种以上,同时会针对小语种、方言等低资源场景做定向优化。

行业分析认为,扩散ASR的成熟有望重构现有语音AI的技术栈:相比传统架构,扩散架构的通用性更强,更容易和大语言模型实现端到端打通,未来可直接应用于多语言同声传译、智能硬件语音交互、跨境内容生产等多个场景,进一步降低语音类AI应用的开发门槛。

本文基于公开信息分析整理,仅供参考。更多AI工具动态与行业解读,请持续关注本站更新。