问小创
告诉我你的需求,我帮你从站内挑最合适的 AI 工具。
2026年4月20日,阿里旗下通义实验室正式发布新一代语音识别大模型Fun-ASR1.5。该模型采用统一大模型架构,解决了语音AI领域长期存在的通用性与精准度平衡难题,可支持全球30种主流语言、汉语七大方言及20余种地方口音的高精度转写,目前已上架阿里云百炼平台,将通过API服务为多行业智能化升级提供技术支撑。
在AI语音赛道,技术落地已经渗透到各行各业,但长期以来存在一个难以调和的核心痛点:针对单一场景优化的模型识别精度高,但换场景、换语种就容易出错;而追求全场景适配的通用模型,又往往会在复杂语境下牺牲识别精度。中国市场本身存在多方言、口音差异大的特点,不少特殊场景如传统文化音频的数字化转写,更是过往模型的能力盲区。
此次发布的Fun-ASR1.5,核心突破就是通过统一大模型架构,实现了通用性与精准度的平衡。该模型在训练阶段就整合了多语种、多方言的海量语料,不需要开发者针对不同场景单独做差异化微调,既降低了适配成本,也保证了全场景的识别表现。
具体来看,Fun-ASR1.5可覆盖全球30种主流语言,还深度适配了汉语七大方言体系及20多种地方口音。更值得关注的是,即便面对语调跌宕、断句特殊的古诗词吟诵,该模型也能实现秒级高精度转写,填补了不少细分场景的能力空白。
目前,Fun-ASR1.5已经正式上架阿里云百炼平台,对外开放API调用服务。阿里通义实验室方面表示,该模型的能力可以覆盖教育、传媒、金融、科技、文化等多个领域的需求:教育领域可用于方言教学内容转写,传媒领域可支持多语种内容快速生成字幕,文化领域则可以帮助完成古诗词、地方曲艺等传统音频的数字化保存转写。该模型将帮助各行业降低语音技术使用门槛,助力智能化办公与内容生产升级。
AI创作导航,创作与探索并重。聚合全球优质AI工具,覆盖短视频、图文、写作、设计等创作场景,以及办公、学习、编程、生活等全品类需求。从创作出发,探索AI的无限可能,为创作者、学生、教师、职场人提供一站式AI工具导航与场景化应用指南。