问小创
告诉我你的需求,我帮你从站内挑最合适的 AI 工具。
2026年4月20日,阿里巴巴正式推出新一代端到端语音识别大模型Fun-ASR1.5,该模型基于阿里千问大模型体系迭代研发,公开测试数据显示其语音转写准确率超过字节跳动、腾讯等业内头部厂商的同类产品。Fun-ASR1.5可识别30种语言,覆盖中文七大方言与20余种地方口音,优化了标点预测等核心能力,可广泛应用于会议纪要整理等多个生产力场景。
对于经常需要整理会议录音、采访素材的办公人群与内容从业者来说,语音转写后的人工校对往往要花费数倍于录音本身的时间,方言口音、标点错乱、专有名词错漏都是行业长期存在的痛点,阿里新一代语音识别大模型直指这些用户痛点。
近年来,远程办公普及、内容行业发展、司法数字化推进,带动全行业对自动化语音转写的需求持续攀升,市场规模逐年增长。但此前绝大多数产品在方言识别、复杂场景准确率上始终存在明显瓶颈,不少带口音的语音转写错误率超过15%,严重影响使用效率,行业呼唤精度更高、适配场景更广的技术方案。
作为阿里千问端到端语音识别大模型的新一代版本,Fun-ASR1.5 在多个核心维度实现了升级。除了支持30种主流语言的识别能力,它完整覆盖中文七大方言体系,可适配20余种地方口音,甚至专门强化了古诗词诵读的专项识别能力。
针对用户吐槽最多的转写格式问题,该模型重点优化了标点预测和文本归一化能力,能够根据语音的抑扬顿挫节奏合理断句,解决了传统转写产品常见的标点混乱、数字/专有名词格式错误等问题,转写结果基本可以直接使用,无需大面积手动校对。目前公开对比数据显示,Fun-ASR1.5的整体转写准确率已经超过字节跳动、腾讯等厂商的同类主流产品。
语音是人机交互最自然的入口之一,精准的语音转写是诸多AI生产力应用的基础能力。Fun-ASR1.5的技术突破,不仅降低了带方言口音用户的使用门槛,也进一步压缩了办公、内容创作、司法等领域的内容整理成本。
业内观点认为,随着大模型技术持续渗透,语音识别赛道的竞争已经从“能用”转向“好用”,头部厂商的技术升级会带动整个行业的精度标准提升,未来会有更多适配细分场景的AI语音产品加速落地。
AI创作导航,创作与探索并重。聚合全球优质AI工具,覆盖短视频、图文、写作、设计等创作场景,以及办公、学习、编程、生活等全品类需求。从创作出发,探索AI的无限可能,为创作者、学生、教师、职场人提供一站式AI工具导航与场景化应用指南。