问小创
告诉我你的需求,我帮你从站内挑最合适的 AI 工具。
2026年7月,通义千问正式对外发布全新实时语音识别模型Fun-ASR-Realtime。该模型将首字识别延迟控制在百毫秒级,识别精度接近行业领先的离线识别模型,同时支持30种通用语言及16种中文方言识别,兼具低延迟、高精度、多语种覆盖三大核心优势,可广泛适配多场景交互需求,为AI语音交互体验升级提供了全新技术底座。

用过实时语音转写功能的用户多半有过类似体验:要么说话后要等1-2秒才会出现文字,要么实时转写的错误率居高不下,碰到带口音的发言更是几乎没法用——这些痛点本质上都是实时语音识别模型在延迟和精度之间难以平衡的结果。
过去很长一段时间里,实时语音识别赛道始终存在难以调和的性能矛盾:为了实现低延迟,模型往往只能基于语音片段做局部识别,导致精度大幅下降;如果要保障识别准确率,又需要拿到完整的语音语句做全局优化,最终延迟拉高到用户可感知的程度。
除此之外,行业内多数主流模型对小语种、中文方言的支持普遍不足,也限制了语音交互的落地场景,不管是C端的智能硬件还是B端的跨境、下沉市场服务,都在期待更均衡的技术解决方案。
此次发布的Fun-ASR-Realtime,直接对准行业痛点实现了三重性能跃升。
首先是首字延迟压缩至百毫秒级,这意味着用户刚发出第一个音节,模型就已经完成识别输出,完全没有感知等待,实现了“即说即反馈”的流畅体验,延迟水准已经接近人类对话的自然反应速度。
在精度层面,该模型的识别表现已经逼近行业领先的离线识别模型——过去离线模型因为可以处理完整语音数据,精度普遍比实时模型高10%-15%,此次技术突破相当于在不牺牲速度的前提下,彻底补上了实时识别的精度短板。
同时该模型还实现了更广的语言覆盖,除了支持30种通用语言之外,还专门优化了16种中文方言的识别能力,不管是粤语、闽南语还是西南官话,都能做到稳定识别,解决了多语言、多方言场景的使用痛点。
目前Fun-ASR-Realtime已经面向开发者和企业用户开放调用接口,其应用价值将快速覆盖多个领域。
C端场景中,智能语音助手、车载交互系统、智能穿戴设备将最先受益,比如车载场景下,驾驶员说出指令后系统即时响应,不用等待,大幅降低驾驶安全隐患;B端场景中,会议速记、实时同传、跨境客服等产品也将迎来体验升级,多方言、多语言的参会者发言都能被准确转写,不用会后再花大量时间校对。
实时语音识别是大模型多模态能力的重要组成部分,这次技术突破不仅提升了语音交互的体验上限,也为后续通用人工智能实现更自然的人机交互打下了基础。随着这类底层语音能力的持续迭代,未来人和机器的交流将会越来越接近人与人之间的自然对话。
本文基于公开信息分析整理,仅供参考。更多AI工具动态与行业解读,请持续关注本站更新。