问小创
告诉我你的需求,我帮你从站内挑最合适的 AI 工具。
2026年8月5日腾讯正式发布混元新一代语音识别模型Hy ASR3.0预览版,该模型基于腾讯混元大语言模型Hy3打造,融合高精度识别与深度语义理解能力,覆盖10大方言片区及20余个二级小片区,整体词错率控制在3%左右,其中普通话3.34%、英语2.62%、粤语3.12%,实现语音识别从逐字转写到语境理解的质变。

日常使用语音转写时遇到的方言识别不准、长音频上下文混乱、同音词无法区分等痛点,如今有望得到系统性解决。腾讯混元此次推出的语音识别新模型,瞄准的正是行业多年未突破的“听懂”而非仅“听清”的核心需求。
长久以来,语音识别技术的落地始终受限于“逐字转写”的底层逻辑:用户需要尽量使用标准普通话,遇到方言、口音、同音词、长文本上下文指代的场景,识别准确率往往大幅跳水。此前行业公开数据显示,主流语音识别产品的方言平均词错率普遍在8%以上,长音频场景的累计误差甚至可达15%,远无法满足专业场景的使用需求。
Hy ASR3.0预览版的核心突破,在于首次将大语言模型的语义理解能力与语音识别链路深度融合,而非采用传统的“先转写后理解”的两段式架构。
基于混元最新一代大语言模型Hy3的能力支撑,该模型目前覆盖粤语、吴语等10大方言片区及20余个二级小片区,无需用户刻意使用标准普通话即可完成精准识别。开源评测集数据显示,该模型多语种整体词错误率(WER)控制在3%左右,其中中文普通话3.34%、英语2.62%、粤语3.12%,准确度已经触及行业天花板。
相比传统语音识别模型,Hy ASR3.0在长音频场景的优势更为突出:依托大模型的上下文理解能力,模型可以自动修正同音词错误、匹配语境指代内容,甚至可以识别出语句中的隐含情绪、省略指代,真正实现从“听清每个字”到“听懂整句话”的跨越。
从落地场景来看,Hy ASR3.0的商用空间十分广阔。
面向To B场景,该模型可以大幅提升会议转写、客服质检、多语种访谈转录的效率,方言识别能力也能很好适配下沉市场的政务服务、农村电商等场景的语音交互需求;面向To C场景,搭载该模型的智能硬件、语音助手可以适配不同地区用户的方言使用习惯,降低老年群体、方言使用者的智能产品使用门槛。
据透露,后续腾讯混元还将开放该模型的API接口,供开发者接入到不同的应用场景中,进一步降低语音交互技术的使用门槛。
AI创作导航,创作与探索并重。聚合全球优质AI工具,覆盖短视频、图文、写作、设计等创作场景,以及办公、学习、编程、生活等全品类需求。从创作出发,探索AI的无限可能,为创作者、学生、教师、职场人提供一站式AI工具导航与场景化应用指南。