问小创
告诉我你的需求,我帮你从站内挑最合适的 AI 工具。
2026年8月4日,腾讯混元正式发布新一代语音识别模型Hy ASR3.0preview,首次将旗下Hy3大语言模型的语义理解能力深度融入识别全链路。该模型在开源评测集中文普通话、英语、粤语词错误率分别低至3.34%、2.62%、3.12%,整体约3%,实现了从逐字转写到语境理解的技术跨越,多场景识别精度处于行业领先水平。

对于经常使用语音转写工具的用户来说,同音字混淆、专业术语识别错误、嘈杂环境下转写准确率暴跌的问题并不少见——传统语音识别技术长期聚焦声学特征的单点优化,缺乏对上下文语义的理解能力,导致转写结果往往需要大量人工校对才能投入使用。
过去十年,语音识别技术的词错误率从20%以上降到5%左右,但始终无法突破“逐字转写”的局限。在会议记录、法律问询、医疗问诊等专业场景下,涉及大量专属术语和上下文关联信息,传统ASR的转写错误率甚至会回升到10%以上,后续校对成本占整体处理成本的60%以上,行业急需新的技术路径打破天花板。
此次腾讯混元推出的Hy ASR3.0preview,核心变革是打破了传统ASR“声学识别-文本纠错”的分离架构,首次将Hy3大语言模型的语义理解能力前置到识别全链路,实现了识别过程中对语境的实时判断。
官方披露的测试数据显示,在开源通用评测集上,该模型的中文普通话、英语、粤语词错误率分别低至3.34%、2.62%、3.12%,整体控制在3%左右;在覆盖10余种方言、专业术语识别、高噪、耳语等复杂场景的自建评测集中,其词错误率同样保持行业领先水平。
这一性能提升来自全链路的技术优化:架构上采用兼顾效率与性能的MoE架构,基座升级为Hy3大模型,同时搭配自研无监督语音Encoder,依托数千万小时级语音数据训练,大幅提升声学特征提取能力,预训练阶段就实现了语音Encoder与大语言模型的联合优化,从底层实现了语音信号和语义信息的打通。
从技术指标来看,Hy ASR3.0preview已经具备了“一键直出可用文本”的能力,无需后续人工校对即可满足绝大多数通用场景的需求。据透露,该模型后续正式上线后,将率先应用于腾讯内部的会议系统、视频平台字幕生成、客服智能质检等场景,后续还将开放API接口,面向企业客户提供定制化的语音识别服务,覆盖跨境交流、专业内容生产、公共服务等多个领域,有望将语音转写的整体处理效率提升50%以上。
AI创作导航,创作与探索并重。聚合全球优质AI工具,覆盖短视频、图文、写作、设计等创作场景,以及办公、学习、编程、生活等全品类需求。从创作出发,探索AI的无限可能,为创作者、学生、教师、职场人提供一站式AI工具导航与场景化应用指南。