问小创
告诉我你的需求,我帮你从站内挑最合适的 AI 工具。
2026年8月4日,腾讯混元正式发布新一代语音识别模型Hy ASR 3.0 preview。该模型依托自研Hy3大语言模型的深度理解能力,融合高精度声学识别与语义感知能力,在多语种、多场景测试中词错误率(WER)普遍降至3%上下,其中中文普通话3.34%、英语2.62%、粤语3.12%,实现语音识别从逐字转写到语义理解的代际升级。

过去数十年,语音识别技术的迭代始终围绕“逐字准确率”做单点优化,依赖声学模型匹配发音特征,一旦遇到高噪环境、轻声耳语、带口音的普通话、对话中的省略指代、行业专属术语,转写结果往往错漏百出,需要人工花费大量时间后期校对,在会议记录、智能客服、车载交互等高频场景的实际体验始终差强人意。
此次发布的Hy ASR 3.0 preview跳出了传统ASR的优化逻辑,直接将Hy3大语言模型的全域语义理解能力与语音识别链路深度融合,不再孤立识别单句发音,而是结合上下文语境判断用户真实表达意图,甚至可以自动修正同音字错误、补全省略的指代信息。
官方公布的测试数据显示,在海外开源评测集上,该模型的多语种词错误率(WER)均控制在3%左右,其中中文普通话3.34%、英语2.62%、粤语3.12%;在腾讯自建的全场景评测集中,无论是方言识别、专业术语识别,还是高噪、耳语等极端声学场景,WER同样保持低位,核心能力覆盖通用识别、上下文感知、多场景鲁棒性、方言适配四大维度,真正实现了从“逐字硬转”到“听懂语境”的进化。
据官方介绍,该模型落地后将首先覆盖企业级会议转写、智能客服质检、车载语音交互、方言区公共服务语音交互等场景,过去需要人工校对30%以上内容的转写文稿,未来可以实现“一键直出”可用版本,大幅降低相关场景的人力成本。此外,低WER的语音识别能力也将为听力障碍群体的实时语音转字幕工具、工业场景的语音指令操控等细分领域带来体验升级。
AI创作导航,创作与探索并重。聚合全球优质AI工具,覆盖短视频、图文、写作、设计等创作场景,以及办公、学习、编程、生活等全品类需求。从创作出发,探索AI的无限可能,为创作者、学生、教师、职场人提供一站式AI工具导航与场景化应用指南。