AI 问小创

你好,我是问小创 AI 助手

告诉我你的需求,我帮你从站内挑最合适的 AI 工具。

推荐结果基于站内收录,仅供参考,请以实际工具信息为准。
猜你想问
推荐一些AI写作工具 有什么AI绘画工具? 推荐视频剪辑AI工具
AI
问小创: 告诉我你的需求,我帮你从站内挑最合适的 AI 工具。

腾讯混元发布Hy ASR 3.0 preview 语音识别迈入语义理解新阶段

2026年8月4日,腾讯混元正式发布新一代语音识别模型Hy ASR 3.0 preview。该模型依托自研Hy3大语言模型的深度理解能力,融合高精度声学识别与语义感知能力,在多语种、多场景测试中词错误率(WER)普遍降至3%上下,其中中文普通话3.34%、英语2.62%、粤语3.12%,实现语音识别从逐字转写到语义理解的代际升级。

配图

过去数十年,语音识别技术的迭代始终围绕“逐字准确率”做单点优化,依赖声学模型匹配发音特征,一旦遇到高噪环境、轻声耳语、带口音的普通话、对话中的省略指代、行业专属术语,转写结果往往错漏百出,需要人工花费大量时间后期校对,在会议记录、智能客服、车载交互等高频场景的实际体验始终差强人意。

此次发布的Hy ASR 3.0 preview跳出了传统ASR的优化逻辑,直接将Hy3大语言模型的全域语义理解能力与语音识别链路深度融合,不再孤立识别单句发音,而是结合上下文语境判断用户真实表达意图,甚至可以自动修正同音字错误、补全省略的指代信息。

官方公布的测试数据显示,在海外开源评测集上,该模型的多语种词错误率(WER)均控制在3%左右,其中中文普通话3.34%、英语2.62%、粤语3.12%;在腾讯自建的全场景评测集中,无论是方言识别、专业术语识别,还是高噪、耳语等极端声学场景,WER同样保持低位,核心能力覆盖通用识别、上下文感知、多场景鲁棒性、方言适配四大维度,真正实现了从“逐字硬转”到“听懂语境”的进化。

据官方介绍,该模型落地后将首先覆盖企业级会议转写、智能客服质检、车载语音交互、方言区公共服务语音交互等场景,过去需要人工校对30%以上内容的转写文稿,未来可以实现“一键直出”可用版本,大幅降低相关场景的人力成本。此外,低WER的语音识别能力也将为听力障碍群体的实时语音转字幕工具、工业场景的语音指令操控等细分领域带来体验升级。

本文基于公开信息分析整理,仅供参考。更多AI工具动态与行业解读,请持续关注本站更新。