问小创
告诉我你的需求,我帮你从站内挑最合适的 AI 工具。
微软AI团队近期正式推出新一代多语言语音转文字模型MAI-Transcribe-1.5,该模型支持43种全球常用语言识别,人工分析场景下词错误率(WER)低至2.4%,在FLEURS公开多语言语音数据集上准确率达行业最优水平,长音频转录速度较前代产品最高提升5倍,有望大幅降低多场景下语音内容转写的人力与时间成本。

近年来,随着远程办公、跨境内容创作、多语言客服等场景的普及,市场对语音转文字工具的需求持续攀升。但此前主流商用转写工具普遍存在小语种识别准确率低、长音频转写等待时间长、专业场景下错误率偏高等问题,不少企业仍需要投入15%-30%的人力用于转写结果校对,运营成本居高不下。
此次微软AI推出的MAI-Transcribe-1.5,针对上述痛点做了多项技术优化。在准确率层面,模型在人工分析测试集下的词错误率(WER)仅为2.4%,远低于行业平均8%-12%的水平;在权威多语言语音数据集FLEURS(覆盖全球100余种语言的真实语音样本)的测试中,其综合准确率登顶行业第一。
在覆盖范围层面,模型支持全球43种常用语言的识别,包括不少此前主流工具支持度较差的小语种。在效率层面,针对1小时以上的长音频场景,其转写速度较前代模型最高提升5倍,且支持边录边转、断点续传等功能,使用体验大幅优化。
据了解,MAI-Transcribe-1.5目前已经开放API接口供企业客户测试,已有多家跨境电商、在线教育平台正在对接相关功能。后续该模型还将集成到微软365的会议纪要、Azure云的语音服务等产品矩阵中。业内人士测算,该模型落地后,可帮助企业降低70%以上的语音转写校对成本,在跨境会议记录、播客内容转写、多语言客服质检、司法庭审记录等专业场景具备极高的应用价值。
AI创作导航,创作与探索并重。聚合全球优质AI工具,覆盖短视频、图文、写作、设计等创作场景,以及办公、学习、编程、生活等全品类需求。从创作出发,探索AI的无限可能,为创作者、学生、教师、职场人提供一站式AI工具导航与场景化应用指南。