2026年9月,Meta正式推出旗下首个实时音频感知模型Muse Voice Transcribe,该模型整合流式语音识别、说话人分离、端点检测三大核心能力,支持20余名说话人同时发言时分轨转写,训练覆盖70余种语言,开发者可通过Meta Model API调用,定价为每千分钟音频3美元,较同类产品具备显著成本优势,可广泛应用于会议记录、实时字幕等场景。

多人会议转写的痛点已经存在多年:传统语音转写工具要么需要等待整场会议结束才能输出完整文本,延迟极高;要么最多只能区分5-10个发言者,遇到大型研讨会、圆桌论坛这类多人同场的场景,转写结果往往混乱不堪,需要人工花费数小时校对,效率极低。
Muse Voice Transcribe的核心优势,是将原本需要独立调用的流式自动语音识别、说话人分离、端点检测三大能力整合到了同一计算流程中,不再需要分步处理音频数据。
所谓流式识别,就是模型不需要等待整段音频输入完成,而是可以边接收语音边输出文字,目前官方公布的延迟可控制在300毫秒以内,用户几乎感知不到输出滞后,完全满足实时场景的使用需求。此外该模型最多可同时精准区分20余名说话人身份,自动分轨输出对应文本,还能通过端点检测能力自动判断发言停顿边界,自动切分段落,不需要人工二次调整。
在语言支持上,该模型的训练数据集覆盖了70余种语言,目前已有25种主流语言完成上线验证,包括中英日韩、西班牙语法语等全球商用高频语言。
本次Meta推出的Muse Voice Transcribe并未单独推出ToC端产品,而是以API接口的形式对外开放,开发者可直接通过Meta Model API快速接入相关能力,不需要自行部署大模型算力,大幅降低了中小团队的使用门槛。
其定价更是远低于行业平均水平:每千分钟音频仅收费3美元,换算下来每小时的使用成本仅为0.18美元,约合人民币1.2元。目前市面上同类型实时多人转写服务的定价普遍在每千分钟8-15美元之间,Meta的定价仅为行业均值的20%-37%,成本优势十分显著。
据了解,该模型目前已经可以适配会议记录、线上直播实时字幕、客服通话质检、播客自动配字幕等多种场景,甚至可以作为AI同传的前置输入工具,进一步降低跨国交流的成本。
Meta相关技术负责人透露,后续团队还将迭代模型的口音适配能力,提升小语种以及带方言口音的语音识别准确率,同时还计划开放自定义说话人标注功能,用户可提前上传特定发言者的语音样本,进一步提升分轨识别的准确率。针对金融、政务等对数据安全要求较高的行业,未来还将推出离线部署版本,满足不同客户的需求。
AI创作导航,创作与探索并重。聚合全球优质AI工具,覆盖短视频、图文、写作、设计等创作场景,以及办公、学习、编程、生活等全品类需求。从创作出发,探索AI的无限可能,为创作者、学生、教师、职场人提供一站式AI工具导航与场景化应用指南。