腾讯混元联合多家顶尖科研机构发布MMAE 填补AI音频编辑评估空白

2026年6月,腾讯混元联合上海交通大学、新加坡南洋理工大学、天津大学、北京大学、复旦大学等顶尖科研机构,共同发布首个通用指令驱动的大规模多任务音频编辑基准测试集MMAE。首轮测试数据显示当前AI模型音频精准编辑能力不足5%,该基准将为AI音频编辑领域提供统一的系统性评估标准,推动相关技术落地商用。

配图

做过短视频后期的创作者大多有过类似的困扰:一段已经剪好的访谈音频里混入了突发的车鸣声,想要删掉杂音却要花十几小时微调音轨,找AI工具处理要么把人声一起消掉,要么改完的音频出现明显的拼接痕迹。这正是当前AI音频领域普遍面临的技术瓶颈:生成能力突飞猛进,编辑能力却迟迟跟不上实际需求。

近年来AI音频生成领域进展迅速,文本转语音、AI作曲、声音克隆等技术已经实现大规模商用,多家厂商的生成音频音质已经接近真人录制水平。但与生成端的成熟相比,AI对已有音频的编辑能力始终存在明显短板:现有模型大多只能根据提示生成完整的新音频,无法按照用户需求精准修改已有音频的特定片段,也难以做到修改部分与原音频的自然衔接,不少用户调侃现在的AI音频是“会生成不会改”,要调整内容不如直接重做。

此前行业缺乏统一的评估标准,不同厂商的音频编辑能力无法横向对比,也导致相关技术研发进展缓慢。本次联合测试披露的当前主流AI模型的音频精准编辑能力通过率不足5%,也印证了这一领域的发展滞后。

此次发布的MMAE全称为大规模多任务音频编辑基准,是行业内首个针对通用指令驱动的音频编辑大规模测试集,由腾讯混元联合多所高校的音频技术、AI研究团队共同打造。

与此前零散的测试标准不同,MMAE覆盖了人声修正、背景音调整、特定音效增减、音色转换、时序修改等数十种常见的音频编辑场景,要求模型能够理解自然语言指令,仅修改用户指定的内容,同时保持原音频其余部分的音质、时序、情绪完全不变,最大程度贴合实际使用需求。

MMAE的发布填补了行业评估标准的空白,未来将成为全球AI团队研发音频编辑技术的核心参考标尺。有了统一的测试标准后,厂商可以针对性优化模型的指令理解、局部修改能力,有望快速提升AI音频编辑的准确率。

接下来包括腾讯混元在内的参与机构也将基于MMAE基准迭代相关技术,未来播客创作者、影视后期人员甚至普通用户,都可以通过自然语言指令快速完成复杂的音频编辑工作,大幅降低音频内容的生产门槛。

本文基于公开信息分析整理,仅供参考。更多AI工具动态与行业解读,请持续关注本站更新。