问小创
告诉我你的需求,我帮你从站内挑最合适的 AI 工具。
2026年6月5日,腾讯云在2026AI产业应用大会上正式发布音视频AI原生能力底座WAND。依托20余年音视频技术积累,WAND内置六大自研媒体专用模型,覆盖60余项媒体AI能力,以Agent-Native模式向行业开放,实现从单点能力供给到AI应用原生媒体底座的战略升级,可填补主流通用生成式大模型在专业媒体生产场景的能力短板。

此次发布是腾讯云音视频业务沉淀20余年技术能力后的一次战略级转向——过往腾讯云对外输出的多是转码、画质增强等单点工具类能力,而WAND的推出意味着其正式锚定AI Agent时代的媒体基础设施定位,为各类AI应用提供开箱即用的音视频处理全链路支持。
WAND整体采用三层架构设计,最底层为模型引擎层,内置编解码、画质增强、智能擦除、内容生成、内容理解、音频处理六大自研媒体专用模型,针对专业媒体生产场景做了专项优化,填补了主流通用生成式大模型在音视频处理精度、效率上的不足。
中间的能力层将60余项媒体AI能力按生成、理解、处理、编码四大维度重新梳理,支持API、Agent预编排工作流(Agentic Workflow)、Skills三种开放模式,AI Agent可直接调用相关能力端到端跑通全链路业务,无需在多个工具之间切换对接,大幅降低开发调试成本。最上层则面向不同行业提供预制的场景方案,可快速适配各类业务需求。
不同于传统云厂商按功能分类开放API的思路,WAND核心采用Agent-Native的开放模式,所有音视频能力都被封装为AI Agent可直接识别调用的技能,甚至针对高频场景提前完成了工作流预编排。
比如面向短视频自动生产场景,开发者无需分别对接素材解析、擦除水印、画质增强、编码输出等多个接口,只需让AI Agent调用WAND对应技能包,即可自动完成整条内容生产链路的处理。据了解,WAND此前已在腾讯内部短视频、直播、数字人等多条业务线完成灰度测试,较传统多工具拼接方案的处理效率提升30%以上,人工介入率下降近70%。
随着生成式AI应用进入规模化落地期,各类AI Agent对音视频处理的需求早已不再局限于单一功能,而是需要可无缝嵌入工作流的全链路能力支持。此前行业普遍面临通用大模型音视频处理能力不足、单点工具对接成本高的痛点,WAND的发布恰好击中这一行业刚需,也标志着国内云厂商的音视频服务正式从工具化供给阶段,迈入面向AI应用的原生底座竞争新赛道。
据腾讯云透露,后续其还将针对广电、电商、教育等垂直行业的专属需求,推出更多定制化的WAND场景方案,进一步降低各行业AI应用的开发门槛。
AI创作导航,创作与探索并重。聚合全球优质AI工具,覆盖短视频、图文、写作、设计等创作场景,以及办公、学习、编程、生活等全品类需求。从创作出发,探索AI的无限可能,为创作者、学生、教师、职场人提供一站式AI工具导航与场景化应用指南。