问小创
告诉我你的需求,我帮你从站内挑最合适的 AI 工具。
2026年7月23日,微软正式对外发布两款自研垂直AI模型:高精度图像生成模型MAI-Image-2.5-Pro、高并发语音交互模型MAI-Voice-2-Flash,目前均已进入公开预览阶段。两款模型均采用可追溯清洁训练数据,不依赖第三方模型蒸馏,其中图像模型GPU成本最高下降84%,目前已落地Bing、PowerPoint等核心产品。

生成式AI商用落地的近两年,算力成本高企、数据合规风险一直是行业最难破解的两大痛点,不少厂商推出的垂直场景模型多依赖通用大模型蒸馏而来,既存在效果适配性不足的问题,也潜藏训练数据授权的隐患,微软此次推出的两款自研模型,正是瞄准这一行业共性问题给出的解决方案。
微软方面介绍,此次发布的两款模型从架构设计到训练全链路均为自主研发,全程未使用第三方模型进行蒸馏,所有训练数据均经过清理且可追溯来源,不存在数据授权不明的版权隐患。
和行业内多数先做通用模型再适配垂直场景的路径不同,这两款模型从设计之初就直接对准微软生态用户的高频需求打磨,能更好适配微软旗下产品的接口和交互逻辑,也能根据用户反馈快速迭代优化。
其中MAI-Image-2.5-Pro是微软目前精度最高的图像生成模型,支持主视觉海报生成、图像细节编辑、图内精准文字渲染等高要求场景,可直接识别自然语言编辑指令,对比行业同类模型GPT-Image-2,GPU运行成本最高可下降84%。
目前该模型已经成为Bing Image Creator的默认图像生成模型,同时接入了PowerPoint的图生图编辑功能,后续还将部署到OneDrive等产品的图像处理场景。另一款MAI-Voice-2-Flash则针对高并发语音交互场景优化,能在大量用户同时发起请求的情况下保持低延迟和高识别准确率,适合智能客服、实时会议转写、终端语音助手等高频交互场景。
此前微软的C端、B端AI服务大多基于OpenAI的通用大模型打造,此次推出自研垂直模型,一方面进一步降低了对第三方技术的依赖,另一方面也能凭借更低的运行成本,压低AI功能的商用门槛。
据了解,后续两款模型大概率会通过Azure云服务开放给第三方开发者,覆盖更多中小企业的定制化AI需求。在生成式AI从尝鲜转向刚需的节点,微软针对图像、语音两大高频场景推出的高性价比自研模型,也将进一步巩固其在办公、搜索两大场景的AI竞争优势。
AI创作导航,创作与探索并重。聚合全球优质AI工具,覆盖短视频、图文、写作、设计等创作场景,以及办公、学习、编程、生活等全品类需求。从创作出发,探索AI的无限可能,为创作者、学生、教师、职场人提供一站式AI工具导航与场景化应用指南。