AI 问小创

你好,我是问小创 AI 助手

告诉我你的需求,我帮你从站内挑最合适的 AI 工具。

推荐结果基于站内收录,仅供参考,请以实际工具信息为准。
猜你想问
推荐一些AI写作工具 有什么AI绘画工具? 推荐视频剪辑AI工具
AI
问小创: 告诉我你的需求,我帮你从站内挑最合适的 AI 工具。

MiniMax发布全模态生成模型H3 宣布近期开源全部模型权重

2026年7月31日,人工智能企业MiniMax正式发布全新全模态生成模型MiniMax H3,同时承诺数日内开源全部模型权重。该模型支持文本、图像、视频、声音任意组合输入,可直接生成带原生双声道音频的高清视频,其采用的H3-Omni Transformer架构使端到端训练吞吐量提升近30%,大幅降低多模态内容创作门槛。

配图

给短视频做后期的创作者大概率都遇到过这样的卡点:用AI生成了视频片段,还要单独找配音、配BGM,不同工具输出的内容节奏不匹配,光调整同步就要耗掉大半天的时间。而MiniMax此次推出的H3模型,直接把多模态内容创作的“最后一公里”给补全了。

过去几年,AI生成内容的能力边界不断拓宽,但主流多模态模型普遍采用“专家模型拆分”的架构:文生图、文生视频、音频生成各由独立的模型负责,用户需要在不同工具间切换,还要花大量时间做内容对齐,不仅效率低,不同模型的能力参差也会拉低最终产出的质量。

此外,头部厂商的全模态服务多以API形式对外开放,调用成本高,也不支持开发者做针对性微调,难以满足教育、电商、影视等垂直行业的定制化需求。

和传统多模态模型的拆分逻辑不同,H3首次将文生图、文生视频、图转视频、音频处理等所有多模态任务整合进同一个预训练框架,推出了更简洁的H3-Omni Transformer架构,直接让端到端的训练吞吐量提升了近30%,训练成本也随之大幅下降。

另外研发团队还重写了Tokenizer模块,配套推出H3-VAE架构,解决了不同模态数据输入时的Token适配问题,让模型可以支持文本、图像、视频、音频的任意组合输入,最终直接输出带原生双声道音频的高清视频,不需要用户再做后期的音画同步调整。实际测试中,用户只要上传参考图片、视频或者音频素材,搭配一句自然语言指令,就能一次性生成符合要求的完整视听内容,整个过程只需要几分钟。

MiniMax此次同步宣布将在数日内开源H3的全部模型权重,这也是全球范围内首个完全开源的可直接生成音视频一体内容的全模态大模型。

开源后,中小研发团队不需要从零开始训练大模型,直接基于H3的权重做微调,就能快速推出面向垂直场景的定制化服务:比如教育机构可以用它自动生成配套动画的知识点微课,电商商家可以批量生成商品展示短视频,影视团队可以快速制作前期概念样片降低沟通成本。对于普通创作者来说,后续如果有基于H3开发的轻量化本地化工具,也不用再为多个AI工具的会员费买单,只用一套系统就能完成全流程的内容创作。

本文基于公开信息分析整理,仅供参考。更多AI工具动态与行业解读,请持续关注本站更新。