一、概览

7月31日,MiniMax 正式发布 H3,一款通用的全模态生成模型,支持对文本、图像、视频、声音组成的多模态上下文进行统一理解,能够输出具备原生双声道的音视频,最高支持 15 秒 2K 分辨率。

8月3日,MiniMax 兑现承诺,在 ModelScope 和 Hugging Face 平台正式开放 H3 模型权重,采用自定义的 MiniMax H3 Community License Agreement。截至发稿,ModelScope 上已获 2111 次下载与 1480 星标。


二、设计理念:从专用走向通用

MiniMax 在技术发布文章中介绍,H3 的设计出发点是对过往生成模型"任务隔离"的反思。在传统范式下,图像生成被拆分为文生图、编辑、主体参考、动作参考等多个独立专家模型;声音生成中的人声、音效、音乐也被作为独立领域研究;视频生成的细分功能更是多达十余种;图像、视频、音频之间有着清晰的边界。

H3 的核心设计纲领是任务的统一与泛化——不再为每个细分功能训练独立的模型,而是让一个模型通过自然语言理解来完成各类生成任务。用户可以用自然语言描述复杂的创作需求,例如"参考视频1的希区柯克镜头运动,让图2中的人物唱歌,歌声参考音频3",由模型自主完成跨模态的上下文理解与生成。

MiniMax 表示,这种任务/能力/模态的隔离限制了使用自由度,也从训练范式上限定了模型的泛化能力,而 H3 构建过程的第一纲领即是任务的统一和泛化。


三、系统架构

完整的 H3 系统由三大模块组成,但本次开源仅包含 H3-Base 模块

1. H3-Context-IR(未开源)

托管的预处理与编排系统,负责解析自由形式的多模态输入——理解文本、图像、音频和参考视频之间的关系以及它们与目标生成的关系。其内部工作流包括指令解析、跨模态关联、时间理解和复杂逻辑推理。因依赖多阶段工作流和多个托管模型,未包含在本次开源发布中。MiniMax 提供 API 复现官方行为,同时发布了详细的 Prompt 编写指南供社区构建自己的预处理系统。

2. H3-Base(已开源)—— 核心技术解析

Contextual Omni Representation

MiniMax 表示,多模态上下文的引入使描述定义被泛化,不仅需要描述目标视频,还需要描述上下文与目标视频之间的关系,甚至上下文内元素之间的关系。语言在其中起到了可泛化的连结和解释作用,让"任务"以开放描述的形式得到统一。为此,MiniMax 定制了专门的模型和全模态理解管线,大部分素材需消耗约 100K Token 进行推理,最终得到平均约 4K Token 的描述。

H3-VAE:架构效率大幅优化

H 系列模型在 tokenizer 技术上持续探索。H3 彻底革新前代 tokenizer 技术,在重建和易学性上取得全面提升。其高压缩率带来 4 倍的序列长度收益,大幅降低训练和推理成本,也是支持原生 2K 分辨率的关键技术。

H3-VisualVAE 是时域因果视频自编码器,空间压缩 16 倍、时间压缩 4 倍、24 通道潜变量。经过 patchify(patch 大小 1×2×2)后,进入 Transformer 时有效空间下采样因子达 32 倍。MiniMax 表示其潜空间针对重建质量和生成模型易学性进行了联合优化。

H3-AudioVAE 左右声道独立编解码后重新组合,支持立体声输入输出。32kHz 音频压缩为 40Hz 潜变量序列。

H3-Omni-Transformer:面向任务泛化的架构选择

基于"架构应服务于任务"的设计理念,MiniMax 抛弃了曾带来显著架构优势的 Hailuo-02 架构,因其在以任务泛化为核心的模型定义中会引入额外复杂性。

H3-Omni-Transformer 是一个 33B 参数密集单流 Transformer,其中约 13B 参数位于 AdaLN 相关分支(可预计算缓存,推理部署无需加载)。注意力层和 FFN 层不含模态特定结构,模态特定参数仅限输入/输出层和 AdaLN 分支。模型采用三维多模态旋转位置编码(MM-RoPE)来表示时空位置关系。最终训练阶段引入原生稀疏注意力,但该实现在首次开源中未包含,将后续发布。

由于多模态上下文的引入,序列长度方差大了 3 倍,理解与生成部分的计算工作负载开始显著异质化。H3 采用理解与生成异构训练架构,精细调优不同工作负载下的硬件利用率,并联合考虑每样本异构计算与样本间的负载均衡,端到端提升近 30% 训练吞吐

In-context Regeneration

H3 没有采用常规的专用超分模块实现 2K 输出,而是让模型在原有多模态上下文信息基础上对自身生成的低分辨率结果进行重新生成。官方称这能超越传统超分方案在还原小文字和细节方面的局限。

3. H3-Regenerate-2K(未开源)

通过 In-context Regeneration 将 768p 输出提升至 2K 分辨率。因系统复杂性,该模块尚未开源,但提供了 API 用于验证官方结果。


四、开源详情

发布平台与许可

平台 地址
ModelScope https://www.modelscope.cn/models/MiniMax/MiniMax-H3
Hugging Face MiniMaxAI/MiniMax-H3
GitHub https://github.com/MiniMax-AI
许可协议 MiniMax H3 Community License Agreement

模型检查点

检查点 支持任务 输入条件 输出
H3-Base-FL2VA 文生视频、首/尾帧生视频 文本 + 可选首帧/尾帧图像 视频 + 音频
H3-Base-Ref2VA 多模态参考生视频 文本 + 参考图像/视频/音频 视频 + 音频

技术规格

项目 规格
输出时长 4–15 秒
输出宽高比 21:9、16:9、4:3、1:1、3:4、9:16 等多种
输出分辨率 默认 768p,2K 需 H3-Regenerate-2K
帧率 24 FPS
输出音频 32kHz 立体声
支持语言 11 种语言(含中英文)
模型精度 BF16
模型大小 约 240GB(权重)/ 约 498GB(含配置文件等)
推荐部署框架 SGLang、vLLM、diffusers、ComfyUI
推荐硬件 4 GPU

五、定价与商业定位

MiniMax 此前公布,H3 默认提供 2K 分辨率,2K 下每秒价格不到主流模型的 1/3,768P 下约为同类 720P 产品的 1/2。模型被定位为适用于广告、品牌、电商、产品设计、UI/UX、游戏等商业场景的商用级内容生成工具。根据前期邀测反馈,H3 在指令遵循、文字与品牌信息呈现、视频到视频动作迁移等方面表现出色。


六、开源背景

MiniMax 在发布公告中指出,长期以来视频生成领域以闭源模型为主导,迭代速度和生态开放性落后于大语言模型等领域。开源旨在推动社区发展、加速国产芯片适配(H3 设计初期已考虑多款国产芯片兼容性),以及方便有定制需求的用户。


七、局限性坦诚披露

在发布文章和开源仓库 README 中,MiniMax 坦承了 H3 当前的局限:

  1. 多模态上下文理解能力仍有巨大提升空间,后续将推动 H 系列下一个版本与 M 系列模型能力的融合
  2. 模型规模限制使得部分能力完成度仍有提升空间,Scaling 是明确方向
  3. 部分场景下画面精细度仍需提升,将持续追求更高分辨率和更精细画质
  4. H3-Context-IR 和 H3-Regenerate-2K 模块尚未开源,完整 2K 工作流依赖 MiniMax API
  5. 稀疏注意力实现尚未发布,当前开源版本仅支持全注意力推理
  6. 近 500GB 的存储需求和 4 GPU 的最低部署门槛,意味着实际可用性高度依赖充足的计算资源

八、行业观察

H3 的发布与开源反映了多模态生成模型的几个重要趋势:

  • 从功能分立走向任务统一:H3 的技术路线选择——以语言作为泛化桥梁、放弃前代架构追求任务泛化、采用 in-context regeneration 替代传统超分——均体现了对模型通用性的侧重
  • 开源生态的拓展:视频生成领域长期以闭源为主,H3 的开源决定在这一背景下引人注目,但关键模块(Context-IR 和 Regenerate-2K)仍保持闭源
  • 33B 参数和 4 GPU 门槛使其在当前开源视频模型中属于较大规模,社区的实际部署体验、微调效果以及后续模块的开源进度,值得持续关注

MiniMax 表示后续将发布更详细的技术报告。