本教程系统讲解如何在消费级 NVIDIA 显卡(12GB / 16GB 显存)上,通过 ComfyUI 节点式界面本地部署 MiniMax H3 全模态视频生成模型,完成文生视频(T2V)与图生视频(I2V)两大核心场景。教程将先梳理 H3 的模型变体与核心架构,再逐步完成 ComfyUI 安装、模型下载与放置、工作流加载与参数配置,最后给出消费级显卡的性能调优与常见问题解答。
前置教程
如想快速开始学习本教程,你可能需要先完成以下前置教程:
- PyTorch安装与版本选择问题详解,本教程的 ComfyUI 依赖 CUDA 版 PyTorch 与显卡驱动配合,了解 PyTorch 与 CUDA 的版本对应关系有助于排查环境问题。
- 本地图像与视频生成模型部署与调用教程,本教程介绍了扩散模型与视频生成的基础概念,是理解 MiniMax H3 工作原理的入门前提。
资源下载
- ComfyUI 官方 Releases 下载地址,选择 ComfyUI_windows_portable_nvidia.7z便携版。
- ComfyUI 网盘下载地址,下载缓慢时可使用网盘下载。
- MiniMax H3 官方整理模型 ModelScope 仓库,包含 FL2VA / Ref2VA 扩散模型、Qwen3-VL 文本编码器与双 VAE。
- MiniMax H3 模型网盘下载地址,网速较慢时可优先使用网盘下载。
1. MiniMax H3 技术概览
1.1 什么是 MiniMax H3
MiniMax H3 是一款通用型全模态生成模型,能够统一理解由文本、图像、视频和音频构成的多模态上下文,并输出带有原生双声道音频的视频内容,最高支持 15 秒 2K 分辨率(2560×1440)、24 FPS 的输出。
H3 在设计上最大的特点是「打破任务边界」——在预训练阶段就把文生视频、图生视频、首尾帧、主体参考、动作参考、视频编辑等任务统一建模,用自然语言描述任务关系,而不是为每种任务单独训练一个专家模型。对使用者而言,同一套模型即可覆盖大多数视频生成场景,无需在不同工具间切换。
1.2 模型变体:FL2VA 与 Ref2VA
H3 开源后提供两个独立的 checkpoint(模型检查点),分别对应两种不同的工作模式。
FL2VA 是「First-and-Last-Frame-to-Video-and-Audio」的缩写,即首尾帧到音视频模式。该模式支持输入 0 张、1 张或 2 张图像:
| 输入方式 | 任务模式 | 说明 |
|---|---|---|
| 不输入图像 | 纯文生视频 | 由提示词直接生成完整视频 |
| 仅输入首帧图像 | 首帧生视频 | 以指定画面为起点继续生成后续运动 |
| 仅输入尾帧图像 | 尾帧生视频 | 生成以指定画面为终点的视频 |
| 同时输入首帧与尾帧 | 首尾帧生视频 | 生成两者之间连贯过渡的完整视频 |
FL2VA checkpoint 统一支持 T2VA(文生视频)和首尾帧生视频两类任务,是日常视频生成最常用的模型变体。本教程第 4、5 章的文生视频与图生视频工作流即基于 FL2VA。
Ref2VA 是「Reference-to-Video-and-Audio」的缩写,专门处理复杂的多模态参考任务:
- 图像参考:最多 9 张
- 视频参考:最多 3 段,每段时长 2–15 秒
- 音频参考:最多 3 段(音频必须与图像或视频一同输入,不能作为唯一输入)
- 总计限制:所有类型输入合计最多 12 个
Ref2VA 的核心用途包括:人物与场景保留、动作与嘴型编辑、音色参考、原始音频复用等复合任务。例如,可以参考一段视频的人物身份和场景,同时参考另一段音频的音色,让画面中的人物生成新的对白和口型动作。
与 FL2VA 不同,Ref2VA 不执行纯文生视频任务——它的工作必须基于用户提供的至少一种参考素材(图像或视频)。
1.3 核心架构组件
H3 是一套由多个组件协同工作的系统,其核心架构可分解为以下几个部分。
1.3.1 VAE:压缩与还原工具
VAE(变分自编码器) 承担着将原始图像/视频数据进行高效压缩与还原的职责。H3 在这一代彻底重构了前代的 Tokenizer 技术,包含两个独立的 VAE:
- Video VAE(视觉编码器):约 2.60B 参数,实现 16 倍空间压缩和 4 倍时间压缩。例如,一段 22 帧、128×128 的视频经过编码后,压缩为
(1, 48, 7, 8, 8)的潜在表示。 - Audio VAE(音频编码器):约 151M 参数,处理 32kHz 立体声音频,每秒可生成 40 个潜在变量。
VAE 的高压缩率为 H3 带来4 倍序列长度收益,直接降低了训练和推理成本,也是支撑原生 2K 分辨率输出的核心技术。
1.3.2 文本编码器:Qwen3-VL-27B
H3 使用 Qwen3-VL-27B(实际为约 25B 参数的 50 层版本)作为冻结的文本/多模态编码器。
它的核心任务是将用户输入的文字描述(Prompt)和视觉参考素材转换为包含丰富语义信息的数学向量(嵌入表示)。在 H3 中:
- 模型仅采用 Qwen3-VL 的前 50 层作为编码器使用
- 权重文件约 66.7GB,是 H3 中体积最大的组件之一(ComfyUI 官方会提供 NVFP4 / INT8 等量化版,大幅减小体积,见第 3 章)
- 它支持理解图像和视频,使 H3 在 Ref2VA 模式下能同时理解文字、图片和视频参考素材的含义
1.3.3 H3-Omni-Transformer(DiT):核心生成引擎
H3-Omni-Transformer 是一个 33B 参数的稠密单流 Transformer(即扩散 Transformer / DiT),负责在潜在空间中执行实际的「去噪创作」过程。
值得注意的技术细节:
- 50 层,隐藏维度 5376,56×128 注意力头
- 约 13B 参数位于 AdaLN(自适应层归一化)相关分支中,这些参数只依赖时间步嵌入,与序列内容无关——因此在推理时可以通过 AdaLN 预计算技术将这 13B 参数(约 26GB)从常驻内存中移除,实际只需常驻约 20B 参数
- 权重文件约 66.3GB(包含 AdaLN 全部参数)
- 在性能上,由于多模态上下文的引入,H3 的序列长度方差比前代大了 3 倍,团队采用了理解与生成异构的训练架构,端到端训练吞吐提升近 30%
1.3.4 扩散模型的工作原理
H3-Omni-Transformer 本质上是一个视频扩散模型。扩散模型的工作流程可以分为两个阶段:
训练阶段:模型被反复训练「去噪」能力——给定一张被不同程度噪声污染的图像/视频,模型学习如何一步步还原出清晰的原始内容。
推理阶段(生成):
- 模型随机生成一段纯噪声(相当于一张「白纸」)
- 借助文本编码器提供的语义指导,在潜在空间中逐步去噪
- 每一步都根据文字描述优化画面的结构和细节
- 经过约 50 步迭代后,生成清晰的潜在表示,再由 Video VAE 解码为视频
这种由粗到细的生成方式,让扩散模型能够从全局布局到局部细节逐层完善,生成的视频比传统生成模型更稳定、细节更丰富。
在 H3 中,视频和音频是联合生成的,而不是后期拼凑——这也是 H3 能输出「原生双声道」音视频的原因。
1.4 完整生成流程:从输入到 2K 输出
H3 的完整生成流程包含三个层次:
- H3-Context-IR(上下文中间表示):深入理解多模态输入,提炼为模型更易理解的中间表示。大部分素材需要约 100K Token 的推理,最终压缩为约 4K Token 的表示。这是 H3 实现广泛指令理解能力的关键模块。
- H3-Base:根据 Context-IR 的输出,由 H3-Omni-Transformer 在潜在空间执行去噪生成,默认输出短边为 768 像素的音视频。
- H3-Regenerate-2K:H3 不使用传统的超分模块,而是将 768p 结果连同原始上下文重新输入 H3,以 2K 分辨率重新生成。这样做的好处是:最大限度复用基模的生成能力,并且可以利用原始多模态上下文还原传统超分方案靠「猜」无法恢复的细节(如小文字和精细纹理)。
文本 / 图像 / 视频 / 音频] --> B[H3-Context-IR
上下文中间表示] B --> C[H3-Base
DiT 潜在空间去噪
默认短边 768] C --> D[H3-Regenerate-2K
768p 结果以 2K 重生成] D --> E[2K 音视频输出
原生双声道音频] classDef input fill:#d6eaf8,stroke:#1a6b8a,stroke-width:2px classDef model fill:#ffecd6,stroke:#e67e22,stroke-width:2px classDef process fill:#d5f5e3,stroke:#27ae60,stroke-width:2px classDef output fill:#fdebd0,stroke:#b7950b,stroke-width:2px class A input class B,C model class D process class E output
1.5 消费级硬件可行性评估
MiniMax H3 全量权重(bf16)体积超过 130GB,直接部署对硬件要求极高。但得益于 ComfyUI 官方推出的 INT8 / NVFP4 量化版与动态显存卸载机制,模型已被压缩到约 40GB,16GB 显存即可稳定运行:
| 硬件指标 | 要求 | 说明 |
|---|---|---|
| 显卡显存 | 16GB 稳定,12GB 最低 | INT8 量化 + 动态显存卸载,16GB 卡实测占用约 14GB |
| 系统内存 | 最低 32GB | 内存会承担模型层换入换出,实测 64GB 内存时占用约 44GB |
| 磁盘空间 | 预留 80–100GB | 仅 FL2VA 组合约 40GB;FL2VA + Ref2VA 需预留 120–150GB |
| 显卡驱动 | 支持 CUDA 12.x | ComfyUI 便携版自带 cu130 版 PyTorch,驱动较新即可 |
关于 2K 分辨率的说明:模型原生支持最高 15 秒、2K(2560×1440)输出,但该能力面向云端高性能环境。本教程的消费级显卡场景实际出片范围是 480p–768p(768P 即
1344×768已接近 16GB 显存上限,2K 像素量约为其 5 倍,必然 OOM)。ComfyUI 官方在 ModelScope 发布了针对消费级显卡重新打包的量化模型(
Comfy-Org/MiniMax-H3),将 Qwen3-VL 编码器从 66.7GB 压缩到约 14.6GB(NVFP4),DiT 主模型压缩到约 19.5GB(INT8),合计约 40GB,是本教程在消费级显卡上部署的前提。
2. 环境准备与 ComfyUI 安装
整体部署流程如下:
NVIDIA 显卡 12 / 16GB 显存] --> B[安装 ComfyUI
便携版解压运行] B --> C[下载 MiniMax H3 模型
ModelScope 约 40GB] C --> D[模型放入 models 目录
diffusion_models / text_encoders / vae] D --> E[加载工作流模板
T2V 或 I2V] E --> F[生成音视频
消费级显卡出片] classDef input fill:#e8f4f8,stroke:#1a6b8a,stroke-width:2px classDef process fill:#d5f5e3,stroke:#27ae60,stroke-width:2px classDef model fill:#ffecd6,stroke:#e67e22,stroke-width:2px classDef output fill:#fdebd0,stroke:#b7950b,stroke-width:2px class A input class B,C,D process class E model class F output
2.1 确认硬件与驱动
开始前先确认显卡型号、显存大小以及驱动是否满足条件。在 PowerShell 中运行:
nvidia-smi
nvidia-smi 会显示显卡型号、驱动版本与显存总量。确认满足第 1.5 节的要求:NVIDIA 显卡,显存 12GB 或 16GB+,驱动较新(支持 CUDA 12.x)。ComfyUI 便携版自带 CUDA 版 PyTorch,无需单独安装系统级 CUDA Toolkit。
若 nvidia-smi 无输出,说明显卡驱动未安装或不是 NVIDIA 显卡,需先安装驱动。
2.2 下载并解压 ComfyUI 便携版
前往 ComfyUI 网盘下载地址(网盘优先,下载速度快),或 ComfyUI 官方 Releases 页面,下载 ComfyUI_windows_portable_nvidia.7z(建议 v0.30.0 及以上版本,自带 torch 2.9.1+cu130,无需单独安装 PyTorch):

解压到目标目录(例如 D:/ComfyUI),便携版目录结构如下:
ComfyUI/
├── ComfyUI/ # 主程序与模型目录
│ ├── models/ # 所有模型统一放置于此
│ │ ├── diffusion_models/ # 扩散主模型(DiT)
│ │ ├── text_encoders/ # 文本/多模态编码器
│ │ └── vae/ # VAE 解码器
│ └── custom_nodes/ # 自定义节点目录
├── python_embeded/ # 内置 Python 与依赖
└── run_nvidia_gpu.bat # NVIDIA 显卡启动脚本
2.3 启动与验证 ComfyUI
双击解压目录下的 run_nvidia_gpu.bat 启动 ComfyUI,等待终端输出启动地址后,用浏览器打开 http://127.0.0.1:8188:
# 启动后终端出现如下提示即说明启动成功
Starting server
To see the GUI go to: http://127.0.0.1:8188
提示:首次启动会加载内置基础模型(ComfyUI 默认自带一个小型文生图工作流),可在页面左侧上传或选择默认工作流,点击「运行」确认能正常出图,从而验证 PyTorch 与显卡驱动工作正常。若此处报
CUDA out of memory或驱动错误,先解决环境问题再继续。
3. 下载并放置 MiniMax H3 模型
3.1 模型文件总览
官方整理版仓库 Comfy-Org/MiniMax-H3 的文件目录结构与 ComfyUI 的 models/ 完全一致。网盘打包资源共含 5 个文件(合计约 60GB),本教程演示的文生视频 / 图生视频场景至少需要其中 4 个 FL2VA 相关文件(合计约 40GB):
| 文件 | 大小 | 放置目录 | 作用 |
|---|---|---|---|
minimax_h3_fl2va_pruned_int8_convrot.safetensors |
19.53GB | models/diffusion_models/ |
FL2VA 扩散主模型(DiT,INT8 量化) |
minimax_h3_ref2va_pruned_int8_convrot.safetensors |
约 19.5GB | models/diffusion_models/ |
Ref2VA 扩散主模型(DiT,INT8 量化) |
qwen3vl_32b_minimax_h3_nvfp4_awq.safetensors |
14.61GB | models/text_encoders/ |
Qwen3-VL 文本/多模态编码器(NVFP4 量化) |
minimax_h3_video_vae_fp16.safetensors |
4.85GB | models/vae/ |
视频 VAE,负责画面解码 |
minimax_h3_audio_vae_fp32.safetensors |
0.56GB | models/vae/ |
音频 VAE,负责双声道音频解码 |
选型要点:
- DiT 主模型使用
pruned_int8_convrot(19.5GB),是 16GB 显存的主流选择;INT8 ConvRot 相比 4bit 量化能保留更多运动细节。 - Qwen3-VL 编码器使用
nvfp4_awq(14.6GB),比 INT8 版(约 25.3GB)节省约 10GB 磁盘;编码器只做提示词编码、负载轻,8GB 显存显卡也实测可跑通。 - Ref2VA 模型教程不演示 Ref2VA 的实际生成流程,模型供第 5.3 节全模态参考模式使用。
3.2 Minimax H3模型下载
你可以从 MiniMax H3 模型网盘下载地址 直接下载模型(下载速度快),也可以使用 ModelScope 官方仓库下载,支持断点续传。先安装 modelscope 命令行工具:
# 安装 modelscope(国内源加速)
pip install modelscope -i https://pypi.tuna.tsinghua.edu.cn/simple
使用 modelscope CLI 下载 4 个核心文件到 D:/models/minimax_h3:
modelscope download --model Comfy-Org/MiniMax-H3 \
diffusion_models/minimax_h3_fl2va_pruned_int8_convrot.safetensors \
text_encoders/qwen3vl_32b_minimax_h3_nvfp4_awq.safetensors \
vae/minimax_h3_video_vae_fp16.safetensors \
vae/minimax_h3_audio_vae_fp32.safetensors \
--local_dir D:/models/minimax_h3
提示:若使用 ModelScope 自行下载且需要 Ref2VA,追加一行
diffusion_models/minimax_h3_ref2va_pruned_int8_convrot.safetensors一并下载即可。
3.3 放入 ComfyUI models 目录
下载完成后,D:/models/minimax_h3 目录内是 diffusion_models/、text_encoders/、vae/ 三个子目录,与 ComfyUI 的 models/ 目录一一对应。不要整体拷贝——ComfyUI 的 models/ 下还有其他模型子目录(checkpoints/、loras/ 等),需按目录结构将每个模型文件分别拷入对应的子目录。
放置后的最终结构:
ComfyUI/ComfyUI/models/
├── diffusion_models/
│ ├── minimax_h3_fl2va_pruned_int8_convrot.safetensors
│ └── minimax_h3_ref2va_pruned_int8_convrot.safetensors # 网盘已包含,Ref2VA 模式专用
├── text_encoders/
│ └── qwen3vl_32b_minimax_h3_nvfp4_awq.safetensors
└── vae/
├── minimax_h3_video_vae_fp16.safetensors
└── minimax_h3_audio_vae_fp32.safetensors
模型放置完成后重启 ComfyUI(关闭启动窗口重新双击 run_nvidia_gpu.bat),让程序扫描到新模型。
4. 文生视频工作流(T2V)
4.1 加载 MiniMax H3 工作流模板
ComfyUI 自带的模板库中已内置 MiniMax H3 工作流。在浏览器页面点击 浏览模板,搜索关键词 MiniMax H3,选择 T2V(Text-to-Video)文生视频工作流 并加载:

4.2 认识工作流核心节点
加载模板后,工作流会按 Models(模型加载)→ Conditioning(条件)→ Sampling(采样)→ Decoding and create video(解码与合成视频) 四段组织,核心环节如下:
CLIPLoader] C[FL2VA 扩散模型
UNETLoader] H1[视频 VAE] H2[音频 VAE] end subgraph COND[Conditioning 条件] A[文本提示词] R[分辨率选择器
16:9 / 864×480] end subgraph SMP[Sampling 采样] D[采样器去噪
KSampler] end subgraph DEC[Decoding and create video 解码与合成] E[视频 VAE 解码
VAEDecode] F[音频 VAE 解码
VAEDecodeAudio] G[CreateVideo 合成输出] end A --> B R --> D B --> D C --> D D --> E D --> F E --> G F --> G classDef input fill:#d6eaf8,stroke:#1a6b8a,stroke-width:2px classDef model fill:#ffecd6,stroke:#e67e22,stroke-width:2px classDef process fill:#d5f5e3,stroke:#27ae60,stroke-width:2px classDef output fill:#fdebd0,stroke:#b7950b,stroke-width:2px class A,R input class B,C,H1,H2 model class D,E,F process class G output
- Models(模型加载):加载四类模型——Qwen3-VL 编码器、FL2VA 扩散主模型,以及视频 / 音频两个 VAE。分别指向
models/diffusion_models/、models/text_encoders/、models/vae/下对应的模型文件。 - Conditioning(条件):输入文本提示词,并通过分辨率选择器设定画布宽高比与分辨率(如 16:9、
864×480)。 - Sampling(采样):采样器负责去噪,接受编码器输出与扩散模型共同引导生成。
- Decoding and create video(解码与合成视频):采样输出同时送入视频 VAE 与音频 VAE,最终由
CreateVideo节点合成为带音轨的视频。

关键:要让输出包含原生音频,采样器的输出必须同时接入视频 VAE 和音频 VAE,且两者都连到
CreateVideo节点。若只接了视频 VAE,生成的视频会没有声音。
4.3 参数配置详解
在提示词节点输入画面描述(支持中文),并核对 H3 节点上的以下参数:
| 参数 | 说明 | 消费级显卡建议 |
|---|---|---|
prompt(提示词) |
描述画面内容、镜头、风格 | 描述越具体越好 |
width / height |
输出分辨率,必须是 32 的倍数 | 抽卡 864×480,成片 1344×768 |
duration(时长) |
视频时长,单位秒,自动换算帧数 | 3–5 秒;帧数需满足 n % 17 == 5,约 124 帧 ≈ 5.17 秒 |
noise_seed(随机种子) |
控制生成随机性,固定种子可复现 | 出片后固定种子,便于微调复现 |
steps(步数) |
采样器节点上的去噪步数 | 8–20 步 |
H3 节点按「时长(秒)」配置,而非帧数,帧数由时长换算并受
n % 17 == 5约束。steps(步数)不在 H3 节点上,需到 Sampling 段的采样器节点(KSampler) 中调整;H3 节点面板只含分辨率、时长、种子与模型绑定参数。H3 是 guidance-distilled(引导蒸馏)检查点,无cfg引导强度参数,也不支持负向提示词,模板默认配置即可。

上图是 T2V 工作流的参数面板实拍。分辨率选择器提供 16:9 / 9:16 等预设宽高比,
width/height为固定组合,由「百万像素(megapixels)× 倍数」共同决定,并自动对齐到 32 的倍数——选择百万像素后宽高即锁定,如 16:9 下 0.4MP 对应864×480、0.5MP 对应960×544,不能随意单独修改;下方还可设置duration(秒)、noise_seed(随机种子),并绑定unet_name、clip_name与双 VAE 模型文件。
MiniMax H3 不支持负向提示词:H3 是 guidance-distilled(引导蒸馏)检查点,没有 negative_prompt。想要排除的内容(如"模糊、变形")直接以文本形式写在提示词末尾即可,例如:
一只金毛犬在草地上奔跑,阳光明媚,写实风格,特写镜头,画面清晰,动作自然流畅,不要模糊,不要出现多余肢体
4.4 生成与导出
配置完成后,点击 「运行」 开始生成。首次生成需加载模型,等待较久属正常现象。生成完成后,CreateVideo 节点会输出带原生双声道音频的 MP4 文件。
提示:生成过程中若显存不足报
CUDA out of memory,优先将分辨率降到864×480、时长降到约 5 秒、步数降到 8 步。16GB 显卡在1344×768下峰值显存约 15.6GB,接近上限,极易 OOM。
4.5 完整示例:雨夜狙击——子弹穿窗
下面以一段「雨夜狙击」短片为例,演示从分镜提示词到参数面板的完整配置过程。
场景设定
对面高层公寓楼内,目标在窗边打电话,狙击手已在对面楼顶就位。这是暗杀行动的最后一刻。
3 秒分镜
| 时间 | 画面 |
|---|---|
| 0s–1s | Shot 1:狙击镜视角,十字准星缓缓锁定对面窗户内走动的人影,呼吸使准星微微晃动,雨滴打在镜头上。 |
| 1s–2s | Shot 2:侧面中景,狙击手手指收紧扳机,脸颊贴枪托,雨水顺着他下颌滑落,眼神冰冷。 |
| 2s–3s | Shot 3:对面窗户玻璃猛然炸裂成碎片,子弹穿过瞬间带起气浪与碎玻璃飞溅,慢动作,目标身影向后倒去,画面在玻璃碎片定格。 |
视觉
冷蓝青色调,城市夜景霓虹倒映在湿漉漉的地面,大量雨水和雾气,变形宽银幕,浅景深,胶片颗粒,写实质感。每个镜头独立角度,硬切无叠化,射击瞬间轻微镜头抖动。
音频
雨声、城市底噪、低频配乐,1s 扣扳机时无枪声只有机械咔嗒轻响,2s 玻璃炸裂时配乐爆发重低音冲击,定格后余音持续 1s 收尾。
无任何文字、字幕、LOGO、水印,非动画、非 CG 渲染,纯实拍电影质感。
将上述设定组织为一条连贯提示词输入提示词节点:
雨夜狙击,对面高层公寓楼内,目标在窗边打电话,狙击手已在对面楼顶就位,这是暗杀行动的最后一刻。
Shot 1 狙击镜视角,十字准星缓缓锁定对面窗户内走动的人影,呼吸使准星微微晃动,雨滴打在镜头上。
Shot 2 侧面中景,狙击手手指收紧扳机,脸颊贴枪托,雨水顺着他下颌滑落,眼神冰冷。
Shot 3 对面窗户玻璃猛然炸裂成碎片,子弹穿过瞬间带起气浪与碎玻璃飞溅,慢动作,目标身影向后倒去,画面在玻璃碎片定格。
冷蓝青色调,城市夜景霓虹倒映在湿漉漉的地面,大量雨水和雾气,变形宽银幕,浅景深,胶片颗粒,写实质感,每个镜头独立角度,硬切无叠化,射击瞬间轻微镜头抖动。
雨声,城市底噪,低频配乐,扣扳机时无枪声只有机械咔嗒轻响,玻璃炸裂时配乐爆发重低音冲击,定格后余音持续收尾。
无任何文字、字幕、LOGO、水印,非动画、非CG渲染,纯实拍电影质感。
参数面板
| 配置项 | 值 | 说明 |
|---|---|---|
宽高比 |
16:9(Widescreen) | 电影宽银幕比例 |
分辨率 |
864×480 |
0.4MP 预设,32 倍数对齐 |
duration |
3.0 秒 | 对应约 73 帧,满足 n % 17 == 5 |
noise_seed |
固定种子 | 出片后锁定种子便于复现微调 |
unet_name |
minimax_h3_fl2va_pruned_int8_convrot.safetensors |
FL2VA 扩散主模型 |
clip_name |
qwen3vl_32b_minimax_h3_nvfp4_awq.safetensors |
Qwen3-VL 文本编码器 |
vae_name |
minimax_h3_video_vae_fp16.safetensors |
视频 VAE |
audio_vae |
minimax_h3_audio_vae_fp32.safetensors |
音频 VAE |
帧数受
n % 17 == 5约束,3 秒目标取最接近的 73 帧(约 3.04 秒)。射击定格等关键帧节奏由分镜提示词控制,模型会按文字描述的镜头顺序生成。
5. 图生视频工作流(I2V)
FL2VA 检查点天然支持图像条件输入,因此图生视频无需更换模型,只需切换工作流模板并上传图像即可。
5.1 首帧图生视频(I2V)
在模板库中搜索 MiniMax H3,选择 I2V(Image-to-Video)图生视频工作流 加载。在图生视频模板中,提示词旁会有一个图像输入节点(如 LoadImage),操作步骤:
- 上传一张首帧图片(建议分辨率 32 倍数对齐,如
832×480) - 在提示词节点描述画面后续运动,如"人物转身,镜头缓缓推近"
- 点击 「运行」,模型将以该图片为起点生成后续视频
5.2 首尾帧生视频
在 I2V 工作流中额外上传一张尾帧图片,模型会在首帧与尾帧之间生成连贯的过渡视频,适合实现"起止画面确定、中间过程补全"的镜头:
| 输入 | 输出 | 适用场景 |
|---|---|---|
| 仅首帧 | 从首帧出发的视频 | 单张定妆照的运镜与动态化 |
| 首帧 + 尾帧 | 首尾之间的过渡视频 | 转场、补间、关键帧插值 |
5.3 全模态参考模式 Ref2VA
Ref2VA 是 H3 的进阶能力,可在同一次扩散过程中同时参考图像、视频与音频多类素材生成音视频——例如参考人物身份、动作与音色,让人物说出新的对白。它使用独立的 Ref2VA 检查点,与 FL2VA 的模型文件不通用,需要按以下步骤启用。
第一步:确认 Ref2VA 模型
Ref2VA 使用独立的 DiT 主模型(约 19.5GB),文本编码器与双 VAE 与 FL2VA 完全复用:
| 文件 | 大小 | 放置目录 |
|---|---|---|
minimax_h3_ref2va_pruned_int8_convrot.safetensors |
约 19.5GB | models/diffusion_models/ |
第二步:导入 Ref2VA 工作流
ComfyUI 默认模板库主要内置 FL2VA 的 T2V / I2V 工作流,Ref2VA 工作流需从社区仓库导入,常用仓库如下:
| 仓库 | 说明 |
|---|---|
ComfyUI_MiniMaxH3_Director |
提供 R2V(多参考生视频)、RV2V(视频换人)、V2V(逐段编辑)等现成工作流 |
minimax-h3-comfyui |
提供 Reference-to-Video 节点,含 5 个图片槽、3 个视频槽、2 个音频槽 |
minimax-h3-hybrid-cond |
支持 Ref2VA 与 FL2VA 混合条件(首帧 + 参考图结合在同一条提示中) |
将仓库克隆到 ComfyUI/custom_nodes/ 后重启 ComfyUI,把工作流 JSON 拖入页面即可。
第三步:上传参考素材并编写提示词
最多 9 张] --> D[Qwen3-VL 编码器
理解多模态参考] B[参考视频
最多 3 段] --> D C[参考音频
最多 3 段] --> D D --> E[Ref2VA DiT 去噪
多参考条件引导] E --> F[视频 / 音频 VAE 解码] F --> G[带原生音轨的视频输出] classDef input fill:#d6eaf8,stroke:#1a6b8a,stroke-width:2px classDef model fill:#ffecd6,stroke:#e67e22,stroke-width:2px classDef process fill:#d5f5e3,stroke:#27ae60,stroke-width:2px classDef output fill:#fdebd0,stroke:#b7950b,stroke-width:2px class A,B,C input class D,E model class F process class G output
在提示词中用标签绑定参考素材:<Picture 1> 指代第 1 张参考图、<Video 1> 指代第 1 段参考视频、<Audio 1> 指代第 1 段参考音频,并在句子中说明每个素材如何影响画面:
以 <Picture 1> 的人物作为主体,借鉴 <Video 1> 的运动方式,配合 <Audio 1> 的语音氛围,人物开口说话,镜头缓缓推近,写实风格
第四步:生成与限制
- 必须有参考素材:至少提供 1 张图像或 1 段视频;音频参考为辅助,不能作为唯一输入
- 音频/视频参考依赖:处理视频与音频参考需安装
ffmpeg与ffprobe并加入系统 PATH - 帧数约束:H3 输出帧数需满足
n % 17 == 5(24FPS),例如 124 帧约 5.17 秒,因此不存在恰好 6 秒的 H3 视频 - 身份一致性:人物身份由模型与参考素材共同约束,无硬性身份锁,长视频需在段落衔接处人工核对
建议先生成 5 秒短片段确认脸部、服装与动作符合预期,再扩展到完整时长,避免长视频返工。若暂时用不到多模态参考,先跑通 FL2VA 的文生视频与图生视频即可。
6. 总结
6.1 核心内容回顾
- 全模态模型:MiniMax H3 统一理解文本、图像、视频与音频,输出带原生双声道音频的视频,最高 15 秒 2K、24FPS
- 双检查点:FL2VA 负责文生视频与首尾帧生视频,Ref2VA 负责多模态参考生视频
- 核心架构:双 VAE(16×空间 / 4×时间压缩)、Qwen3-VL 编码器、33B DiT 生成引擎
- 三级流程:Context-IR 理解 → H3-Base 去噪生成 → Regenerate-2K 高分辨率重生成
- 消费级部署:ComfyUI 便携版 + ModelScope 官方量化模型(约 40GB),16GB 显存稳定、12GB 最低
- 两大场景:文生视频与图生视频均基于 FL2VA,切换工作流模板即可
- 完整示例:以「雨夜狙击——子弹穿窗」3 秒分镜为例,演示从提示词组织到参数面板(16:9、
864×480、73 帧)的完整配置 - Ref2VA 实战:额外下载 Ref2VA 检查点(约 19.5GB),通过社区工作流以
<Picture>/<Video>/<Audio>标签绑定多类参考素材 - 性能优化:生成提速与低显存调优详下节ComfyUI本地部署MiniMax H3性能优化教程(正在编制中,敬请期待)
6.2 常见问题与解答
问:8GB 显存能跑 MiniMax H3 吗?
答:社区验证的最低门槛约为 12GB 显存(低分辨率),8GB 显存可能无法直接运行完整模型。
问:生成视频没有声音怎么办?
答:检查工作流中采样器输出是否同时接入了视频 VAE 与音频 VAE,两个 VAE 都必须连到 CreateVideo 节点。若工作流只保留了视频解码路径,补上音频 VAE 节点即可。
问:为什么我的负向提示词没有效果?
答:MiniMax H3 是 guidance-distilled 检查点,本身不支持负向提示词。把不想要的内容(如"模糊、变形")以自然语言写在提示词末尾,模型会在生成时主动规避。
问:生成过程中报显存不足(OOM)?
答:将分辨率降到 864×480或更低、时长降到约 5 秒;步数(steps)在 Sampling 段采样器节点(KSampler) 中降到 8 步;关闭其他占用显存的程序(浏览器、游戏、本地大模型)。保持 ComfyUI Dynamic VRAM 开启,不要添加 --disable-dynamic-vram。
问:模型可以商用吗?
答:MiniMax H3 开源协议排除了美/欧/英/韩地区的使用,中国地区可用。商用或出海前请自查协议原文,遵守当地法律法规。
举手提问