面向:2×Xeon E5-2680 v4 · 64GB DDR4-2133 · RTX 5060 Ti 16G · 1TB 固态。 目标:在本地 ComfyUI 里生成带原生立体声的短视频。
先说结论:能跑通,但要管好预期。 真正的瓶颈不是那张 5060 Ti,而是这台机器的 PCIe 3.0 ×8 通道和 64GB 内存——H3 是 33B 稠密模型,16G 显存装不下, 必须把大部分权重放在内存里来回搬运,而搬运速度被你 2016 年的老平台卡住了。 所以:768p、5~8 秒片段是现实目标,单条耗时以“十几分钟”量级起步,优化后才可能压到个位数分钟。
「MiniMax H3」=「海螺3」=「Hailuo 3」,是同一款模型的不同叫法。
MiniMax(稀宇科技)于 2026 年 7 月 31 日发布、8 月 3 日公开权重的 通用全模态音视频生成系统。它不是“文生视频小模型”: 它把文字、图片、视频、音频放进同一个上下文理解,并且 在同一次前向传播里同时生成画面和 32kHz 立体声——口型、音效、环境音天然对齐, 不是后期配音贴上去的。
| 规格 | 数值 | 对你的影响 |
|---|---|---|
| 参数量 | 330 亿(33B)稠密,非 MoE | 每帧全部参数参与计算,这就是它吃资源的原因 |
| 本地分辨率 | 短边 768px(16:9 ≈ 1344×768,约 0.98MP) | 本地只能出这个档 |
| 2K 输出 | 走 MiniMax 托管服务(Context-IR + Regenerate-2K) | 2K 不是纯本地能力,别被标题党骗 |
| 时长 / 帧率 | 4~15 秒(整数)· 24fps | 单次片段上限 15 秒 |
| 音频 | 原生 32kHz 立体声,11 种语言口型 | 提示词不写声音,它会自己猜 |
| 两套权重 | FL2VA(文生/首尾帧)· Ref2VA(多参考) | 按需下载,别两个都下(每个都很大) |
| 参考上限 | 9 图 + 3 视频 + 3 音频,混合最多 12 个文件 | Ref2VA 最吃资源 |
| 授权 | H3 Community License(开源权重,非 OSI 开源) | 见下文「授权边界」 |
公开的只有 H3-Base 基座权重(本地产 768p)。 H3-Regenerate-2K 和 H3-Context-IR 属于完整系统里的托管模块, 没有开放权重、本地跑不了。看到“33B + 2K + 全离线”的宣传,请默认它是错的。
逐项过一遍,哪些是优势、哪些是硬伤、哪些可以调。
| 部件 | 你的配置 | 判断 | 说明与建议 |
|---|---|---|---|
| CPU | 2×Xeon E5-2680 v4 (28核56线程) |
够用 | Broadwell-EP,只有 AVX2、无 AVX-512。但 H3 的重计算在 GPU,CPU 主要负责调度与搬运,够用。核多对 offload 和 VAE 分块略有帮助。 |
| 内存 | 64GB DDR4-2133 | 偏紧 | 模型组件峰值驻留约 35~40GB,系统再占 5~8GB,64G 能过但没余量。务必关掉浏览器、Docker、其他大内存程序。预算允许建议加到 96~128GB。频率 2133 低于 2400 规格,带宽略损。 |
| 显卡 | RTX 5060 Ti 16G | 可行 | Blackwell(sm_120),必须用 CUDA 12.8+ / PyTorch 2.7+ 的版本,驱动 570+。16G 属于“能跑、靠 offload”档,装不下完整模型。 |
| 总线 | PCIe 3.0(X99/C612 平台) | 主瓶颈 | 5060 Ti 是 PCIe 5.0 ×8 的卡,插在 3.0 槽位只能跑 3.0 ×8(约 6~7GB/s)。H3 靠 offload,权重频繁在内存↔显存之间搬,这条路越窄,出片越慢。 |
| 硬盘 | 1TB 固态 | 够放 | 模型约 40GB + 环境约 20~40GB,1TB 放得下。但要确认是 NVMe 而不是 SATA:SATA 首次加载慢得多,offload 也受拖累。 |
| BIOS | 服务器/工作站主板 | 必须检查 | 50 系卡对新平台特性更敏感,务必按下面「BIOS 四件事」逐条设置。 |
| 电源/机箱 | — | 确认 | 5060 Ti 16G 约 180W,需 1×8-pin PCIe 供电。服务器电源常是专用接口,可能要用转接线;2U 机箱要确认显卡长度和散热空间。 |
现代 NVIDIA 大显存卡的必要条件。关闭时轻则不识别、重则点不亮。
X99/C612 老主板多数没有这项。没有 ReBAR 也能用,但显存访问效率略降。部分 X99 主板有社区改版 BIOS 可开启,有风险,谨慎。
50 系卡依赖 UEFI GOP。若主板处于 Legacy/CSM 模式,可能直接黑屏无输出。
双路平台关键项。开启后系统看到统一内存,两个 CPU 的内存带宽都能用上;否则单进程往往只吃一个节点的带宽。
社区实测里,RTX 5060 Ti 16G 在较新的平台上用 Turbo LoRA 跑 768×448 的 5 秒片段, 可以做到“约 2 分钟一条”。但你多了一道 PCIe 3.0 ×8 的闸门, 实际耗时大概率明显高于此。把它当成“能稳定出片、但需要耐心”的工作站,而不是实时工具。
原则:能走魔搭就走魔搭,Hugging Face 一律走镜像,大文件一律用多线程工具并支持断点续传。
| 要下载的东西 | 国内首选渠道 | 备选 |
|---|---|---|
| ComfyUI 本体 | 秋叶整合包(B 站 @秋葉aaaki,官网/网盘发布)或 ComfyUI 官网桌面版 comfy.org |
GitHub Release:Comfy-Org/ComfyUI → ComfyUI_windows_portable_nvidia.7z(直连慢可用 ghproxy 类镜像) |
| H3 模型(ComfyUI 适配版) | 魔搭 ModelScopemodelscope.cn/models/Comfy-Org/MiniMax-H3 |
Hugging Face 镜像 hf-mirror.com(设 HF_ENDPOINT) |
| H3 官方原始权重(全精度) | 魔搭 modelscope.cn/models/MiniMax/MiniMax-H3 |
HF MiniMaxAI/MiniMax-H3(约 498GB,家用别下) |
| 更省显存的 GGUF 量化版 | 魔搭 modelscope.cn/models/leejet/MiniMax-H3-GGUF |
需配 leejet/ComfyUI-GGUF 节点 |
| 工作流模板 | ComfyUI 自带「模板库」直接打开(推荐) | GitHub Comfy-Org/workflow_templates |
| 自定义节点 / 加速 | ComfyUI-Manager(可在设置里配国内镜像) | GitHub 仓库直接 clone |
下面是你真正需要下载的四个文件(以 FL2VA 文生/图生视频流程为例)。 括号内为磁盘占用,合计约 40GB。
| 用途 | 文件名 | 大小 | 存放目录 |
|---|---|---|---|
| 扩散主模型 | minimax_h3_fl2va_pruned_int8_convrot.safetensors | ≈19.5GB | models/diffusion_models/ |
| 文本编码器 | qwen3vl_32b_minimax_h3_nvfp4_awq.safetensors | ≈14.6GB | models/text_encoders/ |
| 视频 VAE | minimax_h3_video_vae_fp16.safetensors(也可能是 ..._int8_convrot 版,以仓库 vae/ 目录实际文件名为准) | ≈4.9GB | models/vae/ |
| 音频 VAE | minimax_h3_audio_vae_fp32.safetensors | ≈0.6GB | models/vae/ |
| (可选)加速 LoRA | minimax_h3_fl2v_turbo_8step_v1.0_comfyui_bf16.safetensors | 较小 | models/loras/ |
| (可选,做多参考) | minimax_h3_ref2va_pruned_int8_convrot.safetensors | ≈20GB | models/diffusion_models/ |
fl2va = 文生视频 / 首尾帧;ref2va = 多参考生成。
pruned = 剪枝过(推荐);int8_convrot / fp8_scaled / w6a8 / bf16 是不同量化精度,选哪个取决于你的 torch 版本,见第 03 节。
先装 aria2(Windows 可用 scoop install aria2 或官网 zip 解压)。
魔搭的直链规律是
modelscope.cn/models/<仓库>/resolve/master/<路径>。
把下面的 D:\ComfyUI 换成你的实际路径,逐条执行:
:: 扩散主模型(文生视频 / 图生视频 / 首尾帧)
aria2c -c -x16 -s16 -k8M --file-allocation=none ^
-d "D:\ComfyUI\models\diffusion_models" ^
-o minimax_h3_fl2va_pruned_int8_convrot.safetensors ^
"https://modelscope.cn/models/Comfy-Org/MiniMax-H3/resolve/master/diffusion_models/minimax_h3_fl2va_pruned_int8_convrot.safetensors"
:: 文本编码器
aria2c -c -x16 -s16 -k8M --file-allocation=none ^
-d "D:\ComfyUI\models\text_encoders" ^
-o qwen3vl_32b_minimax_h3_nvfp4_awq.safetensors ^
"https://modelscope.cn/models/Comfy-Org/MiniMax-H3/resolve/master/text_encoders/qwen3vl_32b_minimax_h3_nvfp4_awq.safetensors"
:: 视频 VAE + 音频 VAE
:: 说明:音频 VAE 官方只有 fp32 版;视频 VAE 请先打开仓库的 vae/ 目录,
:: 按实际存在的文件名(fp16 或 int8_convrot)替换下面第一条命令里的 -o 与 URL
aria2c -c -x16 -s16 -k8M --file-allocation=none ^
-d "D:\ComfyUI\models\vae" ^
-o minimax_h3_video_vae_fp16.safetensors ^
"https://modelscope.cn/models/Comfy-Org/MiniMax-H3/resolve/master/vae/minimax_h3_video_vae_fp16.safetensors"
aria2c -c -x16 -s16 -k8M --file-allocation=none ^
-d "D:\ComfyUI\models\vae" ^
-o minimax_h3_audio_vae_fp32.safetensors ^
"https://modelscope.cn/models/Comfy-Org/MiniMax-H3/resolve/master/vae/minimax_h3_audio_vae_fp32.safetensors"
参数说明:-c 断点续传;-x16 -s16 16 线程;-k8M 分块 8MB;
--file-allocation=none 避免预分配大文件时卡顿。断了就重跑同一条命令,会自动续传。
:: 永久写入用户环境变量(Windows)
setx HF_ENDPOINT "https://hf-mirror.com"
:: 装 CLI 后,只拉需要的文件(--include 很重要,否则会下整个仓库)
pip install -U "huggingface_hub[cli]"
hf download Comfy-Org/MiniMax-H3 ^
--include "diffusion_models/minimax_h3_fl2va_pruned_int8_convrot.safetensors" ^
"text_encoders/qwen3vl_32b_minimax_h3_nvfp4_awq.safetensors" ^
"vae/*" ^
--local-dir D:\models\MiniMax-H3
国内很多教程会引导你去夸克网盘下“一键整合包”。它确实省事,但要注意两点: ① 来源不明,体积巨大,可能夹带旧版 torch 或改过的节点; ② 装完仍要自己核对 torch/CUDA 版本是否匹配 5060 Ti。 能用魔搭直连,就尽量自己下官方文件。
这一步选错,后面不是跑不动,而是性能和质量都差一截。这是 50 系新卡最容易踩的坑。
Comfy-Org 官方仓库白纸黑字写着:“扩散模型优先用 int8_convrot,前提是你的 PyTorch 是 cu130 构建。fp8_scaled 只在你用不了 int8_convrot 时才用。”
而实测发现:当 CUDA 版本 < 13 时,ComfyUI 自带的 comfy-kitchen 加速后端会被直接禁用,int8_convrot 根本用不了。也就是说——cu128 的 torch 只能退而求其次用 fp8。
nvidia-smi 看右上角)
int8_convrot,这是最优解。
*_pruned_int8_convrot.safetensors。
*_pruned_fp8_scaled.safetensors。
:: 在 ComfyUI 的 Python 环境里重装
pip install --index-url https://download.pytorch.org/whl/cu130 torch torchvision
pip install --index-url https://download.pytorch.org/whl/cu130 --force-reinstall --no-deps torchaudio
:: 校验:三者必须都是 cu130
python -c "import torch, torchaudio; print(torch.__version__, torch.version.cuda)"
如果报 Detected that PyTorch and TorchAudio were compiled with different CUDA versions,
就是 torch 升了、torchaudio 没跟上。用上面那条 --force-reinstall --no-deps torchaudio 强制对齐即可。
启动后看日志,出现 Found comfy_kitchen backend cuda: {'available': True, 'disabled': False}
才说明加速后端真的启用了。
pip install --index-url https://download.pytorch.org/whl/cu128 torch torchvision torchaudio
:: 验证:能识别显卡 + 能真正做一次计算
python -c "import torch; print(torch.cuda.get_device_name(0)); a=torch.randn(1024,1024,device='cuda'); print((a@a).sum().item())"
只看到 is_available() = True 不算数——老版 torch 会对 sm_120 报警告、结果偷偷退回 CPU。必须跑一次真实矩阵运算。
秋叶等整合包会锁定 torch/CUDA/Python 的版本组合。它的好处是稳定, 坏处是默认版本未必是 cu130。装完先在启动器里看 torch 版本, 按上面方案 A/B 调整后再继续。
假设你已经装好带 cu128/cu130 torch 的 ComfyUI,并且下载器准备就绪。
到 NVIDIA 官网下最新版驱动(建议 580.x 或更新),装完重启,用 nvidia-smi 确认:
能看到 RTX 5060 Ti、显存 16384MiB、CUDA Version ≥ 12.8(cu130 路线则 ≥ 13.0)。
三条路任选:
start.bat,用启动器自带的「更新」把版本推到最新。ComfyUI_windows_portable_nvidia.7z,解压运行 run_nvidia_gpu.bat。comfy.org 下载安装,客户端里点更新。基础 T2V / I2V / R2V 模板需要 0.30.0+; 多帧参考需要 0.34.0;Fun ControlNet、稀疏注意力、注意力后端需要 0.35.0; FastH3 需要 0.36.0。老版本根本没有 H3 节点,装再多模型也认不出来。 装完在界面右下角确认版本号。
路径要求:安装目录绝对不要有中文或空格,例如 D:\ComfyUI 是安全的,D:\我的软件\AI 模型 会出各种诡异问题。
用第 02 节的 aria2 命令下载。放好之后,目录结构应该长这样:
D:\ComfyUI\
├── models\
│ ├── diffusion_models\
│ │ └── minimax_h3_fl2va_pruned_int8_convrot.safetensors
│ ├── text_encoders\
│ │ └── qwen3vl_32b_minimax_h3_nvfp4_awq.safetensors
│ ├── vae\
│ │ ├── minimax_h3_video_vae_fp16.safetensors
│ │ └── minimax_h3_audio_vae_fp32.safetensors
│ └── loras\
│ └── minimax_h3_fl2v_turbo_8step_v1.0_comfyui_bf16.safetensors
├── custom_nodes\
├── input\
└── output\
扩散模型放 diffusion_models/,文本编码器放 text_encoders/,
两个 VAE 都放 vae/。放错地方,节点下拉框里就是空的,也不会报错提示你。
也可以在界面里按 Ctrl+R 刷新模型列表,然后在节点下拉框里手动选中你下载的模型。
第一次的目标不是好看,是确认链路通。建议:
| 参数 | 首次建议值 | 之后可以 |
|---|---|---|
| 分辨率(百万像素) | 0.2~0.3(如 768×448) | 逐步升到 0.98(1344×768 原生画布) |
| 时长 | 5 秒(先别碰 10 秒) | 最长 15 秒 |
| 步数 | 20(base)或开 Turbo 后 8 | 看内容复杂度调 |
| 采样器 / 调度器 | res_multistep + simple | 保持默认 |
| 尺寸对齐 | 宽高必须是 32 的整数倍,否则画面抽搐或报错 | |
第一次会特别慢——要编译 kernel、建立缓存、把权重从硬盘读进来。 十几分钟甚至更久都正常。第二次起会快一些(部分权重还留在内存里)。
两个手段,可以叠加:
github.com/woct0rdho/SageAttention/releases,
按你的 PyTorch / CUDA 版本下载对应 wheel,pip install <wheel文件>。kijai/ComfyUI-KJNodes(放到 custom_nodes/ 后重启)。Patch Sage Attention KJ 节点,
把它接在 UNETLoader 与 BasicGuider 之间,
sage_attention 设为 auto。官方在同一个 Comfy-Org 仓库里提供了蒸馏 LoRA,放进 models/loras/,
然后在 H3 节点上开启 turbo_mode / Enable Lightning LoRA。
| LoRA | 对应流程 | 步数 |
|---|---|---|
minimax_h3_fl2v_turbo_8step_v1.0_comfyui_bf16 | FL2VA(T2V / I2V / 首尾帧) | 20 → 8 |
minimax_h3_ref2v_turbo_4step_v0.1_comfyui_bf16 | Ref2VA(R2V) | 20 → 4 |
① 参考类镜头别乱开 Turbo。官方明确提示:参考 token 会跟着每一步走, 步数压到 4 时参考几乎没起作用,人物姿势/脸型会随视频漂移。 需要紧贴参考的镜头,老老实实用 20 步;还漂就升到 25 步。
② Sage Attention 与 int8_convrot 冲突。官方模板自带的 int8_convrot 权重
和 Comfy Kitchen attention 不兼容,采样会因对齐错误直接崩。
要么保持默认注意力、不用这个后端;要么改用 bf16 权重再切到 comfy kitchen attention。
另外 int8 注意力有时会让片段尾部变形或文字糊掉,遇到就切回默认。
16G 卡建议在启动脚本里加参数(run_nvidia_gpu.bat 或 start.bat):
python main.py --lowvram --reserve-vram 1.5 --preview-method auto
:: 参数含义
:: --lowvram 让 PyTorch 主动管理显存换入换出(你的情况基本必须)
:: --reserve-vram 给系统/其他程序留出显存余量,减少 OOM
:: --preview-method 打开预览,便于观察进度
如果还爆显存,可再加 --use-pytorch-cross-attention 降低注意力峰值,
或用 --cache-none --disable-smart-memory 减少内存驻留(更省内存、但会更慢)。
下面每一条,都是社区里反复踩出来的。装之前先读一遍,能省一整晚。
--force-reinstall --no-deps torchaudio 对齐。is_available()。跑一次真实矩阵运算才算验证通过。int8_convrot 用不了,会退到 fp8_scaled。想用最优量化就得上 cu130。int8_convrot 权重一起上,会崩;int8 注意力也可能导致画面尾部变形、文字变糊。leejet/ComfyUI-GGUF。H3 是开源权重(open weights),不是 OSI 意义上的开源软件,许可证带条件:
部署前建议亲自读一遍许可证原文,本文不构成法律意见。
出片遇到问题时,先回这里对一遍参数。
| 显存档 | 推荐量化 | 说明 |
|---|---|---|
| 8GB | Q3 / 混合 Q2,或 NVFP4 | 靠激进量化 + 大量 offload,画质有损,出片慢 |
| 12GB | Q4 / pruned int8 + nvfp4 编码器 | 大量依赖 offload |
| 16GB(你) | pruned int8_convrot(cu130) 或 pruned fp8_scaled(cu128) + nvfp4_awq 文本编码器 | 余量更大;pruned NVFP4 约 11.9GB 可常驻 |
| 24GB | pruned int8 常驻 | 从容 |
| 32GB+ | 完整 int8 / bf16 | 从容到宽裕 |
| 档位 | 分辨率 | 用途 |
|---|---|---|
| 预览 | 约 768×448 / 832×480 | 试提示词、试构图,最快 |
| 原生画布 | 1344×768(≈0.98MP) | H3 的满血画布,出片质量最好 |
| 超上限 | 1376×768(1.0MP) | 不要用超过模型像素面积上限 |
想要更高清,正确做法是:先用原生画布生成 768p,再单独跑一次放大,而不是直接生成大尺寸。
| 内容 | 建议步数 |
|---|---|
| base 默认 | 20 步(res_multistep + simple) |
| 简单画面 | 12~16 步够用 |
| 高频细节(锁子甲、花纹、小物件堆) | 一路加到约 50 步;低于此会有三角网格伪影 |
| 参考类镜头(要求贴合) | 20 步起步,仍漂移升到 25 步 |
| 语音质量 | 8 步最弱,12 步以上才可用 |
| Turbo 草稿 | T2V/I2V 用 8 步;R2V 用 4 步 |
单次生成 4~15 秒。想做更长的片子:把上一段的最后一帧导出,作为下一段的首帧输入, 配合 Ref2VA 锁定角色,就能拼出多镜头。社区有人用这方法做出了 30 秒三镜头、人物与声音全程一致的片段。
报错原文会随版本变化,请按“症状”对号入座。
| 症状 | 最可能的原因 | 怎么修 |
|---|---|---|
| 加载器下拉框是空的 / 提示找不到模型 | 文件放错目录 | 扩散模型→diffusion_models/;编码器→text_encoders/;VAE→vae/。刷新模型列表或重启 |
| 工作流打开后一堆红框 / 缺节点 | ComfyUI 版本太老 | 升到 0.30.0+(高级模板 0.34/0.35/0.36)。别零散补节点,直接整体升级 |
| 生成出来没声音,或音画不同步 | 音频 VAE 用了 fp16,或 VAE 接反 | 换回 audio_vae_fp32;检查工作流里视频 VAE 与音频 VAE 的连线 |
| 报 CUDA out of memory,但显存看着没满 | 50 系 + 版本不匹配,或峰值瞬时打满 | 确认 torch 是 cu128/cu130;加 --lowvram --reserve-vram;先把时长从 10 秒降到 5 秒,再降分辨率 |
| 卡在 99% 或 VAE 解码阶段 | 视频 VAE 解码瞬间吃显存 | 调小 VAE 的 Tile Size,或开 Tiled VAE |
| 画面抽搐 / 变形 / 出现网格伪影 | 尺寸不是 32 倍数,或量化太狠,或步数不足 | 宽高取 32 整数倍;换更低量化;细密内容加步数 |
| 速度慢到无法接受 | 机械/SATA 硬盘,内存不足,或没装加速 | 换 NVMe;清内存;装 Sage Attention + Turbo LoRA |
| 参考图没起作用 / 人物漂移 | Turbo 步数压太低,参考条件没机会生效 | 关掉 Turbo 用 20 步;参考图质量优先于数量(5 张清晰正侧面 > 9 张糊图) |
PyTorch and TorchAudio compiled with different CUDA |
torch 升了 torchaudio 没升 | pip install --index-url .../cu130 --force-reinstall --no-deps torchaudio |
| 显卡算力不兼容警告 / 退回 CPU | torch 不支持 sm_120 | 换 cu128/cu130 版 torch,并跑一次真实矩阵运算验证 |
建议收藏这一节。
| 内容 | 地址 |
|---|---|
| ComfyUI 适配模型(国内首选) | modelscope.cn/models/Comfy-Org/MiniMax-H3 |
| 官方原始权重(全精度) | modelscope.cn/models/MiniMax/MiniMax-H3 |
| GGUF 量化版 | modelscope.cn/models/leejet/MiniMax-H3-GGUF |
HF 镜像(配 HF_ENDPOINT) | hf-mirror.com |
| HF 官方仓库 | huggingface.co/MiniMaxAI/MiniMax-H3 |
| 内容 | 地址 |
|---|---|
| ComfyUI 官网(桌面版) | comfy.org |
| ComfyUI 便携包 Release | github.com/Comfy-Org/ComfyUI/releases |
| 官方 H3 教程 | docs.comfy.org/tutorials/video/minimax/minimax-h3 |
| 工作流模板仓库 | github.com/Comfy-Org/workflow_templates |
| KJNodes(提供 Sage Attention 节点) | github.com/kijai/ComfyUI-KJNodes |
| SageAttention wheel 下载 | github.com/woct0rdho/SageAttention/releases |
| GGUF 节点(若走 GGUF 路线) | github.com/leejet/ComfyUI-GGUF |
| aria2(多线程下载器) | github.com/aria2/aria2/releases |