在 RTX 5090 32GB 上,MiniMax H3 Turbo 生成一段 5 秒、约 0.7MP、带立体声音频的视频,4 步双时钟采样耗时 46 秒,8 步耗时 58 秒。按测试时的整机租用价格 0.508 美元/小时折算,两档单次算力成本分别约为 0.0065 和 0.0082 美元。
这里的耗时从 ComfyUI 发出第一个节点执行事件开始,计至工作流完成,包含模型推理、VAE 解码和视频保存。远程请求、排队、实例启动、模型下载与结果回传均未计入,因此这组数据适合估算模型执行成本,不能直接当作公网 API 的端到端延迟。
问题详情
“RTX 5090 能运行 MiniMax H3”只能说明显存没有立即溢出。生成速度还会受到步数、量化方式、分辨率、视频时长、采样器、SageAttention、模型是否驻留显存等条件影响。缺少这些条件的单个耗时数字无法用于容量和成本预算。
测试于 2026 年 8 月 21 日完成,环境如下:
| 项目 | 测试配置 |
|---|---|
| GPU | NVIDIA RTX 5090 32GB,Blackwell,功耗上限 460W |
| CPU / 内存 | Intel Core Ultra 9 285K,188GB 系统内存 |
| 软件环境 | Ubuntu 24.04、CUDA 13.2、PyTorch 2.10.0+cu130 |
| ComfyUI | 2026-08-02 构建版本 |
| 扩散模型 | MiniMax H3 Base FL2VA,剪枝 INT8 ConvRot |
| 文本编码器 | Qwen3-VL 32B NVFP4 |
| 输出规格 | 24fps、原生立体声音频;基准为 5 秒、约 0.7MP、120 帧 |
| 计费基准 | 0.508 美元/小时,测试当日的整机租用价格 |
每次运行都更换 seed,防止 ComfyUI 直接复用结果缓存。测试程序先连接本机 WebSocket,再提交工作流;它通过节点事件计算总耗时和各阶段耗时,同时每 0.25 秒采集一次显存、GPU 利用率、功耗和系统内存。
其中一组批量测试覆盖 6 种配置,每种配置运行 15 个内容样本,共 90 次。该批次后来发现提示词格式不符合 H3 官方三字段写法,因此视频不能继续用于正式画质盲评。分辨率、帧数、工作流和模型配置没有变化,计时与费用记录仍可用于性能分析。本文舍弃该批次的画质结论。
排查与原因
步数对耗时的影响大于量化名称
以下 90 次批量测试均启用 SageAttention,输出固定为 5 秒、约 0.7MP。表内 4 步和 8 步 Turbo 使用了旧版 res_multistep,其音频存在失真,因此这里只把它们作为计时下界。可正常听辨音频的结果在“解决办法”中单列。
| 扩散权重 | 步数 | 平均耗时 | 15 次区间 | 单次成本 |
|---|---|---|---|---|
| INT8 ConvRot | 50 | 311 秒 | 306–312 秒 | 0.0438 美元 |
| INT8 ConvRot | 20 | 131 秒 | 130–131 秒 | 0.0185 美元 |
| INT8 ConvRot + Turbo | 8 | 59 秒 | 59–60 秒 | 0.0084 美元 |
| INT8 ConvRot + Turbo | 4 | 36 秒 | 36–37 秒 | 0.0051 美元 |
| 剪枝 FP8 + Turbo | 4 | 44 秒 | 43–54 秒 | 0.0062 美元 |
| INT4 / INT8 混合 + Turbo | 8 | 62 秒 | 62–70 秒 | 0.0088 美元 |
INT8 从 50 步降到 4 步后,平均耗时从 311 秒降至 36 秒,约为原来的九分之一。这个差距只说明计算量变化;4 步与 50 步的画质差异仍需使用修正后的提示词和音视频盲评确认。
测试中的 NVFP4 扩散权重文件约 33GB,需要大量卸载到系统内存,8 步耗时 89.9 秒;同条件 INT8 为 85.6 秒。权重位宽更低没有自动带来更高速度,文件大小、可用显存、卸载量和算子实现都会改变结果。INT4 / INT8 混合权重的峰值显存约 25.9GB,适合优先保留显存余量,但速度没有超过 5090 上的 INT8 ConvRot。
SageAttention 主要缩短采样阶段
保持模型、步数和输入不变后,SageAttention 对 INT8 的采样阶段带来 21%–26% 的缩短。VAE 解码与视频保存不会随注意力实现一同加速,因此总耗时的改善低于采样阶段。
| 配置 | 采样耗时:关闭 → 开启 | 采样缩短 | 总耗时:关闭 → 开启 |
|---|---|---|---|
| INT8,4 步 | 36.7 → 28.9 秒 | 21% | 60.6 → 53.5 秒 |
| INT8,8 步 | 70.1 → 52.0 秒 | 26% | 85.6 → 67.0 秒 |
5 秒 0.7MP 视频的 VAE 解码通常需要约 11–14 秒。这段固定开销解释了为何采样明显变快后,总耗时没有按相同比例下降。
分辨率增加会同时抬高采样和解码成本
以下单变量测试使用 INT8、8 步、图生视频和热运行,关闭 SageAttention。该批次仍使用旧采样器,表中数据只用于比较分辨率对耗时的影响。
| 分辨率 | 总耗时 | 采样 | VAE 解码 | 峰值显存 | 单次成本 |
|---|---|---|---|---|---|
| 0.4MP | 57.2 秒 | 39.3 秒 | 4.2 秒 | 30.6GB | 0.0081 美元 |
| 0.7MP | 86.4 秒 | 69.9 秒 | 11.6 秒 | 31.3GB | 0.0122 美元 |
| 1.0MP | 142.4 秒 | 124.4 秒 | 11.8 秒 | 31.3GB | 0.0201 美元 |
像素量从 0.4MP 增至 1.0MP,采样耗时从 39.3 秒增至 124.4 秒。32GB 显存在 0.7MP 和 1.0MP 时都接近满载,运行能够完成还依赖 50GB 以上的系统内存承担模型卸载。
视频时长的成本增长超过时长本身
固定 0.7MP、INT8 和 8 步后,5 秒、10 秒与 15 秒的测量结果如下:
| 成片时长 | 帧数 | 总耗时 | 采样 | VAE 解码 | 单次成本 |
|---|---|---|---|---|---|
| 5 秒 | 120 | 86.4 秒 | 69.9 秒 | 11.6 秒 | 0.0122 美元 |
| 10 秒 | 240 | 244.4 秒 | 212.4 秒 | 23.3 秒 | 0.0345 美元 |
| 15 秒 | 360 | 475.5 秒 | 428.9 秒 | 34.9 秒 | 0.0671 美元 |
在这组工作流中,成片从 5 秒增加到 15 秒,总耗时和费用扩大约 5.5 倍。VAE 解码接近按帧数线性增长,采样阶段增长更快。长片拆成短片可以降低推理费用,但镜头连续性、音频衔接和额外重试也会引入新成本,不能只按表格做机械拆分。
冷运行增加约 14 秒
同一项 5 秒 0.7MP 文生视频测试,模型驻留时耗时 44.29 秒;重启 ComfyUI 后的首次运行耗时 58.63 秒。约 35GB 权重进入运行环境增加了 14.34 秒,对应约 0.0020 美元。
这项冷运行只包含 ComfyUI 内的模型加载。新建实例、下载镜像和模型文件通常远慢于 14 秒,需要在服务层单独计量。
解决办法
用音频正常的结果建立成本基线
旧版 res_multistep 可以得到更低的 4 步耗时,但会让 H3 Turbo 音频出现爆音、杂音和音色偏移。升级到支持音视频独立采样进度的 ComfyUI,或使用双时钟 Euler 后,4 步和 8 步音频均通过人工听辨。
按 0.508 美元/小时计算,可用于预算的基线为:
| 配置 | 5 秒视频耗时 | 单次算力成本 | 单卡串行理论上限 | 1,000 次算力成本 |
|---|---|---|---|---|
| INT8,4 步 Turbo,双时钟 | 46 秒 | 0.0065 美元 | 约 78 条/小时 | 约 6.49 美元 |
| INT8,8 步 Turbo,双时钟 | 58 秒 | 0.0082 美元 | 约 62 条/小时 | 约 8.18 美元 |
| INT8,20 步,SageAttention | 131 秒 | 0.0185 美元 | 约 27 条/小时 | 约 18.49 美元 |
理论产量按连续串行执行计算,没有预留排队、冷运行、失败重试和维护时间。4 步与 8 步应根据自己的画质与音画同步样本选择,当前计时数据不足以替代正式质量验收。
成本计算只需要两个量:
单次算力成本 = 工作流执行秒数 ÷ 3600 × 整机小时价格
单卡串行理论产量 = 3600 ÷ 工作流执行秒数
例如,整机价格变为 0.80 美元/小时,46 秒运行的单次成本为 46 ÷ 3600 × 0.80 ≈ 0.0102 美元。使用自有显卡时,应把小时价格替换为电费、设备折旧、主机功耗和运维成本的合计。
把成本拆成执行、空闲和失败三部分
单次工作流成本只覆盖显卡实际执行期间的租用费用。完整预算还需要加入:
- 模型冷加载和实例启动;
- 无任务时仍在计费的空闲时间;
- 失败任务、超时与重试;
- 输入上传、结果存储和下载流量;
- 质量不合格后重新生成的费用。
按本次费率简单外推,100 万次音频正常的 4 步运行约消耗 12,778 个执行小时和 6,491 美元;8 步约消耗 16,111 个执行小时和 8,184 美元。这只是连续满载的算力下限,不能替代线上总成本。
固定影响速度的全部条件
公开或复测 H3 性能时,至少同时记录 GPU、显存、系统内存、PyTorch 与 CUDA 版本、ComfyUI 版本、模型文件、量化方式、LoRA、采样器、调度器、步数、分辨率、帧数、任务类型、冷运行或热运行,以及小时价格。
高分辨率应单独报价。优化后的 1080p 两段采样耗时约 345 秒,按相同费率为 0.049 美元;一次完整 2K 运行耗时约 1,302 秒,费用约 0.184 美元,后续优化版本又出现显存溢出。详细过程见 MiniMax H3 高分辨率放大:音视频潜空间拆分与二次采样。
Turbo 音频的修复条件见 MiniMax H3 Turbo 音频失真的根因与双时钟采样器修复。
验证结果
本次公开数据来自以下测量:
- 6 种步数和量化组合,每种 15 个样本,共 90 次计时;
- 3 档分辨率与 3 档视频时长的单变量测试;
- INT8 与 NVFP4 的 SageAttention 开关对照;
- 相同工作流的冷运行与热运行对照;
- 4 步和 8 步双时钟采样的音频听辨。
90 次批量测试累计运行约 2.7 个 GPU 小时,按当时费率折算约 1.36 美元。15 个样本内,INT8 4 步耗时集中在 36–37 秒,8 步集中在 59–60 秒,20 步集中在 130–131 秒;固定输出尺寸和步数后,计时波动较小。
这些数字只适用于当前硬件和软件组合。测试中的峰值显存通常为 29–31.4GB,部分量化配置使用 50–88GB 系统内存承接卸载;内存容量、PCIe 带宽或驱动变化都可能改变速度。小时价格也是 2026 年 8 月 21 日的市场快照,复算时应替换为实际价格。
画质仍有独立验证边界。旧提示词批次的产物已经从质量证据中排除;双时钟音频采用人工听辨,没有客观失真指标。MiniMax H3 本地权重还受 Community License 约束,部署地区和用途应在投入成本前核对许可证原文。
参考资料
喜欢这篇文章?
如果这篇文章帮到了你,可以请我喝杯咖啡,支持我继续写下去。
评论