返回所有文章
2747 10 分钟阅读访问统计加载中

MiniMax H3 在 RTX 5090 上的速度与成本:5 秒视频约 46–60 秒

postmortemAI

在 RTX 5090 32GB 上,MiniMax H3 Turbo 生成一段 5 秒、约 0.7MP、带立体声音频的视频,4 步双时钟采样耗时 46 秒,8 步耗时 58 秒。按测试时的整机租用价格 0.508 美元/小时折算,两档单次算力成本分别约为 0.0065 和 0.0082 美元。

这里的耗时从 ComfyUI 发出第一个节点执行事件开始,计至工作流完成,包含模型推理、VAE 解码和视频保存。远程请求、排队、实例启动、模型下载与结果回传均未计入,因此这组数据适合估算模型执行成本,不能直接当作公网 API 的端到端延迟。

问题详情

“RTX 5090 能运行 MiniMax H3”只能说明显存没有立即溢出。生成速度还会受到步数、量化方式、分辨率、视频时长、采样器、SageAttention、模型是否驻留显存等条件影响。缺少这些条件的单个耗时数字无法用于容量和成本预算。

测试于 2026 年 8 月 21 日完成,环境如下:

项目测试配置
GPUNVIDIA RTX 5090 32GB,Blackwell,功耗上限 460W
CPU / 内存Intel Core Ultra 9 285K,188GB 系统内存
软件环境Ubuntu 24.04、CUDA 13.2、PyTorch 2.10.0+cu130
ComfyUI2026-08-02 构建版本
扩散模型MiniMax H3 Base FL2VA,剪枝 INT8 ConvRot
文本编码器Qwen3-VL 32B NVFP4
输出规格24fps、原生立体声音频;基准为 5 秒、约 0.7MP、120 帧
计费基准0.508 美元/小时,测试当日的整机租用价格

每次运行都更换 seed,防止 ComfyUI 直接复用结果缓存。测试程序先连接本机 WebSocket,再提交工作流;它通过节点事件计算总耗时和各阶段耗时,同时每 0.25 秒采集一次显存、GPU 利用率、功耗和系统内存。

其中一组批量测试覆盖 6 种配置,每种配置运行 15 个内容样本,共 90 次。该批次后来发现提示词格式不符合 H3 官方三字段写法,因此视频不能继续用于正式画质盲评。分辨率、帧数、工作流和模型配置没有变化,计时与费用记录仍可用于性能分析。本文舍弃该批次的画质结论。

排查与原因

步数对耗时的影响大于量化名称

以下 90 次批量测试均启用 SageAttention,输出固定为 5 秒、约 0.7MP。表内 4 步和 8 步 Turbo 使用了旧版 res_multistep,其音频存在失真,因此这里只把它们作为计时下界。可正常听辨音频的结果在“解决办法”中单列。

扩散权重步数平均耗时15 次区间单次成本
INT8 ConvRot50311 秒306–312 秒0.0438 美元
INT8 ConvRot20131 秒130–131 秒0.0185 美元
INT8 ConvRot + Turbo859 秒59–60 秒0.0084 美元
INT8 ConvRot + Turbo436 秒36–37 秒0.0051 美元
剪枝 FP8 + Turbo444 秒43–54 秒0.0062 美元
INT4 / INT8 混合 + Turbo862 秒62–70 秒0.0088 美元

INT8 从 50 步降到 4 步后,平均耗时从 311 秒降至 36 秒,约为原来的九分之一。这个差距只说明计算量变化;4 步与 50 步的画质差异仍需使用修正后的提示词和音视频盲评确认。

测试中的 NVFP4 扩散权重文件约 33GB,需要大量卸载到系统内存,8 步耗时 89.9 秒;同条件 INT8 为 85.6 秒。权重位宽更低没有自动带来更高速度,文件大小、可用显存、卸载量和算子实现都会改变结果。INT4 / INT8 混合权重的峰值显存约 25.9GB,适合优先保留显存余量,但速度没有超过 5090 上的 INT8 ConvRot。

SageAttention 主要缩短采样阶段

保持模型、步数和输入不变后,SageAttention 对 INT8 的采样阶段带来 21%–26% 的缩短。VAE 解码与视频保存不会随注意力实现一同加速,因此总耗时的改善低于采样阶段。

配置采样耗时:关闭 → 开启采样缩短总耗时:关闭 → 开启
INT8,4 步36.7 → 28.9 秒21%60.6 → 53.5 秒
INT8,8 步70.1 → 52.0 秒26%85.6 → 67.0 秒

5 秒 0.7MP 视频的 VAE 解码通常需要约 11–14 秒。这段固定开销解释了为何采样明显变快后,总耗时没有按相同比例下降。

分辨率增加会同时抬高采样和解码成本

以下单变量测试使用 INT8、8 步、图生视频和热运行,关闭 SageAttention。该批次仍使用旧采样器,表中数据只用于比较分辨率对耗时的影响。

分辨率总耗时采样VAE 解码峰值显存单次成本
0.4MP57.2 秒39.3 秒4.2 秒30.6GB0.0081 美元
0.7MP86.4 秒69.9 秒11.6 秒31.3GB0.0122 美元
1.0MP142.4 秒124.4 秒11.8 秒31.3GB0.0201 美元

像素量从 0.4MP 增至 1.0MP,采样耗时从 39.3 秒增至 124.4 秒。32GB 显存在 0.7MP 和 1.0MP 时都接近满载,运行能够完成还依赖 50GB 以上的系统内存承担模型卸载。

视频时长的成本增长超过时长本身

固定 0.7MP、INT8 和 8 步后,5 秒、10 秒与 15 秒的测量结果如下:

成片时长帧数总耗时采样VAE 解码单次成本
5 秒12086.4 秒69.9 秒11.6 秒0.0122 美元
10 秒240244.4 秒212.4 秒23.3 秒0.0345 美元
15 秒360475.5 秒428.9 秒34.9 秒0.0671 美元

在这组工作流中,成片从 5 秒增加到 15 秒,总耗时和费用扩大约 5.5 倍。VAE 解码接近按帧数线性增长,采样阶段增长更快。长片拆成短片可以降低推理费用,但镜头连续性、音频衔接和额外重试也会引入新成本,不能只按表格做机械拆分。

冷运行增加约 14 秒

同一项 5 秒 0.7MP 文生视频测试,模型驻留时耗时 44.29 秒;重启 ComfyUI 后的首次运行耗时 58.63 秒。约 35GB 权重进入运行环境增加了 14.34 秒,对应约 0.0020 美元。

这项冷运行只包含 ComfyUI 内的模型加载。新建实例、下载镜像和模型文件通常远慢于 14 秒,需要在服务层单独计量。

解决办法

用音频正常的结果建立成本基线

旧版 res_multistep 可以得到更低的 4 步耗时,但会让 H3 Turbo 音频出现爆音、杂音和音色偏移。升级到支持音视频独立采样进度的 ComfyUI,或使用双时钟 Euler 后,4 步和 8 步音频均通过人工听辨。

按 0.508 美元/小时计算,可用于预算的基线为:

配置5 秒视频耗时单次算力成本单卡串行理论上限1,000 次算力成本
INT8,4 步 Turbo,双时钟46 秒0.0065 美元约 78 条/小时约 6.49 美元
INT8,8 步 Turbo,双时钟58 秒0.0082 美元约 62 条/小时约 8.18 美元
INT8,20 步,SageAttention131 秒0.0185 美元约 27 条/小时约 18.49 美元

理论产量按连续串行执行计算,没有预留排队、冷运行、失败重试和维护时间。4 步与 8 步应根据自己的画质与音画同步样本选择,当前计时数据不足以替代正式质量验收。

成本计算只需要两个量:

单次算力成本 = 工作流执行秒数 ÷ 3600 × 整机小时价格
单卡串行理论产量 = 3600 ÷ 工作流执行秒数

例如,整机价格变为 0.80 美元/小时,46 秒运行的单次成本为 46 ÷ 3600 × 0.80 ≈ 0.0102 美元。使用自有显卡时,应把小时价格替换为电费、设备折旧、主机功耗和运维成本的合计。

把成本拆成执行、空闲和失败三部分

单次工作流成本只覆盖显卡实际执行期间的租用费用。完整预算还需要加入:

  • 模型冷加载和实例启动;
  • 无任务时仍在计费的空闲时间;
  • 失败任务、超时与重试;
  • 输入上传、结果存储和下载流量;
  • 质量不合格后重新生成的费用。

按本次费率简单外推,100 万次音频正常的 4 步运行约消耗 12,778 个执行小时和 6,491 美元;8 步约消耗 16,111 个执行小时和 8,184 美元。这只是连续满载的算力下限,不能替代线上总成本。

固定影响速度的全部条件

公开或复测 H3 性能时,至少同时记录 GPU、显存、系统内存、PyTorch 与 CUDA 版本、ComfyUI 版本、模型文件、量化方式、LoRA、采样器、调度器、步数、分辨率、帧数、任务类型、冷运行或热运行,以及小时价格。

高分辨率应单独报价。优化后的 1080p 两段采样耗时约 345 秒,按相同费率为 0.049 美元;一次完整 2K 运行耗时约 1,302 秒,费用约 0.184 美元,后续优化版本又出现显存溢出。详细过程见 MiniMax H3 高分辨率放大:音视频潜空间拆分与二次采样

Turbo 音频的修复条件见 MiniMax H3 Turbo 音频失真的根因与双时钟采样器修复

验证结果

本次公开数据来自以下测量:

  • 6 种步数和量化组合,每种 15 个样本,共 90 次计时;
  • 3 档分辨率与 3 档视频时长的单变量测试;
  • INT8 与 NVFP4 的 SageAttention 开关对照;
  • 相同工作流的冷运行与热运行对照;
  • 4 步和 8 步双时钟采样的音频听辨。

90 次批量测试累计运行约 2.7 个 GPU 小时,按当时费率折算约 1.36 美元。15 个样本内,INT8 4 步耗时集中在 36–37 秒,8 步集中在 59–60 秒,20 步集中在 130–131 秒;固定输出尺寸和步数后,计时波动较小。

这些数字只适用于当前硬件和软件组合。测试中的峰值显存通常为 29–31.4GB,部分量化配置使用 50–88GB 系统内存承接卸载;内存容量、PCIe 带宽或驱动变化都可能改变速度。小时价格也是 2026 年 8 月 21 日的市场快照,复算时应替换为实际价格。

画质仍有独立验证边界。旧提示词批次的产物已经从质量证据中排除;双时钟音频采用人工听辨,没有客观失真指标。MiniMax H3 本地权重还受 Community License 约束,部署地区和用途应在投入成本前核对许可证原文。

参考资料

喜欢这篇文章?

如果这篇文章帮到了你,可以请我喝杯咖啡,支持我继续写下去。

评论