一项后续测试,探索通过更换生成工作流,RTX 5090上H3文本转视频的生成速度最多可提升7.3倍。
AI translation, not an official translation. Refer to the original for technical details.
Adapted from @SamJWasserman# H3视频生成后续测试: 同一块RTX 5090,同一分辨率,生成时间大幅缩短。 昨天,我用RTX 5090生成一段八秒的H3文本转视频,最佳成绩耗时9分36秒。 今天,最快版本只需1分19秒。 我没有降低分辨率,也没有去掉音频,我改变的是生成工作流。 本次测试的目标是探索生成速度的极限,并为RTX 5090在实际使用中的可能性建立一套实用框架。不同工作流之间的画质和音质存在差异。这些是速度实验,并不是说每种结果的视觉和音频质量都同样出色。 ## 为什么要做后续测试 我最初的对比涵盖了RTX 4090、RTX 5090、RTX 6000 Ada和NVIDIA DGX Spark。我想得到一个实际的答案:生成一个镜头,我到底要等多久? 这次后续测试聚焦于一个问题:换用不同的H3方案,5090能快多少? 我又租了一块拥有32GB显存的RTX 5090,并设置了62GB的系统内存上限——与我正在考虑购买的那台64GB家用PC接近。昨天对比测试所用机器的内存分配为60GB。这些是家用PC的模拟环境,并非对我可能购买的某款具体成品机的基准测试。 ## 保持不变的因素 今天测试中的所有输出均使用了以下设置: - 分辨率:1376×768 - 时长八秒:24fps下共192帧 - 原生立体声音频 - 原始面包店提示词,图像转视频时使用相同的参考图像 - 相同的基础扩散模型、文本编码器、视频VAE和音频VAE 主要对比项使用了相同的随机种子。普通Turbo的一次重复测试使用了另一个种子。 我测量的是服务器完整的生成时间,包括模型加载、编码、采样、解码和保存视频。初始下载时间以及将视频传回本地电脑的时间均不计入。图计算缓存已禁用。 各机器还使用了相同版本的ComfyUI。由于宿主CPU和驱动程序存在差异,这些是实际工作流的对比——而非对每项单独优化项的严格控制测量。 ## 具体数据 昨天的20步基线:文本转视频9分36秒/图像转视频10分15秒。 4步Turbo + SageAttention:1分41秒/1分48秒。 以上 + Sol-Attn和融合调制:1分44秒/1分52秒。 以上 + Spectrum:1分19秒/1分27秒。 8步Turbo + SageAttention:文本转视频2分32秒。图像转视频未测试。 普通四步Turbo文本转视频重复测试耗时1分33秒。 昨天的数据是每种模式三次运行的中位数。今天的各行数据均为单次运行结果,另行报告的那次重复测试除外。请将其视为探索性对比,而非通用性能保证。 文本转视频最快一次约比昨天的中位数快7.3倍,图像转视频约快7.1倍。 ## 更多优化并不总意味着更快 最大的初始变化是从20步工作流切换到对应的四步Turbo LoRA,并结合SageAttention。仅此组合就已将等待时间缩短至约一分半钟。 在这些短暂的四步测试中,加入Sol-Attn和融合调制并没有超越普通Turbo的速度。这是针对该特定调度方案和配置的测试结果,并非对所有Sol配置的定论。我测试的是ComfyUI的Sol-Attn实现,而非NVIDIA完整的Sol Engine技术栈。 添加 Spectrum 带来了最快的结果。Spectrum 使用近似计算来跳过部分高开销的运算。在本次测试中,这换来了更高的速度,但同时也意味着有额外的理由仔细检查输出内容。 我也研究了 VDN。本轮测试中我没有运行 VDN 基准测试,因此这些结果中不包含任何 VDN 性能数据。 ## 速度是框架,质量是决策。 看完最初那段四步 Turbo 片段后,我的第一反应是: > "音频质量变差了,但还不算太糟。" 随着方案的变化,视觉和音频质量都可能发生变化。本轮测试的目的是摸清我们能达到的速度范围,然后根据片段内容来判断哪些权衡取舍对特定镜头来说是合理的。 输出内容的分辨率、时长和帧率保持不变,音频也是原生音频。但这些规格上的一致,并不代表感知质量上的一致。 我还生成了一个八步 Turbo 样本,耗时 2 分 32 秒,作为另一个对比选项。我并不是说它修复了音频问题;这需要亲耳聆听、亲眼查看,而不是根据步数来假设。所有八个保存的片段均通过了完整的解码和格式检查。这只能证明文件可以正常使用——并不代表其中的对话、运动或细节质量是同等水准的。 ## 观看并聆听测试片段 以下是实际输出的八秒片段。请自行对比其中的对话、运动和细节。下列时间为生成时间,而非播放时长。 示例 1 — 4步 Turbo + SageAttention:1分41秒(文本生成视频)。 示例 2 — Turbo + Sol-Attn + Spectrum:1分19秒(文本生成视频,实测最快)。 示例 3 — 8步 Turbo + SageAttention:2分32秒(文本生成视频,质量对比样本)。 ## 这改变了什么 当这个镜头的等待时间从大约十分钟缩短到大约一到两分钟,5090 在本地视频方面的实用价值就呈现出了截然不同的面貌。 对于探索镜头和测试创意而言,这种更短的反馈循环可能意义重大。而对于最终的对话镜头,如果更慢的方案能带来更好的声音或运动效果,我可能会倾向于选择它。 这并不会改变 5090 的 32GB 显存限制,也不会取代之前在其他机器上进行的测试。但它确实改变了我解读 5090 结果的方式:硬件基准测试需要与具体工作流程相结合。 在购买本地视频工作站之前,我会先测试自己实际计划使用的模型、分辨率、时长和音频需求——然后看输出内容,而不只是看秒表。 同样是这段八秒的 H3 镜头,你会选择约 1 分 20 秒但近似程度更高的方案、约 1 分 30 至 40 秒的普通四步 Turbo 方案,还是为了所需质量而选择更慢的方案? 不声称这些是最快的可能设置,也不声称各方案输出质量相同。 所用工具:H3 Turbo、ComfyUI Sol-Attn、Spectrum。(https://github.com/ModelTC/Minimax-H3-Turbo) (https://github.com/Saganaki22/ComfyUI-sol-attn) (https://github.com/xmarre/ComfyUI-Spectrum-MiniMax-H3)