内容提要
RunningHub 为 MiniMax H3 开源模型推出 H3 Lightning 加速方案,结合后训练加速模型、SageAttention2、Cache-DiT、torch.compile 及 TP2+Ulysses4 多卡并行,在无 NVLink 的 PCIe 多卡环境下实现约 12 倍提速,5 秒视频生成时间从 348.8 秒降至 28.7 秒,并保留 BF16 精度。该方案已开源,可降低创作者试错成本。
延伸解读
加速方案的技术拆解
RunningHub H3 Lightning 通过三层优化实现提速:首先用自研后训练加速模型将生成步数从50步降至9步,耗时从348.8秒减至43秒;其次引入SageAttention2、Cache-DiT和torch.compile优化算子、缓存和编译;最后针对无NVLink的PCIe多卡环境,采用TP2+Ulysses4并行策略,相比TP4+Ulysses2提速约12%并减少约14GiB显存占用。
本地部署的硬件适配性
该方案专门针对无NVLink的PCIe多卡环境优化,使用RTX 6000D等公开可购买的专业GPU。在4卡环境下,5秒视频生成仅需28.7秒;8卡环境下,15秒视频文生图约48秒、双参考图约73秒。这意味着中小团队和工作室无需顶级数据中心算力,也能在本地获得可用的生成速度。
精度与速度的平衡
与常见的降精度加速不同,H3 Lightning全程保留BF16数值精度,没有通过降低计算精度来换取速度。在实测中,5秒文生视频和15秒图生视频均保持了人物特征、场景连贯性和动作逻辑,但快速运动时偶有细节生硬。对于需要高质量输出的创作者,这提供了速度与画质兼顾的选择。
开源生态的实践意义
RunningHub将整套加速方案在GitHub开源,并已开源ComfyUI节点,平台上有上千名创作者贡献了近万条工作流。这种模式让开发者能基于自身硬件和工作流继续优化,而不是依赖封闭的API服务。对于希望自主部署、定制流程的团队,这降低了从模型权重到实际生产力的工程门槛。
Q&A
RunningHub H3 Lightning 是什么?它主要解决了什么问题?
RunningHub H3 Lightning 是 RunningHub 为 MiniMax H3 开源模型推出的加速方案,主要解决视频生成速度慢的问题,让本地部署也能大幅提速。
H3 Lightning 的加速效果具体如何?
在 4 张 RTX 6000D 上生成 5 秒 1344×768 视频,原始 BF16 50 步方案耗时 348.8 秒,加速后仅需 28.7 秒,约 12 倍提速,耗时减少约 92%,且保留 BF16 精度。
H3 Lightning 用了哪些技术来实现加速?
结合了自研 RH 后训练加速模型(减少生成步数)、SageAttention2(优化注意力计算)、Cache-DiT(缓存复用)、torch.compile(编译优化)以及 TP2+Ulysses4 多卡并行,并整合进 SGLang multimodal_gen 推理引擎。
没有 NVLink 的 PCIe 多卡环境也能用 H3 Lightning 加速吗?
可以。H3 Lightning 专门针对无 NVLink 的 PCIe 多卡环境优化,在 8 张 RTX 6000D 上,TP2+Ulysses4 相比 TP4+Ulysses2 速度快约 12%,同时减少约 14GiB 显存占用。
H3 Lightning 是否开源?如何获取?
已开源,GitHub 仓库地址:https://github.com/RH-RunningHub/MiniMax-H3-MultiGPU-Lightning/,任何创作者都可以开箱即用。
加速后视频质量会下降吗?
不会。整套加速方案全程保留 BF16 满血精度,没有走降精度换速度的捷径,画质不劣化。
H3 Lightning 对长视频生成有帮助吗?
有。在 8 张 RTX 6000D 环境下,生成 15 秒 768×1344 视频,纯文字生成约 48 秒,双参考图生成约 73 秒,可打进“1 分钟出结果”的时间尺度。
RunningHub 为什么要做 H3 Lightning 加速?
RunningHub 是 AIGC 创作平台,旨在降低创作者试错成本,让灵感快速落地。其母公司海马云有十多年 GPU 工程积累,做加速是技术能力的自然延伸,也为了反哺开源生态。