
(新)MinimaxH3_R2V-2Stage-VEDA 加速模型和工作流
面向 MiniMax H3 视频生成的 R2V 两阶段加速模型与 VEDA 工作流说明。采用稀疏注意力,仅计算视觉参考与生成视频中关键的注意力块,音频与文本条件保持完整,音画同步质量稳定。在高端显卡上注意力计算与端到端生成均有明显提速。FP8 独立预测器即插即用,不改动主干权重,兼容 Turbo LoRA,附下载入口与推荐参数。
前往网盘下载 →资源存放于第三方网盘,点击将跳转至网盘页面进行下载。
扫码进学习交流群
加专属老师微信图文介绍
专为 MiniMax-H3 视频生成模型打造的 R2VA(参考图/视频生成带同步音频的视频) 专属稀疏注意力加速器,能在不损失画质和音质的前提下,大幅提升长视频的生成速度。
✨ 核心亮点
智能稀疏计算:模型会独立筛选并仅计算“视觉参考”和“生成视频”中最关键的 10% 注意力块,而文本、视觉语言模型 (VLM) 条件和音频 (Audio) 计算保持完整(密集),确保音画同步质量绝不妥协。
显著提速:在高端显卡(如 RTX 6000 级别)上,可实现最高 2.9倍 的注意力计算加速和 2.2倍 的端到端生成加速,视频越长,提速效果越明显。
即插即用 (Plug-and-Play):采用 FP8 格式的独立预测器,不修改 MiniMax-H3 的主干网络权重,也不改变原有风格,完美兼容现有的 Turbo LoRA 和其他微调变体。
🎯 适用场景
需要生成 5秒以上中长视频 且带有环境音/人声的 R2VA 任务。
本地显存有限,或希望显著降低云端推理(如 RunningHub)时间和成本的创作者。
追求高效工作流,希望在保持高质量输出的同时减少等待时间的专业用户。
⚙️ 推荐设置
参考块 (Reference Sparsity):32
当前视频块 (Current-video Sparsity):32
兼容性:需配合 MiniMax-H3 基础模型及 R2VA 工作流使用。
模型官方链接:
https://huggingface.co/Veda-Sparse/Minimax-H3-R2VA-Veda-Preview
https://huggingface.co/Veda-Sparse/Minimax-H3-T2VA-Veda-8NFE-600Step-Preview
常见问题
该加速器以 FP8 独立预测器形式加载,不修改 MiniMax-H3 主干权重,因此在原有显存占用基础上增量较小。在 RTX 6000 级别显卡上,注意力计算提速约 2.9 倍,端到端生成提速约 2.2 倍,视频越长提速越明显。显存有限时建议先跑短视频验证参数,再逐步提高分辨率与时长。
稀疏计算只作用于视觉参考与生成视频两条路径,文本、视觉语言模型条件以及音频计算仍保持完整密集计算,因此人声与环境音的同步不受影响。参考块与当前视频块建议均设为 32,可在速度与画面稳定性之间取得较均衡的表现。
可以。它属于即插即用的独立预测器,不改变主干网络结构与原有画面风格,与现有 Turbo LoRA 及常见微调变体兼容。若叠加多个加速手段,建议分步测试,先确认单模块效果再组合,便于定位画面异常来源。
适合需要 5 秒以上中长视频、且带环境音或人声的参考图/参考视频生成任务,也适合本地显存有限、希望缩短云端推理时间与成本的创作者。追求高效流程、希望在稳定输出前提下减少等待时间的使用者,可优先尝试两阶段配置。
可在 Hugging Face 上 Veda-Sparse 的模型页面获取 R2VA 与 T2VA 相关权重文件,结合站内 MiniMax-H3 基础模型与 R2VA 工作流节点加载,按推荐参数设置参考块与当前视频块后即可运行。



