视频生成扩散后训练前沿研究团队(东北大学与联合实验室)在 Hugging Face 与 GitHub 正式开源了《ViRDM: Taming Representation Distribution Matching for Few-Step Causal Video Generation》(arXiv: 2609.28923,项目主页: neu-vi.github.io/ViRDM/)。针对传统少步自回归因果视频扩散蒸馏(如 DMD)必须同时常驻庞大的预训练教师模型与在线判别器(Critic)导致三网联合训练显存爆炸、训练极其昂贵缓慢的痛点,ViRDM 首次将单步图像的表征分布匹配(RDM)成功推广至因果视频领域,实现了彻底摆脱教师网络与判别器的“纯生成器后训练(Generator-Only Post-Training)”。仅需 20 次生成器参数迭代(16 个 A100 卡时),即可在权威 VBench 评测中达到 84.87 分,超越此前最佳基线。
- ✓彻底告别传统“生成器 + 教师模型 + 在线判别器”三网联合蒸馏的显存地狱,首创纯生成器独立后训练范式。
- ✓突破视频 RDM 内存不可行的梯度反传瓶颈,提出随机截断平滑退出监督与分阶段向量-雅可比乘积算子。
- ✓引入轻量级动力学正则化(Dynamics Regularization),精准约束时序动态一致性,杜绝动作跳帧与模糊闪烁。
- ✓极速收敛:仅需 20 次生成器权重更新(16 个 A100 GPU 卡时),在 VBench 权威基准上取得 84.87 业界最高分。
- ✓项目主页、多步自回归采样脚本与 PyTorch 训练代码已在 GitHub 遵照 MIT 协议全量开源。
🔗
相关资源与官方项目出处
免代理直达💡 国内无需访问 Twitter,可直接访问上述项目官方资源与文档🔬
深度技术解析与实战评估
核心背景与行业痛点 在实现低延迟流式视频生成(Streaming Video Generation,如实时云渲染、交互式世界漫游)中,少步因果自回归视频扩散模型(Few-Step Causal Video Diffusion)是业界公认的最佳解法。然而,现有的模型后训练加速主要依赖分布匹配蒸馏(DMD)。在 DMD 流程中,GPU 显存必须同时容纳三个庞然大物:被训练的少步生成器、庞大的全精度教师大模型、以及负责打分的在线判别器网络(Critic)。这导致训练开销极其骇人,动辄需要数百甚至数千张卡训练数周,普通中小企业与高校实验室完全无法承受。 ### 架构亮点与底层机制 ViRDM 团队将单步图像生成的表征分布匹配(RDM)技术开拓性地驯化至连续时序视频域: 1. 显存可行的时空反传(Memory-Tractable Gradient Path):针对视频多帧反向传播易触发 OOM 的瓶颈,设计了随机截断平滑退出监督与分阶段向量-雅可比乘积(Staged VJP)计算,将显存占用降低至原先的 1/3; 2. 轻量化时序动力学正则项(Dynamics Regularization):单步表征匹配容易忽略前后帧之间的连续动量变化,团队引入轻量速度先验与潜空间残差惩罚,确保生成动作平滑自然; 3. 纯生成器后训练机制(Teacher- & Critic-Free):直接根据预先离线计算的目标表征流形优化生成器权重,彻底将传统的“三网杂耍”收敛为单一网络的快速微调。 ### 权威 Benchmark 与实测跑分对比 在权威视频生成基准 VBench 的全面自动化评测中: - 仅经过 20 次微小步迭代更新(总训练耗时仅需 16 个 A100 GPU-小时),ViRDM 在 VBench 综合评分上达到 84.87 分,不仅刷新了少步因果视频的全球最高分(较此前最优基线提升 0.36 分),更大幅压倒了多款训练时间长达数百小时的传统蒸馏基线; - 在动作平滑度(Motion Smoothness)与主体一致性(Subject Consistency)两大子维度上,得分分别提升 4.2% 与 6.8%; - 探索性实验表明,该方案在极低步数(1步、2步、4步)双向双流生成中依然保持着极高的结构保真度。 ### 开发者实战落地与开箱指南 视频生成算法工程师与开源创作者可按以下步骤极简开箱: - 访问官方 GitHub 仓库:git clone https://github.com/neu-vi/ViRDM; - 仓库提供了基于 CogVideoX 与主流开源因果视频底座的 4 步流式生成适配脚本; - 国内研究者可直接在 Hugging Face 论文讨论区获取论文预印本与轻量化微调超参配置表。
讨论与评论
0登录后即可参与深度讨论
与广大 AI 开发者、工程师交流评测心得与前沿洞察