上海人工智能实验室(Shanghai AI Laboratory,@huggingface)联合高校正式开源了面向音视频联合生成的多模态强化学习框架 AV-GRPO(arXiv: 2609.29816,GitHub: zhiyuxu03/AV-GRPO)。针对当前主流多模态生成模型在声画同步、跨模态因果对齐上的严重脱节,以及音视频双塔模型直接联合训练时算力开销激增、奖励信用分配模糊等瓶颈,AV-GRPO 首创了“模态锚定采样(Modality-Anchored Rollouts)”与“轨迹锁定冻结塔优化机制”,将复杂的跨模态偏好对齐转化为单模态解耦子问题,并在多项权威音视频生成基准上全面击败 LTX-2.3 达到业界 SOTA。
- ✓首次将 DeepSeek GRPO 强化学习框架成功拓展至声画联合生成的连续扩散模型(Diffusion RL)领域。
- ✓提出模态锚定解耦机制,交替冻结单模态塔进行轨迹锁定,彻底理清异构奖励信号的精准信用分配。
- ✓开源业界首个五维解耦、难度可控的音视频强化学习训练数据集 5DAV。
- ✓在 JavisBench 与 VABench 权威评测中,声画同步率与文本语义对齐度较 LTX-2.3 基线分别提升 28.4% 与 19.6%。
- ✓全量推理与训练代码、LoRA 权重与 5DAV 数据集已在 GitHub 和 Hugging Face 全面开源。
🔗
相关资源与官方项目出处
免代理直达💡 国内无需访问 Twitter,可直接访问上述项目官方资源与文档🔬
深度技术解析与实战评估
核心背景与行业痛点 随着 Sora、Kling、LTX 等视频扩散模型的快速迭代,行业正全力向“声画一体(Joint Audio-Video Generation)”方向迈进。然而,现有的联合音视频模型往往存在严重的物理脱节:例如画面中汽车飞驰而过,发动机轰鸣声却出现延迟或相位错乱;人物张嘴说话与声音节律无法对齐。试图直接利用强化学习(RLHF/RLAIF)微调音视频扩散模型时,又面临异构奖励互相拉扯的困局:视觉美感奖励与声音保真度奖励交织在一起,系统难以判断“是画面生成得好还是声音配得准”,导致双塔联合梯度爆炸且训练成本极为高昂。 ### 架构亮点与底层机制 上海 AI 实验室团队提出的 AV-GRPO(Audio-Video Group Relative Policy Optimization)实现了优雅的解耦控制: 1. 模态锚定采样(Modality-Anchored Rollouts):在采样探索阶段,固定某一模态的潜在特征(如固定视频生成轨迹),仅针对音频模态生成多个候选流并计算奖励相对优势,反之亦然; 2. 轨迹锁定冻结塔优化(Trajectory-Locked Frozen-Tower):每次只更新一个模态分支的扩散权重,另一模态作为确定性先验约束,将原本复杂的双塔耦合优化降解为计算代价可控的单模态凸子问题; 3. 自适应扰动与 5DAV 数据基建:构建了涵盖 5 个核心难度维度(物体动作速度、环境混响、发声体遮挡等)的 5DAV 数据集,根据模态动态自动调节扩散扰动强度(Perturbation Strengths)。 ### 权威 Benchmark 与实测跑分对比 在公认的音视频联合生成权威评测 JavisBench 与 VABench 上: - 无论是基于 LoRA 微调还是全参数训练,AV-GRPO 生成结果的声画同步精度(AV-Sync Offset)较此前业界顶尖的 LTX-2.3 降低了 41.2%,同步匹配得分提升 28.4%; - 文本-多模态交叉对齐度提升了 19.6%,彻底杜绝了“有动作无声响”的静音漏放现象; - 算法单步训练显存消耗较传统全量联合反向传播缩减了 52%,使得单张消费级 GPU 即可运行 LoRA 强化学习后训练。 ### 开发者实战落地与开箱指南 多模态研究人员与内容生成创作者可按以下步骤使用: - 克隆官方开源项目:git clone https://github.com/zhiyuxu03/AV-GRPO; - 仓库内置了对 LTX-Video、HunyuanVideo 等主流扩散架构的适配支持,提供单卡微调与分布式多卡启动脚本; - 国内开发者可直接在 Hugging Face 页面下载预训练好的 AV-GRPO 检查点与 5DAV 评测基准数据。
讨论与评论
0登录后即可参与深度讨论
与广大 AI 开发者、工程师交流评测心得与前沿洞察