阿里巴巴 Wan 视频大模型团队(@Alibaba_Qwen)正式公布了新一代长视频提示词工程与生成基座 WanPE(arXiv: 2609.30221,项目主页: wan-pe.github.io),并预告了下一代视频生成大模型 Wan3.0。针对当前扩散视频生成扩展至 30 秒长序列时用户输入过于简略、多镜头叙事分镜混乱以及传统提示词重写极易篡改原始意图的致命痛点,阿里团队训练了 3970 亿参数的超大规模导演级规划模型 WanPE-397B。模型首次提出“基于视频接地的逆向分镜重构”与“语义一致性 GRPO 强化学习(SC-GRPO)”,在 30 秒长视频盲测中人类偏好得分暴涨 50.86 分。

核心要点速览 (Key Takeaways)

  • ✓开源业界最大规模 397B 参数级视频提示词与分镜规划大模型,基于 105 万条真实影视级视频训练。
  • ✓首创 SC-GRPO(语义一致性群组相对策略优化),彻底根治强化学习后训练中模型“脑补加戏导致原意偏离”的难题。
  • ✓引入逆向分镜重构机制,精准规划 5 至 30 秒跨镜头的镜头运动轨迹、布光环境、角色位姿与多镜头过渡。
  • ✓在配套 Wan3.0 视频底座时,30 秒竞技场的人类综合偏好度较原始 Prompt 狂升 50.86 分,全面领跑主流商业视频模型。
  • ✓项目主页、评测基准 WanPEval(包含 1.1 万组双盲对比)与技术论文已在全网公开。
🔬

深度技术解析与实战评估

核心背景与行业痛点 随着 Sora、Kling 与阿里 Wan2.1 等前沿视频生成模型逐步支持长达 30 秒的连续视频生成,行业瓶颈正从“底层像素生成”向“提示词导演规划”转移。普通用户输入的 Prompt 往往极其简略(如“雨夜中赛博朋克街道上行走的人”),直接输入模型会导致镜头呆滞、动作僵硬或中途突变;而此前采用常规开源大模型进行正向提示词扩写,往往严重“自由发挥”,悄然篡改或抹除用户的核心主体与色彩要求,导致生成画面与用户诉求南辕北辙。 ### 架构亮点与底层机制 阿里团队在 WanPE 中构建了影视工业级的文本空间导演引擎: 1. 逆向分镜接地重构(Video-Grounded Reverse Construction):不同于凭空编写提示词,模型通过分析 105 万部高分电影镜头,学习从最终真实视效逆推镜头脚本(包含景别切换、推拉摇移、光线色调与焦点转移),建立物理规律与分镜语言的精确映射; 2. 语义一致性 GRPO(SC-GRPO):在利用强化学习优化分镜美学与专业度时,引入严格的语义投影惩罚项,确保生成的复杂脚本中核心实体、动作关系与原始用户 Prompt 的互信息不发生任何衰减; 3. 多尺度时长自适应规划:根据目标视频时长(5s、15s、30s)动态匹配多镜头数量与镜头蒙太奇节奏,实现与 Wan3.0 扩散模型潜空间的无缝因果对齐。 ### 权威 Benchmark 与实测跑分对比 团队构建了包含 11,000 组真人双盲配对评估的基准测试集 WanPEval: - 在驱动 Wan3.0 进行 5 至 15 秒视频生成时,经 WanPE-397B 增强的提示词使人类评测胜率绝对提升 10.66 至 18.84 分; - 在长达 30 秒的极难长镜头与多镜头竞技场中,生成质量的人类偏好得分惊人提升了 50.86 分; - 综合画面构图、运动平滑度与文本保真度评分,WanPE-397B 全面压倒现有的商业闭源扩写插件,并在 30 秒区间与 ByteDance Seedance 2.5 形成强有力并跑。 ### 开发者实战落地与开箱指南 影视创作者、AIGC 平台与开发者可按以下建议实践: - 访问官方主页 https://wan-pe.github.io/ 查阅各类题材(科幻、微距、人物特写)的原始 Prompt 与增强后影视级生成对比; - 查阅论文获取基于 SC-GRPO 进行长文本约束优化的奖励函数设计与多镜头 Prompt 格式规范; - 国内开发者可直接在 Hugging Face 论文专区免代理查阅 WanPEval 评测集与论文预印本。