由杜一伦(Yilun Du)、张吕敏(Lvmin Zhang,ControlNet 作者)等顶尖学者联合团队在 Hugging Face 与 ArXiv 正式公开了《Training Object Permanence in World Models》(arXiv: 2609.28654)。尽管当前视频生成模型具备惊艳的画面表现力,但在三维物理规律中普遍缺乏人类婴儿级的“物体恒存性(Object Permanence)”认知——物体一旦被遮挡即发生形变、消失或凭空瞬移。团队开创性地推出了涵盖 150 个精细认知任务与 150 万组样本的 WROP 基准数据集,并基于 AWS Trainium2 开源训练了 16B 物理世界模型 PWM-WROP,在双盲 Elo 评测中登顶视频延续模型第一。

核心要点速览 (Key Takeaways)

  • ✓针对视频生成模型“出画即消失、被遮挡即形变”的物理常识盲区,构建认知科学级的数据基础设施。
  • ✓开源业界最大规模物体恒存性基准 WROP,包含 150 项程序化 Blender 认知任务与 150 万条多角度训练样本。
  • ✓全量开源 16B 参数级原生 PyTorch 物理世界模型 PWM-WROP 权重及在 AWS Trainium2 上的训练套件。
  • ✓在涵盖 14 款主流前沿视频模型的盲测 Elo 评测中,PWM-WROP 在长程视频延续生成赛道稳居全球第一。
  • ✓项目主页、评测考卷、模型权重与 PyTorch 代码已遵照宽松协议向全球完全公开。
🔬

深度技术解析与实战评估

核心背景与行业痛点 随着 Sora、Gen-3、Kling 等视频生成模型的发展,工业界普遍寄望于将视频扩散模型打造为理解物理世界的通用世界模型(World Models),用以赋能自动驾驶与具身机器人仿真。然而,顶尖认知科学家指出:目前的视频模型虽然能生成极其逼真的光影,却普遍缺乏人类幼童在数月大即掌握的“物体恒存性(Object Permanence)”与“实体不可穿透性”。当一个小球滚入纸箱后方再出来,或者车辆驶入隧道时,视频模型经常将物体凭空消除、无序形变或生成幽灵幻影,严重阻碍其作为真实世界物理模拟器的可行性。 ### 架构亮点与底层机制 杜一伦、张吕敏等团队在 WROP(World Reasoning with Object Permanence)体系中做出了开拓性突破: 1. 认知科学启发的任务合成矩阵:设计了六大核心物理认知维度(遮挡持续性、重力支撑、刚体碰撞、空间包含等)共 150 个精细化场景,利用 Blender 脚本程序化对相机机位、动态光影与运动速度进行无偏随机化,构建出 150 万条高质量物理交互轨迹; 2. 认知探针评测考卷(Cognitive Exam):设计了包含 300 道反直觉物理陷阱的高难度评测考题,严格考查模型在长遮挡周期的时空一致性与因果推断力; 3. PWM-WROP 16B 世界模型:基于原生 PyTorch 构建了 16B 规模的物理世界基础模型,在 AWS Trainium2 高性能算力集群上完成了端到端大规模自回归时空预训练与认知微调。 ### 权威 Benchmark 与实测跑分对比 在对 14 款业界主流视频模型(涵盖参考生成、视频编辑与自回归延续三大流派)的综合横评中: - 在双盲配对 Elo 评测(Blind Pairwise Elo Study)中,PWM-WROP 在所有视频延续生成(Continuation)模型中高居第一,并在全流派总榜中仅次于需要高强参考图的两款特化参考模型; - 面对长达 5 秒以上的复杂遮挡物穿越测试,PWM-WROP 的物体时空轨迹还原精度(Trajectory Coherence)达到 91.8%,将遮挡形变幻觉率从基线的 64.3% 压制到 12.4%; - 评测证明,经认知科学数据注入的模型展现出强烈的物理因果先验,具备直接作为机器人强化学习沙箱的工程价值。 ### 开发者实战落地与开箱指南 国内多模态、自动驾驶与世界模型研究团队可按以下方式体验: - 访问官方主页 https://www.object-permanence.world/ 查阅全套 150 项认知任务的交互式 3D 演示; - GitHub 官方仓库 git clone https://github.com/hokindeng/object-permanence 已开放完整的 Blender 数据生成脚本与 AWS Trainium2 训练栈; - 模型预训练检查点与 300 题基准评测集已全面同步至 Hugging Face,开发者可直接下载评测复现。