上海人工智能实验室与 OpenDataLab 正式开源统一世界动作模型(WAM)InternW0-Δ。基于开源界规模最大的 2 万小时具身异构语料库,模型采用 Mixture-of-Transformers(MoT)架构联合视频专家与动作专家协同建模。首创“因果印记”(Causal Imprint)机制,仅凭训练期未来监督即可将动态预测表征直接注入动作网络,在推理时彻底摒弃耗时数秒的未来视频渲染展开,实机泛化表现大幅超越既有具身模型。

核心要点速览 (Key Takeaways)

  • ✓2 万小时最大开源具身数据集:清洗并对齐涵盖机械臂实操、UMI 手持采集、人眼第一视角及 Ego2Robot 的 20,000+ 小时异构数据,建立统一状态-动作表征空间。
  • ✓MoT 异构多专家协同:在冻结 VLM 的语义指引下,让视频生成专家与动作预测专家在统一注意力空间内协同计算,通过训练期几何蒸馏注入 4D 空间先验。
  • ✓Causal Imprint 零延迟免展开:攻克传统世界动作模型在推理部署时必须花费数秒生成未来视频帧的落地死结,将未来场景变化因果压缩为隐状态直接供给动作执行,实现毫秒级端侧控制闭环。
🧭

阅读完核心要点?进一步了解模型实力与实际开销

7 大权威镜像天梯跑分与 29+ 款主流编程套餐横向比价测算

🔬

深度技术解析与实战评估

核心背景与行业痛点 具身智能(Embodied AI)长期受限于“动作执行缺少对物理世界动态演进的先验认知”。近年兴起的世界动作模型(World Action Models, WAMs)试图通过联合建模视觉动态与动作序列来突破这一瓶颈。然而,现有 WAM 模型存在两大落地死结:其一是训练数据极度匮乏,各家开源数据碎片化且格式割裂;其二是推理延迟不可承受——传统 WAM 在控制机器人做出下一步动作前,必须先在自回归/扩散过程中耗费数秒生成未来的高清视频预测帧,导致高频闭环控制成为空中楼阁。 ### 架构亮点与底层机制 上海 AI Lab 与 OpenDataLab 联合打造的 InternW0-Δ 实现了系统性重构: 1. 20,000+ 小时开源具身语料:清洗整合机械臂实操演示、UMI 移动手持、人眼第一视角视频及 Ego2Robot 映射数据,完成状态-动作标准化对齐,为业界建立最大公共具身基石; 2. Mixture-of-Transformers (MoT) 协同架构:在冻结的多模态大模型(VLM)全局语义引导下,将视频生成专家与连续动作预测专家进行交叉注意力融合,并在训练期通过几何知识蒸馏注入 4D 运动与空间先验; 3. 因果印记(Causal Imprint)机制:核心杀手锏创新。通过仅在训练阶段引入针对未来场景变化的自监督约束,使网络学会直接将未来的物理演进压缩为“因果印记隐状态”回传给动作专家。在推理部署阶段,完全不需要执行任何未来视频展开计算,直接实现高频动作输出。 ### 权威 Benchmark 与实测跑分对比 - 仿真基准测试(Simulation Benchmarks):在 CALVIN 与 RoboSuite 等主流长程机械操作测试集中,InternW0-Δ 的平均任务成功率大幅领先既有 SOTA 模型约 18.6%; - 真实机器人操作(Real-Robot Evaluation):在双臂协作、精细抓取与未见物体泛化场景下,实物成功率稳居 86.4% 以上; - 端到端控制延迟:相比需要视频展开的传统 WAM(平均单步决策延迟 1,800ms~3,200ms),InternW0-Δ 将动作推理延迟直接压降至 45ms 以内,满足 20Hz+ 工业级实时机械臂控制要求。 ### 开发者实战落地与开箱指南 - 项目主页与资源:项目全量源码与模型权重托管于 https://internrobotics.github.io/InternW0-Delta/; - 预印本论文:技术详述收录于 arXiv:2609.31394; - 开箱部署:官方提供适配 ROS2 与标准机械臂 Python 接口的驱动中间件,开发者可在本地单张 RTX 4090 或 A100 GPU 上一键启动毫秒级世界模型控制循环。