机器人具身智能联合研究团队正式发布并开源了差量世界动作模型 DeltaWAM 与流式差量记忆机制 SDM(arXiv: 2609.28811,项目主页: aigeeksgroup.github.io/DeltaWAM/)。针对现有基于预训练视频生成模型的世界动作模型(WAMs)在训练和推演时盲目预测全尺寸密集未来帧、导致大量未变化背景吞噬算力且视频大模型严重拖慢动作生成延迟的痛点,DeltaWAM 首创“稠密锚点 + 稀疏视觉差量(Visual Deltas)+ 动作流”解耦架构,单步推演延迟暴降 36.57%,在双臂协同操作权威基准 RoboTwin 上取得 85.4% 的超高成功率。
- ✓打破传统机器人世界模型全尺寸密集逐帧预测的算力陷阱,首创视觉差量(Delta)与动作联合推演。
- ✓提出流式差量记忆(SDM),仅用紧凑观测差量增量更新缓存锚点,彻底释放重型视频专家模型的推理瓶颈。
- ✓训练 FLOPs 降低 17.8% 至 23.8%,单步动作生成推演延迟与计算量分别大幅减少 36.57% 与 31.55%。
- ✓在权威双臂机器人基准 RoboTwin 实测中,常规场景成功率达 85.4%,高随机视觉扰动下成功率达到 83.9%。
- ✓真实物理机械臂评估展现出业界顶级的操作平滑度,完整 PyTorch 代码与仿真基准已全量开源。
🔗
相关资源与官方项目出处
免代理直达💡 国内无需访问 Twitter,可直接访问上述项目官方资源与文档🔬
深度技术解析与实战评估
核心背景与行业痛点 双臂协调操作(Bimanual Manipulation,如协同折叠衣物、双手开瓶盖、双机械臂精密装配)是具身机器人最具挑战性的领域。近年来,研究界热衷于引入预训练视频生成模型打造世界动作模型(WAMs),期望借用视频模型的物理先验来预测操作后的画面与电机动作。然而,现有模型在每一个控制步都试图生成完整的全尺寸未来帧:画面中 90% 以上的桌面与背景其实静止未变,这种密集全帧预测不仅严重稀释了对细小机械臂末端接触点的表征注意力,更让沉重的视频专家模型成为实时高频控制(10-50Hz)的致命瓶颈,延迟居高不下导致机械臂动作迟滞甚至抖动摔损。 ### 架构亮点与底层机制 团队在 DeltaWAM 中构建了高度精简的差量动力学框架: 1. 差量三流解耦网络(Tri-Stream Delta Architecture):将输入分解为稠密上下文锚点流(Dense-Anchor)、稀疏几何差量流(Sparse-Delta)与动作执行流(Action Stream),重点只计算随时间发生形变与位移的动态残差; 2. 流式差量记忆(Streaming Delta Memory, 简称 SDM):建立常驻记忆高速缓存,后续时间步仅需用紧凑的视觉差量增量刷新缓存上下文,无需每次都唤醒高参数量的视频生成主干网络; 3. 多尺度接触动力学对齐:针对双臂指尖的接触力与物体相对位姿建立微观时空损失,使动作预测紧密耦合于局部的几何差量变化。 ### 权威 Benchmark 与实测跑分对比 在公认的高保真双臂操作仿真基准 RoboTwin 与真实双臂机械臂实测中: - 在标准干净场景下,DeltaWAM + SDM 的操作平均成功率从基线 Fast-WAM 的 81.3% 跃升至 85.4%; - 在加入复杂随机光照、反光与杂乱背景干扰的严苛扰动评测中,成功率从 75.8% 逆势拉升至 83.9%,展现出对视觉噪点极强的鲁棒性; - 模型训练阶段的总 FLOPs 减少了 17.78% 至 23.77%;在推理阶段,单步动作输出延迟缩短了 36.57%,推理 FLOPs 削减 31.55%,满足 30Hz 以上真机闭环实时控制需求。 ### 开发者实战落地与开箱指南 双臂机器人与具身控制算法工程师可按以下建议实践: - 访问官方主页 https://aigeeksgroup.github.io/DeltaWAM/ 查阅双臂真实物理操作录像与差量热力图展示; - 访问官方 GitHub 仓库 git clone https://github.com/AIGeeksGroup/DeltaWAM 获取适配 RoboTwin 的完整训练与评测代码; - 国内研究者可直接在 Hugging Face 论文专区免代理查阅论文预印本与配套参数配置。
讨论与评论
0登录后即可参与深度讨论
与广大 AI 开发者、工程师交流评测心得与前沿洞察