世界动作模型(World Action Models, WAMs)通过从初始观察与指令中联合预测未来的视觉动态与动作流,被视为具身机器人自主操控的核心发展路径。然而现有 WAM 架构在面对长程复杂任务时面临难以克服的算力瓶颈:逐帧自回归生成稠密视频不仅计算极度昂贵且误差累积严重,而若简单退化为仅预测单一终态帧,又完全丧失了朝向目标渐进推进的中间视觉指导。Meta FAIR 联合上海交通大学团队提出了前沿渐进式世界动作模型 ProWAM(arXiv:2610.02508):核心创新在于联合预测动作以及一组按序排列的“稀疏视觉子目标(Sparse Visual Sub-goals)”,为任务全生命周期的动作生成提供精准锚定的时空视觉脚手架。该架构通过单次前向传播将视频主干提炼的稀疏子目标特征进行高效缓存,彻底终结了重规划时重复生成完整视频的笨重开销,仅需轻量级动作去噪即可完成闭环控制。在仿真基准测试中,ProWAM 在 LIBERO-Plus 上斩获 85.8% 胜率(相对提升高达 +35.9%),在随机化 RoboTwin 上取得 75.7% 胜率,在 RoboCasa365 的 Composite-Unseen 挑战集上名列前茅;尤为关键的是,在零样本真实物理机械臂操作中,ProWAM 在陌生全新场景下达成 70.0% 的超高成功率,相对业界最强基线提升 27.3%。
核心要点速览
- ✓提出渐进式世界动作模型 ProWAM,以有序稀疏视觉子目标(Sub-Goals)取代传统臃肿的密集视频生成
- ✓单次前向传播缓存子目标高维特征,闭环重规划仅需轻量动作去噪,兼顾宏观视觉远见与毫秒级控制响应
- ✓LIBERO-Plus 仿真胜率达 85.8%(相对暴涨 +35.9%),真实物理机械臂零样本操控胜率从 55% 跃升至 70%

开发者 3 秒速决决策指标
把技术选型换算成你的开发预算
29+ 款主流编程套餐横向比价,支持输入/输出 Token 真实账单模拟
相关资源与官方项目出处
免代理直达深度技术解析与实战评估
核心背景与行业痛点
将视觉生成模型与机器人控制相结合的世界动作模型(World Action Models, WAMs),能够让机器人“在脑海中预演未来物理画面的演变,并同时规划动作轨迹”,是实现通用具身智能(Embodied AI)的核心构想。然而,现有的世界动作模型在长流程复杂操控中面临致命的两难困境:若直接自回归生成高帧率的密集连续视频,单次推理耗费高达数秒至数十秒,且时序上的微小误差会在数十帧后迅速发散漂移;而若为了追求效率,仅预测任务完成时的最终单张画面(Single Future Frame),模型则完全失去了逐步向目标演进的中间路标,一旦在半途中遭遇抓取滑脱或障碍物碰撞,机器人便无法判定自己当前身处何种阶段,导致动作执行彻底脱节。
架构亮点与底层机制
针对密集视频生成的算力黑洞与单帧预测的视野缺失,Meta FAIR 与上海交通大学联合团队提出了基于渐进式视觉规划的世界动作模型 ProWAM(arXiv:2610.02508):
- 按序排列的稀疏视觉子目标序列(Progressive Sparse Visual Sub-Goals):ProWAM 创新性地在动作策略与生成模型之间构建了“渐进式路标”——联合预测动作轨迹与一组按时间时序排序的关键稀疏视觉子目标帧,为全流程动作合成提供连续且锚定的视觉演进参照物;
- 解耦的大规模无动作视频预训练:视觉子目标的生成能力可以直接在互联网上海量未标注动作的无监督视频(Action-Free Videos)上进行预训练扩展,使得强大的视频主干网络能够天然承担高维复杂的视觉空间规划职责,极大减轻底层动作策略的拟合负担;
- 单次前向特征缓存与轻量重规划(Single-Pass Feature Caching):ProWAM 仅需执行一次视频主干网络的单次前向计算,即可将整套稀疏子目标的深层视觉特征完全缓存;在后续闭环高频控制与动态重规划中,无需反复重新合成视频,只需基于缓存特征运行极其轻量的动作去噪器(Action Denoising),兼顾了高维前瞻性与实时控制响应率。
权威 Benchmark 与实测跑分对比
在跨越多个业界顶级机器人仿真基准与真实的实体物理机械臂严苛实验中,ProWAM 展现出了惊人的泛化与抗扰能力:
- LIBERO-Plus 仿真胜率达 85.8%(相对提升 +35.9%):在公认高难度的具身控制基准 LIBERO-Plus 上,ProWAM 斩获 85.8% 的最高成功率,相较此前的最强基线实现高达 +35.9% 的相对胜率爆发;在环境随机化扰动测试 RoboTwin 上斩获 75.7%;
- 高难 RoboCasa365 基准位列顶尖梯队:在模拟真实家居场景的 RoboCasa365 上取得 48.1% 的平均成功率,在最具挑战性的复合未知环境切片(Composite-Unseen Split)中达到 18.2%,位列全球综合评测第 4 位;
- 真实物理实体机械臂零样本胜率飙升至 70.0%:在零样本(Zero-Shot)直接迁移至真实世界未知物体与全新摆放场景的物理机械臂抓取分拣中,ProWAM 取得 70.0% 的极高实战胜率,相比最强基准(55.0%)净增 15.0 个百分点(相对提升 +27.3%),证实了渐进式视觉前瞻在闭环物理控制中的非凡价值。
开发者实战落地与开箱指南
ProWAM 的研究成果、演示视频与交互式项目主页已在 GitHub Pages(sii-ferenas.github.io/ProWAM-page/)正式上线。对于正在从事具身智能机械臂开发、仓储自动化物流分拣以及家庭服务机器人研发的技术团队,ProWAM 指明了一条摆脱昂贵视频自回归生成的破局之路。开发者无需在端侧设备上艰难部署臃肿的每秒数十帧的视频扩散流水线,通过引入“稀疏视觉子目标缓存+轻量动作去噪”的分层架构,即可在边缘计算设备上实现兼具人类般宏观预判视野与毫秒级敏捷反应的高性能具身智能控制系统。
即刻查看该技术对应模型与主流工具的实测差异,或一键测算团队 API 调用与 $20/月套餐盈亏平衡点。
讨论与评论
0登录后即可参与深度讨论
与广大 AI 开发者、工程师交流评测心得与前沿洞察