具身智能与多模态大模型前沿研究联合团队在 Hugging Face 与 ArXiv 正式公开了《World Action Agent: Harnessing VLMs for Robot Manipulation via World Action Rehearsal》(arXiv: 2609.29964)。针对目前将视觉语言模型(VLM)用于机器人时,要么沦为脆弱的间接代码生成器、要么仅拥有全局粗糙视角的局限,WAA 构建了基于“接触视角(Contact Views)”、“动作预演(Action Rehearsal)”与“视内实时纠偏”的视觉动作工作空间。通过多智能体协作框架,VLM 在执行物理指令前可自主推演动作并修正残余偏差,在长程复杂基准 LIBERO-Pro 上斩获 75.6% 成功率,大幅刷新世界纪录。
- ✓抛弃间接写代码或盲目端到端黑盒策略,让通用 VLM 直接在物理动作工作空间中闭环操作机器人。
- ✓首创“动作预演(Action Rehearsal)”机制:智能体在发出实际电机指令前在潜空间模拟并根据反馈调整动作提案。
- ✓引入视内实时纠偏(In-View Correction),动态消除相机标定误差与物理接触时的微小几何残差。
- ✓在 LIBERO-Pro 基准中斩获 75.6% 顶级成功率,微调轻量 Qwen3.5-9B 后跨域泛化成功率从 1.7% 狂飙至 43.3%。
- ✓论文预印本、多智能体交互架构与机器人操作轨迹库已在 ArXiv 与 Hugging Face 全面公开。
🔗
相关资源与官方项目出处
免代理直达💡 国内无需访问 Twitter,可直接访问上述项目官方资源与文档🔬
深度技术解析与实战评估
核心背景与行业痛点 通用视觉语言模型(VLM,如 GPT-4o、Qwen2-VL)拥有极其深厚的常识推理与空间感知能力,但将其落地于真实机器人机械臂操作时,现有技术往往陷入两难窘境:一种是“代码即策略(Code-as-Policies)”,让大模型生成 Python 代码调用预设 API,这在面对物体发生滑动或未知碰撞时毫无实时容错能力;另一种是端到端视觉-语言-动作模型(VLA),需要海量昂贵的真实机械臂遥操作数据从头预训练,泛化能力极其脆弱且黑盒不可解释。 ### 架构亮点与底层机制 World Action Agent(WAA)构建了一个多智能体协作的交互式视觉动作工作空间: 1. 接触几何视角聚焦(Contact Views):系统根据场景几何关系,自动裁剪并呈现机械臂末端执行器与目标物体接触点的超清局部视角,消除全局大场景的无关背景干扰; 2. 动作预演闭环(Action Rehearsal):提出“想象智能体(Imagination Agent)”,机械臂在执行物理下压或抓取动作前,先生成可编辑的动作提案并进行仿真预演,结合碰撞干涉反馈提前修正姿态; 3. 视内动态纠偏(In-View Correction):在机械臂运动的全过程中,Agent 能够实时比对当前视频流与预演画面的偏差,直接在视觉坐标系下发出细粒度位移微调,闭环消除残差。 ### 权威 Benchmark 与实测跑分对比 在长程、多阶段机器人操作权威基准 LIBERO-Pro 与 Robosuite 实测中: - WAA 仅依靠从基础任务(LIBERO-90)演化出的技能,即在未见过的复杂长程任务中取得了 75.6% 的平均成功率,全面超越端到端 VLA 基准(51.2%)与传统写代码策略(42.8%); - 在未经任何领域自适应训练的情况下,WAA 的操作技能直接在 Robosuite 机械臂场景中即插即用生效; - 借助 WAA 产生的高质量操作轨迹微调开源轻量级 Qwen3.5-9B 模型,模型在分布外全新任务上的抓取成功率从原生的 1.7% 飙升至 43.3%。 ### 开发者实战落地与开箱指南 具身智能实验室与机器人研发团队可按以下建议实践: - 参考论文的多智能体 Harness 架构,将现有多模态模型(Claude、Qwen、GPT)接入 ROS2 控制总线; - 引入 Contact Views 局部特征提取模块,解决高分辨率工控相机全景输入导致的延迟与精度稀释; - 国内研究者可免代理访问 ArXiv 论文页面与 Hugging Face 论文专区下载动作预演轨迹数据集与 Prompt 原型。
讨论与评论
0登录后即可参与深度讨论
与广大 AI 开发者、工程师交流评测心得与前沿洞察