通用具身机器人(Generalist Robots)的核心理想不仅在于能够完成多项离散任务,更在于能够从执行试错中持续学习,将单次经验转化为可在未来任务中复用的结构化技能资产。然而,现有基于代码生成的机器人智能体(Code-as-Policies)在面对失败时,往往缺乏对任务层级结构的系统性解构,导致每次修复无法精准归因到具体的动作能力模块,且微调极易引发对已有任务的‘灾难性遗忘’。上海人工智能实验室(Shanghai AI Lab)与清华大学等联合研究团队在最新研究(arXiv:2610.12424)中推出了机器人自主进化系统 RoboRSI(开源仓库:github.com/nssmd/RoboRSI)。RoboRSI 首创了‘自顶向下技能精炼(Top-Down Skill Refinement, TSR)’架构,将任务拆解为复合技能、原子技能与基础底座技能三层结构,为每一层定义严格的输入输出契约。系统由 Manager(主管)、Planner(规划器)、Engineer(工程师)与 Reviewer(审查员)四大多智能体协同运转,实现了计划、执行、故障诊断与技能发布的严密流水线。在真实移动双臂复合机器人上,RoboRSI 连续演化了 104 轮复杂多物体家政清理任务;在 LIBERO、LIBERO-PRO、LIBERO-Plus 和 RoboTwin 四大仿真基准上全线斩获最高成功率,相比最强基线提升 2.7 至 11.0 个百分点,官方代码已开源。
核心要点速览
- ✓上海 AI Lab 等开源 RoboRSI,首创自顶向下技能精炼(TSR)与四智能体协同机器人代码自进化框架
- ✓在真实实体机器人上连续 104 轮自主家政进化,LIBERO 等 4 大具身基准全线横扫 SOTA 领先 2.7~11.0 个百分点
- ✓契约隔离机制将故障归因精度提升至 95.8%,实现机器人代码资产终身可复用与零灾难性遗忘
把技术选型换算成你的开发预算
40 款主流编程套餐横向比价,支持输入/输出 Token 真实账单模拟
相关资源与官方项目出处
免代理直达深度技术解析与实战评估
核心背景与行业痛点
随着代码大模型(LLMs)被深度用于机器人控制(如 Code-as-Policies、Voyager 等),智能体通过直接编写和修复 Python 动作代码展现出极强的任务泛化能力。然而,现有的自适应机器人系统在迈向真实复杂生产环境时,面临着两大根本性瓶颈:
- 故障归因模糊与牵一发而动全身:当机器人在抓取苹果放入果盘的任务中失败时,传统系统往往直接将整个报错日志丢给大模型让其全局重写代码。这种粗暴做法无法区分到底是“感知位姿估算错误(Base Skill)”、“夹爪闭合时机错误(Atomic Skill)”还是“整体任务调度逻辑错误(Compound Skill)”,极易导致把原本写好的成熟逻辑改坏;
- 经验无法沉淀为持久资产:单次任务跑通的代码往往是高度特异性、硬编码的临时脚本,无法转化为标准化 API 供后续的复杂任务继承调用。
架构亮点与底层机制
为了构建高稳定、可复用且终身演化的机器人软件工程体系,上海 AI Lab 团队提出了 RoboRSI 架构(arXiv:2610.12424,开源项目 github.com/nssmd/RoboRSI):
- 自顶向下技能精炼树(Top-Down Skill Refinement, TSR):TSR 严格将具身能力划分为三级金字塔结构:底层 Base Skills(如基础逆运动学解算、点云滤波)、中层 Atomic Skills(如对齐物体表面、闭合夹爪)以及顶层 Compound Skills(如清理餐桌、收纳玩具)。每一级技能均具备严格的强类型输入输出契约(I/O Contracts)与前置/后置断言校验;
- 四大多智能体协同流水线(Four-Agent Governance):
- Manager:宏观掌控业务全局目标,拆解执行预算与发布里程碑;
- Planner:根据任务语义编排技能调用有向无环图(DAG);
- Engineer:针对报错分支精准编写单元修复补丁,实施局部代码热重构;
- Reviewer:在沙箱中对新技能运行多轮回归测试,只有 100% 满足契约断言后才批准合入官方技能库;
- 稳定技能链自动固化:随着执行轮次增加,多次被验证稳定的原子技能调用序列会自动被系统编译固化为新的高阶复合技能,实现机器人代码资产的自主滚雪球沉淀。
权威 Benchmark 与实测跑分对比
研究团队在涵盖真实物理实体机器人与主流具身仿真基准上展开了高强度极限压测:
- 真实硬件连续 104 轮无死机自主进化:在搭载双机械臂与全向底盘的移动复合机器人上,RoboRSI 在未经人工重置代码的前提下,自主执行了多物体家庭清扫任务,历经 104 轮连续试错与自修复,成功沉淀出包含 32 个稳健技能的高可用库;
- 四大具身基准全线横扫 SOTA:在权威机器人控制评测集 LIBERO、长程扩展版 LIBERO-PRO、带干扰扰动的 LIBERO-Plus 以及双臂协同基准 RoboTwin 上,RoboRSI 全面刷新最高成功率,相比现存最强基线系统(如 Voyager、Dobb-E、Evo-Agent)领先幅度达 2.7 至 11.0 个百分点;
- 模块化故障定位准确率提升 74%:在注入传感器噪点与物理碰撞异常的诊断测试中,TSR 契约机制将 Bug 归因到正确技能分支的准确率从传统系统的 21.3% 大幅提升至 95.8%,大幅缩短了代码修复迭代耗时。
开发者实战落地与开箱指南
RoboRSI 官方代码与仿真环境已在 GitHub(github.com/nssmd/RoboRSI)开源。这项成果为从事服务机器人开发、工业柔性产线以及具身自动化测试的研发团队树立了规范的软件工程标杆:切勿放任大模型直接生成整段黑盒脚本。建议工程架构采用 TSR 范式:对硬件底座驱动与原子动作定义严苛的断言边界,通过“分层隔离 + 多角色 Reviewer 质检”约束 Coding Agent 的变异范围,让机器人在安全可控的沙箱中将每一次执行失败转化为模块化的确定性技能资产,加速具身智能的大规模商业落地。
即刻查看该技术对应模型与主流工具的实测差异,或一键测算团队 API 调用与 $20/月套餐盈亏平衡点。
讨论与评论
0登录后即可参与深度讨论
与广大 AI 开发者、工程师交流评测心得与前沿洞察