SWE-bench 评测团队联合顶尖机器人实验室(@SWEbench)正式发布 EmbodiedSWE 基准(arXiv: 2609.27308)。该基准将软件工程智能体的评测范围首次从纯代码仓库拓展至机器人仿真与物理交互环境,包含 250 个真实机器人控制系统长程任务,全面考察智能体从物理感知、算法调试到闭环电机控制的代码编写与排错能力。

核心要点速览 (Key Takeaways)

  • 包含 250 个覆盖 ROS2、Isaac Gym 与 MuJoCo 的工业级真实机器人控制编程难题。
  • 引入物理动力学闭环校验(Closed-Loop Physics Verification),必须通过仿真落地验证方可得分。
  • 测试显示当前最前沿编码智能体解决率不足 22%,揭示了 AI 从数字代码跨向物理具身控制的巨大能力鸿沟。
  • 官方基准数据集与评估容器已全面开源,国内机器人与具身智能开发者可直接下载测试。
🔬

深度技术解析与实战评估

核心背景与行业痛点 近年来以 SWE-bench 为代表的测试基准极大地推动了代码生成智能体的发展。然而,现有的代码测试集绝大多数局限于 Web 开发、数据分析与算法库,其代码逻辑运行于纯粹的数字离散空间。当开发者尝试让 Coding Agent 编写机器人底盘驱动、SLAM 建图融合或多指灵巧手逆运动学算法时,模型往往缺乏真实物理世界的质量、惯性、摩擦力与时序延迟常识,生成的代码频频引发仿真崩溃甚至硬件电机堵转。 ### 架构亮点与底层机制 EmbodiedSWE 构建了业界首个“代码编写-物理仿真-实时反馈”闭环评估沙箱: 1. 多环境融合底座:深度集成 ROS2 Humble、NVIDIA Isaac Gym 与 MuJoCo 物理引擎,提供高保真的刚体与柔体物理仿真环境; 2. 物理断言判定系统(Physical Assertions Engine):不仅检查代码语法与单元测试覆盖率,更通过监测机器人末端位姿误差、关节力矩冲击峰值与碰撞能量判定方案是否合格; 3. 多模态传感器时序流重放:向 Agent 提供 RGB-D 深度图、激光雷达点云与关节编码器历史时序日志,考察其根据真实物理报错日志自主 Debug 的能力。 ### 权威 Benchmark 与实测跑分对比 在针对业界各大主流前沿模型的基线评估中: - Claude 3.5 Sonnet 取得了 21.6% 的任务解决率,在运动规划与算法推导上展现出较强推理能力; - DeepSeek-V3 取得了 18.4% 的解决率,展现出极高的逆向调试代码编写效率; - 传统通用单模态模型解决率普遍低于 8%,表明具备物理空间感知的代码生成是下一代智能体进化的必由之路。 ### 开发者实战落地与开箱指南 具身智能与机器人领域的开发团队可即刻使用该基准: - 官方提供了标准化的 Docker 镜像环境,支持在配备单张 GPU 的工作站上一键拉起仿真测试; - 支持与 Cursor、OpenHands、Cline 等主流 Agent 框架直接桥接评测; - 访问 ArXiv 论文预印本与 GitHub 官方仓库,即可获取完整的评测任务集定义与 Baseline 实现。

正在评测或选型此类 AI 编程方案?
查看 7 大官方天梯榜综合跑分,或对比 17+ 厂商订阅成本与独家赠金。
ADSponsored