浙江大学计算机学院 OmniAI 实验室(@huggingface)联合产业界正式开源了 Spatial-Interactor 空间推理架构与大规模交互式空间数据集 LSI-108K(arXiv: 2609.23038)。针对传统视觉语言模型(VLM)停留在静态被动图像识别、面对三维物理世界中深度、遮挡与动态位姿极易发生严重空间幻觉的难题,Spatial-Interactor 首次构建了“动作改变视角、多视角迭代闭环校准”的交互式空间推理机制,全面开源代码与 Apache 2.0 权重。
- ✓告别静态单帧看图推测,首创通过机械臂/相机主动多角度交互消除三维空间几何盲区。
- ✓开源业界首个高质量交互式空间推理数据集 LSI-108K,覆盖 10.8 万组闭环交互轨迹与空间问答对。
- ✓在具身物体定位、三维包围框估计与复杂障碍物避让任务中,三维空间推理准确率平均提升 33.8%。
- ✓全量训练代码、评测基准与模型权重已在 GitHub 和 Hugging Face 遵照 Apache 2.0 协议开源。
🔗
相关资源与官方项目出处
免代理直达💡 国内无需访问 Twitter,可直接访问上述项目官方资源与文档🔬
深度技术解析与实战评估
核心背景与行业痛点 随着具身智能机器人(Embodied AI)与自动驾驶的演进,大模型必须精确理解物理三维世界的几何空间关系(如判断目标物体的绝对距离、遮挡体后方空间与抓取接触点)。然而,现有的前沿多模态大模型(包括 GPT-4o、Claude 3.5 Sonnet、Qwen2-VL)多采用静态图片作为输入。在单目视角的透视缩放与反光遮挡干扰下,静态模型往往发生严重的“视错觉”,无法准确推断真实世界的三维坐标与深度信息,导致机械臂在抓取时频繁扑空或发生物理碰撞。 ### 架构亮点与底层机制 浙江大学团队提出了“交互式主动感知闭环(Interactive Active Perception)”理念: 1. 动作-观察因果状态机(Action-Conditioned State Machine):模型不再被动等待输入,而是能够自主向物理设备发出“向左平移 15cm”、“俯仰旋转 30 度”等探索动作指令,通过改变传感器位姿获取视差信息; 2. 跨视点空间注意力对齐网络:将前后多步相机位姿变化矩阵融入自注意力层,从动态光流与特征点位移中实时构建物理实体的三维神经辐射先验; 3. LSI-108K 闭环数据集:构建了涵盖真实机械臂操作台、桌面乱序堆叠与工业分拣场景的 108,000 条高质量探索轨迹,填补了具身空间交互训练数据的空白。 ### 权威 Benchmark 与实测跑分对比 在跨室内与工业操作的三维空间问答基准(ScanNet-Spatial 及 RealManip)实测中: - 相比仅输入两张静态图片的对比基线,Spatial-Interactor 在三维边界框中心点定位误差上降低了 54.2%; - 复杂遮挡环境下物体空间相对关系的判断准确率从 51.6% 跃升至 85.4%; - 机械臂真实桌面复杂物体分拣任务的一次性成功率达到 89.2%,展现出卓越的工程泛化能力。 ### 开发者实战落地与开箱指南 国内机器人与计算机视觉开发者可按以下步骤极简开箱: - 克隆 GitHub 官方仓库 git clone https://github.com/ZJU-OmniAI/Spatial-Interactor; - 支持与 ROS2、Isaac Gym 仿真环境以及主流 RealSense 深度相机即插即用桥接; - 开发者可免代理直接在魔搭社区与 Hugging Face 页面下载预训练权重进行下游任务微调。
讨论与评论
0登录后即可参与深度讨论
与广大 AI 开发者、工程师交流评测心得与前沿洞察