北京大学 VaLuE 实验室(PKU-VaLuE-Lab,@huggingface)联合团队正式开源了空间声学具身智能模型 OmniEcho 与统一评测基准 OmniEchoBench(arXiv: 2609.23407,GitHub: PKU-VaLuE-Lab/OmniEcho)。人类可以凭听觉本能瞬时定位声源方位并融合视觉进行空间推理,但这一能力在现有智能体中几乎完全空白。团队构建了覆盖 197 个真实三维场景与 900 条一阶高保真立体混响(FOA)导航样本的基准评测,并提出具备一阶空间声学编码器的多模态智能体 OmniEcho,开创性实现了与经典纯视觉语言导航相媲美的高精度听觉引导机器人空间导航。

核心要点速览 (Key Takeaways)

  • ✓打破具身智能体长期“仅靠眼睛看、耳朵完全失真”的单向视觉局限,开创空间声学具身感知新赛道。
  • ✓开源业界首个统一空间声视感知与导航基准 OmniEchoBench,覆盖 197 个真实三维场景与 2,972 组声学问答。
  • ✓提出首阶立体混响(FOA)空间声学编码器,建立声源物理位置、视觉特征与机械臂/底盘轨迹的几何一致性。
  • ✓在听觉引导三维导航任务中,OmniEcho 达到了接近传统纯视觉语言导航(VLN)的同等定位精度水平。
  • ✓全量评测数据集、三维可控声学渲染管道与 PyTorch 预训练模型权重已在 GitHub 和 Hugging Face 遵照开源协议发布。
🔬

深度技术解析与实战评估

核心背景与行业痛点 在家庭服务机器人、灾后救援与工业巡检中,大量关键环境线索并非视觉可见的(如被墙体遮挡的呼救声、隔壁房间漏水滴落声、机器设备异常轴承摩擦声)。然而,现有的前沿具身多模态模型(如各类 VLA)几乎全部建立在纯视觉感知之上,即使接收音频也仅处理单声道的文字语音转换(ASR),彻底丢弃了声波到达双耳的时间差(ITD)与强度差(ILD)等关键物理空间坐标,导致机器人面对视野外的声源时完全盲目。 ### 架构亮点与底层机制 北京大学团队在 OmniEcho 中实现了空间声学与三维场景几何的原生融合: 1. 首阶立体混响(FOA)空间编码器:采用 4 通道 B-format 一阶球谐函数表征,将全景三维声场精确分解为全向声压与 X/Y/Z 三维声强矢量,从物理底层捕捉声源的三维立体指向; 2. 可控空间声学几何渲染管线:构建了能够严格保持“声源三维坐标、机器人观察相机视点、移动轨迹”空间几何一致性的仿真渲染管道,解决了多模态空间声学训练数据极度匮乏的瓶颈; 3. 多模态声视跨注意力融合网络:将声学空间特征图投影至自注意力层,与视觉特征在统一的极坐标系下完成交叉检索,实现“循声辨位、以位定物”。 ### 权威 Benchmark 与实测跑分对比 在跨室内多房间场景的 OmniEchoBench 六大感知与导航任务实测中: - 在三维声源方向定位(DOA)与被遮挡声源感知任务中,OmniEcho 的角误差降低了 36.8%,空间问答准确率较单声道基线模型跃升 41.5%; - 在极富挑战的跨房间“听声循位导航(Audio-Vision-Language Navigation)”实测中,仅依靠微弱的环境音,机器人的目标寻获成功率达到 68.4%,达到了传统依赖明晰视觉地图的高端导航算法相媲美的表现; - 评测同时揭示了微观距离精确估计与动态移动多普勒效应仍是未来具身声学的关键开放课题。 ### 开发者实战落地与开箱指南 具身机器人、智能家居与多模态感知团队可按以下步骤接入: - 克隆 GitHub 官方开源仓库:git clone https://github.com/PKU-VaLuE-Lab/OmniEcho; - 项目提供基于 ROS2 的麦克风阵列数据采集驱动与 FOA 格式实时转换工具; - 国内开发者可直接在 Hugging Face 页面下载预训练好的 OmniEcho 检查点与 OmniEchoBench 评测数据。