北京大学 VaLuE 实验室(PKU-VaLuE-Lab,@huggingface)联合团队正式开源了空间声学具身智能模型 OmniEcho 与统一评测基准 OmniEchoBench(arXiv: 2609.23407,GitHub: PKU-VaLuE-Lab/OmniEcho)。人类可以凭听觉本能瞬时定位声源方位并融合视觉进行空间推理,但这一能力在现有智能体中几乎完全空白。团队构建了覆盖 197 个真实三维场景与 900 条一阶高保真立体混响(FOA)导航样本的基准评测,并提出具备一阶空间声学编码器的多模态智能体 OmniEcho,开创性实现了与经典纯视觉语言导航相媲美的高精度听觉引导机器人空间导航。
核心要点速览 (Key Takeaways)
- ✓打破具身智能体长期“仅靠眼睛看、耳朵完全失真”的单向视觉局限,开创空间声学具身感知新赛道。
- ✓开源业界首个统一空间声视感知与导航基准 OmniEchoBench,覆盖 197 个真实三维场景与 2,972 组声学问答。
- ✓提出首阶立体混响(FOA)空间声学编码器,建立声源物理位置、视觉特征与机械臂/底盘轨迹的几何一致性。
- ✓在听觉引导三维导航任务中,OmniEcho 达到了接近传统纯视觉语言导航(VLN)的同等定位精度水平。
- ✓全量评测数据集、三维可控声学渲染管道与 PyTorch 预训练模型权重已在 GitHub 和 Hugging Face 遵照开源协议发布。

讨论与评论
0登录后即可参与深度讨论
与广大 AI 开发者、工程师交流评测心得与前沿洞察