单张二维图像的三维场景重建向来依赖生成固定网格(Mesh)或神经辐射场/高斯泼溅(NeRF/3DGS),但这些黑盒输出不仅无法被专业三维渲染软件无损二次编辑,更难以支持物理推演与结构化空间查询。跨机构研究团队提出全新“图像到程序”(Image-to-Code)端到端框架 LEGO-Anything:将三维场景重建转化为编写可执行 Blender Python 代码的过程。Coding Agent 自主观察输入图像,迭代编写并执行脚本、生成多视角渲染图、自省对比并持续重构场景代码。针对智能体在长程生成中暴露出的初始布局虚弱、反向倒退修改与自评失真三大顽疾,团队推出免训练的即插即用型控制插件 LEGO-Plugin,在涵盖 104 个复杂室内外场景的全新基准 LEGO-Bench 上,使主流大模型的重建跑分相对暴涨高达 62.7%,为三维物理世界理解开辟了可解释、可编程的全新航道。
核心要点速览 (Key Takeaways)
- ✓Image-to-Code 突破性范式:彻底告别黑盒几何网格与不可编辑的辐射场,将 3D 重建升维为可解释、可参数化修改的 Blender 显式程序代码。
- ✓即插即用控制插件 LEGO-Plugin:直击智能体代码生成中“退化编辑”与“盲目自评”两大致命痛点,无需任何二次微调即可让各大主流模型综合得分相对提升高达 62.7%。
- ✓全自主下游视觉空间查询:重建后的场景代码可直接运行确定性物理与空间查询(目标检测、实例掩码、相对深度估计),为具身智能与物理仿真提供高保真数字化底座。
阅读完核心要点?进一步了解模型实力与实际开销
7 大权威镜像天梯跑分与 29+ 款主流编程套餐横向比价测算

讨论与评论
0登录后即可参与深度讨论
与广大 AI 开发者、工程师交流评测心得与前沿洞察