单张二维图像的三维场景重建向来依赖生成固定网格(Mesh)或神经辐射场/高斯泼溅(NeRF/3DGS),但这些黑盒输出不仅无法被专业三维渲染软件无损二次编辑,更难以支持物理推演与结构化空间查询。跨机构研究团队提出全新“图像到程序”(Image-to-Code)端到端框架 LEGO-Anything:将三维场景重建转化为编写可执行 Blender Python 代码的过程。Coding Agent 自主观察输入图像,迭代编写并执行脚本、生成多视角渲染图、自省对比并持续重构场景代码。针对智能体在长程生成中暴露出的初始布局虚弱、反向倒退修改与自评失真三大顽疾,团队推出免训练的即插即用型控制插件 LEGO-Plugin,在涵盖 104 个复杂室内外场景的全新基准 LEGO-Bench 上,使主流大模型的重建跑分相对暴涨高达 62.7%,为三维物理世界理解开辟了可解释、可编程的全新航道。

核心要点速览 (Key Takeaways)

  • ✓Image-to-Code 突破性范式:彻底告别黑盒几何网格与不可编辑的辐射场,将 3D 重建升维为可解释、可参数化修改的 Blender 显式程序代码。
  • ✓即插即用控制插件 LEGO-Plugin:直击智能体代码生成中“退化编辑”与“盲目自评”两大致命痛点,无需任何二次微调即可让各大主流模型综合得分相对提升高达 62.7%。
  • ✓全自主下游视觉空间查询:重建后的场景代码可直接运行确定性物理与空间查询(目标检测、实例掩码、相对深度估计),为具身智能与物理仿真提供高保真数字化底座。
🧭

阅读完核心要点?进一步了解模型实力与实际开销

7 大权威镜像天梯跑分与 29+ 款主流编程套餐横向比价测算

🔬

深度技术解析与实战评估

核心背景与行业痛点 从单张图像重建三维物理世界是计算机视觉、具身智能与虚拟仿真的终极目标之一。近年来,以 NeRF 与 3D Gaussian Splatting(3DGS)为代表的神经渲染方案取得了逼真的图像合成效果,但在工业工程实践中遭遇了难以逾越的壁垒: 1. 黑盒几何不可编辑:神经场生成的数百万个离散高斯球或顶点密度场无法被导入 Blender、Maya 等行业标准 CAD/DCC 工具进行分层拆解、材质替换与实体微调; 2. 缺乏语义层次与物理可解释性:黑盒重建无法表达“桌面放有一台电脑”、“椅子位于桌腿后方”等结构化拓扑关系,难以支撑机器人物理操作仿真或空间几何逻辑推导。 ### 架构亮点与底层机制 研究团队提出了创新的 LEGO-Anything 框架,将 3D 重建重新形式化为代码生成智能体的交互开发过程: 1. Image-to-Code 编程闭环:以 Blender Python 为中间表达语言,Coding Agent 观察输入单图,自主编写场景初始化脚本并调用 Blender 内核渲染;随后对比渲染图像与原图差异,自适应迭代修补代码; 2. 首发仿真地面基准 LEGO-Bench:采集 104 个涵盖复杂室内(如会议室、卧室)与室外(如庭院、街道)的高保真物理仿真场景,生成 208 张评测图像,全方位量化代码执行合法性、可见表面几何精度以及外观渲染相似度; 3. 即插即用控制插件 LEGO-Plugin:分析智能体交互轨迹发现三大缺陷:弱初始布局、倒退修改(越改越差)以及不可信自评。团队设计了免训练的控制插件,显式约束编辑范围并引入多视角差分锚定,杜绝逻辑退化。 ### 权威 Benchmark 与实测跑分对比 - LEGO-Bench 权威评测:在前沿多模态大模型评测中,基线 GPT-6-astra 在室内场景获得 53.4% 得分,室外获得 39.6% 得分; - 即插即用暴涨 +62.7%:引入免微调的 LEGO-Plugin 后,所评估的六大主流模型表现全面飙升,综合得分相对提升幅度最高达到 62.7%; - 原生下游视觉任务派生:在衍生出的 LEGO-World 任务中,利用生成的 Blender 程序可直接进行零样本确定性三维查询(无需专用感知网络直接输出 3D 物体框、实例分割掩码与真实度量深度),证明程序化场景可作为极具前景的物理环境表达基底。 ### 开发者实战落地与开箱指南 - 论文与技术细节:完整实验架构与代码提示词链已收录于 arXiv:2609.36380; - 3D 数字化工程启示:游戏资产开发与建筑设计团队可借鉴该方案,利用 Coding Agent 自动将概念原画转化为带节点树、材质层与摄像机轨道的原始 .blend 工程,大幅解放 3D 艺术家重复建模劳动力; - 具身智能仿真接入:生成的 Blender 脚本具有完整的刚体与碰撞体积定义,能够无缝导出为 URDF 或 Isaac Sim 格式供机器人运动规划测试。