LEGO-Anything: Coding Agents for 3D Scene Reconstruction
作者:Xirui Li, Peng Shi, Mingwen Dong, Sheng Zhang, Zhuoyan Xu, Dongkyu Lee, Shuaichen Chang, Yi Xiang, Lin Pan, Jiarong Jiang
核心发表机构:University of Maryland, College Park、AWS
论文链接:arXiv:2609.36380v1
发布于:arXiv 预印本(cs.CV)
|—😐—😐—😐—😐—😐—😐—😐—😐
|GPT-6-astra+ Codex | 100.0±0.0 | 52.4±1.1 | 54.4±0.7 |53.4±0.8| 98.0±1.0 | 34.0±1.5 | 45.5±0.5 |39.6±0.8|
|GPT-6-sol+ Codex | 99.4±1.1 | 22.2±2.4 | 42.5±0.3 | 32.3±1.0 | 99.7±0.6 | 19.8±1.0 | 28.7±0.5 | 24.2±0.4 |
|GPT-6-luna+ Codex | 99.7±0.5 | 15.8±1.2 | 30.5±0.3 | 23.2±0.7 | 99.7±0.6 | 13.2±0.6 | 21.4±0.5 | 17.3±0.5 |
|GPT-5.6-sol+ Codex | 97.8±2.3 | 9.8±2.1 | 19.8±0.6 | 14.8±1.0 | 98.7±0.6 | 12.8±1.8 | 17.7±0.4 | 15.3±0.8 |
|GPT-5.6-terra+ Codex | 99.7±0.5 | 9.5±1.0 | 21.3±0.5 | 15.4±0.6 | 98.0±1.7 | 8.1±0.7 | 15.0±0.9 | 11.5±0.4 |
|GPT-5.6-luna+ Codex | 99.1±0.0 | 10.2±2.1 | 18.0±0.7 | 14.1±1.3 | 97.0±1.0 | 7.8±1.5 | 16.6±0.8 | 12.1±1.0 |
基线结果如下,其中 “–” 表示论文设置下未报告该 split。
| 基线 | Indoor V | Indoor R | Indoor A | Indoor S | Outdoor V | Outdoor R | Outdoor A | Outdoor S |
|---|---|---|---|---|---|---|---|---|
| VIGA | 100.0±0.0 | 10.8±1.5 | 20.3±0.7 | 15.6±1.1 | 100.0±0.0 | 8.0±0.4 | 17.1±0.0 | 12.6±0.2 |
| SceneConductor | 12.3±2.3 | 5.0±2.1 | 0.0±0.0 | 0.3±0.2 | – | – | – | – |
| 3D-RE-GEN | 100.0±0.0 | 1.2±0.1 | 11.3±0.2 | 6.3±0.1 | – | – | – | – |
| Gen3DSR | 92.0±1.1 | 65.4±0.7 | 0.0±0.0 | 30.1±0.4 | 80.0±1.0 | 35.0±0.5 | 0.0±0.0 | 14.0±0.1 |
| REST3D | 77.5±13.0 | 7.2±0.7 | 0.0±0.0 | 2.8±0.4 | – | – | – | – |
| SceneGen | 71.6±3.0 | 9.7±1.8 | 0.0±0.0 | 3.4±0.5 | 38.7±1.5 | 2.6±1.1 | 0.0±0.0 | 0.5±0.2 |
主要发现是:所有六个 GPT 配置的 Validity 接近饱和,但保真度差异很大,总体分数从GPT-6-astra的 53.4%/39.6% 到最强GPT-5.6配置的 15.4%/15.3%。GPT-6-astra取得最佳总体分数,超过 task-specific 与 single-image scene-construction 基线。Gen3DSR 的 Reconstruction 高于GPT-6-astra(室内 65.4% vs. 52.4%),但其 Appearance 无法评估(0.0%)。VIGA 和 3D-RE-GEN 能交付有效 artifact,但保真度低。六个基线中有三个不支持 outdoor 场景;而所有编码智能体都能在 indoor/outdoor 两个 split 上运行,Validity 稳定,尽管所有模型在 outdoor 上保真度下降。核心结论是:编码智能体能够稳定交付有效 artifact,但 artifact delivery 与忠实场景重建之间仍存在明显差距。
成本–性能方面,论文用标准化 token 成本代理作为横轴,benchmark 全域、经 artifact 有效性门控的 Final 分数作为纵轴,虚线连接非支配前沿。GPT-5.6-luna是绝对最便宜的点,但质量–成本前沿的大部分由 GPT-6 家族定义:GPT-6-luna相对最低成本区间显著提升,GPT-6-sol以中等成本再添一档质量,GPT-6-astra以显著更高花费达到最高分。GPT-5.6-sol与GPT-5.6-terra位于前沿之外。
Bird’s-Eye 重建压力测试单独报告在非配对的 NYC Bird’s-Eye split 上,每次完整运行含 10 个俯视视图 case;该表报告三个 GPT-6 agent 的 artifact validity、Reconstruction F@2%、Appearance 与有效性门控 Final 分数。
| Model + Harness | V ↑ | R ↑ | A ↑ | S ↑ |
|---|---|---|---|---|
GPT-5.6-sol+Codex | 93.3 ± 5.8 | 11.2 ± 7.9 | 24.3 ± 3.3 | 16.4 ± 3.6 |
GPT-5.6-terra+Codex | 86.7 ± 5.8 | 0.9 ± 1.3 | 23.0 ± 4.2 | 10.7 ± 2.8 |
GPT-5.6-luna+Codex | 80.0 ± 10.0 | 7.6 ± 6.0 | 21.1 ± 2.9 | 11.4 ± 2.8 |
GPT-6-astra+Codex | 100.0 ± 0.0 | 24.0 ± 5.0 | 46.6 ± 0.3 | 35.3 ± 2.5 |
GPT-6-sol+Codex | 100.0 ± 0.0 | 17.8 ± 2.6 | 40.0 ± 0.8 | 28.9 ± 1.0 |
GPT-6-luna+Codex | 100.0 ± 0.0 | 6.7 ± 4.7 | 34.4 ± 0.7 | 20.0 ± 2.7 |
结论是:GPT-6-astra在 Bird’s-Eye 压力测试中最强,GPT-6 家族显著优于 GPT-5.6 家族;但所有模型在 artifact 交付与远更弱的严格几何重建(F@2%)之间仍存在明显差距。
LEGO-World 测试重建场景能否表示自然图像。实验用未启用 LEGO-Plugin 的GPT-6-astra,在三条固定 100 图像轨迹上评测:COCO val2017 检测、LVIS v1 验证集实例分割、ETH3D 相对深度。agent 先构建场景,然后从冻结 artifact 读取任务预测。由于场景导出没有校准置信度,box 和 mask AP 遵循 equal-confidence protocol,即把每个预测实例的置信度统一设为 1.0,并使用确定性并列顺序;缺失的场景预测导出为“无检测”,而不是丢弃该图像。结果如下:
| 方法 | Box AP | Mask AP | AbsRel |
|---|---|---|---|
| Scene readouts(GPT-6-astra 重建) | 30.1 | 14.8 | 0.155 |
| 专用模型 | DINO: 59.9 | SAM 3: 54.0 | Depth Anything 3: 0.078 |
场景 readouts 在三个任务上均达到非平凡性能;检测达到专用模型 box AP 的约一半;但远低于专用视觉模型。当前编码智能体通过程序构建的场景是自然图像的有前景但尚不够精确的表示。覆盖率方面,COCO boxes 与 LVIS masks 各尝试 100 张图像,有计分的场景输出为 94 张,匹配诊断配对为 93 对;ETH3D depth 尝试 100 张,有计分场景输出 99 张,匹配诊断配对 99 对。在相同的 99 张有效图像上,归档直接法与场景式的 AbsRel 均值分别为 0.07845 与 0.15540。
4.3 消融实验 / Ablation Study
场景复杂度的影响。论文在 Easy/Medium/Hard 三档下报告 R 与 A(对所有GPT-6与GPT-5.6配置平均)。Indoor 的 R 从 23.3±0.1 降到 19.7±1.2 再到 18.8±0.4,A 从 30.4±0.6 降到 27.9±0.6 再到 27.4±0.5;Outdoor 的 R 从 18.4±0.9 降到 14.2±1.0 再到 12.7±1.0,A 从 25.3±0.4 降到 22.8±0.9 再到 22.4±0.3。场景复杂度增加主要降低保真度,而非可执行性:Validity 在各 tier 稳定在 99.5%。总体分数从 Easy 的 24.6% 降到 Medium 的 21.3%,再到 Hard 的 20.5%。下降最陡的是 outdoor Reconstruction:18.4% → 12.7%。Outdoor 场景在每个复杂度层级都比 indoor 更难。
更多推理是否改善场景重建。论文在固定的 42-case Office 子集上做 test-time scaling,变化 harness-native reasoning effort(Low、Medium、High、XHigh),同时保持输入、prompts、执行预算和评分固定。三个GPT-6模型的 overall score 随 effort 上升:astra从 32.3% 到 61.8%,sol从 21.3% 到 39.7%,luna从 14.4% 到 21.2%。增益随模型强度增大而增大;astra在接近 XHigh 时饱和,而sol继续改善。相比之下,GPT-5.6模型显示出微弱或非单调变化。该 campaign 覆盖 6 模型 × 4 档 effort × 42 任务,共 1,008 个结果,全部用同一个冻结评估器与同一容器镜像重新打分;图中区间是 42 个任务输入上均值的 pointwise 95% percentile bootstrap 区间,10,000 次重采样,它们不度量重复运行间的波动。新增的GPT-6-sol与GPT-6-luna扫描贡献 336 个结果,其 High 结果专为该扫描生成,提示禁用了主表 campaign 中使用的额外相机引导;13 个 Luna 试验保留原生非零退出标志但 artifact 被成功重新打分,这些结果保留在固定分母中。
LEGO-Plugin 的消融与定性结果。插件在 42-case Office 子集上评估,比较每个模型有/无插件,保持相同输入、prompts、执行预算、reasoning effort 和 evaluator;插件只看到参考图像和当前 Blender 场景,从不看私有 ground truth 或 LEGO-Bench 分数。LEGO-Plugin 改善全部六个模型,增益与基础性能负相关:三个GPT-5.6模型相对改善 55%–63%,约 7–8 个点;GPT-6-luna相对改善 27.5%;GPT-6-sol相对改善 12.1%;GPT-6-astra仅 2.1%。摘要给出的最高相对增益为 62.7%。这一模式表明:插件主要补偿较弱智能体表现出的初始化、回归和自评估失败;最强智能体已经避免了其中大部分问题。
定性例子方面,Reception 场景中,相对于三个GPT-5.6-solbase runs 的最佳结果,LEGO-Plugin 更好匹配参考,总体分数从 0.147 提升到 0.325。下面依次给出该例的参考图、base 结果与插件结果。
Copy room 场景中,总体分数从 0.109 提升到 0.278。下面依次给出该例的参考图、base 结果与插件结果。
结论是:LEGO-Plugin 无需训练即可改善每个模型,对较弱智能体增益最大,缩小了但与最强模型的差距仍未闭合。
轨迹诊断。论文分析GPT-6-astra、GPT-5.6-sol、GPT-5.6-terra、GPT-5.6-luna的首次归档原生高推理努力运行,每个 cohort 目标为 198 个 Indoor/Outdoor 任务,排除 10 个 Bird’s-Eye 任务。合格 checkpoint 需有合法 Blender 场景、几何导出以及 Reconstruction 与 Appearance 两个分数;checkpoint 质量Q = ( R + A ) / 2 Q=(R+A)/2Q=(R+A)/2离线计算且从不暴露给 actor。下图汇总共同任务交集上的首场景时间、轨迹回归与最终 regret。
GPT-6-astra在绝对墙钟时间上更晚到达首个可评测场景,但相对自身运行时长更早,且具有最低的回归率与最好的 best-to-final regret。四个模型的构建过程都是非单调的,因此最终提交应被解读为轨迹端点,而非有保证的最优状态。此前分析还显示,GPT-5.6-sol常停滞或下降:29.6% 的编辑降低分数,最终提交比最佳中间场景低 3.2 分;这些回归来自后续编辑破坏几何、相机设置或之前更强的场景。
编码智能体能否判断自己的场景。论文用 VLM judge 测试方法:给定同一 case 的两张渲染图,judge model 选择更好的一张,测量其与确定性 LEGO-Bench 指标方向的一致性(chance = 50%)。在六个模型的全部 36 个 builder–judge 对中,self-judgments 在 Reconstruction 上一致率为 45.8%,Appearance 上为 62.2%;cross-model judgments 在 Reconstruction 上为 45.4%,Appearance 上为 63.9%。在几何上,judge 接近或低于 chance;self-judging 优于其他五个 judge 的均值,仅出现在 3/6 builders(Reconstruction)和 2/6 builders(Appearance)。VLM judge 设置中,比较共含 360 个 checkpoint 对,来自完整6 × 6 6\times66×6矩阵的 2,160 条主判定,终局失败为 0;额外有 36 对被每个 judge 以反序评估,得到 216 条审计判定,顺序交换一致性 Reconstruction 为 69.4%–100.0%,Appearance 为 61.1%–83.3%。核心结论是:编码智能体不能可靠判断场景质量,尤其是几何;self-judging 相比 cross-model judging 没有一致优势。因此 refinement 应基于 deterministic evidence,而非自我评估。
敏感性检查与铰接试点。小规模敏感性检查固定六个任务子集,由 GPT-6-astra 与 GPT-5.6-sol 共享。改变重建阈值(F@2%、F@5%、F@10%)、外观容差(20、30、40)和点预算(25k、50k、100k)会按预期改变绝对值,但不会改变该子集上的模型排序,GPT-6-astra 始终领先 GPT-5.6-sol。铰接试点方面,论文使用 canonical articulation registry:443 个规范资产中,368(83.1%)确认为静态,75(16.9%)具有验证的关节;关节要求 327 个,其中连续 75、旋转 55、棱柱 197,GT 不可用为 0。在重评一个冻结的 Office 提交时,此前部分 GT 适配器下只有 2 个铰接目标可计分、12 个不可用;完整 canonical manifest 使全部 14 个铰接目标可计分,并保留 12 个人工确认的静态目标作为误运动对照,把不可用计数降到零。该提交仍然得到S A r t p i l o t = 0 S_{\mathrm{Art}}^{\mathrm{pilot}}=0SArtpilot=0,故这个零反映的是预测本身,而非铰接真值缺失。可行的场景级铰接评估仍需要更具体的场景设定,有待进一步探索。
五、相关工作 / Related Work
编码智能体。编码智能体可被理解为 LLM 加代码编辑、执行与迭代验证的工具组合;其 harness 组织工具访问、执行上下文与环境反馈,使代码既是输出也是规划与交互的接口。论文点名的相关工作包括 VIGA(通过 code–render–inspect 循环重建并编辑视觉程序)、SEIG(通过 staged executable inverse graphics 把图像重建为可编辑 Blender 程序)、ArtiCraft(面向铰接式 3D 资产的 agentic coding 接口)、Code-CoT(把可执行 3D 程序作为空间推理的中间表示)等。LEGO-Anything 的差异在于:它把通用编码智能体本身作为“单图可执行场景构建”的 testbed,重点关注场景保真度、迭代失败模式以及冻结重建场景的感知充分性。附录还提到 LL3M,它用多个语言模型 agent 编写、调试、精修 Blender Python 脚本用于 3D 建模;LEGO-Anything 的区别在于任务与评测目标,但源码笔记中该句在“it evaluates end-to-end image-conditioned scene”处截断,后续内容未提供,因此不对其完整对比作额外推断。
3D 场景构建。程序化系统从结构化规格与可复用资产生成自然、室内或城市环境,例如 ProcTHOR、Infinigen、Infinigen Indoors、CityCraft。图像条件方法从视觉观测恢复几何与外观,例如 collaborative multimodal coding、SAM3D 系。其他方向包括从 RGB-D 扫描得到可编辑室内场景,以及 simulation-ready 铰接资产,例如 Ditto、PARIS、URDF-Anything、SimArt、Articulate-Anything、PhysX-Anything 等。这些工作提供越来越强的组件,但没有直接回答“单张自然图像能否被重建为忠实的可执行场景”。物体级 image-to-3D 代表如 TriMM、SAM 3D、LiteReality 提供日益强大的几何与外观先验,可作为更大场景构建流水线的组件;但重建孤立物体本身并不决定多个物体应如何被选择、定位、铰接与整合进连贯的可执行场景。铰接与仿真兼容资产方向与本文互补:它们强化物体级几何、外观与功能,而 LEGO-Anything 评测的是完整可执行场景的图像条件装配。
场景重建与可编辑 3D 中间表示。Panoptic 3D scene reconstruction from a single RGB image 在固定场景表示中联合推理几何、语义与实例;RecGen 通过生成式框架从稀疏 RGB-D 观测重建多物体场景,直接处理不完整视图下的歧义、遮挡与不确定性。与 LEGO-Anything 的差别在输出接口:本文问的是通用编码 agent 能否从单张 RGB 图像产出可执行 Blender 场景程序,而不是预测固定的 panoptic 或生成式场景表示。可编辑 3D 中间表示也用于重建之外:BlenderFusion 用 3D-grounded Blender 场景做视觉编辑与生成式合成,表明显式场景状态、相机控制与物体操控可支持图像条件视觉任务;这与 LEGO-World 的动机相邻——可执行场景不仅是重建产物,也是可被查询、编辑、复用的可检视表示。
基准对比。下表比较相关 3D 基准,✓ 表示支持,✗ 表示不支持。
| Benchmark | Image Input | Scene-level Eval. | Executable / Interactive | Indoor/Outdoor Coverage | Natural-Image Style | Controlled Difficulty |
|---|---|---|---|---|---|---|
3DCodeBench | ✓ | ✗ | ✗ | ✗ | ✗ | ✗ |
WorldCoder-Bench | ✗ | ✓ | ✓ | ✗ | ✗ | ✗ |
P3D-Bench | ✓ | ✗ | ✗ | ✗ | ✗ | ✗ |
SEIG | ✓ | ✗ | ✓ | ✗ | ✗ | ✗ |
SceneActBench | ✓ | ✓ | ✓ | ✗ | ✗ | ✗ |
LEGO-Bench(Ours) | ✓ | ✓ | ✓ | ✓ | ✓ | ✓ |
LEGO-Bench 独特地针对端到端评估可执行场景重建,跨多样、现实场景,具有受控难度。
评估基础设施与可复现性。论文基于 Harbor 完成任务扩展、重复、日志、产物收集、verifier 执行与聚合;自研lego_bench_harbor包新增数据集转换器、隔离的 Blender 运行时、agent 适配器、verifier 与运行 manifest。公开输入挂载给 actor,而私有几何、掩码、深度、对应关系保持 verifier-only。正式运行使用隔离的 Docker/Compose 环境,含 Blender 5.0.1、Xvfb,每个 trial 一个 Blender MCP listener。每个 harness 收到相同的图像、提示、分类体系、工具接口、限制与产物契约。Codex 方面,ContainerCodex继承 Harbor 的 Codex 适配器,在隔离的CODEX_HOME中注册 MCP 工具并附加输入图像;最终 campaign 设置model_provider=amazon-bedrock,因此 GPT 家族标识本身并不指定服务路径。Hermes 方面,包装层使用 Harbor 的通用适配器与上游 Nous Research Hermes Agent,固定于修订aa6f77596b;只有具备冻结运行 manifest 的配置才被报告。论文明确声明,支持某适配器并不意味着该模型配置出现在论文中。
六、局限性与展望 / Limitations & Future Work
论文反复强调的核心局限是:有效性不等于保真度。当前编码智能体能以接近饱和的 Validity 交付合法 scene artifact,但几何与外观的忠实恢复仍远未解决。GPT-6-astra取得最强总体结果,室内 53.4%、室外 39.6%,但仍存在显著差距;Gen3DSR 在 Reconstruction 上更高,却无法评估 Appearance,说明单一指标可能掩盖不同维度的失败。
Outdoor 场景比 indoor 更难,且场景复杂度增加会降低 Reconstruction 与 Appearance,但不影响 Validity。下降最陡的是 outdoor Reconstruction。这意味着可执行性相对稳定,而几何保真度对场景复杂度更敏感。
构建过程本身存在系统性失败。轨迹分析显示,重建质量沿构建轨迹非单调;较弱智能体需要更长时间产生可评估场景,且后续编辑可能降低场景保真度。GPT-5.6-sol有 29.6% 的编辑降低分数,最终提交比最佳中间场景低 3.2 分。编码智能体不能可靠判断场景质量,尤其是几何;self-judging 相比 cross-model judging 没有一致优势。因此,LEGO-Plugin 的设计原则是用参考接地的确定性证据替代自由形式自我纠正,但这并没有完全弥合与最强模型的差距:它改善所有六个模型,对较弱智能体增益最大,对GPT-6-astra仅 2.1% 相对改善。
LEGO-World 的读出在检测、分割与深度上均达到非平凡性能,但远低于专用视觉模型;检测 30.14 对 DINO 59.88,分割 14.75 对 SAM 3 的 53.96,深度 AbsRel 0.1554 对 Depth Anything 3 的 0.0783。论文据此判断,程序构建场景是自然图像的有前景但尚不够精确的表示。此外,equal-confidence AP 不是校准置信度,只能读作固定排序下的兼容性诊断;相对深度使用 scale-and-shift 对齐,不检验绝对度量尺度;缺失输出不能按零误差处理。
Bird’s-Eye split 不是配对的 benchmark split,被排除在配对复杂度分析之外,仅作为更严格的大尺度重建压力测试。场景级铰接试点虽然通过完整 canonical manifest 把不可用计数降到零,并使 0 分归因于预测本身,但可行的场景级铰接评估仍需更具体的场景设定。Reasoning-effort 的区间只反映 42 个任务输入上的均值不确定性,不度量重复运行波动;该 campaign 的耗时也不能作为推理成本的可控度量。成本–性能前沿使用标准化 token 成本代理,它只是成本近似,而非完整经济成本。
未来工作可能包括:提升单图几何与外观保真度,尤其是 outdoor 与复杂场景;改进 harness 与插件,使弱智能体也能获得稳定初始化与可靠 refinement;研究更强的场景级铰接表示与评测协议;扩展资产库与场景规格,使 LEGO-Bench 随资产增长而扩展;以及进一步提升程序构建场景作为统一视觉表示的精度,使其在检测、分割、深度等任务上更接近专用模型。
七、总结 / Conclusion
LEGO-Anything 的核心贡献不在于训练一个更强的 3D 重建模型,而在于重新定义任务接口:把单图场景重建变成通用编码智能体在 Blender 中迭代编写、执行、检查、修订显式场景程序的过程。场景程序可检查、可编辑、可查询,因而比渲染图或固定 3D 输出更适合作为“可操作、可诊断、可复用”的重建结果。为了衡量这一设定,论文提出 LEGO-Bench:208 张图像、104 个场景、8 个环境、17 个主题、443 个资产,模拟器基底允许分离评分 artifact validity、visible-surface geometry 与 rendered appearance,并支持受控复杂度与精确自动评估。
实验表明,当前编码智能体能可靠交付有效 artifact,但几何与外观保真度仍有限;GPT-6-astra在室内外分别达到 53.4% 与 39.6%,是最强配置,但仍与忠实重建存在显著差距。轨迹诊断把差距归因于弱初始化、回归编辑与不可靠自评估,进而催生免训练 harness 插件 LEGO-Plugin;它以 Enhanced Initialization、Grounded Refinement 与 Version Control 三个模块改善全部六个模型,最高相对增益 62.7%,对较弱智能体增益更大。LEGO-World 进一步表明,冻结的重建场景已经能以确定性查询支持检测、分割与深度读出,性能非平凡,但远低于专用视觉模型。总体而言,LEGO-Anything 把可执行场景程序确立为通用编码智能体的一个可测量、可诊断、有前景的研究目标;LEGO-Bench 的可扩展设计有望支持未来走向更忠实的图像条件场景重建。
原文摘要:A 3D scene reconstructed from a single image is most useful when represented not as a rendering or a fixed 3D output, but as an explicit scene program whose execution yields a scene that can be inspected, edited, and queried. We present LEGO-Anything, an Image-to-Code framework in which a coding agent iteratively writes and executes Blender code, inspects scenes and renderings, and revises the program. To evaluate end-to-end scene recovery, we introduce LEGO-Bench, a simulator-grounded benchmark with 208 images from 104 diverse indoor and outdoor scenes. LEGO-Bench separately scores artifact validity, visible-surface geometry, and rendered appearance. Its simulator-grounded design enables extensibility and precise automatic evaluation. Among evaluated agents, GPT-6-astra achieves the strongest overall results, with 53.4% indoor and 39.6% outdoor scores, yet substantial gaps remain between delivering valid scene artifacts and faithfully recovering scene geometry and appearance. Analysis of agent construction trajectories reveals three recurring issues: weak scene initialization, regressive edits during iteration, and unreliable self-evaluation. These findings motivate LEGO-Plugin, a training-free harness plugin for more controlled iterative scene construction, which improves all six evaluated models, with relative gains of up to 62.7% in overall score. Finally, we test whether reconstructed scenes can represent natural images and support vision tasks. In LEGO-World, we derive object detections, instance masks, and relative depth as deterministic queries on scenes reconstructed by GPT-6-astra. These readouts show non-trivial performance across all three tasks but fall well short of specialized vision models, suggesting that program-constructed scenes from current coding agents are a promising but not yet sufficiently precise representation of natural images.
PDF链接:https://arxiv.org/pdf/2609.36380v1