A3. 场景构建
重点是把意图和已有资产装配成可修改的空间结构:对象、层级、共享实例、局部坐标、pivot/锚点,以及能被运动和镜头使用的实际几何。下列条目来自 2026-09-23 研究笔记,本轮未重新获取论文或执行仓库。
可执行世界程序:优先读的条目
Code-as-Room
- 时间与来源:原记 2026-05;论文、仓库。原记 Apache-2.0,复用前核对当前许可与 commit。
- 原记机制:从俯视图出发,分阶段形成空间语义、场景图、Blender 布局、主要物体、表面小物、材质和渲染设置;cross-stage memory 连接产物,代码组织执行与校验。
- 可借鉴:实际布局、物体程序和观察如何传到后续步骤;修复定位在哪一段;物体引用如何稳定。
- 边界:原笔记称“12 阶段”但所列步骤数量不一致,清理后不保留未经核对的阶段数。室内静态 Blender 方案不能直接证明运动、相机时间线或体素编辑能力。借交接和检查方式,不整套移植通用 harness。
SceneCode
- 时间与来源:2026-05-19;论文、补充入口。
- 原记机制:自然语言生成 Blender Python,逐部件描述几何、材质和铰链/滑轨等运动机构。
- 可借鉴:几何构造时同时输出可驱动部件与旋转中心,而不是完成一块 mesh 后再推断 articulation。
- 待查:程序修改后身份、关节参数和人工编辑如何保留;这些关系是否能可靠交给下一阶段。
VoxelCodeBench
- 时间与来源:2026-04;论文入口。
- 原记机制:将 voxel 世界构造作为代码生成评测。
- 可借鉴:任务输入、生成表示与回归案例;优先核实是否包含时间、可编辑性和场景尺度,不能仅凭 voxel+code 名称认定与本项目同题。
World Labs:3D as code / Marble / Chisel
- 时间与来源:原记 2026-03-03;官方文章。
- 原记机制:持久三维世界、粗布局控制层、layout/style 分离,并向 splats/mesh/video 导出。
- 可借鉴:把空间结构作为可单独修改的控制面;布局和写实外观可以分别生成。
- 边界:观点文章和产品能力不是 code authoring 效率的实验背书;可导出 mesh 也不自动代表参数化来源可重建。全景实操和相关资产见下游实践。
Blender agent 的工程产物
- Blender MCP 工程指南,原记 2026:通过 API 查看场景、组织资产、批渲染;适合查看机械步骤和人工调整的分界。
- After Hours 案例,2026-09-06:原记提供可编辑工程、源片段和分阶段耗时,画面仍像原型。是案例文章,未取得工程复跑;“75 分钟”等数字不作为一般效率结论。
- 对闭环:读“交付什么、怎样恢复、怎样再次修改”比仅看成片更有价值。
体素原生工具、格式与混合层级表示
2026-09-25 检索补充。 本节直接对应本项目核心表示(离散占用、dyadic lattice、整数层级、局部下角索引)。检索转述,仓库许可需在仓库内二次核对。
体素工具与资产库
| 工具 | 时间 | 许可 | 关键机制 | 对本项目 |
|---|---|---|---|---|
| MagicaVoxel | 持续(0.99.x) | 免费闭源 | 单模型上限 126³;256 色调色板;多模型 + 场景图 + 帧;内置路径追踪 | .vox 是唯一被广泛读写的交换格式;其「多模型 + 场景图 + 帧」可直接映射到 VoxelModel + SceneNode。局限:无显式 mixed-level,旋转仅 90° 取向 |
| Goxel | 长期维护,跨平台 | 开源(GPL 系) | 内部稀疏矩阵,场景无大小限制;图层;导出 .vox/.qb/glTF2/obj/ply | 稀疏存储 + 无界场景 + glTF 导出,最接近「离散占用 + 连续节点」;无节点/骨架动画 |
| Avoyd | 活跃,0.28 Beta 2026-09 | 商业 $22.50(部分引擎库开源) | 世界可达 256k 体素/边;导入 .VOX/Minecraft/高度图;导出 glTF/GLB/OBJ(带 PBR)+ .VOX;正在做 Layering/Hierarchy System | 最大规模、带层级的体素编辑器,是「层级 + 大世界 + glTF 导出」的工业参照;私有 .avwr,Windows only |
| Teardown | 持续 | 商业游戏 + 官方 Lua Mod API | 每体素 32-bit(材质/颜色/属性);形状由 body 拥有,CreateShape/SetShapeVoxel/GetShapeMaterialAtIndex;GetShapeSize 返回体素尺寸与每体素米制 scale(默认 0.1m) | 最成熟的「可编程体素世界」运行时:节点(shape) + 变换 + 材质 + 尺度分离,与 VoxelModel + Node 高度同构;破坏式编辑可借「revision 间几何可变」 |
| Blockbench | 活跃(2026-07 更新) | 开源 GPL-3.0 | 体素/低模编辑器,内置 glTF 导出(含骨骼动画) | 体素 → glTF + 骨骼动画的现成桥梁 |
| vengi voxel tools | 活跃,v0.4.0 2026-02 | 开源 MIT | 编辑器 + 缩略图 + 命令行格式转换器 VoxConvert,支持动画与大量格式互转 | MIT 许可的格式转换/批处理基础设施,无许可顾虑 |
| VoxEdit(The Sandbox) | 长期免费 | 免费闭源 | 骨骼绑定 + 时间线关键帧动画 | 体素角色骨骼动画的实践参考;格式私有 |
| Kenney Voxel Pack | 2015,持续可用 | CC0 | 190 个模型 | 无许可障碍的测试/占位资产 |
体素格式与交换标准
| 格式 | 时间 | 性质 | 对本项目 |
|---|---|---|---|
| .vox(MagicaVoxel v150 + 扩展) | 2016 规范 | 事实标准、公开规范 | RIFF 式 chunk:MAIN/PACK/SIZE/XYZI/RGBA;扩展含场景图 nTRN(Transform,8-bit 旋转 + int32 平移 + 帧列表)、nGRP、nSHP、MATL、layer。直接映射:XYZI = 离散占用,nTRN/nGRP = SceneNode 层级,帧列表 = 动画雏形。局限:126³/模型、90° 旋转、无 mixed-level、255 色 |
| glTF 2.0 | 2017 规范 | Khronos 官方 | 无专用体素扩展;只有通用 sparse accessor 可勉强编码稀疏数组;EXT_mesh_features/EXT_structural_metadata 处理元数据。需网格化或自定义扩展 |
| 3D Tiles 2.0 voxels 扩展 | 2026 草案(OGC 第 134 次会议 2026-03) | 开放标准草案 | 目前唯一面向大尺度体素的标准流式格式,分层流式 + 逐体素语义元数据;但偏 GIS/地下数据,非创作/动画导向 |
| OpenVDB / NanoVDB | 长期,ASWF | 开源 MPL-2.0,VFX 标准 | 树状稀疏体积(root/internal/leaf),NanoVDB 为 GPU 友好无指针缓冲 + 变比特量化。稀疏层级的工业级数据结构与 GPU 路径;但面向连续标量场(SDF/烟雾),无节点/动画语义 |
| Open Voxel File Format(enkisoftware) | 2025-11 更新,仍 pre-standard | 社区倡议 | 目标是简单的场景描述格式;采用度极低。说明「通用体素场景格式」仍空缺 |
| USD(OpenUSD) | 2026 加速采用 | 开放 | 组合弧(layer/reference/override)、payload 选择性加载、动画 schema,与本项目「revision/overrides 显式所有权」共鸣;但无原生体素图元,需自定义 schema |
.qb / .avwr / .mca | — | 私有 | Qubicle 闭源、Avoyd 私有、Minecraft 格式 |
结论:2026 年仍无通用体素场景标准;.vox 是唯一事实通用格式,3D Tiles voxels 是唯一新兴开放体素流式标准。
学术:稀疏体素层级、混合格式与神经场
| 工作 | 时间 | 许可 | 关键机制 | 对本项目 |
|---|---|---|---|---|
| XCube (X³) | CVPR 2024 Highlight;仓库 | 代码开源(非商用友好) | 稀疏体素层级上的分层潜扩散:L 层由粗到细、细层严格包含于粗层;每体素存任意属性(法线/语义/TSDF/细分掩码);基于 OpenVDB;分辨率达 1024³、百万体素 <30s;支持用户引导编辑、单扫描补全、text-to-3D | ★ 与本项目「dyadic lattice + 整数层级 + mixed-level」目标几乎一一对应,证明层级化稀疏体素可生成、可编辑、可条件化。差异:其属性是连续场、层间是「包含」而非「同格不同级」的显式 mixed-level |
| Hybrid Voxel Formats | ISVC/HPG 2024;论文 | 学术 | 四种基础格式:Raw 网格、距离场(DF)、稀疏体素八叉树(SVO)、稀疏体素 DAG(SVDAG);分层组合成混合格式;终止整数 = 子体积指针或单体素 RGBA | ★ 直接给出「uniform 网格 + octree + DAG 在同一体素上的组合设计」,可用于 mixed-level 存储与渲染后端。局限:渲染导向,无场景图/动画 |
| NSVF(Neural Sparse Voxel Fields) | NeurIPS 2020 | 学术 | 体素八叉树中「体素边界隐式场」:每体素角点存 embedding,MLP 解码密度/颜色;可微 ray-marching 渐进学习八叉树 | 「显式稀疏体素骨架 + 局部神经场」的开山之作,解释为何要保留显式占用(可编辑、可查询)同时可选神经细节 |
| SVRaster | CVPR 2025;项目 | 开源 | 「global-sparse-local-dense」:八叉树叶节点分配单个体素原语,内部为三线性密度场 + 常量 SH 光照;实时高保真、可编辑 | 稀疏体素 + 局部连续场的最新实时渲染方案,可作可微渲染/查看器后端候选 |
| SCube(VoxSplat) | NeurIPS 2024;项目 | 学术 | XCube 生成 1024³ 稀疏体素脚手架,再前馈预测每体素内 3D Gaussians + 天空全景 | 「稀疏体素作骨架 + 神经/高斯细节」的混合表示范例 |
| BlockFusion | SIGGRAPH 2024;项目 | 学术 | 澄清:不是原始体素。场景切成立方块,每块拟合为 tri-plane 神经场,VAE 压缩到潜 tri-plane,再 DDPM 扩散;重叠区外推无缝扩展 | 「分块 + 潜空间扩散 + 外推」的可扩展场景生成范式;底层是神经场而非离散体素 |
| SceneCraft | ICML 2024;论文 | 学术 | LLM 智能体:文本 → 场景图 → 数值约束 → Blender Python;内循环用 GPT-V 看渲染图迭代修正;外循环 library learning 积累可复用函数 | ★「LLM 写场景程序 + 视觉反馈自修复 + 技能库」与本项目两阶段 authoring 直接同构。输出是 Blender 脚本/网格,非体素 |
| VoxelCode | 2025;ACM | 学术 | 基于掩码 Transformer 的结构先验,zero-shot 文本/图像 → 体素,无需独立编码器 | 文本→体素形状的轻量路线;物体级,无动画/层级 |
| VoxSet | ICLR 2026 投稿(评审中);OpenReview | 投稿 | 外层稀疏体素捕捉细节 + 向量集瓶颈做高压缩,得到定长潜码,避免稀疏体素变长 token 的两阶段管线 | 若要做体素 tokenization/学生模型,这是稀疏体素与定长 latent 的桥;物体级、未定 |
| WorldGrow | AAAI 2026;论文 | 学术 | 无限可扩展 3D 世界生成;DINOv2 特征投影到稀疏体素再编码为结构化 latent,解码为 3DGS/辐射场/网格 | 「稀疏体素特征 + 生成式无限世界」的最新路线;最终表示是神经场 |
| NeuralVDB | ACM TOG 2024 | 学术 | 在 NanoVDB 之上用神经压缩提升稀疏体积压缩率 | 大范围稀疏体素的存储/传输压缩路径 |
| VoxelGPT | 2023 | 开源 | 澄清:与体素生成无关——LLM + 视觉数据集查询语言,用于查询图像/视频数据集 | 名称易误导,不应引用为体素场景生成工具 |
关于 mixed-level 的核心结论:
- 学术上最成熟的「多分辨率稀疏体素」载体是 XCube 的 sparse voxel hierarchy(基于 OpenVDB),与本项目的 dyadic lattice、整数层级、局部下角索引几乎可对齐。差异在于 XCube 把层级当作「包含」并配连续属性场,而本项目要的是同一格上的离散占用 mixed-level + 显式场景图/动画——这块学界与工业界都还没有标准答案。
- 稀疏体素与神经场的关系已收敛为**「显式骨架 + 局部隐式/高斯细节」**:NSVF(2020) → SCube/VoxSplat(2024) → SVRaster(2025) 是一条清晰主线。显式稀疏体素负责空间索引、空跳、可编辑与可控;神经场/高斯负责高频外观。这支持本项目保留离散占用为核心,把神经/高斯作为可选的渲染或下游精修层,而不是取代占用。
- 待核对:XCube 许可条款、Goxel 具体许可证、Avoyd 层级系统 beta 状态、Teardown 关卡二进制格式无官方规范。
布局、约束与视觉修订
| 条目 | 时间与来源 | 原记机制 / 可提取内容 |
|---|---|---|
| NaLA | 2026-06,论文 | 原生 3D 输入、碰撞/支撑/容纳、粗到细姿态预测;研究实际几何如何进入规划,但不能把它的离散/连续预测等同于本项目 lattice/node 分工 |
| SAGE | 2026-02,论文 | 视觉与物理 critic;借错误定位和独立观察,不引入普遍物理门槛 |
| Holodeck 2.0 | 原记 CVPR 2026,预印本 2025-08,论文 | 分解、资产生成、空间约束、交互编辑;2026 版本变化待核对 |
| Scenethesis | 原记 ICLR 2026,预印本 2025-05,论文 | LLM 规划与视觉细化;关注修订如何保留先前结果 |
| ReSpace | 原记 ICLR 2026,预印本 2025-06,论文 | 场景合成、编辑与偏好;关注 edit 范围而不是仅看生成样例 |
| SimWorld Studio | 2026-05,论文 | coding agent 生成环境;模拟器的任务边界与影视代理不同 |
| Code2Worlds | 2026-02,论文 | 代码生成含时间的世界;重点查时间与部件表示 |
| AutoUE | 2026-03,论文 | Unreal 场景自动化;关注引擎接口与可编辑工程 |
2025 预印本仅因原记有 2026 会议信息而保留;不能把会议年份当作重大能力更新。若核实没有新增内容,移入背景即可,不继续展开旧作调研。
发现线索:尚不足以支持技术判断
awesome-spatial-reasoning-scene-generation 和 Awesome-3D-Scene-Generation 用来发现来源,列表收录本身不是方法验证。
| 线索 | 原记时间 | 下一步要补的材料 |
|---|---|---|
| SpatialGrammar | 2026 | 论文原页、DSL 语法、生成结果和约束范围 |
| SceneSmith / 3D-Generalist / LandCraft / Reason-3D | 原记 ICML / 3DV / AAAI 2026 | 独立论文 URL 与实际任务定义 |
| SpatialGen | 原记 3DV 2026,2509.14981 | 布局输入与输出编辑能力 |
| GenRecon | 2026-05,论文编号入口 | 场景分块和可编辑 mesh 的实际含义 |
| SceneGen | 原记 3DV 2026,仓库 | 多资产与布局如何输出;不能从“一次前向”推出不可编辑 |
| Code as Worlds | 2026,综述入口 | 来源与版本,作为谱系导航 |
与前后环节的接口
纯 T2V 中的 OnlyShot、ComfyUI-Seedance 资产库和 provider registry 统一归编排报告:它们管理像素资产与后端,不能因为名为 Anchor-Point 就推断使用几何锚点。Tripo/VAST 属于资产生成接口,不列为视频模型消费能力。
对整体闭环,最值得验证的是三件事:结构交接使用真实对象与局部坐标;运动需求在构造时已有对应部件;一次局部修改能保留不相关对象、动作和镜头。碰撞、漂浮、穿插只在任务需要时诊断,不自动作为失败。
待回答的问题
- 场景图能否减少重猜关系的成本,还是重复维护作者程序中的事实?
- 哪些交接信息能从构建产物自动取得,哪些必须保留在作者源中?
- 外部编辑器改过的模型与程序重建怎样合并?外部论文和本项目采用的策略应分别记录。
较早的 VULCAN(2025-12 预印本)与 MiDiffusion(原记 WACV 2026,视频入口)保留为背景线索,尚未确认 2026 有何实质更新,不继续展开。
维护记录
- 2026-09-24:区分可执行程序、布局方法和待查线索;纠正阶段数、Anchor-Point 类比与不可编辑性推断;跨环节资产改用链接。
- 2026-09-25:新增「体素原生工具、格式与混合层级表示」(工具/格式/学术三类)。确立两条结论:2026 仍无通用体素场景标准;稀疏体素与神经场已收敛为「显式骨架 + 局部隐式细节」。检索转述,未逐页复核许可。
- 2026-09-25(同日修订):删除已写入的「世界模型作为场景来源」一节(9 个平台)。用户判定世界模型与本项目暂时不搭,不录入;其中唯一与本环节相关的一条——控制 pass 消费(depth/seg/edge 条件驱动写实化)——改归下游接口维护。本页仍保留原先的 World Labs「3D as code / Chisel」条目,因为其价值在场景程序与 layout/style 分离,不在世界模型路线。