Skip to content

A3. 场景构建 ​

研究入口 · 意图与预算 · 运动 · 相机

重点是把意图和已有资产装配成可修改的空间结构:对象、层级、共享实例、局部坐标、pivot/锚点,以及能被运动和镜头使用的实际几何。下列条目来自 2026-09-23 研究笔记,本轮未重新获取论文或执行仓库。

可执行世界程序:优先读的条目 ​

Code-as-Room ​

  • 时间与来源:原记 2026-05;论文、仓库。原记 Apache-2.0,复用前核对当前许可与 commit。
  • 原记机制:从俯视图出发,分阶段形成空间语义、场景图、Blender 布局、主要物体、表面小物、材质和渲染设置;cross-stage memory 连接产物,代码组织执行与校验。
  • 可借鉴:实际布局、物体程序和观察如何传到后续步骤;修复定位在哪一段;物体引用如何稳定。
  • 边界:原笔记称“12 阶段”但所列步骤数量不一致,清理后不保留未经核对的阶段数。室内静态 Blender 方案不能直接证明运动、相机时间线或体素编辑能力。借交接和检查方式,不整套移植通用 harness。

SceneCode ​

  • 时间与来源:2026-05-19;论文、补充入口。
  • 原记机制:自然语言生成 Blender Python,逐部件描述几何、材质和铰链/滑轨等运动机构。
  • 可借鉴:几何构造时同时输出可驱动部件与旋转中心,而不是完成一块 mesh 后再推断 articulation。
  • 待查:程序修改后身份、关节参数和人工编辑如何保留;这些关系是否能可靠交给下一阶段。

VoxelCodeBench ​

  • 时间与来源:2026-04;论文入口。
  • 原记机制:将 voxel 世界构造作为代码生成评测。
  • 可借鉴:任务输入、生成表示与回归案例;优先核实是否包含时间、可编辑性和场景尺度,不能仅凭 voxel+code 名称认定与本项目同题。

World Labs:3D as code / Marble / Chisel ​

  • 时间与来源:原记 2026-03-03;官方文章。
  • 原记机制:持久三维世界、粗布局控制层、layout/style 分离,并向 splats/mesh/video 导出。
  • 可借鉴:把空间结构作为可单独修改的控制面;布局和写实外观可以分别生成。
  • 边界:观点文章和产品能力不是 code authoring 效率的实验背书;可导出 mesh 也不自动代表参数化来源可重建。全景实操和相关资产见下游实践。

Blender agent 的工程产物 ​

  • Blender MCP 工程指南,原记 2026:通过 API 查看场景、组织资产、批渲染;适合查看机械步骤和人工调整的分界。
  • After Hours 案例,2026-09-06:原记提供可编辑工程、源片段和分阶段耗时,画面仍像原型。是案例文章,未取得工程复跑;“75 分钟”等数字不作为一般效率结论。
  • 对闭环:读“交付什么、怎样恢复、怎样再次修改”比仅看成片更有价值。

体素原生工具、格式与混合层级表示 ​

2026-09-25 检索补充。 本节直接对应本项目核心表示(离散占用、dyadic lattice、整数层级、局部下角索引)。检索转述,仓库许可需在仓库内二次核对。

体素工具与资产库 ​

工具时间许可关键机制对本项目
MagicaVoxel持续(0.99.x)免费闭源单模型上限 126³;256 色调色板;多模型 + 场景图 + 帧;内置路径追踪.vox 是唯一被广泛读写的交换格式;其「多模型 + 场景图 + 帧」可直接映射到 VoxelModel + SceneNode。局限:无显式 mixed-level,旋转仅 90° 取向
Goxel长期维护,跨平台开源(GPL 系)内部稀疏矩阵,场景无大小限制;图层;导出 .vox/.qb/glTF2/obj/ply稀疏存储 + 无界场景 + glTF 导出,最接近「离散占用 + 连续节点」;无节点/骨架动画
Avoyd活跃,0.28 Beta 2026-09商业 $22.50(部分引擎库开源)世界可达 256k 体素/边;导入 .VOX/Minecraft/高度图;导出 glTF/GLB/OBJ(带 PBR)+ .VOX;正在做 Layering/Hierarchy System最大规模、带层级的体素编辑器,是「层级 + 大世界 + glTF 导出」的工业参照;私有 .avwr,Windows only
Teardown持续商业游戏 + 官方 Lua Mod API每体素 32-bit(材质/颜色/属性);形状由 body 拥有,CreateShape/SetShapeVoxel/GetShapeMaterialAtIndex;GetShapeSize 返回体素尺寸与每体素米制 scale(默认 0.1m)最成熟的「可编程体素世界」运行时:节点(shape) + 变换 + 材质 + 尺度分离,与 VoxelModel + Node 高度同构;破坏式编辑可借「revision 间几何可变」
Blockbench活跃(2026-07 更新)开源 GPL-3.0体素/低模编辑器,内置 glTF 导出(含骨骼动画)体素 → glTF + 骨骼动画的现成桥梁
vengi voxel tools活跃,v0.4.0 2026-02开源 MIT编辑器 + 缩略图 + 命令行格式转换器 VoxConvert,支持动画与大量格式互转MIT 许可的格式转换/批处理基础设施,无许可顾虑
VoxEdit(The Sandbox)长期免费免费闭源骨骼绑定 + 时间线关键帧动画体素角色骨骼动画的实践参考;格式私有
Kenney Voxel Pack2015,持续可用CC0190 个模型无许可障碍的测试/占位资产

体素格式与交换标准 ​

格式时间性质对本项目
.vox(MagicaVoxel v150 + 扩展)2016 规范事实标准、公开规范RIFF 式 chunk:MAIN/PACK/SIZE/XYZI/RGBA;扩展含场景图 nTRN(Transform,8-bit 旋转 + int32 平移 + 帧列表)、nGRP、nSHP、MATL、layer。直接映射:XYZI = 离散占用,nTRN/nGRP = SceneNode 层级,帧列表 = 动画雏形。局限:126³/模型、90° 旋转、无 mixed-level、255 色
glTF 2.02017 规范Khronos 官方无专用体素扩展;只有通用 sparse accessor 可勉强编码稀疏数组;EXT_mesh_features/EXT_structural_metadata 处理元数据。需网格化或自定义扩展
3D Tiles 2.0 voxels 扩展2026 草案(OGC 第 134 次会议 2026-03)开放标准草案目前唯一面向大尺度体素的标准流式格式,分层流式 + 逐体素语义元数据;但偏 GIS/地下数据,非创作/动画导向
OpenVDB / NanoVDB长期,ASWF开源 MPL-2.0,VFX 标准树状稀疏体积(root/internal/leaf),NanoVDB 为 GPU 友好无指针缓冲 + 变比特量化。稀疏层级的工业级数据结构与 GPU 路径;但面向连续标量场(SDF/烟雾),无节点/动画语义
Open Voxel File Format(enkisoftware)2025-11 更新,仍 pre-standard社区倡议目标是简单的场景描述格式;采用度极低。说明「通用体素场景格式」仍空缺
USD(OpenUSD)2026 加速采用开放组合弧(layer/reference/override)、payload 选择性加载、动画 schema,与本项目「revision/overrides 显式所有权」共鸣;但无原生体素图元,需自定义 schema
.qb / .avwr / .mca—私有Qubicle 闭源、Avoyd 私有、Minecraft 格式

结论:2026 年仍无通用体素场景标准;.vox 是唯一事实通用格式,3D Tiles voxels 是唯一新兴开放体素流式标准。

学术:稀疏体素层级、混合格式与神经场 ​

工作时间许可关键机制对本项目
XCube (X³)CVPR 2024 Highlight;仓库代码开源(非商用友好)稀疏体素层级上的分层潜扩散:L 层由粗到细、细层严格包含于粗层;每体素存任意属性(法线/语义/TSDF/细分掩码);基于 OpenVDB;分辨率达 1024³、百万体素 <30s;支持用户引导编辑、单扫描补全、text-to-3D★ 与本项目「dyadic lattice + 整数层级 + mixed-level」目标几乎一一对应,证明层级化稀疏体素可生成、可编辑、可条件化。差异:其属性是连续场、层间是「包含」而非「同格不同级」的显式 mixed-level
Hybrid Voxel FormatsISVC/HPG 2024;论文学术四种基础格式:Raw 网格、距离场(DF)、稀疏体素八叉树(SVO)、稀疏体素 DAG(SVDAG);分层组合成混合格式;终止整数 = 子体积指针或单体素 RGBA★ 直接给出「uniform 网格 + octree + DAG 在同一体素上的组合设计」,可用于 mixed-level 存储与渲染后端。局限:渲染导向,无场景图/动画
NSVF(Neural Sparse Voxel Fields)NeurIPS 2020学术体素八叉树中「体素边界隐式场」:每体素角点存 embedding,MLP 解码密度/颜色;可微 ray-marching 渐进学习八叉树「显式稀疏体素骨架 + 局部神经场」的开山之作,解释为何要保留显式占用(可编辑、可查询)同时可选神经细节
SVRasterCVPR 2025;项目开源「global-sparse-local-dense」:八叉树叶节点分配单个体素原语,内部为三线性密度场 + 常量 SH 光照;实时高保真、可编辑稀疏体素 + 局部连续场的最新实时渲染方案,可作可微渲染/查看器后端候选
SCube(VoxSplat)NeurIPS 2024;项目学术XCube 生成 1024³ 稀疏体素脚手架,再前馈预测每体素内 3D Gaussians + 天空全景「稀疏体素作骨架 + 神经/高斯细节」的混合表示范例
BlockFusionSIGGRAPH 2024;项目学术澄清:不是原始体素。场景切成立方块,每块拟合为 tri-plane 神经场,VAE 压缩到潜 tri-plane,再 DDPM 扩散;重叠区外推无缝扩展「分块 + 潜空间扩散 + 外推」的可扩展场景生成范式;底层是神经场而非离散体素
SceneCraftICML 2024;论文学术LLM 智能体:文本 → 场景图 → 数值约束 → Blender Python;内循环用 GPT-V 看渲染图迭代修正;外循环 library learning 积累可复用函数★「LLM 写场景程序 + 视觉反馈自修复 + 技能库」与本项目两阶段 authoring 直接同构。输出是 Blender 脚本/网格,非体素
VoxelCode2025;ACM学术基于掩码 Transformer 的结构先验,zero-shot 文本/图像 → 体素,无需独立编码器文本→体素形状的轻量路线;物体级,无动画/层级
VoxSetICLR 2026 投稿(评审中);OpenReview投稿外层稀疏体素捕捉细节 + 向量集瓶颈做高压缩,得到定长潜码,避免稀疏体素变长 token 的两阶段管线若要做体素 tokenization/学生模型,这是稀疏体素与定长 latent 的桥;物体级、未定
WorldGrowAAAI 2026;论文学术无限可扩展 3D 世界生成;DINOv2 特征投影到稀疏体素再编码为结构化 latent,解码为 3DGS/辐射场/网格「稀疏体素特征 + 生成式无限世界」的最新路线;最终表示是神经场
NeuralVDBACM TOG 2024学术在 NanoVDB 之上用神经压缩提升稀疏体积压缩率大范围稀疏体素的存储/传输压缩路径
VoxelGPT2023开源澄清:与体素生成无关——LLM + 视觉数据集查询语言,用于查询图像/视频数据集名称易误导,不应引用为体素场景生成工具

关于 mixed-level 的核心结论:

  1. 学术上最成熟的「多分辨率稀疏体素」载体是 XCube 的 sparse voxel hierarchy(基于 OpenVDB),与本项目的 dyadic lattice、整数层级、局部下角索引几乎可对齐。差异在于 XCube 把层级当作「包含」并配连续属性场,而本项目要的是同一格上的离散占用 mixed-level + 显式场景图/动画——这块学界与工业界都还没有标准答案。
  2. 稀疏体素与神经场的关系已收敛为**「显式骨架 + 局部隐式/高斯细节」**:NSVF(2020) → SCube/VoxSplat(2024) → SVRaster(2025) 是一条清晰主线。显式稀疏体素负责空间索引、空跳、可编辑与可控;神经场/高斯负责高频外观。这支持本项目保留离散占用为核心,把神经/高斯作为可选的渲染或下游精修层,而不是取代占用。
  3. 待核对:XCube 许可条款、Goxel 具体许可证、Avoyd 层级系统 beta 状态、Teardown 关卡二进制格式无官方规范。

布局、约束与视觉修订 ​

条目时间与来源原记机制 / 可提取内容
NaLA2026-06,论文原生 3D 输入、碰撞/支撑/容纳、粗到细姿态预测;研究实际几何如何进入规划,但不能把它的离散/连续预测等同于本项目 lattice/node 分工
SAGE2026-02,论文视觉与物理 critic;借错误定位和独立观察,不引入普遍物理门槛
Holodeck 2.0原记 CVPR 2026,预印本 2025-08,论文分解、资产生成、空间约束、交互编辑;2026 版本变化待核对
Scenethesis原记 ICLR 2026,预印本 2025-05,论文LLM 规划与视觉细化;关注修订如何保留先前结果
ReSpace原记 ICLR 2026,预印本 2025-06,论文场景合成、编辑与偏好;关注 edit 范围而不是仅看生成样例
SimWorld Studio2026-05,论文coding agent 生成环境;模拟器的任务边界与影视代理不同
Code2Worlds2026-02,论文代码生成含时间的世界;重点查时间与部件表示
AutoUE2026-03,论文Unreal 场景自动化;关注引擎接口与可编辑工程

2025 预印本仅因原记有 2026 会议信息而保留;不能把会议年份当作重大能力更新。若核实没有新增内容,移入背景即可,不继续展开旧作调研。

发现线索:尚不足以支持技术判断 ​

awesome-spatial-reasoning-scene-generation 和 Awesome-3D-Scene-Generation 用来发现来源,列表收录本身不是方法验证。

线索原记时间下一步要补的材料
SpatialGrammar2026论文原页、DSL 语法、生成结果和约束范围
SceneSmith / 3D-Generalist / LandCraft / Reason-3D原记 ICML / 3DV / AAAI 2026独立论文 URL 与实际任务定义
SpatialGen原记 3DV 2026,2509.14981布局输入与输出编辑能力
GenRecon2026-05,论文编号入口场景分块和可编辑 mesh 的实际含义
SceneGen原记 3DV 2026,仓库多资产与布局如何输出;不能从“一次前向”推出不可编辑
Code as Worlds2026,综述入口来源与版本,作为谱系导航

与前后环节的接口 ​

纯 T2V 中的 OnlyShot、ComfyUI-Seedance 资产库和 provider registry 统一归编排报告:它们管理像素资产与后端,不能因为名为 Anchor-Point 就推断使用几何锚点。Tripo/VAST 属于资产生成接口,不列为视频模型消费能力。

对整体闭环,最值得验证的是三件事:结构交接使用真实对象与局部坐标;运动需求在构造时已有对应部件;一次局部修改能保留不相关对象、动作和镜头。碰撞、漂浮、穿插只在任务需要时诊断,不自动作为失败。

待回答的问题 ​

  • 场景图能否减少重猜关系的成本,还是重复维护作者程序中的事实?
  • 哪些交接信息能从构建产物自动取得,哪些必须保留在作者源中?
  • 外部编辑器改过的模型与程序重建怎样合并?外部论文和本项目采用的策略应分别记录。

较早的 VULCAN(2025-12 预印本)与 MiDiffusion(原记 WACV 2026,视频入口)保留为背景线索,尚未确认 2026 有何实质更新,不继续展开。

维护记录 ​

  • 2026-09-24:区分可执行程序、布局方法和待查线索;纠正阶段数、Anchor-Point 类比与不可编辑性推断;跨环节资产改用链接。
  • 2026-09-25:新增「体素原生工具、格式与混合层级表示」(工具/格式/学术三类)。确立两条结论:2026 仍无通用体素场景标准;稀疏体素与神经场已收敛为「显式骨架 + 局部隐式细节」。检索转述,未逐页复核许可。
  • 2026-09-25(同日修订):删除已写入的「世界模型作为场景来源」一节(9 个平台)。用户判定世界模型与本项目暂时不搭,不录入;其中唯一与本环节相关的一条——控制 pass 消费(depth/seg/edge 条件驱动写实化)——改归下游接口维护。本页仍保留原先的 World Labs「3D as code / Chisel」条目,因为其价值在场景程序与 layout/style 分离,不在世界模型路线。