Skip to content

B. 3D proxy → video ​

研究入口 · 综合判断 · 相机与分镜

用户已基于下游的白模能力决定推进整条闭环。本报告重点是消费接口、现成接线、失败模式与反馈入口,不重复论证“这条路线是否存在”。下列时间、机制和资产地址来自 2026-09-23 笔记;本轮没有联网重验或运行下游。

控制接口需要分开比较 ​

输入形态现有线索适合观察什么不能直接承诺什么
白模 RGB 视频参考Seedance、Flick、中文预演台走位、镜头、粗时序的迁移接受参考视频不等于逐帧锁定
首帧 / 首尾帧 / 多关键帧Kling、Seedance、Comfy 导演台构图端点、身份与片段衔接端点相同不保证中途路径相同
depth / pose / edge 等条件Blender→ComfyUI、ReShot、VACE/ControlNet 相关教程、NVIDIA Cosmos Transfer显式结构的影响和权重输出 pass 不等于某版本模型可直接消费,也不保证严格遵循
相机参数 / 点云 / occupancyShotVerse、CameraAnything、InfiniCube 等论文几何条件与生成机制专用研究模型的结果不能直接推广到商业通用视频接口

粗细几何、渲染外观、控制信号类型、时间采样和条件权重是不同选择。原笔记将“粗/细白模”直接对应 lattice level 不够准确。

一个值得单独跟踪的控制 pass 消费方(2026-09-25 检索):NVIDIA Cosmos Transfer 2.5 是 multi-ControlNet 条件模型,接受 RGB / depth / segmentation / edge / blur 作为结构化输入(JSON controlnet_specs),代码 Apache-2.0、权重为 NVIDIA Open Model License,build.nvidia.com 可无 GPU 试用;官方文档(检索称已读页面)。它不做“生成一个世界”,而是消费我们提供的控制通道——与本项目「确定性渲染器输出 depth/seg/edge pass(自带逐帧相机 provenance)→ 条件式写实化 → 下游视频」的接法一致。局限:VRAM 门槛高(7B 需单卡 80GB);对控制 pass 的遵循程度未实测。

下游模型与接线材料 ​

Seedance 白模与参考视频 ​

  • 原记时间:2.5 发布 2026-06-23、上线 2026-07-31;具体发布记录待补。
  • 来源:字节 visual 博客列表、Luma 指南、fal 指南、CSDN 介绍。博客列表不是具体发布公告,其他三者不能冒充字节官方。
  • 原记功能:白模预演、Blender/Maya 插件、视频/图像参考、时间戳与多关键帧;粗白模取空间/运动,细白模用于外观重渲染。
  • 应提取:插件真实导出物、输入命名、参考用途说明、计费方式和版本。旧笔记中的 30s、50 个参考等上限在核对官方具体版本前不作为 adapter 契约。

Blender → ComfyUI 控制链 ​

  • 来源:Flick(原记 2026-06)、Mixar、RunComfy(原记 2026,日期待补)。
  • 原记流程:blockout → clay/beauty/depth,按需要加 pose/normal/edge → 参考外观和视频生成;Flick 另记首帧图 + 运动参考视频 + 简短 prompt。
  • 可借:把构图、运动和外观分配给不同输入;保存 pass 对应的帧、视图和编码。
  • 待核实:原记统称“Wan 2.2 VACE / ControlNet”可能混合底座、社区适配器和 workflow,需要实际 JSON 与模型版本才能判断。不能称其“逐帧结构硬锁定”。

多镜头产品入口 ​

这些可帮助理解摄影词汇、时间戳和手动/自动分镜的 UI 语言;历史秒数、cut 数、分辨率等需按版本复核。支持多镜头不代表可导入任意相机曲线。

西方平台的 3D / 相机输入能力对照 ​

2026-09-25 检索补充。 逐个平台查证「是否接受 3D/深度/白模输入」与「相机控制是否参数化」。检索转述,未调用任何 API 实测;价格来自第三方或官方页,引用前需回到官方文档。

平台时间是否接受 3D/白模/深度相机控制多镜头 / 首尾帧公开 API
Runway(Gen-4.5 / Aleph 2.0 / Act-Two)2026-08;官方文档、changelog(原页)否。输入仅 text/image、video+text(Aleph)、image/video(Act-Two);白模需外部渲染后走 Aleph video-to-video 重制提示词 + Motion Brush;官方 API 文档未列出参数化相机轨迹字段。第三方站点声称有 cameraControl/viewpoint 字段,官方未证实Aleph 可续生成下一镜;无显式多镜头 API有,credits 制(gen4.5 12cr/s、aleph2 28cr/s、act_two 5cr/s)
Google Veo 3.1 / FlowVeo 3.1 2025-11,Ingredients 2026-01;API 文档(2026-09-25 已读官方页)否。输入 = prompt、image(首帧)、lastFrame、≤3 张 referenceImages、video(扩展)官方文档确认:可配参数只有 aspect_ratio、resolution、reference_images、首/末帧与扩展视频,无任何相机参数;相机完全靠提示词。Flow 网页端有自然语言相机控制 + SceneBuilderFlow 时间线、Jump To、Extend;首/尾帧插值有(Gemini API / Vertex);时长 4/6/8s,720p/1080p/4k
Kling(2.5 / 3.0 / O3)3.0 2026-02;多镜头指南 2026-07;API updates否,但接受 text/image/video、Elements、motion-control 参考视频参数化最强:6 轴相机控制(pan/tilt/roll/zoom/水平/垂直,-10~10 强度)、曲线 dolly 3D 相机路径(控制点绘制)、Motion Brush、Camera Shake,全部 API 可用Custom Multi-Shot,每镜头 1–15s、可设相机/景别/时长;2026-05 起多镜头与首尾帧不再互斥有(kling.ai/document-api),原生 4K
Higgsfield(Cinema Studio 2.0 / 3.5)2026-02;官方指南(原页)部分:有「3D Scene Access(进入场景)」,把输入图像当作 3D 场景在三轴移动/改透视以选取关键帧。不是摄入外部 3D/白模文件结构化参数:机身传感器、镜头玻璃(Cooke 等)、焦距 8–50mm、光圈/景深、具体运动、MoveSet 风格预设;相机逻辑跳模型复用≤6 镜头、每镜头 1–12s、总 12s、1080p;单镜头与自动多镜头支持首尾帧(用角色时尾帧不可用)有(cloud.higgsfield.ai / docs.higgsfield.ai),模型覆盖比网页端少
Luma(Ray3.2)2026-06;官方否(text/image/video、关键帧)帧级多关键帧控制(单片段≤16 个关键帧)编排相机路径与节奏;API 通过 keyframes 数组参数化支持 start/end/中间关键帧;单片段 20s@1080p;原生 HDR + 16-bit EXR有,2026-06 开放全套控制面 API
MiniMax Hailuo(2.3 / H3)2026;platform否方括号命令语法 [Pan left][Zoom in],单 prompt ≤3 个组合;H3 V2 未记录该语法(legacy Director 才有)弱,2.0 Pro 有首尾帧有
Vidu(Q2 / Q3)Q3 reference2video 2026-04;官方 docs否提示词驱动;movement_amplitude(auto/small/medium/large)官方文档自相矛盾且对 Q2/Q3 无实际效果(第三方分析)Multi-Frame API ≤9 个关键帧做长片转场;start-end2video有,$0.005/credit
OpenAI Sora 2已公告关停:App 2026-04-26 停、API 2026-09-24 停(媒体一致报道;官方文档页仍在线)否纯提示词Storyboard 多镜头模式;单次 ≤20s,可链式至 ~120s有但不应作为依赖
Pika(2.5)2026否提示词/运动预设(pan/zoom/tilt/motion intensity),非轨迹参数Pikaframes 首尾帧;无多镜头有,~$0.04/s @720p
Krea2026-09 Agent 指南;官方有自有 text-to-3D 与 Stage/Canvas 3D 摆放(成熟度低),但视频相机控制来自底层模型继承底层模型(Seedance 的 camera control 被官方点名为最强)继承底层有
Freepik / Magnific2026 品牌合并;API否预设式(Cinematic Shot、Change Camera),无轨迹参数 API弱有(Business 起 $55/席/月)
LTX Studio(Lightricks)2026-01;官方否(无原生 3D 几何摄入),但有 shot editor 相机运动预设 + 关键帧运动相机运动预设 + 关键帧运动,非完整轨迹参数;Gen Space 支持相机移动控制Dynamic Storyboard(脚本→场景→镜头)、Timeline Editor、Retake(2–16s 局部重生)、Elements有(console.ltx.video 的 LTX API)
Hera2025-11 评测不适用不适用不适用定位为 AI 动效/动态图形,非 3D 影视预演

三条对本项目最直接的结论:

  1. 没有一家西方主流平台原生接受 3D 网格/深度图/白模工程文件作为生成输入。 行业实际通路是「外部 3D 软件渲染白模 → 导出为视频/关键帧 → 作为 video-to-video 或关键帧输入」。最接近原生白模支持的是 Seedance 2.5(字节,非上表平台,但托管在 Runway/Krea/Freepik 上)。
  2. 参数化相机目前只有 Kling 3.0(6 轴 + 曲线 dolly)和 Higgsfield(机身/镜头/焦距/运动预设)是真正的结构化参数;其余基本是提示词或关键帧插值。Veo 的 API 只有 aspect_ratio + resolution(2026-09-25 官方页核实)是最极端的反例。
  3. 若要把白模相机轨迹映射到下游,Kling 的曲线 dolly 与 Luma 的多关键帧是最接近的映射目标;其余平台只能走「渲染参考视频/首帧图」。这是设想,未经实测。

一条补充(2026-09-25 读到 Gemini 官方文档页):Gemini 现在的默认视频模型是 Gemini Omni Flash(Veo 3.1 退居「需要场景扩展/末帧控制/旧管线集成」时使用),其多轮 Interactions API 支持「perspective changes / element replacement」。「多轮改视角」是比一次性参数更强的相机交互形式,值得单独跟踪;本轮未查到它的参数细节。

下游计费与配额的一手线索 ​

  • 即梦涨价通知(原贴引自官方通知,V2EX 2026-03-26):「15 秒视频,fast 模型,积分消耗 30 => 75;标准模型 45 => 120」;贴主补充「服务开通时说视频生成积分消耗四折…一个月没过优惠取消了」。这是平台单方面变更计费/契约的直接证据,说明下游成本不可作为长期预算常量。
  • Sora 2 关停时间线:2026-03-24 通知弃用、2026-04-26 App/网页关停、2026-09-24 API 返回 410 Gone 并删除数据(多为 SEO 博客转述,应以 OpenAI 官方 deprecation 文档为准)。
  • 真白模视频参考的隐形成本:原记 B 站评论称视频参考的积分消耗是图生视频的 2–3 倍;需查具体模型计费并比较总重试成本,不沿用倍率。

可复用资产条目 ​

AIVideo3DSandbox:3D 沙盘到导演指令 ​

  • 来源:BV175NGzFEfQ,原记 2026-03-08;GitHub。原记仓库创建 2026-04-05、无 LICENSE,视频与仓库时间先后需复核。
  • 原记机制:Three.js 关键帧场景和镜头信息 → LLM 导演提示 → Seedance;作者自评玩具级、提示粗糙。
  • 可借:3D 状态如何转成可用提示、LLM 实际读取哪些信息。未读源前不宣称它“唯一开源”,也不宣称缺少所有可重建与编辑能力。

ComfyUI_MiniMaxH3_Director 与 Bernini Director ​

  • 来源:主仓库、Bernini;BV16i8w6JEZR 2026-08-20、BV13ptA6AEvq 08-28、BV1kC8K6AEhW 08-21。
  • 原记 Apache-2.0;分段、首尾帧、多参考、@imageN、提示增强和报告输出。Bernini 的任务名包括 fl2v、vrc2v 等。
  • 可借:任务模式的输入/输出和分段约束;模式名称存在不证明位置/动作可被任意独立控制,“硬锁定”需核验实现和输出。
  • 原记评论:参考图随视频像素缩放而糊、二采连接不便、封装太大。保留为待复现故障,不作为当前版本缺陷结论。热度数字不作为“社区标准”的依据。

ComfyUI-MiniMaxH3-TimelineDirector ​

  • 来源:BV1t58R6jE1S,2026-08-26;仓库;本期网盘。原记 GPL-3.0。
  • 原记功能:素材时间线、分段长视频、动作迁移、编辑;目录含 drift control、latent guide、文档和 tests。
  • 可借:少量节点怎样表达素材时间窗与段间依赖。目录名不是实际能力证明,需跑一个示例。
  • 原记评论有 multiple 文件选择、滚轮转交和 DOM 尺寸问题;复现时记录 commit 与浏览器,避免把旧反馈当现状。

MiniMax-H3 模型与提示素材 ​

  • 来源:仓库、权重,原记 2026-07-30 创建,09-23 调查。
  • 原记有故事板提示 skill,适合查看模型实际接受的参考形式;代码和权重许可分开核对。
  • ComfyUI 节点、模型权重、云平台成本是不同依赖,不把“开源”解释为运行免费。

ReShot:已有视频到深度参考 ​

  • 来源:maosika-ai/reshot,原记 2026-09、Apache-2.0。
  • 原记机制:单目深度视频作为视频模型参考/控制输入,目标是复制镜头而非演员。
  • 可借:深度值如何归一化、编码成视频、对齐尺寸/时间、连接下游。它提供深度参考,不保证完全去除人物结构或恢复准确相机。
  • 获取状态:有仓库地址,未在本轮下载或验证输出格式。

Blender 导演台插件 ​

  • 来源:BV1dH8d68ENP,2026-08-26;百度网盘,码 h094。
  • 原记:作者用 AI 写插件,简化材质和灯光、保留白模预演,后续增加资产库。包未下载、许可未核实。
  • 可借:面向拍摄的窄工具如何组织机位和资产预设。旧评论中的 Blender 版本要求及物体消失问题需在真实包上验证。

Coding-agent 形态的 tygg-ai-film-studio 资产归意图/skill,DeepWhite 拍摄 skill 归分镜资产,避免重复维护下载地址和评论。

白模→视频的商业产品与开源工程 ​

2026-09-25 检索补充。 这一批是「blockout 预演 → 下游 AI 视频」被产品化的直接证据,也是与本项目最直接的产品对照。检索转述;标「原页」者表示检索者称已读仓库 README 或官方页。

Blockout(Sam Wasserman)—— 最接近本项目架构的开源工程 ​

  • 来源:wassermanproductions/blockout。核验状态:2026-09-25 已读仓库元数据、README、docs/DESIGN.md、docs/generator-profiles.md、AGENTS.md、docs/ROADMAP.md 与文件树(未 clone、未构建、未运行)。

  • 仓库:TypeScript/Electron + React + Three.js + Zustand;Apache-2.0(保留 NOTICE、署名 Sam Wasserman);154 star / 26 fork;创建 2026-07-07,最后推送 2026-08-05。

  • 定位(作者原话):Previs for AI-native filmmaking;「deliberately not a 3D art tool」;「fidelity target is unambiguous, not beautiful」。

  • 三个动词 = 整个应用:Stage(摆景)→ Shoot(拍)→ Deliver(交付)。作者明确写「如果某个功能不属于这三者之一,就不发布」。

  • 导出包(每镜头一个文件夹,DESIGN.md 与 README 一致):

    Shot-1A/export-…/
    ├── 1A_reference.mp4      # 动作参考(确定性离线渲染)
    ├── 1A_depth.mp4          # depth pass(可关)
    ├── 1A_normal.mp4         # normal pass(可关)
    ├── stills/               # 每个相机 mark 一帧 + 首/末帧 + 俯视 blocking 图
    ├── prompt.txt            # 从实际 blocking 生成,按生成器定制
    ├── comfyui-workflow.json # 预接好的 depth 条件工作流(Wan/LTX)
    ├── metadata.json         # 机器可读的 marks / 镜头 / 时间
    └── README.txt

    另有整场 animatic 拼接、contact sheet(分镜网格 PDF/PNG)、Blender handoff(.glb 含动画相机 + 一键导入脚本)。

  • generator profiles 是数据不是代码(src/engine/profiles.ts 的 BUILTIN_PROFILES):每个 profile 定义 maxDuration / recommendedDuration / aspects / exportWidth / fps / refModes(按优先级:referenceVideo / firstFrame / lastFrame / depthVideo / stills) / attachHint / adherenceClause。内置 Seedance 2.0、Veo 3.1、Kling 2.x、LTX 2.3、Wan 2.2 + 4 个图像 profile。含 depthVideo 的 profile 才会多出一个预接好的 ComfyUI workflow。

  • 确定性是硬规则:state(t) 是项目数据的纯函数,回放与导出共用同一个求值器;离线按精确 fps 步进渲染,无 wall-clock、无物理步进、无未存种子的随机(handheld 噪声把种子存进 shot)。同一个项目每次导出逐字节一致。

  • 项目格式 = 文件夹 + pretty-printed、stable-key-order JSON(project.json / scenes/scene-01.json / scenes/scene-01/shots/1A.json),目标是可 diff、可分支、可在 GitHub 上 review。

  • 覆盖模型:Scene 拥有 blocking,Shot 拥有相机与时间。同一动作换五个角度拍不需要重新 blocking;shot 需要变体时可以 fork blocking。

  • marks 是唯一心智模型:相机与演员都“走到 marks”,路径可拖、可缓动、有 gait;带速度合理性告警(步速推出 6 m/s 就变黄提醒)。

  • 真镜头数学:Super 16 / Super 35 / Full Frame / 65mm 传感器,焦距可逐 mark 打关键帧(推拉/眩晕变焦一键),焦点距离 + DOF 模糊使变焦对焦在参考视频里真的看得见;39 个经典机位运动、194 个角色动作、33 条动作路径。

  • Agent 可控:内置 MCP server,33 个工具(get_state / add_entity / spawn_choreography / import_scan / apply_camera_move / screenshot 等);app 向 ~/.config/blockout/control.json 写版本化的 localhost-only 控制描述符。仓库同时带 AGENTS.md / CLAUDE.md。

  • 参考摄入(与我们的反馈环相关,作者自己分了三期):V1 = 把已有视频(含 depth-map 视频)作为视口下的同步 ghost 参考,靠肉眼逐帧对齐;V2 = 跑本地姿态估计(MediaPipe/RTMPose 类)提取 2D/3D 骨架并重定向到人偶作为起点;V3 = 从参考视频解相机轨迹并提议相机 marks(标注 experimental)。USD 导出列为 later milestone。

  • Gaussian splat / 摄影测量扫描:可导入并在扫描里摆景,但作者明确写「Scans are an editor aid — they never touch the export.」

  • 同一作者另有两个可拼接的工具:motion-previs-studio(把参考视频变成 pose / depth / 相机数据)与 stem-studio(分轨)。

  • 对本项目的意义:

    • 相同:窄工具、只做可读 blockout、多 pass 导出、面向多个下游、数据驱动 profile、确定性导出、项目即可 diff 的 JSON、MCP 驱动、agent 可读仓库。
    • 它已解决而我们还没定的事:导出契约的具体字段(refModes 优先级、adherenceClause、metadata.json 内容)、生成器 profile 的参数化方式、确定性渲染规则。
    • 它没做的(也就是我们的空位):① 没有场景程序或参数化来源——项目 JSON 是手搭结果的快照,不是可重建的作者程序;② 没有逐帧相机 provenance 的显式概念(只有 marks/lenses/timings);③ 反馈是弱反馈——ghost 靠肉眼、相机解算标 experimental,没有自动回几何;④ 几何是程序化 capsule/低模,不是可混合层级的离散占用。

CineForge Previz(创剧)—— 同方向的中文独立项目 ​

  • 来源:Work-Fisher/cineforge-previz。核验状态:2026-09-25 已读仓库元数据与 README 全文(未运行)。
  • 仓库:Godot Engine 4.7(GDScript);20 star / 4 fork;创建 2026-07-12,同日后再无推送;许可 CC BY-NC-SA 4.0(非商业),README 明确禁止商用、禁止改成 GPL、禁止抹署名。
  • 定位(官方文案):「用白模快速把镜头、走位、群众规模、节奏定下来 —— 白模是「施工图」,AI 是「渲染」」。
  • 功能:搭景(导入模型、基础几何体、打组/变换)、素体人偶 + 走/跑/跳(拉高关键帧自动蓄力跳)+ 群众阵列、虚拟相机(透视/二点透视、运镜、预制镜头)、关键帧时间轴、导出 JSON 工程 / PNG 截图 / H.264 MP4(自动补黑边到 16:9)。
  • 分发:必须登录创剧账号才能使用;账号是项目数据与 AI 生态的入口(官网 cineforge.workfisher.cn)。
  • 资产:app/models/ 下大量 Kenney CC0 的 glb 建筑/家具。
  • 对本项目的意义:
    • 相同:白模定镜头/走位/规模/节奏,再交给即梦/Seedance;导出 JSON 工程 + MP4;Godot(MIT)作宿主,验证了「轻量引擎 + 脚本」这条路可行。
    • 关键差异(三处,都对我们有利):① 账号绑定 + 非商业许可 —— 不是可自由集成的开源依赖;② 只活了一天就停止推送,无测试、无 CI、无设计文档,成熟度远低于 Blockout;③ 导出只有 JSON/PNG/MP4,没有 depth/normal pass,也没有生成器 profile,下游适配靠人工。
    • 它的价值主要是市场信号:中文圈已有团队在做同一件事,而且选了 Godot;但它没有占据我们想占的「可重建程序 + provenance + 闭环」位置。

商业产品(均在争夺「blockout→video」入口) ​

产品时间形态对本项目
Higgsfield Blender 插件 / MCP2026-08-25 发布;higgsfield.aiprompt→blockout、语言→相机动画、秒级 reblock;经 MCP 或 Supercomputer首个「第一方 previz 副驾」,说明「语言优先迭代 + 人工手改」成为主流交互。自述局限:云端锁定、demo≠可生产拓扑、无公开 benchmark
Autodesk Flow Studio(原 Wonder Studio)2026 在售;官方3D Editor + Canvas 一体:世界生成/角色/mocap/相机动画商业一体化 previs 方向;其 USD 场景导出(相机轨迹 + 角色 pass + 遮罩)与本项目 provenance 思路同构
Mixar2026;官方博客Blender 内核 3D 编辑器;五种相机姿态即完整运镜;三 pass:beauty/clay/depth;adherence 保守/表现两档「结构是作者的,表面是生成的」表述精准
Flick2026-06;官方博客Blender → Nano Banana 首帧 → Seedance Omni Reference;进阶:depth/OpenPose/Canny → ControlNet → Wan 2.2 VACE工具链地图最全的一篇:明确 depth/pose/Canny 分工、toyxyz OpenPose rig、fSpy 相机匹配
invideo2026-08-10 更新;官方 FAQblockout → Nano Banana Pro 上色 → Seedance 2.0/Kling 动画量化自述:比纯 prompt 花更多 credits/时间换镜头级控制,但仍远低于传统 previs(「tens of thousands of dollars over weeks」);引用 r/comfyui 共识「plain blockout 优于精细人偶」
SEELE 3D Greybox Previz2026;官方自动生成灰盒「灰盒先行再上色」已被产品化

英文创作者生态(YouTube / Reddit) ​

2026-09-25 检索补充。 这是 B 站那条线在英文世界的对应物。重要限定:检索工具对 YouTube 直抓只回 JS 壳,观看数/日期来自搜索索引快照,可能有数日误差;除个别条目外未取到评论区。下列条目为检索转述。

视频 / 频道日期工具链可借之处
ChatGPT 6 Astra is INSANE for 3D Previz (Blender to Seedance 2.5),JSFILMZ(123K subs)2026-09-09;链接Blender 5.2.1 + GPT-6 Astra + Higgsfield MCP/Supercomputer + Seedance 2.5最直接的英文对标;作者自述失败模式:Seedance 几何「bleeding」(用网格贴图缓解)、相机滞后/裁切、需给角色脸部着色编码才能维持空间逻辑
Seedance 2.5 + Blender Unlocks Cinematic AI Video Creation,AiRace(51.3K)2026-09-05;链接Claude → Blender → 3D previs → Higgsfield → Seedance 2.5零基础用户的进入路径;强调「生成前锁定每个相机/角色/秒数」
Stop Guessing Camera Moves in AI Video,Design Xstream(80K)2026-09-10;链接Blender + Higgsfield 插件 + Seedance 2.5 + 「3D Jutsu」浏览器 3D 建场给出「纯 prompt vs 3D 引导」的对比方法论
How to Control AI Video with Blender (2026),CGDive(97.4K)2026-09-12;链接Higgsfield Blender 插件(赞助)+ GPT-6 Astra作者自述结论:视觉参考的权重远大于文本 prompt;细节越模糊 AI 越会自行补全。赞助视频,成本段单列
We Built a FREE AI Render Engine for CG & Facial Animation,Mickmumpitz(185K)2026-06-19;链接Blender 粗建 + 导出 depth/outline pass + FLUX 参考帧 + LTX-2.3 + 4K 放大;本地 RTX 5090与本项目最接近的开源本地对照:结构由 3D 给、表面由 AI 给,全本地。NVIDIA 付费合作;需 5090 级算力
Can this SOLVE control in AI VIDEOS?,Bad Decisions Studio(291K)2026-08-07;链接Autodesk Flow Studio + Seedance 2.5 + MiniMax H3展示商业一体化 previs 工具;转录提到作者正在「vibe-coding 一个 Unreal 插件 + MCP + LLM 读图转 prompt」——正是自动描述层,当时未完成
How to Make AI Videos with Seedance AI in 2026,AI Master(329K)约 2026-09(日期未证实);链接Seedance 2.5 + 3D blocking + 50 参考图章节含「Blocking the scene in 3D」与专门的「诚实局限」段落
How to Create a Professional AI Film,Curious Refuge(274K)2026-04-14;链接脚本→视觉→剪辑全流程英文世界「AI 电影学院」中心的机构级流程总览;3D previs 只是子话题

频道画像与一条反向结论:英文侧集中在 Blender + Higgsfield/MCP + Seedance 2.5 这一条商业栈,且 2026-08~09 集中爆发;开源本地线由 Mickmumpitz + ComfyUI + Wan VACE + LTX 主导。通用 AI 频道(Nate Herk 主做 n8n 自动化、AI Jason/bycloud 主做模型评测)没有这条主线——检索中「bycloud 3D blockout 平台」的说法疑似搜索摘要臆造,已排除。

Reddit 线索(r/comfyui / r/generativeAI / r/ClaudeCode,2026):

  • 「Your Blender blockout for AI video can be embarrassingly simple」——生成起始帧 + 几个盒子 + 动画相机即可。
  • 「The previz that matters for AI video is not one shot, it is the cut」——在同一场景 block 整段镜头串(走位/构图/镜头/运镜),直接对应本项目「连续运镜 + 显式切」。
  • 有帖把 Blender MCP 建构图/相机 → 渲 previs → Seedance 的流程打包成可复用 skill,换概念复跑得同质结果——「skill 化」思路与本项目 SDK 目标一致。
  • 上述均为社区帖,未核实全文,评论数据未取。

这一生态的共同局限(跨条目重复出现):几何 bleeding(Seedance)、相机滞后/裁切、多镜头一致性、云计费/credits 成本、依赖特定厂商、无 provenance、无自动回几何。

产品实践与仅指导性演示 ​

平台 / 时间来源原记流程与研究用途
updream 预演台,2026-08介绍、补充、BAAI 转述场景图→白模、走位轨迹、相机轨迹/look-at、录制参考;关注哪些状态能导出和改回
LibTV,2026-06产品介绍、聚合页站位、预设动作、多机位、关键帧与画布;黑盒产品须看实际交换边界
AniShort,2026-06-15报道3D 导演台输出镜头参考;“抽卡降 90%”仅宣传口径
天工 SkyProduction,2026-07-16报道全景、站位、分镜;与纯 T2V 资产编排交叉
H3-World,2026-09-08二手介绍原记按键驱动移动与相机,需补官方权重/仓库,不把介绍当开源核验

仅指导性视频作为一组维护:updream 的 BV1Hx8u6GEyA(08-18)、BV1Rgbr6mENx(08-26)、BV1PT8g65Enj(2026,具体日期待补);LibTV 的 BV1FnT46FE3s(07-03);小云雀/导演台演示 BV1nhTW6REcF(07-03);agent+Blender 演示 BV1x7Yx6YEM6(09-09)。原记仅平台推广或官网入口,未取得可复用工作流。

原记 DeepWhite 全景实践(2026-09-02)通过可移动世界取景,再修复为参考图;作者承认清晰度/风格限制,评论给出 ml-sharp、comfyui-sharp、geometrypack、sharp-gui、postshot、superspl.at 等替代线索。这些工具名称尚未逐个绑定仓库与版本;下载入口归分镜报告。

四路线综述(2026-09-10)可作平台预演、Comfy 节点、Blender/agent、首尾帧的分类参考。原笔记先称“节点大量依赖逆向接口”再整体否定,两种泛化都删除;依赖须逐项目检查。Pixmax、MetaDig、万兴、Wemio/DaoAI 尚缺独立资料,只作为后续检索名称。

社区失败线索:用于设计实验 ​

原记观察相关 BV应如何使用
白模材质泄漏到输出BV1Rgbr6mENx分开指定外观与空间用途,测试提示是否有效
动作过度继承白模导致僵硬BV1PT8g65Enj、BV1RLeg6rEri对比仅参考位移/镜头与参考完整动作
视频参考计费更高,报告有 2–3 倍差异BV1PT8g65Enj、BV1Rgbr6mENx查询具体模型计费,比较总重试成本;不沿用倍率
复杂打斗和运镜最终仍需手调BV1x7Yx6YEM6选择简单/复杂成对任务,记录编辑范围
轨迹只能在平面绘制、操控视角难跟随BV1Rgbr6mENx检查编辑器操作与代理表示分别缺什么
“80% 稳定”“每镜 5–15 次”BV1Rgbr6mENx、BV1PT8g65Enj样本、版本、成功定义未知,不能当验收基线

评论的点赞量表示关注度,不提高技术断言的可信度。“参考其实只是转提示词”是评论者猜测,不能据此描述模型内部机制。当前未恢复原始评论 JSON,以上是旧报告的转述。

学术路线:控制与跨镜一致性 ​

工作时间 / 来源原记机制与可借部分
One Sentence, One Drama2026-05-21,论文全景→共享世界,首帧注册、轨迹锚定、机位过滤、人物对齐;研究跨镜状态如何复用
InfiniVerse2026-06,论文粗 occupancy 引导、生成帧反投影更新;需区分重建更新和用户可编辑的作者程序修订
ORV原记 2026,项目4D semantic occupancy 视频引导;驾驶/机器人域的结果不直接迁移到影视
CameraAnything2026-07,论文相机重拍;查条件表示和轨迹输入
Beyond Inpainting2026-01,论文点云/mesh→depth 与 occlusion mask;观察出画和遮挡的显式处理
UniMoCa2026-08,论文人体运动与相机视觉因子;查两类控制如何分离
Geometry Forcing原记 2026,聚合页几何特征对齐;需补论文原页
FantasyWorldICLR 2026,PDF视频与 3D 联合预测;作为相邻路线
WorldForge原记 CVPR 2026,旧笔记仅 awesome 提及未定位独立 URL,暂列待查

InfiniCube(ICCV 2025)和 Blender/Comfy 教程(BV1McXEY6EQL,2025-03-18)仅作历史基线,保留原有入口,不扩展检索。

「几何/占用代理 → 渲染为对齐条件 → 视频扩散」这条学术主线 ​

2026-09-25 检索补充。 机制上等价于「体素白模 → 视频」。检索转述,未读全文。

工作时间关键机制对本项目
InfiniVersearXiv v1 2026-06,v2 2026-08(ECCV workshop SPAD);论文单帧多视图 → 重建 3D 占用(XCube,DINOv2+LSS 反投影条件化)→ 沿任意轨迹自回归扩展 → 视频扩散把粗占用译为视频;「sketch-and-refine」把生成视频反投影回占用做跨模态互增强★ 占用→视频 + 占用↔视频互相精修,与本项目「先几何后外观」完全一致。局限:驾驶域;预印本未广泛复现;占用粗于美术体素
SyntheOcc2024-10;论文提出 3D semantic MPI 把体素占用编码为与 2D UNet 空间对齐的条件;可逐体素编辑占用状态与语义来控制生成图像/视频★ 直接支持「手动编辑体素 → 改变生成画面」,正是本项目 authoring 目标;3D 语义 MPI 是体素→2D 条件的实用编码。局限:驾驶街景、MPI 深度歧义
GEN3C2025(NVIDIA);项目从图像构建近似 3D 缓存(点云),投影到目标相机轨迹作为条件,微调视频扩散;支持精确相机控制、物体移除、场景编辑★ 与「几何代理(点云/体素)→ 投影 → 视频」同构;强调相机轨迹精确控制,契合本项目连续相机运动需求。局限:3D 缓存来自图像而非美术体素
GenieDrive(OccDreamer + Video Dreamer)CVPR 2026 / arXiv 2512.12751;论文OccDreamer 为状态转移模型:多粒度输入 → Occupancy DiT 生成 4D occupancy;Video Dreamer 用 ControlNet 式局部像素级对齐把占用转成语义 MPI,再驱动视频扩散★「occupancy DiT + ControlNet 局部对齐」是可迁移架构;强调局部空间对齐优于全局 1D embedding。局限:驾驶域、重计算
ORV(澄清)arXiv 2025-06,CVPR 2026;仓库不是「one-shot voxel reconstruction」:是机器人操作视频生成,用 4D 语义占用(chunked 稀疏占用)的 2D 渲染作软引导注入视频扩散;Action-Expert AdaLN 对齐动作4D 占用引导 + 动作条件 + 多视图一致的视频生成;「占用渲染作软引导」手法可复用到场景动画。局限:机器人域
Drive-CascadeCVPR 2026自回归「占用 → LiDAR → 视频」级联;Occ Dreamer 状态转移 + Video Dreamer 发射占用为中心的多模态级联思路;驾驶域
Gen3R2026-01-07外观 + 几何共享潜空间联合生成;明确论证两阶段(先生成视频再喂 VGGT)会累积误差且「无反馈环」★ 直接回答「视频反馈回几何」的必要性:研究已证明闭环必要。纯研究,未产品化

关于「体素白模 → 视频」的总结:学术上这条线已经成熟,但几乎全部集中在自动驾驶/机器人,用语义占用网格而非美术调色体素;没有面向艺术家创作的通用「体素白模 → 电影视频」学术系统。商业上 Seedance/Dreamina 页面宣传「3D Blockout to Video / White Model Workflow」,但属厂商营销页,无技术细节与可验证评测。公开可复现方案仍空白——这是本项目的机会窗口,但「空白」是有限检索的结果,不能写成「行业确无」。

程序化生成 + provenance + 闭环:三者尚未合成 ​

2026-09-25 检索的一个明确判断:

  • 创作者/YouTube 生态:基本没有闭环。 主流是「手搭/语言搭 blockout → 单次前馈到视频模型」,reblock 靠人工。未找到任何创作者频道做「视频→几何」自动反馈。
  • 研究生态:三者都有人做,但分散——程序化生成(SceneCraft、SAGE、Code2Worlds 等,见场景构建);provenance 由法规倒逼(EU AI Act Art.50 与 California AI Transparency Act,2026-08-02 生效,要求嵌入来源元数据);视频↔几何闭环(Gen3R、DAIV/DAADiff/EvoWorld/Wanderland/Point4Cast 类,以及 Lyra 2.0)。
  • 尚未有人把三者合成影视 previs 工具。最接近的开源工程是 Blockout(把视频含 depth ghost 回视口,弱反馈),最接近的学术对标是 PrevizWhiz(见相机报告)。
  • 结论用法:可作为本项目定位的论据,但必须写成「本轮有限检索未发现」,不能写成「行业空白已被证明」。

下一步最有用的验证 ​

选一个实际可运行接口,固定 prompt、外观参考、时长与版本,仅改变 proxy 的机位或主体路径,检查视频是否随之改变;再测首帧与视频参考的成本差异。记录输入视频/pass 编码、相机来源、失败片段和人工修订。

反馈回 proxy 的关键是把问题定位到对象、时间、视图和 revision。当前笔记未证明其他系统都缺这条闭环;应逐个查可编辑格式、API 和更新机制,避免把“没找到”写成“没有”。

维护记录 ​

  • 2026-09-24:删除重复平台/路线段;资产按实际获取状态整理;纠正模型硬锁定、行业唯一性、社区标准和 80% 验收的过度结论。
  • 2026-09-25:新增三块联网检索内容——①西方平台 3D/相机输入能力对照(13 个平台)与下游计费一手线索;②「白模→视频」商业产品与开源工程(Blockout、Mixar、Flick、invideo、SEELE、Flow Studio、Higgsfield 插件)与英文创作者生态(YouTube 8 条 + Reddit);③「几何/占用代理 → 对齐条件 → 视频扩散」学术主线(InfiniVerse、SyntheOcc、GEN3C、GenieDrive、ORV 澄清、Drive-Cascade、Gen3R)与「程序化生成 + provenance + 闭环尚未合成」的判断。检索转述,未调用 API、未读论文全文、未取 YouTube 评论区。
  • 2026-09-25(同日修订):按用户判定不录入世界模型路线(与本项目暂时不搭);仅保留其中与本环节直接相关的一条——Cosmos Transfer 作为控制 pass 消费方——写入控制接口一节。
  • 2026-09-25(同日再修订):第一手读完 Blockout(README + DESIGN.md + generator-profiles.md + AGENTS.md + ROADMAP + 文件树 + GitHub API)与 CineForge(README + 元数据),并核实 Veo 官方 API 页;两条从「检索转述」升级为「原文已读」,补全导出包结构、generator profile 字段、确定性规则、项目 JSON 格式、参考摄入三期计划、MCP 工具数(33)与 CineForge 的账号绑定/许可/停止推送事实。新增 Gemini Omni Flash 作为默认视频模型的补充条目。