B. 3D proxy → video
用户已基于下游的白模能力决定推进整条闭环。本报告重点是消费接口、现成接线、失败模式与反馈入口,不重复论证“这条路线是否存在”。下列时间、机制和资产地址来自 2026-09-23 笔记;本轮没有联网重验或运行下游。
控制接口需要分开比较
| 输入形态 | 现有线索 | 适合观察什么 | 不能直接承诺什么 |
|---|---|---|---|
| 白模 RGB 视频参考 | Seedance、Flick、中文预演台 | 走位、镜头、粗时序的迁移 | 接受参考视频不等于逐帧锁定 |
| 首帧 / 首尾帧 / 多关键帧 | Kling、Seedance、Comfy 导演台 | 构图端点、身份与片段衔接 | 端点相同不保证中途路径相同 |
| depth / pose / edge 等条件 | Blender→ComfyUI、ReShot、VACE/ControlNet 相关教程、NVIDIA Cosmos Transfer | 显式结构的影响和权重 | 输出 pass 不等于某版本模型可直接消费,也不保证严格遵循 |
| 相机参数 / 点云 / occupancy | ShotVerse、CameraAnything、InfiniCube 等论文 | 几何条件与生成机制 | 专用研究模型的结果不能直接推广到商业通用视频接口 |
粗细几何、渲染外观、控制信号类型、时间采样和条件权重是不同选择。原笔记将“粗/细白模”直接对应 lattice level 不够准确。
一个值得单独跟踪的控制 pass 消费方(2026-09-25 检索):NVIDIA Cosmos Transfer 2.5 是 multi-ControlNet 条件模型,接受 RGB / depth / segmentation / edge / blur 作为结构化输入(JSON controlnet_specs),代码 Apache-2.0、权重为 NVIDIA Open Model License,build.nvidia.com 可无 GPU 试用;官方文档(检索称已读页面)。它不做“生成一个世界”,而是消费我们提供的控制通道——与本项目「确定性渲染器输出 depth/seg/edge pass(自带逐帧相机 provenance)→ 条件式写实化 → 下游视频」的接法一致。局限:VRAM 门槛高(7B 需单卡 80GB);对控制 pass 的遵循程度未实测。
下游模型与接线材料
Seedance 白模与参考视频
- 原记时间:2.5 发布 2026-06-23、上线 2026-07-31;具体发布记录待补。
- 来源:字节 visual 博客列表、Luma 指南、fal 指南、CSDN 介绍。博客列表不是具体发布公告,其他三者不能冒充字节官方。
- 原记功能:白模预演、Blender/Maya 插件、视频/图像参考、时间戳与多关键帧;粗白模取空间/运动,细白模用于外观重渲染。
- 应提取:插件真实导出物、输入命名、参考用途说明、计费方式和版本。旧笔记中的 30s、50 个参考等上限在核对官方具体版本前不作为 adapter 契约。
Blender → ComfyUI 控制链
- 来源:Flick(原记 2026-06)、Mixar、RunComfy(原记 2026,日期待补)。
- 原记流程:blockout → clay/beauty/depth,按需要加 pose/normal/edge → 参考外观和视频生成;Flick 另记首帧图 + 运动参考视频 + 简短 prompt。
- 可借:把构图、运动和外观分配给不同输入;保存 pass 对应的帧、视图和编码。
- 待核实:原记统称“Wan 2.2 VACE / ControlNet”可能混合底座、社区适配器和 workflow,需要实际 JSON 与模型版本才能判断。不能称其“逐帧结构硬锁定”。
多镜头产品入口
- Kling 3.0,原记 2026-02,第三方模型页。
- Higgsfield Cinema Studio 2.0 演示,原记 2026,发布日期待补。
- Seedance 2.0 多镜头提示演示,原记 2026-04-28。
这些可帮助理解摄影词汇、时间戳和手动/自动分镜的 UI 语言;历史秒数、cut 数、分辨率等需按版本复核。支持多镜头不代表可导入任意相机曲线。
西方平台的 3D / 相机输入能力对照
2026-09-25 检索补充。 逐个平台查证「是否接受 3D/深度/白模输入」与「相机控制是否参数化」。检索转述,未调用任何 API 实测;价格来自第三方或官方页,引用前需回到官方文档。
| 平台 | 时间 | 是否接受 3D/白模/深度 | 相机控制 | 多镜头 / 首尾帧 | 公开 API |
|---|---|---|---|---|---|
| Runway(Gen-4.5 / Aleph 2.0 / Act-Two) | 2026-08;官方文档、changelog(原页) | 否。输入仅 text/image、video+text(Aleph)、image/video(Act-Two);白模需外部渲染后走 Aleph video-to-video 重制 | 提示词 + Motion Brush;官方 API 文档未列出参数化相机轨迹字段。第三方站点声称有 cameraControl/viewpoint 字段,官方未证实 | Aleph 可续生成下一镜;无显式多镜头 API | 有,credits 制(gen4.5 12cr/s、aleph2 28cr/s、act_two 5cr/s) |
| Google Veo 3.1 / Flow | Veo 3.1 2025-11,Ingredients 2026-01;API 文档(2026-09-25 已读官方页) | 否。输入 = prompt、image(首帧)、lastFrame、≤3 张 referenceImages、video(扩展) | 官方文档确认:可配参数只有 aspect_ratio、resolution、reference_images、首/末帧与扩展视频,无任何相机参数;相机完全靠提示词。Flow 网页端有自然语言相机控制 + SceneBuilder | Flow 时间线、Jump To、Extend;首/尾帧插值 | 有(Gemini API / Vertex);时长 4/6/8s,720p/1080p/4k |
| Kling(2.5 / 3.0 / O3) | 3.0 2026-02;多镜头指南 2026-07;API updates | 否,但接受 text/image/video、Elements、motion-control 参考视频 | 参数化最强:6 轴相机控制(pan/tilt/roll/zoom/水平/垂直,-10~10 强度)、曲线 dolly 3D 相机路径(控制点绘制)、Motion Brush、Camera Shake,全部 API 可用 | Custom Multi-Shot,每镜头 1–15s、可设相机/景别/时长;2026-05 起多镜头与首尾帧不再互斥 | 有(kling.ai/document-api),原生 4K |
| Higgsfield(Cinema Studio 2.0 / 3.5) | 2026-02;官方指南(原页) | 部分:有「3D Scene Access(进入场景)」,把输入图像当作 3D 场景在三轴移动/改透视以选取关键帧。不是摄入外部 3D/白模文件 | 结构化参数:机身传感器、镜头玻璃(Cooke 等)、焦距 8–50mm、光圈/景深、具体运动、MoveSet 风格预设;相机逻辑跳模型复用 | ≤6 镜头、每镜头 1–12s、总 12s、1080p;单镜头与自动多镜头支持首尾帧(用角色时尾帧不可用) | 有(cloud.higgsfield.ai / docs.higgsfield.ai),模型覆盖比网页端少 |
| Luma(Ray3.2) | 2026-06;官方 | 否(text/image/video、关键帧) | 帧级多关键帧控制(单片段≤16 个关键帧)编排相机路径与节奏;API 通过 keyframes 数组参数化 | 支持 start/end/中间关键帧;单片段 20s@1080p;原生 HDR + 16-bit EXR | 有,2026-06 开放全套控制面 API |
| MiniMax Hailuo(2.3 / H3) | 2026;platform | 否 | 方括号命令语法 [Pan left][Zoom in],单 prompt ≤3 个组合;H3 V2 未记录该语法(legacy Director 才有) | 弱,2.0 Pro 有首尾帧 | 有 |
| Vidu(Q2 / Q3) | Q3 reference2video 2026-04;官方 docs | 否 | 提示词驱动;movement_amplitude(auto/small/medium/large)官方文档自相矛盾且对 Q2/Q3 无实际效果(第三方分析) | Multi-Frame API ≤9 个关键帧做长片转场;start-end2video | 有,$0.005/credit |
| OpenAI Sora 2 | 已公告关停:App 2026-04-26 停、API 2026-09-24 停(媒体一致报道;官方文档页仍在线) | 否 | 纯提示词 | Storyboard 多镜头模式;单次 ≤20s,可链式至 ~120s | 有但不应作为依赖 |
| Pika(2.5) | 2026 | 否 | 提示词/运动预设(pan/zoom/tilt/motion intensity),非轨迹参数 | Pikaframes 首尾帧;无多镜头 | 有,~$0.04/s @720p |
| Krea | 2026-09 Agent 指南;官方 | 有自有 text-to-3D 与 Stage/Canvas 3D 摆放(成熟度低),但视频相机控制来自底层模型 | 继承底层模型(Seedance 的 camera control 被官方点名为最强) | 继承底层 | 有 |
| Freepik / Magnific | 2026 品牌合并;API | 否 | 预设式(Cinematic Shot、Change Camera),无轨迹参数 API | 弱 | 有(Business 起 $55/席/月) |
| LTX Studio(Lightricks) | 2026-01;官方 | 否(无原生 3D 几何摄入),但有 shot editor 相机运动预设 + 关键帧运动 | 相机运动预设 + 关键帧运动,非完整轨迹参数;Gen Space 支持相机移动控制 | Dynamic Storyboard(脚本→场景→镜头)、Timeline Editor、Retake(2–16s 局部重生)、Elements | 有(console.ltx.video 的 LTX API) |
| Hera | 2025-11 评测 | 不适用 | 不适用 | 不适用 | 定位为 AI 动效/动态图形,非 3D 影视预演 |
三条对本项目最直接的结论:
- 没有一家西方主流平台原生接受 3D 网格/深度图/白模工程文件作为生成输入。 行业实际通路是「外部 3D 软件渲染白模 → 导出为视频/关键帧 → 作为 video-to-video 或关键帧输入」。最接近原生白模支持的是 Seedance 2.5(字节,非上表平台,但托管在 Runway/Krea/Freepik 上)。
- 参数化相机目前只有 Kling 3.0(6 轴 + 曲线 dolly)和 Higgsfield(机身/镜头/焦距/运动预设)是真正的结构化参数;其余基本是提示词或关键帧插值。Veo 的 API 只有
aspect_ratio+resolution(2026-09-25 官方页核实)是最极端的反例。 - 若要把白模相机轨迹映射到下游,Kling 的曲线 dolly 与 Luma 的多关键帧是最接近的映射目标;其余平台只能走「渲染参考视频/首帧图」。这是设想,未经实测。
一条补充(2026-09-25 读到 Gemini 官方文档页):Gemini 现在的默认视频模型是 Gemini Omni Flash(Veo 3.1 退居「需要场景扩展/末帧控制/旧管线集成」时使用),其多轮 Interactions API 支持「perspective changes / element replacement」。「多轮改视角」是比一次性参数更强的相机交互形式,值得单独跟踪;本轮未查到它的参数细节。
下游计费与配额的一手线索
- 即梦涨价通知(原贴引自官方通知,V2EX 2026-03-26):「15 秒视频,fast 模型,积分消耗 30 => 75;标准模型 45 => 120」;贴主补充「服务开通时说视频生成积分消耗四折…一个月没过优惠取消了」。这是平台单方面变更计费/契约的直接证据,说明下游成本不可作为长期预算常量。
- Sora 2 关停时间线:2026-03-24 通知弃用、2026-04-26 App/网页关停、2026-09-24 API 返回 410 Gone 并删除数据(多为 SEO 博客转述,应以 OpenAI 官方 deprecation 文档为准)。
- 真白模视频参考的隐形成本:原记 B 站评论称视频参考的积分消耗是图生视频的 2–3 倍;需查具体模型计费并比较总重试成本,不沿用倍率。
可复用资产条目
AIVideo3DSandbox:3D 沙盘到导演指令
- 来源:BV175NGzFEfQ,原记 2026-03-08;GitHub。原记仓库创建 2026-04-05、无 LICENSE,视频与仓库时间先后需复核。
- 原记机制:Three.js 关键帧场景和镜头信息 → LLM 导演提示 → Seedance;作者自评玩具级、提示粗糙。
- 可借:3D 状态如何转成可用提示、LLM 实际读取哪些信息。未读源前不宣称它“唯一开源”,也不宣称缺少所有可重建与编辑能力。
ComfyUI_MiniMaxH3_Director 与 Bernini Director
- 来源:主仓库、Bernini;BV16i8w6JEZR 2026-08-20、BV13ptA6AEvq 08-28、BV1kC8K6AEhW 08-21。
- 原记 Apache-2.0;分段、首尾帧、多参考、
@imageN、提示增强和报告输出。Bernini 的任务名包括fl2v、vrc2v等。 - 可借:任务模式的输入/输出和分段约束;模式名称存在不证明位置/动作可被任意独立控制,“硬锁定”需核验实现和输出。
- 原记评论:参考图随视频像素缩放而糊、二采连接不便、封装太大。保留为待复现故障,不作为当前版本缺陷结论。热度数字不作为“社区标准”的依据。
ComfyUI-MiniMaxH3-TimelineDirector
- 来源:BV1t58R6jE1S,2026-08-26;仓库;本期网盘。原记 GPL-3.0。
- 原记功能:素材时间线、分段长视频、动作迁移、编辑;目录含 drift control、latent guide、文档和 tests。
- 可借:少量节点怎样表达素材时间窗与段间依赖。目录名不是实际能力证明,需跑一个示例。
- 原记评论有 multiple 文件选择、滚轮转交和 DOM 尺寸问题;复现时记录 commit 与浏览器,避免把旧反馈当现状。
MiniMax-H3 模型与提示素材
- 来源:仓库、权重,原记 2026-07-30 创建,09-23 调查。
- 原记有故事板提示 skill,适合查看模型实际接受的参考形式;代码和权重许可分开核对。
- ComfyUI 节点、模型权重、云平台成本是不同依赖,不把“开源”解释为运行免费。
ReShot:已有视频到深度参考
- 来源:maosika-ai/reshot,原记 2026-09、Apache-2.0。
- 原记机制:单目深度视频作为视频模型参考/控制输入,目标是复制镜头而非演员。
- 可借:深度值如何归一化、编码成视频、对齐尺寸/时间、连接下游。它提供深度参考,不保证完全去除人物结构或恢复准确相机。
- 获取状态:有仓库地址,未在本轮下载或验证输出格式。
Blender 导演台插件
- 来源:BV1dH8d68ENP,2026-08-26;百度网盘,码
h094。 - 原记:作者用 AI 写插件,简化材质和灯光、保留白模预演,后续增加资产库。包未下载、许可未核实。
- 可借:面向拍摄的窄工具如何组织机位和资产预设。旧评论中的 Blender 版本要求及物体消失问题需在真实包上验证。
Coding-agent 形态的 tygg-ai-film-studio 资产归意图/skill,DeepWhite 拍摄 skill 归分镜资产,避免重复维护下载地址和评论。
白模→视频的商业产品与开源工程
2026-09-25 检索补充。 这一批是「blockout 预演 → 下游 AI 视频」被产品化的直接证据,也是与本项目最直接的产品对照。检索转述;标「原页」者表示检索者称已读仓库 README 或官方页。
Blockout(Sam Wasserman)—— 最接近本项目架构的开源工程
来源:wassermanproductions/blockout。核验状态:2026-09-25 已读仓库元数据、README、
docs/DESIGN.md、docs/generator-profiles.md、AGENTS.md、docs/ROADMAP.md与文件树(未 clone、未构建、未运行)。仓库:TypeScript/Electron + React + Three.js + Zustand;Apache-2.0(保留 NOTICE、署名 Sam Wasserman);154 star / 26 fork;创建 2026-07-07,最后推送 2026-08-05。
定位(作者原话):Previs for AI-native filmmaking;「deliberately not a 3D art tool」;「fidelity target is unambiguous, not beautiful」。
三个动词 = 整个应用:Stage(摆景)→ Shoot(拍)→ Deliver(交付)。作者明确写「如果某个功能不属于这三者之一,就不发布」。
导出包(每镜头一个文件夹,DESIGN.md 与 README 一致):
Shot-1A/export-…/ ├── 1A_reference.mp4 # 动作参考(确定性离线渲染) ├── 1A_depth.mp4 # depth pass(可关) ├── 1A_normal.mp4 # normal pass(可关) ├── stills/ # 每个相机 mark 一帧 + 首/末帧 + 俯视 blocking 图 ├── prompt.txt # 从实际 blocking 生成,按生成器定制 ├── comfyui-workflow.json # 预接好的 depth 条件工作流(Wan/LTX) ├── metadata.json # 机器可读的 marks / 镜头 / 时间 └── README.txt另有整场 animatic 拼接、contact sheet(分镜网格 PDF/PNG)、Blender handoff(.glb 含动画相机 + 一键导入脚本)。
generator profiles 是数据不是代码(
src/engine/profiles.ts的BUILTIN_PROFILES):每个 profile 定义maxDuration/recommendedDuration/aspects/exportWidth/fps/refModes(按优先级:referenceVideo/firstFrame/lastFrame/depthVideo/stills) /attachHint/adherenceClause。内置 Seedance 2.0、Veo 3.1、Kling 2.x、LTX 2.3、Wan 2.2 + 4 个图像 profile。含depthVideo的 profile 才会多出一个预接好的 ComfyUI workflow。确定性是硬规则:
state(t)是项目数据的纯函数,回放与导出共用同一个求值器;离线按精确 fps 步进渲染,无 wall-clock、无物理步进、无未存种子的随机(handheld 噪声把种子存进 shot)。同一个项目每次导出逐字节一致。项目格式 = 文件夹 + pretty-printed、stable-key-order JSON(
project.json/scenes/scene-01.json/scenes/scene-01/shots/1A.json),目标是可 diff、可分支、可在 GitHub 上 review。覆盖模型:Scene 拥有 blocking,Shot 拥有相机与时间。同一动作换五个角度拍不需要重新 blocking;shot 需要变体时可以 fork blocking。
marks 是唯一心智模型:相机与演员都“走到 marks”,路径可拖、可缓动、有 gait;带速度合理性告警(步速推出 6 m/s 就变黄提醒)。
真镜头数学:Super 16 / Super 35 / Full Frame / 65mm 传感器,焦距可逐 mark 打关键帧(推拉/眩晕变焦一键),焦点距离 + DOF 模糊使变焦对焦在参考视频里真的看得见;39 个经典机位运动、194 个角色动作、33 条动作路径。
Agent 可控:内置 MCP server,33 个工具(
get_state/add_entity/spawn_choreography/import_scan/apply_camera_move/screenshot等);app 向~/.config/blockout/control.json写版本化的 localhost-only 控制描述符。仓库同时带AGENTS.md/CLAUDE.md。参考摄入(与我们的反馈环相关,作者自己分了三期):V1 = 把已有视频(含 depth-map 视频)作为视口下的同步 ghost 参考,靠肉眼逐帧对齐;V2 = 跑本地姿态估计(MediaPipe/RTMPose 类)提取 2D/3D 骨架并重定向到人偶作为起点;V3 = 从参考视频解相机轨迹并提议相机 marks(标注 experimental)。USD 导出列为 later milestone。
Gaussian splat / 摄影测量扫描:可导入并在扫描里摆景,但作者明确写「Scans are an editor aid — they never touch the export.」
同一作者另有两个可拼接的工具:motion-previs-studio(把参考视频变成 pose / depth / 相机数据)与 stem-studio(分轨)。
对本项目的意义:
- 相同:窄工具、只做可读 blockout、多 pass 导出、面向多个下游、数据驱动 profile、确定性导出、项目即可 diff 的 JSON、MCP 驱动、agent 可读仓库。
- 它已解决而我们还没定的事:导出契约的具体字段(
refModes优先级、adherenceClause、metadata.json内容)、生成器 profile 的参数化方式、确定性渲染规则。 - 它没做的(也就是我们的空位):① 没有场景程序或参数化来源——项目 JSON 是手搭结果的快照,不是可重建的作者程序;② 没有逐帧相机 provenance 的显式概念(只有 marks/lenses/timings);③ 反馈是弱反馈——ghost 靠肉眼、相机解算标 experimental,没有自动回几何;④ 几何是程序化 capsule/低模,不是可混合层级的离散占用。
CineForge Previz(创剧)—— 同方向的中文独立项目
- 来源:Work-Fisher/cineforge-previz。核验状态:2026-09-25 已读仓库元数据与 README 全文(未运行)。
- 仓库:Godot Engine 4.7(GDScript);20 star / 4 fork;创建 2026-07-12,同日后再无推送;许可 CC BY-NC-SA 4.0(非商业),README 明确禁止商用、禁止改成 GPL、禁止抹署名。
- 定位(官方文案):「用白模快速把镜头、走位、群众规模、节奏定下来 —— 白模是「施工图」,AI 是「渲染」」。
- 功能:搭景(导入模型、基础几何体、打组/变换)、素体人偶 + 走/跑/跳(拉高关键帧自动蓄力跳)+ 群众阵列、虚拟相机(透视/二点透视、运镜、预制镜头)、关键帧时间轴、导出 JSON 工程 / PNG 截图 / H.264 MP4(自动补黑边到 16:9)。
- 分发:必须登录创剧账号才能使用;账号是项目数据与 AI 生态的入口(官网 cineforge.workfisher.cn)。
- 资产:
app/models/下大量 Kenney CC0 的 glb 建筑/家具。 - 对本项目的意义:
- 相同:白模定镜头/走位/规模/节奏,再交给即梦/Seedance;导出 JSON 工程 + MP4;Godot(MIT)作宿主,验证了「轻量引擎 + 脚本」这条路可行。
- 关键差异(三处,都对我们有利):① 账号绑定 + 非商业许可 —— 不是可自由集成的开源依赖;② 只活了一天就停止推送,无测试、无 CI、无设计文档,成熟度远低于 Blockout;③ 导出只有 JSON/PNG/MP4,没有 depth/normal pass,也没有生成器 profile,下游适配靠人工。
- 它的价值主要是市场信号:中文圈已有团队在做同一件事,而且选了 Godot;但它没有占据我们想占的「可重建程序 + provenance + 闭环」位置。
商业产品(均在争夺「blockout→video」入口)
| 产品 | 时间 | 形态 | 对本项目 |
|---|---|---|---|
| Higgsfield Blender 插件 / MCP | 2026-08-25 发布;higgsfield.ai | prompt→blockout、语言→相机动画、秒级 reblock;经 MCP 或 Supercomputer | 首个「第一方 previz 副驾」,说明「语言优先迭代 + 人工手改」成为主流交互。自述局限:云端锁定、demo≠可生产拓扑、无公开 benchmark |
| Autodesk Flow Studio(原 Wonder Studio) | 2026 在售;官方 | 3D Editor + Canvas 一体:世界生成/角色/mocap/相机动画 | 商业一体化 previs 方向;其 USD 场景导出(相机轨迹 + 角色 pass + 遮罩)与本项目 provenance 思路同构 |
| Mixar | 2026;官方博客 | Blender 内核 3D 编辑器;五种相机姿态即完整运镜;三 pass:beauty/clay/depth;adherence 保守/表现两档 | 「结构是作者的,表面是生成的」表述精准 |
| Flick | 2026-06;官方博客 | Blender → Nano Banana 首帧 → Seedance Omni Reference;进阶:depth/OpenPose/Canny → ControlNet → Wan 2.2 VACE | 工具链地图最全的一篇:明确 depth/pose/Canny 分工、toyxyz OpenPose rig、fSpy 相机匹配 |
| invideo | 2026-08-10 更新;官方 FAQ | blockout → Nano Banana Pro 上色 → Seedance 2.0/Kling 动画 | 量化自述:比纯 prompt 花更多 credits/时间换镜头级控制,但仍远低于传统 previs(「tens of thousands of dollars over weeks」);引用 r/comfyui 共识「plain blockout 优于精细人偶」 |
| SEELE 3D Greybox Previz | 2026;官方 | 自动生成灰盒 | 「灰盒先行再上色」已被产品化 |
英文创作者生态(YouTube / Reddit)
2026-09-25 检索补充。 这是 B 站那条线在英文世界的对应物。重要限定:检索工具对 YouTube 直抓只回 JS 壳,观看数/日期来自搜索索引快照,可能有数日误差;除个别条目外未取到评论区。下列条目为检索转述。
| 视频 / 频道 | 日期 | 工具链 | 可借之处 |
|---|---|---|---|
| ChatGPT 6 Astra is INSANE for 3D Previz (Blender to Seedance 2.5),JSFILMZ(123K subs) | 2026-09-09;链接 | Blender 5.2.1 + GPT-6 Astra + Higgsfield MCP/Supercomputer + Seedance 2.5 | 最直接的英文对标;作者自述失败模式:Seedance 几何「bleeding」(用网格贴图缓解)、相机滞后/裁切、需给角色脸部着色编码才能维持空间逻辑 |
| Seedance 2.5 + Blender Unlocks Cinematic AI Video Creation,AiRace(51.3K) | 2026-09-05;链接 | Claude → Blender → 3D previs → Higgsfield → Seedance 2.5 | 零基础用户的进入路径;强调「生成前锁定每个相机/角色/秒数」 |
| Stop Guessing Camera Moves in AI Video,Design Xstream(80K) | 2026-09-10;链接 | Blender + Higgsfield 插件 + Seedance 2.5 + 「3D Jutsu」浏览器 3D 建场 | 给出「纯 prompt vs 3D 引导」的对比方法论 |
| How to Control AI Video with Blender (2026),CGDive(97.4K) | 2026-09-12;链接 | Higgsfield Blender 插件(赞助)+ GPT-6 Astra | 作者自述结论:视觉参考的权重远大于文本 prompt;细节越模糊 AI 越会自行补全。赞助视频,成本段单列 |
| We Built a FREE AI Render Engine for CG & Facial Animation,Mickmumpitz(185K) | 2026-06-19;链接 | Blender 粗建 + 导出 depth/outline pass + FLUX 参考帧 + LTX-2.3 + 4K 放大;本地 RTX 5090 | 与本项目最接近的开源本地对照:结构由 3D 给、表面由 AI 给,全本地。NVIDIA 付费合作;需 5090 级算力 |
| Can this SOLVE control in AI VIDEOS?,Bad Decisions Studio(291K) | 2026-08-07;链接 | Autodesk Flow Studio + Seedance 2.5 + MiniMax H3 | 展示商业一体化 previs 工具;转录提到作者正在「vibe-coding 一个 Unreal 插件 + MCP + LLM 读图转 prompt」——正是自动描述层,当时未完成 |
| How to Make AI Videos with Seedance AI in 2026,AI Master(329K) | 约 2026-09(日期未证实);链接 | Seedance 2.5 + 3D blocking + 50 参考图 | 章节含「Blocking the scene in 3D」与专门的「诚实局限」段落 |
| How to Create a Professional AI Film,Curious Refuge(274K) | 2026-04-14;链接 | 脚本→视觉→剪辑全流程 | 英文世界「AI 电影学院」中心的机构级流程总览;3D previs 只是子话题 |
频道画像与一条反向结论:英文侧集中在 Blender + Higgsfield/MCP + Seedance 2.5 这一条商业栈,且 2026-08~09 集中爆发;开源本地线由 Mickmumpitz + ComfyUI + Wan VACE + LTX 主导。通用 AI 频道(Nate Herk 主做 n8n 自动化、AI Jason/bycloud 主做模型评测)没有这条主线——检索中「bycloud 3D blockout 平台」的说法疑似搜索摘要臆造,已排除。
Reddit 线索(r/comfyui / r/generativeAI / r/ClaudeCode,2026):
- 「Your Blender blockout for AI video can be embarrassingly simple」——生成起始帧 + 几个盒子 + 动画相机即可。
- 「The previz that matters for AI video is not one shot, it is the cut」——在同一场景 block 整段镜头串(走位/构图/镜头/运镜),直接对应本项目「连续运镜 + 显式切」。
- 有帖把 Blender MCP 建构图/相机 → 渲 previs → Seedance 的流程打包成可复用 skill,换概念复跑得同质结果——「skill 化」思路与本项目 SDK 目标一致。
- 上述均为社区帖,未核实全文,评论数据未取。
这一生态的共同局限(跨条目重复出现):几何 bleeding(Seedance)、相机滞后/裁切、多镜头一致性、云计费/credits 成本、依赖特定厂商、无 provenance、无自动回几何。
产品实践与仅指导性演示
| 平台 / 时间 | 来源 | 原记流程与研究用途 |
|---|---|---|
| updream 预演台,2026-08 | 介绍、补充、BAAI 转述 | 场景图→白模、走位轨迹、相机轨迹/look-at、录制参考;关注哪些状态能导出和改回 |
| LibTV,2026-06 | 产品介绍、聚合页 | 站位、预设动作、多机位、关键帧与画布;黑盒产品须看实际交换边界 |
| AniShort,2026-06-15 | 报道 | 3D 导演台输出镜头参考;“抽卡降 90%”仅宣传口径 |
| 天工 SkyProduction,2026-07-16 | 报道 | 全景、站位、分镜;与纯 T2V 资产编排交叉 |
| H3-World,2026-09-08 | 二手介绍 | 原记按键驱动移动与相机,需补官方权重/仓库,不把介绍当开源核验 |
仅指导性视频作为一组维护:updream 的 BV1Hx8u6GEyA(08-18)、BV1Rgbr6mENx(08-26)、BV1PT8g65Enj(2026,具体日期待补);LibTV 的 BV1FnT46FE3s(07-03);小云雀/导演台演示 BV1nhTW6REcF(07-03);agent+Blender 演示 BV1x7Yx6YEM6(09-09)。原记仅平台推广或官网入口,未取得可复用工作流。
原记 DeepWhite 全景实践(2026-09-02)通过可移动世界取景,再修复为参考图;作者承认清晰度/风格限制,评论给出 ml-sharp、comfyui-sharp、geometrypack、sharp-gui、postshot、superspl.at 等替代线索。这些工具名称尚未逐个绑定仓库与版本;下载入口归分镜报告。
四路线综述(2026-09-10)可作平台预演、Comfy 节点、Blender/agent、首尾帧的分类参考。原笔记先称“节点大量依赖逆向接口”再整体否定,两种泛化都删除;依赖须逐项目检查。Pixmax、MetaDig、万兴、Wemio/DaoAI 尚缺独立资料,只作为后续检索名称。
社区失败线索:用于设计实验
| 原记观察 | 相关 BV | 应如何使用 |
|---|---|---|
| 白模材质泄漏到输出 | BV1Rgbr6mENx | 分开指定外观与空间用途,测试提示是否有效 |
| 动作过度继承白模导致僵硬 | BV1PT8g65Enj、BV1RLeg6rEri | 对比仅参考位移/镜头与参考完整动作 |
| 视频参考计费更高,报告有 2–3 倍差异 | BV1PT8g65Enj、BV1Rgbr6mENx | 查询具体模型计费,比较总重试成本;不沿用倍率 |
| 复杂打斗和运镜最终仍需手调 | BV1x7Yx6YEM6 | 选择简单/复杂成对任务,记录编辑范围 |
| 轨迹只能在平面绘制、操控视角难跟随 | BV1Rgbr6mENx | 检查编辑器操作与代理表示分别缺什么 |
| “80% 稳定”“每镜 5–15 次” | BV1Rgbr6mENx、BV1PT8g65Enj | 样本、版本、成功定义未知,不能当验收基线 |
评论的点赞量表示关注度,不提高技术断言的可信度。“参考其实只是转提示词”是评论者猜测,不能据此描述模型内部机制。当前未恢复原始评论 JSON,以上是旧报告的转述。
学术路线:控制与跨镜一致性
| 工作 | 时间 / 来源 | 原记机制与可借部分 |
|---|---|---|
| One Sentence, One Drama | 2026-05-21,论文 | 全景→共享世界,首帧注册、轨迹锚定、机位过滤、人物对齐;研究跨镜状态如何复用 |
| InfiniVerse | 2026-06,论文 | 粗 occupancy 引导、生成帧反投影更新;需区分重建更新和用户可编辑的作者程序修订 |
| ORV | 原记 2026,项目 | 4D semantic occupancy 视频引导;驾驶/机器人域的结果不直接迁移到影视 |
| CameraAnything | 2026-07,论文 | 相机重拍;查条件表示和轨迹输入 |
| Beyond Inpainting | 2026-01,论文 | 点云/mesh→depth 与 occlusion mask;观察出画和遮挡的显式处理 |
| UniMoCa | 2026-08,论文 | 人体运动与相机视觉因子;查两类控制如何分离 |
| Geometry Forcing | 原记 2026,聚合页 | 几何特征对齐;需补论文原页 |
| FantasyWorld | ICLR 2026,PDF | 视频与 3D 联合预测;作为相邻路线 |
| WorldForge | 原记 CVPR 2026,旧笔记仅 awesome 提及 | 未定位独立 URL,暂列待查 |
InfiniCube(ICCV 2025)和 Blender/Comfy 教程(BV1McXEY6EQL,2025-03-18)仅作历史基线,保留原有入口,不扩展检索。
「几何/占用代理 → 渲染为对齐条件 → 视频扩散」这条学术主线
2026-09-25 检索补充。 机制上等价于「体素白模 → 视频」。检索转述,未读全文。
| 工作 | 时间 | 关键机制 | 对本项目 |
|---|---|---|---|
| InfiniVerse | arXiv v1 2026-06,v2 2026-08(ECCV workshop SPAD);论文 | 单帧多视图 → 重建 3D 占用(XCube,DINOv2+LSS 反投影条件化)→ 沿任意轨迹自回归扩展 → 视频扩散把粗占用译为视频;「sketch-and-refine」把生成视频反投影回占用做跨模态互增强 | ★ 占用→视频 + 占用↔视频互相精修,与本项目「先几何后外观」完全一致。局限:驾驶域;预印本未广泛复现;占用粗于美术体素 |
| SyntheOcc | 2024-10;论文 | 提出 3D semantic MPI 把体素占用编码为与 2D UNet 空间对齐的条件;可逐体素编辑占用状态与语义来控制生成图像/视频 | ★ 直接支持「手动编辑体素 → 改变生成画面」,正是本项目 authoring 目标;3D 语义 MPI 是体素→2D 条件的实用编码。局限:驾驶街景、MPI 深度歧义 |
| GEN3C | 2025(NVIDIA);项目 | 从图像构建近似 3D 缓存(点云),投影到目标相机轨迹作为条件,微调视频扩散;支持精确相机控制、物体移除、场景编辑 | ★ 与「几何代理(点云/体素)→ 投影 → 视频」同构;强调相机轨迹精确控制,契合本项目连续相机运动需求。局限:3D 缓存来自图像而非美术体素 |
| GenieDrive(OccDreamer + Video Dreamer) | CVPR 2026 / arXiv 2512.12751;论文 | OccDreamer 为状态转移模型:多粒度输入 → Occupancy DiT 生成 4D occupancy;Video Dreamer 用 ControlNet 式局部像素级对齐把占用转成语义 MPI,再驱动视频扩散 | ★「occupancy DiT + ControlNet 局部对齐」是可迁移架构;强调局部空间对齐优于全局 1D embedding。局限:驾驶域、重计算 |
| ORV(澄清) | arXiv 2025-06,CVPR 2026;仓库 | 不是「one-shot voxel reconstruction」:是机器人操作视频生成,用 4D 语义占用(chunked 稀疏占用)的 2D 渲染作软引导注入视频扩散;Action-Expert AdaLN 对齐动作 | 4D 占用引导 + 动作条件 + 多视图一致的视频生成;「占用渲染作软引导」手法可复用到场景动画。局限:机器人域 |
| Drive-Cascade | CVPR 2026 | 自回归「占用 → LiDAR → 视频」级联;Occ Dreamer 状态转移 + Video Dreamer 发射 | 占用为中心的多模态级联思路;驾驶域 |
| Gen3R | 2026-01-07 | 外观 + 几何共享潜空间联合生成;明确论证两阶段(先生成视频再喂 VGGT)会累积误差且「无反馈环」 | ★ 直接回答「视频反馈回几何」的必要性:研究已证明闭环必要。纯研究,未产品化 |
关于「体素白模 → 视频」的总结:学术上这条线已经成熟,但几乎全部集中在自动驾驶/机器人,用语义占用网格而非美术调色体素;没有面向艺术家创作的通用「体素白模 → 电影视频」学术系统。商业上 Seedance/Dreamina 页面宣传「3D Blockout to Video / White Model Workflow」,但属厂商营销页,无技术细节与可验证评测。公开可复现方案仍空白——这是本项目的机会窗口,但「空白」是有限检索的结果,不能写成「行业确无」。
程序化生成 + provenance + 闭环:三者尚未合成
2026-09-25 检索的一个明确判断:
- 创作者/YouTube 生态:基本没有闭环。 主流是「手搭/语言搭 blockout → 单次前馈到视频模型」,reblock 靠人工。未找到任何创作者频道做「视频→几何」自动反馈。
- 研究生态:三者都有人做,但分散——程序化生成(SceneCraft、SAGE、Code2Worlds 等,见场景构建);provenance 由法规倒逼(EU AI Act Art.50 与 California AI Transparency Act,2026-08-02 生效,要求嵌入来源元数据);视频↔几何闭环(Gen3R、DAIV/DAADiff/EvoWorld/Wanderland/Point4Cast 类,以及 Lyra 2.0)。
- 尚未有人把三者合成影视 previs 工具。最接近的开源工程是 Blockout(把视频含 depth ghost 回视口,弱反馈),最接近的学术对标是 PrevizWhiz(见相机报告)。
- 结论用法:可作为本项目定位的论据,但必须写成「本轮有限检索未发现」,不能写成「行业空白已被证明」。
下一步最有用的验证
选一个实际可运行接口,固定 prompt、外观参考、时长与版本,仅改变 proxy 的机位或主体路径,检查视频是否随之改变;再测首帧与视频参考的成本差异。记录输入视频/pass 编码、相机来源、失败片段和人工修订。
反馈回 proxy 的关键是把问题定位到对象、时间、视图和 revision。当前笔记未证明其他系统都缺这条闭环;应逐个查可编辑格式、API 和更新机制,避免把“没找到”写成“没有”。
维护记录
- 2026-09-24:删除重复平台/路线段;资产按实际获取状态整理;纠正模型硬锁定、行业唯一性、社区标准和 80% 验收的过度结论。
- 2026-09-25:新增三块联网检索内容——①西方平台 3D/相机输入能力对照(13 个平台)与下游计费一手线索;②「白模→视频」商业产品与开源工程(Blockout、Mixar、Flick、invideo、SEELE、Flow Studio、Higgsfield 插件)与英文创作者生态(YouTube 8 条 + Reddit);③「几何/占用代理 → 对齐条件 → 视频扩散」学术主线(InfiniVerse、SyntheOcc、GEN3C、GenieDrive、ORV 澄清、Drive-Cascade、Gen3R)与「程序化生成 + provenance + 闭环尚未合成」的判断。检索转述,未调用 API、未读论文全文、未取 YouTube 评论区。
- 2026-09-25(同日修订):按用户判定不录入世界模型路线(与本项目暂时不搭);仅保留其中与本环节直接相关的一条——Cosmos Transfer 作为控制 pass 消费方——写入控制接口一节。
- 2026-09-25(同日再修订):第一手读完 Blockout(README + DESIGN.md + generator-profiles.md + AGENTS.md + ROADMAP + 文件树 + GitHub API)与 CineForge(README + 元数据),并核实 Veo 官方 API 页;两条从「检索转述」升级为「原文已读」,补全导出包结构、generator profile 字段、确定性规则、项目 JSON 格式、参考摄入三期计划、MCP 工具数(33)与 CineForge 的账号绑定/许可/停止推送事实。新增 Gemini Omni Flash 作为默认视频模型的补充条目。