综合判断:怎样用这些资料推进创作闭环
用户的出发点已经很明确:下游视频模型展现出消费 3D 预演的能力,接下来要补足 agent 驱动的场景与剧本创作、可二次编辑的代理,以及视频反馈到代理修改的链路。因此本库的价值是找出可组合的资产和机制,为后续重构提供依据。
以下是对 2026-09-23 资料的整理性判断。本轮未重验外部来源;具体出处、获取状态和适用边界在各主题条目中。
值得优先吸收的模式
| 模式 | 依据条目 | 对完整闭环的用途 | 还不能据此得出的结论 |
|---|---|---|---|
| 简短意图逐步展开为可追踪产物 | drama-skills、OnlyShot、haya-hello | 剧本、角色、场景、分镜、视频提示有明确依赖;局部修改知道回到哪一步 | 必须采用相同文档数量、多个 agent 或固定审批链 |
| 先看便宜的中间态,再生成成品 | OnlyShot、故事板资产 | 先调整构图和镜头方案,减少昂贵生产中的无目标试错 | voxel 预演必然便宜、固定节省 18 倍、所有镜头都值得建模 |
| 场景程序输出实际可驱动结构 | Code-as-Room、SceneCode | 把对象、层级、部件和布局交给动作/相机;保留可修改来源 | 外部程序天然符合体素表示、编辑提交或 revision 契约 |
| 镜头规划和下游执行分开评价 | ShotVerse、OmniCam、UCPE | 定位失败发生在意图、轨迹还是视频生成 | 论文内部相机编码就是我们的 schema,或者模型消融能证明软件协议选择 |
| 明确每份参考的用途 | 提示指南、视频接口 | 外观、构图、运动、声音分开分配素材;减少错误继承 | 一句提示就能完全解耦控制,或者白模材质绝不会泄漏 |
| 时间线与模式路由显式化 | Comfy 导演台、纯 T2V 编排 | 关联素材时段、首尾帧、生成模式、重试与结果 | 一个 task_type 名称代表任意精确控制,或开源 workflow 已在本环境跑通 |
| 失败只修改必要范围 | haya-hello、skill 使用反馈 | 用“目标、现象、期望、保留项”表达返修;关联对象、镜头和来源 | 社区评论已经独立验证了某种修复机制 |
哪些问题值得拿资料来比较
意图到结构。 先看 AIPrompts 的真实模板、Code-as-Room 的阶段输入输出和 SceneCode 的部件表达。重点是完整动作/镜头意图如何影响资产与布局,而不是强迫所有任务写更长的计划。静态结构交接之后,运动阶段应能引用真实部件、pivot 和尺寸。
编辑到重建。 读公开工程时检查交付的是 prompt、像素、可编辑 scene,还是带参数的原始程序。可拖动对象、可导出 mesh、能从源码重建、能保留用户手工修改是不同能力,需要分别查明。未发现公开接口,不等于对方不存在这些能力。
代理到视频。 白模视频、首帧+运动参考、逐帧 depth/pose、显式相机参数各有输入语义。先取得实际接线,再判断哪个适合当前任务;不能把所有路线统称为逐帧硬控制。对修改后的轨迹是否被下游遵循,需看实际结果。
结果到修订。 InfiniVerse 的反投影更新、ReShot 的深度参考以及局部返修工作流提供相邻机制,但尚未组成我们要的整条作者闭环。应记录可迁移部分和缺口;有限检索不能证明“没有同类”或“我们唯一”。
重构前最有价值的几份材料
- drama-skills / OnlyShot / haya-hello:取得一条具体 brief→资产→镜头→返修的文件链,比较信息来源和重复维护成本。
- AIPrompts / DeepWhite / Comfy storyboard workflow:取得真实 prompt 或 JSON;看如何扩展短输入、给素材命名、规定镜头阅读顺序。
- Code-as-Room / SceneCode:阅读源程序与阶段交接;确认可动结构和局部修改如何表达。
- ShotVerse:核对相机表示、全局坐标、镜头边界和三种评价的原定义。
- ReShot / 一个 Comfy 时间线导演台:核对控制信号格式与最小接线,用一个明确的代理变化检查结果。
- tygg 影视 skill:取得实际包,比较文档加载、澄清次数、修改范围和上下文成本;评论只作为选题线索。
这是一份阅读优先级,不是新的实现或实验前置条件。
2026-09-25 补充:跨主题的三条判断
本轮联网检索(见维护与证据)新增三条跨主题判断。均为检索整理,不是独立复现。
| 判断 | 依据 | 用途 | 不能据此得出 |
|---|---|---|---|
| 控制 pass 是最可行的下游集成点 | 下游接口 · 控制信号(Cosmos Transfer 的 multi-ControlNet 接受 RGB/depth/seg/edge/blur) | 确定性渲染器输出 depth/seg/edge pass(自带逐帧相机 provenance)→ 条件式写实化 → 下游视频,不需中间世界模型 | 已验证该接线可用;或控制 pass 能替代显式场景程序 |
| 运动数据存在一条硬分水岭 | 运动 | 「给可复用运动数据」(Move JSON、MHR/FBX、SMPL)与「只给视频」(Act-Two、Kling、Wan-Animate)必须分开;后者不能作 AnimationTrack 输入 | 下游修饰动作等于我们得到可重定向运动 |
| USD 是唯一同时承载几何层级 + 相机光学 + 逐帧动画的开放交换格式 | 相机报告 · previs 工具 | 可作「场景 + 相机轨迹」的主交换格式候选;EDL/AAF 只承担切点/时长 | 传统分镜工具能当外部编辑器;或 USD 有原生体素图元 |
一个仍未解决的接口问题(本轮检索未能回答):外部资产与实拍重建的输出普遍是 mesh / 高斯 / 点云,未见带部件语义、层级、pivot/锚点与 rest pose 的通用导出。这直接关系到「资产能否携带可驱动结构」,仍属待解。
保留的研究问题
- 表达预算怎样在几何细节、独立部件、动作、镜头和生成成本之间分配?外部费用预算不能直接替代它。
- 哪些镜头只需静态参考,哪些值得使用整段代理视频?把上游生成/修订、人工编辑、参考计费和重试一起算,总成本是否下降?
- 人物骨架怎样简化为刚性部件而保留动作语义?下游对僵硬动作的修饰能力如何?
- 视频反馈能否稳定定位到对象、时间和视图,并保留无关手工修改?
需要避免的证据误用
评论的“80% 稳定”“5–15 次抽卡”缺少样本与成功定义,适合提示问题,不适合设验收阈值。故事板中草图较好的经验不能推出粗体素总优于细体素。产品页面和仓库名称也不能证明内部机制或兼容性。
外部流程中的确认、Hook、多 agent 和物理校验都是具体实现选择;吸收机制时仍遵循现有宿主授权、项目表示和任务边界。数值/来源/执行契约、代理表达质量和下游效果应分别验证。
维护记录
- 2026-09-24:从主题报告提炼阅读重点和可迁移机制;按整体闭环写启发,保留假设和证据边界,不宣称外部资产已复跑或行业空白已被证明。
- 2026-09-25:新增「跨主题的三条判断」(控制 pass 是最可行的下游集成点、运动数据分水岭、USD 作为唯一完整相机交换格式)与一个仍未解决的接口问题(资产不携带可驱动结构)。
- 2026-09-25(同日修订):删除已写入的「世界模型不构成替代路线」与「provenance 只有两条路径」两条判断;用户判定世界模型与本项目暂时不搭,不录入。保留其中唯一与本项目相关的「控制 pass 集成」一条。