Skip to content

综合判断:怎样用这些资料推进创作闭环 ​

研究入口

用户的出发点已经很明确:下游视频模型展现出消费 3D 预演的能力,接下来要补足 agent 驱动的场景与剧本创作、可二次编辑的代理,以及视频反馈到代理修改的链路。因此本库的价值是找出可组合的资产和机制,为后续重构提供依据。

以下是对 2026-09-23 资料的整理性判断。本轮未重验外部来源;具体出处、获取状态和适用边界在各主题条目中。

值得优先吸收的模式 ​

模式依据条目对完整闭环的用途还不能据此得出的结论
简短意图逐步展开为可追踪产物drama-skills、OnlyShot、haya-hello剧本、角色、场景、分镜、视频提示有明确依赖;局部修改知道回到哪一步必须采用相同文档数量、多个 agent 或固定审批链
先看便宜的中间态,再生成成品OnlyShot、故事板资产先调整构图和镜头方案,减少昂贵生产中的无目标试错voxel 预演必然便宜、固定节省 18 倍、所有镜头都值得建模
场景程序输出实际可驱动结构Code-as-Room、SceneCode把对象、层级、部件和布局交给动作/相机;保留可修改来源外部程序天然符合体素表示、编辑提交或 revision 契约
镜头规划和下游执行分开评价ShotVerse、OmniCam、UCPE定位失败发生在意图、轨迹还是视频生成论文内部相机编码就是我们的 schema,或者模型消融能证明软件协议选择
明确每份参考的用途提示指南、视频接口外观、构图、运动、声音分开分配素材;减少错误继承一句提示就能完全解耦控制,或者白模材质绝不会泄漏
时间线与模式路由显式化Comfy 导演台、纯 T2V 编排关联素材时段、首尾帧、生成模式、重试与结果一个 task_type 名称代表任意精确控制,或开源 workflow 已在本环境跑通
失败只修改必要范围haya-hello、skill 使用反馈用“目标、现象、期望、保留项”表达返修;关联对象、镜头和来源社区评论已经独立验证了某种修复机制

哪些问题值得拿资料来比较 ​

意图到结构。 先看 AIPrompts 的真实模板、Code-as-Room 的阶段输入输出和 SceneCode 的部件表达。重点是完整动作/镜头意图如何影响资产与布局,而不是强迫所有任务写更长的计划。静态结构交接之后,运动阶段应能引用真实部件、pivot 和尺寸。

编辑到重建。 读公开工程时检查交付的是 prompt、像素、可编辑 scene,还是带参数的原始程序。可拖动对象、可导出 mesh、能从源码重建、能保留用户手工修改是不同能力,需要分别查明。未发现公开接口,不等于对方不存在这些能力。

代理到视频。 白模视频、首帧+运动参考、逐帧 depth/pose、显式相机参数各有输入语义。先取得实际接线,再判断哪个适合当前任务;不能把所有路线统称为逐帧硬控制。对修改后的轨迹是否被下游遵循,需看实际结果。

结果到修订。 InfiniVerse 的反投影更新、ReShot 的深度参考以及局部返修工作流提供相邻机制,但尚未组成我们要的整条作者闭环。应记录可迁移部分和缺口;有限检索不能证明“没有同类”或“我们唯一”。

重构前最有价值的几份材料 ​

  1. drama-skills / OnlyShot / haya-hello:取得一条具体 brief→资产→镜头→返修的文件链,比较信息来源和重复维护成本。
  2. AIPrompts / DeepWhite / Comfy storyboard workflow:取得真实 prompt 或 JSON;看如何扩展短输入、给素材命名、规定镜头阅读顺序。
  3. Code-as-Room / SceneCode:阅读源程序与阶段交接;确认可动结构和局部修改如何表达。
  4. ShotVerse:核对相机表示、全局坐标、镜头边界和三种评价的原定义。
  5. ReShot / 一个 Comfy 时间线导演台:核对控制信号格式与最小接线,用一个明确的代理变化检查结果。
  6. tygg 影视 skill:取得实际包,比较文档加载、澄清次数、修改范围和上下文成本;评论只作为选题线索。

这是一份阅读优先级,不是新的实现或实验前置条件。

2026-09-25 补充:跨主题的三条判断 ​

本轮联网检索(见维护与证据)新增三条跨主题判断。均为检索整理,不是独立复现。

判断依据用途不能据此得出
控制 pass 是最可行的下游集成点下游接口 · 控制信号(Cosmos Transfer 的 multi-ControlNet 接受 RGB/depth/seg/edge/blur)确定性渲染器输出 depth/seg/edge pass(自带逐帧相机 provenance)→ 条件式写实化 → 下游视频,不需中间世界模型已验证该接线可用;或控制 pass 能替代显式场景程序
运动数据存在一条硬分水岭运动「给可复用运动数据」(Move JSON、MHR/FBX、SMPL)与「只给视频」(Act-Two、Kling、Wan-Animate)必须分开;后者不能作 AnimationTrack 输入下游修饰动作等于我们得到可重定向运动
USD 是唯一同时承载几何层级 + 相机光学 + 逐帧动画的开放交换格式相机报告 · previs 工具可作「场景 + 相机轨迹」的主交换格式候选;EDL/AAF 只承担切点/时长传统分镜工具能当外部编辑器;或 USD 有原生体素图元

一个仍未解决的接口问题(本轮检索未能回答):外部资产与实拍重建的输出普遍是 mesh / 高斯 / 点云,未见带部件语义、层级、pivot/锚点与 rest pose 的通用导出。这直接关系到「资产能否携带可驱动结构」,仍属待解。

保留的研究问题 ​

  • 表达预算怎样在几何细节、独立部件、动作、镜头和生成成本之间分配?外部费用预算不能直接替代它。
  • 哪些镜头只需静态参考,哪些值得使用整段代理视频?把上游生成/修订、人工编辑、参考计费和重试一起算,总成本是否下降?
  • 人物骨架怎样简化为刚性部件而保留动作语义?下游对僵硬动作的修饰能力如何?
  • 视频反馈能否稳定定位到对象、时间和视图,并保留无关手工修改?

需要避免的证据误用 ​

评论的“80% 稳定”“5–15 次抽卡”缺少样本与成功定义,适合提示问题,不适合设验收阈值。故事板中草图较好的经验不能推出粗体素总优于细体素。产品页面和仓库名称也不能证明内部机制或兼容性。

外部流程中的确认、Hook、多 agent 和物理校验都是具体实现选择;吸收机制时仍遵循现有宿主授权、项目表示和任务边界。数值/来源/执行契约、代理表达质量和下游效果应分别验证。

维护记录 ​

  • 2026-09-24:从主题报告提炼阅读重点和可迁移机制;按整体闭环写启发,保留假设和证据边界,不宣称外部资产已复跑或行业空白已被证明。
  • 2026-09-25:新增「跨主题的三条判断」(控制 pass 是最可行的下游集成点、运动数据分水岭、USD 作为唯一完整相机交换格式)与一个仍未解决的接口问题(资产不携带可驱动结构)。
  • 2026-09-25(同日修订):删除已写入的「世界模型不构成替代路线」与「provenance 只有两条路径」两条判断;用户判定世界模型与本项目暂时不搭,不录入。保留其中唯一与本项目相关的「控制 pass 集成」一条。