Skip to content

外部创作工作流研究库 ​

本目录服务于整条 text/image → 可编辑 3D proxy → video → 反馈修订 创作闭环,供重构、工作流组合和持续跟进使用。近期阅读重点是 agent 驱动的代理构建,但纯 text → video 的提示词、资产组织、分镜和生产顺序同样重要。

研究资料不替代项目设计,也不自动增加实现任务或宿主权限规则。

管线划分与闭环 ​

研究按三条线组织,其中 A 按创作环节细分:

text
A. text/image → 3D proxy
   ├─ A1. 意图扩充与表达预算
   ├─ A2. 资产生成(占位,暂不重复调研)
   ├─ A3. 场景构建
   └─ A4. 驱动剧本
       ├─ A4a. 人物与物体运动
       └─ A4b. 分镜与相机轨迹

B. 3D proxy → video
   └─ 白模视频、参考帧、控制 passes、相机/几何条件的下游消费

C. 纯 text → video
   └─ 剧本、参考资产、分镜、提示词、分段生产、剪辑与返修

A → B 是代理创作主线;C 是并行研究的现有创作路线,其提示词、资产组织、编排和返修方式可以被吸收到整体闭环中。A2 保留资产接口位置,按既定范围不重复课题组已有的资产生成调研。

目标闭环是:

text
意图 → 代理构建与驱动 → 预览/人工编辑 → 下游视频
          ↑                              │
          └── 根据视频反馈修改对象、动作或镜头 ──┘

这描述研究目标,不表示整条反馈链已经实现。反馈修订横跨 A/B/C,相关机制与案例写在各自主题下。

A1–A4 是研究主题划分,不规定独立服务、模型调用次数或强制执行顺序。项目的两阶段 authoring 仍是:先建立静态可驱动结构,再在实际结构上生成对象与相机驱动;两阶段都读取完整已知意图。分镜意图可以先影响场景构造,执行轨迹则需要结合实际结构。

文件架构与内容归属 ​

text
docs/research/
├── README.md                         # 总入口:管线、结构、阅读导航
├── 00-synthesis.md                   # 跨主题综合判断与优先阅读方向
├── text-to-3d-proxy/                 # A. 上游代理创作
│   ├── README.md                    # 上游主题导航
│   ├── 01-intent-and-budget.md       # A1. 意图、预算、prompt/skill
│   ├── 02-asset-generation.md        # A2. 资产接口占位
│   ├── 03-scene-construction.md      # A3. 布局、层级、场景程序与交接
│   ├── 04-motion.md                  # A4a. 对象/人物运动与适配
│   └── 05-storyboard-and-camera.md   # A4b. 分镜模板、故事板、相机轨迹
├── proxy-to-video.md                 # B. 下游控制接口、导演台与接线
├── text-to-video.md                  # C. 纯 T2V 编排与生产资产
├── 06-assets-and-watchlist.md        # 按问题选材的导航与跟踪重点
└── 07-sources-and-evidence.md        # 维护方法、核验状态与证据缺口

主题报告拥有具体条目的来源、下载方式、机制、启发与限制。例如 AIPrompts 和 tygg skill 归意图扩充,Code-as-Room 归场景构建,HY-Motion 归运动,ShotVerse 和故事板工作流归分镜/相机,ReShot 与下游导演台归 proxy → video,drama-skills 的生产编排归纯 T2V。

跨主题相关内容通过链接互相引用,避免重复维护整段条目。综合判断负责提炼共性;资产导航只负责定位;维护与证据页负责更新方法和待核对项。B 站、GitHub、网盘、飞书等是来源渠道,不另建创作者生态分类。

阅读入口 ​

要解决的问题阅读
这批资料能支持哪些判断,哪些还只是设想?综合判断
如何从简单 brief 扩充意图、预算与参考用途?A1 意图与预算
资产怎样进入场景?A2 资产接口占位;按用户要求不重复调研资产生成
agent 怎样构造可驱动、可修改的结构?A3 场景构建
怎样生成对象与部件运动?A4a 运动
怎样编排镜头和相机,哪里有分镜模板?A4b 分镜与相机
下游吃什么控制信号,哪里有导演台和接线?B proxy → video
无 proxy 的成熟流程有哪些可借部分?C text → video
想按阅读问题快速选一个资产资产导航与跟踪
后续如何更新、记录获取状态和核验事实?维护与证据

上游整体导航见 text → 3D proxy。

研究范围与时间 ​

  • 资料来自 2026-09-23 的 agent-driven research;2026-09-24 做内容清理和重写(未联网);2026-09-25 做第二轮联网检索,覆盖之前未调查过的平台(西方视频平台、专业 previs 工具、运动驱动平台、体素工具与格式、3D 采集重建、开发者社区),见维护与证据。
  • 优先 2026 年工作。此前已收集的少量旧作保留为背景;2026 会议收录与 2026 实质更新分开写,不能仅凭会议年份认定能力更新。
  • 每条尽量保留具体时间和 URL;无法确认发布日期时写“原调查日期 / 发布日期待补”,不把调查日冒充发布日期。
  • 旧报告和修改差异由 Git 保存,不另外建立历史备份目录。

当前材料能核验到哪一步 ​

这轮完整读取了指定会话的八次用户输入,确认了管线划分、整体闭环视角、2026 优先、资产生成暂不调研、资产按主题归属以及私信领取也作为独立线索等要求。

原报告声称保存了 evidence/bilibili-3d-proxy-bv-2026-09-23.json,但当前工作树没有该文件或目录。文中的 B 站评论、仓库元数据和下载内容因此标作历史记录或待核验;“有链接”“已获取”“已读源码”“已运行”不混用。论文和官方页面也只有在核对具体内容后才支持相应断言。

本轮维护记录 ​

  • 2026-09-23:建立初始主题报告与来源集合。
  • 2026-09-24:保留三段管线及上游细分,重写七份报告;去除重复、校正资产归属、区分观察与推断,增加综合入口和维护方式;原始版本由 Git 管理。
  • 2026-09-24:补充完整管线图、目标闭环、研究划分与两阶段 authoring 的关系,以及文件树和内容归属,使入口文档可独立说明研究库结构。
  • 2026-09-25:第二轮联网检索,按归属写入各主题报告:A2 实拍/单图→几何与体素化、A3 体素工具格式、A4a 运动驱动平台与人体表示、A4b 专业 previs 工具与 USD/EDL/AAF、B 西方平台能力对照与白模→视频产品与英文生态、C 开发者社区成本证据;新增综合判断三条跨主题结论、资产导航 选材与 7 项优先阅读、维护与证据 本轮方法与待核对项。
  • 2026-09-25(同日修订):按用户判定删除世界模型相关条目(世界模型与本项目暂时不搭);保留体素格式与工具(用户认为相关,已有调研但与本轮不冲突)。