Skip to content

A1. 意图扩充与表达预算 ​

研究入口 · 场景构建 · 分镜与相机

本环节关注 brief 如何展开为资产、场景、动作和镜头意图,以及如何限制生成成本而不丢掉核心表达。研究范围以 2026 年为主;下列时间和机制继承自 2026-09-23 笔记,本轮没有联网重验。来源性质不等于核验状态,详见维护与证据。

值得提取的工作流 ​

工作 / 时间 / 来源原笔记记录的机制对整体闭环的启发与限制
Agentic Iterative Refinement of Expanded Prompts,2026,技术披露brief 扩写 → 结构化 critique → 重写;逐镜列时长、景别、光色和声音将新增假设与原始要求分开;critique 应指向具体错误,不能自动变成长审批链
The Script is All You Need,2026-01,论文线索Scripter/Director/Critic,ScriptBench 与 Visual-Script Alignment剧本忠实度和视觉吸引力分别评估;论文的多 agent 分工不要求工程上建立多个服务
One Sentence, One Drama,2026-05-21,论文线索分层剧本、片段初始道具状态、reviewer、BGM/转场初始布局必须知道后续动作;生成后评审要能定位到镜头和对象
Structured-Prompt-Driven Development,原记 2026,工程文章结构化意图、约束与操作顺序可借结构化需求,不能把作者程序、用户意图和生成计划合成一份权威
长时程规划综述,2026-05-14目标分解、依赖、记忆与局部重规划对资产→结构→驱动的依赖有参考价值;通用 agent 运行时由宿主承担
Building AI Video Agents,2026,工程指南planning / generation / evaluation规划、执行、评价职责可分;不是三套基础设施的依据
Seedance 提示指南 / fal 指南,原记 2026-07主体、动作、环境、镜头、声音;参考角色、时间戳、end state可提取参考用途和结束状态的词表;这两个链接是第三方指南,不能标作字节官方规范

可参考的 prompt 与 skill 资产 ​

AIPrompts:中文剧本、角色和分镜模板 ​

  • 来源:fenggeliaoai/AIPrompts,原记 2026-01 起;资产形态为文本模板,内容本轮未下载。
  • 原笔记列出 剧本-1214.txt、角色表-1214.txt、角色生成-测试版.txt、分镜正式版.txt、多人对话分镜、爆款开头、图片参考词等模板。
  • 可提取:角色标识、外观描述的稳定区块、镜头输出字段和声音描述;保留用户简短意图到完整分镜的中间步骤。
  • 复用前需核对:原笔记同时记有 GPL-3.0 和部分原作者“勿商用”,不能据此直接认定所有模板可复制使用。

OnlyShot:预算与失败经验 ​

  • 来源:A-cat-with-carrots/OnlyShot,原记 2026-05、含 v0.3.0/v0.6.1 记录;资产为 skill、脚本和 troubleshooting。
  • 原记机制:先生成分镜图再出视频,保留模式及首尾帧路径,按阶段生产;失败经验附版本、模型、样本数和适用条件。完整编排见纯 text → video。
  • 原记成本:分镜图 3 积分、视频重生 55 积分,约 18 倍差异。这是该工作流的作者报告,不证明 voxel 预演必然节省同样成本。
  • 可提取:便宜中间态的总成本核算;失败清单写明复现条件,避免把单次观察变成普遍规则。

tygg-ai-film-studio:coding-agent 影视 skill 对照 ​

  • 来源:BV1RLeg6rEri,2026-09-19;百度网盘,提取码 rtun。
  • 原记形态:Codex skill + Blender + Hyper3D MCP,生成白模预演。已记录公开领取地址,包内容、版本、许可和可运行性未核验。
  • 原记评论集中批评:reference 太密、上下文过载、防御性澄清、阶段门禁拖慢试错,以及资产管理不足。也有评论质疑效果来自模型还是 skill。
  • 可提取:按需读取和快速修订应通过实际任务评估;比较同模型有/无 skill 的结果。评论反映使用感受,不等同于独立代码审查。

7 套 AI 电影 Skill 汉化包 ​

  • 来源:BV1FNhc6mEjz,2026-08-27;飞书入口,往期视频。
  • 原记包含剧本到视频提示词及“四轨路由”;页面访问权限、实际目录和原作者授权待查。
  • 可提取:路由如何按当前创作步骤选择提示材料,优先看真实模板而不是包名。

AI 导演工作流 3+2:私信领取条目 ​

  • 来源:BV1SJbr6rEUR / BV1zKgj6zEGj,原调查 2026-09-23,发布日期待补。
  • 领取方式:三连/后台留言;原记评论称体验版不完整,完整版需付费。保留为独立资产线索,状态是“私信可询、未获取”,不是“已开源”。
  • 可提取:需区分模板、可执行工具、付费课程和依赖平台,取得包后再比较能力。

身份与参考用途 ​

Elser 一致性指南、创作者 SOP 与 AIGC 教程(原记均为 2026)提供身份区块、参考图、后置校验的组合思路。角色脸、服装和风格可相对稳定,动作、地点与镜头按片段变化。

这些是参考用途分配的素材。原笔记中的“10 张角色卡”“人脸阈值 0.85”“LoRA 约 ¥80”不是通用配置;人脸相似度也不能类比为 lattice 合法性那样的确定性证明。

表达预算:可借原则,尚无直接映射 ​

本轮材料更多谈费用、时延、候选数量和重试,而不是几何、控制部件、动作、相机共同组成的表达预算。Forasoft 和 预算文章(原记 2026)作为背景保留;有限检索不足以证明“没有相关研究”或“本项目首创”。

值得继续验证的是:粗代理是否降低总成本(上游生成、修订、人工、参考输入计费、下游重试一起算);减少几何细节与减少独立动作自由度的影响是否不同。

2026-09-25 检索补充的成本线索(社区自述,未验证,细节见纯 T2V 报告):

  • 抽卡次数与总成本的敏感度:卖方研报引厂商 CEO 称单镜抽卡可达 7 次,测算「抽卡频率降至 75% 省约 5% 总成本;降至 50% 令每秒生成成本降 37%」。这是行业侧口径,不是独立复现。
  • 参考图数量不是线性成本:创作者自述「两张图的工作量常常是三倍往上」,并有教程称参考图过多使一致性成本呈指数增长。这对「每份参考的用途必须明确」提供了成本侧理由,但不支持具体倍率。
  • 本地 vs 云端的时间成本反转:本地 ComfyUI 跑 7 秒 608×352/16 帧/8 步约 6 分钟,而云端抽卡按秒计费。两者不是同一类预算,不能直接比较。
  • 平台计费可被单方面变更:即梦官方通知把 15 秒视频的积分从 30 改到 75(fast)/ 45 改到 120(标准),并提前结束四折优惠。下游成本不能作为长期预算常量,表达预算不应写成固定货币额度。

后续阅读与验证 ​

先取 AIPrompts/OnlyShot 的具体模板,再取 tygg 的实际 skill 包;记录版本、输入、输出、修改一镜时的影响范围。外部“每批确认”流程可作为付费生产的设计选项,授权与权限仍由宿主和用户决定,不移植成每次 build/render 的必经门禁。

其他商业编排、drama-skills、Hook 教程归纯 text → video。旧版本由 Git 保存;不以历史数字代替当前核验。

维护记录 ​

  • 2026-09-24:按方法、具体资产、参考用途和预算问题重写;保留私信领取线索,取消普遍确认闸门与成本外推。
  • 2026-09-25:在表达预算下补充 2026-09-25 检索到的成本线索(抽卡敏感度、参考图边际成本、本地/云端时间成本、平台计费可单方面变更),细节归纯 T2V 报告;重申下游成本不应作为固定货币额度。