C. 纯 text → video:可复用的工作流与资产
这条路线对整体闭环的价值在于:简短 brief 怎样变成剧本和资产,提示词如何分工,生产按什么顺序执行,失败如何局部修订。它不因为没有 3D proxy 就失去参考意义。下列时间与内容继承自 2026-09-23 笔记,本轮未克隆或复跑。
共同的流程骨架
brief / 原著 → 故事与分集 → 人物、场景、道具决策
→ 参考资产 → 分镜与关键帧 → 视频提示与模式选择
→ 分段生产 → 剪辑、声音与审查 → 局部返修这是一种跨样本归纳,不是已证明的行业标准。步骤可以交错;局部改镜头未必需要重新做角色资产;有些实现会在付费生产前要求确认,有些支持预授权的批量执行。
优先读的编排资产
drama-skills
- 时间与来源:原记活跃至 2026-09-18;zenstory-ai/drama-skills。资产为 skill、创作文件和校验脚本,实际版本待固定。
- 原记结构:原著→分集→视觉设定→图片提示/分镜→视频提示→生产→剪辑→审查;五份 Markdown 和剪辑单记录创作事实。
- 值得提取:连续性锁、
IMG-* / PLAN-* / REF-*的状态/来源区分、准确生产参数、字幕与剧本引用、局部返修和机械检查。旧笔记另记两遍 EBU R128,可作为音频交付线索。 - 适用边界:不直接采用其文档数量或 ID 前缀;先检查哪些信息真实消除歧义、哪些只是重复。确认策略由实际授权和调用方负责。
OnlyShot
- 时间与来源:原记 2026-05;仓库。
- 原记结构:创作/设定/reference → 分镜图候选 → 按模式生成视频 → 人工剪辑;脚本包含 ref 完备性检查、分镜图和分集视频生成。
- 可提取字段:
video_mode、first_frame_path、last_frame_path、multiframe_paths,用于明确实际素材和模型模式的关系。 - 值得比较:修改静态关键帧是否减少昂贵重试;自动路由是否可覆写;失败能否从文件续跑。旧笔记中的 80%/10% 等模式比例不作默认配置。
- 成本与信度材料归意图/预算。
oh-my-minimaxh3-director
- 时间与来源:原记 2026,发布日期待补;仓库。
- 原记结构:剧本→需求→衔接分镜→人物多视图→H3 提示→Ref2VA/T2V/I2V 路由→参数表→批量提交/续跑→剪映草稿。
- 可借:后端模式怎样依赖素材,断点如何记录,生产前有哪些可检查输入。
- 边界:GPU 监控、无人值守、provider 调度属于该系统实现,不意味着代理 authoring 项目应另建宿主运行时。
AI-real-person-short-drama-workflow
- 时间与来源:2026-08-06;haya-hello 仓库。
- 原记定位:模型无关的导演提示工作流;站位连镜、道具稳定、表演触发、局部返修。
- 可提取返修格式:出错镜头 / 错误现象 / 期望效果 / 必须保留项;默认只改受影响镜头及必要邻接镜头。
- 对闭环:同一种反馈格式可指向像素片段、proxy 对象或相机段,但需要显式基线,不能只用“上一版”这样的隐含引用。
ComfyUI-Seedance:素材库与 provider 选择
- 时间与来源:原记 2026-06;仓库。
- 原记节点:Prompt Builder、Mood Anchor Preset、Style Template、Cast Loader/Scanner/Saver、Provider Registry;目录提到 Anchor-Point 方法。
- 可借:角色素材和全局风格的复用、提示构建、后端替换。
- 边界:Anchor-Point 是该项目的组织名称,不等于几何 pivot/anchor;“同一接口”是否真能覆盖不同模型的条件语义需逐一核验。
中文创作者的领取型资产
AI 小说短剧自动化工作流
- 来源:BV1JC9oBZE7W,2026-05-03,梦婆糖_。
- 获取方式:原记三连、评论 666、私信领取;没有公开下载 URL,状态为“未取得”。按用户原始要求保留为独立资产 entry,不标作开源或已运行。
- 作者自述:小说→旁白/字幕/分镜表/Flux 提示→ComfyUI API 批量出图;图生视频与拼接属于规划,不写成已经跑通。
- 可借:声音、字幕、分镜的共同来源;API 批处理如何保留输入与结果映射。
ComfyUI+AI 短剧精通教程资料
- 来源:BV1DCQiBnEd7,原调查 2026-09-23,发布日期待补。
- 获取方式:三连/后台领取;旧记录未取得文件或目录。作为待取资产线索,价值需在拿到 workflow 后判断。
ComfyUI 视频全集整合包
- 来源:BV1csMx6hEPK,原调查 2026-09-23;置顶专栏。
- 获取方式:专栏列资料类别,未记录直接文件。需确认资产地址、节点依赖和授权,不用教程标题代替能力。
AI 短剧制作工作流教程
- 来源:BV14UdmBnEGa,标题称 2026,发布日期待补;专栏。
- 获取方式:专栏/私信;原评论反馈自动回复链接失效。保留入口,标记未取得。
多主体一致性工作流
- 来源:BV1E7XfBhExS,原调查 2026-09-23,发布日期待补。
- 获取方式:原记“666/关注自动领取”,未取得公开 workflow。未来优先查角色引用和不同主体的控制范围。
LTX / MiniMax / 首尾帧整合包
- 来源:BV1S48b6GEvr,原调查 2026-09-23,发布日期待补。
- 获取方式:原记评论 666;包和许可未取得。需固定模型、节点和工作流版本才有复用价值。
只有指导、未记录可领取资产的线索:BV1uQNFzjEXe 的 Wan2.2 角色一致性教学,以及 OpenClaw+n8n 演示、ComfyUI+Seedance 自动化演示(均原调查 2026-09-23,发布日期/实际附件待补),合并作为指导性条目。观察步骤拆分,不宣称已获得它们的资产。
影视 skill 包归意图/预算,宫格 prompt/workflow 归分镜与相机,3D 导演台节点归proxy → video。
可浏览的工程实现
以下是已有地址的比较对象;机制均为旧笔记摘要,不是本轮源码审查结论。
| 项目 | 原记时间 | 关注的工程点 |
|---|---|---|
| Moyin Creator | 2026-04 | 剧本、角色、场景、分镜、成片的批处理与共享参考 |
| huobao-drama | 2026 | 文案到 TTS/视频/字幕/合成的依赖链 |
| waoowaoo | 2026 | 网文实体、场景和剧情节点提取;旧笔记项目拼写不一,以仓库为准 |
| BigBanana AI Director | 2026-09 | Script-to-Asset-to-Keyframe 的产物交接 |
| Open-AI-Micro-Drama-Generator | 2026-08 | 编剧、分镜、图片和视频的分工 |
| aid-server | 2026-09 | 多模型生产、素材管理与任务调度;与代理工具边界不同 |
| super_gen | 2026-09 | @ 素材引用、节点画布与剪辑 |
| suihe1/short-drama-production | 2026 | 总控与粗剪 QC |
| Hao0321/ai-short-drama | 2026-08 | continuity、validation、resumable workflows |
| Dramake | 2026-08 | skill 编排 |
| codex-short-drama-pipeline-skill | 2026-07 | Codex 接入与阶段产物 |
| Standed/Seedance2.5 / ai-short-drama-skills | 2026-07 / 09 | 特定模型指南与通用分工的分离 |
冰河分镜工厂文章(原记 2026)介绍总编剧、视觉、美术和场记分工;Hook 教程(2026-05-13)强调用脚本约束执行。可借鉴职责与确定性检查,不把“必须多 agent”“必须 Hook”当通则。
Prompt 管理节点与分享渠道
| 资产 | 原记时间 | 参考用途 |
|---|---|---|
| ComfyUI-prompt-storage | 2026 | TXT/JSON/MD 模板保存与选择 |
| Prompt-Iterator | 2026 | 逐行批处理、模板填值和计数 |
| AF-Pack-Prompt-Nodes | 2026 | LLM 提示、人工编辑、历史回载 |
| comfyui-jsonprompt | 2026 | 结构化字段到模型提示 |
Comfyui-ergouzi-Nodes 在原笔记只有名称,无确定 URL,留作待定位线索。
发现渠道(原调查 2026-09-23):Comfy workflows、OpenArt、ComfyWorkflows、RunComfy、官方示例、GitHub workflow topic、短剧 topic。站点上架不代表本地可运行,也不沿用“免费”“流量最高”等旧宣传。
未验下载入口:短剧 workflow 合集、Dify+ComfyUI 汇总、飞书聚合一、聚合二。缺明确作品、版本和许可,先作为发现入口保留。
商业与生产复盘
| 来源 | 原记时间 | 能借的流程 / 证据限度 |
|---|---|---|
| 巨日禄横评 | 2026-09-11 | 生成、审片、重抽与剪辑串联;角色统一度和费用属报道/宣传 |
| RHSTORY | 2026-08-03 | 剧本拆解、全景影棚、制片管理 |
| 天工 | 2026-07-16 | 资产与相邻镜头站位图;3D 部分见下游报告 |
| Pixmax | 2026 | 工作台入口,能力版本需核对 |
| 45 天 320 集案例 | 原记 2026 | 角色卡/reference/LoRA、分镜 JSON、节奏和成本;一致率 41→74→96% 等未经独立复现 |
| 短剧全流程拆解 | 原记 2026 | JSON 输出和镜头节奏;创作者投入比例不作普遍预算 |
这些材料没有公开某种接口,不代表它们一定没有可编辑来源或反馈能力。尚未取得准确出处的 Seko、Jellyfish、Toonflow、drama-workshop、剧流 Studio 和 OneClickStudio 仅保留名称作检索线索,不据此排名。
开发者社区的可控性与成本证据
2026-09-25 检索补充。 目标是找到「视频本身不会说」的信息:真实成本数字、失败原因、API 限制、平台涨价,以及工程师对可控性的技术性批评。检索限制:HN Algolia / Stack Exchange / 掘金站内 API 在本环境多次超时,部分条目依赖搜索代理摘要;日期由页面「X months ago」换算,非精确日期。所有数字均为社区自述,未验证。
「必须用 3D 才能真可控」:社区论证
社区主流(非绝对)观点是 3D blockout + 相机路径是目前最可靠的控制面,但不能推出「绝对必须 3D」:
- HN 帖 All AI Videos Are Harmful(约 2026-01,317 points / 321 评论):「Current diffusion models make these thousands of decisions for you based on what usually looks good… Right now we have randomization, not democratization.」另一条:「Until we solve reliable latent space control (something like ControlNet, but for video and on steroids), AI video will remain a tool for generating digital noise, not cinema.」——本轮最强「可控性 = 电影前提」的论证。
- HN Sora 2 发布讨论(约 2025-11,905 points):the_duke「Generated videos are very short, with minimal controls. The only selectable option is picking between landscape and portrait mode.」;dvngnt_「After using Wan with comfyui, im uninterested in closed platforms. they lack the amount of control even if the quality might be better.」——两位均为一手对比。
- HN GPT Image 1.5(约 2026-01):echelon「Nano Banana models take the low-fidelity previz elements/stand-ins and unfortunately keep the elements in place without attempting to 'upscale' them… Gpt-image-1 understands the layout and blocking of the scene, the pose of human characters, and will literally repair and upscale everything.」并提议用 Blender 程序化 previz + 角色参考图做 benchmark。直接支撑「3D 白模→风格化」路线,且是作者附自测样例的一手实验。
- 反方/边界:同帖称「barely any 3D at all」(几个 box + 相机动画即可);echelon 认为 Sora 2 有「internal storytelling」能自行补足部分控制。因此可支撑「3D 预演是当前最可靠的控制接口」,不能支撑「绝对必须 3D」。
「参考机制是假的」:应降级为「不可靠」
未检索到可信的、明确声称「参考机制是假的」的开发者论证。现有技术批评实际指向:
- 参考/条件机制在跨镜头不继承身份;一致性是「设置问题」而非提示词技巧,措辞微调即漂移。
- Stack Overflow 提问 Animate a static tattoo on moving skin using Wan 2.6(约 2026-01):「纹身随皮肤形变持久附着」失败——参考图 + 运动在形变表面上的持久性直接失败。
- Google AI Developers Forum 帖 173742(2026-07~08):大量「identity drift and character consistency failure in video-to-video」,含「参考图被忽略、模型幻觉出通用人物」。
- 正确的写法:「参考机制在跨镜头/形变场景下不可靠、且不提供真正的相机/几何控制」,而非「机制是假的」。
长视频一致性存在硬上限
HN 帖 Hy4 preview(约 2026-09-15,387 points)评论 aabdi:「the verification loop only works for … a very short movie. Sub 3-5 mins. After that you burn through million tokens… Too long video and it loses consistency… it lacks global consistency.」——与本项目「一个场景时间线 + 显式 cut」的切分动机一致。
真实成本:V2EX 一手经验
帖 我做了一个把网文自动变成动漫短视频的工具(2026-05-17,33 replies),多位自称投放/漫剧从业者一致判定作者定价严重低估:
- wuyiccc:「AI 视频讲究的是抽卡,基本不可能一次就能生成想要的视频」
- tyhunter:「30s 广告素材,一条抽卡顺利基本都要 200+ 了」
- tadashiyui:「一集下来算最少抽卡次数和官方最优惠价格也得上百」
- foolherb:「字节 seedance2.0 一秒钟视频均价一块钱」
这是本轮最强的「真实成本/抽卡」社区证据,但仍是无样本定义的自述,不能当验收基线。
本地生成的显存/耗时边界
掘金 ComfyUI + MiniMax H3 安装教程(2026)给出可复现参数:8GB 显存 + 16GB 内存 + SSD,「7 秒 / 608×352 / 16 帧 / 8 步 → 约 6 分钟;7 秒 / 736×416 / 10 步 → 约 10 分钟」;模型约 40GB。本地生成的时间成本远高于云端抽卡,是「本地开源线」的真实边界。
抽卡次数的行业侧引用
国盛证券研报(2026,investing.com 转载)引用巨日禄科技 CEO:「单个镜头的抽卡次数可以高达 7 次之多」;测算「抽卡频率降至 75% 省约 5% 总成本;降至 50% 令每秒生成成本降 37%」。卖方研报,非开发者亲测,中等信度;但可作为「抽卡次数→总成本」敏感度的参考数量级。
参考图数量的边际成本
掘金 一小时入门(2026-04-20)作者(快手账号约 6000 关注):「SeeDance 2.0 单条最长就是 15 秒」;「两张图的工作量往往不是一张的两倍,常常是三倍往上——参考图越多,工作量不是线性增加的」;「先有图、再生成视频,比'文字一步到视频'更可控」。另有即梦推广文称「参考图过多导致角色一致性成本呈指数增长」并建议「限制每段视频的关键帧数(15 秒以内更易控制)」(低信度,但与多方一致)。
对本环节的结论
- 真实成本证据的分辨率很粗(都是自述、无样本定义),适合用于「设计实验时该测什么」,不适合设阈值。
- 「3D 预演是当前最可靠的控制面」有社区共识,但没有严格对照实验;本项目可把「有/无白模的抽卡次数与总成本」作为自己的验收实验,而不是引用外部数字。
- 长视频一致性上限(3–5 分钟)与参考图边际成本递增,共同支持本项目「显式分段 + 显式 cut + 每段有限参考」的方向。
- 待核对:HN 日期由相对时间换算;Sora 2 关停时间线、Runway Gen-4.5 失败率(第三方评测称 30 段中 70% 角色完全一致、7% 完全失败)等数字均未取得一手官方来源。
学术编排与下一步
The Script is All You Need(2026-01)与 One Sentence, One Drama(2026-05-21)的意图/reviewer 机制归意图扩充,共享三维世界归下游报告。2025 MovieAgent 仅留背景,不展开。
下一步优先比较一套 skill 和一套 workflow:同一 brief 能否产出可定位的角色/场景/镜头文件;改变一个动作时哪些素材重用、哪些重算;是否能准确续跑和恢复人工修改。成功案例和失败案例都保存,代理路线可以借用这些接口和顺序,而不必复制其全部平台。
维护记录
- 2026-09-24:按编排实现、领取型资产、工程对照、prompt 工具与复盘重写;把私信资产与纯演示分开,保留全部已知领取入口。
- 2026-09-25:新增「开发者社区的可控性与成本证据」(HN 4 帖、SO 1 帖、V2EX 1 帖、掘金 2 文、研报 1 份):确立三条可支撑表述——3D 预演是当前最可靠控制面(非绝对必须)、参考机制应降级为「跨镜头/形变不可靠」而非「是假的」、长视频一致性存在 3–5 分钟上限。检索转述且部分依赖搜索代理摘要,所有数字均为社区自述未验证。