AI 门道·灵刻
面向视频创作者的轻量化 AI 导演工具,探索一键成片的更短路径。
依据项目实际经历整理的流程示意。
从故事到成片,少来回搬几次
AI 门道·灵刻面向视频创作者,想做一款轻量化的 AI 导演工具,探索更短的一键成片路径。做视频时,故事、分镜、生成和剪辑分散在不同工具里,信息要反复搬来搬去。这个产品希望减少这部分工作,让创作者多花些心思在表达上。
我从 2025 年 9 月开始手工尝试 AIGC 视频,随后在 2025 年 10 月至 2026 年 3 月推进这个产品,担任创始人与产品负责人。目前产品已下线。这里记录当时试过的流程与取舍;“一键成片”是探索方向,完整的全自动成片效果还没有得到验证。
导演 Agent 要把镜头交代清楚
流程从故事输入开始。导演 Agent 组织分镜、时间线和镜头提示词,调用当时使用的 Sora 2 服务生成片段,最后用 FFmpeg 拼接。该服务当时每个镜头有 15 秒限制,较长的内容要拆成多个镜头。
难的地方在于,每一步究竟该交出什么。故事里写“气氛紧张”,后面还得知道谁在场、发生了什么、这一镜头要让人看到哪一个变化。提示词写长了,也可能还是没把这些交代清楚。
我主要看导演 Agent 给出的安排能不能执行:每个镜头讲什么,时长是否合适,前后有没有共同参考。单独一段画面再漂亮,放回故事里也可能接不上,最后剪辑时就得补这笔账。
下一镜头为什么一定要等
我们实际用过一种串行办法:拿上一镜头的末帧,作为下一镜头的首帧。这样能给画面衔接提供参考,代价是下一段必须等上一段生成完。
用户等的是整段视频。如果镜头之间一直在互相等,单次生成快一些,未必就能让人很快拿到成片。这里有些等待来自模型,有些则是我们安排流程时加进去的。
返工也是一样。前面的镜头改了,后面用了它作为参考的镜头可能受影响。除了正常生成的顺序,还得想清楚哪一步出错以后,要从哪里接着做。
先准备参考图,再分别生成
后来的流程先推导完整剧本和各镜头的首帧图片提示词,生成参考图片,再并行生成视频片段。这条流程已经在 n8n 跑通。
人物、场景和镜头参考先准备好,各段视频就可以分别开工,不用再逐个等上一段交出末帧。改变任务之间的依赖,也就少了一类等待。
不过,参考图是否一致,人物和场景能不能接上,仍然要检查。并行并没有替我们解决所有连续性问题。这里没有经过确认的量化提速数据,n8n 流程跑通也不代表已经完整集成进正式产品。
按钮少了,出了错也要知道怎么办
我理解的轻量化,是创作者比较容易看懂自己在做什么、系统做到哪里,以及还有什么需要自己判断。界面上只留一个按钮,出了错却让人猜半天,也不见得轻松。
所以产品仍要把一些中间结果交代清楚:故事拆成了哪些镜头,哪些素材已经准备好,哪里失败了,这次修改会影响哪些部分。技术细节可以少展示,用户继续做事所需的信息不能一起藏掉。
以后再优化成片流程,我会先看哪些任务互相依赖,出错时能不能检查和接着做,再考虑怎样加速、哪些操作可以省掉。最后看的还是整段作品:质量怎么样,等了多久,又返工了多少。