灵刻:做出导演 Agent 之后,还缺什么
单个镜头很好看,接成故事却可能说不通;改了前面,后面又得重查。导演 Agent 能否帮上忙,要看它怎样处理这些修改,以及上一次的改稿经验能不能用在下一部作品里。
2025 年 9 月,我开始手工尝试 AIGC 视频。单个片段生成得精彩,当然让人兴奋。可想把它们做成完整作品,就得处理另一类问题:这一镜为什么接在这里?前一段改了,后面还能不能用?
创作者知道自己写下了什么,观众却总不能靠阅读提示词,理解主角刚刚去了哪里。
同年 10 月,我开始做 AI 门道·灵刻,希望用一个轻量化的导演 Agent,帮视频创作者从想法更快走到成片。2026 年 3 月,我们停止了运营。技术流程有过进展,但直到停下来,产品仍没有充分回答:创作者为什么愿意把下一部作品也交给它?
先让故事说得通
当时的流程从故事输入开始,生成分镜、时间线和镜头提示词,再通过所用的 Sora 2 服务生成片段,最后用 FFmpeg 拼接。当时所用服务的单段时长限制是 15 秒,较长的叙事需要拆开生成。
不过,镜头还没拆,有些事情就得先想好。假设有人要求“拍一段温暖的咖啡店故事”,这个温暖从哪里来?朋友重逢可以,店员记得常客的习惯也可以。如果选后者,就得先让观众看出两人的关系,之后的举动才像是在关照熟人。两个人微笑,几杯咖啡冒着热气,画面很好看,却不一定已经讲出了这个故事。
导演 Agent 要帮创作者想清楚的,就是观众先知道什么,人物接着做什么,每个镜头又告诉观众什么。想清楚了,才轮到写镜头提示词、调用生成服务。把一句 prompt 扩成几百字,再平均分成十个镜头,也可能只是把含糊写得更长。
第一版剧本通常也不会就此定下来。创作者看过草稿,可能发现人物关系依然不清楚,也可能嫌铺垫太多。一个导演类产品有没有用,接下来就要看它能否陪着这部作品继续改下去。
镜头不用排队,还得接得上
为了维持画面连续性,我们实际用过“末帧接首帧”:把上一镜最后一帧作为下一镜的起始画面。它给了下一镜明确的依据,也让所有镜头不得不排队。前面的片段一旦重做,末帧变了,后面的镜头就要逐个检查还能不能接上。
后来,我们先准备完整剧本和各镜头的首帧图片提示词,生成参考图,再并行生成片段。这套流程已经在 n8n 跑通。把一部分决定放到生成之前,镜头就有机会分别开工。
角色和场景一致,动作却还未必接得上。拿那个假设故事来说,下一镜如果要接着表现“刚刚端起杯子”,人物长得一样不够,杯子的位置和动作状态也得对上。能独立表达的镜头可以并行;必须承接前一镜具体结果的地方,仍要等那个结果。
修改时也一样。换掉一个装饰性镜头,其他片段可能都能留下;改了人物作出那个决定的原因,就可能得回到剧本,看看后面的行动还说不说得通。全部重做太费力,一律只改眼前这一段,又容易留下故事上的断裂。
我会更想看一次修改怎样做完:用户改了这一处,哪些参考图要更新,哪些片段还能用,哪里需要重新剪辑,什么时候才能再看到完整作品?n8n 的验证说明并行安排能执行,还不能说明整套生产流程已经可用。修改是否更省事、镜头是否更连贯、成片是否值得采用,都还要另行验证。
换个模型,也得重新回答做给谁
既然可以接入别的视频模型,为什么在 3 月停下来?
Sora 的弃用安排,是我们决定停止运营的背景之一。官方开发者文档记录的弃用通知日期是 2026 年 3 月 24 日,API 移除计划是同年 9 月 24 日。[1] 公告、实际停服与灵刻在 3 月停止运营,并不是同一个时间口径。
与此同时,字节于 2 月 12 日发布 Seedance 2.0,支持文本、图像、音频和视频输入,并加强了参考控制与多镜头生成能力。[2] 视频模型开始直接处理更多原来要由应用安排的事情,只替用户接好模型、串好步骤,也就更难让他一直用下去。换一个模型可以补回某项能力,灵刻接下来要为谁做什么,仍然得自己想清楚。
3 月 18 日,LibTV 正式推出,成为 LiblibAI 的专业视频创作平台。[3] 它是新平台,背后的 LiblibAI 生态却已有积累:自 2023 年已有运营记录,投资方在 2025 年披露了创作者、模型、工作流和生成内容的规模。[4] 已有的这些积累,让它更有机会持续接触创作者,看到他们实际怎样使用产品。不过,公开资料并不能证明它拥有多大规模、什么质量的专业 prompt—剧本配对数据,不能把生态规模直接当成剧本能力。
技术方案可以接着做,但创作者为什么改稿、为什么采用某个结果,不会随着换模型一起变得清楚。回头看,我判断当时团队更缺的是专业创作数据,能让我们看到这些选择是怎样发生的。
先看谁会回来做下一部
要积累这样的数据,先得离开“服务视频创作者”这个过于宽泛的说法。做商品介绍的人,要把信息和产品特征讲准确;做剧情短片的人,更在意人物动机、情绪和节奏。两种视频都能生成,不代表两类人会因为同一件事觉得产品好用。
产品与市场是否匹配,也就是 PMF,得放在这些具体工作里看。先选定一种反复发生的任务,才好了解这类创作者原来在哪一步花力气,灵刻能不能替他省下这部分工作,下次做同类作品时为什么还会回来。如果每次采用前都得自己重写剧本,即使第一段视频让人惊喜,产品能持续帮上的忙也可能很有限。
灵刻当时没有足够证据证明自己找到了这样的稳定需求。再做一次,我会先跟着同一类创作者看完整个过程,而不急着把能生成的题材都列成产品能力。这既是在验证需求,也是在弄清值得积累哪种经验。连要完成的工作都没说具体,一份剧本为什么好,大家也很难谈到一起。
一条改稿理由,怎样帮到下一份剧本
回到那个虚构的咖啡店故事。假设创作者把一段关系铺垫移到店员送上咖啡之前,因为观众原先不知道两人熟悉,没看懂这个动作的含义。
系统若只记下“把第三镜移到第一镜”,下次照做,也可能用错地方。还要记下为什么移:观众需要先知道两人的关系,才能看懂这个动作,原稿却把关系交代晚了。改完以后,观众先知道了这些,再看动作就有了依据。
我想把原始要求、用途与受众、修改前后的剧本、分镜安排、改稿理由和采用版本放在一起,能从一次修改找到它对应的材料。下一次收到同样需要表现熟悉关系的要求,系统就可以检索这类样本,再看看新剧本把关系线索放在了哪里。若又缺少铺垫,就提出调整,让创作者比较、判断。
这样就能参考上次为什么改,而不必照搬咖啡店和它的镜头顺序。这条经验也不能次次照用:如果新作品故意把人物关系留到结尾揭示,贸然提前交代,可能正好破坏了它想要的效果。
这些记录还需要懂创作的人来整理、评价。同样删掉一个镜头,可能因为信息重复,也可能因为产品细节错误;同样提前一场戏,可能是在补充理解条件,也可能只是个人节奏偏好。只看操作,分不清这些理由。创作者采用了一个版本,也不能替它证明对别的题材同样有用。
可以先在材料授权的用途内,把它们整理成能检索、能比较的样本,试试能否帮到创作,不必一步跳到训练模型。灵刻尚未完成这样的数据系统,也没有相应的训练效果;上面说的是我希望建立的能力。
怎样知道这些经验有用
样本多,能比较的材料才多。但要知道当时为什么那样改,还得持续接触创作者,了解修改的情境,再由懂创作的人整理和评价,判断下次能不能参考。海量图片不会自然变成专业剧本,用户多也不等于修改理由已经留了下来。
如果重新开始,我会先服务一类有重复需求的创作者,得到足够清楚的修改记录,再拿相似的新任务试一试:参考这些样本以后,剧本还会不会犯原来那类错误?创作者是不是仍要做同样的修补?如果只是文件越来越多,新任务却没有变好,积累的可能仍是一份档案。
流程功能当然还可以继续加。但在重返这个赛道之前,我得先找到持续收集、整理和检验这些经验的办法。我想知道,下一部作品能不能让观众少一点困惑,也让创作者少做几次相同的修补。
阅读补充
参考与延伸
- OpenAI · Deprecations: Sora 2 and the Videos API
官方记录 2026-03-24 的弃用通知,并列明 API 计划于 2026-09-24 移除。用于区分公告与实际停服时间;灵刻 3 月停止运营来自作者本人确认。
- ByteDance Seed · Seedance 2.0 Official Launch
2026-02-12 官方发布,介绍多模态输入、参考控制与多镜头生成。文中的竞争影响是作者判断。
- 哩布哩布AI · LibTV 正式上线
官方账号 2026-03-18 发布。支持 LibTV 正式推出时间及其与 LiblibAI 的关系。
- 渶策资本 · LiblibAI 再获数亿元融资
投资方 2025-02-24 披露,介绍 LiblibAI 自 2023 年起的经营及创作者、模型、工作流和内容积累。历史披露不等于 LibTV 的专业剧本数据规模。