← 返回博客
Ai预计阅读 10 分钟

本周,智能体开始执导短片。瓶颈转移到了质量控制。

发布于 2026年10月6日
本周,智能体开始执导短片。瓶颈转移到了质量控制。

一名开发者于10月5日披露,一部名为《发条飞蛾》的动画短片由一条14个智能体组成的流水线在单张RTX 5090上端到端制作完成。约十分钟的流水线时间覆盖了九个场景中的106个镜头,以及四个反复出现角色的19种场景状态。自动化QA通过了102/102项检查。资产包总计2.4 GB。工具链未披露。

有趣之处与运行时长关系不大。真正突出的是开发者指出的难题所在:让角色身份在镜头之间保持一致,以及自动化质量控制。而不是第一帧。

这一判断与同一周另一个项目相吻合。一名Reddit用户发布了《DOGNAPPED》,这是一部三分钟的会说话狗狗喜剧,几乎完全由Claude制作:Claude在基于开源Video Builder节点搭建的ComfyUI环境中运行Claude Code。人类贡献了创意简报、两只真实狗狗的参考照片以及工具配置。Claude编写了故事,虚构了第三只狗狗角色,生成了地点和角色参考,撰写了包含镜头指导的22场剧本,通过MiniMax H3渲染每个场景的视频、配音和音效,用MiniMax Music 3创作配乐,并剪辑了影片。渲染大约耗时四个半小时。

随后,模型进行了自己的重拍。QA循环将每一句台词与剧本进行转写比对,检查人声音高,审查画面和剪辑,并运行帧级精确的音画同步检查。在小狗咿呀乱叫或狗狗盯着镜头看的地方,它重拍了这些场景。

暗红色灯光的暗房中,一条空白未曝光的胶片从夹子上垂下

为什么QA循环才是关键

生成单个令人信服的镜头已经是一个足够成熟的问题,演示早已司空见惯。而要把106个这样的镜头组装起来,让同一个角色在所有镜头中看起来仍像同一个角色,则并非如此。

身份漂移是破坏长篇AI视频的失效模式。一个在孤立镜头中能很好渲染角色的模型,在不同镜头之间仍会改变面孔、服装或发际线,因为每次生成都是从分布中重新抽样。常见修复手段包括参考条件控制、针对特定角色训练的LoRA,以及人工筛选。所有这些都会在流水线本应消除人工劳动的地方,恰好增加人工劳动。

自动化QA是另一半。一条能产出素材、却无法分辨好坏输出的流水线,会把审阅负担转嫁给一个人,而让一个人审阅一百个镜头,正是整套方法想要消除的瓶颈。《DOGNAPPED》的工作流通过把剧本变成验证预言机来解决这一点:转写每一句台词,与写好的内容比对,检查音高,检查同步,标记失败,重新渲染。这是一种程序化的“可接受”定义,不需要人类观看所有内容。

这一周呈现的模式

有几个项目呈现出相同形态。一位用户名为konte的用户把Claude Code变成了执行制片人,并在单张RTX 5090上生成了一支2分54秒的音乐视频:61个镜头、342项任务,约两小时的人工参与和约四个半小时的生成。镜头按照歌曲的节奏和节拍来编写,因此剪辑落在音乐上。

另一条路线完全跳过了文本到视频。Claude Opus 5.5为每一帧和每一段音乐编写代码,制作出一部名为《我从未见过太阳》的短片,其提示词被设定为一部面向电影节、时长三到五分钟的作品。

最后这种方法指向了该领域的一个真实分野。代码生成的动态是确定性的。如果第420帧看起来不对,你修改代码并重新渲染第420帧。扩散视频是随机性的。如果一个镜头不对,你重新抽卡并祈祷。对于动态排版、UI动画、图表和标志展示等设计性动态,确定性路径更强。对于逼真的人类、有机表演和真实世界物理,扩散模型仍然胜出,因为代码无法模拟它从未建模过的东西。

这一转变背后的工具

这些项目的共同主线,是一个接入生成流水线的编码智能体。Video Builder节点、自定义ComfyUI图,以及通过API调用开放模型的智能体技能,让语言模型拥有与开发者同等的渲染访问能力。模型本身不需要是视频模型。它需要能够编写并运行驱动视频模型的代码。

这就是成本结构呈现如此面貌的原因。在一次公开的会话中,一位创作者向Claude Opus 5.5输入了7000多张Midjourney图像和一首Suno曲目,并运行了一场约两小时的自主创作会话,花费大约6.80美元。在《DOGNAPPED》项目中,主要成本是本地渲染时间,而非API调用。当基础模型是开放权重、编排由代码完成时,一次实验的边际成本会崩塌。

这对技能还有二阶影响。留给人的工作,已经从操作时间线或盯着渲染结果,转向足够精确地指定简报,使自动检查器能够判定输出是否满足要求。本周发布的每个项目都在某处编码了其验收标准,因为流水线无法围绕“把它做得更好”进行迭代。

哪些方面仍然行不通

这些演示对自己的局限很诚实,而且局限是一致的。角色身份能在少数镜头中保持,但在几十个镜头中会漂移,这就是参考条件控制和按角色适配器成为标准做法的原因。长时程结构很脆弱:一部影片可能在三十秒内看起来连贯,到第三分钟却失去空间或时间一致性。而自动化QA只能检查它被要求检查的内容,这意味着一条验证对话和同步的流水线,会欣然放行一个没人写过检查项的连续性错误场景。

这些限制解释了为什么本周交付的项目都是短片。一部有三分钟、演员阵容小、场景简单的喜剧是一个可处理的问题。一部有几十个角色、服装变化和复杂调度的长片则不是,至少目前还不是,除非人类审阅输出的规模远远超过自动化本应节省的程度。

这对制作预算意味着什么

经济性正以特定方式发生变化。当一部短片的成本只有几美元算力和一个下午的编排时,约束就不再是钱,而是简报的清晰度。留存下来的人类贡献,是知道自己想要什么,并能足够精确地说出来,让智能体可以验证它。

这也引出了一个治理问题。一个编写剧本、渲染剧本、评判自己的输出并重拍失败镜头的智能体,正在没有人参与闭环的情况下做出创作决策。QA循环让输出更可靠,同时也意味着模型自己的标准定义了“完成”的样子。

本周的这些项目是演示,其工具链部分未披露。但方向是一致的。生成很便宜,编排才是产品,而决定一条流水线是否有用的,是它能否判断自己何时失败了。

相关文章