← 返回博客
Tutorial预计阅读 10 分钟

为什么 AI 视频在手部和面部依然崩坏,以及能解决它的工作顺序

发布于 2026年10月4日
为什么 AI 视频在手部和面部依然崩坏,以及能解决它的工作顺序

去问任何一个给客户交付过 AI 视频的人,你都会听到同样的抱怨。手不对。脸在飘。一切都惊艳得不行,直到角色伸手拿起某样东西的那一刻,幻觉就在观众目光无法移开的那一处崩塌了。

解决办法与其说在于模型,不如说在于你的工作顺序。那些能稳定出片的团队,都是先生成静帧、检查、修复,然后才做动画。

顺序比模型更重要

在静帧里发现一根断掉的手指,代价只是一次图像编辑。等视频跑完才发现,代价就是整段片段重跑一遍。按目前的价格,一段八秒的片段依据模型不同,花费从几个积分到几百个积分不等,而一次图像编辑只是其中很小的一部分。从视频倒推着做,等于把一个昂贵的资源浪费在一个你几乎零成本就能发现的缺陷上。

所以实用的工作流是一份检查清单,而不是一条提示词。生成画面。放大看手和脸。修掉坏的地方。确认通过。只做一次动画。把这个顺序固化成模板,每个产品镜头都走同样的步骤,这就把一个本来就充满猜测的流程里的猜测成分去掉了。

各模型的区别在于你能锁定多少人体结构

现在每个视频模型都接受某种形式的图像输入,而一致性上限取决于它能接收多少张参考图,以及是否支持首尾帧控制。这个控制就是那个没被充分利用的杠杆。与其让模型自行发明一段运动的终点,不如你把两端都给它,让模型在你已经确认过的两帧之间做插值。

Veo 3.1 最多可接收同一人物或产品的三张素材图,外加首帧和尾帧。当面部和音频都必须到位时,它就是你要用的模型;Veo 3.1 Fast 以更低的价格提供同样的参考输入,适合在你花旗舰积分之前先做运镜的走位。Seedance 2.0 最多接收九张图片、三段视频片段和三段音频片段作为参考,单次生成最长可达十五秒,不过真实人脸需要字节跳动的授权和面部核验。Kling 3.0 的 Elements 每个由两到四张参考图构成,每段片段最多三个,这就是在多镜头序列中保持同一主体的办法。Runway Gen-4.5 只接受首帧。

这个对比得出的实用法则:在快速模型上跑一遍草稿,是你手头最便宜的诊断手段。如果手在 Veo Fast 上就崩了,它在旗舰模型上多半也撑不住,而你是用更少的积分发现这件事的。

从产品已经被握住的状态开始

有一个技巧在制作笔记里反复出现,简单到几乎不像真的。让产品一开始就已经在手里,然后再移动镜头。模型维持一个已有的握持,比让它形成一个新握持要可靠得多。让模型去琢磨人是怎么把东西拿起来的,等于让它去解决一个跟这个镜头要干什么毫无关系的问题。

同样的逻辑也适用于脸。如果镜头需要一张可辨识的面孔,就提供参考图、让模型去插值,而不是用文字描述这张脸然后祈祷。文字描述生成的脸,一瞥之下还算合理,盯着看就让人不适——对于任何观众会看第二遍的东西来说,这是最糟的结果。

片段长度逼着你做选择

如果一条镜头要超过八秒左右,可选范围就缩小到 Seedance 2.0 和 Kling 3.0,它们最长可跑十五秒。其他模型都需要串联,而串联正是角色和物体一致性再次崩掉的地方。这就是首尾帧控制如此重要的原因:它是让一个握持动作跨过剪辑点延续下去、而不用模型重新发明的机制。

静帧优先的顺序,本质上是一笔经济账

把它当作一种制作方法来对待,账目就一目了然。一次图像生成和一次图像编辑,相比一次视频生成都很便宜。片段的成本随长度和分辨率上升,而它是整条链上唯一一个错误在付完钱之后才出现的环节。上游的一切,都是为了让那唯一昂贵的一步不必重来。

这颠覆了大多数人从写提示词带过来的本能。最自然的做法是用文字描述整个场景,直接生成视频,因为那感觉像是在把模型用在最强的地方。这也恰恰是花钱最多、保障最少的那条路。先确认一帧,就把一次开放式的生成变成了一次受控的生成,因为模型现在动起来的,是你已经判定为正确的东西。

同样的顺序还能防住一种更隐蔽的失败:逐帧看都没问题、一动起来就不对的镜头。一只在静帧里看着没毛病的手,一动起来就可能崩,而唯一知道的办法就是看一遍——也就是说,无论如何你都得看。问题在于,你要看的是那段有问题但你可以修的片段,还是那段有问题你只能花钱重做的片段。

模型之间真正还存在差异的地方

模型之间的差异并不都是价格档位。可接收参考图的数量,以及有没有首尾帧控制,改变的是能做到什么,而不只是花多少钱。一个只接受单张首帧的模型,无法让主体跨过剪辑点保持连续,因为模型没有第二个参考可以作为目标。

这就是为什么参考规格值得和画质评分一样受重视。一个能接收九张参考图的模型,可以带着一个角色走完整个序列,这是只吃首帧的模型做不到的,哪怕后者单段片段更漂亮。拍口播镜头,漂亮的那个赢。拍一支配有反复出现的产品的短序列,参考额度大的那个赢。

首尾帧控制是大多数团队用得不够的杠杆,它正好对准了每个视频模型的核心弱点:它会自行发明一个你无法预测的终点。把两端都交出去,模型就在你已经检查过的两帧之间插值。运动之所以保持可信,是因为两个端点是真实的,一致性问题也就此不再是一场对模型想象力的赌博。

这对谁能做这份工作意味着什么

工作顺序加上参考控制,一起拓宽了能做出合格 AI 视频的人群。一个没有后期流水线的小工作室,现在可以生成一张静帧、在图像编辑器里修好它,再做出一个立得住的动画镜头,不必再做过去必须要做的专家级清理。技能的重心从修补崩坏的画帧,转移到规划那些能避开模型仍然会失手的镜头的方案上。

两年前静态图像生成也经历过同样的转变。当工具变得足够可靠,手艺就向上游移到艺术指导,向下游移到审看,而中间那一步——人跟工具较劲、把它掰到配合为止的那一步——缩小了。视频现在正进入这个阶段,率先调整流程的团队会按期交付,而其他人还在反复重跑片段。

所以这套纪律值得写下来。生成静帧,修好手,确认画面,然后做动画。功劳归模型。结果归顺序。

相关文章