← 返回博客
Ai预计阅读 11 分钟

Vibe Video:通过编写前端代码来制作影片的编码模型

发布于 2026年10月10日
Vibe Video:通过编写前端代码来制作影片的编码模型

过去一个月里,全球讨论度最高的 AI 视频并不是由视频模型制作的。它出自一个编码模型之手——这个模型不断编写前端代码,直到一个动画成形。

这些片段来自 Claude Opus 5.5。在一个广泛传播的案例中,一位创作者利用参考提示词、Midjourney 的使用权限和一份情绪板,在大约 12 小时内制作出一部电影感十足的反乌托邦短片。该帖子浏览量超过 2000 万。另一位创作者仅用一条指令就生成了一段 2 分 16 秒的文明史作品;它在两天内突破 1000 万次观看。一个收集 Opus 5.5 视频的 GitHub 合集已收录 400 多个条目,其中大多数都公开了提示词和代码。

人们开始把它称为 Vibe Video。这个名字有些笨拙,但这套技术值得理解,因为它通向动态影像的路径,与其他人正在走的那条路确实不同。

代码作为渲染引擎

常见的 AI 视频流程是扩散模型预测像素。你给它一个提示词或一张静态图,它返回若干帧。该模型在视频上训练,其运动感就是从这些数据中学到的。

代码渲染则不同。语言模型编写 HTML、CSS、SVG 或 JavaScript 来绘制动画,再由浏览器渲染。没有任何东西是逐帧预测出来的。运动来自代码,而代码明确描述了位置、时序和缓动。

这一区别很重要,因为它让一些扩散模型觉得困难的事变得容易。精准的图形、字体排版、图表、几何运动和屏幕之间的转场,一旦用代码实现就轻而易举。而它们恰恰是视频模型输出得模糊不清的东西。代价是,代码渲染无法生成运动中照片级真实的人脸。它只能画出代码所能描述的东西。

左侧的代码编辑器面板为右侧清晰的动画画面提供输入

为什么创作者纷纷迷上它

有两个特性解释了这种热情。第一是可复现性。扩散模型生成的片段是一个样本;再运行一次,你得到的是表亲,而不是双胞胎。编码动画则是一个程序。改一个值,你就知道会发生什么。这让修改变得便宜,而大部分工作实际上就发生在修改环节。

第二是,输出已经是一种工作流其余环节可以使用的格式。浏览器动画可以被捕获、嵌入网站,或接入数据源。它天然适合放在产品页或仪表盘里,而许多对动态效果的商业需求正是来自这些地方。

还有一个供给侧的原因。Claude Opus 5.5 于 9 月 22 日发布,附带一份 230 页的系统卡,API 定价为每百万输入 token 4 美元、每百万输出 token 20 美元。它在大多数任务上的基准表现接近上一代旗舰,而成本显著更低。更便宜的前沿模型让长时间、迭代式的代码生成对个人而言变得可行,而这正是那些 12 小时构建所需要的。

另一条赛道

同一周,另一个通用模型正从不同方向切入视频领域。据报道,GPT-6 Astra 扮演一种 AI 导演的角色,负责故事板规划和白模预可视化,并接入 Blender、Unreal Engine 和 DaVinci Resolve 来搭建场景、安排镜头调度和处理剪辑。

把两者放在一起,一个模式就浮现出来。通用模型并不想在照片级真实运动上击败 Seedance、Kling 或 MiniMax。它们正在向上游移动,进入策划和生产管线,同时向侧翼移动,进入程序化而非摄影式的动态领域。这留给专用视频模型继续在真实感上推进,而通用模型则接管流程中那些看起来像软件的部分。

工作流究竟如何运转

那些做出好结果的创作者所描述的过程,更接近软件开发,而不是电影制作。你写一段提示词来设定氛围和约束,模型产出代码,代码在浏览器中渲染,然后你查看结果。接着你改一个地方,再运行一次。这个循环很短暂,输出也可检查,这正是 12 小时构建之所以可能的原因。把一段文字交给视频模型 12 小时只会产生噪声。花 12 小时编辑代码则会产出一件成品。

情绪板和参考模型之所以重要,有一个与构图无关的原因。它们让静态图拥有一致的色调和主题,这样当代码摆放它们、围绕它们做动画时,各个片段看起来就像属于同一部影片。代码提供运动和字体排版。静态图提供世界。缺了任何一半,另一半都无法成立。

成本真正落在哪里

人们很容易以为代码渲染视频是免费的,因为渲染发生在你自己机器上的浏览器里。但模型调用并不免费,而且循环很长。每一次重写都是一次付费请求,一件经过数百次编辑的作品,就是数百次附带大上下文的请求。Anthropic 将价格降到每百万输入 token 4 美元,才让这个循环对个人而不仅是工作室变得负担得起。模型越便宜,创作者就能越自由地迭代,而迭代正是整套方法的核心。

这带来一个奇怪的后果。这种风格的瓶颈不是渲染所需的算力,而是审看。总得有人观看每一次渲染,并决定要改什么,而这种注意力并不会随着 API 价格降低而规模化。用 Vibe Video 取得成功的创作者,在功能上就是盯着每日样片、给出意见的导演,只不过这些意见最终写进了 diff。

代码渲染与生成视频,并排对比

精确区分哪种风格擅长什么会很有帮助。代码渲染可复现、修改成本低、在图形和文字上清晰锐利,并且善于处理数据。它无法生成照片级真实的演员、人群或抓拍瞬间。扩散视频擅长这些,而把其他一切当作近似。由视频模型渲染的 logo 出来时几乎是对的。由代码渲染的 logo 则分毫不差。

这种分工意味着两者会共存,而不是竞争。一件作品可能以生成的建立镜头开场,切到编码制作的动画图表,再以生成画面收尾。有趣的创意问题不再是该用哪个工具,而是该在哪里切换。那些搞清楚这些接缝的团队,会做出显得刻意为之而非随意生成的作品。

它在哪里行不通

代码渲染不是视频生成的替代品,把它当作替代品会让人失望。它拍不了演员。它无法生成纪录片式的画面或可信的人群。它擅长设计、抽象运动、信息和界面,而在任何需要看起来像有摄像机在场的东西上都很弱。

它还有一种没人谈论的成本结构。在第一帧看起来正确之前,你可能已经烧掉大量模型 token,因为循环是写、渲染、检查、重写。更便宜的模型会降低这项成本,但不会消除它。那些做出惊艳结果的创作者不仅仅是在写提示词;他们是在审阅代码。

它告诉我们这个领域正在发生什么

Vibe Video 的有趣之处,不在于编码模型能做出漂亮的片段。而在于“视频生成”与“让东西动起来的软件”之间的边界,最终比任何人以为的都更模糊。当语言模型可以直接写出动画时,对生成视频的一部分需求,就由代码来满足了。

对制作视觉内容的人来说,实际问题不再是要不要选一个工具。而是一件作品中哪些部分最适合用预测出来的帧,哪些部分最适合用写出来的帧。现在正在弄清这一点的团队,他们的作品会显得深思熟虑,而不只是被生成出来。

相关文章