← 返回博客
Ai预计阅读 10 分钟

Vidu Q3 将参考生视频拆分为三款产品。这既是模型决策,也是产品打包决策。

发布于 2026年10月5日
Vidu Q3 将参考生视频拆分为三款产品。这既是模型决策,也是产品打包决策。

大多数视频模型发布时只宣布一次,之后便以同一个名称出现在各处。Vidu 对其 Q3 参考生视频产品线却反其道而行。

9月14日,阿里云 Model Studio 列出了三款独立的 Vidu Q3 参考生视频模型。第一款 viduq3-mix 是通用模型,接收参考图像和文本提示词,并将这些图像中的主体融合进所描述的场景。第二款 viduq3-ad 面向广告,具备营销级场景剪辑、镜头运动以及直接音频输出;你上传产品图片,就能得到广告视频。第三款 viduq3-drama 面向短剧和 AI 漫画制作,针对故事驱动内容调优了角色一致性、运动效果和情感表达。

三款模型均以每秒 0.14 美元的价格运行,支持 720p 或 1080p,速率限制为每秒 5 次请求。三者的定价完全相同,这说明差异化不在成本,而在输出行为。

Vidu 真正要解决的问题

Vidu 来自北京的生数科技。其 Q3 模型于 2026 年 1 月 30 日发布,并迅速登上基准测试榜单。Artificial Analysis 在发布时将其列为中国第一、全球第二,领先于 Runway Gen-4.5、Google Veo 3.1 和 OpenAI 的 Sora 2,得分为 1241。

支撑这一排名的三项技术转变值得点明。Q3 是最早一批在生成画面的同一遍流程中产出同步对白、音效和背景音乐的长视频模型之一,而不是在后期再附加音频。它将单次生成片段延长到 16 秒,这在当时的主要模型中是最长的。它还构建了参考生视频系统,用户上传角色、物体或风格的 3 到 7 张图像,模型便将这些图像作为后续生成中的视觉锚点。

参考系统才是最有意思的部分。2026 年的大多数视频模型都在同一条轴上竞争:让单个片段看起来惊艳。Vidu 的押注不同。它的卖点从来不是“看这个绝美镜头”。而是“看同一个角色出现在十个镜头里,并注意到他们仍然像同一个人”。

这是一个更难的问题,而它正是系列内容真正依赖的东西。在与 Runway Gen-4、Kling 3.0、Luma Ray、Pika 2.0 和 Sora 2 的对比中,使用同一角色提示词测试六种场景变化,Vidu Q3 在六项测试中的五项里保持了面部和服装一致性。

一致性正是区分“一次性片段工具”和“系列内容工具”的关键。对于动漫创作者、短剧制作人,以及任何围绕常驻角色打造品牌内容的人来说,它改变了可能性边界。

为什么三个 SKU 很重要

把一个模型家族拆成三个命名产品,看起来像营销选择。实际上更接近采购决策。

三个朴素的深色圆柱排成一排,立在反光表面上,周围有飘散的烟雾

广告团队和短剧工作室购买的不是同一样东西,即使底层的 transformer 相似也是如此。广告买家需要产品保真度、干净的场景转场,以及能配合品牌声音的音频。短剧买家需要角色在剧集和镜头之间保持身份一致,并且表情能读作表演。把它们打包成独立的模型 ID,并配有各自文档,能让每个买家只针对一项任务进行评估和预算,而不必阅读通用功能列表然后猜测。

通用型 mix 模型则服务于这两个盒子之外的所有人。对于一个买家越来越是有截止日期的制作团队、而非测试提示词的爱好者的市场来说,这是一种合理的结构。

Vidu Claw 与流水线层

把模型打包只是战略的一半。另一半是组装层。Vidu Claw 是一个 AI 创作自动化引擎,构建在开源 OpenClaw 框架之上,由 Q3 驱动。你连接自己的 Vidu token,定义 Skills,并自动化从想法到成片的路径。像“为面向 Instagram 年轻女性的跑鞋制作一支短视频广告”这样一句提示词,就足以让 Vidu Claw 生成概念、脚本、分镜、视觉、配音、音乐和最终剪辑。

独立评测的评价褒贬不一,但这种方式很有参考价值。一位评测者在产品广告上测试后发现,该平台对学生和初学者确实免费且易用,但报告称它在精确的结构细节上表现吃力。有一个案例中,即使反复修改提示词,它仍会以某种方式渲染某个细节,使其格外显眼;输出也带有明显的 AI 味道,光照和色彩显得廉价。

这就是诚实的取舍。Vidu Claw 是一个面向个人创作者和小型营销团队的生产力工具,适合需要快速从概念推进到可用草稿的场景,而不是专业制作团队的替代品。顺利时,它能把五天的广告制作周期压缩到一天。不顺利时,质量问题很难被忽视。

Vidu 正在构建的生态

参考生视频的聚焦与一个分发生态相连。2026 年 2 月,软件公司万兴科技宣布对生数科技进行战略投资,双方计划在 AI 漫画上合作。Vidu Q3 模型被集成到一个全链路 AI 漫画制作平台中,用于让角色、声音和场景在剧集之间保持一致。阿里云百炼平台也在 2026 年 5 月将 Vidu Q3 添加为第三方模型。

因此,这个模型至少通过三个渠道流通:直接的网页和 API 访问、面向漫画和短剧的创作平台,以及云模型市场。每个渠道都有不同的买家,对“足够好”的定义也不同。

钱到底在哪里

转向系列内容不是创作偏好,而是预算所在。短剧是多集产品,有常驻演员阵容,其经济性取决于产出比单支广告或一次性片段多得多的素材。如果模型迫使创作者在每个镜头都从零处理角色外观,那么生成素材节省下来的成本就会被一致性修复吃掉。Vidu 的押注是:愿意为每秒 0.14 美元付费的团队,买的不是单个漂亮镜头,而是一种让同一个人在整部剧中保持可辨识的方法。

这也是为什么参考系统比原始质量分数更重要。一个在全球基准上排名第二的模型令人印象深刻,但基准衡量的是片段。参考功能衡量的是系列。两者不是同一种购买行为,而 Vidu 卖的是后者。

它尚未兑现的地方

参考一致性并不完美,六分之五不等于六分之六。在失败的第六个案例中,工具交付的面部和服装偏离了源图,而这正是会毁掉一个系列的失败。成本也是真实存在的,每秒 0.14 美元在一个 16 秒片段上会迅速累积,在系列规模、数百个镜头投入使用时更会变得显著。流水线层产出的是草稿,而不是成品广告;评测者发现,即使反复修改提示词,它也无法可靠地修正某个结构性细节。

还有一个结构性限制值得点明。参考生视频锚定的是身份,但它尚未解决整部制作中的连续性。仍然需要有人做出导演选择,把一组一致的片段变成故事;而模型对节奏、镜头覆盖,甚至某个场景是否应该存在,都没有意见。

值得关注什么

三 SKU 结构是其他厂商可能效仿的部分。如果参考生视频成为系列内容制作的默认方式,预计会有更多模型家族推出针对具体任务的变体,而不是单一旗舰。接下来重要的问题是:这种一致性能否在更长时长和更复杂镜头运动中保持,以及流水线层能否好到可以卖给工作室,而不只是个人创作者。

相关文章