← 返回博客
Ai预计阅读 9 分钟

图像模型的军备竞赛:Midjourney、Nano Banana 与开源权重的悄然崛起

发布于 2026年10月1日
图像模型的军备竞赛:Midjourney、Nano Banana 与开源权重的悄然崛起

如果你有几个月没关注 AI 图像生成,回来时看到的景象几乎让人认不出来。大厂纷纷换了版本,曾经的消费级宠儿正在被退役,而开源权重领域变得强大了许多。以下是 2026 年秋季的现状。

Midjourney 已推进到 V8,V8.2 在 7 月成为默认版本。当目标偏向艺术指导而非单纯能力时,它仍是人们的首选工具——它像人类导演那样解读氛围与光线。原生 2K 输出无需放大、提示词理解更好,还有一套个性化系统,能从你挑选的图像中学习你的品味。取舍依旧没变:没有免费层级、三起进行中的版权诉讼,以及文本渲染虽然有所改善,但面对复杂字体排版仍不可靠。

Google 的 Nano Banana 走过了一段最令人困惑的历程。原版在 2026 年 2 月悄悄被基于 Gemini 3.1 Flash 的 Nano Banana 2 取代,并成为 Gemini 应用中的默认选项。较旧的 Gemini 2.5 Flash Image 正在被弃用,将于 10 月 2 日关停。这个社区昵称掩盖了一个事实:Nano Banana 根本不是独立产品。它是内嵌在 Gemini 中的图像生成功能,这究竟算方便还是令人沮丧,取决于你想要的是聊天界面还是专用工具。它的优势实实在在:多轮编辑能记住上下文,并且经实测可在多次编辑中保持最多五个人物和十四个物体的一致性。

正如一份社区指南所说,Nano Banana 的诀窍在于给每张参考图安排一项任务:一张负责身份,一张负责姿态,一张负责风格。把所有东西都塞进单一参考图,输出就会变得浑浊。这是一条小小的纪律,却比大多数提示词技巧更重要,而且它也是整个领域多参考图编辑背后的同一原则。

OpenAI 的 GPT Image 系列正在推进指令限定式编辑,支持最多十六张参考图,其较新的 Sunburst 和 Flare 变体位居 LMArena 图像编辑榜榜首——该榜单如今已在 57 个模型上收集了超过 3000 万张投票。xAI 的 Grok Imagine Image 2.0 把精准编辑和清晰文本渲染作为卖点,在早前的深度伪造丑闻迫使其重新思考护栏之后,将自己定位为可投入生产的选项。

对长期而言最重要的事发生在开源权重领域。Black Forest Labs 的 FLUX.2 目前领跑可编辑的高分辨率开源模型,另有 klein 4B 变体和面向速度的 turbo 变体。Z-Image、Qwen-Image 和 Ideogram 4.0 补齐了 Apache-2.0 许可的选项,而 Ideogram 的开源权重渲染质量让开发者称之为顶级。许可已经成为真正的分水岭:FLUX.2 dev 为非商用,而 FLUX.2 klein、Z-Image 和 Qwen-Image 在 Apache 2.0 下允许商用。如今选择基础模型,要从许可开始,而不是从跑分开始。

许可这一点值得强调,因为大多数人正是在这里栽跟头。两个模型可能在基准测试上得分相同,但在你能用输出做什么上却天差地别。一个你可以微调并部署给客户的模型,比一个稍好却只能用于研究的模型更有价值。开源领域正是沿着这条线分裂的,而可商用的那一档——Apache 2.0 或同等许可——才是生态真正在构建的地方。

这一切背后的转变是:编辑取代生成,成为前沿。一年前,竞赛是谁能从文本渲染出最逼真的图像。现在人人都做得到。新的竞赛是:谁能让你只改一处而不重新生成全部,谁能在上百张图像中保持同一个角色,谁能在海报上放上清晰、正确的文字。正在胜出的模型,是那些为迭代而优化的模型,而不是追求第一代惊艳的模型。

硬件这条线也与这一切并行。开源模型已经小到一个 7B 级别的模型能在消费级 GPU 上运行,社区则用一键集成包作出回应,向那些完全不想碰终端的人承诺本地生成。“能在 6GB 显存卡上跑”这一基准,已经变得和任何榜单分数一样像营销话术,因为它决定了一个模型是猎奇玩具还是工具。

人们对一致性的看法也在悄然转变,而一致性已经成为真正的战场。一个能渲染出一张漂亮图像的模型只是入场门槛。一个能在上百张图像中渲染同一角色、或从十几个角度渲染同一产品的模型,才能赢得真实工作流中的一席之地。基于参考图的方法——附上同一角色的一张到十四张图像,让模型复现——是快速起步的方式。LoRA 训练,即在你自己精挑细选的图像上微调一个小型适配器,则是当参考图发生漂移时更重的锤子。取舍在于控制力与准备时间,而诚实的答案是:没有任何方法能保证一张稳定的脸,这正是为什么每位严肃创作者在正式投入前都会用一份固定的拍摄清单来测试。

这个品类也为外行发展出了一套有用的词汇。多轮编辑意味着模型记得它做过什么,并与你反复迭代。指令限定式编辑意味着你可以告诉它具体要改什么,其余部分它不会碰。多参考图合成意味着输入多张图像,并告诉每一张它负责什么。这些都不新奇;它们如今已是标准功能,模型之间比拼的是执行得好不好,而不是有没有。

对今天要选工具的人来说,诚实的建议没有变,大概也不会变。让模型匹配任务。要审美选 Midjourney,要在 Google 生态内做多轮编辑选 Nano Banana,要做指令限定的生产级编辑选 GPT Image 或 Grok,需要控制权、数据驻留或一个你能永久保留的微调角色时选开源权重。“一个模型通吃所有需求”的时代已经悄然结束,没有人真正宣布过。取代它的,是一个“正确答案完全取决于你想做什么”的市场,而做得最好的人,是那些不再追逐唯一赢家、学会货比三家的人。

在所有这些变化中,唯一不变的是:差异化因素不再是原始图像质量,而是围绕它的工作流。一致性、可编辑性、许可清晰度,以及与你已在使用的工具的集成度。这才是真正决定一个模型会出现在你的日常工作里,还是躺在一个你再也不会打开的“精彩演示”文件夹里的原因。军备竞赛是真的,但赢家不是跑分最好的模型。而是那些契合人们实际工作方式的模型,这更难衡量,却也是判断什么能留下来的更好预测指标。

相关文章