商汤想让图像被交付,而不是靠抽卡

随便问一个在工作中使用图像模型的人,这份工作到底是什么样子,你都会听到同一种摩擦。你得到一张满意的图。然后有人要求你改掉图里的一个词,你就得从头再来。试了十次之后,结果反而比原来那张更差,而二十分钟前那个文件已经不见了。
9月21日,商汤把生产级的 SenseNova U1 Pro 模型上线到自家 Raccoon 应用和 SenseNova API,而这套说辞正对准了这样的摩擦。公司称它为“交付级多模态智能体”,而不是图像模型。它想划出的界线,是“生成一张图”与“完成一项任务”之间的区别。
从抽卡到交付
U1 Pro 所描述的工作流比一句提示词要长。它从理解需求开始,然后检索并补全缺失的信息,处理手头的素材,生成与编辑,检查自己的输出,修正发现的问题,并在交付前核验结果。其主张是:检查与纠正发生在交付之前,而不是在你发现哪里不对之后。
这与文生图接口是完全不同的产品品类。文生图模型回答一句提示词,然后就结束了。U1 Pro 试图回应的是需求简报,而这是件更杂乱的事。一份简报通常意味着一组相关的产出,比如一张海报、一条配套横幅,再加一个竖屏版本,而且它通常还附带关于文字必须与原文完全一致的要求。
模型的技术路线也由此而来。商汤描述了一种交错的图文思维链,推理步骤与图像成形交替进行,而不是作为彼此独立的阶段运行。版式层级、字体排布和图形元素要在生成过程中始终保持对齐,而不是事后修补。商汤还列出最高 8K 的输出分辨率和自定义宽高比,瞄准的是大幅面作品,而非社交媒体用的方形裁切图。
目标场景是信息图、海报和建筑可视化。它们有一个共同点:承载结构化信息,而结构出错比像素略有偏差更糟糕。
它所宣称的基准成绩
商汤有一个排行榜名次可以拿出来说。在 2026 年 8 月的 SuperCLUE Image 文生图榜单上,SenseNova U1 Pro 以 93.81 分位居第一,领先 GPT Image 2 的 93.23 分,字节跳动的豆包 Seedream 5.0 Pro 和阿里巴巴的 Qwen Image 3.0 Pro 紧随其后。中国模型在中国基准上拿下第一是意料之中的结果,但它仍然说明了一些事:中国实验室与美国前沿之间的差距已经小到,排名先后取决于用哪个基准。
商汤没有公布的东西更能说明问题。没有包含参数量的模型卡,没有许可条款,也没有独立的基准测试表。8K 上限和版式方面的说法,在第三方复现之前都只是公司自述。对于通过商业 API 交付的中国企业级模型而言,这并不罕见,但这确实意味着买家是在信任厂商给出的数字,而不是自己测试这些数字。
API 同样有门槛。SenseNova U1 Pro 以白名单形式向企业客户开放,需要通过邮件申请,而非自助开通。很多中国企业级 AI 都是这样进入市场的,这也决定了谁有能力评估它。你没法在周五下午随手把它跑起来亲自看看。
通往同一个模型的两扇门
商汤通过两条气质迥异的渠道交付 U1 Pro。消费者一侧是它的办公套件 Raccoon,模型在其中以“一图说清”模式出现:粘贴一份文档或一组产品照片,要求生成一张海报或一张说明图,就能拿回一个成品画面。今天谁都可以试用。
企业一侧是 SenseNova API,仅限白名单。企业通过邮件申请接入,商汤逐个完成接入。这种把关在中国企业级 AI 厂商中很常见,也决定了谁能评估这个模型。一家初创公司无法在周五把它跑起来,看看是否适合自己的流程。而一个有采购关系的大客户可以,这种客户正是商汤要去服务的人。
这种拆分告诉你公司认为这个产品是什么。消费者那扇门是演示,也是漏斗。企业那扇门才是收入所在,而那道门上的摩擦是特性而非缺陷:它让商汤可以按客户定价,而不是按 token 定价,也让模型不会落到任何会在公开场合压力测试这些说法的人手里。
为什么这种重新定义很重要
U1 Pro 有意思的地方不在于分辨率或基准成绩,而在于它的主张:输出的单位应当是一份完成的交付物,而不是一张生成的图片。如果这一主张成立,设计师的工作面貌就会改变。
今天,用好图像模型很大一部分在于懂得怎么抽卡。你要学会哪些提示词能产出可用的结果、怎样措辞修改要求才不会让模型毁掉画面其余部分,以及什么时候该放弃、手动修补。这门技能是真实存在的,但它同时也是一种绕行方案。它之所以存在,是因为模型不擅长把事情做完。
一个能检查并修正自身工作的模型,会把这项技能从人转移到机器上。设计师的工作将转向明确交付物需要满足哪些条件,而不是把一次生成引导到可用状态。这比基准分数跳升是更大的变化,也是好几家实验室同时在推进的方向。阿里巴巴的 Qwen-Image-2.1 把生成、编辑和透明输出合并进一个模型,出于同样的理由。蚂蚁的 Ming-Image-Layer 把成品设计重新拆分成可编辑的部件,也是出于同样的理由。
图像生成的竞争不再是谁画的图最漂亮,而是谁能给最终交付的人留下最少的收尾工作。
在信任它之前该检查什么
如果你在评估 U1 Pro,有三件事很重要。8K 输出在全尺寸下是否仍然连贯,因为大幅面画布往往是文字和版式出问题的地方。模型能否处理你真正用于发布的那种语言的文字,因为一张信息图的好坏取决于它最小的那行可读文字。还有自检回路到底能抓出真实错误,还是只是把错误抹平——这一点你只能通过喂给它带有已知错误细节的简报、看它是否会标出来才能知道。
这些问题厂商基准回答不了。也正是这些问题决定了模型是进入生产流程,还是留在演示文件夹里。