← ブログに戻る
Ai読了目安 14 分

SenseTimeが目指すのは、画像を「回す」のではなく「納品」すること

公開日 2026年10月2日
SenseTimeが目指すのは、画像を「回す」のではなく「納品」すること

仕事で画像モデルを使っている人に、実際の仕事はどんなものかと尋ねれば、同じ摩擦について聞くことになるでしょう。気に入った画像が得られます。すると誰かがその中の1語を変えるように頼み、最初からやり直すことになります。10回試した後には、以前より悪い結果になり、20分前のファイルは消えてしまっています。

SenseTimeは、9月21日に、実運用向けのSenseNova U1 Proモデルを自社のRaccoonアプリとSenseNova APIに投入し、その売り込みはまさにその摩擦を狙ったものです。同社はそれを画像モデルではなく、納品グレードのマルチモーダルエージェントと呼んでいます。それが描いている区別は、画像を生成することとタスクを完了することの間のものです。

「回す」から「納品」へ

U1 Proが説明するワークフローは、プロンプトよりも長いものです。それはリクエストを理解することから始まり、次に不足情報を検索して補い、手持ちの素材を処理し、生成と編集を行い、自身の出力をチェックし、見つけた問題を修正し、引き渡す前に結果を検証します。主張は、チェックと修正が、何かが間違っていることに気づいた後ではなく、納品前に起こるというものです。

それは、テキスト-to-イメージのエンドポイントとは異なる製品カテゴリです。テキスト-to-イメージモデルはプロンプトに応答して停止します。U1 Proはブリーフに応えようとしているのであり、それはより雑然としたものです。ブリーフは通常、ポスターに加えてそれに合うバナー、さらに縦型画面用のバージョンなど、関連する出力のセットを意味し、通常は正確に書かれた通りに表示される必要があるテキストに関する要件が付いてきます。

モデルの技術的アプローチはそこから来ています。SenseTimeは、推論ステップと画像形成が別々の段階として実行されるのではなく交互に行われる、インターリーブされたテキスト-画像の思考の連鎖について説明しています。レイアウト階層、タイポグラフィの配置、グラフィック要素は、後から修正されるのではなく、生成を通じて整合性が保たれることを意図しています。SenseTimeはまた、カスタムアスペクト比を備えた最大8Kの出力解像度を挙げており、正方形のソーシャルクロップではなく大判の仕事を対象としています。

対象となるワークロードは、インフォグラフィック、ポスター、建築ビジュアライゼーションです。これらには共通する特性が1つあります。それは構造化された情報を運ぶということであり、構造を間違えることは、ピクセルがわずかにずれるよりも悪いことです。

主張しているベンチマーク

SenseTimeには指し示すことのできるリーダーボードの位置があります。2026年8月のSuperCLUE Imageテキスト-to-イメージボードでは、SenseNova U1 Proが93.81で1位に位置し、93.23のGPT Image 2を上回り、ByteDanceのDoubao Seedream 5.0 ProとAlibabaのQwen Image 3.0 Proがすぐ後ろに続いています。中国のモデルが中国のベンチマークで首位を取るのは予想される結果であり、それでも何かを物語っています。中国のラボとアメリカのフロンティアとの間のギャップは今や非常に小さく、順位はベンチマークに依存するほどになっています。

SenseTimeが公開していないことの方がより雄弁です。パラメータ数を含むモデルカードはなく、ライセンス条件もなく、独立したベンチマーク表もありません。8Kの上限とレイアウトの主張は、第三者が再現するまでは会社の主張です。それは商業APIを通じて提供される中国のエンタープライズモデルとしては珍しいことではなく、買い手がテストするのではなくベンダーの数字を信頼していることを意味します。

APIも制限されています。SenseNova U1 Proは、ホワイトリストモデルとしてエンタープライズ顧客に利用可能であり、セルフサービスではなくメールでリクエストします。それは多くの中国のエンタープライズAIが市場に到達する方法であり、誰がそれを評価できるかを形作ります。金曜日の午後に立ち上げて自分で確かめることはできません。

同じモデルへの2つの扉

SenseTimeは、まったく性格の異なる2つのチャネルを通じてU1 Proを提供しています。コンシューマー側は、そのオフィススイートであるRaccoonで、モデルは「1枚の画像で説明する」モードとして登場します。文書や一連の製品写真を貼り付け、ポスターや説明用グラフィックを要求すると、完成したフレームが返ってきます。誰でも今日それを試すことができます。

エンタープライズ側はSenseNova APIであり、ホワイトリスト限定です。企業はメールでアクセスをリクエストし、SenseTimeは一度に1社ずつオンボーディングします。そのゲートキーピングは中国のエンタープライズAIベンダーの間では一般的であり、誰がモデルを評価できるかを形作ります。スタートアップは金曜日に立ち上げて、パイプラインに適合するかどうかを確認することはできません。調達関係を持つ大規模顧客はでき、その顧客こそがSenseTimeがサービスを提供するために構築されている相手です。

その分割は、会社が製品を何だと考えているかを物語っています。コンシューマーの扉はデモとファネルです。エンタープライズの扉は収益が存在する場所であり、その扉の摩擦はバグではなく機能です。それはSenseTimeがトークンごとではなく顧客ごとに価格設定することを可能にし、公の場で主張をストレステストするような人々の手にモデルが渡るのを防ぎます。

なぜ再定義が重要なのか

U1 Proについて興味深いのは、解像度やベンチマークではありません。出力の単位が、生成された画像ではなく、完成した成果物であるべきだという主張です。その主張が成り立つなら、デザイナーの仕事のあり方が変わります。

今日、画像モデルをうまく使うことの大部分は、「回し方」を知ることです。どのプロンプトが使用可能な出力を生み出すか、モデルが画像の残りを台無しにしないように編集をどう表現するか、いつ諦めて手で修正するかを学びます。そのスキルは本物であり、同時に回避策でもあります。それはモデルが物事を仕上げるのが苦手だから存在します。

自身の仕事をチェックして修正するモデルは、そのスキルを人間からマシンへと移すでしょう。デザイナーの仕事は、生成を利用可能な状態へと操縦するのではなく、成果物が何を満たす必要があるかを指定することへと移行するでしょう。それはベンチマークのジャンプよりも大きな変化であり、複数のラボが同時に押し進めている方向です。AlibabaのQwen-Image-2.1は、同じ理由で生成、編集、透過出力を1つのモデルに統合しました。AntのMing-Image-Layerは、同じ理由で完成したデザインを編集可能なピースに分割します。

画像生成における競争は、どのモデルが最も美しい絵を描くかではなくなりました。それは、それを出荷しなければならない人にとって、どのモデルが最も後片付けを少なくするかについてです。

信頼する前に確認すべきこと

U1 Proを評価するなら、3つのことが重要です。8K出力がフルサイズで一貫性を保つかどうか。大きなキャンバスは通常、テキストとレイアウトが壊れる場所だからです。モデルが実際に公開している言語でテキストを扱えるかどうか。インフォグラフィックは、最も小さい判読可能な行と同じくらいしか良くないからです。そして、自己チェックループが本当のエラーを捉えるのか、それとも単に滑らかにするだけなのか。それは、既知の誤った詳細を含むブリーフを投入し、それをフラグ付けするかどうかを見ることによってのみ学べます。

これらは、ベンダーのベンチマークでは答えられない質問です。また、モデルが本番パイプラインに入るか、デモフォルダに留まるかを決める質問でもあります。

関連記事