← 블로그로
Ai약 12 분 읽기

센스타임이 원하는 것은 '리롤'이 아니라 '납품'되는 이미지다

게시일 2026년 10월 2일
센스타임이 원하는 것은 '리롤'이 아니라 '납품'되는 이미지다

업무에 이미지 모델을 쓰는 사람에게 실제 작업이 어떤지 물어보면, 누구나 같은 불편을 이야기한다. 마음에 드는 그림을 하나 얻는다. 그런데 누군가 그 안의 단어 하나만 바꿔달라고 하고, 그러면 처음부터 다시 시작해야 한다. 열 번을 시도하고 나면 처음 것보다 못한 결과가 남고, 20분 전의 파일은 사라져 있다.

센스타임은 9월 21일 자사의 프로덕션 모델인 SenseNova U1 Pro를 자사 앱 Raccoon과 SenseNova API에 올렸고, 그 제안은 바로 이 불편을 정면으로 겨냥한다. 이 회사는 이를 이미지 모델이 아니라 '납품 등급(delivery-grade)' 멀티모달 에이전트라고 부른다. 여기서 그으려는 선은 그림을 생성하는 것과 작업을 끝내는 것 사이의 차이다.

리롤에서 납품으로

U1 Pro가 설명하는 워크플로는 프롬프트 하나보다 길다. 요청을 이해하는 것에서 시작해, 빠진 정보를 찾아 채우고, 가진 재료를 처리하고, 생성하고 편집하고, 자기 출력을 검사하고, 발견한 것을 고치고, 넘겨주기 전에 결과를 검증한다. 핵심 주장은 검사와 수정이 사용자가 뭔가 잘못된 걸 알아차린 뒤가 아니라 납품 전에 일어난다는 것이다.

이것은 텍스트-투-이미지 엔드포인트와는 다른 제품 범주다. 텍스트-투-이미지 모델은 프롬프트에 답하고 멈춘다. U1 Pro는 브리프(brief)에 답하려 한다. 브리프는 훨씬 지저분한 것이다. 브리프는 보통 포스터에 어울리는 배너, 세로 화면용 버전까지 함께 요구하는 식으로 서로 연관된 여러 결과물을 함축하며, 대개 정확히 적힌 그대로 나와야 하는 텍스트에 대한 요구사항을 동반한다.

모델의 기술적 접근도 여기서 나온다. 센스타임은 추론 단계와 이미지 형성이 별개 단계로 실행되는 대신 번갈아 이어지는 '인터리브드 텍스트-이미지 사고 사슬(chain of thought)'을 설명한다. 레이아웃 위계, 타이포그래피 배치, 그래픽 요소는 사후에 고치는 것이 아니라 생성 과정 전반에 걸쳐 정렬된 상태로 유지되도록 설계됐다. 센스타임은 또한 사용자 지정 종횡비를 지원하는 최대 8K 출력 해상도를 제시하며, 정사각형 소셜 이미지 크롭이 아니라 대형 포맷 작업을 겨냥한다.

목표로 삼은 작업은 인포그래픽, 포스터, 건축 시각화다. 이들은 한 가지 속성을 공유한다. 바로 구조화된 정보를 담고 있다는 점이며, 구조를 틀리는 것이 픽셀이 조금 어긋나는 것보다 나쁘다.

내세우는 벤치마크

센스타임이 가리킬 만한 리더보드 순위는 있다. 2026년 8월 SuperCLUE Image 텍스트-투-이미지 보드에서 SenseNova U1 Pro는 93.81로 1위에 올랐고, GPT Image 2가 93.23으로 그 뒤를 이으며 바이트댄스의 Doubao Seedream 5.0 Pro와 알리바바의 Qwen Image 3.0 Pro가 바짝 뒤따른다. 중국 모델이 중국 벤치마크에서 1위를 차지하는 건 예상된 결과이며, 그래도 시사하는 바가 있다. 중국 연구소와 미국 최전선의 격차가 이제 순위가 벤치마크에 따라 갈릴 만큼 작아졌다는 것이다.

센스타임이 공개하지 않은 것이 오히려 더 많은 것을 말해준다. 파라미터 수를 담은 모델 카드도, 라이선스 조건도, 독립적인 벤치마크 표도 없다. 8K 상한과 레이아웃 관련 주장은 제3자가 재현하기 전까지는 회사가 주장하는 값일 뿐이다. 상용 API로 출시되는 중국 엔터프라이즈 모델로서 이는 특별한 일이 아니며, 실제로 구매자가 검증하는 대신 벤더의 수치를 신뢰하게 된다는 뜻이기도 하다.

API는 또한 제한적으로 열려 있다. SenseNova U1 Pro는 기업 고객에게 화이트리스트 모델로 제공되며, 셀프서비스가 아니라 이메일로 신청해야 한다. 많은 중국 엔터프라이즈 AI가 시장에 나오는 방식이 그렇고, 이는 누가 이를 평가할 수 있는지를 결정한다. 금요일 오후에 바로 띄워서 직접 확인해 볼 수는 없다.

같은 모델로 들어가는 두 개의 문

센스타임은 성격이 매우 다른 두 채널로 U1 Pro를 출시한다. 소비자 쪽은 자사의 오피스 제품군인 Raccoon이며, 여기서 모델은 '이미지 하나로 설명하는' 모드로 등장한다. 문서나 제품 사진 묶음을 붙여넣고 포스터나 설명용 그래픽을 요청하면 완성된 프레임을 돌려받는다. 누구나 오늘 바로 시험해 볼 수 있다.

엔터프라이즈 쪽은 SenseNova API이며 화이트리스트 전용이다. 기업은 이메일로 접근을 신청하고, 센스타임은 한 곳씩 온보딩한다. 이런 게이트키핑은 중국 엔터프라이즈 AI 벤더들 사이에서 흔하며, 누가 이 모델을 평가할 수 있는지를 좌우한다. 스타트업은 금요일에 띄워서 파이프라인에 맞는지 확인할 수 없다. 조달 관계가 있는 대형 고객은 가능하며, 센스타임은 바로 그 고객을 위해 만들어졌다.

이 분할은 회사가 이 제품을 무엇이라고 생각하는지 보여준다. 소비자 문은 데모이자 유입 깔때기다. 엔터프라이즈 문은 수익이 사는 곳이며, 그 문에서의 마찰은 결함이 아니라 기능이다. 고객별로 가격을 매길 수 있게 해주고(토큰별이 아니라), 공개적으로 주장을 스트레스 테스트할 사람들 손에 모델이 들어가지 않게 해준다.

재정의가 중요한 이유

U1 Pro에서 흥미로운 점은 해상도나 벤치마크가 아니다. 산출물의 단위가 생성된 이미지가 아니라 완성된 결과물이어야 한다는 주장이다. 이 주장이 성립한다면, 디자이너의 일이 어떻게 생겼는지가 달라진다.

오늘날 이미지 모델을 잘 쓴다는 것의 상당 부분은 리롤하는 법을 아는 것이다. 어떤 프롬프트가 쓸 만한 결과를 내는지, 모델이 나머지 그림을 망가뜨리지 않게 편집을 어떻게 표현할지, 언제 포기하고 손으로 고칠지를 배운다. 그 기술은 실재하지만, 동시에 우회책이다. 모델이 일을 끝내는 데 서툴기 때문에 존재하는 기술이다.

스스로 검사하고 수정하는 모델은 그 기술을 사람에게서 기계로 옮긴다. 디자이너의 일은 생성을 쓸 만한 상태로 몰고 가는 것에서, 결과물이 무엇을 충족해야 하는지를 지정하는 쪽으로 이동할 것이다. 이는 벤치마크 점프보다 더 큰 변화이며, 여러 연구소가 동시에 밀고 있는 방향이다. 알리바바의 Qwen-Image-2.1은 같은 이유로 생성, 편집, 투명 출력을 하나의 모델로 합쳤다. 앤트의 Ming-Image-Layer는 같은 이유로 완성된 디자인을 다시 편집 가능한 조각으로 분해한다.

이미지 생성 경쟁은 이제 어떤 모델이 가장 예쁜 그림을 그리는지의 문제가 아니다. 실제로 제품을 내보내야 하는 사람에게 얼마나 적은 뒷정리를 남기는지의 문제다.

믿기 전에 확인할 것

U1 Pro를 평가한다면 세 가지가 중요하다. 8K 출력이 전체 크기에서도 일관성을 유지하는지, 큰 캔버스는 보통 텍스트와 레이아웃이 깨지는 지점이기 때문이다. 모델이 실제로 발행하는 언어의 텍스트를 제대로 다루는지, 인포그래픽은 읽을 수 있는 가장 작은 줄만큼만 좋기 때문이다. 그리고 자기 검사 루프가 실제 오류를 잡아내는지 아니면 그냥 덮어버리는지, 이는 알려진 오류가 있는 브리프를 넣어보고 그것을 지적하는지 확인해야만 알 수 있다.

이것들은 벤더 벤치마크가 답할 수 없는 질문이다. 또한 모델이 프로덕션 파이프라인에 들어갈지, 데모 폴더에 남을지를 결정하는 질문이기도 하다.

관련 글