← 블로그로
Ai약 13 분 읽기

FLUX 3 Image: 바운딩 박스, 4K 출력, 그리고 구성 파일로서의 레이아웃

게시일 2026년 10월 7일
FLUX 3 Image: 바운딩 박스, 4K 출력, 그리고 구성 파일로서의 레이아웃

Black Forest Labs가 10월 1일 FLUX 3 Image를 공개하며 FLUX 3 제품군의 이미지 구성 요소를 완성했습니다. 이 모델은 회사의 API와 플레이그라운드를 통해 이용할 수 있으며, 10월 8일까지 50% 출시 기념 할인이 적용되고, 향후 몇 주 내 오픈 웨이트 공개가 예고되어 있습니다.

이번 발표의 세 가지 핵심 주장은 네이티브 4K 출력, 요소 수준의 레이아웃 제어, 영역 보존 편집입니다. 각각을 하나씩 뜯어볼 가치가 있는데, 세 번째 기능이 마케팅이 시사하는 것보다 더 많은 일을 하고 있기 때문입니다.

그리드가 산문을 대체하다

FLUX 3 Image는 프롬프트에 덧붙인 바운딩 박스의 JSON 배열을 받으며, 이는 0-1000으로 정규화된 좌표 그리드로 표현됩니다. 각 요소에는 ID, 텍스트 설명, 그리고 [y_min, x_min, y_max, x_max] 형식의 박스가 지정됩니다. 그러면 모델은 출력 해상도와 무관하게 해당 요소를 그 박스 안에 배치합니다.

이것이 이번 릴리스의 중심축이며, 레이아웃을 지정하는 방식에 있어 진정한 전환점입니다. 대부분의 텍스트-투-이미지 워크플로에서는 공간 배치를 자연어로 설명하고("왼쪽 3분의 1 지점에 놓인 병, 오른쪽에서 들어오는 손") 모델은 이를 느슨한 선호로 해석합니다. 그 결과는 대개 설명 근처에 안착하지만, 때로는 그렇지 않은 출력 분포입니다.

좌표 그리드는 해석 단계를 없애줍니다. 더 이상 레이아웃을 설명하고 바라는 것이 아니라, 레이아웃을 선언하는 것입니다. 레이아웃 도구에서 작업하는 디자이너에게 이는 이미 익숙한 멘탈 모델에 그대로 대응합니다. 모두 같은 위치에 모델이 있어야 하는 수백 장의 제품 사진을 생성하는 파이프라인에게 이것은 미적 문제를 구성 문제로 바꿔줍니다.

어떤 좌표계든 따라오는 단서가 있습니다. 박스는 그 안에 무엇이 들어가야 하는지 모델에게 알려주지 않으며, 잘못된 객체를 지정한 설명은 자신 있게 잘못된 위치에 렌더링됩니다. 기하학적 정밀도가 곧 의미론적 정밀도로 이어지지는 않습니다.

업스케일 단계 없는 4K

FLUX 3 Image는 여러 화면비에 걸쳐 최대 5,456 x 3,072 픽셀(약 1,680만 화소)까지 슈퍼 해상도 처리를 거치지 않고 네이티브로 생성합니다.

대부분의 이미지 모델은 네이티브 기준으로 1024~2048픽셀에서 한계에 도달했고, 그보다 큰 출력은 이후 업스케일링으로 처리했습니다. 이는 화면 전달에는 문제없지만, 인쇄물, 이커머스 대표 이미지, 대형 디스플레이에서는 점점 어색해지는데, 후처리 단계가 바로 그 해상도를 정당화해 주는 텍스처 디테일을 매끄럽게 지워버리는 경향이 있기 때문입니다.

4K에서 생성하는 것은 워크플로가 검증해야 할 항목도 바꿉니다. 업스케일러는 고유한 실패 모드를 지닌 별도의 단계이며, 단계를 제거하면 한 범주의 품질 관리도 제거됩니다. 네이티브 출력이 단순히 눈에 띄는 아티팩트를 피하는 것을 넘어 원본 크기에서 견딜 수 있는지는 직접 테스트해야만 판가름 날 문제입니다.

영역 편집과 픽셀 동일성 주장

세 번째 기능은 부분 편집입니다. 지정된 바운딩 박스 영역만 다시 생성하고 그 밖의 모든 것은 그대로 둡니다. Black Forest Labs에 따르면 편집 후 픽셀의 67.8~89.7%가 비트 단위로 동일하게 유지됩니다.

이 범위는 넓고, 그 편차는 정보를 담고 있습니다. 하한은 손대지 않은 영역 전반에 걸친 의미 있는 드리프트를 시사하고, 상한은 사실상 진정한 마스크 편집에 가깝습니다. 특정 편집이 어디에 위치하는지는 재생성된 영역이 주변을 얼마나 제약하는지에 달려 있을 가능성이 큽니다. 조명 번짐, 그림자, 접촉 경계 모두 일관성을 위해 인접 픽셀을 바꾸려는 압력을 만듭니다.

그럼에도 픽셀 동일성 수치를 아예 공개했다는 것 자체가 유용한 행보입니다. 반복적 이미지 편집에서의 드리프트 문제는 지난 2년간 확산 모델 편집에 대한 핵심 불만이었습니다. 수정을 거듭할수록 만족했던 부분이 저하되다가, 결국 포기하고 처음부터 다시 시작하게 되니까요. 자신이 얼마나 보존하는지를 수치로 제시하는 모델은 최소한 목표치를 밝힌 셈입니다.

FLUX 3 Image는 또한 단일 요청에서 최대 10장의 참조 이미지를 받아들이며, 프롬프트와 바운딩 박스 레이아웃에 따라 피사체를 배치합니다. 이 조합(다중 참조 + 선언된 배치)에 이르면 모델은 이미지 생성기라기보다 생성 백엔드를 갖춘 합성 도구처럼 보이기 시작합니다.

10장의 참조는 '참조'가 무엇을 위한 것인지에 대한 질문도 제기합니다. 현재 대부분의 워크플로에서 참조 이미지는 스타일 전이를 의미합니다. 모델에 어떤 룩을 주면 그것을 근사하는 식입니다. 각 참조 피사체를 선언된 박스 안에 배치하는 것은 더 좁고 더 기계적인 약속입니다. '이 객체를, 여기에'라고 말하는 셈입니다. 모델이 부하가 걸린 상황(10개 피사체, 4K 캔버스, 겹치는 박스)에서도 이를 지키는지는 출시 글이 아니라 실제 프로덕션 사용에서 드러나는 종류의 문제입니다.

주목할 만한 학습 관련 언급

기술적 세부 사항 속에 묻혀 있는 내용: FLUX 3 Image는 Black Forest Labs의 Self-Flow 아키텍처로 이미지, 비디오, 오디오 데이터를 공동으로 학습했습니다. FLUX 3 베이스는 세 가지 모달리티를 모두 아우르는 멀티모달 플로 모델이며, 이미지 모델은 그중 하나의 면입니다.

이는 로드맵을 어떻게 읽어야 하는지에 중요합니다. 이미지, 비디오, 오디오가 학습 기반을 공유한다면, '몇 주 내 오픈 웨이트' 약속은 이번 릴리스를 넘어서며, 같은 베이스 위에 구축될 모델 제품군과 Google과 OpenAI의 폐쇄형 멀티모달 스택에 대한 오픈 웨이트 대안으로 자리매김하려는 회사를 이야기합니다.

이는 출시 순서도 설명해 줍니다. Black Forest Labs는 FLUX 3의 비디오와 오디오 구성 요소를 먼저 내놓고 정지 이미지 모델을 마지막에 공개했습니다. 이미지 생성으로 명성을 쌓은 회사라면 비디오 모델 다음에 이미지 모델을 내놓는 것은 이상한 순서입니다. 다만 이미지 모델이 공유 베이스 위에서 가장 완성하기 어려운 모델이라면 이야기가 달라집니다. 바운딩 박스 제어는 기능이라기보다 세 모달리티에 걸친 공동 학습이 세밀한 공간 충실도에 미치는 영향에 대한 우회책에 가까울 수 있습니다.

앞으로 지켜볼 것

당장의 실용적 해석은 더 좁습니다. FLUX 3 Image는 이전에는 합성 단계가 필요했던 레이아웃 제어, 업스케일러를 제거해 주는 네이티브 해상도, 그리고 공개된 충실도 수치를 동반한 영역 편집을 갖춘 유료 API 제품입니다. 이것들이 대안보다 나은지의 문제는 벤치마킹의 문제이며, 앞으로 몇 주간의 독립적 테스트는 바로 그것을 위한 것입니다.

가중치가 공개되면 세 가지를 추적할 가치가 있습니다. 첫째, 바운딩 박스 API가 오픈 릴리스에서도 온전히 살아남을지, 아니면 API 전용 기능이 될지입니다. 후자라면 유료와 무료 티어 사이에 의미 있는 분할이 생깁니다. 둘째, 커뮤니티 파인튜닝이 더 작은 하드웨어에서도 같은 레이아웃 정밀도를 달성할 수 있는지, 아니면 좌표 동작이 규모에 의존하는지입니다. 셋째, 픽셀 동일성 수치가 독립적 재현에서도 유지되는지, 아니면 유리한 편집에서의 최선의 측정치에 불과한 것으로 드러나는지입니다.

더 넓은 신호는 릴리스 노트가 거의 지나가듯 언급한 것입니다. 이미지 생성에서의 경쟁은 단일 출력이 얼마나 인상적인가에서, 백 번째 출력이 첫 번째와 일치하는가로 옮겨갔습니다. 레이아웃 그리드, 영역 보존, 픽셀 동일성 지표는 모두 그 질문에 대한 답입니다. 어느 것도 아름다운 이미지를 만들어 주지는 않습니다. 다만 반복 가능한 이미지를 만들어 줍니다.

관련 글