FLUX 3 Image, 이미지 생성을 레이아웃 파일로 바꾸다

Black Forest Labs는 10월 1일 FLUX 3 Image를 출시했고, 대부분의 보도는 해상도를 앞세웠습니다. 최대 4K 네이티브 출력, 약 1,680만 화소, 업스케일러가 끼어들지 않는 파이프라인. 확실한 업그레이드입니다. 동시에 이번 릴리스에서 가장 흥미롭지 않은 부분이기도 합니다.
문서를 읽어볼 가치가 있는 부분은 입력 형식입니다. FLUX 3 Image는 문단 하나와 소원 하나를 원하지 않습니다. 표를 원합니다.
모든 요소에 주소가 부여된다
생성 요청은 요소들의 JSON 배열입니다. 각 요소는 고유 ID, 정규화된 0~1000 그리드 위에 `[y_min, x_min, y_max, x_max]` 형식으로 표기된 바운딩 박스, 그리고 그 자리에 무엇이 들어가야 하는지에 대한 자연어 설명을 담습니다. 배경 블록은 전체 캔버스를 차지합니다. 제품은 `[400, 200, 950, 800]`에 놓입니다. 로고는 왼쪽 상단 모서리에 자리합니다. 장면 프롬프트는 여전히 존재하지만, 이제는 전체 브리프가 아니라 여러 입력 중 하나일 뿐입니다.
그리드는 해상도에 독립적입니다. 동일한 레이아웃 JSON이 768픽셀 폭에서도, 네이티브 4K에서도 같은 구도를 렌더링합니다. 즉, 저렴한 시안에서 테스트한 레이아웃이 비싼 최종 결과물에서도 그대로 나온다는 뜻입니다.
편의 기능처럼 들립니다. 하지만 실제로는 이 모델을 누가 호출할 수 있는지를 바꿔 놓습니다. BFL은 언어 모델이 한 줄짜리 브리프와 목표 가로세로 비율만으로 요소 테이블을 작성할 수 있도록 설계했습니다. 에이전트는 의도를 산문으로 옮기고 잘 되기를 바랄 필요가 없습니다. 스프레드시트를 배치하듯 이미지를 배치할 수 있고, 요소 ID는 이후 턴에서 참조할 수 있는 핸들로 살아남습니다.

더 저렴한 결과도 있습니다. 그리드가 해상도에 독립적이기 때문에, 레이아웃을 768픽셀에서 훨씬 적은 비용으로 검증한 뒤 구도를 그대로 유지한 채 4K로 렌더링할 수 있습니다. 반복 작업과 최종 납품이 예산을 두고 서로 충돌하지 않게 되며, 이는 동일한 템플릿으로 수십 장의 이미지를 제작하는 사람에게 중요합니다.
픽셀 고정과 드리프트 문제
편집도 같은 논리를 따릅니다. 원본 바운딩 박스와 대상 바운딩 박스를 지정하고, 이동·교체·삭제할 요소를 고르면, 해당 영역 밖의 픽셀은 정확히 원래 자리에 남아 있어야 합니다. BFL 자체 측정에 따르면 손대지 않은 영역의 비트 단위 동일성 충실도는 67.8~89.7퍼센트이며, 이 범위는 편집이 얼마나 복잡한지에 따라 달라집니다.
정직한 부분은 표현입니다. 출시 데모는 "다른 어떤 픽셀도 바꾸지 않고" 편집한다고 약속합니다. API 문서는 손대지 않은 픽셀이 "일반적으로" 그대로 유지된다고 말하며, BFL은 편집이 지정된 박스를 넘어갈 수 있음을 인정합니다. 경계 아티팩트는 실제로 존재합니다. 이걸 파이프라인에 넣으려는 팀이라면 데모를 믿기보다 수용 테스트를 만들어야 합니다.
그래도 일반적인 인페인팅과의 비교는 접전이 아닙니다. 전통적인 인페인팅은 건드리지 말라고 지정한 영역에서도 미세한 드리프트를 남깁니다. 한 번의 편집으로는 아무도 눈치채지 못합니다. 그러나 열 단계의 승인 사이클을 거치면 배경은 밀렸고, 타이포그래피는 흐려졌으며, 구도는 세 라운드 전에 클라이언트가 승인한 것과 더 이상 일치하지 않습니다. 이러한 누적이 바로 긴 편집 체인을 사용할 수 없게 만드는 원인이며, 바운딩 박스가 막고자 하는 바로 그 지점입니다.
크리에이터들이 실제로 발견한 것
동일한 편집 지시를 Midjourney, Ideogram 4.5, FLUX 3 Image에 각각 적용해 본 한 크리에이터가 유용한 비교를 올렸습니다. 의상을 흰 꽃이 달린 분홍 실크와 커스터드 옐로 리본으로 바꾸고, 얼굴과 손의 매크로 클로즈업을 요청한 테스트에서 Midjourney는 클로즈업은 잘 처리했지만 흰 꽃과 정확한 색조를 놓쳤습니다. Ideogram 4.5는 의상 변경은 일치시켰으나 매크로 샷의 조명이 어색해 보였습니다. FLUX 3 Image는 의상 변경을 일치시켰고 클로즈업의 조명과 맥락에서 호평을 받았습니다. 별도의 테스트에서는 작은 열 편집을 의도한 객체에만 국한시킨 반면, 나머지 두 모델은 변경을 더 넓게 퍼뜨렸습니다.
크리에이터 한 명의 스레드는 벤치마크가 아닙니다. 이 모델이 강점을 보이는 지점, 즉 넓은 스타일라이제이션보다 세밀한 디테일 지시 이행에 강하다는 신호로 받아들이면 됩니다.
바운딩 박스가 해결하지 못하는 것
배치와 드리프트는 두 가지 문제일 뿐, 전부가 아닙니다. 박스는 무엇이 어디에 가야 하는지 알려줄 뿐, 그 대상이 어떤 모습이어야 하는지는 알려주지 않으며, 한번 배치된 참조 요소가 스타일을 바꾸는 것도 막지 못합니다. 하나의 제품을 서로 다른 서른 개의 배경과 함께 생성하는 팀은 여전히 제품 자체의 일관성을 유지해야 하고, 그 작업은 좌표가 아니라 참조 이미지와 프롬프트에 달려 있습니다.
텍스트 렌더링은 또 다른 열린 틈새입니다. BFL의 자체 데모 이미지들은 사람이 다듬은 프롬프트에서 나온 것입니다. 레이아웃 모델이 작은 박스 안에 특정 폰트로 읽을 수 있는 텍스트를 안정적으로 배치하는지는 별개의 질문이며, 출시 자료는 이에 답하지 않습니다. 이번 릴리스가 겨냥한 잡지 레이아웃과 이커머스 작업에서는 바로 이 디테일이 도입을 결정합니다.
구조화된 입력이라고 해서 미학에 관한 한 모델이 블랙박스에서 벗어나는 것도 아닙니다. 로고가 왼쪽 상단 모서리에 들어간다고 지정할 수는 있습니다. 구도가 차분하게 느껴져야 한다고 지정할 수는 없습니다.
헤드라인에 없던 트레이드오프
바운딩 박스는 "배경을 파랗게 만들어"라고 타이핑하는 것보다 준비 비용이 더 큽니다. 무엇이 어디에 가야 하는지 알아야 합니다. 일회성 이미지라면 그 오버헤드는 아마 그만한 가치가 없을 것입니다. 동일한 레이아웃을 스무 장의 제품 사진에 걸쳐 재생성하는 파이프라인이나, 로고를 안정적으로 어딘가에 배치해야 하는 에이전트라면 빠르게 본전을 뽑습니다.
출시 가격은 10월 8일까지 50퍼센트 할인입니다. 768픽셀 이미지 약 $0.0205부터 4K $0.3035까지이며, 참조와 프롬프트가 포함되고 실패한 생성에는 요금이 부과되지 않습니다. 상업용 자체 호스팅 가중치는 BFL에 문의하면 이용할 수 있고, 오픈 가중치 에디션은 향후 몇 주 내에 공개될 예정입니다.
참조 처리 방식은 따로 짚을 가치가 있습니다. 한 번의 호출에 최대 10개의 참조 이미지를 받을 수 있고, 각 요소에 어느 참조에서 와서 어디에 속하는지 지정할 수 있습니다. 참조 10개만으로는 특별할 게 없습니다. 하지만 10개의 참조가 각각 캔버스의 특정 박스에 매핑된다면, 이는 기존 자산으로 구도를 조립하는 워크플로입니다. 프롬프트가 작동하는 방식보다 디자이너가 일하는 방식에 더 가깝습니다. 여기에 레이아웃 그리드를 결합하면, 이 모델은 화가라기보다 자기 의견을 가진 합성기처럼 보이기 시작합니다.
더 큰 그림은 이미지 API가 수년간 한 가지 질문을 중심으로 최적화되어 왔다는 점입니다. 그림이 얼마나 잘 나오는가? FLUX 3 Image는 에이전트가 더 중요하게 여기는 두 번째 질문을 추가합니다. 그림의 한 부분을 지정해서 바꾸고 나머지는 그대로 둘 수 있는가? 답이 '그렇다'가 되는 순간, 이미지 생성은 슬롯머신이기를 멈추고 편집할 수 있는 파일처럼 동작하기 시작합니다.
이 차이 때문에 Midjourney, Ideogram과의 비교는 처음 보이는 것보다 덜 중요합니다. 그 모델들은 새로 만든 이미지가 얼마나 아름다운지를 두고 경쟁하며, 그 점에서는 여전히 매우 뛰어납니다. BFL은 생성된 이미지를 안정적인 영역을 가진 문서로 다룰 수 있는지를 두고 경쟁하며, 이는 다른 승자가 나올 다른 경쟁입니다. 첫 번째 경쟁은 거의 결판났고 두 번째 경쟁은 막 시작되었는데, 이는 대략 인프라 배팅이 있고 싶어 하는 자리입니다.
관련 글
AI 비디오 도구, 사용 편의성은 10점 만점에 9점. 컴플라이언스 점수는 다른 이야기다.
사용자들은 AI 비디오 생성기를 좋아한다. 법무팀은 아직 검토 요청을 받지 않았다.
InternLumina-U2, 텍스트·이미지·비디오·3D를 단일 16B 모델에 담고 두 세트의 가중치를 공개하다
작업 목록은 야심 차다. 공개 형식이 더 많은 신호를 담고 있다.
HappyOyster는 보는 클립이 아니라 걸어 들어갈 수 있는 세계를 판다
대부분의 비디오 모델은 파일 하나를 건네줍니다. 이 모델은 문이 있는 방을 건네줍니다.
Luma Ray3 Modify, 연기는 그대로 두고 주변 세계를 다시 협상하다
AI 영상 편집에서 가장 어려운 문제는 효과가 아니다. 이미 비용을 치른 테이크를 망가뜨리지 않는 일이다.