Flux 3와 Imagen 4, Replicate에 상륙하다 — 이미지 진열대는 포화 상태

10월 1일, Black Forest Labs와 Google이 같은 날 Replicate에 새 이미지 모델을 올렸습니다. Black Forest Labs는 최대 10장의 참조 이미지를 지원하는 텍스트-투-이미지 및 편집용 Flux 3를 출시했습니다. Google은 네 가지 모델을 공개했습니다. 속도와 비용을 위한 Imagen 4 fast, 디테일을 위한 Imagen 4 ultra, 가격에 민감한 작업을 위한 Imagen 3 fast, 최고 품질 출력을 위한 Imagen 3입니다. 이미 사용 중인 동일한 API로 호출할 수 있습니다.
헤드라인만 보면 모델 출시처럼 읽힙니다. 실상은 유통 발표에 가깝습니다. 이 모델들은 모두 이미 어딘가에 존재하고 있었습니다. 달라진 것은 Replicate 토큰을 가진 개발자가 Black Forest Labs에 계정을 만들거나 Google Cloud 프로젝트를 연결하지 않고도 이들에 접근할 수 있게 되었다는 점입니다.
참조 이미지 10장이 실제로 사주는 것
잠시 멈춰 볼 숫자는 Flux 3의 참조 이미지 10장입니다. 1년 전만 해도 이미지 편집은 입력 이미지 한 장과 텍스트 지시문이 전부였습니다. 참조가 10장이 되면 모델에 요구할 수 있는 일이 달라집니다. 제품 사진 한 장, 두 번째 이미지의 텍스처, 세 번째 이미지의 색상 팔레트, 네 번째 이미지의 얼굴을 건네고 이 모두를 반영한 구도를 요청할 수 있습니다.
이는 시장 전체가 달려온 역량입니다. Nano Banana Pro는 최대 14장의 이미지와 5명의 인물을 합성합니다. GPT Image 2.5 Sunburst는 나머지를 건드리지 않고 한 영역만 바꾸는 능력으로 Artificial Analysis 편집 보드를 이끕니다. Seedream 5.0은 편집에 현실 세계의 참조가 필요할 때 실시간 웹 검색을 활용합니다. 경쟁의 기준선은 첫 이미지가 얼마나 잘 나오는가에서, 열 번째 편집에서 모델이 지시를 얼마나 잘 따르는가로 옮겨갔습니다.

이런 도구 위에 제품을 만드는 사람에게 참조 이미지 개수는 벤치마크 점수보다 유용한 스펙입니다. 사용자에게 얼마나 많은 통제권을 넘길 수 있는지를 알려주기 때문입니다. 참조를 한 장 받는 모델은 텍스트-투-이미지 버튼에 어울립니다. 열 장을 받는 모델은 사용자가 승인된 에셋 폴더에서 브랜드 소재를 조립하는 디자인 도구에 어울립니다.
Google의 네 모델은 사실상 두 계층
Google의 라인업은 네 개의 릴리스처럼 보입니다. 이름을 들여다보면 비용으로 나뉜 두 모델입니다. Imagen 4 fast와 Imagen 4 ultra는 같은 생성 과정을 돌리되 하나는 저렴함에, 하나는 디테일에 맞춰 조정되었습니다. Imagen 3 fast와 Imagen 3도 마찬가지입니다. fast 변형이 의미 있는 수준에서 더 나쁜 모델인 것은 아닙니다. 같은 모델에 더 낮은 컴퓨트 예산을 배정해 더 낮은 가격에 파는 것입니다.
이는 이미지 생성을 파는 합리적인 방식이며, 동시에 비용이 어디에 있는지에 대한 힌트이기도 합니다. fast와 ultra 등급의 유일한 차이가 모델이 생각할 수 있는 시간이라면, 모델 자체는 더 이상 제품이 아닙니다. 컴퓨트가 제품이 되었고, 모델은 그것을 소비하는 존재입니다.
프로덕션에서 무엇을 돌릴지 결정하는 팀에게 이는 계산을 바꿉니다. 질문은 네 가지 중 무엇이 최고인가가 아닙니다. 여러분의 사용 사례에 실제로 필요한 품질 수준이 무엇인가입니다. fast만 있으면 되는 사용 사례에 ultra 비용을 내는 것은 사용자가 알아채지도 못할 것을 개선하지 않고 돈을 태우는 방법이기 때문입니다.
플랫폼에 등재된다는 것의 실제 가치
모델이 Replicate에 올라가는 것이 왜 뉴스인지 정확히 짚어볼 필요가 있습니다. Replicate는 호스팅 추론을 임대합니다. 개발자는 한 번 가입하고 토큰을 받아 카탈로그의 어떤 모델이든 같은 인터페이스로 호출합니다. Black Forest Labs와 Google에게 등재는, 특정 모델 하나 때문에 별도 계정을 열 일이 없는 개발자에게 도달하고 그 도달 범위에 대해 플랫폼에 비용을 지불한다는 뜻입니다.
이것이 오픈 모델 제작자들이 강제로 받아들인 거래입니다. 가중치를 공개하면 기술에 호기심 있는 사람들이 누구에게도 비용을 들이지 않고, 랩에는 수익도 없이 돌릴 수 있습니다. 호스팅 플랫폼에 등재하면 엔드포인트와 월 청구서를 원하는 사람들까지 대상이 넓어지지만, 중간자가 몫을 가져가고 모델은 선택기 안에서 수십 개 경쟁자 옆에 놓입니다.
대안은 직접 접근을 파는 것이며, 이는 클로즈드 모델이 하는 일이고 대부분의 랩이 규모 있게 할 수 없는 일입니다. 그래서 호스팅 플랫폼은 오픈 모델과 클로즈드 모델이 같은 개발자를 두고 같은 페이지에서 평가받는 중립 지대가 됩니다. 좋은 가중치를 가진 작은 랩이 이제 Google 릴리스 옆에 나란히 설 수 있으며, 이는 어느 쪽에 서 있느냐에 따라 건강한 경쟁일 수도, 상품화 경쟁일 수도 있습니다.
구매자에게는 실질적인 결과가 하나 있습니다. 오늘 고른 모델이 이미 익숙한 인터페이스로 접근 가능하다는 점은 전환 비용을 낮추고 실험을 저렴하게 만듭니다. 동시에, 같은 진열대가 모두에게 열려 있으므로 오늘 고른 모델은 아마 특별하지 않을 것이라는 뜻이기도 합니다.
그날의 나머지 소식
같은 날 더 작은 릴리스들이 다양하게 쏟아졌습니다. Cloudflare는 이미지-텍스트-투-텍스트 모델 Clef를 Hugging Face에 공개했습니다. ISTA-DASLab은 Qwen3.8 Flash의 GGUF 빌드를 공개했는데, 이는 주로 모델을 로컬에서 돌리는 사람들에게 중요한 소식입니다. Vercel의 AI Gateway는 확률 점수로 지원 요청과 에이전트 워크플로를 라우팅하는 결정 모델 Laya를 추가했고 10월 말까지 무료로 제공하며, Microsoft 오디오 모델과 Browserbase의 검색 도구도 함께 넣었습니다. Google은 시각장애 및 저시력 사용자를 위해 만든 실시간 시각 지원 기능을 Gemini Live에 추가했습니다.
이 중 어느 것도 그 자체로 이미지 파이프라인을 바꾸지는 않습니다. 그러나 함께 보면 플랫폼 벤더들이 어디로 밀고 있는지 드러납니다. Replicate, Vercel, Hugging Face는 개발자가 모델을 고르는 장소가 되기 위해 경쟁하고 있고, 경쟁 방식은 카탈로그를 더 넓히고 청구를 더 단순하게 만드는 것입니다. 모델 랩들도 이득입니다. 플랫폼을 통한 유통이야말로 작은 랩이 별도 계약을 맺지 않을 개발자에게 도달하는 방법이기 때문입니다.
이것이 모든 오픈 모델 제작자가 마주한 거래입니다. 가중치를 공개하고 커뮤니티가 돌리게 하면 비용이 들지 않고 기술에 호기심 있는 사람들에게 도달합니다. 또는 호스팅 플랫폼에 등재해 엔드포인트와 청구서를 원하는 개발자에게 도달하면 더 많은 사람에게 닿지만 플랫폼에 몫을 떼어줍니다. Flux 3가 Replicate에 있다는 것은 Black Forest Labs가 두 번째 대상이 간절해 기꺼이 나눠 갖겠다는 뜻입니다.
선택하는 입장이라면 무엇을 의미하나
이 모든 것의 실질적 효과는 진열대가 붐비고 라벨을 읽기가 점점 어려워진다는 것입니다. 네 개의 Imagen 모델, 하나의 Flux 릴리스, 그리고 긴 꼬리의 커뮤니티 빌드가 모두 파이프라인의 같은 자리를 두고 경쟁합니다. 중요한 차이는 마케팅이 시사하는 것보다 좁습니다.
확정하기 전에 세 가지를 확인할 가치가 있습니다. 모델이 참조 이미지를 몇 장 받는지, 이것이 통제의 상한을 결정합니다. 라이선스가 상업적 사용을 허용하는지, 여기서 Apache-2.0과 비상업용 빌드가 갈립니다. 그리고 여러분의 배포 방식에 맞는 곳에서 사용 가능한지, 사용할 수 없는 플랫폼 뒤에 있는 훌륭한 모델은 사용할 수 없는 모델이기 때문입니다.
어느 것도 화려하지 않고, 어느 것도 출시 포스트에는 없을 것입니다. 그러나 발표가 스크롤되어 사라진 6개월 뒤에도 그 모델이 제품에서 작동하는지를 결정하는 것은 바로 이 부분입니다.
관련 글
AI 비디오 도구, 사용 편의성은 10점 만점에 9점. 컴플라이언스 점수는 다른 이야기다.
사용자들은 AI 비디오 생성기를 좋아한다. 법무팀은 아직 검토 요청을 받지 않았다.
InternLumina-U2, 텍스트·이미지·비디오·3D를 단일 16B 모델에 담고 두 세트의 가중치를 공개하다
작업 목록은 야심 차다. 공개 형식이 더 많은 신호를 담고 있다.
HappyOyster는 보는 클립이 아니라 걸어 들어갈 수 있는 세계를 판다
대부분의 비디오 모델은 파일 하나를 건네줍니다. 이 모델은 문이 있는 방을 건네줍니다.
Luma Ray3 Modify, 연기는 그대로 두고 주변 세계를 다시 협상하다
AI 영상 편집에서 가장 어려운 문제는 효과가 아니다. 이미 비용을 치른 테이크를 망가뜨리지 않는 일이다.