← 블로그로
Ai약 10 분 읽기

Iris-3B, VAE 없이 픽셀을 직접 생성한다

게시일 2026년 10월 11일
Iris-3B, VAE 없이 픽셀을 직접 생성한다

인기 있는 이미지 생성기는 거의 모두 내부 구조가 같다. 픽셀을 직접 그리지 않고, 먼저 VAE(변분 오토인코더)라 불리는 부품으로 이미지를 더 작은 추상 표현으로 압축하고, 그 압축 공간에서 생성한 뒤 픽셀로 되돌린다. 이 2단계 설계는 효율적이고, 작은 결함의 상당수도 여기서 온다. 작은 글자는 번지고, 얇은 선은 흔들리고, 세부는 왕복 과정에서 사라진다.

2026년 10월, Speridlabs라는 작은 팀이 Iris-3B를 공개했다. 30억 파라미터 모델로, 그 왕복을 통째로 건너뛰고 픽셀을 직접 생성한다. 가중치는 Apache 2.0으로 공개됐고, 전체는 flow-matching transformer로 구축됐다. 이달 가장 크거나 화려한 이미지 모델은 아니지만, 시사하는 바에서는 가장 흥미로운 하나일 수 있다.

VAE를 건너뛰는 것이 중요한 이유

VAE는 생성을 저렴하게 만들기 위해 존재한다. 압축된 잠재 공간에서 작업하면 필요한 연산을 크게 줄일 수 있어, 거의 모든 확산 모델이 이를 쓴다. 대가는 인코더가 생성이 시작되기도 전에 정보를 버리고, 디코더가 그것을 추측해 되돌려야 한다는 점이다. 저해상도에서는 보이지 않지만, 고해상도이거나 글자가 빽빽하고 경계가 정확한 이미지에서는 생성기가 세부 주변에서 흔히 내는 번짐으로 나타난다.

픽셀 공간에서 생성하면 이 병목이 사라진다. 압축 단계가 아무것도 잃지 않기 때문이다. 대가는 훨씬 큰 값 격자에서 작업해야 해 비용이 크다는 점이다. Iris-3B의 주장은 충분히 작아서 그 비용을 감당 가능한 범위에 둘 수 있다는 것이다. 실제로 성립하는지는 커뮤니티가 시험할 일이지만, 방향은 분명하다. 효율이 오를수록 VAE의 화질 대가를 받아들일 이유는 약해진다.

{{INLINE1}}

두 번째 장치: 생성 사전분포를 시각 작업에 쓰기

Iris-3B의 더 이례적인 점은 다른 일도 한다는 것이다. 모델은 생성 사전분포를 세부가 중요한 시각 작업, 즉 깊이 추정과 이미지 복원에 적용한다. 쉽게 말해, 이미지를 만들도록 학습된 모델에게 이미지에서 정보를 복원하게 시킬 수도 있다. 물체가 얼마나 멀리 있는지 추정하거나, 손상된 사진을 깨끗하게 만드는 일이다.

이는 의미 있는 조합이다. 더 넓은 흐름을 가리키기 때문이다. 한때 생성과 이해는 별개의 문제, 별개의 모델로 여겨졌다. 최근에는 합쳐지고 있다. 그럴듯한 이미지를 낼 수 있는 시스템은 장면이 어떻게 구성되고, 빛이 어떻게 떨어지며, 물체가 공간에서 어떻게 관계하는지를 이미 깊이 이해한다. 그 이해를 분석 작업에 재사용하는 편이 작업마다 전용 모델을 훈련하는 것보다 저렴하다.

flow matching이란 무엇인가

Iris-3B는 flow-matching transformer에 기반한다. 개념은 이름보다 이해하기 쉽다. 이전 이미지 모델은 이미지에 무작위 노이즈를 조금씩 더해 지워가는 과정을 거꾸로 학습하고, 생성 시에는 그 과정을 반대로 돌려 노이즈를 단계적으로 제거하며 이미지를 떠올린다. flow matching은 더 직접적인 길을 택한다. 노이즈에서 이미지로 가는 거의 곧은 경로를 학습하고, 구불구불한 경로를 학습하지 않는다. 이론상 더 적은 단계와 연산으로 좋은 결과에 도달한다.

이는 픽셀 공간 모델에 특히 중요하다. 원시 픽셀에서 작업하면 비용이 크고, 이를 억제하는 통상적 방법은 각 단계를 효율화하는 것이다. 곧은 경로는 단계 수를 줄이며, 그것이 30억 파라미터 모델이 원래는 VAE 지름길로만 감당하던 작업에 도전할 수 있는 이유 중 하나다. 설계와 규모는 한 세트이고, 어느 하나만으로는 부족하다.

독립적 시험이 이 거래의 손익을 결정한다. 픽셀 공간 생성이 잠재 공간 생성과 비슷한 비용으로 맞먹는다면 VAE는 기본값이 아니라 선택지가 된다. 아니라면 Iris-3B는 '벽이 어디에 있는가'를 보여주는 유용한 데이터 포인트로 남는다.

작은 오픈 모델은 무엇에 쓰이는가

Iris-3B는 어떤 리더보드에서도 거인을 넘지 못한다. 30억 파라미터는 상업 리더의 일부에 불과하고, 그 크기의 범용 모델은 가장 어려운 프롬프트에서 진다. 그 기준으로 재면 핵심을 놓친다.

이 규모의 오픈 모델은 세 가지 방식으로 자기 자리를 번다. 이미 가진 하드웨어에서 돌아가므로 이미지당 과금도, 밖으로 나가는 데이터도 없다. 좁은 용도로 미세조정할 수 있고, 여기서 작은 모델이 큰 모델을 이기는 일이 많다. 기업의 제품 사진에 맞춰 훈련한 모델은 그 특정 작업에서 범용 모델을 이긴다. 그리고 검사 가능하며, 출력이 어디서 왔는지 설명해야 하는 팀에 중요하다.

이 세 가지를 동시에 가능하게 하는 세부가 Apache 2.0이다. 관대한 라이선스가 있으면 스타트업이 조건 협상이나 향후 가격 변동 걱정 없이 Iris-3B 위에 제품을 만들 수 있다. 자기 설계를 퍼뜨리려는 연구팀에게 그것은 관련성에 이르는 가장 빠른 길이다. 모델은 벤치마크를 이길 필요가 없다. 다른 누군가가 그것으로 무언가를 만들면 된다.

모든 오픈 공개에 적용되는 주의

모든 오픈 모델에 적용되는 주의가 하나 있고, Iris-3B도 예외가 아니다. 관대한 라이선스가 덮는 것은 가중치이며, 훈련 데이터도 출력도 아니다. 상업적으로 내보낼 팀은 무엇에서 배운 모델인지, 생성된 이미지에 어떤 권리가 붙는지를 여전히 따져야 한다. 이것은 라이선스가 답할 수 없는 법적 문제이며, 모든 오픈 모델이 던지는 같은 질문이다. 직접 모델을 돌릴 자유는 실재하고 가치 있지만, 책임으로부터의 자유와는 같지 않다.

더 큰 그림

2026년 10월의 이미지 분야는 위에서 보면 붐빈다. Nano Banana 2.1, GPT Image 2.5, FLUX 3, Seedream 5.0이 최근 업데이트를 내놨고, 최전선의 진전은 아주 작은 차이로 측정된다. 그 아래에서 더 흥미로운 움직임은 설계에 있다. 픽셀 공간 생성은 첫 확산 모델 이래 계속된 전제에 의문을 던진다. 만들려면 먼저 압축해야 한다는 전제다. 그리고 작은 오픈 모델은 아이디어를 분야 전체로 퍼뜨리는 가장 빠른 방법이 그것을 내주는 일임을 계속 증명한다.

Iris-3B는 각주로 끝날 수도 있고, 다른 누군가가 베낄 버전이 될 수도 있다. 어느 쪽이든 제기하는 두 질문은 지켜볼 만하다. 손실 있는 중간 단계 없이 모든 세부를 갖춰 이미지를 생성할 수 있는가, 그리고 하나의 모델이 만들면서 분석할 수 있는가. 답이 '가능하다'가 된다면, 다음 세대 이미지 도구는 이전 세대와 다른 토대 위에 세워질 것이다.

관련 글