오픈소스 이미지 생성, 소비자용 그래픽카드 한 장으로 압축되다: Hunyuan DiT가 진입 장벽을 6GB VRAM까지 낮추다

지난 한 해 동안 오픈소스 텍스트-투-이미지(text-to-image) 업데이트는 대부분 화질을 중심으로 돌아갔다. 누구의 글자가 더 선명한지, 누구의 빛과 그림자가 더 사진처럼 보이는지가 순위표에서 며칠 더 머무는 기준이었다. 그런데 이번 10월에는 바람이 조금 바뀌었다. 커뮤니티의 논의 초점은 더 이상 “어떤 이미지가 더 예쁜가”가 아니라 “내 그래픽카드로 과연 돌아가긴 하는가”다.
6GB VRAM이라는 선은 이를 악물고 깎아낸 결과다
텐센트의 Hunyuan 텍스트-투-이미지 대형 모델(Hunyuan DiT)이 최근 공개한 소식 중 가장 실용적인 것은 “소형 VRAM 버전”을 오픈소스로 공개했다는 점이다. 공식 설명에 따르면 6GB VRAM만으로도 실행할 수 있다. 이 숫자가 얼마나 큰 의미인지는 오픈소스 이미지 생성 모델을 써본 사람이라면 안다. 그전까지 로컬에서 제대로 된 텍스트-투-이미지 모델을 돌리려면 16GB VRAM이 사실상 출발선이었고, 8GB는 간신히 되는 수준, 6GB는 아예 시작도 하지 말라는 분위기였다.

뒷받침하는 작업도 이어졌다. 이 버전은 LoRA, ControlNet 같은 플러그인까지 Diffusers 라이브러리에 함께 맞춰 넣었고, Kohya 그래픽 인터페이스 지원도 추가했다. 커뮤니티에서 Kohya의 역할은 “내 LoRA 직접 학습시키기”를 명령줄의 장벽에서 끌어내 몇 번의 마우스 클릭으로 만드는 것이다. 이것이 연동되었다는 것은 “모델이 내 화풍을 배우게 하고 싶다”는 길을 평탄하게 닦았다는 뜻이다.
동시에 Hunyuan DiT 본체는 1.2 버전으로 올라갔고, 공식적으로 내세운 개선점은 화면 텍스처와 구도에 집중되어 있다. 이 두 가지는 오픈소스 모델이 오랫동안 비판받아 온 지점과 정확히 맞물린다. 디테일이 많아지면 뭉개지고, 구도가 복잡해지면 흩어진다는 점이다.
또 다른 소식은 더 쉽게 지나칠 수 있지만 매우 핵심적이다. 텐센트가 Hunyuan의 태깅 모델인 “Hunyuan Captioner”도 오픈소스로 공개한 것이다. 태깅 모델은 LoRA 학습의 첫 번째 공정이다. 먼저 기계가 각 소재를 읽을 수 있는 문장으로 풀어내야 학습을 논할 수 있다. 과거에는 이 단계에서 폐쇄형 API를 쓰거나 품질이 들쭉날쭉한 대체품을 써야 했다. 이것이 오픈소스화되면서 로컬 학습 체인에서 외부 서비스 의존이 하나 더 줄었다.
오픈소스 모델이 돌아가기 시작하자, 커뮤니티는 “수리”에 바빠졌다
Hunyuan 쪽 진전은 길을 넓히는 일이라면, 커뮤니티는 다른 축에 패치를 대고 있다. Qwen-Image 2.1이 오픈소스로 공개된 뒤 대량의 2차 창작이 일어났고, 그에 따라 집중적인 수정 물결이 뒤따랐다.
비교적 대표적인 조합은 Qwen-Image-2.1-viggle-turbo다. 7.26GB, 6스텝 추론, int8 양자화로, 빠르게 캐릭터 설정 이미지를 뽑아낼 때 자주 쓰이며, 여기에 676MB의 texture-fix VAE를 붙여 텍스처를 보완한다. 다른 작성자의 Fix v2.0은 Qwen 특유의 노이즈와 어수선한 디테일을 제거하면서 구도는 거의 건드리지 않는다고 주장한다. 또 하나의 Opinionated 버전은 화면이 더 날카롭지만, 그 대가로 화면이 약간 움직인다. 작성자는 이를 RES4LYF에서 파생된 res_2m_nc 샘플러 세트와 함께 묶어 공개했다.
이런 패치들은 사소해 보이지만 한 가지를 말해준다. 오픈소스 모델이 실제 제작에 들어갔을 때, 그것이 정말 쓸 만한지를 결정하는 것은 대개 공개 당일의 버전이 아니라, 이후 몇 주 동안 커뮤니티가 기꺼이 수정 작업을 해주는지 여부다.
커뮤니티에는 바로 따라 쓸 수 있는 파라미터도 쌓였다. 누군가는 Qwen 2.1에 LoRA를 로드한 뒤 CFG는 2.0~3.0, 40스텝, 샘플러는 res_multistep 또는 beta를 쓰라고 권했다. 또 다른 사람은 LoRA 없이 2.0MP 표준 워크플로를 돌리며, 새 버전 Qwen 이미지 모델에서 예전에는 폐쇄형 모델에서만 보던 Midjourney 같은 느낌이 난다고 말했다.
속도에서도 뚜렷한 진전이 있다. Krea 2 Turbo의 2스텝 증류 LoRA 체크포인트는 1024x1024 디노이징 시간을 76.4초에서 19.3초로, 약 4배 줄였다. 대가는 디테일 질감이 교사 모델의 0.97~1.09배 수준에 그친다는 점이다. 이는 네이티브 Turbo 2스텝의 0.40~0.65배보다 훨씬 낫지만, 클로즈업 계열 화면에서 가장 잘 나오고 큰 장면은 아직 조금 아쉽다.
겸사겸사 메워진 작은 빈틈들
메인 모델 외에도 커뮤니티에서 소수지만 평판이 안정적인 오픈소스 모델 몇 가지가 조금씩 약점을 메우고 있다. Anima의 Aesthetic v1.1과 One Obsession v4는 스타일화된 결과물을 만들 때 자주 쓰인다. 사용자들은 스타일을 잘 따라주고 프롬프트를 쓰기 쉽다고 칭찬하며, 시드를 고정한 뒤 프롬프트만 바꾸면 일관된 변형을 얻을 수 있고 짧은 텍스트도 렌더링할 수 있다고 말한다. 약점도 솔직하다. 다중 캐릭터 동시 등장과 긴 텍스트는 여전히 버겁고, 커뮤니티는 Anima 2를 기다리고 있다.
Krea 2 쪽에서는 “시드를 바꿔도 비슷해 보인다”는 불만이 집중되자, 누군가 LoRA를 추가하지 않고 모델 전용 노드도 설치하지 않는 방법을 찾아냈다. ComfyUI의 텍스트 인코더(예: Qwen3VL 4B)를 LLM처럼 재사용해 프롬프트를 확장하고, 프롬프트 시드는 거친 조정 손잡이로, 샘플링 시드는 미세 조정 손잡이로 쓰는 방식이다. 이런 “현장식 방법”은 빠르게 퍼지며, 종종 공식 문서보다 실제 문제를 더 잘 해결한다.
문턱이 내려간 뒤, 겨루는 것은 무엇인가
이 움직임들을 함께 놓고 보면 방향은 분명하다. 오픈소스 이미지 생성은 더 이상 “비슷하게 그릴 수 있는가”만 답하지 않는다. 이제 두 가지 질문에 답하기 시작했다. 내가 살 수 있는 기계에서 돌아가는가, 그리고 내 의도대로 정확히 고칠 수 있는가.
Hunyuan이 VRAM을 6GB로 낮추고 태깅 모델을 오픈소스화한 것은 첫 번째 질문에 대한 답이다. Qwen 커뮤니티의 그 수정판들과 가속 LoRA는 두 번째 질문 중 “정확하게 고치기”와 “빠르게 돌리기”에 대한 답이다. 두 축은 서로 무관해 보이지만 도착점은 같다. 생성이라는 일을 데모에서 일상으로 옮기는 것이다.
일반 창작자에게 이것은 아마 지난 1년간 가장 실질적인 변화일 것이다. 더 이상 이미지 한 장을 위해 연산력을 빌릴 필요가 없고, 스타일을 바꾸기 위해 전체 환경을 다시 설치할 필요도 없다. 몇 년 전의 중급 그래픽카드 한 장에 커뮤니티가 모아낸 툴체인을 더하면, 제법 괜찮은 작품 한 세트를 만드는 데 충분하다.
진짜로 압축된 것은 “한번 해볼까”에서 “정말 시작한다”까지의 거리다.
관련 글
Agility Digit 5, 단순한 스펙 시트가 아닌 안전성 입증 자료와 함께 출시되다
창고 현장은 실험실이 아니다. 관문은 인증이지 데모가 아니다.
프론티어 에이전트가 연구 워크플로의 30퍼센트를 완료했다. 그 숫자가 핵심이다.
에이전트는 연구를 운영할 수 있다. 절차를 새로 고안하는 일은 아직 요원하다.
Figure AI, 판매할 제품도 없이 35억 달러어치 컴퓨팅을 확보하다
베팅의 핵심은 일반화가 컴퓨팅 문제라는 것이다. 업계는 아직 결론을 내리지 못했다.
OpenAI, 마침내 이미지 API에 투명 배경 추가
파이프라인에서 한 단계를 통째로 없애는 작은 기능.