← 블로그로
Ai약 10 분 읽기

오픈소스 이미지 생성, 소비자용 그래픽카드 한 장으로 압축되다: Hunyuan DiT가 진입 장벽을 6GB VRAM까지 낮추다

게시일 2026년 10월 4일
오픈소스 이미지 생성, 소비자용 그래픽카드 한 장으로 압축되다: Hunyuan DiT가 진입 장벽을 6GB VRAM까지 낮추다

지난 한 해 동안 오픈소스 텍스트-투-이미지(text-to-image) 업데이트는 대부분 화질을 중심으로 돌아갔다. 누구의 글자가 더 선명한지, 누구의 빛과 그림자가 더 사진처럼 보이는지가 순위표에서 며칠 더 머무는 기준이었다. 그런데 이번 10월에는 바람이 조금 바뀌었다. 커뮤니티의 논의 초점은 더 이상 “어떤 이미지가 더 예쁜가”가 아니라 “내 그래픽카드로 과연 돌아가긴 하는가”다.

6GB VRAM이라는 선은 이를 악물고 깎아낸 결과다

텐센트의 Hunyuan 텍스트-투-이미지 대형 모델(Hunyuan DiT)이 최근 공개한 소식 중 가장 실용적인 것은 “소형 VRAM 버전”을 오픈소스로 공개했다는 점이다. 공식 설명에 따르면 6GB VRAM만으로도 실행할 수 있다. 이 숫자가 얼마나 큰 의미인지는 오픈소스 이미지 생성 모델을 써본 사람이라면 안다. 그전까지 로컬에서 제대로 된 텍스트-투-이미지 모델을 돌리려면 16GB VRAM이 사실상 출발선이었고, 8GB는 간신히 되는 수준, 6GB는 아예 시작도 하지 말라는 분위기였다.

어두운 테이블 위의 녹색 회로 기판, 차가운 푸른 빛이 가지런히 배열된 검은 칩 위를 스친다

뒷받침하는 작업도 이어졌다. 이 버전은 LoRA, ControlNet 같은 플러그인까지 Diffusers 라이브러리에 함께 맞춰 넣었고, Kohya 그래픽 인터페이스 지원도 추가했다. 커뮤니티에서 Kohya의 역할은 “내 LoRA 직접 학습시키기”를 명령줄의 장벽에서 끌어내 몇 번의 마우스 클릭으로 만드는 것이다. 이것이 연동되었다는 것은 “모델이 내 화풍을 배우게 하고 싶다”는 길을 평탄하게 닦았다는 뜻이다.

동시에 Hunyuan DiT 본체는 1.2 버전으로 올라갔고, 공식적으로 내세운 개선점은 화면 텍스처와 구도에 집중되어 있다. 이 두 가지는 오픈소스 모델이 오랫동안 비판받아 온 지점과 정확히 맞물린다. 디테일이 많아지면 뭉개지고, 구도가 복잡해지면 흩어진다는 점이다.

또 다른 소식은 더 쉽게 지나칠 수 있지만 매우 핵심적이다. 텐센트가 Hunyuan의 태깅 모델인 “Hunyuan Captioner”도 오픈소스로 공개한 것이다. 태깅 모델은 LoRA 학습의 첫 번째 공정이다. 먼저 기계가 각 소재를 읽을 수 있는 문장으로 풀어내야 학습을 논할 수 있다. 과거에는 이 단계에서 폐쇄형 API를 쓰거나 품질이 들쭉날쭉한 대체품을 써야 했다. 이것이 오픈소스화되면서 로컬 학습 체인에서 외부 서비스 의존이 하나 더 줄었다.

오픈소스 모델이 돌아가기 시작하자, 커뮤니티는 “수리”에 바빠졌다

Hunyuan 쪽 진전은 길을 넓히는 일이라면, 커뮤니티는 다른 축에 패치를 대고 있다. Qwen-Image 2.1이 오픈소스로 공개된 뒤 대량의 2차 창작이 일어났고, 그에 따라 집중적인 수정 물결이 뒤따랐다.

비교적 대표적인 조합은 Qwen-Image-2.1-viggle-turbo다. 7.26GB, 6스텝 추론, int8 양자화로, 빠르게 캐릭터 설정 이미지를 뽑아낼 때 자주 쓰이며, 여기에 676MB의 texture-fix VAE를 붙여 텍스처를 보완한다. 다른 작성자의 Fix v2.0은 Qwen 특유의 노이즈와 어수선한 디테일을 제거하면서 구도는 거의 건드리지 않는다고 주장한다. 또 하나의 Opinionated 버전은 화면이 더 날카롭지만, 그 대가로 화면이 약간 움직인다. 작성자는 이를 RES4LYF에서 파생된 res_2m_nc 샘플러 세트와 함께 묶어 공개했다.

이런 패치들은 사소해 보이지만 한 가지를 말해준다. 오픈소스 모델이 실제 제작에 들어갔을 때, 그것이 정말 쓸 만한지를 결정하는 것은 대개 공개 당일의 버전이 아니라, 이후 몇 주 동안 커뮤니티가 기꺼이 수정 작업을 해주는지 여부다.

커뮤니티에는 바로 따라 쓸 수 있는 파라미터도 쌓였다. 누군가는 Qwen 2.1에 LoRA를 로드한 뒤 CFG는 2.0~3.0, 40스텝, 샘플러는 res_multistep 또는 beta를 쓰라고 권했다. 또 다른 사람은 LoRA 없이 2.0MP 표준 워크플로를 돌리며, 새 버전 Qwen 이미지 모델에서 예전에는 폐쇄형 모델에서만 보던 Midjourney 같은 느낌이 난다고 말했다.

속도에서도 뚜렷한 진전이 있다. Krea 2 Turbo의 2스텝 증류 LoRA 체크포인트는 1024x1024 디노이징 시간을 76.4초에서 19.3초로, 약 4배 줄였다. 대가는 디테일 질감이 교사 모델의 0.97~1.09배 수준에 그친다는 점이다. 이는 네이티브 Turbo 2스텝의 0.40~0.65배보다 훨씬 낫지만, 클로즈업 계열 화면에서 가장 잘 나오고 큰 장면은 아직 조금 아쉽다.

겸사겸사 메워진 작은 빈틈들

메인 모델 외에도 커뮤니티에서 소수지만 평판이 안정적인 오픈소스 모델 몇 가지가 조금씩 약점을 메우고 있다. Anima의 Aesthetic v1.1과 One Obsession v4는 스타일화된 결과물을 만들 때 자주 쓰인다. 사용자들은 스타일을 잘 따라주고 프롬프트를 쓰기 쉽다고 칭찬하며, 시드를 고정한 뒤 프롬프트만 바꾸면 일관된 변형을 얻을 수 있고 짧은 텍스트도 렌더링할 수 있다고 말한다. 약점도 솔직하다. 다중 캐릭터 동시 등장과 긴 텍스트는 여전히 버겁고, 커뮤니티는 Anima 2를 기다리고 있다.

Krea 2 쪽에서는 “시드를 바꿔도 비슷해 보인다”는 불만이 집중되자, 누군가 LoRA를 추가하지 않고 모델 전용 노드도 설치하지 않는 방법을 찾아냈다. ComfyUI의 텍스트 인코더(예: Qwen3VL 4B)를 LLM처럼 재사용해 프롬프트를 확장하고, 프롬프트 시드는 거친 조정 손잡이로, 샘플링 시드는 미세 조정 손잡이로 쓰는 방식이다. 이런 “현장식 방법”은 빠르게 퍼지며, 종종 공식 문서보다 실제 문제를 더 잘 해결한다.

문턱이 내려간 뒤, 겨루는 것은 무엇인가

이 움직임들을 함께 놓고 보면 방향은 분명하다. 오픈소스 이미지 생성은 더 이상 “비슷하게 그릴 수 있는가”만 답하지 않는다. 이제 두 가지 질문에 답하기 시작했다. 내가 살 수 있는 기계에서 돌아가는가, 그리고 내 의도대로 정확히 고칠 수 있는가.

Hunyuan이 VRAM을 6GB로 낮추고 태깅 모델을 오픈소스화한 것은 첫 번째 질문에 대한 답이다. Qwen 커뮤니티의 그 수정판들과 가속 LoRA는 두 번째 질문 중 “정확하게 고치기”와 “빠르게 돌리기”에 대한 답이다. 두 축은 서로 무관해 보이지만 도착점은 같다. 생성이라는 일을 데모에서 일상으로 옮기는 것이다.

일반 창작자에게 이것은 아마 지난 1년간 가장 실질적인 변화일 것이다. 더 이상 이미지 한 장을 위해 연산력을 빌릴 필요가 없고, 스타일을 바꾸기 위해 전체 환경을 다시 설치할 필요도 없다. 몇 년 전의 중급 그래픽카드 한 장에 커뮤니티가 모아낸 툴체인을 더하면, 제법 괜찮은 작품 한 세트를 만드는 데 충분하다.

진짜로 압축된 것은 “한번 해볼까”에서 “정말 시작한다”까지의 거리다.

관련 글