9월 국산 오픈소스 이미지 생성 모델 연달아 출격: 센스타임·앤트·서생 모두 가만있지 않았다

지난 9월, 국산 AI 이미지 생성에는 눈에 잘 띄지 않지만 꽤 중요한 변화가 있었습니다. 바로 오픈소스입니다. 불과 일주일 사이에 센스타임, 앤트, 상하이 인공지능 연구소의 서생 팀이 잇달아 오픈소스 이미지 생성 모델을 공개하면서, 기존에는 클로즈드 소스 대형 업체만 쥐고 있던 능력을 모두가 볼 수 있는 자리로 꺼내놓았습니다. 이 일의 영향은 특정 새 모델 출시보다 훨씬 클 수 있습니다.
세 팀이 내놓은 카드는 각각 무엇인가
센스타임 SenseNova U1.5 Lite는 9월 8일 오픈소스로 공개된 8B 규모의 이미지 생성 모델입니다. 강점은 4K 직접 출력이며, 공식 입장은 “클로즈드 소스 대형 모델에 버금간다”는 것입니다. 8B라는 크기가 중요한데, 일반 개발자가 가진 GPU로도 돌릴 수 있어 처음부터 12G, 24G VRAM을 찾지 않아도 된다는 뜻입니다.
앤트의 6B 통합 이미지 모델은 9월 6일 오픈소스로 공개되었습니다. 더 “편한” 길을 택했는데, 텍스트 생성과 지시 기반 편집을 하나의 모델에 담았습니다. 다시 말해 처음부터 그림을 그리게 할 수도 있고, 이미지를 주고 “배경을 바꿔줘” “색을 밝게 해줘”라고 요청할 수도 있어 두 모델을 오갈 필요가 없습니다. 더 드문 점은 앤트가 학습 레시피까지 전부 공개했다는 것입니다. 오픈소스 모델은 많지만 학습 디테일을 모두 공개한 경우는 많지 않습니다.
서생 InternLumina-U2는 9월 3일 공개된 비전 대형 모델로, 이미지 이해와 생성을 하나로 통합한 것이 특징이며 가중치가 공개될 예정입니다. “하나의 모델이 이미지를 이해하고 동시에 그릴 수 있다”는 방향에 더 가까워, 모델이 참조 이미지를 먼저 이해한 뒤 그에 맞춰 수정해야 하는 시나리오에서 순수 생성 모델보다 유리합니다.

오픈소스를 따로 짚어야 하는 이유
많은 사람은 오픈소스 모델이 일반 사용자와 먼 이야기라고 생각할 수 있습니다. 어차피 모델을 학습시키지 않으니까요. 하지만 실제 영향의 연결 고리는 이렇습니다. 오픈소스 모델이 다양한 무료 도구의 토대가 된다는 것입니다.
독립 개발자나 소규모 팀이 대형 업체 API를 살 돈이 없는데 제품에 이미지 생성 기능을 넣고 싶다면 어떻게 해야 할까요? 답은 Hugging Face에서 오픈소스 모델을 받아 로컬에서, 또는 저렴한 GPU를 빌려 돌리는 것입니다. 센스타임 8B, 앤트 6B 같은 크기는 “소비자용 기기에 들어갈 수 있는” 구간에 딱 맞습니다. 오픈소스 모델이 많아지고 작아지고 강해질수록 일반인이 직접 구축할 수 있는 무료 이미지 생성 솔루션도 늘어납니다.
반대로 보면 이는 국산 모델이 Stable Diffusion, Flux 같은 기존 오픈소스 진영에 내놓는 대응이기도 합니다. 예전에는 오픈소스 이미지 생성이라고 하면 기본적으로 Stable Diffusion 생태계를 떠올렸습니다. 이제 국산 주자들이 그 사이로 파고들고 있고, 중국어 이해와 중국어 문자 렌더링 같은 로컬 강점을 가져오고 있습니다. 이는 중국어 사용자에게 실질적인 플러스입니다.
오픈소스 이후, 승부처는 무엇인가
오픈소스는 끝이 아니라 시작입니다. 모델이 오픈소스로 공개되었다고 해서 실제로 쓰일 수 있을지는 세 가지에 달려 있습니다.
첫째는 생태계입니다. 모델은 가중치만으로는 부족하고, 추론 도구, LoRA 학습 스크립트, WebUI 지원 같은 주변 환경이 필요합니다. Stable Diffusion이 지금까지도 많은 사람의 기본 선택으로 남아 있는 것은 특정 버전 덕분이 아니라 그 뒤에 있는 광범위한 도구 체인 덕분입니다.
둘째는 중국어 능력입니다. 국산 모델의 가장 큰 차별점은 중국어 프롬프트 이해와 중국어 문자 렌더링입니다. 이는 해외 오픈소스 모델이 오랫동안 제대로 해내지 못한 부분이자, 국산 오픈소스 모델이 가장 집요하게 물고 늘어져야 할 부분입니다.
셋째는 상업화 경로입니다. 오픈소스 모델로 어떻게 수익을 낼지는 오랫동안 어려운 문제였습니다. 센스타임, 앤트, 서생 같은 플레이어에게 오픈소스는 자선이 아니라 오픈소스를 통해 생태계를 키운 뒤 기업 서비스, 클라우드 API, 커스터마이징으로 수익화하려는 의도일 가능성이 큽니다. 사용자 입장에서는 무료인 것이 점점 많아진다는 뜻이지만, “무료”와 “지속적인 유지보수” 사이에 등호를 놓을 수 있을지는 지켜봐야 합니다.
덧붙일 배경이 하나 더 있습니다. 이번 오픈소스 흐름은 해외 오픈소스 생태계가 다소 공백기를 겪는 시점에 정확히 겹쳤습니다. Stable Diffusion은 진정한 의미의 메이저 버전 업데이트가 오랫동안 없었고, Flux는 완전한 오픈소스 가중치를 아직 내놓지 않고 있습니다. 국산 모델들이 이 타이밍에 6B, 8B처럼 “가정용 기기에 들어갈 수 있는” 크기를 오픈소스로 공개한 것은, 상대가 숨 고르는 틈에 중국어 오픈소스 이미지 생성의 기반을 먼저 닦은 셈입니다.
일반 창작자에게 주는 실질적 의미
구체적인 사용자 관점에서 보면, 이들 오픈소스 모델이 가져오는 변화는 이미지 생성 비용이 계속 낮아지고 있다는 점입니다.
예전에는 AI 이미지 생성을 안정적으로 활용해 제대로 된 결과물을 만들려면 도구를 구독하거나 이미지 수 기준으로 API 요금을 내야 했습니다. 오픈소스 모델이 많아지면서 무료이고 로컬에서 돌아가는 선택지도 늘어났습니다. 이런 방식은 보통 환경 설정과 파라미터 조정을 알아야 하는 진입 장벽이 있지만, 그 장벽조차 커뮤니티가 조금씩 낮춰가고 있습니다.
제 판단으로는 당분간 일반 창작자에게는 여전히 웹 도구가 가장 편합니다. 하지만 작은 제품이나 소규모 앱을 만들면서 이미지 생성 기능을 내장해야 한다면, 이번 오픈소스 모델의 밀도와 크기는 다시 한번 눈여겨볼 만합니다. 적어도 “국산에는 쓸 만한 오픈소스 이미지 생성 모델이 없다”는 말은 9월부터 더 이상 성립하지 않습니다.
관련 글
ChatGPT Images 2.5, 더 빠르고 선명해졌으며 드디어 스케치를 지원합니다
Images 2.5는 지연 시간을 최대 50% 단축하고, 스케치 기능을 추가하며, 다중 턴 편집을 안정화했습니다. 무엇이 바뀌었고 누가 주목해야 할까요.
텐센트 훈위안, AI 이미지 생성을 영화·드라마 촬영장으로: HyImage 3.5 preview 사용기
HyImage 3.5 preview는 블라인드 테스트에서 약 30% 개선됐고, 최대 5장 레퍼런스와 2K 출력을 지원하며, WorkRally에 연동되어 《행표》에서 실전에 쓰였다. 이 글에서 성능과 사용 경로를 분석합니다.
2026년 9월 최고의 AI 이미지 생성기 순위
GPT Image 2.5, Midjourney V8.2, Nano Banana 2, Flux 2 등 가격과 작업별 추천을 포함한 순위.
Microsoft MAI-Image-2.6, GPT Image 2에 조용히 근접 중
Microsoft의 도전자가 Elo 격차를 21점까지 좁혔습니다. MAI-Image-2.6의 부상이 AI 이미지 시장에 의미하는 바는 무엇일까요.