← Voltar ao blog
Aicerca de 6 min de leitura

Geração de imagens open source comprimida em uma GPU de consumidor: Hunyuan DiT reduz a barreira para 6 GB de VRAM

Publicado 4 de out. de 2026
Geração de imagens open source comprimida em uma GPU de consumidor: Hunyuan DiT reduz a barreira para 6 GB de VRAM

No último ano, as atualizações de geração de imagens texto-para-imagem open source giraram basicamente em torno da qualidade de imagem. Quem tinha texto mais nítido, quem tinha luz e sombra mais parecidas com fotografia, conseguia permanecer mais alguns dias nos rankings. Mas neste outubro, o vento mudou um pouco. O foco das discussões da comunidade já não é “qual imagem é mais bonita”, e sim “será que a minha GPU aguenta rodar isso”.

A linha dos 6 GB de VRAM foi conquistada na marra

Entre os anúncios recentes do modelo de geração de imagens texto-para-imagem Hunyuan, da Tencent (Hunyuan DiT), o mais útil é a abertura do código de uma “versão de baixa VRAM”. Segundo a empresa, 6 GB de VRAM já bastam para rodá-lo. Qualquer um que já tenha usado geração de imagens open source entende o peso desse número: até então, para rodar localmente um conjunto decente de geração texto-para-imagem, 16 GB de VRAM era praticamente o mínimo, 8 GB era no limite e 6 GB era descartado de imediato.

Uma placa de circuito verde sobre uma bancada escura, com luz azul fria varrendo chips pretos alinhados

As ações complementares vieram na mesma esteira. Essa versão adaptou plugins como LoRA e ControlNet para a biblioteca Diffusers e ainda adicionou suporte à interface gráfica do Kohya. O papel do Kohya na comunidade é justamente tirar o “treinar seu próprio LoRA” da barreira da linha de comando e transformá-lo em alguns cliques de mouse. Ao integrá-lo, basicamente se abriu o caminho para “quero que o modelo aprenda o meu próprio estilo de desenho”.

Ao mesmo tempo, o próprio Hunyuan DiT subiu para a versão 1.2, e as melhorias anunciadas concentram-se na textura da imagem e na composição. Esses dois pontos são exatamente onde os modelos open source sempre foram criticados: quando há muitos detalhes, a imagem borra; quando a composição é complexa, ela se desfaz.

Outra notícia mais fácil de passar despercebida, mas crucial: a Tencent também abriu o código do modelo de rotulagem do Hunyuan, o “Hunyuan Captioner”. O modelo de rotulagem é a primeira etapa do treinamento de LoRA — é preciso primeiro fazer a máquina transformar cada material em descrições legíveis antes de sequer pensar em treinar. No passado, essa etapa dependia de APIs de código fechado ou de alternativas de qualidade irregular. Com a sua abertura, a cadeia de treinamento local perde mais uma dependência de serviços externos.

Depois que os modelos open source começaram a rodar, a comunidade está ocupada “consertando”

O progresso do lado do Hunyuan é alargar o caminho, enquanto a comunidade aplica patches em outra linha. Após a abertura do Qwen-Image 2.1, surgiram muitas criações derivadas e, com elas, uma onda intensa de correções.

Uma combinação bastante representativa é o Qwen-Image-2.1-viggle-turbo: 7,26 GB, inferência em 6 passos, quantização int8, frequentemente usado para produzir rapidamente folhas de design de personagens, combinado com um VAE texture-fix de 676 MB para complementar texturas. O Fix v2.0 de outro autor afirma remover aquela camada característica de ruído e detalhes bagunçados do Qwen, praticamente sem alterar a composição. Há ainda uma versão Opinionated, com imagem mais nítida, ao custo de mover levemente o quadro; o autor a lançou empacotada com um conjunto de samplers res_2m_nc derivados do RES4LYF.

Esses patches podem parecer triviais, mas dizem uma coisa: quando um modelo open source entra em produção real, o que de fato determina se ele é bom de usar muitas vezes não é a versão do dia do lançamento, e sim se a comunidade está disposta a escrever correções para ele nas semanas seguintes.

A comunidade também acumulou alguns parâmetros que dá para copiar diretamente. Alguém que carregou LoRA no Qwen 2.1 recomendou CFG entre 2,0 e 3,0, 40 passos e sampler res_multistep ou beta. Outro, rodando um fluxo de trabalho padrão de 2,0 MP sem LoRA, disse que a nova versão do modelo de imagem Qwen trouxe um toque de Midjourney que antes só se via em modelos de código fechado.

Em velocidade também houve progresso notável. Um checkpoint LoRA de destilação em dois passos do Krea 2 Turbo reduziu o tempo de denoising de 1024x1024 de 76,4 segundos para 19,3 segundos, quase quatro vezes menos. O custo é que a qualidade dos detalhes fica entre 0,97 e 1,09 vez a do modelo professor, muito melhor que os 0,40 a 0,65 vez do Turbo nativo em dois passos, mas o desempenho é melhor em cenas de close-up; em grandes panoramas ainda deixa a desejar.

As pequenas lacunas que também foram preenchidas de quebra

Além dos modelos principais, alguns modelos open source de nicho, mas com reputação sólida, também vêm aos poucos corrigindo as suas deficiências. O Aesthetic v1.1 e o One Obsession v4, do Anima, são frequentemente usados para produções estilizadas; os usuários elogiam a sua obediência ao estilo e a facilidade de escrever prompts — fixando a seed e alterando o prompt, dá para obter variações coerentes, além de renderizar textos curtos. As suas fraquezas são igualmente francas: múltiplos personagens no mesmo quadro e textos longos ainda são difíceis, e a comunidade aguarda o Anima 2.

No caso do Krea 2, as reclamações concentram-se no fato de que “seeds diferentes parecem iguais”, então alguém desenvolveu um método sem adicionar LoRA nem instalar nós exclusivos do modelo: reaproveitar o codificador de texto do ComfyUI (como o Qwen3VL 4B) como LLM para expandir o prompt, tratando a seed do prompt como botão de ajuste grosso e a seed de amostragem como botão de ajuste fino. Esse tipo de “gambiarra” se espalha rápido e muitas vezes resolve problemas práticos melhor do que a documentação oficial.

Depois que a barreira diminui, o que está em jogo?

Olhando essas ações em conjunto, a direção é clara. A geração de imagens open source já não responde apenas a “dá para desenhar de forma realista?”, mas começa a responder a outras duas perguntas: dá para rodar numa máquina que eu consigo comprar, e dá para modificar com precisão conforme a minha intenção?

O Hunyuan, ao reduzir a VRAM para 6 GB e abrir o modelo de rotulagem, responde à primeira pergunta. As correções e LoRAs de aceleração da comunidade do Qwen respondem ao “modificar com precisão” e ao “rodar rápido” da segunda pergunta. As duas linhas parecem não ter relação, mas convergem para o mesmo ponto: fazer da geração algo que passa da demonstração para o cotidiano.

Para criadores comuns, essa é provavelmente a mudança mais concreta do último ano. Você não precisa mais alugar poder de computação por causa de uma imagem, nem reinstalar todo o ambiente só para mudar de estilo. Uma GPU de médio porte de alguns anos atrás, somada ao conjunto de ferramentas que a comunidade acumulou, já é suficiente para você produzir uma série de trabalhos decentes.

O que foi realmente encurtado é a distância entre “quero experimentar” e “vou realmente começar a fazer”.

Artigos relacionados