← Voltar ao blog
News6 min

Em setembro, modelos chineses open source de geração de imagens vieram com tudo: SenseTime, Ant e InternLumina não ficaram parados

Publicado 26 de set. de 2026
Em setembro, modelos chineses open source de geração de imagens vieram com tudo: SenseTime, Ant e InternLumina não ficaram parados

No último mês de setembro, houve uma mudança discreta, mas crucial, na geração de imagens por IA na China: o open source. Em apenas uma semana, a SenseTime, a Ant e a equipe Shusheng do Laboratório de Inteligência Artificial de Xangai lançaram, um após o outro, modelos open source de geração de imagens, colocando sobre a mesa capacidades que antes estavam restritas a grandes empresas de modelos fechados. O impacto disso pode ser muito maior do que o lançamento de um novo modelo específico.

O que cada um dos três está apresentando

SenseTime SenseNova U1.5 Lite foi disponibilizado em open source em 8 de setembro e é um modelo de geração de imagens de escala 8B. Seu grande atrativo é a saída direta em 4K; a comunicação oficial diz que ele “se equipara a grandes modelos fechados”. O tamanho 8B é crucial, porque significa que ele roda até nas placas de vídeo que desenvolvedores comuns têm em mãos, sem precisar já começar mirando 12 GB ou 24 GB de VRAM.

O modelo unificado de imagem 6B da Ant foi disponibilizado em open source em 6 de setembro. Ele segue um caminho mais “prático”: a geração a partir de texto e a edição por instruções estão combinadas em um único modelo. Em outras palavras, você pode tanto pedir para ele desenhar uma imagem do zero quanto dar uma imagem e pedir para “trocar o fundo” ou “deixar as cores mais claras”, sem precisar alternar entre dois modelos. O mais raro é que a Ant também divulgou completamente a receita de treinamento. Não faltam modelos open source, mas não são muitos os que expõem os detalhes do treinamento.

InternLumina-U2, da equipe Shusheng, foi lançado em 3 de setembro. É um grande modelo visual focado na unificação entre compreensão e geração de imagens, com pesos que serão abertos. Seu posicionamento tende mais para “um modelo que tanto entende imagens quanto desenha imagens”, o que é uma vantagem sobre modelos puramente generativos em cenários em que é preciso primeiro entender uma imagem de referência e depois editá-la seguindo essa referência.

Diagrama do ecossistema de modelos chineses open source de geração de imagens por IA

Por que o open source merece uma discussão à parte

Muitas pessoas talvez achem que modelos open source estão longe do usuário comum — afinal, “eu não treino modelos”. Mas a real cadeia de impacto é esta: modelos open source se tornam a base de várias ferramentas gratuitas.

Um desenvolvedor independente, ou uma equipe pequena, sem dinheiro para comprar APIs de grandes empresas, mas que quer adicionar geração de imagens ao próprio produto, o que faz? A resposta é ir ao Hugging Face, baixar um modelo open source e rodá-lo localmente ou alugar uma GPU barata. Tamanhos como o 8B da SenseTime e o 6B da Ant estão exatamente na faixa de “cabe em uma máquina de consumo”. Quanto mais modelos open source houver, menores e mais fortes eles forem, mais soluções gratuitas de geração de imagens poderão ser montadas por pessoas comuns.

Por outro lado, essa também é uma resposta dos modelos chineses às rotas open source já estabelecidas, como Stable Diffusion e Flux. Antes, quando se falava em geração de imagens open source, o padrão era o ecossistema Stable Diffusion. Agora, participantes chineses estão entrando nesse espaço, trazendo vantagens locais como compreensão de chinês e renderização de fontes chinesas. Para usuários de língua chinesa, isso é um ganho real.

Depois do open source, o que entra em jogo

Open source não é a linha de chegada, e sim o ponto de partida. Quando um modelo se torna open source, conseguir usá-lo de fato ainda depende de três coisas.

A primeira é o ecossistema. Não basta o modelo ter pesos disponíveis; é preciso ter ferramentas de inferência, scripts de treinamento LoRA e suporte a WebUI. Se o Stable Diffusion ainda é a escolha padrão de muita gente até hoje, não é por causa de uma versão específica, mas por causa de toda a cadeia de ferramentas que existe ao redor dele.

A segunda é a capacidade em chinês. A maior diferenciação dos modelos chineses está na compreensão de prompts em chinês e na renderização de caracteres chineses. Esse é um ponto em que os modelos open source do exterior deixam a desejar há tempos, e é exatamente onde os modelos chineses open source devem se agarrar.

A terceira é o caminho de monetização. Como modelos open source ganham dinheiro sempre foi uma questão difícil. Para players como SenseTime, Ant e InternLumina, o open source provavelmente não é caridade; eles querem nutrir um ecossistema por meio do open source e, depois, monetizar com serviços empresariais, APIs em nuvem e personalização. Para os usuários, isso significa que haverá cada vez mais coisas gratuitas, mas se “grátis” e “manutenção contínua” podem ser tratados como equivalentes é algo que precisamos observar com o tempo.

Vale acrescentar um contexto: essa onda de open source chega exatamente em um momento em que o ecossistema open source no exterior está numa fase de entressafra. O Stable Diffusion já não tem uma atualização de versão realmente significativa há bastante tempo, e o Flux ainda não liberou pesos open source completos. Ao disponibilizar modelos de 6B e 8B — tamanhos que “cabem em máquinas domésticas” —, os players chineses estão aproveitando essa janela de respiro para fincar primeiro as bases da geração de imagens open source em chinês.

O significado prático para criadores comuns

Para as pessoas concretas, a mudança trazida por esses modelos open source é: o custo de gerar imagens continua caindo.

Antes, se você quisesse usar IA para gerar imagens de forma estável e fazer algo sério, ou assinava uma ferramenta ou pagava taxas de API por imagem. Com o aumento dos modelos open source, surgiu uma série de soluções gratuitas que rodam localmente. Embora essas soluções geralmente tenham uma barreira de entrada — é preciso saber instalar o ambiente e ajustar parâmetros —, a própria barreira está sendo gradualmente reduzida pela comunidade.

Minha avaliação é que, no curto prazo, criadores comuns ainda terão mais tranquilidade usando ferramentas web. Mas, se você está criando um pequeno produto ou aplicativo e precisa incorporar recursos de geração de imagens, a densidade e o tamanho dos modelos open source desta onda merecem uma nova olhada. No mínimo, a ideia de que “não existem bons modelos chineses open source de geração de imagens” deixou de ser verdade a partir de setembro.

Artigos relacionados