← Voltar ao blog
Aicerca de 7 min de leitura

Quem realmente usa: modelos chineses levam mais da metade do uso de geração de imagem e vídeo no exterior

Publicado 11 de out. de 2026
Quem realmente usa: modelos chineses levam mais da metade do uso de geração de imagem e vídeo no exterior

De 24 de agosto a 5 de outubro, o Overchat AI registrou 1,09 milhão de usuários e 31,6 milhões de interações com modelos. Ao abrir essa estatística anônima, o que mais chama atenção não é quem subiu um ponto em alguma tabela, mas sim em quem as pessoas votaram quando realmente colocaram a mão na massa: geração de imagem e geração de vídeo, as duas tarefas que mais consomem poder computacional e mais dinheiro, tiveram mais da metade concluída por modelos chineses.

Estes não são resultados de avaliação, são volume de uso. Resultados podem ser inflados com um teste ampliado; o volume de uso só se acumula com cliques repetidos, um após o outro.

Primeiro, é preciso deixar claro o critério desses dados, para não os tomar como um censo de mercado. Eles vêm de uma plataforma que reúne vários modelos em um mesmo miniaplicativo e contabilizam 31,6 milhões de interações de 1,09 milhão de usuários em 1,2 milhão de sessões entre 24 de agosto e 5 de outubro; a participação é calculada como "cada vez que um usuário usa um modelo, conta um", e não pelo acúmulo de cada chamada. A amostra favorece naturalmente usuários dispostos a testar vários modelos ao mesmo tempo, então ela é mais um retrato de "quem está sendo aberto repetidamente" do que uma conta de receita do setor inteiro. Mas, justamente porque todos os modelos ficam na mesma entrada e diante do mesmo grupo de pessoas, essa comparação é mais convincente do que os benchmarks divulgados por cada fabricante.

O texto ainda é dos EUA; a imagem está trocando de mãos

Vejamos primeiro o que não mudou. Nas interações de texto, Gemini, GPT, Claude e Grok somam 86,2%, e fabricantes americanos quase não têm rivais nesse campo. O que mudou é a imagem: a participação de modelos chineses na geração de imagem subiu de 54,0% no período anterior para 59,5%, e na geração de vídeo, de 43,5% para 53,6%. No mesmo período, modelos chineses representaram 36,9% de todas as interações.

Se aproximarmos o zoom nas famílias específicas, a divisão de trabalho fica mais clara. No lado da imagem, o Seedream, da ByteDance, mantém a primeira posição com 33,5%; o Nano Banana, do Google, tem 26,1%; e o Qwen Image, da Alibaba, 26,0%, quase o dobro dos 12,3% do período anterior. No lado do vídeo, o Grok Imagine, da xAI, continua em primeiro entre produtos individuais (30,6%, embora abaixo dos 39,6% do período anterior), o Seedance, da ByteDance, saltou de 10,8% para 25,2%, e o Kling se manteve em 21,9%.

O que realmente merece uma pausa é a janela de duas semanas: de 22 de setembro a 5 de outubro, o Qwen Image se tornou a família de modelos mais usada em todas as categorias, com 17,2%, superando os 10,9% do GPT para texto e os 10,8% do Gemini. Uma família originada de pesos abertos e especializada em edição de imagem, em uma entrada que agrega modelos de diversos fabricantes, foi aberta mais vezes do que todos os modelos de texto.

Um gráfico comparativo de participação de uso: nas duas barras de geração de imagem e geração de vídeo, a proporção de modelos chineses passa da metade

Barato não significa ser usado: os números do Qwen indicam outra coisa

A explicação mais fácil seria o preço. O Overchat AI fez questão de acrescentar: o Qwen Image e o GPT Image 2.5 têm o mesmo preço unitário na plataforma e ambos estão incluídos no plano gratuito. O preço é igual, mas o volume de uso difere em cerca de quatro vezes. Portanto, o que está em jogo aqui não é quem é mais barato, e sim outra coisa: a taxa de resultados utilizáveis nas imagens geradas, o grau de preservação da imagem original ao editar e a disposição do usuário em tentar uma segunda vez depois do primeiro teste.

Um dado complementar explica bem essa retenção. Entre as escolhas de modelo de novos usuários, OpenAI e Anthropic somam 23,8%; entre usuários recorrentes, esse número cai para 19,8%. Ao mesmo tempo, o Google sobe de 20,9% para 28,0%, e os fabricantes chineses, de 36,3% para 39,8%. A primeira escolha vem da familiaridade; depois, vem da experiência real. As pessoas trocam, e trocam na direção da capacidade de geração visual.

O uso está mudando, e os dispositivos também

As diferenças regionais são maiores do que se imagina. No Japão, 74,4% do uso de IA vem do Gemini, que praticamente domina sozinho; Espanha e Indonésia claramente preferem o Qwen Image. Os Estados Unidos são uma exceção: são o único grande mercado que tem a geração de vídeo como primeira categoria, com 36,8%. O Brasil é o mais voltado a texto, com 49,3%.

O mobile respondeu por cerca de 74% das sessões, e texto, imagem e vídeo ficaram quase divididos em três partes iguais, com aproximadamente 33% cada. Já o desktop é claramente mais voltado a texto, 51,3%, com as famílias dominantes sendo GPT, Gemini e Claude. Essa comparação revela uma coisa: a geração de imagem e vídeo está se tornando algo que se faz "na hora", quando o usuário tem a ideia no celular, em vez de esperar até sentar no computador para fazer com cuidado. As famílias preferidas no mobile também confirmam isso: Seedream, Grok Imagine e Seedance.

Não confunda volume de uso com qualidade do produto

Os pontos que exigem cautela também são claros. Esta é uma amostra de uma única plataforma, e a estrutura de usuários tende a favorecer pessoas dispostas a testar novos modelos, não podendo ser extrapolada diretamente para o mercado inteiro. Um volume de uso alto só mostra que algo é aberto repetidamente, não que cada imagem seja melhor. O custo do Seedance é cerca de três vezes o do Grok Imagine 1.5, e ainda assim sua participação mais que triplicou, o que mostra que os usuários nunca se importaram apenas com o preço.

Mas, ao juntar esta amostra com outros sinais, a direção deixa de ser ambígua. No mesmo período, a Alibaba abriu os pesos do Qwen-Image (embora a licença tenha sido alterada para uso apenas em pesquisa), a ByteDance adotou para o Seedance o modelo de gerar primeiro um rascunho em 480P e só produzir o vídeo final se o usuário aprovar, e a Shengshu Technology reduziu o preço de lançamento do seu modelo de vídeo principal para 0,09 yuan por segundo. Todas essas ações apontam para o mesmo objetivo: tornar "tentar mais algumas vezes" algo acessível.

Ampliando um pouco mais o escopo, estes dados também explicam algo mais macro: a adoção de texto para vídeo e de texto para imagem está descendo dos estúdios profissionais para as mãos de pessoas comuns. O fato de o mobile responder por mais de 70% das sessões e de os três tipos de conteúdo ficarem quase empatados significa que a maioria das pessoas não está montando fluxos de trabalho, mas testando de forma casual. Esse público não determina o teto de benchmark dos modelos de ponta, mas determina com que frequência os modelos são usados e para quantas pessoas são recomendados. Quem conseguir ser mais consistente em "um teste, um resultado utilizável" terá mais chance de permanecer na primeira tela do celular.

A competição em imagem e vídeo, no fim, não é sobre o teto de uma única peça final, mas sobre quantas vezes você consegue testar, quantas vezes consegue editar e quantas vezes está disposto a manter, com o mesmo orçamento. Os dados de volume de uso apenas escreveram essa verdade simples com trinta milhões de cliques.

Artigos relacionados