Quem realmente usa: modelos chineses levam mais da metade do uso de geração de imagem e vídeo no exterior

De 24 de agosto a 5 de outubro, o Overchat AI registrou 1,09 milhão de usuários e 31,6 milhões de interações com modelos. Ao abrir essa estatística anônima, o que mais chama atenção não é quem subiu um ponto em alguma tabela, mas sim em quem as pessoas votaram quando realmente colocaram a mão na massa: geração de imagem e geração de vídeo, as duas tarefas que mais consomem poder computacional e mais dinheiro, tiveram mais da metade concluída por modelos chineses.
Estes não são resultados de avaliação, são volume de uso. Resultados podem ser inflados com um teste ampliado; o volume de uso só se acumula com cliques repetidos, um após o outro.
Primeiro, é preciso deixar claro o critério desses dados, para não os tomar como um censo de mercado. Eles vêm de uma plataforma que reúne vários modelos em um mesmo miniaplicativo e contabilizam 31,6 milhões de interações de 1,09 milhão de usuários em 1,2 milhão de sessões entre 24 de agosto e 5 de outubro; a participação é calculada como "cada vez que um usuário usa um modelo, conta um", e não pelo acúmulo de cada chamada. A amostra favorece naturalmente usuários dispostos a testar vários modelos ao mesmo tempo, então ela é mais um retrato de "quem está sendo aberto repetidamente" do que uma conta de receita do setor inteiro. Mas, justamente porque todos os modelos ficam na mesma entrada e diante do mesmo grupo de pessoas, essa comparação é mais convincente do que os benchmarks divulgados por cada fabricante.
O texto ainda é dos EUA; a imagem está trocando de mãos
Vejamos primeiro o que não mudou. Nas interações de texto, Gemini, GPT, Claude e Grok somam 86,2%, e fabricantes americanos quase não têm rivais nesse campo. O que mudou é a imagem: a participação de modelos chineses na geração de imagem subiu de 54,0% no período anterior para 59,5%, e na geração de vídeo, de 43,5% para 53,6%. No mesmo período, modelos chineses representaram 36,9% de todas as interações.
Se aproximarmos o zoom nas famílias específicas, a divisão de trabalho fica mais clara. No lado da imagem, o Seedream, da ByteDance, mantém a primeira posição com 33,5%; o Nano Banana, do Google, tem 26,1%; e o Qwen Image, da Alibaba, 26,0%, quase o dobro dos 12,3% do período anterior. No lado do vídeo, o Grok Imagine, da xAI, continua em primeiro entre produtos individuais (30,6%, embora abaixo dos 39,6% do período anterior), o Seedance, da ByteDance, saltou de 10,8% para 25,2%, e o Kling se manteve em 21,9%.
O que realmente merece uma pausa é a janela de duas semanas: de 22 de setembro a 5 de outubro, o Qwen Image se tornou a família de modelos mais usada em todas as categorias, com 17,2%, superando os 10,9% do GPT para texto e os 10,8% do Gemini. Uma família originada de pesos abertos e especializada em edição de imagem, em uma entrada que agrega modelos de diversos fabricantes, foi aberta mais vezes do que todos os modelos de texto.

Barato não significa ser usado: os números do Qwen indicam outra coisa
A explicação mais fácil seria o preço. O Overchat AI fez questão de acrescentar: o Qwen Image e o GPT Image 2.5 têm o mesmo preço unitário na plataforma e ambos estão incluídos no plano gratuito. O preço é igual, mas o volume de uso difere em cerca de quatro vezes. Portanto, o que está em jogo aqui não é quem é mais barato, e sim outra coisa: a taxa de resultados utilizáveis nas imagens geradas, o grau de preservação da imagem original ao editar e a disposição do usuário em tentar uma segunda vez depois do primeiro teste.
Um dado complementar explica bem essa retenção. Entre as escolhas de modelo de novos usuários, OpenAI e Anthropic somam 23,8%; entre usuários recorrentes, esse número cai para 19,8%. Ao mesmo tempo, o Google sobe de 20,9% para 28,0%, e os fabricantes chineses, de 36,3% para 39,8%. A primeira escolha vem da familiaridade; depois, vem da experiência real. As pessoas trocam, e trocam na direção da capacidade de geração visual.
O uso está mudando, e os dispositivos também
As diferenças regionais são maiores do que se imagina. No Japão, 74,4% do uso de IA vem do Gemini, que praticamente domina sozinho; Espanha e Indonésia claramente preferem o Qwen Image. Os Estados Unidos são uma exceção: são o único grande mercado que tem a geração de vídeo como primeira categoria, com 36,8%. O Brasil é o mais voltado a texto, com 49,3%.
O mobile respondeu por cerca de 74% das sessões, e texto, imagem e vídeo ficaram quase divididos em três partes iguais, com aproximadamente 33% cada. Já o desktop é claramente mais voltado a texto, 51,3%, com as famílias dominantes sendo GPT, Gemini e Claude. Essa comparação revela uma coisa: a geração de imagem e vídeo está se tornando algo que se faz "na hora", quando o usuário tem a ideia no celular, em vez de esperar até sentar no computador para fazer com cuidado. As famílias preferidas no mobile também confirmam isso: Seedream, Grok Imagine e Seedance.
Não confunda volume de uso com qualidade do produto
Os pontos que exigem cautela também são claros. Esta é uma amostra de uma única plataforma, e a estrutura de usuários tende a favorecer pessoas dispostas a testar novos modelos, não podendo ser extrapolada diretamente para o mercado inteiro. Um volume de uso alto só mostra que algo é aberto repetidamente, não que cada imagem seja melhor. O custo do Seedance é cerca de três vezes o do Grok Imagine 1.5, e ainda assim sua participação mais que triplicou, o que mostra que os usuários nunca se importaram apenas com o preço.
Mas, ao juntar esta amostra com outros sinais, a direção deixa de ser ambígua. No mesmo período, a Alibaba abriu os pesos do Qwen-Image (embora a licença tenha sido alterada para uso apenas em pesquisa), a ByteDance adotou para o Seedance o modelo de gerar primeiro um rascunho em 480P e só produzir o vídeo final se o usuário aprovar, e a Shengshu Technology reduziu o preço de lançamento do seu modelo de vídeo principal para 0,09 yuan por segundo. Todas essas ações apontam para o mesmo objetivo: tornar "tentar mais algumas vezes" algo acessível.
Ampliando um pouco mais o escopo, estes dados também explicam algo mais macro: a adoção de texto para vídeo e de texto para imagem está descendo dos estúdios profissionais para as mãos de pessoas comuns. O fato de o mobile responder por mais de 70% das sessões e de os três tipos de conteúdo ficarem quase empatados significa que a maioria das pessoas não está montando fluxos de trabalho, mas testando de forma casual. Esse público não determina o teto de benchmark dos modelos de ponta, mas determina com que frequência os modelos são usados e para quantas pessoas são recomendados. Quem conseguir ser mais consistente em "um teste, um resultado utilizável" terá mais chance de permanecer na primeira tela do celular.
A competição em imagem e vídeo, no fim, não é sobre o teto de uma única peça final, mas sobre quantas vezes você consegue testar, quantas vezes consegue editar e quantas vezes está disposto a manter, com o mesmo orçamento. Os dados de volume de uso apenas escreveram essa verdade simples com trinta milhões de cliques.
Artigos relacionados
O protocolo PACT da Decagon quer tornar o consentimento um padrao
A Decagon abriu um protocolo para verificar a identidade de um agente pessoal e as permissoes que um cliente concedeu. E encanamento, e decide se a economia dos agentes funciona.
A onda de reencontros com IA: um debate que a China ainda nao sabe como sentir
Filmes de homenagem feitos com IA trouxeram figuras falecidas de volta as telas chinesas e renderam centenas de milhares de curtidas. Depois veio a reacao, e era sobre consentimento.
A Apple publicou um modelo multimodal aberto e quase nao avisou
Este lancamento voltado a pesquisa passou despercebido, mas seu ancoramento visual de grao fino diz muito sobre para onde vai a pilha de IA da Apple.
OpenCut e o momento do CapCut de codigo aberto
Um editor de video gratuito com licenca MIT continua subindo nas tendencias do GitHub, e seu roteiro inclui um servidor MCP para agentes de IA. As ferramentas em torno da midia com IA estao alcancando os modelos.