← Retour au blog
AiEnviron 7 min de lecture

Qui les utilise vraiment : les modèles chinois captent plus de la moitié des usages de génération d'images et de vidéos à l'étranger

Publié le 11 oct. 2026
Qui les utilise vraiment : les modèles chinois captent plus de la moitié des usages de génération d'images et de vidéos à l'étranger

Du 24 août au 5 octobre, Overchat AI a enregistré 1,09 million d'utilisateurs et 31,6 millions d'interactions avec des modèles. Quand on déplie ces statistiques anonymisées, ce qui saute le plus aux yeux n'est pas qui gagne un point sur un classement, mais à qui les gens confient réellement la tâche : la génération d'images et celle de vidéos, les deux activités les plus gourmandes en calcul et les plus coûteuses, sont assurées à plus de la moitié par des modèles chinois.

Il ne s'agit pas de scores d'évaluation, mais de volume d'usage. Un score peut s'obtenir en gonflant un test ponctuel ; un volume d'usage ne s'accumule qu'à force de clics répétés, encore et encore.

Précisons d'abord la méthodologie, pour éviter de prendre ces données pour un recensement du marché. Elles proviennent d'une plateforme qui réunit plusieurs modèles dans une même mini-application ; elles portent sur 31,6 millions d'interactions réalisées par 1,09 million d'utilisateurs dans 1,2 million de sessions, entre le 24 août et le 5 octobre. La part est calculée ainsi : « chaque fois qu'un utilisateur a recours à un modèle, cela compte pour une unité », et non en cumulant chaque appel. L'échantillon penche naturellement vers des utilisateurs prêts à essayer plusieurs modèles à la fois ; il ressemble donc davantage à un instantané de « qui est rouvert encore et encore » qu'à une facture de chiffre d'affaires du secteur entier. Mais justement parce que tous les modèles sont placés à une même entrée et face au même public, cette comparaison est plus convaincante que les benchmarks publiés séparément par les éditeurs.

Le texte reste américain, l'image change de mains

Commençons par ce qui n'a pas changé. Dans les interactions textuelles, Gemini, GPT, Claude et Grok totalisent 86,2 %, et les éditeurs américains n'y ont quasiment pas de concurrents. Ce qui change, c'est l'image : la part des modèles chinois en génération d'images passe de 54,0 % à 59,5 % par rapport à la période précédente, et celle en génération de vidéos de 43,5 % à 53,6 %. Sur la même période, les modèles chinois représentent 36,9 % de l'ensemble des interactions.

En zoomant sur les familles de modèles, la répartition devient plus nette. Côté image, Seedream de ByteDance reste solidement en tête avec 33,5 %, suivi de Nano Banana de Google (26,1 %) et de Qwen Image d'Alibaba (26,0 %), ce dernier ayant presque doublé par rapport aux 12,3 % de la période précédente. Côté vidéo, Grok Imagine de xAI reste premier (30,6 %, en recul toutefois face aux 39,6 % précédents), Seedance de ByteDance bondit de 10,8 % à 25,2 %, et Kling se maintient à 21,9 %.

Ce qui mérite vraiment qu'on s'y arrête, c'est la fenêtre de deux semaines : du 22 septembre au 5 octobre, Qwen Image devient la famille de modèles la plus utilisée, toutes catégories confondues, avec 17,2 %, devançant le texte de GPT (10,9 %) et celui de Gemini (10,8 %). Une famille issue de poids ouverts et spécialisée dans l'édition d'images est donc ouverte plus souvent que tous les modèles textuels réunis, dans une entrée qui agrège les modèles de tous les éditeurs.

Un graphique comparatif des parts d'usage : dans les deux colonnes de la génération d'images et de vidéos, la part des modèles chinois dépasse la moitié

Être moins cher ne veut pas dire être utilisé : ce que disent vraiment les chiffres de Qwen

L'explication la plus évidente serait le prix. Overchat AI précise d'ailleurs que Qwen Image et GPT Image 2.5 ont le même prix unitaire sur la plateforme, et sont tous deux inclus dans l'offre gratuite. À prix égal, l'écart d'usage est d'environ quatre fois. Ce qui joue ici n'est donc pas la question de savoir qui est le moins cher, mais autre chose : le taux d'images réellement exploitables, la capacité à préserver l'image d'origine lors d'une édition, et l'envie de l'utilisateur de retenter une deuxième fois après le premier essai.

Une donnée connexe explique bien cette fidélité. Chez les nouveaux utilisateurs, OpenAI et Anthropic totalisent 23,8 % des choix de modèles ; chez les utilisateurs qui reviennent, ce chiffre tombe à 19,8 %. Dans le même temps, Google passe de 20,9 % à 28,0 % et les éditeurs chinois de 36,3 % à 39,8 %. Le premier choix repose sur la notoriété, les suivants sur l'expérience réelle. Les gens changent, et ils changent en direction des capacités visuelles.

Les usages changent, les appareils aussi

Les écarts régionaux sont plus marqués que prévu. Au Japon, 74,4 % de l'usage de l'IA provient de Gemini, qui règne quasiment sans partage ; l'Espagne et l'Indonésie penchent nettement vers Qwen Image. Les États-Unis font exception : c'est le seul grand marché où la génération de vidéos constitue la première catégorie, avec 36,8 %. Le Brésil est le plus tourné vers le texte, à 49,3 %.

Le mobile représente environ 74 % des sessions, avec un partage presque égal entre texte, image et vidéo, à environ 33 % chacun. Sur ordinateur, le texte domine nettement, à 51,3 %, avec GPT, Gemini et Claude comme familles principales. Ce contraste révèle une chose : la génération d'images et de vidéos devient une activité « qu'on fait sur le pouce », que l'on essaie dès qu'on y pense sur son téléphone, plutôt que quelque chose que l'on prépare sérieusement une fois devant son ordinateur. Les familles privilégiées sur mobile le confirment : Seedream, Grok Imagine, Seedance.

Ne confondez pas volume d'usage et qualité

Les limites sont tout aussi claires. Il s'agit de l'échantillon d'une seule plateforme, dont la structure d'utilisateurs penche vers des personnes prêtes à tester de nouveaux modèles : impossible de l'extrapoler directement à l'ensemble du marché. Un usage élevé signifie seulement qu'un modèle est rouvert souvent, pas que chaque image est meilleure. Le coût de Seedance est environ trois fois supérieur à celui de Grok Imagine 1.5, et pourtant sa part a plus que triplé : la preuve que le prix n'a jamais été le seul critère qui compte pour les utilisateurs.

Mais en croisant cet échantillon avec d'autres signaux, la direction devient limpide. Sur la même période, Alibaba a ouvert les poids de Qwen-Image (même si la licence a été restreinte à la recherche), ByteDance a ajouté à Seedance un mode qui génère d'abord un brouillon en 480P avant de produire la version finale une fois le résultat satisfaisant, et Shengshu Technology a ramené le prix de lancement de son modèle vidéo phare à 0,09 yuan la seconde. Tous ces gestes visent le même objectif : rendre le fait de « réessayer plusieurs fois » abordable.

En élargissant encore le cadre, ces données éclairent aussi un phénomène plus macro : l'adoption de la génération de vidéos et d'images à partir de texte descend des studios professionnels vers monsieur Tout-le-monde. Que le mobile représente plus de 70 % des sessions et que les trois types de contenu se partagent presque également l'usage signifie que la plupart des gens ne construisent pas de workflows, mais essaient au hasard. Ce public ne détermine pas le plafond de performance des modèles de pointe, mais il détermine à quelle fréquence un modèle est utilisé et à combien de personnes il est recommandé. Celui qui saura le plus sûrement garantir qu'« un essai donne un résultat exploitable » aura le plus de chances de rester sur le premier écran du téléphone.

Dans la compétition de l'image et de la vidéo, ce qui compte au final n'est pas le plafond d'une œuvre unique, mais combien de fois vous pouvez essayer, retoucher, et accepter de garder, à budget égal. Les données d'usage ne font qu'écrire cette idée toute simple, en trente millions de clics.

Articles associés