← Retour au blog
News6 min

En septembre, les modèles open source chinois de génération d'images ripostent coup sur coup : SenseTime, Ant Group et InternLM ne restent pas les bras croisés

Publié le 26 sept. 2026
En septembre, les modèles open source chinois de génération d'images ripostent coup sur coup : SenseTime, Ant Group et InternLM ne restent pas les bras croisés

Ce mois de septembre qui vient de s'écouler a été marqué par un changement discret mais crucial dans la génération d'images par IA en Chine : l'open source. En l'espace d'une semaine, SenseTime, Ant Group et l'équipe InternLM du Laboratoire d'intelligence artificielle de Shanghai ont successivement publié des modèles de génération d'images open source, mettant sur la table des capacités jusqu'ici réservées aux grands acteurs fermés. L'impact pourrait être bien plus important que la sortie d'un nouveau modèle.

Ce que chacun des trois acteurs met sur la table

SenseTime SenseNova U1.5 Lite, publié en open source le 8 septembre, est un modèle de génération d'images de 8 milliards de paramètres. Son argument clé est la sortie directe en 4K, avec un discours officiel le présentant comme « comparable aux grands modèles fermés ». La taille de 8B est essentielle : elle signifie qu'il peut tourner sur les cartes graphiques dont disposent déjà les développeurs ordinaires, sans devoir viser d'emblée 12 Go ou 24 Go de VRAM.

Le modèle d'image unifié 6B d'Ant Group, publié en open source le 6 septembre, emprunte une voie plus « pratique » : la génération à partir de texte et l'édition par instructions sont réunies dans un seul modèle. Autrement dit, vous pouvez lui demander de créer une image de zéro, ou lui donner une image et lui dire de « changer l'arrière-plan » ou « éclaircir les couleurs », sans basculer entre deux modèles. Plus rare encore, Ant Group a également entièrement publié sa recette d'entraînement. Les modèles open source ne manquent pas, mais ceux qui dévoilent les détails de l'entraînement sont peu nombreux.

InternLumina-U2 de l'équipe InternLM, annoncé le 3 septembre, est un grand modèle visuel axé sur l'unification de la compréhension et de la génération d'images ; les poids seront ouverts. Il se positionne plutôt comme « un modèle qui comprend les images et sait aussi en créer », ce qui constitue un avantage par rapport aux modèles purement génératifs lorsqu'il faut d'abord lui faire comprendre une image de référence puis la modifier en conséquence.

Schéma de l'écosystème des modèles open source chinois de génération d'images par IA

Pourquoi l'open source mérite qu'on s'y attarde

Beaucoup pensent peut-être que les modèles open source concernent peu les utilisateurs ordinaires, puisqu'ils n'entraînent pas eux-mêmes de modèles. Mais la véritable chaîne d'impact est la suivante : les modèles open source deviennent la fondation de toutes sortes d'outils gratuits.

Un développeur indépendant, ou une petite équipe, sans budget pour les API des grands fournisseurs, mais qui veut ajouter une fonction de génération d'images à son produit, que fait-il ? La réponse consiste à récupérer un modèle open source sur Hugging Face et à le faire tourner en local, ou sur un GPU loué à bas coût. Des tailles comme le 8B de SenseTime ou le 6B d'Ant Group se situent précisément dans la fourchette « capable de tenir dans une machine grand public ». Plus les modèles open source sont nombreux, petits et performants, plus les solutions gratuites de génération d'images que des gens ordinaires peuvent assembler se multiplient.

Inversement, c'est aussi une réponse des modèles chinois aux voies open source bien établies comme Stable Diffusion et Flux. Auparavant, parler de génération d'images open source signifiait par défaut l'écosystème Stable Diffusion. Aujourd'hui, des acteurs chinois commencent à s'y faire une place, avec des atouts locaux comme la compréhension du chinois et le rendu des caractères chinois, ce qui représente un vrai gain pour les utilisateurs sinophones.

Après l'open source, que reste-t-il à jouer ?

L'open source n'est pas une fin, mais un point de départ. Une fois un modèle publié, sa capacité à être réellement utilisé dépend encore de trois choses.

La première, c'est l'écosystème. Il ne suffit pas d'avoir les poids d'un modèle : il faut des outils d'inférence, des scripts d'entraînement LoRA et une prise en charge WebUI. Si Stable Diffusion reste aujourd'hui le choix par défaut de beaucoup de gens, ce n'est pas grâce à une version en particulier, mais grâce à toute la chaîne d'outils qui l'entoure.

La deuxième, c'est la capacité en chinois. La plus grande différenciation des modèles chinois réside dans la compréhension des invites en chinois et le rendu du texte chinois. C'est un point que les modèles open source étrangers n'ont longtemps pas su bien traiter, et c'est aussi celui que les modèles open source chinois devraient s'efforcer de verrouiller.

La troisième, c'est la voie de commercialisation. Comment gagner de l'argent avec des modèles open source reste une question difficile. Pour des acteurs comme SenseTime, Ant Group et InternLM, l'open source n'est probablement pas de la philanthropie : il s'agit de bâtir un écosystème grâce à l'ouverture, puis de le monétiser via des services aux entreprises, des API cloud et des prestations sur mesure. Pour les utilisateurs, cela signifie que les choses gratuites vont se multiplier, mais il faudra observer dans la durée si « gratuit » et « maintenance continue » peuvent vraiment aller de pair.

Un dernier élément de contexte mérite d'être ajouté : cette vague d'open source arrive à un moment où l'écosystème open source étranger marque un peu le pas. Stable Diffusion n'a pas connu de véritable mise à jour majeure depuis longtemps, et Flux n'a toujours pas publié l'intégralité de ses poids en open source. En ouvrant maintenant des modèles de 6B et 8B, c'est-à-dire « pouvant tenir dans une machine domestique », les acteurs chinois profitent de ce creux pour poser les fondations de la génération d'images open source en chinois.

Ce que cela change concrètement pour les créateurs ordinaires

Concrètement, pour les individus, le changement apporté par ces modèles open source est le suivant : le coût de la génération d'images continue de baisser.

Auparavant, pour utiliser régulièrement l'IA afin de produire quelque chose de sérieux, il fallait soit s'abonner à un outil, soit payer une API à la pièce. Avec la multiplication des modèles open source, une série de solutions gratuites et exécutées en local a vu le jour. Certes, ces solutions ont généralement un certain seuil d'entrée — il faut savoir installer un environnement et régler des paramètres —, mais ce seuil est peu à peu réduit par la communauté.

Mon avis est qu'à court terme, les créateurs ordinaires auront encore tout intérêt à utiliser des outils web, plus simples. Mais si vous développez un petit produit ou une petite application et que vous avez besoin d'y intégrer une capacité de génération d'images, la densité et le format de cette vague de modèles open source méritent que vous y jetiez un nouvel œil. Au minimum, l'idée selon laquelle « la Chine ne dispose pas de bons modèles open source de génération d'images » ne tient plus depuis septembre.

Articles associés