← Retour au blog

Du slop IA à la transparence native : une année de génération d’images, en quatre mutations

Publié le 27 sept. 2026
Du slop IA à la transparence native : une année de génération d’images, en quatre mutations

Il y a un an, le mot le plus fort dans la conversation sur l’image IA était « slop ». Il décrivait le flot d’images peu soignées et étranges qui envahissaient les fils sociaux et les fermes de contenu, ce genre d’image qui semblait presque juste et pourtant fausse, un visage avec trop de dents, une main à six doigts, un paysage qui se dissolvait en bruit sur les bords. Le terme est resté parce qu’il nommait quelque chose de réel : une technologie devenue assez bonne pour produire de la médiocrité en masse, mais pas encore assez bonne pour compter.

Douze mois plus tard, la même technologie livre la transparence native, l’édition sur dix images et des modèles locaux qui tournent sur un GPU de milieu de gamme. L’ère du « slop » ne s’est pas vraiment terminée : elle est devenue plus complexe. Les outils qui produisaient des déchets sont les mêmes qui produisent aujourd’hui des ressources que les professionnels utilisent réellement. La différence n’est pas une percée unique, mais quatre mutations survenues progressivement, et si vous voulez comprendre où va la génération d’images, vous devez voir ces quatre mutations en même temps.

La première mutation va de la nouveauté au flux de travail. Les premiers générateurs d’images produisaient une seule image, puis s’arrêtaient. Les nouveaux sont conçus autour de l’édition, de la composition et de la production de ressources qui s’intègrent dans un processus plus large. Un logo avec un canal alpha propre n’est pas une œuvre finie, c’est un composant. Un modèle capable de combiner dix références ne fabrique pas une image, il assemble une composition. La catégorie de produit est passée de « générateur d’images » à « outil d’images », et ce changement compte parce qu’un outil se juge à la façon dont il s’insère dans le travail, pas à l’effet produit par une seule sortie.

La deuxième mutation va du fermé à l’ouvert. Les meilleurs modèles se trouvaient autrefois derrière des API. Cette année, les modèles ouverts ont suffisamment rattrapé leur retard pour qu’un modèle de 7 milliards de paramètres exécuté localement puisse gérer des tâches qui nécessitaient auparavant une API payante. Qwen-Image 2.1 est le marqueur actuel, mais il s’inscrit dans une tendance plus longue. Les poids ouverts, les licences de recherche et une communauté de créateurs de packs d’intégration ont fait de la génération d’images performante quelque chose que l’on peut exécuter sur son propre matériel. Le tutoriel « tourne sur une carte 6 Go » est le symbole de cette mutation, le moment où l’accès a cessé d’être le goulot d’étranglement.

La troisième mutation va de l’absence de contraintes à la responsabilité. La crise des deepfakes de Grok en a été la version la plus aiguë, mais le mouvement de fond était déjà en cours. Les régulateurs ont cessé de traiter les générateurs d’images comme des outils neutres et ont commencé à les considérer comme des produits dont les développeurs portent la responsabilité de ce qu’ils livrent. La provenance des contenus, la sécurité intégrée au modèle plutôt qu’ajoutée après coup et la responsabilité en cas d’images non consenties sont toutes passées des marges au centre de la conversation. Un outil capable de tout générer était autrefois une fonctionnalité. Aujourd’hui, c’est un risque juridique.

La quatrième mutation va de la rareté de calcul à l’efficacité de calcul. L’entraînement est devenu plus rapide, le service moins cher, et l’histoire matérielle a gagné une seconde voie avec des alternatives comme Ascend de Huawei. Rien de tout cela n’est une percée unique, mais l’effet cumulé est que la génération d’images a cessé d’être réservée aux plus grands laboratoires pour devenir quelque chose qu’une petite équipe ou un créateur solo peut réellement budgéter. Des articles sur l’efficacité, comme l’accélération de l’entraînement par 3,6, sont le moteur discret de cette mutation.

Ce qui est intéressant avec ces quatre mutations, c’est qu’elles sont en tension les unes avec les autres. La mutation vers la responsabilité pousse à la prudence et à la restriction, à des livraisons plus lentes, à davantage de garde-fous. Les mutations vers l’ouverture et l’efficacité poussent à l’accès et à la vitesse, à plus de modèles, plus de liberté. L’ère du « slop » est ce qui s’est produit quand l’accès a dépassé la qualité, quand tout le monde pouvait générer mais peu pouvaient bien générer, et le résultat a été un flot de productions médiocres. L’année à venir se définira par la capacité du domaine à tenir les quatre à la fois : rendre la génération d’images ouverte et bon marché sans la rendre, de nouveau, majoritairement médiocre.

Il existe un vrai risque que ce ne soit pas possible. Les modèles ouverts sont désormais assez bons pour que le problème du « slop » puisse empirer avant de s’améliorer, parce que les outils permettant de produire des images peu soignées sont maintenant gratuits et locaux. Les mécanismes de responsabilité sont encore en train de rattraper leur retard, et les précédents juridiques sont établis en temps réel par les affaires Grok. Il est tout à fait possible d’imaginer un monde où la capacité progresse plus vite que les garde-fous, avec pour résultat plus de « slop », plus d’abus et plus de réactions hostiles. Les quatre mutations ne pointent pas dans une direction nette, elles tirent les unes contre les autres.

Mais il existe aussi une lecture plus optimiste. La mutation du flux de travail, le passage d’images finies à des ressources composables, s’oppose par nature au « slop ». Une couche transparente qu’un designer peut livrer, une composition à dix références pour une campagne, un modèle local qui produit les photos de produits d’une petite boutique : tout cela est l’opposé du « slop ». C’est la même technologie tournée vers l’artisanat. La question n’est pas de savoir si la génération d’images produira des déchets, elle en produira toujours, mais si les déchets resteront l’impression dominante.

Le mot « slop » perdurera probablement, car il reste encore beaucoup de productions peu soignées, et il y en aura peut-être toujours. Mais ce n’est plus toute l’histoire. Les mêmes modèles sous-jacents génèrent désormais des couches transparentes qu’un designer peut livrer, composent dix références en une image de campagne et tournent sur une carte que l’on peut acheter au détail. La technologie ne s’est pas tant échappée de l’ère du « slop » qu’elle a grandi autour, ajoutant un étage supérieur productif pendant que les déchets s’accumulaient en dessous.

Ce qui a changé en un an, ce n’est pas que les modèles ont cessé de faire de mauvaises images. C’est qu’ils ont commencé à en faire de bonnes, dans des formats adaptés à la façon dont les gens travaillent réellement. C’est une étape plus discrète que n’importe quel lancement de modèle, et c’est celle qui comptera le plus à long terme. Les démos clinquantes vont et viennent, mais la capacité de remettre à un designer une ressource transparente propre, ou à un petit vendeur un modèle local qui produit ses photos de produits, est le genre de progrès qui s’accumule. Dans un an, le mot « slop » sera probablement encore là, mais il décrira une part de plus en plus réduite de ce que ces outils font réellement.

Si vous voulez une seule image pour résumer toute l’année, c’est celle-ci : la génération d’images a grandi. La technologie est passée d’un tour de salon produisant une image impressionnante à la fois à une capacité industrielle qui produit des ressources, dans les bons formats, sous les bonnes contraintes, à un prix qu’une personne normale peut se permettre. Les quatre mutations — flux de travail, ouverture, responsabilité et efficacité — sont quatre façons de dire la même chose. L’outil a cessé de tourner autour du modèle pour tourner autour du travail.

C’est ce recadrage qui explique pourquoi les deux plus grandes histoires de l’année semblent si différentes en surface. Qwen-Image 2.1, avec ses couches transparentes et son édition multi-images, est l’outil qui grandit dans la direction productive, vers l’artisanat. La crise des deepfakes de Grok est l’outil qui grandit dans la direction dangereuse, vers la responsabilité, le moment où les conséquences adultes d’un outil sans contraintes sont devenues impossibles à ignorer. Les deux relèvent de la même maturation de fond, vue sous des angles opposés, et un domaine autrefois défini entièrement par ce que les modèles pouvaient créer est désormais défini tout autant par la façon dont ils sont fabriqués, par qui peut les utiliser et par ce qui se passe lorsqu’ils sont détournés.

Le mot « slop » perdurera probablement, car il reste encore beaucoup de productions peu soignées, et il y en aura peut-être toujours. Mais ce n’est plus toute l’histoire. Les mêmes modèles sous-jacents génèrent désormais des couches transparentes qu’un designer peut livrer, composent dix références en une image de campagne et tournent sur une carte que l’on peut acheter au détail. La technologie ne s’est pas tant échappée de l’ère du « slop » qu’elle a grandi autour, ajoutant un étage supérieur productif pendant que les déchets s’accumulaient en dessous. Il y a un an, cet étage supérieur n’existait pas. Aujourd’hui, il existe, et c’est la chose la plus importante à propos de la génération d’images que la plupart des gens n’ont pas remarquée.

Articles associés