L'open source de génération d'images compressé sur une carte graphique grand public : Hunyuan DiT abaisse le seuil à 6 Go de VRAM

Depuis un an, les mises à jour de la génération d'images à partir de texte en open source tournent essentiellement autour de la qualité visuelle. Celui dont le texte est plus net, celui dont la lumière et les ombres ressemblent davantage à de la photographie — c'est lui qui reste quelques jours de plus en tête des classements. En ce mois d'octobre, le vent a quelque peu tourné. Le centre des discussions dans la communauté n'est plus « quelle image est la plus belle », mais « ma carte graphique, est-ce qu'elle tient le coup, oui ou non ».
La barre des 6 Go de VRAM a été conquise de haute lutte
Parmi les annonces récentes du grand modèle de génération d'images à partir de texte de Tencent Hunyuan (Hunyuan DiT), la plus utile concerne la publication en open source d'une « version à faible VRAM ». Selon la communication officielle, 6 Go de VRAM suffisent à le faire tourner. Le poids de ce chiffre, quiconque a utilisé la génération d'images open source le comprend : jusqu'ici, pour faire tourner une configuration décente en local, 16 Go de VRAM représentaient presque le ticket d'entrée, 8 Go était tout juste faisable, et 6 Go vous valait un refus catégorique.

Les mesures d'accompagnement ont suivi. Cette version adapte également des extensions comme LoRA et ControlNet à la bibliothèque Diffusers, et ajoute la prise en charge de l'interface graphique Kohya. Le rôle de Kohya au sein de la communauté, c'est justement d'arracher « l'entraînement de son propre LoRA » au seuil de la ligne de commande pour en faire une affaire de quelques clics. Son intégration revient à ouvrir grand la voie vers « je veux que le modèle apprenne mon propre style ».
En parallèle, Hunyuan DiT passe lui-même en version 1.2, les améliorations annoncées portant sur les textures et la composition de l'image. Ces deux points sont précisément ceux qui sont reprochés depuis longtemps aux modèles open source : dès qu'il y a trop de détails, ça devient flou ; dès que la composition se complexifie, ça se disperse.
Une autre annonce passe plus facilement inaperçue, mais elle est essentielle : Tencent a également publié en open source le modèle d'annotation de Hunyuan, « Hunyuan Captioner ». Le modèle d'annotation est la première étape de l'entraînement d'un LoRA : il faut d'abord que la machine décompose chaque élément en phrases descriptives lisibles avant de pouvoir parler d'entraînement. Jusqu'ici, cette étape passait soit par des interfaces propriétaires, soit par des substituts de qualité inégale. Son ouverture en open source retire une dépendance de plus à des services externes dans la chaîne d'entraînement locale.
Une fois les modèles open source lancés, la communauté s'affaire à les « réparer »
Les progrès du côté de Hunyuan reviennent à élargir la route, tandis que la communauté s'emploie à corriger une autre ligne. Après l'ouverture en open source de Qwen-Image 2.1, une vague massive de créations dérivées a déferlé, suivie d'une période de corrections intensives.
Une combinaison assez représentative est Qwen-Image-2.1-viggle-turbo : 7,26 Go, inférence en 6 étapes, quantification int8, souvent utilisée pour produire rapidement des planches de personnages, complétée par un VAE de correction de texture texture-fix de 676 Mo. La version Fix v2.0 d'un autre auteur prétend éliminer cette couche caractéristique de bruit et de détails désordonnés de Qwen, et ce presque sans toucher à la composition. Il existe aussi une version Opinionated, plus nette, au prix d'un léger décalage de l'image, que son auteur publie empaquetée avec un ensemble de sampleurs res_2m_nc dérivés de RES4LYF.
Ces correctifs peuvent sembler anecdotiques, mais ils démontrent une chose : lorsqu'un modèle open source entre en production réelle, ce qui détermine vraiment son utilité n'est souvent pas la version du jour de sa sortie, mais la volonté de la communauté d'écrire des correctifs pour lui dans les semaines qui suivent.
La communauté a aussi accumulé des paramètres directement réutilisables. Après avoir chargé un LoRA sur Qwen 2.1, quelqu'un recommande un CFG entre 2,0 et 3,0, 40 étapes, avec le sampleur res_multistep ou beta. Un autre, qui fait tourner le flux de travail standard en 2,0 MP sans LoRA, affirme que la nouvelle version du modèle d'image Qwen dégage une saveur Midjourney que l'on ne voyait auparavant que dans les modèles propriétaires.
Des progrès nets ont également été réalisés en vitesse. Krea 2 Turbo, un point de contrôle LoRA à distillation en deux étapes, réduit le temps de débruitage en 1024x1024 de 76,4 secondes à 19,3 secondes, soit environ quatre fois moins. Le prix à payer : la qualité des détails ne représente plus qu'entre 0,97 et 1,09 fois celle du modèle enseignant, bien mieux que les 0,40 à 0,65 fois du Turbo natif en deux étapes, mais les plans rapprochés s'en sortent le mieux, tandis que les grandes scènes restent en deçà.
Les petites lacunes comblées au passage
Outre les modèles principaux, plusieurs modèles open source de niche mais à la réputation solide comblent peu à peu leurs faiblesses. Aesthetic v1.1 et One Obsession v4 d'Anima sont souvent utilisés pour des rendus stylisés ; les utilisateurs louent sa fidélité au style, la facilité d'écriture des prompts, la possibilité d'obtenir des variantes cohérentes en modifiant le prompt après avoir fixé la graine, ainsi que le rendu de textes courts. Ses faiblesses sont tout aussi assumées : les scènes à plusieurs personnages et les textes longs restent laborieux, et la communauté attend Anima 2.
Du côté de Krea 2, les plaintes portent sur le fait que « différentes graines se ressemblent ». Quelqu'un a donc mis au point une méthode sans LoRA et sans nœuds spécifiques au modèle : réutiliser l'encodeur de texte de ComfyUI (par exemple Qwen3VL 4B) comme LLM pour enrichir le prompt, en traitant la graine du prompt comme un bouton de réglage grossier et la graine d'échantillonnage comme un bouton de réglage fin. Ces « astuces maison » circulent vite et résolvent souvent mieux les problèmes concrets que la documentation officielle.
Une fois le seuil abaissé, la comparaison porte sur autre chose
Si l'on met tous ces mouvements côte à côte, la direction est claire. La génération d'images open source ne répond plus seulement à « est-ce que ça peut dessiner de façon réaliste », elle commence à répondre à deux autres questions : est-ce que ça peut tourner sur une machine que je peux m'offrir, et est-ce que ça peut être modifié précisément selon mon intention.
Hunyuan, en compressant la VRAM à 6 Go et en ouvrant son modèle d'annotation, répond à la première question. Les correctifs et les LoRA d'accélération de la communauté Qwen répondent, dans la seconde, au « modifier avec précision » et au « tourner vite ». Ces deux lignes semblent sans rapport, mais elles convergent vers le même point : faire passer la génération du stade de la démonstration à celui du quotidien.
Pour le créateur ordinaire, c'est sans doute le changement le plus concret de l'année écoulée. Vous n'avez plus besoin de louer de la puissance de calcul pour une seule image, ni de réinstaller tout un environnement pour changer de style. Une carte graphique de milieu de gamme d'il y a quelques années, plus la chaîne d'outils accumulée par la communauté, suffisent déjà à produire une série d'œuvres présentables.
Ce qui a réellement été comprimé, c'est la distance entre « j'aimerais essayer » et « je m'y mets vraiment ».
Articles associés
Un semi-humanoïde à roues a terminé une heure de lessive sans aide
Des tâches individuelles peuvent réussir alors qu'un flux de travail échoue encore. Dyna a changé la métrique.
LTX 2.5 veut transformer votre brouillon Blender en un plan finalisé
En texte-vidéo, vous ne contrôlez pas ce qui se passe. Cet outil tente d'y remédier.
ServiceNow transforme les échecs des agents en données d'entraînement
La génération sans vérification est du bruit. Les portes sont le produit.
Un seul cadre pour le langage et la vision : le modèle ouvert 1,6B d’Horizon
Un pari : les ponts entre le langage et la vision n’ont jamais été nécessaires.