← Retour au blog
AiEnviron 10 min de lecture

Quatre étapes au lieu de quarante : comment la distillation compresse les modèles d'images ouverts sur les GPU grand public

Publié le 6 oct. 2026
Quatre étapes au lieu de quarante : comment la distillation compresse les modèles d'images ouverts sur les GPU grand public

L'écart entre un bon modèle d'image ouvert et une carte graphique grand public se resserre depuis des mois. Le mécanisme en jeu : moins d'étapes de débruitage. Un modèle qui demandait autrefois quarante passes pour transformer du bruit en image peut désormais y parvenir en quatre, six ou huit, à condition d'y attacher le bon adaptateur.

Deux publications de début octobre ont de nouveau repoussé cette frontière, et ce depuis des directions opposées : un article de recherche qui repense la manière dont la distillation est entraînée, et un LoRA de production qui applique l'idée à un modèle ouvert très utilisé.

DMAD transforme l'appariement de distributions en problème de classification

L'article en question est DMAD, pour Distribution Matching as Adversarial Distillation, signé par des chercheurs de Texas A&M et de ByteDance. Il a été rendu public le 1er octobre et s'attaque à un coût bien connu de la distillation.

La recette standard fonctionne ainsi. Un modèle enseignant génère des échantillons de haute qualité en de nombreuses étapes. Un modèle étudiant doit approximer la même distribution en une à quatre étapes. Pour guider l'étudiant, on entraîne un modèle de diffusion auxiliaire qui continue d'épouser la distribution courante de l'étudiant, puis on utilise la différence entre le score de l'enseignant et celui de l'étudiant pour mettre à jour l'étudiant. Le problème, c'est que l'étudiant ne cesse de changer, si bien que le modèle auxiliaire doit sans cesse le rattraper. La mémoire et le calcul grimpent.

DMAD reformule l'objectif en classification. Sur un socle de caractéristiques partagé reposent deux têtes de discriminateur. L'une sépare les données réelles des échantillons de l'étudiant. L'autre sépare les échantillons de l'enseignant de ceux de l'étudiant. Dans des conditions optimales, le score de sortie du discriminateur correspond à un logarithme de rapport de densités, ce qui signifie que l'étudiant peut se mettre à jour selon un objectif linéaire dérivé du score du discriminateur. Aucun modèle de score auxiliaire distinct n'est nécessaire.

Le second ingrédient est une supervision dépendante du niveau de bruit. Un enseignant est proche de la distribution réelle à certains niveaux de bruit et visiblement à côté à d'autres. DMAD mesure la différence empirique de score entre les échantillons réels et ceux de l'enseignant avec la première tête de discriminateur, puis repondère l'entraînement de l'étudiant en conséquence, afin que celui-ci hérite moins du biais de l'enseignant aux niveaux de bruit où ce dernier est le plus faible. Cela transforme une hypothèse — « l'enseignant a toujours raison » — en quelque chose de mesurable.

Les résultats couvrent trois échelles. Lors de l'entraînement en classification d'images sur ImageNet, la génération 64x64 en une étape a atteint un FID de 1,04. Le FID mesure à quel point la distribution générée diffère de la distribution réelle, et plus il est bas, mieux c'est.

La version de production est déjà disponible

La même idée parvient aux utilisateurs via des adaptateurs LoRA plutôt que par des articles. Alibaba PAI a publié Qwen-Image-2.1-Fun-Acc-LoRAs sur Hugging Face, appliquant une distillation par décodage parallèle pour réduire l'inférence des 40 évaluations de fonction neuronale de l'enseignant à 4, pour la génération texte-image comme pour l'édition par instruction. L'adaptateur est de rang 64 avec un alpha de réseau de 64 en BF16, et la fiche du modèle fournit des scripts de démarrage rapide pour Diffusers et VideoX-Fun.

La fiche du modèle est franche sur les compromis. Le petit texte dense se dégrade par rapport à l'enseignant, et les retouches d'image ressortent légèrement plus floues ou plus sombres. Pour une affiche avec un paragraphe de mentions en petits caractères, quatre étapes n'est pas le bon outil. Pour des images au format réseaux sociaux, où le texte est court et grand, ça l'est.

Un second adaptateur va plus loin en qualité. Qwen-Image-2.1 Turbo v0.2.1 est un LoRA de rang 128 en six étapes, d'environ 648 mégaoctets, qui compresse la longue ODE de flux de probabilité du modèle de flow matching de base en un calendrier sigma allant de 1,0 à 0,25. Six étapes est un réglage intermédiaire : assez de passes pour préserver le détail, assez peu pour rester rapide.

Les distillations communautaires complètent le reste de l'échelle. Un adaptateur turbo de Viggle vise quatre étapes. Les adaptateurs de PrunaAI visent cinq ou huit étapes. Tous deux reconnaissent honnêtement être des travaux en cours, et les notes de Pruna indiquent que la version à faible nombre d'étapes n'égale pas encore le modèle de base sur la composition multi-références, les échanges de visage et les retouches à contraintes multiples.

Krea 2 Turbo a pris une voie différente sur la licence. Ses adaptateurs de distillation en deux et quatre étapes sont désormais livrés avec des workflows ComfyUI sous Apache-2.0 pour Comfy Cloud, ComfyUI en local et Apple MLX, avec changement d'étapes automatique. Apache-2.0 sur la couche de workflow importe pour quiconque veut bâtir un produit dessus sans revue juridique.

Ce qui change concrètement pour celui qui utilise ces outils

L'effet pratique, c'est que le même matériel produit plus d'images, et que les réglages qui comptent changent. Les discussions communautaires autour de Qwen 2.1 recommandent un CFG de 2,0 à 3,0 et 40 étapes lorsqu'un LoRA est chargé, avec un VAE de correction de texture d'environ 676 mégaoctets. D'autres rapportent que le workflow standard à 2,0 mégapixels sans LoRA produit désormais une qualité de rendu que les modèles ouverts précédents atteignaient rarement.

La lecture honnête, c'est que la distillation à faible nombre d'étapes est un compromis, pas un repas gratuit. La fidélité du texte, la précision des retouches et la cohérence multi-références sont les premières choses à en pâtir, car ce sont les tâches qui demandent le plus de passes pour se résoudre. Le respect du prompt sur un sujet unique et clair tient bien.

Une seule feuille verte montrée quatre fois de suite avec un grain de film et un bruit croissants

Cela suggère un flux de travail plutôt qu'un réglage unique. Faites un brouillon en quatre étapes, choisissez la composition qui vous plaît, puis re-rendez l'image retenue avec le nombre complet d'étapes. Les adaptateurs de distillation rendent l'exploration peu coûteuse et laissent la passe finale en pleine qualité.

Ce que la recherche apporte au-delà des adaptateurs

Les LoRA que les utilisateurs téléchargent sont l'extrémité visible de ce travail, mais l'article DMAD explique pourquoi la prochaine génération d'adaptateurs devrait être meilleure. L'ancienne recette exigeait un modèle auxiliaire actif pour suivre la distribution mouvante de l'étudiant, et ce surcoût augmentait à chaque étape d'entraînement. Reformuler l'objectif en une paire de discriminateurs élimine le modèle auxiliaire, ce qui signifie qu'un même budget GPU peut entraîner un étudiant plus fort.

L'idée de repondération est la contribution la plus durable. Traiter l'enseignant comme uniformément correct est l'hypothèse qui limite la qualité d'un étudiant distillé, car un étudiant entraîné face aux pires moments de l'enseignant hérite de ces erreurs. Mesurer où l'enseignant diverge des données réelles et réduire le poids de ces régions est une technique générale, qui devrait se transposer à la diffusion vidéo, à l'audio et à toute autre modalité générative où la distillation sert à réduire le coût d'inférence.

Comment décider si un adaptateur distillé suffit

La décision dépend du type de tâche. Les adaptateurs à faible nombre d'étapes gèrent bien les compositions à sujet unique, bien éclairées et de grand format. Ils peinent sur tout ce qui demande beaucoup de passes pour se résoudre : des paragraphes de petits caractères, une typographie fine, des retouches qui doivent préserver l'identité sur plusieurs références, et des instructions qui empilent plusieurs contraintes. Ce sont exactement les cas dont les fiches de modèle avertissent, et ces avertissements sont cohérents d'un fournisseur à l'autre.

La licence est l'autre variable. Certains de ces adaptateurs portent des conditions de recherche ou d'autres restrictions, et la question de l'usage commercial n'est pas toujours tranchée sur la fiche du modèle. La publication d'Alibaba PAI indique une licence « other » sans préciser les conditions commerciales, ce qui signifie qu'une équipe qui la déploie dans un produit a du travail à faire avant de livrer. Les workflows Apache-2.0 de Krea font exception, et cette permissivité aura probablement son importance pour quiconque construit un service commercial par-dessus.

La direction est claire. Les modèles d'images ouverts sont compressés pour tourner sur le matériel que les gens possèdent déjà, et cette compression se fait en public, avec les poids, les fiches de modèle et les limites annoncées. Cette ouverture est utile en soi, car elle permet à un acheteur de juger les compromis avant de s'engager. Un fournisseur fermé peut dégrader la qualité dans une mise à jour et appeler cela une amélioration de vitesse. Un adaptateur publié avec une fiche de modèle qui nomme ses points faibles ne le peut pas.

Une note sur ce qu'il faut mesurer

Les promesses de vitesse dans ce domaine sont faciles à exagérer, car le nombre d'étapes n'est qu'un facteur parmi d'autres dans la latence. La résolution, la taille du lot, l'échantillonneur et le nombre d'images générées par prompt changent bien plus le temps réel que ne le laisse croire le nombre d'étapes affiché. Un adaptateur à quatre étapes en haute résolution sur une carte de milieu de gamme peut être plus lent qu'une exécution en quarante étapes en résolution brouillon sur le même matériel.

La comparaison qui compte pour un acheteur, ce sont les images par minute à la qualité dont il a réellement besoin, sur le matériel qu'il possède réellement. Les fiches de modèle rapportent rarement ce chiffre, il faut donc le mesurer localement. Les adaptateurs rendent cette mesure peu coûteuse, et c'est là le vrai bénéfice. Quatre étapes, c'est assez rapide pour lancer l'expérience qui vous dira si quatre étapes suffisaient.

Ce qu'il faut surveiller ensuite

Les adaptateurs et l'article pointent dans la même direction. Le coût d'inférence des modèles d'images ouverts continue de baisser, et chaque nouvelle distillation réduit l'écart entre une carte grand public et un accélérateur loué. La question à suivre est de savoir si la prochaine génération d'adaptateurs comble l'écart de rendu de texte et de fidélité aux références, ou si ces limites sont inscrites dans la génération à faible nombre d'étapes elle-même. Tant que ce n'est pas tranché, la posture raisonnable est de considérer le nombre d'étapes comme un réglage parmi d'autres, et de mesurer les images par minute sur le matériel que vous possédez réellement.

Articles associés