Vier Schritte statt vierzig: Wie Destillation offene Bildmodelle auf Consumer-GPUs quetscht

Die Lücke zwischen einem starken offenen Bildmodell und einer Consumer-Grafikkarte schließt sich seit Monaten. Der Mechanismus sind weniger Denoising-Schritte. Ein Modell, das einst vierzig Durchläufe brauchte, um Rauschen in ein Bild zu verwandeln, schafft es jetzt in vier, sechs oder acht – wenn man den richtigen Adapter anhängt.
Zwei Veröffentlichungen Anfang Oktober verschoben diese Grenze erneut aus entgegengesetzten Richtungen: ein Forschungsartikel, der das Training der Destillation neu denkt, und ein Produktions-LoRA, das die Idee auf ein weit verbreitetes offenes Modell anwendet.
DMAD verwandelt Distribution Matching in ein Klassifikationsproblem
Der Artikel heißt DMAD, kurz für Distribution Matching as Adversarial Distillation, von Forschenden der Texas A&M und von ByteDance. Er wurde am 1. Oktober erstmals veröffentlicht und befasst sich mit einem bekannten Kostenfaktor der Destillation.
Das Standardrezept funktioniert so. Ein Lehrermodell erzeugt über viele Schritte hochwertige Samples. Ein Schülermodell muss dieselbe Verteilung in ein bis vier Schritten annähern. Um das Schülermodell zu führen, trainiert man ein zusätzliches Diffusionsmodell, das immer wieder die aktuelle Verteilung des Schülermodells anpasst, und verwendet dann die Differenz zwischen dem Score des Lehrermodells und dem Score des Schülermodells, um das Schülermodell zu aktualisieren. Das Problem ist, dass sich das Schülermodell ständig verändert, sodass das Hilfsmodell ihm ständig hinterherjagen muss. Speicher- und Rechenaufwand steigen.
DMAD schreibt das Ziel als Klassifikation neu. Auf einem gemeinsamen Feature-Backbone sitzen zwei Diskriminator-Köpfe. Einer trennt echte Daten von Schülermodell-Samples. Der andere trennt Lehrermodell-Samples von Schülermodell-Samples. Unter optimalen Bedingungen entspricht der Ausgabe-Score des Diskriminators einem Log-Dichte-Verhältnis, was bedeutet, dass das Schülermodell entlang eines linearen Ziels aktualisiert werden kann, das vom Diskriminator-Score abgeleitet ist. Ein separates Hilfs-Score-Modell ist nicht nötig.
Die zweite Zutat ist rauschpegelabhängige Überwachung. Ein Lehrermodell ist bei manchen Rauschpegeln nahe an der echten Verteilung und bei anderen sichtbar daneben. DMAD misst die empirische Score-Differenz zwischen echten und Lehrermodell-Samples mit dem ersten Diskriminator-Kopf und gewichtet das Training des Schülermodells entsprechend neu, sodass das Schülermodell bei den Rauschpegeln, bei denen das Lehrermodell am schwächsten ist, weniger von dessen Bias erbt. Das verwandelt eine Annahme – „das Lehrermodell hat immer recht“ – in etwas Messbares.
Die Ergebnisse erstrecken sich über drei Skalen. Beim Bildklassifikations-Training auf ImageNet erreichte die Ein-Schritt-Generierung mit 64x64 einen FID von 1,04. FID misst, wie unterschiedlich die generierte Verteilung von der echten ist, und niedriger ist besser.
Die Produktionsversion ist bereits verfügbar
Dieselbe Idee erreicht Nutzer über LoRA-Adapter statt über Artikel. Alibaba PAI hat Qwen-Image-2.1-Fun-Acc-LoRAs auf Hugging Face veröffentlicht und wendet parallele Decoding-Destillation an, um die Inferenz von 40 neuronalen Funktionsauswertungen des Lehrermodells auf 4 zu senken – sowohl für Text-zu-Bild als auch für instruktionsbasierte Bearbeitung. Der Adapter hat Rang 64 mit Netzwerk-Alpha 64 in BF16, und die Modellkarte bietet Schnellstart-Skripte für Diffusers und VideoX-Fun.
Die Modellkarte ist offen bezüglich der Kompromisse. Dichter kleiner Text verschlechtert sich im Vergleich zum Lehrermodell, und Bildbearbeitungen fallen etwas unscharfer oder dunkler aus. Für ein Poster mit einem Absatz Kleingedrucktem sind vier Schritte nicht das richtige Werkzeug. Für Bilder in Social-Media-Größe, bei denen der Text kurz und groß ist, schon.
Ein zweiter Adapter geht bei der Qualität weiter. Qwen-Image-2.1 Turbo v0.2.1 ist ein Rang-128-Sechs-Schritt-LoRA mit etwa 648 Megabyte, das die lange Probability-Flow-ODE des Basis-Flow-Matching-Modells in einen Sigma-Zeitplan von 1,0 bis 0,25 komprimiert. Sechs Schritte sind eine mittlere Einstellung: genug Durchläufe, um Details zu halten, wenige genug, um schnell zu bleiben.
Community-Destillationen füllen den Rest der Leiter aus. Ein Viggle-Turbo-Adapter zielt auf vier Schritte. Die Adapter von PrunaAI zielen auf fünf oder acht. Beide sind ehrlich, dass es sich um unfertige Arbeiten handelt, und Prunas Hinweise sagen, dass die Low-Step-Version das Basismodell bei Multi-Referenz-Komposition, Face Swaps und Bearbeitungen mit mehreren Einschränkungen noch nicht erreicht.
Krea 2 Turbo ging bei der Lizenzierung einen anderen Weg. Seine Zwei-Schritt- und Vier-Schritt-Destillationsadapter werden jetzt mit Apache-2.0-ComfyUI-Workflows für Comfy Cloud, lokales ComfyUI und Apple MLX ausgeliefert, mit automatischem Schrittwechsel. Apache-2.0 auf der Workflow-Ebene ist für alle wichtig, die darauf ein Produkt aufbauen wollen, ohne juristische Prüfung.
Was sich für Anwender tatsächlich ändert
Der praktische Effekt ist, dass dieselbe Hardware mehr Bilder produziert und dass sich die relevanten Einstellungen verschieben. Community-Threads zu Qwen 2.1 empfehlen CFG 2,0 bis 3,0 und 40 Schritte, wenn ein LoRA geladen ist, zusammen mit einem Texture-Fix-VAE von etwa 676 Megabyte. Andere berichten, dass der Standard-Workflow bei 2,0 Megapixeln ohne LoRA mittlerweile eine Rendering-Qualität liefert, die frühere offene Modelle selten erreichten.
Die ehrliche Lesart ist, dass Low-Step-Destillation ein Kompromiss ist, kein kostenloses Mittagessen. Texttreue, Bearbeitungspräzision und Multi-Referenz-Konsistenz leiden zuerst, weil das die Aufgaben sind, die die meisten Durchläufe brauchen, um aufgelöst zu werden. Die Prompt-Treue bei einem einzelnen klaren Motiv bleibt gut erhalten.

Das legt einen Workflow statt einer einzelnen Einstellung nahe. Entwirf mit vier Schritten, wähle die gewünschte Komposition und rendere das ausgewählte Bild dann mit der vollen Schrittanzahl neu. Die Destillationsadapter machen die Erkundung günstig und belassen den finalen Durchlauf bei voller Qualität.
Was die Forschung über die Adapter hinaus hinzufügt
Die LoRAs, die Nutzer herunterladen, sind das sichtbare Ende dieser Arbeit, aber der DMAD-Artikel erklärt, warum die nächste Generation von Adaptern besser sein sollte. Das alte Rezept brauchte ein laufendes Hilfsmodell, um die sich verschiebende Verteilung des Schülermodells zu verfolgen, und dieser Overhead wuchs mit jedem Trainingsschritt. Das Umformulieren des Ziels als Paar von Diskriminatoren entfernt das Hilfsmodell, was bedeutet, dass dasselbe GPU-Budget ein stärkeres Schülermodell trainieren kann.
Die Idee der Neugewichtung ist der nachhaltigere Beitrag. Das Lehrermodell als durchweg korrekt zu behandeln, ist die Annahme, die begrenzt, wie gut ein destilliertes Schülermodell sein kann, denn ein Schülermodell, das gegen die schwächsten Momente eines Lehrermodells trainiert wird, erbt diese Fehler. Zu messen, wo das Lehrermodell von echten Daten abweicht, und diese Bereiche herunterzugewichten, ist eine allgemeine Technik, und sie sollte sich auf Videodiffusion, Audio und jede andere generative Modalität übertragen lassen, bei der Destillation genutzt wird, um Inferenzkosten zu senken.
Wie man entscheidet, ob ein destillierter Adapter ausreicht
Die Entscheidung hängt vom Aufgabentyp ab. Low-Step-Adapter bewältigen Kompositionen mit einem einzelnen Motiv, klarer Beleuchtung und großem Format gut. Sie tun sich mit allem schwer, was viele Durchläufe braucht, um aufgelöst zu werden: Absätze mit kleinem Text, feine Typografie, Bearbeitungen, die die Identität über mehrere Referenzen hinweg bewahren müssen, und Anweisungen, die mehrere Einschränkungen gleichzeitig stapeln. Genau das sind die Fälle, vor denen die Modellkarten warnen, und die Warnungen sind über Anbieter hinweg konsistent.
Die Lizenzierung ist die andere Variable. Einige dieser Adapter tragen Forschungs- oder anderweitig eingeschränkte Bedingungen, und die Frage der kommerziellen Nutzung ist nicht immer auf der Modellkarte geklärt. Die Veröffentlichung von Alibaba PAI listet ihre Lizenz als „other“ auf, ohne kommerzielle Bedingungen zu nennen, was bedeutet, dass ein Team, das sie in einem Produkt einsetzt, vor dem Ausliefern Hausaufgaben zu erledigen hat. Kreas Apache-2.0-Workflows sind die Ausnahme, und diese Freizügigkeit dürfte für alle wichtig sein, die darauf einen kommerziellen Dienst aufbauen.
Die Stoßrichtung ist klar. Offene Bildmodelle werden auf die Hardware komprimiert, die die Leute bereits besitzen, und diese Komprimierung findet öffentlich statt – mit Gewichten, Modellkarten und benannten Einschränkungen. Diese Offenheit ist selbst nützlich, weil sie Käufern erlaubt, die Kompromisse vor einer Entscheidung einzuschätzen. Ein geschlossener Anbieter kann in einem Update die Qualität senken und es eine Geschwindigkeitsverbesserung nennen. Ein Adapter, der mit einer Modellkarte veröffentlicht wird, die seine Schwachpunkte benennt, kann das nicht.
Eine Anmerkung dazu, was gemessen werden sollte
Geschwindigkeitsaussagen in diesem Bereich sind leicht zu übertreiben, denn die Schrittanzahl ist nur ein Faktor für die Latenz. Auflösung, Batch-Größe, Sampler und die Anzahl der pro Prompt generierten Bilder verändern die Gesamtlaufzeit weit stärker, als die Schlagzeilen-Schrittanzahl vermuten lässt. Ein Vier-Schritt-Adapter bei hoher Auflösung auf einer Mittelklassekarte kann langsamer sein als ein Vierzig-Schritt-Lauf bei Entwurfsauflösung auf derselben Hardware.
Der Vergleich, der für einen Käufer zählt, sind Bilder pro Minute bei der Qualität, die er tatsächlich braucht, auf der Hardware, die er tatsächlich besitzt. Modellkarten berichten diese Zahl selten, also muss sie lokal gemessen werden. Die Adapter machen die Messung günstig, was der eigentliche Vorteil ist. Vier Schritte sind schnell genug, um das Experiment durchzuführen, das zeigt, ob vier Schritte ausreichten.
Was als Nächstes zu beobachten ist
Die Adapter und der Artikel weisen in dieselbe Richtung. Die Inferenzkosten für offene Bildmodelle sinken weiter, und jede neue Destillation verringert die Lücke zwischen einer Consumer-Karte und einem gemieteten Beschleuniger. Die Frage, die es zu verfolgen lohnt, ist, ob die nächste Runde von Adaptern die Lücke bei Text-Rendering und Referenztreue schließt oder ob diese Grenzen in die Low-Step-Generierung selbst eingebaut sind. Bis das geklärt ist, ist die vernünftige Haltung, die Schrittanzahl als einen von mehreren Reglern zu behandeln und Bilder pro Minute auf der Hardware zu messen, die man tatsächlich besitzt.
Verwandte Artikel
BOSSFIGHT ließ Frontier-Modelle 24 Wochen lang als Cafébesitzer antreten. Die meisten verloren gegen Nichtstun.
Eine Bestechung in einem Quiz abzulehnen und sich in einem laufenden Quartal nicht verbiegen zu lassen, sind zwei verschiedene Fähigkeiten, und aktuelle Evaluationen neigen dazu, die einfachere zu messen.
NASA und IBM haben ein lunares Foundation-Modell als Open Source veröffentlicht, das mit 17 Jahren Orbiter-Daten trainiert wurde
Das Modell ist nützlich, um Merkmale zu finden und zu charakterisieren, und unzuverlässig, wenn es darum geht, mit hoher Präzision genau anzugeben, wo sie sich befinden.
Agenten begannen diese Woche, Kurzfilme zu inszenieren. Der Engpass verlagerte sich zur Qualitätskontrolle.
Generierung ist billig, Orchestrierung ist das Produkt, und was entscheidet, ob eine Pipeline nützlich ist, ist, ob sie erkennen kann, wann sie versagt hat.
Reka Rho-1 vereint Verständnis und Generierung im selben KV-Cache
Dieselben Gewichte, die ein Kamerabild vorhersagen, steuern auch die Roboterbewegung, weil beide im selben Repräsentationsraum leben.