← Zurück zum Blog
Aica. 6 Min. Lesezeit

Open-Source-Bildgenerierung passt jetzt auf eine Consumer-Grafikkarte: Hunyuan DiT senkt die Hürde auf 6 GB VRAM

Veröffentlicht 4. Okt. 2026
Open-Source-Bildgenerierung passt jetzt auf eine Consumer-Grafikkarte: Hunyuan DiT senkt die Hürde auf 6 GB VRAM

Im vergangenen Jahr drehten sich Updates bei Open-Source-Text-zu-Bild-Modellen im Wesentlichen um die Bildqualität. Wer klarere Schrift erzeugte, wessen Licht und Schatten fotografischer wirkten, konnte ein paar Tage länger in den Bestenlisten bleiben. In diesem Oktober hat sich der Wind ein wenig gedreht. Im Mittelpunkt der Community-Diskussionen steht nicht mehr „Welches Bild sieht besser aus?“, sondern „Läuft das auf meiner Grafikkarte überhaupt?“

Die 6-GB-VRAM-Marke wurde hart erkämpft

Unter den jüngsten Ankündigungen zum großen Text-zu-Bild-Modell Hunyuan von Tencent (Hunyuan DiT) ist die praktischste die Open-Source-Freigabe einer Version mit geringem VRAM-Bedarf. Laut offiziellen Angaben lässt sie sich mit 6 GB VRAM betreiben. Wer schon einmal Open-Source-Bildgenerierung genutzt hat, weiß, was diese Zahl bedeutet: Wer ein ordentliches Text-zu-Bild-Modell lokal betreiben wollte, brauchte bisher praktisch mindestens 16 GB VRAM, 8 GB waren grenzwertig, und bei 6 GB wurde man direkt abgeschreckt.

Eine grüne Leiterplatte auf einer dunklen Oberfläche, kaltes blaues Licht streift über ordentlich angeordnete schwarze Chips

Auch die begleitenden Maßnahmen zogen nach. Diese Version wurde mitsamt Plug-ins wie LoRA und ControlNet in die Diffusers-Bibliothek integriert und um Unterstützung für die Kohya-GUI ergänzt. Die Rolle von Kohya in der Community besteht darin, das „Trainieren eines eigenen LoRA“ aus der Kommandozeilen-Hürde herauszuholen und daraus ein paar Mausklicks zu machen. Dass es eingebunden wurde, ebnet den Weg für „Ich möchte dem Modell meinen eigenen Stil beibringen“.

Gleichzeitig wurde Hunyuan DiT selbst auf Version 1.2 angehoben; die offiziell genannten Verbesserungen konzentrieren sich auf Bildtextur und Komposition. Genau diese beiden Punkte wurden bei Open-Source-Modellen lange kritisiert: Bei vielen Details wird das Bild schnell matschig, bei komplexer Komposition zerfällt es.

Eine weitere Nachricht wird leichter übersehen, ist aber entscheidend: Tencent hat auch das Tagging-Modell von Hunyuan, den „Hunyuan Captioner“, als Open Source freigegeben. Ein Tagging-Modell ist der erste Arbeitsschritt beim LoRA-Training: Zuerst muss die Maschine jedes Ausgangsbild in einzelne lesbare Beschreibungen zerlegen, bevor überhaupt ans Training zu denken ist. Früher nutzte man für diesen Schritt entweder Closed-Source-Schnittstellen oder Ersatzlösungen schwankender Qualität. Nach der Open-Source-Freigabe entfällt in der lokalen Trainingskette eine weitere Abhängigkeit von externen Diensten.

Nachdem die Open-Source-Modelle laufen, ist die Community mit „Reparieren“ beschäftigt

Der Fortschritt bei Hunyuan erweitert sozusagen die Straße, während die Community an einer anderen Linie Flicken anbringt. Die Open-Source-Veröffentlichung von Qwen-Image 2.1 löste zahlreiche Nachahmungen und Weiterentwicklungen aus, und damit kam eine dichte Welle von Fixes.

Eine recht typische Kombination ist Qwen-Image-2.1-viggle-turbo: 7,26 GB, 6 Inferenzschritte, int8-Quantisierung; sie wird oft genutzt, um schnell Charakterbögen zu erzeugen, ergänzt durch einen 676 MB großen Texture-Fix-VAE zur Texturnachbesserung. Ein Fix v2.0 eines anderen Autors soll Qwens typisches Rauschen und unruhige Details entfernen, ohne die Komposition nennenswert zu verändern. Eine Opinionated-Version liefert ein schärferes Bild, bewegt dafür aber das Bild leicht; der Autor veröffentlicht sie zusammen mit einem aus RES4LYF abgeleiteten res_2m_nc-Sampler.

Diese Patches mögen kleinteilig klingen, doch sie belegen eines: Wenn ein Open-Source-Modell in die praktische Produktion geht, entscheidet oft nicht die Version am Veröffentlichungstag darüber, wie brauchbar es ist, sondern ob die Community in den folgenden Wochen bereit ist, dafür Fixes zu schreiben.

In der Community haben sich außerdem einige direkt übernehmbare Parameter herauskristallisiert. Jemand empfiehlt nach dem Laden eines LoRA auf Qwen 2.1 CFG 2.0 bis 3.0, 40 Schritte und den Sampler res_multistep oder beta. Ein anderer betreibt den 2.0-MP-Standardworkflow ohne LoRA und sagt, das neue Qwen-Bildmodell erzeuge einen Midjourney-Touch, den man früher nur bei Closed-Source-Modellen gesehen habe.

Auch bei der Geschwindigkeit gibt es deutliche Fortschritte. Ein Zwei-Schritt-Distillations-LoRA-Checkpoint für Krea 2 Turbo drückt die Denoising-Zeit für 1024x1024 von 76,4 Sekunden auf 19,3 Sekunden, also ungefähr um das Vierfache. Der Preis: Die Detailqualität erreicht nur das 0,97- bis 1,09-Fache des Lehrer-Modells, was deutlich besser ist als das 0,40- bis 0,65-Fache des nativen Turbo mit zwei Schritten, doch am besten funktionieren Nahaufnahmen; bei großen Szenen hapert es noch.

Die kleinen Lücken, die nebenbei ebenfalls geschlossen wurden

Neben den Hauptmodellen schließen auch einige Nischen-Open-Source-Modelle mit stabiler Reputation in der Community nach und nach ihre Lücken. Animas Aesthetic v1.1 und One Obsession v4 werden oft für stilisierte Ergebnisse verwendet; Nutzer loben, dass der Stil folgsam ist, sich Prompts gut schreiben lassen, man nach Festlegung des Seeds durch Ändern des Prompts zusammenhängende Varianten erhält und kurze Texte gerendert werden können. Die Schwächen werden ebenso offen benannt: Mehrere Charaktere im selben Bild und lange Texte bleiben schwierig, die Community wartet auf Anima 2.

Bei Krea 2 konzentriert sich die Kritik darauf, dass „verschiedene Seeds ähnlich aussehen“. Daher hat jemand einen Weg ohne LoRA und ohne modellspezifische Nodes gefunden: den Textencoder von ComfyUI (zum Beispiel Qwen3VL 4B) als LLM zum Erweitern von Prompts wiederverwenden, den Prompt-Seed als Grobregler und den Sampling-Seed als Feinregler behandeln. Solche „Hausmittel“ verbreiten sich schnell und lösen praktische Probleme oft besser als die offizielle Dokumentation.

Was zählt, nachdem die Hürde gesunken ist?

Betrachtet man diese Entwicklungen zusammen, ist die Richtung klar. Open-Source-Bildgenerierung beantwortet nicht mehr nur die Frage „Kann es so aussehen wie gewünscht?“, sondern beginnt, zwei weitere Fragen zu beantworten: Läuft es auf einer Maschine, die ich mir leisten kann, und lässt es sich präzise nach meinen Vorstellungen ändern?

Hunyuan beantwortet die erste Frage, indem es den VRAM-Bedarf auf 6 GB senkt und das Tagging-Modell als Open Source freigibt. Die Fixes und Beschleunigungs-LoRAs aus der Qwen-Community beantworten den Teil der zweiten Frage, der „präzise ändern“ und „schnell laufen“ betrifft. Die beiden Linien scheinen nichts miteinander zu tun zu haben, laufen aber auf dasselbe Ziel hinaus: die Generierung von der Demo in den Alltag zu bringen.

Für normale Kreative ist das wahrscheinlich die handfesteste Veränderung des vergangenen Jahres. Man muss nicht mehr für ein einziges Bild Rechenleistung mieten und auch nicht die gesamte Umgebung neu installieren, nur um den Stil zu wechseln. Eine einige Jahre alte Mittelklasse-Grafikkarte plus die von der Community zusammengetragene Toolchain reichen aus, um eine ansehnliche Serie von Arbeiten zu erstellen.

Was wirklich zusammenschrumpft, ist die Distanz zwischen „Das würde ich gern mal ausprobieren“ und „Jetzt fange ich wirklich damit an“.

Verwandte Artikel