← Zurück zum Blog
Aica. 5 Min. Lesezeit

TaoMate-H3 von Taobao als Open Source: Minutenlange kontinuierliche Audio-Video-Generierung auf nur drei Denoising-Schritte pro Segment reduziert

Veröffentlicht 7. Okt. 2026
TaoMate-H3 von Taobao als Open Source: Minutenlange kontinuierliche Audio-Video-Generierung auf nur drei Denoising-Schritte pro Segment reduziert

Das TaoLive-AIGC-Team von Alibaba hat den Inferenzcode und die LoRA-Gewichte von TaoMate-H3 auf GitHub und Hugging Face veröffentlicht. Was das Modell tut, ist nicht wirklich neu: Bild und Ton in derselben Generierung entstehen zu lassen. Doch die Art, wie es sich misst, hat sich geändert: Es vergleicht nicht, wessen einzelnes Segment die spektakulärere Bildqualität hat, sondern wie lange es dauert, vom Absetzen des Prompts bis zum ersten fertigen Segment.

Wartezeit auf das erste Segment – eine Kennzahl, die bisher niemand beachtete

Die Generierungslogik gängiger Videomodelle beruht auf dem Denoising des gesamten Abschnitts. Man schreibt eine dreißig Sekunden lange Beschreibung, und das Modell wirft alle Frames dieser dreißig Sekunden gemeinsam in den Diffusionsprozess und iteriert wiederholt, ohne zwischendurch etwas auszugeben – erst wenn der gesamte Abschnitt berechnet ist, wird alles auf einmal ausgeliefert. Das Problem dieses Ansatzes ist offensichtlich: Die Wartezeit ist proportional zur Videolänge. Wer mehr will, muss länger warten.

TaoMate-H3 verfolgt einen segmentweisen Ansatz. Es zerlegt die Generierung in kleine Segmente, von denen jedes nur drei Denoising-Schritte benötigt; das Modell arbeitet zunächst das aktuelle Segment vollständig aus und generiert danach die folgenden Inhalte weiter. Technisch verbindet es dreistufige LoRA-Inferenz mit autoregressiver Generierung, wobei Figuren, Stimmen und Szenen aus dem vorherigen Segment als Kontext in das nächste übernommen werden.

Der praktische Unterschied dieser Änderung liegt darin, „wann man etwas sehen kann“. Bei Live-Erklärungen, Auftritten virtueller Charaktere oder jeder Situation, die unmittelbares Feedback erfordert, müssen Nutzer nicht warten, bis das gesamte Video fertig generiert ist, um das erste Bild zu sehen. Die Zeit bis zur Ausgabe des ersten Segmentinhalts wird verkürzt – eine Kennzahl, die bisher kaum ein Modell als Hauptverkaufsargument beworben hat. In einem Bericht von Jiqizhixin heißt es, TaoMate-H3 werbe genau mit der „Generierungszeit des ersten Segments“.

Wie der Ton an der Generierung teilnimmt

Für die gemeinsame Audio-Video-Generierung gibt es in der Branche zwei Ansätze. Der eine generiert zuerst das Bild und lässt dann ein anderes Modell den Ton hinzufügen, wobei beide Teile in der Nachbearbeitung synchronisiert werden; der andere lässt den Ton bereits während des Generierungsprozesses teilnehmen und gibt zeitliche Vorgaben für Lippenbewegungen, Mimik und Aktionen.

Zwei kleine, leere Messing-Klangwellenplättchen, aufrecht auf einem hellen Holztisch stehend, warmes Licht streift ihre glatten, unmarkierten Oberflächen

TaoMate-H3 verfolgt den letzteren Ansatz. Im selben Generierungsprozess werden Ton und Bild gleichzeitig verarbeitet; sprechende Personen, Gesang und Dialoge von Charakteren fallen ebenso in dieses Framework wie Umgebungs- und Aktionsgeräusche wie Meereswellen, fahrende Fahrzeuge oder Explosionen. Die zeitliche Abstimmung von Dialog und Bild muss nicht bis zur Nachbearbeitung warten.

Bei den Ausgabespezifikationen unterstützt es die drei Stufen 480p, 768p und 1080p sowie Quer- und Hochformat. Szenenbeschreibungen können als ein vollständiger Prompt verfasst oder Dialoge, Aktionen und Handlung abschnittsweise angeordnet werden; das Modell setzt die Fortsetzung auf Basis des erhaltenen historischen Kontexts fort. Minutenlange kontinuierliche Generierung ist sein Zielbereich.

Nicht viele Parameter – doch erst im echten Workflow wird der Wert verständlich

TaoMate-H3 wurde auf Basis von MiniMax H3 nachtrainiert. Die Base ist ein bereits von anderen als Open Source veröffentlichtes Grundmodell, auf das das TaoMate-Team die Fähigkeit zur Streaming-Generierung aufgesetzt hat. Das ist auch der Grund, warum die Gewichte so schnell veröffentlicht werden konnten: Es war nicht nötig, ein großes Modell von Grund auf zu trainieren; der Schwerpunkt liegt auf der Inferenz-Pipeline und LoRA.

Für Entwickler hat das einen praktischen Nutzen auf mehreren Ebenen. Am unmittelbarsten: Es lässt sich auf eigener Hardware ausführen, ohne für Streaming-Generierungsforschung von Cloud-APIs abhängig zu sein. Zum anderen eröffnet die Streaming-Generierung selbst Szenarien, die zuvor unpraktisch waren: Generieren und gleichzeitig Abspielen, langandauernde kontinuierliche Performances von Charakteren sowie interaktive Videos, deren spätere Inhalte je nach Publikumsreaktion angepasst werden müssen.

Eine Einschränkung sollte klar benannt werden. Drei Denoising-Schritte bedeuten, dass der Rechenaufwand pro Segment sehr niedrig gehalten wird – der Preis dafür ist die Obergrenze der Bildqualität eines einzelnen Segments. Die Wirkung in offiziellen Demos ist das eine; in einer finalen Auslieferung mit hohen Qualitätsanforderungen ist es etwas anderes. Das Modell ist eher eine nutzbare Open-Source-Basis für das Bedürfnis nach „kontinuierlicher Generierung“ und nicht dazu da, sich bei der Einzelframe-Qualität mit führenden Closed-Source-Modellen zu messen.

Der Weg der chinesischen Open-Source-Videomodelle in diesem Jahr

Betrachtet man TaoMate-H3 auf der Zeitachse dieses Jahres, zeigt sich ein recht klarer Pfad. Anfang des Jahres verglich man Parameter und Leaderboard-Punkte; in der zweiten Jahreshälfte verlagerte sich der Schwerpunkt darauf, Modelle in echte Workflows zu pressen: geringerer VRAM-Bedarf, schnellere erste Frames, niedrigere Kosten pro Sekunde.

MiniMax H3 hat das Grundmodell als Open Source veröffentlicht, TaoLive baut darauf Audio-Video-Streaming auf, und Alibaba PAI hat einen ControlNet-Union-Zweig veröffentlicht, der acht Steuerungsbedingungen und Videoreparatur unterstützt. Kaum ist ein Modell da, folgen schnell andere mit darauf aufbauenden Fähigkeiten. Diese Arbeitsteilung läuft in der Open-Source-Community schneller als im Closed-Source-Ökosystem, weil niemand darauf warten muss, dass jemand Schnittstellen öffnet.

Für Content-Macher laufen diese Veränderungen am Ende auf sehr konkrete Dinge hinaus: Für ein Video mit durchgehender Performance musste man früher vielleicht zehn Segmente getrennt generieren und dann zusammenfügen; heute kann man abschnittsweise schreiben, und das Modell führt mit eigenem Kontext fort. Wenn danach etwas nicht stimmt, lässt sich nur dieses eine Segment ändern.

Zum Schluss

Das Erinnernswerteste an dieser Veröffentlichung von TaoMate-H3 ist, dass sie die „Wartezeit auf das erste Segment“ auf den Tisch bringt. Die Videogenerierung hat in den vergangenen Jahren stets gelöst, „ob man generieren kann“ und „wie gut die Generierung ist“; nun beginnen einige ernsthaft zu berechnen, „wann der erste Frame sichtbar ist“. Die Antwort auf diese Frage entscheidet, ob Videomodelle vom Demopult in den täglichen Workflow gelangen können.

Die Gewichte und der Inferenzcode sind bereits offen; als Nächstes bleibt zu sehen, ob die Community darauf mehr wachsen lässt – insbesondere für Szenarien, die lange kontinuierliche Ausgaben benötigen und nicht auf das Rendern eines ganzen Abschnitts warten können.

Verwandte Artikel