Ein siebzehnminütiger chinesischer KI-Film gewann in Astana, und das Team bestand aus einem Dutzend Menschen

--- title: Ein siebzehnminütiger chinesischer KI-Film gewann in Astana, und das Team bestand aus einem Dutzend Menschen slug: a-seventeen-minute-chinese-ai-film-won-at-astana meta_title: Ein Dutzend Menschen, eineinhalb Monate, ein Preis meta_description: 2xLabs gewann mit einem 17-minütigen Kurzfilm, der von einem Dutzend Menschen und mit weniger als 14.000 US-Dollar an Rechenleistung produziert wurde, den Preis für die beste Geschichte beim ersten Astana AI Film Festival. category: ai tags: KI-Film,Astana AI Film Festival,2xLabs,The Last Span,generatives Video,chinesische Animation,Produktionskosten,Storytelling ---
Das erste Astana AI Film Festival verlieh seinen Preis für die beste Geschichte im offenen Wettbewerb an 2xLabs, ein chinesisches Team, für einen 17-minütigen Kurzfilm mit dem Titel „The Last Span“ (合龙). Der Film folgt einem Mädchen namens Ayu, das einen Fluss überquert, um ihre Mutter zu finden, während Menschen an beiden Ufern eine Brücke bauen, die sich schließlich in der Mitte schließt.
Die Prämisse geht auf ein reales Objekt zurück. Das Gemälde „Wohnen in den Fuchun-Bergen“ wurde verbrannt und in zwei Schriftrollen getrennt, die in verschiedenen Sammlungen aufbewahrt und später wieder gemeinsam ausgestellt wurden. Der Film verwandelt diese Geschichte in eine Erzählung über Wiedervereinigung.
Die Produktionszahlen
Executive Director Wang Yuchen sagte gegenüber China News Service, das Projekt habe ein Team aus einem Dutzend Menschen etwa sechs Wochen gekostet und umfasse Drehbuch, Regie, Art Design, KI-Visualgenerierung, Schnitt und Postproduktion. Die Rechenkosten lagen unter 100.000 Yuan, ungefähr 14.000 US-Dollar.
Die Aufteilung dieser Zeit ist der bemerkenswerte Teil. Die eigentliche Videogenerierung dauerte etwas mehr als eine Woche. Alles andere floss in den Feinschliff am Drehbuch und die Festlegung des visuellen Stils, damit Bild und Geschichte sich gegenseitig verstärkten.
Der Workflow selbst ist 2026 unspektakulär. Das Team übergab stilisierte Bilder und Audio an das Modell, beschrieb dann per Prompts Einstellungsgröße, Figurenaktion und Stimmklang und generierte das Filmmaterial. Wenn die Ergebnisse nicht passten, überprüften sie ihre Lesart der Szene erneut und passten den Prompt an.
Dieses letzte Detail beschreibt eine Schleife, die die meisten KI-Video-Teams kennen. Das Scheitern liegt selten daran, dass das Modell den Prompt ignoriert. Es liegt daran, dass der Creator eine unpräzise Vorstellung von der Szene hat, die das Modell getreu reproduziert. Wangs Bericht legt nahe, dass das Team eine schlechte Generierung als Feedback zur eigenen Ausrichtung und nicht als Fehlfunktion des Werkzeugs behandelte.
Was laut dem Regisseur den Unterschied ausmacht
Wangs Antwort auf die Qualitätsfrage ist unverblümt. KI-Technologie wird ständig weiterentwickelt, daher sind eindrucksvolle Bilder leicht zu kopieren. Das eigene Denken eines Creators und ein unverwechselbarer kultureller Ausdruck verleihen einem Werk einen klaren Charakter.
Die Wahl des Ausgangsmaterials stützt dieses Argument. Das Team wählte keine Prämisse, weil sie leicht zu generieren war. Es wählte eine, die bereits eine Struktur in sich trug: zwei getrennte Hälften eines Gemäldes, wieder vereint. Das gibt dem Film eine Form, die ein Modell nicht liefern kann.
Wang beobachtete außerdem, dass Creators in verschiedenen Ländern eine gemeinsame filmische Sprache teilen. Diese Sprache gut zu nutzen, um einen qualitativ hochwertigen Film zu machen, sei die Voraussetzung für jedes interkulturelle Verständnis. Er nannte einen aktuellen chinesischen Film, „Welcome to the Dragon Restaurant“, als Beispiel für ein Werk, das sein Publikum zuerst durch Handwerk und erst danach durch seine Botschaft gewann.
Kasachische Medien, die über das Festival berichteten, lobten die unverwechselbare Art Direction und die straffe Erzählstruktur des Films. Das ist die Rezeption, die sich ein Team wünscht, unabhängig davon, wie das Filmmaterial erstellt wurde.
Die handwerklichen Entscheidungen, die ihn zusammenhielten
Siebzehn Minuten sind eine lange Zeit, um ein Publikum mit generierten Bildern zu halten, und die Entscheidungen des Teams lesen sich eher als handwerkliche denn als technische Entscheidungen. Die Besetzung auf eine kleine Zahl von Figuren zu begrenzen, reduziert das Drift-Problem, das längere KI-Arbeiten plagt: Ein Gesicht, das in Einstellung drei gerendert wurde, passt irgendwann nicht mehr zu demselben Gesicht in Einstellung dreißig. Die Beschränkung auf einen Fluss und seine beiden Ufer tut dasselbe für die Umgebung: weniger Schauplätze bedeuten weniger Gelegenheiten, dass sich die Welt zwischen den Einstellungen verändert.
Die Brücke selbst ist ein nützliches Erzählmittel für einen generierten Film. Ein Bauwerk, das sichtbar von Einstellung zu Einstellung voranschreitet, gibt dem Publikum eine Möglichkeit, vergehende Zeit ohne Dialog zu lesen, und gibt der Produktion einen natürlichen Grund, denselben Ort wiederholt in verschiedenen Stadien zu zeigen. Das ist die Art struktureller Entscheidung, die dem entgegenkommt, was die Pipeline gut beherrscht.
Der Ton ist der andere Bereich, in dem der Film seine Rezeption verdient. Das Team generierte Audio zusammen mit den Bildern und beschrieb den Stimmklang in Prompts – der Workflow, der die Stimme einer Figur über Szenen hinweg stabil hält. Festivalberichte nannten die Musik und die Stimmarbeit als Stärken, was wichtig ist, weil ungleichmäßiger Ton eines der häufigsten Erkennungszeichen von KI-Video ist.
Die Wirtschaftlichkeit eines kleinen KI-Films
Unter 100.000 Yuan für einen siebzehnminütigen Film sind eine Zahl, die Gespräche mit Geldgebern verändert. Traditionelle 2D-Animation in dieser Länge kostet typischerweise Millionen, und ein Realfilm mit einem Fluss-Set und historischen Kostümen wäre nicht billiger. Die Lücke ist groß genug, um zu verändern, welche Arten von Geschichten erzählt werden, denn eine Prämisse, die niemals ein siebenstelliges Budget rechtfertigen würde, kann ein Budget von hunderttausend Yuan rechtfertigen.
Der Haken ist, dass die Rechenleistung nicht der größte Kostenfaktor war. Sechs Wochen Zeit für ein Dutzend Menschen sind der eigentliche Posten, und er bleibt gleich, unabhängig vom Preis der Generierung. Deshalb ist die Angabe des Teams, dass die Generierung nur eine Woche dauerte, wichtig: Der teure Teil der KI-Filmarbeit ist weiterhin der Teil, der schon immer teuer war – das Denken.
Warum das wichtiger ist als das Festival
Festivalpreise für KI-Arbeiten lassen sich leicht als Neuheit abtun. Der Fall Astana ist interessanter, weil die Einschränkungen gewöhnlich waren. Ein Dutzend Menschen, sechs Wochen, ein bescheidenes Rechenbudget. Das ist eine Form, die viele unabhängige Teams tatsächlich versuchen können.
Der Film zeigt auch, wo sich die Anstrengung konzentrierte. Die Generierung war schnell. Die langsamen Teile waren die Entscheidung, was die Geschichte sein sollte, und das Festhalten des visuellen Stils über siebzehn Minuten hinweg – die anhaltende Schwierigkeit bei KI-Video. Langform-Arbeiten legen Konsistenzfehler offen, die kurze Clips verbergen.
Es gibt ein Übersetzungsproblem, das spezifisch für diese Kategorie von Film ist. Eine Geschichte, die in einem bestimmten historischen Objekt verwurzelt ist, muss für ein Publikum funktionieren, das diesem Objekt nie begegnet ist. Wangs Antwort lautet, dass Qualität an erster Stelle steht: Der Film muss anschaubar sein, bevor seine Werte reisen können. Ob diese Argumentation trägt, hat die Festivaljury bereits einmal beantwortet.
Der breitere Kontext
Die Bekanntgabe fiel in dieselbe Woche, in der chinesische KI-Video-Tools mehrere Meilensteine erreichten. Unternehmen der Kategorie treiben die native Generierung auf 30 Sekunden voran, fügen Keyframe-Steuerung im Umfang von Dutzenden Frames hinzu und erweitern multimodale Referenzen. Der chinesische Markt für KI-Dramen und Comic-Serien wird voraussichtlich 2026 die 40-Milliarden-Yuan-Marke überschreiten.
Die Produktion wird auf eine Weise billiger, die sich in Zahlen niederschlägt. Ein dokumentierter Aufbau generierte 40 Sekunden durchgehendes 1080p-Material von Grund auf auf einer 16-GB-GPU in 42 Minuten, und eine destillierte Modellvariante erzeugt 10-Sekunden-Clips auf einer 12-GB-Consumer-Grafikkarte.
Einzelne Creators haben denselben Punkt in größerem Maßstab bewiesen. Eine von einer Person erstellte Geschichtsserie sammelte über 100 Millionen Aufrufe, wobei der Creator Drehbuch, Regie, Schnitt und Art Direction allein übernahm. Berichtete Prognosen sehen die chinesischen Märkte für KI-Dramen und Comic-Serien in diesem Jahr über 40 Milliarden Yuan, und Plattformanreize sind gefolgt.
Vor diesem Hintergrund ist ein zwölfköpfiges Team, das einen internationalen Jurypreis gewinnt, ein nützliches Gegengewicht. Verbesserungen der Werkzeuge senken die Kosten für eine weitere Iteration. Sie liefern keinen Grund, den Film zu machen. Wangs Zusammenfassung, dass ästhetisches Urteilsvermögen, erzählerisches Können und Menschenkenntnis von Creators zunehmend ein Werk von einem anderen unterscheiden, ist der Fall, den die Auszeichnung in Astana tatsächlich stützt.
Der nächste Test ist, ob sich das Muster wiederholt. Eine einzelne Auszeichnung kann ein Ausreißer sein. Ein Dutzend Filme, auf dieselbe Weise und im selben Maßstab gemacht, wären ein Beleg dafür, dass sich die Hürde für internationale Anerkennung tatsächlich verschoben hat.
Verwandte Artikel
Satellitenbilder sind jetzt Trainingsdaten für Roboter
Der Engpass beim Training physischer KI ist nicht mehr die Rechenleistung oder die Modellfähigkeit. Er wurde die Qualität der synthetischen Welt.
Googles Gemini 3.5 Live Translate beseitigt die Pause
Übersetzung, die kontinuierlich läuft, in der Stimme der sprechenden Person, auf einem Telefon, das ohnehin schon in der Tasche steckt, macht das Feature von etwas, das man öffnet, zu etwas, das einfach an ist.
China hat den ersten verbindlichen Sicherheitsstandard für KI-Agenten geschrieben
Sicherheit wird von einem Feature, mit dem man wirbt, zu einer Hürde, die man passieren muss. Das Risikoinventar umfasst 13 Kategorien und 97 Punkte.
KI-generierte Inhalte müssen jetzt ihre Identität offenlegen
Dieser Schritt löst nicht alle Probleme, aber er macht „KI-generiert“ von einer Option, die man verbergen konnte, zu einer Frage, die beantwortet werden muss.