← Zurück zum Blog
Communityca. 6 Min. Lesezeit

Warum jedes KI-Gesicht gleich aussieht – und warum Zuschauer beginnen, es zu hassen

Veröffentlicht 1. Okt. 2026
Warum jedes KI-Gesicht gleich aussieht – und warum Zuschauer beginnen, es zu hassen

Es gibt einen Moment, der sich im KI-Drama-Boom ständig wiederholt. Ein Zuschauer scrollt, sieht einen Clip, liket ihn und bemerkt dann, dass der männliche Hauptdarsteller dieser Serie dasselbe Gesicht hat wie der männliche Hauptdarsteller der letzten Serie und der davor. Gleiche Gesichtsform, gleiche Haare, derselbe Mittelscheitel-Pony. Die Vergleichs-Screenshots sind viral gegangen, und die Reaktion hat im chinesischen Internet-Slang einen Namen: physiologischer Ekel.

Der Grund, warum jedes KI-Gesicht auf demselben Gesicht konvergiert, ist kein Rätsel. Es ist Statistik. Ein Videomodell muss ein Gesicht von Frame zu Frame konsistent halten, und ein symmetrisches, makelloses, merkmalloses Gesicht hat die höchste Toleranz für die winzigen Fehler, die Cross-Frame-Flackern verursachen. Individuelle Merkmale – eine schiefe Nase, ein Leberfleck, asymmetrische Augen – sind genau das, was bricht, wenn das Modell dasselbe Gesicht dreißig Mal pro Sekunde neu rendert. Also greift das Modell zum „sicheren“ Gesicht, dem, das der Durchschnitt aller Gesichter ist, mit denen es trainiert wurde. Heraus kommt das, was ein Forscher eine statistische „durchschnittlich optimale Lösung“ nannte.

Die Ökonomie drängt in dieselbe Richtung. Generative Videos werden pro Sekunde abgerechnet, und ein individuelles Gesicht zu gestalten bedeutet, Prompts zu iterieren, Merkmale festzuschreiben und Mikroexpressionen Frame für Frame zu kalibrieren, was die Zeit verdoppelt. Die meisten Teams, die einen täglichen Upload-Plan verfolgen, überspringen all das und verwenden ein Erfolgs-Template mit einer öffentlichen Gesichtsbibliothek wieder. Es gibt dafür sogar einen Graumarkt: Ein Paket mit zwanzigtausend angeblich urheberrechtsverletzenden Drama-Clips zum Training wird für weniger als einen Dollar verkauft. Wenn die Trainingsdaten selbst aus derselben Handvoll Quellen stammen, können die daraus erzeugten Gesichter nicht anders, als sich zu ähneln.

Das Ergebnis ist eine Inhaltskategorie, in der die Gesichter perfekt und austauschbar sind. Ein Journalismusprofessor der Tsinghua-Universität brachte das Problem auf eine Formel, die hängen geblieben ist: Der Algorithmus kann einen Schönheitswert berechnen, aber nicht die Tiefe einer menschlichen Persönlichkeit. Die Unvollkommenheit ist der Punkt. Sommersprossen, eine leichte Asymmetrie, die Art, wie sich ein Auge zusammenkneift, wenn jemand wirklich lächelt, die Art, wie sich eine Braue entspannt, wenn jemand müde ist. Das sind die Dinge, die es einem ermöglichen, eine Person von einer anderen zu unterscheiden, und genau das feilt ein Modell, das auf Glattheit optimiert ist, weg.

Ein sich wiederholendes Raster nahezu identischer KI-generierter Porträtgesichter

Darin steckt auch ein evolutionäres Argument. Menschen sind darauf gepolt, Gesichter auf Identität und Emotion zu lesen, und wir sind auf kleine Unterschiede angewiesen, um Menschen auseinanderzuhalten. Ein standardisiertes Gesicht ohne unterscheidende Merkmale löst denselben Alarm aus wie das Uncanny Valley: Es ist menschlich genug, um als Gesicht wahrgenommen zu werden, aber anders genug, um sich falsch anzufühlen. Der Ekel ist kein Snobismus. Es ist eine Wahrnehmungsreaktion auf ein Ding, das fast menschlich aussieht, aber nicht ganz.

Dieselbe Dynamik zeigt sich darin, wie das Modell Identität selbst behandelt. Ein KI-„Schauspieler“ ist eine statistische Anpassung an eine Verteilung von Ausdrücken, keine Person mit einem autonomen Nervensystem. Echte Gesichter bewegen sich aufgrund von Physiologie und Situation; die Braue einer müden Person entspannt sich auf eine bestimmte Weise, eine wirklich amüsierte Person kneift die Augen zusammen. Das Modell kann diese Dinge annähern, aber nicht selbst hervorbringen, und der Unterschied zeigt sich als subtile Flachheit, die Zuschauer registrieren, auch wenn sie sie nicht benennen können. Es ist der Unterschied zwischen einer Darbietung und einem Rendering.

Es gibt einen konkreten Datenpunkt, der zeigt, wie weit die Homogenisierung fortgeschritten ist. Berichte beschreiben Trainingsmaterial-Pakete mit Zehntausenden von Kurzdrama-Clips, die angeblich ohne Erlaubnis gescrapt und für unter einem Dollar verkauft wurden. Wenn die Trainingsdaten so eng und so breit wiederverwendet werden, können die daraus erzeugten Gesichter nicht anders, als zu konvergieren. Die Gleichheit ist kein Unfall des Geschmacks. Sie ist eine nachgelagerte Konsequenz einer Lieferkette, die auf billige Masse optimiert ist.

Das ist nicht nur eine ästhetische Beschwerde. Es wird zu einer kommerziellen. Wenn jede Show wie dieselbe Show aussieht, ist nichts einprägsam, und eine Kategorie, die von Neuheit lebt, stirbt an Gleichförmigkeit. Die chinesische Regulierungsbehörde arbeitet bereits an einem Qualitätsstandard, der die Unterscheidbarkeit von Figuren zu einem eigenen Bewertungskriterium macht, was ein klares Signal dafür ist, wo die Branche die nächste Wettbewerbswelle erwartet. Eine Kategorie, die ihre eigenen Figuren nicht auseinanderhalten kann, ist eine Kategorie, die nicht verstanden hat, warum jemand weiterschauen sollte.

Darunter liegt ein tieferer Punkt, der weit über Kurzdramen hinausgeht. Generative KI neigt zum Durchschnitt, weil der Durchschnitt die sicherste Wette ist, und die sicherste Wette ist das, worauf ein Wahrscheinlichkeitsmodell trainiert wird. Menschliche Kreativität neigt zum Spezifischen, weil eine spezifische Entscheidung das Einzige ist, was heraussticht. Der Kampf zwischen beiden spielt sich jetzt in Echtzeit, in massivem Maßstab, in einer Ecke des Internets ab, die die meisten westlichen Beobachter nicht im Blick haben.

Warum das über Ästhetik hinaus wichtig ist: Es gibt eine Vorschau auf eine größere kulturelle Frage. Wenn der billigste und einfachste Content alles auf dasselbe Aussehen, dasselbe Gesicht, dieselbe Stimme konvergiert, dann wird das Internet zu einem Spiegelkabinett, das einen statistischen Durchschnitt auf sich selbst zurückwirft. Die Menschen, die sich dieser Konvergenz widersetzen, die auf einer schiefen Nase, einem Dialekt, einer ungeplanten Pause beharren, sind nicht nostalgisch. Sie verteidigen das, was Kultur überhaupt lebenswert macht.

Die Parallele zum breiteren KI-Slop-Problem ist exakt. Deezer meldet 75.000 KI-Songs, die täglich hochgeladen werden. Eine Prüfung amerikanischer Zeitungen ergab, dass 9 Prozent der neuen Artikel als KI-generiert gekennzeichnet wurden. Der gemeinsame Nenner ist, dass generative Tools, ohne redaktionelle Absicht betrieben, eine Flut kompetenter, aber austauschbarer Ergebnisse produzieren. Das KI-Gesicht ist nur das visuell verstörendste Beispiel eines Phänomens, das gleichzeitig Musik, Text und Bilder umformt.

Die Lösung ist nicht, die Modelle weniger glatt zu machen. Sie besteht darin, die Standardausgabe des Modells nicht länger als fertiges Produkt zu behandeln. Die Unterscheidbarkeit von Figuren muss bewusst gestaltet werden, genauso wie ein Casting-Director eine Besetzung zusammenstellt. Die Tools unterstützen das bereits: Referenzbilder, Keyframes, fixierte Merkmale. Was fehlt, ist der Wille, die zusätzliche Zeit zu investieren, denn die Ökonomie des Booms belohnt Geschwindigkeit. Die Kreativen, die sich dem Durchschnittsgesicht widersetzen, werden noch Publikum haben, wenn die Neuheit verflogen ist. Das ist die Wette, und es ist dieselbe Wette, die jedes reifende Medium seinen Kreativen aufzwingt: Sei spezifisch, oder verschwinde im Durchschnitt.

Es gibt Gründe anzunehmen, dass sich der Druck bereits verschiebt. Die Plattformen, die den Boom befeuert haben, indem sie Masse belohnt haben, beginnen nun, Eigenständigkeit zu belohnen, denn ein Feed voller austauschbarer Gesichter ist ein Bindungsproblem. Der Qualitätsstandard ist ein Hebel; der Algorithmus ein anderer. Sobald die Plattform aufhört, Gleichförmigkeit zu belohnen, kippt die Ökonomie, und die Teams, die das Können für Figurendesign aufgebaut haben, werden in der Position sein, zu gewinnen. Das KI-Gesicht verschwindet nicht. Was verschwindet, ist die Vorstellung, mit der Voreinstellung gewinnen zu können, und das ist eine gesunde Entwicklung für alle, die wirklich etwas Sehenswertes machen wollen.

Verwandte Artikel