← Zurück zum Blog
Aica. 7 Min. Lesezeit

Der Video-Werbe-Stack hat sich in Spezialisten aufgeteilt, und Boreal-H3 zeigt, warum

Veröffentlicht 7. Okt. 2026
Der Video-Werbe-Stack hat sich in Spezialisten aufgeteilt, und Boreal-H3 zeigt, warum

Creatify Labs hat am 2. Oktober Boreal-H3 vorgestellt, ein Video-Modell, das durch Post-Training von MiniMax H3 in Partnerschaft mit MiniMax entwickelt wurde und auf eine einzige Aufgabe ausgerichtet ist: die Produktion von Werbeclips. Der interessante Teil liegt in dem Benchmark, den Creatify erfunden hat, um es zu verkaufen, und darin, was dieser Benchmark darüber aussagt, wohin die Videogenerierung steuert.

Der Pitch in Zahlen

Boreal-H3 erreicht 133,3 auf dem Ads Quality Index von Creatify, bei dem MiniMax H3 auf 100 normalisiert ist. Im Vergleichs-Set liegt es vor Gemini Omni 1.1 Flash mit 122,2, Seedance 2.5 mit 118,1 und Wan 3.0 Prime mit 111,1.

Bei der Referenztreue (gemessen an einem strengeren Schwellenwert von 7 von 10) erreichte Boreal-H3 85,3 Prozent, vor MiniMax H3 mit 82,4 Prozent, Wan 3.0 Prime mit 79,4 Prozent, Seedance 2.5 mit 71,9 Prozent und Omni 1.1 Flash mit 70,6 Prozent.

Gegenüber seiner eigenen Basis verbesserte die Post-Training-Schleife die Subjektkonsistenz von 83,3 auf 94,4 Prozent, erhöhte die Briefing-Erfüllung von 27,8 auf 50,0 Prozent bei einer Reihe schwieriger Produktions-Briefings und reduzierte sichtbare Defekte von 1,11 auf 0,33 pro Clip, eine Reduktion um 70 Prozent.

Die Kosten- und Geschwindigkeitszahlen sind der Punkt, an dem das Verkaufsargument schärfer wird. Bei 768p generiert Boreal-H3 mit 1,1 Sekunden pro Videosekunde, sodass ein 10-Sekunden-Clip etwa 11 Sekunden dauert und 0,40 $ kostet. Seedance 2.5 läuft mit 46,5 Sekunden pro Videosekunde und etwa 0,47 $ pro Sekunde. Bei einer 15-sekündigen Produktdemo rendert Boreal-H3 in 84 Sekunden gegenüber 411 Sekunden für Seedance 2.5.

Warum der Benchmark wichtiger ist als das Modell

Der Ads Quality Index misst etwas Spezifisches: wie oft ein Modell einen Clip produziert, der als Werbung funktioniert. Ein Clip besteht nur, wenn Prompt-Befolgung, Referenzkonsistenz und visueller Realismus jeweils 6 von 10 oder höher erreichen. Die Bestehensquote jedes Modells wird dann gegen MiniMax H3 indexiert.

Das ist eine andere Frage als die, die die meisten Video-Benchmarks stellen. Artificial Analysis und ähnliche Ranglisten bewerten Ergebnisse nach allgemeiner Qualität und ästhetischer Anziehungskraft. Ob ein Clip ein Produktetikett lesbar hält, die Verpackungssilhouette stabil hält und das Gesicht des Creators vom ersten bis zum letzten Frame bewahrt, wird von diesen Rankings nicht gemessen, und genau das prüft ein Werbetreibender zuerst.

Der ehrliche Vorbehalt ist, dass Creatify den Index erstellt hat, ihn betreibt und das Modell verkauft, das ihn gewinnt. Das Unternehmen sagt, seine automatisierten Bewerter wurden gegen menschliche Präferenzen validiert und dass menschliche Studien anonymisierte, randomisierte Ergebnisse verwendeten. Das ist eine vernünftige Methodikbehauptung, und es ist immer noch eine Eigenaussage des Anbieters über das Produkt des Anbieters. Eine unabhängige Replikation existiert noch nicht.

Es gibt auch ein leiseres Detail: Der Vergleich umfasst Seedance 2.5 und Wan 3.0 Prime, beides starke Allzweck-Videomodelle, die anhand werbespezifischer Kriterien bewertet werden. Einen spezialisierten Benchmark gegen ein spezialisiertes Modell zu verlieren, ist zu erwarten. Die Zahl, die alarmierend wäre, ist, wenn Boreal-H3 auf seinem eigenen Terrain gegen ein allgemeines Modell verlöre.

Die Spezialisten-Aufspaltung ist real und strukturell

Wo Boreal-H3 hineinpasst, ist interessanter als die Frage, ob es gewinnt.

Die Videogenerierung hat sich 2026 sichtbar aufgespalten. Auf der einen Seite stehen die filmischen Generalisten (Googles Veo, Kling, Runways Gen-4.5), die Qualität, Kamerasteuerung und nativen Ton an jeden verkaufen, der eine Geschichte zu erzählen hat. Auf der anderen Seite stehen die Werbespezialisten: Creatify, Arcads, HeyGen, alle auf UGC-artige Creator-Videos und Produktdemos ausgerichtet, verkauft an Performance-Marketer, die Volumen und Iterationsgeschwindigkeit brauchen statt eines Hero-Shots.

Die Ökonomie erklärt die Aufspaltung. Eine Performance-Werbekampagne braucht Dutzende Varianten, um den funktionierenden Hook zu finden. Wenn jede Variante 5 $ kostet, geht die Rechnung nicht auf. Wenn jede 40 Cent kostet und in 11 Sekunden rendert, kann man ein Dutzend Hooks vor dem Mittagessen testen. Filmische Qualität und Iterationsdurchsatz sind unterschiedliche Produkte, und der Versuch, beides aus einem Modell zu verkaufen, bedeutet Kompromisse bei dem, was dem Käufer wichtiger ist.

HeyGen schlug in derselben Woche einen ähnlichen Weg ein und brachte ein universelles Videomodell für einen Cent pro Sekunde auf den Markt, ebenfalls durch Post-Training auf MiniMax H3. Zwei Unternehmen entschieden unabhängig voneinander, dass MiniMax' Basis das richtige Substrat für eine Spezialisierung sei, was etwas darüber aussagt, wo die Open-Weight-Frontier liegt.

Was das Modell noch nicht kann

Der Abschnitt, den die meisten Anbieter überspringen: Produktverformung.

Die Form einer Flasche kann sich zwischen Frames subtil verändern oder über separat generierte Varianten desselben Produkts hinweg. Markenzeichen werden plausibel aussehend, aber technisch falsch gerendert: ein Logo mit den falschen Proportionen, eine extrudierte Wortmarke mit einem Buchstaben, der so nicht ganz existiert. Verpackungskonsistenz über Generationen hinweg ist so verbreitet, dass ernsthafte Workflows ein Referenzbild sperren, um sie einzuschränken, anstatt einer Textbeschreibung zu vertrauen.

Creatify behauptet, dies angegangen zu sein und eine Reduzierung der Defektrate veröffentlicht zu haben. Was die Behauptung nicht abdeckt, ist der Fehlermodus, der in einer bezahlten Kampagne am wichtigsten ist: ein Defekt, der die Überprüfung übersteht, weil er in Thumbnail-Größe richtig und in voller Größe falsch aussieht. Automatisierte Bewerter, die visuellen Realismus mit 6 von 10 bewerten, werden ein falsch gezeichnetes Logo nicht zuverlässig erkennen. Ein Mensch, der die Ausgabe mit dem physischen Produkt vergleicht, schon.

Die daraus folgende Workflow-Empfehlung ist unglamourös. Beginnen Sie jede Produktaufnahme mit einem Foto des echten Produkts statt mit einer Textbeschreibung, denn ein reiner Text-Prompt lässt das Modell das Etikett zusammen mit dem Objekt erfinden. Schreiben Sie Prompts für die Bewegung (was sich bewegt, wie sich die Kamera bewegt, was das Licht macht), denn das Foto trägt bereits das Produkt. Legen Sie jeden Clip neben das physische Objekt, bevor er ausgeliefert wird.

Was Spezialisierung bringt und was sie kostet

Das Argument für ein Modell wie Boreal-H3 ist einfach: Wenn Ihre Ausgabe Werbung ist, spart ein auf Werbung abgestimmtes Modell Ihnen Iterationszyklen, die ein allgemeines Modell für Fähigkeiten aufwendet, die Sie nicht brauchen.

Das Gegenargument ist eine bestimmte Art von Lock-in. Ein Modell, das auf die Evaluierungsschleife eines Unternehmens nachtrainiert wurde, ist auf die Definition einer guten Werbung dieses Unternehmens optimiert, und diese Definition wird nicht in einer Form veröffentlicht, die jemand anderes prüfen kann. Der Ads Quality Index ist ein vernünftiger Proxy für „Funktioniert das als Werbespot?“ Ob er mit „Performt diese Kampagne?“ korreliert, ist eine Frage, die nur Media-Einkäufer beantworten können, und sie werden sie in den nächsten zwei Quartalen mit ihren Budgets beantworten.

Es gibt einen Effekt zweiter Ordnung, den es sich vorzustellen lohnt. Wenn ein Modell auf ein bestimmtes kommerzielles Ziel nachtrainiert wird, neigt es dazu, besser in den Mustern zu werden, die dieses Ziel belohnt, und schlechter in denen, die es nicht misst. Ein werbefokussiertes Modell, das auf Produkttreue und Creator-Konsistenz optimiert wurde, kann von der visuellen Erfindungsgabe abdriften, die eine Kampagne einprägsam macht. Der Ads Quality Index hat keine Komponente, die misst, ob ein Clip interessant ist, und das ist eine bewusste Scoping-Entscheidung mit Konsequenzen.

Die Anforderung an Referenzmaterial ist die andere praktische Einschränkung. Keyframe-Steuerung und Multi-Reference-Steuerung erfordern beide, dass der Werbetreibende gute Eingaben liefert: eine saubere Produktaufnahme, einen konsistenten Creator, einen etablierten visuellen Stil. Das ist in Ordnung für Marken, die bereits eine Fotobibliothek und ein Designsystem haben. Für einen kleinen Verkäufer, der Kreativinhalte von Grund auf generiert, ist die Spezialisierung weniger nützlich, weil die Eingaben, die das Modell braucht, die Eingaben sind, die der Verkäufer nicht hat.

Was Boreal-H3 wirklich demonstriert, ist, dass der Videogenerierungsmarkt über den Punkt hinausgereift ist, an dem eine einzelne Rangliste irgendetwas entscheidet. Die relevante Frage für einen Käufer Ende 2026 ist nicht mehr, welches Modell das beste ist. Sie lautet, welches Modell am besten für die spezifische Sache ist, die Sie herstellen, und ob Sie das selbst messen können, anstatt dem Index des Anbieters zu vertrauen.

Der letzte Satz ist derjenige, der am meisten zählt. Die Anbieter, die Werbemodelle entwickeln, sind auch die Anbieter, die die Benchmarks verkaufen, die sie bewerten. Die einzige zuverlässige Bewertung ist ein kontrollierter Test mit Ihrem eigenen Produktset, mit Ihren eigenen Bewertungskriterien und einem Menschen, der jede Ausgabe mit dem physischen Objekt vergleicht. Das ist langsamer als das Lesen einer Rangliste und erheblich nützlicher.

Verwandte Artikel