← Zurück zum Blog
Aica. 8 Min. Lesezeit

TwelveLabs Pegasus 1.6 verwandelt First-Person-Video in Trainingsdaten für Roboter

Veröffentlicht 7. Okt. 2026
TwelveLabs Pegasus 1.6 verwandelt First-Person-Video in Trainingsdaten für Roboter

Einem Roboter das Zusammenlegen von Wäsche beizubringen, beginnt damit, dass jemand stundenlanges Material von Menschen ansieht, die Wäsche zusammenlegen, und dann jede Bewegung aufschreibt. TwelveLabs möchte diesen zweiten Job vom Tisch nehmen.

Am 6. Oktober veröffentlichte das Unternehmen für Video Intelligence Pegasus 1.6, ein Modell mit nativer Unterstützung für egozentrisches Video. Das bedeutet Aufnahmen aus der Ich-Perspektive der Person, die die Arbeit ausführt – sei es jemand, der kocht, Teile am Fließband montiert oder einen Roboter ferngesteuert bedient.

Warum First-Person-Video ein anderes Problem ist

Aufnahmen aus der Ich-Perspektive tragen andere räumliche Hinweise und Bewegungsmuster als Video von festen Überkopfkameras oder Third-Person-Kameras. Sie enthalten Bewegungsunschärfe, wechselnde Lichtverhältnisse und Objekte, die auftauchen und verschwinden, während sich die tragende Person bewegt. Modelle, die auf allgemeinen Videodaten trainiert wurden, kommen damit meist schlecht zurecht.

Pegasus 1.6 ist darauf ausgelegt, diese unstrukturierte Eingabe zu verarbeiten und die Details zu extrahieren, die wichtig sind, um einem Roboter beizubringen, sich zu bewegen, zu greifen oder zu navigieren. Das Modell unterstützt fünf Workflows direkt.

Aktionssegmentierung und -kennzeichnung erzeugt mit Zeitstempeln versehene Labels für Aufgaben, Schritte, Objekte und Hand-Objekt-Interaktionen aus Rohvideo, zugeordnet zu einer domänenspezifischen Taxonomie. Dichte Beschriftung (Dense Caption Labeling) erzeugt beschreibende Sprache für räumliche Beziehungen, Szenenkontext und Hand-Objekt-Interaktionen, mit dem Ziel, sprachkonditionierte Roboter-Policies zu trainieren. Qualitätsbewertung filtert minderwertige Clips heraus, indem sie Aktionsklarheit, Bildkomposition und Stabilität bewertet, bevor das Material menschliche Prüfer erreicht. Suche und Kuratierung machen seltene Ereignisse und Long-Tail-Szenarien in einem großen Videorepositorium über natürlichsprachliche Abfragen sichtbar. Einwilligungs- und Compliance-Markierung erkennt Gesichter, Umstehende und sensible Daten auf Bildschirmen oder Papier, bevor das Material in nachgelagerte Pipelines gelangt.

Die Rechnung beim Arbeitsaufwand

Die Zahl, die das Produkt erklärt, sind die manuellen Kennzeichnungskosten. Die manuelle Kennzeichnung egozentrischer Aufnahmen kann 70 bis 155 Stunden menschlicher Arbeitszeit pro Videostunde erfordern. Rechnet man das auf einen einzelnen zweistündigen Clip hoch, steht ein menschlicher Annotator bei einer einzigen Datei vor Wochen Arbeit.

Pegasus 1.6 kommt mit einem Kontextfenster von 261.120 Token, groß genug, um Videos von bis zu zwei Stunden Länge zu verarbeiten. Der Zugriff läuft über die TwelveLabs-API und kostet 1,75 US-Dollar pro Videostunde, 3 US-Dollar pro Million Bild-Eingabe-Token und 15 US-Dollar pro Million Ausgabe-Token – doppelt so viel wie bei Pegasus 1.5.

Ein Hinweis für Teams, die große Aufträge planen: Die Batch-Analyse wird weiterhin von Pegasus 1.5 übernommen, sodass die Massenverarbeitung mit hohem Volumen noch nicht vollständig auf das neue Modell umgestellt wurde.

Die Unterscheidung zwischen Verstehen und Tun

Der CEO des Unternehmens, Jae Lee, beschrieb die unmittelbare Chance als Trainingsinfrastruktur. Eine Aktion zu verstehen, ist nur ein Teil davon, sie beizubringen. Pegasus kann Gliedmaßenbewegungen beschreiben und ein grobes Verständnis von Trajektorien liefern, aber es liefert nicht alle Informationen, die zur Ausführung erforderlich sind. Druck, Berührung und präzise Steuerung bleiben separate Probleme.

Das ist eine ehrliche Einordnung der Grenze, und daran sollte man festhalten. Robotikteams müssen aus Video gewonnene Informationen mit anderen Daten kombinieren und Systeme bauen, die sie in Aktion übersetzen. Pegasus sitzt vorgelagert und speist den Trainingsprozess, anstatt den Robotik-Stack zu ersetzen.

Ein Roboter-Greifer aus gebürstetem Aluminium nähert sich einem schlichten weißen Keramikwürfel auf einer hellgrauen Oberfläche

Lee gab einen Hinweis auf die Verarbeitungsskala und erinnerte sich an einen Lauf, der in etwa 18 Stunden Material im Umfang von rund 17 Jahren First-Person-Video verarbeitete, ohne dass ein Video fehlschlug. Er nannte weder die Rechenressourcen noch die Evaluierungsbedingungen, was daraus einen anekdotischen Durchsatzwert statt eines reproduzierbaren Benchmarks macht. Die technischen Unterlagen des Unternehmens beschreiben interne Evaluationen zur Aktionsidentifikation und zur Erkennung der ausführenden Hand, liefern aber keine numerischen Werte oder einen reproduzierbaren Vergleich mit Wettbewerbern.

Wie es gegenüber den Alternativen einzuordnen ist

Das Wettbewerbsfeld erstreckt sich über mehrere Teile der Robotik-Entwicklungspipeline. NVIDIAs Cosmos Curator überschneidet sich direkt bei der Datenvorbereitung durch Filterung, Annotation und Duplikatentfernung, und seine offenen Tools bieten Teams eine Alternative zu einem Managed Service. Die Integration von NVIDIA Cosmos Reason 2 und Embed durch Encord konkurriert um die Annotations- und Kuratierungsarbeit und erzeugt vorläufige Labels für die menschliche Prüfung mit verhaltensbasierter Suche. Googles Gemini Robotics ER 2 überschneidet sich bei der Interpretation von Video und der Verfolgung des Aufgabenfortschritts, betont jedoch Planung und Koordination und übergibt die motorische Ausführung an untergeordnete Aktionsmodelle. FLUX-mimic von Black Forest Labs und mimic nutzt ein Video-Modell-Fundament, um Roboteraktionen zu erzeugen, und adressiert damit die Ausführung statt der Datenvorbereitung.

Die Abrechnungseinheiten und Produktumfänge unterscheiden sich bei diesen Tools, sodass ihre Preise nicht klären, welches für eine bestimmte Arbeitslast am günstigsten ist. Pegasus rechnet Video nach Dauer und Textausgabe nach Token ab, was zu Teams passt, deren Engpass die Kennzeichnung und nicht die Aktionsgenerierung ist.

Was die Veröffentlichung belegt und was nicht

Pegasus 1.6 stellt ein konkretes Produkt hinter die Videoverstehens-Forschung von TwelveLabs und zielt auf einen echten Engpass. Der Weg von rohem menschlichem Material zu nutzbaren Roboter-Trainingsdaten ist wirklich langsam und teuer, und einen Teil davon zu automatisieren, wäre für jeden relevant, der verkörperte KI entwickelt.

Ungeklärt bleibt, ob das Modell deutlich bessere Ergebnisse liefert als bestehende Alternativen. Zur Ankündigung gab es weder Benchmarks von Dritten noch Preisvergleiche über das gesamte Feld oder veröffentlichte Kundenergebnisse. Am klarsten lässt sich als Nächstes beobachten, ob Robotikentwickler Ergebnisse aus der Nutzung von Pegasus 1.6 in tatsächlichen Kennzeichnungs-Workflows veröffentlichen. Diese Evidenz würde die Diskussion von der Ankündigung zur Bewertung verschieben, und nur sie kann eine Aussage über eingesparte Arbeit klären.

Warum menschliches Video die Basis der Pyramide ist

Die Strategie hinter Pegasus 1.6 beruht auf einem Argument darüber, woher das Verhaltenswissen von Robotern stammt, und es lohnt sich, es klar auszusprechen.

Das meiste, was Menschen über körperliche Arbeit wissen, wurde nie in einer Form erfasst, aus der eine Maschine lernen kann. Ein Koch passt einen Griff an, ohne nachzudenken. Ein Arbeiter fängt ein heruntergefallenes Werkzeug auf, indem er Gewicht und Reichweite so verlagert, wie es niemand aufschreibt. Diese Anpassungen sind der Unterschied zwischen einem Roboter, der eine Bewegung ausführt, und einem Roboter, der eine Aufgabe abschließt.

Menschliches Video ist eine der reichsten Quellen für diese Anpassungen, und es ist in enormem Umfang verfügbar. Die Wette lautet, dass eine breite Basis an Verhaltenswissen, die aus menschlichem Material extrahiert und durch teleoperierte Demonstrationen an spezifische Roboter angepasst wird, ein schnellerer Weg zu leistungsfähigen Maschinen ist, als für jede Aufgabe bei null anzufangen.

Das ist eine Entwicklungsstrategie und keine bewiesene Garantie, und der CEO sagte genau das. Mehr Video führt nicht automatisch zu einem breit leistungsfähigen Roboter, und eine verstandene Aktion in eine ausgeführte zu übersetzen, bleibt ein separates Problem, das Kraft, Berührung und Steuerung umfasst.

Die Einwilligungsdimension

Einer der fünf Workflows, die Pegasus 1.6 unterstützt, verdient besondere Erwähnung, weil er auf eine Governance-Frage verweist, die mit dem Terrain einhergeht. Einwilligungs- und Compliance-Markierung erkennt Gesichter, Umstehende und sensible Daten auf Bildschirmen oder Papier, bevor das Material in nachgelagerte Pipelines gelangt.

Diese Funktion existiert, weil egozentrisches Video aus der Perspektive einer Person bei der Arbeit aufgenommen wird, und dieser Bildausschnitt erfasst mehr als nur die Aufgabe. Er fängt ein Namensschild, einen Bildschirm, ein Gesicht im Hintergrund, ein Dokument auf einem Schreibtisch ein. Für ein Robotikteam, das Material in industriellem Maßstab sammelt, ist der Markierungsschritt das, was eine Trainingspipeline davon abhält, Material aufzunehmen, das sie nicht sollte.

Die Aufnahme dieses Workflows neben den Kennzeichnungs-Workflows ist ein leises Eingeständnis, dass die Datenpipeline eine Compliance-Oberfläche hat und dass diese Oberfläche manuell schwer zu verwalten ist. Für Teams in regulierten Branchen könnte die Markierungsfunktion am Ende genauso wichtig werden wie die Kennzeichnungsgeschwindigkeit, denn eine Pipeline, die ihre Eingaben nicht prüfen kann, ist überhaupt nicht nutzbar.

Was skaliert und was nicht

TwelveLabs beschreibt die Veröffentlichung als einen Schritt von kleinen, sorgfältig kuratierten Datensätzen hin zu einer skalierbaren Pipeline, die auf echter menschlicher Erfahrung aufbaut. Der ehrliche Vorbehalt ist, dass Skalierung im Kennzeichnungsschritt nicht automatisch Skalierung im Trainingsschritt bedeutet.

Selbst eine schnelle, kostengünstige Kennzeichnungspipeline erzeugt Daten, die weiterhin mit den Berührungs- und Steuersignalen kombiniert werden müssen, die ein Roboter benötigt, und die weiterhin an die Verkörperung einer bestimmten Maschine angepasst werden müssen. Pegasus 1.6 beseitigt einen Engpass, nämlich den Arbeitsaufwand für die Kennzeichnung, und tut nichts gegen die anderen. Das ist ein nützlicher Beitrag und keine vollständige Lösung, und die Teams, die am meisten profitieren, werden diejenigen sein, bei denen der Kennzeichnungsschritt der bindende Engpass war. Ob das auf die meisten Robotikteams zutrifft, ist genau die Frage, die veröffentlichte Ergebnisse aus tatsächlichen Einsätzen beantworten würden.

Verwandte Artikel