← Zurück zum Blog
Aica. 7 Min. Lesezeit

Ein Foto, eine begehbare Welt: InSpatio-World 1.5 verwandelt Bilder in Räume

Veröffentlicht 3. Okt. 2026
Ein Foto, eine begehbare Welt: InSpatio-World 1.5 verwandelt Bilder in Räume

Die meisten Bild- und Videomodelle liefern einen festen Frame oder einen festen Clip. Man sieht, was das Modell entschieden hat zu zeigen. Ein chinesisches Unternehmen namens InSpatio hat diesen Monat ein Modell veröffentlicht, das ein einzelnes Foto, ein Panorama oder ein vorhandenes Video nimmt und daraus einen Raum macht, in dem man sich bewegen kann.

InSpatio-World 1.5 ging Ende September auf dem Shanghai International Audiovisual Arts Carnival an den Start, und das Unternehmen hat den Code unter Apache 2.0 als Open Source veröffentlicht. Das Demo-Video erklärt am deutlichsten, was anders ist. Es beginnt in einem überdachten Wandelgang eines chinesischen Palasts. Die Kamera fährt vorwärts, passiert ein Geländer und eine Treppe und biegt in einen Innenhof ein. Pavillons, die hinter Säulen verborgen waren, kommen in den Blick, während sich der Standpunkt verschiebt. Was das Modell erzeugt hat, ist ein Raum, der beim Erkunden immer weiter gerendert wird – und nicht ein Clip mit vorgegebenem Kamerapfad.

Ein dunstiger Gang aus Steinsäulen, der sich zu einer Tür mit hellem Licht hin erstreckt

Drei Dinge haben sich in dieser Version geändert

Das Erste ist, was das Modell als Eingabe akzeptiert. Frühere Weltmodelle wollten meist ein einzelnes Bild. Version 1.5 nimmt ein einzelnes Bild, eine Reihe von Bildern, ein Panorama oder ein Video. Das ist wichtig, weil es den Einstiegspunkt festlegt. Ein einzelnes Foto ist ein Ausgangspunkt für Endnutzer. Mehrbild-Sets und vorhandenes Videomaterial sind das, was ein Film- oder Werbeteam bereits zur Hand hat, und sie zu akzeptieren erweitert den Kreis derer, die das Werkzeug nutzen können.

Das Zweite ist die Echtzeit-Erkundung. Einmal im generierten Raum, kann man den Standpunkt weiter bewegen, um Verdeckungen herumgehen und Bereiche erreichen, die nicht im Ausgangsbild waren. Jedes Mal, wenn sich der Standpunkt ändert, muss das Modell die zuvor unsichtbaren Teile der Szene auffüllen – und zwar konsistent mit dem, was man bereits gesehen hat. Das ist ein schwierigeres Problem als das Erzeugen eines gefälligen Clips, denn das Modell muss eine innere Vorstellung von einem Ort aufrechterhalten statt einer Bildfolge.

Das Dritte ist die raumzeitliche Konsistenz, die eigentliche Trennlinie zwischen einem Weltmodell und einem Videogenerator. Wenn die Kamera einen Raum verlässt und zurückkehrt, sollte sich der Raum nicht umgestellt haben. InSpatio sagt, man habe dies in 1.5 verstärkt, um längere Erkundungspfade und komplexere Szenen zu unterstützen, und die Demo stützt diese Behauptung, indem sie Bereiche wiederholt aus neuen Blickwinkeln ansteuert.

Die Zahlen hinter der Demo

InSpatio beschreibt das Modell als kompakt – 1,3 Milliarden Parameter – und meldet einen Wert von 68,72 auf WorldScore-Dynamic, womit es laut eigener Aussage unter den evaluierten echtzeitfähigen interaktiven Methoden an erster Stelle steht, bei bis zu 24 Bildern pro Sekunde. Das sind die eigenen Zahlen des Unternehmens, und unabhängige Reproduktionen sind noch dünn gesät, also sollte man sie als Ausgangspunkt und nicht als gesichertes Ergebnis betrachten.

Der technische Ansatz hat ein paar bewegliche Teile, die man benennen sollte. Bei Videoeingaben nutzt die Pipeline Depth Anything 3, um fehlende Tiefe sowie Kamera-Intrinsics und -Extrinsics pro Frame zu schätzen; das ermöglicht die Rekonstruktion einer Szene aus Material, das nicht als 3D-Aufnahme gedreht wurde. Ein raumzeitlich autoregressiver Prozess sorgt dafür, dass ein persistenter Weltzustand erhalten bleibt, während sich die Ansicht ändert, statt die Szene jedes Mal von Grund auf neu zu erzeugen.

Wo sich eine begehbare Szene bezahlt macht

Der unmittelbarste Einsatz ist der, auf den die Demo zeigt. In Film und Werbung steht die Kameraposition meist in dem Moment fest, in dem man dreht. Will man einen anderen Winkel, dreht man neu – und Nachdrehs sind teuer. Ein Weltmodell erlaubt es einem Team, Kamerapositionen im Nachhinein weiter zu suchen und zusätzliche Einstellungen aus bereits vorhandenem Material zu holen. InSpatio nennt Bullet-Time in der Werbung als direktes Beispiel: Statt ein Kamera-Rig um ein Motiv zu synchronisieren, gibt man eine Reihe von Bildern ein und entwirft einen neuen Kamerapfad um dasselbe Motiv.

Der zweite Einsatz sind Trainingsdaten für Roboter. Ein Problem in der verkörperten KI ist, dass der größte Teil des Videos, das das Internet liefert, in der dritten Person gedreht ist, während ein Roboter die Welt in der ersten Person sieht. Laut InSpatio kann das Modell Drittpersonen-Aufnahmen eines Vorgangs nehmen und eine Ego-Perspektive vorhersagen, die näher an dem liegt, was ein Roboter wahrnehmen würde, und kann denselben Prozess aus verschiedenen Richtungen mit veränderten Verdeckungsverhältnissen neu beobachten. Wenn das in großem Maßstab funktioniert, ist es ein Weg, vorhandenes Video in Trainingsmaterial für Roboter zu verwandeln, ohne für jede Umgebung neu drehen zu müssen.

Darüber hinaus verweist das Unternehmen auf Tourismus und kulturelle Erlebnisse, digitale Zwillinge und industrielle Simulation – Bereiche, in denen ein Raum, der sich wie ein Raum verhält, nützlicher ist als ein Bild, das wie einer aussieht.

Ein dichtes Rennen mit unterschiedlichen Definitionen von Sieg

InSpatio ist nicht allein mit diesem Ziel, und die konkurrierenden Ansätze sind sich nicht einmal darüber einig, wofür ein Weltmodell überhaupt gut ist. Manche Labore optimieren auf cineastische Ergebnisse und erzeugen eine wunderschön konsistente Minute Material mit einer einzigen erzählerischen Kamerafahrt. Andere setzen auf Interaktivität und priorisieren die Fähigkeit, sich frei zu bewegen und die Szene ohne festen Pfad reagieren zu lassen. Ein drittes Lager, näher am Gaming, will Echtzeit-Engines, die eine Welt als navigierbaren Ort im Speicher halten.

Diese Ziele ziehen in unterschiedliche Richtungen. Ein auf cineastische Qualität abgestimmtes Weltmodell kann Rechenleistung auf eine vorherbestimmte Sequenz verwenden und jedes Frame gut aussehen lassen. Ein auf Interaktion abgestimmtes Modell muss rendern, wohin der Nutzer als Nächstes schaut, was in Richtung Geschwindigkeit und in Richtung eines Szenengedächtnisses drängt, das beliebige Bewegungen übersteht. InSpatio-World 1.5 steht klar im interaktiven Lager, und die Wahl eines kleinen Modells mit 1,3 Milliarden Parametern ist eine Wette darauf, dass Echtzeitfähigkeit wichtiger ist als der Sieg in einem Standbild-Schönheitswettbewerb.

Der für Käufer relevante Vergleich ist der mit anderen navigierbaren Systemen, und hier ist das Feld noch so früh, dass die meisten Angaben aus Eigenberichten stammen. Ein Benchmark wie WorldScore-Dynamic versucht, den schwer fassbaren Teil zu beziffern – ob die Welt konsistent bleibt, während man sich durch sie bewegt –, aber ein Benchmark misst nur, was seine Entwickler zu messen beschlossen haben. Konsistenz über eine lange Erkundung, Treue zum Originalfoto und Bildrate arbeiten alle gegeneinander, und jedes System wird andere Kompromisse wählen.

Das ist der eigentliche Grund, die Open-Source-Veröffentlichung zu beobachten. Wenn Dutzende Forschende das Modell mit eigenen Eingaben auf Herz und Nieren prüfen, wird das Bild davon, wo es hält und wo es bricht, weit nützlicher sein als die Launch-Demo – und es wird dem restlichen Feld erlauben, Ansätze auf gemeinsamer Grundlage zu vergleichen statt auf konkurrierenden Highlight-Reels.

Warum Open Source die Strategie ist und nicht das Verschenken

InSpatio hat den Code zusammen mit dem Modell veröffentlicht und teasert ein neues Topos-Pro 1.0 für Tests auf Einladung an. Die Begründung ist die, die sich quer durch die räumliche Intelligenz zeigt: Die nützlichen Anwendungen verteilen sich über Film, Tourismus, Robotik und digitale Zwillinge, und kein einzelnes Unternehmen kann sie alle abdecken. Die Basisfähigkeit zu veröffentlichen, lässt Forschende die Grenzen überprüfen und Partner die vertikale Schicht darauf aufbauen. Es ist ein Weg, das Erdgeschoss zu sein statt das ganze Gebäude.

Das Risiko ist das übliche bei einer frühen Open-Source-Veröffentlichung. Die Demo ist beeindruckend, der Benchmark stammt aus Eigenberichten, und die Lücke zwischen einer kontrollierten Demo und einem Werkzeug, das bei unordentlichen realen Eingaben standhält, ist oft groß. Die nächsten Monate, in denen unabhängige Forschende und Kreative den Code in die Hände bekommen, werden zeigen, welche Teile des Versprechens den Kontakt mit den Daten anderer Leute überstehen.

Verwandte Artikel