PixVerse R2 transforme la génération vidéo en un monde que l’on peut parcourir

La plupart des outils de génération vidéo vous demandent la même chose : décrivez une scène, attendez, récupérez un clip, décidez si vous le gardez. Le résultat est un fichier. Il se déroule de la même façon à chaque fois. Si vous voulez une fin différente, vous écrivez un autre prompt et recommencez.
PixVerse R2, publié le 23 septembre par l’entreprise derrière la plateforme vidéo PixVerse, AIsphere, repose sur un principe différent. Au lieu de renvoyer un clip figé, il génère un monde audiovisuel continu qui continue de tourner pendant que vous interagissez avec lui. Vous créez un monde à partir de texte ou d’une image, déplacez un personnage avec les touches WASD, changez la caméra et saisissez des prompts pour échanger des personnages, ajouter des objets ou modifier l’environnement. La scène ne redémarre pas. Les actions antérieures persistent et façonnent ce qui suit.
Ce dernier détail, c’est toute l’idée. Dans la plupart des vidéos génératives, chaque requête est indépendante. Dans R2, un prompt met à jour l’état du monde. Offrez un cadeau à une créature dans le film interactif de démonstration *Zero Mark*, créé avec le créateur Xiaolongbao, et le résultat est généré en direct selon le cadeau que vous avez choisi. Tendez-lui un dragon ou une feuille et l’histoire bifurque. Un autre créateur, Jade Wu, a construit une séquence autour d’un personnage numérique en temps réel nommé Eve, qui conserve une identité et une mémoire cohérentes au fil de nombreux échanges.

AIsphere qualifie R2 de modèle de monde en temps réel polyvalent et a ouvert des espaces de démonstration pour les jeux, les films interactifs et les humains numériques sur world.pixverse.video. R2 succède à R1, que l’entreprise a présenté en janvier.
Le compromis qu’il cherche à rompre
La génération en temps réel a toujours imposé un choix. Un petit modèle rapide peut suivre une interaction en direct, mais il ne peut pas faire grand-chose. Un grand modèle performant produit de meilleures images, mais il tourne trop lentement pour réagir à quoi que ce soit. Les équipes ont généralement choisi un camp et accepté la limitation.
R2 divise le problème en deux couches. La base est une architecture autorégressive causale appelée Omni Causal AR, entraînée en continu sur des vidéos courtes et longues, des références multimodales, de l’audio et des contrôles d’action. Elle évolue selon cinq dimensions : modèle, données, tâches, signaux de contrôle et horizons temporels. Au-dessus se trouve une couche d’accélération en temps réel qui distille la même architecture en une version à très peu d’étapes qui tourne en direct.
La distinction compte. Plutôt que d’entraîner un petit modèle séparé pour gérer l’interactivité et d’accepter qu’il soit plus faible, AIsphere distille son modèle performant vers une forme plus rapide. Les deux couches partagent une même lignée, de sorte que la version rapide n’apprend pas à partir de zéro.
Des techniques complémentaires viennent préciser les détails. Le découpage dynamique (dynamic chunking) gère des signaux qui opèrent à différentes échelles de temps, afin que le modèle ne soit pas forcé de traiter de la même manière un changement environnemental lent et un mouvement rapide de personnage. Trois canaux de mémoire suivent les règles persistantes du monde, le mouvement récent et l’état des objets. Une Error Bank rejoue les propres états d’échec du modèle pendant l’entraînement.
L’entreprise rapporte que l’Error Bank a réduit une mesure de dérive de luminosité à long horizon de 35,8 % lors de tests internes, et que l’attention parcimonieuse par blocs (block-sparse attention) maintient une qualité presque intacte au-delà de 90 % de parcimonie. La dérive de luminosité est une mesure peu glamour mais révélatrice. Dans les longues séquences, l’accumulation subtile d’erreurs est exactement ce qui brise l’illusion que vous regardez un lieu cohérent.
Ce qu’il n’est pas
AIsphere fait preuve de franchise sur les limites, ce qui est rafraîchissant dans une catégorie où le marketing dépasse généralement le produit. Dans des contraintes strictes de temps réel et de latence, la qualité de sortie en un seul passage de R2 reste en deçà des principaux modèles vidéo hors ligne. Si vous voulez le clip le plus net possible, vous avez toujours intérêt à générer hors ligne et à attendre.
La proposition de valeur n’est donc pas la qualité. C’est la continuité et la réactivité. Le modèle échange un peu de finition image par image contre la capacité de maintenir un monde en vie et de réagir aux entrées, et le pari est qu’un grand nombre d’usages se soucient davantage de cette capacité.
Ce cadrage explique aussi où se situe R2 face à la vague plus large de modèles de monde venant de laboratoires chinois et d’ailleurs. HD-V1 de HiDream, dont nous avons parlé plus tôt, se positionne autour de la cohérence physique et de la cohérence narrative en génération hors ligne. Les modèles de monde interactifs de Google ont poussé vers des environnements jouables. Le positionnement de R2 s’appuie le plus fortement sur la métaphore de « l’environnement dans lequel on entre ». Le fondateur et PDG d’AIsphere, Wang Changhu, le dit sans détour : la vidéo interactive en temps réel ne constitue pas toute la modélisation de monde, mais c’est la voie que les gens peuvent expérimenter le plus tôt. Il s’attend à ce que R2 évolue d’un outil de création vers un environnement dans lequel les utilisateurs peuvent entrer à tout moment.
Pourquoi le moteur de jeu compte
Le PixVerse Game Engine, lancé initialement en juillet, fonctionne désormais sur R2. C’est la partie à surveiller pour toute personne extérieure à la recherche. Un modèle de monde en temps réel attaché à un moteur de jeu est un produit très différent d’un générateur vidéo. Il implique des interactions conçues, des sauvegardes d’état et le type de persistance de session que les joueurs attendent déjà d’un logiciel plutôt que d’un média.
Les cas d’usage de démonstration s’articulent autour de cette idée : jeux, films interactifs, humains numériques. Tous trois sont des formats où le public fait quelque chose, et où un clip figé ne peut pas offrir l’expérience. Un humain numérique qui se souvient du dernier échange est utile dans le service client ou l’accompagnement d’une manière qu’une vidéo à usage unique ne pourra jamais égaler. Un film interactif où le choix du spectateur bifurque réellement est une forme que les pipelines vidéo traditionnels ne peuvent pas produire du tout.
Il existe un écart pratique entre un espace de démonstration et un déploiement en production, et AIsphere n’a pas divulgué de calendrier pour la disponibilité commerciale, le prix ou la quantité de calcul consommée par une session R2 en direct. Ces chiffres décideront si le modèle devient une plateforme ou reste une démo.
La tendance derrière le lancement
Prenez du recul, et R2 s’inscrit dans un schéma reconnaissable de l’année écoulée dans la vidéo IA. La frontière ne cesse de se déplacer de « générer un joli clip » vers « maintenir une chose cohérente dans le temps ». Et cela, qu’il s’agisse d’un récit de cinq minutes, d’un personnage qui reste cohérent d’un plan à l’autre ou, dans le cas de R2, d’un monde qui conserve ses règles pendant que vous le sollicitez.
Chacun de ces cas est le même problème sous-jacent sous des habits différents : maintenir la cohérence de l’état d’un système génératif à mesure que le temps et les interactions s’accumulent. Les modèles hors ligne le résolvent image par image au sein d’un seul rendu. R2 le résout sur toute une session en direct, où les entrées continuent d’arriver.
Que R2 devienne un outil largement utilisé ou une expérience bien financée, il constitue un marqueur utile de l’endroit où la catégorie pense que se trouve le prochain avantage. Les entreprises capables de maintenir un monde cohérent sous des entrées en temps réel seront bien positionnées, car c’est cette capacité qui transforme la vidéo générative de quelque chose que l’on regarde en quelque chose que l’on utilise.
Articles associés
Un semi-humanoïde à roues a terminé une heure de lessive sans aide
Des tâches individuelles peuvent réussir alors qu'un flux de travail échoue encore. Dyna a changé la métrique.
LTX 2.5 veut transformer votre brouillon Blender en un plan finalisé
En texte-vidéo, vous ne contrôlez pas ce qui se passe. Cet outil tente d'y remédier.
ServiceNow transforme les échecs des agents en données d'entraînement
La génération sans vérification est du bruit. Les portes sont le produit.
Un seul cadre pour le langage et la vision : le modèle ouvert 1,6B d’Horizon
Un pari : les ponts entre le langage et la vision n’ont jamais été nécessaires.