PixelUMM verwirft die zwei Komponenten, auf die jedes visuelle KI-Modell angewiesen ist

Am 1. Oktober veröffentlichte ein Entwickler unter dem Namen CongWei1230 PixelUMM, ein encoderfreies multimodales Modell, das Bild- und Videoverständnis sowie -generierung direkt im Pixelraum bewältigt. Der Code und die trainierten Gewichte sind öffentlich. Interessant ist, was das Modell nicht enthält.
Die meisten in den letzten Jahren entwickelten visuellen KI-Systeme teilen zwei Komponenten. Ein variationaler Autoencoder komprimiert ein Bild in eine kompakte latente Repräsentation, und das generative Modell arbeitet in diesem komprimierten Raum statt auf Rohpixeln. Separat dazu verwandeln Vision-Transformer ein Bild in Patches, über die ein Sprachmodell Schlussfolgerungen ziehen kann. PixelUMM lässt beide weg. Es entfernt den für die Generierung verwendeten latenten Raum und den für das Verständnis verwendeten Patch-Encoder und verarbeitet Pixel direkt.
Diese Behauptung ist architektonisch, und es lohnt sich zu verstehen, warum fast alle anderen diese Komponenten beibehalten haben.
Wofür die beiden Komponenten da waren
Ein VAE existiert, um die Generierung bezahlbar zu machen. Ein Foto mit 1024 x 1024 Pixeln und drei Farbkanälen umfasst etwa drei Millionen Zahlen. Ein Diffusionsprozess über drei Millionen Werte bei jedem Schritt ist teuer, also komprimiert der VAE das Bild auf ein kleineres latentes Raster, und das Modell entrauscht dort. Der Kompromiss ist, dass der VAE einen verlustbehafteten Engpass einführt. Feine Details und präzise Textwiedergabe verlieren bei der Kompression oft Informationen, weshalb frühe Bildmodelle mit kleiner Schrift Schwierigkeiten hatten.
Der ViT existiert, um Verständnis zu ermöglichen. Sprachmodelle verarbeiten Tokens, und ein ViT verwandelt ein Bild in eine Folge von Patch-Einbettungen, die wie Tokens aussehen. So kann ein multimodales Modell Fragen zu einem Bild beantworten. Der Kompromiss ist, dass das Patch-Raster fest ist und Informationen an den Grenzen zwischen Patches verwischt werden können.

PixelUMMs Wette ist, dass es durch das Weglassen beider Komponenten Verständnis und Generierung in einem Framework vereinen und die Artefakte vermeiden kann, die jede Komponente einführt.
Warum das schwierig ist
Diffusion auf Pixelebene wurde schon früher vorgeschlagen und ist immer wieder an Rechenleistung gescheitert. Wenn ein latentes Modell ein latentes Raster von 128 x 128 entrauscht, entrauscht ein Pixelmodell ein Bildraster von 1024 x 1024, was ungefähr 64-mal so vielen Positionen pro Schritt entspricht. Sequenzlängen explodieren, Attention-Kosten skalieren mit dem Quadrat der Sequenzlänge, und das Ergebnis sind Trainings- und Inferenzkosten, die die meisten Labore für einen moderaten Qualitätsgewinn nicht zahlen werden.
Encoderfreies Verständnis hat ein anderes Problem. Ein Modell darauf zu trainieren, direkt über Rohpixel zu schlussfolgern, bedeutet, dass das Modell visuelle Merkmale von Grund auf lernen muss, statt von einem vortrainierten Vision-Encoder zu starten. Das ist eine große Menge an Supervision, die wiederhergestellt werden muss, und es ist nicht offensichtlich, dass der Nutzen die Kosten übersteigt.
PixelUMM ist eine Wette darauf, dass architektonische Einfachheit und Genauigkeit die Rechenkosten wert sind. Die veröffentlichten Gewichte sind der Beleg, an dem man das bewerten kann. Ob es bei Qualität pro Dollar gewinnt, ist eine offene Frage, die von Leuten entschieden wird, die es ausführen, nicht vom Veröffentlichungsbeitrag. Das ist der normale Lebenszyklus eines Architekturvorschlags: interessant, bis jemand ihn benchmarkt, danach nützlich oder vergessen.
Der Teil, der wirklich neu ist
Was die Veröffentlichung beachtenswert macht, ist die Behauptung der Vereinheitlichung. Die meisten Produktionsstacks für Bild und Video werden aus Teilen zusammengesetzt, die separat entworfen wurden: ein VAE für den einen Zweck, ein Diffusion-Transformer für einen anderen, ein Vision-Encoder für einen dritten. Jede Verbindung zwischen ihnen ist ein Ort, an dem sich das Verhalten zwischen Training und Deployment unterscheiden kann und an dem sich Fehler verstärken.
Ein einziges Framework, das Generierung und Verständnis in derselben Repräsentation bewältigt, beseitigt diese Verbindungen. Wenn es funktioniert, wird das Debuggen einer multimodalen Pipeline einfacher, weil es eine Repräsentation und einen Satz von Fehlermodi gibt statt vier.
Es gibt auch eine Datengeschichte. Ein Modell, das niemals komprimiert, erbt kein Kompressionsartefakt und kann daher prinzipiell exakte Details bewahren, einschließlich Text und feiner Textur, ohne eine separate Verfeinerungsstufe. Das ist relevant für alle, die Pipelines für Dokumente, UIs oder Produktbilder bauen, bei denen kleine Fehler ein Ausschlusskriterium sind.
Der Zeitpunkt ist kein Zufall
PixelUMM kam in derselben Woche, in der mehrere kommerzielle Systeme die Bewahrung von Details zu ihrem Hauptmerkmal machten. Black Forest Labs lieferte FLUX 3 Image mit 4K-Ausgabe und pixelbewahrenden regionalen Bearbeitungen aus, und die Imagen-4-Varianten von Google landeten auf einer gehosteten Plattform. Der Markt belohnt eindeutig Modelle, die bewahren, was der Nutzer hatte, während sie nur ändern, was der Nutzer ändern wollte.
Pixelraum-Generierung ist die Antwort eines Forschers auf dieselbe Frage, die diese Produkte mit industrieller Ingenieurskunst beantworten. Der kommerzielle Weg fügt Auflösung und Bearbeitungssteuerung zusätzlich zu einer latenten Architektur hinzu. Der Forschungsweg entfernt die latente Architektur und bezahlt dafür mit Rechenleistung. Beide versuchen, den Punkt zu erreichen, an dem generierte Details einer genauen Prüfung standhalten, und sie werden von denselben Nutzern beurteilt.
Warum jemand das jetzt veröffentlicht hat
Die Veröffentlichung ist auch ein Kommentar dazu, wo das offene Ökosystem steht. Zwei Jahre lang hat die Open-Model-Community hauptsächlich über Skalierung konkurriert und immer größere Modelle veröffentlicht, die mit mehr Daten trainiert wurden. Dieser Wettbewerb hat wirklich leistungsfähige Systeme hervorgebracht, aber auch viele sehr ähnliche Architekturen, da fast alle dasselbe latente Diffusionsdesign und dieselbe Familie von Vision-Encodern verwenden.
Ein encoderfreies Modell zu veröffentlichen ist eine Möglichkeit, über Struktur statt über Größe zu konkurrieren. Es ist billiger, eine andere Architektur auszuprobieren, als die größten Labore bei Trainingsdaten zu überbieten, und es ist ein nützlicherer Beitrag, wenn es funktioniert. Eine Community, die vorhandene Designs nur skaliert, konvergiert auf einen Ansatz. Eine Community, die Alternativen testet, hält mehr Optionen am Leben.
Das ist die wohlwollende Lesart, und wahrscheinlich ist sie richtig. Die veröffentlichten Gewichte geben dem Ansatz eine faire Chance, was mehr ist, als die meisten Architekturvorschläge bekommen.
Was als Erfolg zählen würde
Die Gewichte sind veröffentlicht, also sind die Tests billig durchzuführen und schwer zu fälschen.
Schauen Sie sich die Textwiedergabe an. Encoderfreie Generierung sollte kleine Schrift besser bewältigen als ein latentes Modell mit demselben Budget, sonst gibt es keinen Grund, die Rechenkosten zu akzeptieren.
Schauen Sie sich Speicher und Latenz auf einem einzelnen Consumer-Beschleuniger an. Wenn das Modell Datenzentrums-Hardware braucht, um ein bescheidenes Bild zu erzeugen, bleibt es ein Forschungsartefakt. Wenn es mit nützlicher Geschwindigkeit auf einer High-End-Workstation-Karte läuft, wird es zu einem Werkzeug.
Schauen Sie sich den Videopfad an. Die Veröffentlichung beansprucht einheitlichen Umgang mit Bild und Video, und Video ist der Bereich, in dem das Rechenargument am härtesten zuschlägt, weil die zeitliche Sequenzlänge alles multipliziert. Ein glaubwürdiger kurzer Clip, der im Pixelraum generiert wurde, wäre der stärkste Beleg für den Ansatz.
Erwarten Sie gemischte Ergebnisse. Neue Architekturen sind das meistens, und die ersten öffentlichen Benchmarks erzählen selten die ganze Geschichte. Eine Veröffentlichung wie diese ist wichtig, weil sie die Annahmen des etablierten Designs explizit macht, und diese Annahmen wurden lange genug als geklärt behandelt, dass es nützlich ist, jemanden zu sehen, der sie direkt testet.
Verwandte Artikel
Das Video-Modell-Ranking, das niemand bewirbt: Wohin die Anfragen wirklich gehen
Jede Woche erscheint ein neues Ranking zur Videogenerierung, und fast alle sind nach demselben Muster aufgebaut.
Ai2 hat den Trainings-Stack als Open Source veröffentlicht – nicht nur ein weiteres Set Gewichte
Gewichte sind leicht weiterzugeben und schwer daraus zu lernen.
Alibabas Qwen3.8-Max behauptet, zwei Wochen lang selbstständig programmieren zu können
Parameterzahlen sind schon vor einer Weile keine Neuigkeit mehr. Zwölf Tage ist die Zahl, die es zu untersuchen lohnt.
KI-Rechenzentren warten jetzt auf Stromleitungen, nicht auf Chip-Lieferungen
Die Projekte, die 2027 termingerecht eröffnen, werden diejenigen sein, die den Netzanschluss und die Speicherzuweisung zuerst gelöst haben.