Ein Framework für Sprache und Vision: Horizons offenes 1,6-Milliarden-Modell

Ein Paper der Huazhong University of Science and Technology, der Beijing Jiaotong University und von Horizon Robotics schlägt etwas vor, das fast zu grundlegend klingt, um neu zu sein: ein einziges Modell, das Sprache und Bilder als dieselbe Art von Ding behandelt.
Das Framework heißt Multimodal Flow, oder MF-1, und ist vollständig offen. Seine größte Version hat 1,6 Milliarden Parameter und wurde mit 150 Milliarden Pre-Training-Tokens trainiert. Bei GenEval erreicht es 82,8 und bei DPG-Bench 75,3, womit ein Modell bescheidener Größe neben viel größeren multimodalen Systemen steht.
Die Idee in einem Satz
Die meisten multimodalen Modelle sind Zusammenbauten. Ein Textmodell und ein Bildmodell, oder ein Sprach-Backbone mit separaten, angeschraubten Vision-Komponenten, die Repräsentationen über diskrete Tokens oder separate Encoder hin und her reichen. MF-1 macht das nicht. Es modelliert Text und Bilder gemeinsam in einem geteilten Einbettungsraum und verwendet Flow Matching als einzelnes generatives Ziel und Sampling-Verfahren für beide.

Das ist die interessante Behauptung. Anstatt an einer Grenze zwischen Modalitäten zu übersetzen, arbeitet das Modell auf einer kontinuierlichen Repräsentation, in der Sprache und Vision keine grundsätzlich verschiedenen Objekte sind. Die Autoren argumentieren, dass dies die Schwächen der diskreten und hybriden Ansätze umgeht, die die aktuelle Praxis dominieren.
Wenn es sich bewährt, ist der Gewinn Allgemeinheit. Ein einziges Framework, das Sprachmodellierung, visuelles Verständnis, Bildgenerierung, Bearbeitung und Videosequenzen handhabt, ist viel einfacher zu trainieren, zu erweitern und zu durchdenken als eine Pipeline von Spezialisten. Es deutet auch auf eine Zukunft hin, in der andere Modalitäten – jede Eingabe, die als geordneter kontinuierlicher Block ausgedrückt werden kann – ohne Neugestaltung in dieselbe Struktur passen.
Es gibt einen praktischen Grund, dies jenseits von Eleganz zu wollen. Jedes Mal, wenn man eine neue Modalität an ein System anschraubt, führt man eine neue Schnittstelle ein, die gewartet werden muss, und einen neuen Ort, an dem sich Fehler ansammeln können. Einen Vision-Encoder an ein Sprachmodell zu ketten, bedeutet, dass ein Bild in Tokens zusammengefasst werden muss, die das Sprachmodell versteht, und diese Zusammenfassung verliert Informationen. Eine geteilte Repräsentation überspringt den Übersetzungsschritt, und genau dort entweicht viel subtile Qualität aus multimodalen Systemen.
Der Name in den Credits
Ein Detail in der Autorenliste ist einen zweiten Blick wert. Unter den Autoren sind Yu Kai, der Gründer von Horizon Robotics und früher Architekt von Baidus Deep-Learning-Bemühungen, und Mitgründer Huang Chang. Der korrespondierende Autor ist Wang Xinggang vom Vision Lab der Huazhong University.
Yus Name auf einem Paper ist nicht Routine. Er hat in den Jahren seit 2016 selten publiziert, als er Teil eines früheren Versuchs war, die Texterkennung in natürlichen Szenen zu vereinheitlichen. Sein Wiederauftauchen jetzt, auf einem Paper über die Vereinheitlichung von Sprache und Vision, liest sich als bewusste Rückkehr zu einem Problem, an dem er vor einem Jahrzehnt gearbeitet hat, in einem Moment, in dem die Branche die Rechenleistung und die Daten hat, um es relevant zu machen.
Es gibt einen bezeichnenden Satz, der ihm aus einem früheren Vortrag zugeschrieben wird: dass die Buzzwords VLA, VLM, End-to-End, World Model oft kommerziell bedeutsamer sind als technisch, und dass ernsthafte Teams im Wesentlichen ähnliche Dinge tun. Ein Paper, das mehrere dieser Kategorien in einem einzigen generativen Framework zusammenfallen lässt, ist konsistent mit dieser Sichtweise. Es ist ein Argument dafür, dass die Labels weniger wichtig sind als der zugrunde liegende Mechanismus.
Warum klein und offen der Punkt ist
Ein Modell mit 1,6 Milliarden Parametern, das konkurrenzfähig abschneidet, ist aus demselben Grund bemerkenswert wie die kleinen Modelle, die aus anderen Labors kommen. Fähigkeit pro Parameter ist die Metrik, die entscheidet, was lokal läuft, was auf einem Telefon läuft und was sich ein kleines Team leisten kann, feinabzustimmen.
Die 150 Milliarden Trainings-Tokens sind nach Frontier-Maßstäben ebenfalls bescheiden, was darauf hindeutet, dass der Ansatz effizient und nicht mit roher Gewalt erzwungen ist. Ob diese Effizienz in größerem Maßstab überlebt, ist die offene Frage. Ein kleines Modell, das sich gut verhält, sagt etwas über eine Methode aus, aber nicht alles.
Offene Gewichte sind hier aus einem bestimmten Grund wichtig. Ein einheitliches generatives Framework ist am nützlichsten, wenn andere es erweitern, es auf Modalitäten testen können, die die Autoren nicht ausprobiert haben, und auf der geteilten Repräsentation aufbauen können. Eine geschlossene Version wäre ein interessantes Paper. Eine offene ist ein Werkzeug.
Was die Benchmarks nicht abdecken
GenEval und DPG-Bench messen, wie getreu ein Modell einen Prompt in ein Bild umsetzt. Sie sagen nichts darüber aus, ob die vereinheitlichte Repräsentation die Fähigkeit eines Modells verbessert, gemeinsam über Text und Bilder zu schlussfolgern, was die eigentliche Behauptung ist. Ein Modell könnte bei der Bildtreue gut abschneiden und dennoch die beiden Modalitäten als getrennte Subsysteme behandeln, die zufällig ein Zahlenformat teilen. Die Autoren sind sich dieser Lücke bewusst, und das eigentliche Argument des Papers liegt in der Architektur, nicht in den Scores. Für jeden, der die Arbeit bewertet, ist die richtige Frage, ob die geteilte Repräsentation das Verhalten bei Aufgaben ändert, die beide Modalitäten gleichzeitig erfordern, und genau das lassen die Benchmarks ungemessen.
Die ehrlichen Unbekannten
Modalitäten in einem Raum zu vereinheitlichen, ist eine starke Behauptung, und starke Behauptungen laden zur Prüfung ein. Die Benchmark-Scores sind real, aber sie messen die Bildgenerierungstreue, nicht ob die geteilte Repräsentation dem Modell tatsächlich hilft, modalitätsübergreifend so zu schlussfolgern, wie es die Rahmung impliziert. Es ist möglich, eine gute GenEval-Zahl zu erzielen und dennoch ein Modell zu haben, das Text und Bilder als Nachbarn in einer Einbettung behandelt und nicht als wirklich dasselbe Material.
Das andere Unbekannte ist der Maßstab. Kontinuierliche vereinheitlichte Repräsentationen waren historisch in der Theorie attraktiv und in der Praxis hartnäckig, weil das Trainingssignal schwieriger zu stabilisieren sein kann als in einem diskreten Aufbau. Ein 1,6B-Erfolg ist ermutigend und noch nicht abschließend.
Wohin es als Nächstes zeigt
Die offensichtliche Erweiterung sind Video und Audio, die beide kontinuierliche Signale sind und daher natürliche Kandidaten für ein Framework, das auf kontinuierlichen Repräsentationen aufbaut. Die Autoren deuten dies an und erklären jede Modalität, die als geordneter kontinuierlicher Block ausdrückbar ist, für machbar. Wenn der Ansatz Bestand hat, ist der Gewinn eine einzige Pipeline, die ein Team auf eine Modalität erweitern kann, die die ursprünglichen Autoren nie berührt haben. Das ist das Versprechen offener Gewichte hier: kein fertiges Produkt, sondern ein Fundament, das andere an ihr eigenes Problem anpassen können.
Das größere Bild
Was dies beobachtenswert macht, ist weniger das Modell als die Richtung. Das Feld hat Jahre damit verbracht, zunehmend aufwendige Brücken zwischen getrennten Text- und Vision-Systemen zu bauen. MF-1 ist eine Wette darauf, dass die Brücken unnötig sind, dass der richtige Schritt ist, Sprache und Bilder nicht länger als einander fremd zu behandeln und sie auf eine gemeinsame Grundlage zu stellen.
Wenn diese Wette richtig ist, ist die praktische Konsequenz auf die bestmögliche Weise langweilig. Ein Framework, ein Trainingsziel, ein Satz Werkzeuge, angewendet auf welche Modalität auch immer Sie als Nächstes brauchen. Wenn sie falsch ist, ist es immer noch ein gut durchgeführtes Experiment von einem Team mit langer Geschichte in diesem Bereich, offen veröffentlicht, wo es überprüft werden kann.
So oder so, der interessante Teil ist, dass die Leute, die dieses Problem ein Jahrzehnt lang beobachtet haben, sich entschieden haben, es jetzt erneut anzugehen, und sich entschieden haben, es mit einem offenen, kleinen Modell statt mit einem riesigen zu tun. Diese Kombination ist normalerweise ein Signal dafür, dass jemand glaubt, die Methode und nicht der Maßstab sei das, was gefehlt hat.
Verwandte Artikel
Ein Halbhumanoid auf Rädern erledigte eine Stunde Wäsche ohne Hilfe
Einzelne Aufgaben können erfolgreich sein, während ein Workflow trotzdem scheitert. Dyna hat die Kennzahl geändert.
LTX 2.5 will deinen blockigen Blender-Entwurf in eine fertige Einstellung verwandeln
Du hast keine Kontrolle darüber, was im Text-zu-Video passiert. Das hier versucht, das zu beheben.
ServiceNow macht aus Agenten-Fehlern Trainingsdaten
Generierung ohne Verifikation ist Rauschen. Die Gates sind das Produkt.
Eine photonische Speicherwand ist die 88-Millionen-Dollar-Wette, die Volantis gerade eingegangen ist
Der Kompromiss, mit dem alle zu leben gelernt haben, ist genau das, was es zu beseitigen versucht.