Un unico framework per linguaggio e visione: il modello aperto da 1,6 miliardi di Horizon

Un paper della Huazhong University of Science and Technology, della Beijing Jiaotong University e di Horizon Robotics propone qualcosa che sembra quasi troppo semplice per essere innovativo: un unico modello che tratta linguaggio e immagini come lo stesso tipo di cosa.
Il framework si chiama Multimodal Flow, o MF-1, ed è completamente aperto. La sua versione più grande ha 1,6 miliardi di parametri, addestrata su 150 miliardi di token di pre-addestramento. Su GenEval ottiene 82,8 e su DPG-Bench 75,3, collocando un modello di dimensioni modeste accanto a sistemi multimodali molto più grandi.
L'idea in una frase
La maggior parte dei modelli multimodali è un assemblaggio. Un modello di testo e uno di immagini, oppure una spina dorsale linguistica con componenti di visione separate avvitate sopra, che si scambiano rappresentazioni avanti e indietro tramite token discreti o encoder separati. MF-1 non fa questo. Modella testo e immagini insieme in uno spazio di embedding condiviso e usa il Flow Matching come unico obiettivo generativo e procedura di campionamento per entrambi.

Questa è l'affermazione interessante. Invece di tradurre tra modalità al confine, il modello opera su un'unica rappresentazione continua in cui linguaggio e visione non sono oggetti fondamentalmente diversi. Gli autori sostengono che questo aggiri le debolezze degli approcci discreti e ibridi che dominano la pratica attuale.
Se regge, il guadagno è la generalità. Un unico framework che gestisce modellazione linguistica, comprensione visiva, generazione di immagini, editing e sequenze video è una cosa molto più semplice da addestrare, estendere e ragionare rispetto a una pipeline di specialisti. Indica anche un futuro in cui altre modalità, qualsiasi input che possa essere espresso come un blocco continuo ordinato, si inseriscono nella stessa struttura senza una riprogettazione.
C'è una ragione pratica per volerlo, oltre all'eleganza. Ogni volta che si aggiunge una nuova modalità a un sistema, si introduce una nuova interfaccia da mantenere e un nuovo punto in cui gli errori si accumulano. Concatenare un encoder di visione a un modello linguistico significa che un'immagine deve essere riassunta in token che il modello linguistico comprende, e quel riassunto perde informazioni. Una rappresentazione condivisa salta il passaggio di traduzione, che è dove molta qualità sottile fuoriesce dai sistemi multimodali.
Il nome nei crediti
Un dettaglio nell'elenco degli autori merita una seconda occhiata. Tra gli autori ci sono Yu Kai, fondatore di Horizon Robotics e in precedenza architetto degli sforzi di deep learning di Baidu, e il co-fondatore Huang Chang. L'autore corrispondente è Wang Xinggang del Vision Lab della Huazhong University.
Il nome di Yu su un paper non è routine. Ha pubblicato raramente negli anni successivi al 2016, quando faceva parte di un precedente tentativo di unificare il rilevamento del testo in scene naturali. La sua ricomparsa ora, su un paper che unifica linguaggio e visione, si legge come un ritorno deliberato a un problema su cui ha lavorato un decennio fa, in un momento in cui l'industria ha la potenza di calcolo e i dati per renderlo rilevante.
C'è una frase rivelatrice attribuita a lui da un intervento precedente: che le parole d'ordine, VLA, VLM, end-to-end, world model, sono spesso più significative commercialmente che tecnicamente, e che i team seri stanno in gran parte facendo cose simili. Un paper che collassa diverse di quelle categorie in un unico framework generativo è coerente con quella visione. È un argomento secondo cui le etichette sono meno importanti del meccanismo sottostante.
Perché piccolo e aperto è il punto
Un modello da 1,6 miliardi di parametri che ottiene punteggi competitivi è notevole per la stessa ragione per cui lo sono i piccoli modelli che escono da altri laboratori. La capacità per parametro è la metrica che decide cosa gira in locale, cosa gira su un telefono e cosa un piccolo team può permettersi di mettere a punto.
Anche i 150 miliardi di token di addestramento sono modesti per gli standard di frontiera, il che suggerisce che l'approccio è efficiente anziché basato sulla forza bruta. Se quell'efficienza sopravviva su scala più grande è la domanda aperta. Un piccolo modello che si comporta bene dice qualcosa su un metodo, ma non tutto.
I pesi aperti contano qui per una ragione specifica. Un framework generativo unificato è più utile se altre persone possono estenderlo, testarlo su modalità che gli autori non hanno provato e costruire sulla rappresentazione condivisa. Una versione chiusa sarebbe un paper interessante. Una aperta è uno strumento.
Cosa non coprono i benchmark
GenEval e DPG-Bench misurano con quanta fedeltà un modello trasforma un prompt in un'immagine. Non dicono nulla sul fatto che la rappresentazione unificata migliori la capacità di un modello di ragionare insieme su testo e immagini, che è l'affermazione vera. Un modello potrebbe ottenere buoni punteggi sulla fedeltà delle immagini pur trattando le due modalità come sottosistemi separati che condividono per caso un formato numerico. Gli autori sono consapevoli di questa lacuna, e il vero argomento del paper vive nell'architettura, non nei punteggi. Per chiunque valuti il lavoro, la domanda giusta è se la rappresentazione condivisa cambia il comportamento su compiti che richiedono entrambe le modalità contemporaneamente, ed è esattamente ciò che i benchmark lasciano non misurato.
Le incognite oneste
Unificare le modalità in uno spazio è un'affermazione forte, e le affermazioni forti invitano al vaglio. I punteggi dei benchmark sono reali, ma misurano la fedeltà della generazione di immagini, non se la rappresentazione condivisa aiuti effettivamente il modello a ragionare attraverso le modalità nel modo implicato dall'inquadramento. È possibile ottenere un buon numero su GenEval e avere comunque un modello che tratta testo e immagini come vicini in un embedding piuttosto che come genuinamente lo stesso materiale.
L'altra incognita è la scala. Le rappresentazioni unificate continue sono state storicamente attraenti in teoria e ostinatamente difficili in pratica, perché il segnale di addestramento può essere più difficile da stabilizzare rispetto a un'impostazione discreta. Un successo da 1,6B è incoraggiante e non ancora conclusivo.
Dove punta in seguito
L'estensione ovvia è video e audio, entrambi segnali continui e quindi adatti naturalmente a un framework costruito su rappresentazioni continue. Gli autori vi accennano, inquadrando qualsiasi modalità esprimibile come blocco continuo ordinato come gioco lecito. Se l'approccio regge, il guadagno è un'unica pipeline che un team può estendere a una modalità che gli autori originali non hanno mai toccato. Questa è la promessa dei pesi aperti qui: non un prodotto finito, ma una base che altri possono piegare al proprio problema.
Il quadro più ampio
Ciò che rende questo degno di attenzione è meno il modello che la direzione. Il campo ha passato anni a costruire ponti sempre più elaborati tra sistemi di testo e visione separati. MF-1 è una scommessa che i ponti siano inutili, che la mossa giusta sia smettere di trattare linguaggio e immagini come estranei l'uno all'altro e modellarli su un unico piano.
Se quella scommessa è giusta, la conseguenza pratica è noiosa nel migliore dei modi. Un framework, un obiettivo di addestramento, un set di strumenti, applicati a qualunque modalità ti serva dopo. Se è sbagliata, è comunque un esperimento ben condotto da un team con una lunga storia nell'area, rilasciato in aperto dove può essere verificato.
In ogni caso, la parte interessante è che le persone che hanno osservato questo problema per un decennio hanno scelto ora di attaccarlo di nuovo, e hanno scelto di farlo con un modello aperto e piccolo anziché uno gigantesco. Quella combinazione di solito è un segnale che qualcuno crede che il metodo, non la scala, sia la cosa che è mancata.
Articoli correlati
Agility Digit 5 arriva con un safety case, non solo una scheda tecnica
Il pavimento di un magazzino non è un laboratorio. La certificazione è il passaggio obbligato, non la demo.
Gli agenti di frontiera hanno completato il 30 percento di un flusso di lavoro di ricerca. Questo è il numero.
Gli agenti possono eseguire ricerca. Inventare la procedura è ancora fuori portata.
Figure AI blinda 3,5 miliardi di dollari di potenza di calcolo prima di avere un prodotto da vendere
La scommessa è che la generalizzazione sia un problema di potenza di calcolo. Il settore non ha ancora deciso.
OpenAI introduce finalmente gli sfondi trasparenti nell'API per le immagini
Una piccola funzionalità che elimina un intero passaggio dalla pipeline.