Um único framework para linguagem e visão: o modelo aberto de 1,6 bilhão da Horizon

Um artigo da Universidade de Ciência e Tecnologia de Huazhong, da Universidade Jiaotong de Pequim e da Horizon Robotics propõe algo que soa quase básico demais para ser inovador: um único modelo que trata linguagem e imagens como o mesmo tipo de coisa.
O framework é chamado de Multimodal Flow, ou MF-1, e é totalmente aberto. Sua maior versão tem 1,6 bilhão de parâmetros, treinada em 150 bilhões de tokens de pré-treinamento. No GenEval, ele pontua 82,8 e, no DPG-Bench, 75,3, colocando um modelo de tamanho modesto lado a lado com sistemas multimodais muito maiores.
A ideia em uma frase
A maioria dos modelos multimodais são montagens. Um modelo de texto e um modelo de imagem, ou um backbone de linguagem com componentes de visão separados acoplados, passando representações de um lado para o outro por meio de tokens discretos ou codificadores separados. O MF-1 não faz isso. Ele modela texto e imagens juntos em um espaço de embedding compartilhado e usa o Flow Matching como um único objetivo generativo e procedimento de amostragem para ambos.

Essa é a afirmação interessante. Em vez de traduzir entre modalidades em uma fronteira, o modelo opera sobre uma representação contínua única, na qual linguagem e visão não são objetos fundamentalmente diferentes. Os autores argumentam que isso contorna as fraquezas das abordagens discretas e híbridas que dominam a prática atual.
Se isso se sustentar, o retorno é a generalidade. Um único framework que lida com modelagem de linguagem, compreensão visual, geração de imagens, edição e sequências de vídeo é algo muito mais simples de treinar, estender e raciocinar do que um pipeline de especialistas. Ele também aponta para um futuro em que outras modalidades, qualquer entrada que possa ser expressa como um bloco contínuo ordenado, se encaixam na mesma estrutura sem uma reformulação.
Há uma razão prática para querer isso além da elegância. Toda vez que você acopla uma nova modalidade a um sistema, você introduz uma nova interface para manter e um novo lugar para os erros se acumularem. Encadear um codificador de visão a um modelo de linguagem significa que uma imagem precisa ser resumida em tokens que o modelo de linguagem entende, e essa sumarização perde informações. Uma representação compartilhada pula a etapa de tradução, que é onde muita qualidade sutil escapa dos sistemas multimodais.
O nome nos créditos
Um detalhe na lista de autores merece uma segunda olhada. Entre os autores estão Yu Kai, fundador da Horizon Robotics e anteriormente arquiteto dos esforços de aprendizado profundo da Baidu, e o cofundador Huang Chang. O autor correspondente é Wang Xinggang, do Vision Lab da Universidade de Huazhong.
O nome de Yu em um artigo não é algo rotineiro. Ele publicou raramente nos anos desde 2016, quando fez parte de uma tentativa anterior de unificar a detecção de texto em cenas naturais. Seu reaparecimento agora, em um artigo sobre unificar linguagem e visão, soa como um retorno deliberado a um problema no qual trabalhou uma década atrás, em um momento em que a indústria tem o poder computacional e os dados para torná-lo relevante.
Há uma frase reveladora atribuída a ele em uma palestra anterior: que os jargões, VLA, VLM, ponta a ponta, modelo de mundo, muitas vezes são mais significativos comercialmente do que tecnicamente, e que equipes sérias estão, em grande parte, fazendo coisas semelhantes. Um artigo que colapsa várias dessas categorias em um único framework generativo é consistente com essa visão. É um argumento de que os rótulos são menos importantes do que o mecanismo subjacente.
Por que pequeno e aberto é o ponto
Um modelo de 1,6 bilhão de parâmetros que pontua de forma competitiva é notável pela mesma razão que os modelos pequenos vindos de outros laboratórios são notáveis. Capacidade por parâmetro é a métrica que decide o que roda localmente, o que roda em um telefone e o que uma equipe pequena pode se dar ao luxo de ajustar finamente.
Os 150 bilhões de tokens de treinamento também são modestos para os padrões de fronteira, o que sugere que a abordagem é eficiente em vez de força bruta. Se essa eficiência sobrevive em escala maior é a questão em aberto. Um modelo pequeno que se comporta bem diz algo sobre um método, mas não tudo.
Pesos abertos importam aqui por uma razão específica. Um framework generativo unificado é mais útil se outras pessoas puderem estendê-lo, testá-lo em modalidades que os autores não tentaram e construir sobre a representação compartilhada. Uma versão fechada seria um artigo interessante. Uma aberta é uma ferramenta.
O que os benchmarks não cobrem
GenEval e DPG-Bench medem quão fielmente um modelo transforma um prompt em uma imagem. Eles não dizem nada sobre se a representação unificada melhora a capacidade de um modelo de raciocinar sobre texto e imagens em conjunto, que é a afirmação real. Um modelo pode pontuar bem em fidelidade de imagem enquanto trata as duas modalidades como subsistemas separados que por acaso compartilham um formato numérico. Os autores estão cientes dessa lacuna, e o argumento real do artigo está na arquitetura, não nas pontuações. Para qualquer pessoa avaliando o trabalho, a pergunta certa é se a representação compartilhada muda o comportamento em tarefas que exigem ambas as modalidades ao mesmo tempo, e é exatamente isso que os benchmarks deixam sem medir.
As incógnitas honestas
Unificar modalidades em um único espaço é uma afirmação forte, e afirmações fortes convidam ao escrutínio. As pontuações dos benchmarks são reais, mas medem a fidelidade da geração de imagens, não se a representação compartilhada realmente ajuda o modelo a raciocinar entre modalidades como o enquadramento implica. É possível obter um bom número no GenEval e ainda ter um modelo que trata texto e imagens como vizinhos em um embedding, em vez de como genuinamente o mesmo material.
A outra incógnita é a escala. Representações unificadas contínuas têm sido historicamente atraentes na teoria e resistentes na prática, porque o sinal de treinamento pode ser mais difícil de estabilizar do que em uma configuração discreta. Um sucesso de 1,6 bi é encorajador e ainda não conclusivo.
Para onde aponta em seguida
A extensão óbvia é vídeo e áudio, ambos sinais contínuos e, portanto, encaixes naturais para um framework construído sobre representações contínuas. Os autores fazem alusão a isso, enquadrando qualquer modalidade expressável como um bloco contínuo ordenado como alvo legítimo. Se a abordagem se sustentar, o retorno é um único pipeline que uma equipe pode estender a uma modalidade que os autores originais nunca tocaram. Essa é a promessa dos pesos abertos aqui: não um produto acabado, mas uma base que outros podem moldar ao seu próprio problema.
O quadro mais amplo
O que torna isso digno de atenção é menos o modelo do que a direção. O campo passou anos construindo pontes cada vez mais elaboradas entre sistemas separados de texto e visão. O MF-1 é uma aposta de que as pontes são desnecessárias, de que o movimento certo é parar de tratar linguagem e imagens como estranhas entre si e modelá-las em uma mesma base.
Se essa aposta estiver certa, a consequência prática é entediante da melhor maneira possível. Um framework, um objetivo de treinamento, um conjunto de ferramentas, aplicados à modalidade que você precisar em seguida. Se estiver errada, ainda assim é um experimento bem conduzido de uma equipe com longa história na área, lançado em aberto onde pode ser verificado.
De qualquer forma, a parte interessante é que as pessoas que observaram esse problema por uma década escolheram agora atacá-lo novamente, e escolheram fazê-lo com um modelo aberto e pequeno, em vez de um gigante. Essa combinação geralmente é um sinal de que alguém acredita que o método, não a escala, é a coisa que estava faltando.
Artigos relacionados
Um semihumanoide sobre rodas concluiu uma hora de lavanderia sem ajuda
Tarefas individuais podem ter sucesso enquanto um fluxo de trabalho ainda falha. A Dyna mudou a métrica.
O LTX 2.5 quer renderizar seu esboço em blocos do Blender como uma tomada finalizada
Você não controla o que acontece em texto para vídeo. Isto tenta corrigir isso.
ServiceNow transforma falhas de agentes em dados de treinamento
Geração sem verificação é ruído. Os portões são o produto.
Uma parede de memória fotônica é a aposta de US$ 88 milhões que a Volantis acaba de fazer
O trade-off com que todo mundo aprendeu a conviver é justamente o que ela tenta eliminar.