← Volver al blog
Aiaprox. 7 min de lectura

Un marco para lenguaje y visión: el modelo abierto de 1.6B de Horizon

Publicado 4 oct 2026
Un marco para lenguaje y visión: el modelo abierto de 1.6B de Horizon

Un artículo de la Universidad Huazhong de Ciencia y Tecnología, la Universidad Jiaotong de Pekín y Horizon Robotics propone algo que suena casi demasiado básico para ser novedoso: un único modelo que trata el lenguaje y las imágenes como el mismo tipo de cosa.

El marco se llama Multimodal Flow, o MF-1, y es totalmente abierto. Su versión más grande tiene 1.6 mil millones de parámetros, entrenada con 150 mil millones de tokens de preentrenamiento. En GenEval obtiene 82.8 y en DPG-Bench 75.3, lo que sitúa a un modelo de tamaño modesto junto a sistemas multimodales mucho más grandes.

La idea en una frase

La mayoría de los modelos multimodales son ensamblajes. Un modelo de texto y un modelo de imagen, o una columna vertebral de lenguaje con componentes de visión separados añadidos, pasando representaciones de ida y vuelta a través de tokens discretos o codificadores separados. MF-1 no hace eso. Modela texto e imágenes juntos en un espacio de embedding compartido, y utiliza Flow Matching como un único objetivo generativo y procedimiento de muestreo para ambos.

Una única cinta de vidrio transparente curvada a través de la oscuridad, iluminada con tonos cálidos y fríos

Esa es la afirmación interesante. En lugar de traducir entre modalidades en una frontera, el modelo opera sobre una representación continua donde lenguaje y visión no son objetos fundamentalmente diferentes. Los autores sostienen que esto evita las debilidades de los enfoques discretos e híbridos que dominan la práctica actual.

Si se mantiene, el beneficio es la generalidad. Un único marco que maneja modelado de lenguaje, comprensión visual, generación de imágenes, edición y secuencias de video es algo mucho más simple de entrenar, extender y razonar que una pipeline de especialistas. También apunta a un futuro donde otras modalidades, cualquier entrada que pueda expresarse como un bloque continuo ordenado, encajan en la misma estructura sin un rediseño.

Hay una razón práctica para querer esto más allá de la elegancia. Cada vez que añades una nueva modalidad a un sistema, introduces una nueva interfaz que mantener y un nuevo lugar donde los errores se acumulan. Encadenar un codificador de visión a un modelo de lenguaje significa que una imagen tiene que ser resumida en tokens que el modelo de lenguaje entiende, y ese resumen pierde información. Una representación compartida omite el paso de traducción, que es donde mucha calidad sutil se filtra de los sistemas multimodales.

El nombre en los créditos

Un detalle en la lista de autores merece una segunda mirada. Entre los autores están Yu Kai, fundador de Horizon Robotics y anteriormente arquitecto de los esfuerzos de aprendizaje profundo de Baidu, y el cofundador Huang Chang. El autor correspondiente es Wang Xinggang del Laboratorio de Visión de la Universidad Huazhong.

El nombre de Yu en un artículo no es rutinario. Ha publicado raramente en los años desde 2016, cuando fue parte de un intento anterior de unificar la detección de texto en escenas naturales. Su reaparición ahora, en un artículo sobre unificar lenguaje y visión, se lee como un retorno deliberado a un problema en el que trabajó hace una década, en un momento en que la industria tiene el cómputo y los datos para hacerlo relevante.

Hay una frase reveladora atribuida a él de una charla anterior: que las palabras de moda, VLA, VLM, end-to-end, modelo del mundo, a menudo son más significativas comercialmente que técnicamente, y que los equipos serios están haciendo en gran medida cosas similares. Un artículo que colapsa varias de esas categorías en un único marco generativo es consistente con esa visión. Es un argumento de que las etiquetas importan menos que el mecanismo subyacente.

Por qué lo pequeño y abierto es el punto

Un modelo de 1.6 mil millones de parámetros que obtiene puntuaciones competitivas es notable por la misma razón que los modelos pequeños que salen de otros laboratorios son notables. La capacidad por parámetro es la métrica que decide qué se ejecuta localmente, qué se ejecuta en un teléfono y qué puede permitirse ajustar un equipo pequeño.

Los 150 mil millones de tokens de entrenamiento también son modestos para los estándares de frontera, lo que sugiere que el enfoque es eficiente en lugar de fuerza bruta. Si esa eficiencia sobrevive a mayor escala es la pregunta abierta. Un modelo pequeño que se comporta bien dice algo sobre un método, pero no todo.

Los pesos abiertos importan aquí por una razón específica. Un marco generativo unificado es más útil si otras personas pueden extenderlo, probarlo en modalidades que los autores no probaron y construir sobre la representación compartida. Una versión cerrada sería un artículo interesante. Una abierta es una herramienta.

Qué no cubren los benchmarks

GenEval y DPG-Bench miden con qué fidelidad un modelo convierte un prompt en una imagen. No dicen nada sobre si la representación unificada mejora la capacidad de un modelo para razonar sobre texto e imágenes juntos, que es la afirmación real. Un modelo podría obtener una buena puntuación en fidelidad de imagen mientras trata las dos modalidades como subsistemas separados que casualmente comparten un formato numérico. Los autores son conscientes de esta brecha, y el argumento real del artículo vive en la arquitectura, no en las puntuaciones. Para cualquiera que evalúe el trabajo, la pregunta correcta es si la representación compartida cambia el comportamiento en tareas que requieren ambas modalidades a la vez, y eso es exactamente lo que los benchmarks dejan sin medir.

Las incógnitas honestas

Unificar modalidades en un espacio es una afirmación fuerte, y las afirmaciones fuertes invitan al escrutinio. Las puntuaciones de los benchmarks son reales, pero miden la fidelidad de generación de imágenes, no si la representación compartida realmente ayuda al modelo a razonar entre modalidades como implica el encuadre. Es posible obtener un buen número en GenEval y aún tener un modelo que trata texto e imágenes como vecinos en un embedding en lugar de como genuinamente el mismo material.

La otra incógnita es la escala. Las representaciones continuas unificadas han sido históricamente atractivas en teoría y obstinadas en la práctica, porque la señal de entrenamiento puede ser más difícil de estabilizar que en una configuración discreta. Un éxito de 1.6B es alentador y aún no concluyente.

Hacia dónde apunta a continuación

La extensión obvia es video y audio, ambos son señales continuas y por lo tanto encajes naturales para un marco construido sobre representaciones continuas. Los autores insinúan esto, enmarcando cualquier modalidad expresable como un bloque continuo ordenado como un juego limpio. Si el enfoque se mantiene, el beneficio es una única pipeline que un equipo puede extender a una modalidad que los autores originales nunca tocaron. Esa es la promesa de los pesos abiertos aquí: no un producto terminado, sino una base que otros pueden doblar a su propio problema.

El panorama general

Lo que hace que esto valga la pena observar es menos el modelo que la dirección. El campo ha pasado años construyendo puentes cada vez más elaborados entre sistemas separados de texto y visión. MF-1 es una apuesta a que los puentes son innecesarios, que el movimiento correcto es dejar de tratar el lenguaje y las imágenes como ajenos entre sí y modelarlos sobre una misma base.

Si esa apuesta es correcta, la consecuencia práctica es aburrida de la mejor manera. Un marco, un objetivo de entrenamiento, un conjunto de herramientas, aplicado a cualquier modalidad que necesites a continuación. Si es incorrecta, sigue siendo un experimento bien ejecutado de un equipo con una larga historia en el área, publicado en abierto donde puede ser verificado.

De cualquier manera, la parte interesante es que las personas que han observado este problema durante una década eligieron ahora atacarlo de nuevo, y eligieron hacerlo con un modelo abierto y pequeño en lugar de uno gigante. Esa combinación suele ser una señal de que alguien cree que el método, no la escala, es lo que ha estado faltando.

Artículos relacionados