Xiaomi lanzó un modelo omnimodal que iguala a la frontera, además de la receta de entrenamiento

Una empresa de teléfonos lanzó un modelo de IA el 22 de septiembre y el número destacado fue 46. Esa es la puntuación de Xiaomi para MiMo-V2.6 Pro en el Índice de Inteligencia de Artificial Analysis, que según la compañía es la más alta registrada por un modelo de código abierto en el momento de su lanzamiento.
MiMo-V2.6 llega en dos versiones. Pro es la grande, Flash es la rápida. Xiaomi afirma que Pro rinde a la par de Claude Opus 5 y GPT-5.6 Sol en la mayoría de los benchmarks de agentes, y señala mejoras en programación, uso de computadoras, razonamiento 3D y tareas creativas. Los modelos son omnimodales, lo que significa que aceptan texto, imágenes y otras entradas a través de un único conjunto de pesos, y se entrenaron con aprendizaje por refuerzo a escala, que es la parte que explica tanto las capacidades como el formato de lanzamiento.
Qué incluía realmente la descarga
La mayoría de los lanzamientos de pesos abiertos entregan los pesos y se detienen ahí. MiMo-V2.6 incluye los pesos, un informe técnico, los entornos de aprendizaje por refuerzo y el código de entrenamiento. Xiaomi publicó los cuatro en su propio sitio en lugar de dirigir a los desarrolladores a un hub de modelos con una página de licencia y una lista de espera.
La inclusión de entornos de RL es la diferencia significativa. Los pesos te permiten ejecutar un modelo. Los entornos te permiten reentrenarlo. Cuando un laboratorio publica los entornos con los que entrenó, te está diciendo cómo obtuvo el comportamiento, y no solo cuál es el comportamiento. Para cualquiera que quiera reproducir el resultado, o ajustar el modelo con su propia señal de recompensa, los entornos son el artefacto real.
También eleva el costo del lanzamiento para la empresa que lo hizo. Publicar los entornos expone la forma de la señal de entrenamiento, que se parece más a una receta que a un checkpoint. Un competidor puede leerla y ahorrarse un año de prueba y error. Xiaomi parece haber decidido que los beneficios en reclutamiento y credibilidad superan ese costo.
Por qué una empresa de dispositivos hace investigación de frontera
Xiaomi no es un laboratorio de investigación que resulta que vende teléfonos. Es al revés, y esa orientación se nota en para qué sirve un modelo omnimodal.
Un teléfono es el hogar natural para un asistente que puede leer una pantalla, entender una fotografía, operar una interfaz y responder en una conversación hablada. El uso de computadoras, el razonamiento 3D y la generación creativa no son benchmarks abstractos desde ese punto de vista. Son los componentes de un sistema que tiene que ejecutarse en un dispositivo que alguien sostiene en la mano, a menudo con una conexión lenta y una batería que proteger. Una familia de modelos dividida en un nivel Pro para la capacidad y un nivel Flash para la latencia es una decisión de hoja de ruta de dispositivos tanto como de investigación.
Publicar los pesos cumple dos propósitos. Atrae a investigadores que mejorarán el modelo en público, y pone un piso a la posición de la empresa en un mercado donde, de lo contrario, las afirmaciones de capacidad se aceptan por confianza. Un modelo que puedes descargar y evaluar tú mismo necesita menos marketing, y Xiaomi compite por la atención de los desarrolladores contra laboratorios cuya reputación entera se basa en resultados publicados.
Qué significa omnimodal en la práctica
La etiqueta cubre una afirmación de ingeniería concreta: un solo modelo maneja varios tipos de entrada mediante una representación compartida, en lugar de enrutar cada tipo de entrada a un especialista separado. Para un teléfono, eso importa porque la alternativa es ejecutar varios modelos y unir sus salidas, y tanto la memoria como la latencia son escasas en un móvil. El nivel Flash de Xiaomi existe por la misma razón. Un modelo que responde en un segundo en un buque insignia puede ser inutilizable en un dispositivo de gama media o en un coche, así que la familia es en realidad dos puntos en una curva de capacidad y latencia, y no un único lanzamiento.

El método de entrenamiento explica el resto. El aprendizaje por refuerzo a escala significa que el modelo se optimiza contra una señal de recompensa y no solo se entrena para predecir el siguiente token, y es el enfoque detrás del reciente salto en el rendimiento agéntico en toda la industria. También es la razón por la que los entornos importan tanto como los pesos. Una señal de recompensa es tan buena como el entorno que la produce, así que publicar el entorno se parece más a publicar un método que a publicar un resultado.
El dispositivo es el canal de distribución
La ventaja de Xiaomi es que no necesita un ecosistema de desarrolladores para llegar a los usuarios. Envía hardware a decenas de millones de personas, y un modelo que se ejecuta dentro del asistente de un teléfono llega a más gente en un trimestre de la que llega un hub de modelos en un año. Por eso el formato de lanzamiento es generoso. Los pesos y la receta le cuestan relativamente poco a la empresa en ingresos de licencias perdidos, y le compran credibilidad ante la comunidad investigadora, que de otro modo juzgaría el modelo a partir de una captura de pantalla de un benchmark.
El riesgo es el mismo que la ventaja. A un asistente de teléfono se le juzga por si funciona siempre, y un agente que falla en una de cada veinte tareas es una molestia en una ventana de chat y un riesgo dentro de un dispositivo que también gestiona pagos, fotografías y mensajes. Los benchmarks de capacidad no miden esa brecha, y una puntuación compuesta de 46 tampoco.
El mismo martes, otros tres lanzamientos
El momento es instructivo. El 22 de septiembre, el modelo de Xiaomi apareció junto al Qwen-Image-2.1 de Alibaba, cuyos pesos Alibaba abrió el 20 de septiembre y presentó en su conferencia Yunqi ese mismo día, y a la vista previa de Hy Image 3.5 de Tencent, un modelo de imagen profesional con un precio de 0,15 yuanes por imagen 2K en la API de Tencent Cloud. Unitree usó la misma ventana para anunciar Dex5-S, una mano robótica diestra con 22 grados de libertad desde 6.500 dólares.
Alibaba también aprovechó la conferencia para reclamar el primer puesto en la tabla de líderes agéntica de Artificial Analysis con Qwen3.8-Max y el primero en CodeArena en programación de frontend, y para decir que Qwen4 está en entrenamiento con modelos sucesores planeados de cinco a diez billones de parámetros. Su responsable de Qwen-Image señaló que el objetivo del equipo es reducir el costo de completar una tarea en lugar de maximizar el número de parámetros, que es el mismo equilibrio que hace la estructura de dos niveles de MiMo.
Ninguno de esos anuncios estuvo coordinado y todos apuntaban en la misma dirección. La pregunta competitiva en la IA china este otoño no es si existe un modelo de clase frontera. Es cuánto de uno se te permite tener en tus manos.
La advertencia sobre los benchmarks
Un número como 46 depende enteramente del índice que hay detrás, y el Índice de Inteligencia de Artificial Analysis es un compuesto entre varios. La comparación con Claude Opus 5 y GPT-5.6 Sol la hace Xiaomi, con la selección de benchmarks de Xiaomi, y la frase «la mayoría de los benchmarks de agentes» hace un trabajo que una tabla de resultados haría mejor. Los benchmarks de agentes en particular son sensibles al andamiaje: el mismo modelo puede obtener puntuaciones muy distintas según lo que lo rodee.
Lo que hace que la afirmación sea más que marketing es la descarga. Cualquiera que dude del 46 puede ejecutar el modelo, leer el informe y reentrenarlo en los entornos que Xiaomi publicó. Es una prueba más dura que una captura de pantalla de una tabla de líderes, y solo está disponible porque la empresa decidió publicar la receta junto con el resultado.
Artículos relacionados
Huawei Cloud reconstruyó su stack en torno a los agentes y después puso fecha a las facturas
La capacidad de los modelos ha convergido y el valor se ha desplazado a lo que los rodea.
Cadence introduce agentes en el diseño de chips y reduce un ciclo de verificación de cinco semanas a un día
Por lo tanto, los agentes llaman a más motores subyacentes, no a menos.
Roblox Build publicó 9.000 juegos en seis semanas. El número interesante es 71
Léelo como una cifra de captación más que como una cifra de calidad.
Dos agentes entraron en producción en septiembre. Esto es lo que tenían en común
Los agentes que sobrevivieron al contacto con la producción en septiembre fueron los que encajaron en un proceso existente.