Los nuevos modelos abiertos de China se entrenan para ser sustratos de agentes

Tres lanzamientos de modelos de laboratorios chinos en la última semana comparten un instinto de diseño que es fácil pasar por alto si se leen como una lista de recuentos de parámetros. Ninguno de ellos fue construido para ser bueno en la conversación.
Fueron construidos para ser aquello sobre lo que corre un agente. Ese es un objetivo distinto, y las decisiones de entrenamiento que se derivan de él parecen extrañas si uno asume que la meta es un mejor chatbot.
Entrenar la tarea y el mundo que la rodea
El ejemplo más claro es IQuest-Q1, lanzado por el ZhiZhi Innovation Research Institute el 29 de septiembre. Es un modelo de mezcla de expertos dispersa con 320 mil millones de parámetros totales, 15 mil millones activos y una ventana de contexto de 524.288 tokens. La arquitectura no tiene nada de destacable junto a su método de entrenamiento.
En lugar de ajustar finamente sobre transcripciones de conversaciones humanas o sobre conjuntos de instrucciones estáticos, el equipo sintetizó tareas y los entornos en los que ocurren en conjunto. Luego, el modelo se entrenó a través de varios andamiajes de agentes distintos. Mantuvo intactas las herramientas nativas y la gestión de contexto de cada andamiaje, y trató únicamente los errores del propio modelo como señal de aprendizaje. No se permitió que el arnés se convirtiera en la lección. Después, cuatro modelos especialistas se fusionaron en uno mediante destilación on-policy multi-maestro.
Esto importa por un problema con el que cualquiera que construya agentes se ha topado. Un modelo que obtiene buenos resultados en un benchmark puede desmoronarse cuando se lo envuelve con las propias herramientas, porque aprendió las peculiaridades del arnés de otro. Entrenar a través de distintos andamiajes mientras se mantiene constante el arnés ataca esa falla específica. El resultado reportado es un modelo que queda justo detrás de Claude Opus 5 en tareas de lenguaje natural a repositorio, algo extraño en lo que ser bueno y exactamente lo que necesita un agente de programación.
Ver y decidir en el mismo paso
El segundo lanzamiento toma una ruta distinta hacia la misma meta. El mismo día, el Shanghai AI Laboratory presentó un modelo de decisión llamado Shusheng Mingjue, en tres tamaños: 0,8B, 2B y 4B. Es pequeño a propósito.
El principio de diseño es que la percepción y la decisión no deberían ser etapas separadas. La mayoría de las pilas de agentes toman una captura de pantalla, se la pasan a un modelo de visión, obtienen una descripción, pasan la descripción a un planificador y actúan. Cada salto añade latencia y pierde detalle. Mingjue fusiona la percepción visual nativa con el seguimiento de instrucciones para que el modelo mire una pantalla y tome una decisión en una sola pasada. El laboratorio informa que supera a Jev y a modelos abiertos comparables en calidad de decisión. Para un agente que tiene que actuar dentro de un entorno dinámico, el tamaño es lo importante: un modelo de 4B puede correr cerca del bucle, y uno de 320B no.
Eliminar la capa de atención para alcanzar un millón de tokens
El tercer lanzamiento es el más agresivo en términos de arquitectura. Naive N0.5 Flash, del laboratorio de Pekín NaiveAI, es un modelo de mezcla de expertos de 309 mil millones de parámetros con 15,5 mil millones de parámetros activos, construido sobre MiMo-V2.5 de Xiaomi. Admite de forma nativa un contexto de un millón de tokens y se distribuye bajo la licencia MIT.
La parte interesante es lo que eliminó. El modelo usa un híbrido de atención de ventana deslizante y la atención dispersa de DeepSeek, y no tiene capas de atención completa en absoluto. La atención estándar de los transformers escala cuadráticamente con la longitud de la secuencia, y por eso el contexto largo ha sido históricamente costoso. Eliminar la atención completa es una apuesta a que la información útil en una secuencia larga puede alcanzarse mediante dispersión estructurada, y si eso se sostiene, cambia lo que un agente puede mantener a la vista de una vez. Un millón de tokens es aproximadamente un repositorio grande, o el historial de una larga sesión de trabajo, retenido sin truncamiento.
Los lanzamientos más pequeños apuntan en la misma dirección
El patrón aparece más allá de estos tres. Puro-2B de Tsinghua se entrenó por alrededor de $4.400 y supera en promedio a un modelo Qwen más grande en quince tareas. Un laboratorio de telecomunicaciones lanzó TeleOCR, un modelo de análisis de documentos de 1,2B que encabezó un benchmark de comprensión de documentos. Stanford y NVIDIA lanzaron un verificador contrastivo que elige la mejor acción candidata mediante alineación de embeddings en lugar de razonamiento, y reporta grandes aceleraciones frente a un modelo juez comparable.
Cada uno de ellos es un componente dentro de un agente, no un destino para un usuario. Un verificador que ordena a bajo costo acciones candidatas, un modelo pequeño que analiza documentos, un modelo minúsculo que decide en qué hacer clic. Las piezas se están especializando y volviendo pequeñas, mientras que el único modelo que sostiene el contexto de toda la sesión se vuelve muy grande.
El problema de evaluación que nadie ha resuelto
Hay un agujero que recorre todo esto. Los benchmarks para modelos base de agentes todavía se toman en su mayoría de la evaluación de chatbots, que mide las cosas equivocadas. Un modelo puede obtener una buena puntuación en una prueba de razonamiento y seguir siendo un mal sustrato para un agente, porque las propiedades que importan solo aparecen a lo largo de una sesión: cuántos turnos pasan antes de que el contexto se degrade, si una llamada a herramienta que falla se reintenta de forma sensata, si el modelo nota que ha perdido de vista el objetivo original.
La mayoría de las cifras reportadas aquí provienen de los propios laboratorios, en benchmarks que ellos ayudaron a definir. Que IQuest-Q1 quede “justo detrás de Claude Opus 5” en tareas de lenguaje natural a repositorio es una comparación de proveedor. Que Mingjue “supere a Jev” es una afirmación de proveedor. La ausencia de atención completa en Naive N0.5 Flash es un hecho arquitectónico fácil de verificar y cuyas consecuencias prácticas aún no se han medido a escala. Nada de eso hace que la dirección sea incorrecta. Significa que el estado honesto de la situación es que tenemos tres diseños interesantes y muy poca evidencia independiente sobre cuál resiste cuando un agente corre durante seis horas.
La brecha empieza a ser reconocida. Grupos independientes han estado construyendo benchmarks orientados al servicio en producción en lugar de a la generación de código, y al secuestro de agentes en lugar de a la seguridad de modelos, lo que sugiere que el campo sabe que ha estado midiendo la capa equivocada. Hasta que esos maduren, la señal útil de un lanzamiento como este no es la puntuación. Es el método de entrenamiento, porque un método que aborda un modo de fallo conocido de los agentes tiene más probabilidades de ser real que un número que responde a una tabla de clasificación.
Hay una consecuencia más de este cambio que es fácil pasar por alto. Si los modelos importantes se convierten en componentes pequeños en lugar de grandes destinos, entonces la ventaja de un laboratorio deja de venir de tener el modelo más grande y empieza a venir de saber cómo encajan las piezas. Un equipo que puede entrenar un modelo de decisión rápido, un analizador de documentos barato y un verificador, y conectarlos en un bucle que corre en hardware modesto, tiene algo que un único checkpoint gigante no puede igualar. Esa es una competencia distinta, más cercana a la ingeniería de sistemas que al escalado, y los lanzamientos que llegan este mes sugieren que al menos algunos equipos chinos ya se han reorientado hacia ella.
Durante dos años, la carrera de los pesos abiertos se midió por cuán cerca podía llegar un modelo gratuito a un chatbot de frontera. Ese encuadre está perdiendo fuerza. La calidad de chat se ha convertido en una línea base, y las preguntas que deciden si el software funciona se han trasladado a otro terreno: cuántos turnos pasan antes de que el contexto se degrade, con qué rapidez puede actuar el modelo dentro de un bucle, qué tan bien tolera ser insertado en las herramientas de otro.
Los modelos que responden a esas preguntas no ganarán muchas tablas de clasificación. Ganarán la contienda menos visible de cuál elige un desarrollador cuando el chatbot ya ha hecho su trabajo y el trabajo realmente tiene que ocurrir. Esa contienda se desarrolló en silencio esta semana, en tres lanzamientos que no intentaban impresionar a nadie con conversación.
Artículos relacionados
Un semihumanoide con ruedas completó una hora de lavandería sin ayuda
Las tareas individuales pueden salir bien mientras un flujo de trabajo sigue fallando. Dyna cambió la métrica.
LTX 2.5 quiere renderizar tu tosco borrador de Blender y convertirlo en un plano terminado
No controlas lo que ocurre en el texto a vídeo. Esto intenta solucionarlo.
ServiceNow convierte los fallos de los agentes en datos de entrenamiento
La generación sin verificación es ruido. Los controles son el producto.
Un marco para lenguaje y visión: el modelo abierto de 1.6B de Horizon
Una apuesta a que los puentes entre lenguaje y visión nunca fueron necesarios.