Step 5 se saltó cuatro números de versión, quedó segundo entre los modelos abiertos y nadie lo está llamando

A finales de septiembre de 2026, el laboratorio chino StepFun publicó Step 5 Preview. El número de versión no es un error tipográfico. El modelo anterior de la línea era Step 3.7 Flash, y la empresa se saltó toda la serie 4 para llegar hasta aquí. El lanzamiento de código abierto está previsto para el 15 de octubre, y el modelo ya es accesible a través de los productos y la API de StepFun.
La especificación apunta a un único trabajo. Step 5 Preview usa 600 mil millones de parámetros totales con 27 mil millones activos, admite un contexto de un millón de tokens y acepta de forma nativa tanto texto como imágenes. StepFun lo posiciona para programación, ingeniería de software y tareas de agente de largo horizonte, más que para chat general.
En el Artificial Analysis Intelligence Index obtiene 44. Eso lo coloca al nivel de Kimi K3 y Grok 4.6, un punto por detrás de GLM-5.3, y empatado en segundo lugar entre los modelos de código abierto a nivel global. Tres meses antes, Step 3.7 Flash se situaba en torno a 19 en el mismo índice.

El salto es la parte fácil de explicar
Un ascenso de 25 puntos en un solo lanzamiento suena increíble hasta que se mira lo que cambió por debajo. Step 3.7 Flash era un modelo pequeño y rápido, creado para trabajo de visión. Era bueno leyendo capturas de pantalla y fotogramas de vídeo y, según los desarrolladores que lo integraron en herramientas de programación, no era lo bastante potente como para delegarle el trabajo complicado. Step 5 Preview es una clase distinta de modelo, con un presupuesto de activación unas tres veces mayor, una ventana de contexto dimensionada para bases de código completas y un entrenamiento dirigido explícitamente al comportamiento agéntico.
Los laboratorios chinos han estado aplicando este manual a lo largo de 2026. Lanzar un modelo pequeño y rápido, aprender qué falla y luego gastar el cómputo en un intento de frontera. Lo inusual aquí es la aritmética pública de versiones, y la aritmética juega a favor de StepFun. Nadie que haya usado Step 3.7 Flash lo confundirá con Step 5 Preview, y la brecha entre ambos hace legible la mejora sin necesidad de un gráfico de benchmarks.
Las primeras pruebas independientes respaldan la afirmación con una observación mundana. Un desarrollador que conectó el modelo a un agente de programación informó de que la salida era estable y que el código de ingeniería volvía necesitando menos ciclos de retrabajo. Ese es el tipo de elogio que importa para un modelo de programación, y es lo bastante poco glamuroso como para ser creíble.
La cifra de adopción es la verdadera historia
Aquí es donde el lanzamiento se vuelve interesante. OpenRouter publica un ranking semanal de volumen de llamadas a modelos, y Step 5 Preview no aparece en el top ten. Tiene la posición en los benchmarks, la ventana de contexto y la licencia abierta, y no se está llamando a volumen en el enrutador multimodelo más concurrido.
Esa brecha merece un momento de reflexión, porque describe un patrón en los lanzamientos chinos de pesos abiertos, más que un fracaso específico de este modelo. La posición en los benchmarks es una señal que usan los productores para juzgar un modelo. El volumen de llamadas es una señal que producen los consumidores al usarlo. Las dos han estado divergiendo todo el año.
Parte de la explicación es estructural. El volumen de OpenRouter está dominado por desarrolladores de mercados donde alojar un modelo chino conlleva cuestiones de compras o de cumplimiento normativo, y por cargas de trabajo que ya están integradas con lo que sea que el equipo eligió primero. Los costes de cambio son reales incluso cuando el modelo es gratuito, porque el trabajo de integración no lo es. Un modelo puede ser mejor y aun así perder, si el coste de cambio supera la ganancia percibida.
Parte es distribución. StepFun no es Google ni Meta, y no tiene un canal que canalice a los desarrolladores hacia su endpoint. El lanzamiento de código abierto del 15 de octubre nos dirá más que cualquier benchmark, porque los pesos que la gente puede descargar y ejecutar localmente sortean por completo la cuestión del alojamiento. Ese es el momento en que un modelo deja de necesitar una relación con un proveedor para ser adoptado.
También hay un problema de lenguaje llano que los laboratorios chinos han tardado en resolver. Todo desarrollador occidental que prueba Step 5 Preview tiene que navegar por una consola de API, una documentación y unos mensajes de error que se escribieron primero para un público nacional. Un modelo que está un punto por detrás del líder en un índice puede estar quince minutos por detrás en la primera petición, y la primera petición es donde realmente se decide la adopción.
Qué podría cambiar la vía de ejecución local
El lanzamiento de pesos abiertos es la parte de esta historia con más potencial, y merece la pena ser específico sobre por qué.
Un desarrollador que puede descargar los pesos elimina dos obstáculos a la vez. No hay relación con un proveedor que establecer, y no hay duda sobre dónde ocurre la inferencia ni sobre qué jurisdicción cruzan los datos. Para un equipo en Europa o Norteamérica que sopesa un modelo chino frente a uno nacional, esa diferencia suele ser el factor decisivo y no una nota a pie de página. Es la misma razón por la que los derivados de Llama y Qwen aparecen dentro de empresas que jamás llamarían a un endpoint alojado en otro país.
El problema es que los pesos abiertos trasladan el coste de una factura por token a hardware y operaciones. Un modelo de 600 mil millones de parámetros con 27 mil millones activos no se ejecuta en una estación de trabajo. Servirlo lo bastante bien como para superar en coste a un endpoint alojado requiere GPUs empresariales o una compilación cuantizada agresiva, y las compilaciones cuantizadas llegan de la comunidad, no del laboratorio. Ese calendario, y no la fecha de la licencia, marca cuándo el modelo pasa a estar disponible de forma práctica para la mayoría de los equipos.
El calendario de lanzamiento de StepFun sugiere que la empresa lo entiende, ya que los pesos llegan el 15 de octubre mientras el modelo está disponible a través de su propia API desde finales de septiembre. Esa brecha da al laboratorio un mes de comentarios de producción que incorporar antes de que la versión que la gente puede inspeccionar realmente sea pública.
Qué dice esto sobre el mercado de pesos abiertos
Step 5 Preview llega a un campo abarrotado que ha desplazado su eje competitivo durante el último año. A principios de 2026, la pregunta era qué modelo encabezaba una tabla de clasificación. Para el otoño, las preguntas que deciden la adopción habían cambiado a algo más práctico: qué permite la licencia, qué fabricantes de chips han adaptado sus cadenas de herramientas, cuán completa es la pila de ajuste fino y cuán activa es la comunidad en torno a él.
Ese cambio importa para cualquiera que elija un modelo hoy. Un modelo que lidera en un benchmark pero no tiene una vía de despliegue clara, ni compilaciones cuantizadas, ni una comunidad sólida costará más en tiempo de integración que un modelo algo más débil con herramientas que funcionan. El benchmark te dice qué puede hacer el modelo. El ecosistema te dice cuánto te costará averiguarlo.
La apuesta de StepFun parece ser que el salto de capacidad compra atención, y que el lanzamiento de pesos abiertos del 15 de octubre convierte parte de esa atención en uso. Es una apuesta razonable, y también es la habitual. Casi todos los lanzamientos chinos de frontera de 2026 han seguido el mismo arco: una posición fuerte en benchmarks, pesos abiertos, una cascada de adaptaciones de fabricantes nacionales de chips y luego una pregunta silenciosa sobre si el volumen semanal de llamadas se movió siquiera.
Lo verdaderamente notable de Step 5 Preview es la disciplina de la especificación. Un contexto de un millón de tokens con entrenamiento agéntico y un presupuesto de 27 mil millones de parámetros activos es un producto coherente para trabajo de ingeniería, más que un contendiente de propósito general. StepFun se saltó cuatro números de versión y no se excedió en la lista de tareas. Que los desarrolladores se den cuenta es otra cuestión, y la respuesta aparecerá en el volumen de llamadas, no en una reseña.
Artículos relacionados
Gemini Omni 1.1 Flash encadenó cuatro solicitudes en una toma de 40 segundos. El flujo de trabajo es el producto.
Google lanzó un pipeline de producción con un control de revisión incorporado en el precio.
Microsoft redujo la latencia de las transcripciones parciales a 100 milisegundos. Eso cambia para qué sirve la transcripción.
Por debajo de 100 milisegundos, un producto de transcripción puede responder mientras alguien todavía está hablando.
Synthesia pasó una década grabando avatares. Ahora quiere que respondan.
Una herramienta de capacitación que las personas repiten voluntariamente es un producto distinto de una que completan porque alguien se la asignó.
Un modelo que se niega a escribir frases ahora procesa un billón de tokens al día
Un clasificador con una interfaz mucho mejor, dirigido al trabajo que el software ya quería estructurado.