← Retour au blog
AiEnviron 8 min de lecture

Step 5 a sauté quatre numéros de version, s'est hissé au deuxième rang des modèles ouverts, et personne ne l'appelle

Publié le 5 oct. 2026
Step 5 a sauté quatre numéros de version, s'est hissé au deuxième rang des modèles ouverts, et personne ne l'appelle

Fin septembre 2026, le laboratoire chinois StepFun a publié Step 5 Preview. Le numéro de version n'est pas une coquille. Le modèle précédent de la gamme était Step 3.7 Flash, et l'entreprise a sauté toute la série 4 pour arriver ici. La version open source est prévue pour le 15 octobre, et le modèle est déjà accessible via les produits et l'API de StepFun.

La spécification vise un seul objectif. Step 5 Preview utilise 600 milliards de paramètres au total, dont 27 milliards actifs, prend en charge un contexte d'un million de tokens et accepte nativement le texte et les images. StepFun le positionne pour le codage, l'ingénierie logicielle et les tâches d'agents à long horizon plutôt que pour le chat généraliste.

Sur l'Artificial Analysis Intelligence Index, il obtient 44. Cela le place à égalité avec Kimi K3 et Grok 4.6, à un point derrière GLM-5.3, et à la deuxième place ex æquo parmi les modèles open source à l'échelle mondiale. Trois mois plus tôt, Step 3.7 Flash se situait autour de 19 sur le même indice.

Une haute pile de blocs de pierre plats et rugueux en équilibre sur une surface sombre dans une lumière dure

Le saut est la partie facile à expliquer

Une progression de 25 points en une seule version semble incroyable jusqu'à ce qu'on regarde ce qui a changé en dessous. Step 3.7 Flash était un petit modèle rapide conçu pour le travail de vision. Il était bon pour lire des captures d'écran et des images vidéo, et il n'était pas, selon les développeurs qui l'ont intégré à des outils de codage, assez puissant pour qu'on lui confie les tâches compliquées. Step 5 Preview appartient à une autre catégorie de modèle, avec un budget d'activation environ trois fois supérieur, une fenêtre de contexte dimensionnée pour des bases de code entières et un entraînement explicitement orienté vers les comportements agentiques.

Les laboratoires chinois déroulent ce scénario tout au long de 2026. Publier un petit modèle rapide, apprendre ce qui casse, puis investir la puissance de calcul dans une tentative de modèle de frontière. Ce qui est inhabituel ici, c'est l'arithmétique publique des versions, et cette arithmétique joue en faveur de StepFun. Personne n'ayant utilisé Step 3.7 Flash ne le confondra avec Step 5 Preview, et l'écart entre eux rend l'amélioration perceptible sans graphique de benchmark.

Des premiers tests indépendants étayent cette affirmation par une observation banale. Un développeur qui a connecté le modèle à un agent de codage a rapporté que la sortie était stable et que le code d'ingénierie revenait en nécessitant moins de cycles de reprise. C'est le genre d'éloge qui compte pour un modèle de codage, et c'est assez peu glamour pour être crédible.

Le chiffre d'adoption est la vraie histoire

C'est ici que la sortie devient intéressante. OpenRouter publie un classement hebdomadaire du volume d'appels des modèles, et Step 5 Preview n'apparaît pas dans le top dix. Il a le classement au benchmark, la fenêtre de contexte et la licence ouverte, et il n'est pas appelé en volume sur le routeur multi-modèles le plus fréquenté.

Cet écart mérite qu'on s'y attarde, car il décrit un schéma qui touche les versions chinoises à poids ouverts plutôt qu'un échec propre à ce modèle. La position dans les benchmarks est un signal que les producteurs utilisent pour juger un modèle. Le volume d'appels est un signal que les consommateurs produisent en l'utilisant. Les deux ont divergé toute l'année.

Une partie de l'explication est structurelle. Le volume d'OpenRouter est dominé par des développeurs situés sur des marchés où héberger un modèle chinois soulève des questions d'approvisionnement ou de conformité, et par des charges de travail déjà intégrées à ce que l'équipe a choisi en premier. Les coûts de changement sont réels même lorsque le modèle est gratuit, car le travail d'intégration ne l'est pas. Un modèle peut être meilleur et perdre quand même, si le coût de changement dépasse le gain perçu.

Une autre partie tient à la distribution. StepFun n'est pas Google ou Meta, et ne dispose pas d'un canal qui achemine les développeurs vers son point de terminaison. La sortie open source du 15 octobre nous en dira plus que n'importe quel benchmark, car des poids que l'on peut télécharger et exécuter localement contournent entièrement la question de l'hébergement. C'est le moment où un modèle cesse d'avoir besoin d'une relation avec un fournisseur pour être adopté.

Il y a aussi un problème de langue simple que les laboratoires chinois ont été lents à résoudre. Chaque développeur occidental qui essaie Step 5 Preview doit naviguer dans une console API, une documentation et des messages d'erreur qui ont d'abord été écrits pour un public national. Un modèle qui a un point de retard sur le leader d'un indice peut avoir quinze minutes de retard lors de la première requête, et c'est à la première requête que l'adoption se décide réellement.

Ce que la voie de l'exécution locale pourrait changer

La publication des poids ouverts est l'élément de cette histoire qui présente le plus de potentiel, et il vaut la peine de préciser pourquoi.

Un développeur qui peut télécharger les poids supprime deux obstacles d'un coup. Il n'y a pas de relation avec un fournisseur à établir, et il n'y a aucune question sur l'endroit où l'inférence a lieu ni sur la juridiction que les données traversent. Pour une équipe en Europe ou en Amérique du Nord qui compare un modèle chinois à un modèle local, cette différence est souvent le facteur décisif plutôt qu'une note de bas de page. C'est la même raison pour laquelle les dérivés de Llama et Qwen apparaissent dans des entreprises qui n'appelleraient jamais un point de terminaison hébergé dans un autre pays.

Le hic, c'est que les poids ouverts déplacent le coût d'une facture par token vers le matériel et l'exploitation. Un modèle de 600 milliards de paramètres avec 27 milliards de paramètres actifs ne tourne pas sur une station de travail. Le servir suffisamment bien pour battre un point de terminaison hébergé en termes de coût nécessite soit des GPU d'entreprise, soit une version quantifiée agressive, et les versions quantifiées arrivent de la communauté plutôt que du laboratoire. C'est ce calendrier, et non la date de licence, qui détermine le moment où le modèle devient réellement disponible pour la plupart des équipes.

Le calendrier de publication de StepFun suggère que l'entreprise le comprend, puisque les poids arrivent le 15 octobre alors que le modèle est disponible via sa propre API depuis fin septembre. Cet écart donne au laboratoire un mois de retours de production à intégrer avant que la version que les gens peuvent réellement inspecter ne devienne publique.

Ce que cela dit du marché des poids ouverts

Step 5 Preview arrive dans un secteur saturé qui a déplacé son axe concurrentiel au cours de l'année écoulée. Au début de 2026, la question était de savoir quel modèle dominait un classement. À l'automne, les questions qui décident de l'adoption avaient changé pour quelque chose de plus pratique : que permet la licence, quels fabricants de puces ont adapté leurs chaînes d'outils, quelle est la complétude de la pile de fine-tuning et quelle est l'activité de la communauté autour du modèle.

Ce changement compte pour quiconque choisit un modèle aujourd'hui. Un modèle qui mène sur un benchmark mais n'a pas de voie de déploiement claire, pas de versions quantifiées et une communauté limitée coûtera plus cher en temps d'intégration qu'un modèle légèrement plus faible avec des outils fonctionnels. Le benchmark vous dit ce que le modèle peut faire. L'écosystème vous dit ce qu'il vous en coûtera pour le découvrir.

Le pari de StepFun semble être que ce saut de capacités capte l'attention, et que la publication des poids ouverts du 15 octobre convertit une partie de cette attention en usage. C'est un pari raisonnable, et c'est aussi le pari standard. Presque toutes les sorties chinoises de modèles de frontière en 2026 ont suivi le même arc : un bon classement aux benchmarks, des poids ouverts, une cascade d'adaptations de la part des fabricants de puces nationaux, puis une question discrète de savoir si le volume d'appels hebdomadaire a bougé, ne serait-ce qu'un peu.

Ce qui est vraiment remarquable avec Step 5 Preview, c'est la discipline de la spécification. Un contexte d'un million de tokens avec un entraînement agentique et un budget de 27 milliards de paramètres actifs constituent un produit cohérent pour le travail d'ingénierie plutôt qu'un prétendant généraliste. StepFun a sauté quatre numéros de version et n'a pas vu trop grand dans la liste des tâches. Que les développeurs le remarquent est une autre affaire, et la réponse apparaîtra dans le volume d'appels plutôt que dans une critique.

Articles associés