Step 5 übersprang vier Versionsnummern, landete auf Platz zwei unter offenen Modellen – und niemand ruft es ab

Ende September 2026 veröffentlichte das chinesische Labor StepFun Step 5 Preview. Die Versionsnummer ist kein Tippfehler. Das vorherige Modell der Reihe war Step 3.7 Flash, und das Unternehmen übersprang die gesamte 4er-Serie, um hierher zu gelangen. Die Open-Source-Veröffentlichung ist für den 15. Oktober geplant, und das Modell ist bereits über StepFuns Produkte und API erreichbar.
Die Spezifikation ist auf eine Aufgabe ausgerichtet. Step 5 Preview nutzt 600 Milliarden Gesamtparameter bei 27 Milliarden aktiven, unterstützt einen Kontext von einer Million Token und akzeptiert nativ sowohl Text als auch Bilder. StepFun positioniert es für Coding, Softwareentwicklung und Agentenaufgaben mit langem Zeithorizont statt für allgemeinen Chat.
Im Artificial Analysis Intelligence Index erreicht es 44. Damit liegt es gleichauf mit Kimi K3 und Grok 4.6, einen Punkt hinter GLM-5.3 und gemeinsam auf Platz zwei unter den Open-Source-Modellen weltweit. Drei Monate zuvor lag Step 3.7 Flash im selben Index bei ungefähr 19.

Der Sprung ist der leicht zu erklärende Teil
Ein Anstieg um 25 Punkte in einer einzigen Veröffentlichung klingt unglaubwürdig, bis man sich ansieht, was sich darunter verändert hat. Step 3.7 Flash war ein kleines, schnelles Modell, das für Bildverarbeitung gebaut wurde. Es war gut darin, Screenshots und Videoframes zu lesen, und war – nach Aussage von Entwicklern, die es in Coding-Tools eingebunden haben – nicht stark genug, um ihm die komplizierte Arbeit zu überlassen. Step 5 Preview ist eine andere Modellklasse mit einem Aktivierungsbudget von etwa dreifacher Größe, einem Kontextfenster, das für ganze Codebasen dimensioniert ist, und einem Training, das explizit auf agentisches Verhalten ausgerichtet ist.
Chinesische Labore fahren dieses Drehbuch seit 2026. Ein schnelles kleines Modell veröffentlichen, lernen, was kaputtgeht, und dann das Rechenbudget in einen Frontier-Versuch stecken. Ungewöhnlich ist hier die öffentliche Versionsarithmetik, und die Arithmetik spielt StepFun in die Hände. Niemand, der Step 3.7 Flash genutzt hat, wird es mit Step 5 Preview verwechseln, und die Lücke zwischen ihnen macht die Verbesserung ohne Benchmark-Diagramm erkennbar.
Unabhängige frühe Tests stützen die Behauptung mit einer nüchternen Beobachtung. Ein Entwickler, der das Modell mit einem Coding-Agenten verband, berichtete, dass die Ausgabe stabil war und dass Engineering-Code mit weniger Nacharbeitszyklen zurückkam. Das ist die Art von Lob, die für ein Coding-Modell zählt, und sie ist unglamourös genug, um glaubwürdig zu sein.
Die Akzeptanzzahl ist die eigentliche Geschichte
Hier wird die Veröffentlichung interessant. OpenRouter veröffentlicht ein wöchentliches Ranking des Modell-Aufrufvolumens, und Step 5 Preview taucht nicht in den Top Ten auf. Es hat die Benchmark-Platzierung, das Kontextfenster und die offene Lizenz – und wird auf dem meistgenutzten Multi-Modell-Router nicht in großem Umfang aufgerufen.
Diese Lücke sollte man auf sich wirken lassen, denn sie beschreibt ein Muster über chinesische Open-Weight-Veröffentlichungen hinweg und nicht ein spezifisches Versagen dieses Modells. Die Benchmark-Position ist ein Signal, das Produzenten nutzen, um ein Modell zu beurteilen. Das Aufrufvolumen ist ein Signal, das Nutzer durch seine Nutzung erzeugen. Die beiden haben sich das ganze Jahr über auseinanderentwickelt.
Ein Teil der Erklärung ist struktureller Natur. OpenRouters Volumen wird von Entwicklern in Märkten dominiert, in denen das Hosten eines chinesischen Modells Beschaffungs- oder Compliance-Fragen aufwirft, sowie von Workloads, die bereits auf das integriert sind, was das Team zuerst gewählt hat. Wechselkosten sind real, selbst wenn das Modell kostenlos ist, denn die Integrationsarbeit ist es nicht. Ein Modell kann besser sein und trotzdem verlieren, wenn die Wechselkosten den wahrgenommenen Gewinn übersteigen.
Ein Teil davon ist Distribution. StepFun ist nicht Google oder Meta und hat keinen Kanal, der Entwickler zu seinem Endpunkt leitet. Die Open-Source-Veröffentlichung am 15. Oktober wird uns mehr sagen als jeder Benchmark, denn Gewichte, die man herunterladen und lokal ausführen kann, umgehen die Hosting-Frage vollständig. Das ist der Moment, in dem ein Modell keine Anbieterbeziehung mehr braucht, um übernommen zu werden.
Es gibt außerdem ein Sprachbarriere-Problem, dessen Lösung chinesische Labore nur langsam angehen. Jeder westliche Entwickler, der Step 5 Preview ausprobiert, muss sich durch eine API-Konsole, Dokumentation und Fehlermeldungen arbeiten, die zuerst für ein heimisches Publikum geschrieben wurden. Ein Modell, das in einem Index einen Punkt hinter dem Spitzenreiter liegt, kann bei der ersten Anfrage fünfzehn Minuten zurückliegen – und bei der ersten Anfrage entscheidet sich tatsächlich über die Akzeptanz.
Was der Pfad des lokalen Ausführens ändern könnte
Die Open-Weight-Veröffentlichung ist der Teil dieser Geschichte mit dem größten Potenzial, und es lohnt sich, genau zu benennen, warum.
Ein Entwickler, der Gewichte herunterladen kann, beseitigt zwei Hindernisse auf einmal. Es gibt keine Anbieterbeziehung aufzubauen, und es stellt sich nicht die Frage, wo die Inferenz stattfindet oder wessen Gerichtsbarkeit die Daten durchqueren. Für ein Team in Europa oder Nordamerika, das ein chinesisches Modell gegen ein einheimisches abwägt, ist dieser Unterschied oft der entscheidende Faktor und nicht eine Fußnote. Es ist derselbe Grund, aus dem Llama- und Qwen-Derivate in Unternehmen auftauchen, die niemals einen gehosteten Endpunkt in einem anderen Land aufrufen würden.
Der Haken ist, dass offene Gewichte die Kosten von einer Pro-Token-Rechnung auf Hardware und Betrieb verlagern. Ein Modell mit 600 Milliarden Parametern und 27 Milliarden aktiven Parametern läuft nicht auf einer Workstation. Es gut genug zu betreiben, um einen gehosteten Endpunkt bei den Kosten zu schlagen, erfordert entweder Enterprise-GPUs oder einen aggressiven quantisierten Build, und die quantisierten Builds kommen aus der Community statt aus dem Labor. Dieser Zeitplan, nicht das Lizenzdatum, bestimmt, wann das Modell für die meisten Teams praktisch verfügbar wird.
StepFuns Veröffentlichungsplan deutet darauf hin, dass das Unternehmen das versteht, denn die Gewichte erscheinen am 15. Oktober, während das Modell seit Ende September über die eigene API verfügbar ist. Diese Lücke gibt dem Labor einen Monat Produktionsfeedback, das es einarbeiten kann, bevor die Version, die man tatsächlich inspizieren kann, öffentlich wird.
Was das über den Open-Weight-Markt sagt
Step 5 Preview kommt in ein überfülltes Feld, das im vergangenen Jahr seine Wettbewerbsachse verschoben hat. Anfang 2026 lautete die Frage, welches Modell eine Bestenliste anführt. Im Herbst hatten sich die Fragen, die über die Akzeptanz entscheiden, zu etwas Praktischerem gewandelt: Was erlaubt die Lizenz, welche Chiphersteller haben ihre Toolchains angepasst, wie vollständig ist der Fine-Tuning-Stack und wie aktiv ist die Community darum?
Diese Verschiebung ist für jeden wichtig, der heute ein Modell auswählt. Ein Modell, das bei einem Benchmark führt, aber keinen klaren Deployment-Pfad, keine quantisierten Builds und eine dünne Community hat, kostet mehr an Integrationszeit als ein etwas schwächeres Modell mit funktionierendem Tooling. Der Benchmark sagt Ihnen, was das Modell kann. Das Ökosystem sagt Ihnen, was es Sie kosten wird, das herauszufinden.
StepFuns Wette scheint zu sein, dass der Fähigkeitssprung Aufmerksamkeit erkauft und dass die Open-Weight-Veröffentlichung am 15. Oktober einen Teil dieser Aufmerksamkeit in Nutzung verwandelt. Das ist eine vernünftige Wette, und es ist auch die Standardwette. Fast jede chinesische Frontier-Veröffentlichung des Jahres 2026 folgte demselben Bogen: starke Benchmark-Platzierung, offene Gewichte, eine Kaskade von Anpassungen heimischer Chiphersteller und dann eine leise Frage, ob sich das wöchentliche Aufrufvolumen überhaupt bewegt hat.
Wirklich bemerkenswert an Step 5 Preview ist die Disziplin in der Spezifikation. Ein Kontext von einer Million Token mit agentischem Training und einem Budget von 27 Milliarden aktiven Parametern ist ein kohärentes Produkt für Engineering-Arbeit und kein Allzweck-Anwärter. StepFun übersprang vier Versionsnummern und griff bei der Aufgabenliste nicht zu weit. Ob Entwickler es bemerken, ist eine andere Frage, und die Antwort wird sich im Aufrufvolumen zeigen, nicht in einer Rezension.
Verwandte Artikel
Gemini Omni 1.1 Flash verkettete vier Anfragen zu einer 40-Sekunden-Aufnahme. Der Workflow ist das Produkt.
Google hat eine Produktionspipeline ausgeliefert, bei der ein Review-Gate in die Preisgestaltung eingebaut ist.
Microsoft senkt die Latenz für Teiltranskripte auf 100 Millisekunden. Das verändert, wofür Transkription da ist.
Unterhalb von 100 Millisekunden kann ein Transkriptionsprodukt reagieren, während jemand noch spricht.
Synthesia hat ein Jahrzehnt lang Avatare aufgezeichnet. Jetzt sollen sie zurücksprechen.
Ein Trainingswerkzeug, das Menschen freiwillig wiederholen, ist ein anderes Produkt als eines, das sie abschließen, weil es ihnen zugewiesen wurde.
Ein Modell, das sich weigert, Sätze zu schreiben, verarbeitet jetzt eine Billion Token pro Tag
Ein Klassifikator mit einer viel besseren Schnittstelle, ausgerichtet auf die Arbeit, die Software schon immer strukturiert haben wollte.