Step 5 跳过四个版本号,跻身开源模型第二名,却无人调用

2026年9月底,中国实验室 StepFun 发布了 Step 5 Preview。这个版本号不是笔误。该系列此前的模型是 Step 3.7 Flash,而公司直接跳过了整个 4 系列来到这里。开源版本定于10月15日发布,目前该模型已可通过 StepFun 的产品和 API 访问。
这份规格参数瞄准的只有一件事。Step 5 Preview 总参数量 6000 亿,激活参数 270 亿,支持一百万 token 上下文,原生接受文本和图像。StepFun 将其定位于编程、软件工程和长时程智能体任务,而非通用聊天。
在 Artificial Analysis 智能指数上,它得分 44。这使其与 Kimi K3 和 Grok 4.6 持平,落后 GLM-5.3 一分,在全球开源模型中并列第二。三个月前,Step 3.7 Flash 在同一指数上仅约 19 分。

这次跃升是最容易解释的部分
单次发布提升 25 分听起来难以置信,直到你看看底层发生了什么变化。Step 3.7 Flash 是一个为视觉任务打造的小型快速模型。它擅长读取截图和视频帧,但据那些把它接入编程工具的开发者反映,它还不够强,无法承接复杂工作。Step 5 Preview 是另一类模型,其激活预算约为前者三倍,上下文窗口足以容纳整个代码库,训练明确针对智能体行为。
中国实验室在整个 2026 年一直在沿用这套打法。先发布一个快速的小模型,了解哪些地方会出问题,然后把算力投入到一次前沿尝试中。这里不同寻常的是公开的版本号算术,而这套算术对 StepFun 有利。用过 Step 3.7 Flash 的人都不会把它和 Step 5 Preview 混为一谈,两者之间的差距让进步变得清晰可见,无需基准图表。
独立早期测试用一个平淡的观察支持了这一说法。一位将该模型接入编程智能体的开发者报告说,输出稳定,工程代码返回时需要返工的循环更少。对于编程模型来说,这正是那种重要的赞誉,而且它足够不起眼,因而可信。
采用率数字才是真正的故事
这里才是这次发布变得有趣的地方。OpenRouter 每周发布模型调用量排名,而 Step 5 Preview 并未出现在前十。它拥有基准排名、上下文窗口和开源许可证,却在最繁忙的多模型路由器上没有获得大规模调用。
这一差距值得琢磨,因为它描述的是中国开放权重模型发布的一个普遍模式,而非这一款模型特有的失败。基准位置是生产者用来评判模型的信号,调用量则是消费者通过使用产生的信号。一整年来,两者一直在分化。
部分解释是结构性的。OpenRouter 的流量主要来自那些托管中国模型会带来采购或合规问题的市场的开发者,以及那些已经围绕团队最初选择的方案完成集成的工作负载。即使模型免费,切换成本也是真实存在的,因为集成工作不是免费的。如果切换成本超过感知收益,一个更好的模型仍然可能落败。
部分原因在于分发。StepFun 不是谷歌或 Meta,它没有一条能把开发者引向自己端点的渠道。10月15日的开源发布将比任何基准测试告诉我们更多,因为人们可以下载并在本地运行的权重完全绕开了托管问题。那一刻,模型不再需要与供应商建立关系才能被采用。
还有一个中国实验室迟迟未能解决的语言问题。每一位尝试 Step 5 Preview 的西方开发者都必须应对一个首先为国内用户编写的 API 控制台、文档和错误信息。一个在指数上落后领跑者一分的模型,可能在首次请求时就慢上十五分钟,而首次请求恰恰是采用与否真正被决定的时刻。
本地运行路径可能改变什么
开放权重发布是这则故事中最具上行空间的部分,值得具体说明原因。
能够下载权重的开发者一次性移除了两个障碍。无需建立供应商关系,也不存在推理在哪里发生、数据跨越谁管辖范围的问题。对于正在权衡中国模型与本土模型的欧洲或北美团队来说,这一差异往往是决定性因素,而非脚注。这也是为什么 Llama 和 Qwen 的衍生模型会出现在那些绝不会调用他国托管端点的企业内部。
问题在于,开放权重把成本从按 token 计费转移到了硬件和运维上。一个总参数量 6000 亿、激活参数 270 亿的模型不可能在工作站上跑。要把它服务得足够好、在成本上击败托管端点,要么需要企业级 GPU,要么需要激进量化版本,而量化版本来自社区而非实验室。决定大多数团队何时能实际用上这个模型的,是这条时间线,而不是许可证日期。
StepFun 的发布节奏表明公司明白这一点:权重在10月15日落地,而该模型自9月底起就已可通过自家 API 使用。这段间隔让实验室有一个月的生产反馈,可以在公众可实际检查的版本发布前纳入其中。
这对开放权重市场意味着什么
Step 5 Preview 进入的是一个拥挤的领域,过去一年其竞争轴心已经转移。2026年初,问题还是哪个模型登顶排行榜。到了秋天,决定采用的问题已经变成更实际的东西:许可证允许什么,哪些芯片厂商适配了工具链,微调技术栈有多完整,以及围绕它的社区有多活跃。
对于今天任何选择模型的人来说,这种转变都很重要。一个在基准测试中领先、但没有清晰部署路径、没有量化版本、社区稀薄的模型,其集成时间成本会高于一个稍弱但工具链可用的模型。基准测试告诉你模型能做什么。生态系统告诉你弄明白这一点要付出多少代价。
StepFun 的赌注似乎是:能力跃升能换来关注,而10月15日的开放权重发布会把其中一部分关注转化为使用。这是个合理的赌注,也是标准做法。2026年几乎每一次中国前沿模型发布都遵循同样的弧线:强劲的基准排名、开放权重、国内芯片厂商的一连串适配,然后是一个安静的问题——周调用量到底有没有动。
Step 5 Preview 真正值得注意的是其规格上的克制。一百万 token 上下文、智能体训练,加上 270 亿激活参数预算,这是一个为工程工作打造的一致产品,而非通用型竞争者。StepFun 跳过了四个版本号,也没有在任务清单上过度扩张。开发者是否注意到则是另一回事,而答案将体现在调用量上,而不是评测里。