← Voltar ao blog
Aicerca de 8 min de leitura

O Step 5 pulou quatro números de versão, ficou em segundo entre os modelos abertos e ninguém o está chamando

Publicado 5 de out. de 2026
O Step 5 pulou quatro números de versão, ficou em segundo entre os modelos abertos e ninguém o está chamando

No fim de setembro de 2026, o laboratório chinês StepFun publicou o Step 5 Preview. O número de versão não é um erro de digitação. O modelo anterior da linha era o Step 3.7 Flash, e a empresa pulou toda a série 4 para chegar até aqui. O lançamento open-source está previsto para 15 de outubro, e o modelo já pode ser acessado pelos produtos e pela API da StepFun.

A especificação é voltada para uma única finalidade. O Step 5 Preview usa 600 bilhões de parâmetros totais com 27 bilhões ativos, suporta um contexto de um milhão de tokens e aceita nativamente tanto texto quanto imagens. A StepFun o posiciona para programação, engenharia de software e tarefas de agente de longo horizonte, e não para conversa geral.

No Artificial Analysis Intelligence Index ele marca 44. Isso o coloca no mesmo nível de Kimi K3 e Grok 4.6, um ponto atrás do GLM-5.3, e empatado em segundo lugar entre os modelos open-source do mundo. Três meses antes, o Step 3.7 Flash estava em cerca de 19 no mesmo índice.

Uma pilha alta de blocos de pedra áspera e achatados equilibrada sobre uma superfície escura sob luz dura

O salto é a parte fácil de explicar

Um avanço de 25 pontos em um único lançamento soa implausível até você olhar o que mudou por baixo. O Step 3.7 Flash era um modelo pequeno e rápido, construído para trabalho de visão. Era bom em ler capturas de tela e quadros de vídeo e, segundo relatos de desenvolvedores que o conectaram a ferramentas de programação, não era forte o suficiente para receber o trabalho complicado. O Step 5 Preview é uma classe diferente de modelo, com um orçamento de ativação cerca de três vezes maior, uma janela de contexto dimensionada para bases de código inteiras e treinamento voltado explicitamente para comportamento agêntico.

Os laboratórios chineses vêm seguindo esse manual ao longo de 2026. Lance um modelo pequeno e rápido, aprenda o que quebra, depois gaste o poder de computação em uma tentativa de fronteira. O incomum aqui é a aritmética pública de versões, e a aritmética funciona a favor da StepFun. Ninguém que usou o Step 3.7 Flash vai confundi-lo com o Step 5 Preview, e a distância entre eles torna a melhoria legível sem um gráfico de benchmark.

Testes independentes iniciais sustentam a alegação com uma observação prosaica. Um desenvolvedor que conectou o modelo a um agente de programação relatou que a saída era estável e que o código de engenharia voltava precisando de menos ciclos de retrabalho. Esse é o tipo de elogio que importa para um modelo de programação, e é pouco glamouroso o bastante para ser crível.

O número de adoção é a verdadeira história

Aqui é onde o lançamento fica interessante. O OpenRouter publica um ranking semanal de volume de chamadas de modelos, e o Step 5 Preview não aparece no top dez. Ele tem a posição em benchmark, a janela de contexto e a licença aberta, e não está sendo chamado em volume no roteador multimodelo mais movimentado.

Essa lacuna vale a pena ser considerada, porque descreve um padrão entre lançamentos chineses de pesos abertos, e não uma falha específica deste modelo. A posição em benchmark é um sinal que os produtores usam para julgar um modelo. O volume de chamadas é um sinal que os consumidores produzem ao usá-lo. Os dois vêm divergindo o ano todo.

Parte da explicação é estrutural. O volume do OpenRouter é dominado por desenvolvedores em mercados onde hospedar um modelo chinês traz questões de contratação ou conformidade, e por cargas de trabalho já integradas àquilo que a equipe escolheu primeiro. Os custos de troca são reais mesmo quando o modelo é gratuito, porque o trabalho de integração não é. Um modelo pode ser melhor e ainda assim perder, se o custo de troca superar o ganho percebido.

Parte é distribuição. A StepFun não é o Google nem a Meta, e não tem um canal que direcione desenvolvedores para o seu endpoint. O lançamento open-source em 15 de outubro dirá mais do que qualquer benchmark, porque pesos que as pessoas podem baixar e rodar localmente contornam completamente a questão da hospedagem. Esse é o momento em que um modelo deixa de precisar de uma relação com fornecedor para ser adotado.

Há também um problema de linguagem simples que os laboratórios chineses têm demorado a resolver. Todo desenvolvedor ocidental que experimenta o Step 5 Preview precisa navegar por um console de API, uma documentação e mensagens de erro escritos primeiro para um público doméstico. Um modelo que está um ponto atrás do líder em um índice pode estar quinze minutos atrás na primeira requisição, e é na primeira requisição que a adoção de fato se decide.

O que o caminho de execução local pode mudar

O lançamento de pesos abertos é a parte desta história com o maior potencial, e vale ser específico sobre o porquê.

Um desenvolvedor que consegue baixar os pesos remove dois obstáculos de uma vez. Não há relação com fornecedor a estabelecer, e não há dúvida sobre onde a inferência acontece ou sob qual jurisdição os dados cruzam. Para uma equipe na Europa ou na América do Norte avaliando um modelo chinês contra um doméstico, essa diferença costuma ser o fator decisivo, e não uma nota de rodapé. É a mesma razão pela qual derivados do Llama e do Qwen aparecem dentro de empresas que nunca chamariam um endpoint hospedado em outro país.

O porém é que pesos abertos transferem o custo de uma fatura por token para hardware e operações. Um modelo de 600 bilhões de parâmetros com 27 bilhões de parâmetros ativos não roda em uma estação de trabalho. Servi-lo bem o suficiente para superar um endpoint hospedado em custo exige GPUs empresariais ou uma build quantizada agressiva, e as builds quantizadas chegam da comunidade, não do laboratório. Esse cronograma, e não a data da licença, define quando o modelo se torna praticamente disponível para a maioria das equipes.

O calendário de lançamento da StepFun sugere que a empresa entende isso, já que os pesos chegam em 15 de outubro enquanto o modelo está disponível por meio de sua própria API desde o fim de setembro. Essa lacuna dá ao laboratório um mês de feedback de produção para incorporar antes que a versão que as pessoas podem de fato inspecionar se torne pública.

O que isso diz sobre o mercado de pesos abertos

O Step 5 Preview chega a um campo movimentado que mudou seu eixo competitivo ao longo do último ano. No início de 2026, a pergunta era qual modelo liderava um ranking. No outono, as perguntas que decidem a adoção tinham mudado para algo mais prático: o que a licença permite, quais fabricantes de chips adaptaram suas cadeias de ferramentas, quão completo é o stack de fine-tuning e quão ativa é a comunidade em torno dele.

Essa mudança importa para quem escolhe um modelo hoje. Um modelo que lidera um benchmark mas não tem caminho claro de implantação, nem builds quantizadas, nem comunidade consistente custará mais em tempo de integração do que um modelo ligeiramente mais fraco com ferramentas que funcionam. O benchmark diz o que o modelo é capaz de fazer. O ecossistema diz quanto vai custar descobrir.

A aposta da StepFun parece ser que o salto de capacidade compra atenção, e que o lançamento de pesos abertos em 15 de outubro converte parte dessa atenção em uso. É uma aposta razoável, e também é a padrão. Quase todo lançamento chinês de fronteira de 2026 seguiu o mesmo arco: posição forte em benchmark, pesos abertos, uma cascata de adaptações de fabricantes domésticos de chips, e depois uma pergunta silenciosa sobre se o volume semanal de chamadas mudou ou não.

O que é genuinamente notável no Step 5 Preview é a disciplina na especificação. Um contexto de um milhão de tokens com treinamento agêntico e um orçamento de 27 bilhões de parâmetros ativos é um produto coerente para trabalho de engenharia, e não um concorrente de propósito geral. A StepFun pulou quatro números de versão e não exagerou na lista de tarefas. Se os desenvolvedores vão notar é outra questão, e a resposta aparecerá no volume de chamadas, não em uma resenha.

Artigos relacionados