Cartão de título gerado intitulado 'Prévia do Step 5 — o que o repositório diz', listando seis linhas: parâmetros totais 600B, ativados por token 27B, janela de contexto 1M tokens, entrada de texto e imagem, AA Intelligence Index 44 e preço $1,00 de entrada / $2,70 de saída. Um rodapé diz: 'A StepFun anunciou em 20 de setembro de 2026; pesos previstos para 15 de outubro de 2026. Valor do índice conforme a Artificial Analysis.'
Engineering & Research

Step 5 Preview é anunciado: o que o modelo carro-chefe de 600B da StepFun realmente entrega, e o que ainda falta

Autor

Gideon Frost

Data de publicação

Modelos mais recentes · 20Ver todos os modelos
Benchmarks: Artificial Analysis · atualizado diariamente
Voltar para todas as publicações

A StepFun anunciou o Step 5 Preview em 20 de setembro de 2026 — um modelo carro-chefe esparso de mistura de especialistas com 600 bilhões de parâmetros, com 27B parâmetros ativos por token, uma janela de contexto de 1M de tokens, entrada de imagem nativa e uma pontuação de 44 no Artificial Analysis Intelligence Index. A API foi aberta no mesmo dia. O que não foi aberto é o próprio modelo: o repositório do Hugging Face stepfun-ai/Step-5-Preview-BF16 já existia na tarde do anúncio e contém exatamente um arquivo, .gitattributes, sem pesos, sem licença, sem cartão de modelo e sem configuração. Os próprios materiais da StepFun colocam o lançamento de pesos abertos em 15 de outubro de 2026. Então, o resumo honesto de uma linha deste lançamento é que o modelo é chamável hoje e baixável em cerca de três semanas e meia, e essas são duas coisas diferentes. Este também é o mesmo modelo que este blog cobriu mais cedo hoje como um vazamento não anunciado, com benchmark sob uma tag de teste antes de a StepFun ter publicado uma página de produto — um lembrete útil de que uma prévia pode passar de vazamento para lançamento sem que um único número mude.

O repositório é um placeholder, e essa é a história.

Quando um fornecedor publica pesos, o repositório é a evidência. Ele tem um arquivo de licença, uma configuração com uma contagem de parâmetros nela, um README com o uso pretendido e a tabela de avaliação, e shards safetensors cujo tamanho total informa se a alegação de parâmetros é real. stepfun-ai/Step-5-Preview-BF16 não tem nada disso. O registro da API do Hugging Face para ele mostra um carimbo de data/hora de criação de 2026-09-20T03:52Z, zero downloads, dois likes, um objeto de configuração vazio, nenhum pipeline_tag, nenhuma licença e um único arquivo irmão. A página da organização StepFun o lista, e não lista nenhum outro repositório Step 5 — nenhuma build FP8, nenhuma build NVFP4, nenhum GGUF, nenhuma das variantes de quantização que acompanharam o Step-3.7-Flash em junho.

Leia isso como uma questão de cronograma, não como um mistério. O sufixo BF16 no nome do repositório é a pista reveladora: um laboratório que pretende publicar primeiro um checkpoint bfloat16 — o formato a partir do qual você faz fine-tuning e quantização, antes de chegarem as builds de serving FP8 e NVFP4 — nomeia o repositório assim no momento da criação e o preenche depois. A StepFun declarou 15 de outubro em seus próprios materiais de anúncio. Até lá, o repositório é uma afirmação sobre uma intenção, e a única coisa que ele prova é que a StepFun reservou o namespace.

Isso importa por uma razão prática. O Preview sufixo e os pesos ausentes são o mesmo sinal apontando na mesma direção: o modelo pode ser chamado, os preços estão definidos, e o artefato que você executaria em seu próprio hardware ainda não existe. Qualquer plano que pressuponha um Step 5 Preview auto-hospedado antes de meados de outubro é um plano sem artefato por trás.

O que foi realmente anunciado

O posicionamento da StepFun é restrito e específico: o Step 5 Preview é um modelo base para trabalho agêntico do mundo real — codificação com IA, engenharia de software, trabalho de conhecimento profissional e finanças —, com ênfase em contexto longo, chamadas de ferramentas em múltiplos turnos e execução sustentada, em vez de qualidade de chat. A empresa pulou completamente a linha Step 4.x, indo do Step-3.7-Flash direto para o Step 5, o que, por si só, é uma declaração sobre o tamanho do passo que ela considera que isso representa.

Vale destacar um detalhe de data, porque é o tipo de coisa que atrapalha um calendário de compras: a Artificial Analysis data este modelo como 18 de setembro de 2026, dois dias antes do anúncio da própria StepFun. O board pontua um modelo quando consegue acessá-lo, e essa lacuna de dois dias é o atraso comum entre um modelo se tornar chamável e um fornecedor escrever sobre ele. O anúncio da StepFun — 20 de setembro, com a API e o Studio abrindo no mesmo dia — é a data a citar, e a data dos pesos, 15 de outubro, vem dos mesmos materiais.

A especificação conforme publicada:

• Parâmetros totais — 600B, mistura esparsa de especialistas

• Ativos por token — 27B, cerca de 4,5% do total, uma proporção incomumente esparsa

• Janela de contexto — 1M tokens

• Entrada — texto e imagens nativamente; a saída é apenas texto

• Raciocínio — sim, com pensamento estendido

• Preço — $1,00 por milhão de tokens de entrada, $2,70 por milhão de tokens de saída, com 95% de desconto no cache

• Disponibilidade — API e Studio disponíveis a partir de 20 de setembro; pesos programados para 15 de outubro

A alegação de eficiência com que a StepFun está liderando é que a divisão 600B/27B coloca o modelo na fronteira de Pareto — capacidade por unidade de computação — e a empresa a apresenta como três gerações da mesma busca, do Step-3.5-Flash ao Step-3.7-Flash até este. É uma história coerente, e a proporção de esparsidade é o mecanismo: com 27B ativos, o custo de serviço por token fica na faixa de um modelo muito menor, enquanto o total de 600B é sobretudo uma questão de pegada de memória.

Alegações de fornecedores, e os números de terceiros ao lado delas.

Duas classes de números aparecem nos materiais de lançamento, e elas não devem ser lidas da mesma forma. As próprias avaliações da StepFun são a primeira classe: uma reivindicação de custo de tarefa única de um oitavo do Claude Opus 5; segundo lugar atrás do GPT-6 Astra ou do Claude Opus 5 no ALE-CLI, FrontierFinance e DRACO; uma execução de otimização de kernel de GPU de 24 horas que elevou o desempenho máximo do kernel MLA para 508 TFLOPS contra 493 do Claude Opus 5; um experimento automatizado de pós-treinamento que moveu o Qwen3-30B-A3B de 53,3% para 60% no AIME24; DeepSWE v1.1 em 67,7% e seu StepCodeBench interno em 49,0%. A StepFun construiu o StepCodeBench ela mesma — 553 repositórios de código, nove tipos de tarefas, 33 linguagens de programação — o que o torna um instrumento razoável para medir seu próprio modelo e não um independente.

A segunda classe é medida por outra pessoa, e é a parte com base na qual se planeja. A Artificial Analysis pontua o Step 5 Preview com 44 no Intelligence Index v4.3.2, classificando-o em 24º entre 200 modelos — empatado com o Kimi K3, um ponto atrás do GLM-5.3 e empatado com a configuração de esforço de raciocínio médio do Claude Opus 5. No Terminal-Bench 4.0, o mesmo ranking registra 33,3%, à frente do DeepSeek V4.1 Flash com 26,8% e bem à frente do Kimi K3 com cerca de 12,6%. A velocidade de saída é de 99,8 tokens por segundo e o tempo até o primeiro token é de 2,96 segundos — ambos provenientes da mesma execução independente, e ambos são o tipo de número que decide se um loop de agente parece interativo.

Um número de terceiros aponta no sentido oposto e merece ficar ao lado do preço. A mesma execução do índice usou 160 milhões de tokens de saída para o Step 5 Preview, contra uma mediana de 92 milhões entre os modelos avaliados — o modelo é prolixo. A US$ 2,70 por milhão de tokens de saída, essa verbosidade não é gratuita: 160 milhões de tokens de saída equivalem a cerca de US$ 432 dos US$ 922,84 que a execução custou no total e, em um modelo que cobra três vezes mais, seria a linha dominante da fatura. Um preço anunciado baixo e uma alta contagem de tokens por tarefa são duas metades de um mesmo número, e o custo por tarefa do índice — US$ 0,71 — é o que já contém as duas.

Screenshot of the Artificial Analysis model page for Step 5 Preview, showing StepFun as the creator and a September 2026 release date, an Intelligence Index of 44 at rank 24 of 200, output speed 99.8 tokens per second at rank 45 of 200, cost per Intelligence Index task $0.71 at rank 27 of 200, verbosity 160M output tokens at rank 64 of 200, pricing of $1.00 per million input tokens and $2.70 per million output tokens with a 95% cache discount, and technical specifications listing reasoning, text and image input, and a 1M-token context window.

O que o vazamento acertou, e a única coisa que ele não resolveu

A cobertura anterior deste blog foi escrita a partir de uma execução de avaliação que surgiu antes de qualquer anúncio, e sinalizou as afirmações que não conseguia confirmar. O anúncio resolveu a maioria delas. O par 600B/27B agora é declarado pelo fornecedor, e não inferido. A janela de contexto de 1M tokens agora consta na especificação da própria StepFun, e não apenas em um quadro de terceiros. O preço de US$ 1,00 e US$ 2,70 é o preço. O nome é Step 5 Preview, e não uma alternativa especulada.

O que o anúncio não fez foi resolver a contradição da janela de contexto que a cobertura do vazamento levantou. Uma configuração separada de terceiros que circula em ferramentas de desenvolvedor listava o modelo com 350.000 tokens de contexto e uma saída máxima de 64.000 tokens. Uma janela de 1M e uma janela de 350k são produtos diferentes, com custos de memória diferentes, e um teto de saída de 64k é uma restrição rígida justamente para o trabalho agêntico de longo horizonte para o qual este modelo está sendo vendido. O anúncio da StepFun diz 1M e não menciona um limite de saída. Vale a pena saber em qual delas o seu roteamento vai acabar antes de você construir um pipeline que dependa da resposta, e essa é uma questão para a documentação do fornecedor, e não para um leaderboard.

A outra coisa que o lançamento não mudou é a reprodução independente. Todas as linhas de benchmark acima que não são da Artificial Analysis são da própria StepFun, executadas nos harnesses da StepFun, e nenhum terceiro reproduziu os resultados agênticos. O padrão dos carros-chefe dos laboratórios chineses deste ano é que o índice agregado se sustenta e as linhas de destaque do fornecedor variam; trate o agregado como o número de planejamento.

O que você pode chamar hoje e o que encaminhar enquanto isso

O Step 5 Preview não está no nosso catálogo, e o OrcaRouter não o roteia — há uma API pública e um Studio do lado da StepFun, e é lá que ele roda. O que temos é o conjunto de modelos com os quais ele está sendo comparado, atrás de uma única chave: DeepSeek V4.1 Flash a US$ 0,15 de entrada e US$ 0,60 de saída por milhão, GLM-5.3 a US$ 1,26 e US$ 3,96 contra os US$ 1,40 e US$ 4,40 listados pela Z.ai, Claude Opus 5 a US$ 5,00 e US$ 25,00, e Kimi K3 ao lado deles. Essa é a forma prática das próximas três semanas: uma prévia que você pode usar como referência, e um conjunto de modelos de produção com os quais você pode realmente contar, acessível por uma única API para mais de 200 modelos, com o preço de tabela do provedor repassado com 0% de margem — então, se o preço da StepFun mudar antes de outubro, o valor que você pagaria muda junto no mesmo dia, não na renovação.

O failover automático vale mais do que o habitual nesta janela, porque o modo de falha de um preview não é ser ruim — é ser limitado por capacidade. Um modelo que abriu sua API no dia do anúncio e ainda não tem pesos é um modelo cuja frota de serving ainda está sendo construída, e um endpoint de preview que degrada às 2 da manhã leva o seu loop de agente junto. Coloque o preview atrás de um roteador com um modelo comprovado como fallback e você obtém um sinal de qualidade sobre sua própria carga de trabalho sem apostar um caminho de produção em uma frota não comprovada.

Screenshot of the Hugging Face repository page for stepfun-ai/Step-5-Preview-BF16, showing the repository created on September 20, 2026 with one contributor, a single initial commit and a single file listed, .gitattributes at 1.52 kB, with no model card, no license and no configuration.

A data que importa é 15 de outubro

Tudo o que está acima é provisório de uma forma específica: os pesos são o que torna um modelo permanente. Uma prévia fechada a US$ 1,00 e US$ 2,70 é um bom preço vindo de um único fornecedor, e um checkpoint BF16 sob uma licença publicada é um preço que nenhum fornecedor isolado controla mais. A StepFun se comprometeu com o segundo para 15 de outubro, e o nome do repositório que ela já reservou traz bfloat16 em primeiro lugar.

O que observar entre agora e lá é restrito e verificável. O repositório será preenchido — e com qual licença? Um arquivo de configuração confirma 600B no total e 27B ativos? A StepFun publica o teto de saída junto com a janela de contexto, resolvendo a questão 350k/64k? O preço se mantém quando a prévia perder o sufixo? Essas quatro respostas decidem se o Step 5 Preview se torna um modelo que você hospeda por conta própria, um modelo que você aluga ou um modelo que você avalia uma vez e deixa para trás. Até que o repositório tenha mais do que um .gitattributes dentro dele, o anúncio é o começo da história, e não o fim dela.

Generated two-column infographic titled 'Step 5 Preview — live today vs promised October 15'. The left card 'Callable now' lists rows: API and Studio open September 20, price $1.00 in / $2.70 out, AA Intelligence Index 44, 1M-token context, output speed 99.8 tokens/sec. The right card 'Promised October 15' lists rows: BF16 weights, licence terms, config with parameter counts, output ceiling. A footer reads 'The announcement covers the left card; the right card is unconfirmed until the repository is filled.'

Comparados neste artigo1

Detectado a partir deste artigo · Benchmarks: Artificial Analysis · atualizado diariamente