
Step 5 Preview é anunciado: o que o modelo carro-chefe de 600B da StepFun realmente entrega, e o que ainda falta
- OrcaNOVOOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 por 1M de tokens
- orcaNOVOOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 por 1M de tokens
- deepseekNOVODeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligência
- openaiOpenAI: GPT-6 Astra2026-09-0453Inteligência77Código
- googleGoogle: Gemini 3.8 Flash2026-09-0241Inteligência76Código
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Inteligência76Código
- anthropicAnthropic: Claude Fable 5.12026-09-0153Inteligência82Código
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 por 1M de tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligência72Código
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 por 1M de tokens
- z-aiZ.ai: GLM 5.32026-08-1845Inteligência75Código
- obsidianQwen3.8 27B2026-08-1534Inteligência68Código
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Inteligência69Código
- grokSpaceXAI: Grok 4.62026-08-1244Inteligência77Código
- metaMeta: Muse Spark 1.22026-08-0540Inteligência72Código
- qwenQwen: Qwen3.8 Max2026-08-0345Inteligência76Código
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135Inteligência69Código
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 por 1M de tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
A StepFun anunciou o Step 5 Preview em 20 de setembro de 2026 — um modelo carro-chefe esparso de mistura de especialistas com 600 bilhões de parâmetros, com 27B parâmetros ativos por token, uma janela de contexto de 1M de tokens, entrada de imagem nativa e uma pontuação de 44 no Artificial Analysis Intelligence Index. A API foi aberta no mesmo dia. O que não foi aberto é o próprio modelo: o repositório do Hugging Face stepfun-ai/Step-5-Preview-BF16 já existia na tarde do anúncio e contém exatamente um arquivo, .gitattributes, sem pesos, sem licença, sem cartão de modelo e sem configuração. Os próprios materiais da StepFun colocam o lançamento de pesos abertos em 15 de outubro de 2026. Então, o resumo honesto de uma linha deste lançamento é que o modelo é chamável hoje e baixável em cerca de três semanas e meia, e essas são duas coisas diferentes. Este também é o mesmo modelo que este blog cobriu mais cedo hoje como um vazamento não anunciado, com benchmark sob uma tag de teste antes de a StepFun ter publicado uma página de produto — um lembrete útil de que uma prévia pode passar de vazamento para lançamento sem que um único número mude.
O repositório é um placeholder, e essa é a história.
Quando um fornecedor publica pesos, o repositório é a evidência. Ele tem um arquivo de licença, uma configuração com uma contagem de parâmetros nela, um README com o uso pretendido e a tabela de avaliação, e shards safetensors cujo tamanho total informa se a alegação de parâmetros é real. stepfun-ai/Step-5-Preview-BF16 não tem nada disso. O registro da API do Hugging Face para ele mostra um carimbo de data/hora de criação de 2026-09-20T03:52Z, zero downloads, dois likes, um objeto de configuração vazio, nenhum pipeline_tag, nenhuma licença e um único arquivo irmão. A página da organização StepFun o lista, e não lista nenhum outro repositório Step 5 — nenhuma build FP8, nenhuma build NVFP4, nenhum GGUF, nenhuma das variantes de quantização que acompanharam o Step-3.7-Flash em junho.
Leia isso como uma questão de cronograma, não como um mistério. O sufixo BF16 no nome do repositório é a pista reveladora: um laboratório que pretende publicar primeiro um checkpoint bfloat16 — o formato a partir do qual você faz fine-tuning e quantização, antes de chegarem as builds de serving FP8 e NVFP4 — nomeia o repositório assim no momento da criação e o preenche depois. A StepFun declarou 15 de outubro em seus próprios materiais de anúncio. Até lá, o repositório é uma afirmação sobre uma intenção, e a única coisa que ele prova é que a StepFun reservou o namespace.
Isso importa por uma razão prática. O Preview sufixo e os pesos ausentes são o mesmo sinal apontando na mesma direção: o modelo pode ser chamado, os preços estão definidos, e o artefato que você executaria em seu próprio hardware ainda não existe. Qualquer plano que pressuponha um Step 5 Preview auto-hospedado antes de meados de outubro é um plano sem artefato por trás.
O que foi realmente anunciado
O posicionamento da StepFun é restrito e específico: o Step 5 Preview é um modelo base para trabalho agêntico do mundo real — codificação com IA, engenharia de software, trabalho de conhecimento profissional e finanças —, com ênfase em contexto longo, chamadas de ferramentas em múltiplos turnos e execução sustentada, em vez de qualidade de chat. A empresa pulou completamente a linha Step 4.x, indo do Step-3.7-Flash direto para o Step 5, o que, por si só, é uma declaração sobre o tamanho do passo que ela considera que isso representa.
Vale destacar um detalhe de data, porque é o tipo de coisa que atrapalha um calendário de compras: a Artificial Analysis data este modelo como 18 de setembro de 2026, dois dias antes do anúncio da própria StepFun. O board pontua um modelo quando consegue acessá-lo, e essa lacuna de dois dias é o atraso comum entre um modelo se tornar chamável e um fornecedor escrever sobre ele. O anúncio da StepFun — 20 de setembro, com a API e o Studio abrindo no mesmo dia — é a data a citar, e a data dos pesos, 15 de outubro, vem dos mesmos materiais.
A especificação conforme publicada:
• Parâmetros totais — 600B, mistura esparsa de especialistas
• Ativos por token — 27B, cerca de 4,5% do total, uma proporção incomumente esparsa
• Janela de contexto — 1M tokens
• Entrada — texto e imagens nativamente; a saída é apenas texto
• Raciocínio — sim, com pensamento estendido
• Preço — $1,00 por milhão de tokens de entrada, $2,70 por milhão de tokens de saída, com 95% de desconto no cache
• Disponibilidade — API e Studio disponíveis a partir de 20 de setembro; pesos programados para 15 de outubro
A alegação de eficiência com que a StepFun está liderando é que a divisão 600B/27B coloca o modelo na fronteira de Pareto — capacidade por unidade de computação — e a empresa a apresenta como três gerações da mesma busca, do Step-3.5-Flash ao Step-3.7-Flash até este. É uma história coerente, e a proporção de esparsidade é o mecanismo: com 27B ativos, o custo de serviço por token fica na faixa de um modelo muito menor, enquanto o total de 600B é sobretudo uma questão de pegada de memória.
Alegações de fornecedores, e os números de terceiros ao lado delas.
Duas classes de números aparecem nos materiais de lançamento, e elas não devem ser lidas da mesma forma. As próprias avaliações da StepFun são a primeira classe: uma reivindicação de custo de tarefa única de um oitavo do Claude Opus 5; segundo lugar atrás do GPT-6 Astra ou do Claude Opus 5 no ALE-CLI, FrontierFinance e DRACO; uma execução de otimização de kernel de GPU de 24 horas que elevou o desempenho máximo do kernel MLA para 508 TFLOPS contra 493 do Claude Opus 5; um experimento automatizado de pós-treinamento que moveu o Qwen3-30B-A3B de 53,3% para 60% no AIME24; DeepSWE v1.1 em 67,7% e seu StepCodeBench interno em 49,0%. A StepFun construiu o StepCodeBench ela mesma — 553 repositórios de código, nove tipos de tarefas, 33 linguagens de programação — o que o torna um instrumento razoável para medir seu próprio modelo e não um independente.
A segunda classe é medida por outra pessoa, e é a parte com base na qual se planeja. A Artificial Analysis pontua o Step 5 Preview com 44 no Intelligence Index v4.3.2, classificando-o em 24º entre 200 modelos — empatado com o Kimi K3, um ponto atrás do GLM-5.3 e empatado com a configuração de esforço de raciocínio médio do Claude Opus 5. No Terminal-Bench 4.0, o mesmo ranking registra 33,3%, à frente do DeepSeek V4.1 Flash com 26,8% e bem à frente do Kimi K3 com cerca de 12,6%. A velocidade de saída é de 99,8 tokens por segundo e o tempo até o primeiro token é de 2,96 segundos — ambos provenientes da mesma execução independente, e ambos são o tipo de número que decide se um loop de agente parece interativo.
Um número de terceiros aponta no sentido oposto e merece ficar ao lado do preço. A mesma execução do índice usou 160 milhões de tokens de saída para o Step 5 Preview, contra uma mediana de 92 milhões entre os modelos avaliados — o modelo é prolixo. A US$ 2,70 por milhão de tokens de saída, essa verbosidade não é gratuita: 160 milhões de tokens de saída equivalem a cerca de US$ 432 dos US$ 922,84 que a execução custou no total e, em um modelo que cobra três vezes mais, seria a linha dominante da fatura. Um preço anunciado baixo e uma alta contagem de tokens por tarefa são duas metades de um mesmo número, e o custo por tarefa do índice — US$ 0,71 — é o que já contém as duas.

O que o vazamento acertou, e a única coisa que ele não resolveu
A cobertura anterior deste blog foi escrita a partir de uma execução de avaliação que surgiu antes de qualquer anúncio, e sinalizou as afirmações que não conseguia confirmar. O anúncio resolveu a maioria delas. O par 600B/27B agora é declarado pelo fornecedor, e não inferido. A janela de contexto de 1M tokens agora consta na especificação da própria StepFun, e não apenas em um quadro de terceiros. O preço de US$ 1,00 e US$ 2,70 é o preço. O nome é Step 5 Preview, e não uma alternativa especulada.
O que o anúncio não fez foi resolver a contradição da janela de contexto que a cobertura do vazamento levantou. Uma configuração separada de terceiros que circula em ferramentas de desenvolvedor listava o modelo com 350.000 tokens de contexto e uma saída máxima de 64.000 tokens. Uma janela de 1M e uma janela de 350k são produtos diferentes, com custos de memória diferentes, e um teto de saída de 64k é uma restrição rígida justamente para o trabalho agêntico de longo horizonte para o qual este modelo está sendo vendido. O anúncio da StepFun diz 1M e não menciona um limite de saída. Vale a pena saber em qual delas o seu roteamento vai acabar antes de você construir um pipeline que dependa da resposta, e essa é uma questão para a documentação do fornecedor, e não para um leaderboard.
A outra coisa que o lançamento não mudou é a reprodução independente. Todas as linhas de benchmark acima que não são da Artificial Analysis são da própria StepFun, executadas nos harnesses da StepFun, e nenhum terceiro reproduziu os resultados agênticos. O padrão dos carros-chefe dos laboratórios chineses deste ano é que o índice agregado se sustenta e as linhas de destaque do fornecedor variam; trate o agregado como o número de planejamento.
O que você pode chamar hoje e o que encaminhar enquanto isso
O Step 5 Preview não está no nosso catálogo, e o OrcaRouter não o roteia — há uma API pública e um Studio do lado da StepFun, e é lá que ele roda. O que temos é o conjunto de modelos com os quais ele está sendo comparado, atrás de uma única chave: DeepSeek V4.1 Flash a US$ 0,15 de entrada e US$ 0,60 de saída por milhão, GLM-5.3 a US$ 1,26 e US$ 3,96 contra os US$ 1,40 e US$ 4,40 listados pela Z.ai, Claude Opus 5 a US$ 5,00 e US$ 25,00, e Kimi K3 ao lado deles. Essa é a forma prática das próximas três semanas: uma prévia que você pode usar como referência, e um conjunto de modelos de produção com os quais você pode realmente contar, acessível por uma única API para mais de 200 modelos, com o preço de tabela do provedor repassado com 0% de margem — então, se o preço da StepFun mudar antes de outubro, o valor que você pagaria muda junto no mesmo dia, não na renovação.
O failover automático vale mais do que o habitual nesta janela, porque o modo de falha de um preview não é ser ruim — é ser limitado por capacidade. Um modelo que abriu sua API no dia do anúncio e ainda não tem pesos é um modelo cuja frota de serving ainda está sendo construída, e um endpoint de preview que degrada às 2 da manhã leva o seu loop de agente junto. Coloque o preview atrás de um roteador com um modelo comprovado como fallback e você obtém um sinal de qualidade sobre sua própria carga de trabalho sem apostar um caminho de produção em uma frota não comprovada.

A data que importa é 15 de outubro
Tudo o que está acima é provisório de uma forma específica: os pesos são o que torna um modelo permanente. Uma prévia fechada a US$ 1,00 e US$ 2,70 é um bom preço vindo de um único fornecedor, e um checkpoint BF16 sob uma licença publicada é um preço que nenhum fornecedor isolado controla mais. A StepFun se comprometeu com o segundo para 15 de outubro, e o nome do repositório que ela já reservou traz bfloat16 em primeiro lugar.
O que observar entre agora e lá é restrito e verificável. O repositório será preenchido — e com qual licença? Um arquivo de configuração confirma 600B no total e 27B ativos? A StepFun publica o teto de saída junto com a janela de contexto, resolvendo a questão 350k/64k? O preço se mantém quando a prévia perder o sufixo? Essas quatro respostas decidem se o Step 5 Preview se torna um modelo que você hospeda por conta própria, um modelo que você aluga ou um modelo que você avalia uma vez e deixa para trás. Até que o repositório tenha mais do que um .gitattributes dentro dele, o anúncio é o começo da história, e não o fim dela.

Comparados neste artigo1
Detectado a partir deste artigo · Benchmarks: Artificial Analysis · atualizado diariamente
