Cartão de título gerado para o Step 5 Preview com o texto 'Step 5 Preview — o vazamento até agora', listando seis especificações como linhas de rótulo e valor: parâmetros totais cerca de 600B, ativados por inferência cerca de 27B, texto e imagem de entrada, janela de contexto de 1M tokens, AA Intelligence Index 44, e preço $1,00 de entrada e $2,70 de saída por 1M tokens. Um rodapé diz 'Todos os números são de terceiros e não auditados - a StepFun não anunciou este modelo.' O logotipo da OrcaRouter fica no canto inferior direito.
Guides & Insights

Prévia do Step 5: O flagship de 600B não anunciado da StepFun já está no leaderboard

Autor

Elias Hawthorne

Data de publicação

Modelos mais recentes · 20Ver todos os modelos
Benchmarks: Artificial Analysis · atualizado diariamente
Voltar para todas as publicações

Step 5 Preview tem uma posição no ranking, um preço publicado, uma velocidade de saída medida e uma pontuação de 44 no Intelligence Index — a mesma pontuação que Kimi K3, um modelo aproximadamente cinco vezes maior que ele. O que ele não tem é um lançamento. A StepFun não o anunciou, a documentação da própria plataforma da StepFun não o lista, e não há pesos para baixar. Todos os números abaixo vêm de um terceiro que obteve acesso antes de o fornecedor dizer qualquer coisa publicamente, o que torna isto um artigo do tipo "o que sabemos até agora", e não uma análise. Leia os números como evidência do que está por vir, não como uma ficha técnica.

O vazamento é a história

O primeiro vestígio público do Step 5 Preview é uma execução de avaliação. A Artificial Analysis tem uma página de modelo ao vivo para ele, pontuada por meio da própria API da StepFun sob a tag de teste step-5-preview-b, com a plataforma datando o modelo como 18 de setembro de 2026. É dessa página que vêm o 44, o preço, a medição de velocidade e as linhas de benchmark neste artigo.

Em contrapartida, o lado do fornecedor está vazio. A documentação para desenvolvedores da StepFun lista modelos até o Step 3.7 Flash e o Step 3.5 Flash e para por aí — nenhum step-5, nenhuma entrada de prévia. A organização stepfun-ai no Hugging Face não tem nenhum repositório do Step 5, o que é consistente com um carro-chefe de pesos fechados, e não com um descuido. Relatos da comunidade em fóruns de desenvolvedores chineses apontam para uma possível revelação no evento AGI Frontier em Xangai, em 19 de setembro, o que seria cerca de um dia depois de as avaliações surgirem. Até o momento em que este texto foi escrito, ninguém fora da StepFun tem uma especificação oficial, um preço oficial ou um nome oficial para a versão que será lançada.

A própria nomenclatura já é a primeira pista de que isto é uma prévia e não um lançamento. A StepFun pulou totalmente a linha Step 4.x e foi para o Step 5. Um modelo lançado sob um sufixo Preview, avaliado por benchmarks antes mesmo de ter uma página de produto, é um modelo que o fornecedor ainda está calibrando — preços, roteamento e limites podem todos mudar antes da disponibilidade geral.

Como é a especificação, até onde se pode saber

Estes são os números que circulam, e são as alegações mais repetidas da fuga de informação — o que não é o mesmo que as mais confirmadas:

• Parâmetros totais — cerca de 600B, contra aproximadamente 2,8T do Kimi K3

• Ativados por inferência — cerca de 27B, aproximadamente 4,5% do total, uma proporção de mistura de especialistas excepcionalmente esparsa

• Modalidades de entrada — texto e imagens; a saída é apenas texto

• Raciocínio — sim, com pensamento estendido

• Janela de contexto — 1M tokens no Artificial Analysis; uma configuração separada de terceiros que circula em ferramentas de desenvolvedores lista 350.000 com saída máxima de 64.000

• Disponibilidade de peso — fechado, sem repositório

Essa contradição da janela de contexto merece ser destacada de forma clara, porque ninguém a resolveu. Uma janela de 1M de tokens e uma janela de 350k tokens são produtos diferentes, com custos de memória diferentes, e o segundo número vem com um limite de saída de 64k sobre o qual o primeiro não diz nada. Se você está planejando um pipeline de documentos longos com base no número de 1M, a configuração de 350k é o motivo para esperar por uma página do fornecedor. A contagem de parâmetros tem uma imprecisão semelhante: o rastreador do DataLearner ainda registra a arquitetura MoE e as contagens de parâmetros do Step 5 Preview como indisponíveis, o que significa que o par 600B/27B — o fato mais citado sobre este modelo — é também um dos menos confirmados oficialmente.

O número interessante é 27B, não 600B

Modelos esparsos de mistura de especialistas só gastam computação nos especialistas para os quais um token de fato é roteado, então o número de parâmetros ativados é o que rege como o modelo se comporta em produção. Com cerca de 27B ativos, o Step 5 Preview realiza trabalho por token na mesma faixa que modelos com uma fração do seu tamanho, enquanto o total de 600B é, em grande parte, uma questão de pegada de memória.

Duas consequências decorrem disso, e ambas aparecem nas medições de terceiros. O custo de servir acompanha os parâmetros ativados, o que é parte do motivo pelo qual o preço está onde está. E a velocidade por token também se beneficia: a Artificial Analysis mede 99,8 tokens de saída por segundo, ficando em 42º lugar entre 200 modelos, contra uma mediana de 64,6. O tempo até o primeiro token é de 2,96 segundos, contra uma mediana de cerca de 3,57 segundos. Se a divisão 600B/27B estiver correta, este é um modelo projetado para ser barato de servir, e não barato de hospedar — uma distinção importante se você é quem paga pelas GPUs, e não pelos tokens.

Onde ele se posiciona no Intelligence Index

A Artificial Analysis pontua o Step 5 Preview com 44 no Intelligence Index v4.3, que incorpora dez avaliações. Isso o coloca em 25º entre 200 modelos no ranking e bem acima do modelo mediano pontuado pelo índice, que fica em 25.

• Índice de Inteligência — Step 5 Preview 44 vs Kimi K3 44

• Imediatamente acima — GLM-5.3 e Claude Opus 5, ambos com 45

• Logo abaixo — DeepSeek V4.1 Flash em 40 e DeepSeek V4 Pro em 36

• Terminal-Bench 4.0 — Step 5 Preview 33,3% contra Kimi K3 com aproximadamente 12,6%, e contra DeepSeek V4.1 Flash com 26,8%

• SciCode — 59% para Step 5 Preview, empatado com Kimi K3

• Velocidade de saída — 99,8 tokens por segundo vs. uma mediana do setor de 64,6

A manchete é o empate com o Kimi K3, e a leitura honesta é mais restrita do que as manchetes sugerem. Igualar um modelo de 2,8T de parâmetros em um índice agregado com 600B no total é um resultado real de eficiência, mas o agregado esconde o formato disso: a diferença no Terminal-Bench 4.0 favorecendo o Step 5 Preview é dramática, enquanto o resultado no SciCode é um empate absoluto. Paridade agregada em um índice não é paridade em toda parte, e uma build de prévia é o momento menos confiável para presumir que as diferenças se manterão.

Mais uma discrepância que vale a pena mencionar: a Artificial Analysis reporta 44, enquanto o rastreador independente da DataLearner registra a mesma execução como 43,6. É uma diferença de arredondamento, e não um desacordo sobre capacidade, mas é o tipo de coisa que reforça o ponto sobre os números deste modelo em geral — são leituras de terceiros de um modelo não anunciado, feitas em momentos ligeiramente diferentes, e nenhuma delas foi confirmada pela StepFun. Nenhum desses benchmarks é reportado pelo fornecedor, o que é uma faca de dois gumes: ninguém na StepFun reivindicou um número aqui, e ninguém na StepFun deu respaldo a nenhum deles também.

Screenshot of the Artificial Analysis model page for Step 5 Preview, headed 'Step 5 Preview Intelligence, Performance & Price Analysis', showing StepFun as the creator, a release date of September 2026, an Intelligence Index of 44 at rank 25 of 200, an output speed of 99.8 tokens per second at rank 42 of 200, input pricing of $1.00 and output pricing of $2.70 per million tokens with a 95% cache discount, $0.71 per Intelligence Index task, verbosity of 160M output tokens, and technical specifications listing reasoning as supported, input modality as text plus image, and a 1M token context window.

O preço, e a verbosidade que o corrói.

A precificação é a parte deste vazamento que afetará um orçamento mais rapidamente. Por meio da API da StepFun, a Artificial Analysis registra o seguinte:

• Entrada — $1,00 por milhão de tokens, em comparação com uma mediana de $1,88 para modelos comparáveis

• Saída — $2,70 por milhão de tokens, contra uma mediana de $10,00

• Cache — um desconto de cache de 95%, deixando os hits de cache em cerca de US$ 0,05 por milhão de tokens

• Combinado — cerca de $0,51 por milhão de tokens em uma proporção de 7:2:1 de acertos de cache para entrada para saída

• Custo por tarefa do Intelligence Index — $0,71

• Custo de uma execução completa de indexação — $918,34 no total

A saída a $2,70 é a linha que mais importa, porque fica abaixo de um quinto do que a Kimi K3 cobra pelos mesmos milhões de tokens a $15,00. Mas há um detalhe que uma comparação por token esconde, e a Artificial Analysis o mede diretamente: verbosidade. O Step 5 Preview gerou 160M de tokens de saída para completar o Intelligence Index, contra uma mediana de 90M para o setor e uma posição de 65º de 200 nessa medida.

Faça as contas. A $2,70 por milhão, 160M tokens de saída custam cerca de $432 — aproximadamente metade do custo total de $918,34 de toda a execução do índice, gasto na verbosidade do próprio modelo, e não nas tarefas. Passe os mesmos 160M tokens pela tarifa de saída de $15,00 do Kimi K3 e você chega a $2.400, que é de onde vem a vantagem de preço. Mas o alerta prático é para quem estima custos extraindo uma contagem de tokens de um modelo diferente: o Step 5 Preview escreve cerca de 1,8 vez a mediana, então uma carga de trabalho com muita saída compra a tarifa mais barata e mais tokens ao mesmo tempo. O desconto sobrevive, mas é menor do que $1,00/$2,70 contra $3,00/$15,00 faz parecer, e o tamanho dele depende inteiramente de quão tagarela seus prompts tornam o modelo.

O desconto de cache de 95% é a outra alavanca, e é incomumente agressivo. Uma carga de trabalho com reutilização intensa de prompt — um prompt de sistema longo, um documento fixo, uma base de código compartilhada — fica muito mais próxima do valor combinado de $0,51 do que da taxa de entrada de $1,00. Esse valor combinado pressupõe uma proporção de 7:2:1, que é uma suposição de modelagem e não uma garantia, mas é o formato de cálculo certo para aplicar ao seu próprio tráfego.

A generated two-column comparison scoreboard titled 'Step 5 Preview vs Kimi K3 — the scoreboard'. The left column gives Step 5 Preview the rows AA Index 44, total params about 600B, active params about 27B, Terminal-Bench 4.0 33.3%, SciCode 59%, and price $1.00 / $2.70. The right column gives Kimi K3 the rows AA Index 44, total params about 2.8T, active params not disclosed, Terminal-Bench 4.0 about 12.6%, SciCode 59%, and price $3.00 / $15.00. A footer reads 'Step 5 Preview figures third-party via Artificial Analysis and unaudited; Kimi K3 figures per Artificial Analysis. Prices per 1M tokens.' The OrcaRouter logo sits in the bottom-right corner.

O que os primeiros testadores estão enfrentando

Estes são relatos individuais de fóruns de desenvolvedores e postagens em redes sociais nos dias em torno do vazamento, não medições, e devem ser ponderados de acordo:

• A chamada de ferramentas é a reclamação mais comum — nomes de ferramentas errados são selecionados e edições são tentadas sem ler primeiro o arquivo de destino

• Erros relatados após aproximadamente 340.000 tokens de contexto, que é o modo de falha a observar se a janela de 1M se revelar o número real

• Filtragem de conteúdo truncando saídas em alguns prompts

• Impressões sobre capacidade divergem: alguns testadores o colocam acima do GLM-5.3 Flash, outros o colocam abaixo do DeepSeek V4.1 Flash

Uma build de pré-visualização não lançada falhar no uso de ferramentas não é um escândalo — é exatamente para isso que serve o rótulo de pré-visualização. Mas isso significa que o 44 não deve ser lido como uma promessa de fiabilidade agêntica, porque o Intelligence Index não testa aquilo de que os primeiros testadores mais se queixam.

Como você realmente chamaria isso — e o que usar nesse meio-tempo

O OrcaRouter não roteia o Step 5 Preview. Não há endpoint público nem pesos, então não há nada para rotear, e nenhuma plataforma de terceiros pode afirmar o contrário com honestidade por enquanto. Quem lhe disser hoje onde chamá-lo está descrevendo um endpoint de avaliação, não um produto.

Os modelos com os quais ele está sendo comparado são outra questão. Kimi K3, GLM-5.3 e DeepSeek V4.1 Flash estão todos disponíveis pelo OrcaRouter, ao lado de 199 modelos de 15 provedores, por trás de uma única chave de API e uma única fatura. Os preços são repassados pelo preço de tabela do provedor com 0% de margem, o que importa mais do que o habitual em um modelo como este: se o preço de US$ 1,00/US$ 2,70 do Step 5 Preview se mantiver no lançamento e depois mudar, uma rota de repasse muda no mesmo dia, e não conforme o calendário de reajuste de outra pessoa.

Quando ele se tornar chamável, a forma sensata de executar um modelo próximo de um não lançado é a mesma forma como você executaria qualquer modelo em que ainda não confia — atrás de uma rota com failover automático, para que uma falha de chamada de ferramenta ou um erro de contexto longo recaia sobre um modelo que funciona, em vez de derrubar sua aplicação junto. Esse é o padrão que os primeiros relatos defendem aqui especificamente: uma build de pré-visualização com problemas relatados de chamada de ferramentas e erros de contexto longo é exatamente o modelo que você quer que tenha um fallback por trás, não um que você quer em um caminho de produção sozinho.

Screenshot of the OrcaRouter models page at www.orcarouter.ai/models showing 199 models from 15 providers behind one API key and one bill, with filters for input modalities, context length, input price, status, series and supported parameters, and a 'How to call any model' card showing a POST request to the OrcaRouter chat completions endpoint.

O que transformaria isto de um vazamento em um lançamento?

Três coisas a observar, em ordem de quanto elas resolveriam. Primeiro, uma página de modelo e preços na própria plataforma de desenvolvedor da StepFun — no momento em que step-5 aparecer na lista de modelos, a ficha técnica do fornecedor substitui todas as leituras de terceiros neste artigo, incluindo o par 600B/27B e a alegação de contexto de 1M. Segundo, a resolução da contradição entre contexto de 1M e 350k; um limite de saída de 64k sob uma janela de 1M é uma diferença significativa para quem constrói pipelines de documentos longos ou agênticos, e atualmente não está resolvido. Terceiro, se o preço é uma postura de lançamento ou uma linha permanente — preços de pré-visualização em modelos emblemáticos chineses têm histórico de mudar quando a capacidade fica apertada, e US$ 2,70 por milhão de tokens de saída é agressivo o suficiente para suscitar essa questão.

Até que pelo menos o primeiro desses se concretize, o resumo honesto é que o Step 5 Preview parece um modelo genuinamente eficiente — 600B no total realizando trabalho agregado de classe 2,8T, a um preço que fica várias vezes abaixo do mercado — com uma especificação não verificada, um custo real de verbosidade e uma reputação em chamada de ferramentas que ainda não foi conquistada. Vale a pena planejar em torno disso. Ainda não vale a pena apostar um caminho de produção nisso.

Comparados neste artigo4

Detectado a partir deste artigo · Benchmarks: Artificial Analysis · atualizado diariamente