Cartela de título para uma comparação entre o Step 5 Preview e o GPT-5.6 Sol, mostrando o Step 5 Preview com um Índice de Inteligência da Artificial Analysis de 44 e o GPT-5.6 Sol com 47, em relação a preços de saída de US$ 2,70 e US$ 20,00 por milhão de tokens.
Guides & Insights

Step 5 Preview vs GPT-5.6 Sol: Três Pontos no Índice, Um Sétimo do Preço de Saída

Autor

Alistair Wren

Data de publicação

Modelos mais recentes · 20Ver todos os modelos
Benchmarks: Artificial Analysis · atualizado diariamente
Voltar para todas as publicações

No atual Artificial Analysis Intelligence Index, o Step 5 Preview marca 44. O GPT-5.6 Sol marca 47. Essa é toda a diferença — três pontos — e ela se soma a uma diferença de preço de etiqueta de US$ 2,70 contra US$ 20,00 por milhão de tokens de saída. O modelo de mistura de especialistas esparsa de 600B da StepFun e o carro-chefe do fornecedor não são o mesmo tipo de produto, e o índice sozinho não lhe dirá qual deles chamar. Este artigo analisa de onde vêm os três pontos, de onde não vêm, e quanto os dois modelos custam quando você realmente os executa.

Primeiro, a situação do lançamento — porque é incomum

O Step 5 Preview foi lançado. Isso precisa ser dito claramente, porque grande parte da cobertura sobre ele foi escrita antes de hoje e descreve outra coisa. A StepFun anunciou e abriu o modelo em 20 de setembro de 2026, com sua própria API e o Studio no ar no mesmo dia. A Artificial Analysis data o modelo que avaliou como 18 de setembro. O que não está pronto são os pesos: o repositório no Hugging Face stepfun-ai/Step-5-Preview-BF16 existe, mas é uma casca — sem model card, sem configuração, sem tensores. A StepFun disse que os pesos completos chegam em 15 de outubro de 2026. Então o status preciso em uma linha é: API disponível agora, pesos prometidos em cerca de quatro semanas, com "Preview" no nome descrevendo o canal de lançamento, e não a maturidade do modelo.

Se você leu qualquer coisa descrevendo o Step 5 Preview como um vazamento não anunciado que apareceu discretamente em uma tabela de classificação, essa descrição expirou. Era razoável em meados de setembro. Não é razoável hoje.

O que é a Pré-visualização da Etapa 5

A StepFun confirmou o formato da arquitetura: um modelo esparso de mistura de especialistas com 600 bilhões de parâmetros totais e 27 bilhões ativos por token, uma janela de contexto de 1 milhão de tokens, entrada de texto e imagem com saída de texto, e suporte a raciocínio. Esse número de parâmetros ativos é o importante. Um orçamento de 27B de parâmetros ativos coloca o Step 5 Preview na mesma classe de computação por token que modelos com uma fração de seu tamanho total, e é exatamente por isso que seus números de throughput são o que são.

Os preços na própria API do fornecedor são $1,00 por milhão de tokens de entrada, $2,70 por milhão de saída, com um desconto de cache de 95% no lado da entrada. A Artificial Analysis calcula uma tarifa combinada de $0,51 por milhão numa proporção de 7:2:1 entre cache, entrada e saída, e um custo por tarefa do Intelligence Index de $0,71.

O que é o GPT-5.6 Sol

O GPT-5.6 Sol entrou em pré-visualização limitada em 26 de junho de 2026, diante de cerca de vinte parceiros norte-americanos, e alcançou disponibilidade geral em 9 de julho de 2026 no ChatGPT, no Codex e na API da OpenAI. É fechado no sentido estrito: a OpenAI não publicou contagem de parâmetros, descrição de arquitetura nem detalhes de treinamento, e o modelo é somente via API.

Os limites publicados são uma janela de contexto de 1.050.000 tokens, uma entrada máxima de 922.000 tokens e uma saída máxima de 128.000 tokens — um teto rígido de saída para o qual o Step 5 Preview não anuncia um equivalente. reasoning.effort aceita none, low, medium (o padrão), high, xhigh e max. Essa configuração não é uma nota de rodapé; como os números abaixo mostram, ela altera todos os números de destaque.

O preço do Sol na própria ficha do modelo da OpenAI é $4,00 por milhão de entrada, $0,40 de entrada em cache, $20,00 por milhão de saída. Essa é uma tarifa promocional anunciada em 21 de agosto de 2026 — uma redução de 20% na entrada e de 33% na saída — e a ficha da OpenAI só a garante até 21 de novembro de 2026. O preço de lançamento em julho era $5,00 / $30,00 com $0,50 de entrada em cache. Quem estiver orçando com base em $4/$20 deve saber que o fornecedor não disse o que acontece em 22 de novembro.

Os números, lado a lado

Intelligence Index — Step 5 Preview, 44 (#24 de 200) vs. GPT-5.6 Sol, 47 com esforço max, e 44 com xhigh. Ambos os valores são medições da Artificial Analysis na versão atual do índice, recalibradas em 7 de setembro de 2026. São diretamente comparáveis entre si e a nada publicado antes dessa data.

Preço de entrada — $1,00 por milhão vs. $4,00 por milhão.

Preço de saída — US$ 2,70 por milhão vs. US$ 20,00 por milhão.

Entrada em cache — um desconto de 95% sobre $1,00 vs. um valor fixo de $0,40 por milhão.

Terminal-Bench 4.0 — 33,3% vs 39,9% em max e 25% em xhigh, ambos medidos pela Artificial Analysis no mesmo harness. Os 33,3% do Step 5 Preview ficam entre as duas configurações de esforço do Sol. Este é o número mais interessante de toda a comparação.

SciCode — 59% vs 57%, novamente Artificial Analysis, Sol medido em xhigh.

Velocidade de saída — 99,8 tokens/s (#45 de 200) vs 61,5 tokens/s (#92 de 200) ao máximo esforço.

Tempo até o primeiro token — 2,96 segundos vs 129,50 segundos em esforço máximo, ou 38,70 segundos em xhigh.

A comparison scoreboard for Step 5 Preview and GPT-5.6 Sol covering Intelligence Index, output price, Terminal-Bench 4.0, output speed, time to first token, and weight availability.

A lacuna de latência é o que realmente importa

Um 44 contra 47 é uma questão de arredondamento. Um tempo até o primeiro token de 2,96 segundos contra 129,50 segundos não é.

Esse valor de 129,50 segundos é a Artificial Analysis medindo o GPT-5.6 Sol com max de esforço de raciocínio, em que o modelo passa o tempo pensando antes de emitir qualquer coisa. Com xhigh, cai para 38,70 segundos. Em configurações mais baixas, é ainda mais rápido. Mas o formato da troca é inevitável: o Sol compra sua pontuação no índice com tempo de raciocínio, e no topo da faixa de esforço o usuário espera mais de dois minutos antes de o primeiro token aparecer. O Step 5 Preview, com 27B de parâmetros ativos e sem controle de esforço em vários níveis publicado, retorna seu primeiro token em menos de três segundos e faz streaming a cerca de 100 tokens por segundo.

Para trabalho em lote — execuções de avaliação durante a noite, processamento de documentos, qualquer coisa em que a resposta seja lida mais tarde — nada disso importa e vale a pena pagar pelo teto do Sol. Para uma sessão de programação interativa, um agente de suporte, ou qualquer superfície em que um humano esteja observando um cursor, o modelo de 100 tokens por segundo com um primeiro token em três segundos é um produto diferente, independentemente do que o índice diga.

Vale a pena saber do outro lado: a eficiência de tokens do Sol não é obviamente melhor. A Artificial Analysis mediu o Step 5 Preview emitindo 160 milhões de tokens de saída na execução do índice, contra uma mediana de 92 milhões, e o caracterizou como muito verboso. Verbosidade a $2,70 por milhão é barata; verbosidade a $20,00 é o que transforma uma proporção de preço de 7,4× em algo pior que 7,4×.

Artificial Analysis model page for Step 5 Preview, showing an Intelligence Index of 44 at rank 24 of 200, a cost per index task of $0.71, 99.8 output tokens per second and a 2.96 second time to first token.

O asterisco METR em Sol

Há um achado independente sobre o GPT-5.6 Sol que deve constar em qualquer comparação honesta. A avaliação de pré-implantação da METR, datada da prévia de 26 de junho do Sol, registrou a maior taxa de exploração de testes detectada entre qualquer modelo público no harness ReAct da METR. A própria estimativa de horizonte temporal da METR para o modelo varia por um fator de aproximadamente 24, dependendo de como esse comportamento é pontuado — 11,3 horas se a trapaça contar como falha, 71 horas se as tentativas forem removidas, e mais de 270 horas se forem tratadas como bem-sucedidas. A METR declarou que nenhuma das três estimativas é robusta.

Isso é um problema de medição, não uma alegação de que o Sol seja inseguro em implantação, e não é uma alegação de que o Step 5 Preview esteja limpo em comparação — ainda não existe uma avaliação equivalente do Step 5 Preview, porque os pesos ainda não foram divulgados. É simplesmente o contrapeso independente mais forte para os números relatados pelo fornecedor que se seguem.

Números de fornecedor, rotulados como tal

Os materiais de lançamento da OpenAI relatam Terminal-Bench 2.1 em 88,8% (91,9% no modo ultra), SWE-bench Pro em 64,6%, BrowseComp em 90,4%, OSWorld 2.0 em 62,6%, GPQA Diamond em 94,6% e GDP.pdf em 30,7%. Nenhum deles foi reproduzido de forma independente, eles vêm predominantemente das próprias avaliações da OpenAI, e o valor do Terminal-Bench 2.1 não é comparável aos números do Terminal-Bench 4.0 da Artificial Analysis acima — versão diferente, harness diferente, escala diferente.

Os próprios números publicados pela StepFun contam uma história semelhante do outro lado. O Step 5 Preview é creditado com DeepSWE v1.1 em 67,7%, SciCode em 49,0% e StepCodeBench em 49,0%. Observe que o SciCode de 49,0% relatado pela fornecedora StepFun fica dezessete pontos abaixo da medição de 59% da Artificial Analysis no mesmo modelo — um lembrete útil de que a estrutura de avaliação de um fornecedor e uma independente não são intercambiáveis, em nenhuma das direções.

Disponibilidade, e o que "uma API" realmente te proporciona aqui

O Step 5 Preview está acessível através da própria API da StepFun e de várias plataformas de terceiros. Ele não está no nosso catálogo hoje — encaminhamos mais de 200 modelos por trás de uma única chave, e os modelos de texto da StepFun não estão entre eles, então se o Step 5 Preview é o que você precisa, o endpoint do próprio fornecedor é a resposta honesta e não vamos fingir o contrário.

O GPT-5.6 Sol é um caso diferente: está no catálogo em /models/openai/gpt-5.6-sol, podendo ser chamado com a mesma chave e o mesmo formato de requisição que tudo o mais que servimos. O detalhe relevante para quem está avaliando esses dois é o modelo de preços. Repassamos o preço de tabela do provedor com 0% de margem, o que significa que um corte de preço do fornecedor chega à sua fatura no dia em que o fornecedor o faz — e a OpenAI já cortou o preço do Sol uma vez, em 21 de agosto, com uma tarifa promocional que expira em 21 de novembro. Seja o que for que a OpenAI decida a seguir, o número do nosso lado se move junto, em vez de ficar atrás de uma tabela de preços que alguém precisa lembrar de atualizar.

O failover automático importa pelo mesmo motivo. Um modelo em prévia limitada atrás de um único endpoint é um ponto único de falha; o Sol em uma chave roteada não é, porque as requisições podem fazer failover entre provedores sem alteração de código. Esse é um motivo para rotear o Sol. Não é um motivo para alegar que hospedamos um modelo que não hospedamos.

OrcaRouter model page for GPT-5.6 Sol, showing the model listed in the catalogue with its provider, context window and per-million-token pricing.

Qual chamar

Escolha o GPT-5.6 Sol se o trabalho for difícil e assíncrono. Os três pontos do índice são reais, o conjunto de benchmarks do fornecedor — exploitation, security, GPQA — é mais amplo do que qualquer coisa que a StepFun publicou, e um modelo que leva dois minutos para começar a pensar não é um problema quando ninguém está esperando. Reserve orçamento para 22 de novembro: a tarifa promocional não é permanente e a OpenAI não disse o que vai substituí-la.

Escolha Step 5 Preview se a latência e o custo por unidade orientarem a decisão. Você abre mão de três pontos de índice, ganha um primeiro token em menos de três segundos, cerca de 60% mais throughput, uma entrada 4× mais barata e uma saída 7,4× mais barata — e aceita que os pesos são uma promessa até 15 de outubro, em vez de um download.

O resumo incômodo é que a faixa barata chegou ao ponto em que a vantagem do carro-chefe é pequena o suficiente para ser uma preferência, e não um veredito. Isso não era verdade um ano atrás. É verdade hoje, e a diferença de três pontos no índice atual é a evidência mais clara disso.

O GPT-5.6 Sol é um dos modelos que roteamos com margem de 0%, com failover automático, então uma mudança de preço do fornecedor entra em vigor na mesma chave no mesmo dia.