
Step 5 Preview vs GPT-6 Astra: Dez Vezes o Preço de Entrada por Nove Pontos de Índice
- OrcaNOVOOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 por 1M de tokens
- orcaNOVOOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 por 1M de tokens
- deepseekNOVODeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligência
- openaiOpenAI: GPT-6 Astra2026-09-0453Inteligência77Código
- googleGoogle: Gemini 3.8 Flash2026-09-0241Inteligência76Código
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Inteligência76Código
- anthropicAnthropic: Claude Fable 5.12026-09-0153Inteligência82Código
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 por 1M de tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligência72Código
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 por 1M de tokens
- z-aiZ.ai: GLM 5.32026-08-1845Inteligência75Código
- obsidianQwen3.8 27B2026-08-1534Inteligência68Código
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Inteligência69Código
- grokSpaceXAI: Grok 4.62026-08-1244Inteligência77Código
- metaMeta: Muse Spark 1.22026-08-0540Inteligência72Código
- qwenQwen: Qwen3.8 Max2026-08-0345Inteligência76Código
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135Inteligência69Código
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 por 1M de tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
Esses dois modelos foram anunciados com dezessete dias de diferença e com preços de planetas diferentes. Step 5 Preview, o modelo esparso de mistura de especialistas de 600B parâmetros da StepFun, anunciado em 20 de setembro de 2026, cobra US$ 1,00 por milhão de tokens de entrada e US$ 2,70 por milhão de tokens de saída. GPT-6 Astra, o carro-chefe do fornecedor, lançado em 3 de setembro de 2026, cobra US$ 10,00 e US$ 50,00 pelas mesmas unidades abaixo de um limite de 272K tokens de entrada — e US$ 20,00 e US$ 75,00 acima disso. Isso representa dez vezes o preço de entrada e cerca de dezoito vezes o preço de saída para um modelo que marca nove pontos a mais no Intelligence Index independente, 53 contra 44. Não se questiona se a Astra é melhor. Se a diferença vale trinta dólares extras por milhão de tokens de saída na sua carga de trabalho é o que está em questão, e a resposta muda duas vezes ao longo deste artigo.
Para que serve cada modelo
O Step 5 Preview foi construído e é vendido para trabalho agêntico: programação com IA, engenharia de software, trabalho de conhecimento profissional, finanças. A arquitetura foi ajustada para isso — 600B de parâmetros totais com cerca de 27B ativos por token, um contexto de 1M de tokens, entrada de texto e imagem, e raciocínio com pensamento estendido. A StepFun pulou toda a linha Step 4.x para chegar aqui, passando diretamente do Step-3.7-Flash para o Step 5.
GPT-6 Astra é o carro-chefe de uso geral da OpenAI: um contexto de 1M de tokens, até 128K tokens de saída, entrada em texto, imagens e arquivos, saída em texto, data de corte de conhecimento em 30 de abril de 2026, e suporte para raciocínio, codificação e fluxos de trabalho agênticos. É o modelo que uma empresa busca quando a resposta precisa estar certa e a conta de tokens não é a restrição limitante.
• Índice de Inteligência — Step 5 Preview 44 vs GPT-6 Astra 53
• Parâmetros — Step 5 Preview: 600B no total / 27B ativos vs GPT-6 Astra não divulgado
• Contexto e teto de saída — ambos com contexto de 1M de tokens; a Astra lista uma janela de 1.050.000 tokens e um teto de saída de 128K, a StepFun não publicou nenhum teto de saída
• Modalidade de entrada — texto e imagens vs texto, imagens e arquivos
• Velocidade de saída — Step 5 Preview 99,8 tokens/seg vs GPT-6 Astra 59,3 tokens/seg
• Preço por 1M de tokens — $1,00 de entrada / $2,70 de saída vs $10,00 de entrada / $50,00 de saída abaixo de 272K de entrada, subindo para $20,00 / $75,00 acima disso
• Cache — Step 5 Preview com desconto de 95% vs GPT-6 Astra com desconto de leitura de 90% e uma taxa de escrita de cache de $12,50 por milhão
• Custo por tarefa do Intelligence Index — Step 5 Preview $0,71 vs GPT-6 Astra $3,26

A fatura, linha por linha
O preço do Step 5 Preview é fixo e barato: US$ 1,00 de entrada, US$ 2,70 de saída, com um desconto de cache de 95% que deixa a entrada em cache perto de US$ 0,05 por milhão de tokens. Em uma mistura 7:2:1 de acertos de cache, entrada e saída — a convenção que este blog usa para tráfego de agentes —, a taxa combinada fica perto de US$ 0,51 por milhão de tokens, e o custo por tarefa do Intelligence Index chega a US$ 0,71, 27º de 200. A ressalva é a verbosidade: o modelo produziu 160 milhões de tokens de saída nesse Index contra uma mediana de 92 milhões, então as contagens brutas de tokens ficam acima do que o preço de tabela sugere.
O preço do GPT-6 Astra é escalonado, e o nível é a parte que vale a pena ler com atenção. Abaixo de 272K tokens de entrada por requisição, são $10,00 e $50,00; acima disso, $20,00 e $75,00. O nível é selecionado pela contagem de tokens de entrada de cada requisição, o que importa mais do que parece para um modelo vendido com contexto de 1M de tokens — uma única chamada de contexto grande cruza a linha e dobra a tarifa da requisição inteira. Leituras de cache custam $1,00 por milhão, um desconto de 90%, e gravações de cache custam $12,50 por milhão. Na mesma mistura 7:2:1, a tarifa combinada fica perto de $7,70 por milhão de tokens, e o custo por tarefa Index é $3,26, 71º de 200.
No que diz respeito à verbosidade, a Astra vai na direção oposta e é o modelo conciso aqui: 60M de tokens de saída no Index, contra os 160M do Step 5 Preview, 27º de 200 nessa métrica. Uma quantidade menor de tokens a uma taxa mais alta reduz a lacuna de uma forma que o múltiplo bruto exagera. Ela não fecha essa lacuna — o número de custo por tarefa já leva em conta, em conjunto, a verbosidade, o comportamento de cache e a precificação, e US$ 3,26 contra US$ 0,71 ainda é uma diferença de 4,6 vezes.
O que os nove pontos do índice compram
Os números de destaque da Astra são da própria OpenAI e não foram reproduzidos: 96,1 no GPQA Diamond, 72,6% no OSWorld 2.0, 97,6% no FrontierMath Tier 4, 57,2% no Humanity's Last Exam com ferramentas, e cerca de 57,9% no Terminal-Bench 4.0. O valor do ARC-AGI-3 é o que deve ser tratado com cuidado — a OpenAI relata 99,9% sob seu próprio harness de adaptador de provedor e 62,7% no harness padrão, e uma variação de 37 pontos entre harnesses é uma afirmação sobre o harness pelo menos tanto quanto sobre o modelo.
Os números publicados do Step 5 Preview situam-se no mesmo território nas tarefas agênticas para as quais foi criado, e trazem a mesma ressalva: 33,3% no Terminal-Bench 4.0, 80,5 no ProgramBench, 67,7 no DeepSWE v1.1 e 49,0 no StepCodeBench, todos da StepFun e nenhum reproduzido de forma independente. Fornecedores diferentes, harnesses diferentes, nenhuma execução compartilhada — e é exatamente por isso que a lacuna de nove pontos medida de forma independente é um número mais útil do que qualquer um destes.
Essa diferença é real e não é pequena. Em um ranking de 200 modelos, 53 e 44 ocupam a terceira e a vigésima quarta posição, e a separação aparece como uma classe diferente de tarefa, em vez de uma pontuação diferente na mesma tarefa: as vitórias publicadas da Astra se concentram em raciocínio de longo horizonte e uso de computador, que é onde o topo do ranking se distancia. Se a sua carga de trabalho está aí, os nove pontos valem mais do que a fatura.
Uma ressalva sobre a pontuação da Astra. A Artificial Analysis revisa o Intelligence Index, e os números para o mesmo modelo variam entre instantâneos tirados com semanas de diferença — 52,8, 53 e 54,7 aparecem todos em materiais publicados sobre esse modelo no mesmo mês. O 53 na página atual do modelo é o número a ser usado, e qualquer comparação que coloque um instantâneo mais antigo da Astra ao lado de um número atual do Step 5 Preview está medindo com duas réguas diferentes.

Velocidade e latência são duas questões diferentes
Na velocidade de geração, o painel independente é inequívoco: 99,8 tokens de saída por segundo para o Step 5 Preview contra 59,3 para o GPT-6 Astra, que também é mais lento do que a média de 70 tokens por segundo entre os modelos medidos. Em um ciclo de codificação interativo, essa é a diferença entre uma sugestão e uma pausa, e isso se acumula ao longo de uma sessão, assim como um desconto de cache.
A latência é a história mais complicada, e um único número engana a esse respeito. O Astra encaminha o raciocínio antes de emitir, de modo que o tempo até o primeiro token e o tempo até uma resposta utilizável não são a mesma medição, e os números publicados a esse respeito variam amplamente dependendo de o raciocínio ser contabilizado ou não. No nosso próprio tráfego dos últimos sete dias, o tempo mediano até o primeiro token do GPT-6 Astra é de 6,72 segundos, com um percentil 95 de 10,00 segundos — o número que um chamador realmente experimenta através do nosso endpoint. O Artificial Analysis situa o tempo até o primeiro token do Step 5 Preview em 2,96 segundos no seu próprio harness, e esses dois números não são medidos da mesma forma, portanto não devem ser subtraídos um do outro.
Onde a assimetria de cache de fato se manifesta
Ambos os modelos descontam fortemente prefixos repetidos e ambos cobram pela gravação deles, e a diferença entre eles é de 20 vezes na leitura. O desconto de cache de 95% do Step 5 Preview coloca a entrada em cache perto de $0,05 por milhão de tokens. O GPT-6 Astra lê o cache a $1,00 por milhão — um desconto de 90% sobre uma taxa base dez vezes mais alta — e o grava a $12,50 por milhão.
Para um loop de agente que reenvia o mesmo prompt de sistema e contexto do repositório a cada turno, a taxa de leitura é o que se acumula, e o desconto mais profundo no modelo mais barato vale mais do que o desconto mais superficial no modelo caro. A mistura da Astra ainda fica perto de $7,70 por milhão de tokens contra $0,51 do Step 5 Preview na mesma proporção 7:2:1 — uma diferença de quinze vezes que uma sessão longa não fecha, mas amplia.
Executando ambos a partir de uma tecla.
O GPT-6 Astra já está no ar no OrcaRouter sob openai/gpt-6-astra pelas tarifas de tabela da OpenAI — US$ 10,00 e US$ 50,00 por milhão abaixo do limite de 272K, US$ 20,00 e US$ 75,00 acima dele — repassadas sem nenhum acréscimo, de modo que uma mudança de preço do fornecedor entra em vigor do nosso lado no mesmo dia, e não no próximo ciclo de faturamento. Nossa própria telemetria de sete dias nesse endpoint mostra a mediana de 6,72 segundos e o percentil 95 de 10,00 segundos para o tempo até o primeiro token citado acima, além de 277,9M de tokens de tráfego por ele na última semana.
O Step 5 Preview não está no nosso catálogo e não o encaminhamos. Ele roda na API e no Studio próprios da StepFun, e esse é o único lugar onde roda até o checkpoint de 15 de outubro chegar. Essa assimetria não é uma falha da comparação; ela é a comparação. A metade barata deste confronto é a metade que você precisa buscar em outro lugar para chamar, e a metade que você pode colocar em produção hoje fica atrás de uma única API para mais de 200 modelos: GPT-6 Astra nas tarifas acima, GLM-5.3 a $1,26 e $3,96, DeepSeek V4 Pro, Claude Opus 5 e o restante, com failover automático entre provedores mantendo um caminho estável quando a capacidade de um provedor oscila e a DSL de roteamento permitindo que uma tarefa comece barata e só escale quando precisar. Essa regra de escalonamento é a verdadeira resposta para uma diferença de preço de dez vezes: a maior parte de uma carga de trabalho não precisa do topo do ranking, e uma camada de roteamento é como você deixa de pagar pela parte que não precisa.

Quem deve escolher qual
Se sua carga de trabalho é um agente de horizonte longo que precisa acertar uma tarefa difícil — uso de computador, pesquisa em várias etapas, trabalho em que uma resposta errada custa mais do que os tokens —, a vantagem de nove pontos do GPT-6 Astra é a parte mais barata da decisão, e a fatura é o que a capacidade custa. Use-o como alvo de escalonamento, não como padrão, e fique atento ao limite de 272K: uma única requisição superdimensionada dobra a tarifa para tudo nela.
Se sua carga de trabalho for texto agêntico de alto volume — geração de código, refatorações, extração estruturada, o loop interno de um assistente de programação —, o Step 5 Preview está à frente em tudo o que importa para a fatura e o relógio, e nove pontos de índice provavelmente não sobreviverão ao contato com uma distribuição de tarefas que não fica no topo do ranking. O problema não é o desempenho: o modelo é proprietário, sem licença publicada, sem autorização para uso comercial e sem checkpoint até 15 de outubro. Você pode chamá-lo; não pode possuí-lo, fazer fine-tuning nele ou lançar um derivado dele.
Se a resposta não for óbvia, o padrão é uma divisão por níveis, e não uma escolha. Encaminhe o tráfego geral para um modelo de nível intermediário e reserve o Astra para as solicitações que precisam do topo da tabela — ambas as pontas dessa regra ficam atrás de uma única chave do nosso lado, então a divisão custa uma regra de roteamento, e não um segundo contrato. Pagar tarifas de modelo de ponta por um trabalho que um modelo de nível intermediário conclui corretamente é o erro do qual esta comparação realmente trata.
