Cartão de título gerado intitulado 'Step 5 Preview vs GPT-6 Astra — dez vezes o preço' com duas colunas: Step 5 Preview no AA Index 44, 600B no total / 27B ativos, preço $1,00 / $2,70, combinado $0,51 e 99,8 tokens/seg; GPT-6 Astra no AA Index 53, preço $10,00 / $50,00, combinado $7,70 e 59,3 tokens/seg. Um rodapé diz 'Ambos os números de acordo com o Artificial Analysis Intelligence Index; o preço do Astra sobe para $20 / $75 acima de 272K tokens de entrada.'
Guides & Insights

Step 5 Preview vs GPT-6 Astra: Dez Vezes o Preço de Entrada por Nove Pontos de Índice

Autor

Gideon Frost

Data de publicação

Modelos mais recentes · 20Ver todos os modelos
Benchmarks: Artificial Analysis · atualizado diariamente
Voltar para todas as publicações

Esses dois modelos foram anunciados com dezessete dias de diferença e com preços de planetas diferentes. Step 5 Preview, o modelo esparso de mistura de especialistas de 600B parâmetros da StepFun, anunciado em 20 de setembro de 2026, cobra US$ 1,00 por milhão de tokens de entrada e US$ 2,70 por milhão de tokens de saída. GPT-6 Astra, o carro-chefe do fornecedor, lançado em 3 de setembro de 2026, cobra US$ 10,00 e US$ 50,00 pelas mesmas unidades abaixo de um limite de 272K tokens de entrada — e US$ 20,00 e US$ 75,00 acima disso. Isso representa dez vezes o preço de entrada e cerca de dezoito vezes o preço de saída para um modelo que marca nove pontos a mais no Intelligence Index independente, 53 contra 44. Não se questiona se a Astra é melhor. Se a diferença vale trinta dólares extras por milhão de tokens de saída na sua carga de trabalho é o que está em questão, e a resposta muda duas vezes ao longo deste artigo.

Para que serve cada modelo

O Step 5 Preview foi construído e é vendido para trabalho agêntico: programação com IA, engenharia de software, trabalho de conhecimento profissional, finanças. A arquitetura foi ajustada para isso — 600B de parâmetros totais com cerca de 27B ativos por token, um contexto de 1M de tokens, entrada de texto e imagem, e raciocínio com pensamento estendido. A StepFun pulou toda a linha Step 4.x para chegar aqui, passando diretamente do Step-3.7-Flash para o Step 5.

GPT-6 Astra é o carro-chefe de uso geral da OpenAI: um contexto de 1M de tokens, até 128K tokens de saída, entrada em texto, imagens e arquivos, saída em texto, data de corte de conhecimento em 30 de abril de 2026, e suporte para raciocínio, codificação e fluxos de trabalho agênticos. É o modelo que uma empresa busca quando a resposta precisa estar certa e a conta de tokens não é a restrição limitante.

• Índice de Inteligência — Step 5 Preview 44 vs GPT-6 Astra 53

• Parâmetros — Step 5 Preview: 600B no total / 27B ativos vs GPT-6 Astra não divulgado

• Contexto e teto de saída — ambos com contexto de 1M de tokens; a Astra lista uma janela de 1.050.000 tokens e um teto de saída de 128K, a StepFun não publicou nenhum teto de saída

• Modalidade de entrada — texto e imagens vs texto, imagens e arquivos

• Velocidade de saída — Step 5 Preview 99,8 tokens/seg vs GPT-6 Astra 59,3 tokens/seg

• Preço por 1M de tokens — $1,00 de entrada / $2,70 de saída vs $10,00 de entrada / $50,00 de saída abaixo de 272K de entrada, subindo para $20,00 / $75,00 acima disso

• Cache — Step 5 Preview com desconto de 95% vs GPT-6 Astra com desconto de leitura de 90% e uma taxa de escrita de cache de $12,50 por milhão

• Custo por tarefa do Intelligence Index — Step 5 Preview $0,71 vs GPT-6 Astra $3,26

Generated two-column comparison scoreboard titled 'Step 5 Preview vs GPT-6 Astra — the scoreboard'. The left column gives Step 5 Preview the rows AA Index 44, parameters 600B total / 27B active, price $1.00 / $2.70, cache discount 95%, cost per index task $0.71 and output speed 99.8 tokens/sec. The right column gives GPT-6 Astra the rows AA Index 53, parameters undisclosed, price $10.00 / $50.00, cache discount 90%, cost per index task $3.26 and output speed 59.3 tokens/sec. A footer reads 'Both figures per Artificial Analysis Intelligence Index; Astra pricing rises to $20 / $75 above 272K input tokens.'

A fatura, linha por linha

O preço do Step 5 Preview é fixo e barato: US$ 1,00 de entrada, US$ 2,70 de saída, com um desconto de cache de 95% que deixa a entrada em cache perto de US$ 0,05 por milhão de tokens. Em uma mistura 7:2:1 de acertos de cache, entrada e saída — a convenção que este blog usa para tráfego de agentes —, a taxa combinada fica perto de US$ 0,51 por milhão de tokens, e o custo por tarefa do Intelligence Index chega a US$ 0,71, 27º de 200. A ressalva é a verbosidade: o modelo produziu 160 milhões de tokens de saída nesse Index contra uma mediana de 92 milhões, então as contagens brutas de tokens ficam acima do que o preço de tabela sugere.

O preço do GPT-6 Astra é escalonado, e o nível é a parte que vale a pena ler com atenção. Abaixo de 272K tokens de entrada por requisição, são $10,00 e $50,00; acima disso, $20,00 e $75,00. O nível é selecionado pela contagem de tokens de entrada de cada requisição, o que importa mais do que parece para um modelo vendido com contexto de 1M de tokens — uma única chamada de contexto grande cruza a linha e dobra a tarifa da requisição inteira. Leituras de cache custam $1,00 por milhão, um desconto de 90%, e gravações de cache custam $12,50 por milhão. Na mesma mistura 7:2:1, a tarifa combinada fica perto de $7,70 por milhão de tokens, e o custo por tarefa Index é $3,26, 71º de 200.

No que diz respeito à verbosidade, a Astra vai na direção oposta e é o modelo conciso aqui: 60M de tokens de saída no Index, contra os 160M do Step 5 Preview, 27º de 200 nessa métrica. Uma quantidade menor de tokens a uma taxa mais alta reduz a lacuna de uma forma que o múltiplo bruto exagera. Ela não fecha essa lacuna — o número de custo por tarefa já leva em conta, em conjunto, a verbosidade, o comportamento de cache e a precificação, e US$ 3,26 contra US$ 0,71 ainda é uma diferença de 4,6 vezes.

O que os nove pontos do índice compram

Os números de destaque da Astra são da própria OpenAI e não foram reproduzidos: 96,1 no GPQA Diamond, 72,6% no OSWorld 2.0, 97,6% no FrontierMath Tier 4, 57,2% no Humanity's Last Exam com ferramentas, e cerca de 57,9% no Terminal-Bench 4.0. O valor do ARC-AGI-3 é o que deve ser tratado com cuidado — a OpenAI relata 99,9% sob seu próprio harness de adaptador de provedor e 62,7% no harness padrão, e uma variação de 37 pontos entre harnesses é uma afirmação sobre o harness pelo menos tanto quanto sobre o modelo.

Os números publicados do Step 5 Preview situam-se no mesmo território nas tarefas agênticas para as quais foi criado, e trazem a mesma ressalva: 33,3% no Terminal-Bench 4.0, 80,5 no ProgramBench, 67,7 no DeepSWE v1.1 e 49,0 no StepCodeBench, todos da StepFun e nenhum reproduzido de forma independente. Fornecedores diferentes, harnesses diferentes, nenhuma execução compartilhada — e é exatamente por isso que a lacuna de nove pontos medida de forma independente é um número mais útil do que qualquer um destes.

Essa diferença é real e não é pequena. Em um ranking de 200 modelos, 53 e 44 ocupam a terceira e a vigésima quarta posição, e a separação aparece como uma classe diferente de tarefa, em vez de uma pontuação diferente na mesma tarefa: as vitórias publicadas da Astra se concentram em raciocínio de longo horizonte e uso de computador, que é onde o topo do ranking se distancia. Se a sua carga de trabalho está aí, os nove pontos valem mais do que a fatura.

Uma ressalva sobre a pontuação da Astra. A Artificial Analysis revisa o Intelligence Index, e os números para o mesmo modelo variam entre instantâneos tirados com semanas de diferença — 52,8, 53 e 54,7 aparecem todos em materiais publicados sobre esse modelo no mesmo mês. O 53 na página atual do modelo é o número a ser usado, e qualquer comparação que coloque um instantâneo mais antigo da Astra ao lado de um número atual do Step 5 Preview está medindo com duas réguas diferentes.

Screenshot of the Artificial Analysis model page for GPT-6 Astra, showing OpenAI as the creator with a September 2026 release date, an Intelligence Index of 53 at rank 3 of 200, output speed 59.3 tokens per second at rank 101 of 200, cost per Intelligence Index task $3.26 at rank 71 of 200, verbosity 60M output tokens at rank 27 of 200, pricing of $10.00 per million input tokens and $50.00 per million output tokens with a 90% cache discount, and technical specifications listing reasoning, text and image input, a 1M-token context window and an April 30, 2026 knowledge cutoff.

Velocidade e latência são duas questões diferentes

Na velocidade de geração, o painel independente é inequívoco: 99,8 tokens de saída por segundo para o Step 5 Preview contra 59,3 para o GPT-6 Astra, que também é mais lento do que a média de 70 tokens por segundo entre os modelos medidos. Em um ciclo de codificação interativo, essa é a diferença entre uma sugestão e uma pausa, e isso se acumula ao longo de uma sessão, assim como um desconto de cache.

A latência é a história mais complicada, e um único número engana a esse respeito. O Astra encaminha o raciocínio antes de emitir, de modo que o tempo até o primeiro token e o tempo até uma resposta utilizável não são a mesma medição, e os números publicados a esse respeito variam amplamente dependendo de o raciocínio ser contabilizado ou não. No nosso próprio tráfego dos últimos sete dias, o tempo mediano até o primeiro token do GPT-6 Astra é de 6,72 segundos, com um percentil 95 de 10,00 segundos — o número que um chamador realmente experimenta através do nosso endpoint. O Artificial Analysis situa o tempo até o primeiro token do Step 5 Preview em 2,96 segundos no seu próprio harness, e esses dois números não são medidos da mesma forma, portanto não devem ser subtraídos um do outro.

Onde a assimetria de cache de fato se manifesta

Ambos os modelos descontam fortemente prefixos repetidos e ambos cobram pela gravação deles, e a diferença entre eles é de 20 vezes na leitura. O desconto de cache de 95% do Step 5 Preview coloca a entrada em cache perto de $0,05 por milhão de tokens. O GPT-6 Astra lê o cache a $1,00 por milhão — um desconto de 90% sobre uma taxa base dez vezes mais alta — e o grava a $12,50 por milhão.

Para um loop de agente que reenvia o mesmo prompt de sistema e contexto do repositório a cada turno, a taxa de leitura é o que se acumula, e o desconto mais profundo no modelo mais barato vale mais do que o desconto mais superficial no modelo caro. A mistura da Astra ainda fica perto de $7,70 por milhão de tokens contra $0,51 do Step 5 Preview na mesma proporção 7:2:1 — uma diferença de quinze vezes que uma sessão longa não fecha, mas amplia.

Executando ambos a partir de uma tecla.

O GPT-6 Astra já está no ar no OrcaRouter sob openai/gpt-6-astra pelas tarifas de tabela da OpenAI — US$ 10,00 e US$ 50,00 por milhão abaixo do limite de 272K, US$ 20,00 e US$ 75,00 acima dele — repassadas sem nenhum acréscimo, de modo que uma mudança de preço do fornecedor entra em vigor do nosso lado no mesmo dia, e não no próximo ciclo de faturamento. Nossa própria telemetria de sete dias nesse endpoint mostra a mediana de 6,72 segundos e o percentil 95 de 10,00 segundos para o tempo até o primeiro token citado acima, além de 277,9M de tokens de tráfego por ele na última semana.

O Step 5 Preview não está no nosso catálogo e não o encaminhamos. Ele roda na API e no Studio próprios da StepFun, e esse é o único lugar onde roda até o checkpoint de 15 de outubro chegar. Essa assimetria não é uma falha da comparação; ela é a comparação. A metade barata deste confronto é a metade que você precisa buscar em outro lugar para chamar, e a metade que você pode colocar em produção hoje fica atrás de uma única API para mais de 200 modelos: GPT-6 Astra nas tarifas acima, GLM-5.3 a $1,26 e $3,96, DeepSeek V4 Pro, Claude Opus 5 e o restante, com failover automático entre provedores mantendo um caminho estável quando a capacidade de um provedor oscila e a DSL de roteamento permitindo que uma tarefa comece barata e só escale quando precisar. Essa regra de escalonamento é a verdadeira resposta para uma diferença de preço de dez vezes: a maior parte de uma carga de trabalho não precisa do topo do ranking, e uma camada de roteamento é como você deixa de pagar pela parte que não precisa.

Screenshot of the OrcaRouter model page for GPT-6 Astra at www.orcarouter.ai/models/openai/gpt-6-astra, showing the model id openai/gpt-6-astra with NEW, FLAGSHIP and FEATURED badges, a 1M-token context and 128K max output, text, image and file input with text output, best-for tags for reasoning, coding and agentic work, input pricing of $10.00 and output pricing of $50.00 per million tokens, a seven-day median time to first token of 6.72 seconds and a 95th percentile of 10.00 seconds, 277.9M tokens of seven-day traffic, and the chat-completions and responses endpoints behind the OrcaRouter API.

Quem deve escolher qual

Se sua carga de trabalho é um agente de horizonte longo que precisa acertar uma tarefa difícil — uso de computador, pesquisa em várias etapas, trabalho em que uma resposta errada custa mais do que os tokens —, a vantagem de nove pontos do GPT-6 Astra é a parte mais barata da decisão, e a fatura é o que a capacidade custa. Use-o como alvo de escalonamento, não como padrão, e fique atento ao limite de 272K: uma única requisição superdimensionada dobra a tarifa para tudo nela.

Se sua carga de trabalho for texto agêntico de alto volume — geração de código, refatorações, extração estruturada, o loop interno de um assistente de programação —, o Step 5 Preview está à frente em tudo o que importa para a fatura e o relógio, e nove pontos de índice provavelmente não sobreviverão ao contato com uma distribuição de tarefas que não fica no topo do ranking. O problema não é o desempenho: o modelo é proprietário, sem licença publicada, sem autorização para uso comercial e sem checkpoint até 15 de outubro. Você pode chamá-lo; não pode possuí-lo, fazer fine-tuning nele ou lançar um derivado dele.

Se a resposta não for óbvia, o padrão é uma divisão por níveis, e não uma escolha. Encaminhe o tráfego geral para um modelo de nível intermediário e reserve o Astra para as solicitações que precisam do topo da tabela — ambas as pontas dessa regra ficam atrás de uma única chave do nosso lado, então a divisão custa uma regra de roteamento, e não um segundo contrato. Pagar tarifas de modelo de ponta por um trabalho que um modelo de nível intermediário conclui corretamente é o erro do qual esta comparação realmente trata.