
Grok 4.5 vs GPT-6 Astra: Seis vezes o preço de etiqueta, três vezes a conta
- OrcaNOVOOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 por 1M de tokens
- orcaNOVOOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 por 1M de tokens
- deepseekNOVODeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligência
- openaiOpenAI: GPT-6 Astra2026-09-0453Inteligência77Código
- googleGoogle: Gemini 3.8 Flash2026-09-0241Inteligência76Código
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Inteligência76Código
- anthropicAnthropic: Claude Fable 5.12026-09-0153Inteligência82Código
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 por 1M de tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligência72Código
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 por 1M de tokens
- z-aiZ.ai: GLM 5.32026-08-1845Inteligência75Código
- obsidianQwen3.8 27B2026-08-1534Inteligência68Código
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Inteligência69Código
- grokSpaceXAI: Grok 4.62026-08-1244Inteligência77Código
- metaMeta: Muse Spark 1.22026-08-0540Inteligência72Código
- qwenQwen: Qwen3.8 Max2026-08-0345Inteligência76Código
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3134Inteligência69Código
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 por 1M de tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
Coloque Grok 4.5 e GPT-6 Astra lado a lado em suas tabelas de preços e a diferença parece absurda: US$ 2,00 contra US$ 10,00 por milhão de tokens de entrada, US$ 6,00 contra US$ 50,00 por milhão na saída. Submeta os mesmos dois ao Intelligence Index da Artificial Analysis e a diferença diminui para algo sobre o que uma equipe consegue de fato discutir — US$ 1,04 por tarefa concluída contra US$ 3,26. O múltiplo da etiqueta é 5x na entrada e 8,3x na saída. O múltiplo da fatura, medido em contagens reais de tokens, é um pouco mais de 3x. E a dimensão em que esses dois modelos mais diferem não é nenhuma dessas. É quanto tempo você espera pelo primeiro token, em que a medição independente é 10,94 segundos contra 342,30.
Esse é o confronto inteiro em um parágrafo, e é por isso que esta página não é uma coroação em nenhuma das direções. O GPT-6 Astra é o modelo mais inteligente, por uma margem clara e reproduzível. O Grok 4.5 é o mais barato, por uma margem que é real, mas consideravelmente menor do que sua tabela de preços sugere. Todo o resto — velocidade, eficiência de tokens, contexto, os benchmarks de programação — ou se divide, ou empata, ou acaba sendo medido com duas réguas diferentes.
Nenhum destes é um novo modelo
Vale a pena dizer claramente, porque muitas páginas de comparação dão a impressão de que ambos chegaram na semana passada.
A xAI lançou o Grok 4.5 em 8 de julho de 2026. Ele é construído sobre a base V9 de 1,5 trilhão de parâmetros e co-treinado com o Cursor em dados de sessões de desenvolvedores, em vez de apenas código estático, e é daí que vem sua reputação em codificação agêntica. Ele tem uma janela de contexto de 500.000 tokens. A lista de modelos do próprio fornecedor ainda o inclui hoje, ao lado de dois sucessores — a xAI desde então lançou o Grok 4.6 e o Grok 4.7 —, então trate o Grok 4.5 como a faixa de US$ 2/US$ 6 da linha Grok, e não como o topo dela.
A OpenAI anunciou o GPT-6 Astra em 3 de setembro de 2026, com um lançamento faseado ao longo dos dias seguintes, e ele continua sendo o carro-chefe da OpenAI: uma janela de contexto de 1M tokens (o catálogo da OrcaRouter lista 1.050.000 de entrada e 128.000 de saída máxima), uma data de corte de conhecimento de 30 de abril de 2026 e um posicionamento claramente voltado ao trabalho agêntico de longo horizonte — uso de computador, pesquisa, tarefas científicas e de cibersegurança. Segundo a própria OpenAI, é o primeiro modelo a ultrapassar seu limiar de cibersegurança "Crítico", o que também explica por que o acesso empresarial fica desativado por padrão até que um administrador o ative.
Ambos estão disponíveis de forma geral nas APIs de seus fornecedores. Nenhum dos dois está sendo lançado. A única coisa que mudou esta semana é a família em torno de um deles, e isso vem no final deste texto porque altera a recomendação, e não a comparação.
As tabelas de tarifas, incluindo o nível que ninguém cita.
• Entrada, contexto curto — Grok 4.5 US$ 2,00 por 1M vs. GPT-6 Astra US$ 10,00 por 1M
• Saída, contexto curto — Grok 4.5 $6,00 por 1M vs. GPT-6 Astra $50,00 por 1M
• Entrada em cache — Grok 4.5 $0.30 por 1M vs GPT-6 Astra $1.00 por 1M
• Entrada de contexto longo — Grok 4.5 US$ 4,00 por 1M vs. GPT-6 Astra US$ 20,00 por 1M
• Saída de contexto longo — Grok 4.5 $12,00 por 1M vs GPT-6 Astra $75,00 por 1M
• Janela de contexto — Grok 4.5 500.000 tokens vs GPT-6 Astra 1.000.000 tokens
A cláusula que importa é a que quase nenhuma página de comparação publica. No Grok 4.5, quando o prompt de uma solicitação atinge 200.000 tokens, o preço de toda a solicitação é recalculado para o nível superior — a documentação da xAI é explícita ao afirmar que a solicitação é "cobrada à tarifa mais alta por todos os tokens da solicitação", e não apenas pelos tokens que ultrapassam o limite. Assim, a janela de 500.000 tokens é real, mas aproximadamente os 60% superiores dela são cobrados em dobro. A página de preços da OpenAI para o Astra exibe a mesma estrutura de duas colunas, curta/longa, sem declarar onde fica seu ponto de transição, então considere a coluna de contexto longo como a que se aplica quando você estiver trabalhando em escala e confirme o limite com base na sua própria fatura.

Dois multiplicadores em nível de serviço incidem sobre os números do Astra: Batch e Flex operam à metade da tarifa padrão, e o modo Fast opera em dobro — US$ 20,00 de entrada e US$ 100,00 de saída em contexto curto. O Grok 4.5 não tem nível de batch na tabela da xAI; suas alavancas são o desconto de cache e o processamento prioritário a 2x.
A nossa própria posição sobre tudo isto é deliberadamente entediante: a OrcaRouter repassa o preço de tabela do provedor com 0% de margem, por isso ambas as tabelas de preços acima estão ativas do nosso lado no mesmo dia em que qualquer fornecedor as altere, e os tokens em cache são cobrados à tarifa de cache do provedor, em vez do preço integral. Não há um segundo número para reconciliar.
O que uma carga de trabalho realmente custa
Os preços de tabela são um guia pouco confiável aqui, porque os dois modelos não gastam a mesma quantidade de tokens para concluir a mesma tarefa. Pegue uma tarefa de agente de codificação com um contexto de repositório de 120.000 tokens e uma resposta de 25.000 tokens. No Grok 4.5, isso dá US$ 0,24 de entrada e US$ 0,15 de saída, ou seja, US$ 0,39. No GPT-6 Astra, dá US$ 1,20 e US$ 1,25, ou seja, US$ 2,45. Uma diferença de 6,3x.
Agora leve o prompt além da linha de contexto longo: 300.000 tokens de entrada, 20.000 de saída. O Grok 4.5 cobra $1,20 mais $0,24, ou $1,44. O GPT-6 Astra cobra $6,00 mais $1,50, ou $7,50. A diferença se comprime para 5,2x, porque ambos os fornecedores dobram a taxa de entrada e o múltiplo de saída do Astra diminui no nível superior.
Nenhum desses é o que a Artificial Analysis mede, e o número deles é o mais útil. Ao executar o Índice de Inteligência completo, o custo médio por tarefa concluída é de US$ 1,04 para o Grok 4.5 em esforço alto e US$ 3,26 para o GPT-6 Astra em esforço máximo. O motivo pelo qual a proporção cai para 3,1x quando os preços de entrada diferem por um fator de 5 é a eficiência de tokens: em todo o índice, o Grok 4.5 gerou 77 milhões de tokens de saída e o Astra gerou 60 milhões. O Astra é o modelo mais conciso, então ele fecha parte de uma diferença que abriu no preço. Se você vem citando “cinco vezes mais barato” em um documento de orçamento, 3x é o número que vai aparecer na fatura.
A velocidade está empatada. A latência não.
Este é o achado que nos surpreendeu, e contraria a intuição de que o modelo barato é o rápido.
A Artificial Analysis mede o Grok 4.5 a 55 tokens de saída por segundo e o GPT-6 Astra a 58. Isso é uma diferença de 5% na mesma revisão do índice, e o próprio resumo da AA descreve ambos como mais lentos que a média — a mediana da comparação é 74 tokens por segundo. Se a taxa de transferência for o seu critério de seleção, esses dois modelos não se distinguem. Diga isso claramente em vez de fabricar um vencedor: no único número de velocidade medido da mesma forma para ambos, eles estão empatados.
A latência os separa violentamente. A AA coloca o tempo até o primeiro token de resposta do Grok 4.5 em 10,94 segundos, com 20,01 segundos de ponta a ponta; já o GPT-6 Astra, em 342,30 segundos, com 350,91 segundos de ponta a ponta. Isso é aproximadamente 31x e, em uma requisição síncrona, é a diferença entre um indicador de carregamento e uma pausa para o café.
Duas ressalvas honestas antes que alguém faça orçamento com base nisso. Primeiro, esses são números que incluem o raciocínio — o "tempo até o primeiro token de resposta" da AA conta deliberadamente o tempo de pensamento do modelo —, então eles descrevem uma tarefa difícil, não um turno de chat. Segundo, não são de esforço equiparado: a entrada publicada do Astra está em esforço máximo, a do Grok 4.5 em alto, e a configuração de esforço é exatamente o botão que move esse número. O próprio anúncio do OrcaRouter para o GPT-6 Astra mostra um tempo até o primeiro token de 8,31 segundos no p50 e 10,00 segundos no p95 em tráfego real, o que é um ponto de medição completamente diferente — primeiro token em chamadas reais de produção, não primeiro token de resposta em uma tarefa de benchmark. Os dois não são comparáveis e não deveriam ser colocados na mesma frase como comparação.

Benchmarks de programação: confira a versão antes de citá-la
Pesquise por este confronto e você encontrará os 83,3% do Grok 4.5 no Terminal-Bench 2.1 contrapostos aos 57,9% do GPT-6 Astra no Terminal-Bench 4.0. Esses são benchmarks diferentes usando o mesmo nome. Eles não podem ser comparados, e as páginas de comparação que os empilham não estão lhe dizendo nada.
A maioria dos números de codificação publicados de ambos os fornecedores tem esse problema. A planilha da xAI para o Grok 4.5 reporta SWE-bench Pro 64,7%, Terminal-Bench 2.1 83,3%, DeepSWE 1.0 62,0% e DeepSWE 1.1 53%. A planilha da OpenAI para o Astra reporta Terminal-Bench 4.0 57,9%, OSWorld 2.0 72,6%, FrontierMath Tier 4 97,6% e ARC-AGI-3 99,9%. Todos reportados pelos fornecedores, e quase nenhum deles se sobrepõe.
Há um único ponto em que os dois se encontram verdadeiramente no mesmo harness: o DeepSWE v1.1 da Datacurve, que executa todos os modelos através do mesmo scaffold mini-swe-agent em 113 tarefas originais e livres de contaminação. Aí, o GPT-6 Astra obtém 74,1% a cerca de 6,52 dólares por tarefa, enquanto o Grok 4.5 fica em 53%. Esse é o resultado mais limpo e isolado desta página, e favorece decisivamente o Astra. Uma ressalva adicional específica ao Grok 4.5: o valor do CursorBench da xAI foi excluído da comparação pública depois de se descobrir que uma base de código anterior tinha vazado para o treino, por isso, considere qualquer número do CursorBench para este modelo como inutilizável.
Comportamento agêntico e chamada de ferramentas
Os dois seguem caminhos diferentes até o mesmo destino, e a diferença é arquitetural, e não uma pontuação.
Os recursos do GPT-6 Astra voltados para desenvolvedores pressupõem que você esteja criando um orquestrador. Ele oferece suporte a chamadas assíncronas de ferramentas, de modo que esperar por uma ferramenta não impede o modelo de continuar outros trabalhos; direcionamento no meio da tarefa via WebSockets, de modo que uma execução em andamento possa ser redirecionada sem reiniciá-la; e esforço de raciocínio ajustável no meio da conversa. No Codex, ele adiciona um mecanismo de preservação de contexto que mantém notas entre janelas de contexto enquanto o contexto anterior permanece pesquisável. Segundo relatos, o próprio system card da OpenAI observa que o modelo é mais difícil de monitorar do que seu antecessor, o que é um motivo para tratar logs de chamadas de ferramentas e o estado do sistema — não a narração do modelo — como sua evidência de auditoria.
A história agêntica do Grok 4.5 tem menos a ver com novas primitivas e mais com onde ele foi treinado. O co-treinamento com o Cursor em sessões reais de edição e depuração de vários arquivos é o que a xAI credita por sua eficiência de tokens em tarefas de software, e é por isso que o modelo aparece como padrão em superfícies de codificação, em vez de como um carro-chefe de uso geral. Chamada de função, saída estruturada, streaming e cache de prompt são todos suportados; a chamada de ferramentas segue o formato compatível com a OpenAI, e é por isso que colocá-lo em um cliente existente é uma mudança de URL base.
Não existe um benchmark agêntico independente e compartilhado em que ambos apareçam com esforço equiparado, então não vamos inventar um vencedor aqui. O que se pode dizer é que a superfície de chamada de ferramentas da Astra é a mais expressiva das duas para trabalhos de horizonte longo, e a economia de tokens por tarefa do Grok 4.5 é a mais atraente para trabalhos de alto volume.
Escolha o Grok 4.5 se
• Você executa trabalho de alto volume ou alta frequência, em que o custo por tarefa domina a decisão, e uma pontuação de 39 no AA Intelligence Index atende ao seu padrão de qualidade.
• Seus prompts ficam abaixo de 200.000 tokens. É aí que a vantagem de preço do Grok 4.5 é mais ampla e o reajuste de preços para contexto longo nunca é acionado.
• Você quer um desconto de cache fazendo trabalho de verdade. A US$ 0,30 por milhão de tokens de entrada em cache, contra US$ 1,00 da Astra, cargas de trabalho com prefixos repetidos — prompts de sistema longos, contexto compartilhado de repositório — ficam baratas rapidamente.
• Você precisa de latência de primeiro token inferior a um minuto em tarefas difíceis e não pode absorver uma espera de vários minutos.
Escolha o GPT-6 Astra se
• A tarefa é o produto, e a conta é um erro de arredondamento diante de uma resposta errada. Quatorze pontos de índice neste extremo da curva representam uma diferença real de capacidade, não uma de marketing.
• Você está de fato trabalhando além da marca de 500.000 tokens. A janela da Astra é aproximadamente o dobro da do Grok 4.5, e a Astra é a única das duas que alcança isso sem uma cláusula de reprecificação.
• Você precisa de uso de computador, pesquisa aprofundada ou da postura de cibersegurança — incluindo os controles desativados por padrão para empresas que acompanham o limiar Critical da OpenAI.
• Você está escrevendo código de orquestrador que quer chamadas de ferramentas assíncronas e direcionamento durante a execução, em vez de uma chamada direta de requisição-resposta.
O que se moveu esta semana, e por que isso muda a recomendação
Em 22 de setembro de 2026, a OpenAI lançou o GPT-6 Sol e o GPT-6 Luna a $2.00/$10.00 e $0.10/$0.50 por milhão de tokens, descrevendo as tarifas como permanentes e não promocionais. O Sol é o modelo de nível intermediário para programação e análise, a cerca de um quinto do preço de entrada da Astra.
Isso importa para esta decisão específica. Se o motivo pelo qual você estava comparando Grok 4.5 com GPT-6 Astra era o preço, a comparação honesta do lado da OpenAI já não é com Astra — Astra é o carro-chefe, e Sol agora ocupa a faixa em que Grok 4.5 realmente compete. Grok 4.5 ainda cobra menos que Sol na saída (US$ 6,00 contra US$ 10,00) e iguala Sol na entrada (US$ 2,00 cada), então ele não foi deslocado; mas uma comparação escrita antes desta semana estava comparando um modelo de custo-benefício com um carro-chefe e chamando o resultado de uma questão de preço.
O mesmo vale para o lado da xAI: a própria lista de modelos da xAI inclui grok-4.6 e grok-4.7 ao lado do grok-4.5, de modo que o Grok 4.5 é uma opção dentro de uma família, e não a fronteira atual.

Qual é o argumento real para o roteamento em vez da escolha. A stack de dois modelos que continua aparecendo em relatos de profissionais — envie o grosso para o modelo barato, escale a cauda difícil para o caro — é uma decisão de roteamento, e é uma que você pode expressar como configuração em vez de uma reescrita. O OrcaRouter coloca ambos os modelos por trás de uma única API e uma única chave, com o preço de lista do provedor repassado com 0% de markup, failover automático entre provedores, e uma DSL de roteamento que permite enviar trabalho abaixo de um limite para grok/grok-4.5 e escalar para openai/gpt-6-astra quando uma tarefa falha ou ultrapassa um limite de tamanho. Você pode testar o caminho caro em uma fatia estreita de tráfego sem apostar um pipeline de produção nele.
A versão curta
O GPT-6 Astra é o melhor modelo. Não há comparação, e esta página não teria valor se fingisse o contrário — 53 contra 39 na mesma revisão do índice, 74,1% contra 53% no único benchmark de programação que ambos realizaram.
Grok 4.5 é o modelo mais barato, mas por 3,1x por tarefa concluída, em vez dos 5x a 8,3x que sua tabela de preços sugere, porque a Astra gasta menos tokens para chegar lá. E no único número de velocidade medido de forma idêntica para ambos, eles estão no mesmo nível.
A decisão não é qual modelo vence. É se uma diferença de 14 pontos no índice justifica cerca do triplo da conta na sua carga de trabalho específica — e se a resposta é a mesma para cada pedido que envia.
Comparados neste artigo2
Detectado a partir deste artigo · Benchmarks: Artificial Analysis · atualizado diariamente
