Cartão de título de destaque para Grok 4.5 vs GPT-6 Astra, com o subtítulo 'Seis vezes o preço de etiqueta, três vezes a fatura', cartões de estatísticas com os dizeres 'Preço de etiqueta: US$ 2,00 / US$ 6,00 vs US$ 10,00 / US$ 50,00 por 1M', 'Custo por tarefa: US$ 1,04 vs US$ 3,26' e 'Primeiro token: 10,94s vs 342,30s', um rodapé com os dizeres 'Tabelas de preços de fornecedores e números independentes referentes a 23 de setembro de 2026', e o logotipo da OrcaRouter no canto inferior direito.
Guides & Insights

Grok 4.5 vs GPT-6 Astra: Seis vezes o preço de etiqueta, três vezes a conta

Autor

Elias Hawthorne

Data de publicação

Modelos mais recentes · 20Ver todos os modelos
Benchmarks: Artificial Analysis · atualizado diariamente
Voltar para todas as publicações

Coloque Grok 4.5 e GPT-6 Astra lado a lado em suas tabelas de preços e a diferença parece absurda: US$ 2,00 contra US$ 10,00 por milhão de tokens de entrada, US$ 6,00 contra US$ 50,00 por milhão na saída. Submeta os mesmos dois ao Intelligence Index da Artificial Analysis e a diferença diminui para algo sobre o que uma equipe consegue de fato discutir — US$ 1,04 por tarefa concluída contra US$ 3,26. O múltiplo da etiqueta é 5x na entrada e 8,3x na saída. O múltiplo da fatura, medido em contagens reais de tokens, é um pouco mais de 3x. E a dimensão em que esses dois modelos mais diferem não é nenhuma dessas. É quanto tempo você espera pelo primeiro token, em que a medição independente é 10,94 segundos contra 342,30.

Esse é o confronto inteiro em um parágrafo, e é por isso que esta página não é uma coroação em nenhuma das direções. O GPT-6 Astra é o modelo mais inteligente, por uma margem clara e reproduzível. O Grok 4.5 é o mais barato, por uma margem que é real, mas consideravelmente menor do que sua tabela de preços sugere. Todo o resto — velocidade, eficiência de tokens, contexto, os benchmarks de programação — ou se divide, ou empata, ou acaba sendo medido com duas réguas diferentes.

Nenhum destes é um novo modelo

Vale a pena dizer claramente, porque muitas páginas de comparação dão a impressão de que ambos chegaram na semana passada.

A xAI lançou o Grok 4.5 em 8 de julho de 2026. Ele é construído sobre a base V9 de 1,5 trilhão de parâmetros e co-treinado com o Cursor em dados de sessões de desenvolvedores, em vez de apenas código estático, e é daí que vem sua reputação em codificação agêntica. Ele tem uma janela de contexto de 500.000 tokens. A lista de modelos do próprio fornecedor ainda o inclui hoje, ao lado de dois sucessores — a xAI desde então lançou o Grok 4.6 e o Grok 4.7 —, então trate o Grok 4.5 como a faixa de US$ 2/US$ 6 da linha Grok, e não como o topo dela.

A OpenAI anunciou o GPT-6 Astra em 3 de setembro de 2026, com um lançamento faseado ao longo dos dias seguintes, e ele continua sendo o carro-chefe da OpenAI: uma janela de contexto de 1M tokens (o catálogo da OrcaRouter lista 1.050.000 de entrada e 128.000 de saída máxima), uma data de corte de conhecimento de 30 de abril de 2026 e um posicionamento claramente voltado ao trabalho agêntico de longo horizonte — uso de computador, pesquisa, tarefas científicas e de cibersegurança. Segundo a própria OpenAI, é o primeiro modelo a ultrapassar seu limiar de cibersegurança "Crítico", o que também explica por que o acesso empresarial fica desativado por padrão até que um administrador o ative.

Ambos estão disponíveis de forma geral nas APIs de seus fornecedores. Nenhum dos dois está sendo lançado. A única coisa que mudou esta semana é a família em torno de um deles, e isso vem no final deste texto porque altera a recomendação, e não a comparação.

As tabelas de tarifas, incluindo o nível que ninguém cita.

• Entrada, contexto curto — Grok 4.5 US$ 2,00 por 1M vs. GPT-6 Astra US$ 10,00 por 1M

• Saída, contexto curto — Grok 4.5 $6,00 por 1M vs. GPT-6 Astra $50,00 por 1M

• Entrada em cache — Grok 4.5 $0.30 por 1M vs GPT-6 Astra $1.00 por 1M

• Entrada de contexto longo — Grok 4.5 US$ 4,00 por 1M vs. GPT-6 Astra US$ 20,00 por 1M

• Saída de contexto longo — Grok 4.5 $12,00 por 1M vs GPT-6 Astra $75,00 por 1M

• Janela de contexto — Grok 4.5 500.000 tokens vs GPT-6 Astra 1.000.000 tokens

A cláusula que importa é a que quase nenhuma página de comparação publica. No Grok 4.5, quando o prompt de uma solicitação atinge 200.000 tokens, o preço de toda a solicitação é recalculado para o nível superior — a documentação da xAI é explícita ao afirmar que a solicitação é "cobrada à tarifa mais alta por todos os tokens da solicitação", e não apenas pelos tokens que ultrapassam o limite. Assim, a janela de 500.000 tokens é real, mas aproximadamente os 60% superiores dela são cobrados em dobro. A página de preços da OpenAI para o Astra exibe a mesma estrutura de duas colunas, curta/longa, sem declarar onde fica seu ponto de transição, então considere a coluna de contexto longo como a que se aplica quando você estiver trabalhando em escala e confirme o limite com base na sua própria fatura.

Screenshot of xAI's own documentation page for Grok 4.5 (docs.x.ai, model id grok-4.5) captured 23 September 2026, showing 'At a glance' with Modalities Text, Image to Text, a Context window of 500,000 and Pricing of $2.00 and $6.00, supported Capabilities of function calling, structured outputs and reasoning, and a Pricing block giving Input Tokens $2.00 / 1M tokens, Cached tokens $0.30 / 1M tokens and Output Tokens $6.00 / 1M tokens, above a 'Higher context pricing' control reading 'We charge different rates for requests which exceed the 200K context window'.

Dois multiplicadores em nível de serviço incidem sobre os números do Astra: Batch e Flex operam à metade da tarifa padrão, e o modo Fast opera em dobro — US$ 20,00 de entrada e US$ 100,00 de saída em contexto curto. O Grok 4.5 não tem nível de batch na tabela da xAI; suas alavancas são o desconto de cache e o processamento prioritário a 2x.

A nossa própria posição sobre tudo isto é deliberadamente entediante: a OrcaRouter repassa o preço de tabela do provedor com 0% de margem, por isso ambas as tabelas de preços acima estão ativas do nosso lado no mesmo dia em que qualquer fornecedor as altere, e os tokens em cache são cobrados à tarifa de cache do provedor, em vez do preço integral. Não há um segundo número para reconciliar.

O que uma carga de trabalho realmente custa

Os preços de tabela são um guia pouco confiável aqui, porque os dois modelos não gastam a mesma quantidade de tokens para concluir a mesma tarefa. Pegue uma tarefa de agente de codificação com um contexto de repositório de 120.000 tokens e uma resposta de 25.000 tokens. No Grok 4.5, isso dá US$ 0,24 de entrada e US$ 0,15 de saída, ou seja, US$ 0,39. No GPT-6 Astra, dá US$ 1,20 e US$ 1,25, ou seja, US$ 2,45. Uma diferença de 6,3x.

Agora leve o prompt além da linha de contexto longo: 300.000 tokens de entrada, 20.000 de saída. O Grok 4.5 cobra $1,20 mais $0,24, ou $1,44. O GPT-6 Astra cobra $6,00 mais $1,50, ou $7,50. A diferença se comprime para 5,2x, porque ambos os fornecedores dobram a taxa de entrada e o múltiplo de saída do Astra diminui no nível superior.

Nenhum desses é o que a Artificial Analysis mede, e o número deles é o mais útil. Ao executar o Índice de Inteligência completo, o custo médio por tarefa concluída é de US$ 1,04 para o Grok 4.5 em esforço alto e US$ 3,26 para o GPT-6 Astra em esforço máximo. O motivo pelo qual a proporção cai para 3,1x quando os preços de entrada diferem por um fator de 5 é a eficiência de tokens: em todo o índice, o Grok 4.5 gerou 77 milhões de tokens de saída e o Astra gerou 60 milhões. O Astra é o modelo mais conciso, então ele fecha parte de uma diferença que abriu no preço. Se você vem citando “cinco vezes mais barato” em um documento de orçamento, 3x é o número que vai aparecer na fatura.

A velocidade está empatada. A latência não.

Este é o achado que nos surpreendeu, e contraria a intuição de que o modelo barato é o rápido.

A Artificial Analysis mede o Grok 4.5 a 55 tokens de saída por segundo e o GPT-6 Astra a 58. Isso é uma diferença de 5% na mesma revisão do índice, e o próprio resumo da AA descreve ambos como mais lentos que a média — a mediana da comparação é 74 tokens por segundo. Se a taxa de transferência for o seu critério de seleção, esses dois modelos não se distinguem. Diga isso claramente em vez de fabricar um vencedor: no único número de velocidade medido da mesma forma para ambos, eles estão empatados.

A latência os separa violentamente. A AA coloca o tempo até o primeiro token de resposta do Grok 4.5 em 10,94 segundos, com 20,01 segundos de ponta a ponta; já o GPT-6 Astra, em 342,30 segundos, com 350,91 segundos de ponta a ponta. Isso é aproximadamente 31x e, em uma requisição síncrona, é a diferença entre um indicador de carregamento e uma pausa para o café.

Duas ressalvas honestas antes que alguém faça orçamento com base nisso. Primeiro, esses são números que incluem o raciocínio — o "tempo até o primeiro token de resposta" da AA conta deliberadamente o tempo de pensamento do modelo —, então eles descrevem uma tarefa difícil, não um turno de chat. Segundo, não são de esforço equiparado: a entrada publicada do Astra está em esforço máximo, a do Grok 4.5 em alto, e a configuração de esforço é exatamente o botão que move esse número. O próprio anúncio do OrcaRouter para o GPT-6 Astra mostra um tempo até o primeiro token de 8,31 segundos no p50 e 10,00 segundos no p95 em tráfego real, o que é um ponto de medição completamente diferente — primeiro token em chamadas reais de produção, não primeiro token de resposta em uma tarefa de benchmark. Os dois não são comparáveis e não deveriam ser colocados na mesma frase como comparação.

Two-column comparison scoreboard for Grok 4.5 vs GPT-6 Astra. Grok 4.5 column: AA Index 39 (high), price per 1M $2.00 / $6.00, cached input $0.30, cost per task $1.04, speed 55 tok/s, first answer token 10.94s. GPT-6 Astra column: AA Index 53 (max), price per 1M $10.00 / $50.00, cached input $1.00, cost per task $3.26, speed 58 tok/s, first answer token 342.30s. Footer: 'Index, cost, speed and latency per Artificial Analysis, index v4.3.2, read 23 September 2026. Prices per the vendors' own rate cards.'

Benchmarks de programação: confira a versão antes de citá-la

Pesquise por este confronto e você encontrará os 83,3% do Grok 4.5 no Terminal-Bench 2.1 contrapostos aos 57,9% do GPT-6 Astra no Terminal-Bench 4.0. Esses são benchmarks diferentes usando o mesmo nome. Eles não podem ser comparados, e as páginas de comparação que os empilham não estão lhe dizendo nada.

A maioria dos números de codificação publicados de ambos os fornecedores tem esse problema. A planilha da xAI para o Grok 4.5 reporta SWE-bench Pro 64,7%, Terminal-Bench 2.1 83,3%, DeepSWE 1.0 62,0% e DeepSWE 1.1 53%. A planilha da OpenAI para o Astra reporta Terminal-Bench 4.0 57,9%, OSWorld 2.0 72,6%, FrontierMath Tier 4 97,6% e ARC-AGI-3 99,9%. Todos reportados pelos fornecedores, e quase nenhum deles se sobrepõe.

Há um único ponto em que os dois se encontram verdadeiramente no mesmo harness: o DeepSWE v1.1 da Datacurve, que executa todos os modelos através do mesmo scaffold mini-swe-agent em 113 tarefas originais e livres de contaminação. Aí, o GPT-6 Astra obtém 74,1% a cerca de 6,52 dólares por tarefa, enquanto o Grok 4.5 fica em 53%. Esse é o resultado mais limpo e isolado desta página, e favorece decisivamente o Astra. Uma ressalva adicional específica ao Grok 4.5: o valor do CursorBench da xAI foi excluído da comparação pública depois de se descobrir que uma base de código anterior tinha vazado para o treino, por isso, considere qualquer número do CursorBench para este modelo como inutilizável.

Comportamento agêntico e chamada de ferramentas

Os dois seguem caminhos diferentes até o mesmo destino, e a diferença é arquitetural, e não uma pontuação.

Os recursos do GPT-6 Astra voltados para desenvolvedores pressupõem que você esteja criando um orquestrador. Ele oferece suporte a chamadas assíncronas de ferramentas, de modo que esperar por uma ferramenta não impede o modelo de continuar outros trabalhos; direcionamento no meio da tarefa via WebSockets, de modo que uma execução em andamento possa ser redirecionada sem reiniciá-la; e esforço de raciocínio ajustável no meio da conversa. No Codex, ele adiciona um mecanismo de preservação de contexto que mantém notas entre janelas de contexto enquanto o contexto anterior permanece pesquisável. Segundo relatos, o próprio system card da OpenAI observa que o modelo é mais difícil de monitorar do que seu antecessor, o que é um motivo para tratar logs de chamadas de ferramentas e o estado do sistema — não a narração do modelo — como sua evidência de auditoria.

A história agêntica do Grok 4.5 tem menos a ver com novas primitivas e mais com onde ele foi treinado. O co-treinamento com o Cursor em sessões reais de edição e depuração de vários arquivos é o que a xAI credita por sua eficiência de tokens em tarefas de software, e é por isso que o modelo aparece como padrão em superfícies de codificação, em vez de como um carro-chefe de uso geral. Chamada de função, saída estruturada, streaming e cache de prompt são todos suportados; a chamada de ferramentas segue o formato compatível com a OpenAI, e é por isso que colocá-lo em um cliente existente é uma mudança de URL base.

Não existe um benchmark agêntico independente e compartilhado em que ambos apareçam com esforço equiparado, então não vamos inventar um vencedor aqui. O que se pode dizer é que a superfície de chamada de ferramentas da Astra é a mais expressiva das duas para trabalhos de horizonte longo, e a economia de tokens por tarefa do Grok 4.5 é a mais atraente para trabalhos de alto volume.

Escolha o Grok 4.5 se

• Você executa trabalho de alto volume ou alta frequência, em que o custo por tarefa domina a decisão, e uma pontuação de 39 no AA Intelligence Index atende ao seu padrão de qualidade.

• Seus prompts ficam abaixo de 200.000 tokens. É aí que a vantagem de preço do Grok 4.5 é mais ampla e o reajuste de preços para contexto longo nunca é acionado.

• Você quer um desconto de cache fazendo trabalho de verdade. A US$ 0,30 por milhão de tokens de entrada em cache, contra US$ 1,00 da Astra, cargas de trabalho com prefixos repetidos — prompts de sistema longos, contexto compartilhado de repositório — ficam baratas rapidamente.

• Você precisa de latência de primeiro token inferior a um minuto em tarefas difíceis e não pode absorver uma espera de vários minutos.

Escolha o GPT-6 Astra se

• A tarefa é o produto, e a conta é um erro de arredondamento diante de uma resposta errada. Quatorze pontos de índice neste extremo da curva representam uma diferença real de capacidade, não uma de marketing.

• Você está de fato trabalhando além da marca de 500.000 tokens. A janela da Astra é aproximadamente o dobro da do Grok 4.5, e a Astra é a única das duas que alcança isso sem uma cláusula de reprecificação.

• Você precisa de uso de computador, pesquisa aprofundada ou da postura de cibersegurança — incluindo os controles desativados por padrão para empresas que acompanham o limiar Critical da OpenAI.

• Você está escrevendo código de orquestrador que quer chamadas de ferramentas assíncronas e direcionamento durante a execução, em vez de uma chamada direta de requisição-resposta.

O que se moveu esta semana, e por que isso muda a recomendação

Em 22 de setembro de 2026, a OpenAI lançou o GPT-6 Sol e o GPT-6 Luna a $2.00/$10.00 e $0.10/$0.50 por milhão de tokens, descrevendo as tarifas como permanentes e não promocionais. O Sol é o modelo de nível intermediário para programação e análise, a cerca de um quinto do preço de entrada da Astra.

Isso importa para esta decisão específica. Se o motivo pelo qual você estava comparando Grok 4.5 com GPT-6 Astra era o preço, a comparação honesta do lado da OpenAI já não é com Astra — Astra é o carro-chefe, e Sol agora ocupa a faixa em que Grok 4.5 realmente compete. Grok 4.5 ainda cobra menos que Sol na saída (US$ 6,00 contra US$ 10,00) e iguala Sol na entrada (US$ 2,00 cada), então ele não foi deslocado; mas uma comparação escrita antes desta semana estava comparando um modelo de custo-benefício com um carro-chefe e chamando o resultado de uma questão de preço.

O mesmo vale para o lado da xAI: a própria lista de modelos da xAI inclui grok-4.6 e grok-4.7 ao lado do grok-4.5, de modo que o Grok 4.5 é uma opção dentro de uma família, e não a fronteira atual.

Screenshot of the OrcaRouter model page for GPT-6 Astra, model id openai/gpt-6-astra, captured 23 September 2026, showing INPUT $10.00 and OUTPUT $50.00 per 1M tokens, a p50 time to first token of 8.31s and p95 of 10.00s over seven days, traffic of 300.7M tokens over seven days, a 1M-token context with 128K maximum output, an OpenAI-compatible base URL of https://api.orcarouter.ai/v1, the catalogue date 2026-09-04, and the English-language interface with the language switcher on EN.

Qual é o argumento real para o roteamento em vez da escolha. A stack de dois modelos que continua aparecendo em relatos de profissionais — envie o grosso para o modelo barato, escale a cauda difícil para o caro — é uma decisão de roteamento, e é uma que você pode expressar como configuração em vez de uma reescrita. O OrcaRouter coloca ambos os modelos por trás de uma única API e uma única chave, com o preço de lista do provedor repassado com 0% de markup, failover automático entre provedores, e uma DSL de roteamento que permite enviar trabalho abaixo de um limite para grok/grok-4.5 e escalar para openai/gpt-6-astra quando uma tarefa falha ou ultrapassa um limite de tamanho. Você pode testar o caminho caro em uma fatia estreita de tráfego sem apostar um pipeline de produção nele.

A versão curta

O GPT-6 Astra é o melhor modelo. Não há comparação, e esta página não teria valor se fingisse o contrário — 53 contra 39 na mesma revisão do índice, 74,1% contra 53% no único benchmark de programação que ambos realizaram.

Grok 4.5 é o modelo mais barato, mas por 3,1x por tarefa concluída, em vez dos 5x a 8,3x que sua tabela de preços sugere, porque a Astra gasta menos tokens para chegar lá. E no único número de velocidade medido de forma idêntica para ambos, eles estão no mesmo nível.

A decisão não é qual modelo vence. É se uma diferença de 14 pontos no índice justifica cerca do triplo da conta na sua carga de trabalho específica — e se a resposta é a mesma para cada pedido que envia.

Comparados neste artigo2

Detectado a partir deste artigo · Benchmarks: Artificial Analysis · atualizado diariamente