Cartão de título de destaque gerado com o título 'GPT-6 Luna vs Grok 4.6' e o subtítulo 'Vinte vezes o preço, e um penhasco em 200.000 tokens', um rodapé que diz 'Preços conforme OpenAI e xAI; números do índice conforme a Artificial Analysis.', e o logotipo da OrcaRouter composto no canto inferior direito.
Guides & Insights

GPT-6 Luna vs Grok 4.6: A diferença de preço é de vinte vezes, e a janela é a verdadeira diferença

Autor

Gideon Frost

Data de publicação

Modelos mais recentes · 20Ver todos os modelos
Benchmarks: Artificial Analysis · atualizado diariamente
Voltar para todas as publicações

Coloque GPT-6 Luna e Grok 4.6 na mesma página e a primeira comparação se escreve sozinha. O GPT-6 Luna custa US$ 0,10 por milhão de tokens de entrada e US$ 0,50 por milhão de saída. O Grok 4.6 custa US$ 2,00 e US$ 6,00, com leitura em cache de US$ 0,50. Vinte vezes na entrada, doze vezes na saída, e uma taxa de entrada em cache que é cinquenta vezes maior no modelo do fornecedor. Esse é o preço de tabela, e com base no preço de tabela a resposta não está nem perto.

A razão pela qual vale a pena escrever o resto deste texto é que os dois modelos discordam sobre algo mais estrutural do que o preço. O Grok 4.6 tem uma janela de contexto de 500.000 tokens e reajusta o preço de toda a solicitação assim que o prompt ultrapassa 200.000 tokens. O GPT-6 Luna tem 1.050.000 tokens e reajusta o preço em 272.000. Ambos os limiares são precipícios, e não taxas marginais — ultrapasse um deles e toda a solicitação será cobrada pelo valor mais alto, não apenas a parte acima da linha. Onde esses dois precipícios ficam, e o que acontece com uma carga de trabalho de contexto longo no lado errado de cada um, decide mais desta comparação do que a manchete de vinte vezes.

Dois modelos, duas posturas muito diferentes

O Grok 4.6 é o modelo da xAI de 12 de agosto de 2026, e é um lançamento de fronteira de propósito geral: texto de entrada, texto de saída, uma janela de 500.000 tokens, um custo publicado por tarefa de US$ 1,86 no painel independente em esforço alto, e uma velocidade medida de 57,7 tokens de saída por segundo. É o tipo de modelo que uma equipe adota porque é bom em muitas coisas e o fornecedor está lançando rápido.

O GPT-6 Luna tem a postura oposta. A OpenAI o lançou em 22 de setembro de 2026 como o nível de volume da família GPT-6, abaixo do GPT-6 Sol, a US$ 2,00/US$ 10,00, e do carro-chefe GPT-6 Astra, a US$ 10,00/US$ 50,00. Entrada de texto e imagem, saída de texto, janela de 1.050.000 tokens com entrada máxima de 922.000 tokens, limite de saída de 128.000 tokens, e uma escala de raciocínio que vai de none, passando por low, medium, high, xhigh, até max, com medium como padrão. Não é um modelo que alguém adote por sua amplitude. É um modelo que se coloca debaixo de uma carga de trabalho.

Então, a forma honesta de enquadrar a questão não é "qual destes é melhor". É "qual destes está precificado para o formato de trabalho que você tem", e os dois formatos são genuinamente diferentes.

Os cartões, linha por linha

Uma linha por dimensão, ambos os lados em cada:

• Entrada por 1M — GPT-6 Luna $0.10 vs Grok 4.6 $2.00

• Saída por 1M — GPT-6 Luna US$ 0,50 vs Grok 4.6 US$ 6,00

• Entrada em cache por 1 milhão — GPT-6 Luna $0,01 vs Grok 4.6 $0,50, um décimo de sua própria tarifa de entrada, contra um quarto da tarifa de entrada da xAI

• Limite de contexto longo — GPT-6 Luna 272.000 tokens de entrada vs Grok 4.6 200.000 tokens de prompt

• Tarifas de contexto longo — GPT-6 Luna reajusta o preço de toda a solicitação para US$ 0,20 de entrada, US$ 0,75 de saída e US$ 0,02 em cache, enquanto Grok 4.6 reajusta o preço de toda a solicitação para US$ 4,00 de entrada, US$ 12,00 de saída e US$ 1,00 em cache

• Janela de contexto — GPT-6 Luna 1.050.000 tokens vs. Grok 4.6 500.000 tokens

• Saída máxima — GPT-6 Luna 128.000 tokens vs. Grok 4.6 não publicado como limite separado no cartão

• Intelligence Index, independente — GPT-6 Luna 37 em esforço máximo vs Grok 4.6 44 em esforço alto na revisão do índice v4.3.2

• Pontuação de esforço padrão — GPT-6 Luna 29 no seu médio padrão vs Grok 4.6 43 no médio, onde o placar também o mede

• Custo por tarefa do Index, independente — GPT-6 Luna cerca de US$ 0,07 vs Grok 4.6 US$ 1,86 com esforço alto

• Tokens de saída na execução do índice — GPT-6 Luna 150M vs Grok 4.6 94M, contra uma mediana do quadro de 88M

• Velocidade de saída, independente — GPT-6 Luna 153,9 tokens/seg vs Grok 4.6 57,7 tokens/seg em alto

• Tempo até o primeiro token, independente — Grok 4.6 38,63s, ponta a ponta 47,31s; GPT-6 Luna retorna um primeiro token em um tempo que permite ao usuário esperar

• Capacidade cibernética, independente — Grok 4.6 obtém 57 na avaliação cibernética do painel; nenhum número comparável do GPT-6 Luna foi publicado

• No OrcaRouter — GPT-6 Luna não está no nosso catálogo vs Grok 4.6 roteável ao preço de tabela da xAI

Generated two-column scoreboard titled 'GPT-6 Luna vs Grok 4.6 - the scoreboard'. Left column GPT-6 Luna rows: Price in/out $0.10 / $0.50, Cached input $0.01, Long-context threshold 272,000, Context 1,050,000, AA Index 37 at max effort, Cost per index task $0.07. Right column Grok 4.6 rows: Price in/out $2.00 / $6.00, Cached input $0.50, Long-context threshold 200,000, Context 500,000, AA Index 44 at high effort, Cost per index task $1.86. Footer: 'Prices per OpenAI and xAI; index figures per Artificial Analysis.'

200.000 contra 272.000 é o argumento inteiro.

Leia os dois limiares ao lado das duas janelas e a comparação reorganiza-se.

O penhasco do Grok 4.6 fica em 200.000 tokens dentro de uma janela de 500.000 tokens — 40% do caminho. O do GPT-6 Luna fica em 272.000 dentro de 1.050.000 — 26% do caminho. Então, não só o modelo mais barato começa a reprecificar mais tarde, como tem mais que o dobro de espaço após o limiar antes de a janela se esgotar por completo.

Concretamente: uma solicitação de 450.000 tokens cabe nos dois modelos. No GPT-6 Luna, a cobrança ocorre na faixa de contexto longo, a US$ 0,20 e US$ 0,75. No Grok 4.6, a cobrança é de US$ 4,00 e US$ 12,00. Isso representa vinte vezes mais na entrada e dezesseis vezes mais na saída para o mesmo prompt — e é uma solicitação que o Grok 4.6 consegue atender, então a escolha é real, e não teórica.

O caso inverso é o que apanha as pessoas desprevenidas. Uma solicitação de 190.000 tokens fica abaixo de ambos os limites e é cobrada pelas tarifas padrão nos dois: $0,10/$0,50 contra $2,00/$6,00, uma diferença exata de vinte e de doze vezes. Uma solicitação de 210.000 tokens fica acima do limite do Grok 4.6 e abaixo do limite do GPT-6 Luna. A cobrança é de $4,00/$12,00 no Grok 4.6 e de $0,10/$0,50 no Luna — uma disparidade de quarenta e de vinte e quatro vezes gerada inteiramente por uma diferença de 20.000 tokens no comprimento do prompt, sem qualquer alteração em nenhum dos modelos.

Isso não é um motivo para evitar o Grok 4.6. É um motivo para saber onde seus prompts realmente chegam, porque uma carga de trabalho que tem média de 180.000 tokens e picos de 220.000 está pagando duas tabelas de preços diferentes e vai parecer um erro de cobrança no primeiro mês em que isso acontecer.

O que a diferença de preço compra no conselho independente

O Grok 4.6 obtém 44 no Artificial Analysis Intelligence Index com esforço alto. O GPT-6 Luna obtém 37 com esforço máximo. Sete pontos, em uma métrica composta na qual um único ponto está dentro do ruído de uma nova execução — e os dois modelos estão separados por cerca de vinte e seis vezes no custo por tarefa concluída, US$ 1,86 contra cerca de US$ 0,07.

Duas coisas sobre esse par de números merecem ser separadas.

O primeiro é o padrão de esforço. O 37 do GPT-6 Luna é um valor de esforço máximo, e seu padrão é médio, no qual ele pontua 29. O 44 do Grok 4.6 é um valor de esforço alto, e o ranking também o mede no nível médio, no qual ele pontua 43. Portanto, a comparação em condições iguais nas configurações padrão é 29 contra 43 — quatorze pontos, não sete, e a versão de quatorze pontos é a que uma equipe que faz o deploy de ambos e não altera nada realmente vivenciará. O Grok 4.6 perde um ponto ao passar de alto para médio. O GPT-6 Luna perde oito. O ajuste de esforço custa ao modelo barato muito mais do que custa ao caro, e essa assimetria é invisível nos números principais do índice.

O segundo é a verbosidade, e aqui a direção é oposta ao que a proporção de preços sugere. O GPT-6 Luna gerou 150 milhões de tokens de saída ao completar o índice; o Grok 4.6 gerou 94 milhões. O modelo que custa um doze avos por token de saída gastou 60% mais tokens para obter uma pontuação menor. Em uma tabela de preços por saída, essa é a diferença entre uma lacuna de custo por tarefa de vinte e seis vezes e uma menor, e é a razão pela qual qualquer comparação baseada apenas nos preços de tabela exagerará o argumento a favor do nível barato.

O Grok 4.6 também publica uma pontuação de capacidade cibernética de 57 no mesmo quadro. Não há um valor comparável para o GPT-6 Luna, de modo que essa dimensão tem apenas um lado — mas é o tipo de dado que importa se a sua carga de trabalho envolver ferramentas de segurança, e a ausência dele no modelo mais barato é informação, e não uma lacuna a ser preenchida por suposição.

Latência, onde os dois não estão próximos e não estão na mesma direção

Os números independentes de latência do Grok 4.6 são 38,63 segundos até o primeiro token e 47,31 segundos de ponta a ponta com esforço alto. Esse é um número para um modelo que faz raciocínio sério antes de falar, e não é compatível com uma pessoa olhando para um cursor. Nossa própria listagem para o modelo registra um p50 de tempo até o primeiro token de 6,71 segundos e um p95 de 10,00 segundos em uma janela de sete dias, que mede um ponto diferente da resposta e não é comparável ao número independente — os dois números não estão em desacordo, eles estão respondendo a perguntas diferentes.

O GPT-6 Luna funciona a 153,9 tokens de saída por segundo e retorna seu primeiro token rápido o suficiente para estar por trás de uma superfície interativa. Sua vazão é quase três vezes a do Grok 4.6 em esforço alto. Para um job em lote, essa diferença é uma conveniência em termos de tempo decorrido. Para qualquer coisa que um usuário esteja aguardando, é a diferença entre um produto e um protótipo.

A combinação é incomum e vale a pena dizer claramente: o modelo barato é o rápido, o modelo caro é o lento, e o modelo caro está sete pontos à frente no composto com esforço equivalente. Esse é o perfil de um modelo feito para pensar a fundo uma vez, e de um modelo feito para responder rapidamente muitíssimas vezes. Se a sua carga de trabalho for uma chamada por tarefa, a latência do Grok 4.6 é acessível. Se forem mil chamadas por tarefa, não é.

O que você está realmente comprando do lado da xAI

O Grok 4.6 custa cerca de vinte e seis vezes mais por tarefa concluída do que o GPT-6 Luna e está sete pontos de índice à frente com esforço equivalente. Essa é uma taxa de troca ruim para uma carga de trabalho de propósito geral, e é razoável para uma classe específica de trabalho.

Três coisas justificam isso. A pontuação de cibersegurança de 57 é uma capacidade para a qual o GPT-6 Luna não publica uma contrapartida. A execução de índice de 94 milhões de tokens contra os 150 milhões do Luna é uma verdadeira vantagem de concisão em qualquer tarefa em que a saída é consumida por uma pessoa, e não por um parser. E o modelo está em produção desde 12 de agosto, seis semanas a mais do que o GPT-6 Luna existe — o que não é um benchmark, mas é um histórico, e, para uma equipe que já construiu em cima dele, o custo de migração de abandoná-lo faz parte do preço de abandoná-lo.

Em contrapartida, o caso do GPT-6 Luna não é principalmente a taxa vinte vezes maior. É o limite de 272.000 tokens dentro de uma janela de um milhão de tokens, a capacidade de receber instrução para interromper totalmente o raciocínio, uma tarifa de entrada em cache de um centavo por milhão, e um valor de throughput que o torna utilizável como componente em vez de endpoint. Essas são propriedades estruturais da camada barata, e nenhuma vantagem de índice do outro lado, por maior que seja, as substitui.

Executando um deles, ou ambos

O Grok 4.6 está no OrcaRouter pelo preço de tabela da xAI, sob precificação de repasse que faz uma mudança de tarifa do fornecedor recair sobre nós no mesmo dia, em vez de esperar que um revendedor renegocie. O failover automático é a parte que justifica seu lugar especificamente para este modelo: uma janela de 500.000 tokens com um corte abrupto em 200.000 tokens é uma carga de trabalho em que uma solicitação ocasionalmente cai no lado errado da linha, e uma rota que se move entre upstreams sem uma implantação vale mais do que uma fração de centavo por token.

O GPT-6 Luna não está em nosso catálogo até o momento desta redação e é acessado pela própria API da OpenAI. Portanto, uma equipe que quer os dois usa uma chave para o Grok 4.6 junto com o que já utiliza para a OpenAI. O DSL de roteamento é a peça que se encaixa nesse pareamento: uma regra que envia prompts acima de um limite de tokens para o modelo cujo penhasco eles superam, e tudo abaixo dele para o modelo que custa um doze avos do preço, é expressável como configuração em vez de como uma ramificação na sua aplicação — o que importa quando os limites estão tão próximos dos tamanhos comuns de prompt quanto estes dois estão.

Screenshot of OpenAI's developer documentation page for GPT-6 Luna, showing the model selector, the description 'Our most efficient model for focused, high-volume tasks', reasoning set to High, speed Fast, price $0.1 · $0.5, text and image input with text output, a 1,050,000-token context window, 128,000 maximum output tokens, a May 18, 2026 knowledge cutoff, and pricing cards of $0.10 input, $0.01 cached input, $0.125 cache writes and $0.50 output per 1M tokens.

Qual deles, e quando

Use o GPT-6 Luna se sua carga de trabalho for de alto volume, consumida por programas e curta. Classificação, extração, roteamento, sumarização em massa, o loop interno de um agente. A $0.10/$0.50 com uma leitura em cache de um centavo, contra um modelo que custa vinte e seis vezes mais por tarefa concluída para sete pontos de índice com esforço equivalente, a vantagem aritmética é esmagadora. Defina explicitamente o parâmetro de esforço — o padrão é medium e o 37 anunciado é um número de esforço máximo — e mantenha suas chamadas longas abaixo de 272.000 tokens.

Use o Grok 4.6 se você precisar da capacidade ciber, se a sua saída for lida por uma pessoa e valer a pena pagar pela concisão dela, ou se você tiver uma carga de trabalho de 300.000 a 500.000 tokens que o GPT-6 Luna consegue atender, mas na qual você prefere não ser a primeira equipe a descobrir como ele se comporta nesse comprimento. Considere no orçamento, explicitamente, o precipício de 200.000 tokens, e não o coloque atrás de uma superfície interativa em esforço alto — 38 segundos até o primeiro token não é um número de latência, é uma declaração sobre para que serve o modelo.

O erro que esta comparação convida a cometer é tratar a taxa vinte vezes maior como a decisão. Ela é a decisão para um formato de carga de trabalho. Para o outro, a decisão é tomada em 200.000 e 272.000 tokens, e a proporção de preços é um detalhe que você lê depois.

Screenshot of the OrcaRouter model page for Grok 4.6 showing the xAI vendor label, list pricing of $2.00 input and $6.00 output per 1M tokens, a 500,000-token context window, recorded latency statistics, an uptime chart, and the provider routing section.

Comparados neste artigo1

Detectado a partir deste artigo · Benchmarks: Artificial Analysis · atualizado diariamente