
GPT-6 vs GPT-6 Luna: A dez centavos por milhão de tokens, e o nível que responde ao plano gratuito
- openaiNOVOOpenAI: GPT-6.1 Sol2026-09-2952Inteligência
- anthropicNOVOAnthropic: Claude Sonnet 5.52026-09-2856Inteligência
- typesafeNOVOTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 por 1M de tokens · 128 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238Inteligência
- OpenAIOpenAI: GPT-6 Sol2026-09-2248Inteligência
- AnthropicAnthropic: Claude Opus 5.52026-09-2258Inteligência
- xAIGrok 4.72026-09-2146Inteligência
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 por 1M de tokens · 60 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 por 1M de tokens · 320 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligência
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Inteligência77Código
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Inteligência76Código
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Inteligência76Código
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Inteligência82Código
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 por 1M de tokens · 54 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 por 1M de tokens · 356 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligência72Código
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 por 1M de tokens · 232 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Inteligência75Código
- obsidianQwen3.8 27B2026-08-1534Inteligência68Código
Há uma versão desta comparação em que a resposta é uma linha: você não pode chamar o GPT-6, e você pode chamar o GPT-6 Luna por dez centavos por milhão de tokens de entrada. Mas a versão mais útil é a que explica por que a Luna é agora o modelo que a maioria das pessoas realmente usou — a OpenAI a colocou nos níveis Free e Go do ChatGPT em 8 de outubro de 2026, o que a torna o nível mais barato da geração e, em número de usuários, o mais movimentado. O que segue é a escada de níveis explicada uma vez, e depois o que dez centavos por milhão realmente compram.
A família, e onde Luna se encaixa nela
A OpenAI lança a geração GPT-6 como três IDs de modelo lançados em 22 de setembro de 2026, sem openai/gpt-6 endpoint por trás do nome da família:
• GPT-6 Astra — o carro-chefe, US$ 10,00 de entrada / US$ 50,00 de saída por milhão de tokens, listado na tabela de preços da OpenAI como o topo da geração
• GPT-6 Sol — o nível intermediário, US$ 2,00 / US$ 10,00, e o modelo que a OpenAI indica para conversas nos níveis pagos do ChatGPT
• GPT-6 Luna — o nível barato, US$ 0,10 / US$ 0,50, e o modelo que a OpenAI indica para os níveis Free e Go
Essa última linha é a parte que vale a pena definir com precisão, porque é a razão pela qual o tráfego da Luna é muito maior que tudo o mais na família. O próprio anúncio da OpenAI para o lançamento de 7–8 de outubro afirma que "o GPT-6 no ChatGPT é alimentado pelo GPT-6 Sol para os níveis Plus, Pro, Business e Enterprise, e pelo GPT-6 Luna para os níveis Free e Go." Um modelo a $0.10 / $0.50 atendendo ao plano gratuito é um modelo que responde a mais perguntas por dia do que qualquer nível premium, e é o mesmo checkpoint que você pode invocar pela API. A superfície voltada ao consumidor é um canal de distribuição, não um SKU separado.
Uma ressalva que precisa ser repetida aqui porque este blog já publicou sobre isso: o mesmo anúncio diz que Free e Go recebem o GPT-6 Luna, enquanto a página do centro de ajuda da OpenAI sobre o GPT-6 no ChatGPT descrevia Free e Go como executando o GPT-5.6 Luna no dia em que foi consultada. Essas não são afirmações compatíveis sobre o mesmo nível, a OpenAI não disse qual é a atual, e se o seu trabalho depende de qual modelo barato está por trás do plano gratuito, trate a entrada do centro de ajuda como a página mais específica e verifique novamente antes de construir com base em qualquer uma delas.
O que dez centavos por milhão realmente compram
O número em destaque é o menos interessante no cartão da Luna. Aqui está o cartão completo, e a etapa de nível logo abaixo:
• Contexto curto, até 272.000 tokens de entrada — $0,10 por milhão de entrada, $0,50 por milhão de saída
• Acima de 272.000 tokens de entrada — $0,20 por milhão de entrada, $0,75 por milhão de saída, aplicado à solicitação inteira
• Entrada em cache — $0,01 por milhão na faixa curta, um desconto de 90%; $0,02 acima da linha
• Gravações em cache — $0,125 por milhão na faixa curta, $0,25 acima dela
• Contexto e saída — 1.050.000 tokens de entrada, 128.000 tokens de saída
• Modalidades de entrada — texto, imagem e arquivo, a mesma entrada multimodal que Sol e Astra
• Raciocínio — um parâmetro de esforço configurável, juntamente com ferramentas, saída JSON e amostragem com semente
Duas coisas se seguem. A primeira é que Luna não é um modelo despojado. Aceita imagens e arquivos, expõe a mesma interface de chamada de ferramentas e de saída estruturada que seus dois irmãos mais caros, e a única coisa que a separa de Sol na ficha técnica é profundidade, e não capacidade. A segunda é o degrau. Um prompt acima de 272.000 tokens de entrada dobra a tarifa de entrada da Luna e aumenta a tarifa de saída em 50%, em toda a requisição, e não apenas no excedente. Isso é um degrau suave nesses preços — uma requisição de 300.000 tokens custa cerca de seis centavos de entrada em vez de três — de modo que a cláusula de contexto longo, que domina o planejamento orçamentário para Astra e é importante para Sol, é quase irrelevante aqui.
O número que de fato movimenta dinheiro em escala é a leitura em cache. A um centavo por milhão, uma carga de trabalho que reenvia o mesmo contexto grande a cada turno paga quase nada pela parte repetida. Em um pipeline de extração ou classificação de alto volume, com um prompt de sistema estável e um documento estável, essa é a diferença entre um modelo barato e um praticamente gratuito, e é o motivo específico pelo qual o custo real da Luna por resposta finalizada fica bem abaixo do que a tabela de preços sugere.
O que isso lhe custa em capacidade
Luna é o nível mais barato porque é o menos capaz, e o painel independente não deixa dúvidas sobre quanto menos. Consulte o Artificial Analysis através da entrada do catálogo do OrcaRouter para cada modelo em 8 de outubro de 2026:
• AA Intelligence Index — GPT-6 Sol 47,6, posição 14; GPT-6 Luna 38,1, posição 37
• Humanity's Last Exam — GPT-6 Sol 47,9 vs GPT-6 Luna 38,5
• SciCode — GPT-6 Sol 57,6 vs GPT-6 Luna 54,6
• Recall de contexto longo — GPT-6 Sol 83,7 vs GPT-6 Luna 83,3
• Terminal-Bench 4.0 — GPT-6 Sol 43,9 vs GPT-6 Luna 12,6
• Tráfego ao longo de sete dias — GPT-6 Luna cerca de 574 milhões de tokens; GPT-6 Sol cerca de 2,1 milhões
• Tempo mediano até o primeiro token — GPT-6 Luna 1.494 ms vs GPT-6 Sol 6.785 ms
• Velocidade mediana de saída — GPT-6 Luna 132,9 tokens/s vs GPT-6 Sol 179,6 tokens/s
A forma disso é mais informativa do que a diferença principal. Luna está 9,5 pontos de índice atrás de Sol, e a perda não está distribuída de maneira uniforme: a recuperação de contexto longo é um empate de 0,4 ponto, e o SciCode — compreensão de código em vez de produção de código — está a apenas 3 pontos de distância. O que colapsa é a execução agêntica de múltiplas etapas: Terminal-Bench 4.0 com 12,6 contra os 43,9 de Sol. Um modelo que consegue recuperar de um documento de um milhão de tokens quase tão bem quanto seu irmão maior, e escrever uma resposta competente em uma única tentativa, é um instrumento diferente daquele que consegue conduzir um loop de ferramentas até a conclusão.
Duas ressalvas. Os números do índice vêm da Artificial Analysis, não da OpenAI, e esse avaliador não garante que duas páginas de modelo sejam renderizadas com a mesma revisão do índice no mesmo dia — trate diferenças inferiores a um ponto como direção, não como precisão. E os números de serving são nossas próprias medições de roteamento em uma janela móvel de sete dias; eles variam entre leituras e são úteis para a forma da diferença, e não como uma promessa de nível de serviço.
Há um número de serving que vale a pena destacar. O tempo mediano até o primeiro token da Luna é 1.494 ms contra os 6.785 ms do Sol — cerca de 4,5 vezes mais rápido até o primeiro token — e seu throughput é significativamente menor assim que o streaming começa. Para uma interface de chat em que o usuário aguarda a linha de abertura, essa inversão é o ponto central do nível, e é por isso que o plano gratuito pode parecer rápido mesmo executando o modelo mais barato da família.
A nova competição dentro da família
A vantagem de preço da Luna dentro da geração diminuiu desde o seu lançamento. GPT-6.1 Solchegou em 29 de setembro com o preço de US$ 2,00 / US$ 10,00 do Sol e um índice de 51,8, e reduziu a tarifa de entrada em cache para US$ 0,10 por milhão. Isso não afeta a tarifa de contexto curto da Luna — dez centavos na entrada e cinquenta centavos na saída ainda é vinte vezes mais barato na entrada do que qualquer Sol —, mas significa que a camada acima da Luna ficou mais barata de operar com tráfego em cache, que é justamente a carga de trabalho em que a vantagem da Luna era mais ampla. A diferença ainda é grande. Já não é tão grande quanto as tabelas de preços sozinhas sugerem.

Onde fica a linha de nível na prática
Divida o trabalho pelo que a tarefa precisa, não por qual modelo obtém a pontuação mais alta.
Luna é a escolha certa para chat de alto volume, classificação, extração, moderação e sumarização de um documento longo — a linha em que ela empata com seu irmão maior na recuperação é exatamente a linha que determina se um contexto grande é utilizável. Sua latência do primeiro token a torna a melhor escolha para qualquer aplicação interativa que não seja intensiva em raciocínio. E, a um centavo por milhão em cache, um pipeline de contexto estável é praticamente gratuito na parte repetida.
Sol, ou agora GPT-6.1 Sol, é a escolha certa no momento em que a tarefa exige um ciclo de ferramentas, um plano de longo horizonte ou uma cadeia de passos que precisa ser concluída. A diferença no Terminal-Bench — 43,9 contra 12,6 — é o sinal mais claro desta comparação, e corresponde ao verdadeiro modo de falha: um modelo barato que responde bem ao primeiro passo e depois perde o fio da meada. O parâmetro effort significa que você pode pedir à Luna mais raciocínio, mas esse parâmetro aumenta a contagem de tokens em vez do teto; ele não transforma um 12,6 em um 43,9.
E a Astra continua sendo a resposta para o trabalho que só o modelo de ponta consegue fazer — o que, a US$ 10,00 de entrada e US$ 50,00 de saída, contra os dez centavos da Luna, é uma decisão que você deveria conseguir justificar por chamada, e não por equipe.
A versão de API única desta escolha
A parte incômoda de uma família de três níveis é que a fronteira entre níveis muda conforme a funcionalidade, e muda a cada requisição — a mesma aplicação geralmente quer Luna para um endpoint e Sol para o próximo. Isso é um problema de roteamento, não de compras. Todos os três níveis do GPT-6 ficam no mesmo catálogo do OrcaRouter, chamados por meio de uma única API compatível com OpenAI diante de mais de 200 modelos, com o preço de tabela do provedor repassado com 0% de markup, de modo que uma mudança de preço do fornecedor em qualquer nível entra no ar aqui no mesmo dia, em vez de na sua próxima conciliação. A DSL de roteamento compõe a divisão explicitamente — por tamanho da requisição, por endpoint ou por proporção — para que o caminho de classificação possa executar Luna enquanto o caminho agêntico executa Sol, e o failover automático entre provedores cobre uma rota que se degrada, em vez de deixar você descobrir isso a partir de uma execução com falha.
Uma coisa que isso não faz é lhe dar uma Luna que se comporta como Sol. Os níveis existem porque os modelos diferem, e os números acima são o tamanho da diferença. O que uma única chave e uma regra de roteamento lhe proporcionam é a capacidade de colocar cada solicitação no nível que realmente lhe convém, em vez de colocar tudo no mais caro por segurança ou tudo no mais barato por orçamento.

A resposta, pela única pergunta que importa.
Se a tarefa é recuperar e depois responder em um documento grande, chat ou processamento de texto em massa, o GPT-6 Luna é o nível certo, e o cartão de dez centavos não é uma concessão — a linha de recall de contexto longo diz que ele recupera tão bem quanto o modelo que custa vinte vezes mais. Se a tarefa exige um agente de várias etapas para ser concluída, o Luna é o nível errado, e a atitude honesta é usar o GPT-6 Sol ou o GPT-6.1 Sol, em que o preço ainda é baixo em termos absolutos e as avaliações agênticas param de colapsar.
O que "GPT-6" é por si só, de novo, não é nada que se possa chamar. É um nome de família que abrange três IDs em três faixas de preço e três tetos de capacidade diferentes, e Luna é a que está na base — a mais barata, a mais rápida até o primeiro token, a que atende o plano gratuito e aquela cujo teto aparece no momento em que uma tarefa precisa de mais do que uma única resposta confiante.

Comparados neste artigo1
Detectado a partir deste artigo · Benchmarks: Artificial Analysis · atualizado diariamente
