Cartão de título gerado com a inscrição "GPT-6 vs GPT-6 Luna", com um chip com a inscrição "GPT-6 é um nome de família, não um id de modelo" e um chip com a inscrição "GPT-6 Luna: $0,10 de entrada / $0,50 de saída, alimenta o ChatGPT Free e Go", e um rodapé com a inscrição "Modelos lançados em 22 de setembro de 2026; regra de nível conforme o próprio anúncio da OpenAI." O logotipo da OrcaRouter está composto no canto inferior direito.
Guides & Insights

GPT-6 vs GPT-6 Luna: A dez centavos por milhão de tokens, e o nível que responde ao plano gratuito

Autor

Elias Hawthorne

Data de publicação

Modelos mais recentes · 20Ver todos os modelos →
Benchmarks: Artificial Analysis · atualizado diariamente
Voltar para todas as publicações

Há uma versão desta comparação em que a resposta é uma linha: você não pode chamar o GPT-6, e você pode chamar o GPT-6 Luna por dez centavos por milhão de tokens de entrada. Mas a versão mais útil é a que explica por que a Luna é agora o modelo que a maioria das pessoas realmente usou — a OpenAI a colocou nos níveis Free e Go do ChatGPT em 8 de outubro de 2026, o que a torna o nível mais barato da geração e, em número de usuários, o mais movimentado. O que segue é a escada de níveis explicada uma vez, e depois o que dez centavos por milhão realmente compram.

A família, e onde Luna se encaixa nela

A OpenAI lança a geração GPT-6 como três IDs de modelo lançados em 22 de setembro de 2026, sem openai/gpt-6 endpoint por trás do nome da família:

• GPT-6 Astra — o carro-chefe, US$ 10,00 de entrada / US$ 50,00 de saída por milhão de tokens, listado na tabela de preços da OpenAI como o topo da geração
• GPT-6 Sol — o nível intermediário, US$ 2,00 / US$ 10,00, e o modelo que a OpenAI indica para conversas nos níveis pagos do ChatGPT
• GPT-6 Luna — o nível barato, US$ 0,10 / US$ 0,50, e o modelo que a OpenAI indica para os níveis Free e Go

Essa última linha é a parte que vale a pena definir com precisão, porque é a razão pela qual o tráfego da Luna é muito maior que tudo o mais na família. O próprio anúncio da OpenAI para o lançamento de 7–8 de outubro afirma que "o GPT-6 no ChatGPT é alimentado pelo GPT-6 Sol para os níveis Plus, Pro, Business e Enterprise, e pelo GPT-6 Luna para os níveis Free e Go." Um modelo a $0.10 / $0.50 atendendo ao plano gratuito é um modelo que responde a mais perguntas por dia do que qualquer nível premium, e é o mesmo checkpoint que você pode invocar pela API. A superfície voltada ao consumidor é um canal de distribuição, não um SKU separado.

Uma ressalva que precisa ser repetida aqui porque este blog já publicou sobre isso: o mesmo anúncio diz que Free e Go recebem o GPT-6 Luna, enquanto a página do centro de ajuda da OpenAI sobre o GPT-6 no ChatGPT descrevia Free e Go como executando o GPT-5.6 Luna no dia em que foi consultada. Essas não são afirmações compatíveis sobre o mesmo nível, a OpenAI não disse qual é a atual, e se o seu trabalho depende de qual modelo barato está por trás do plano gratuito, trate a entrada do centro de ajuda como a página mais específica e verifique novamente antes de construir com base em qualquer uma delas.

O que dez centavos por milhão realmente compram

O número em destaque é o menos interessante no cartão da Luna. Aqui está o cartão completo, e a etapa de nível logo abaixo:

• Contexto curto, até 272.000 tokens de entrada — $0,10 por milhão de entrada, $0,50 por milhão de saída
• Acima de 272.000 tokens de entrada — $0,20 por milhão de entrada, $0,75 por milhão de saída, aplicado à solicitação inteira
• Entrada em cache — $0,01 por milhão na faixa curta, um desconto de 90%; $0,02 acima da linha
• Gravações em cache — $0,125 por milhão na faixa curta, $0,25 acima dela
• Contexto e saída — 1.050.000 tokens de entrada, 128.000 tokens de saída
• Modalidades de entrada — texto, imagem e arquivo, a mesma entrada multimodal que Sol e Astra
• Raciocínio — um parâmetro de esforço configurável, juntamente com ferramentas, saída JSON e amostragem com semente

Duas coisas se seguem. A primeira é que Luna não é um modelo despojado. Aceita imagens e arquivos, expõe a mesma interface de chamada de ferramentas e de saída estruturada que seus dois irmãos mais caros, e a única coisa que a separa de Sol na ficha técnica é profundidade, e não capacidade. A segunda é o degrau. Um prompt acima de 272.000 tokens de entrada dobra a tarifa de entrada da Luna e aumenta a tarifa de saída em 50%, em toda a requisição, e não apenas no excedente. Isso é um degrau suave nesses preços — uma requisição de 300.000 tokens custa cerca de seis centavos de entrada em vez de três — de modo que a cláusula de contexto longo, que domina o planejamento orçamentário para Astra e é importante para Sol, é quase irrelevante aqui.

O número que de fato movimenta dinheiro em escala é a leitura em cache. A um centavo por milhão, uma carga de trabalho que reenvia o mesmo contexto grande a cada turno paga quase nada pela parte repetida. Em um pipeline de extração ou classificação de alto volume, com um prompt de sistema estável e um documento estável, essa é a diferença entre um modelo barato e um praticamente gratuito, e é o motivo específico pelo qual o custo real da Luna por resposta finalizada fica bem abaixo do que a tabela de preços sugere.

O que isso lhe custa em capacidade

Luna é o nível mais barato porque é o menos capaz, e o painel independente não deixa dúvidas sobre quanto menos. Consulte o Artificial Analysis através da entrada do catálogo do OrcaRouter para cada modelo em 8 de outubro de 2026:

• AA Intelligence Index — GPT-6 Sol 47,6, posição 14; GPT-6 Luna 38,1, posição 37
• Humanity's Last Exam — GPT-6 Sol 47,9 vs GPT-6 Luna 38,5
• SciCode — GPT-6 Sol 57,6 vs GPT-6 Luna 54,6
• Recall de contexto longo — GPT-6 Sol 83,7 vs GPT-6 Luna 83,3
• Terminal-Bench 4.0 — GPT-6 Sol 43,9 vs GPT-6 Luna 12,6
• Tráfego ao longo de sete dias — GPT-6 Luna cerca de 574 milhões de tokens; GPT-6 Sol cerca de 2,1 milhões
• Tempo mediano até o primeiro token — GPT-6 Luna 1.494 ms vs GPT-6 Sol 6.785 ms
• Velocidade mediana de saída — GPT-6 Luna 132,9 tokens/s vs GPT-6 Sol 179,6 tokens/s

A forma disso é mais informativa do que a diferença principal. Luna está 9,5 pontos de índice atrás de Sol, e a perda não está distribuída de maneira uniforme: a recuperação de contexto longo é um empate de 0,4 ponto, e o SciCode — compreensão de código em vez de produção de código — está a apenas 3 pontos de distância. O que colapsa é a execução agêntica de múltiplas etapas: Terminal-Bench 4.0 com 12,6 contra os 43,9 de Sol. Um modelo que consegue recuperar de um documento de um milhão de tokens quase tão bem quanto seu irmão maior, e escrever uma resposta competente em uma única tentativa, é um instrumento diferente daquele que consegue conduzir um loop de ferramentas até a conclusão.

Duas ressalvas. Os números do índice vêm da Artificial Analysis, não da OpenAI, e esse avaliador não garante que duas páginas de modelo sejam renderizadas com a mesma revisão do índice no mesmo dia — trate diferenças inferiores a um ponto como direção, não como precisão. E os números de serving são nossas próprias medições de roteamento em uma janela móvel de sete dias; eles variam entre leituras e são úteis para a forma da diferença, e não como uma promessa de nível de serviço.

Há um número de serving que vale a pena destacar. O tempo mediano até o primeiro token da Luna é 1.494 ms contra os 6.785 ms do Sol — cerca de 4,5 vezes mais rápido até o primeiro token — e seu throughput é significativamente menor assim que o streaming começa. Para uma interface de chat em que o usuário aguarda a linha de abertura, essa inversão é o ponto central do nível, e é por isso que o plano gratuito pode parecer rápido mesmo executando o modelo mais barato da família.

A nova competição dentro da família

A vantagem de preço da Luna dentro da geração diminuiu desde o seu lançamento. GPT-6.1 Solchegou em 29 de setembro com o preço de US$ 2,00 / US$ 10,00 do Sol e um índice de 51,8, e reduziu a tarifa de entrada em cache para US$ 0,10 por milhão. Isso não afeta a tarifa de contexto curto da Luna — dez centavos na entrada e cinquenta centavos na saída ainda é vinte vezes mais barato na entrada do que qualquer Sol —, mas significa que a camada acima da Luna ficou mais barata de operar com tráfego em cache, que é justamente a carga de trabalho em que a vantagem da Luna era mais ampla. A diferença ainda é grande. Já não é tão grande quanto as tabelas de preços sozinhas sugerem.

A generated two-column comparison scoreboard titled "GPT-6 Sol vs GPT-6 Luna — the scoreboard". The left column, GPT-6 Sol, reads Input $2.00, Output $10.00, AA Intelligence 47.6, Terminal-Bench 4.0 43.9, First token 6,785 ms, Cached input $0.20. The right column, GPT-6 Luna, reads Input $0.10, Output $0.50, AA Intelligence 38.1, Terminal-Bench 4.0 12.6, First token 1,494 ms, Cached input $0.01. A footer line reads "Index figures per Artificial Analysis; serving figures are a rolling seven-day window from OrcaRouter." The OrcaRouter logo is composited in the bottom-right corner.

Onde fica a linha de nível na prática

Divida o trabalho pelo que a tarefa precisa, não por qual modelo obtém a pontuação mais alta.

Luna é a escolha certa para chat de alto volume, classificação, extração, moderação e sumarização de um documento longo — a linha em que ela empata com seu irmão maior na recuperação é exatamente a linha que determina se um contexto grande é utilizável. Sua latência do primeiro token a torna a melhor escolha para qualquer aplicação interativa que não seja intensiva em raciocínio. E, a um centavo por milhão em cache, um pipeline de contexto estável é praticamente gratuito na parte repetida.

Sol, ou agora GPT-6.1 Sol, é a escolha certa no momento em que a tarefa exige um ciclo de ferramentas, um plano de longo horizonte ou uma cadeia de passos que precisa ser concluída. A diferença no Terminal-Bench — 43,9 contra 12,6 — é o sinal mais claro desta comparação, e corresponde ao verdadeiro modo de falha: um modelo barato que responde bem ao primeiro passo e depois perde o fio da meada. O parâmetro effort significa que você pode pedir à Luna mais raciocínio, mas esse parâmetro aumenta a contagem de tokens em vez do teto; ele não transforma um 12,6 em um 43,9.

E a Astra continua sendo a resposta para o trabalho que só o modelo de ponta consegue fazer — o que, a US$ 10,00 de entrada e US$ 50,00 de saída, contra os dez centavos da Luna, é uma decisão que você deveria conseguir justificar por chamada, e não por equipe.

A versão de API única desta escolha

A parte incômoda de uma família de três níveis é que a fronteira entre níveis muda conforme a funcionalidade, e muda a cada requisição — a mesma aplicação geralmente quer Luna para um endpoint e Sol para o próximo. Isso é um problema de roteamento, não de compras. Todos os três níveis do GPT-6 ficam no mesmo catálogo do OrcaRouter, chamados por meio de uma única API compatível com OpenAI diante de mais de 200 modelos, com o preço de tabela do provedor repassado com 0% de markup, de modo que uma mudança de preço do fornecedor em qualquer nível entra no ar aqui no mesmo dia, em vez de na sua próxima conciliação. A DSL de roteamento compõe a divisão explicitamente — por tamanho da requisição, por endpoint ou por proporção — para que o caminho de classificação possa executar Luna enquanto o caminho agêntico executa Sol, e o failover automático entre provedores cobre uma rota que se degrada, em vez de deixar você descobrir isso a partir de uma execução com falha.

Uma coisa que isso não faz é lhe dar uma Luna que se comporta como Sol. Os níveis existem porque os modelos diferem, e os números acima são o tamanho da diferença. O que uma única chave e uma regra de roteamento lhe proporcionam é a capacidade de colocar cada solicitação no nível que realmente lhe convém, em vez de colocar tudo no mais caro por segurança ou tudo no mais barato por orçamento.

Screenshot of the OrcaRouter model page for openai/gpt-6-luna, showing the OpenAI vendor label, a 2026-09-22 catalogue release date, a 1.05M-token context window, a 128K maximum output, text, image and file input with Vision, Tools, JSON and Reasoning badges, and a rate strip reading $0.10 per million input, $0.50 per million output, a 1.49 s median time to first token, a 5.06 s p95, and 574.0M tokens routed in seven days.

A resposta, pela única pergunta que importa.

Se a tarefa é recuperar e depois responder em um documento grande, chat ou processamento de texto em massa, o GPT-6 Luna é o nível certo, e o cartão de dez centavos não é uma concessão — a linha de recall de contexto longo diz que ele recupera tão bem quanto o modelo que custa vinte vezes mais. Se a tarefa exige um agente de várias etapas para ser concluída, o Luna é o nível errado, e a atitude honesta é usar o GPT-6 Sol ou o GPT-6.1 Sol, em que o preço ainda é baixo em termos absolutos e as avaliações agênticas param de colapsar.

O que "GPT-6" é por si só, de novo, não é nada que se possa chamar. É um nome de família que abrange três IDs em três faixas de preço e três tetos de capacidade diferentes, e Luna é a que está na base — a mais barata, a mais rápida até o primeiro token, a que atende o plano gratuito e aquela cujo teto aparece no momento em que uma tarefa precisa de mais do que uma única resposta confiante.

Screenshot of the OrcaRouter model page for openai/gpt-6-sol, showing the OpenAI vendor label, a 2026-09-22 catalogue release date, a 1,050,000-token context window (shown as 1.05M-token context in the model blurb), a 128K maximum output, text, image and file input, and a rate strip reading $2.00 per million input, $10.00 per million output, a 6.79 s median time to first token, a 10.00 s p95, and 2.1M tokens routed in seven days.

Comparados neste artigo1

Detectado a partir deste artigo · Benchmarks: Artificial Analysis · atualizado diariamente