Um cartão de título principal gerado com o texto 'GPT-6 Sol e GPT-6 Luna' sob a sobrelinha 'Lançamento do modelo - setembro de 2026', com o subtítulo 'Metade do preço por token não é metade do custo por tarefa.', com quatro chips exibindo 'GPT-6 Sol: $2,00 / $10,00 por 1M', 'GPT-6 Luna: $0,10 / $0,50 por 1M', 'Sol: índice 48 a $1,06 por tarefa' e 'Luna: índice 37 a $0,07 por tarefa', e uma nota de rodapé lendo 'Preços conforme OpenAI; índice e custo por tarefa conforme Artificial Analysis, 22 de setembro de 2026.' O logotipo real da OrcaRouter está composto no canto inferior direito.
Guides & Insights

GPT-6 Sol e GPT-6 Luna: O token mais barato nem sempre é a tarefa mais barata

Autor

Magnus Corvin

Data de publicação

Modelos mais recentes · 20Ver todos os modelos
Benchmarks: Artificial Analysis · atualizado diariamente
Voltar para todas as publicações

O fornecedor lançou GPT-6 Sol e GPT-6 Luna em 22 de setembro de 2026, e a manchete em todos os lugares é o preço: Sol a $2,00 por milhão de tokens de entrada e $10,00 de saída, Luna a $0,10 e $0,50, ambos cerca de metade do que GPT-5.6 Sol e GPT-5.6 Luna cobram nas taxas promocionais atuais, e ambos ficando bem abaixo do carro-chefe GPT-6 Astra a $10,00/$50,00. O anúncio do próprio fornecedor começa com "também tornamos o cache e a inferência mais eficientes". O problema de ler isso como uma narrativa de desconto é que a unidade que realmente aparece na sua fatura não é um token. É uma tarefa. E as primeiras medições independentes, publicadas no mesmo dia, mostram os dois novos modelos divergindo em direções opostas exatamente nessa unidade — com o GPT-6 Luna, o mais barato dos dois por um fator de vinte na entrada, tendo o pior desempenho dos dois em relação ao seu próprio antecessor. Um desses modelos é um upgrade direto e o outro é um trade-off genuíno, e o anúncio do fornecedor não distingue entre eles.

Antes dos números, as regras de fontes para este artigo, porque os dois conjuntos de evidências aqui merecem pesos muito diferentes. Os preços, a janela de contexto, as taxas de cache e as datas de corte de conhecimento vêm da própria documentação da API e das tabelas de preços da OpenAI, consultadas em 23 de setembro de 2026, com as linhas de nível de serviço e de gravação em cache corroboradas por rastreadores de custos de terceiros, em vez de retiradas apenas do anúncio. As tabelas de benchmark da OpenAI — AutomationBench, DeepSWE 1.1, OSWorld 2.0, Agents' Last Exam e uma avaliação interna de factualidade — são relatadas pelo fornecedor e não reproduzidas, e todos os números extraídos delas abaixo são identificados como tal. Os números independentes vêm da Artificial Analysis, que executou ambos os modelos em seu Intelligence Index e Coding Agent Index no dia do lançamento; são esses em que se deve confiar para tomar uma decisão. Quando os dois divergem, o artigo diz isso, em vez de calcular a média entre eles.

O lançamento, em um parágrafo

Sol e Luna são membros de nível médio e baixo da família GPT-6, treinados com os métodos por trás do GPT-6 Astra e posicionados como formas mais rápidas e baratas de alcançar a maior parte de sua capacidade. O enquadramento da OpenAI é o custo por tarefa, e não a capacidade bruta: ela afirma que o GPT-6 Sol comete cerca de metade dos erros do GPT-5.6 Sol em sua avaliação interna de factualidade, e que o GPT-6 Luna, com esforço de raciocínio mais alto, iguala a factualidade do GPT-5.6 Sol a aproximadamente um centésimo do custo por tarefa. Ambos aceitam entrada de texto e imagem e produzem texto, ambos têm uma janela de contexto de 1.050.000 tokens com um teto de saída de 128K — a Artificial Analysis lista 872k para o mesmo modelo, então trate o limite superior dessa janela como informado pelo fornecedor — e ambos expõem esforço de raciocínio de none a max, um nível que o GPT-6 Astra não oferece, porque o Astra não tem none. Os IDs dos modelos são gpt-6-sol e gpt-6-luna. A disponibilidade se dá pela API, pelo ChatGPT Work e Codex para contas Plus, Pro, Business, Enterprise e Edu, e pelo Amazon Bedrock, que anunciou a disponibilidade geral de ambos no mesmo dia. Usuários Free e Go recebem o Luna no aplicativo para desktop; nenhum dos modelos está no modo Chat simples ainda.

O que dizem os quatro números independentes, e por que discordam

Comecemos pelo GPT-6 Sol, porque a sua história é simples. O Artificial Analysis atribui-lhe 48 no Índice de Inteligência, 18.º de 212 modelos medidos, a US$ 1,06 por tarefa de índice contra US$ 1,99 do GPT-5.6 Sol — cerca de metade do custo para uma pontuação de índice equivalente, e uma melhoria de custo por tarefa que se mantém em vez de se evaporar. O seu Índice de Agente de Codificação sobe para 57, contra 55, com o Terminal-Bench 4.0 a passar de 37% para 43% e o SWE-Atlas-QnA de 54% para 58%, a US$ 2,99 por tarefa na fronteira de Pareto. A sua taxa de alucinação cai de 92% para 60%, e o seu comportamento de abstenção muda completamente de forma: agora responde a 83% das perguntas onde a geração anterior respondia a 99%, e em troca obtém um quarto menos de respostas erradas, com a exatidão a cair de 59% para 54%. Este é um modelo que foi ensinado a calar-se quando não sabe, e o Índice AA-Omniscience a passar de 22 para 27 é esse mesmo fato declarado como pontuação.

Agora, com o GPT-6 Luna, a história muda. O Artificial Analysis pontua-o com 37 no Intelligence Index — o número idêntico que o GPT-5.6 Luna pontua. Seu custo por tarefa de índice cai de $0,18 para $0,07, cerca de 60% menos, e essa economia é real. Mas seu Coding Agent Index cai, de 43 para 41, com o SWE-Atlas-QnA caindo de 49% para 44% e o DeepSWE 1.1 caindo de 66% para 64%. Sua taxa de alucinação melhora de 93% para 77%, e seu comportamento de abstenção quase não muda — precisão de 44% contra 43%, AA-Omniscience de −10 para 1. Lidos em conjunto: a mesma inteligência medida, a cerca de 40% do custo da tarefa, com um agente de programação pior e qualidade de resposta praticamente inalterada.

Isso não é uma contradição, e o motivo importa. Um token mais barato só lhe rende menos se o modelo gastar mais tokens para concluir o mesmo trabalho — e os dados independentes dizem que estes modelos gastam mais, não menos. A saída por tarefa de indexação subiu de 29k para 31k tokens no Sol e de 41k para 51k na Luna. A economia de 60% do GPT-6 Luna vem inteiramente do corte de preço, não de operar de forma mais enxuta. A variação de tokens por tarefa é pequena o suficiente para que a aritmética ainda funcione a seu favor aqui; não é pequena o suficiente para ser ignorada como categoria, porque é o mecanismo pelo qual um futuro corte de preço pode ser neutralizado por um modelo mais tagarela. A própria abordagem da OpenAI passou a incidir sobre o custo por tarefa pelo mesmo motivo.

Duas regressões ficam fora dos dois índices principais e merecem ser nomeadas, porque nenhuma delas aparece no anúncio da OpenAI. No GDPval-AA v2.1, que mede entregáveis de trabalho de conhecimento, o GPT-6 Sol perde cerca de 100 Elo em relação ao seu antecessor e o GPT-6 Luna cerca de 75. O GPT-6 Luna também perde cerca de 45 Elo no AA-Briefcase v1.1, onde o Sol se mantém estável — a Artificial Analysis atribui a diferença a uma apresentação mais fraca e a itens de rubrica em falta. Se a sua utilização do nível barato for sumarização em massa, extração e classificação, nada disso o afeta. Se for redigir algo que uma pessoa aprova, afeta.

A generated two-column scoreboard titled 'GPT-6 Sol vs GPT-6 Luna - the scoreboard'. The left column, GPT-6 Sol, lists Intelligence Index 48, cost per index task $1.06, Coding Agent Index 57, hallucination rate 60%, GDPval-AA about 100 Elo lower, and price per million tokens $2.00 / $10.00. The right column, GPT-6 Luna, lists Intelligence Index 37, cost per index task $0.07, Coding Agent Index 41, hallucination rate 77%, GDPval-AA about 75 Elo lower, and price per million tokens $0.10 / $0.50. A footer line credits Artificial Analysis for the index, cost and hallucination figures as of September 22, 2026 and OpenAI for the prices. The real OrcaRouter logo is composited in the bottom-right corner.

A mudança no cache é a verdadeira notícia da API

Escondida sob a tabela de preços há uma mudança que importa mais para a fatura de produção do que o corte em destaque, e é a parte do anúncio que o próprio post da OpenAI menciona de passagem em uma frase. Três coisas mudaram, e a terceira é a que se deve ler duas vezes.

O primeiro é o próprio desconto: as leituras de entrada em cache são cobradas a 10% da tarifa de entrada, um desconto de 90%, que é a mesma condição que a família já aplicava, e não uma nova. A entrada em cache do Sol é US$ 0,20 por milhão, e a do Luna é US$ 0,01; as gravações em cache têm um acréscimo de 1,25x, US$ 2,50 e US$ 0,125 respectivamente, com um único tempo de vida de 30 minutos.

O segundo é o controle. O cache explícito por meio de prompt_cache_options e prompt_cache_breakpoint — os parâmetros que permitem declarar onde um prefixo de prompt reutilizável termina, em vez de esperar que o provedor adivinhe — está disponível em ambos os modelos. Isso não é uma nova superfície de API; o que é novo é que vale a pena usá-lo, porque as taxas de acerto padrão aumentaram.

A terceira é a que muda a arquitetura. Alterar o esforço de raciocínio ou ativar e desativar ferramentas não invalida mais o prefixo em cache. Antes disso, um loop de agente que aumentava o esforço para uma etapa difícil e o reduzia para uma fácil pagava para reprocessar todo o seu contexto a cada ajuste, e o mesmo acontecia com um que adicionava ou removia uma ferramenta no meio da conversa. Esse custo agora desapareceu nesses dois modelos. A OpenAI cita o GitHub, que relatou que as mudanças reduziram em mais da metade a proporção de tokens de prompt que precisavam de processamento novo em bilhões de solicitações. Considere isso um número fornecido pelo fornecedor — é crível e não é auditado de forma independente.

Faça as contas para um loop de agente longo e a ordem dos dois anúncios se inverte. Um loop que carrega um prompt de sistema e um esquema de ferramentas de 30.000 tokens ao longo de 200 turnos movimenta 6 milhões de tokens de contexto. Sem cache, no GPT-6 Sol, isso representa US$ 12,00 de entrada. Com o prefixo em cache a US$ 0,20 por milhão, são US$ 1,20 mais a gravação única — uma ordem de magnitude, graças a uma mudança de parâmetro, antes mesmo de o corte de preço ser aplicado. O corte de preço foi o que o anúncio vendeu. O comportamento do cache é o que de fato move o número, e é a razão pela qual uma tarifa anunciada de US$ 2,00 se comporta como algo muito mais barato nas cargas de trabalho para as quais a OpenAI está promovendo esses modelos.

O tarifário, incluindo as partes que o anúncio deixa de fora.

As tarifas em destaque não são a tabela de preços completa, e três níveis mudam a decisão para cargas de trabalho específicas.

Base — GPT-6 Sol $2,00 de entrada / $10,00 de saída; GPT-6 Luna $0,10 de entrada / $0,50 de saída, por milhão de tokens, para prompts de até 272 mil tokens de entrada.

Contexto longo — acima de 272K tokens de entrada, a solicitação inteira é cobrada a 2x a entrada e 1,5x a saída: $4.00/$15.00 para Sol e $0.20/$0.75 para Luna. Isto é um penhasco, não uma taxa marginal. Se os seus prompts chegam a 300K tokens, você está pagando o dobro pela solicitação inteira, não pelos 28K acima do limite, e dividir um documento em duas chamadas abaixo do limite costuma ser mais barato do que enviá-lo uma vez acima.

Níveis de serviço — O Flex reduz a fatura pela metade (US$ 1,00/US$ 5,00 para o Sol, US$ 0,05/US$ 0,25 para a Luna) em troca de um tempo de resposta mais lento; o Priority dobra esse valor. Ambos são selecionados por meio do parâmetro service_tier. É no Flex que as tarefas do tipo lote deveriam ficar e quase nunca ficam.

Entrada em cache — $0,20 por milhão na Sol e $0,01 na Luna, um desconto de 90%, com TTL de 30 minutos e um prêmio de 1,25x na gravação em cache.

Contexto e saída — janela de 1.050.000 tokens, saída máxima de 128K, entrada de texto e imagem, saída de texto, esforço de raciocínio nenhum a máx. com médio como padrão.

Datas de corte de conhecimento — 20 de abril de 2026 para o GPT-6 Sol e 18 de maio de 2026 para o GPT-6 Luna, ou seja, um mês de diferença dentro da mesma família, algo que vale a pena saber antes de presumir que os dois modelos partilham a mesma visão do mundo.

O que a tabela de benchmarks da OpenAI diz, e o que ela não diz

As comparações publicadas pela OpenAI são todas de custo por tarefa, todas contra a Anthropic e todas executadas pelo fornecedor. No AutomationBench 1.0.6, uma avaliação agêntica com 47 ferramentas, a empresa relata que o GPT-6 Sol com esforço xhigh obtém 33,2% a US$ 0,27 por tarefa, contra o Claude Opus 5 com 26,9% e cerca de 11 vezes o custo por tarefa. No DeepSWE 1.1, ela relata o Sol no esforço máximo com 68,8% contra o Claude Fable 5 com 69,9% — uma perda na pontuação com custo por tarefa cerca de 80% menor — e o Luna com 66,6%. No OSWorld 2.0, o Sol obtém 60,5% com xhigh contra 60,3% do Opus 5, novamente com cerca de 80% menos por tarefa. No Agents' Last Exam, o Sol alcança 56,4%, o que, segundo a OpenAI, supera o melhor resultado do Opus 5 a um custo por tarefa 60% menor.

Todos esses números foram informados pelo fornecedor e não foram reproduzidos, e duas ressalvas merecem ser levadas adiante, em vez de arquivadas. Primeiro, a OpenAI fez o benchmark contra o Claude Opus 5, e não contra o Claude Opus 5.5, lançado horas antes do anúncio, de modo que nenhuma comparação no mesmo ambiente de avaliação estabelece ainda qual modelo de fato entrega o menor custo por tarefa bem-sucedida. Segundo, custo por tarefa não é custo por tarefa correta: um modelo que responde 83% das vezes e se abstém no restante vai parecer barato por tarefa em um benchmark que conta abstenções como tarefas. Os dados independentes de abstenção acima são o que permite precificar isso com honestidade — o GPT-6 Sol responder 83% das perguntas onde o modelo antigo respondia 99% é uma troca deliberada, e se ela é uma boa troca depende inteiramente de quanto uma resposta errada custa para você.

A OpenAI relata que o GPT-6 Luna, com esforço mais elevado, iguala a factualidade do GPT-5.6 Sol a cerca de um centésimo do custo da tarefa. Trata-se de uma comparação de factualidade, não de capacidade, e o índice independente Coding Agent Index coloca o GPT-6 Luna dois pontos abaixo do GPT-5.6 Luna, muito menos do GPT-5.6 Sol.

Screenshot of the Artificial Analysis model page for GPT-6 Sol, captured 23 September 2026, showing the model's Intelligence Index of 48 alongside its cost per task and its output-token and speed figures for the measured reasoning-effort settings.

O que realmente fazer com isto

O GPT-6 Sol é o mais direto. Metade do custo da tarefa em uma pontuação de índice de nível, um agente de programação melhor, uma grande queda nas alucinações e uma mudança genuína no comportamento de abstenção somam uma atualização que você pode adotar conforme um cronograma, em vez de uma aposta. Se você usa o GPT-5.6 Sol, isto é uma migração, e a única questão real é quais dos seus prompts dependem da disposição do modelo antigo de responder a tudo.

O GPT-6 Luna é o modelo a testar antes de migrar. Ele não é um GPT-5.6 Luna estritamente melhor; é um modelo com um perfil diferente — mais barato por tarefa, mais cauteloso quanto ao que afirma e mensuravelmente pior em codificação agêntica. Para classificação, extração, roteamento e sumarização em volume, a troca chega a ser quase dinheiro fácil. Para qualquer coisa que alimente um agente de codificação, ou produza um documento que uma pessoa aprove formalmente, a regressão de dois pontos no Coding Agent e a queda no GDPval são o motivo para manter o GPT-5.6 Luna no fluxo até você ter testado suas próprias tarefas nos dois.

Esse também é o argumento para não fixar nenhum dos dois em definitivo. Ambos os modelos são exclusivos da OpenAI no momento, e as cargas de trabalho que essas camadas atendem — roteamento, extração, classificação barata — são justamente aquelas em que um segundo provedor por trás do mesmo endpoint transforma uma regressão de modelo em um não evento. O OrcaRouter repassa os preços de lista dos provedores com 0% de markup, de modo que uma mudança de tarifa do fornecedor chega ao nosso lado no mesmo dia em que chega ao lado do fornecedor, e a DSL de roteamento permite colocar o GPT-6 Luna atrás de um modelo mais barato para a fatia fácil do tráfego, enquanto a fatia mais difícil vai para o GPT-6 Sol — com failover automático caso qualquer um dos caminhos se degrade. Você não precisa escolher um vencedor no dia do lançamento para se beneficiar do lançamento.

A ressalva honesta: GPT-6 Sol e GPT-6 Luna não são roteáveis pelo OrcaRouter em 23 de setembro de 2026. Ainda não os hospedamos, e nada do que foi dito acima deve ser interpretado como uma afirmação de que o fazemos. O que está do nosso lado hoje é o conjunto de comparação — GPT-5.6 Sol a US$ 4,00/US$ 20,00, GPT-5.6 Luna a US$ 0,20/US$ 1,20 e GPT-6 Astra a US$ 10,00/US$ 50,00 — que é exatamente o que você precisa para precificar a migração antes de se comprometer com ela.

Screenshot of the OrcaRouter model page for GPT-5.6 Luna, captured 23 September 2026, showing the model id openai/gpt-5.6-luna with its context window, input and output pricing per million tokens, measured time to first token and recent traffic.

O que assistir em seguida

Três coisas resolveriam o que este lançamento de fato foi. A primeira é se a tarifa de US$ 0,20/US$ 1,20 do GPT-5.6 Luna sobrevive ao trimestre, porque, historicamente, um preço permanente de um fornecedor tem sido o lance de abertura, e não o fim dele — e o lançamento do Claude Opus 5.5 no mesmo dia sugere que a pressão que produziu esse corte não desapareceu. A segunda é se a mudança de abstenção se sustenta em campo: o GPT-6 Sol deixar de responder uma em cada seis perguntas é o tipo de mudança que, num laboratório, é lida como melhoria e, num pipeline que pressupunha uma resposta, como um produto quebrado. A terceira é se o comportamento de cache é real no seu tráfego, o que é mensurável esta semana e só pode ser respondido medindo — o desconto é grande o suficiente para que uma única hora gasta instrumentando taxas de acerto de cache nos seus prompts mais longos valha mais do que mais uma tabela de benchmark.

Comparados neste artigo2

Detectado a partir deste artigo · Benchmarks: Artificial Analysis · atualizado diariamente

© 2026 OrcaRouter

Para provedores

Opera uma plataforma de inferência? Traga seus modelos para o OrcaRouter.

providers@orcarouter.ai

Junte-se à comunidade

Discordsupport@orcarouter.aiXGitHubYouTube