Uma cartela de título para uma análise da redução de preço de 80% do GPT-5.6 Luna, exibindo uma grande seta para baixo rotulada como corte de 80%, a tarifa antes do corte de US$ 1,00 por milhão de tokens de entrada e US$ 6,00 por milhão de tokens de saída, e as tarifas atuais de US$ 0,20 para entrada e US$ 1,20 para saída.
Guides & Insights

GPT-5.6 Luna: O que o corte de preço de 80% da OpenAI realmente mudou

Autor

Elias Hawthorne

Data de publicação

Modelos mais recentes · 20Ver todos os modelos
Benchmarks: Artificial Analysis · atualizado diariamente
Voltar para todas as publicações

GPT-5.6 Luna está 80% mais barato do que seu preço de lançamento desde o final de julho, e a OpenAI começou a tratar isso como um argumento, e não como um desconto. O modelo — o nível rápido e de baixo custo da família GPT-5.6 — entrou em disponibilidade geral em 9 de julho de 2026, a US$ 1,00 por milhão de tokens de entrada e US$ 6,00 por milhão de saída. Hoje, é cobrado a US$ 0,20 e US$ 1,20. Em 9 de setembro, a diretora financeira da OpenAI, Sarah Friar, disse na conferência Communacopia do Goldman Sachs que o corte produziu um aumento de cerca de dez vezes no uso, e que implantar o Luna é mais barato do que executar o GLM 5.3 da Z.ai em uma camada de nuvem.

Essa última alegação é da própria OpenAI, feita por um executivo numa conferência de investidores, e merece o mesmo tratamento que qualquer outro número de fornecedor: vale a pena noticiar, vale a pena verificar, não vale a pena repetir como fato estabelecido. O preço em si é outra questão. É público, e não voltou atrás.

O que realmente mudou, e quando

Nada sobre as capacidades, a janela de contexto ou a disponibilidade do GPT-5.6 Luna mudou em setembro. O que mudou foi a forma como a Open​AI o está vendendo, e por trás dessa mudança há cinco datas.

26 de junho de 2026 — A Open​AI anunciou a família GPT-5.6 (GPT-5.6 Sol, GPT-5.6 Terra, GPT-5.6 Luna) em pré-visualização limitada para um pequeno grupo de parceiros, após coordenação com agências do governo dos Estados Unidos.

9 de julho de 2026 — disponibilidade geral. Sol, Terra e Luna chegaram à API a $5/$30, $2,50/$15 e $1/$6 por milhão de tokens de entrada/saída, respectivamente.

Final de julho de 2026 — o corte de 80% apenas na Luna, para US$ 0,20 de entrada e US$ 1,20 de saída. As leituras de entrada em cache têm cerca de 90% de desconto. Acima do limite de contexto longo, a taxa aproximadamente dobra, para cerca de US$ 0,40/US$ 1,80.

6–7 de agosto de 2026 — A Luna substituiu o GPT-5.5 Instant como modelo padrão do ChatGPT Free e Go, com chats de texto ilimitados e um botão "Think" para raciocínio mais aprofundado, que chegou na semana seguinte. A avaliação interna da OpenAI colocou a taxa de respostas da Luna contendo pelo menos um erro factual cerca de 62% abaixo da do GPT-5.5 Instant em prompts financeiros, médicos e jurídicos — um número relatado pelo fornecedor, não independente.

9 de setembro de 2026 — Os comentários de Friar, que pela primeira vez tornaram públicos números sobre o efeito do corte: aproximadamente 10x de uso, receita empresarial 32% maior de junho para julho, contra 20% de crescimento anualizado total, e Codex com 25 milhões de usuários.

Lidas em conjunto, essas datas descrevem uma conversão de dois meses de uma camada barata em uma estratégia de volume. A Luna sempre foi a camada destinada a absorver trabalho de alto volume e baixa complexidade — classificação, extração, roteamento, rascunhos de primeira passagem. O corte tornou a aritmética por trás desse posicionamento muito mais difícil de contestar.

O número que importa mais do que o preço do token

Screenshot of the Artificial Analysis model page for GPT-5.6 Luna (max), showing an Intelligence Index of 38 ranked 4th of 177 models, output speed of 109.4 tokens per second, input pricing of $0.20 and output pricing of $1.20 per million tokens, a cache discount of 90%, and a cost of $0.18 per Intelligence Index task.

Os preços de tabela são onde a maioria das comparações termina, e, para a Luna, eles a favorecem. Com US$ 0,20/US$ 1,20, ela cobra cerca de 5x menos que o Claude Haiku 4.5 da Anthropic — o mais próximo que ela tem de um concorrente direto — na entrada e 4x menos na saída.

A Artificial Analysis mede algo menos conveniente: o custo por tarefa concluída do Intelligence Index, que incorpora quantos tokens um modelo realmente consome para concluir o mesmo trabalho. No índice atual, a configuração de raciocínio do GPT-5.6 Luna fica em $0,18 por tarefa. Já o Claude Haiku 4.5, em sua configuração de raciocínio, fica em $0,21.

Isso é uma diferença de cerca de 14%, não 5x. O motivo é a verbosidade. Concluir esse conjunto de avaliação consumiu da Luna cerca de 150M tokens de saída, contra 78M do Haiku. A Luna raciocina de forma extensa, e os tokens de saída são cobrados a seis vezes a taxa dos de entrada.

A leitura prática se divide de forma clara. Para trabalhos de saída curta e alto volume — classificação, etiquetagem, extração, roteamento de solicitações, rascunhos de primeira passagem — o corte de 80% é real, grande e aparece diretamente na fatura. Para trabalhos em que o modelo raciocina antes de responder, uma parcela substancial do desconto é consumida por tokens de saída extras. Ambas as afirmações são verdadeiras ao mesmo tempo, e a segunda é a parte que a cobertura do corte deixou de fora.

Também vale a pena saber o que o índice diz sobre capacidade, porque os níveis não estão nem perto. Atualmente, o Artificial Analysis atribui ao GPT-5.6 Luna a pontuação 38, quarto lugar entre 177 modelos da sua classe. A configuração de raciocínio do Claude Haiku 4.5 obtém 18, 138º entre 200. Duas ressalvas sobre esses números. Primeiro, o índice foi reavaliado em setembro de 2026, portanto os valores da época do lançamento — incluindo os 51 e 52 que ainda circulam para o Luna — vêm de uma escala aposentada. Segundo, o Artificial Analysis adotou o GPT-5.6 Luna como único avaliador de várias das suas próprias avaliações, o que vale a pena ter em conta ao ler as suas pontuações.

Por que a Open​AI está apresentando esse argumento agora

Um corte de 80% anunciado no final de julho não precisava de uma CFO para reabrir a discussão em setembro. O fato de ela ter feito isso revela para que servia o corte.

Modelos chineses de pesos abertos têm passado 2026 pressionando exatamente o eixo que a Luna ocupa: qualidade adequada a um preço que torna a contabilidade por token o fator decisivo. Cobrar menos do que isso em uma implantação na nuvem é uma afirmação mais difícil de fazer do que cobrar menos pelos pesos, e é a afirmação que a OpenAI escolheu — nomeando especificamente o GLM 5.3 em vez de fazer referência a "modelos abertos" em geral.

Os números do segmento corporativo que Friar associou a isso apontam na mesma direção. Receita corporativa crescendo 32% mês a mês contra 20% no geral é a cara de uma empresa que vende para ciclos de compras, e ciclos de compras são justamente onde um item de linha acaba sendo questionado. Ela também confirmou que a OpenAI está experimentando uma precificação baseada em resultados, atrelando as tarifas a resultados de negócio em vez do consumo de tokens. Trata-se de uma admissão significativa para uma empresa cujo modelo de receita inteiro sempre foi por token: isso sugere que, na ponta barata do mercado, o número por token está se tornando um argumento de venda mais fraco do que aquilo que o modelo conclui.

Nada disso torna a comparação do GLM verificada. A alegação de Friar baseia-se numa comparação de implantação na nuvem que a Open​AI não publicou em detalhes, e "mais barato do que executar o X por conta própria numa camada de nuvem" depende inteiramente de qual nuvem, qual instância e qual premissa de utilização você escolher. Trate isso como uma alegação posicionada de uma parte interessada e verifique isso em relação à sua própria carga de trabalho antes que isso mude qualquer coisa que você construir.

O que muda se você já roteia entre modelos

Screenshot of the OrcaRouter model page for GPT-5.6 Luna, showing the model identifier openai/gpt-5.6-luna, a release date of 2026-07-09, a 1M-token context window, 128K maximum output, input pricing of $0.20 per million tokens, output pricing of $1.20, a median time to first token of 1.83 seconds and a 95th percentile of 10.00 seconds.

Três coisas importam aqui mais do que o preço anunciado.

Os cortes de preço entram em vigor no mesmo dia em que acontecem. A OrcaRouter repassa o preço de tabela do provedor com 0% de markup, então, quando um fornecedor altera uma tarifa, a tarifa do nosso lado muda junto — sem ticket de suporte, sem contrato renegociado, sem uma segunda relação de cobrança. É exatamente por isso que vale a pena escrever sobre o corte de julho, em vez de apenas mencioná-lo: para qualquer pessoa que chame a Luna por meio de uma API para mais de 200 modelos, isso já estava valendo no mesmo dia.

O alias é uma armadilha. O sem sufixo gpt-5.6 identificador resolve para o nível Sol principal, não para Luna, então qualquer integração que queira a economia de Luna tem que fixar gpt-5.6-luna explicitamente. Isso está documentado nos guias de desenvolvedor da família e ainda é uma das formas mais comuns de uma migração para "nível barato" cobrar silenciosamente a tarifas de ponta.

Os níveis baratos fazem failover bem. Um modelo nesse patamar de preço geralmente executa tarefas em que um breve 503 sai caro — milhares de chamadas de classificação, e não uma única conclusão importante. Encaminhar a mesma requisição por vários provedores do GPT-5.6 Luna com failover automático é a diferença entre uma fila de novas tentativas e uma indisponibilidade, e é o recurso que torna seguro colocar um nível de baixo custo em um caminho de produção.

Você pode ver a taxa atual e os números de p50/p95 de tempo até o primeiro token na página GPT-5.6 Luna on OrcaRouter — vale a pena dar uma olhada, porque as páginas de preços dos fornecedores ficam defasadas em relação aos cortes e os rastreadores de terceiros ficam defasados em relação a ambos.

O que assistir em seguida

Três coisas transformariam isto de uma história de precificação em uma história diferente.

Um corte adicional. A cobertura financeira em língua chinesa no início de setembro enquadrou a Open​AI como estando se preparando para ajustar os preços novamente para enfrentar a concorrência de modelos de pesos abertos. Essa reportagem é prospectiva e não confirmada, mas é consistente com uma empresa que já aceitou uma redução de 80% em sua faixa de volume e agora discute publicamente o custo por implantação.

A precificação baseada em resultados está se tornando realidade. Se a OpenAI começar a vender Luna por resultado de negócio em vez de por token, a comparação por token na qual todo este mercado se baseia deixa de ser o placar relevante — e toda estimativa de custo por tarefa, incluindo as acima, precisa ser recalculada.

Um sucessor capaz pelo mesmo preço. O GPT-6 Astra já existe acima da linha GPT-5.6, e a própria posição da Luna depende de a Open​AI deixá-la onde está. No momento em que uma nova categoria pequena chegar a $0.20/$1.20, a pergunta interessante deixa de ser se a Luna é barata e passa a ser se ela ainda é a coisa mais barata para a qual vale a pena rotear.

A summary card for GPT-5.6 Luna listing its July 9, 2026 release date, its current price of $0.20 per million input tokens and $1.20 per million output, its launch price of $1.00 and $6.00, an Artificial Analysis Intelligence Index of 38 ranked 4th of 177, a cost of $0.18 per index task, and Claude Haiku 4.5's comparative figure of $0.21 per index task.

Por enquanto, a situação é excepcionalmente simples. O GPT-5.6 Luna é um modelo de dois meses cujo preço, e não sua capacidade, é a notícia — e o preço por token é a forma mais lisonjeira de encará-lo, não a mais precisa.