
GPT-5.6 Luna: O que o corte de preço de 80% da OpenAI realmente mudou
- deepseekNOVODeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligência
- openaiNOVOOpenAI: GPT-6 Astra2026-09-0453Inteligência77Código
- googleNOVOGoogle: Gemini 3.8 Flash2026-09-0241Inteligência76Código
- qwenNOVOQwen: Qwen3.8 Max (0902)2026-09-0240Inteligência72Código
- anthropicNOVOAnthropic: Claude Fable 5.12026-09-0153Inteligência82Código
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 por 1M de tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligência72Código
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.24 / $0.73 por 1M de tokens
- z-aiZ.ai: GLM 5.32026-08-1845Inteligência75Código
- obsidianQwen3.8 27B2026-08-1534Inteligência68Código
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Inteligência69Código
- grokSpaceXAI: Grok 4.62026-08-1244Inteligência77Código
- metaMeta: Muse Spark 1.22026-08-0540Inteligência72Código
- qwenQwen: Qwen3.8 Max2026-08-0340Inteligência72Código
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135Inteligência69Código
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 por 1M de tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2451Inteligência78Código
- googleGoogle: Gemini 3.6 Flash2026-07-2134Inteligência69Código
GPT-5.6 Luna está 80% mais barato do que seu preço de lançamento desde o final de julho, e a OpenAI começou a tratar isso como um argumento, e não como um desconto. O modelo — o nível rápido e de baixo custo da família GPT-5.6 — entrou em disponibilidade geral em 9 de julho de 2026, a US$ 1,00 por milhão de tokens de entrada e US$ 6,00 por milhão de saída. Hoje, é cobrado a US$ 0,20 e US$ 1,20. Em 9 de setembro, a diretora financeira da OpenAI, Sarah Friar, disse na conferência Communacopia do Goldman Sachs que o corte produziu um aumento de cerca de dez vezes no uso, e que implantar o Luna é mais barato do que executar o GLM 5.3 da Z.ai em uma camada de nuvem.
Essa última alegação é da própria OpenAI, feita por um executivo numa conferência de investidores, e merece o mesmo tratamento que qualquer outro número de fornecedor: vale a pena noticiar, vale a pena verificar, não vale a pena repetir como fato estabelecido. O preço em si é outra questão. É público, e não voltou atrás.
O que realmente mudou, e quando
Nada sobre as capacidades, a janela de contexto ou a disponibilidade do GPT-5.6 Luna mudou em setembro. O que mudou foi a forma como a OpenAI o está vendendo, e por trás dessa mudança há cinco datas.
• 26 de junho de 2026 — A OpenAI anunciou a família GPT-5.6 (GPT-5.6 Sol, GPT-5.6 Terra, GPT-5.6 Luna) em pré-visualização limitada para um pequeno grupo de parceiros, após coordenação com agências do governo dos Estados Unidos.
• 9 de julho de 2026 — disponibilidade geral. Sol, Terra e Luna chegaram à API a $5/$30, $2,50/$15 e $1/$6 por milhão de tokens de entrada/saída, respectivamente.
• Final de julho de 2026 — o corte de 80% apenas na Luna, para US$ 0,20 de entrada e US$ 1,20 de saída. As leituras de entrada em cache têm cerca de 90% de desconto. Acima do limite de contexto longo, a taxa aproximadamente dobra, para cerca de US$ 0,40/US$ 1,80.
• 6–7 de agosto de 2026 — A Luna substituiu o GPT-5.5 Instant como modelo padrão do ChatGPT Free e Go, com chats de texto ilimitados e um botão "Think" para raciocínio mais aprofundado, que chegou na semana seguinte. A avaliação interna da OpenAI colocou a taxa de respostas da Luna contendo pelo menos um erro factual cerca de 62% abaixo da do GPT-5.5 Instant em prompts financeiros, médicos e jurídicos — um número relatado pelo fornecedor, não independente.
• 9 de setembro de 2026 — Os comentários de Friar, que pela primeira vez tornaram públicos números sobre o efeito do corte: aproximadamente 10x de uso, receita empresarial 32% maior de junho para julho, contra 20% de crescimento anualizado total, e Codex com 25 milhões de usuários.
Lidas em conjunto, essas datas descrevem uma conversão de dois meses de uma camada barata em uma estratégia de volume. A Luna sempre foi a camada destinada a absorver trabalho de alto volume e baixa complexidade — classificação, extração, roteamento, rascunhos de primeira passagem. O corte tornou a aritmética por trás desse posicionamento muito mais difícil de contestar.
O número que importa mais do que o preço do token

Os preços de tabela são onde a maioria das comparações termina, e, para a Luna, eles a favorecem. Com US$ 0,20/US$ 1,20, ela cobra cerca de 5x menos que o Claude Haiku 4.5 da Anthropic — o mais próximo que ela tem de um concorrente direto — na entrada e 4x menos na saída.
A Artificial Analysis mede algo menos conveniente: o custo por tarefa concluída do Intelligence Index, que incorpora quantos tokens um modelo realmente consome para concluir o mesmo trabalho. No índice atual, a configuração de raciocínio do GPT-5.6 Luna fica em $0,18 por tarefa. Já o Claude Haiku 4.5, em sua configuração de raciocínio, fica em $0,21.
Isso é uma diferença de cerca de 14%, não 5x. O motivo é a verbosidade. Concluir esse conjunto de avaliação consumiu da Luna cerca de 150M tokens de saída, contra 78M do Haiku. A Luna raciocina de forma extensa, e os tokens de saída são cobrados a seis vezes a taxa dos de entrada.
A leitura prática se divide de forma clara. Para trabalhos de saída curta e alto volume — classificação, etiquetagem, extração, roteamento de solicitações, rascunhos de primeira passagem — o corte de 80% é real, grande e aparece diretamente na fatura. Para trabalhos em que o modelo raciocina antes de responder, uma parcela substancial do desconto é consumida por tokens de saída extras. Ambas as afirmações são verdadeiras ao mesmo tempo, e a segunda é a parte que a cobertura do corte deixou de fora.
Também vale a pena saber o que o índice diz sobre capacidade, porque os níveis não estão nem perto. Atualmente, o Artificial Analysis atribui ao GPT-5.6 Luna a pontuação 38, quarto lugar entre 177 modelos da sua classe. A configuração de raciocínio do Claude Haiku 4.5 obtém 18, 138º entre 200. Duas ressalvas sobre esses números. Primeiro, o índice foi reavaliado em setembro de 2026, portanto os valores da época do lançamento — incluindo os 51 e 52 que ainda circulam para o Luna — vêm de uma escala aposentada. Segundo, o Artificial Analysis adotou o GPT-5.6 Luna como único avaliador de várias das suas próprias avaliações, o que vale a pena ter em conta ao ler as suas pontuações.
Por que a OpenAI está apresentando esse argumento agora
Um corte de 80% anunciado no final de julho não precisava de uma CFO para reabrir a discussão em setembro. O fato de ela ter feito isso revela para que servia o corte.
Modelos chineses de pesos abertos têm passado 2026 pressionando exatamente o eixo que a Luna ocupa: qualidade adequada a um preço que torna a contabilidade por token o fator decisivo. Cobrar menos do que isso em uma implantação na nuvem é uma afirmação mais difícil de fazer do que cobrar menos pelos pesos, e é a afirmação que a OpenAI escolheu — nomeando especificamente o GLM 5.3 em vez de fazer referência a "modelos abertos" em geral.
Os números do segmento corporativo que Friar associou a isso apontam na mesma direção. Receita corporativa crescendo 32% mês a mês contra 20% no geral é a cara de uma empresa que vende para ciclos de compras, e ciclos de compras são justamente onde um item de linha acaba sendo questionado. Ela também confirmou que a OpenAI está experimentando uma precificação baseada em resultados, atrelando as tarifas a resultados de negócio em vez do consumo de tokens. Trata-se de uma admissão significativa para uma empresa cujo modelo de receita inteiro sempre foi por token: isso sugere que, na ponta barata do mercado, o número por token está se tornando um argumento de venda mais fraco do que aquilo que o modelo conclui.
Nada disso torna a comparação do GLM verificada. A alegação de Friar baseia-se numa comparação de implantação na nuvem que a OpenAI não publicou em detalhes, e "mais barato do que executar o X por conta própria numa camada de nuvem" depende inteiramente de qual nuvem, qual instância e qual premissa de utilização você escolher. Trate isso como uma alegação posicionada de uma parte interessada e verifique isso em relação à sua própria carga de trabalho antes que isso mude qualquer coisa que você construir.
O que muda se você já roteia entre modelos

Três coisas importam aqui mais do que o preço anunciado.
Os cortes de preço entram em vigor no mesmo dia em que acontecem. A OrcaRouter repassa o preço de tabela do provedor com 0% de markup, então, quando um fornecedor altera uma tarifa, a tarifa do nosso lado muda junto — sem ticket de suporte, sem contrato renegociado, sem uma segunda relação de cobrança. É exatamente por isso que vale a pena escrever sobre o corte de julho, em vez de apenas mencioná-lo: para qualquer pessoa que chame a Luna por meio de uma API para mais de 200 modelos, isso já estava valendo no mesmo dia.
O alias é uma armadilha. O sem sufixo gpt-5.6 identificador resolve para o nível Sol principal, não para Luna, então qualquer integração que queira a economia de Luna tem que fixar gpt-5.6-luna explicitamente. Isso está documentado nos guias de desenvolvedor da família e ainda é uma das formas mais comuns de uma migração para "nível barato" cobrar silenciosamente a tarifas de ponta.
Os níveis baratos fazem failover bem. Um modelo nesse patamar de preço geralmente executa tarefas em que um breve 503 sai caro — milhares de chamadas de classificação, e não uma única conclusão importante. Encaminhar a mesma requisição por vários provedores do GPT-5.6 Luna com failover automático é a diferença entre uma fila de novas tentativas e uma indisponibilidade, e é o recurso que torna seguro colocar um nível de baixo custo em um caminho de produção.
Você pode ver a taxa atual e os números de p50/p95 de tempo até o primeiro token na página GPT-5.6 Luna on OrcaRouter — vale a pena dar uma olhada, porque as páginas de preços dos fornecedores ficam defasadas em relação aos cortes e os rastreadores de terceiros ficam defasados em relação a ambos.
O que assistir em seguida
Três coisas transformariam isto de uma história de precificação em uma história diferente.
Um corte adicional. A cobertura financeira em língua chinesa no início de setembro enquadrou a OpenAI como estando se preparando para ajustar os preços novamente para enfrentar a concorrência de modelos de pesos abertos. Essa reportagem é prospectiva e não confirmada, mas é consistente com uma empresa que já aceitou uma redução de 80% em sua faixa de volume e agora discute publicamente o custo por implantação.
A precificação baseada em resultados está se tornando realidade. Se a OpenAI começar a vender Luna por resultado de negócio em vez de por token, a comparação por token na qual todo este mercado se baseia deixa de ser o placar relevante — e toda estimativa de custo por tarefa, incluindo as acima, precisa ser recalculada.
Um sucessor capaz pelo mesmo preço. O GPT-6 Astra já existe acima da linha GPT-5.6, e a própria posição da Luna depende de a OpenAI deixá-la onde está. No momento em que uma nova categoria pequena chegar a $0.20/$1.20, a pergunta interessante deixa de ser se a Luna é barata e passa a ser se ela ainda é a coisa mais barata para a qual vale a pena rotear.

Por enquanto, a situação é excepcionalmente simples. O GPT-5.6 Luna é um modelo de dois meses cujo preço, e não sua capacidade, é a notícia — e o preço por token é a forma mais lisonjeira de encará-lo, não a mais precisa.
