
OpenAI Reduziu os Preços da API do GPT-5.6: O Que Mudou, Por Que e Como Obtê-la
- qwenNOVOQwen: Qwen3.8 Max2026-08-03$2.00 / $6.00 por 1M de tokens · 55 tok/s
- deepseekNOVODeepSeek: DeepSeek V4 Flash 07312026-07-3150Inteligência69Código
- qwenNOVOQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 por 1M de tokens · 206 tok/s
- orcaNOVOOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicNOVOAnthropic: Claude Opus 52026-07-2461Inteligência78Código
- googleNOVOGoogle: Gemini 3.6 Flash2026-07-2150Inteligência69Código
- googleNOVOGoogle: Gemini 3.5 Flash-Lite2026-07-2137Inteligência49Código
- metaMeta: Muse Spark 1.12026-07-1651Inteligência71Código
- kimiMoonshotAI: Kimi K32026-07-1557Inteligência76Código
- openaiOpenAI: GPT-5.6 Luna2026-07-0951Inteligência71Código
- openaiOpenAI: GPT-5.6 Terra2026-07-0955Inteligência77Código
- openaiOpenAI: GPT-5.6 Sol2026-07-0959Inteligência77Código
- grokxAI: Grok 4.52026-07-0854Inteligência72Código
- tencentTencent: Hy32026-07-0641Inteligência59Código
- obsidianQwen3.6 35B A3B Uncensored (Aggressive)2026-07-0232Inteligência42Código
- obsidianGemma4 26B A4B Uncensored (Balanced)2026-07-0226Inteligência39Código
- anthropicAnthropic: Claude Sonnet 52026-06-3053Inteligência72Código
- klingKling: Kling 3.0 Turbo2026-06-1757Inteligência52Código57Matemática
- z-aiZ.ai: GLM 5.22026-06-1651Inteligência69Código60Matemática
- kimiMoonshotAI: Kimi K2.7 Code2026-06-1242Inteligência61Código61Matemática
Em 30 de julho de 2026, a OpenAI reduziu os preços de API dos seus dois modelos GPT-5.6 de menor custo — cortando drasticamente o nível mais barato e ajustando o intermediário, enquanto deixou seu carro-chefe intacto. É um movimento notável em uma guerra de preços cada vez mais intensa, e a mudança entrou imediatamente na tabela de preços publicada. Este artigo explica exatamente o que mudou, a engenharia por trás disso, como os novos preços se comparam aos dos concorrentes, os custos ocultos a observar, como reduzir ainda mais sua fatura — e como os preços mais baixos já estão disponíveis no OrcaRouter com margem de 0%.
Cada valor abaixo tem sua fonte indicada. Os preços são por milhão de tokens (entrada / saída) e refletem a tabela de preços da OpenAI de 30 de julho de 2026, conforme relatado por veículos incluindo Unite.AI, além das páginas de modelo de repasse da OrcaRouter; os valores dos concorrentes são atribuídos. Os preços mudam — verifique antes de construir.
TL;DR. A OpenAI reduziu o preço do GPT-5.6 Luna para US$ 0,20 / US$ 1,20 (antes US$ 1 / US$ 6, ~80% de desconto) e o do GPT-5.6 Terra para US$ 2 / US$ 12 (antes US$ 2,50 / US$ 15, ~20% de desconto), enquanto o GPT-5.6 Sol permanece em US$ 5 / US$ 30. Dois ganhos de eficiência pagaram por isso: kernels de GPU reescritos (custo de inferência cerca de 20% menor) e um modelo de rascunho reprojetado para decodificação especulativa (geração de tokens 15%+ mais rápida). O corte coloca a Luna abaixo da Haiku 4.5 da Anthropic e a aproxima do piso de modelos abertos baratos definido por DeepSeek e GLM. Se você rotear por um endpoint neutro em relação a fornecedores, com margem de 0%, como o OrcaRouter, os novos preços já estão ativos — mesmo preço, uma API compatível com a OpenAI, com todos os modelos concorrentes ao lado para comparar e rotear entre eles.
Principais conclusões
• GPT-5.6 Luna: agora US$ 0,20 / US$ 1,20 por 1M de tokens, ante US$ 1 / US$ 6 — aproximadamente 80% de redução.
• GPT-5.6 Terra: agora $2 / $12, em vez de $2.50 / $15 — cerca de 20% de corte.
• GPT-5.6 Sol (principal): inalterado em $5 / $30.
• Porquê: kernels de GPU de produção reescritos (~20% de redução no custo de serviço) além de um redesenho do modelo de rascunho de decodificação especulativa (15%+ de eficiência na geração de tokens), de acordo com o post de engenharia da OpenAI de 29 de julho.
• Como obtê-lo: a redução já está refletida no OrcaRouter (0% de markup) — Luna a $0,20 / $1,20 — através de um endpoint compatível com OpenAI.
O que exatamente mudou?
A família GPT-5.6 da OpenAI funciona em uma escada de níveis: Luna (rápida, mais barata), Terra (intermediária) e Sol (principal). O corte de 30 de julho atingiu os dois níveis mais baratos. Conforme a tabela de preços divulgada, a GPT-5.6 Luna caiu de US$ 1 / US$ 6 para US$ 0,20 / US$ 1,20 por milhão de tokens de entrada/saída — uma redução de cerca de 80% tanto na entrada quanto na saída — e a GPT-5.6 Terra caiu de US$ 2,50 / US$ 15 para US$ 2 / US$ 12, aproximadamente 20%. A GPT-5.6 Sol, o principal modelo construído para os raciocínios mais difíceis e codificação agêntica, permaneceu em US$ 5 / US$ 30. Os níveis de volume ficaram drasticamente mais baratos; o nível superior não mudou.
A taxa base por token não é a história completa. O preço do GPT-5.6 também tem faixas de comprimento de entrada (contextos muito longos passam para uma taxa mais alta), um desconto de cache de prompt (entrada em cache é muito mais barata do que entrada nova) e uma opção de lote (tarefas assíncronas com desconto). Todos os três se aplicam ao corte, então o preço efetivo para uma carga de trabalho com uso intenso de cache ou lote pode ser ainda menor. Cuidado com a faixa de contexto longo na direção oposta: alimentar prompts enormes pode elevar você para uma faixa superior.

As duas otimizações por trás do corte.
{{1}}Não foi um gesto de loss-leader — a OpenAI o apresentou como um dividendo de eficiência.{{/1}} {{2}}Em uma publicação de engenharia de 29 de julho de 2026, membros da equipe técnica da OpenAI descreveram otimizações na inferência e no harness do agente por trás do Codex e do ChatGPT Work.{{/2}} {{3}}Duas se destacam.{{/3}} {{4}}Primeiro, reescritas de kernels de GPU na infraestrutura de produção — com a Sol, rodando dentro do Codex, usada para reescrever os próprios kernels da empresa — que, segundo a OpenAI, reduziram os custos de serving de ponta a ponta em cerca de 20%.{{/4}} {{5}}Segundo, um modelo de draft de decodificação especulativa redesenhado que, segundo relatos, melhorou a eficiência de geração de tokens em mais de 15%.{{/5}} {{6}}Menor custo de serving, repassado aos clientes como preços mais baixos nos níveis de alto volume, é a história — e é um vislumbre de um ciclo de feedback que toda a indústria persegue: usar modelos de fronteira para otimizar a própria infraestrutura que os serve.{{/6}}
Como os novos preços se comparam
O corte mira diretamente a concorrência. De acordo com o relatório da Unite.AI, os novos US$ 0,20 / US$ 1,20 da Luna subcotam os do Haiku 4.5 da Anthropic em aproximadamente 5x na entrada e cerca de 4x na saída, e os novos US$ 2 / US$ 12 da Terra ficam abaixo do preço padrão do Claude Sonnet 5 (reportado em US$ 3 / US$ 15, com vigência após 31 de agosto de 2026). Em relação ao campo de pesos abertos, a Luna agora se posiciona próxima ao piso de inferência barata estabelecido pela linha V4 da DeepSeek e pelo GLM-5.2 da Zhipu (aproximadamente US$ 1,20 / US$ 4,10), com as camadas Qwen da Alibaba e Gemini Flash do Google na mesma faixa. Em outras palavras, a OpenAI moveu suas camadas de volume para baixo, até onde os modelos capazes mais baratos já vivem — reduzindo a penalidade de preço por escolher um modelo proprietário em vez de um aberto.
A inferência continua ficando mais barata.
Ampliando o panorama, esse corte se encaixa em uma tendência plurianual: o custo de um determinado nível de capacidade caiu fortemente, geração após geração, à medida que os laboratórios extraem mais throughput do mesmo hardware. As próprias faixas mais antigas da OpenAI ilustram a tendência de queda ao longo do tempo, e cada avanço de eficiência — melhores kernels, decodificação especulativa, atenção mais barata — tende a aparecer como corte de preço em poucos meses. Para os compradores, a implicação prática é arquitetar para um mundo onde a inferência fica mais barata de forma previsível: não se comprometa demais com o preço de um único modelo e mantenha baixo o custo de troca.
O custo oculto a observar: tokens de raciocínio
Os modelos GPT-5.6 são modelos de raciocínio, e isso molda os gastos no mundo real. Quando o raciocínio está habilitado, o modelo emite tokens internos de raciocínio que são cobrados como saída — portanto, seu custo efetivo de saída pode ser maior do que uma estimativa ingênua de "palavras na resposta" sugere, especialmente em prompts difíceis com alto esforço de raciocínio. A solução é ajustar o esforço de raciocínio à tarefa (baixo ou desligado para chamadas simples), limitar a saída quando possível e medir o uso real de tokens em vez de assumir. Uma taxa mais barata por token ajuda, mas controlar quantos tokens você gera ajuda mais.
O que isso significa para desenvolvedores
Se você usa GPT-5.6 Luna ou Terra para trabalho de alto volume — classificação, extração, roteamento, agentes leves, chat — sua fatura acabou de cair, em alguns casos pela maior parte do seu valor, sem precisar mudar nenhum código. Isso torna os níveis de volume ainda mais atraentes para cargas de trabalho sensíveis a custo e reduz a diferença de preço em relação a modelos abertos baratos. A matemática do carro-chefe não mudou: Sol a US$ 5 / US$ 30 continua sendo uma escolha premium para as tarefas mais difíceis. O padrão vencedor é rotear por dificuldade — níveis baratos (ou modelos abertos baratos) para os 80% fáceis, e o carro-chefe somente onde ele justifica seu custo.
Como cortar ainda mais sua conta
O corte de preço é um piso para construir, não a linha de chegada. As maiores alavancas adicionais: cache de prompt (reutilize um prompt de sistema estável ou contexto longo e pague a taxa de entrada em cache muito menor); a opção de lote (execute trabalhos não urgentes de forma assíncrona com desconto); roteamento por nível e por modelo (envie cada solicitação para o modelo mais barato que possa lidar com ela, incluindo modelos abertos); e controle de raciocínio (não pague por raciocínio profundo em chamadas triviais). Juntas, essas medidas reduzem rotineiramente as contas reais muito mais do que qualquer mudança de tarifa isolada. Como uma âncora concreta: com 10 milhões de tokens por mês e uma parcela de 70% de entrada, as novas tarifas da Luna resultam em cerca de US$ 5 por mês (cerca de US$ 4,37 com cache); o mesmo volume na Sol é de cerca de US$ 125 por mês — o argumento mais claro para o roteamento por dificuldade.
Como capturar os preços mais baixos imediatamente
Aqui está a parte que amarra tudo. a href="https://www.orcarouter.ai/">OrcaRouter/a> cobra markup de 0% e repassa o preço dos provedores diretamente, então o corte da OpenAI já está disponível no OrcaRouter: GPT-5.6 Luna mostra $0,20 / $1,20 e Terra $2 / $12 nas páginas dos modelos agora mesmo — as mesmas tarifas da própria ficha da OpenAI, acessíveis por meio de um único endpoint compatível com OpenAI, junto com mais de 185 outros modelos. Você obtém o corte sem migração e pode comparar preços da Luna e da Terra com DeepSeek, GLM, Qwen, Gemini e Claude em um só lugar, roteando cada solicitação para o que for mais barato para a tarefa. Também há um plano gratuito e uma página de Offers para economias adicionais.

A redução já está no ar na OrcaRouter: GPT-5.6 Luna a US$ 0,20 / US$ 1,20 por 1M de tokens, repassado com markup de 0%.
Trace a rota por dificuldade para economizar ainda mais.
A conta mais barata não é um único modelo — é o modelo certo para cada solicitação. Como o OrcaRouter expõe todo o leque de modelos por meio de um único endpoint, você pode enviar chamadas simples e de alto volume para a Luna ou para um modelo aberto barato e reservar a Sol ou outro carro-chefe para as difíceis, alternando com uma mudança de configuração em vez de uma reintegração. Uma redução de preço na Luna torna essa estratégia de roteamento por dificuldade ainda mais barata, sem que você precise reconectar nada.

Perguntas Frequentes
Quanto a OpenAI reduziu os preços do GPT-5.6?
GPT-5.6 Luna caiu de $1 / $6 para $0.20 / $1.20 por milhão de tokens (cerca de 80%), e GPT-5.6 Terra de $2.50 / $15 para $2 / $12 (cerca de 20%). GPT-5.6 Sol permaneceu em $5 / $30.
Quando o corte de preço entrou em vigor?
30 de julho de 2026, registrado no changelog da API da OpenAI e disponível na tabela de preços publicada.
Por que a OpenAI reduziu os preços?
A OpenAI atribui isso a otimizações de inferência — kernels de GPU de produção reescritos (cerca de 20% menos custo de serviço) e um modelo de rascunho de decodificação especulativa redesenhado (mais de 15% de eficiência na geração de tokens) — de acordo com uma publicação de engenharia de 29 de julho de 2026.
O carro-chefe (Sol) ficou mais barato?
Não. GPT-5.6 Sol continua $5 / $30 por milhão de tokens. Apenas os dois níveis mais baratos, Luna e Terra, foram cortados.
Como os novos preços se comparam aos da Anthropic e aos modelos abertos?
Segundo relatórios, a Luna agora subcotiza o Haiku 4.5 da Anthropic em aproximadamente 5x na entrada / 4x na saída, e a Terra fica abaixo do preço padrão do Claude Sonnet 5 ($3 / $15). A Luna também se posiciona próxima ao piso de modelos abertos baratos definido pela DeepSeek e GLM-5.2.
Qual é a pegadinha com os tokens de raciocínio?
GPT-5.6 são modelos de raciocínio; tokens de raciocínio interno são cobrados como saída, então o custo efetivo de saída pode exceder uma estimativa ingênua. Ajuste o esforço de raciocínio e limite a saída para controlá-lo.
Como consigo os novos preços mais baixos?
Eles já estão disponíveis na API da OpenAI e, com markup de 0%, no OrcaRouter — onde GPT-5.6 Luna mostra $0.20 / $1.20 — através de um endpoint compatível com a OpenAI, sem necessidade de mudança de código.
Conclusão
O corte de 30 de julho da OpenAI torna o GPT-5.6 Luna e o Terra dramaticamente mais baratos para trabalho de alto volume — um dividendo de eficiência proveniente de reescritas de kernel e ganhos de decodificação especulativa, e uma resposta clara a uma guerra de preços real que agora subcotiza os níveis mais baratos da Anthropic e se aproxima do piso dos modelos abertos. O carro-chefe Sol permanece inalterado, então roteie pela dificuldade, apoie-se em cache e processamento em lote e controle os tokens de raciocínio para economizar ao máximo. E como o OrcaRouter repassa os preços dos provedores com margem de 0%, as tarifas mais baixas já estão disponíveis lá — mesmo preço, um endpoint compatível com OpenAI, todos os modelos em um único lugar. Aproveite o corte sem mudar uma linha de código e deixe cada solicitação escolher o modelo mais barato que possa fazer o trabalho.
