OpenAI Reduziu os Preços da API do GPT-5.6: O Que Mudou, Por Que e Como Obtê-la
Guides & Insights

OpenAI Reduziu os Preços da API do GPT-5.6: O Que Mudou, Por Que e Como Obtê-la

Autor

Rowan Sterling

Data de publicação

Modelos mais recentes · 20Ver todos os modelos →
Benchmarks: Artificial Analysis · atualizado diariamente
Voltar para todas as publicações

Em 30 de julho de 2026, a OpenAI reduziu os preços de API de seus dois modelos GPT-5.6 de menor custo — cortando drasticamente o nível mais barato e diminuindo o nível intermediário. Três semanas depois, voltou-se para o carro-chefe: em 21 de agosto de 2026, a OpenAI anunciou que os preços da API GPT-5.6 Sol caem mais de 20% pelos próximos três meses enquanto a empresa trabalha para executar o modelo com mais eficiência. Este artigo explica exatamente o que mudou nas duas rodadas, a engenharia por trás delas, como os novos preços se comparam aos concorrentes, os custos ocultos a observar, como reduzir ainda mais sua fatura — e como os preços mais baixos já estão disponíveis na OrcaRouter com margem de 0%.

Cada figura abaixo é rotulada pela fonte. O preço é por milhão de tokens (entrada / saída). As tarifas da Luna e da Terra refletem a tabela de preços da OpenAI de 30 de julho de 2026, conforme relatado por veículos incluindo Unite.AI; a redução da Sol reflete o anúncio da OpenAI de 21 de agosto de 2026, com preços por token conforme relatado por veículos incluindo Runtimewire e Reuters. As páginas do modelo de repasse da OrcaRouter mostram os mesmos números; os valores dos concorrentes são atribuídos. Os preços mudam — verifique antes de construir.

TL;DR. A OpenAI reduziu o preço do GPT-5.6 Luna para US$ 0,20 / US$ 1,20 (antes US$ 1 / US$ 6, ~80% de desconto) e do GPT-5.6 Terra para US$ 2 / US$ 12 (antes US$ 2,50 / US$ 15, ~20% de desconto) em 30 de julho. Em 21 de agosto, estendeu o desconto ao carro-chefe: os preços da API do GPT-5.6 Sol caem mais de 20% pelos próximos três meses — para US$ 4 / US$ 20 por milhão de tokens, ante US$ 5 / US$ 30, segundo a OpenAI — enquanto os créditos baseados em tokens do Codex e do ChatGPT Work rendem mais e o uso da assinatura permanece inalterado. Dois ganhos de eficiência pagaram pelo corte de julho: kernels de GPU reescritos (custo de serviço cerca de 20% menor) e um modelo de rascunho de decodificação especulativa reprojetado (geração de tokens 15%+ mais rápida). Se você rotear por um endpoint neutro de fornecedor, com markup de 0%, como o OrcaRouter, as novas tarifas já estão valendo — mesmo preço, uma API compatível com OpenAI, com todos os modelos concorrentes ao lado para comparar e rotear entre eles.

Principais conclusões

• GPT-5.6 Luna: agora US$ 0,20 / US$ 1,20 por 1M de tokens, ante US$ 1 / US$ 6 — aproximadamente 80% de redução.

• GPT-5.6 Terra: agora $2 / $12, em vez de $2.50 / $15 — cerca de 20% de corte.

GPT-5.6 Sol (carro-chefe): agora US$ 4 / US$ 20 pelos próximos três meses, frente aos US$ 5 / US$ 30 anteriores — uma redução de >20% anunciada em 21 de agosto de 2026.

• Créditos baseados em tokens do Codex e do ChatGPT Work rendem mais: a entrada do Sol cai para 100 créditos e a saída para 500 créditos por 1M de tokens (de 125 / 750).

• Assinaturas inalteradas: o uso incluso, os limites de cinco horas/semana e as taxas de crédito legadas do Plus, Pro e Business não são afetados.

• Por quê: A OpenAI enquadrou ambas as rodadas como dividendos de eficiência — kernels de GPU de produção reescritos (~20% de redução no custo de serviço) além de um redesenho do modelo de rascunho de decodificação especulativa (eficiência de geração de tokens superior a 15%), conforme o post de engenharia da OpenAI de 29 de julho.

• Como obter: os cortes já estão refletidos no OrcaRouter (margem de 0%) — Luna a $0,20 / $1,20, Sol a $4 / $20 — por meio de um endpoint compatível com OpenAI.

O que exatamente mudou?

A família GPT-5.6 da OpenAI funciona como uma escada de níveis: Luna (rápida, mais barata), Terra (intermediária) e Sol (principal). O corte de 30 de julho atingiu os dois níveis mais baratos. De acordo com a tabela de preços divulgada, a GPT-5.6 Luna caiu de US$ 1 / US$ 6 para US$ 0,20 / US$ 1,20 por milhão de tokens de entrada/saída — cerca de 80% de redução tanto na entrada quanto na saída — e a GPT-5.6 Terra caiu de US$ 2,50 / US$ 15 para US$ 2 / US$ 12, aproximadamente 20%. A GPT-5.6 Sol, a principal, criada para os raciocínios mais difíceis e codificação agêntica, não foi afetada naquele dia — mas em 21 de agosto de 2026, a OpenAI anunciou um corte temporário também para ela: os preços da API caem mais de 20% pelos próximos três meses, para US$ 4 por milhão de tokens de entrada e US$ 20 por milhão de tokens de saída, com entrada em cache caindo de US$ 0,50 para US$ 0,40. O mesmo anúncio disse que os créditos que você compra rendem mais no Codex em planos baseados em tokens, e o uso incluído na sua assinatura permanece o mesmo.

A taxa base por token não é a história completa. O preço do GPT-5.6 também tem faixas de comprimento de entrada (contextos muito longos passam para uma taxa mais alta), um desconto de cache de prompt (entrada em cache é muito mais barata do que entrada nova) e uma opção de lote (tarefas assíncronas com desconto). Todos os três se aplicam ao corte, então o preço efetivo para uma carga de trabalho com uso intenso de cache ou lote pode ser ainda menor. Cuidado com a faixa de contexto longo na direção oposta: alimentar prompts enormes pode elevar você para uma faixa superior.

As duas otimizações por trás do corte.

{{1}}Não foi um gesto de loss-leader — a OpenAI o apresentou como um dividendo de eficiência.{{/1}} {{2}}Em uma publicação de engenharia de 29 de julho de 2026, membros da equipe técnica da OpenAI descreveram otimizações na inferência e no harness do agente por trás do Codex e do ChatGPT Work.{{/2}} {{3}}Duas se destacam.{{/3}} {{4}}Primeiro, reescritas de kernels de GPU na infraestrutura de produção — com a Sol, rodando dentro do Codex, usada para reescrever os próprios kernels da empresa — que, segundo a OpenAI, reduziram os custos de serving de ponta a ponta em cerca de 20%.{{/4}} {{5}}Segundo, um modelo de draft de decodificação especulativa redesenhado que, segundo relatos, melhorou a eficiência de geração de tokens em mais de 15%.{{/5}} {{6}}Menor custo de serving, repassado aos clientes como preços mais baixos nos níveis de alto volume, é a história — e é um vislumbre de um ciclo de feedback que toda a indústria persegue: usar modelos de fronteira para otimizar a própria infraestrutura que os serve.{{/6}}

O corte da Sol anunciado em 21 de agosto segue o mesmo enquadramento. Segundo a OpenAI, a redução — de mais de 20% para os próximos três meses — ocorre à medida que a empresa torna o modelo mais eficiente para operar, e é explicitamente temporária, e não um reajuste permanente de preço.

Como os novos preços se comparam

O corte visa diretamente a concorrência. De acordo com a cobertura da Unite.AI, os novos preços de $0,20 / $1,20 da Luna ficam abaixo dos da Haiku 4.5 da Anthropic em cerca de 5x na entrada e aproximadamente 4x na saída, e os novos $2 / $12 da Terra ficam abaixo do preço padrão do Claude Sonnet 5 (reportado em $3 / $15, com vigência após 31 de agosto de 2026). No campo dos modelos de pesos abertos, a Luna agora se aproxima do piso de inferência barata estabelecido pela linha V4 da DeepSeek e pelo GLM-5.2 da Zhipu (cerca de $1,20 / $4,10), com os níveis do Qwen da Alibaba e do Gemini Flash do Google na mesma vizinhança. O corte temporário da Sol para $4 / $20 mantém o modelo principal bem acima de seus próprios níveis de volume, mas reduz o prêmio — e a redução de um terço nos tokens de saída importa mais para cargas de trabalho de agentes com uso intensivo de saída. A cobertura da medida observa que isso ocorre enquanto a OpenAI enfrenta concorrência crescente da Anthropic e de modelos de IA chineses.

A inferência continua ficando mais barata.

Ampliando o panorama, esse corte se encaixa em uma tendência plurianual: o custo de um determinado nível de capacidade caiu fortemente, geração após geração, à medida que os laboratórios extraem mais throughput do mesmo hardware. As próprias faixas mais antigas da OpenAI ilustram a tendência de queda ao longo do tempo, e cada avanço de eficiência — melhores kernels, decodificação especulativa, atenção mais barata — tende a aparecer como corte de preço em poucos meses. Para os compradores, a implicação prática é arquitetar para um mundo onde a inferência fica mais barata de forma previsível: não se comprometa demais com o preço de um único modelo e mantenha baixo o custo de troca.

O custo oculto a observar: tokens de raciocínio

Os modelos GPT-5.6 são modelos de raciocínio, e isso molda os gastos no mundo real. Quando o raciocínio está habilitado, o modelo emite tokens internos de raciocínio que são cobrados como saída — portanto, seu custo efetivo de saída pode ser maior do que uma estimativa ingênua de "palavras na resposta" sugere, especialmente em prompts difíceis com alto esforço de raciocínio. A solução é ajustar o esforço de raciocínio à tarefa (baixo ou desligado para chamadas simples), limitar a saída quando possível e medir o uso real de tokens em vez de assumir. Uma taxa mais barata por token ajuda, mas controlar quantos tokens você gera ajuda mais.

O que isso significa para desenvolvedores

Se você usa GPT-5.6 Luna ou Terra para trabalho de alto volume — classificação, extração, roteamento, agentes leves, chat — sua fatura acabou de cair, em alguns casos pela maior parte do seu valor, sem que seja necessária mudança de código. Isso torna os níveis de volume ainda mais atraentes para cargas de trabalho sensíveis a custo e estreita a diferença de preço em relação aos modelos abertos baratos. A matemática do carro-chefe também mudou, pelo menos por enquanto: Sol a US$ 4 / US$ 20 pelos próximos três meses reduz o custo do trabalho com raciocínio intenso e com agentes no nível mais alto, e os créditos baseados em tokens do Codex e do ChatGPT Work rendem mais. Ainda é uma opção premium para as tarefas mais difíceis — só que mais barata do que era. O padrão vencedor é o mesmo: roteie pela dificuldade — níveis baratos (ou modelos abertos baratos) para os 80% fáceis, e o carro-chefe apenas onde ele compensa o custo.

Como cortar ainda mais sua conta

O corte de preço é um piso para construir, não a linha de chegada. As maiores alavancas adicionais: cache de prompt (reutilize um prompt de sistema estável ou contexto longo e pague a taxa de entrada em cache muito menor); a opção de lote (execute trabalhos não urgentes de forma assíncrona com desconto); roteamento por nível e por modelo (envie cada solicitação para o modelo mais barato que possa lidar com ela, incluindo modelos abertos); e controle de raciocínio (não pague por raciocínio profundo em chamadas triviais). Juntas, essas medidas reduzem rotineiramente as contas reais muito mais do que qualquer mudança de tarifa isolada. Como uma âncora concreta: com 10 milhões de tokens por mês e uma parcela de 70% de entrada, as novas tarifas da Luna resultam em cerca de US$ 5 por mês (cerca de US$ 4,37 com cache); o mesmo volume na Sol é de cerca de US$ 125 por mês — o argumento mais claro para o roteamento por dificuldade.

Como capturar os preços mais baixos imediatamente

Aqui está a parte que liga tudo. OrcaRouter cobra margem de 0% e repassa o preço do provedor diretamente, então os cortes da OpenAI já estão ativos no OrcaRouter: GPT-5.6 Luna mostra $0.20 / $1.20, Terra $2 / $12 e GPT-5.6 Sol $4 / $20 nas páginas dos modelos agora — as mesmas tarifas da tabela da própria OpenAI, acessíveis por meio de um único endpoint compatível com OpenAI junto com mais de 185 outros modelos. Você obtém os cortes sem migração e pode comparar preços de Sol, Luna e Terra com DeepSeek, GLM, Qwen, Gemini e Claude em um só lugar, e então rotear cada solicitação para o que for mais barato para o trabalho. Há também um plano gratuito e uma página de Ofertas para economias adicionais.

Os cortes já estão disponíveis no OrcaRouter: GPT-5.6 Luna a US$ 0,20 / US$ 1,20 e GPT-5.6 Sol a US$ 4 / US$ 20 por 1M de tokens, repassados com margem de 0%.

Trace a rota por dificuldade para economizar ainda mais.

A conta mais barata não é um único modelo — é o modelo certo para cada solicitação. Como o OrcaRouter expõe todo o campo por meio de um único endpoint, você pode enviar chamadas fáceis e de alto volume para a Luna ou para um modelo aberto barato e reservar a Sol ou outro carro-chefe para as difíceis, alternando com uma mudança de configuração em vez de uma reintegração. Uma redução de preço na Luna torna essa estratégia de roteamento por dificuldade ainda mais barata, e o desconto temporário da Sol também reduz o custo das chamadas difíceis — sem que você precise reconfigurar nada.

Perguntas Frequentes

Quanto a OpenAI reduziu os preços do GPT-5.6?

GPT-5.6 Luna caiu de $1 / $6 para $0,20 / $1,20 por milhão de tokens (cerca de 80%), e GPT-5.6 Terra de $2,50 / $15 para $2 / $12 (cerca de 20%). Em 21 de agosto de 2026, a OpenAI também reduziu o GPT-5.6 Sol de $5 / $30 para $4 / $20 pelos próximos três meses.

Quando o corte de preço entrou em vigor?

Os cortes de Luna e Terra entraram em vigor em 30 de julho de 2026, ativos na tabela de preços publicada. A OpenAI anunciou a redução temporária de Sol em 21 de agosto de 2026, pelos próximos três meses.

Por que a OpenAI reduziu os preços?

A OpenAI atribui o corte de julho a otimizações de inferência — kernels de GPU de produção reescritos (custo de serviço cerca de 20% menor) e um modelo de draft de decodificação especulativa redesenhado (eficiência de geração de tokens 15%+) — segundo um post de engenharia de 29 de julho de 2026. Ela enquadrou o corte da Sol da mesma forma, como uma medida tomada enquanto o modelo se torna mais barato de executar, em um mercado com concorrência crescente.

O carro-chefe (Sol) ficou mais barato?

Sim — temporariamente. O corte de 30 de julho deixou o GPT-5.6 Sol em US$ 5 / US$ 30, mas em 21 de agosto de 2026, a OpenAI anunciou uma redução de preço de mais de 20% para os próximos três meses, para US$ 4 / US$ 20 por milhão de tokens. Os créditos baseados em tokens do Codex e do ChatGPT Work também compram mais, enquanto o uso da assinatura permanece inalterado.

Como os novos preços se comparam aos da Anthropic e aos modelos abertos?

Segundo relatórios, a Luna agora subcotiza o Haiku 4.5 da Anthropic em aproximadamente 5x na entrada / 4x na saída, e a Terra fica abaixo do preço padrão do Claude Sonnet 5 ($3 / $15). A Luna também se posiciona próxima ao piso de modelos abertos baratos definido pela DeepSeek e GLM-5.2.

Qual é a pegadinha com os tokens de raciocínio?

GPT-5.6 são modelos de raciocínio; tokens de raciocínio interno são cobrados como saída, então o custo efetivo de saída pode exceder uma estimativa ingênua. Ajuste o esforço de raciocínio e limite a saída para controlá-lo.

Como consigo os novos preços mais baixos?

Eles já estão disponíveis na API da OpenAI e, com markup de 0%, no OrcaRouter — onde GPT-5.6 Luna mostra $0.20 / $1.20 e GPT-5.6 Sol $4 / $20 — por meio de um endpoint compatível com OpenAI, sem necessidade de alteração de código.

Conclusão

O corte de 30 de julho da OpenAI tornou o GPT-5.6 Luna e o Terra dramaticamente mais baratos para trabalhos de alto volume, e seu anúncio de 21 de agosto estende a história ao carro-chefe: o GPT-5.6 Sol cai para US$ 4 / US$ 20 pelos próximos três meses, enquanto os créditos de token do Codex compram mais e o uso da assinatura permanece inalterado. Ambas as rodadas são dividendos de eficiência — reescritas de kernel e ganhos de decodificação especulativa, por um lado, e serviço de execução mais barato, por outro — e uma resposta clara a uma guerra de preços real. Roteie por dificuldade, apoie-se em cache e processamento em lote e controle os tokens de raciocínio para economizar ao máximo. E como o OrcaRouter repassa os preços dos provedores com margem de 0%, as tarifas mais baixas já estão ativas lá — Luna a US$ 0,20 / US$ 1,20, Sol a US$ 4 / US$ 20 — mesmo preço, um endpoint compatível com a OpenAI, todo o campo de modelos em um só lugar. Aproveite os cortes sem mudar uma linha de código e deixe cada solicitação escolher o modelo mais barato que pode fazer o trabalho.