Preços da API GPT-5.6: Camadas Sol, Terra e Luna, Custo Real e Como Chamar Cada Uma
Guides & Insights

Preços da API GPT-5.6: Camadas Sol, Terra e Luna, Custo Real e Como Chamar Cada Uma

Autor

Fengya Tian

Data de publicação

Modelos mais recentes · 20Ver todos os modelos
Benchmarks: Artificial Analysis · atualizado diariamente
Voltar para todas as publicações

GPT-5.6 é a família principal da OpenAI de julho de 2026, e o importante para os desenvolvedores é que não há um único preço. Ela é lançada em três níveis—Sol, Terra e Luna. Na API da OpenAI, Sol custa $5 por milhão de tokens de entrada e $30 por milhão de tokens de saída, Terra custa $2.50 e $15, e Luna custa $1 e $6. Cada nível tem um desconto de entrada em cache, todos os três aceitam entrada de imagem além de texto, e a janela de contexto é de cerca de 1.05M tokens com até 128K de saída.

O preço de lista é apenas o começo do custo real. Qual tier você realmente precisa, quanto você armazena em cache, quanto output o modelo gera, e algumas regras de precificação que a maioria dos guias ignora—prompts com mais de 272 mil tokens, acréscimo por residência de dados e tiers de serviço—determinam a conta muito mais do que a taxa principal. Este guia detalha o preço de cada tier, para que serve, como pontua, como migrar do GPT-5.5, como chamá-lo e como se compara com Claude, GLM, Gemini, DeepSeek e Grok.

Resposta rápida: preços do GPT-5.6 em resumo

- Três níveis (por milhão de tokens, entrada / saída): Sol $5 / $30, Terra $2.50 / $15, Luna $1 / $6.

- Entrada em cache: $0,50 (Sol), $0,25 (Terra), $0,10 (Luna) por milhão de tokens; escritas em cache custam 1,25x a taxa de entrada não armazenada em cache.

- Posicionamento: Sol para o trabalho de raciocínio e agentivo mais difícil, Terra como o padrão equilibrado, Luna para tarefas de alto volume e sensíveis a custo.

- Modalidade: multimodal—GPT-5.6 aceita entrada de imagem junto com texto. Contexto ~1.05M tokens, saída máxima 128K.

- Duas regras de preço a considerar: prompts com mais de 272 mil tokens de entrada são cobrados em 2x na entrada e 1.5x na saída para toda a solicitação, e endpoints de residência de dados adicionam um acréscimo de 10%.

- Maneiras de pagar menos: Lote tem 50% de desconto sobre o padrão, cache reduz a entrada repetida a um décimo, e rotear trabalho rotineiro para um nível inferior evita a saída de $30 de Sol.

- Inteligência: A Artificial Analysis coloca GPT-5.6 Sol perto do topo de seu Índice de Inteligência (pontuação 59).

Preços da API GPT-5.6, nível por nível

A OpenAI precifica o GPT-5.6 por milhão de tokens, e a saída é muito mais cara que a entrada em todos os níveis. As taxas atualmente publicadas são:

- GPT-5.6 Sol: $5,00 de entrada, $0,50 de entrada em cache, $30,00 de saída (escritas em cache $6,25).

- GPT-5.6 Terra: $2,50 entrada, $0,25 entrada em cache, $15,00 saída.

- GPT-5.6 Luna: $1.00 de entrada, $0.10 de entrada em cache, $6.00 de saída.

Dois detalhes são importantes antes de planejar um orçamento. Primeiro, a taxa de saída domina a maioria das contas reais, especialmente para trabalhos de raciocínio e agentivos onde o modelo gera longas trilhas, chamadas de ferramentas e revisões antes de uma resposta final. Segundo, não há uma linha de preço separada "Sol Ultra" na página de preços; "Sol Ultra" é uma configuração de raciocínio superior do Sol (uma configuração multiagente), não um nível independente — faça o orçamento em torno de Sol, Terra e Luna.

Para que realmente serve cada nível

Luna: alto volume e sensível a custos

Luna é o nível econômico a $1 de entrada e $6 de saída. É a opção padrão adequada para classificação, extração, roteamento, sumarização, redação e o grande volume de trabalho rotineiro onde uma pequena diferença de qualidade não altera o resultado. A seis dólares por milhão de tokens de saída, é barato o suficiente para ser executado em escala e para amostragem repetida.

Terra: o padrão equilibrado

Terra fica no meio, a US$ 2,50 e US$ 15. Para a maioria dos trabalhos de aplicação e codificação, é o ponto de partida sensato: visivelmente mais forte que Luna em tarefas mais difíceis, mas pela metade do preço de saída de Sol. Comece aqui e, em seguida, mova uma tarefa para Sol apenas quando Terra falhar visivelmente.

Sol: o raciocínio mais difícil e o trabalho agêntico

Sol é o carro-chefe a $5 e $30, e a Artificial Analysis o coloca perto do topo do seu Índice de Inteligência. Reserve-o para arquiteturas difíceis, depuração complexa, agentes de longo horizonte e análises de alto risco, onde um erro evitado vale o prêmio. Usar Sol para trabalhos rotineiros é a maneira mais comum de gastar demais no GPT-5.6.

Vindo do GPT-5.5? Qual nível economiza mais?

GPT-5.6 Sol tem o mesmo preço do GPT-5.5: US$5 para entrada e US$30 para saída, então mover uma carga de trabalho do GPT-5.5 diretamente para o Sol muda pouco na conta. A economia está nos dois novos níveis inferiores. O Terra oferece aproximadamente a qualidade da classe GPT-5.5 na maioria das tarefas pela metade do preço, então a migração mais simples é enviar o tráfego existente do GPT-5.5 para o Terra e apenas promover as tarefas que regridem de volta para o Sol.

O plano de migração prática tem três etapas: redirecionar as chamadas do GPT-5.5 para Terra, executar seu conjunto de avaliação e escalar apenas as falhas para Sol, enquanto empurra o trabalho claramente rotineiro para Luna. A maioria das cargas de trabalho do GPT-5.5 fica mais barata dessa forma, sem uma perda de qualidade que você possa medir.

Como os níveis realmente pontuam

O preço só importa quando comparado à capacidade. Nos números do próprio Terminal-Bench 2.1 da OpenAI, as camadas se separam aproximadamente como seria de esperar: Sol 88.8%, Sol Ultra 91.9%, Terra 87.4% e Luna 84.7%. Para contexto na mesma tabela, o GPT-5.5 obtém 85.6%, Claude Opus 4.8 é 78.9%, Claude Fable 5 é 83.1%, e Gemini 3.1 Pro (preview) é 70.7%. A Artificial Analysis atribui separadamente ao Sol um Intelligence Index de 59, próximo ao topo do ranking.

Leia estes como relatados pelo fornecedor e direcionais. A OpenAI publicou um conjunto limitado de avaliações para o GPT-5.6 e não, no momento da escrita, benchmarks tradicionais de codificação e raciocínio como SWE-bench Verified ou GPQA, portanto, use essas pontuações para decidir o que testar em sua própria carga de trabalho, em vez de como um veredito final.

A taxa de leitura de entrada em cache de cada nível é um décimo da taxa de entrada nova: $0,50 no Sol, $0,25 no Terra, $0,10 no Luna. No entanto, escrever no cache custa 1,25x a taxa de entrada não armazenada em cache (cerca de $6,25 por milhão no Sol), então o cache só compensa quando um prefixo estável é reutilizado vezes suficientes para recuperar o prêmio de escrita—instruções do sistema, um documento grande, regras de repositório ou uma taxonomia de produto. Coloque material estável no início do prompt e a pergunta variável no final, e evite inserir timestamps ou identificadores aleatórios antes do contexto reutilizável.

O cache reduz o custo de entrada repetida; não faz nada para a saída. Como a saída é o lado caro em todos os níveis, as duas alavancas que mais movimentam uma conta GPT-5.6 são armazenar em cache um prefixo estável e controlar quanto o modelo escreve.

Qual nível você deve escolher?

Não escolha um nível por reputação. Escolha-o por teste. Construa um pequeno conjunto de tarefas representativas com critérios de aceitação claros, execute-as primeiro no Luna e promova apenas as tarefas que falharem para o Terra, depois para o Sol. Meça o custo por tarefa aceita, não o preço médio do token, porque um nível mais barato que precisa de três tentativas pode custar mais do que um nível mais forte que tenha sucesso uma vez.

Um hábito operacional economiza dinheiro real: fixe o ID exato do modelo de nível em cada chamada, em vez de confiar em um alias simples, para que uma solicitação rotineira nunca seja executada silenciosamente no nível mais caro. Uma carga de trabalho mista geralmente se resolve em Luna para transformação e rascunho rotineiros, Terra para implementação e análise do dia a dia, e Sol reservada para a minoria difícil — a maioria das solicitações nunca precisa do carro-chefe.

GPT-5.6 vs a concorrência em preço

GPT-5.6 não existe isoladamente. Leia em comparação com o campo atual (por milhão de tokens, entrada/saída, meados de 2026): Claude Opus 4.8 custa $5 / $25, Claude Fable 5—o modelo público mais forte da Anthropic—custa $10 / $50, GLM 5.2 custa $1,40 / $4,40 na Z.AI (hospedagens de terceiros podem ser mais baratas), Grok 4.5 custa $2 / $6, do Google Gemini 3.5 Flash custa cerca de $1,50 / $9, e o DeepSeek V4-Pro custa cerca de $0,44 / $0,87. Confirme cada um na página do próprio fornecedor, pois esses valores variam.

As conclusões são específicas. O GPT-5.6 Sol equipara-se ao Opus 4.8 na entrada, mas é mais caro na saída ($30 contra $25); portanto, em trabalhos agentivos com muita saída, o Opus é ligeiramente mais barato por token, enquanto o Sol lidera o Intelligence Index. O Terra subcotiza ambos os carros-chefe e é a opção de melhor custo-benefício na família OpenAI. O Luna compete em preço com modelos mais baratos, embora o Grok 4.5, o GLM 5.2 e especialmente o DeepSeek estejam ainda mais abaixo. Nenhum nível ou fornecedor único vence em tudo, e é exatamente por isso que rotear por dificuldade supera se comprometer com um só.

Uma fatura mensal processada

Coloque números nisso. Para um mês médio-pesado de 50M de tokens de entrada e 10M de tokens de saída, ao preço de tabela antes de caching e uso de ferramentas, o custo do modelo é aproximadamente:

GPT-5.6 Luna: cerca de $110.

- GPT-5.6 Terra: cerca de $275.

- GPT-5.6 Sol: cerca de $550.

- Para comparação: GLM 5.2 cerca de $114, Grok 4.5 cerca de $160, Claude Opus 4.8 cerca de $500, Claude Fable 5 cerca de $1.000.

As mesmas tarefas roteadas de forma inteligente — Luna e Terra para a maior parte, Sol para a minoria difícil — ficam muito mais próximas da faixa de $110–$275 do que de um valor fixo de $550 de Sol-para-tudo. Essa diferença, multiplicada ao longo de um ano, é todo o argumento para o roteamento baseado em níveis.

Custos ocultos a planejar

Várias regras de precificação não aparecem na taxa principal e surpreendem as equipes mais tarde:

- Prompts longos: uma solicitação com mais de 272 mil tokens de entrada é cobrada em 2x a entrada e 1,5x a saída para toda a solicitação, portanto, chamadas de contexto grande e big-RAG podem mais que dobrar de custo.

- Volume de saída: a saída é até seis vezes a taxa de entrada, portanto, a saída sem limite ou com raciocínio elevado é o principal risco de gasto excessivo.

- Nível de serviço: O processamento prioritário é aproximadamente o dobro da tarifa padrão (cerca de $10 de entrada / $60 de saída no Sol); Flex e Batch são mais baratos. Escolha o nível deliberadamente com a configuração service_tier.

- Residência de dados: endpoints de processamento regional adicionam um acréscimo de 10% para modelos lançados em ou após 5 de março de 2026, o que inclui o GPT-5.6.

- Loops e repetições do agente: instruções, ferramentas e histórico são reenviados a cada turno, e uma requisição longa com falha desperdiça a entrada que você já pagou.

- Deriva de camada: deixar tudo em Sol "para ficar seguro" é o hábito mais caro de todos.

Maneiras de pagar menos

Três alavancas reduzem uma conta do GPT-5.6 sem mudar o que você constrói. Lote: solicitações assíncronas através do nível Batch têm 50% de desconto sobre o preço padrão, ideal para trabalho de alto volume em Luna que não é sensível à latência. Cache: reutilize um prefixo estável vezes suficientes para superar o prêmio de escrita de 1,25x e as entradas repetidas caem para um décimo. Roteamento: envie trabalho rotineiro para Luna ou Terra e escale apenas a minoria difícil para Sol, e mantenha os prompts abaixo do limite de 272K quando possível.

Como chamar o GPT-5.6

GPT-5.6 está disponível através da API OpenAI e através de gateways compatíveis com OpenAI, de forma que a integração permanece estável enquanto você altera o modelo ou nível por trás dela. O seguinte é um padrão compatível com OpenAI; confirme o ID do modelo atual antes do uso em produção, e fixe o nível exato em vez de um alias simples.

from openai import OpenAI
client = OpenAI(base_url="https://www.orcarouter.ai/v1", api_key="YOUR_API_KEY")
response = client.chat.completions.create(
model="openai/gpt-5.6-terra",
messages=[{"role": "user", "content": "Refatore este módulo e explique os riscos."}],
)
print(response.choices[0].message.content)

Mudar de nível é uma alteração de uma linha no campo do modelo, que é o que torna prático o roteamento baseado em dificuldade: enviar chamadas rotineiras para Luna ou Terra e escalar apenas as difíceis para Sol.

Testando GPT-5.6 através do OrcaRouter

Um gateway torna o GPT-5.6 mais fácil de adotar por dois motivos. Primeiro, o mesmo cliente compatível com OpenAI pode chamar todos os três níveis e modelos de comparação, como Claude Opus 4.8, GLM 5.2 e Grok 4.5, para que você possa executar um conjunto de avaliação em tudo sem reescrever o código de integração e medir o custo real por tarefa aceita — incluindo taxas de ferramentas, repetições e a sobretaxa de 272K. Segundo, um gateway pode fazer failover entre provedores e impor um limite de orçamento, de modo que um problema temporário de capacidade ou uma chamada Sol errante não estoure o mês. Confirme a rota ativa do GPT-5.6 e os IDs de nível atuais antes de construir um orçamento com base neles.

Próximo passo: Registre-se no OrcaRouter e execute sua própria comparação de níveis do GPT-5.6 através de um endpoint de API.

Perguntas Frequentes

Qual é a diferença entre GPT-5.6 Sol, Terra e Luna?

São três níveis da mesma família com preços e níveis de capacidade diferentes. Sol é o carro-chefe para o trabalho mais pesado ($5/$30), Terra é o padrão equilibrado ($2.50/$15) e Luna é o nível econômico para tarefas de alto volume ($1/$6). Escolha o mais baixo que passe nos seus testes.

Existe um nível de preços do GPT-5.6 Sol Ultra?

Não. "Sol Ultra" é uma configuração de raciocínio superior e multiagente do Sol, não uma linha separada na página de preços. Ela usa mais tokens e custa mais por tarefa, mas você a orça como Sol com maior esforço.

Por que minha fatura do GPT-5.6 excedeu uma estimativa simples?

Geralmente tokens de saída, a sobretaxa de prompt longo de 272K (2x entrada, 1,5x saída), camada de serviço prioritário, aumento de residência de dados ou novas tentativas. Registre a cadeia completa de solicitações e meça o custo por tarefa aceita em vez de por prompt.

Posso ajustar o GPT-5.6 e existe um nível gratuito?

Não em ambos. O GPT-5.6 não suporta ajuste fino, e a API não tem nível gratuito — a cobrança começa no primeiro token. O acesso gratuito só existe em alguns planos do ChatGPT, que é um produto separado da API.

Qual plano do ChatGPT pode usar qual nível?

Varia de acordo com o produto. No ChatGPT Work e Codex, os planos Free e Go podem usar Terra, enquanto Plus e superiores podem escolher entre Sol, Terra e Luna; a configuração ultra máxima é limitada aos planos Pro e Enterprise. Trate os planos da API e do ChatGPT como separados — uma chave de API não herda o acesso de uma assinatura.

O resultado final

A história de precificação do GPT-5.6 é a estratificação. Sol a $5/$30 lidera os rankings de inteligência, Terra a $2,50/$15 é o padrão de valor e o lar natural para o tráfego do antigo GPT-5.5, e Luna a $1/$6 lida com volume. O cache reduz a entrada repetida a um décimo (após um prêmio de gravação de 1,25x), Batch custa metade do preço, mas a saída é o lado caro em cada nível e prompts longos com mais de 272K têm uma sobretaxa.

Trate os três níveis como um problema de roteamento, não como uma única compra: padrão baixo, escalar em caso de falha, cache de contexto estável, usar Batch onde a latência permitir, e manter um modelo de comparação acessível através do mesmo endpoint. Isso produz um custo por tarefa aceita muito menor do que pagar taxas premium por trabalho rotineiro.


© 2026 OrcaRouter

Para provedores

Opera uma plataforma de inferência? Traga seus modelos para o OrcaRouter.

Fale conosco

Junte-se à comunidade

DiscordEmailXGitHubYouTube