Um cartão de título para o guia da API GPT-5.6 Sol, mostrando um cartão de gateway arredondado com um chip de código que exibe model: gpt-5.6-sol, uma etiqueta de preço que indica $5 / $30 por 1M de tokens, um dial rotulado como Esforço de raciocínio com seis posições, e quatro chips de modelo rotulados como GPT, Claude, Gemini e Qwen, conectados por linhas finas ao gateway único.
Guides & Insights

API GPT-5.6 Sol: como chamar, quanto custa e quando fazer downgrade

Autor

Alistair Wren

Data de publicação

Modelos mais recentes · 20Ver todos os modelos
Benchmarks: Artificial Analysis · atualizado diariamente
Voltar para todas as publicações

To call the GPT-5.6 Sol API you send model: "gpt-5.6-sol" to https://api.openai.com/v1/chat/completions — or to the Responses API, the recommended route for new builds — and you are billed $5 per million input tokens and $30 per million output. The same model id works through any OpenAI-compatible gateway: GPT-5.6 Sol on OrcaRouter passes that list price through with $0 per-token markup, and with bring-your-own-key the request bills your existing account directly. Sol is the flagship tier of the GPT-5.6 family, released July 9, 2026, with a ~1.05M-token context window. The decision that actually matters is not which dialect you call but whether the task earns the $30 output rate — this guide covers the exact request shapes, the reasoning dial that controls the real cost, and the honest case for routing volume elsewhere.

Os dois dialetos e o id do modelo

A maioria dos tutoriais de GPT-5.6 Sol mostra um único dialeto e para por aí. Existem dois, e ambos alcançam os mesmos pesos.

Chat Completions — /v1/chat/completions. POST to https://api.openai.com/v1/chat/completions with an Authorization: Bearer header carrying your OpenAI key. The body takes model: "gpt-5.6-sol", a messages array, and your chosen reasoning effort. This is the dialect the standard OpenAI Python and TypeScript SDKs send by default.

Responses API — client.responses.create. The same model id with a newer request shape: a single input field and a reasoning block ({"effort": "high"}) instead of the messages array. OpenAI recommends it for new builds because it takes reasoning parameters directly and returns reasoning tokens as first-class output — and the highest effort level is only available here.

Fixe a camada. O alias puro gpt-5.6 roteia para Sol hoje, mas um alias é exatamente o que um fornecedor altera quando um novo carro-chefe é lançado. Passar gpt-5.6-sol significa explicitamente que cada chamada declara o que custa, e é o id que todo gateway espera.

O que você recebe — e o mostrador que decide a sua conta.

O GPT-5.6 Sol é o carro-chefe da OpenAI com forte foco em raciocínio: uma janela de contexto de ~1,05 milhão de tokens, saída máxima de 128K, corte de conhecimento em 16 de fevereiro de 2026 e entrada de texto, imagem e arquivo com saída de texto. No leaderboard independente da Artificial Analysis, ele mede um Índice de Inteligência AA de 61 e uma pontuação de Codificação AA de 77, com uma pontuação SWE-bench Pro de 64,6% medida de forma independente pelo llm-stats — o número de codificação é o que a comunidade de agentes realmente cita.

A spec and benchmark scoreboard for GPT-5.6 Sol: model id gpt-5.6-sol, ~1.05M token context window, 128K max output, released July 9 2026, AA Intelligence Index 61 and AA Coding 77 per Artificial Analysis, SWE-bench Pro 64.6% independently measured by llm-stats, and six reasoning-effort levels from none to max.

O pensamento está ativado por padrão, e o parâmetro de esforço de raciocínio é a maior alavanca tanto na latência quanto no custo:

Seis níveisnenhum, baixo, médio, alto, extra alto, máximo. nenhum desativa o raciocínio para tarefas mecânicas; máximo é para problemas de alto custo de erro e está disponível apenas através da Responses API.

Comece no médio e avance um nível de cada vez. O tutorial do apidog GPT-5.6 observa que muitas cargas de trabalho do GPT-5.5 mantêm sua qualidade um nível abaixo na família 5.6 — meça a qualidade antes de pagar por mais raciocínio.

O modo Pro é uma configuração, não um modelo. Defina reasoning.mode: "pro" e o modelo prioriza a qualidade das respostas em vez da velocidade. O preço e o ID do modelo permanecem inalterados.

Verbosidadebaixa, média (padrão), alta — controla o tamanho da saída independentemente do raciocínio.

Tokens de raciocínio são cobrados como saída a US$ 30 por milhão. Em prompts difíceis no nível xhigh ou max, o raciocínio interno pode dominar a fatura — a parte oculta do preço dos modelos de raciocínio que o preço anunciado nunca mostra.

O que Sol realmente custa

O preço base da Sol sobreviveu inalterado ao corte de preços da OpenAI em 30 de julho de 2026: $5 por milhão de entrada e $30 por milhão de saída. O corte incidiu sobre os dois níveis mais baratos — GPT-5.6 Terra caiu para $2 / $12 e GPT-5.6 Luna para $0.20 / $1.20 — o que importa aqui porque é a comparação exata que mostra quando a Sol é exagero.

A price card for the GPT-5.6 Sol API: Sol at $5 input / $30 output per 1M with a $0.50 cache read and a $6.25 cache write, a long-context tier at $10 / $45, GPT-5.6 Terra at $2 / $12 and GPT-5.6 Luna at $0.20 / $1.20, and a worked example of 100K tokens in plus 20K out billing $1.10 uncached or about $0.65 with a cached input leg.

Três modificadores alteram a taxa efetiva:

Cache de prompt. A entrada reutilizada é cobrada a cerca de $0.50 por milhão em uma leitura de cache — 90% de desconto em relação à entrada nova — e gravações de cache são cobradas a $6.25 por milhão (1,25x a taxa de entrada sem cache). O cache é implícito por padrão e pode ser tornado explícito via prompt_cache_options com um ttl; o prefixo em cache precisa de pelo menos 1.024 tokens e permanece ativo por pelo menos 30 minutos.

Níveis de contexto longo. Acima de um tamanho de entrada limite, o Sol passa para $10 / $45 por milhão. Alguns prompts muito longos alteram silenciosamente seu preço médio.

Tudo o que o modelo emite é saída. Isso inclui tokens de raciocínio interno, então em chamadas com muito raciocínio, é no lado da saída que a fatura se concentra.

Uma fatura concreta: uma solicitação de 100K tokens que gera 20K tokens de saída custa $0.50 pela entrada e $0.60 pela saída — $1.10 sem cache. Se essa solicitação de 100K tokens for servida pelo cache na próxima chamada, a parte de entrada cai para cerca de $0.05 e a ida e volta fica perto de $0.65. Em um longo loop de agente que reutiliza o mesmo prompt de sistema o dia todo, o cache é a diferença entre a Sol ser acessível ou não.

Um endpoint, mais de 200 modelos

If you are reading a GPT-5.6 Sol API guide you already have an integration or are about to write one, and the real question is how many more you want to maintain. OrcaRouter puts 200+ models behind one OpenAI-compatible endpoint: the same base URL (https://api.orcarouter.ai/v1), the same client, and a different model id per model — openai/gpt-5.6-sol today, a cheaper tier or a different family when the workload stops earning Sol's rate, all without a code change.

The OrcaRouter model page for openai/gpt-5.6-sol, showing the $5.00 per million input and $30.00 per million output pricing, the 1.05M-token context window, 128K max output, the p50 TTFT of 4.59s, and the /v1/chat/completions and /v1/responses endpoints.

A parte econômica é a honesta. A OrcaRouter adiciona $0 por token — os $5 / $30 na página do modelo são a tarifa da OpenAI repassada, e uma alteração de preço do fornecedor entra em vigor do nosso lado no mesmo dia em que é anunciada. Traga sua própria chave é uma opção de primeira linha: forneça sua chave existente da OpenAI, mantenha seus próprios limites de uso e créditos, e a OpenAI cobra você diretamente. Guardrails — um escudo de PII e uma política de conteúdo — são aplicados antes de a solicitação ser cobrada, não depois. O DSL de roteamento compõe o failover para que um modelo mais barato responda quando a Sol retornar erros ou quando o padrão do seu tráfego permitir.

Quando Sol está no tier errado

Ser o carro-chefe não é o mesmo que ser o ideal para cada chamada, e há três lugares onde a tarifa de $5 / $30 perde.

Chamadas de alto volume e baixo risco. Um pipeline de classificação ou extração que processa 10M de tokens de entrada por mês custa $50 no Sol contra $2 no GPT-5.6 Luna — mesmo endpoint, mesma chave, uma mudança de id. Luna a $0,20 / $1,20 é precificada exatamente para esse tipo de trabalho.

Raciocínio intermediário que não precisa de profundidade de ponta. GPT-5.6 Terra a US$ 2 / US$ 12 fica entre o volume e o topo de linha. A recomendação do tutorial do apidog é o padrão sensato: prototipe na Terra, escale para Sol apenas onde a Terra falhar de forma mensurável e empurre os caminhos estáveis de alto volume para a Luna.

O limite do que podemos prometer.OrcaRouter roteia e cobra; OpenAI executa os pesos. O endpoint, o markup zero, o failover e as salvaguardas são nossos, mas a qualidade da inferência e o comportamento de segurança são da OpenAI, e com BYOK o dinheiro vai direto para eles. Esse é o acordo, dito sem rodeios: você paga a tarifa do provedor de qualquer forma, e a questão é se um endpoint para 200+ modelos vale a pena.

Conclusão

Use a API GPT-5.6 Sol com Chat Completions se você já tiver um cliente OpenAI, e com a API Responses se estiver criando algo novo — o id do modelo gpt-5.6-sol, a tarifa de $5 / $30, e o mesmo controle de raciocínio em qualquer dos casos. É o modelo certo quando a tarefa é difícil, o contexto é longo e a saída vale $30 por milhão de tokens — e o modelo errado quando a tarefa é rotineira, onde Terra e Luna custam uma fração do preço. A configuração mais limpa é aquela que permite mudar de ideia: um endpoint, sua própria chave, margem de $0, e um id de modelo que você pode trocar no dia em que a carga de trabalho mudar.

O GPT-5.6 Sol está disponível no OrcaRouter pelo preço de tabela de US$ 5 / US$ 30 da OpenAI, com US$ 0 de acréscimo por token — use sua chave OpenAI existente e o provedor cobra você diretamente. Comece com o GPT-5.6 Sol no OrcaRouter — um endpoint, sem segunda integração.

© 2026 OrcaRouter

Para provedores

Opera uma plataforma de inferência? Traga seus modelos para o OrcaRouter.

Fale conosco

Junte-se à comunidade

DiscordEmailXGitHubYouTube