
GPT-5 Codex vs GPT-5.6 Sol: O Especialista em Codificação vs o Carro-Chefe Que o Engoliu
- googleNOVOGoogle: Gemini 3.8 Flash2026-09-0259Inteligência76Código
- qwenNOVOQwen: Qwen3.8 Max (0902)2026-09-0258Inteligência72Código
- anthropicNOVOAnthropic: Claude Fable 5.12026-09-0166Inteligência82Código
- AlibabaNOVOQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 por 1M de tokens
- z-aiNOVOZ.ai: GLM 5.3 Flash2026-08-2658Inteligência72Código
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.15 / $0.29 por 1M de tokens
- z-aiZ.ai: GLM 5.32026-08-1860Inteligência75Código
- obsidianQwen3.8 27B2026-08-1552Inteligência68Código
- qwenQwen: Qwen3.8 27B (free)2026-08-13qwen/qwen3.8-27b-free
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1253Inteligência69Código
- grokSpaceXAI: Grok 4.62026-08-1261Inteligência77Código
- metaMeta: Muse Spark 1.22026-08-0557Inteligência72Código
- qwenQwen: Qwen3.8 Max2026-08-0358Inteligência72Código
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3152Inteligência69Código
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 por 1M de tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463Inteligência78Código
- googleGoogle: Gemini 3.6 Flash2026-07-2152Inteligência69Código
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137Inteligência49Código
Quando a OpenAI lançou a família GPT-5.6 em 9 de julho de 2026, ela aposentou silenciosamente o aplicativo independente Codex e integrou o modo de agente de codificação ao ChatGPT. A página do modelo que a OpenAI escreveu para GPT-5.6 Sol então parecia uma descrição de cargo tirada de um especialista em codificação — "raciocínio profundo em múltiplas etapas, engenharia de software em larga escala e fluxos de trabalho agênticos de longo horizonte." Assim, o confronto entre GPT-5 Codex e o GPT-5.6 Sol não é uma disputa comum de especificações. É o especialista perguntando se o carro-chefe que acabou de absorver a sua categoria de produto também o tornou redundante.
A resposta curta é não — mas o motivo é mais interessante do que “Codex ainda é bom”. O GPT-5 Codex permanece ativo na API por US$ 1,25 por milhão de tokens de entrada e US$ 10 por milhão de saída: um agente de engenharia de software feito sob medida, ajustado para automação de CLI, IDE e GitHub, com pontuações medidas de forma independente. O GPT-5.6 Sol custa quatro vezes mais na entrada e três vezes mais na saída (US$ 5 / US$ 30) e é o mais novo carro-chefe geral, com números de codificação mais altos — mas, em sua maioria, relatados pelo fornecedor. O que está realmente em jogo nessa combinação é preço, contexto e a diferença entre um especialista e um generalista que codifica bem. Tudo abaixo está identificado por fonte.
O que cada modelo é
O GPT-5 Codex é exatamente o que sua página do modelo diz: "uma versão especializada do GPT-5 otimizada para engenharia de software e fluxos de trabalho de codificação." Lançado em setembro de 2025, é o modelo de API por trás do agente de codificação da OpenAI — aquele que constrói projetos do zero, implementa funcionalidades, refatora em escala, revisa código e planeja alterações em vários arquivos com um controle ajustável de esforço de raciocínio. Ele aceita entrada de texto e imagem (capturas de tela para tarefas de UI), tem um contexto de 400 mil tokens, um teto de saída de 128 mil tokens e é explicitamente voltado para aplicações de codificação agêntica: CLI, extensões de IDE, GitHub e tarefas em nuvem.
GPT-5.6 Sol é o nível principal da série GPT-5.6, lançado em 9 de julho de 2026 com corte de conhecimento em fevereiro de 2026. É o modelo para o qual a OpenAI direciona o trabalho geral mais difícil: raciocínio profundo em múltiplas etapas, engenharia de software em larga escala, agentes de longo horizonte, uso de computador e um modo de raciocínio multiagente "ultra". Seu contexto é de 1,05 milhão de tokens — 2,6 vezes o do GPT-5 Codex — com o mesmo teto de saída de 128K, e aceita entrada de texto, imagem e arquivo. Sol também roda dentro do ChatGPT, então quando a OpenAI fala sobre "Codex" no sentido de produto hoje, normalmente significa Sol realizando trabalho de codificação agêntica.
Preço: uma diferença de 4x / 3x que estreita mas nunca fecha
Os números de destaque, ambos repassados ao preço de tabela do provedor: GPT-5 Codex a US$ 1,25 / US$ 10 por milhão de tokens (leitura de cache US$ 0,125); GPT-5.6 Sol a US$ 5 / US$ 30 (leitura de cache US$ 0,50). Isso equivale a quatro vezes o preço de entrada e três vezes o preço de saída. Em um dia típico de codificação, com dez milhões de tokens e uma divisão de 75/25 entre entrada e saída, o GPT-5 Codex cobra cerca de US$ 34; o GPT-5.6 Sol cobra cerca de US$ 112. A diferença não é teórica.
Duas coisas reduzem isso. Primeiro, o cache: ambos os modelos precificam a entrada em cache muito abaixo da entrada nova, e os loops de agente releem constantemente o mesmo contexto do repositório, então uma grande parcela dos tokens pode usar a camada barata. Segundo, eficiência: a OpenAI afirma que a geração 5.6 conclui tarefas de agente com aproximadamente 54% menos tokens de saída do que a geração anterior. Se a Sol precisa de apenas metade dos tokens de saída para a mesma tarefa, a diferença por tarefa diminui de cerca de 3,3x para cerca de 2x — uma economia real, mas que não elimina uma diferença de 4x no preço de entrada, e uma alegação de eficiência que é relatada pela OpenAI, não medida de forma independente.
A Sol também possui um preço de entrada em camadas: na página do modelo do OrcaRouter, sua base de US$ 5 / US$ 30 se aplica a solicitações de até 32 mil tokens de entrada, e solicitações maiores são cobradas na camada superior de US$ 10 / US$ 45. Esse é o imposto de contexto longo — exatamente as solicitações que um agente de repositório grande faz. Portanto, a comparação prática de preços depende ainda mais da carga de trabalho do que os 3-4x do título sugerem.

Contexto e como você os chama
A lacuna de contexto é o segundo divisor real. 400 mil tokens cobrem uma base de código substancial, e o Codex, sendo um especialista, foi construído para ser eficiente dentro dessa janela. Mas um contexto Sol de 1,05 milhão de tokens muda o que você pode entregar a um modelo: um monorepo inteiro, rastros longos de agente, um wiki de integração além do código. Para equipes que fornecem repositórios inteiros em uma única solicitação, a janela maior é a diferença entre "o modelo pode ver os arquivos relevantes" e "o modelo pode ver os arquivos relevantes mais tudo o que os importa." É também a diferença entre um token de entrada de US$ 1,25 e um de US$ 5, razão pela qual a decisão de contexto é uma decisão de custo.
Ambos os modelos utilizam os mesmos dois formatos de API — OpenAI Chat Completions e a Responses API — e ambos suportam chamadas de ferramentas/funções e saídas estruturadas. No OrcaRouter, ambos estão atrás de um único endpoint compatível com OpenAI, então alternar entre eles é uma mudança de nome do modelo, não uma mudança de integração.
Onde os benchmarks divergem — e a nota de honestidade
O número interessante é que os dois modelos quase não compartilham nenhum benchmark. O GPT-5 Codex tem pontuações genuinamente independentes: a Artificial Analysis o mede com um Índice de Inteligência de 36.1 e um índice de Codificação de 38.9, com um Índice de Matemática de 98.7, LiveCodeBench em 84.0 e SWE-Bench Verified em 74.5 por cento. Os números de destaque do GPT-5.6 Sol — Terminal-Bench 2.1 em 88.8, um Índice de Agente de Codificação da Artificial Analysis de 80 em raciocínio máximo, Agents' Last Exam em 53.6 — são os que a OpenAI publicou no lançamento e não foram reproduzidos por um avaliador independente. "88.8 versus 84.0" não é uma luta justa, porque um desses números é auditado e o outro é a alegação do fornecedor. O resumo honesto: Sol é uma geração mais nova e seu teto é claramente mais alto, mas a única pontuação de codificação que qualquer um dos modelos possui e que foi verificada por um laboratório independente pertence ao especialista mais barato e mais antigo.

Há também um benchmark que a própria OpenAI contesta. No SWE-Bench Pro, o GPT-5.6 Sol pontua 64,6 por cento, enquanto o Claude Fable 5 lidera com 80 — e a OpenAI questionou publicamente a validade do benchmark. Nesse caso, o sinal interessante não é a pontuação, mas o fato de que uma fornecedora de destaque agora argumenta que sua própria nota baixa é culpa do benchmark. Para um time de codificação, isso é um lembrete para testar o modelo no seu próprio repositório antes de confiar em qualquer placar, incluindo o nosso.
Velocidade: a ressalva do tráfego
Na telemetria de sete dias do OrcaRouter, o GPT-5.6 Sol mostra uma mediana de tempo até o primeiro token de 3,82 segundos e cerca de 465 tokens de saída por segundo, em 39 milhões de tokens de tráfego. A página do GPT-5 Codex ainda está "coletando" telemetria — seu tráfego pelo roteador é fino demais para que haja algo a calcular como média. Esse tráfego fino é, por si só, uma informação: aos olhos do mercado, o trabalho com a API de agente de codificação já migrou para modelos mais novos. Isso não significa que o GPT-5 Codex seja lento ou esteja quebrado; significa que "qual é o mais rápido" não pode ser respondido com os dados do roteador até que alguém passe um volume real de tráfego por ele.
Qual você deve escolher?
Escolha GPT-5 Codex se…
Sua carga de trabalho é genuinamente moldada para codificação: você executa um agente que edita código, revisa pull requests, refatora, escreve testes e trabalha dentro de um ambiente de IDE ou CLI. Você quer o foco do especialista, o custo quatro vezes menor e a única pontuação de codificação verificada de forma independente neste confronto. O GPT-5 Codex também é a escolha certa se você quiser a semântica de codificador agêntico da OpenAI — o controle de esforço de raciocínio, o ciclo de uso de ferramentas — sem pagar preços de carro-chefe por uma capacidade geral que você não usará.
Escolha GPT-5.6 Sol se…
Seu trabalho mistura codificação com raciocínio geral difícil, agentes de longo horizonte, uso de computador ou entrada com muitos arquivos — ou você simplesmente quer um carro-chefe para tudo. O contexto de 1.05M, o modo ultra multiagente, o treinamento mais recente e a integração de produtos ChatGPT e Codex favorecem a Sol. Seus números de codificação são mais altos no papel, e em um benchmark em que o fornecedor acredita, é o melhor agente de codificação que a OpenAI já lançou. Você está pagando de três a quatro vezes mais por token por essa amplitude; a eficiência de tokens reduz a diferença em tarefas que a Sol realmente vence.
A resposta é muitas vezes ambas — roteie conforme a tarefa.
Como ambos estão ativos no OrcaRouter com margem de 0%, a configuração mais forte nem chega a ser uma escolha. Direcione o volume voltado para codificação ao GPT-5 Codex — o especialista de $1,25 / $10 — e escale apenas as tarefas que precisam da abrangência de um carro-chefe para o GPT-5.6 Sol a $5 / $30. Uma chave de API, um endpoint compatível com OpenAI, uma mudança de nome do modelo no roteamento e failover automático se um provedor tiver uma hora ruim. O repasse é importante de uma forma específica aqui: os $1,25 / $10 e $5 / $30 que você orçou são os preços de tabela dos provedores, então um futuro corte de preço da OpenAI entra no ar no nosso endpoint no mesmo dia em que é anunciado, e sua lógica de roteamento não precisa mudar.

Perguntas que isso levanta
O GPT-5.6 Sol substituiu o GPT-5 Codex?
No produto, sim — o aplicativo independente Codex foi incorporado ao ChatGPT no lançamento da versão 5.6, e o Sol é o mecanismo que executa o modo de agente de codificação lá. Na API, não: o GPT-5 Codex ainda é um modelo ativo e servido, com preço próprio, e muitos pipelines de agentes ainda o utilizam por ser construído para esse fim e barato.
A programação do Sol é realmente melhor que a do Codex?
Nos números que a OpenAI publicou, sim — Terminal-Bench 2.1 em 88.8 contra o LiveCodeBench do Codex em 84.0 — mas esses são benchmarks diferentes, e os números da Sol são reportados pelo fornecedor enquanto os do Codex são medidos de forma independente. Teste no seu próprio repositório; essa é a única pontuação que conta.
Por que alguém ainda rodaria o GPT-5 Codex?
Preço e adequação. A um quarto do preço de entrada do Sol, um pipeline dedicado a agente de codificação que nunca precisa da abrangência do carro-chefe geral economiza dinheiro real por milhão de tokens, e o foco do especialista significa menos ajuste de prompt para mantê-lo no trabalho de codificação.
A razão pela qual vale a pena pensar nesse confronto é que a OpenAI incorporou a resposta ao próprio produto. A empresa passou um ano vendendo um especialista em codificação e depois o absorveu em um carro-chefe generalista que codifica bem o suficiente para reivindicar a coroa do especialista — enquanto deixava o especialista na API por uma fração do preço. Isso não é um truque; é o piso de preço para "queremos o agente de codificação sem pagar pelo carro-chefe". O GPT-5 Codex é o especialista barato, focado e medido de forma independente. O GPT-5.6 Sol é o carro-chefe mais novo, mais amplo e mais caro, cujas alegações de codificação você deve verificar no seu próprio trabalho. A maioria das equipes de produção descobrirá que a resposta honesta é ambos — e com ambos em um único endpoint de passagem, o roteamento entre eles é uma configuração, não uma migração.
Comparados neste artigo2
Detectado a partir deste artigo · Benchmarks: Artificial Analysis · atualizado diariamente
