
GPT-6.1 Sol vs GPT-5.6 Sol: Quatro e Meio Pontos de Índice, Metade da Conta, Duas Regressões
- openaiNOVOOpenAI: GPT-6.1 Sol2026-09-2952Inteligência
- anthropicNOVOAnthropic: Claude Sonnet 5.52026-09-2856Inteligência
- typesafeNOVOTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 por 1M de tokens · 161 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238Inteligência
- OpenAIOpenAI: GPT-6 Sol2026-09-2248Inteligência
- AnthropicAnthropic: Claude Opus 5.52026-09-2258Inteligência
- xAIGrok 4.72026-09-2146Inteligência
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 por 1M de tokens · 79 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 por 1M de tokens · 320 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligência
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Inteligência77Código
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Inteligência76Código
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Inteligência76Código
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Inteligência82Código
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 por 1M de tokens · 53 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 por 1M de tokens · 301 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligência72Código
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 por 1M de tokens · 232 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Inteligência75Código
- obsidianQwen3.8 27B2026-08-1534Inteligência68Código
A OpenAI lançou GPT-6.1 Sol em 29 de setembro de 2026, onze semanas após GPT-5.6 Sol, que foi lançado em 9 de julho de 2026 como o carro-chefe da geração anterior. Ambos ainda estão à venda, ambos ainda podem ser invocados, e a diferença entre eles no ranking neutro é de 4,8 pontos — 51,8 contra 47,0 no Intelligence Index da Artificial Analysis, ambos medidos com esforço máximo de raciocínio no mesmo conjunto de dez avaliações. A diferença de preço é muito maior que a diferença de pontuação: US$ 0,72 por tarefa de índice concluída contra US$ 1,99, e US$ 2,00/US$ 10,00 por milhão de tokens contra US$ 4,00/US$ 20,00. Essa é a versão curta. A versão longa é que a atualização não é uniforme, e duas das avaliações regrediram.
O que cada modelo é, e o que substituiu o quê
O GPT-5.6 Sol era o topo da linha 5.6 — um modelo fechado, exclusivo para API, com uma janela de contexto de 1.050.000 tokens, um teto de saída de 128.000 tokens, entrada de texto, imagem e arquivo, e uma escala de raciocínio que ia de none até max. Era descrito pela OpenAI como o nível criado para o trabalho mais difícil: fluxos de trabalho agênticos de longo horizonte, engenharia de software com múltiplos arquivos, raciocínio profundo — e seu preço era condizente: US$ 4,00 e US$ 20,00 por milhão de tokens, com entrada em cache a US$ 0,40 e gravações de cache a US$ 5,00. Acima de 272.000 tokens de entrada, passava a custar US$ 8,00 e US$ 30,00, e contava com um nível Batch a US$ 2,50 e US$ 15,00.
GPT-6.1 Sol é o nível intermediário da geração que veio depois: abaixo do GPT-6 Astra, acima do GPT-6 Luna e, agora, o modelo para o qual a OpenAI direciona desenvolvedores sensíveis a custos. Ele mantém a janela de 1.050.000 tokens e o limite de saída de 128.000 tokens, estende a data de corte de conhecimento de 20 de abril para 30 de abril de 2026 e reduz a escala de esforço de seis níveis para cinco — baixo, médio (padrão), alto, xalto, máx. O valor nenhum que o GPT-5.6 Sol aceitava agora retorna um erro, e a orientação de migração da OpenAI é explícita de que a substituição é baixo, não uma atualização silenciosa.
Vale a pena parar um momento nisto, porque é a única mudança do lançamento que custa dinheiro em vez de o poupar. Um pipeline que recorria a none para obter uma chamada barata, rápida e sem raciocínio já não tem essa configuração, em nenhuma das famílias de modelos. O degrau mais barato do GPT-6.1 Sol é um degrau de raciocínio, e os tokens de raciocínio são cobrados como tokens de saída, quer consiga vê-los ou não.
A escada, degrau por degrau
O painel independente publica uma pontuação e um custo de execução para cada configuração de esforço em ambos os modelos, o que transforma o confronto direto em algo mais útil do que uma única comparação. Alinhados em configurações equivalentes:
• Escala de esforço, GPT-6.1 Sol — máx. 51,8 a $0,72 por tarefa de índice; xhigh 51,0 a $0,39; alto 50,2 a $0,32; médio (o padrão) 47,8 a $0,21 • Velocidade de saída — 59,7 tokens por segundo para o GPT-6.1 Sol vs 87,8 para o GPT-5.6 Sol
• Tempo até o primeiro chunk — 332 segundos para o GPT-6.1 Sol vs um valor mais rápido para o GPT-5.6 Sol, contra uma mediana do ranking próxima de 4 segundos
• Tokens de saída na execução do índice — 67,2 milhões para o GPT-6.1 Sol vs 90,0 milhões para o GPT-5.6 Sol
• Preço de entrada / saída — $2,00 / $10,00 vs $4,00 / $20,00
• Entrada em cache — $0,10 vs $0,40; gravações em cache $2,50 vs $5,00
• Tarifa de lote — não publicada para o GPT-6.1 Sol vs $2,50 / $15,00 para o GPT-5.6 Sol
• Etapa de contexto longo — acima de 272.000 tokens de entrada, o GPT-6.1 Sol passa a custar $4,00 / $15,00 pela solicitação inteira vs $8,00 / $30,00 do GPT-5.6 Sol
• Nível mínimo de esforço — baixo vs nenhum
Duas coisas decorrem dessa lista. A primeira é que o corte de preço é estrutural, e não promocional: a tarifa padrão do GPT-6.1 Sol, de US$ 2,00 e US$ 10,00, é inferior à tarifa de lote do GPT-5.6 Sol, de US$ 2,50 e US$ 15,00, de modo que até o nível com desconto do modelo antigo é mais caro que o preço de tabela do modelo novo. A segunda é que a atualização não é uma linha reta em termos de latência. O GPT-6.1 Sol gera saída cerca de um terço mais devagar e levou 332 segundos até o primeiro chunk nos testes de prompt longo do board — a mesma ordem de magnitude dos 107 segundos do GPT-6 Sol e cerca de oitenta vezes a mediana do board. Se você criou um produto interativo com o GPT-5.6 Sol, isso é uma regressão funcional independente de qualquer benchmark, e a correção é arquitetural, não um parâmetro.

Duas avaliações seguiram o caminho errado
O ganho composto é de 4,8 pontos. Os componentes não são uniformemente positivos, e as pontuações por avaliação do conselho confirmam isso:
• SciCode — GPT-6.1 Sol 0,542 vs GPT-5.6 Sol 0,571. Uma regressão de 2,9 pontos em codificação científica.
• GDPval-AA v2.1 — GPT-6.1 Sol Elo 1575,1 vs GPT-5.6 Sol Elo 1611,3. Uma regressão de 36 pontos no Elo em trabalho de conhecimento economicamente valioso.
• Humanity's Last Exam — GPT-6.1 Sol 0,529 vs GPT-5.6 Sol 0,495. Um ganho de 3,4 pontos.
• Terminal-Bench 4.0 — GPT-6.1 Sol 0,561 vs GPT-5.6 Sol 0,399. Um ganho de 16 pontos, o maior movimento único do pareamento.
• AA-Omniscience — GPT-6.1 Sol 41,5 vs GPT-5.6 Sol 22,0, que se refere à confiabilidade do conhecimento e à alucinação, em vez de recall bruto.
• AA-Briefcase v1.1, AutomationBench-AA, AA-LCR v1.1, GDP.pdf, CritPt — os cinco restantes, que completam o composto e são onde o restante do ganho de 4,8 pontos é obtido.
Um modelo que é significativamente melhor em trabalho em terminal, substancialmente melhor em confiabilidade factual e mensuravelmente pior em programação científica e no Elo de trabalho profissional não é um modelo estritamente melhor. É um ponto diferente na fronteira, e foi colocado ali deliberadamente: o próprio posicionamento de lançamento da OpenAI para o GPT-6.1 Sol é custo por tarefa concluída com qualidade quase de ponta, não pontuação máxima. Se a sua carga de trabalho for do tipo SciCode ou do tipo GDPval, a métrica composta não é a que se aplica a você, e a regressão é.
GPT-5.6 Sol ainda tem o resultado publicado de contexto longo
O único ponto em que o modelo mais antigo tem um número que o mais novo não tem é a precisão de recuperação na faixa de contexto em que a tabela de preços do GPT-6.1 Sol muda. O GPT-5.6 Sol traz um resultado publicado de 91,5% no MRCR v2 de oito agulhas na faixa de 256.000 a 512.000 tokens. O GPT-6.1 Sol não tem equivalente publicado e, acima de 272.000 tokens de entrada, toda a sua solicitação é reprecificada em 2× para entrada e cache, e 1,5× para saída.
Junte esses dois fatos e o segmento em que a economia do novo modelo é mais fraca é exatamente o segmento em que o modelo antigo tem a única força documentada. As economias não desaparecem — $4,00 e $15,00 no nível com preço reajustado, em comparação com $8,00 e $30,00 no próprio nível de contexto longo do GPT-5.6 Sol, ainda é uma redução pela metade —, mas a história do preço pela metade é uma história de carga de trabalho geral, e um pipeline de recuperação de contexto longo não é isso. Se essa é a sua carga de trabalho, o GPT-5.6 Sol a $4,00 e $20,00 com 91,5% publicados é um lugar defensável para permanecer.
Os outros resultados publicados do GPT-5.6 Sol permanecem intactos e são a razão pela qual algumas equipes não vão migrar: BrowseComp 90,4 para agentes de pesquisa na web, Terminal-Bench 2.1 em 88,8 e 88,0, SWE-Bench Pro 64,6, Agents' Last Exam 53,6, OSWorld 2.0 em 62,6. Esses são divulgados pela OpenAI, no harness da OpenAI, e foram reportados em julho. O que mudou desde então é que o painel de avaliação agora pontua os dois modelos em uma única suíte, com um único conjunto de configurações, e o modelo mais antigo perde no resultado composto e no custo.
A migração em si é uma mudança de string, com uma exceção
Mesmo fornecedor, mesma superfície de API, adjacentes no ranking, mesma janela e mesmo limite de saída — então, para a maioria das stacks, isto é um identificador de modelo e um preço que cai pela metade. As exceções são específicas e vale a pena nomeá-las antes de você virar a chave.
Se o seu código definir reasoning.effort como none ou minimal, ele falhará em vez de degradar, e low é o substituto documentado. Se o seu tráfego ultrapassar 272.000 tokens de entrada, verifique o nível com preço reajustado antes de modelar a economia. Se o seu produto depende do tempo até o primeiro token, meça antes de lançar, porque o número de 332 segundos do painel não é um erro de arredondamento. E se as suas avaliações tiverem uma fração no formato do SciCode ou do GDPval, execute essa fração nos dois modelos em vez de confiar no composto.
Ambos os modelos estão no OrcaRouter pelos próprios preços de tabela da OpenAI — o GPT-6.1 Sol a US$ 2,00 e US$ 10,00, com entrada em cache a US$ 0,10, e o GPT-5.6 Sol a US$ 4,00 e US$ 20,00, com entrada em cache a US$ 0,40 — sob um modelo de repasse que faz com que uma mudança de preço da OpenAI chegue ao nosso lado no mesmo dia em que entra em vigor, e não depois que um revendedor renegocia. Como a tabela de preços é repassada sem alteração, e não com margem acrescentada, a aritmética neste artigo é a aritmética que você obtém: o mesmo modelo de US$ 0,72 por tarefa, a mesma redução pela metade, sem nenhum prêmio de plataforma sobreposto a qualquer dos lados.

O uso prático de ter ambos atrás de um único endpoint é que a comparação permanece ativa. Envie o novo tráfego para o GPT-6.1 Sol, mantenha o GPT-5.6 Sol a uma alteração de configuração de distância como fallback e como caminho de contexto longo, e deixe o failover automático cobrir a janela em que a disponibilidade de um flagship de dois meses e a habilitação para Enterprise ainda estão se estabilizando. Uma migração que reduz a fatura pela metade e faz dois sub-benchmarks recuarem não é uma decisão para tomar uma vez e esquecer; é uma decisão a ser tomada por rota, e uma camada de roteamento é o que torna isso barato.

Onde cada um pertence
• Trabalho agêntico e de terminal em geral — GPT-6.1 Sol. Dezesseis pontos no Terminal-Bench 4.0 e metade do preço não é uma decisão difícil.
• Confiabilidade factual, produtos de respostas recuperadas — GPT-6.1 Sol, em uma diferença de quase vinte pontos no AA-Omniscience.
• Codificação científica — verifique suas próprias avaliações primeiro. O placar mostra uma regressão de 2,9 pontos, e o composto não vai revelar isso.
• Trabalho do conhecimento economicamente valioso — mesma cautela. A regressão de Elo do GDPval-AA é de 36 pontos.
• Recuperação de contexto longo acima de 272.000 tokens — GPT-5.6 Sol, até que o GPT-6.1 Sol tenha um número publicado nessa faixa.
• Superfícies interativas e sensíveis à latência — meça antes de migrar. Saída mais rápida, primeiro token muito mais lento.
• Chamada sem raciocínio mais barata — nenhuma delas. Essa configuração não existe mais nesta família.
Comparados neste artigo1
Detectado a partir deste artigo · Benchmarks: Artificial Analysis · atualizado diariamente
