
GPT-6.1 Sol vs GLM-5.3: Os pesos foram lançados, e a conta não mudou
- openaiNOVOOpenAI: GPT-6.1 Sol2026-09-2952Inteligência
- anthropicNOVOAnthropic: Claude Sonnet 5.52026-09-2856Inteligência
- typesafeNOVOTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 por 1M de tokens · 161 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238Inteligência
- OpenAIOpenAI: GPT-6 Sol2026-09-2248Inteligência
- AnthropicAnthropic: Claude Opus 5.52026-09-2258Inteligência
- xAIGrok 4.72026-09-2146Inteligência
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 por 1M de tokens · 79 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 por 1M de tokens · 320 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligência
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Inteligência77Código
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Inteligência76Código
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Inteligência76Código
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Inteligência82Código
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 por 1M de tokens · 53 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 por 1M de tokens · 301 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligência72Código
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 por 1M de tokens · 232 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Inteligência75Código
- obsidianQwen3.8 27B2026-08-1534Inteligência68Código
A OpenAI lançou GPT-6.1 Sol em 29 de setembro de 2026 em sua apresentação principal do DevDay, e a Z.ai lançou GLM-5.3 seis semanas antes, em 18 de agosto de 2026, e depois manteve o checkpoint retido por uma semana. Esse período de retenção acabou: zai-org/GLM-5.3 está no Hugging Face desde 25 de agosto, um checkpoint BF16/FP8 com aproximadamente 753 bilhões de parâmetros, dos quais cerca de 40 bilhões estão ativos por token, e desde então ultrapassou 1,4 milhão de downloads. Então a pergunta que a maioria das comparações vem fazendo desde agosto — este é um modelo aberto ou um aluguel? — tem uma resposta, e a resposta não mudou a aritmética. No ranking independente, GPT-6.1 Sol obtém 51,8 e custa US$ 0,72 por tarefa de índice concluída; GLM-5.3 obtém 44,8 e custa US$ 2,01. Agora você pode possuir o modelo mais barato por token e ainda pagar quase três vezes mais por trabalho concluído.
O que cada modelo realmente é
GPT-6.1 Sol é o modelo GPT-6 de nível intermediário da OpenAI, um degrau abaixo do carro-chefe GPT-6 Astra e acima do GPT-6 Luna, da linha econômica. Ele possui uma janela de contexto de 1.050.000 tokens com um teto de saída de 128.000 tokens e uma data de corte de conhecimento em 30 de abril de 2026, e aceita texto, imagens e arquivos como entrada. O raciocínio vai de baixo a máximo com padrão médio; os nenhum e mínimo valores que o GPT-6 Sol aceitava agora retornam um erro, o que a própria orientação de migração da OpenAI aborda ao instruir os desenvolvedores a substituir por baixo. Ele custa US$ 2,00 por milhão de tokens de entrada e US$ 10,00 por milhão de saída, com entrada em cache a US$ 0,10.
O GLM-5.3 é o atual carro-chefe da Z.ai para engenharia de software e trabalho agêntico de longo horizonte, construído sobre a mesma base de mistura de especialistas do GLM-5.2, com os ganhos vindos do pós-treinamento, e não de um modelo maior. É entrada de texto, saída de texto — sem visão, a qualquer preço — com uma janela de 1M tokens, um limite de saída de 128.000 tokens e raciocínio permanentemente ativado. Não há modo sem raciocínio, o que é uma restrição rígida para uma chamada sensível à latência. A Z.ai o lista a US$ 1,40 de entrada e US$ 4,40 de saída por milhão de tokens, com entrada em cache a US$ 0,26; nosso próprio catálogo o oferece a US$ 1,26 e US$ 3,96, com leitura de cache a US$ 0,234, portanto a tabela do fornecedor é o número mais conservador e aquele a partir do qual se deve argumentar.
A tabela de tarifas, e a linha que a inverte
Uma linha por dimensão, ambos os lados em cada:
• Entrada — GPT-6.1 Sol US$ 2,00 por 1M vs GLM-5.3 US$ 1,40 por 1M; GLM é 30% mais barato
• Saída — GPT-6.1 Sol US$ 10,00 por 1M vs GLM-5.3 US$ 4,40 por 1M; GLM é 56% mais barato
• Entrada em cache — GPT-6.1 Sol US$ 0,10 por 1M vs GLM-5.3 US$ 0,26 por 1M; a ordem se inverte, Sol é 2,6× mais barato
• Cláusula de contexto longo — GPT-6.1 Sol reprecifica toda a requisição acima de 272.000 tokens de entrada a 2× de entrada e cache e 1,5× de saída vs GLM-5.3 sem cláusula equivalente na tabela publicada
• Contexto e saída — 1.050.000 de entrada / 128.000 de saída vs 1M de entrada / 128.000 de saída; uma diferença de 5%, irrelevante
• Modalidade — texto, imagem e arquivo de entrada, texto de saída vs somente texto
• Piso de raciocínio — GPT-6.1 Sol baixo, médio (padrão), alto, xhigh, máximo vs GLM-5.3 sempre ativo, sem piso para reduzir
• Pesos — fechados, somente API vs abertos, disponíveis para download, FP8
• Pontuação independente, Artificial Analysis v4.3.2 no esforço máximo — 51,8 vs 44,8
• Custo independente por tarefa do índice — US$ 0,72 vs US$ 2,01
• Tokens de saída para a execução do índice — 67 milhões vs 210 milhões
img src="2.png" alt="Um placar comparativo de duas colunas gerado, intitulado 'GPT-6.1 Sol vs GLM-5.3 - o placar'. Coluna da esquerda, 'GPT-6.1 Sol': linhas com 'Índice de Inteligência: 51.8', 'Custo por tarefa do índice: $0.72', 'Preço de entrada: $2.00 por 1M', 'Preço de saída: $10.00 por 1M', 'Tokens de saída na execução do índice: 67M', 'Pesos: fechados'. Coluna da direita, 'GLM-5.3': linhas com 'Índice de Inteligência: 44.8', 'Custo por tarefa do índice: $2.01', 'Preço de entrada: $1.40 por 1M', 'Preço de saída: $4.40 por 1M', 'Tokens de saída na execução do índice: 210M', 'Pesos: abertos no Hugging Face'. Um rodapé diz 'Números independentes conforme Artificial Analysis v4.3.2 em esforço máximo; preços de tabela dos fornecedores.' O logotipo da OrcaRouter fica no canto inferior direito." /> É nesse último par que este confronto se decide, e o efeito não é nada sutil.

O problema dos 210 milhões de tokens
Artificial Analysis executa a mesma suíte de dez avaliações em cada modelo do quadro e publica as contagens de tokens por trás de cada pontuação. O GLM-5.3 gerou aproximadamente 210 milhões de tokens de saída ao completar a execução. O GPT-6.1 Sol gerou 67 milhões. Comparado com a própria classe de comparação de cada modelo no quadro, os 210 milhões do GLM-5.3 ficam acima de uma mediana de classe de cerca de 140 milhões, enquanto os 67 milhões do Sol ficam bem abaixo da mediana de aproximadamente 81 milhões da classe principal em que ele é avaliado. Como a saída é o lado caro de toda tabela de preços, o desconto anunciado de 56% do GLM-5.3 na linha de saída não resiste ao contato com a medição: ele emite 3,1× os tokens a 0,44× o preço, e 3,1 × 0,44 é 1,37 — o GLM-5.3 é o modelo mais caro nesta carga de trabalho, apesar de uma tabela de preços materialmente mais barata.
A própria cifra de custo por tarefa do conselho confirma a direção e a ordem de grandeza. $2.01 contra $0.72 dá 2,8×, uma diferença maior do que a proporção de tokens por si só sugere, porque o GLM-5.3 também gasta mais nas linhas de entrada e de cache por tarefa. Vale a pena ser preciso quanto ao que isto prova e ao que não prova: a execução do índice é composta por dez avaliações fixas, e a verbosidade nelas não é a mesma que a verbosidade no seu tráfego. Mas, para um comprador, são os tokens que são faturados, e a forma da diferença é a mesma em qualquer conjunto de tarefas em que o modelo tenha de produzir uma resposta longa.
A compensação parcial é a linha de entrada em cache. A leitura de cache do GLM-5.3 é $0.26 contra uma base de $1.40, e a do GPT-6.1 Sol é $0.10 contra uma base de $2.00 — Sol vence por um fator de 2.6 numa taxa que domina qualquer carga de trabalho com um prefixo estável. Se o seu tráfego for um grande corpus fixo com uma resposta de um parágrafo, o GLM-5.3 é claramente a opção mais barata e você deve escolhê-lo. Se o seu tráfego se parecer com o tráfego para o qual ambos esses modelos foram construídos — loops de agentes, edições em escala de repositório, longas saídas geradas — a vantagem da entrada em cache encolhe para ruído ao lado de uma proporção de tokens de 3×.
Onde os números do fornecedor chegam
Os números de lançamento da Z.ai são fortes e, como sempre, não reproduzidos. Terminal-Bench 2.1 em 88,2, DeepSWE v1.1 em 66,9, CyberGym em 84,5, ExploitBench em 54,4, AutomationBench em 48,2, GDPval-AA v2 com 1769 Elo. O único número que vale a pena ler duas vezes é o Terminal-Bench 3.0 em 28,3 — o benchmark sucessor, e a correção para o 88,2 no mais antigo. Um modelo pode ser excelente no benchmark que seu pós-treinamento teve como alvo e medíocre na próxima geração do mesmo benchmark.
OpenAI's launch numbers for GPT-6.1 Sol are framed entirely around cost per completed task rather than raw score: DeepSWE v1.1 beating GPT-6 Sol's best by 6.4 percentage points at a lower reasoning effort, AutomationBench 1.0.6 at 2.2 points above Claude Opus 5.5 at medium effort, OSWorld 2.0 up seven points on GPT-6 Sol at maximum effort, Terminal-Bench Science 0.1 more than doubling GPT-6 Sol at less than half the cost per task. Note that these are OpenAI's harness at OpenAI's settings on OpenAI's selected benchmark set, and that none of them has been reproduced independently.
A sobreposição entre os conjuntos publicados pelos dois fornecedores é pequena, e a única comparação direta disponível é no mesmo benchmark: a Z.ai relata 66,9 no DeepSWE v1.1, a OpenAI relata 68,8 para o GPT-6 Sol — o modelo que o 6.1 substitui — e uma melhoria de 6,4 pontos para o 6.1 Sol em relação ao seu próprio antecessor. Dois pontos de diferença na comparação relatada pelos fornecedores, e cerca de seis de diferença no próprio delta da OpenAI. Isso chega perto de uma comparação controlada, e diz o que o conselho independente diz: quase paridade em capacidade, uma grande lacuna no que custa concluir o trabalho.
Uma API, ou dois contratos
Os dois modelos estão no OrcaRouter, que é a parte incomum deste par. O GPT-6.1 Sol entrou no catálogo ao preço de tabela da própria OpenAI no dia do lançamento — $2,00 e $10,00 por milhão de tokens, entrada em cache $0,10, com o passo de 272.000 tokens para $4,00 e $15,00 repassado exatamente como o fornecedor o lista — e o GLM-5.3 fica ao lado dele a $1,26 e $3,96 com uma leitura de cache de $0,234. Nada é acrescentado sobre nenhum dos dois: a plataforma repassa o preço de tabela do fornecedor sem alterações, e é por isso que um corte de preço do fornecedor aparece do nosso lado no mesmo dia, em vez de depois que um revendedor renegocia.

Isso importa mais para este par específico do que para a maioria. A decisão entre eles não é “qual é melhor” — é um limite no comprimento da sua própria saída, e ele vai mudar na primeira vez que a Z.ai ajustar sua tabela de preços ou a OpenAI alterar o limite do tier 6.1. Manter os dois atrás de uma única chave, com failover automático entre eles e uma regra de roteamento que você altera na configuração em vez de em uma implantação, é o que permite testar esse limite com tráfego real em vez de discutir sobre ele. Se a linha de cache do Sol vencer para sua carga de trabalho, roteie por ela; se o comprimento das suas respostas continuar curto e a tabela fixa do GLM-5.3, sem penhasco de contexto, vencer o segmento, roteie por essa em vez disso — a mesma chave, sem segundo contrato, sem segunda fatura.

Qual deles, se você tiver que escolher hoje?
• Saídas longas geradas, loops de agentes, trabalho com muitas saídas — GPT-6.1 Sol, e a margem chega perto de três vezes quando a contagem de tokens é aplicada. É aqui que a tabela de preços mente, e a medição não.
• Prefixo estável, resposta curta — GLM-5.3. As suas tarifas de entrada em cache e de entrada são genuinamente melhores, e a verbosidade nunca tem chance de atrapalhar.
• Qualquer requisição acima de 272.000 tokens de entrada — GLM-5.3, porque o GPT-6.1 Sol reprecifica a requisição inteira nesse limite, e a tabela do GLM-5.3 não tem degrau equivalente.
• Qualquer coisa com uma imagem ou um documento como entrada visual — GPT-6.1 Sol. O GLM-5.3 é somente texto, e isso não chega nem perto.
• Inferência dentro do seu próprio limite, ou uma proteção contra a mudança nos termos de um fornecedor — GLM-5.3, e agora o download em vez de uma promessa. Reserve orçamento para o hardware: o checkpoint é um artefato FP8 grande, e a auto-hospedagem é uma decisão de capital, não de API.
• Chamadas sensíveis à latência — nenhum dos dois sem cuidado. O GLM-5.3 não tem como desligar o raciocínio; o GPT-6.1 Sol tem um piso no nível baixo, e o seu próprio tempo até o primeiro token no painel independente mediu 332 segundos, contra uma mediana do painel de 3,7.
Comparados neste artigo3
Detectado a partir deste artigo · Benchmarks: Artificial Analysis · atualizado diariamente
