Um cartão de destaque gerado para uma comparação entre o GPT-6.1 Sol e o GLM-5.3, com o título "Sete pontos de índice, 2,8 vezes o valor", com selos que dizem "GPT-6.1 Sol: US$ 0,72 por tarefa de índice", "GLM-5.3: US$ 2,01 por tarefa de índice" e "Pesos do GLM-5.3: disponíveis para download desde 25 de agosto de 2026", um rodapé que diz "Números independentes conforme o Artificial Analysis v4.3.2, esforço máximo; cartão gerado por IA", e o logotipo da OrcaRouter no canto inferior direito.
Guides & Insights

GPT-6.1 Sol vs GLM-5.3: Os pesos foram lançados, e a conta não mudou

Autor

Gideon Frost

Data de publicação

Modelos mais recentes · 20Ver todos os modelos →
Benchmarks: Artificial Analysis · atualizado diariamente
Voltar para todas as publicações

A OpenAI lançou GPT-6.1 Sol em 29 de setembro de 2026 em sua apresentação principal do DevDay, e a Z.ai lançou GLM-5.3 seis semanas antes, em 18 de agosto de 2026, e depois manteve o checkpoint retido por uma semana. Esse período de retenção acabou: zai-org/GLM-5.3 está no Hugging Face desde 25 de agosto, um checkpoint BF16/FP8 com aproximadamente 753 bilhões de parâmetros, dos quais cerca de 40 bilhões estão ativos por token, e desde então ultrapassou 1,4 milhão de downloads. Então a pergunta que a maioria das comparações vem fazendo desde agosto — este é um modelo aberto ou um aluguel? — tem uma resposta, e a resposta não mudou a aritmética. No ranking independente, GPT-6.1 Sol obtém 51,8 e custa US$ 0,72 por tarefa de índice concluída; GLM-5.3 obtém 44,8 e custa US$ 2,01. Agora você pode possuir o modelo mais barato por token e ainda pagar quase três vezes mais por trabalho concluído.

O que cada modelo realmente é

GPT-6.1 Sol é o modelo GPT-6 de nível intermediário da Open​AI, um degrau abaixo do carro-chefe GPT-6 Astra e acima do GPT-6 Luna, da linha econômica. Ele possui uma janela de contexto de 1.050.000 tokens com um teto de saída de 128.000 tokens e uma data de corte de conhecimento em 30 de abril de 2026, e aceita texto, imagens e arquivos como entrada. O raciocínio vai de baixo a máximo com padrão médio; os nenhum e mínimo valores que o GPT-6 Sol aceitava agora retornam um erro, o que a própria orientação de migração da Open​AI aborda ao instruir os desenvolvedores a substituir por baixo. Ele custa US$ 2,00 por milhão de tokens de entrada e US$ 10,00 por milhão de saída, com entrada em cache a US$ 0,10.

O GLM-5.3 é o atual carro-chefe da Z.ai para engenharia de software e trabalho agêntico de longo horizonte, construído sobre a mesma base de mistura de especialistas do GLM-5.2, com os ganhos vindos do pós-treinamento, e não de um modelo maior. É entrada de texto, saída de texto — sem visão, a qualquer preço — com uma janela de 1M tokens, um limite de saída de 128.000 tokens e raciocínio permanentemente ativado. Não há modo sem raciocínio, o que é uma restrição rígida para uma chamada sensível à latência. A Z.ai o lista a US$ 1,40 de entrada e US$ 4,40 de saída por milhão de tokens, com entrada em cache a US$ 0,26; nosso próprio catálogo o oferece a US$ 1,26 e US$ 3,96, com leitura de cache a US$ 0,234, portanto a tabela do fornecedor é o número mais conservador e aquele a partir do qual se deve argumentar.

A tabela de tarifas, e a linha que a inverte

Uma linha por dimensão, ambos os lados em cada:

• Entrada — GPT-6.1 Sol US$ 2,00 por 1M vs GLM-5.3 US$ 1,40 por 1M; GLM é 30% mais barato
• Saída — GPT-6.1 Sol US$ 10,00 por 1M vs GLM-5.3 US$ 4,40 por 1M; GLM é 56% mais barato
• Entrada em cache — GPT-6.1 Sol US$ 0,10 por 1M vs GLM-5.3 US$ 0,26 por 1M; a ordem se inverte, Sol é 2,6× mais barato
• Cláusula de contexto longo — GPT-6.1 Sol reprecifica toda a requisição acima de 272.000 tokens de entrada a 2× de entrada e cache e 1,5× de saída vs GLM-5.3 sem cláusula equivalente na tabela publicada
• Contexto e saída — 1.050.000 de entrada / 128.000 de saída vs 1M de entrada / 128.000 de saída; uma diferença de 5%, irrelevante
• Modalidade — texto, imagem e arquivo de entrada, texto de saída vs somente texto
• Piso de raciocínio — GPT-6.1 Sol baixo, médio (padrão), alto, xhigh, máximo vs GLM-5.3 sempre ativo, sem piso para reduzir
• Pesos — fechados, somente API vs abertos, disponíveis para download, FP8
• Pontuação independente, Artificial Analysis v4.3.2 no esforço máximo — 51,8 vs 44,8
• Custo independente por tarefa do índice — US$ 0,72 vs US$ 2,01
• Tokens de saída para a execução do índice — 67 milhões vs 210 milhões

img src="2.png" alt="Um placar comparativo de duas colunas gerado, intitulado 'GPT-6.1 Sol vs GLM-5.3 - o placar'. Coluna da esquerda, 'GPT-6.1 Sol': linhas com 'Índice de Inteligência: 51.8', 'Custo por tarefa do índice: $0.72', 'Preço de entrada: $2.00 por 1M', 'Preço de saída: $10.00 por 1M', 'Tokens de saída na execução do índice: 67M', 'Pesos: fechados'. Coluna da direita, 'GLM-5.3': linhas com 'Índice de Inteligência: 44.8', 'Custo por tarefa do índice: $2.01', 'Preço de entrada: $1.40 por 1M', 'Preço de saída: $4.40 por 1M', 'Tokens de saída na execução do índice: 210M', 'Pesos: abertos no Hugging Face'. Um rodapé diz 'Números independentes conforme Artificial Analysis v4.3.2 em esforço máximo; preços de tabela dos fornecedores.' O logotipo da OrcaRouter fica no canto inferior direito." /> É nesse último par que este confronto se decide, e o efeito não é nada sutil.

A generated two-column comparison scoreboard titled 'GPT-6.1 Sol vs GLM-5.3 - the scoreboard'. Left column 'GPT-6.1 Sol': rows reading 'Intelligence Index: 51.8', 'Cost per index task: $0.72', 'Input price: $2.00 per 1M', 'Output price: $10.00 per 1M', 'Output tokens on index run: 67M', 'Weights: closed'. Right column 'GLM-5.3': rows reading 'Intelligence Index: 44.8', 'Cost per index task: $2.01', 'Input price: $1.40 per 1M', 'Output price: $4.40 per 1M', 'Output tokens on index run: 210M', 'Weights: open on Hugging Face'. A footer reads 'Independent figures per Artificial Analysis v4.3.2 at max effort; vendor list prices.' The OrcaRouter logo sits in the bottom-right corner.

O problema dos 210 milhões de tokens

Artificial Analysis executa a mesma suíte de dez avaliações em cada modelo do quadro e publica as contagens de tokens por trás de cada pontuação. O GLM-5.3 gerou aproximadamente 210 milhões de tokens de saída ao completar a execução. O GPT-6.1 Sol gerou 67 milhões. Comparado com a própria classe de comparação de cada modelo no quadro, os 210 milhões do GLM-5.3 ficam acima de uma mediana de classe de cerca de 140 milhões, enquanto os 67 milhões do Sol ficam bem abaixo da mediana de aproximadamente 81 milhões da classe principal em que ele é avaliado. Como a saída é o lado caro de toda tabela de preços, o desconto anunciado de 56% do GLM-5.3 na linha de saída não resiste ao contato com a medição: ele emite 3,1× os tokens a 0,44× o preço, e 3,1 × 0,44 é 1,37 — o GLM-5.3 é o modelo mais caro nesta carga de trabalho, apesar de uma tabela de preços materialmente mais barata.

A própria cifra de custo por tarefa do conselho confirma a direção e a ordem de grandeza. $2.01 contra $0.72 dá 2,8×, uma diferença maior do que a proporção de tokens por si só sugere, porque o GLM-5.3 também gasta mais nas linhas de entrada e de cache por tarefa. Vale a pena ser preciso quanto ao que isto prova e ao que não prova: a execução do índice é composta por dez avaliações fixas, e a verbosidade nelas não é a mesma que a verbosidade no seu tráfego. Mas, para um comprador, são os tokens que são faturados, e a forma da diferença é a mesma em qualquer conjunto de tarefas em que o modelo tenha de produzir uma resposta longa.

A compensação parcial é a linha de entrada em cache. A leitura de cache do GLM-5.3 é $0.26 contra uma base de $1.40, e a do GPT-6.1 Sol é $0.10 contra uma base de $2.00 — Sol vence por um fator de 2.6 numa taxa que domina qualquer carga de trabalho com um prefixo estável. Se o seu tráfego for um grande corpus fixo com uma resposta de um parágrafo, o GLM-5.3 é claramente a opção mais barata e você deve escolhê-lo. Se o seu tráfego se parecer com o tráfego para o qual ambos esses modelos foram construídos — loops de agentes, edições em escala de repositório, longas saídas geradas — a vantagem da entrada em cache encolhe para ruído ao lado de uma proporção de tokens de 3×.

Onde os números do fornecedor chegam

Os números de lançamento da Z.ai são fortes e, como sempre, não reproduzidos. Terminal-Bench 2.1 em 88,2, DeepSWE v1.1 em 66,9, CyberGym em 84,5, ExploitBench em 54,4, AutomationBench em 48,2, GDPval-AA v2 com 1769 Elo. O único número que vale a pena ler duas vezes é o Terminal-Bench 3.0 em 28,3 — o benchmark sucessor, e a correção para o 88,2 no mais antigo. Um modelo pode ser excelente no benchmark que seu pós-treinamento teve como alvo e medíocre na próxima geração do mesmo benchmark.

Open​AI's launch numbers for GPT-6.1 Sol are framed entirely around cost per completed task rather than raw score: DeepSWE v1.1 beating GPT-6 Sol's best by 6.4 percentage points at a lower reasoning effort, AutomationBench 1.0.6 at 2.2 points above Claude Opus 5.5 at medium effort, OSWorld 2.0 up seven points on GPT-6 Sol at maximum effort, Terminal-Bench Science 0.1 more than doubling GPT-6 Sol at less than half the cost per task. Note that these are Open​AI's harness at Open​AI's settings on Open​AI's selected benchmark set, and that none of them has been reproduced independently.

A sobreposição entre os conjuntos publicados pelos dois fornecedores é pequena, e a única comparação direta disponível é no mesmo benchmark: a Z.ai relata 66,9 no DeepSWE v1.1, a Open​AI relata 68,8 para o GPT-6 Sol — o modelo que o 6.1 substitui — e uma melhoria de 6,4 pontos para o 6.1 Sol em relação ao seu próprio antecessor. Dois pontos de diferença na comparação relatada pelos fornecedores, e cerca de seis de diferença no próprio delta da Open​AI. Isso chega perto de uma comparação controlada, e diz o que o conselho independente diz: quase paridade em capacidade, uma grande lacuna no que custa concluir o trabalho.

Uma API, ou dois contratos

Os dois modelos estão no OrcaRouter, que é a parte incomum deste par. O GPT-6.1 Sol entrou no catálogo ao preço de tabela da própria OpenAI no dia do lançamento — $2,00 e $10,00 por milhão de tokens, entrada em cache $0,10, com o passo de 272.000 tokens para $4,00 e $15,00 repassado exatamente como o fornecedor o lista — e o GLM-5.3 fica ao lado dele a $1,26 e $3,96 com uma leitura de cache de $0,234. Nada é acrescentado sobre nenhum dos dois: a plataforma repassa o preço de tabela do fornecedor sem alterações, e é por isso que um corte de preço do fornecedor aparece do nosso lado no mesmo dia, em vez de depois que um revendedor renegocia.

A screenshot of the OrcaRouter model page for z-ai/glm-5.3, showing the listing dated 2026-08-18, the model described as Z.ai (Zhipu AI)'s latest flagship for complex software engineering and long-horizon agentic tasks, a 1M-token context with 128K maximum output, text in and text out, and the pass-through list price of $1.26 input and $3.96 output per million tokens, with the page's own pricing tabs and a 4.00 s median time to first token visible.

Isso importa mais para este par específico do que para a maioria. A decisão entre eles não é “qual é melhor” — é um limite no comprimento da sua própria saída, e ele vai mudar na primeira vez que a Z.ai ajustar sua tabela de preços ou a OpenAI alterar o limite do tier 6.1. Manter os dois atrás de uma única chave, com failover automático entre eles e uma regra de roteamento que você altera na configuração em vez de em uma implantação, é o que permite testar esse limite com tráfego real em vez de discutir sobre ele. Se a linha de cache do Sol vencer para sua carga de trabalho, roteie por ela; se o comprimento das suas respostas continuar curto e a tabela fixa do GLM-5.3, sem penhasco de contexto, vencer o segmento, roteie por essa em vez disso — a mesma chave, sem segundo contrato, sem segunda fatura.

A screenshot of the OrcaRouter model page for openai/gpt-6.1-sol, showing the listing dated 2026-09-29, a 1M-token context with 128K maximum output, text, image and file input, a reasoning effort ladder running from low to max, and the pass-through list price of $2.00 input and $10.00 output per million tokens with cached input at $0.10.

Qual deles, se você tiver que escolher hoje?

• Saídas longas geradas, loops de agentes, trabalho com muitas saídas — GPT-6.1 Sol, e a margem chega perto de três vezes quando a contagem de tokens é aplicada. É aqui que a tabela de preços mente, e a medição não.
• Prefixo estável, resposta curta — GLM-5.3. As suas tarifas de entrada em cache e de entrada são genuinamente melhores, e a verbosidade nunca tem chance de atrapalhar.
• Qualquer requisição acima de 272.000 tokens de entrada — GLM-5.3, porque o GPT-6.1 Sol reprecifica a requisição inteira nesse limite, e a tabela do GLM-5.3 não tem degrau equivalente.
• Qualquer coisa com uma imagem ou um documento como entrada visual — GPT-6.1 Sol. O GLM-5.3 é somente texto, e isso não chega nem perto.
• Inferência dentro do seu próprio limite, ou uma proteção contra a mudança nos termos de um fornecedor — GLM-5.3, e agora o download em vez de uma promessa. Reserve orçamento para o hardware: o checkpoint é um artefato FP8 grande, e a auto-hospedagem é uma decisão de capital, não de API.
• Chamadas sensíveis à latência — nenhum dos dois sem cuidado. O GLM-5.3 não tem como desligar o raciocínio; o GPT-6.1 Sol tem um piso no nível baixo, e o seu próprio tempo até o primeiro token no painel independente mediu 332 segundos, contra uma mediana do painel de 3,7.

Comparados neste artigo3

Detectado a partir deste artigo · Benchmarks: Artificial Analysis · atualizado diariamente