Um cartão de título de destaque gerado com o texto 'GPT-6 Luna vs GLM-5.3', com o subtítulo 'Oito pontos de índice por dez vezes o custo por tarefa, e os pesos ainda não foram publicados.', com chips mostrando Luna a $0,10/$0,50 por 1M com índice 37, GLM-5.3 a $1,40/$4,40 por 1M com índice 45, e custo por tarefa de índice de $0,07 contra $0,68, com o logotipo da OrcaRouter no canto inferior direito.
Guides & Insights

GPT-6 Luna vs GLM-5.3: O modelo de pesos abertos que você ainda não pode baixar

Autor

Elias Hawthorne

Data de publicação

Modelos mais recentes · 20Ver todos os modelos
Benchmarks: Artificial Analysis · atualizado diariamente
Voltar para todas as publicações

GLM-5.3é o melhor modelo. Ele pontua 45 no Artificial Analysis Intelligence Index em esforço máximo, contra o GPT-6 Luna, que pontua 37; ele iguala o Mythos 5 em avaliações selecionadas de cibersegurança, segundo a Z.ai, e é o modelo líder de pesos abertos em vários dos rankings compostos. Além disso, neste momento, é uma API que você aluga em vez de um modelo que você possui: a Z.ai atrasou o lançamento dos pesos em cerca de duas semanas por preocupações com cibersegurança, e o download que deveria ser o ponto principal de um carro-chefe de pesos abertos ainda não está disponível.

Esse atraso é a história deste confronto, e muda a aritmética de um jeito que as tabelas de preços não captam. O GPT-6 Luna chegou em 22 de setembro de 2026 a US$ 0,10 por milhão de tokens de entrada e US$ 0,50 por milhão de saída, em disponibilidade geral, sem condições ocultas. O GLM-5.3 chegou em 18 de agosto de 2026 a US$ 1,40 e US$ 4,40 — quatorze vezes a taxa de entrada do Luna e quase nove vezes a taxa de saída dele — com seus pesos retidos. Portanto, a comparação não é aberto contra fechado. É um modelo fechado que você pode chamar hoje por um décimo do custo contra um modelo aberto que você só pode chamar hoje, com um preço como se você estivesse comprando aquilo que ainda não pode ter.

Dois modelos, com um mês de diferença, dois negócios muito diferentes

GPT-6 Luna é o nível pequeno da geração GPT-6 da OpenAI, lançado junto com o GPT-6 Sol a US$ 2,00/US$ 10,00 e abaixo do carro-chefe GPT-6 Astra a US$ 10,00/US$ 50,00. Ele possui uma janela de contexto de 1.050.000 tokens, um limite de saída de 128.000 tokens, entrada de texto e imagem, e uma escala de raciocínio que vai de none, passando por low, medium, high e xhigh, até max — com medium como padrão. A OpenAI o chama de modelo mais eficiente da família para trabalhos focados e de alto volume, e a tabela de preços confirma isso: entrada em cache a US$ 0,01 por milhão é um décimo de uma taxa sem cache já baixa.

O GLM-5.3 é o atual carro-chefe da Z.ai para engenharia de software complexa e trabalho agêntico de longo horizonte, lançado em 18 de agosto de 2026. É texto entra, texto sai, traz uma janela de contexto de 1 milhão de tokens com limite de saída de 128.000 tokens e raciocina sempre ativado — não existe modo sem raciocínio. A Z.ai descreve uma melhoria de cerca de 50% na experiência de programação em relação ao GLM-5.2 e o posiciona para programação em escala de repositório e engenharia autônoma de múltiplas etapas. Os pesos, quando chegarem, serão o recurso de destaque; hoje, a API é o que está ativo.

O que as duas tabelas de preços realmente dizem

Uma linha por dimensão, ambos os lados em cada:

• Entrada por 1M — GPT-6 Luna $0.10 vs GLM-5.3 $1.40

• Saída por 1M — GPT-6 Luna $0,50 vs GLM-5.3 $4,40

• Entrada em cache — GPT-6 Luna $0,01 por 1M vs GLM-5.3 $0,26 por 1M, um desconto de 81% sobre sua própria tarifa de entrada

• AA Intelligence Index — GPT-6 Luna 37 com esforço máximo vs GLM-5.3 45 com esforço máximo

• Pontuação de esforço padrão — GPT-6 Luna 29 no seu padrão médio vs raciocínio sempre ativo do GLM-5.3, medido no máximo

• Tokens de saída na execução do índice — GPT-6 Luna 150M vs GLM-5.3 210M, contra uma mediana do painel de 140M

• Custo para executar o índice — GPT-6 Luna $122.39 vs GLM-5.3 $2,503.48

• Custo por tarefa de índice — GPT-6 Luna cerca de $0,07 vs GLM-5.3 cerca de $0,68

• Contexto e saída — GPT-6 Luna 1.050.000 entrada / 128.000 saída vs GLM-5.3 1M entrada / 128.000 saída

• Cláusula de contexto longo — GPT-6 Luna: 2x entrada e cache, 1,5x saída acima de 272K de entrada, requisição inteira vs. GLM-5.3; nenhuma cláusula equivalente no card publicado

• Interruptor de desativação do raciocínio — GPT-6 Luna de nenhum a máximo vs. GLM-5.3 sempre ativado, sem modo sem raciocínio

• Pesos — GPT-6 Luna fechado, apenas API vs GLM-5.3 aberto por compromisso, lançamento atrasado

A generated single-panel scoreboard card headed 'Same suite, ten times the task cost' with six rows: GPT-6 Luna $0.10 in / $0.50 out per 1M with index 37 at max effort; GLM-5.3 $1.40 in / $4.40 out per 1M with index 45 at max effort; cost per completed index task about $0.07 against about $0.68; output tokens on the index run Luna 150M against GLM-5.3's 210M and a board median of 140M; reasoning configuration Luna none through max against GLM-5.3 always on with no off switch; and weights, Luna closed and API-only against GLM-5.3 open by commitment with the release delayed. Footer: 'Index and cost per task per Artificial Analysis; prices per OpenAI and Z.ai.'

O imposto da verbosidade é o número que decide isso

A diferença de oito pontos no índice é real e a diferença de preço é maior, e nenhuma delas é o número que mais importa. O que importa são os tokens de saída por tarefa concluída, porque é aí que uma vantagem de capacidade de oito pontos ou se paga ou não.

A execução do índice da Artificial Analysis é a comparação controlada mais limpa disponível: a mesma suíte, o mesmo harness, aplicados aos dois modelos. O GLM-5.3 gerou 210 milhões de tokens de saída ao concluí-la. O GPT-6 Luna gerou 150 milhões. Diante de uma mediana do ranking de 140 milhões, ambos são prolixos — o GLM-5.3 em uma vez e meia a mediana, o GPT-6 Luna em cerca de um décimo. Mas a direção dessa diferença pesa ainda mais contra o modelo da Z.ai no preço: ele emite 40% mais tokens e cobra 8,8 vezes mais por cada um.

Juntando os dois, o custo por tarefa de índice concluída fica em cerca de US$ 0,68 para o GLM-5.3, contra cerca de US$ 0,07 para o GPT-6 Luna — uma diferença de aproximadamente dez vezes, maior que a proporção bruta da tabela de preços, porque o modelo mais caro também é o mais prolixo. Essa é a forma honesta dessa combinação. O GLM-5.3 compra oito pontos de índice por dez vezes o dinheiro por trabalho concluído, e se essa é uma boa compra depende inteiramente de sua carga de trabalho ser uma em que oito pontos fazem a diferença entre funcionar e não funcionar.

Para boa parte do tráfego de produção, não é. Para um agente de programação trabalhando em um repositório no limite do que o modelo é capaz de fazer, muitas vezes é, e nenhuma vantagem de preço fecha uma lacuna de capacidade em uma tarefa que falha.

Por que os pesos abertos mudam a resposta, e por que o atraso a muda de volta

O argumento padrão em favor de um modelo principal de pesos abertos é que o preço por token é temporário. Você aluga até que seu volume justifique a compra; depois baixa o modelo e o custo marginal de um token passa a ser a eletricidade. Segundo esse argumento, os US$ 1,40/US$ 4,40 do GLM-5.3 não são realmente quatorze vezes os US$ 0,10 do GPT-6 Luna — é um preço-ponte a caminho de zero, e a tarifa mais barata do modelo fechado é um aluguel sem saída.

Esse argumento está correto e, no momento, está suspenso. A Z.ai adiou a liberação dos pesos em cerca de duas semanas devido a descobertas de cibersegurança, o que significa que a rota de saída que justifica o preço premium ainda não existe. Até que ela exista, o GLM-5.3 é uma API tarifada por uso a um custo por tarefa dez vezes maior que o de um modelo que está quatro pontos de índice atrás dele no ranking geral e um ponto atrás no ranking de programação — e o comprador está pagando preços de pesos abertos por acesso a pesos fechados.

Há um ponto de segunda ordem que vale a pena nomear. O atraso não é um escândalo; é um fornecedor levando a sério uma descoberta de capacidade, e um modelo que encontra vulnerabilidades bem é exatamente o tipo de modelo com que um laboratório deveria ter cuidado ao lançar como um arquivo para download. Mas isso significa que a data de lançamento dos pesos é agora a data mais importante nesta comparação, e ela não está publicada. Uma equipe escolhendo entre estes dois modelos num horizonte de doze meses está escolhendo entre um modelo cujos termos podem mudar no próximo mês e um modelo cujos termos não podem — e apenas um deles está precificado de acordo.

A superfície de migração é pequena

Ambos os modelos expõem uma interface de chat completions compatível com a OpenAI, ambos trazem uma janela de contexto da classe de 1M e ambos limitam a saída a 128.000 tokens, portanto uma portabilidade entre eles está mais próxima de uma mudança de configuração do que de uma reescrita. As diferenças que realmente vão causar problemas são comportamentais, não estruturais.

A cláusula de contexto longo do GPT-6 Luna é a que sai cara: pedidos acima de 272.000 tokens de entrada são cobrados ao dobro das tarifas de entrada e de cache e a 1,5 vez a tarifa de saída para todo o pedido, de modo que uma chamada de 300.000 tokens custa o dobro do que o mesmo trabalho custa dividido em duas. A ficha publicada do GLM-5.3 não traz cláusula equivalente, o que, em pedidos únicos genuinamente grandes, reduz consideravelmente a diferença de preço e pode invertê-la num trabalho intensivo em saída.

A configuração de raciocínio corta no sentido oposto. O GLM-5.3 raciocina sempre ativado e não oferece nenhuma forma de desativá-lo, o que é uma restrição rígida para qualquer coisa sensível à latência — um classificador ou um roteador não pode usá-lo. O GPT-6 Luna oferece none, low, medium, high, xhigh e max, e o padrão é medium, em que pontua 29 em vez de 37. Esse único parâmetro é a diferença entre o GPT-6 Luna ficar oito pontos de índice atrás do modelo da Z.ai e ficar dezesseis atrás, e uma equipe que migra sem defini-lo explicitamente está executando a segunda configuração enquanto acredita ter comprado a primeira.

O GLM-5.3 está no OrcaRouter pelo preço de tabela da Z.ai, sob preços de repasse que colocam uma mudança de tarifa do fornecedor do nosso lado no mesmo dia, em vez de esperar que um revendedor renegocie — o que importa mais do que o habitual para um modelo cujo número de destaque deve mudar quando os pesos chegarem. O GPT-6 Luna não está no nosso catálogo no momento em que escrevemos e é acessado pela própria API da OpenAI. Uma equipe que usa os dois, que é a configuração racional aqui, dada a diferença entre os dois nos extremos, usa uma chave para o GLM-5.3 junto com o que já usa para a OpenAI, e move o tráfego entre um classificador de cinco centavos e um agente de codificação em escala de repositório mudando uma rota em vez de uma implantação.

A screenshot of the Artificial Analysis page for GPT-6 Luna (max), showing an Intelligence rank of 6th of 183 models, a Speed rank of 35th, a Cost rank of 20th and a Verbosity rank of 36th, input pricing of $0.10 and output of $0.50 per 1M tokens, an Intelligence Index score of 37 against a comparable-model median of 12, 150M output tokens generated during the index run, 153.9 tokens per second, and a total of $122.39 spent evaluating the model.

A chamada

Use o GPT-6 Luna para tudo que for consumido por programas e de alto volume. Classificação, extração, roteamento, sumarização em massa, o loop interno de um agente. A US$ 0,10/US$ 0,50, com entrada em cache a um centavo e o Batch pela metade da tarifa padrão, ele é uma ordem de magnitude mais barato por tarefa concluída do que o GLM-5.3, e a diferença de oito pontos no índice não aparecerá na sua avaliação. Defina explicitamente o parâmetro effort e mantenha suas chamadas longas abaixo de 272.000 tokens.

Use o GLM-5.3 quando a tarefa for a difícil e a resposta importar mais do que a fatura. Engenharia de software em escala de repositório, trabalho autônomo em várias etapas, qualquer caso em que oito pontos de índice sejam a diferença entre uma tarefa ser concluída e uma tarefa falhar. A verbosidade é um imposto real e o custo dez vezes maior por tarefa é real, mas um modelo que termina é mais barato do que um modelo que precisa ser repetido.

E fique de olho nos pesos. O dia em que a Z.ai publicar o download do GLM-5.3 é o dia em que o fato central desta comparação muda, e é a única data nesta página que ainda não está no calendário.

A screenshot of the OrcaRouter model page for GLM-5.3 (z-ai/glm-5.3), showing the Tools, JSON and Reasoning badges, a 2026-08-18 catalogue date, 1M-token context with 128K maximum output, list pricing of $1.26 input and $3.96 output per 1M tokens, a p50 time to first token of 3.99s, 1807.1M tokens of traffic, and the description of GLM-5.3 as Z.ai's flagship model for complex software engineering and long-horizon agentic tasks.

Comparados neste artigo2

Detectado a partir deste artigo · Benchmarks: Artificial Analysis · atualizado diariamente