Um cartão de título para a comparação GLM-5.3 versus Kimi K3: um cubo menor à esquerda rotulado GLM-5.3 com o rótulo base 743B pós-treinada, e um cubo maior à direita rotulado Kimi K3 com o rótulo base 2.8T construída do zero.
Guides & Insights

GLM-5.3 vs Kimi K3: Tirar o máximo de uma base de 743B ou construir uma de 2.8T — Qual aposta compensa?

Autor

Rowan Sterling

Data de publicação

Modelos mais recentes · 20Ver todos os modelos
Benchmarks: Artificial Analysis · atualizado diariamente
Voltar para todas as publicações

A corrida chinesa de pesos abertos acabou de se dividir em duas respostas para a mesma pergunta. A Moonshot AI construiu Kimi K3do zero — um modelo base de mistura de especialistas com 2,8 trilhões de parâmetros, o maior modelo de pesos abertos já lançado, anunciado em 16 de julho de 2026, com os pesos disponibilizados em 27 de julho. G​L​M-5.3é a aposta oposta: a Z.ai manteve exatamente o modelo base de 743 bilhões de parâmetros que alimentava o GLM-5.2 e gastou todo o ciclo de lançamento em pós-treinamento, argumentando que o teto de inteligência do modelo base nunca foi o problema. Ambos são modelos principais com contexto de 1M, focados em codificação e agentes, e ambos afirmam ser o melhor modelo de codificação aberto do mercado. Eles não podem ser ambos a melhor forma de gastar o mesmo orçamento, e os benchmarks realmente se dividem ao meio — o que torna isso menos uma comparação e mais um referendo sobre como construir o próximo modelo de fronteira.

Duas apostas sobre como construir um modelo de fronteira

Z.ai chama o G​LM-5.3 de "deep dig" em vez de uma atualização geracional. A base é byte por byte o mesmo modelo de 743B do GLM-5.2; a diferença está inteiramente no pós-treinamento, executado por meio da estrutura de código aberto slime em tarefas que abrangem sessões completas de engenharia — diagnosticar, corrigir, verificar e entregar em clusters reais, sistemas de armazenamento e bases de código, algumas levando vários dias de trabalho de um engenheiro sênior. Os ganhos relatados pelo fornecedor são grandes: um salto de 50% em seu próprio Code Bench, Terminal-Bench 3.0 de 4,6 para 28,3, DeepSWE v1.1 de 46,2 para 66,9, e uma capacidade cibernética que forçou uma revisão de segurança antes do lançamento dos pesos. Moonshot seguiu o outro caminho. Kimi K3 é uma base totalmente nova — 2,8T de parâmetros totais com cerca de 104B ativos por token (16 de 896 especialistas), uma arquitetura Kimi Delta Attention, entrada nativa de imagem e vídeo, raciocínio sempre ativo que não pode ser desligado e uma janela de contexto de 1M tanto na entrada quanto na saída. Enquanto a Z.ai aposta que mais do mesmo modelo é suficiente, a Moonshot aposta que a própria base era o teto.

The Z.ai research blog post announcing GLM-5.3, dated August 14 2026, titled GLM-5.3: Frontier Coding with Emergent Cyber Capabilities, with a Coding Plan / Code with ZCode call to action and a HuggingFace (Coming Soon) button.

O confronto direto, com proveniência anexada.

O único lugar em que ambos os modelos aparecem na mesma página é a tabela de lançamento da própria Z.ai, então é de lá que vêm os números lado a lado — rotulados como relatados pelo fornecedor, não auditados de forma independente. Os números isolados do Kimi K3 coincidem com o que a Moonshot publicou em julho e com o que a Artificial Analysis mede, mas nenhum laboratório neutro testou ambos ainda.

Terminal-Bench 3.0 — G​LM-5.3 com 28.3 contra Kimi K3 com 17.4 (tabela da Z.ai). A maior lacuna de codificação do confronto, na versão mais recente e mais difícil.

Terminal-Bench 2.1 — G​LM-5.3 com 88.2 contra Kimi K3 com 88.3. Um empate técnico.

DeepSWE v1.1 — G​LM-5.3 com 66,9 versus Kimi K3 com 67,5. Kimi vence por pouco.

SWE-Marathon v1.1 — G​LM-5.3 com 42.5 contra Kimi K3 com 48.1. A melhor vitória de codificação da Kimi.

ExploitGym — G​LM-5.3 com 105/130 contra Kimi K3 com 36/70. Uma vitória quase total para G​LM.

GDPval-AA v2 (trabalho de conhecimento) — G​LM-5.3 com 1.769 versus Kimi K3 com 1.682.

Acesso — G​LM-5.3: assinatura do Coding Plan, pesos bloqueados até aproximadamente 28 de agosto. Kimi K3: API disponível a $3 / $15, pesos disponíveis para download desde 27 de julho.

A comparison scoreboard for GLM-5.3 and Kimi K3: GLM-5.3 shows Terminal-Bench 3.0 of 28.3, Terminal-Bench 2.1 of 88.2, DeepSWE v1.1 of 66.9, ExploitGym of 105/130, GDPval-AA v2 of 1,769 and weights around August 28, versus Kimi K3s 17.4, 88.3, 67.5, 36/70, 1,682, weights live since July 27 and $3/$15 API pricing.

O fosso de segurança é a verdadeira separação.

Se deixarmos de lado os benchmarks de codificação, a diferença decisiva é a cibersegurança. O G​LM-5.3 registra 84.5 no CyberGym contra 80.0 do Kimi K3, e sua pontuação de 54.4 no ExploitBench é quase o dobro dos 32.2 do Kimi K3. No ExploitGym, a lacuna não é uma simples diferença; é uma categoria diferente — 105 e 130 contra 36 e 70 nas execuções de 2 e 6 horas. É por isso que os dois lançamentos parecem tão diferentes na prática: os pesos do Kimi K3 estão abertos sob uma licença MIT modificada, enquanto os do G​LM-5.3 estão sendo retidos para reforço de segurança, precisamente porque a Z.ai diz que o modelo é bom o suficiente para encontrar e explorar falhas, a ponto de que disponibilizar os pesos imediatamente parecia irresponsável. Se o seu trabalho envolve auditar o código de outra pessoa, ou defender o seu próprio contra a caça automatizada de vulnerabilidades, este é o ponto mais relevante de toda a comparação — e também o menos verificado de forma independente.

Onde a Kimi K3 contra-ataca

As vitórias do Kimi K3 se concentram onde o G​LM-5.3 é mais fraco: trabalho de repositório de longo horizonte. Ele mantém vantagem no DeepSWE e no SWE-Marathon, lidera no Toolathlon Verified, e sua janela de saída de 1M de tokens significa que ele pode escrever um codebase inteiro ou um longo trace de agente em uma única passada. Seu raciocínio sempre ativo transmite o trace completo para a API, que os desenvolvedores consideraram muito mais útil para depurar agentes do que explicações resumidas opacas — com a ressalva operacional de que você precisa passar os campos de raciocínio de volta verbatim entre chamadas de ferramentas, e não há prefill de assistente. No Intelligence Index da Artificial Analysis, o Kimi K3 fica em 57, quarto no geral, com cerca de US$ 0,94 de custo por tarefa medido em seu conjunto padrão. Também é o modelo mais caro que um laboratório chinês já lançou: US$ 3 por milhão de tokens de entrada e US$ 15 por milhão de saída, preço de nível Sonnet, enquanto o G​LM-5.3 ainda não pode ser precificado por token porque só existe dentro de um plano de assinatura.

A realidade do acesso e dos custos

O Kimi K3 está no OrcaRouter agora mesmo pelo preço de tabela da própria Moonshot — US$ 3 / US$ 15 por milhão de tokens, US$ 0,30 para leituras em cache, margem de 0% — então o trabalho de agente com contexto de 1M pode ser chamado na mesma chave do restante da sua stack, e os pesos abertos são a opção de saída se você quiser fazer self-hosting. O G​LM-5.3 é o mais difícil de conseguir: uma assinatura mensal de US$ 18 a US$ 168 com um sistema de pontos que gasta créditos a 6,9x na entrada e 24x na saída, preço fora de pico que reduz o gasto pela metade fora do intervalo 14h00–18h00 no horário da China, e sem API por token até a revisão de segurança ser concluída. A camada de roteamento efetivamente achata essa assimetria na janela de duas semanas: quando a API do G​LM-5.3 chegar na mesma chave, uma chamada de painel pode rodar os dois flagships de codificação aberta contra as suas próprias tarefas e deixar o juiz reconciliá-los — e se você não puder esperar, os pesos já lançados do Kimi K3 fazem dele o único dos dois que você pode levar totalmente para on-premises hoje.

The OrcaRouter model page for MoonshotAI Kimi K3, showing the New and Featured badges, the kimi/kimi-k3 slug, $3.00 per million input and $15.00 per million output pricing, and text plus image input.

Qual aposta está pagando

O veredito honesto após uma semana é que ambas as apostas estão valendo a pena, mas em cargas de trabalho diferentes. Se o seu trabalho é voltado para terminal, adjacente à segurança e orquestrado por agentes, o G​LM-5.3 é a direção mais forte com base nas evidências que a Z.ai publicou — e a lacuna em cibersegurança é grande o suficiente para valer a pena esperar duas semanas pelos pesos para verificar por conta própria. Se o seu trabalho envolve sessões longas em repositórios, entrada multimodal ou qualquer coisa em que você precise dos pesos em mãos hoje, o Kimi K3 é o único dos dois que está realmente disponível — e suas vitórias em repositórios profundos são as que você pode verificar agora mesmo pela API ao vivo. A única coisa a ter em mente: todos os números neste confronto direto da comparação vêm da tabela da própria Z.ai, então trate os deltas de codificação como direcionais até que um laboratório independente execute ambos. Esse é exatamente o tipo de verificação que a espera de duas semanas trará.

Comparados neste artigo1

Detectado a partir deste artigo · Benchmarks: Artificial Analysis · atualizado diariamente

© 2026 OrcaRouter

Para provedores

Opera uma plataforma de inferência? Traga seus modelos para o OrcaRouter.

providers@orcarouter.ai

Junte-se à comunidade

Discordsupport@orcarouter.aiXGitHubYouTube