Um cartão de título de destaque para GLM-5.2 vs Kimi K3, com o subtítulo 'Mais barato e mais rápido, ou maior e melhor', três selos arredondados em formato de pílula com os dizeres 'contexto de 1M tokens cada', 'AA Index 34 vs 44' e '$1.40 / $4.40 vs $3.00 / $15.00', uma linha de rodapé com os dizeres 'Tabelas de tarifas dos fornecedores e Artificial Analysis, 2026-09-23', e o logotipo OrcaRouter no canto inferior direito.
Guides & Insights

GLM-5.2 vs Kimi K3: Mais barato e mais rápido, ou maior e melhor

Autor

Alistair Wren

Data de publicação

Modelos mais recentes · 20Ver todos os modelos
Benchmarks: Artificial Analysis · atualizado diariamente
Voltar para todas as publicações

GLM-5.2 e Kimi K3 chegaram com um mês de diferença em meados de 2026 e são quase perfeitamente inversos um ao outro. Kimi K3, lançado em 2026-07-16, com pesos abertos disponibilizados em 2026-07-27, é o maior e, no papel, o melhor modelo: 2,8 trilhões de parâmetros, 104 bilhões deles ativos, e a pontuação mais alta em praticamente todos os benchmarks nos quais os dois foram testados. GLM-5.2 está disponível desde 2026-06-16, é o menor dos dois, com 753 bilhões de parâmetros e 40 bilhões ativos, custa aproximadamente um terço do valor por token de saída, responde mais rápido na mediana e é distribuído sob a licença MIT, em vez de uma licença sob medida com gatilhos de receita.

Essa é a decisão em um parágrafo. O que vem a seguir é a evidência por trás dela — a aritmética de preços em um trabalho que você talvez realmente execute, as medições em que os dois estão próximos o bastante para que a diferença seja ruído, e um número popular que não é comparável ao número impresso ao lado dele.

Onde os dois estão

Ambos estão geralmente disponíveis por meio das APIs dos próprios fornecedores, ambos são roteáveis no OrcaRouter e ambos têm pesos disponíveis para download. As diferenças que importam antes de você chegar perto de um benchmark:

• Lançado — GLM-5.2 em 2026-06-16 vs. Kimi K3 em 2026-07-16 (páginas de modelos da Artificial Analysis; a própria página de modelo da OrcaRouter para o Kimi K3 data-o um dia antes, 2026-07-15)

• Pesos — GLM-5.2 aberto sob MIT vs. Kimi K3 aberto sob a Licença Kimi K3, que exige um acordo separado acima de US$ 20 milhões em receita anual de model-as-a-service e atribuição proeminente acima de 100 milhões de usuários mensais (pesquisa e desenvolvimento internos são isentos)

• Tamanho — GLM-5.2 753B no total / 40B ativos vs Kimi K3 2,8T no total / 104B ativos

• Contexto — GLM-5.2 1.000.000 tokens vs Kimi K3 1.048.576 tokens

• Entrada — GLM-5.2: texto de entrada, texto de saída vs Kimi K3: texto e imagens de entrada, texto de saída

• Saída máxima publicada — GLM-5.2 128.000 tokens vs não publicado na página do OrcaRouter do Kimi K3

No OrcaRouter, ambos ficam atrás de uma única chave em um endpoint compatível com OpenAI em https://api.orcarouter.ai/v1, e repassamos o preço de tabela do provedor diretamente, sem acréscimo de margem — portanto, cada valor abaixo é o número do fornecedor, não o nosso.

Quanto custa um milhão de tokens, em um trabalho que custa algo

Primeiro, as tabelas de preços dos fornecedores, lidas das próprias páginas de preços dos fornecedores em 2026-09-23. A Z.ai lista o GLM-5.2 a $1,40 por milhão de tokens de entrada, $0,26 por milhão de tokens de entrada em cache e $4,40 por milhão de tokens de saída. A Moonshot lista o Kimi K3 a $3,00 de entrada, $0,30 de leitura de cache, $15,00 de saída — além de uma taxa de escrita em cache de $3,00 por milhão para um cache de cinco minutos e $6,00 por milhão para um cache de uma hora. Esses são preços publicados, não auditados de forma independente, e qualquer um dos fornecedores pode alterá-los.

Coloque-os em um trabalho que é principalmente leitura: uma revisão de base de código de 600.000 tokens com uma resposta escrita de 8.000 tokens. No GLM-5.2, isso é 0,6 x $1,40 = $0,84 de entrada mais 0,008 x $4,40 = $0,035 de saída, ou cerca de $0,88. No Kimi K3, é 0,6 x $3,00 = $1,80 mais 0,008 x $15,00 = $0,12, ou cerca de $1,92. Aproximadamente 2,2 vezes o custo para o mesmo trabalho.

Agora, execute-o novamente com a base de código já presente na cache do fornecedor. A linha de entrada cai para a tarifa de leitura da cache, e os dois preços que estavam separados por um fator de 2,1x passam a ser $0,26 contra $0,30 por milhão — uma diferença de 15%. Este é o número menos discutido da comparação e o que mais importa para um agente que relê o mesmo contexto a cada turno. Também tem um asterisco: a Kimi K3 cobra separadamente pela escrita na cache e a página do GLM-5.2 não anuncia qualquer encargo de escrita, pelo que um arranque a frio custa significativamente mais na Kimi K3 do que o valor de destaque de $3,00 sugere.

• Uma leitura de 600k tokens com uma resposta de 8k — GLM-5.2 cerca de US$ 0,88 vs Kimi K3 cerca de US$ 1,92

• A mesma linha de entrada em cache — GLM-5.2 US$ 0,16 vs Kimi K3 US$ 0,18 por 600 mil tokens

A self-built two-column scoreboard for GLM-5.2 vs Kimi K3. Left column 'GLM-5.2' (753B total / 40B active, MIT, $1.40 / $4.40): Intelligence Index 34, blended price per million $0.902, cost per task $0.96, output speed 68.2 tok/s, long context AA-LCR 78%, agentic AutomationBench 28%. Right column 'Kimi K3' (2.8T total / 104B active, Kimi K3 License, $3.00 / $15.00): Intelligence Index 44, blended price per million $2.31, cost per task $2.00, output speed 36.7 tok/s, long context AA-LCR 89%, agentic AutomationBench 58%. Footer reads 'Benchmark, speed and cost figures per Artificial Analysis (Intelligence Index v4.3.2, read 2026-09-23), both models in their maximum-reasoning configuration. Vendor list prices per Z.ai and Moonshot. OrcaRouter passes provider list price through at 0% markup.'

O modelo independente concorda quanto à direção, mas não quanto à magnitude. A Artificial Analysis combina tokens de cache-hit, de entrada e de saída numa proporção de 7:2:1 e adiciona os tokens de raciocínio que um modelo realmente consome, e seus números para esses dois — lidos em 2026-09-23 segundo seu índice v4.3.2 — colocam o GLM-5.2 a US$ 0,902 por milhão de tokens combinados, contra US$ 2,31 do Kimi K3, e o custo de concluir uma de suas tarefas de avaliação em US$ 0,96 contra US$ 2,00. Executar o Intelligence Index completo uma vez custa US$ 1.559 no GLM-5.2 e US$ 3.658 no Kimi K3.

Há um detalhe contraintuitivo escondido nesse modelo de custos. O Kimi K3 usa menos tokens de saída por tarefa do que o GLM-5.2 — 48.000 contra 64.000 — e menos tokens de raciocínio, 32.000 contra 51.000. É o modelo mais econômico por unidade de trabalho e ainda assim custa cerca de duas vezes mais por tarefa, porque seu preço por token é 2,1x na entrada e 3,4x na saída. Barato por tarefa e barato por token são propriedades diferentes, e este é um caso em que elas apontam em direções opostas.

A janela de contexto, e o que realmente cabe nela

Os dois estão dentro de 5% um do outro no papel: 1.000.000 de tokens contra 1.048.576. Noticiar isso como uma vitória do Kimi K3 seria bobagem. Ambos são modelos de um milhão de tokens e a janela não é um diferencial; a pergunta honesta é o que cada um ainda consegue fazer com texto enterrado no meio dela.

É isso que a avaliação de raciocínio de contexto longo da Artificial Analysis mede, e é uma das lacunas mais amplas do conjunto de dados: o Kimi K3 obtém 89% contra os 78% do GLM-5.2. Se o seu trabalho é carregar um grande corpus e fazer perguntas que exijam unir fatos de extremos opostos dele, os 48.576 tokens extras não são o motivo para escolher o Kimi K3 — a margem de onze pontos em contexto longo é.

O piso sob a janela também difere. O GLM-5.2 publica uma saída máxima de 128.000 tokens; a página do Kimi K3 não publica um número equivalente, então não vamos fornecer um. Se você estiver gerando documentos longos em vez de lê-los, essa assimetria vale a pena ser verificada em relação à sua própria carga de trabalho antes de comprar qualquer um dos dois.

Velocidade: o único eixo que o GLM-5.2 domina por completo

Duas medições independentes apontam na mesma direção aqui, o que vale a pena dizer justamente porque não concordam em tudo.

Os nossos próprios dados de encaminhamento, nos sete dias até 2026-09-23, mostram o GLM-5.2 a responder com uma mediana de 3,28 segundos até ao primeiro token, contra os 8,09 segundos do Kimi K3, e a transmitir 68,1 tokens por segundo, contra 43,4. O p95 do tempo até ao primeiro token de ambos os modelos situa-se exatamente nos 10,00 segundos. A Artificial Analysis, medindo separadamente, coloca o GLM-5.2 em 68,2 tokens de saída por segundo, contra os 36,7 do Kimi K3, em 41,29 segundos ponta a ponta, contra 72,13, e em 33,95 segundos até à primeira resposta, contra 58,52.

A screenshot of the OrcaRouter model page for GLM 5.2 (z-ai/glm-5.2) captured 2026-09-23, showing the FEATURED badge, the byline 'by Z.ai · 2026-06-16', a 1M-token context with 128K maximum output and text in / text out, rate cards of $1.40 input and $4.40 output per 1M tokens with a $0.260 cache read, a p50 time to first token of 3.28 s against a p95 of 10.00 s, 29.4M tokens of traffic in the last 7 days, and a PERFORMANCE panel showing an output speed of 68.1 tokens per second and a 9.2% error rate.

As duas fontes divergem em um ponto, e vale a pena destacar isso em vez de passar por cima. O Artificial Analysis coloca o Kimi K3 um pouco à frente no tempo bruto até o primeiro token, 4,08 segundos contra 4,62, enquanto nosso próprio roteamento aponta o GLM-5.2 como quase duas vezes e meia mais rápido no p50. Endpoints diferentes, provedores upstream diferentes, janelas diferentes. Trate a direção da vazão — GLM-5.2 consideravelmente mais rápido — como sólida, e trate qualquer número isolado de tempo até o primeiro token, nosso ou deles, como uma propriedade de uma semana específica.

Há também um número na nossa página do GLM-5.2 que não vamos deixar de fora em silêncio: ao longo dos mesmos sete dias, ele mostra uma taxa de erro de 9,2%, contra 0,26% do Kimi K3. Uma diferença desse tamanho tem tanta probabilidade de ser uma semana ruim para os provedores upstream que atendem o GLM-5.2 quanto uma característica do modelo, e sete dias não são uma janela longa o suficiente para distinguir uma coisa da outra. É o tipo de problema que o roteamento existe para resolver — quando um provedor está falhando uma solicitação em onze, o failover automático move o tráfego sem que ninguém precise acionar o plantão.

A screenshot of the OrcaRouter model page for Kimi K3 (kimi/kimi-k3) captured 2026-09-23, showing the FEATURED badge, the byline 'by MoonshotAI · 2026-07-15', text-and-image input with text output, a 1,048,576-token context, rate cards of $3.00 input and $15.00 output per 1M tokens with a $0.300 cache read, a p50 time to first token of 8.09 s against a p95 of 10.00 s, 1116.2M tokens of traffic in the last 7 days, and a PERFORMANCE panel showing an output speed of 43.4 tokens per second and a 0.26% error rate.

Benchmarks: uma varredura real, mais restrita do que a manchete

Kimi K3 vence quase tudo em que ambos os modelos foram executados. Estes são números da Artificial Analysis segundo a revisão v4.3.2 do índice, com ambos os modelos em sua configuração de raciocínio máximo, consultados em 2026-09-23:

• Índice de Inteligência — Kimi K3 44 vs GLM-5.2 34

• AA-Briefcase v1.1 — 1510 vs 1233

• GDPval-AA v2.1 — 1524 vs 1358

• AutomationBench-AA — 58% vs 28%

• Terminal-Bench 4.0 — 13% vs 1%

• SciCode — 59% vs. 51%

• Humanity's Last Exam — 47% vs 41%

• GDP.pdf — 22% vs 10%

• AA-LCR v1.1 — 89% vs 78%

• CritPt — 23% vs 21%

Duas ressalvas antes que alguém tire print dessa lista.

Primeiro, a revisão do índice. A cobertura do lançamento do Kimi K3 em julho citava-o em 57 no Intelligence Index, com o GLM-5.2 em 51. As páginas ao vivo de hoje dizem 44 e 34. Essas não são a mesma medição — a Artificial Analysis revisa o índice e recalcula as pontuações dos modelos com base nele, e colocar um número de julho ao lado de um número de setembro é o erro mais fácil de cometer nessa comparação. A direção é estável em todos os instantâneos; os números absolutos não são comparáveis entre revisões.

Segundo, os níveis. O Terminal-Bench 4.0 com 13% e 1% é uma avaliação difícil, e nesse patamar a proporção diz mais do que qualquer um dos números. O AA-Omniscience, que testa se um modelo conhece os limites do próprio conhecimento, coloca o GLM-5.2 em 4 contra 20 do Kimi K3 — um piso que vale a pena conhecer se você planeja executar qualquer um deles sem supervisão.

Mais uma coisa que a Artificial Analysis registra sobre a listagem do GLM-5.2: ela marca a configuração de raciocínio máximo como obsoleta em favor do mais recente GLM-5.3. Isso não altera nenhum dos números acima, que são um instantâneo do GLM-5.2 tal como foi medido, mas significa que o roadmap da Z.ai já avançou além deste modelo. Em um endpoint roteado, isso custa uma string de modelo em vez de uma migração, que é o principal argumento para não fixar no código nenhum desses nomes em seu aplicativo.

Agentes e uso de ferramentas: onde a lacuna é maior

Se um bloco dessa tabela deve decidir a compra, é este. O trabalho agêntico de longo prazo é onde a margem do Kimi K3 é maior e mais consistente:

• AutomationBench-AA — 58% vs 28%, uma diferença de 30 pontos

• GDPval-AA v2.1 — 1524 vs 1358

• AA-Briefcase v1.1 — 1510 vs 1233

• Terminal-Bench 4.0 — 13% vs 1%

O próprio material de lançamento da Moonshot se apoia na mesma narrativa — o lançamento dos pesos do K3 veio acompanhado de um relatório técnico que aborda a pilha de treinamento com paralelismo de especialistas do fornecedor e um harness de ambiente de agente —, mas material de fornecedor é material de fornecedor, e os números acima são os independentes.

O agregador terceirizado LLM Stats, que executa seu próprio composto sobre um conjunto de benchmarks compartilhado, chega à mesma conclusão por um caminho diferente: dos onze benchmarks que avalia para ambos os modelos, o Kimi K3 vence todos os onze, e suas pontuações por categoria colocam o Kimi K3 à frente em uso de ferramentas (30,8 vs 19,6), agentes (38,3 vs 29,6) e codificação (42,3 vs 34,8). Esses são os compostos próprios do LLM Stats sob sua própria ponderação, em um conjunto compartilhado que não é grande, então trate-os como corroboração, e não como resultado de laboratório. Onze de onze ainda não é uma disputa acirrada.

Codificação

Mesma direção, margem menor. Nas avaliações de codificação que a Artificial Analysis pontua para ambos, o Kimi K3 lidera o SciCode por 59% a 51%; no conjunto compartilhado do LLM Stats, ele conquista DeepSWE, DeepSWE 1.1, FrontierSWE, SWE-Marathon, Program Bench e Terminal-Bench 2.1. Os números lisonjeiros do GLM-5.2 — 99,2% no AIME 2026, 94,4% no HMMT 2025, 91,2% no GPQA conforme divulgados por agregadores terceiros — são reportados pelo fornecedor e não reproduzidos, e a maioria deles mede matemática de competição, e não engenharia de software.

A leitura prática: para um agente de programação que funciona por muito tempo, edita muitos arquivos e precisa se recuperar dos próprios erros, a margem agêntica do Kimi K3 é o sinal mais relevante do que as pontuações de matemática de qualquer um dos modelos. Para um assistente de código rápido, barato e em grande parte de execução única, a vantagem de throughput do GLM-5.2 vale mais do que o custo da diferença nos benchmarks.

Onde estão suficientemente próximos para que isso não importe

• Preço de entrada em cache — US$ 0,26 vs US$ 0,30 por milhão, uma diferença de 15% contra uma diferença de 3,4x na saída

• Janela de contexto — 1.000.000 vs 1.048.576 tokens

• p95 tempo até o primeiro token — 10,00 s vs 10,00 s no nosso próprio roteamento

• CritPt — 23% vs 21%

• Matemática — O LLM Stats coloca o GLM-5.2 marginalmente à frente em seu composto de matemática (41,4 vs 40,9), enquanto o Kimi K3 lidera em matemática com imagens; pelas evidências disponíveis, nenhum dos modelos domina a aritmética

Quem lhe disser que um desses modelos é o dobro do outro em todos os aspectos está lendo uma única linha da tabela.

Escolha o GLM-5.2 se…

Você está pagando a conta, e a conta é a restrição. O GLM-5.2 custa aproximadamente um terço do preço de saída, também é mais barato na linha de cache, tem licença MIT sem gatilho de receita para verificar, é mais rápido na mediana e muito mais rápido ao fazer streaming, e sua janela de um milhão de tokens é suficientemente próxima da do Kimi K3 para que a diferença nunca decida nada. Se sua carga de trabalho é texto de entrada e texto de saída, e consiste principalmente em leitura, e não em longas cadeias de chamadas de ferramentas, os pontos extras de benchmark no Kimi K3 são pontos que sua aplicação nunca vai coletar.

Escolha o Kimi K3 se…

O trabalho é agêntico e longo. A diferença de 30 pontos no AutomationBench, as vantagens no GDPval e no AA-Briefcase, a margem de onze pontos em raciocínio de contexto longo e o domínio do conjunto compartilhado do LLM Stats apontam todas na mesma direção: o Kimi K3 é o melhor modelo para entregar uma tarefa de várias etapas e ir embora. É também o único dos dois que aceita imagens. Você pagará aproximadamente o dobro por tarefa por isso, e se o seu conjunto de trabalho estiver fortemente em cache, pagará menos que o dobro — mas o argumento a favor dele não é o preço, e não é a velocidade.

Ambos são roteáveis no OrcaRouter a partir de uma única chave contra um único endpoint compatível com OpenAI, aos preços de tabela dos provedores, sem nada acrescentado por cima, e ambos ficam atrás do mesmo failover automático. Essa é a maneira mais barata de descobrir qual deles sua carga de trabalho realmente quer, porque alternar entre eles é uma string de modelo, e não um contrato.

Comparados neste artigo2

Detectado a partir deste artigo · Benchmarks: Artificial Analysis · atualizado diariamente