
GLM-5.2 vs Kimi K3: Mais barato e mais rápido, ou maior e melhor
- OrcaNOVOOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 por 1M de tokens
- orcaNOVOOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 por 1M de tokens
- deepseekNOVODeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligência
- openaiOpenAI: GPT-6 Astra2026-09-0453Inteligência77Código
- googleGoogle: Gemini 3.8 Flash2026-09-0241Inteligência76Código
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Inteligência76Código
- anthropicAnthropic: Claude Fable 5.12026-09-0153Inteligência82Código
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 por 1M de tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligência72Código
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 por 1M de tokens
- z-aiZ.ai: GLM 5.32026-08-1845Inteligência75Código
- obsidianQwen3.8 27B2026-08-1534Inteligência68Código
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Inteligência69Código
- grokSpaceXAI: Grok 4.62026-08-1244Inteligência77Código
- metaMeta: Muse Spark 1.22026-08-0540Inteligência72Código
- qwenQwen: Qwen3.8 Max2026-08-0345Inteligência76Código
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3134Inteligência69Código
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 por 1M de tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
GLM-5.2 e Kimi K3 chegaram com um mês de diferença em meados de 2026 e são quase perfeitamente inversos um ao outro. Kimi K3, lançado em 2026-07-16, com pesos abertos disponibilizados em 2026-07-27, é o maior e, no papel, o melhor modelo: 2,8 trilhões de parâmetros, 104 bilhões deles ativos, e a pontuação mais alta em praticamente todos os benchmarks nos quais os dois foram testados. GLM-5.2 está disponível desde 2026-06-16, é o menor dos dois, com 753 bilhões de parâmetros e 40 bilhões ativos, custa aproximadamente um terço do valor por token de saída, responde mais rápido na mediana e é distribuído sob a licença MIT, em vez de uma licença sob medida com gatilhos de receita.
Essa é a decisão em um parágrafo. O que vem a seguir é a evidência por trás dela — a aritmética de preços em um trabalho que você talvez realmente execute, as medições em que os dois estão próximos o bastante para que a diferença seja ruído, e um número popular que não é comparável ao número impresso ao lado dele.
Onde os dois estão
Ambos estão geralmente disponíveis por meio das APIs dos próprios fornecedores, ambos são roteáveis no OrcaRouter e ambos têm pesos disponíveis para download. As diferenças que importam antes de você chegar perto de um benchmark:
• Lançado — GLM-5.2 em 2026-06-16 vs. Kimi K3 em 2026-07-16 (páginas de modelos da Artificial Analysis; a própria página de modelo da OrcaRouter para o Kimi K3 data-o um dia antes, 2026-07-15)
• Pesos — GLM-5.2 aberto sob MIT vs. Kimi K3 aberto sob a Licença Kimi K3, que exige um acordo separado acima de US$ 20 milhões em receita anual de model-as-a-service e atribuição proeminente acima de 100 milhões de usuários mensais (pesquisa e desenvolvimento internos são isentos)
• Tamanho — GLM-5.2 753B no total / 40B ativos vs Kimi K3 2,8T no total / 104B ativos
• Contexto — GLM-5.2 1.000.000 tokens vs Kimi K3 1.048.576 tokens
• Entrada — GLM-5.2: texto de entrada, texto de saída vs Kimi K3: texto e imagens de entrada, texto de saída
• Saída máxima publicada — GLM-5.2 128.000 tokens vs não publicado na página do OrcaRouter do Kimi K3
No OrcaRouter, ambos ficam atrás de uma única chave em um endpoint compatível com OpenAI em https://api.orcarouter.ai/v1, e repassamos o preço de tabela do provedor diretamente, sem acréscimo de margem — portanto, cada valor abaixo é o número do fornecedor, não o nosso.
Quanto custa um milhão de tokens, em um trabalho que custa algo
Primeiro, as tabelas de preços dos fornecedores, lidas das próprias páginas de preços dos fornecedores em 2026-09-23. A Z.ai lista o GLM-5.2 a $1,40 por milhão de tokens de entrada, $0,26 por milhão de tokens de entrada em cache e $4,40 por milhão de tokens de saída. A Moonshot lista o Kimi K3 a $3,00 de entrada, $0,30 de leitura de cache, $15,00 de saída — além de uma taxa de escrita em cache de $3,00 por milhão para um cache de cinco minutos e $6,00 por milhão para um cache de uma hora. Esses são preços publicados, não auditados de forma independente, e qualquer um dos fornecedores pode alterá-los.
Coloque-os em um trabalho que é principalmente leitura: uma revisão de base de código de 600.000 tokens com uma resposta escrita de 8.000 tokens. No GLM-5.2, isso é 0,6 x $1,40 = $0,84 de entrada mais 0,008 x $4,40 = $0,035 de saída, ou cerca de $0,88. No Kimi K3, é 0,6 x $3,00 = $1,80 mais 0,008 x $15,00 = $0,12, ou cerca de $1,92. Aproximadamente 2,2 vezes o custo para o mesmo trabalho.
Agora, execute-o novamente com a base de código já presente na cache do fornecedor. A linha de entrada cai para a tarifa de leitura da cache, e os dois preços que estavam separados por um fator de 2,1x passam a ser $0,26 contra $0,30 por milhão — uma diferença de 15%. Este é o número menos discutido da comparação e o que mais importa para um agente que relê o mesmo contexto a cada turno. Também tem um asterisco: a Kimi K3 cobra separadamente pela escrita na cache e a página do GLM-5.2 não anuncia qualquer encargo de escrita, pelo que um arranque a frio custa significativamente mais na Kimi K3 do que o valor de destaque de $3,00 sugere.
• Uma leitura de 600k tokens com uma resposta de 8k — GLM-5.2 cerca de US$ 0,88 vs Kimi K3 cerca de US$ 1,92
• A mesma linha de entrada em cache — GLM-5.2 US$ 0,16 vs Kimi K3 US$ 0,18 por 600 mil tokens

O modelo independente concorda quanto à direção, mas não quanto à magnitude. A Artificial Analysis combina tokens de cache-hit, de entrada e de saída numa proporção de 7:2:1 e adiciona os tokens de raciocínio que um modelo realmente consome, e seus números para esses dois — lidos em 2026-09-23 segundo seu índice v4.3.2 — colocam o GLM-5.2 a US$ 0,902 por milhão de tokens combinados, contra US$ 2,31 do Kimi K3, e o custo de concluir uma de suas tarefas de avaliação em US$ 0,96 contra US$ 2,00. Executar o Intelligence Index completo uma vez custa US$ 1.559 no GLM-5.2 e US$ 3.658 no Kimi K3.
Há um detalhe contraintuitivo escondido nesse modelo de custos. O Kimi K3 usa menos tokens de saída por tarefa do que o GLM-5.2 — 48.000 contra 64.000 — e menos tokens de raciocínio, 32.000 contra 51.000. É o modelo mais econômico por unidade de trabalho e ainda assim custa cerca de duas vezes mais por tarefa, porque seu preço por token é 2,1x na entrada e 3,4x na saída. Barato por tarefa e barato por token são propriedades diferentes, e este é um caso em que elas apontam em direções opostas.
A janela de contexto, e o que realmente cabe nela
Os dois estão dentro de 5% um do outro no papel: 1.000.000 de tokens contra 1.048.576. Noticiar isso como uma vitória do Kimi K3 seria bobagem. Ambos são modelos de um milhão de tokens e a janela não é um diferencial; a pergunta honesta é o que cada um ainda consegue fazer com texto enterrado no meio dela.
É isso que a avaliação de raciocínio de contexto longo da Artificial Analysis mede, e é uma das lacunas mais amplas do conjunto de dados: o Kimi K3 obtém 89% contra os 78% do GLM-5.2. Se o seu trabalho é carregar um grande corpus e fazer perguntas que exijam unir fatos de extremos opostos dele, os 48.576 tokens extras não são o motivo para escolher o Kimi K3 — a margem de onze pontos em contexto longo é.
O piso sob a janela também difere. O GLM-5.2 publica uma saída máxima de 128.000 tokens; a página do Kimi K3 não publica um número equivalente, então não vamos fornecer um. Se você estiver gerando documentos longos em vez de lê-los, essa assimetria vale a pena ser verificada em relação à sua própria carga de trabalho antes de comprar qualquer um dos dois.
Velocidade: o único eixo que o GLM-5.2 domina por completo
Duas medições independentes apontam na mesma direção aqui, o que vale a pena dizer justamente porque não concordam em tudo.
Os nossos próprios dados de encaminhamento, nos sete dias até 2026-09-23, mostram o GLM-5.2 a responder com uma mediana de 3,28 segundos até ao primeiro token, contra os 8,09 segundos do Kimi K3, e a transmitir 68,1 tokens por segundo, contra 43,4. O p95 do tempo até ao primeiro token de ambos os modelos situa-se exatamente nos 10,00 segundos. A Artificial Analysis, medindo separadamente, coloca o GLM-5.2 em 68,2 tokens de saída por segundo, contra os 36,7 do Kimi K3, em 41,29 segundos ponta a ponta, contra 72,13, e em 33,95 segundos até à primeira resposta, contra 58,52.

As duas fontes divergem em um ponto, e vale a pena destacar isso em vez de passar por cima. O Artificial Analysis coloca o Kimi K3 um pouco à frente no tempo bruto até o primeiro token, 4,08 segundos contra 4,62, enquanto nosso próprio roteamento aponta o GLM-5.2 como quase duas vezes e meia mais rápido no p50. Endpoints diferentes, provedores upstream diferentes, janelas diferentes. Trate a direção da vazão — GLM-5.2 consideravelmente mais rápido — como sólida, e trate qualquer número isolado de tempo até o primeiro token, nosso ou deles, como uma propriedade de uma semana específica.
Há também um número na nossa página do GLM-5.2 que não vamos deixar de fora em silêncio: ao longo dos mesmos sete dias, ele mostra uma taxa de erro de 9,2%, contra 0,26% do Kimi K3. Uma diferença desse tamanho tem tanta probabilidade de ser uma semana ruim para os provedores upstream que atendem o GLM-5.2 quanto uma característica do modelo, e sete dias não são uma janela longa o suficiente para distinguir uma coisa da outra. É o tipo de problema que o roteamento existe para resolver — quando um provedor está falhando uma solicitação em onze, o failover automático move o tráfego sem que ninguém precise acionar o plantão.

Benchmarks: uma varredura real, mais restrita do que a manchete
Kimi K3 vence quase tudo em que ambos os modelos foram executados. Estes são números da Artificial Analysis segundo a revisão v4.3.2 do índice, com ambos os modelos em sua configuração de raciocínio máximo, consultados em 2026-09-23:
• Índice de Inteligência — Kimi K3 44 vs GLM-5.2 34
• AA-Briefcase v1.1 — 1510 vs 1233
• GDPval-AA v2.1 — 1524 vs 1358
• AutomationBench-AA — 58% vs 28%
• Terminal-Bench 4.0 — 13% vs 1%
• SciCode — 59% vs. 51%
• Humanity's Last Exam — 47% vs 41%
• GDP.pdf — 22% vs 10%
• AA-LCR v1.1 — 89% vs 78%
• CritPt — 23% vs 21%
Duas ressalvas antes que alguém tire print dessa lista.
Primeiro, a revisão do índice. A cobertura do lançamento do Kimi K3 em julho citava-o em 57 no Intelligence Index, com o GLM-5.2 em 51. As páginas ao vivo de hoje dizem 44 e 34. Essas não são a mesma medição — a Artificial Analysis revisa o índice e recalcula as pontuações dos modelos com base nele, e colocar um número de julho ao lado de um número de setembro é o erro mais fácil de cometer nessa comparação. A direção é estável em todos os instantâneos; os números absolutos não são comparáveis entre revisões.
Segundo, os níveis. O Terminal-Bench 4.0 com 13% e 1% é uma avaliação difícil, e nesse patamar a proporção diz mais do que qualquer um dos números. O AA-Omniscience, que testa se um modelo conhece os limites do próprio conhecimento, coloca o GLM-5.2 em 4 contra 20 do Kimi K3 — um piso que vale a pena conhecer se você planeja executar qualquer um deles sem supervisão.
Mais uma coisa que a Artificial Analysis registra sobre a listagem do GLM-5.2: ela marca a configuração de raciocínio máximo como obsoleta em favor do mais recente GLM-5.3. Isso não altera nenhum dos números acima, que são um instantâneo do GLM-5.2 tal como foi medido, mas significa que o roadmap da Z.ai já avançou além deste modelo. Em um endpoint roteado, isso custa uma string de modelo em vez de uma migração, que é o principal argumento para não fixar no código nenhum desses nomes em seu aplicativo.
Agentes e uso de ferramentas: onde a lacuna é maior
Se um bloco dessa tabela deve decidir a compra, é este. O trabalho agêntico de longo prazo é onde a margem do Kimi K3 é maior e mais consistente:
• AutomationBench-AA — 58% vs 28%, uma diferença de 30 pontos
• GDPval-AA v2.1 — 1524 vs 1358
• AA-Briefcase v1.1 — 1510 vs 1233
• Terminal-Bench 4.0 — 13% vs 1%
O próprio material de lançamento da Moonshot se apoia na mesma narrativa — o lançamento dos pesos do K3 veio acompanhado de um relatório técnico que aborda a pilha de treinamento com paralelismo de especialistas do fornecedor e um harness de ambiente de agente —, mas material de fornecedor é material de fornecedor, e os números acima são os independentes.
O agregador terceirizado LLM Stats, que executa seu próprio composto sobre um conjunto de benchmarks compartilhado, chega à mesma conclusão por um caminho diferente: dos onze benchmarks que avalia para ambos os modelos, o Kimi K3 vence todos os onze, e suas pontuações por categoria colocam o Kimi K3 à frente em uso de ferramentas (30,8 vs 19,6), agentes (38,3 vs 29,6) e codificação (42,3 vs 34,8). Esses são os compostos próprios do LLM Stats sob sua própria ponderação, em um conjunto compartilhado que não é grande, então trate-os como corroboração, e não como resultado de laboratório. Onze de onze ainda não é uma disputa acirrada.
Codificação
Mesma direção, margem menor. Nas avaliações de codificação que a Artificial Analysis pontua para ambos, o Kimi K3 lidera o SciCode por 59% a 51%; no conjunto compartilhado do LLM Stats, ele conquista DeepSWE, DeepSWE 1.1, FrontierSWE, SWE-Marathon, Program Bench e Terminal-Bench 2.1. Os números lisonjeiros do GLM-5.2 — 99,2% no AIME 2026, 94,4% no HMMT 2025, 91,2% no GPQA conforme divulgados por agregadores terceiros — são reportados pelo fornecedor e não reproduzidos, e a maioria deles mede matemática de competição, e não engenharia de software.
A leitura prática: para um agente de programação que funciona por muito tempo, edita muitos arquivos e precisa se recuperar dos próprios erros, a margem agêntica do Kimi K3 é o sinal mais relevante do que as pontuações de matemática de qualquer um dos modelos. Para um assistente de código rápido, barato e em grande parte de execução única, a vantagem de throughput do GLM-5.2 vale mais do que o custo da diferença nos benchmarks.
Onde estão suficientemente próximos para que isso não importe
• Preço de entrada em cache — US$ 0,26 vs US$ 0,30 por milhão, uma diferença de 15% contra uma diferença de 3,4x na saída
• Janela de contexto — 1.000.000 vs 1.048.576 tokens
• p95 tempo até o primeiro token — 10,00 s vs 10,00 s no nosso próprio roteamento
• CritPt — 23% vs 21%
• Matemática — O LLM Stats coloca o GLM-5.2 marginalmente à frente em seu composto de matemática (41,4 vs 40,9), enquanto o Kimi K3 lidera em matemática com imagens; pelas evidências disponíveis, nenhum dos modelos domina a aritmética
Quem lhe disser que um desses modelos é o dobro do outro em todos os aspectos está lendo uma única linha da tabela.
Escolha o GLM-5.2 se…
Você está pagando a conta, e a conta é a restrição. O GLM-5.2 custa aproximadamente um terço do preço de saída, também é mais barato na linha de cache, tem licença MIT sem gatilho de receita para verificar, é mais rápido na mediana e muito mais rápido ao fazer streaming, e sua janela de um milhão de tokens é suficientemente próxima da do Kimi K3 para que a diferença nunca decida nada. Se sua carga de trabalho é texto de entrada e texto de saída, e consiste principalmente em leitura, e não em longas cadeias de chamadas de ferramentas, os pontos extras de benchmark no Kimi K3 são pontos que sua aplicação nunca vai coletar.
Escolha o Kimi K3 se…
O trabalho é agêntico e longo. A diferença de 30 pontos no AutomationBench, as vantagens no GDPval e no AA-Briefcase, a margem de onze pontos em raciocínio de contexto longo e o domínio do conjunto compartilhado do LLM Stats apontam todas na mesma direção: o Kimi K3 é o melhor modelo para entregar uma tarefa de várias etapas e ir embora. É também o único dos dois que aceita imagens. Você pagará aproximadamente o dobro por tarefa por isso, e se o seu conjunto de trabalho estiver fortemente em cache, pagará menos que o dobro — mas o argumento a favor dele não é o preço, e não é a velocidade.
Ambos são roteáveis no OrcaRouter a partir de uma única chave contra um único endpoint compatível com OpenAI, aos preços de tabela dos provedores, sem nada acrescentado por cima, e ambos ficam atrás do mesmo failover automático. Essa é a maneira mais barata de descobrir qual deles sua carga de trabalho realmente quer, porque alternar entre eles é uma string de modelo, e não um contrato.
Comparados neste artigo2
Detectado a partir deste artigo · Benchmarks: Artificial Analysis · atualizado diariamente
