Qwen 3.8 vs Kimi K3: Dois gigantes chineses, e agora um está mais barato
Guides & Insights

Qwen 3.8 vs Kimi K3: Dois gigantes chineses, e agora um está mais barato

Autor

Rowan Sterling

Data de publicação

Modelos mais recentes · 20Ver todos os modelos
Benchmarks: Artificial Analysis · atualizado diariamente
Voltar para todas as publicações

Estes são os dois modelos de fronteira chineses mais importantes de 2026, e são primos próximos: ambos enormes sistemas de Mistura de Especialistas esparsa, ambos com contexto de 1M-token, ambos multimodais, ambos prometendo pesos abertos. Kimi K3 da Moonshot é na verdade o maior dos dois, com 2,8T de parâmetros totais contra os 2,4T da Qwen — um lembrete útil de que a contagem de parâmetros não é um ranking.

Até 3 de agosto de 2026, essa comparação era desequilibrada de uma forma específica: o Kimi K3 tinha um Artificial Analysis Intelligence Index auditado de 57,1, uma classificação #1 da LMArena em código frontend, preços publicados e pesos disponibilizados, enquanto o Qwen3.8-Max tinha 2,4T como manchete e nada mais. A GA mudou a economia de forma decisiva. A Qwen agora publica US$ 2 / US$ 6 por milhão de tokens contra US$ 3 / US$ 15 da Kimi — o que faz do modelo maior e mais bem comprovado o mais caro por uma ampla margem.

Uma nota para desenvolvedores — a maneira mais rápida de resolver isso é executar ambos com seus próprios prompts. O OrcaRouter disponibiliza mais de 200 modelos em um único endpoint compatível com OpenAI, para que você possa colocar o Qwen 3.8 Max contra o Kimi K3 na mesma tarefa sem precisar integrar dois SDKs.

TL;DR: veredito. Kimi K3 ainda vence em evidências: um índice auditado, o AA Intelligence Index de 57,1 (#3), a posição #1 em frontend-code da LMArena a 1679, e pesos abertos que estão realmente prontos. Qwen3.8-Max não foi pontuado por nenhum avaliador independente. Mas a GA deu a Qwen duas vantagens reais. No preço, agora está substancialmente mais barato — $2 / $6 contra $3 / $15, o que significa 2,5× menos na saída. E no único teste de terceiros frente a frente que existe, Qwen perdeu o confronto principal por 80 a 83, apesar de ser visivelmente o agente mais bem-comportado: 354 citações de repositório contra 274, 22 solicitações de gateway contra 53 e zero chamadas de ferramenta com falha contra duas. Kimi pela qualidade auditada; Qwen pela execução agêntica mais barata e limpa.

Principais conclusões

Kimi K3 é o modelo maior — 2.8T MoE contra 2.4T da Qwen, cerca de 400B a mais — o que é um bom argumento contra tratar a contagem de parâmetros como um indicador de capacidade.

Qwen3.8-Max está em GA desde 3 de agosto de 2026 a $2 / $6 por 1M flat, versus Kimi K3, que tem $3 / $15 (AA blended ~$2.31). Qwen agora está 2,5× mais barato na saída.

Kimi K3 detém a classificação auditada: AA Intelligence Index 57.1 (#3), atrás apenas de Fable 5 e GPT-5.6 Sol, além de LMArena frontend-code #1 (1679). O Qwen3.8-Max está ainda sem pontuação.

No único teste direto (Trilogy AI), a Kimi superou a Qwen por 83 a 80 no geral — mas a Qwen fez mais citações de repositório (354 vs 274), menos requisições de gateway (22 vs 53), e teve zero chamadas de ferramenta com falha (vs duas), com uma avaliação de uso de ferramentas de 9/10 contra 8/10 da Kimi.

A Qwen agora reporta números de agentes e de codificação: Terminal-Bench 2.1 86.6, OSWorld-Verified 86.1, FrontierSWE 73.5 (contra os 40.7 do predecessor) — todos relatados pela Alibaba.

O cronograma de abertura ainda favorece a Kimi: seus pesos estão essencialmente prontos; os da Qwen são prometidos para esta semana, sem licença ou repositório ainda.

Nota de precisão: todos os números de qualidade do Qwen3.8-Max são relatados pela Alibaba e não verificados por terceiros. Os números do Kimi K3 vêm da Artificial Analysis e do LMArena. A comparação direta é um único teste da Trilogy AI e deve ser lida como um ponto de dados, não como uma classificação geral. O preço do Qwen é a tabela de tarifas de GA e substitui o desconto de pré-visualização de julho.

Especificações e preço, lado a lado

Aqui estão os dados concretos, cada número atribuído à sua fonte.

• Fabricante / status — Qwen3.8-Max: Alibaba; GA (3 de agosto de 2026); Kimi K3: Moonshot; lançamento de pesos abertos

• Arquitetura — Qwen3.8-Max: ~2.4T total, MoE esparso (parâmetros ativos ainda não divulgados); Kimi K3: 2.8T MoE, visão nativa (Artificial Analysis)

• Janela de contexto — Qwen3.8-Max: 1M tokens (983.616 com pensamento; saída máxima 131.072); Kimi K3: 1M tokens (Artificial Analysis)

• AA Intelligence Index — Qwen3.8-Max: Ainda sem pontuação; Kimi K3: 57.1 — #3 (Artificial Analysis)

• Arena / classificação — Qwen3.8-Max: Sem pontuação pública; Kimi K3: Frontend-code #1, 1679 (LMArena)

• Pontuações relatadas pelo fornecedor — Qwen3.8-Max: Terminal-Bench 2.1 86.6, GPQA Diamond 92.6, OSWorld-Verified 86.1 (relatado pela Alibaba); Kimi K3: posição é medida por terceiros

• Preços (entrada / saída) — Qwen3.8-Max: $2.00 / $6.00 por 1M, fixo; entrada em cache $0.25; Kimi K3: $3 / $15 por 1M (AA combinado ~$2.31), acertos de cache $0.30

• Pesos abertos — Qwen3.8-Max: Prometido para esta semana (sem licença ainda); Kimi K3: Pesos abertos; pesos prontos

• Velocidade — Qwen3.8-Max: p50 TTFT 1.64s (telemetria de 7 dias do OrcaRouter); Kimi K3: verboso e lento (~34s TTFT, segundo AA)

Duas coisas enquadram essa comparação, e uma delas se reverteu completamente em 3 de agosto.

Primeiro, a relação de preços se inverteu. Até julho, Kimi K3 era o modelo com preço real e Qwen era o modelo com cupom de desconto. Agora ambos publicam tarifas, e o modelo mais comprovado e maior é o mais caro: $3 / $15 contra $2 / $6. Na saída — onde raciocínio e geração de código gastam seu dinheiro — Kimi custa 2.5× mais. A Qwen também cobra uma tarifa fixa em todo o seu contexto de 1M de tokens, e sua entrada em cache a $0.25 fica ligeiramente abaixo da taxa de acerto de cache de $0.30 da Kimi. Para qualquer carga de trabalho de alto volume, a economia da Qwen agora é claramente melhor.

Segundo, a lacuna de prova permanece inalterada, e é por isso que a Kimi ainda vence. O Índice de Inteligência 57.1 da Kimi K3 a coloca em terceiro lugar no geral, atrás apenas de Fable 5 e GPT-5.6 Sol — esse é o veredito de um avaliador neutro. Seu #1 em frontend-code no LMArena com 1679 é um resultado de crowdsourcing de muitas comparações cegas. Os números Terminal-Bench 86.6 e GPQA Diamond 92.6 da Qwen são reais, mas são da própria Alibaba, em uma plataforma que ninguém mais executou. Uma âncora útil: o antecessor Qwen3.7-Max obteve 46 no índice AA contra os 57.1 da Kimi, então a Qwen precisa de um grande salto geracional apenas para empatar.

Há também uma peculiaridade de latência que vale a pena notar, porque ela contraria a história usual. Artificial Analysis mede o Kimi K3 em aproximadamente 34 segundos de tempo até o primeiro token — realmente lento. A telemetria de GA do OrcaRouter mostra o Qwen3.8-Max com um TTFT p50 de 1,64 segundos. Essas medições vêm de fontes diferentes e não são uma comparação controlada, mas complicam a suposição da era de pré-visualização de que o Qwen é o mais lento do par.

O único teste comparativo direto, leia atentamente.

Este é o único confronto da série em que um terceiro executou ambos os modelos frente a frente na mesma tarefa, o que faz valer a pena ler atentamente em vez de resumir a um vencedor.

A Trilogy AI executou uma tarefa de compreensão de arquitetura — compreender um repositório real e chegar a uma conclusão arquitetural correta — e avaliou os resultados:

• Pontuação geral — Qwen3.8-Max: 80 / 100; Kimi K3: 83 / 100

• Citações de repositório — Qwen3.8-Max: 354; Kimi K3: 274

• Requisições de gateway — Qwen3.8-Max: 22; Kimi K3: 53

• Falhas em chamadas de ferramenta — Qwen3.8-Max: 0; Kimi K3: 2

• Avaliação de uso de ferramentas — Qwen3.8-Max: 9 / 10; Kimi K3: 8 / 10

• Taxa de acerto de cache — Qwen3.8-Max: >90%; Kimi K3: >90%

Kimi venceu as manchetes por três pontos. Mas observe as colunas de processo, porque para engenharia de agentes elas importam mais do que a pontuação. Qwen chegou à mesma conclusão arquitetural central usando menos da metade das solicitações de gateway enquanto produzia 29% mais citações de fundamentação e — o detalhe que deveria interessar a qualquer pessoa que construa agentes — zero chamadas de ferramenta com falha contra as duas da Kimi.

Chamadas de ferramentas com falha são o que realmente quebram agentes de produção. Elas se propagam: uma chamada malformada produz um erro que o modelo deve interpretar, o que consome turnos, o que arrisca erros adicionais. Um modelo que faz 22 solicitações limpas enquanto outro faz 53 com duas falhas é mais barato e mais previsível de operar, mesmo que pontue três pontos a menos na resposta. Combinado com a taxa de saída 2,5× mais barata da Qwen, a economia operacional dessa execução favorece substancialmente a Qwen.

A ressalva é que isto é uma tarefa, um avaliador, uma execução. Isso não é uma suíte de benchmarks e não generaliza. O índice 57.1 da Kimi e o ranking #1 de frontend baseiam-se em muito mais evidências do que este único teste. A conclusão correta é restrita: em pelo menos uma tarefa agêntica realista, o Qwen foi o usuário de ferramentas mais disciplinado, embora tenha perdido ligeiramente em qualidade de saída.

Custo na prática: execuções agênticas em volume

Considere um agente de análise de repositório: 250.000 tokens de contexto de código por execução, 12.000 tokens de saída.

Qwen3.8-Max: 0,25M × $2 = $0,50, mais 0,012M × $6 = $0,072. ≈ $0,57 por execução.

Kimi K3: 0,25M × $3 = $0,75, mais 0,012M × $15 = $0,18. ≈ $0,93 por execução.

• A 1.500 execuções/dia: Qwen ≈ $858/dia; Kimi ≈ $1.395/dia — cerca de $16.000/mês de diferença.

• Com cache em um repositório estável: a entrada em cache da Qwen a $0.25/1M leva a execução para ≈ $0.14; a taxa de acerto de cache de $0.30 da Kimi leva a ≈ $0.26.

A lacuna é real em ambas as extremidades, e o resultado do Trilogy a agrava: se o Qwen realmente usa menos da metade das solicitações de gateway para concluir trabalhos comparáveis, a diferença de custo efetiva em tarefas agênticas é mais ampla do que a tabela de preços sozinha sugere.

Ambos os modelos cobram tokens de raciocínio como saída, então configurações com uso intenso de raciocínio custam mais do que a estimativa ingênua em ambos os casos — mas a tarifa de US$ 6 da Qwen torna essa penalidade 2,5× menor.

Abertura: quase paridade, ritmo diferente

Este é o eixo em que os dois mais se assemelham, e a diferença é puramente uma questão de prontidão. Os pesos do Kimi K3 estão abertos e essencialmente prontos. Os do Qwen3.8-Max foram prometidos para esta semana, sem texto de licença, ficha técnica do modelo ou repositório ainda — e é a licença que determina se você pode usar um modelo comercialmente ou não.

Na prática, nenhum dos dois modelos principais é auto-hospedável por uma equipe normal. O Qwen, com 2,4T, ocupa aproximadamente 1,2 TB em 4 bits, contra cerca de 141 GB por H200; o Kimi, com 2,8T, é ainda maior. Ambos precisam de oito ou mais aceleradores de última geração, e a contagem não divulgada de parâmetros ativos da Alibaba significa que você não consegue sequer modelar o throughput do Qwen.

É por isso que o simultaneamente anunciado Qwen3.8-27B importa aqui. Também com pesos abertos e, segundo relatos, rodando em cerca de 17GB de VRAM, isso dá à família Qwen uma história genuína de implantação local que nem o carro-chefe de 2.4T nem o de 2.8T oferece. Se pesos abertos são sua razão real para escolher entre esses dois, o 27B muda a equação mais do que qualquer um dos gigantes.

Perguntas Frequentes

Qwen 3.8 é melhor que Kimi K3?

Não com base em evidência auditada. Kimi K3 detém um AA Intelligence Index independente de 57,1 (#3) e o primeiro lugar da LMArena em código frontend, enquanto Qwen3.8-Max permanece sem nota de nenhum avaliador terceirizado. No único teste direto disponível, Kimi venceu por 83 a 80. As vantagens da Qwen são o preço (saída 2,5× mais barata) e, nesse mesmo teste, uso de ferramentas mais limpo.

Qual modelo é maior?

Kimi K3, com 2,8T de parâmetros totais contra os 2,4T do Qwen3.8-Max — cerca de 400B a mais. No entanto, nenhum dos dois divulga o suficiente para que isso seja significativo: a Alibaba nunca publicou a contagem de parâmetros ativos do Qwen, que é o número que de fato determina o custo de servir em um modelo Mixture-of-Experts.

Qual é mais barato?

Qwen3.8-Max, claramente, desde o GA. Ele lista $2 / $6 por 1M contra $3 / $15 do Kimi K3 — 33% menos na entrada e 2.5× menos na saída. A taxa do Qwen é fixa em todo o contexto de 1M, e sua entrada em cache a $0.25 fica ligeiramente abaixo da taxa de cache-hit de $0.30 do Kimi.

O que o teste comparativo realmente mostrou?

A tarefa de compreensão de arquitetura da Trilogy AI atribuiu 83 a Kimi e 80 a Qwen. Mas Qwen produziu 354 citações de repositório contra 274 de Kimi, usou 22 solicitações de gateway contra 53, registrou zero chamadas de ferramenta com falha contra duas e obteve 9/10 em uso de ferramentas contra 8/10 de Kimi. Kimi deu a melhor resposta; Qwen foi o agente mais disciplinado. É apenas uma tarefa, então trate-a como um ponto de dados em vez de um ranking.

O Qwen 3.8 Max saiu do preview?

Sim, em 3 de agosto de 2026, com uma tabela de preços publicada e um endpoint compatível com OpenAI e DashScope. A campanha de créditos Qoder de julho não descreve mais como ele é vendido.

Qual é o mais rápido?

Possivelmente o Qwen agora, o que reverte a suposição da era de pré-visualização. A Artificial Analysis mede o Kimi K3 em cerca de 34 segundos de tempo até o primeiro token; a telemetria GA de 7 dias da OrcaRouter mostra o Qwen3.8-Max com um TTFT p50 de 1,64 segundos. São fontes diferentes e não uma comparação controlada, mas ambos os modelos têm reputação de verbosidade, e o TTFT medido do Kimi é genuinamente lento.

Posso auto-hospedar qualquer um deles?

Não é realista em escala de flagship — modelos de 2,4T e 2,8T precisam de oito ou mais GPUs classe H200. Os pesos da Kimi estão prontos hoje; os da Qwen são prometidos dentro da semana, ainda sem licença. Para uma opção genuinamente on-premise, o Qwen3.8-27B anunciado simultaneamente (supostamente ~17GB de VRAM) é a escolha prática na família Qwen.

Conclusão

Qwen 3.8 vs Kimi K3 é o confronto mais próximo desta série, e a disponibilidade geral o dividiu claramente em dois eixos. Kimi K3 mantém a coroa da qualidade com base em medições feitas por um árbitro: 57,1 no Intelligence Index, terceiro no geral, e o primeiro lugar em código frontend da LMArena. Esses não são alegações — são resultados, e a Qwen não tem nada equivalente.

O que a Qwen venceu em 3 de agosto foi a questão econômica, e ela a venceu de forma decisiva: $2 / $6 contra $3 / $15, fixos em um milhão de tokens, com cache ligeiramente mais barato. Some a isso a descoberta da Trilogy de que a Qwen concluiu uma tarefa agêntica comparável com metade das requisições de gateway e zero chamadas de ferramenta com falha, e a Qwen parece ser o modelo operacionalmente mais eficiente, mesmo onde é o menos preciso. Observe dois eventos: a primeira pontuação independente do Intelligence Index para o Qwen3.8-Max, e a disponibilização dos pesos sob uma licença. Se a Qwen pontuar perto dos 57.1 da Kimi, a diferença de preço torna muito difícil justificar a Kimi para trabalho em volume. Até lá, a Kimi é o modelo em que você confia, e a Qwen é o modelo que você pode pagar para rodar — e a forma honesta de escolher é nos seus próprios repositórios.

Comparados neste artigo2

Detectado a partir deste artigo · Benchmarks: Artificial Analysis · atualizado diariamente