
Qwen 3.8 vs Kimi K3: Dois gigantes chineses, e agora um está mais barato
- openaiNOVOOpenAI: GPT-6 Luna2026-09-2237Inteligência
- openaiNOVOOpenAI: GPT-6 Sol2026-09-2248Inteligência
- anthropicNOVOAnthropic: Claude Opus 5.52026-09-2258Inteligência
- grokNOVOGrok 4.72026-09-2146Inteligência
- OrcaNOVOOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 por 1M de tokens · 177 tok/s
- orcaNOVOOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 por 1M de tokens · 1323 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligência
- openaiOpenAI: GPT-6 Astra2026-09-0453Inteligência77Código
- googleGoogle: Gemini 3.8 Flash2026-09-0241Inteligência76Código
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Inteligência76Código
- anthropicAnthropic: Claude Fable 5.12026-09-0153Inteligência82Código
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 por 1M de tokens · 108 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligência72Código
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 por 1M de tokens · 220 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Inteligência75Código
- obsidianQwen3.8 27B2026-08-1534Inteligência68Código
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Inteligência69Código
- grokSpaceXAI: Grok 4.62026-08-1244Inteligência77Código
- metaMeta: Muse Spark 1.22026-08-0540Inteligência72Código
- qwenQwen: Qwen3.8 Max2026-08-0345Inteligência76Código
Estes são os dois modelos de fronteira chineses mais importantes de 2026, e são primos próximos: ambos enormes sistemas de Mistura de Especialistas esparsa, ambos com contexto de 1M-token, ambos multimodais, ambos prometendo pesos abertos. Kimi K3 da Moonshot é na verdade o maior dos dois, com 2,8T de parâmetros totais contra os 2,4T da Qwen — um lembrete útil de que a contagem de parâmetros não é um ranking.
Até 3 de agosto de 2026, essa comparação era desequilibrada de uma forma específica: o Kimi K3 tinha um Artificial Analysis Intelligence Index auditado de 57,1, uma classificação #1 da LMArena em código frontend, preços publicados e pesos disponibilizados, enquanto o Qwen3.8-Max tinha 2,4T como manchete e nada mais. A GA mudou a economia de forma decisiva. A Qwen agora publica US$ 2 / US$ 6 por milhão de tokens contra US$ 3 / US$ 15 da Kimi — o que faz do modelo maior e mais bem comprovado o mais caro por uma ampla margem.
Uma nota para desenvolvedores — a maneira mais rápida de resolver isso é executar ambos com seus próprios prompts. O OrcaRouter disponibiliza mais de 200 modelos em um único endpoint compatível com OpenAI, para que você possa colocar o Qwen 3.8 Max contra o Kimi K3 na mesma tarefa sem precisar integrar dois SDKs.
TL;DR: veredito. Kimi K3 ainda vence em evidências: um índice auditado, o AA Intelligence Index de 57,1 (#3), a posição #1 em frontend-code da LMArena a 1679, e pesos abertos que estão realmente prontos. Qwen3.8-Max não foi pontuado por nenhum avaliador independente. Mas a GA deu a Qwen duas vantagens reais. No preço, agora está substancialmente mais barato — $2 / $6 contra $3 / $15, o que significa 2,5× menos na saída. E no único teste de terceiros frente a frente que existe, Qwen perdeu o confronto principal por 80 a 83, apesar de ser visivelmente o agente mais bem-comportado: 354 citações de repositório contra 274, 22 solicitações de gateway contra 53 e zero chamadas de ferramenta com falha contra duas. Kimi pela qualidade auditada; Qwen pela execução agêntica mais barata e limpa.
Principais conclusões
• Kimi K3 é o modelo maior — 2.8T MoE contra 2.4T da Qwen, cerca de 400B a mais — o que é um bom argumento contra tratar a contagem de parâmetros como um indicador de capacidade.
• Qwen3.8-Max está em GA desde 3 de agosto de 2026 a $2 / $6 por 1M flat, versus Kimi K3, que tem $3 / $15 (AA blended ~$2.31). Qwen agora está 2,5× mais barato na saída.
• Kimi K3 detém a classificação auditada: AA Intelligence Index 57.1 (#3), atrás apenas de Fable 5 e GPT-5.6 Sol, além de LMArena frontend-code #1 (1679). O Qwen3.8-Max está ainda sem pontuação.
• No único teste direto (Trilogy AI), a Kimi superou a Qwen por 83 a 80 no geral — mas a Qwen fez mais citações de repositório (354 vs 274), menos requisições de gateway (22 vs 53), e teve zero chamadas de ferramenta com falha (vs duas), com uma avaliação de uso de ferramentas de 9/10 contra 8/10 da Kimi.
• A Qwen agora reporta números de agentes e de codificação: Terminal-Bench 2.1 86.6, OSWorld-Verified 86.1, FrontierSWE 73.5 (contra os 40.7 do predecessor) — todos relatados pela Alibaba.
• O cronograma de abertura ainda favorece a Kimi: seus pesos estão essencialmente prontos; os da Qwen são prometidos para esta semana, sem licença ou repositório ainda.
Nota de precisão: todos os números de qualidade do Qwen3.8-Max são relatados pela Alibaba e não verificados por terceiros. Os números do Kimi K3 vêm da Artificial Analysis e do LMArena. A comparação direta é um único teste da Trilogy AI e deve ser lida como um ponto de dados, não como uma classificação geral. O preço do Qwen é a tabela de tarifas de GA e substitui o desconto de pré-visualização de julho.
Especificações e preço, lado a lado
Aqui estão os dados concretos, cada número atribuído à sua fonte.
• Fabricante / status — Qwen3.8-Max: Alibaba; GA (3 de agosto de 2026); Kimi K3: Moonshot; lançamento de pesos abertos
• Arquitetura — Qwen3.8-Max: ~2.4T total, MoE esparso (parâmetros ativos ainda não divulgados); Kimi K3: 2.8T MoE, visão nativa (Artificial Analysis)
• Janela de contexto — Qwen3.8-Max: 1M tokens (983.616 com pensamento; saída máxima 131.072); Kimi K3: 1M tokens (Artificial Analysis)
• AA Intelligence Index — Qwen3.8-Max: Ainda sem pontuação; Kimi K3: 57.1 — #3 (Artificial Analysis)
• Arena / classificação — Qwen3.8-Max: Sem pontuação pública; Kimi K3: Frontend-code #1, 1679 (LMArena)
• Pontuações relatadas pelo fornecedor — Qwen3.8-Max: Terminal-Bench 2.1 86.6, GPQA Diamond 92.6, OSWorld-Verified 86.1 (relatado pela Alibaba); Kimi K3: posição é medida por terceiros
• Preços (entrada / saída) — Qwen3.8-Max: $2.00 / $6.00 por 1M, fixo; entrada em cache $0.25; Kimi K3: $3 / $15 por 1M (AA combinado ~$2.31), acertos de cache $0.30
• Pesos abertos — Qwen3.8-Max: Prometido para esta semana (sem licença ainda); Kimi K3: Pesos abertos; pesos prontos
• Velocidade — Qwen3.8-Max: p50 TTFT 1.64s (telemetria de 7 dias do OrcaRouter); Kimi K3: verboso e lento (~34s TTFT, segundo AA)
Duas coisas enquadram essa comparação, e uma delas se reverteu completamente em 3 de agosto.
Primeiro, a relação de preços se inverteu. Até julho, Kimi K3 era o modelo com preço real e Qwen era o modelo com cupom de desconto. Agora ambos publicam tarifas, e o modelo mais comprovado e maior é o mais caro: $3 / $15 contra $2 / $6. Na saída — onde raciocínio e geração de código gastam seu dinheiro — Kimi custa 2.5× mais. A Qwen também cobra uma tarifa fixa em todo o seu contexto de 1M de tokens, e sua entrada em cache a $0.25 fica ligeiramente abaixo da taxa de acerto de cache de $0.30 da Kimi. Para qualquer carga de trabalho de alto volume, a economia da Qwen agora é claramente melhor.
Segundo, a lacuna de prova permanece inalterada, e é por isso que a Kimi ainda vence. O Índice de Inteligência 57.1 da Kimi K3 a coloca em terceiro lugar no geral, atrás apenas de Fable 5 e GPT-5.6 Sol — esse é o veredito de um avaliador neutro. Seu #1 em frontend-code no LMArena com 1679 é um resultado de crowdsourcing de muitas comparações cegas. Os números Terminal-Bench 86.6 e GPQA Diamond 92.6 da Qwen são reais, mas são da própria Alibaba, em uma plataforma que ninguém mais executou. Uma âncora útil: o antecessor Qwen3.7-Max obteve 46 no índice AA contra os 57.1 da Kimi, então a Qwen precisa de um grande salto geracional apenas para empatar.
Há também uma peculiaridade de latência que vale a pena notar, porque ela contraria a história usual. Artificial Analysis mede o Kimi K3 em aproximadamente 34 segundos de tempo até o primeiro token — realmente lento. A telemetria de GA do OrcaRouter mostra o Qwen3.8-Max com um TTFT p50 de 1,64 segundos. Essas medições vêm de fontes diferentes e não são uma comparação controlada, mas complicam a suposição da era de pré-visualização de que o Qwen é o mais lento do par.

O único teste comparativo direto, leia atentamente.
Este é o único confronto da série em que um terceiro executou ambos os modelos frente a frente na mesma tarefa, o que faz valer a pena ler atentamente em vez de resumir a um vencedor.
A Trilogy AI executou uma tarefa de compreensão de arquitetura — compreender um repositório real e chegar a uma conclusão arquitetural correta — e avaliou os resultados:
• Pontuação geral — Qwen3.8-Max: 80 / 100; Kimi K3: 83 / 100
• Citações de repositório — Qwen3.8-Max: 354; Kimi K3: 274
• Requisições de gateway — Qwen3.8-Max: 22; Kimi K3: 53
• Falhas em chamadas de ferramenta — Qwen3.8-Max: 0; Kimi K3: 2
• Avaliação de uso de ferramentas — Qwen3.8-Max: 9 / 10; Kimi K3: 8 / 10
• Taxa de acerto de cache — Qwen3.8-Max: >90%; Kimi K3: >90%
Kimi venceu as manchetes por três pontos. Mas observe as colunas de processo, porque para engenharia de agentes elas importam mais do que a pontuação. Qwen chegou à mesma conclusão arquitetural central usando menos da metade das solicitações de gateway enquanto produzia 29% mais citações de fundamentação e — o detalhe que deveria interessar a qualquer pessoa que construa agentes — zero chamadas de ferramenta com falha contra as duas da Kimi.
Chamadas de ferramentas com falha são o que realmente quebram agentes de produção. Elas se propagam: uma chamada malformada produz um erro que o modelo deve interpretar, o que consome turnos, o que arrisca erros adicionais. Um modelo que faz 22 solicitações limpas enquanto outro faz 53 com duas falhas é mais barato e mais previsível de operar, mesmo que pontue três pontos a menos na resposta. Combinado com a taxa de saída 2,5× mais barata da Qwen, a economia operacional dessa execução favorece substancialmente a Qwen.
A ressalva é que isto é uma tarefa, um avaliador, uma execução. Isso não é uma suíte de benchmarks e não generaliza. O índice 57.1 da Kimi e o ranking #1 de frontend baseiam-se em muito mais evidências do que este único teste. A conclusão correta é restrita: em pelo menos uma tarefa agêntica realista, o Qwen foi o usuário de ferramentas mais disciplinado, embora tenha perdido ligeiramente em qualidade de saída.

Custo na prática: execuções agênticas em volume
Considere um agente de análise de repositório: 250.000 tokens de contexto de código por execução, 12.000 tokens de saída.
• Qwen3.8-Max: 0,25M × $2 = $0,50, mais 0,012M × $6 = $0,072. ≈ $0,57 por execução.
• Kimi K3: 0,25M × $3 = $0,75, mais 0,012M × $15 = $0,18. ≈ $0,93 por execução.
• A 1.500 execuções/dia: Qwen ≈ $858/dia; Kimi ≈ $1.395/dia — cerca de $16.000/mês de diferença.
• Com cache em um repositório estável: a entrada em cache da Qwen a $0.25/1M leva a execução para ≈ $0.14; a taxa de acerto de cache de $0.30 da Kimi leva a ≈ $0.26.
A lacuna é real em ambas as extremidades, e o resultado do Trilogy a agrava: se o Qwen realmente usa menos da metade das solicitações de gateway para concluir trabalhos comparáveis, a diferença de custo efetiva em tarefas agênticas é mais ampla do que a tabela de preços sozinha sugere.
Ambos os modelos cobram tokens de raciocínio como saída, então configurações com uso intenso de raciocínio custam mais do que a estimativa ingênua em ambos os casos — mas a tarifa de US$ 6 da Qwen torna essa penalidade 2,5× menor.
Abertura: quase paridade, ritmo diferente
Este é o eixo em que os dois mais se assemelham, e a diferença é puramente uma questão de prontidão. Os pesos do Kimi K3 estão abertos e essencialmente prontos. Os do Qwen3.8-Max foram prometidos para esta semana, sem texto de licença, ficha técnica do modelo ou repositório ainda — e é a licença que determina se você pode usar um modelo comercialmente ou não.
Na prática, nenhum dos dois modelos principais é auto-hospedável por uma equipe normal. O Qwen, com 2,4T, ocupa aproximadamente 1,2 TB em 4 bits, contra cerca de 141 GB por H200; o Kimi, com 2,8T, é ainda maior. Ambos precisam de oito ou mais aceleradores de última geração, e a contagem não divulgada de parâmetros ativos da Alibaba significa que você não consegue sequer modelar o throughput do Qwen.
É por isso que o simultaneamente anunciado Qwen3.8-27B importa aqui. Também com pesos abertos e, segundo relatos, rodando em cerca de 17GB de VRAM, isso dá à família Qwen uma história genuína de implantação local que nem o carro-chefe de 2.4T nem o de 2.8T oferece. Se pesos abertos são sua razão real para escolher entre esses dois, o 27B muda a equação mais do que qualquer um dos gigantes.
Perguntas Frequentes
Qwen 3.8 é melhor que Kimi K3?
Não com base em evidência auditada. Kimi K3 detém um AA Intelligence Index independente de 57,1 (#3) e o primeiro lugar da LMArena em código frontend, enquanto Qwen3.8-Max permanece sem nota de nenhum avaliador terceirizado. No único teste direto disponível, Kimi venceu por 83 a 80. As vantagens da Qwen são o preço (saída 2,5× mais barata) e, nesse mesmo teste, uso de ferramentas mais limpo.
Qual modelo é maior?
Kimi K3, com 2,8T de parâmetros totais contra os 2,4T do Qwen3.8-Max — cerca de 400B a mais. No entanto, nenhum dos dois divulga o suficiente para que isso seja significativo: a Alibaba nunca publicou a contagem de parâmetros ativos do Qwen, que é o número que de fato determina o custo de servir em um modelo Mixture-of-Experts.
Qual é mais barato?
Qwen3.8-Max, claramente, desde o GA. Ele lista $2 / $6 por 1M contra $3 / $15 do Kimi K3 — 33% menos na entrada e 2.5× menos na saída. A taxa do Qwen é fixa em todo o contexto de 1M, e sua entrada em cache a $0.25 fica ligeiramente abaixo da taxa de cache-hit de $0.30 do Kimi.
O que o teste comparativo realmente mostrou?
A tarefa de compreensão de arquitetura da Trilogy AI atribuiu 83 a Kimi e 80 a Qwen. Mas Qwen produziu 354 citações de repositório contra 274 de Kimi, usou 22 solicitações de gateway contra 53, registrou zero chamadas de ferramenta com falha contra duas e obteve 9/10 em uso de ferramentas contra 8/10 de Kimi. Kimi deu a melhor resposta; Qwen foi o agente mais disciplinado. É apenas uma tarefa, então trate-a como um ponto de dados em vez de um ranking.
O Qwen 3.8 Max saiu do preview?
Sim, em 3 de agosto de 2026, com uma tabela de preços publicada e um endpoint compatível com OpenAI e DashScope. A campanha de créditos Qoder de julho não descreve mais como ele é vendido.
Qual é o mais rápido?
Possivelmente o Qwen agora, o que reverte a suposição da era de pré-visualização. A Artificial Analysis mede o Kimi K3 em cerca de 34 segundos de tempo até o primeiro token; a telemetria GA de 7 dias da OrcaRouter mostra o Qwen3.8-Max com um TTFT p50 de 1,64 segundos. São fontes diferentes e não uma comparação controlada, mas ambos os modelos têm reputação de verbosidade, e o TTFT medido do Kimi é genuinamente lento.
Posso auto-hospedar qualquer um deles?
Não é realista em escala de flagship — modelos de 2,4T e 2,8T precisam de oito ou mais GPUs classe H200. Os pesos da Kimi estão prontos hoje; os da Qwen são prometidos dentro da semana, ainda sem licença. Para uma opção genuinamente on-premise, o Qwen3.8-27B anunciado simultaneamente (supostamente ~17GB de VRAM) é a escolha prática na família Qwen.
Conclusão
Qwen 3.8 vs Kimi K3 é o confronto mais próximo desta série, e a disponibilidade geral o dividiu claramente em dois eixos. Kimi K3 mantém a coroa da qualidade com base em medições feitas por um árbitro: 57,1 no Intelligence Index, terceiro no geral, e o primeiro lugar em código frontend da LMArena. Esses não são alegações — são resultados, e a Qwen não tem nada equivalente.
O que a Qwen venceu em 3 de agosto foi a questão econômica, e ela a venceu de forma decisiva: $2 / $6 contra $3 / $15, fixos em um milhão de tokens, com cache ligeiramente mais barato. Some a isso a descoberta da Trilogy de que a Qwen concluiu uma tarefa agêntica comparável com metade das requisições de gateway e zero chamadas de ferramenta com falha, e a Qwen parece ser o modelo operacionalmente mais eficiente, mesmo onde é o menos preciso. Observe dois eventos: a primeira pontuação independente do Intelligence Index para o Qwen3.8-Max, e a disponibilização dos pesos sob uma licença. Se a Qwen pontuar perto dos 57.1 da Kimi, a diferença de preço torna muito difícil justificar a Kimi para trabalho em volume. Até lá, a Kimi é o modelo em que você confia, e a Qwen é o modelo que você pode pagar para rodar — e a forma honesta de escolher é nos seus próprios repositórios.

Comparados neste artigo2
Detectado a partir deste artigo · Benchmarks: Artificial Analysis · atualizado diariamente
