Um cartão hero gerado com o título "Qwen 4 Max vs Kimi K3", o subtítulo "A promessa dos pesos abertos encontra a entrega dos pesos abertos" e três selos em forma de pílula com os dizeres "Pesos prometidos, não entregues", "Pesos do K3 disponíveis em 27 de julho de 2026" e "Licença MIT modificada". Uma linha de rodapé diz "Alibaba Yunqi Conference, Hangzhou". Estilo editorial de vetor plano sobre fundo branco, com uma aplicação de gradiente de azul para ciano e o logotipo da OrcaRouter composto no canto inferior direito.
Engineering & Research

Qwen 4 Max vs Kimi K3: a promessa dos pesos abertos encontra a entrega dos pesos abertos

Autor

Alistair Wren

Data de publicação

Modelos mais recentes · 20Ver todos os modelos
Benchmarks: Artificial Analysis · atualizado diariamente
Voltar para todas as publicações

A Moonshot AI lançou o Kimi K3 em 16 de julho de 2026 e depois fez o que a maioria dos laboratórios apenas menciona: publicou os pesos. O checkpoint de 2,8 trilhões de parâmetros foi disponibilizado em 27 de julho de 2026 sob uma licença MIT Modificada, onze dias após o lançamento. Enquanto isso, a conferência Yunqi, em 22 de setembro de 2026, foi usada para anunciar o Qwen 4 Max como o carro-chefe de uma família Qwen 4 de quatro níveis que inclui um Qwen 4 27B de pesos abertos — um nível que é prometido, não lançado. Esses dois fatos são a comparação. Todo o resto sobre o Qwen 4 Max é atualmente desconhecido, e a lacuna entre um nível aberto prometido e um entregue é onde esta comparação realmente tem algo a dizer.

O que a Kimi K3 colocou na mesa em julho

Kimi K3 é um modelo de mistura de especialistas com 2,8 trilhões de parâmetros que ativa 16 de 896 especialistas por token, o que coloca aproximadamente 104 bilhões de parâmetros em ação a cada etapa. Ele possui uma janela de contexto de 1.048.576 tokens tanto no lado da entrada quanto no da saída e aceita entrada de texto, imagem e vídeo com saída de texto. Sua API própria tem preço de US$ 3,00 por milhão de tokens de entrada, US$ 15,00 por milhão de tokens de saída e US$ 0,30 por milhão de tokens de entrada em cache, e as tarifas de terceiros ficam abaixo disso.

A arquitetura é a parte que a própria prévia da Alibaba ecoa. O Kimi K3 é construído sobre Kimi Delta Attention e Attention Residuals, que a Moonshot afirma proporcionarem cerca de 2,5 vezes melhor eficiência de escalonamento que o Kimi K2 e decodificação até 6,3 vezes mais rápida em contextos de um milhão de tokens. Esse é o mesmo problema que o QSA do Qwen visa resolver — tornar a atenção acessível em comprimentos extremos — o que significa que as duas famílias não estão competindo tanto em escala, mas sim em qual design de atenção esparsa envelhece melhor.

As pontuações que a Moonshot publicou no lançamento, relatadas pelo fornecedor e não reproduzidas na época:

• Artificial Analysis Intelligence Index — 57, terceiro na época, atrás de Claude Fable 5 e GPT-5.6 Sol. Esse número foi registrado sob uma revisão anterior do índice; o índice foi reconstruído duas vezes desde então, portanto é uma leitura histórica, e não atual.

• Frontend Code Arena — primeiro lugar com 1.679 Elo, à frente de ambos os modelos que o superaram no índice geral

• Terminal-Bench 2.1 — 88.3

• SWE-Marathon — 42, à frente de Opus 4.8 e GPT-5.6 Sol

• DeepSearchQA — 0,95, primeiro lugar, e MATH-Vision 0,98, também em primeiro lugar

• GPQA-Diamond — 0,94

O próprio material de lançamento da Moonshot admite que o K3 ainda fica atrás do Claude Fable 5 e do GPT-5.6 Sol em capacidade geral, o que é uma frase mais útil do que qualquer uma das alegações de primeiro lugar acima dela. O aspecto interessante dos números é que um modelo terceiro no índice geral ficou em primeiro lugar em código frontend e em primeiro lugar em busca de longo horizonte — um perfil que diz que o índice agregado está escondendo uma ferramenta especializada em vez de descrever uma ferramenta geral.

A generated scoreboard titled 'Qwen 4 Max vs Kimi K3 - the scoreboard'. Left column 'Qwen 4 Max' reads announced not released, Qwen 4 27B promised, not published, not published, not published, not published. Right column 'Kimi K3' reads GA since July 16 2026, published July 27 2026, Modified MIT, $3.00 per 1M tokens, $15.00 per 1M tokens, 1,048,576 tokens. Footer reads 'Kimi K3 figures from Moonshot's launch material; Qwen 4 Max status per Alibaba's September 22 2026 Yunqi conference.'

O que a Alibaba prometeu, e quanto vale uma promessa

O anúncio do Qwen 4 nomeou quatro níveis. Qwen 4 Max como carro-chefe, Qwen 4 Flash para throughput, Qwen 4 Plus como a opção intermediária equilibrada, e Qwen 4 27B como o nível local de pesos abertos. O líder de LLM da Qwen, Liu Da Yiheng, descreveu a família como treinando em uma arquitetura de nova geração e disse que ela chegaria em breve. Não há data, model card, identificador de API, listagem em nuvem, preço nem pontuação publicada para nenhum dos quatro.

Duas coisas específicas sobre esse anúncio são noticiadas de forma incorreta, e ambas são importantes para quem está tentando se planejar com base nele:

• O número de 5 trilhões a 10 trilhões de parâmetros associado à cobertura do Qwen 4 não é uma especificação do Qwen 4. Ele pertence ao roadmap do Qwen 4.5 e do Qwen 5. Nenhuma contagem de parâmetros de qualquer tipo foi publicada para o Qwen 4 Max

• A continuação dos nomes de nível não leva as especificações adiante. A janela de contexto, o preço e a licença do Qwen 4 Max são desconhecidos; os números do Qwen3.8-Max em produção — 1.000.000 tokens a $2,00 e $6,00 por milhão — descrevem um modelo diferente

O motivo pelo qual o escalão 27B é o interessante não tem nada a ver com benchmarks. É o único escalão da linha Qwen 4 que, historicamente, tem sido disponibilizado sob pesos abertos, e a geração Qwen 3.8 mostrou o que isso desbloqueia: poucos dias após a chegada dos pesos 27B, a comunidade já tinha produzido conversões MLX, quantizações NVFP4 e fine-tunes de todos os tipos. Um 27B anunciado é um compromisso com um ecossistema a jusante, e é a entrega mais previsível no roadmap.

Mas previsível não é entregue. Os pesos do Kimi K3 são um arquivo que você pode baixar hoje. Os pesos do Qwen 4 27B são uma linha em uma palestra de conferência.

Pesos abertos e pesos executáveis são afirmações diferentes

Há uma armadilha em tratar o Kimi K3 como a resposta de pesos abertos, e vale a pena dizê-lo sem rodeios, porque é o exagero mais comum na cobertura de modelos de fronteira chineses. Um mixture-of-experts de 2,8 trilhões de parâmetros é um artefato em escala de datacenter. Pesos publicados significam que você tem permissão para executá-lo, pode inspecioná-lo, pode fazer ajuste fino nele e pode quantizá-lo. Não significam que você possa executá-lo em uma estação de trabalho. A disponibilização eficiente de um checkpoint desse tamanho exige dezenas de aceleradores, e o trabalho de quantização que se segue a um lançamento aberto — as variantes no estilo NVFP4 e REAP que circulam em poucas semanas — tem tanto a ver com tornar o modelo possível de ser servido quanto com torná-lo menor.

Portanto, a leitura honesta da licença do Kimi K3 é mais restrita e ainda assim significativa: trata-se de um modelo de fronteira auditável, modificável e auto-hospedável, sob uma licença MIT Modificada, para organizações com o hardware necessário para servi-lo. Isso é um ativo estratégico real e é pouco adequado para quem interpretou "pesos abertos" como "roda no meu laptop".

A mesma ressalva se aplicará ao Qwen 4 27B se e quando ele for lançado — e ela se aplica de forma menos acentuada, porque uma categoria de pesos abertos de 27B é genuinamente de escala local, ao contrário de um modelo carro-chefe de 2,8T. É exatamente por isso que a categoria Qwen 4 27B merece mais atenção do que a categoria Max nesta comparação, ainda que a categoria Max seja o que o anúncio apresentou primeiro.

A screenshot of the OrcaRouter model page for Kimi K3 (kimi/kimi-k3), captured September 22 2026, showing the model name, the 1M token context, text and image input with text output, vision, tool and reasoning badges, and a p50 time-to-first-token figure.

A questão comercial subjacente à questão da licença

A tarifa de primeira parte do Kimi K3, de US$ 3,00 de entrada e US$ 15,00 de saída por milhão de tokens, é uma posição premium, e a Moonshot foi explícita ao afirmar que seu preço está deliberadamente acima do extremo barato do mercado chinês. Em comparação com o Qwen3.8-Max, a US$ 2,00 e US$ 6,00, isso é uma vez e meia a tarifa de entrada e duas vezes e meia a tarifa de saída — uma diferença grande o suficiente para que uma carga de trabalho precise se importar com os pontos fortes específicos do Kimi K3, entre eles código de front-end e busca de longo horizonte, para que o prêmio valha a pena.

O OrcaRouter encaminha kimi/kimi-k3 ao lado da família Qwen 3.8 em um único endpoint compatível com OpenAI, com 0% de markup, o que significa que você é cobrado pela tarifa de tabela do fornecedor, e não por um equivalente com markup. Em uma comparação em que a diferença de preço é de um fator de 2,5 na saída, a ausência de margem da plataforma não é um detalhe de arredondamento — uma camada de dez por cento sobre uma tarifa de saída de US$ 15,00 equivale a US$ 1,50 por milhão de tokens, o que é mais do que todo o custo de entrada do modelo mais barato neste confronto. O mesmo endpoint oferece failover automático e uma DSL de roteamento para expressar políticas explicitamente, que é como você testa um modelo com o perfil do Kimi K3 em uma fatia do tráfego de produção sem apostar um caminho inteiro em um fornecedor que você nunca executou antes.

O que a OrcaRouter não disponibiliza é o Qwen 4 Max ou qualquer nível do Qwen 4, porque nenhum deles existe como produto ainda.

A screenshot of the OrcaRouter models catalogue, captured September 22 2026, showing the filter sidebar (input modalities, context length, input price, status, series), the model card grid and a code sample posting to the OpenAI-compatible endpoint at api.orcarouter.ai.

O que observar, e o que ignorar

Três sinais mudariam esta comparação, e são específicos o bastante para ficarmos atentos:

• Os pesos do Qwen 4 27B. Não a tabela de benchmarks do nível Max — o checkpoint de 27B, a sua licença e o seu tamanho. É esse lançamento que lhe dirá se o compromisso da Alibaba com pesos abertos nesta geração é tão real quanto o da anterior.

• A licença do Qwen 4 Max, se houver. Se a Alibaba publicar os pesos do seu modelo principal da mesma forma que fez com o Qwen3.8-Max, o argumento dos pesos abertos neste confronto deixa de ser uma vantagem da Kimi e passa a ser um empate

• Uma nova leitura independente sobre o Kimi K3. As pontuações de lançamento da Moonshot foram autorreportadas e o índice Artificial Analysis foi reconstruído duas vezes desde então, portanto, tanto o 57 quanto o Elo do Frontend Code Arena precisam ter a base redefinida antes de serem comparados a qualquer coisa atual.

O que ignorar é qualquer tabela de especificações do Qwen 4 Max que apareça antes de a Alibaba publicar uma ficha do modelo, e qualquer alegação de que os pesos abertos do Kimi K3 o tornam executável localmente. Ambos os erros já estão circulando. Enquanto isso, a comparação com base na qual você pode agir é entre dois modelos que existem: Kimi K3 a uma tarifa premium, com pesos disponibilizados e um perfil de codificação genuinamente diferenciado, e Qwen3.8-Max a menos da metade da tarifa de saída, com uma janela fixa de um milhão de tokens e pesos próprios. Essa é uma escolha real, com preços dos dois lados, e não exige esperar que um slide de conferência se torne um produto.

Comparados neste artigo3

Detectado a partir deste artigo · Benchmarks: Artificial Analysis · atualizado diariamente