Um cartão de título de destaque para "Qwen 4 Max vs DeepSeek V4 Pro" com o subtítulo "95 bilhões de parâmetros ativos contra 49 bilhões", três badges em formato de pílula com os dizeres "$2.00 e $6.00", "$0.66 e $1.98" e "1 em 25 vs 1 em 33", uma linha de rodapé com os dizeres "Alibaba anunciou em 22 de setembro de 2026; DeepSeek listada em 24 de abril de 2026", e o logotipo da OrcaRouter no canto inferior direito.
Engineering & Research

Qwen 4 Max vs DeepSeek V4 Pro: 95 bilhões de parâmetros ativos contra 49 bilhões

Autor

Gideon Frost

Data de publicação

Modelos mais recentes · 20Ver todos os modelos
Benchmarks: Artificial Analysis · atualizado diariamente
Voltar para todas as publicações

O anúncio do Qwen 4 Max na conferência Yunqi em 22 de setembro de 2026 deu ao setor um nome e uma estrutura de níveis e nada mais — sem pesos, sem preço, sem janela de contexto, sem data. O DeepSeek V4 Pro está listado desde 24 de abril de 2026 como uma mistura de especialistas de 1,6 trilhão de parâmetros, com 49 bilhões de parâmetros ativos por token, um contexto de 1 milhão de tokens e um preço fora de pico de US$ 0,66 por milhão de tokens de entrada e US$ 1,98 por milhão de tokens de saída. O número que vale colocar lado a lado não é a contagem total de parâmetros, mas a contagem ativa: o último Qwen3.8-Max publicado ativa 95 bilhões de parâmetros por token, aproximadamente o dobro dos 49 bilhões de parâmetros ativos que o DeepSeek V4 Pro executa, e esse único número responde pela maior parte da diferença de preço de três vezes entre os dois laboratórios antes mesmo de se consultar um único benchmark.

Duas apostas diferentes na esparsidade

Ambos os laboratórios constroem modelos esparsos de mistura de especialistas. Discordam, de forma acentuada, sobre o quão esparsos devem ser. Qwen3.8-Max — o modelo carro-chefe da Qwen em produção, e a única referência concreta para o que será o Qwen 4 Max — é um modelo de 2,4 trilhões de parâmetros que ativa 95 bilhões de parâmetros por token, uma proporção de aproximadamente uma parte em vinte e cinco. O DeepSeek V4 Pro é um modelo de 1,6 trilhão de parâmetros que ativa 49 bilhões, uma proporção de aproximadamente uma parte em trinta e três, e armazena os pesos dos seus especialistas em FP4, com as camadas de atenção, roteador e normalização mantidas em FP8, o que reduz ainda mais a computação por token.

Essas não são diferenças de ajuste. São duas respostas diferentes para a mesma pergunta — quanto um modelo de fronteira deve gastar por token:

• Total de parâmetros — Qwen 3.8 carro-chefe 2,4T versus DeepSeek V4 Pro 1,6T

• Ativos por token — Qwen 3.8 carro-chefe 95B versus DeepSeek V4 Pro 49B

• Taxa de ativação — aproximadamente 1 em 25 versus aproximadamente 1 em 33

• Preço de entrada, fora de pico — Qwen3.8-Max US$ 2,00 por 1M versus DeepSeek V4 Pro US$ 0,66 por 1M

• Preço de saída, fora de pico — Qwen3.8-Max US$ 6,00 por 1 milhão versus DeepSeek V4 Pro US$ 1,98 por 1 milhão

• Pesos do modelo carro-chefe — Qwen 3.8, o carro-chefe, sob uma licença Qwen personalizada versus DeepSeek V4 Pro publicado sob a licença MIT

• Contexto — Qwen3.8-Max 1M de tokens versus DeepSeek V4 Pro 1M de tokens

• Modalidade — entrada de texto, imagem e vídeo do Qwen3.8-Max versus DeepSeek V4 Pro, somente texto na sua listagem

• Latência observada — Qwen3.8-Max p50 tempo até o primeiro token de 3,29 s versus DeepSeek V4 Pro 3,52 s no mesmo catálogo

A diferença de esparsidade e a diferença de preço apontam para o mesmo lado desta vez, o que não é a direção sugerida pelas contagens totais de parâmetros. A Qwen ativa aproximadamente duas vezes mais parâmetros por token que a DeepSeek e cobra cerca de três vezes mais, e a esparsidade sozinha não fecha essa lacuna. O que fecha o restante é a modalidade: o carro-chefe da Qwen carrega codificadores de visão e vídeo, eles são pagos em toda requisição, esteja ou não uma imagem nela, e é por isso que a tarifa de entrada fica onde fica. O DeepSeek V4 Pro recebe texto e devolve texto, e tem o preço de um modelo que faz só isso.

Uma ressalva deve ser incluída na coluna DeepSeek antes que ela seja usada para qualquer finalidade. A DeepSeek cobra com base em um cronograma de pico e fora de pico: os valores de US$ 0,66 e US$ 1,98 são as tarifas fora de pico e, durante as janelas de pico — 01:00 às 04:00 e 06:00 às 10:00 UTC em dias úteis, excluindo feriados públicos chineses —, o mesmo modelo cobra US$ 1,32 de entrada e US$ 3,96 de saída. Todo o restante, incluindo todos os fins de semana e feriados, é fora de pico. A tarifa que você paga é, portanto, uma função de quando seu tráfego é executado, e um modelo de custo baseado apenas no valor fora de pico estará errado para qualquer carga de trabalho com um componente matinal em dias úteis.

A two-column scoreboard titled "Qwen 4 Max vs DeepSeek V4 Pro - the scoreboard". Left column Qwen 4 Max: Total parameters 2.4T, Active per token 95B, Input price off-peak $2.00 per 1M tokens, Output price off-peak $6.00 per 1M tokens, Context window 1M tokens, Modality text, image, video in. Right column DeepSeek V4 Pro: Total parameters 1.6T, Active per token 49B, Input price off-peak $0.66 per 1M tokens, Output price off-peak $1.98 per 1M tokens, Context window 1M tokens, Modality text-only. Footer reading "DeepSeek V4 Pro figures from its catalogue listing; Qwen figures from the Qwen3.8-Max model card, September 22 2026.", with the OrcaRouter logo bottom-right.

A coluna Qwen 4 Max está vazia, e isso não é uma condição temporária

É tentador preencher a comparação com a suposição de que o Qwen 4 Max ficará próximo dos números do Qwen 3.8 e com preço abaixo deles. Resista a isso. A Alibaba descreveu a arquitetura do Qwen 4 como uma nova geração e disse que ela está em treinamento; o único artefato lançado que descreve essa arquitetura é o Qwen3.8-Flash-Next, disponibilizado como código aberto no final de agosto de 2026 e rotulado em sua própria ficha de modelo como uma prévia do design do Qwen 4. É um modelo principal de 125 bilhões de parâmetros, com 51 bilhões de parâmetros de embeddings de N-gramas ativando cerca de 6 bilhões por etapa, com atenção esparsa QSA, resíduos com gate e um contexto nativo de 262.000 tokens, extensível até 1 milhão.

Se esse design escalar até o nível Max, a contagem ativa deve permanecer na casa das dezenas de bilhões, em vez de subir em direção ao total da DeepSeek — manter a computação por passo aproximadamente constante à medida que o total de parâmetros cresce é o ponto central do QSA e dos embeddings de N-gramas que são consultados em vez de calculados de forma densa. Isso é uma direção, não uma especificação, e não deve ser impresso como tal.

O que se pode saber agora é a assimetria operacional. Um modelo que existe pode ser medido na sua carga de trabalho; um modelo que não existe não pode ser medido em nada. O Qwen 4 Max será acessível, quando for lançado, pela API do próprio fornecedor e por várias plataformas de terceiros — o mesmo caminho que todo modelo principal da Alibaba seguiu. Ele não está no OrcaRouter hoje: o catálogo tem zero entradas para a família Qwen 4. O DeepSeek V4 Pro está no OrcaRouter agora, e um snapshot datado dele também.

Reprodutibilidade é o argumento que ninguém apresenta.

A DeepSeek fornece snapshots datados e os mantém endereçáveis. O catálogo contém tanto o identificador flutuante DeepSeek V4 Pro quanto uma variante fixada de 2026-08-13 — sendo essa data a build que a própria DeepSeek designou como a versão de disponibilidade geral. Isso não é nada glamouroso e importa mais do que um delta de benchmark para quem executa um harness de avaliação ou um pipeline controlado por conformidade: quando você fixa o snapshot, sua suíte de regressão está medindo o seu código, e não a cadência de lançamento do fornecedor.

A geração Qwen 3.8 fez a mesma coisa — há um snapshot datado do Qwen3.8-Max no mesmo catálogo, ao lado do nome flutuante — e não há motivo para pensar que a Alibaba vai parar. Mas isso é uma característica dos modelos lançados, e vale dizer claramente que, no dia em que o Qwen 4 Max for anunciado, ele não terá snapshot para fixar, nem identificador estável contra o qual testar, nem forma de fazer um antes e depois com seus próprios dados. Qualquer comparação que você queira fazer, você a fará mais tarde.

A screenshot of the OrcaRouter model page for DeepSeek V4 Pro (deepseek/deepseek-v4-pro, English UI), showing the FLAGSHIP badge, the 1M token context badge, the model ID deepseek/deepseek-v4-pro, a 384K maximum output, text input, the Tools, JSON and Reasoning tags, the listing date 2026-04-24 credited to DeepSeek, a p50 time-to-first-token of 3.52s, the OpenAI-compatible code samples against api.orcarouter.ai/v1, and the opening of the model description describing a 1.6T total / 49B active flagship MoE with 1M context and top-tier reasoning and agentic tool use.

Executando ambos sem executar duas stacks

O OrcaRouter encaminha o DeepSeek V4 Pro como deepseek/deepseek-v4-pro a $0,66 de entrada e $1,98 de saída por milhão de tokens, que é o próprio preço de tabela fora de pico da DeepSeek repassado com 0% de margem. Essa última parte vale mais aqui do que noutros pontos deste lote, porque $1,98 de saída já está próximo do mínimo para um modelo de nível de fronteira: uma margem da plataforma de apenas dez por cento seria um quinto da diferença entre este modelo e uma alternativa de nível intermédio, e com 0% de margem a tarifa que vê na página é a tarifa que a DeepSeek publica — incluindo a divisão entre hora de pico e fora de pico, que é repassada segundo o mesmo calendário em vez de ser diluída numa tarifa fixa.

O mesmo endpoint disponibiliza a família Qwen 3.8 — Qwen3.8-Max, Qwen3.8-Flash e Qwen3.8-27B — ao lado do DeepSeek V4 Pro numa única API compatível com OpenAI com perto de 200 modelos, com failover automático quando um caminho de fornecedor se degrada e uma DSL de encaminhamento para tornar a seleção explícita em vez de a codificar de forma rígida. Se a DeepSeek cortar a tarifa, a alteração chega à sua chave no mesmo dia, porque não há uma camada de margem atrás da qual um corte possa ficar preso. Quando for lançado um nível Qwen 4, é no mesmo catálogo que ele apareceria.

Onde isso te deixa

DeepSeek V4 Pro vence esta comparação por W.O., e vale a pena ser preciso sobre o motivo em vez de embelezá-lo. É mais barato nos dois eixos por um fator de cerca de três, ativa cinco vezes mais parâmetros por token, sua janela de contexto é equivalente, e tem um snapshot datado que você pode fixar. O Qwen 4 Max tem um nome de categoria e um horário em conferência.

A comparação que realmente está valendo é DeepSeek V4 Pro contra Qwen3.8-Max, e é uma disputa real, não um massacre: o DeepSeek é um modelo apenas de texto por cerca de um terço do preço, com pesos publicados sob a licença MIT e um perfil de ativação por token mais enxuto, enquanto o carro-chefe da Qwen aceita entrada de imagem e vídeo por US$ 2,00 e US$ 6,00. Escolha com base na modalidade e no custo medido por tarefa concluída, não na contagem de parâmetros, e refaça a comparação quando a Alibaba publicar uma ficha técnica do modelo — nesse momento, a pergunta interessante será se o Qwen 4 Max precifica sua capacidade multimodal acima da tarifa de texto do DeepSeek por uma margem menor do que faz hoje.

A screenshot of the OrcaRouter model page for Qwen3.8 Max (qwen/qwen3.8-max, English UI), showing the 1M token context badge, the model ID qwen/qwen3.8-max, text plus image plus video input with text output, the Vision, Tools, JSON, Reasoning and Thinking capability tags, the listing date 2026-08-03, a p50 time-to-first-token of 3.29s, and the model description naming Qwen3.8-Max Alibaba's newest flagship and highest-capability tier to date.

Comparados neste artigo4

Detectado a partir deste artigo · Benchmarks: Artificial Analysis · atualizado diariamente