
Qwen 4 Max vs DeepSeek V4 Pro: 95 bilhões de parâmetros ativos contra 49 bilhões
- OrcaNOVOOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 por 1M de tokens
- orcaNOVOOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 por 1M de tokens
- deepseekNOVODeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligência
- openaiOpenAI: GPT-6 Astra2026-09-0453Inteligência77Código
- googleGoogle: Gemini 3.8 Flash2026-09-0241Inteligência76Código
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Inteligência76Código
- anthropicAnthropic: Claude Fable 5.12026-09-0153Inteligência82Código
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 por 1M de tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligência72Código
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 por 1M de tokens
- z-aiZ.ai: GLM 5.32026-08-1845Inteligência75Código
- obsidianQwen3.8 27B2026-08-1534Inteligência68Código
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Inteligência69Código
- grokSpaceXAI: Grok 4.62026-08-1244Inteligência77Código
- metaMeta: Muse Spark 1.22026-08-0540Inteligência72Código
- qwenQwen: Qwen3.8 Max2026-08-0345Inteligência76Código
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3134Inteligência69Código
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 por 1M de tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
O anúncio do Qwen 4 Max na conferência Yunqi em 22 de setembro de 2026 deu ao setor um nome e uma estrutura de níveis e nada mais — sem pesos, sem preço, sem janela de contexto, sem data. O DeepSeek V4 Pro está listado desde 24 de abril de 2026 como uma mistura de especialistas de 1,6 trilhão de parâmetros, com 49 bilhões de parâmetros ativos por token, um contexto de 1 milhão de tokens e um preço fora de pico de US$ 0,66 por milhão de tokens de entrada e US$ 1,98 por milhão de tokens de saída. O número que vale colocar lado a lado não é a contagem total de parâmetros, mas a contagem ativa: o último Qwen3.8-Max publicado ativa 95 bilhões de parâmetros por token, aproximadamente o dobro dos 49 bilhões de parâmetros ativos que o DeepSeek V4 Pro executa, e esse único número responde pela maior parte da diferença de preço de três vezes entre os dois laboratórios antes mesmo de se consultar um único benchmark.
Duas apostas diferentes na esparsidade
Ambos os laboratórios constroem modelos esparsos de mistura de especialistas. Discordam, de forma acentuada, sobre o quão esparsos devem ser. Qwen3.8-Max — o modelo carro-chefe da Qwen em produção, e a única referência concreta para o que será o Qwen 4 Max — é um modelo de 2,4 trilhões de parâmetros que ativa 95 bilhões de parâmetros por token, uma proporção de aproximadamente uma parte em vinte e cinco. O DeepSeek V4 Pro é um modelo de 1,6 trilhão de parâmetros que ativa 49 bilhões, uma proporção de aproximadamente uma parte em trinta e três, e armazena os pesos dos seus especialistas em FP4, com as camadas de atenção, roteador e normalização mantidas em FP8, o que reduz ainda mais a computação por token.
Essas não são diferenças de ajuste. São duas respostas diferentes para a mesma pergunta — quanto um modelo de fronteira deve gastar por token:
• Total de parâmetros — Qwen 3.8 carro-chefe 2,4T versus DeepSeek V4 Pro 1,6T
• Ativos por token — Qwen 3.8 carro-chefe 95B versus DeepSeek V4 Pro 49B
• Taxa de ativação — aproximadamente 1 em 25 versus aproximadamente 1 em 33
• Preço de entrada, fora de pico — Qwen3.8-Max US$ 2,00 por 1M versus DeepSeek V4 Pro US$ 0,66 por 1M
• Preço de saída, fora de pico — Qwen3.8-Max US$ 6,00 por 1 milhão versus DeepSeek V4 Pro US$ 1,98 por 1 milhão
• Pesos do modelo carro-chefe — Qwen 3.8, o carro-chefe, sob uma licença Qwen personalizada versus DeepSeek V4 Pro publicado sob a licença MIT
• Contexto — Qwen3.8-Max 1M de tokens versus DeepSeek V4 Pro 1M de tokens
• Modalidade — entrada de texto, imagem e vídeo do Qwen3.8-Max versus DeepSeek V4 Pro, somente texto na sua listagem
• Latência observada — Qwen3.8-Max p50 tempo até o primeiro token de 3,29 s versus DeepSeek V4 Pro 3,52 s no mesmo catálogo
A diferença de esparsidade e a diferença de preço apontam para o mesmo lado desta vez, o que não é a direção sugerida pelas contagens totais de parâmetros. A Qwen ativa aproximadamente duas vezes mais parâmetros por token que a DeepSeek e cobra cerca de três vezes mais, e a esparsidade sozinha não fecha essa lacuna. O que fecha o restante é a modalidade: o carro-chefe da Qwen carrega codificadores de visão e vídeo, eles são pagos em toda requisição, esteja ou não uma imagem nela, e é por isso que a tarifa de entrada fica onde fica. O DeepSeek V4 Pro recebe texto e devolve texto, e tem o preço de um modelo que faz só isso.
Uma ressalva deve ser incluída na coluna DeepSeek antes que ela seja usada para qualquer finalidade. A DeepSeek cobra com base em um cronograma de pico e fora de pico: os valores de US$ 0,66 e US$ 1,98 são as tarifas fora de pico e, durante as janelas de pico — 01:00 às 04:00 e 06:00 às 10:00 UTC em dias úteis, excluindo feriados públicos chineses —, o mesmo modelo cobra US$ 1,32 de entrada e US$ 3,96 de saída. Todo o restante, incluindo todos os fins de semana e feriados, é fora de pico. A tarifa que você paga é, portanto, uma função de quando seu tráfego é executado, e um modelo de custo baseado apenas no valor fora de pico estará errado para qualquer carga de trabalho com um componente matinal em dias úteis.

A coluna Qwen 4 Max está vazia, e isso não é uma condição temporária
É tentador preencher a comparação com a suposição de que o Qwen 4 Max ficará próximo dos números do Qwen 3.8 e com preço abaixo deles. Resista a isso. A Alibaba descreveu a arquitetura do Qwen 4 como uma nova geração e disse que ela está em treinamento; o único artefato lançado que descreve essa arquitetura é o Qwen3.8-Flash-Next, disponibilizado como código aberto no final de agosto de 2026 e rotulado em sua própria ficha de modelo como uma prévia do design do Qwen 4. É um modelo principal de 125 bilhões de parâmetros, com 51 bilhões de parâmetros de embeddings de N-gramas ativando cerca de 6 bilhões por etapa, com atenção esparsa QSA, resíduos com gate e um contexto nativo de 262.000 tokens, extensível até 1 milhão.
Se esse design escalar até o nível Max, a contagem ativa deve permanecer na casa das dezenas de bilhões, em vez de subir em direção ao total da DeepSeek — manter a computação por passo aproximadamente constante à medida que o total de parâmetros cresce é o ponto central do QSA e dos embeddings de N-gramas que são consultados em vez de calculados de forma densa. Isso é uma direção, não uma especificação, e não deve ser impresso como tal.
O que se pode saber agora é a assimetria operacional. Um modelo que existe pode ser medido na sua carga de trabalho; um modelo que não existe não pode ser medido em nada. O Qwen 4 Max será acessível, quando for lançado, pela API do próprio fornecedor e por várias plataformas de terceiros — o mesmo caminho que todo modelo principal da Alibaba seguiu. Ele não está no OrcaRouter hoje: o catálogo tem zero entradas para a família Qwen 4. O DeepSeek V4 Pro está no OrcaRouter agora, e um snapshot datado dele também.
Reprodutibilidade é o argumento que ninguém apresenta.
A DeepSeek fornece snapshots datados e os mantém endereçáveis. O catálogo contém tanto o identificador flutuante DeepSeek V4 Pro quanto uma variante fixada de 2026-08-13 — sendo essa data a build que a própria DeepSeek designou como a versão de disponibilidade geral. Isso não é nada glamouroso e importa mais do que um delta de benchmark para quem executa um harness de avaliação ou um pipeline controlado por conformidade: quando você fixa o snapshot, sua suíte de regressão está medindo o seu código, e não a cadência de lançamento do fornecedor.
A geração Qwen 3.8 fez a mesma coisa — há um snapshot datado do Qwen3.8-Max no mesmo catálogo, ao lado do nome flutuante — e não há motivo para pensar que a Alibaba vai parar. Mas isso é uma característica dos modelos lançados, e vale dizer claramente que, no dia em que o Qwen 4 Max for anunciado, ele não terá snapshot para fixar, nem identificador estável contra o qual testar, nem forma de fazer um antes e depois com seus próprios dados. Qualquer comparação que você queira fazer, você a fará mais tarde.

Executando ambos sem executar duas stacks
O OrcaRouter encaminha o DeepSeek V4 Pro como deepseek/deepseek-v4-pro a $0,66 de entrada e $1,98 de saída por milhão de tokens, que é o próprio preço de tabela fora de pico da DeepSeek repassado com 0% de margem. Essa última parte vale mais aqui do que noutros pontos deste lote, porque $1,98 de saída já está próximo do mínimo para um modelo de nível de fronteira: uma margem da plataforma de apenas dez por cento seria um quinto da diferença entre este modelo e uma alternativa de nível intermédio, e com 0% de margem a tarifa que vê na página é a tarifa que a DeepSeek publica — incluindo a divisão entre hora de pico e fora de pico, que é repassada segundo o mesmo calendário em vez de ser diluída numa tarifa fixa.
O mesmo endpoint disponibiliza a família Qwen 3.8 — Qwen3.8-Max, Qwen3.8-Flash e Qwen3.8-27B — ao lado do DeepSeek V4 Pro numa única API compatível com OpenAI com perto de 200 modelos, com failover automático quando um caminho de fornecedor se degrada e uma DSL de encaminhamento para tornar a seleção explícita em vez de a codificar de forma rígida. Se a DeepSeek cortar a tarifa, a alteração chega à sua chave no mesmo dia, porque não há uma camada de margem atrás da qual um corte possa ficar preso. Quando for lançado um nível Qwen 4, é no mesmo catálogo que ele apareceria.
Onde isso te deixa
DeepSeek V4 Pro vence esta comparação por W.O., e vale a pena ser preciso sobre o motivo em vez de embelezá-lo. É mais barato nos dois eixos por um fator de cerca de três, ativa cinco vezes mais parâmetros por token, sua janela de contexto é equivalente, e tem um snapshot datado que você pode fixar. O Qwen 4 Max tem um nome de categoria e um horário em conferência.
A comparação que realmente está valendo é DeepSeek V4 Pro contra Qwen3.8-Max, e é uma disputa real, não um massacre: o DeepSeek é um modelo apenas de texto por cerca de um terço do preço, com pesos publicados sob a licença MIT e um perfil de ativação por token mais enxuto, enquanto o carro-chefe da Qwen aceita entrada de imagem e vídeo por US$ 2,00 e US$ 6,00. Escolha com base na modalidade e no custo medido por tarefa concluída, não na contagem de parâmetros, e refaça a comparação quando a Alibaba publicar uma ficha técnica do modelo — nesse momento, a pergunta interessante será se o Qwen 4 Max precifica sua capacidade multimodal acima da tarifa de texto do DeepSeek por uma margem menor do que faz hoje.

Comparados neste artigo4
Detectado a partir deste artigo · Benchmarks: Artificial Analysis · atualizado diariamente
