Cartão de título do herói para uma comparação entre DeepSeek V4 Pro e Qwen3.8 Max, legendado 'Especialista em raciocínio vs o versátil chinês'.
Guides & Insights

DeepSeek V4 Pro vs Qwen3.8 Max: Especialista em Raciocínio vs o Versátil Chinês

Autor

Rowan Sterling

Data de publicação

Modelos mais recentes · 20Ver todos os modelos
Benchmarks: Artificial Analysis · atualizado diariamente
Voltar para todas as publicações

Com dez dias de diferença, os dois modelos mais acompanhados da China entraram no ar: a Alibaba lançou Qwen3.8 Max em 3 de agosto de 2026 — um carro-chefe sparse-MoE de 2,4 trilhões de parâmetros que ela promove como um coringa para agentes, trabalho de escritório e compreensão multimodal — e a D​eepSeek lançou a versão oficial do DeepSeek V4 Pro em 12 de agosto, seu especialista em raciocínio e codificação, com 1,6 T de parâmetros totais e um preço cerca de um sétimo do cobrado pela Q​wen em tokens de saída. Os dois miram as mesmas carteiras de desenvolvedores, mas discordam sobre para que serve um carro-chefe. O Qwen3.8 Max quer ser o modelo único pelo qual você roteia tudo; o DeepSeek V4 Pro quer ser aquele para quem você encaminha as tarefas difíceis.

The OrcaRouter DeepSeek V4 Pro model page showing the flagship MoE badge, 1M-token context, 384K max output, per-million pricing and an OpenAI-compatible code sample.

Principais conclusões

• Qwen3.8 Max é o modelo de maior capacidade bruta nos rankings gerais chineses (SuperCLUE #1, julho) e o pacote multimodal/empresarial mais forte — entrada de vídeo, ferramentas integradas, saída estruturada, tudo em uma única API.

• O DeepSeek V4 Pro é dramaticamente mais barato (~7× na saída), já tem pesos abertos, e agora detém as alegações mais altas de codificação/agentes — Terminal-Bench 2.1 com 87,9 contra os 86,6 relatados pelo fornecedor da Q​wen.

• Observe o custo da verbosidade: execuções independentes mostram que o Qwen3.8 Max tem uma média de ~64 turnos e ~$1,14 por tarefa agêntica — um problema de custo efetivo que a ficha técnica esconde.

• A manchete honesta: Qwen3.8 Max é o carro-chefe da "guerra de capacidades" que equipara o preço dos modelos fechados dos EUA; DeepSeek V4 Pro é a réplica de custo-benefício.

Duas filosofias em uma tabela de especificações.

• Parâmetros totais — Qwen3.8 Max 2.4T (MoE esparso, ~95B ativos) vs DeepSeek V4 Pro 1.6T (MoE, ~49B ativos)

• Contexto / saída máxima — ambos com 1M de contexto; Q​wen atinge no máximo cerca de 128–131K de saída vs 384K do D​eepSeek

• Entradas — Q​wen aceita texto, imagem e vídeo; DeepSeek V4 Pro aceita texto e imagem, com novo raciocínio nativo de imagem na versão oficial.

• Pesos abertos — DeepSeek V4 Pro: lançado (MIT); Q​wen3.8 Max: prometido para a semana de 10 de agosto, o primeiro Qwen da classe Max a ter código aberto.

• Extras de API — Q​wen inclui ferramentas integradas e saída estruturada de fábrica; o DeepSeek V4 Pro oferece opções de raciocínio, JSON estruturado, uma Responses API e compatibilidade com Codex.

• Preço — Qwen3.8 Max $2.00 / $6.00 por milhão de tokens ($0.25 em cache) vs DeepSeek V4 Pro ~$0.42 / $0.87 ($0.0035 em cache)

Scoreboard contrasting DeepSeek V4 Pro (Terminal-Bench 2.1 87.9 official, output price $0.87 per 1M, 1.6T total params, MIT open weights out now, 384K max output, text+image input) with Qwen3.8 Max (86.6 vendor, $6.00, 2.4T params, weights promised, ~128K max output, text+image+video input).

Onde o Qwen3.8 Max vence

No eixo generalista, o Qwen3.8 Max está à frente e os dados independentes concordam. A Artificial Analysis o coloca com um Índice de Inteligência de 58, um Índice de Codificação de 71,8 e um Índice Agêntico de 58 — o mais próximo que qualquer laboratório chinês chegou do topo desse ranking agêntico. No ranking de julho em chinês da SuperCLUE, ele fica em #1 com 71,48, enquanto o DeepSeek-V4-Pro fica em #5 com 64,4. As demonstrações de lançamento da Alibaba — uma execução de codificação autônoma de 16 dias, uma reprodução de artigo que superou o resultado AIME24 do artigo original — são a evidência mais forte de todo o ciclo de lançamento de que este é um agente de horizonte longo genuinamente capaz.

Para um desenvolvedor, as vantagens práticas são voltadas para integração: entrada de vídeo, chamada integrada de ferramentas, saída estruturada sem configuração e um ecossistema (Model Studio, a cadeia de ferramentas Q​wen) que a D​eepSeek não tenta igualar. Se a carga de trabalho é intensiva em documentos, multimodal ou precisa de uma proposta de integração empresarial, o Qwen3.8 Max é o modelo que o mercado chinês está adotando como padrão atualmente.

Onde o DeepSeek V4 Pro vence

Em termos de codificação e custo, o V4 Pro oficial é a resposta. A DeepSeek reporta a versão oficial com 87,9 no Terminal-Bench 2.1 (acima dos 72,1 da prévia) e 62,7 no DeepSWE — contra os 86,6 do Terminal-Bench reportados pela Qwen. A prévia já tinha 80,6 no SWE-bench Verified, 90,1 no GPQA Diamond e 93,5 no LiveCodeBench, a maior pontuação de programação competitiva entre modelos abertos, e as mudanças da versão oficial estão concentradas exatamente nas tarefas de agência e raciocínio onde esses números se encontram.

Depois, há o preço. A $0.42/$0.87 por milhão de tokens, o DeepSeek V4 Pro é cerca de 4.8× mais barato na entrada e 6.9× mais barato na saída do que os $2/$6 do Qwen3.8 Max. A D​eepSeek também sinalizou em 6 de agosto que um aumento de preço está por vir, o que torna a tarifa de hoje uma janela, não uma promessa — mais sobre isso abaixo.

An infographic summarizing the official DeepSeek V4 Pro release: Terminal-Bench 2.1 at 87.9 (preview 72.1), DeepSWE 62.7 (preview 12.8), AutomationBench 31.8 (preview 12.8), with native image reasoning, 1M context, 384K output and $0.87 per 1M output.

Faça as contas em uma tarefa agêntica real.

Execuções de agentes independentes são onde o preço de tabela da Qwen deixa de ser o preço real. Nas tarefas de agentes do Artificial Analysis, a Qwen3.8 Max teve média de ~64 turnos por tarefa e custou ~US$ 1,14 por tarefa, contra ~US$ 0,53 da geração anterior — o modelo é verboso e planeja muito. Execute o mesmo formato de tarefa na DeepSeek V4 Pro a US$ 0,87 por milhão de tokens de saída e o custo por tarefa fica aproximadamente uma ordem de grandeza menor. Se o seu produto é um loop que chama o modelo cem vezes por dia por usuário, essa diferença é a sua margem.

Ressalvas de confiabilidade em ambos os lados

A honestidade das fontes tem dois lados aqui. Testes independentes apontaram que a taxa de alucinação do Qwen3.8 Max subiu de 23% para 40%, com uma queda de dez pontos no índice AA-Omniscience — o modelo ficou mais capaz e menos confiável na mesma versão. A prévia do DeepSeek apresentou uma taxa documentada de 94% de resposta-sempre no AA-Omniscience, ou seja, tende a produzir uma resposta mesmo quando não sabe. Ambos os pontos importam para produção; nenhum é desqualificante para as cargas de trabalho às quais esses modelos se destinam.

Por que o momento dos pesos abertos muda a matemática do preço

O lançamento dos pesos abertos do Qwen3.8 Max, quando acontecer, mudará a economia desse confronto em uma semana — quem faz self-hosting terá um carro-chefe de 2,4T, e a pressão sobre os preços da API será real. Este é exatamente o cenário em que um modelo de preços com repasse direto mantém você honesto. O OrcaRouter repassa o preço de tabela do provedor sem nenhum markup; então, no momento em que a Alibaba ou a DeepSeek alterar um preço — para cima ou para baixo — a mudança entra em vigor na mesma chave no mesmo dia, sem renegociação e sem um segundo contrato para ler. Você roteia para o Qwen3.8 Max ou para o DeepSeek V4 Pro, conforme o que sua avaliação atual preferir, e o preço permanece exatamente o que o fornecedor efetivamente cobra.

Qual escolher para sua decisão de construtor de API?

Escolha o Qwen3.8 Max quando o trabalho exigir a superfície completa — entrada multimodal, saída estruturada, ferramentas integradas, qualidade em chinês no topo dos rankings atuais — e seu modelo de custo tolerar execuções agênticas verbosas. Escolha o DeepSeek V4 Pro quando a tarefa for pesada em raciocínio ou codificação, o volume de tokens for alto, pesos abertos importarem para conformidade ou auto-hospedagem, ou a linha do orçamento for a restrição vinculante. A leitura mais clara desse confronto é a que as próprias empresas estão sinalizando: o Qwen3.8 Max é o carro-chefe contra o qual você mede tudo, e o DeepSeek V4 Pro é o que faz o benchmark parecer caro.

Comparados neste artigo3

Detectado a partir deste artigo · Benchmarks: Artificial Analysis · atualizado diariamente

© 2026 OrcaRouter

Para provedores

Opera uma plataforma de inferência? Traga seus modelos para o OrcaRouter.

providers@orcarouter.ai

Junte-se à comunidade

Discordsupport@orcarouter.aiXGitHubYouTube