
Qwen 4 Max vs DeepSeek V4 Pro : 95 milliards de paramètres actifs contre 49 milliards
- OrcaNOUVEAUOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 par million de tokens
- orcaNOUVEAUOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 par million de tokens
- deepseekNOUVEAUDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligence
- openaiOpenAI: GPT-6 Astra2026-09-0453Intelligence77Code
- googleGoogle: Gemini 3.8 Flash2026-09-0241Intelligence76Code
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Intelligence76Code
- anthropicAnthropic: Claude Fable 5.12026-09-0153Intelligence82Code
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 par million de tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligence72Code
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 par million de tokens
- z-aiZ.ai: GLM 5.32026-08-1845Intelligence75Code
- obsidianQwen3.8 27B2026-08-1534Intelligence68Code
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Intelligence69Code
- grokSpaceXAI: Grok 4.62026-08-1244Intelligence77Code
- metaMeta: Muse Spark 1.22026-08-0540Intelligence72Code
- qwenQwen: Qwen3.8 Max2026-08-0345Intelligence76Code
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3134Intelligence69Code
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 par million de tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
L'annonce de Qwen 4 Max à la conférence Yunqi le 22 septembre 2026 n'a donné à l'industrie qu'un nom et une structure de niveaux, et rien d'autre — pas de poids, pas de prix, pas de fenêtre de contexte, pas de date. DeepSeek V4 Pro est répertorié depuis le 24 avril 2026 comme un mélange d'experts de 1,6 billion de paramètres avec 49 milliards de paramètres actifs par token, un contexte de 1 million de tokens, et un prix hors pointe de 0,66 $ par million de tokens en entrée et 1,98 $ par million de tokens en sortie. Le chiffre qui mérite d'être mis côte à côte n'est pas le nombre total de paramètres mais le nombre de paramètres actifs : le dernier Qwen3.8-Max publié active 95 milliards de paramètres par token, soit environ le double des 49 milliards de paramètres actifs que fait tourner DeepSeek V4 Pro, et ce seul chiffre explique la majeure partie de l'écart de prix d'un facteur trois entre les deux laboratoires avant même de consulter le moindre benchmark.
Deux paris différents sur la parcimonie
Les deux laboratoires conçoivent des modèles de mélange d’experts parcimonieux. Ils sont en net désaccord sur le degré de parcimonie à adopter. Qwen3.8-Max — le modèle phare de Qwen actuellement en production, et la seule référence concrète pour imaginer ce à quoi ressemblera Qwen 4 Max — est un modèle de 2,4 billions de paramètres qui active 95 milliards de paramètres par token, soit un rapport d’environ un pour vingt-cinq. DeepSeek V4 Pro est un modèle de 1,6 billion de paramètres qui en active 49 milliards, soit un rapport d’environ un pour trente-trois, et il stocke les poids de ses experts en FP4, les couches d’attention, de routage et de normalisation étant laissées en FP8, ce qui fait encore baisser le coût de calcul par token.
Ce ne sont pas des différences de réglage. Ce sont deux réponses différentes à la même question — ce qu’un modèle de pointe devrait dépenser par token :
• Paramètres totaux — Qwen 3.8 modèle phare 2,4T contre DeepSeek V4 Pro 1,6T
• Actifs par token — Qwen 3.8 modèle phare 95B face à DeepSeek V4 Pro 49B
• Taux d'activation — environ 1 sur 25 contre environ 1 sur 33
• Prix des entrées, heures creuses — Qwen3.8-Max 2,00 $ par million contre DeepSeek V4 Pro 0,66 $ par million
• Prix de sortie, heures creuses — Qwen3.8-Max 6,00 $ pour 1 M contre DeepSeek V4 Pro 1,98 $ pour 1 M
• Poids phares — Qwen 3.8 phare sous une licence Qwen personnalisée face à DeepSeek V4 Pro publié sous MIT
• Contexte — Qwen3.8-Max 1M tokens contre DeepSeek V4 Pro 1M tokens
• Modalité — entrée texte, image et vidéo pour Qwen3.8-Max, contre texte uniquement pour DeepSeek V4 Pro sur sa fiche
• Latence observée — p50 du temps jusqu'au premier token de Qwen3.8-Max : 3,29 s contre 3,52 s pour DeepSeek V4 Pro sur le même catalogue
Cette fois, l’écart de sparsité et l’écart de prix vont dans le même sens, ce qui ne correspond pas à la direction que suggèrent les nombres totaux de paramètres. Qwen active environ deux fois plus de paramètres par token que DeepSeek et facture environ trois fois plus cher, et la sparsité à elle seule ne comble pas cet écart. Ce qui comble le reste, c’est la modalité : le modèle phare de Qwen embarque des encodeurs de vision et de vidéo, ils sont facturés à chaque requête, qu’une image y soit présente ou non, et c’est pourquoi le tarif d’entrée se situe là où il se situe. DeepSeek V4 Pro prend du texte et renvoie du texte, et il est facturé comme un modèle qui ne fait que cela.
Une réserve s’impose concernant la colonne DeepSeek avant qu’elle ne serve à quoi que ce soit. DeepSeek applique une tarification selon un calendrier heures pleines/heures creuses : les chiffres de 0,66 $ et 1,98 $ sont les tarifs heures creuses, et pendant les fenêtres de pointe — de 01:00 à 04:00 et de 06:00 à 10:00 UTC en semaine, hors jours fériés chinois — le même modèle est facturé 1,32 $ en entrée et 3,96 $ en sortie. Tout le reste, y compris tous les week-ends et jours fériés, relève des heures creuses. Le tarif que vous payez dépend donc du moment où votre trafic s’exécute, et un modèle de coûts construit sur le seul montant heures creuses sera erroné pour toute charge de travail comportant une composante liée aux matinées en semaine.

La colonne Qwen 4 Max est vide, et ce n'est pas une situation temporaire.
Il est tentant de compléter la comparaison en supposant que Qwen 4 Max se situera près des chiffres de Qwen 3.8 et à un prix inférieur à ceux-ci. Résistez-y. Alibaba a décrit l’architecture de Qwen 4 comme une nouvelle génération et a déclaré qu’elle est en cours d’entraînement ; le seul artefact publié qui décrit cette architecture est Qwen3.8-Flash-Next, publié en open source fin août 2026 et étiqueté sur sa propre fiche de modèle comme un aperçu de la conception de Qwen 4. Il s’agit d’un modèle principal de 125 milliards de paramètres, avec 51 milliards de paramètres d’embeddings de N-grammes dont environ 6 milliards s’activent par étape, avec une attention parcimonieuse QSA, des résidus à portes et un contexte natif de 262 000 tokens extensible jusqu’à 1 million.
Si cette conception passe à l’échelle jusqu’au palier Max, le nombre de paramètres actifs devrait rester dans les dizaines de milliards plutôt que de grimper vers le total de DeepSeek — maintenir un calcul par étape à peu près constant à mesure que le nombre total de paramètres augmente est tout l’intérêt de QSA et des embeddings N-gram qui sont consultés plutôt que calculés densément. C’est une direction plutôt qu’une spécification, et il ne faudrait pas l’imprimer comme une spécification.
Ce qui est connaissable aujourd'hui, c'est l'asymétrie opérationnelle. Un modèle qui existe peut être mesuré sur votre charge de travail ; un modèle qui n'existe pas ne peut être mesuré sur quoi que ce soit. Qwen 4 Max sera accessible, lorsqu'il sortira, via l'API propre du fournisseur et plusieurs plateformes tierces — la même voie qu'ont empruntée tous les fleurons d'Alibaba. Il n'est pas sur OrcaRouter aujourd'hui : le catalogue ne comporte aucune entrée pour la famille Qwen 4. DeepSeek V4 Pro est désormais sur OrcaRouter, tout comme un instantané daté de celui-ci.
La reproductibilité est l'argument que personne n'avance.
DeepSeek livre des instantanés datés et les garde adressables. Le catalogue contient à la fois l’identifiant flottant DeepSeek V4 Pro et une variante épinglée du 2026-08-13 — cette date correspondant à la build que DeepSeek lui-même a désignée comme la version de disponibilité générale. Cela manque de panache et compte davantage qu’un delta de benchmark pour quiconque exécute un harnais d’évaluation ou un pipeline contrôlé par la conformité : lorsque vous épinglez l’instantané, votre suite de régression mesure votre code plutôt que le rythme de publication du fournisseur.
La génération Qwen 3.8 a fait la même chose — il y a un instantané daté de Qwen3.8-Max dans le même catalogue, aux côtés du nom flottant — et rien ne permet de penser qu'Alibaba va s'arrêter. Mais c'est une propriété des modèles livrés, et il vaut la peine de dire clairement que le jour où Qwen 4 Max sera annoncé, il n'aura aucun instantané à épingler, aucun identifiant stable sur lequel tester, et aucun moyen de faire un avant/après sur vos propres données. Quelle que soit la comparaison que vous souhaitiez faire, vous la ferez plus tard.

Exécuter les deux sans exécuter deux stacks
OrcaRouter route DeepSeek V4 Pro sous deepseek/deepseek-v4-pro à 0,66 $ en entrée et 1,98 $ en sortie par million de tokens, soit le tarif public hors pointe de DeepSeek lui-même, répercuté avec 0 % de marge. Ce dernier point compte davantage ici qu'ailleurs dans ce lot, car 1,98 $ en sortie est déjà proche du plancher pour un modèle de premier rang : une marge de plateforme de ne serait-ce que dix pour cent représenterait un cinquième de l'écart entre ce modèle et une alternative de gamme intermédiaire, et à 0 % de marge, le tarif affiché sur la page est celui que DeepSeek publie — y compris la distinction entre heures pleines et heures creuses, répercutée selon le même calendrier plutôt que lissée en un tarif uniforme.
Le même point de terminaison porte la famille Qwen 3.8 — Qwen3.8-Max, Qwen3.8-Flash et Qwen3.8-27B — aux côtés de DeepSeek V4 Pro sur une seule API compatible OpenAI avec près de 200 modèles, avec basculement automatique lorsqu'un chemin de fournisseur se dégrade et un DSL de routage pour rendre la sélection explicite plutôt que de la coder en dur. Si DeepSeek réduit le tarif, la modification s'applique à votre clé le jour même, car il n'existe aucune couche de marge derrière laquelle une baisse pourrait rester bloquée. Quand un palier Qwen 4 sortira, c'est dans ce même catalogue qu'il apparaîtra.
Où cela vous laisse
DeepSeek V4 Pro remporte cette comparaison par forfait, et il vaut la peine d’être précis sur les raisons plutôt que de les enjoliver. Il est moins cher sur les deux axes d’un facteur d’environ trois, il active cinq fois plus de paramètres par token, sa fenêtre de contexte est équivalente, et il dispose d’un instantané daté que vous pouvez épingler. Qwen 4 Max a un nom de niveau et un créneau de conférence.
La comparaison réellement d’actualité est DeepSeek V4 Pro face à Qwen3.8-Max, et il s’agit d’un véritable arbitrage plutôt que d’une déroute : DeepSeek est un modèle uniquement textuel à environ un tiers du prix, avec des poids publiés sous licence MIT et un profil d’activation par token plus léger, tandis que le modèle phare de Qwen accepte les entrées image et vidéo à 2,00 $ et 6,00 $. Faites votre choix sur la modalité et sur le coût mesuré par tâche achevée, pas sur le nombre de paramètres, et relancez la comparaison quand Alibaba publiera une fiche de modèle — à ce moment-là, la question intéressante sera de savoir si Qwen 4 Max facture sa capacité multimodale au-dessus du tarif texte de DeepSeek dans une proportion moindre qu’aujourd’hui.

Comparés dans cet article4
Détecté à partir de cet article · Benchmarks : Artificial Analysis · mis à jour quotidiennement
