Carte de titre hero pour une comparaison de DeepSeek V4 Pro et Qwen3.8 Max, sous-titrée « Spécialiste du raisonnement face au polyvalent chinois ».
Guides & Insights

DeepSeek V4 Pro contre Qwen3.8 Max : le spécialiste du raisonnement face au touche-à-tout chinois

Auteur

Rowan Sterling

Date de publication

Derniers modèles · 20Voir tous les modèles
Benchmarks : Artificial Analysis · mis à jour quotidiennement
Retour à tous les articles

À dix jours d'intervalle, les deux modèles les plus suivis de Chine ont fait leurs débuts : Alibaba a lancé Qwen3.8 Max le 3 août 2026 — un fleuron à MoE éparse de 2,4 billions de paramètres qu'il présente comme un modèle polyvalent pour les agents, le travail bureautique et la compréhension multimodale — et D​eepSeek a publié la version officielle de DeepSeek V4 Pro le 12 août, son spécialiste du raisonnement et du codage avec 1,6 billion de paramètres au total et un prix d'environ un septième de celui de Q​wen sur les jetons de sortie. Les deux visent les mêmes portefeuilles de développeurs, mais divergent sur ce à quoi sert un modèle phare. Qwen3.8 Max veut être le modèle unique par lequel vous faites transiter tout ; DeepSeek V4 Pro veut être celui auquel vous confiez les tâches difficiles.

The OrcaRouter DeepSeek V4 Pro model page showing the flagship MoE badge, 1M-token context, 384K max output, per-million pricing and an OpenAI-compatible code sample.

Points clés

• Qwen3.8 Max est le modèle à plus haute capacité brute sur les classements généraux chinois (SuperCLUE n°1, juillet) et l'offre multimodale/entreprise la plus solide — entrée vidéo, outils intégrés, sortie structurée, le tout dans une seule API.

• DeepSeek V4 Pro est considérablement moins cher (~7× sur la sortie), déjà en open-weights, et détient désormais les meilleures revendications en codage/agentique — Terminal-Bench 2.1 à 87,9 contre 86,6 rapporté par le fournisseur de Q​wen.

• Attention au coût de verbosité : des exécutions indépendantes montrent que Qwen3.8 Max effectue en moyenne ~64 tours et coûte ~1,14 $ par tâche agentique — un problème de coût effectif que la fiche technique cache.

• Le titre honnête : Qwen3.8 Max est le fleuron de la « guerre des capacités » qui s'aligne sur la tarification des modèles fermés américains ; DeepSeek V4 Pro est la riposte en matière de rapport coût/performance.

Deux philosophies dans un seul tableau de spécifications

• Paramètres totaux — Qwen3.8 Max 2,4 T (MoE sparse, ~95 B actifs) vs DeepSeek V4 Pro 1,6 T (MoE, ~49 B actifs)

• Contexte / sortie maximale — les deux ont un contexte de 1M; Q​wen plafonne autour de 128–131K de sortie contre 384K pour D​eepSeek.

• Entrées — Q​wen accepte le texte, l'image et la vidéo ; DeepSeek V4 Pro accepte le texte et l'image, avec un nouveau raisonnement natif sur les images dans la version officielle

• Poids ouverts — DeepSeek V4 Pro : publié (MIT) ; Qwen3.8 Max : promis pour la semaine du 10 août, le premier Q​wen de classe Max jamais open-sourcé.

• API extras — Q​wen propose des outils intégrés et une sortie structurée en standard ; DeepSeek V4 Pro propose des interrupteurs de réflexion, du JSON structuré, une API Responses et une compatibilité Codex.

• Prix — Qwen3.8 Max 2,00 $ / 6,00 $ par million de tokens (0,25 $ en cache) contre DeepSeek V4 Pro ~0,42 $ / 0,87 $ (0,0035 $ en cache)

Scoreboard contrasting DeepSeek V4 Pro (Terminal-Bench 2.1 87.9 official, output price $0.87 per 1M, 1.6T total params, MIT open weights out now, 384K max output, text+image input) with Qwen3.8 Max (86.6 vendor, $6.00, 2.4T params, weights promised, ~128K max output, text+image+video input).

Là où Qwen3.8 Max excelle

Sur l'axe généraliste, Qwen3.8 Max est en tête et les données indépendantes concordent. Artificial Analysis lui attribue un indice d'intelligence de 58, un indice de codage de 71,8 et un indice agentique de 58 — la meilleure performance jamais atteinte par un laboratoire chinois en tête de ce classement agentique. Dans le classement chinois de SuperCLUE de juillet, il se classe #1 avec 71,48 tandis que DeepSeek-V4-Pro se classe #5 avec 64,4. Les démos de lancement d'Alibaba — une session de codage autonome de 16 jours, une reproduction d'article qui a surpassé le résultat AIME24 de l'article original — constituent la preuve la plus solide de tout le cycle de publication que ce modèle est un agent à long horizon véritablement capable.

Pour un développeur, les gains pratiques sont orientés intégration : entrée vidéo, appel d'outils intégré, sortie structurée sans configuration, et un écosystème (Model Studio, la chaîne d'outils Qwen) que DeepSeek ne cherche pas à égaler. Si la charge de travail est lourde en documents, multimodale, ou nécessite un scénario d'intégration d'entreprise, Qwen3.8 Max est le modèle que le marché chinois choisit actuellement par défaut.

Là où DeepSeek V4 Pro excelle

En termes de codage et de coût, le V4 Pro officiel est la réplique. D​eepSeek rapporte que la version officielle obtient 87,9 sur Terminal-Bench 2.1 (contre 72,1 pour l’aperçu) et 62,7 sur DeepSWE — contre les 86,6 sur Terminal-Bench annoncés par Q​wen. L’aperçu détenait déjà un score de 80,6 sur SWE-bench Verified, 90,1 sur GPQA Diamond et 93,5 sur LiveCodeBench, le meilleur score open-model en programmation compétitive, et les changements de la version officielle se concentrent exactement sur les tâches agentiques et de raisonnement où ces chiffres se situent.

Ensuite, il y a le prix. À 0,42 $/0,87 $ par million de jetons, DeepSeek V4 Pro est environ 4,8 fois moins cher à l'entrée et 6,9 fois moins cher à la sortie que les 2 $/6 $ de Qwen3.8 Max. D​eepSeek a également signalé le 6 août qu'une augmentation de prix est à venir, ce qui fait du tarif actuel une fenêtre, pas une promesse — plus de détails ci-dessous.

An infographic summarizing the official DeepSeek V4 Pro release: Terminal-Bench 2.1 at 87.9 (preview 72.1), DeepSWE 62.7 (preview 12.8), AutomationBench 31.8 (preview 12.8), with native image reasoning, 1M context, 384K output and $0.87 per 1M output.

Fais le calcul sur une tâche agentique réelle.

Les exécutions agentiques indépendantes sont là où le prix affiché de Q​wen cesse d'être le prix réel. Sur les tâches agentiques d'Artificial Analysis, Qwen3.8 Max a réalisé en moyenne ~64 tours par tâche pour un coût d'environ 1,14 $ par tâche, contre ~0,53 $ pour la génération précédente — le modèle est verbeux et planifie beaucoup. Exécutez la même forme de tâche sur DeepSeek V4 Pro à 0,87 $ par million de tokens de sortie et le coût par tâche tombe environ un ordre de grandeur plus bas. Si votre produit est une boucle qui appelle le modèle cent fois par jour et par utilisateur, cette différence constitue votre marge.

Réserves sur la fiabilité des deux côtés

La transparence des sources va dans les deux sens ici. Des tests indépendants ont signalé que le taux d'hallucination de Qwen3.8 Max passait de 23 % à 40 % et que son score AA-Omniscience chutait de dix points — le modèle est devenu plus performant et moins fiable dans la même version. L'aperçu de D​eepSeek présentait un taux de réponse systématique documenté de 94 % sur AA-Omniscience, ce qui signifie qu'il tend à produire une réponse qu'il connaisse ou non la réponse. Ces deux signaux comptent pour la production ; aucun n'est disqualifiant pour les charges de travail auxquelles ces modèles sont destinés.

Pourquoi le moment des poids ouverts modifie le calcul du prix.

La sortie des poids ouverts de Qwen3.8 Max, quand elle arrivera, changera l'économie de ce duel en moins d'une semaine — les auto-hébergeurs disposeront d'un fleuron de 2,4 T, et la pression sur les prix des API sera réelle. C'est précisément le scénario où un modèle de tarification en transparence vous garde honnête. OrcaRouter répercute le prix catalogue du fournisseur sans aucune marge, de sorte que dès qu'Alibaba ou DeepSeek modifie un prix — à la hausse ou à la baisse — le changement est en vigueur sur une seule clé le jour même, sans renégociation ni second contrat à lire. Vous routez vers celui de Qwen3.8 Max ou DeepSeek V4 Pro que votre évaluation actuelle privilégie, et la tarification reste celle que le fournisseur facture réellement.

Lequel pour votre décision concernant le constructeur d'API ?

Choisissez Qwen3.8 Max quand la tâche exige l’ensemble de la surface — entrée multimodale, sortie structurée, outils intégrés, qualité en chinois au sommet des classements actuels — et que votre modèle de coûts tolère des exécutions agentiques verbeuses. Choisissez DeepSeek V4 Pro quand la tâche est lourde en raisonnement ou en code, que le volume de tokens est élevé, que les poids ouverts comptent pour la conformité ou l’auto-hébergement, ou que la ligne budgétaire est la contrainte décisive. La lecture la plus nette de ce face-à-face est celle que les deux entreprises elles-mêmes signalent : Qwen3.8 Max est le produit phare par rapport auquel tout se mesure, et DeepSeek V4 Pro est celui qui fait paraître le benchmark coûteux.

Comparés dans cet article1

Détecté à partir de cet article · Benchmarks : Artificial Analysis · mis à jour quotidiennement

© 2026 OrcaRouter

Pour les fournisseurs

Vous exploitez une plateforme d'inférence ? Proposez vos modèles sur OrcaRouter.

providers@orcarouter.ai

Rejoignez notre communauté

Discordsupport@orcarouter.aiXGitHubYouTube