Hero-titelkaart voor een vergelijking van DeepSeek V4 Pro en Qwen3.8 Max, met als ondertitel 'Reasoning-specialist versus de Chinese allrounder'.
Guides & Insights

DeepSeek V4 Pro tegen Qwen3.8 Max: Redeneerspecialist tegen de Chinese alleskunner

Auteur

Rowan Sterling

Publicatiedatum

Nieuwste modellen · 20Bekijk alle modellen
Benchmarks: Artificial Analysis · dagelijks bijgewerkt
Terug naar alle berichten

Met tien dagen verschil gingen de twee meest bekeken modellen in China live: Alibaba bracht Qwen3.8 Max op 3 augustus 2026 uit — een vlaggenschip met 2,4 biljoen parameters en sparse-MoE-architectuur, dat het bedrijf aanprijst als alleskunner voor agents, kantoorwerk en multimodaal begrip — en D​eepSeek leverde de officiële versie van DeepSeek V4 Pro op 12 augustus, zijn specialist op het gebied van redeneren en coderen, met in totaal 1,6 biljoen parameters en een prijs voor output-tokens die ruwweg een zevende van die van Q​wen bedraagt. De twee mikken op dezelfde ontwikkelaarsportemonnee, maar verschillen van mening over waar een vlaggenschip voor dient. Qwen3.8 Max wil het model zijn waar je alles doorheen stuurt; DeepSeek V4 Pro wil het model zijn waar je het moeilijke werk naartoe escaleert.

The OrcaRouter DeepSeek V4 Pro model page showing the flagship MoE badge, 1M-token context, 384K max output, per-million pricing and an OpenAI-compatible code sample.

Belangrijkste conclusies

• Qwen3.8 Max is het model met de hoogste ruwe capaciteit op de Chinese algemene ranglijsten (SuperCLUE #1, juli) en het sterkere multimodale/enterprise-pakket — video-invoer, ingebouwde tools, gestructureerde output, allemaal in één API.

DeepSeek V4 Pro is dramatisch goedkoper (~7× op output), al open-weights, en claimt nu de hogere coding/agentic prestaties — Terminal-Bench 2.1 op 87,9 tegen de door de leverancier gerapporteerde 86,6 van Qwen.

• Let op de verbositeitskosten: onafhankelijke runs tonen aan dat Qwen3.8 Max gemiddeld ~64 beurten en ~$1.14 per agentische taak kost — een probleem met de effectieve kosten dat het specificatieblad verbergt.

De eerlijke kop: Qwen3.8 Max is het vlaggenschip van de 'capaciteitenoorlog' dat de prijsstelling van Amerikaanse gesloten modellen evenaart; DeepSeek V4 Pro is het prijs-prestatie-weerwoord.

Twee filosofieën in één specificatietabel

• Totale parameters — Qwen3.8 Max 2.4T (sparse MoE, ~95B actief) vs DeepSeek V4 Pro 1.6T (MoE, ~49B actief)

• Context / maximale output — beide 1M context; Q​wen piekt rond 128–131K output, tegenover D​eepSeek's 384K

• Invoer — Q​wen accepteert tekst, afbeeldingen en video; DeepSeek V4 Pro accepteert tekst en afbeeldingen, met nieuwe native afbeeldingsredenering in de officiële build.

• Open gewichten — DeepSeek V4 Pro: uitgebracht (MIT); Qwen3.8 Max: beloofd voor de week van 10 augustus, de eerste Max-klasse Q​wen die ooit open source is gemaakt

• API-extras — Q​wen wordt standaard geleverd met ingebouwde tools en gestructureerde uitvoer; DeepSeek V4 Pro wordt geleverd met denkmodus-schakelaars, gestructureerde JSON, een Responses API en Codex-compatibiliteit.

Prijs — Qwen3.8 Max $2.00 / $6.00 per miljoen tokens ($0.25 gecachet) vs DeepSeek V4 Pro ~$0.42 / $0.87 ($0.0035 gecachet)

Scoreboard contrasting DeepSeek V4 Pro (Terminal-Bench 2.1 87.9 official, output price $0.87 per 1M, 1.6T total params, MIT open weights out now, 384K max output, text+image input) with Qwen3.8 Max (86.6 vendor, $6.00, 2.4T params, weights promised, ~128K max output, text+image+video input).

Waar Qwen3.8 Max wint

Op de generalistische as ligt Qwen3.8 Max voorop en de onafhankelijke gegevens bevestigen dat. Artificial Analysis plaatst het op een Intelligentie-Index van 58, een Codeer-Index van 71,8 en een Agentische Index van 58 — de dichtste benadering die een Chinees laboratorium ooit heeft bereikt van de top van dat agentische klassement. Op SuperCLUE's juli-ranglijst voor Chinese taal staat het op #1 met 71,48, terwijl DeepSeek-V4-Pro op #5 staat met 64,4. Alibaba's lanceringdemo's — een autonome codeersessie van 16 dagen, een papierreproductie die het AIME24-resultaat van het oorspronkelijke papier overtrof — vormen het sterkste bewijs in de hele releasecyclus dat dit een werkelijk capabele langetermijnagent is.

Voor een ontwikkelaar zijn de praktische voordelen integratiegericht: video-invoer, ingebouwde tool-calling, gestructureerde output zonder configuratie, en een ecosysteem (Model Studio, de Q​wen-toolchain) dat D​eepSeek niet probeert te evenaren. Als de workload documentintensief, multimodaal is of een enterprise-integratieverhaal nodig heeft, is Qwen3.8 Max het model waar de Chinese markt momenteel standaard op terugvalt.

Waar DeepSeek V4 Pro wint

Wat coderen en kosten betreft, is de officiële V4 Pro het weerwoord. D​eepSeek rapporteert de officiële build op 87.9 op Terminal-Bench 2.1 (gestegen van 72.1 bij de preview) en 62.7 op DeepSWE — tegen Q​wen's door de leverancier gerapporteerde 86.6 op Terminal-Bench. De preview had al een 80.6 SWE-bench Verified, een 90.1 GPQA Diamond en een 93.5 LiveCodeBench, de #1 open-model score voor competitief programmeren, en de wijzigingen in de officiële build zijn precies geconcentreerd in de agentic- en redeneringstaken waar die cijfers thuishoren.

Dan is er de prijs. Met $0.42/$0.87 per miljoen tokens is DeepSeek V4 Pro ongeveer 4.8× goedkoper op input en 6.9× goedkoper op output dan de $2/$6 van Qwen3.8 Max. DeepSeek gaf op 6 augustus ook aan dat er een prijsverhoging aankomt, wat het huidige tarief tot een gelegenheid maakt, geen belofte — later meer daarover.

An infographic summarizing the official DeepSeek V4 Pro release: Terminal-Bench 2.1 at 87.9 (preview 72.1), DeepSWE 62.7 (preview 12.8), AutomationBench 31.8 (preview 12.8), with native image reasoning, 1M context, 384K output and $0.87 per 1M output.

Reken het uit voor een echte agentische taak.

Zelfstandige agentic-runs zijn waar {{1}}de stickerprijs van Qwen ophoudt de echte prijs te zijn{{/1}}. Op de agentic-taken van Artificial Analysis haalde Qwen3.8 Max gemiddeld ~64 beurten per taak en kostte ~$1,14 per taak, tegenover ~$0,53 voor de vorige generatie — het model is breedsprakig en doet veel aan planning. Draai dezelfde taakvorm op DeepSeek V4 Pro tegen $0,87 per miljoen output en de kosten per taak liggen ruwweg een orde van grootte lager. Als je product een loop is die het model honderd keer per dag per gebruiker aanroept, dan is {{2}}dat verschil je marge{{/2}}.

Betrouwbaarheidskanttekeningen aan beide kanten

Eerlijkheid over herkomst snijdt hier twee kanten op. Onafhankelijke tests wezen uit dat het hallucinatiepercentage van Qwen3.8 Max steeg van 23% naar 40% en dat de AA-Omniscience-score tien punten daalde — het model werd in dezelfde release capabeler en minder betrouwbaar. De preview van D​eepSeek had een gedocumenteerd 'answer-always'-percentage van 94% op AA-Omniscience, wat betekent dat het geneigd is altijd een antwoord te geven, of het er nu een weet of niet. Beide signalen zijn van belang voor productie; geen van beide is diskwalificerend voor de workloads waar deze modellen op gericht zijn.

Waarom de timing van open-weights de prijsberekening verandert.

De open-weights-release van Qwen3.8 Max zal, zodra die verschijnt, binnen een week de economische verhoudingen van deze concurrentiestrijd veranderen — self-hosters krijgen een 2,4T-vlaggenschip en de API-prijsdruk zal reëel zijn. Dit is precies het scenario waarin een pass-through-prijsmodel je eerlijk houdt. OrcaRouter geeft de lijstprijs van de provider door zonder enige opslag, dus op het moment dat Alibaba of D​eepSeek een prijs wijzigt — omhoog of omlaag — is de wijziging dezelfde dag live op één key, zonder heronderhandeling en zonder tweede contract om te lezen. Je routeert naar welke van Qwen3.8 Max of DeepSeek V4 Pro jouw huidige evaluatie ook de voorkeur geeft, en de prijs blijft wat de leverancier daadwerkelijk in rekening brengt.

Welke voor uw API-builder-beslissing?

Kies Qwen3.8 Max wanneer de klus het hele scala vereist — multimodale input, gestructureerde output, ingebouwde tools, kwaliteit van het Chinees aan de top van de huidige ranglijsten — en je kostenmodel uitgebreide agentische runs tolereert. Kies DeepSeek V4 Pro wanneer de taak redeneer- of codeerintensief is, het tokenvolume hoog is, open gewichten belangrijk zijn voor compliance of self-hosting, of de budgetlijn de beperkende factor is. De meest heldere interpretatie van deze krachtmeting is die welke de twee bedrijven zelf aangeven: Qwen3.8 Max is het vlaggenschip waaraan je alles afmeet, en DeepSeek V4 Pro is degene die de benchmark duur doet lijken.

Vergeleken in dit artikel2

Herkend uit dit artikel · Benchmarks: Artificial Analysis · dagelijks bijgewerkt

© 2026 OrcaRouter

Voor aanbieders

Beheer je een inferentieplatform? Zet je modellen op OrcaRouter.

providers@orcarouter.ai

Word lid van de community

Discordsupport@orcarouter.aiXGitHubYouTube