Hero-titelkaart voor de vergelijking 'Grok 4.6 vs DeepSeek V4 Pro', met ondertitel 'Een prijzenoorlog aan de frontlinie, uitgevochten met 24 uur verschil', en een badge 'Vergelijking · augustus 2026'.
Guides & Insights

Grok 4.6 vs DeepSeek V4 Pro: Een prijzenoorlog aan de frontlinie, met 24 uur verschil uitgevochten

Auteur

Rowan Sterling

Publicatiedatum

Nieuwste modellen · 20Bekijk alle modellen
Benchmarks: Artificial Analysis · dagelijks bijgewerkt
Terug naar alle berichten

Twee frontier-modellen verschenen binnen 24 uur na elkaar, en het verschil tussen hun prijslijsten is het grootst dat deze generatie heeft opgeleverd. Grok 4.6 lanceerde op 12 augustus 2026 voor $2 per miljoen invoertokens en $6 per miljoen uitvoertokens. DeepSeek V4 Pro — de officiële productierelease van D​eepSeek's vlaggenschip, versie DeepSeek-V4-Pro-0813 — volgde op 13 augustus 2026 voor ¥3 per miljoen cache-miss invoertokens en ¥6 per miljoen uitvoertokens, wat ruwweg $0,42 en $0,85 is. Zelfde categorie, dezelfde agentische ambities, een orde van grootte verschil in prijs. Dit is geen vergelijking van twee specificaties; het is een vergelijking van twee strategieën voor wat een agentvormig model zou moeten kosten, en beide zijn deze week uitgekomen.

Dit stuk plaatst de twee prijslijsten naast elkaar, leest de benchmarkclaims van elke leverancier met het leverancierslabel erbij, en berekent wat het verschil daadwerkelijk kost op een echte workload — want op papier liggen deze modellen qua mogelijkheden dichter bij elkaar dan qua filosofie, en het verschil in prijs per taak is waar de beslissing valt.

De timing is het punt.

Dat beide modellen in hetzelfde 48-uursvenster landden, is geen kalendertoeval. Grok 4.6 is SpaceXAI's agentische ombouw van zijn 1,5T-fundament — een post-training-refresh die sterk leunt op reinforcement learning voor codering, kernelwerk en CAD, geprijsd als de brandstof voor de Cursor- en Grok Bot-producten die het bedrijf bezit. DeepSeek V4 Pro is de formalisering van een preview die stilletjes herdefinieerde wat 'agentisch' betekende voor een fractie van de prijs, nu verbeterd voor de agent-economie: D​eepSeek's release notes voor de 0813-build beginnen met aanzienlijk verbeterde agentmogelijkheden, voegen ondersteuning toe voor de Responses API en Codex-integratie, en behouden zowel de denkmodus (standaard) als de niet-denkmodus, JSON-output, toolcalls en het Anthropic API-formaat. Twee zeer verschillende bedrijven concludeerden tegelijkertijd dat agenten in laat 2026 de markt zijn die ertoe doet — en prijsden hun toetreding voor zeer verschillende portemonnees.

De twee prijslijsten, naast elkaar

Grok 4.6 — $2.00 / $6.00 / $0.50 (cached invoer) per miljoen tokens, 500K context, een stap van $4 / $12 / $1 boven ongeveer 200K invoertokens, en een snellere variant tegen het dubbele basistarief.

DeepSeek V4 Pro — ¥3,00 (≈$0,42) cache-miss-invoer, ¥0,025 (≈$0,0035) gecachte invoer, ¥6,00 (≈$0,85) uitvoer per miljoen tokens, met een contextvenster van 1 miljoen tokens en tot 384K uitvoertokens. Het goedkopere broertje, V4 Flash, kost ¥1 / ¥2.

Zelfs vergeleken met Grok 4.6 — al de goedkoopste frontier-API van zijn generatie — is DeepSeek V4 Pro ruwweg vijf keer goedkoper bij cache-miss-invoer en zeven keer goedkoper bij output, en het levert een 2x groter contextvenster en een veel grotere maximale output voor dezelfde prijsklasse. De twee concurreren niet op prijs; DeepSeek heeft eenzijdig een nieuwe ondergrens gesteld en Grok is nu de premiumoptie in dezelfde zin. Die framing doet ertoe, want het vorige frame — 'Grok 4.6 is het goedkope frontier-model' — was precies één dag waar.

Two-column scoreboard: Grok 4.6 AA Index 61 (independent), $2/$6, 500K context, DeepSWE v1.1 65.9% (vendor), Terminal-Bench 26% (v3.0), cache-hit input $0.50 vs DeepSeek V4 Pro AA Index none yet, ≈$0.42/$0.85, 1M context, DeepSWE 62.7% (vendor), Terminal-Bench 87.9% (v2.1), cache-hit input ≈$0.0035.

Wat DeepSeek V4 Pro daadwerkelijk heeft verbeterd

DeepSeek's lanceercijfers zijn het meest dramatisch omdat ze worden afgemeten tegen de eigen preview, en de sprong van preview naar release is enorm. In de eigen evaluaties van de leverancier:

DeepSWE — 62,7% op de release-build, tegenover 12,8% op de preview — een software-engineering long-horizon-score die de leverancier plaatst tussen de 58,0% van Opus 4.8 en de 70,0% van Claude Fable 5.

Cybergym — 83,3%, gestegen van 52,7%, nipt boven de 83,1% van Fable 5 en beter dan de 78,3% van Opus 4.8.

Terminal Bench 2.1 — 87,9%, binnen een punt van Fable 5's 88,0% en hoger dan Opus 4.8's 85,0%.

AutomationBench (public) — 31,8%, gestegen van 12,8%, en beter dan zowel Fable 5 (29,1%) als Opus 4.8 (27,2%).

Toolathlon-Verified, NL2Repo, DSBench-FullStack en DSBench-Hard — respectievelijk 74,1%, 61,5%, 71,1% en 67,2%, geclusterd op of nabij het niveau van Opus 4.8 / Fable 5.

Elk van die is door D​eepSeek gerapporteerd op D​eepSeek's eigen evaluatiesuite. De richting is onmiskenbaar — de preview was niet klaar voor productie-agentloops en de releasebuild beweert dat wel te zijn — maar het eerlijke label is dat geen enkel onafhankelijk laboratorium D​eepSeek V4 Pro nog heeft gescoord, en de modellen waartegen het wordt gebenchmarkt, worden niet door een externe partij genoemd.

Waarmee Grok 4.6 antwoordt

De concurrent van Grok 4.6 is wezenlijk anders: hij is de enige van de twee met een onafhankelijk scorebord. Artificial Analysis mat hem op 61 op zijn Intelligence Index — gelijk met GPT-5.6 Sol, boven Kimi K3 (60) — voordat DeepSeek V4 Pro überhaupt werd uitgebracht. De leverancierstabel claimt een leidende score van 65,9% op DeepSWE v1.1 en 69,9% op CursorBench v3.2, met een openlijk toegegeven zwakke plek van 26% op Terminal-Bench v3.0. Die zijn door xAI gerapporteerd, geen enkele onafhankelijk gereproduceerd per 13 augustus.

De versieverschillen zijn van belang wanneer je de twee direct wilt vergelijken. D​eepSeek's 87.9 is op Terminal Bench 2.1; Grok's 26% is op de moeilijkere v3.0 — verschillende examens, dus "D​eepSeek verplettert Grok op terminals" is geen eerlijke uitspraak, en dat geldt ook voor "Grok leidt op DeepSWE" zonder te vermelden dat de twee leveranciers verschillende eval-versies hebben gedraaid en geen van beide cijfers van een derde partij komt. Wat vergelijkbaar is, is de onafhankelijke dimensie: Grok 4.6 heeft één geverifieerde scorecard, DeepSeek V4 Pro heeft er nog geen, en voor een productiebeslissing is die asymmetrie op zichzelf al informatie.

Screenshot of the Artificial Analysis page for Grok 4.6 (high) scoring 61 — the independent scorecard DeepSeek V4 Pro does not yet have.

De totale kosten voor een lange agent-run.

Neem een realistische agentische taak — het lezen en redeneren over 500K tokens aan context, het schrijven van 100K tokens aan uitvoer, wat een middelgrote refactor of een lange documentpijplijn is, binnen de vensters van beide modellen:

Grok 4.6 — 0.5M input à $2 = $1.00, plus 0.1M output à $6 = $0.60. Totaal: $1.60.

DeepSeek V4 Pro — 0.5M cache-miss invoer tegen ¥3 = ¥1.50, plus 0.1M uitvoer tegen ¥6 = ¥0.60. Totaal: ¥2.10, ongeveer $0.29.

Dat is een gat van 5,5x bij dezelfde nominale taak, vóór enig cachevoordeel — en het 1M-contextvenster van D​eepSeek plus 384K maximale output betekent ook dat de klus in één enkele doorgang past, terwijl het 500K-contextvenster van Grok 4.6 er mogelijk twee nodig heeft. Het addertje onder het gras dat dit geen antwoord van één regel maakt, zijn de redeneerkosten en het risico: de denkmodus van D​eepSeek is standaard ingeschakeld, dus elk verzoek betaalt voor een volledige redeneertrace, zelfs wanneer je er geen wilt, en het vertrouwen van de leverancier in zijn eigen benchmarks is door niemand onafhankelijk getest. Goedkoop per token met altijd actief redeneren is tegen deze tarieven nog steeds goedkoop per taak, maar "goedkoop" en "geverifieerd" zijn verschillende beweringen, en slechts één van deze modellen draagt de tweede.

Wie moet welke kiezen

De keuze is minder 'welke is beter' dan 'welk risicoprofiel past bij de werklast':

Hoge volumes, kostgebonden en bereid om ongeverificeerde cijfers te dragen — DeepSeek V4 Pro is de prijsvloer-optie. De 1M context en 384K output maken het de sterkere kandidaat voor lange contexten en batchverwerking, en het tarief van ¥0.025 voor gecachte invoer maakt retrieval-intensieve pijplijnen bijna gratis. Doe gewoon je eigen evals, want niemand onafhankelijk heeft dat gedaan.

Agentische diepgang met een onafhankelijke scorekaart, in een OpenAI-compatibel ecosysteem — De 61 van Grok 4.6 is geverifieerd, de richting van de codeer- en agentische benchmarks is consistent, en de eindzwakte is vooraf bekend. De 42 seconden time-to-first-token is de prijs die je betaalt voor de geverifieerde kwaliteit.

Screenshot of the OrcaRouter model page for Grok 4.6, the pass-through endpoint where both models sit behind one key at provider list price.

Gemengd verkeer — dit is eerder een geval van routering dan van keuze. Op OrcaRouter zitten beide modellen achter één sleutel tegen doorberekende prijzen volgens de providerlijst — dus de ¥3/¥6 van D​eepSeek blijft ¥3/¥6 op de factuur, en Grok 4.6 blijft $2/$6, zonder opslag op beide. Een routeringsregel kan het kostenafhankelijke werk met lange context naar DeepSeek V4 Pro sturen en het geverifieerde agentische werk naar Grok 4.6, het verkeer per verzoek splitsen totdat je eigen evaluatie de verdeling bepaalt, en rekenen op automatische failover als het gedrag van een van beide leveranciers in de eerste week de cijfers van de lancering weerspreekt. Voor een paar modellen die nog maar één dag oud zijn en aan weerszijden van een prijzenoorlog staan, is de mogelijkheid om beide op je eigen workload te vergelijken — en de splitsing om te draaien zonder code te wijzigen — geen luxe. Het is de enige verdedigbare manier om een van beide in gebruik te nemen.

Vergeleken in dit artikel1

Herkend uit dit artikel · Benchmarks: Artificial Analysis · dagelijks bijgewerkt

© 2026 OrcaRouter

Voor aanbieders

Beheer je een inferentieplatform? Zet je modellen op OrcaRouter.

providers@orcarouter.ai

Word lid van de community

Discordsupport@orcarouter.aiXGitHubYouTube