
GPT-6 vs DeepSeek V4 Pro: de een kun je bij iedereen huren, de ander kun je mee naar huis nemen
- openaiNIEUWOpenAI: GPT-6.1 Sol2026-09-2952Intelligentie
- anthropicNIEUWAnthropic: Claude Sonnet 5.52026-09-2856Intelligentie
- typesafeNIEUWTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 per 1 mln tokens · 128 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238Intelligentie
- OpenAIOpenAI: GPT-6 Sol2026-09-2248Intelligentie
- AnthropicAnthropic: Claude Opus 5.52026-09-2258Intelligentie
- xAIGrok 4.72026-09-2146Intelligentie
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 per 1 mln tokens · 67 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 per 1 mln tokens · 320 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligentie
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Intelligentie77Coderen
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Intelligentie76Coderen
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Intelligentie76Coderen
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Intelligentie82Coderen
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 per 1 mln tokens · 54 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1 mln tokens · 360 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligentie72Coderen
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1 mln tokens · 232 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Intelligentie75Coderen
- obsidianQwen3.8 27B2026-08-1534Intelligentie68Coderen
There is exactly one thing you can do with DeepSeek V4 Pro that you cannot do with GPT-6 Sol: take it home. DeepSeek V4 Pro is an MIT-licensed mixture-of-experts flagship — 1.6 trillion total parameters, 49 billion active per token — released on 13 August 2026, and the checkpoint is downloadable. GPT-6 Sol is closed weights, shipped by OpenAI on 22 September 2026, and as of 7 October 2026 it is also the model sitting under the paid tiers of ChatGPT's global rollout to more than 1.2 billion weekly users.
Al het andere in deze vergelijking is een kwestie van welke meter je leest. Op de tariefkaart liggen de twee een factor vier uit elkaar. Op wat het daadwerkelijk kostte om een afgerond antwoord op de onafhankelijke suite te produceren, liggen ze 1,55× uit elkaar. Op de Intelligence Index lijken de rijen zestien punten uit elkaar te liggen en zijn ze, volgens de eigen gedocumenteerde methodologie van de evaluator, helemaal niet van elkaar af te trekken. Uitzoeken welk van die drie getallen een beslissing zou moeten sturen, is de hele opgave, en het antwoord verschilt al naargelang je een leverancier of een bestand kiest.
Wat elk model is, in één zin
GPT-6 Sol is the middle tier of OpenAI's GPT-6 line — below the GPT-6 Astra flagship, above the budget GPT-6 Luna — with a 1,050,000-token context window, a 128,000-token output ceiling, text, image and file input, native tool calling, structured outputs, and reasoning effort selectable across five levels from low to max. It is the tier OpenAI routes ChatGPT Plus, Pro, Business and Enterprise to, and it is priced at $2.00 per million input tokens and $10.00 per million output, with a long-context tier that reprices the whole request at $4.00 and $15.00 once the prompt passes 272,000 input tokens.
DeepSeek V4 Pro is a text-only flagship with a 1,048,576-token window and a 384,000-token maximum output — three times GPT-6 Sol's ceiling — and no vision at any price. DeepSeek's own API documentation lists it at $0.66 per million input tokens and $1.98 per million output during peak hours, halved to $0.33 and $0.99 off-peak, with cache hits at $0.022 off-peak. Peak hours are 01:00–04:00 and 06:00–10:00 UTC on weekdays; everything else, including weekends and Chinese public holidays, is off-peak.
De drie meters
Begin met degene die het vaakst wordt geciteerd, want het is degene die het vaakst zonder zijn context wordt geciteerd. Artificial Analysis geeft DeepSeek V4 Pro 36,0 en GPT-6 Sol 47,6 op de Intelligence Index v4.3.2. Elf en een half punt is het soort verschil dat een vergelijking beëindigt.
Dat zou het niet moeten, en de evaluator zegt dat zelf ook. Artificial Analysis vergelijkt open-weightsmodellen alleen met andere open-weightsmodellen in dezelfde grootteklasse, met de grens bij 150 miljard parameters, en propriëtaire modellen over een prijsband bij een samengestelde verhouding van 3:1 tussen input en output. Dat zijn twee verschillende peergroepen die twee verschillende schalen opleveren. Een 36 en een 47,6 die in aangrenzende rijen van dezelfde tabel staan, vormen geen rechtstreekse vergelijking, en de eerlijke zet is om dat te zeggen in plaats van de een van de ander af te trekken en het als capaciteit te bestempelen.

De twee meters die vergelijkbaar zijn, zeggen iets nuttigers:
• Gemengde prijs bij 3:1 — GPT-6 Sol $4,00 per 1M vs DeepSeek V4 Pro $0,99 bij piektarieven, of $0,50 buiten de piek; een verschil van 4× tot 8×, afhankelijk van wanneer je het uitvoert
• Kosten per voltooide indextaak — GPT-6 Sol $1,04 vs DeepSeek V4 Pro $0,67; een verschil van 1,55×
• Outputtokens gegenereerd over de hele suite — GPT-6 Sol 76,8M vs DeepSeek V4 Pro 162,9M, dus het goedkope model schrijft 2,1× zoveel om hetzelfde werk te voltooien
• Maximale output — DeepSeek V4 Pro 384.000 tokens vs GPT-6 Sol 128.000; een plafond van 3×
• Multimodale input — GPT-6 Sol accepteert tekst, afbeeldingen en bestanden vs DeepSeek V4 Pro alleen tekst
• Gewichten — DeepSeek V4 Pro MIT-gelicentieerd en downloadbaar vs GPT-6 Sol gesloten

De vierde en vijfde regel verklaren de tweede. Een 4× headline-verschil dat op echt werk terugvalt naar 1,55× is wat er gebeurt wanneer het goedkopere model ook het uitgebreidere model is: DeepSeek V4 Pro produceerde 2,1× zoveel outputtokens als GPT-6 Sol binnen dezelfde evaluatieset. Uitgebreidheid is een kostenvermenigvuldiger die nooit op een prijspagina verschijnt, en het is het meest onderbelichte getal in deze vergelijking.
Waar het open model echt wint
Twee plekken, en beide zijn structureel in plaats van marginaal.
Het uitvoerplafond is het eerste. 384.000 tokens tegen 128.000 is een drievoudig verschil, en het bepaalt hele categorieën werk: een groot gestructureerd artefact in één aanroep genereren, een lang document schrijven zonder chaining, een grote refactor als één antwoord produceren. GPT-6 Sol kan die dingen tegen geen enkele prijs doen, omdat de limiet geen facturatiecategorie is — het is het maximum van het model.
Agentic tool use is the second, on one specific measurement. DeepSeek V4 Pro scores 96.2% on τ²-Bench, the agentic tool-use evaluation, and that is the figure DeepSeek leads its own card with. It is also the number the model's OrcaRouter catalogue entry repeats, which is the version of the claim our own readers would meet. GPT-6 Sol's comparable τ²-Bench figure is not published on the same board, so treat the comparison as directional: on the one benchmark DeepSeek chose to headline, the open model is at the top of the field, and the closed model has not put a number in the same column.
En dan het eigendomsaspect, dat helemaal geen benchmark is. Een downloadbaar MIT-checkpoint betekent dat je het model op je eigen hardware kunt draaien, een verzoek buiten ieders netwerk kunt houden, het kunt fine-tunen, een versie kunt vastzetten en weet dat die er over drie jaar nog steeds is. Geen enkele leverancier kan het afschaffen, de prijs ervan wijzigen of het uit een tariefkaart halen. Voor een klasse kopers — gereguleerde sectoren, iedereen met een datalocatiebeperking, iedereen die ooit is getroffen door het uitfaseren van een model — is dat meer waard dan elf indexpunten.
Waar GPT-6 Sol wint, en het is niet alleen de index
Terminal-Bench 4.0 is de minst flatteuze regel op de kaart van DeepSeek V4 Pro: 14,1% tegenover de 43,9% van GPT-6 Sol. Dat is geen afrondingsverschil en het wijst op een echt profiel — het open model is sterk in multi-turn tool-orkestratie en zwak in het langetermijnterminalwerk waar moderne codeeragenten uit bestaan. Als je workload een agent is die een shell-sessie twintig minuten lang bij elkaar moet houden, dan is deze enkele evaluatie voorspellender voor jouw ervaring dan de samengestelde index.
Multimodaliteit is de tweede. DeepSeek V4 Pro is tekst-in, tekst-uit. GPT-6 Sol accepteert afbeeldingen en bestanden, en dat is niet zomaar een afvinkvakje — documentintensief professioneel werk betekent screenshots, gescande pagina's, diagrammen en pdf's, en een model dat alleen tekst aankan, kan die categorie helemaal niet binnentreden.
The third is the thing that happened this week. GPT-6 landed in ChatGPT's Chat tab for Plus, Pro, Business and Enterprise on 7 October, with Free and Go following from 8 October, carrying a capability OpenAI calls Intelligent UI — answers that compose text, graphics, charts, forms and tappable controls per question rather than defaulting to prose. That is a surface, not an API feature, and it does not change a line of your integration code. What it does change is the ambient default: the model your team already has open in a browser tab is now GPT-6, and prototype work drifts toward the model it can reach without a key. Vendor-reported and unreproduced, OpenAI also claims GPT-6 at Extra High begins answering as fast as GPT-5.6 at Medium, and that GPT-6 Instant starts answering 44% sooner on search-backed questions.
Eén uitvoeren, of beide uitvoeren
The reason this particular pairing is easier to hedge than most is that both models sit on the same catalogue. OrcaRouter routes GPT-6 Sol and DeepSeek V4 Pro — along with 200-plus other models — through one OpenAI-compatible endpoint on one key, at 0% markup over the provider's list price. That pass-through is what makes the peak/off-peak structure legible rather than mysterious: DeepSeek's off-peak halving is the vendor's, we do not touch it, and when a vendor reprices, the change is live here the same day.
Het is ook waar de piekvensterbeslissing een routeringsbeslissing wordt. Het off-peaktarief van DeepSeek V4 Pro is de helft van zijn piektarief, en de piekvensters zijn vaste UTC-uren. Een batchtaak die kan verschuiven, is het waard om rond die vensters te plannen, en een latentiegevoelig pad is het waard om erbuiten te blijven. Met beide modellen achter één sleutel is de splitsing een configuratie in plaats van een tweede leverancierscontract: routeer bulk- en languitvoerwerk tijdens off-peak naar DeepSeek V4 Pro, routeer het multimodale en reasoning-intensieve verkeer naar GPT-6 Sol, en laat automatische failover een snelheidslimiet aan beide zijden opvangen in plaats van er in productie achter te komen.

Wat ik eigenlijk zou doen
Als je afbeeldingen, bestanden of een frontier-redeneerscore nodig hebt en je een API koopt, is GPT-6 Sol het antwoord, en de elf indexpunten doen er grotendeels niet toe — de multimodale poort beslecht het voordat de benchmarks een stem krijgen. Als je 384.000-tokenoutput nodig hebt, een licentie die je kunt behouden, een on-premise-implementatie, of de laagste kosten per afgeronde taak in het aanbod, wint DeepSeek V4 Pro en is de indexkloof de peergroep van iemand anders.
Wat ik niet zou doen, is 36 tegenover 47,6 interpreteren als een capaciteitskloof en daarop kopen. De vergelijkbare maatstaven — $0,67 tegenover $1,04 per taak, en een 2,1×-verboseheidsverschil dat schuilt achter een 4×-hoofdcijferverschil — vertellen een veel getrouwer verhaal dan de indexrijen doen, en zij zijn degene die op een factuur terechtkomen.
The thing to watch next is whether DeepSeek closes the Terminal-Bench gap in a V4 Pro refresh, since that is the one measurement where the open model looks genuinely behind rather than differently scored. GPT-6, for its part, just stopped being a choice and became a default, and defaults are hard to argue with even when the benchmark says otherwise.
Vergeleken in dit artikel2
Herkend uit dit artikel · Benchmarks: Artificial Analysis · dagelijks bijgewerkt
