
GPT-6.1 Sol vs DeepSeek V4 Pro: Drie meters, drie verschillende antwoorden
- openaiNIEUWOpenAI: GPT-6.1 Sol2026-09-2952Intelligentie
- anthropicNIEUWAnthropic: Claude Sonnet 5.52026-09-2856Intelligentie
- typesafeNIEUWTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 per 1 mln tokens · 161 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238Intelligentie
- OpenAIOpenAI: GPT-6 Sol2026-09-2248Intelligentie
- AnthropicAnthropic: Claude Opus 5.52026-09-2258Intelligentie
- xAIGrok 4.72026-09-2146Intelligentie
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 per 1 mln tokens · 79 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 per 1 mln tokens · 320 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligentie
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Intelligentie77Coderen
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Intelligentie76Coderen
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Intelligentie76Coderen
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Intelligentie82Coderen
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 per 1 mln tokens · 53 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1 mln tokens · 301 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligentie72Coderen
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1 mln tokens · 232 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Intelligentie75Coderen
- obsidianQwen3.8 27B2026-08-1534Intelligentie68Coderen
Vraag hoe ver GPT-6.1 Sol en DeepSeek V4 Pro uit elkaar liggen, en het eerlijke antwoord is dat het ervan afhangt welke maatstaf je leest, en de drie maatstaven zijn het meer met elkaar oneens dan dat de meeste modelvergelijkingen het over alles oneens zijn. Qua prijs per miljoen tokens, gemengd in een verhouding van 3:1 tussen input en output, bedragen ze $4,00 tegenover $0,99 — een factor vier. Qua wat het daadwerkelijk kostte om dezelfde evaluatiesuite te draaien, bedragen ze $0,72 tegenover $0,67 per taak — zeven procent. Op de Artificial Analysis Intelligence Index staan ze op 51,8 tegenover 36 — zestien punten, wat beslissend klinkt totdat je kijkt waartegen elk cijfer werd vergeleken, want de eigen methodologie van die beoordelaar plaatst de twee modellen in verschillende klassen. GPT-6.1 Sol werd uitgebracht op 29 september 2026 voor $2,00 in en $10,00 uit met een contextvenster van 1.050.000 tokens. DeepSeek V4 Pro is een mixture-of-experts-vlaggenschip onder MIT-licentie, 1,6 biljoen parameters waarvan 49 miljard actief, uitgebracht op 13 augustus 2026 voor $0,66 en $1,98 met een contextvenster van 1.048.576 tokens. De ene is een tekstmodel dat je kunt downloaden. De andere ziet afbeeldingen. Uitzoeken op welke van de drie maatstaven je je daadwerkelijk moet richten, is de hele opgave.
De indexrij is niet de vergelijking waar het op lijkt.
Begin met het nummer dat het vaakst wordt geciteerd, want dat is degene die het vaakst verkeerd wordt geciteerd.
Artificial Analysis publiceert zijn methodologie naast zijn leaderboard, en twee zinnen daarin zijn hier van belang. Modellen met open gewichten, zo staat er, worden alleen vergeleken met andere modellen met open gewichten in dezelfde grootteklasse — tiny, small, medium, large, met de grens bij 150 miljard parameters. Propriëtaire modellen worden in plaats daarvan vergeleken binnen een prijsband, met een gemengde input-outputverhouding van 3:1. Dat zijn twee verschillende peergroepen. DeepSeek V4 Pro 0813 heeft open gewichten — de FAQ van de evaluator zelf zegt dit, en verwijst naar de gepubliceerde gewichten — en met 1,6 biljoen totale parameters valt het in de open-gewichtenklasse large. GPT-6.1 Sol is propriëtair en wordt gescoord tegen modellen in zijn eigen prijsband.
Een 51,8 en een 36 die in aangrenzende rijen van dezelfde tabel staan, zijn dus geen rechtstreekse vergelijking. Het zijn een score tegen de ene peergroep en een score tegen een andere, en dat is precies waarom de kostencijfers per taak vergelijkbaar zijn en de ruwe indexcijfers niet. Als je wilt weten of DeepSeek V4 Pro goed is voor een downloadbaar model, dan is 36 het getal dat daar antwoord op geeft. Als je wilt weten hoe het zich verhoudt tot een gehost frontiermodel, zal de indexkolom je dat niet vertellen, en dit is een geval waarin de eerlijke zet is om dat te zeggen in plaats van 36 van 51,8 af te trekken en het een kloof te noemen.
Wat zuiver kan worden vergeleken: de prijskaarten, de context- en outputlimieten, de modaliteitslijsten, en de kosten van het draaien van dezelfde evaluatiesuite — want dat laatste cijfer is een boekhouding van identiek werk, niet een score.
Wat de ruwe meters zeggen

• Invoerprijs — GPT-6.1 Sol $2,00 vs DeepSeek V4 Pro $0,66 per miljoen tokens
• Uitvoerprijs — GPT-6.1 Sol $10,00 vs DeepSeek V4 Pro $1,98, met stappen naar $1,32 en $3,96 binnen twee vier uur durende UTC-tijdvensters op werkdagen
• Cache-lezen — GPT-6.1 Sol $0,10 vs DeepSeek V4 Pro $0,022 per miljoen tokens; beide cachen, en de goedkope kant is weer 4,5× goedkoper
• Kosten per indextaak — GPT-6.1 Sol $0,72 vs DeepSeek V4 Pro $0,67
• Uitgegeven outputtokens op de indexsuite — GPT-6.1 Sol 67M vs DeepSeek V4 Pro 160M
• Maximale uitvoer — DeepSeek V4 Pro 384.000 tokens vs GPT-6.1 Sol 128.000 tokens
• Modaliteiten — GPT-6.1 Sol accepteert tekst, afbeeldingen en bestanden; DeepSeek V4 Pro accepteert alleen tekst
De vierde en vijfde regel zijn het interessante paar. DeepSeek V4 Pro genereert 2,4 keer zoveel tokens op dezelfde suite en komt toch 7% goedkoper uit per taak, omdat zijn outputtarief een vijfde is van dat van GPT-6.1 Sol. Zo ziet een prijsgedreven model eruit wanneer je output meet in plaats van tarief: de breedsprakigheid is reëel, en doet het voordeel niet teniet. Het timingvenster is het sterretje. Twee blokken van vier uur op weekdagen — 40 van de 168 uur in een week — verdubbelen het vermelde tarief tot $1,32 en $3,96, en die toeslag geldt voor dezelfde tokens die anders op beide kaarten het goedkoopst zouden zijn.
Wat het goedkopere model niet doet
Drie dingen, en elk ervan is een harde limiet in plaats van een afweging.
Het kan niet zien. DeepSeek V4 Pro is tekst-in, tekst-uit. Geen screenshots, geen gescande pdf's, geen grafieken lezen, geen diagram in een ticket. Computergebruik en documentintensieve workflows — precies de workloads waarvoor GPT-6.1 Sol is gepositioneerd — zijn tegen elke prijs geen optie. Als je pipeline al afbeeldingen naar een visionmodel stuurt, is dit geen probleem; zo niet, dan is het de beslissende beperking.
Het heeft geen releasecadans waarop je kunt plannen. De naam "deepseek-v4-pro" verwijst sinds augustus naar de 0813-build, en dat ging er niet geruisloos aan toe: de leverancier kondigde aan dat de build op 14 september zou worden uitgefaseerd, trok de aankondiging twee dagen voor die datum in en bleef de API bedienen met ongewijzigde facturering. Onze eigen catalogus vermeldt het nog steeds als het vlaggenschip met dezelfde context, hetzelfde outputplafond en dezelfde gelijktijdigheidslimiet. Een leverancier die een deprecatie binnen twee dagen kan intrekken, kan er ook van afzien; de operationele les is niet dat het model onstabiel is, maar dat de naam een verwijzing is, en gedrag vastpinnen op een build-ID in plaats van een routenaam is de goedkope verzekering.
Het bevat de omliggende kennis niet. GPT-6.1 Sol is acht dagen oud en heeft al één onafhankelijke configuratie gepubliceerd; DeepSeek V4 Pro heeft een langere evaluatiegeschiedenis en een veel grotere basis van praktijkgebruikers, waaronder een gepubliceerde servingstack en throughputwerk van derden. Voor een self-hosted deployment is dat materiaal meer waard dan de indexrij, want dat is wat je raadpleegt wanneer het model zich vreemd gedraagt op jouw hardware in plaats van op een benchmark.
Wanneer de vier keer goedkopere meter de verkeerde meter is
Als het goedkope model simpelweg op alles slechter was, zou dit een kort artikel zijn. Het ongemakkelijke feit is dat de twee modellen op identiek werk per taak 7% van elkaar verschillen, en 2,4× van elkaar verschillen in hoeveel ze schrijven om daar te komen. Dat betekent dat de blended-tokenmeter — degene die 4× aangeeft — een verschil meet dat je grotendeels niet betaalt, omdat die een tokenmix prijst die je mogelijk nooit verstuurt. En de indexmeter, degene die 16 punten aangeeft, meet over twee peergroepen en kan niet worden afgetrokken.
Dus de praktische tweedeling is niet "frontiermodel voor zwaar werk, goedkoop model voor makkelijk werk." Het is een tweedeling naar modaliteit en een tweedeling naar volume. Alles met een afbeelding erin gaat naar GPT-6.1 Sol, en dat geldt ook voor alles waarbij het antwoord kort is en het redeneren het dure deel is — de vijf inspanningsniveaus, low tot en met max met medium als standaard, laten je redeneren inkopen zonder proza te kopen, en de gecachte input van $0,10 maakt een lange herhaalde prompt goedkoop. Alles wat alleen tekst is, een hoog volume heeft en een langer antwoord verdraagt — classificatie, extractie, samenvatten, bulkgeneratie tegen een outputbudget van 384.000 tokens — gaat naar DeepSeek V4 Pro, idealiter buiten de twee UTC-vensters.
Beide op één toets, en de splitsing is een configuratieregel.
Beide modellen staan op OrcaRouter tegen de eigen gepubliceerde tarieven van hun aanbieders, niets toegevoegd: GPT-6.1 Sol voor $2,00 / $10,00, oplopend naar $4,00 / $15,00 boven 272.000 prompttokens, en DeepSeek V4 Pro voor $0,66 / $1,98, waarbij de twee getimede vensters worden overgenomen zoals vermeld. Eén sleutel, één factuur, één OpenAI-compatibel endpoint voor beide.
Dat is de reden waarom de bovenstaande splitsing het waard is om op te schrijven in plaats van erover te discussiëren. Een modaliteitssplitsing is uit te drukken als een routeringsregel, zodat afbeeldingsbevattende verzoeken naar het visionmodel gaan en de bulktekst naar het goedkope model zonder wijziging aan de applicatie; als een route verslechtert, verplaatst failover de aanroep in plaats van deze te laten mislukken. En omdat beide op hetzelfde endpoint staan, kan de prijsvergelijking die er echt toe doet — die van jou, op jouw verkeer, bij jouw tokenmix — worden gemaakt op basis van je eigen facturen in plaats van op basis van het gemiddelde van een benchmarksuite.


Het oordeel, in één regel, is dat de vier keer goedkopere lezing degene is om te wantrouwen en de zeven procent-lezing degene is om te controleren. Vier keer is wat de gemengde meter zegt over een tokenmix die je misschien niet verzendt. Zeven procent is wat dezelfde evaluatie op beide kostte, en er zit een ingebakken verschil in uitgebreidheid van 2,4× bij. De zestien punten zijn reëel, ze liggen ook over twee peergroepen, en de beperking die in de praktijk de meeste implementaties van dit tweetal bepaalt, is helemaal geen getal: een van deze modellen kan een screenshot lezen en het andere niet.
Vergeleken in dit artikel2
Herkend uit dit artikel · Benchmarks: Artificial Analysis · dagelijks bijgewerkt
