
DeepSeek V4 Pro Releasedatum: al 14x goedkoper dan Kimi K3, nog niet zo slim
- metaNIEUWMeta: Muse Spark 1.22026-08-0557Intelligentie72Coderen
- qwenNIEUWQwen: Qwen3.8 Max2026-08-0358Intelligentie72Coderen
- deepseekNIEUWDeepSeek: DeepSeek V4 Flash 07312026-07-3152Intelligentie69Coderen
- minimaxNIEUWMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 per 1 mln tokens · 2110 tok/s
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463Intelligentie78Coderen
- googleGoogle: Gemini 3.6 Flash2026-07-2152Intelligentie69Coderen
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137Intelligentie49Coderen
- metaMeta: Muse Spark 1.12026-07-1653Intelligentie71Coderen
- kimiMoonshotAI: Kimi K32026-07-1560Intelligentie76Coderen
- openaiOpenAI: GPT-5.6 Luna2026-07-0952Intelligentie71Coderen
- openaiOpenAI: GPT-5.6 Terra2026-07-0957Intelligentie77Coderen
- openaiOpenAI: GPT-5.6 Sol2026-07-0961Intelligentie77Coderen
- grokxAI: Grok 4.52026-07-0856Intelligentie72Coderen
- tencentTencent: Hy32026-07-0642Intelligentie59Coderen
- obsidianQwen3.6 35B A3B Uncensored (Aggressive)2026-07-0232Intelligentie42Coderen
- obsidianGemma4 26B A4B Uncensored (Balanced)2026-07-0226Intelligentie39Coderen
- anthropicAnthropic: Claude Sonnet 52026-06-3055Intelligentie72Coderen
- klingKling: Kling 3.0 Turbo2026-06-1757Intelligentie52Coderen57Wiskunde
Op 31 juli 2026 publiceerde het bedrijf een changelog-bericht waarin werd aangekondigd dat het goedkope model het dure model had verslagen. Het bericht ging over DeepSeek V4 Flash, de efficiëntielaag van 284B, en de kernclaim was: "aanzienlijk verbeterde agentmogelijkheden, met benchmarkresultaten die ver boven V4-Pro-Preview uitstijgen." V4-Pro-Preview is DeepSeek V4 Pro — het vlaggenschip met 1,6 biljoen parameters, het model dat drie keer zoveel per token kost. Hetzelfde bericht sloot af met een enkele zin erover: "De officiële release van DeepSeek-V4-Pro volgt binnenkort." Dat is de context voor de voorspelling die momenteel rondgaat, dat wanneer de echte V4 Pro uitkomt, die op Kimi K3 niveau zal zitten maar tien keer goedkoper zal zijn. De ene helft daarvan is al meetbaar, en die zit ernaast in een richting die bijna niemand verwacht.
Een opmerking over wat dit artikel wel en niet is. Er is hier geen gelekt systeemkaartje, geen interne benchmark, geen datum. De voorspelling die rondgaat komt van @scaling01 op X — "DeepSeek-V4 Pro will be a banger probably also Kimi-K3 level but 10x cheaper" — en het is een verwachting van een veelgevolgde praktijkdeskundige, geen onthulling van iemand met toegang. Door het als een lek te behandelen ontstaan slechte berichten over releasedatums. Wat we in plaats daarvan kunnen doen, is de twee toetsbare helften van de bewering nemen en die controleren tegen cijfers die al bestaan, want de preview-build is al drie maanden aanroepbaar en zowel die als Kimi K3 zijn door een onafhankelijk lab gerund. Alles hieronder is gelabeld naar bron: de eigen documentatie van het bedrijf, de metingen van Artificial Analysis, of rekenwerk dat we zelf hebben gedaan en tonen.
Wat DeepSeek daadwerkelijk heeft gezegd, en wat niet
De bevestigde omvang is groter dan de framing van het 'niet-uitgebrachte model' doet vermoeden. V4 Pro is geen vaporware — je kunt het nu al aanroepen. Wat niet is gebeurd, is de release die het bedrijf zelf als officieel beschouwt.
• Architectuur — een mixture-of-experts-model met 1.6T totale parameters en 49B actief per token, bevestigd door het bedrijf en identiek vermeld op Artificial Analysis als 1600B/49B.
• Context en uitvoer — een invoervenster van 1M tokens (1.048.576) met maximaal 384K uitvoertokens. Tekst in, tekst uit; geen afbeelding, audio of video-invoer.
• Licentie en gewichten — MIT, met gewichten gepubliceerd op Hugging Face. Dit is een vlaggenschip met open gewichten, wat de hele reden is dat de vergelijking met Kimi K3 interessant is.
• Lijstprijs — $0.435 per miljoen invoertokens bij een cachemisser, $0.003625 bij een cachetreffer, en $0.87 per miljoen uitvoertokens, volgens de eigen prijspagina van het bedrijf.
• Interfaces — OpenAI-stijl ChatCompletions en Anthropic-formaat endpoints, plus reasoning-effort-niveaus, tool calling en gestructureerde output.
• Tijdlijn tot nu toe — de V4-familie arriveerde als preview op 24 april 2026; de verouderde deepseek-chat en deepseek-reasoner modelnamen werden op 24 juli 2026 uitgefaseerd; Flash kreeg zijn officiële build op 31 juli 2026; Pro niet.
• 6 augustus 2026 — DeepSeek heeft ontwikkelaars laten weten dat het van plan is de algehele prijzen voor DeepSeek API-diensten "in de nabije toekomst, met een verwachte aanzienlijke stijging," te verhogen, en herhaalde dat de officiële V4 Pro-release zal volgen. Er zijn geen nieuwe tarieven en geen ingangsdatum gepubliceerd.
En de delen die werkelijk onbekend blijven, wat het grootste deel is van waar mensen naar op zoek zijn:
• De GA-datum — nog niet aangekondigd. “Volgt binnenkort” blijft de volledige formele toezegging van het bedrijf. Onbevestigde persmeldingen wijzen op een venster medio augustus — één medium heeft 10–20 augustus gesuggereerd, en de prijspagina van een reseller heeft op 3 augustus de V4 Pro-cacheprijzen aangepast in een patroon dat historisch gezien aan een release voorafgaat — maar niets daarvan is afkomstig van het bedrijf. Er is geen datum bevestigd.
• Wat de GA-build zal veranderen — niet vermeld. Het bedrijf heeft niet bekendgemaakt of de officiële V4 Pro een re-post-train van dezelfde gewichten is, een nieuwe pretraining, of een herprijzing.
• Of de prijs het overleeft — onbesproken, en er is een specifieke reden om ons hier zorgen over te maken, waar we hieronder op terugkomen.
Eén correctie die het waard is om expliciet te vermelden, omdat de zoekresultaten voor deze vraag vervuild zijn: je zult pagina's vinden die beweren dat de V4-familie op 20 juli 2026 algemeen beschikbaar werd. De eigen changelog van het bedrijf, elf dagen na die datum, zegt dat de officiële V4 Pro-release nog steeds in behandeling is, en voegt toe dat de update van 31 juli "alleen de DeepSeek-V4-Flash API upgradet. De DeepSeek-V4-Pro API en de APP/WEB-modellen zijn ongewijzigd." Wanneer een samenvatting van een derde partij en de primaire changelog van een leverancier met elkaar in tegenspraak zijn, wint de changelog.

De prijsclaim: "10x goedkoper" is de conservatieve lezing.
Kimi K3 staat genoteerd op $3,00 per miljoen invoertokens en $15,00 per miljoen uitvoertokens, met cachetreffers op $0,30. V4 Pro staat genoteerd op $0,435 en $0,87, met cachetreffers op $0,003625. Zet je die tegen elkaar af, dan blijkt "10x" het lage uiteinde van een bereik te zijn, niet de kop:
• Invoertokens — $3,00 tegenover $0,435, dus V4 Pro is 6,9x goedkoper. Dit is de enige dimensie waarin de bewering overdrijft.
• Output tokens — $15,00 tegenover $0,87, of 17,2x goedkoper. Output is waar redeneermodellen het meeste aan uitgeven, wat dit het belangrijkste getal maakt.
• Een 70/30 input-output blend — $6,60 per miljoen tegen $0,5655, of 11,7x.
• De 7:2:1 cache-hit/input/output-blend van Artificial Analysis — $2,31 tegenover $0,18, oftewel 12,8x.
• Gecachete invoer — $0.30 tegenover $0.003625, ruwweg 83x. De cache-read-prijs van het bedrijf staat op de 4e plaats van de 101 modellen die Artificial Analysis volgt, met een korting van 99% ten opzichte van het eigen cache-miss-tarief.
Over hypothetische blends kun je twisten, dus hier is een gemeten voorbeeld. Artificial Analysis publiceert wat het daadwerkelijk heeft uitgegeven om zijn volledige Intelligence Index op elk model te draaien — dezelfde evaluatiesuite, dezelfde harness, echte tokentellingen in plaats van een aangenomen verhouding. Kimi K3 kostte $2.437,41 om te evalueren. V4 Pro kostte $176,34. Dat is 13,8x, bij een identieke werklast, in dollars die iemand echt heeft betaald.
Het is de moeite waard om te begrijpen waarom dat cijfer lager is dan de 17,2x output-prijsverhouding, want het is de enige plek waar de goedkoopheid van V4 Pro deels zelfveroorzaakt is. V4 Pro is breedsprakig: het verbruikte 180M output-tokens om de index door te komen, tegen 130M voor Kimi K3 en tegen een mediaan van 100M voor zijn klasse. Het besteedt dus ongeveer 38% meer tokens om te zeggen wat het te zeggen heeft, wat het voordeel per token uitholt. Die 13,8x heeft dat al ingeprijsd; de 17,2x niet. Als je budgetteert, gebruik dan het gemeten cijfer.
Dit is ook het deel van het verhaal dat je gemakkelijk zelf kunt controleren in plaats van op goed vertrouwen aan te nemen. Omdat OrcaRouter de lijstprijzen van providers met 0% opslag rechtstreeks doorgeeft, zijn de prijzen per token op onze modelpagina's voor deepseek/deepseek-v4-pro en kimi/kimi-k3 de prijzen van de twee leveranciers zelf — K3 toont $3.00/$15.00 op onze pagina en $3.00/$15.00 op die van Moonshot — geen doorverkooptarief met een verborgen marge — wat betekent dat de bovenstaande berekening op één factuur terugkomt, en als een van beide leveranciers een prijs aanpast, komt die wijziging dezelfde dag bij ons terecht in plaats van na een contractcyclus.
De intelligentieclaim: 13 punten, geen pariteit.
"Kimi K3-niveau" is de helft van de voorspelling die de confrontatie met de huidige cijfers niet overleeft. Op de Intelligence Index van Artificial Analysis, per 5 augustus 2026, scoort Kimi K3 57 en DeepSeek V4 Pro (redeneren, maximale inspanning) scoort 44 — gerangschikt op #6 van 101 modellen, wat een werkelijk sterke positie is, en nog steeds 13 punten tekort. Beide worden gemeten door hetzelfde laboratorium op dezelfde samengestelde index, beide met maximale redeneerinspanning, beide met een 1M-tokencontext.
De leveranciersbenchmarks vertellen een ander en vleiender verhaal, en dat is precies waarom ze gelabeld moeten worden. Het bedrijf rapporteert V4 Pro-Preview op 80.6% op SWE-bench Verified en 90.1% op GPQA Diamond. Moonshot rapporteert Kimi K3 op 76.8% op SWE-bench Verified en 93.5% op GPQA Diamond. Als we ze voor de nominale waarde nemen, wint V4 Pro de coderingsbenchmark overduidelijk. Geen van beide sets is onafhankelijk gereproduceerd; ze zijn geproduceerd op verschillende testopstellingen door teams met een belang bij de uitkomst, en bij de enige samengestelde test waarbij een derde partij beide modellen zelf heeft gedraaid, keert de volgorde om. Dat is de hele reden om enkele benchmarkvergelijkingen tussen leveranciers te wantrouwen.

Twee dingen over het indexnummer verdienen hun eigen kanttekeningen. Ten eerste, als je oudere beschrijvingen tegenkomt die V4 Pro op 52 in plaats van 44 zetten, dan zitten ze niet fout — het eigen lanceringsartikel van Artificial Analysis van april plaatste V4 Pro (Max) inderdaad op 52 en noemde het het #2 open-weights redeneringsmodel. De index wordt herzien, en herzieningen verplaatsen de score van elk model. De praktische regel is dat alleen vergelijkingen binnen dezelfde momentopname iets betekenen; een 52 van april en een 57 van augustus horen niet in dezelfde zin thuis. Ten tweede, de pagina van Artificial Analysis is gedateerd "Released april 2026" en maakt geen onderscheid tussen de preview-build en een toekomstige officiële versie, dus de 44 is een meting van wat de endpoint serveerde, wanneer het ook getest werd.
Waar V4 Pro het duidelijk wint van Kimi K3 is op de assen die geen intelligentie betreffen. Het genereert 66,5 tokens per seconde tegenover 37,6 voor K3, in een klasse waarvan de mediaan 65,9 is — dus V4 Pro zit rond het gemiddelde voor zijn klasse en Kimi K3 is ongewoon langzaam. De tijd tot het eerste token is 1,61 seconden tegenover 2,85. Voor een interactieve agent-loop is dat verschil bij elke stap voelbaar, en het is het sterkste argument voor de preview-build zoals die er nu voorstaat.
Wat de officiële build van Flash ons vertelt over Pro's
Hier is wat het dichtst in de buurt komt van echt bewijs over het nog niet uitgebrachte model, en het komt van het zustermodel dat het proces al heeft doorlopen.
In het wijzigingslogboek van 31 juli vermeldt het bedrijf dat "DeepSeek-V4-Flash-0731 dezelfde modelarchitectuur en -grootte behoudt als DeepSeek-V4-Flash-Preview en alleen opnieuw post-training heeft ondergaan." Zelfde aantal gewichten, zelfde architectuur, zelfde prijs — alleen post-training. Artificial Analysis scoorde het resultaat op 50, tegen 40 voor de vorige Flash-build. Tien punten op de samengestelde index, alleen door post-training, zonder extra kosten per token. Het output-tokenverbruik op de index daalde ook met 12%, van ~234M naar ~206M, waardoor het goedkoper werd om te draaien tegen dezelfde catalogusprijs.
Pas dat precedent toe op Pro en de rekensom is onvermijdelijk: 44 plus 10 is 54. Kimi K3 zit op 57. Zelfs als de officiële V4 Pro de meest succesvolle post-training-upgrade herhaalt die het bedrijf publiekelijk heeft gedemonstreerd, komt hij ongeveer drie punten tekort op 'Kimi K3-niveau' — terwijl het draaien ervan ongeveer een veertiende kost. Dat is een opmerkelijk resultaat en het is niet de uitkomst die de voorspelling voorspelt.
De eerlijke kanttekeningen bij die extrapolatie, die rekenkundig is en geen voorspelling: een +10-winst op een 284B-model zegt weinig over wat beschikbaar is op een 1.6T-model, en de speelruimte kan groter of veel kleiner zijn. Het bedrijf heeft niet gezegd dat de Pro-build uitsluitend post-training zal zijn. En de index is een samengestelde maatstaf, dus drie punten kunnen één benchmark zijn. De reden om het getal toch uit te rekenen, is dat het het enige gekwantificeerde, door de leverancier bevestigde precedent is dat bestaat, en dat is veel meer dan waar de voorspelling op rust.
Eén detail uit die wijzigingslogboek verdient het om te worden gemarkeerd in plaats van herhaald: Flash's agentische scores werden geproduceerd met behulp van "de Harness-minimale modus van het bedrijf (binnenkort te verschijnen)" met maximale inspanning, topp=0.95, temperatuur=1.0. De harness die de cijfers genereerde is niet publiekelijk uitgebracht — deze ging begin augustus in gesloten bèta — dus die cijfers kunnen nog steeds door niemand buiten het bedrijf worden gereproduceerd, zelfs niet in principe, niet omdat ze onjuist zijn maar omdat het instrument niet beschikbaar is. Verwachting dat de Pro-release met dezelfde asterisk zal verschijnen.
De clausules die de goedkope-modelthese ongedaan kunnen maken.
In de prijsdocumentatie van het bedrijf is een beleid verborgen dat bijna geen dekking van de V4-lijnprijzen in zich heeft. In de woorden van het bedrijf zal de API "binnenkort overgaan op" een schema waarbij "tijdens piekuren de prijzen 2x de reguliere prijzen zullen zijn, van toepassing op alle factuuritems." Piekuren zijn gedefinieerd als 09:00–12:00 en 14:00–18:00 Beijing-tijd, dagelijks — zeven uur per dag, elke dag. De ingangsdatum is "onder voorbehoud van de officiële aankondiging," en op het moment van schrijven is de toeslag niet actief.
Let op de richting. Het bedrijf bood historisch gezien buiten de piekuren kortingen op V3 en R1 aan; dit is een piektoeslag op het standaardtarief. Als deze wordt geactiveerd met de vermelde vermenigvuldiger, wordt de dagprijs van V4 Pro $0,87 in en $1,74 uit, en verandert de vergelijking van vorm: het 11,7x gewogen voordeel ten opzichte van Kimi K3 daalt naar 5,8x, en de gemeten 13,8x daalt naar 6,9x. Nog steeds goedkoop. Niet langer "10x goedkoper", en niet langer goedkoop op de uren waarop een Europees of Aziatisch team daadwerkelijk werkt.
Op 6 augustus viel de grotere schoen. DeepSeek kondigde op zijn ontwikkelaarsplatform aan dat het van plan is de algemene prijsstelling voor DeepSeek API-diensten te verhogen 'in de nabije toekomst, waarbij een aanzienlijke verhoging wordt verwacht.' Er zijn geen nieuwe tarieven en geen ingangsdatum gepubliceerd, en het bedrijf heeft niet gezegd of de verhoging losstaat van de piekurenregeling of ermee samenvalt. De pers die het bedrijf volgt, las de aankondiging als een signaal dat de officiële V4 Pro-release op handen is — een nog niet uitgebracht vlaggenschip prijs je niet agressief in een kortingsregime dat je op het punt staat te verlaten. Iedereen die vandaag een kostmodel bouwt op V4 Pro, moet beide scenario's modelleren, en iedereen die een kop leest als 'het bedrijf is 14x goedkoper' — inclusief deze — moet weten dat die een prijslijst beschrijft waaraan een aangekondigde vervalvoorwaarde is verbonden. Dit is de meest waarschijnlijke manier waarop de prijshelft van de voorspelling niet langer uitkomt, en het heeft niets met het model te maken.
Hoe weet u dat de officiële build is uitgebracht?
Er is een detail in hoe het bedrijf verzendt dat belangrijker is dan de datum, en het is een echt operationeel gevaar.
De API-model-ID is deepseek-v4-pro. Niet deepseek-v4-pro-preview, en geen gedateerde build-string — ook al verwijst de eigen changelog van het bedrijf naar de huidige build als V4-Pro-Preview en naar de uitgebrachte Flash-build als V4-Flash-0731. Toen Flash officieel werd, luidde de instructie: "De API-aanroepmethode blijft ongewijzigd — stel eenvoudigweg de modelnaam in op deepseek-v4-flash om de nieuwste versie te gebruiken." Met andere woorden: het vastpinnen van de model-ID legt de build niet vast. Dezelfde string begon stilletjes een andere set gewichten te bedienen, met wezenlijk ander gedrag en tien indexpunten meer.
Dus het praktische antwoord op "wanneer komt V4 Pro uit" is dat als je deepseek-v4-pro in productie aanroept, je er misschien achter komt door te zien dat je eigen outputs veranderen. Concreet zijn dit de dingen om in de gaten te houden: een nieuwe gedateerde vermelding in de API-changelog van het bedrijf, waar de release van Flash als eerste verscheen; een build-achtervoegsel zoals V4-Pro-0731 in de tekst van die vermelding, ook al blijft de aanroepbare ID onveranderd; een bijgewerkte score op de V4 Pro-pagina van Artificial Analysis, wat de eerste onafhankelijke bevestiging is die je krijgt; de aangekondigde prijsverhoging die zich vertaalt in daadwerkelijke tarieven, aangezien GA het natuurlijke moment is om zowel die als de piekurentabel door te voeren; en de Responses API van het bedrijf, waarvan de documentatie zegt dat deepseek-v4-pro-ondersteuning gepland staat voor begin augustus — de overgang van het model van de "gepland"-lijst naar de lijst met ondersteunde modellen is ongeveer het dichtst dat het bedrijf bij een officieel releasignaal komt. Twee signalen die we niet kunnen bevestigen, zijn desondanks de moeite waard om te weten: de prijspagina van een reseller heeft op 3 augustus de cacheprijzen van V4 Pro aangepast in een patroon dat historisch gezien aan een release voorafgaat, en de interne evaluatie-harness van het bedrijf bevindt zich in een gesloten bèta, wat betekent dat de vendor-benchmarks eindelijk controleerbaar kunnen worden zodra die uitkomt. Een string die lijkt op deepseek-v4-pro-202606 is ook rondgegaan als een gelekt build-ID; we konden het niet verifiëren aan de hand van enige officiële bron van het bedrijf, en er moet geen geloof aan worden gehecht totdat iemand dat kan.
Moet je vandaag op de preview bouwen?
Voor de meeste mensen die dit model evalueren, is de releasedatum de verkeerde vraag. De preview is aanroepbaar, heeft een prijs, valt onder de MIT-licentie en wordt onafhankelijk gemeten op #6 van 101 op intelligentie. De echte vraag is wat de aanstaande GA doet met het werk dat je nu bouwt, en daar zijn twee verschillende antwoorden op.
Als je tussen V4 Pro en Kimi K3 kiest op basis van capaciteiten, wijst het huidige bewijs uit dat Kimi K3 de samengestelde score met 13 punten wint en dat V4 Pro met ruime marges wint op snelheid, latentie en kosten — en dat een aanstaande post-training upgrade de intelligentiekloof kan verkleinen zonder die te dichten. Als je werk op het scherpst van de snede van moeilijk redeneren ligt, zijn die 13 punten het hele spel en is de prijs een afleiding. Als je werk een hoog volume kent en slechts moeilijk is, is 14x betalen moeilijk te rechtvaardigen.
Als je al voor V4 Pro hebt gekozen, is het risico dat je moet beheren niet de releasedatum, maar de stille wissel: de build achter die model-ID zal onder je veranderen, precies zoals bij Flash gebeurde, en je evals zouden dat moeten kunnen detecteren. Zorg voor een regressieset die je op verzoek opnieuw kunt draaien, en houd een tweede model bereikbaar zonder code-wijziging. Dit is de alledaagse reden waarom we failover op deze manier hebben gebouwd — V4 Pro, V4 Flash en Kimi K3 zitten allemaal achter één OrcaRouter-sleutel op een OpenAI-compatibel endpoint, dus "de eval op alle drie opnieuw draaien en dan verkeer verplaatsen" is een configuratiewijziging in plaats van een inkoopexercitie, en een slechte GA-build is een routeringsbeslissing in plaats van een incident. Een onbewezen vlaggenschip uitproberen is veel gemakkelijker als het terugdraaien van die keuze niets kost.

Vragen die mensen daadwerkelijk stellen
Is DeepSeek V4 Pro uitgebracht of niet?
Beide, afhankelijk van wat je bedoelt, en daarom spreken de zoekresultaten elkaar tegen. Het model is sinds de lancering van de V4-preview op 24 april 2026 openbaar aanroepbaar, met gepubliceerde prijzen, open gewichten onder MIT en onafhankelijke benchmarkdekking. Maar de eigen changelog van het bedrijf van 31 juli 2026 stelt expliciet dat de V4 Pro API "ongewijzigd" is en dat de officiële release "binnenkort volgt", en op 6 augustus zei DeepSeek opnieuw dat de officiële versie zo snel mogelijk zou worden uitgebracht, terwijl het een grote API-prijsverhoging aankondigde. Dus: beschikbaar, maar nog niet officieel. Er is geen datum bevestigd; onbevestigde berichten wijzen op half augustus, wat de wachttijd kort zou maken.
Zal de officiële build net zo goed zijn als Kimi K3?
Op het enige gekwantificeerde precedent dat beschikbaar is, waarschijnlijk niet helemaal. De officiële build van Flash behaalde 10 punten op de Intelligentie-index van Artificial Analysis alleen al door post-training; V4 Pro staat op 44 en Kimi K3 op 57, dus een identieke winst komt uit op 54. Die extrapolatie kan in beide richtingen fout zijn — een 1,6T-model kan andere headroom hebben dan een 284B-model, en het bedrijf heeft niet gezegd dat de Pro-release alleen post-training zal zijn. Maar wie vandaag gelijkwaardigheid beweert, beweert iets dat geen enkele gepubliceerde meting ondersteunt.
Waarom scoort het goedkope model van DeepSeek momenteel hoger dan zijn vlaggenschip?
Vanwege de releasevolgorde, niet omdat Flash het betere model is. Flash kreeg op 31 juli een post-training-upgrade waardoor het op de index van 40 naar 50 ging; Pro heeft het equivalent daarvan niet gekregen, dus het wordt nog steeds gemeten op de post-training van april. Het bedrijf zegt dat zelf ook, en omschrijft de agentische resultaten van Flash-0731 als "ver boven die van V4-Pro-Preview uitstijgend." De omkering is een momentopname van een onvoltooide uitrol, en de aanstaande Pro-release is precies wat daar een einde aan zou maken.
Is de prijs van $0,435 / $0,87 veilig om een kostenmodel op te bouwen?
Voorwaardelijk, en minder veilig dan een week geleden. Het is de huidige gepubliceerde lijstprijs van het bedrijf en het weerspiegelt al een grote permanente verlaging ten opzichte van de V4-lanceringsprijzen. Maar op 6 augustus kondigde DeepSeek aan dat het van plan is de API-prijzen in het algemeen te verhogen, "met een aanzienlijke stijging verwacht," en er zijn nog geen nieuwe tarieven of een datum gepubliceerd — bovenop het aangekondigde maar inactieve piekurenbeleid dat alle facturatieposten zeven uur per dag zou verdubbelen. Modelleer beide scenario's en merk op dat zelfs in het verdubbelde geval het nog steeds ongeveer 6x goedkoper is dan Kimi K3.
De eerlijke lezing
De voorspelling die dit in gang zette was half goed, en de helft die het goed had, is de helft die mensen het moeilijkst te geloven zullen vinden. "10x goedkoper" is nog een understatement: bij dezelfde gemeten evaluatieworkload kostte de preview-build van DeepSeek V4 Pro $176.34 tegenover $2,437.41 voor Kimi K3, en bij gecachte invoer is het verschil niet tienvoudig maar ongeveer tachtigvoudig. "Kimi K3 level" is het deel dat er nog niet is — 44 tegen 57 op de enige samengestelde test die een onafhankelijk lab op beide draaide, met een optimistische extrapolatie op basis van het beste precedent van het bedrijf zelf die uitkomt op 54.
Wat deze lezing zou veranderen is specifiek en de moeite waard om in de gaten te houden. Als de officiële V4 Pro-build arriveert als een post-training upgrade en Artificial Analysis het opnieuw scoort boven 57, wordt de voorspelling volledig bevestigd en is het centrale getal van dit artikel achterhaald. Als het arriveert samen met de piekuren-toeslag of de prijsverhoging die op 6 augustus is aangekondigd, halveert het prijsargument en wordt de interessante vraag of een 6x korting een achterstand van 13 punten opkoopt. En als het bedrijf zijn evaluatie-harness uitbrengt — al in gesloten bèta — worden de vendor-benchmarks die V4 Pro op het gebied van coderen momenteel bevoordelen voor het eerst controleerbaar. Totdat een van deze dingen gebeurt, is de accurate samenvatting van DeepSeek V4 Pro dat het het beste serious reasoning-model met downloadbare gewichten is voor zijn prijs, dat het niet de slimste is, en dat de leverancier ons heeft verteld dat het nog niet af is.
Vergeleken in dit artikel4
Herkend uit dit artikel · Benchmarks: Artificial Analysis · dagelijks bijgewerkt
