
DeepSeeks 3T-model: de opschaling die op de clusters moet wachten
- deepseekNIEUWDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligentie
- openaiNIEUWOpenAI: GPT-6 Astra2026-09-0453Intelligentie77Coderen
- googleNIEUWGoogle: Gemini 3.8 Flash2026-09-0241Intelligentie76Coderen
- qwenNIEUWQwen: Qwen3.8 Max (0902)2026-09-0240Intelligentie72Coderen
- anthropicNIEUWAnthropic: Claude Fable 5.12026-09-0153Intelligentie82Coderen
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1 mln tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligentie72Coderen
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1 mln tokens
- z-aiZ.ai: GLM 5.32026-08-1845Intelligentie75Coderen
- obsidianQwen3.8 27B2026-08-1534Intelligentie68Coderen
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Intelligentie69Coderen
- grokSpaceXAI: Grok 4.62026-08-1244Intelligentie77Coderen
- metaMeta: Muse Spark 1.22026-08-0540Intelligentie72Coderen
- qwenQwen: Qwen3.8 Max2026-08-0340Intelligentie72Coderen
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135Intelligentie69Coderen
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 per 1 mln tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2451Intelligentie78Coderen
- googleGoogle: Gemini 3.6 Flash2026-07-2134Intelligentie69Coderen
Op 14 september neemt DeepSeek afscheid van DeepSeek V4 Pro — het 1,6 biljoen parameters tellende vlaggenschip dat het op 13 augustus algemeen beschikbaar maakte — en beantwoordt elke aanroep naar deepseek-v4-pro met DeepSeek V4.1 Flash, het model met 552 miljard parameters dat het op 10 september uitbracht. Vier dagen voordat die omschakeling werd aangekondigd, plaatste een pseudonieme DeepSeek-volger iets prikkelends in de tegenovergestelde richting: dat het lab aan een model met 3 biljoen parameters had gewerkt, "waarschijnlijk nog een Engram met 1T params," en dat de reden dat het niet is uitgebracht economisch is, niet een kwestie van capaciteit.
Over dat model is niets bevestigd. Er is geen naam, geen repository, geen configuratiebestand, geen benchmark, geen releasevenster — één X-bericht, met als bron een "gezaghebbende autoriteit", waarbij het allerinteressantste detail door de auteur zelf expliciet als speculatie wordt bestempeld. Zie het als een signaal, niet als een feit. Het is toch de moeite waard om te lezen, want de twee helften van de bewering trekken in tegengestelde richtingen en slechts één ervan zal waarschijnlijk het contact met de eigen roadmap van DeepSeek overleven.
Wat de lek daadwerkelijk zegt, en wat het niet zegt.
De post is afkomstig van het account teortaxesTex, een al lang meelopende DeepSeek-watcher die zichzelf omschrijft als fan van het lab sinds 2023. De volledige tekst luidt: "Eigenlijk weet ik uit betrouwbare bron dat DeepSeek aan een 3T-model werkte (backbone, waarschijnlijk nog een Engram met 1T-parameters, maar dat is mijn speculatie). Ze waren alleen niet zeker of het rendabel zou zijn om het te post-trainen en te serveren. Wanneer hun clusters groeien, zullen we er een paar zien..."
Vier dingen in die twee zinnen wegen zwaar, en één daarvan is helemaal geen feit. "Good authority" is niet bij naam genoemd. Het aantal parameters komt als één getal, zonder onderscheid tussen totaal en actief. De opmerking over Engram wordt door degene die speculeert als speculatie bestempeld. En "wanneer hun clusters groeien" is een voorwaardelijke zin zonder datum eraan.
• Wat er wordt beweerd — dat er een DeepSeek-model met 3 biljoen parameters bestaat in een of andere fase van ontwikkeling.
• Wat uitdrukkelijk de eigen gok van de auteur is — dat ruwweg 1T ervan Engram-geheugen is.
Wat onbekend is — de naam, de architectuur, het aantal actieve parameters, het contextvenster, de trainingsstatus en of het überhaupt als product wordt uitgebracht.
• Wat op dit moment verifieerbaar is — niets. Geen enkele DeepSeek-repository, modelkaart, prijzenrij of documentatievermelding rept erover.
Zelfs de rekenkunde is dubbelzinnig. "3T-model (backbone, waarschijnlijk nog eens 1T params Engram)" ondersteunt twee interpretaties: een 3T-model waarvan ongeveer 1T Engram is, of een 3T-backbone met nog eens 1T Engram erbij, voor in totaal ruwweg 4T. Die kloof is een biljoen parameters breed en verandert de serverfactuur meer dan de meeste labs aan een trainingsrun uitgeven.
Het is ook goed om te onthouden dat de staat van dienst van dit account gemengd is en niet van orakelniveau. Hij interpreteerde het bericht van DeepSeek van 9 september over het omleiden van V4 Pro-verkeer als bewijs dat het lab "de architectuurproblemen van de V4-familie had opgelost" — een redelijke gevolgtrekking, en nog steeds een gevolgtrekking. Begin september opperde hij ook het idee dat een anoniem stealthmodel op een codeerplatform van een derde partij het MiMo-V3-Flash van Xiaomi was, wat niemand heeft bevestigd. Nuttig vroeg signaal; geen gezaghebbende bron.
De interessante helft is de geheugentabel, niet het aantal parameters.
Engram is echt, en het is de reden dat een 3T-bewering aannemelijker is dan die in eerste instantie klinkt. DeepSeek publiceerde de conditionele geheugenarchitectuur in januari 2026 met opensourcecode erbij, en deze doet iets ongewoons: hij scheidt statische kennisretrieval van dynamische redenering. In plaats van GPU-rekenkracht te besteden aan het ophalen van feiten, hasht het model zijn context naar embeddingtabellen in DRAM en haalt die in constante tijd op, zonder GPU-werk in het opzoekpad, plus een gatingmechanisme dat een opgehaalde herinnering onderdrukt wanneer die in conflict komt met de omringende context.
De cijfers die DeepSeek voor zijn eigen testconfiguratie rapporteerde, zijn de cijfers om aan vast te houden: een embeddingtabel van 100 miljard parameters die naar DRAM wordt geoffload tegen een doorvoerpenalty van minder dan 3%, en 97% needle-in-a-haystack-nauwkeurigheid bij 1M tokens tegenover 84,2% voor standaard attention. Dat zijn de cijfers van het lab zelf, niet door ons gereproduceerd. Onafhankelijke vroege evaluaties zouden naar verluidt op 93–96% zijn uitgekomen bij dezelfde contextlengte — duidelijk boven de baseline, onder de claim.
Schaal dat idee tien keer op en de vorm van het lek verandert. Als het grootste deel van de extra parameters van een 3T-model hash-tabelgeheugen is dat in DRAM zit, in plaats van experts die concurreren om HBM, dan is "3T" niet langer een proxy voor "niet serveerbaar". Het totale aantal parameters en de servingkosten komen los van elkaar. Dat is het werkelijk nieuwe idee in dit lek, en het is het deel dat het gepubliceerde onderzoek daadwerkelijk ondersteunt.
Het voorbehoud is dat het Engram-artikel naar verluidt geen aandacht besteedt aan de overhead tijdens inferentie — latentie en doorvoer — en dat is precies waar een in DRAM opgeslagen opzoektabel zichtbaar zou worden, als die al ergens zichtbaar zou worden. Geheugen dat je moet gaan ophalen is geen geheugen dat je gratis krijgt.

Waarom DeepSeek's eigen september het tegendeel beargumenteert.
Het argument tegen een 3T-product dat binnenkort uitkomt, is dat DeepSeek net het experiment op 1,6T heeft uitgevoerd en zijn eigen vraag met iets kleiners heeft beantwoord. De V4-ladder zoals die er vandaag uitziet:
• DeepSeek-V4-Flash-0731 — 284B totale parameters, 13B actief per token.
• DeepSeek-V4-Pro-0813 — 1.6T totaal, 49B actief, open gewichten onder een MIT-licentie.
• DeepSeek V4.1 Flash — 552B backbone op een causaal encoder-decoder-ontwerp dat 8B parameters per token activeert tijdens prefill en 16B tijdens decode.
Op 14 september om 12 uur 's middags Pekingse tijd verschijnt de middelste trede. DeepSeek haalt V4 Pro offline en leidt verzoeken voor deepseek-v4-pro door naar V4.1 Flash, gefactureerd tegen Flash-tarieven, totdat er een V4.1 Pro bestaat. De officiële prijspagina bevat vandaag twee rijen, en geen van beide is qua grootte de opvolger van het uitgefaseerde model: deepseek-flash voor $0,30 per miljoen inputtokens en $1,20 per miljoen output tijdens piekuren, deepseek-v4-pro voor $1,32 en $3,96, met off-peaktarieven op de helft van die bedragen. Beide vermelden een contextvenster van 1M tokens en een uitvoerplafond van 384.000 tokens.
De richting is niet subtiel. Een lab dat zijn grootste model met pensioen stuurt ten gunste van een model dat tien keer minder parameters per token activeert, heeft al geconcludeerd dat de economische eenheid van grensverleggende capaciteit niet het grootste checkpoint is dat het kan trainen. Een 3T-model waarvan de bouwer niet zeker weet of het 'economisch kan worden nagetraind en geserveerd', is geen gerucht over aarzeling; het beschrijft een lab dat nu meetdata over het alternatief heeft.
Post-training is de scherpere helft van dat probleem. Volledige-parameter post-training van de DeepSeek-V4-Pro-lijn op Huawei's CloudMatrix384 SuperPOD is door het externe SLAI T-Rex-project gerapporteerd op 34.22% MFU, ruwweg 2.93x het open baselinerecept. Dat is een bemoedigend getal — een getal van een derde partij, op een 1.6T-model. Het verdubbelen van de backbone verdubbelt grofweg de rekening voordat er ook maar één token wordt geserveerd.

Wanneer hun clusters groeien
De dragende clausule in het lek is de laatste, omdat het het enige deel is met een openbaar papieren spoor. Naar verluidt is DeepSeek van plan om minstens 160.000 Ascend 950DT-versnellers van Huawei te plaatsen in een nieuw datacenter in Ulanqab, Binnen-Mongolië, in een order ter waarde van ongeveer $2,56 miljard — een van de grootste clusters van AI-silicium van Chinese makelij die ooit iemand heeft geprobeerd.
De kanttekeningen bij dat plan wegen zwaarder dan de kop. De chips zijn bedoeld voor inferentie, niet voor training: DeepSeek heeft eerder geprobeerd op Huawei-silicon te trainen en traint nog steeds op Nvidia-accelerators, de stap die een 3T-model werkelijk nodig zou hebben. Levering kan meer dan een jaar duren. Een deel van de capaciteit gaat naar verwachting eind 2027 tot begin 2028 online. En naar verwachting zal het aanbod van high-bandwidth memory, niet logica, bepalen hoeveel 950DT-eenheden Huawei dit jaar kan bouwen.
Dus de optimistische lezing van "wanneer hun clusters groeien" zet een 3T-model op zijn vroegst op een tijdlijn van 2027–2028, en de pessimistische lezing — dat het een onderzoeksartefact blijft en nooit een product wordt — is in overeenstemming met alles wat DeepSeek in 2026 heeft uitgebracht. De compute-omgeving rond het lab is ook een omstreden beleidskwestie in plaats van een pure aanbodkwestie: op 8–9 september beweerden de NSA, FBI en CISA gezamenlijk dat zes Chinese labs, waaronder DeepSeek, Amerikaanse frontiermodellen op "industriële schaal" hadden gedistilleerd, een beschuldiging die het Chinese ministerie van Handel verwierp. Wat men ook van de beschuldiging vindt, een release die afhankelijk is van clustergroei hangt af van beslissingen waar niemand binnen DeepSeek controle over heeft.
Wat zou dit van een lek in een lancering veranderen?
De checklist is kort en specifiek, en er is nog niets van geactiveerd:
Een repository onder de deepseek-ai organisatie op Hugging Face, met een versiebeheerde checkpointnaam in plaats van een familieslug.
• Een nieuwe rij op de pagina Modellen en prijzen van DeepSeek.
• Een gedateerde vermelding op de nieuwsfeed van de API-documentatie, in het gebruikelijke newsYYMMDD-formaat van het lab.
• Een modelidentificatie, geen familienaam — DeepSeek-versies zijn checkpoints, en een kale familie-slug heeft tot nu toe een preview betekend.
De dichterbij gelegen mijlpaal is V4.1 Pro, die een DeepSeek-teamlid op 9 september aanhaalde als het eindpunt van het routeringsvenster. Er zijn geen gepubliceerde specificaties, geen parameteraantal, geen prijs en ook geen datum. In zekere zin is V4.1 Pro de test voor dit lek: als de volgende flagship op ongeveer de 1,6T van de V4 Pro of daaronder uitkomt, is de 3T-bewering minstens een generatie opgeschoven.
Wat dit allemaal betekent als je deze week een model kiest
Een 3T-model is in 2026 geen aankoopbeslissing, en de praktische les van DeepSeek's september gaat helemaal niet over schaal. Het is dat het model achter een endpoint kan veranderen terwijl de naam van het endpoint exact hetzelfde blijft. Iedereen die deepseek-v4-pro via een abstractielaag aanroept, krijgt op 14 september een ander, kleiner, goedkoper model zonder zijn code aan te raken. Iedereen die rechtstreeks vastzit aan de implementatie van die ID door één provider, krijgt wat die provider besluit te doen.
Zowel DeepSeek V4.1 Flash als DeepSeek V4 Pro staan op OrcaRouter onder één sleutel met 0% opslag — de lijstprijs van de provider wordt één-op-één doorgegeven, wat betekent dat DeepSeeks prijswijziging van 10 september hier dezelfde dag tegen lijstprijs ingaat in plaats van tegen een of andere opgeschroefde versie ervan. Op de modelpagina staat $0,15 per miljoen inputtokens en $0,60 per miljoen output in de off-peaktariefband, wat DeepSeeks eigen off-peaktarief is en er komt niets bovenop. Automatische failover tussen providers is de onglamoureuze functie die in een week als deze het meest telt: wanneer een leverancier het model onder een endpoint vandaan haalt, is de routeringslaag waar dat een configuratiewijziging wordt in plaats van een migratie.
Als er ooit een 3T DeepSeek-model daadwerkelijk wordt uitgebracht, zal het worden aangeboden door wie de clusters heeft om het te huisvesten, tegen een prijs die de rekenkracht bepaalt. In diezelfde routeringslaag zou je het tegenkomen — zonder een tweede contract en zonder iets opnieuw op te bouwen.

De open vraag is niet of DeepSeek een model van 3 biljoen parameters kan bouwen. Drie gepubliceerde architectuurpapers, een werkend geheugenontwerp en een model van 552 miljard parameters waarvan de maker zegt dat het beter presteert dan zijn eigen voorganger van 1,6 biljoen, wijzen er allemaal op dat het lab weet hoe het moet. De vraag is of iemand ervoor zal betalen om het te serveren — en afgaande op de aanwijzingen van de afgelopen twee weken is DeepSeek daar zelf niet zeker van. Let op het cluster, niet op het aantal parameters. De prijzenpagina zal je sneller dan welke leak dan ook vertellen wat DeepSeek daadwerkelijk uitbrengt.
Vergeleken in dit artikel1
Herkend uit dit artikel · Benchmarks: Artificial Analysis · dagelijks bijgewerkt
