Titelkaart met de tekst "DeepSeek's 3T Model", met de ondertitel "Een 3-biljoen-parameterclaim, een 1T Engram-geheugentabel en een cluster dat pas in 2027 beschikbaar komt", met daarboven drie pictogramtegels met de tekst "3T — parameters: niet geverifieerd", "~1T — Engram: eigen gok van de auteur" en "Cluster — op zijn vroegst eind 2027", en met een voettekstregel met de tekst "Lek uit één bron; er bestaat geen repository, modelkaart of prijsrij."
Guides & Insights

DeepSeeks 3T-model: de opschaling die op de clusters moet wachten

Auteur

Alistair Wren

Publicatiedatum

Nieuwste modellen · 20Bekijk alle modellen
Benchmarks: Artificial Analysis · dagelijks bijgewerkt
Terug naar alle berichten

Op 14 september neemt DeepSeek afscheid van DeepSeek V4 Pro — het 1,6 biljoen parameters tellende vlaggenschip dat het op 13 augustus algemeen beschikbaar maakte — en beantwoordt elke aanroep naar deepseek-v4-pro met DeepSeek V4.1 Flash, het model met 552 miljard parameters dat het op 10 september uitbracht. Vier dagen voordat die omschakeling werd aangekondigd, plaatste een pseudonieme DeepSeek-volger iets prikkelends in de tegenovergestelde richting: dat het lab aan een model met 3 biljoen parameters had gewerkt, "waarschijnlijk nog een Engram met 1T params," en dat de reden dat het niet is uitgebracht economisch is, niet een kwestie van capaciteit.

Over dat model is niets bevestigd. Er is geen naam, geen repository, geen configuratiebestand, geen benchmark, geen releasevenster — één X-bericht, met als bron een "gezaghebbende autoriteit", waarbij het allerinteressantste detail door de auteur zelf expliciet als speculatie wordt bestempeld. Zie het als een signaal, niet als een feit. Het is toch de moeite waard om te lezen, want de twee helften van de bewering trekken in tegengestelde richtingen en slechts één ervan zal waarschijnlijk het contact met de eigen roadmap van DeepSeek overleven.

Wat de lek daadwerkelijk zegt, en wat het niet zegt.

De post is afkomstig van het account teortaxesTex, een al lang meelopende Deep​Seek-watcher die zichzelf omschrijft als fan van het lab sinds 2023. De volledige tekst luidt: "Eigenlijk weet ik uit betrouwbare bron dat Deep​Seek aan een 3T-model werkte (backbone, waarschijnlijk nog een Engram met 1T-parameters, maar dat is mijn speculatie). Ze waren alleen niet zeker of het rendabel zou zijn om het te post-trainen en te serveren. Wanneer hun clusters groeien, zullen we er een paar zien..."

Vier dingen in die twee zinnen wegen zwaar, en één daarvan is helemaal geen feit. "Good authority" is niet bij naam genoemd. Het aantal parameters komt als één getal, zonder onderscheid tussen totaal en actief. De opmerking over Engram wordt door degene die speculeert als speculatie bestempeld. En "wanneer hun clusters groeien" is een voorwaardelijke zin zonder datum eraan.

• Wat er wordt beweerd — dat er een DeepSeek-model met 3 biljoen parameters bestaat in een of andere fase van ontwikkeling.

• Wat uitdrukkelijk de eigen gok van de auteur is — dat ruwweg 1T ervan Engram-geheugen is.

Wat onbekend is — de naam, de architectuur, het aantal actieve parameters, het contextvenster, de trainingsstatus en of het überhaupt als product wordt uitgebracht.

• Wat op dit moment verifieerbaar is — niets. Geen enkele DeepSeek-repository, modelkaart, prijzenrij of documentatievermelding rept erover.

Zelfs de rekenkunde is dubbelzinnig. "3T-model (backbone, waarschijnlijk nog eens 1T params Engram)" ondersteunt twee interpretaties: een 3T-model waarvan ongeveer 1T Engram is, of een 3T-backbone met nog eens 1T Engram erbij, voor in totaal ruwweg 4T. Die kloof is een biljoen parameters breed en verandert de serverfactuur meer dan de meeste labs aan een trainingsrun uitgeven.

Het is ook goed om te onthouden dat de staat van dienst van dit account gemengd is en niet van orakelniveau. Hij interpreteerde het bericht van DeepSeek van 9 september over het omleiden van V4 Pro-verkeer als bewijs dat het lab "de architectuurproblemen van de V4-familie had opgelost" — een redelijke gevolgtrekking, en nog steeds een gevolgtrekking. Begin september opperde hij ook het idee dat een anoniem stealthmodel op een codeerplatform van een derde partij het MiMo-V3-Flash van Xiaomi was, wat niemand heeft bevestigd. Nuttig vroeg signaal; geen gezaghebbende bron.

De interessante helft is de geheugentabel, niet het aantal parameters.

Engram is echt, en het is de reden dat een 3T-bewering aannemelijker is dan die in eerste instantie klinkt. Deep​Seek publiceerde de conditionele geheugenarchitectuur in januari 2026 met opensourcecode erbij, en deze doet iets ongewoons: hij scheidt statische kennisretrieval van dynamische redenering. In plaats van GPU-rekenkracht te besteden aan het ophalen van feiten, hasht het model zijn context naar embeddingtabellen in DRAM en haalt die in constante tijd op, zonder GPU-werk in het opzoekpad, plus een gatingmechanisme dat een opgehaalde herinnering onderdrukt wanneer die in conflict komt met de omringende context.

De cijfers die DeepSeek voor zijn eigen testconfiguratie rapporteerde, zijn de cijfers om aan vast te houden: een embeddingtabel van 100 miljard parameters die naar DRAM wordt geoffload tegen een doorvoerpenalty van minder dan 3%, en 97% needle-in-a-haystack-nauwkeurigheid bij 1M tokens tegenover 84,2% voor standaard attention. Dat zijn de cijfers van het lab zelf, niet door ons gereproduceerd. Onafhankelijke vroege evaluaties zouden naar verluidt op 93–96% zijn uitgekomen bij dezelfde contextlengte — duidelijk boven de baseline, onder de claim.

Schaal dat idee tien keer op en de vorm van het lek verandert. Als het grootste deel van de extra parameters van een 3T-model hash-tabelgeheugen is dat in DRAM zit, in plaats van experts die concurreren om HBM, dan is "3T" niet langer een proxy voor "niet serveerbaar". Het totale aantal parameters en de servingkosten komen los van elkaar. Dat is het werkelijk nieuwe idee in dit lek, en het is het deel dat het gepubliceerde onderzoek daadwerkelijk ondersteunt.

Het voorbehoud is dat het Engram-artikel naar verluidt geen aandacht besteedt aan de overhead tijdens inferentie — latentie en doorvoer — en dat is precies waar een in DRAM opgeslagen opzoektabel zichtbaar zou worden, als die al ergens zichtbaar zou worden. Geheugen dat je moet gaan ophalen is geen geheugen dat je gratis krijgt.

A single-column scoreboard titled "DeepSeek's scale ladder — the scoreboard" with six rows: DeepSeek-V4-Flash-0731 at 284B total / 13B active; DeepSeek-V4-Pro-0813 at 1.6T total / 49B active; DeepSeek V4.1 Flash at 552B backbone / 8B prefill, 16B decode; Leaked successor at ~3T, unverified; Engram memory table at ~1T claimed, unverified; and Serving status reading "V4 Pro retired Sept 14; 3T has no cluster date". Footer reads "V4 figures per DeepSeek model cards; 3T and Engram figures unverified, single-source."

Waarom Deep​Seek's eigen september het tegendeel beargumenteert.

Het argument tegen een 3T-product dat binnenkort uitkomt, is dat Deep​Seek net het experiment op 1,6T heeft uitgevoerd en zijn eigen vraag met iets kleiners heeft beantwoord. De V4-ladder zoals die er vandaag uitziet:

DeepSeek-V4-Flash-0731 — 284B totale parameters, 13B actief per token.

DeepSeek-V4-Pro-0813 — 1.6T totaal, 49B actief, open gewichten onder een MIT-licentie.

• DeepSeek V4.1 Flash — 552B backbone op een causaal encoder-decoder-ontwerp dat 8B parameters per token activeert tijdens prefill en 16B tijdens decode.

Op 14 september om 12 uur 's middags Pekingse tijd verschijnt de middelste trede. DeepSeek haalt V4 Pro offline en leidt verzoeken voor deepseek-v4-pro door naar V4.1 Flash, gefactureerd tegen Flash-tarieven, totdat er een V4.1 Pro bestaat. De officiële prijspagina bevat vandaag twee rijen, en geen van beide is qua grootte de opvolger van het uitgefaseerde model: deepseek-flash voor $0,30 per miljoen inputtokens en $1,20 per miljoen output tijdens piekuren, deepseek-v4-pro voor $1,32 en $3,96, met off-peaktarieven op de helft van die bedragen. Beide vermelden een contextvenster van 1M tokens en een uitvoerplafond van 384.000 tokens.

De richting is niet subtiel. Een lab dat zijn grootste model met pensioen stuurt ten gunste van een model dat tien keer minder parameters per token activeert, heeft al geconcludeerd dat de economische eenheid van grensverleggende capaciteit niet het grootste checkpoint is dat het kan trainen. Een 3T-model waarvan de bouwer niet zeker weet of het 'economisch kan worden nagetraind en geserveerd', is geen gerucht over aarzeling; het beschrijft een lab dat nu meetdata over het alternatief heeft.

Post-training is de scherpere helft van dat probleem. Volledige-parameter post-training van de DeepSeek-V4-Pro-lijn op Huawei's CloudMatrix384 SuperPOD is door het externe SLAI T-Rex-project gerapporteerd op 34.22% MFU, ruwweg 2.93x het open baselinerecept. Dat is een bemoedigend getal — een getal van een derde partij, op een 1.6T-model. Het verdubbelen van de backbone verdubbelt grofweg de rekening voordat er ook maar één token wordt geserveerd.

Screenshot of DeepSeek's official API documentation "Models & Pricing" page, captured September 10 2026, in English, showing two model columns: deepseek-flash (model version DeepSeek-V4.1-Flash) and deepseek-v4-pro (model version DeepSeek-V4-Pro-0813), both listing a 1M context length and a 384K maximum output, a features block where Vision is supported on flash and marked "Not supported" on v4-pro, and a pricing block with peak and off-peak rates including input cache-miss at $0.3 / $1.32 per million tokens and output at $1.2 / $3.96 per million tokens.

Wanneer hun clusters groeien

De dragende clausule in het lek is de laatste, omdat het het enige deel is met een openbaar papieren spoor. Naar verluidt is DeepSeek van plan om minstens 160.000 Ascend 950DT-versnellers van Huawei te plaatsen in een nieuw datacenter in Ulanqab, Binnen-Mongolië, in een order ter waarde van ongeveer $2,56 miljard — een van de grootste clusters van AI-silicium van Chinese makelij die ooit iemand heeft geprobeerd.

De kanttekeningen bij dat plan wegen zwaarder dan de kop. De chips zijn bedoeld voor inferentie, niet voor training: DeepSeek heeft eerder geprobeerd op Huawei-silicon te trainen en traint nog steeds op Nvidia-accelerators, de stap die een 3T-model werkelijk nodig zou hebben. Levering kan meer dan een jaar duren. Een deel van de capaciteit gaat naar verwachting eind 2027 tot begin 2028 online. En naar verwachting zal het aanbod van high-bandwidth memory, niet logica, bepalen hoeveel 950DT-eenheden Huawei dit jaar kan bouwen.

Dus de optimistische lezing van "wanneer hun clusters groeien" zet een 3T-model op zijn vroegst op een tijdlijn van 2027–2028, en de pessimistische lezing — dat het een onderzoeksartefact blijft en nooit een product wordt — is in overeenstemming met alles wat Deep​Seek in 2026 heeft uitgebracht. De compute-omgeving rond het lab is ook een omstreden beleidskwestie in plaats van een pure aanbodkwestie: op 8–9 september beweerden de NSA, FBI en CISA gezamenlijk dat zes Chinese labs, waaronder Deep​Seek, Amerikaanse frontiermodellen op "industriële schaal" hadden gedistilleerd, een beschuldiging die het Chinese ministerie van Handel verwierp. Wat men ook van de beschuldiging vindt, een release die afhankelijk is van clustergroei hangt af van beslissingen waar niemand binnen Deep​Seek controle over heeft.

Wat zou dit van een lek in een lancering veranderen?

De checklist is kort en specifiek, en er is nog niets van geactiveerd:

Een repository onder de deepseek-ai organisatie op Hugging Face, met een versiebeheerde checkpointnaam in plaats van een familieslug.

• Een nieuwe rij op de pagina Modellen en prijzen van DeepSeek.

• Een gedateerde vermelding op de nieuwsfeed van de API-documentatie, in het gebruikelijke newsYYMMDD-formaat van het lab.

• Een modelidentificatie, geen familienaam — DeepSeek-versies zijn checkpoints, en een kale familie-slug heeft tot nu toe een preview betekend.

De dichterbij gelegen mijlpaal is V4.1 Pro, die een Deep​Seek-teamlid op 9 september aanhaalde als het eindpunt van het routeringsvenster. Er zijn geen gepubliceerde specificaties, geen parameteraantal, geen prijs en ook geen datum. In zekere zin is V4.1 Pro de test voor dit lek: als de volgende flagship op ongeveer de 1,6T van de V4 Pro of daaronder uitkomt, is de 3T-bewering minstens een generatie opgeschoven.

Wat dit allemaal betekent als je deze week een model kiest

Een 3T-model is in 2026 geen aankoopbeslissing, en de praktische les van DeepSeek's september gaat helemaal niet over schaal. Het is dat het model achter een endpoint kan veranderen terwijl de naam van het endpoint exact hetzelfde blijft. Iedereen die deepseek-v4-pro via een abstractielaag aanroept, krijgt op 14 september een ander, kleiner, goedkoper model zonder zijn code aan te raken. Iedereen die rechtstreeks vastzit aan de implementatie van die ID door één provider, krijgt wat die provider besluit te doen.

Zowel DeepSeek V4.1 Flash als DeepSeek V4 Pro staan op OrcaRouter onder één sleutel met 0% opslag — de lijstprijs van de provider wordt één-op-één doorgegeven, wat betekent dat DeepSeeks prijswijziging van 10 september hier dezelfde dag tegen lijstprijs ingaat in plaats van tegen een of andere opgeschroefde versie ervan. Op de modelpagina staat $0,15 per miljoen inputtokens en $0,60 per miljoen output in de off-peaktariefband, wat DeepSeeks eigen off-peaktarief is en er komt niets bovenop. Automatische failover tussen providers is de onglamoureuze functie die in een week als deze het meest telt: wanneer een leverancier het model onder een endpoint vandaan haalt, is de routeringslaag waar dat een configuratiewijziging wordt in plaats van een migratie.

Als er ooit een 3T DeepSeek-model daadwerkelijk wordt uitgebracht, zal het worden aangeboden door wie de clusters heeft om het te huisvesten, tegen een prijs die de rekenkracht bepaalt. In diezelfde routeringslaag zou je het tegenkomen — zonder een tweede contract en zonder iets opnieuw op te bouwen.

Screenshot of the OrcaRouter model page for deepseek/deepseek-v4.1-flash, captured September 10 2026, in English, showing a p50 time-to-first-token of 287 milliseconds, an OpenAI-compatible base URL of api.orcarouter.ai/v1, a Python code sample calling the model by that ID, and an off-peak price block reading input $0.150 per million tokens, output $0.600 per million tokens and cache read $0.0030 per million tokens.

De open vraag is niet of DeepSeek een model van 3 biljoen parameters kan bouwen. Drie gepubliceerde architectuurpapers, een werkend geheugenontwerp en een model van 552 miljard parameters waarvan de maker zegt dat het beter presteert dan zijn eigen voorganger van 1,6 biljoen, wijzen er allemaal op dat het lab weet hoe het moet. De vraag is of iemand ervoor zal betalen om het te serveren — en afgaande op de aanwijzingen van de afgelopen twee weken is DeepSeek daar zelf niet zeker van. Let op het cluster, niet op het aantal parameters. De prijzenpagina zal je sneller dan welke leak dan ook vertellen wat DeepSeek daadwerkelijk uitbrengt.

Vergeleken in dit artikel1

Herkend uit dit artikel · Benchmarks: Artificial Analysis · dagelijks bijgewerkt