Titelkort med texten "{{1}}DeepSeeks 3T-modell{{/1}}" med undertiteln "{{2}}Ett påstående om 3 biljoner parametrar, en 1T Engram-minnestabell och ett kluster som inte kommer förrän 2027{{/2}}", ovanför tre ikonrutor med texten "{{3}}3T — parametrar: overifierade{{/3}}", "{{4}}~1T — Engram: författarens egen gissning{{/4}}" och "{{5}}Kluster — tidigast i slutet av 2027{{/5}}", med en sidfot som lyder "{{6}}Läcka från en enda källa; det finns varken repository, modellkort eller prisrad.{{/6}}"
Guides & Insights

DeepSeeks 3T-modell: Uppskalningen som måste vänta på klustren

Författare

Alistair Wren

Publiceringsdatum

Senaste modellerna · 20Visa alla modeller
Benchmarks: Artificial Analysis · uppdateras dagligen
Tillbaka till alla inlägg

Den 14 september kommer Deep​Seek att pensionera DeepSeek V4 Pro — den flaggskeppsmodell med 1,6 biljoner parametrar som företaget gjorde allmänt tillgänglig den 13 augusti — och besvara varje anrop till deepseek-v4-pro med DeepSeek V4.1 Flash, den 552-miljarder-parametermodell som det släppte den 10 september. Fyra dagar innan det bytet tillkännagavs publicerade en pseudonym Deep​Seek-bevakare något som pekade i motsatt riktning: att laboratoriet hade arbetat på en modell med 3 biljoner parametrar, ”förmodligen ytterligare ett Engram med 1T parametrar”, och att anledningen till att den inte är ute är ekonomi snarare än kapacitet.

Ingenting om den modellen är bekräftat. Det finns inget namn, inget repository, ingen konfigurationsfil, inga benchmarks, inget släppfönster – ett X-inlägg, med "tillförlitlig källa" som grund, där dess enda mest intressanta detalj uttryckligen flaggas som spekulation av författaren själv. Behandla det som en signal, inte ett faktum. Det är ändå värt att läsa, eftersom de två halvorna av påståendet drar åt motsatta håll och bara en av dem sannolikt överlever kontakten med Deep​Seek:s egen färdplan.

Vad läckan faktiskt säger, och vad den inte säger

Inlägget kommer från kontot teortaxesTex, en långvarig Deep​Seek-bevakare som beskriver sig själv som ett fan av labbet sedan 2023. Det lyder i sin helhet: "Jag har det faktiskt från tillförlitlig källa att Deep​Seek arbetade på en 3T-modell (stomme, förmodligen ytterligare 1T parametrar Engram, men det är min spekulation). De var bara inte säkra på att det skulle vara ekonomiskt att efterträna och servera den. När deras kluster växer får vi se lite..."

Fyra saker i de två meningarna väger tungt, och en av dem är inte ett faktum alls. "God auktoritet" är namnlös. Antalet parametrar kommer som ett enda tal utan uppdelning mellan totalt och aktivt. Engram-sidoanmärkningen är märkt som spekulation av personen som spekulerar. Och "när deras kluster växer" är en villkorssats utan datum kopplat till det.

Vad är det som påstås — att en DeepSeek-modell med 3 biljoner parametrar finns i något utvecklingsstadium.

• Vad som uttryckligen är författarens egen gissning — att ungefär 1T av det är Engram-minne.

• Vad som är okänt — dess namn, arkitektur, antal aktiva parametrar, kontextfönster, träningsstatus, och huruvida den överhuvudtaget släpps som en produkt.

• Vad som är verifierbart just nu — ingenting. Inget Deep​Seek-repositorium, modellkort, prisrad eller dokumentationspost nämner det.

Även räkneexemplet är tvetydigt. ”3T-modell (backbone, troligen ytterligare 1T parametrar Engram)” medger två tolkningar: en 3T-modell där cirka 1T är Engram, eller en 3T-backbone med ytterligare 1T Engram vid sidan av, totalt ungefär 4T. Den skillnaden är en biljon parametrar bred, och den förändrar serveringsnotan mer än vad de flesta labb spenderar på en träningskörning.

Det är också värt att komma ihåg att detta kontos historik är blandad snarare än av orakelklass. Han läste Deep​Seek:s meddelande från den 9 september om omdirigering av V4 Pro-trafik som bevis på att laboratoriet hade "löst arkitektoniska problem i V4-familjen" — en rimlig slutsats, men fortfarande en slutsats. I början av september framkastade han också idén att en anonym smygmodell på en tredjepartsplattform för kodning var Xiaomis MiMo-V3-Flash, vilket ingen har bekräftat. Användbar tidig signal; inte en tillförlitlig källa.

Den intressanta halvan är minnestabellen, inte parameterantalet.

Engram är verkligt, och det är anledningen till att ett 3T-påstående är mer trovärdigt än det först låter. Deep​Seek publicerade den villkorsbaserade minnesarkitekturen i januari 2026 med medföljande öppen källkod, och den gör något ovanligt: den separerar statisk kunskapsinhämtning från dynamiskt resonemang. Istället för att förbruka GPU-beräkning för att återkalla fakta, hashar modellen sin kontext till inbäddningstabeller som lagras i DRAM och hämtar på konstant tid, utan GPU-arbete i uppslagsvägen, plus en grindmekanism som undertrycker ett hämtat minne när det står i konflikt med den omgivande kontexten.

Siffrorna som Deep​Seek rapporterade för sin egen testkonfiguration är de man ska hålla sig till: en inbäddningstabell med 100 miljarder parametrar som lastats av till DRAM med mindre än 3 % genomströmningsförlust, och 97 % nålen-i-höstacken-träffsäkerhet vid 1M tokens jämfört med 84,2 % för vanlig attention. Det är labbets egna siffror, inte reproducerade av oss. Oberoende tidiga utvärderingar har enligt uppgift hamnat i intervallet 93–96 % vid samma kontextlängd – klart över baslinjen, men under påståendet.

Skala upp den idén tio gånger och läckans form förändras. Om merparten av en 3T-modells extra parametrar är hashtabellsminne som ligger i DRAM snarare än experter som konkurrerar om HBM, då upphör "3T" att vara en proxy för "oserverbar". Totalt antal parametrar och serveringskostnad går isär. Det är den genuint nya idén i detta läckage, och det är den del som den publicerade forskningen faktiskt stöder.

Förbehållet är att Engram-artikeln enligt uppgift inte tar upp overhead vid inferens — latens och genomströmning — vilket är precis där en DRAM-baserad uppslagstabell skulle visa sig om den visade sig någonstans. Minne som du måste hämta är inte minne du får gratis.

A single-column scoreboard titled "DeepSeek's scale ladder — the scoreboard" with six rows: DeepSeek-V4-Flash-0731 at 284B total / 13B active; DeepSeek-V4-Pro-0813 at 1.6T total / 49B active; DeepSeek V4.1 Flash at 552B backbone / 8B prefill, 16B decode; Leaked successor at ~3T, unverified; Engram memory table at ~1T claimed, unverified; and Serving status reading "V4 Pro retired Sept 14; 3T has no cluster date". Footer reads "V4 figures per DeepSeek model cards; 3T and Engram figures unverified, single-source."

Varför Deep​Seeks egen september argumenterar för motsatsen

Argumentet mot att en 3T-produkt snart lanseras är att Deep​Seek precis körde experimentet på 1.6T och besvarade sin egen fråga med något mindre. V4-stegen som den ser ut idag:

DeepSeek-V4-Flash-0731 — 284B totala parametrar, 13B aktiva per token.

DeepSeek-V4-Pro-0813 — 1,6T totalt, 49B aktiva, öppna vikter under MIT-licens.

DeepSeek V4.1 Flash — 552B-backbone i en kausal encoder-decoder-design som aktiverar 8B parametrar per token under prefill och 16B under avkodning.

Den 14 september klockan 12.00 Peking-tid lanseras mellansteget. Deep​Seek tar V4 Pro offline och dirigerar om förfrågningar för deepseek-v4-pro till V4.1 Flash, som faktureras enligt Flash-priserna, tills en V4.1 Pro finns. Den officiella prissidan visar idag två rader, och ingen av dem är storleksmässigt den pensionerade modellens efterträdare: deepseek-flash för 0,30 USD per miljon inmatningstoken och 1,20 USD per miljon utmatningstoken vid högtrafik, deepseek-v4-pro för 1,32 USD och 3,96 USD, med lågtrafikpriser på hälften av dessa siffror. Båda anger ett kontextfönster på 1M-token och ett utmatningstak på 384 000 token.

Färdriktningen är inte subtil. Ett labb som pensionerar sin största modell till förmån för en som aktiverar en tiondel så många parametrar per token har redan dragit slutsatsen att den ekonomiska enheten för frontlinjekapacitet inte är den största checkpoint det kan träna. En 3T-modell vars byggare är osäker på att den kan "eftertränas och serveras ekonomiskt" är inte ett rykte om tvekan; den beskriver ett labb som nu har uppmätt data om alternativet.

Postträning är den vassare hälften av det problemet. Fullparametrisk postträning av DeepSeek-V4-Pro-serien på Huaweis CloudMatrix384 SuperPOD har rapporterats av tredjepartsprojektet SLAI T-Rex till 34,22 % MFU, ungefär 2,93 gånger det öppna baslinjereceptet. Det är en uppmuntrande siffra – en tredjepartssiffra – på en 1,6T-modell. Att fördubbla ryggraden fördubblar ungefär notan innan en enda token har serverats.

Screenshot of DeepSeek's official API documentation "Models & Pricing" page, captured September 10 2026, in English, showing two model columns: deepseek-flash (model version DeepSeek-V4.1-Flash) and deepseek-v4-pro (model version DeepSeek-V4-Pro-0813), both listing a 1M context length and a 384K maximum output, a features block where Vision is supported on flash and marked "Not supported" on v4-pro, and a pricing block with peak and off-peak rates including input cache-miss at $0.3 / $1.32 per million tokens and output at $1.2 / $3.96 per million tokens.

När deras kluster växer

Den bärande klausulen i läckan är den sista, eftersom det är den enda delen med ett offentligt pappersspår. Deep​Seek uppges planera minst 160 000 av Huaweis Ascend 950DT-acceleratorer vid ett nytt datacenter i Ulanqab, Inre Mongoliet, i en order värd cirka 2,56 miljarder dollar — ett av de största klustren av kinesisktillverkat AI-kisel som någon har försökt sig på.

De varningar som är knutna till den planen betyder mer än rubriken. Chipsen är planerade för inferens, inte träning: DeepSeek har tidigare försökt träna på Huawei-kretsar och tränar fortfarande på Nvidia-acceleratorer, vilket är det steg en 3T-modell faktiskt skulle behöva. Leveransen kan ta mer än ett år. Delvis kapacitet förväntas vara igång i slutet av 2027 till början av 2028. Och tillgången på högbandbreddsminne, inte logik, väntas sätta taket för hur många 950DT-enheter Huawei kan bygga i år.

Så den optimistiska tolkningen av "när deras kluster växer" placerar en 3T-modell på en 2027–2028-tidslinje tidigast, och den pessimistiska tolkningen — att den förblir ett forskningsartefakt och aldrig blir en produkt — är förenlig med allt Deep​Seek har levererat under 2026. Beräkningsmiljön kring laboratoriet är också en omtvistad policyfråga snarare än en ren utbudsfråga: den 8–9 september hävdade NSA, FBI och CISA gemensamt att sex kinesiska laboratorier, inklusive Deep​Seek, destillerade amerikanska frontlinjemodeller i "industriell skala," en anklagelse som Kinas handelsministerium avvisade. Oavsett vad man anser om anklagelsen, en lansering som beror på klustertillväxt beror på beslut som ingen inom Deep​Seek kontrollerar.

Vad skulle förvandla detta från ett läckage till en lansering?

Checklistan är kort och specifik, och inget av den har utlösts ännu:

• Ett repository under deepseek-ai-organisationen på Hugging Face, med ett versionsnumrerat checkpoint-namn snarare än en familjeslug.

• En ny rad på DeepSeeks sida Models & Pricing.

• En daterad post på API-dokumentationens nyhetsflöde, i labbets vanliga newsYYMMDD-format.

• En modellidentifierare, inte ett familjenamn — Deep​Seek-versioner är checkpoints, och en bar familjeslug har hittills inneburit en förhandsversion.

Den närmare milstolpen är V4.1 Pro, som en DeepSeek‑teammedlem den 9 september hänvisade till som slutpunkten för routingfönstret. Den har inga publicerade specifikationer, inget parameterantal, inget pris och inget datum heller. På ett sätt är V4.1 Pro testet på denna läcka: om nästa flaggskepp landar på ungefär V4 Pro:s 1,6T eller lägre, har 3T‑påståendet glidit minst en generation.

Vad allt detta innebär om du väljer en modell den här veckan

En 3T-modell är inte ett köpbeslut 2026, och den praktiska lärdomen från DeepSeeks september handlar inte alls om skala. Det handlar om att modellen bakom en endpoint kan ändras medan endpointens namn förblir exakt detsamma. Den som anropar deepseek-v4-pro genom ett abstraktionslager får en annan, mindre, billigare modell den 14 september utan att röra sin kod. Den som är direkt kopplad till en enda leverantörs implementation av det ID:t får vad den leverantören än väljer att göra.

Både DeepSeek V4.1 Flash och DeepSeek V4 Pro finns på OrcaRouter under en enda nyckel med 0 % påslag — leverantörens listpris förs vidare, vilket innebär att Deep​Seeks prisförändring från den 10 september är live här samma dag till listpris i stället för till någon påslagen variant av det. Modellsidan visar 0,15 USD per miljon inmatade tokens och 0,60 USD per miljon utdata i lågtrafikbandet, vilket är Deep​Seeks eget lågtrafikpris och inget därutöver. Automatisk failover mellan leverantörer är den föga glamorösa funktion som betyder mest i en vecka som denna: när en leverantör byter ut modellen bakom en endpoint är det i routningslagret som det blir en konfigurationsändring i stället för en migrering.

Om en 3T Deep​Seek-modell någonsin faktiskt levereras, kommer den att betjänas av den som har klustren att hålla den, till ett pris som beräkningskraften dikterar. Samma routningslager är där du skulle möta den — utan ett andra kontrakt och utan att bygga om någonting.

Screenshot of the OrcaRouter model page for deepseek/deepseek-v4.1-flash, captured September 10 2026, in English, showing a p50 time-to-first-token of 287 milliseconds, an OpenAI-compatible base URL of api.orcarouter.ai/v1, a Python code sample calling the model by that ID, and an off-peak price block reading input $0.150 per million tokens, output $0.600 per million tokens and cache read $0.0030 per million tokens.

Den öppna frågan är inte om Deep​Seek kan bygga en modell med 3 biljoner parametrar. Tre publicerade arkitekturartiklar, en fungerande minnesdesign och en 552B-modell som tillverkaren säger överträffar sin egen 1,6T-föregångare tyder alla på att labbet kan. Frågan är om någon kommer att betala för att driva den — och baserat på de senaste två veckorna är inte Deep​Seek själv säker. Håll ögonen på klustret, inte parameterantalet. Prissidan kommer att visa dig vad Deep​Seek faktiskt levererar snabbare än någon läcka.

Jämförda i den här artikeln1

Identifierat från den här artikeln · Benchmarks: Artificial Analysis · uppdateras dagligen