Karta tytułowa z napisem „Model 3T DeepSeek” z podtytułem „Deklaracja 3 bilionów parametrów, tabela pamięci Engram o pojemności 1T i klaster, który nie pojawi się przed 2027 rokiem”, nad trzema kafelkami z ikonami z napisami „3T — parametry: niezweryfikowane”, „~1T — Engram: własny domysł autora” i „Klaster — najwcześniej koniec 2027”, z linią stopki o treści „Wyciek z jednego źródła; brak repozytorium, karty modelu lub wiersza cennika.”
Guides & Insights

Model 3T DeepSeek: Skalowanie, które musi poczekać na klastry

Autor

Alistair Wren

Data publikacji

Najnowsze modele · 20Zobacz wszystkie modele
Benchmarki: Artificial Analysis · aktualizowane codziennie
Powrót do wszystkich wpisów

14 września DeepSeek wycofa DeepSeek V4 Pro — flagowy model o 1,6 biliona parametrów, który 13 sierpnia został wprowadzony do ogólnej dostępności — i odpowie na każde wywołanie deepseek-v4-pro za pomocą DeepSeek V4.1 Flash, modelu o 552 miliardach parametrów wydanego 10 września. Cztery dni przed ogłoszeniem tej zmiany obserwator DeepSeek piszący pod pseudonimem opublikował coś wymownego, wskazującego w przeciwnym kierunku: że laboratorium pracowało nad modelem o 3 bilionach parametrów, „prawdopodobnie kolejnym Engramem o 1T parametrów”, a powodem, dla którego nie zostało wydane, są względy ekonomiczne, a nie możliwości.

Nic na temat tego modelu nie zostało potwierdzone. Nie ma nazwy, repozytorium, pliku konfiguracyjnego, benchmarku, okna premiery — tylko jeden post na X, powołujący się na „dobre źródło”, którego jedyny najciekawszy szczegół sam jego autor wyraźnie oznaczył jako spekulację. Traktuj to jako sygnał, a nie fakt. Mimo to warto go przeczytać, ponieważ obie połowy tej tezy ciągną w przeciwnych kierunkach i tylko jedna z nich prawdopodobnie przetrwa kontakt z własną roadmapą Deep​Seek.

Co właściwie mówi przeciek, a czego nie mówi

Post pochodzi z konta teortaxesTex, od dawna śledzącego Deep​Seek obserwatora, który opisuje siebie jako fana tego laboratorium od 2023 roku. W całości brzmi: „Właściwie mam to z dobrego źródła, że Deep​Seek pracował nad modelem 3T (backbone, prawdopodobnie kolejny Engram o 1T parametrów, ale to moja spekulacja). Po prostu nie byli pewni, czy opłacałoby się go post-trenować i serwować. Kiedy ich klastry się rozrosną, zobaczymy coś...”

Cztery rzeczy w tych dwóch zdaniach mają znaczenie, a jedna z nich nie jest wcale faktem. „Good authority” nie jest wymienione z nazwy. Liczba parametrów pojawia się jako pojedyncza liczba bez podziału na całkowite i aktywne. Wtręt o Engramie jest oznaczony jako spekulacja przez osobę, która spekuluje. A „when their clusters grow” to zdanie warunkowe bez podanej daty.

• Co się twierdzi — że model DeepSeek o 3 bilionach parametrów istnieje na pewnym etapie rozwoju.

To, co jest wyraźnie własnym przypuszczeniem autora — że mniej więcej 1T z tego to pamięć engramowa.

• Co jest nieznane — jego nazwa, architektura, liczba aktywnych parametrów, okno kontekstowe, status treningu oraz to, czy w ogóle jest dostarczane jako produkt.

• Co da się teraz zweryfikować — nic. Żadne repozytorium DeepSeek, karta modelu, pozycja w cenniku ani wpis w dokumentacji o tym nie wspomina.

Nawet arytmetyka jest niejednoznaczna. „Model 3T (backbone, prawdopodobnie kolejne 1T parametrów Engram)” dopuszcza dwie interpretacje: model 3T, z którego około 1T to Engram, albo backbone 3T z dodatkowym 1T Engramu obok, co daje łącznie około 4T. Ta przepaść jest szeroka na bilion parametrów i zmienia rachunek za serwowanie o więcej, niż większość laboratoriów wydaje na jeden przebieg treningowy.

Warto też pamiętać, że dorobek tego konta jest mieszany, a nie nieomylny jak wyrocznia. Odczytał komunikat DeepSeek z 9 września o przekierowaniu ruchu V4 Pro jako dowód, że laboratorium „rozwiązało problemy architektoniczne rodziny V4” — rozsądny wniosek, ale wciąż tylko wniosek. Na początku września wysunął też przypuszczenie, że anonimowy model stealth na platformie do kodowania należącej do strony trzeciej to MiMo-V3-Flash firmy Xiaomi, czego nikt nie potwierdził. Przydatny wczesny sygnał; nie źródło miarodajne.

Interesująca połowa to tabela pamięci, a nie liczba parametrów.

Engram jest prawdziwy i to właśnie dlatego twierdzenie o 3T jest bardziej wiarygodne, niż początkowo brzmi. Deep​Seek opublikował w styczniu 2026 r. architekturę pamięci warunkowej wraz z dołączonym kodem open source i robi coś nietypowego: oddziela statyczne wyszukiwanie wiedzy od dynamicznego rozumowania. Zamiast zużywać moc obliczeniową GPU na przypominanie faktów, model haszuje swój kontekst do tabel osadzeń przechowywanych w DRAM i wyszukuje w stałym czasie, bez pracy GPU na ścieżce wyszukiwania, a dodatkowo mechanizm bramkowania tłumi odzyskaną pamięć, gdy koliduje ona z otaczającym kontekstem.

Liczby, które DeepSeek podał dla własnej konfiguracji testowej, są tymi, których należy się trzymać: tabela embeddingów o 100 miliardach parametrów przeniesiona do DRAM przy spadku przepustowości poniżej 3% oraz 97% dokładności w teście needle-in-a-haystack przy 1 mln tokenów wobec 84,2% dla standardowego mechanizmu uwagi. To własne liczby laboratorium, nieodtworzone przez nas. Niezależne wczesne oceny miały rzekomo osiągać zakres 93–96% przy tej samej długości kontekstu — powyżej poziomu odniesienia, poniżej deklaracji.

Pomnóż ten pomysł przez dziesięć, a kształt przecieku się zmieni. Jeśli większość dodatkowych parametrów modelu 3T to pamięć tablicy haszującej znajdująca się w DRAM, a nie eksperci konkurujący o HBM, to „3T” przestaje być przybliżeniem „niemożliwego do wdrożenia”. Całkowita liczba parametrów i koszt serwowania rozchodzą się. To jest właśnie naprawdę nowa idea w tym przecieku — i tę część opublikowane badania faktycznie potwierdzają.

Zastrzeżenie jest takie, że artykuł o Engram rzekomo nie porusza kwestii narzutu w czasie wnioskowania — opóźnienia i przepustowości — a właśnie tam pojawiłaby się tabela odnośników w pamięci DRAM, gdyby miała się gdziekolwiek pojawić. Pamięć, po którą trzeba sięgnąć, nie jest pamięcią, którą dostaje się za darmo.

A single-column scoreboard titled "DeepSeek's scale ladder — the scoreboard" with six rows: DeepSeek-V4-Flash-0731 at 284B total / 13B active; DeepSeek-V4-Pro-0813 at 1.6T total / 49B active; DeepSeek V4.1 Flash at 552B backbone / 8B prefill, 16B decode; Leaked successor at ~3T, unverified; Engram memory table at ~1T claimed, unverified; and Serving status reading "V4 Pro retired Sept 14; 3T has no cluster date". Footer reads "V4 figures per DeepSeek model cards; 3T and Engram figures unverified, single-source."

Dlaczego własny wrzesień Deep​Seek przemawia za przeciwnym wnioskiem

Argument przeciw temu, by produkt 3T wkrótce trafił na rynek, jest taki, że DeepSeek właśnie przeprowadził eksperyment na poziomie 1,6T i odpowiedział na własne pytanie czymś mniejszym. Drabinka V4 w obecnej postaci:

DeepSeek-V4-Flash-0731 — łącznie 284B parametrów, 13B aktywnych na token.

DeepSeek-V4-Pro-0813 — 1.6T łącznie, 49B aktywnych, otwarte wagi na licencji MIT.

• DeepSeek V4.1 Flash — szkielet o 552B parametrów w architekturze Causal Encoder-Decoder, aktywujący 8B parametrów na token podczas prefillu i 16B podczas dekodowania.

14 września w południe czasu pekińskiego pojawia się środkowy szczebel. Deep​Seek wyłącza V4 Pro i kieruje żądania dla deepseek-v4-pro do V4.1 Flash, rozliczane według stawek Flash, dopóki nie powstanie V4.1 Pro. Oficjalna strona z cennikiem zawiera dziś dwa wiersze i żaden z nich nie jest następcą wycofanego modelu pod względem rozmiaru: deepseek-flash po 0,30 USD za milion tokenów wejściowych i 1,20 USD za milion tokenów wyjściowych w szczycie, deepseek-v4-pro po 1,32 USD i 3,96 USD, przy czym stawki poza szczytem są o połowę niższe. Oba mają okno kontekstu 1 mln tokenów i limit wyjścia 384 000 tokenów.

Kierunek podróży nie jest subtelny. Laboratorium, które wycofuje swój największy model na rzecz modelu aktywującego jedną dziesiątą liczby parametrów na token, już doszło do wniosku, że ekonomiczną jednostką możliwości granicznych nie jest największy checkpoint, jaki może wytrenować. Model 3T, którego twórca nie jest pewien, czy można go "dotrenować i serwować ekonomicznie", nie jest pogłoską o wahaniu; opisuje laboratorium, które ma teraz zmierzone dane na temat alternatywy.

Post-trening to ostrzejsza połowa tego problemu. Pełnoparametrowy post-trening linii DeepSeek-V4-Pro na platformie CloudMatrix384 SuperPOD firmy Huawei został zgłoszony przez zewnętrzny projekt SLAI T-Rex na poziomie 34,22% MFU, czyli około 2,93x w porównaniu z otwartym bazowym przepisem. To zachęcająca liczba — liczba podana przez stronę trzecią, dla modelu 1,6T. Podwojenie szkieletu mniej więcej podwaja rachunek, zanim zostanie obsłużony pierwszy token.

Screenshot of DeepSeek's official API documentation "Models & Pricing" page, captured September 10 2026, in English, showing two model columns: deepseek-flash (model version DeepSeek-V4.1-Flash) and deepseek-v4-pro (model version DeepSeek-V4-Pro-0813), both listing a 1M context length and a 384K maximum output, a features block where Vision is supported on flash and marked "Not supported" on v4-pro, and a pricing block with peak and off-peak rates including input cache-miss at $0.3 / $1.32 per million tokens and output at $1.2 / $3.96 per million tokens.

Kiedy ich skupiska rosną.

Kluczową klauzulą w tym przecieku jest ta ostatnia, ponieważ jako jedyna ma publiczny ślad dokumentacyjny. Donoszono, że DeepSeek planuje co najmniej 160 000 akceleratorów Huawei Ascend 950DT w nowym centrum danych w Ulanqab w Mongolii Wewnętrznej, w ramach zamówienia o wartości około 2,56 mld dolarów — jeden z największych klastrów chińskich układów AI, jakich ktokolwiek próbował zbudować.

Zastrzeżenia towarzyszące temu planowi mają większe znaczenie niż sam nagłówek. Układy są planowane do wnioskowania, a nie trenowania: DeepSeek próbował już trenować na krzemie Huawei i nadal trenuje na akceleratorach Nvidia, co jest krokiem, którego model 3T faktycznie by potrzebował. Dostawa może potrwać ponad rok. Część mocy produkcyjnych ma zostać uruchomiona pod koniec 2027 r. i na początku 2028 r. A to, ile jednostek 950DT Huawei może zbudować w tym roku, ma ograniczać podaż pamięci o wysokiej przepustowości, a nie logika.

Tak więc optymistyczna interpretacja zwrotu „kiedy ich klastry urosną” umieszcza model 3T najwcześniej w perspektywie lat 2027–2028, a pesymistyczna interpretacja — że pozostanie artefaktem badawczym i nigdy nie stanie się produktem — jest spójna ze wszystkim, co DeepSeek dostarczył w 2026 r. Środowisko obliczeniowe wokół laboratorium to również sporna polityka, a nie czysto podażowa kwestia: 8–9 września NSA, FBI i CISA wspólnie zarzuciły, że sześć chińskich laboratoriów, w tym DeepSeek, destylowało amerykańskie modele frontier „na skalę przemysłową”, zarzut, który odrzuciło Ministerstwo Handlu Chin. Cokolwiek sądzić o tym zarzucie, wydanie, które zależy od wzrostu klastrów, zależy od decyzji, których nikt wewnątrz DeepSeek nie kontroluje.

Co zamieniłoby ten wyciek w premierę?

Lista kontrolna jest krótka i konkretna, a żaden z jej punktów jeszcze nie zadziałał:

• Repozytorium w organizacji deepseek-ai na Hugging Face, z wersjonowaną nazwą checkpointu zamiast sluga rodziny.

• Nowy wiersz na stronie Models & Pricing DeepSeeka.

• Datowany wpis w kanale aktualności dokumentacji API, w typowym dla laboratorium formacie newsYYMMDD.

• Identyfikator modelu, a nie nazwa rodziny — Deep​Seek wersjonuje checkpointy, a sam slug rodziny oznaczał dotąd wersję zapoznawczą.

Bliższym kamieniem milowym jest V4.1 Pro, o którym członek zespołu DeepSeek wspomniał 9 września jako o punkcie końcowym okna routingu. Nie ma opublikowanych specyfikacji, liczby parametrów, ceny ani daty. W pewnym sensie V4.1 Pro jest testem tego przecieku: jeśli następny flagowiec pojawi się na poziomie mniej więcej 1,6T V4 Pro lub niżej, twierdzenie o 3T przesunęło się co najmniej o jedną generację.

Co to wszystko oznacza, jeśli w tym tygodniu wybierasz model

Model 3T nie jest w 2026 roku decyzją zakupową, a praktyczna lekcja września Deep​Seek nie dotyczy wcale skali. Chodzi o to, że model stojący za punktem końcowym może się zmienić, podczas gdy nazwa punktu końcowego pozostaje dokładnie taka sama. Każdy, kto wywołuje deepseek-v4-pro przez warstwę abstrakcji, 14 września otrzyma inny, mniejszy, tańszy model, nie dotykając przy tym swojego kodu. Każdy, kto jest podłączony bezpośrednio do implementacji tego identyfikatora u jednego dostawcy, dostaje to, co ten dostawca postanowi zrobić.

Zarówno DeepSeek V4.1 Flash, jak i DeepSeek V4 Pro są dostępne w OrcaRouter pod jednym kluczem przy 0% marży — cena katalogowa dostawcy przekazywana bez zmian, co oznacza, że zmiana cennika DeepSeek z 10 września obowiązuje tutaj tego samego dnia według ceny katalogowej, a nie według jakiejś podwyższonej jej wersji. Strona modelu podaje 0,15 USD za milion tokenów wejściowych i 0,60 USD za milion tokenów wyjściowych w paśmie poza godzinami szczytu, co jest własną stawką DeepSeek w godzinach poza szczytem i niczym ponad to. Automatyczne przełączanie awaryjne między dostawcami to mało efektowna funkcja, która ma największe znaczenie w tygodniu takim jak ten: gdy dostawca podmienia model pod danym punktem końcowym, warstwa routingu sprawia, że staje się to zmianą konfiguracji, a nie migracją.

Jeśli model 3T Deep​Seek kiedykolwiek zostanie wydany, będzie obsługiwany przez tego, kto ma klastry, by go pomieścić, w cenie, którą dyktuje moc obliczeniowa. Ta sama warstwa routingu to miejsce, w którym byś go spotkał — bez drugiej umowy i bez przebudowywania czegokolwiek.

Screenshot of the OrcaRouter model page for deepseek/deepseek-v4.1-flash, captured September 10 2026, in English, showing a p50 time-to-first-token of 287 milliseconds, an OpenAI-compatible base URL of api.orcarouter.ai/v1, a Python code sample calling the model by that ID, and an off-peak price block reading input $0.150 per million tokens, output $0.600 per million tokens and cache read $0.0030 per million tokens.

Otwarte pytanie nie brzmi, czy Deep​Seek potrafi zbudować model o 3 bilionach parametrów. Trzy opublikowane prace o architekturze, działający projekt pamięci i model 552B, o którym jego twórca mówi, że przewyższa własnego poprzednika 1.6T — wszystko to sugeruje, że laboratorium wie, jak to zrobić. Pytanie brzmi, czy ktokolwiek zapłaci za jego obsługę — a sądząc po dowodach z ostatnich dwóch tygodni, sam Deep​Seek nie jest tego pewien. Patrz na klaster, nie na liczbę parametrów. Strona z cennikiem powie ci, co Deep​Seek faktycznie wypuszcza szybciej, niż zrobi to jakikolwiek przeciek.

Porównane w tym artykule1

Wykryto na podstawie tego artykułu · Benchmarki: Artificial Analysis · aktualizowane codziennie