
Model 3T DeepSeek: Skalowanie, które musi poczekać na klastry
- deepseekNOWOŚĆDeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligencja
- openaiNOWOŚĆOpenAI: GPT-6 Astra2026-09-0453Inteligencja77Kod
- googleNOWOŚĆGoogle: Gemini 3.8 Flash2026-09-0241Inteligencja76Kod
- qwenNOWOŚĆQwen: Qwen3.8 Max (0902)2026-09-0240Inteligencja72Kod
- anthropicNOWOŚĆAnthropic: Claude Fable 5.12026-09-0153Inteligencja82Kod
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 za 1 mln tokenów
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligencja72Kod
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 za 1 mln tokenów
- z-aiZ.ai: GLM 5.32026-08-1845Inteligencja75Kod
- obsidianQwen3.8 27B2026-08-1534Inteligencja68Kod
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Inteligencja69Kod
- grokSpaceXAI: Grok 4.62026-08-1244Inteligencja77Kod
- metaMeta: Muse Spark 1.22026-08-0540Inteligencja72Kod
- qwenQwen: Qwen3.8 Max2026-08-0340Inteligencja72Kod
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135Inteligencja69Kod
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 za 1 mln tokenów
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2451Inteligencja78Kod
- googleGoogle: Gemini 3.6 Flash2026-07-2134Inteligencja69Kod
14 września DeepSeek wycofa DeepSeek V4 Pro — flagowy model o 1,6 biliona parametrów, który 13 sierpnia został wprowadzony do ogólnej dostępności — i odpowie na każde wywołanie deepseek-v4-pro za pomocą DeepSeek V4.1 Flash, modelu o 552 miliardach parametrów wydanego 10 września. Cztery dni przed ogłoszeniem tej zmiany obserwator DeepSeek piszący pod pseudonimem opublikował coś wymownego, wskazującego w przeciwnym kierunku: że laboratorium pracowało nad modelem o 3 bilionach parametrów, „prawdopodobnie kolejnym Engramem o 1T parametrów”, a powodem, dla którego nie zostało wydane, są względy ekonomiczne, a nie możliwości.
Nic na temat tego modelu nie zostało potwierdzone. Nie ma nazwy, repozytorium, pliku konfiguracyjnego, benchmarku, okna premiery — tylko jeden post na X, powołujący się na „dobre źródło”, którego jedyny najciekawszy szczegół sam jego autor wyraźnie oznaczył jako spekulację. Traktuj to jako sygnał, a nie fakt. Mimo to warto go przeczytać, ponieważ obie połowy tej tezy ciągną w przeciwnych kierunkach i tylko jedna z nich prawdopodobnie przetrwa kontakt z własną roadmapą DeepSeek.
Co właściwie mówi przeciek, a czego nie mówi
Post pochodzi z konta teortaxesTex, od dawna śledzącego DeepSeek obserwatora, który opisuje siebie jako fana tego laboratorium od 2023 roku. W całości brzmi: „Właściwie mam to z dobrego źródła, że DeepSeek pracował nad modelem 3T (backbone, prawdopodobnie kolejny Engram o 1T parametrów, ale to moja spekulacja). Po prostu nie byli pewni, czy opłacałoby się go post-trenować i serwować. Kiedy ich klastry się rozrosną, zobaczymy coś...”
Cztery rzeczy w tych dwóch zdaniach mają znaczenie, a jedna z nich nie jest wcale faktem. „Good authority” nie jest wymienione z nazwy. Liczba parametrów pojawia się jako pojedyncza liczba bez podziału na całkowite i aktywne. Wtręt o Engramie jest oznaczony jako spekulacja przez osobę, która spekuluje. A „when their clusters grow” to zdanie warunkowe bez podanej daty.
• Co się twierdzi — że model DeepSeek o 3 bilionach parametrów istnieje na pewnym etapie rozwoju.
To, co jest wyraźnie własnym przypuszczeniem autora — że mniej więcej 1T z tego to pamięć engramowa.
• Co jest nieznane — jego nazwa, architektura, liczba aktywnych parametrów, okno kontekstowe, status treningu oraz to, czy w ogóle jest dostarczane jako produkt.
• Co da się teraz zweryfikować — nic. Żadne repozytorium DeepSeek, karta modelu, pozycja w cenniku ani wpis w dokumentacji o tym nie wspomina.
Nawet arytmetyka jest niejednoznaczna. „Model 3T (backbone, prawdopodobnie kolejne 1T parametrów Engram)” dopuszcza dwie interpretacje: model 3T, z którego około 1T to Engram, albo backbone 3T z dodatkowym 1T Engramu obok, co daje łącznie około 4T. Ta przepaść jest szeroka na bilion parametrów i zmienia rachunek za serwowanie o więcej, niż większość laboratoriów wydaje na jeden przebieg treningowy.
Warto też pamiętać, że dorobek tego konta jest mieszany, a nie nieomylny jak wyrocznia. Odczytał komunikat DeepSeek z 9 września o przekierowaniu ruchu V4 Pro jako dowód, że laboratorium „rozwiązało problemy architektoniczne rodziny V4” — rozsądny wniosek, ale wciąż tylko wniosek. Na początku września wysunął też przypuszczenie, że anonimowy model stealth na platformie do kodowania należącej do strony trzeciej to MiMo-V3-Flash firmy Xiaomi, czego nikt nie potwierdził. Przydatny wczesny sygnał; nie źródło miarodajne.
Interesująca połowa to tabela pamięci, a nie liczba parametrów.
Engram jest prawdziwy i to właśnie dlatego twierdzenie o 3T jest bardziej wiarygodne, niż początkowo brzmi. DeepSeek opublikował w styczniu 2026 r. architekturę pamięci warunkowej wraz z dołączonym kodem open source i robi coś nietypowego: oddziela statyczne wyszukiwanie wiedzy od dynamicznego rozumowania. Zamiast zużywać moc obliczeniową GPU na przypominanie faktów, model haszuje swój kontekst do tabel osadzeń przechowywanych w DRAM i wyszukuje w stałym czasie, bez pracy GPU na ścieżce wyszukiwania, a dodatkowo mechanizm bramkowania tłumi odzyskaną pamięć, gdy koliduje ona z otaczającym kontekstem.
Liczby, które DeepSeek podał dla własnej konfiguracji testowej, są tymi, których należy się trzymać: tabela embeddingów o 100 miliardach parametrów przeniesiona do DRAM przy spadku przepustowości poniżej 3% oraz 97% dokładności w teście needle-in-a-haystack przy 1 mln tokenów wobec 84,2% dla standardowego mechanizmu uwagi. To własne liczby laboratorium, nieodtworzone przez nas. Niezależne wczesne oceny miały rzekomo osiągać zakres 93–96% przy tej samej długości kontekstu — powyżej poziomu odniesienia, poniżej deklaracji.
Pomnóż ten pomysł przez dziesięć, a kształt przecieku się zmieni. Jeśli większość dodatkowych parametrów modelu 3T to pamięć tablicy haszującej znajdująca się w DRAM, a nie eksperci konkurujący o HBM, to „3T” przestaje być przybliżeniem „niemożliwego do wdrożenia”. Całkowita liczba parametrów i koszt serwowania rozchodzą się. To jest właśnie naprawdę nowa idea w tym przecieku — i tę część opublikowane badania faktycznie potwierdzają.
Zastrzeżenie jest takie, że artykuł o Engram rzekomo nie porusza kwestii narzutu w czasie wnioskowania — opóźnienia i przepustowości — a właśnie tam pojawiłaby się tabela odnośników w pamięci DRAM, gdyby miała się gdziekolwiek pojawić. Pamięć, po którą trzeba sięgnąć, nie jest pamięcią, którą dostaje się za darmo.

Dlaczego własny wrzesień DeepSeek przemawia za przeciwnym wnioskiem
Argument przeciw temu, by produkt 3T wkrótce trafił na rynek, jest taki, że DeepSeek właśnie przeprowadził eksperyment na poziomie 1,6T i odpowiedział na własne pytanie czymś mniejszym. Drabinka V4 w obecnej postaci:
• DeepSeek-V4-Flash-0731 — łącznie 284B parametrów, 13B aktywnych na token.
• DeepSeek-V4-Pro-0813 — 1.6T łącznie, 49B aktywnych, otwarte wagi na licencji MIT.
• DeepSeek V4.1 Flash — szkielet o 552B parametrów w architekturze Causal Encoder-Decoder, aktywujący 8B parametrów na token podczas prefillu i 16B podczas dekodowania.
14 września w południe czasu pekińskiego pojawia się środkowy szczebel. DeepSeek wyłącza V4 Pro i kieruje żądania dla deepseek-v4-pro do V4.1 Flash, rozliczane według stawek Flash, dopóki nie powstanie V4.1 Pro. Oficjalna strona z cennikiem zawiera dziś dwa wiersze i żaden z nich nie jest następcą wycofanego modelu pod względem rozmiaru: deepseek-flash po 0,30 USD za milion tokenów wejściowych i 1,20 USD za milion tokenów wyjściowych w szczycie, deepseek-v4-pro po 1,32 USD i 3,96 USD, przy czym stawki poza szczytem są o połowę niższe. Oba mają okno kontekstu 1 mln tokenów i limit wyjścia 384 000 tokenów.
Kierunek podróży nie jest subtelny. Laboratorium, które wycofuje swój największy model na rzecz modelu aktywującego jedną dziesiątą liczby parametrów na token, już doszło do wniosku, że ekonomiczną jednostką możliwości granicznych nie jest największy checkpoint, jaki może wytrenować. Model 3T, którego twórca nie jest pewien, czy można go "dotrenować i serwować ekonomicznie", nie jest pogłoską o wahaniu; opisuje laboratorium, które ma teraz zmierzone dane na temat alternatywy.
Post-trening to ostrzejsza połowa tego problemu. Pełnoparametrowy post-trening linii DeepSeek-V4-Pro na platformie CloudMatrix384 SuperPOD firmy Huawei został zgłoszony przez zewnętrzny projekt SLAI T-Rex na poziomie 34,22% MFU, czyli około 2,93x w porównaniu z otwartym bazowym przepisem. To zachęcająca liczba — liczba podana przez stronę trzecią, dla modelu 1,6T. Podwojenie szkieletu mniej więcej podwaja rachunek, zanim zostanie obsłużony pierwszy token.

Kiedy ich skupiska rosną.
Kluczową klauzulą w tym przecieku jest ta ostatnia, ponieważ jako jedyna ma publiczny ślad dokumentacyjny. Donoszono, że DeepSeek planuje co najmniej 160 000 akceleratorów Huawei Ascend 950DT w nowym centrum danych w Ulanqab w Mongolii Wewnętrznej, w ramach zamówienia o wartości około 2,56 mld dolarów — jeden z największych klastrów chińskich układów AI, jakich ktokolwiek próbował zbudować.
Zastrzeżenia towarzyszące temu planowi mają większe znaczenie niż sam nagłówek. Układy są planowane do wnioskowania, a nie trenowania: DeepSeek próbował już trenować na krzemie Huawei i nadal trenuje na akceleratorach Nvidia, co jest krokiem, którego model 3T faktycznie by potrzebował. Dostawa może potrwać ponad rok. Część mocy produkcyjnych ma zostać uruchomiona pod koniec 2027 r. i na początku 2028 r. A to, ile jednostek 950DT Huawei może zbudować w tym roku, ma ograniczać podaż pamięci o wysokiej przepustowości, a nie logika.
Tak więc optymistyczna interpretacja zwrotu „kiedy ich klastry urosną” umieszcza model 3T najwcześniej w perspektywie lat 2027–2028, a pesymistyczna interpretacja — że pozostanie artefaktem badawczym i nigdy nie stanie się produktem — jest spójna ze wszystkim, co DeepSeek dostarczył w 2026 r. Środowisko obliczeniowe wokół laboratorium to również sporna polityka, a nie czysto podażowa kwestia: 8–9 września NSA, FBI i CISA wspólnie zarzuciły, że sześć chińskich laboratoriów, w tym DeepSeek, destylowało amerykańskie modele frontier „na skalę przemysłową”, zarzut, który odrzuciło Ministerstwo Handlu Chin. Cokolwiek sądzić o tym zarzucie, wydanie, które zależy od wzrostu klastrów, zależy od decyzji, których nikt wewnątrz DeepSeek nie kontroluje.
Co zamieniłoby ten wyciek w premierę?
Lista kontrolna jest krótka i konkretna, a żaden z jej punktów jeszcze nie zadziałał:
• Repozytorium w organizacji deepseek-ai na Hugging Face, z wersjonowaną nazwą checkpointu zamiast sluga rodziny.
• Nowy wiersz na stronie Models & Pricing DeepSeeka.
• Datowany wpis w kanale aktualności dokumentacji API, w typowym dla laboratorium formacie newsYYMMDD.
• Identyfikator modelu, a nie nazwa rodziny — DeepSeek wersjonuje checkpointy, a sam slug rodziny oznaczał dotąd wersję zapoznawczą.
Bliższym kamieniem milowym jest V4.1 Pro, o którym członek zespołu DeepSeek wspomniał 9 września jako o punkcie końcowym okna routingu. Nie ma opublikowanych specyfikacji, liczby parametrów, ceny ani daty. W pewnym sensie V4.1 Pro jest testem tego przecieku: jeśli następny flagowiec pojawi się na poziomie mniej więcej 1,6T V4 Pro lub niżej, twierdzenie o 3T przesunęło się co najmniej o jedną generację.
Co to wszystko oznacza, jeśli w tym tygodniu wybierasz model
Model 3T nie jest w 2026 roku decyzją zakupową, a praktyczna lekcja września DeepSeek nie dotyczy wcale skali. Chodzi o to, że model stojący za punktem końcowym może się zmienić, podczas gdy nazwa punktu końcowego pozostaje dokładnie taka sama. Każdy, kto wywołuje deepseek-v4-pro przez warstwę abstrakcji, 14 września otrzyma inny, mniejszy, tańszy model, nie dotykając przy tym swojego kodu. Każdy, kto jest podłączony bezpośrednio do implementacji tego identyfikatora u jednego dostawcy, dostaje to, co ten dostawca postanowi zrobić.
Zarówno DeepSeek V4.1 Flash, jak i DeepSeek V4 Pro są dostępne w OrcaRouter pod jednym kluczem przy 0% marży — cena katalogowa dostawcy przekazywana bez zmian, co oznacza, że zmiana cennika DeepSeek z 10 września obowiązuje tutaj tego samego dnia według ceny katalogowej, a nie według jakiejś podwyższonej jej wersji. Strona modelu podaje 0,15 USD za milion tokenów wejściowych i 0,60 USD za milion tokenów wyjściowych w paśmie poza godzinami szczytu, co jest własną stawką DeepSeek w godzinach poza szczytem i niczym ponad to. Automatyczne przełączanie awaryjne między dostawcami to mało efektowna funkcja, która ma największe znaczenie w tygodniu takim jak ten: gdy dostawca podmienia model pod danym punktem końcowym, warstwa routingu sprawia, że staje się to zmianą konfiguracji, a nie migracją.
Jeśli model 3T DeepSeek kiedykolwiek zostanie wydany, będzie obsługiwany przez tego, kto ma klastry, by go pomieścić, w cenie, którą dyktuje moc obliczeniowa. Ta sama warstwa routingu to miejsce, w którym byś go spotkał — bez drugiej umowy i bez przebudowywania czegokolwiek.

Otwarte pytanie nie brzmi, czy DeepSeek potrafi zbudować model o 3 bilionach parametrów. Trzy opublikowane prace o architekturze, działający projekt pamięci i model 552B, o którym jego twórca mówi, że przewyższa własnego poprzednika 1.6T — wszystko to sugeruje, że laboratorium wie, jak to zrobić. Pytanie brzmi, czy ktokolwiek zapłaci za jego obsługę — a sądząc po dowodach z ostatnich dwóch tygodni, sam DeepSeek nie jest tego pewien. Patrz na klaster, nie na liczbę parametrów. Strona z cennikiem powie ci, co DeepSeek faktycznie wypuszcza szybciej, niż zrobi to jakikolwiek przeciek.
Porównane w tym artykule1
Wykryto na podstawie tego artykułu · Benchmarki: Artificial Analysis · aktualizowane codziennie
