Główna karta tytułowa z napisem DeepSeek V4.1 Flash w OpenCode, z nadtytułem Playbook agenta kodującego – wrzesień 2026 i podtytułem o trzech integracjach zweryfikowanych dzisiaj oraz pokrętle wysiłku, które decyduje, czy zadanie zostanie ukończone, z czterema chipami: OpenCode Go 10 USD/mies., poza szczytem 0,15 USD / 0,60 USD za 1 mln, presety wysiłku niski 50, wysoki 75, maks. 100, i AA Intelligence Index 40, a w stopce adnotacja, że presety wysiłku są zgłaszane przez społeczność.
Guides & Insights

DeepSeek V4.1 Flash w OpenCode: konfiguracja, koszty i pokrętło wysiłku, o którym nikt nie wspomina

Autor

Alistair Wren

Data publikacji

Najnowsze modele · 20Zobacz wszystkie modele →
Benchmarki: Artificial Analysis · aktualizowane codziennie
Powrót do wszystkich wpisów

DeepSeek V4.1 Flash znajduje się w OpenCode Go od 10 września, a mnożnik, który OpenCode do niego przypisał, ma opublikowaną datę zakończenia: 20 września. To cztery dni od teraz. Najciekawszy nie jest jednak sam termin — lecz to, że ustawienie, które decyduje o tym, czy przyjemnie się z tym modelem koduje, brakuje w każdym przewodniku konfiguracji na pierwszej stronie wyników, a w co najmniej dwóch harnessach jest po cichu pomijane. To playbook, jak skierować agenta kodującego na DeepSeek V4.1 Flash: dokładne identyfikatory modeli, trzy integracje zweryfikowane dzisiaj, kontrola wysiłku rozumowania raportowana przez społeczność oraz tryb awarii polegający na nadmiernym myśleniu wraz ze środkami zaradczymi, które faktycznie działają.

Na co tak naprawdę kierujesz swojego agenta

DeepSeek V4.1 Flash został wydany 10.09.2026 — nota wydawnicza w dokumentacji API samego DeepSeek jest datowana na ten dzień, a to najmniejszy model w nowej rodzinie architektur tego dostawcy. DeepSeek podaje, że szkielet typu mixture-of-experts ma 552 mld parametrów i opiera się na tym, co firma nazywa projektem Causal Encoder–Decoder, aktywując około 8 mld parametrów na token podczas prefill i 16 mld podczas decode. Przyjmuje tekst i obrazy jako dane wejściowe i zwraca tekst, obsługuje okno kontekstowe do miliona tokenów i wygeneruje do 384 000 tokenów w pojedynczej odpowiedzi — pułapy kontekstu i danych wyjściowych pochodzą z własnej strony modelu w OrcaRouter, na której podano odpowiednio 1 048 576 i 384 000.

Benchmarki dostawcy, z wykresu na stronie wydania DeepSeek, a zatem raportowane przez dostawcę i nieaudytowane: 30,0 w Terminal-Bench 3.0, 74,2 w DeepSWE v1.1, 88,1 w CyberGym, 54,8 w Automation-Bench i 90,9 w GPQA Diamond. Niezależne punktacje są skromniejsze, ale istnieją — Artificial Analysis, odczytane bezpośrednio dziś, umieszcza DeepSeek V4.1 Flash na poziomie 40 w swoim Intelligence Index, na 6. miejscu spośród 113 w swojej klasie porównawczej. Jedna linijka z tej samej strony ma większe znaczenie dla czytelnika zajmującego się agentami kodującymi niż pozycja w rankingu: Artificial Analysis określa ten model jako bardzo rozwlekły, zużywszy 250 mln tokenów wyjściowych na ukończenie swojego przebiegu Intelligence Index wobec mediany 140 mln. Wrócimy do tego.

Dwa fakty dotyczące nazewnictwa pozwalają zaoszczędzić rzeczywisty czas debugowania. Kanoniczny identyfikator modelu API DeepSeek to teraz code>deepseek-flash/code>. Starsze ciągi code>deepseek-v4-flash/code> oraz code>deepseek-v4-flash-vision-exp/code> są nadal akceptowane, ale modele, które za nimi stoją, zostały wycofane, a żądania są obsługiwane przez V4.1 Flash w cenie Flash. Niezależnie od tego, DeepSeek V4 Pro nie zniknął: dokumentacja DeepSeek podaje, że usługa API V4 Pro jest kontynuowana po 2026-09-14 bez zmian w rozliczeniach. Jeśli powiedziano ci, że flagowy model został wyłączony, to nie jest zgodne z tym, co mówią dokumenty samego dostawcy.

Single-column scoreboard titled DeepSeek V4.1 Flash in coding agents, with six rows reading Released 2026-09-10, Context window 1,048,576, Max output 384,000, Price per 1M $0.15 / $0.60 off-peak, Peak price per 1M $0.30 / $1.20, and AA Intelligence Index 40, #6 of 113, over a footer citing DeepSeek and OpenCode Go documentation for price and limits and Artificial Analysis for the index.

OpenCode: dwie drogi wejścia i identyfikator, który faktycznie trzeba wpisać

Istnieją dwa sposoby na umieszczenie DeepSeek V4.1 Flash za OpenCode i mają one różną ekonomikę.

Ścieżka subskrypcyjna to OpenCode Go — plan za 10 USD miesięcznie, który OpenCode opisuje jako wyselekcjonowany zestaw otwartych modeli do kodowania, przetestowanych i zmierzonych w benchmarkach. Konfiguracja składa się z czterech kroków i nie ma żadnego pliku konfiguracyjnego do ręcznej edycji: zaloguj się w OpenCode Zen, zasubskrybuj Go, skopiuj klucz API, a następnie uruchom code>/connect/code> w TUI, wybierz OpenCode Go i wklej klucz. Następnie code>/models/code> wyświetla listę dostępnych modeli. Odwołania do modeli w konfiguracji mają postać code>opencode-go/<model-id>/code>.

Które id modelu? Oba. Własna lista modeli bramy Go, pobrana dziś z code>https://opencode.ai/zen/go/v1/models/code>, zwraca code>deepseek-flash/code> i code>deepseek-v4.1-flash/code> jako dwa odrębne wpisy, obok starszych code>deepseek-v4-flash/code> i code>deepseek-v4-pro/code>. Którykolwiek z tych dwóch pierwszych prowadzi do modelu, którego chcesz; code>deepseek-flash/code> to nazwa kanoniczna i bezpieczniejszy wybór dla wszystkiego, co zamierzasz utrzymywać w działaniu.

Bezpośrednia ścieżka całkowicie pomija subskrypcję: uruchom code>/connect/code>, wyszukaj DeepSeek i wklej klucz platformy DeepSeek. Wtedy rozlicza cię DeepSeek według ceny katalogowej, zamiast korzystać z przydziału Go. DeepSeek podaje, że cena katalogowa poza godzinami szczytu wynosi 0,15 USD za 1 mln tokenów wejściowych i 0,60 USD za 1 mln tokenów wyjściowych, a odczyty z pamięci podręcznej kosztują 0,003 USD za 1 mln — i dokładnie dwa razy tyle w godzinach szczytu. Zarówno dokumentacja OpenCode Go, jak i strona modelu OrcaRouter, przeczytane dzisiaj, są zgodne co do tych wartości.

Tym, co dodaje OpenCode Go, jest struktura przydziałów, a tutaj liczby warto czytać uważnie, ponieważ to one sprawiają, że termin nabiera znaczenia. Dokumentacja OpenCode wymienia DeepSeek V4.1 Flash z miesięcznym limitem 15 USD, obecnie pomnożonym 4× do 60 USD w ramach promocji, którą OpenCode oznacza jako „Kończy się 20 września”. Szacunkowe liczby żądań podano w dwóch kolumnach: 6 500 na każde 5 godzin / 16 250 na tydzień / 32 500 na miesiąc według stawki standardowej albo 26 000 / 65 000 / 130 000 po zastosowaniu mnożnika 4×. Kształt przydziału jest spójny we wszystkich modelach — limit 5-godzinny wynosi 20% wartości miesięcznej, limit tygodniowy 50%, a limit miesięczny to całość.

To są opublikowane liczby OpenCode, odczytane dzisiaj z jej dokumentacji Go. To oni mogą zakończyć promocję, a ma ona datę.

Screenshot of the OpenCode Go documentation pricing table showing the DeepSeek V4.1 Flash off-peak row at $0.15 input, $0.60 output and $0.003 cached read per 1M tokens with a monthly limit of $15 raised to $60 under a 4x promotion ending Sep 20, the DeepSeek V4.1 Flash peak row at $0.30 input, $1.20 output and $0.006 cached read with the same $15 to $60 limit, and a footnote stating peak hours are 01:00-04:00 and 06:00-10:00 UTC Monday through Friday with all other hours including weekends off-peak.

Command Code: nadal działa, a raport o błędzie, o którym warto wiedzieć

Własny katalog Command Code nadal wymienia ten model na dzień dzisiejszy, pod identyfikatorem code>deepseek-v4-1-flash/code>, z oknem kontekstowym 1 mln tokenów i taką samą ekonomiką przenoszenia kosztów: 0,15 USD / 0,60 USD poza szczytem, 0,30 USD / 1,20 USD w szczycie, 0,003 USD za odczyt z pamięci podręcznej. Zbieżność cen w dwóch niezależnych środowiskach testowych nie jest przypadkiem — oba przekazują cenę katalogową DeepSeek, a nie ustalają własnej.

Mechanika jest prosta. Zainstaluj za pomocą code>npm i -g command-code/code>, uruchom go w katalogu swojego projektu, uwierzytelnij się za pomocą code>/login/code>, i użyj code>/connect/code>, jeśli chcesz użyć własnego klucza dostawcy. code>/model <id>/code> stosuje zmianę modelu bezpośrednio, podczas gdy samo code>/model/code> otwiera selektor, a code>/effort/code> ustawia poziom wysiłku rozumowania dla bieżącego modelu — flaga, która tutaj ma największe znaczenie.

Jeden raport o błędzie od społeczności warto zapisać sobie w głowie, zanim zaczniesz debugować niewłaściwą warstwę. Otwarte zgłoszenie dotyczące warstwy routingu od firmy trzeciej opisuje pamięć podręczną odtwarzania rozumowania, która nigdy się nie aktywuje dla identyfikatora code>command-code/deepseek-v4.1-flash/code>, ponieważ wzorzec, na który dopasowuje warstwa routingu, oczekuje code>v4./code> lub code>v4-/code> segmentu, a ten ciąg to code>v4.1/code>. Zgłaszanym objawem są błędy 400 zwracane przez warstwę nadrzędną, które skarżą się, że treść rozumowania wygenerowana w trybie myślenia musi być przekazana z powrotem do API. To raport o błędzie od społeczności dotyczący mechanizmu dopasowywania po stronie klienta, a nie wytyczne dostawcy ani problem z modelem — ale to dokładnie ten rodzaj rzeczy, który o drugiej w nocy wygląda jak usterka modelu.

Claude Code, Codex oraz klienci, których zweryfikował sam OpenCode

OpenCode Go nie jest przeznaczony wyłącznie dla OpenCode i ich dokumentacja mówi to wprost: został zaprojektowany dla OpenCode oraz innych agentów kodujących, które generują podobne wzorce żądań, a do tego opublikowano listę klientów potwierdzonych jako działające. Na tej liście wymieniono obecnie Hermes, Claude Code, Codex, ZCode i Pi — a w przypadku Claude Code uwaga brzmi, że „rozpoznaje swój natywny nagłówek sesji. Nakładka z niestandardowym nagłówkiem nie jest potrzebna”. Wiążą się z tym dwa wymagania: identyfikuj swojego klienta za pomocą jego własnego user agenta, a nie ogólnej nazwy SDK, oraz wysyłaj stabilny identyfikator sesji w nagłówku code>x-opencode-session/code> przy każdej rozmowie, co umożliwia działanie ich routingu i buforowania promptów. W przypadku Hermesa znaczenie ma potwierdzona kompilacja — poprawka nagłówka została scalona po v0.21.0, więc samo to wydanie jej nie zawiera.

Istnieje również trasa bez żadnej powiązanej subskrypcji, korzystająca bezpośrednio z punktu końcowego DeepSeek zgodnego z Anthropic. Ustaw code>ANTHROPIC_BASE_URL/code> na code>https://api.deepseek.com/anthropic/code>, code>ANTHROPIC_AUTH_TOKEN/code> na swój klucz DeepSeek i ustaw zmienne modelu tak, aby wskazywały na model. Nazwy modeli Claude są przy wejściu mapowane na nowo: wszystko zaczynające się od code>claude-opus/code> trafia do DeepSeek V4 Pro i jest rozliczane w cenie V4 Pro, natomiast nazwy code>claude-sonnet/code> i code>claude-haiku/code> trafiają do modelu Flash. Sufiks code>[1m]/code> w ciągu modelu żąda wariantu z kontekstem miliona tokenów. Własny przewodnik DeepSeek dotyczący tej konfiguracji ustawia również code>CLAUDE_CODE_EFFORT_LEVEL=max/code> i przypina okno automatycznego kompaktowania do 786432 tokenów.

Ta ostatnia zmienna to miejsce, w którym znajduje się poprawka społeczności. Istnieje proxy obejściowe, ponieważ niedawne kompilacje Claude Code wysyłają code>thinking: {"type": "disabled"}/code> w żądaniach podagentów, podczas gdy code>CLAUDE_CODE_EFFORT_LEVEL=max/code> dodaje parametr wysiłku rozumowania, a endpoint DeepSeek w formacie Anthropic odrzuca tę kombinację komunikatem, że opcje myślenia nie mogą być wyłączone, gdy ustawiono wysiłek rozumowania. Zgłaszane obejście jest wąskie — usuń parametr wysiłku tylko z żądań podagentów, pozostawiając głównego agenta bez zmian. Traktuj to jako ustalenie społeczności dotyczące niezgodności kontraktu klient/serwer i spodziewaj się, że dokładna granica wersji się przesunie.

Pokrętło wysiłku: 1–100 i dlaczego „niski” oznacza 50

Wszystko w tej sekcji to ustalenia społeczności, a nie wytyczne dostawcy. DeepSeek nie publikuje możliwego do zweryfikowania mapowania presetów na liczby, a poniższe liczby pochodzą z opracowań praktyków i dokumentacji zewnętrznych środowisk testowych. Są wystarczająco spójne między źródłami, by być użyteczne, i wystarczająco niepotwierdzone, że powinieneś przetestować je na własnej pracy.

DeepSeek V4.1 Flash jest trenowany z ciągłym skalarem wysiłku rozumowania od 1 do 100. To nie jest limit tokenów — przesuwa on punkt, w którym model znajduje się na krzywej wyuczonej przez proces treningowy, gdzie niższy wysiłek wywiera większą presję na zwięzłość, a wyższy wysiłek sprawia, że dodatkowe rozumowanie jest tańsze. Trzy publiczne presety mapują się na tę skalę:

• Niski — 50, najkrótsza ścieżka i preset, któremu to ustawienie zawdzięcza reputację taniości.

• Wysoki — 75, poziom, który większość źródeł społecznościowych opisuje jako rozsądny pułap dla pracy agenta.

• Max — 100, gdzie kara za długość rozumowania jest całkowicie zniesiona.

To, co daje pokrętło, jest realne, ale gwałtownie maleje. Jeden z przeglądów benchmarków społeczności doniósł, że zwiększenie wysiłku z 25 do 100 przesunęło Terminal-Bench 2.1 z 82,4 na 90,6, jednocześnie zwiększając ogólną liczbę tokenów wyjściowych około 2,5-krotnie. Raporty zbiegają się wokół wysiłku gdzieś między 60 a 80, który pozwala uchwycić większość dostępnej dokładności przy mniej niż połowie budżetu tokenów, podczas gdy maksymalny wysiłek dodaje kolejne 1,6–1,8× do trajektorii agenta za marginalny zysk.

Wartość domyślna to część, co do której nikt się nie zgadza. Część dokumentacji harnessów i relacji praktyków mówi, że nieustawiony effort przyjmuje wartość high; inne opisują domyślną wartość serwera jako po prostu nieznaną. Udokumentowane, a nie sporne, jest to, że dwie integracje harnessów nie wysyłały tego parametru w ogóle — profil dostawcy OpenCode Go i natywny profil DeepSeek oba pomijały wysyłanie code>reasoning_effort/code> dla code>deepseek-flash/code> slug, ponieważ ich guard dopasowania oczekiwał przedrostka code>deepseek-v…/code>, którego nie ma kanoniczny identyfikator. W obu przypadkach wybrane przez użytkownika ustawienie zostało po cichu zastąpione domyślną wartością dostawcy. Jeśli twój klient pokazuje kontrolkę effort, nie jest to dowodem, że parametr faktycznie jest wysyłany. Zaloguj jedno ciało żądania i sprawdź.

Jeszcze jedna osobliwość z tych samych raportów: endpoint OpenCode Go akceptuje code>low/code>, code>medium/code>, code>high/code> i code>max/code>, ale odrzuca całkowitą wartość effort — zgłoszono, że wartość 80 zwraca HTTP 400. Skala 1–100 istnieje w modelu, ale nie jest wszędzie udostępniana jako surowa liczba, więc „ustaw effort na 65” może nie być możliwe do wyrażenia w Twoim kliencie.

Tryb awarii nadmiernego myślenia i co tak naprawdę go naprawia

To tryb awarii, który decyduje o tym, czy zostawisz model w swojej pętli. Raporty społeczności opisują, że DeepSeek V4.1 Flash kontynuuje rozumowanie po zakończeniu pracy: ponownie spiera się o kwestię, na którą już odpowiedział poprawnie, relacjonuje korygowanie własnych błędnych założeń i generuje długie łańcuchy rozumowania o niskiej gęstości informacyjnej. Jeden z praktyków zgłosił, że generowanie rozumowania trwało ponad godzinę w sesji CLI do programowania. Inny zgłosił, że nie był w stanie w ogóle doprowadzić go do ukończenia długiego przebiegu benchmarku.

Notka źródłowa dotycząca tego drugiego raportu, ponieważ to właśnie ten rodzaj twierdzenia, który bywa „prany”. Pochodzi z wątku społecznościowego o niezawodnym działaniu modelu, a Reddit blokuje nasz program pobierający, więc nie mogliśmy przeczytać tego wątku bezpośrednio — przekazujemy ten raport, a nie cytujemy strony, którą otworzyliśmy. To, co mogliśmy zweryfikować niezależnie, to kształt problemu, a tutaj zewnętrzne dowody są wyjątkowo czyste: Artificial Analysis na własnej stronie wskazuje, że ten model jest bardzo rozwlekły, zużywając 250 mln tokenów wyjściowych, aby ukończyć przebieg, który jego medianowy model porównawczy kończy w 140 mln. To około 1,8×, zmierzone przez podmiot trzeci, na stałym zestawie zadań. Raporty z forum i niezależny wskaźnik opisują to samo zachowanie.

Środki zaradcze, które wynikają z tych raportów, wszystkie pochodzące od społeczności:

• Ustaw wysiłek na wysoki lub niższy i nie pozwól, by się stopniowo podkręcał. Najbardziej jednoznaczną poprawką spotykaną w praktyce jest wtyczka routingu napisana specjalnie po to, aby powstrzymać eskalację wysiłku: głębokość tury nie wnosi nic do wyniku eskalacji, liczy się wyłącznie nieudany wynik narzędzia albo identyczna ponowna próba, eskalacja jest ograniczona, a tryb maksymalny jest opcjonalny i domyślnie obniżony. Jeśli twoje środowisko uruchomieniowe pozwala agentowi zwiększać własny wysiłek w miarę wydłużania się przebiegu, to właśnie ten mechanizm należy wyłączyć.

• Nie uruchamiaj trybu max jako domyślnego. Wielu praktyków zgłasza, że max wpada w pętlę zamiast zbiegać się przy rutynowej pracy, a przełączenie z powrotem na high rozwiązuje ten problem.

• Ogranicz code>max_tokens/code> na ścieżkach interaktywnych. Pułap 384 000 tokenów na wyjściu to limit, a nie cel, a pętla, która się nie zakończy, jest kosztowna przy tym pułapie.

• Sprawdź, czy parametr jest wysyłany. Skoro stwierdzono, że dwa harnessy po cichu go gubią, „ustawiłem go na high” i „high dotarło do API” to różne twierdzenia.

• Otoczka ma większe znaczenie, niż można by się spodziewać. Praktycy uruchamiający te same wagi zgłaszają wyraźnie odmienne zachowanie w różnych powłokach — ten sam model, który spiera się sam ze sobą i zakopuje sygnał w jednej otoczce, w innej nie wzbudza żadnych takich zastrzeżeń. To obserwacja społeczności dotycząca zachowania otoczki, a nie twierdzenie dostawcy o modelu, ale to najczęściej powtarzana rada w raportach.

Ile tak naprawdę kosztuje pętla kodowania przy tych stawkach

Cennik DeepSeek wynosi 0,15 USD za 1 mln tokenów wejściowych i 0,60 USD za 1 mln tokenów wyjściowych poza godzinami szczytu — wyjście jest czterokrotnie droższe od wejścia i to pierwsza rzecz, którą trzeba sobie przyswoić na temat agenta generującego zarówno rozumowanie, jak i kod.

Weź realistyczną turę agenta: 60 000 tokenów kontekstu (prompt systemowy, schematy narzędzi, wycinek repozytorium, historia rozmowy) na wejściu i 3000 tokenów rozumowania plus patch na wyjściu. To daje 60 000 × 0,15 USD/1 mln = 0,009 USD na wejściu plus 3000 × 0,60 USD/1 mln = 0,0018 USD na wyjściu, czyli około 1,1 centa na turę. Dwieście takich tur w dniu roboczym to około 2,16 USD, czyli około 47 USD przez miesiąc dni roboczych przy stawce poza szczytem. To ta arytmetyka sprawia, że miesięczny limit 15 USD z dodatkową promocją 4× wygląda hojnie — i ta arytmetyka sprawia, że to na gadatliwość trzeba uważać.

Bo właśnie tu kryje się dźwignia w tej liczbie z Artificial Analysis. To, że model zużywa 1,8× mediany tokenów wyjściowych na stałym zestawie zadań, oznacza, że pętla ograniczona wyjściem kosztuje 1,8× tego, co sugerowałaby sama cena tokenów. A pokrętło wysiłku służy dokładnie do kontrolowania tego. Doniesienia społeczności wskazują, że przejście z max na high zmniejsza liczbę tokenów wyjściowych mniej więcej o połowę — to znacznie większe wahnięcie niż cokolwiek, co zrobi z tobą harmonogram szczytowy/poza szczytowy. Ustawienie wysiłku to duża dźwignia; harmonogram to ta darmowa.

Co warto wiedzieć, zanim cokolwiek zaplanujesz: godziny szczytu to 01:00–04:00 i 06:00–10:00 UTC, od poniedziałku do piątku, a wszystko inne, łącznie z weekendami, jest poza szczytem. Europejski zespół pracujący w godzinach 09:00–18:00 CET nigdy nie trafia na szczyt. Zespół w Pekinie pracujący w tych samych lokalnych godzinach trafia na szczyt od 09:00 do 12:00 i od 14:00 do 18:00 — siedem z dziewięciu godzin pracy w podwójnej cenie. Ten sam model, ten sam kod, dwukrotnie wyższy rachunek, o czym decyduje wyłącznie strefa czasowa.

Inną darmową oszczędnością jest stawka odczytu z pamięci podręcznej, 0,003 USD za 1 mln wobec 0,15 USD za świeże dane wejściowe — jedna pięćdziesiąta. Prompt agenta kodującego to w większości stabilny prefiks: instrukcje systemowe, definicje narzędzi, te części repozytorium, które się nie zmieniają. Trzymaj stabilny materiał z przodu, a treść zmienną niech podąża za nim, a pamięć podręczna po stronie dostawcy zrobi resztę. To, czy przysługuje zniżka na dane wejściowe z pamięci podręcznej i na jakich warunkach, ustala DeepSeek, a nie klient, więc potwierdź to w aktualnej dokumentacji, zanim oprzesz na tym budżet — nasza własna strona modelu dla code>deepseek/deepseek-v4.1-flash/code> mówi to samo, że stawka za dane wejściowe z pamięci podręcznej podlega warunkom dostawcy.

Jeśli wolisz nie dodawać drugiej subskrypcji, aby ocenić model, ten sam identyfikator jest dostępny przez jeden punkt końcowy zgodny z OpenAI obsługujący cały nasz katalog, w stawce dostawcy z 0% marży — więc zmiana ceny po stronie DeepSeek jest tu widoczna tego samego dnia, a nie przy następnej aktualizacji cennika. Ma to największe znaczenie dokładnie w sytuacji opisanej w tym artykule: model z udokumentowaną skłonnością do kontynuowania, na ścieżce, której oceny nie dokończyłeś. Łańcuch awaryjny sprawia, że tura, która pójdzie źle, trafia do innego modelu, zanim rozpocznie się odpowiedź, zamiast kończyć się niepowodzeniem żądania.

552B, 748B lub 763B — kwestia rozmiaru jest naprawdę otwarta

Nie powtarzaj liczby parametrów tego modelu jako ustalonej, ponieważ w obiegu są trzy różne liczby i żadna z nich nie jest po prostu błędna.

Karta modelu samego DeepSeek opisuje model o „552B parametrach szkieletu” i jest to wartość podana przez dostawcę — to także liczba widniejąca w panelu specyfikacji na naszej własnej stronie modelu. Ta sama karta osobno wymienia moduł „Engram conditional memory” o 196B parametrach, „dostępny rzadko poprzez wyszukiwanie oparte na tokenach”. Dodaj obie te liczby i otrzymasz 748B, co jest wynikiem obliczeń, do którego analiza społeczności doszła w ciągu kilku godzin od premiery. A metadane pliku w tym samym repozytorium modelu podają rozmiar modelu wynoszący 763B parametrów, co stanowi już trzecią wartość.

Pozorny spór ma charakter definicyjny, a nie sprzeczności. Parametry Engramu odczytywane z tablicy kosztują pamięć, ale niemal nie wymagają obliczeń na token, natomiast obliczane parametry szkieletu kosztują czas przy każdym tokenie — i właśnie dlatego dostawca podaje je osobno oraz dlatego porównywanie głównych liczb dwóch modeli o różnych architekturach mówi bardzo niewiele.

To, co nie jest poważnie kwestionowane, to liczba aktywnych parametrów: około 8B na token podczas prefill i 16B podczas decode, i to właśnie ta liczba faktycznie rządzi kosztem wnioskowania. Wagi są otwarte na licencji MIT, jeśli chcesz samodzielnie to wszystko sprawdzić. Traktuj 552B jako dane zgłoszone przez dostawcę, 748B jako wiarygodną sumę społeczności, a wszelkie twierdzenia, że kwestia rozmiaru jest zamknięta, jako przedwczesne.

Screenshot of DeepSeek's own API documentation release page for DeepSeek-V4.1-Flash, dated 2026-09-10, showing the headline claim of a 552B-parameter MoE on a new Causal Encoder-Decoder architecture with 8B active parameters for input and 16B for output, a bar chart comparing DeepSeek V4.1 Flash against Kimi K3, GLM-5.3, Opus 5 and GPT-5.6 Sol on Terminal-Bench 3.0, DeepSWE v1.1, CyberGym and Automation-Bench, and the start of a vendor benchmark table with GPQA Diamond at 90.9 and HLE at 36.8.

Co zrobić przed dwudziestym

Jeśli zamierzasz wypróbować DeepSeek V4.1 Flash w agencie kodującym, kolejność, która marnuje najmniej czasu, jest następująca: najpierw wybierz środowisko testowe, potem ustal poziom wysiłku, a na końcu mierz.

Jeśli chodzi o stanowisko testowe, uczciwe podsumowanie dzisiejszej weryfikacji jest takie, że wszystkie trzy ścieżki działają i różnią się tym, czego od ciebie wymagają. OpenCode Go to subskrypcja za 10 USD miesięcznie z promocyjnym mnożnikiem, który wygasa 20 września, a konfiguracja to code>/connect/code> plus code>/models/code> bez żadnego pliku do edycji. Command Code wyszczególnia model na żywo we własnym katalogu, przełącza się za pomocą code>/model <id>/code> i udostępnia poziom wysiłku jako komendę pierwszej klasy. Claude Code dociera do niego albo przez ścieżkę zweryfikowanych klientów OpenCode Go — gdzie nie potrzebuje własnej otoczki nagłówka — albo bezpośrednio do punktu końcowego DeepSeek w formacie Anthropic, gdzie konflikt wysiłku podagenta jest znanym słabym punktem.

W kwestii effort ustaw go jawnie i ustaw dość nisko: high, albo domyślną wartość modelu, jeśli okaże się, że to high, a nie max. Następnie potwierdź, że opuścił twoją maszynę, bo odkryto, że dwa harnessy go gubią.

Jeśli chodzi o pomiar, patrz na tokeny wyjściowe, a nie na czas zegarowy. Gadatliwość to koszt, pokrętło wysiłku to element sterujący, a harmonogram szczytowego obciążenia to przypadkowa konsekwencja stref czasowych, której możesz uniknąć za darmo.

A jeśli chodzi o twierdzenia o rozmiarze, które w tym tygodniu będą ci przytaczane — 552B, 748B, 763B — użyteczna odpowiedź brzmi: dostawca podaje swój backbone, społeczność dodaje moduł pamięci, a metadane repozytorium mówią jeszcze coś innego. Kto przedstawia jedną z tych liczb jako rozstrzygającą odpowiedź, ten wybrał sobie liczbę, zamiast ją sprawdzić.