Wygenerowana karta tytułowa z napisem „Kimi K4" i podtytułem „co mówi przeciek, a czego nie", plakietką PRZECIEK / NIEPOTWIERDZONE, trzema liniami jedna pod drugą o treści „Brak karty modelu", „Brak wag" i „Brak ceny i trasy" oraz wierszem stopki „Na dzień 25 września 2026", z logo OrcaRouter nałożonym w prawym dolnym rogu.
Guides & Insights

Kimi K4: co tak naprawdę twierdzi przeciek i dlaczego „mniej aktywnych parametrów” byłoby prawdziwą historią

Autor

Rowan Sterling

Data publikacji

Najnowsze modele · 20Zobacz wszystkie modele →
Benchmarki: Artificial Analysis · aktualizowane codziennie
Powrót do wszystkich wpisów

Pojedynczy post wprowadził do obiegu jednocześnie cztery niezapowiedziane nazwy modeli. Lista zaczyna się od K​imi K4, domniemanej następnej generacji od Moonshot AI, obok GLM-5.5 Flash i GLM-5.4 od Z.ai i D​eepSeek V4.1P — a sam autor kładzie nacisk nie na żadną z flagowych nazw, lecz na podejrzenie dotyczące arytmetyki stojącej za K4: że może aktywować mniej parametrów niż model, który zastępuje. To twierdzenie jest niezweryfikowane. Nie ma karty modelu Kimi K4, wag, identyfikatora API, ceny ani trasy, i to samo dotyczy każdej nazwy Z.ai na liście. To, co warto teraz zrobić, to ustalić, które z tych twierdzeń dałoby się sprawdzić, jak wygląda wdrożony model bazowy i co właściwie oznaczałby rzadszy K4.

Sygnał i jego poziom

To wczesny sygnał i jako taki należy go odczytywać. Post, który go niesie, jest interpretacją konwencji nazewnictwa modeli, a nie raportem z obserwacji: wskazuje „GLM-5.5 Flash, GLM-5.4” jako interesującą nomenklaturę i nazywa K​imi K4 „bardzo dziwnym”, po czym proponuje spekulatywny mechanizm — mniejszą liczbę aktywowanych ekspertów — nie twierdząc, że widział konfigurację, listę checkpointów lub endpoint stagingowy.

Nic w publicznie dostępnych źródłach nie przeczy tym nazwom, ale też nic ich nie potwierdza. Ta asymetria jest normalna na tym etapie cyklu wydania i właśnie dlatego użytecznym posunięciem jest ustalenie punktu odniesienia oraz testów, a nie dalsze spekulowanie. Nazwa w poście to hipoteza dotycząca produktu, a nie dowód jego istnienia.

Punkt odniesienia, względem którego mierzono by Kimi K4

Kimi K3 istnieje naprawdę, został wydany i jest wyjątkowo dobrze udokumentowany, co czyni go solidnym punktem odniesienia. Własna karta modelu Moonshot opisuje model Mixture-of-Experts o 2,8 biliona parametrów, który aktywuje 104 mld parametrów na token, rozłożonych na 93 warstwy — jedną gęstą i 92 rzadkie. Rzadkość jest agresywna i podana wprost: na token uruchamia się 16 z 896 ekspertów, oprócz 2 współdzielonych ekspertów, co Moonshot przypisuje około 2,5-krotnej poprawie efektywności skalowania w porównaniu z Kimi K2.

Stos uwagi to miejsce, w którym K3 zrywa z poprzednią generacją. Spośród jego 92 rzadkich warstw 69 wykorzystuje Kimi Delta Attention — hybrydowy mechanizm uwagi liniowej — a 24 używa bramkowanego MLA; podział 3:1 zachowuje mniejszość warstw pełnej uwagi, a resztę przenosi na tańszą ścieżkę liniową. Co 12 bloków w warstwach występuje rezyduum uwagi, funkcją aktywacji jest SiTU-GLU, a cały model jest trenowany z wagami MXFP4 i aktywacjami MXFP8 w ramach treningu uwzględniającego kwantyzację. Długość kontekstu wynosi 1 048 576 tokenów, słownik liczy 163 840 pozycji, a wizja działa przez enkoder MoonViT-V2 o 401 mln parametrów, dzięki czemu K3 natywnie obsługuje obrazy, a nie jest multimodalny przez doklejenie.

Screenshot of the Artificial Analysis model page for Kimi K3 (max), headed "Released July 2026", whose comparison summary reads In $3.00 / Out $15.00 and describes the model as leading on intelligence but expensive next to other open-weight models of similar size, notably slow and somewhat verbose, with text and image input and a 1M-token context window.

To liczby, które następca musi przebić. Zauważ, co z nich wynika dla idei „mniej aktywnych parametrów”: K3 jest już niezwykle rzadkim modelem. Aktywuje około 3,7% swojej całkowitej liczby parametrów na token. K4, który aktywowałby mniej niż 104 mld, nie odchudzałby nadmiernie rozbudowanego projektu — cofałby współczynnik rzadkości, który Moonshot publicznie przedstawiał jako sukces, i robiłby to w generacji, w której reszta branży zmierza w przeciwnym kierunku.

Co oznaczałoby „mniej aktywnych parametrów”, gdyby to była prawda?

Dostępne są dwie interpretacje i wskazują one w przeciwnych kierunkach. Życzliwa z nich ma charakter architektoniczny: Moonshot mógłby dalej rozwijać hybrydę KDA, zastępując kolejne warstwy pełnej uwagi warstwami liniowymi i na nowo równoważąc budżet ekspertów, tak aby niższa liczba aktywacji przekładała się na dłuższy kontekst, tańszy koszt obsługi albo lepszy stosunek jakości do FLOP-ów. W tej interpretacji mniejsza liczba aktywnych parametrów jest udoskonaleniem tej samej tezy, którą K3 już głosi — że rzadkość jest strategią skalowania, a nie kompromisem.

Inna interpretacja jest taka, że K4 wcale nie jest jednolitym następcą. Linia K​imi rozgałęziła się już raz w tym roku, a doniesienia na różne sposoby wskazywały na K3.1, K3.2 i K4 jako trzy różne produkty. K4, który aktywuje mniej niż K3, w rodzinie, która dostarcza osobny wariant do kodowania, jest co najmniej równie spójny z repozycjonowaniem, jak z prostym ulepszeniem. Obie interpretacje to spekulacje. Żadnej z nich nie rozstrzyga post.

Jest też wymiar licencyjny, którego nikt nie poruszył. Wagi K3 są udostępniane na licencji Kimi K3, niestandardowej licencji „innej”, a nie standardowej licencji open source, i jest to pierwszy otwarty model klasy 3T. To, czy rzadszy K4 odziedziczy tę licencję, czy ją zawęzi, ma większe znaczenie dla każdego, kto buduje na tych wagach, niż kilka punktów wyniku indeksu.

A generated two-column scoreboard titled "Kimi K3 vs Kimi K4 — the scoreboard", with six shared rows: Status (K3 "released 15 July 2026" vs K4 "unreleased"), Total parameters ("2.8T" vs "unverified"), Activated parameters ("104B" vs "unverified"), Experts per token ("16 of 896" vs "unverified"), Context ("1M tokens" vs "unverified") and Price ("$3 / $15" vs "none"), with the footer line "Kimi K3 figures per Moonshot's model card; Kimi K4 has no model card, weights or price."

Pozostałe trzy nazwy w tym samym poście

GLM-5.5 Flash i GLM-5.4 to bardziej zaskakująca para i nie chodzi tu o liczby. Publikowany pułap Z.ai to GLM-5.3, który ukazał się 14 sierpnia 2026 roku z 743 mld parametrów, a GLM-5.3-Flash pojawił się 26 sierpnia, podczas gdy wydania wag BF16 i Flash-BF16 trafiły do sieci 25 sierpnia. Własna dokumentacja Z.ai wymienia dokładnie trzy aktualne identyfikatory modeli: glm-5.3, glm-5.3-flash i glm-5.2. Nie istnieje żaden GLM-5.4, żaden GLM-5.5 ani żaden GLM-5.5 Flash — a to właśnie kierunek nazewnictwa jest osobliwy, ponieważ generacja 5.5 poprzedzająca generację 5.4 to nie sposób, w jaki Z.ai kiedykolwiek numerował swoją rodzinę modeli. Numery wersji pojawiające się w wycieku w niewłaściwej kolejności to dobrze znany tryb awarii: zwykle są to sąsiadujące produkty, wewnętrzne nazwy kodowe lub etykieta poziomu serwowania, a nie nowy model bazowy.

DeepSeek V4.1P to nazwa, która – jak twierdzi autor sygnału – interesuje go najbardziej, i najłatwiej ją sprawdzić spośród tych czterech. Dokumentacja API DeepSeek wymienia dokładnie dwa aktualne ciągi znaków modeli: deepseek-flash i deepseek-v4-pro. Sufiks „P” nie ma odpowiednika w żadnym identyfikatorze DeepSeek, a najnowsze wydanie wag w samej organizacji DeepSeek to DeepSeek-V4.1-Flash, opublikowane 10 września 2026 r. V4.1P byłby najprawdopodobniej siostrzanym modelem z klasy Pro tego modelu — ale „najprawdopodobniej” to domysł dotyczący ciągu znaków, a nie produktu.

Skąd miałbyś wiedzieć, że cokolwiek z tego jest prawdziwe?

Cztery nazwy nie przechodzą tego samego testu w ten sam sposób, co sprawia, że oczekiwanie jest proste, a nie udręczające. Prawdziwe wydanie pozostawia artefakty, a każdy z nich można łatwo sprawdzić:

• Karta modelu we własnej organizacji dostawcy na Hugging Face. Najnowszym wpisem Moonshot jest Kimi-K3, utworzony 13 czerwca 2026; najnowsze od Z.ai to rodzina GLM-5.3 z 25 sierpnia; najnowszym od DeepSeek jest DeepSeek-V4.1-Flash z 10 września. W żadnym z tych trzech nie ma nic nowszego.

• Konfiguracja, która rozstrzyga spór. Konkretnie dla K4 pola, których należy szukać, to num_experts i num_experts_per_token — K3 miał 896 i 16. Konfiguracja K4 z niższą wartością na token to twierdzenie z tego wycieku, które można potwierdzić lub obalić za pomocą jednego pliku.

• Model, który można routować. Nazwa, która pojawia się w katalogu, to nazwa, za którą stoją cena, okno kontekstowe i dostawca; nazwa, która znajduje się tylko we wpisie, nie ma żadnego z tych elementów.

Screenshot of the OrcaRouter model page for kimi/kimi-k3 by MoonshotAI, dated 2026-07-15, with Vision, Tools, JSON and Reasoning capability chips and pricing of $3.00 per million input tokens and $15.00 per million output tokens.

Co możesz dziś trasować

Praktyczna wersja tego przecieku jest taka, że generacja, którą opisuje, nie jest tym, na czym można budować. Dostępna jest poprzednia, a zadaniem routera jest sprawić, by różnica między generacjami była decyzją routingową, a nie projektem migracyjnym. Kimi K3 jest już dostępny z pełnym kontekstem 1 mln tokenów i natywnym przetwarzaniem obrazu, w cenie 3,00 USD za milion tokenów wejściowych i 15,00 USD za milion tokenów wyjściowych, a odczyt z pamięci podręcznej po 0,30 USD — z rozliczeniem według stawki dostawcy bez marży, dlatego zmiana ceny dostawcy dla K3 trafia na Twój rachunek tego samego dnia, a nie dopiero w kolejnym cyklu aktualizacji cen. Kimi K3 w OrcaRouter zawiera pełną specyfikację i aktualną stawkę.

To samo dotyczy reszty oferty. GLM-5.3, GLM-5.3-Flash i DeepSeek V4.1 Flash są dostępne w routingu obok Kimi K3, przez jeden punkt końcowy zgodny z OpenAI, obejmującyponad 200 modeli, z automatycznym przełączaniem awaryjnym, gdy dostawca zawodzi, oraz DSL routingu do wyrażania preferencji — limitów kosztów, minimalnej jakości, budżetów opóźnień — jako polityki, a nie logiki dla każdego wywołania. Gdy pojawi się K​imi K4, GLM-5.5 Flash lub D​eepSeek V4.1P, migracja to zmiana ciągu znaków w polityce routingu i nic więcej. Fuzja modeli pozwala łączyć wyniki z kilku modeli w tym samym punkcie końcowym, gdy jest to korzystne dla danego zadania.

Mówiąc wprost, czym to nie jest: żadna z czterech nazw z przecieku nie jest dziś trasą w OrcaRouter. Nie hostujemy ich i nie możemy ich obsługiwać.

Konkluzja

Ciekawym twierdzeniem nie są tu numery wersji. Jest nim mechanizm — flagowy model nowej generacji, który aktywuje mniej parametrów niż jego poprzednik, byłby deklaracją, że Moonshot uważa, iż osią wartą forsowania jest rzadkość (sparsity), a nie surowa liczba aktywacji, a podział 16 z 896 ekspertów w K3 jest już argumentem w tym kierunku. Każda część tego twierdzenia jest niezweryfikowana: Kimi K4, GLM-5.5 Flash, GLM-5.4 i DeepSeek V4.1P nie mają kart modeli, wag, identyfikatorów API ani cen, a katalogi samych producentów kończą się w każdym z tych przypadków o jedną generację wcześniej. Traktuj te nazwy jako zapowiedź pytania, a nie odpowiedź — a jeśli potrzebujesz dziś otwartych wag klasy frontier przy kontekście 1M, Kimi K3 to model, który już istnieje.

Kiedy K​imi K4 faktycznie się pojawi, automatyczne przełączanie awaryjne jest tym, co powstrzymuje migrację przed zamienieniem się w incydent