Wygenerowana karta hero zatytułowana „Qwen 4 Max vs Kimi K3” z podtytułem „Obietnica otwartych wag spotyka się z dostawą otwartych wag” oraz trzema plakietkami typu pill z napisami „Wagi obiecane, niewysłane”, „Wagi K3 ukażą się 27 lipca 2026” i „Zmodyfikowana licencja MIT”. Wiersz stopki brzmi „Alibaba Yunqi Conference, Hangzhou”. Płaska wektorowa stylistyka edytorska na białym tle z niebiesko-cyjanowym gradientem i logo OrcaRouter nałożonym w prawym dolnym rogu.
Engineering & Research

Qwen 4 Max kontra Kimi K3: obietnica otwartych wag spotyka realizację otwartych wag

Autor

Alistair Wren

Data publikacji

Najnowsze modele · 20Zobacz wszystkie modele
Benchmarki: Artificial Analysis · aktualizowane codziennie
Powrót do wszystkich wpisów

Moonshot AI wydało Kimi K3 16 lipca 2026 r., a potem zrobiło to, o czym większość laboratoriów tylko mówi: opublikowało wagi. Checkpoint o 2,8 biliona parametrów trafił do sieci 27 lipca 2026 r. na licencji Modified MIT, jedenaście dni po premierze. Tymczasem konferencję Yunqi 22 września 2026 r. wykorzystano do ogłoszenia Qwen 4 Max jako flagowego modelu czteropoziomowej rodziny Qwen 4, obejmującej Qwen 4 27B z otwartymi wagami — poziom obiecywany, a nie dostarczony. Te dwa fakty stanowią porównanie. Wszystko inne w Qwen 4 Max jest obecnie nieznane, a luka między obiecanym otwartym poziomem a dostarczonym to miejsce, w którym to zestawienie faktycznie ma coś do powiedzenia.

Co Kimi K3 położył na stole w lipcu

Kimi K3 to model typu mixture-of-experts o 2,8 biliona parametrów, który na każdy token aktywuje 16 z 896 ekspertów, co przekłada się na około 104 miliardy parametrów wykorzystywanych w danym kroku. Ma okno kontekstowe o rozmiarze 1 048 576 tokenów zarówno po stronie wejściowej, jak i wyjściowej, oraz przyjmuje dane wejściowe w postaci tekstu, obrazu i wideo, zwracając tekst. Jego własne API ma cennik na poziomie 3,00 USD za milion tokenów wejściowych, 15,00 USD za milion tokenów wyjściowych i 0,30 USD za milion buforowanych tokenów wejściowych, a stawki podmiotów trzecich kształtują się poniżej tego poziomu.

Architektura to ta część, którą odzwierciedla własna zapowiedź Alibaby. Kimi K3 opiera się na Kimi Delta Attention i Attention Residuals, które według Moonshot mają zapewniać około 2,5 razy lepszą wydajność skalowania niż Kimi K2 i do 6,3 razy szybsze dekodowanie w kontekstach o długości miliona tokenów. To ten sam problem, na który celuje QSA Qwen — uczynienie uwagi przystępną przy ekstremalnych długościach — co oznacza, że obie rodziny nie konkurują tak bardzo skalą, jak tym, czyj projekt rzadkiej uwagi starzeje się lepiej.

Wyniki opublikowane przez Moonshot w momencie premiery, zgłoszone przez dostawcę i nieodtworzone wówczas:

• Indeks Inteligencji Artificial Analysis — 57, wówczas trzecie miejsce, za Claude Fable 5 i GPT-5.6 Sol. Wartość ta została zarejestrowana w ramach wcześniejszej wersji indeksu; od tego czasu indeks przebudowano dwukrotnie, jest to więc odczyt historyczny, a nie aktualny.

• Frontend Code Arena — pierwsze miejsce z wynikiem 1,679 Elo, przed oboma modelami, które uzyskały lepszy wynik w ogólnym indeksie

• Terminal-Bench 2.1 — 88,3

• SWE-Marathon — 42, przed Opus 4.8 i GPT-5.6 Sol

DeepSearchQA — 0,95, pierwsze miejsce, oraz MATH-Vision 0,98, również pierwsze

• GPQA-Diamond — 0.94

Materiały premierowe samego Moonshot przyznają, że K3 wciąż ustępuje Claude Fable 5 i GPT-5.6 Sol pod względem ogólnych możliwości, co jest zdaniem bardziej użytecznym niż którekolwiek z powyższych twierdzeń o pierwszym miejscu. Ciekawy układ liczb polega na tym, że model trzeci w indeksie ogólnym zajął pierwsze miejsce w kodzie frontendowym i pierwsze w wyszukiwaniu długoterminowym — profil, który mówi, że indeks zbiorczy ukrywa narzędzie specjalistyczne, a nie opisuje narzędzia ogólnego.

A generated scoreboard titled 'Qwen 4 Max vs Kimi K3 - the scoreboard'. Left column 'Qwen 4 Max' reads announced not released, Qwen 4 27B promised, not published, not published, not published, not published. Right column 'Kimi K3' reads GA since July 16 2026, published July 27 2026, Modified MIT, $3.00 per 1M tokens, $15.00 per 1M tokens, 1,048,576 tokens. Footer reads 'Kimi K3 figures from Moonshot's launch material; Qwen 4 Max status per Alibaba's September 22 2026 Yunqi conference.'

Co Alibaba obiecał i ile warta jest obietnica

W ogłoszeniu Qwen 4 wymieniono cztery poziomy. Qwen 4 Max jako flagowy, Qwen 4 Flash do przepustowości, Qwen 4 Plus jako zrównoważony środek, a Qwen 4 27B jako lokalny poziom z otwartymi wagami. Lider Qwen LLM Liu Da Yiheng opisał tę rodzinę jako trenowaną na nowej generacji architekturze i powiedział, że pojawi się wkrótce. Nie ma daty, karty modelu, identyfikatora API, oferty w chmurze, ceny ani opublikowanego wyniku dla żadnego z czterech.

Dwie konkretne rzeczy w tym ogłoszeniu są błędnie relacjonowane i obie mają znaczenie dla każdego, kto próbuje zaplanować coś na ich podstawie:

• Liczba 5–10 bilionów parametrów przypisywana materiałom o Qwen 4 nie jest specyfikacją Qwen 4. Należy ona do planu rozwoju Qwen 4.5 i Qwen 5. Dla Qwen 4 Max nie opublikowano żadnej liczby parametrów.

• Kontynuacja nazw poziomów nie przenosi specyfikacji dalej. Okno kontekstowe, cena i licencja Qwen 4 Max są nieznane; parametry wersji produkcyjnej Qwen3.8-Max — 1 000 000 tokenów po $2.00 i $6.00 za milion — dotyczą innego modelu

Powód, dla którego poziom 27B jest najciekawszy, nie ma nic wspólnego z benchmarkami. To jedyny poziom w linii Qwen 4, który historycznie był wydawany na otwartych wagach, a generacja Qwen 3.8 pokazała, co to odblokowuje: w ciągu kilku dni od pojawienia się wag 27B społeczność przygotowała konwersje MLX, kwantyzacje NVFP4 i dostrojenia wszelkiego rodzaju. Ogłoszony model 27B to zobowiązanie wobec ekosystemu downstream i najbardziej przewidywalna dostawa w roadmapie.

Ale przewidywalność nie została dostarczona. Wagi Kimi K3 to plik, który możesz pobrać już dziś. Wagi Qwen 4 27B to linijka w wystąpieniu konferencyjnym.

Otwarte wagi i wagi możliwe do uruchomienia to różne twierdzenia

Pułapka tkwi w traktowaniu Kimi K3 jako odpowiedzi open-weights i warto powiedzieć to wprost, ponieważ jest to najczęstsza nadinterpretacja w omówieniach chińskich modeli frontier. Mixture-of-experts o 2,8 biliona parametrów to artefakt w skali centrum danych. Opublikowane wagi oznaczają, że masz pozwolenie na jego uruchamianie, możesz go sprawdzić, dostroić i skwantyzować. Nie oznaczają jednak, że możesz uruchomić go na stacji roboczej. Wydajne serwowanie checkpointu tej wielkości wymaga dziesiątek akceleratorów, a prace nad kwantyzacją, które następują po otwartym wydaniu — warianty w stylu NVFP4 i REAP krążące w ciągu tygodni — służą tyle samo uczynieniu modelu możliwym do serwowania, co zmniejszeniu go.

Uczciwa interpretacja licencji Kimi K3 jest więc węższa, a mimo to wciąż znacząca: to poddający się audytowi, modyfikowalny i możliwy do samodzielnego hostowania model czołowy, na zmodyfikowanej licencji MIT, dla organizacji dysponujących sprzętem do jego obsługi. To prawdziwy atut strategiczny i słaby wybór dla każdego, kto odczytał „open weights” jako „działa na moim laptopie”.

To samo zastrzeżenie będzie dotyczyć Qwen 4 27B, jeśli i kiedy zostanie wydany — i ma ono mniejsze znaczenie, ponieważ poziom 27B z otwartymi wagami rzeczywiście ma skalę lokalną, czego nie można powiedzieć o flagowcu 2,8T. Właśnie dlatego poziom Qwen 4 27B zasługuje w tym porównaniu na więcej uwagi niż poziom Max, mimo że to właśnie od poziomu Max zaczęło się ogłoszenie.

A screenshot of the OrcaRouter model page for Kimi K3 (kimi/kimi-k3), captured September 22 2026, showing the model name, the 1M token context, text and image input with text output, vision, tool and reasoning badges, and a p50 time-to-first-token figure.

Pytanie komercyjne leżące pod pytaniem o licencję

Bezpośrednia stawka Kimi K3 — 3,00 USD za wejście i 15,00 USD za wyjście za milion tokenów — to pozycjonowanie premium, a Moonshot wyraźnie zaznaczył, że została ona świadomie wyceniona powyżej najtańszego segmentu chińskiego rynku. W porównaniu z Qwen3.8-Max po 2,00 USD i 6,00 USD oznacza to półtorakrotnie wyższą stawkę za wejście i dwuipółkrotnie wyższą stawkę za wyjście — różnica wystarczająco duża, by obciążenie robocze musiało uwzględniać konkretne mocne strony Kimi K3, w tym kod frontendowy i wyszukiwanie na długim horyzoncie, aby dopłata się opłacała.

OrcaRouter kieruje kimi/kimi-k3 obok rodziny Qwen 3.8 przez jeden punkt końcowy zgodny z OpenAI przy 0% marży, co oznacza, że rozliczany jest cennik katalogowy dostawcy, a nie jego narzucany odpowiednik. W porównaniu, w którym różnica cen na wyjściu wynosi 2,5-krotność, brak marży platformy nie jest szczegółem do zaokrąglenia — dziesięcioprocentowa warstwa na stawce wyjściowej 15,00 USD to 1,50 USD za milion tokenów, czyli więcej niż cały koszt wejściowy tańszego modelu w tym zestawieniu. Ten sam punkt końcowy obsługuje automatyczne przełączanie awaryjne oraz DSL routingu do jawnego wyrażania polityki — dzięki temu możesz przetestować model o profilu Kimi K3 na wycinku ruchu produkcyjnego, nie stawiając całej ścieżki na dostawcy, którego wcześniej nie uruchamiałeś.

To, czego OrcaRouter nie ma w ofercie, to Qwen 4 Max ani żadnego modelu z rodziny Qwen 4, ponieważ żaden z nich nie istnieje jeszcze jako produkt.

A screenshot of the OrcaRouter models catalogue, captured September 22 2026, showing the filter sidebar (input modalities, context length, input price, status, series), the model card grid and a code sample posting to the OpenAI-compatible endpoint at api.orcarouter.ai.

Na co zwracać uwagę, a co ignorować

Trzy sygnały wpłynęłyby na to porównanie, a są one wystarczająco konkretne, by ich wypatrywać:

• Wagi Qwen 4 27B. Nie tabela wyników benchmarków poziomu Max — lecz checkpoint 27B, jego licencja i rozmiar. To właśnie to wydanie powie ci, czy zaangażowanie Alibaby na rzecz otwartych wag w tej generacji jest tak prawdziwe jak w poprzedniej

• Licencja Qwen 4 Max, jeśli w ogóle istnieje. Jeśli Alibaba opublikuje wagi swojego flagowego modelu tak, jak zrobiła to w przypadku Qwen3.8-Max, argument za otwartymi wagami w tym starciu przestaje być przewagą Kimi i staje się remisem

• Świeże, niezależne spojrzenie na Kimi K3. Wyniki premiery Moonshot były raportowane samodzielnie, a indeks Artificial Analysis został od tego czasu dwukrotnie przebudowany, więc zarówno 57, jak i Frontend Code Arena Elo wymagają przeliczenia na nową bazę, zanim zostaną porównane z czymkolwiek aktualnym

To, co należy zignorować, to każda tabela specyfikacji Qwen 4 Max, która pojawi się, zanim Alibaba opublikuje kartę modelu, oraz każde twierdzenie, że otwarte wagi Kimi K3 sprawiają, że da się go uruchomić lokalnie. Oba te błędy już krążą. W międzyczasie porównanie, na którym możesz oprzeć swoje działania, dotyczy dwóch modeli, które istnieją: Kimi K3 za stawkę premium, z dostarczonymi wagami i naprawdę wyróżniającym się profilem do kodowania, oraz Qwen3.8-Max za mniej niż połowę stawki za tokeny wyjściowe, ze stałym oknem miliona tokenów i własnymi wagami. To prawdziwy wybór, wyceniony po obu stronach, i nie wymaga czekania, aż slajd z konferencji stanie się produktem.

Porównane w tym artykule3

Wykryto na podstawie tego artykułu · Benchmarki: Artificial Analysis · aktualizowane codziennie