Qwen 3.8 vs Kimi K3: Dwa chińskie giganty, a teraz jeden jest tańszy
Guides & Insights

Qwen 3.8 vs Kimi K3: Dwa chińskie giganty, a teraz jeden jest tańszy

Autor

Rowan Sterling

Data publikacji

Najnowsze modele · 20Zobacz wszystkie modele
Benchmarki: Artificial Analysis · aktualizowane codziennie
Powrót do wszystkich wpisów

To dwa najbardziej znaczące chińskie modele graniczne 2026 roku, bliscy kuzyni: oba to ogromne, rzadkie systemy Mixture-of-Experts, oba z kontekstem 1M tokenów, oba multimodalne, oba zapowiadające otwarte wagi. Kimi K3 od Moonshot jest właściwie większym z tych dwóch, z 2,8T parametrów łącznie wobec 2,4T Qwena — co jest użytecznym przypomnieniem, że liczba parametrów nie jest rankingiem.

Do 3 sierpnia 2026 r. to porównanie było nierówne w konkretny sposób: Kimi K3 miał audytowany Artificial Analysis Intelligence Index wynoszący 57,1, pierwsze miejsce w rankingu LMArena frontend-code, opublikowane ceny i udostępnione wagi, podczas gdy Qwen3.8-Max miał tylko hasło 2.4T i nic poza tym. GA zdecydowanie zmieniło ekonomikę. Qwen publikuje obecnie $2 / $6 za milion tokenów, podczas gdy Kimi $3 / $15 — co sprawia, że większy, lepiej sprawdzony model jest znacznie droższy.

Uwaga dla deweloperów — najszybszy sposób na rozstrzygnięcie tej kwestii to uruchomienie obu modeli na własnych promptach. OrcaRouter udostępnia ponad 200 modeli za jednym punktem końcowym zgodnym z OpenAI, dzięki czemu możesz zestawić Qwen 3.8 Max z Kimi K3 w tym samym zadaniu bez konfigurowania dwóch SDK.

Werdykt w skrócie.Kimi K3 nadal wygrywa pod względem dowodów: audytowany AA Intelligence Index wynoszący 57.1 (#3), pierwsze miejsce w LMArena frontend-code z wynikiem 1679, oraz otwarte wagi, które są faktycznie gotowe. Qwen3.8-Max pozostaje bez oceny od żadnego niezależnego ewaluatora. Ale GA dała Qwen dwie realne przewagi. Jeśli chodzi o cenę, jest teraz znacznie tańszy — $2 / $6 w porównaniu z $3 / $15, co oznacza 2.5× mniej na wyjściu. A w jedynym istniejącym niezależnym teście bezpośrednim Qwen przegrał w głównej punktacji 80 do 83, będąc wyraźnie lepiej zachowującym się agentem: 354 cytowań w repo do 274, 22 żądania gateway do 53 i zero nieudanych wywołań narzędzi do dwóch. Kimi za audytowaną jakość; Qwen za tańsze, czystsze wykonywanie agentowe.

Najważniejsze wnioski

Kimi K3 to większy model — 2.8T MoE wobec 2.4T Qwena, czyli około 400B więcej — co jest dobrym argumentem przeciwko traktowaniu liczby parametrów jako wskaźnika możliwości.

Qwen3.8-Max jest ogólnie dostępny od 3 sierpnia 2026 w cenie $2 / $6 za 1M przy płaskiej stawce, wobec Kimi K3: $3 / $15 (AA blended ~2,31 USD). Qwen jest teraz 2,5× tańszy na wyjściu.

Kimi K3 posiada audytowaną pozycję: AA Intelligence Index 57,1 (#3), ustępując jedynie Fable 5 i GPT-5.6 Sol, oraz LMArena frontend-code #1 (1679). Qwen3.8-Max jest nadal bez wyniku.

W jedynym bezpośrednim teście (Trilogy AI) Kimi minimalnie pokonał Qwen 83 do 80 w ogólnym rozrachunku — ale Qwen miał więcej cytowań repozytoriów (354 vs 274), mniej żądań do bramki (22 vs 53), i miał zero nieudanych wywołań narzędzi (w porównaniu z dwoma), z oceną użycia narzędzi 9/10 wobec 8/10 Kimiego.

Qwen podaje teraz wyniki agentowe i programistyczne: Terminal-Bench 2.1 86.6, OSWorld-Verified 86.1, FrontierSWE 73.5 (z 40.7 poprzednika) — wszystkie raportowane przez Alibaba.

Termin otwarcia wciąż sprzyja Kimi: jego wagi są w zasadzie gotowe; wagi Qwen są obiecane w ciągu tygodnia, na razie bez licencji ani repozytorium.

Uwaga dotycząca dokładności: wszystkie dane dotyczące jakości Qwen3.8-Max pochodzą od Alibaba i nie zostały zweryfikowane przez strony trzecie. Dane Kimi K3 pochodzą z Artificial Analysis i LMArena. Porównanie bezpośrednie jest pojedynczym testem przeprowadzonym przez Trilogy AI i należy je traktować jako pojedynczy punkt danych, a nie ogólny ranking. Cennik Qwen to karta stawek GA i zastępuje lipcowy rabat promocyjny.

Specyfikacje i cena, obok siebie

Oto twarde dane, każda liczba przypisana do swojego źródła.

• Producent / status — Qwen3.8-Max: Alibaba; GA (3 sierpnia 2026); Kimi K3: Moonshot; wydanie z otwartymi wagami

• Architektura — Qwen3.8-Max: ~2,4T łącznie, rzadki MoE (aktywne parametry wciąż nieujawnione); Kimi K3: 2,8T MoE, natywna obsługa obrazu (Artificial Analysis)

• Okno kontekstowe — Qwen3.8-Max: 1M tokenów (983,616 z myśleniem; maks. wyjście 131,072); Kimi K3: 1M tokenów (Artificial Analysis)

• AA Intelligence Index — Qwen3.8-Max: Nadal bez wyniku; Kimi K3: 57.1 — #3 (Artificial Analysis)

• Arena / ranking — Qwen3.8-Max: nie oceniono publicznie; Kimi K3: Frontend-code #1, 1679 (LMArena)

• Wyniki raportowane przez dostawcę — Qwen3.8-Max: Terminal-Bench 2.1 86.6, GPQA Diamond 92.6, OSWorld-Verified 86.1 (raportowane przez Alibaba); Kimi K3: wynik mierzony przez stronę trzecią

• Cennik (wejście / wyjście) — Qwen3.8-Max: $2.00 / $6.00 za 1M, stała opłata; wejście z cache $0.25; Kimi K3: $3 / $15 za 1M (AA blended ~$2.31), trafienia w cache $0.30

• Otwarte wagi — Qwen3.8-Max: Obiecane w tym tygodniu (brak jeszcze licencji); Kimi K3: Otwarte wagi; wagi gotowe

• Szybkość — Qwen3.8-Max: p50 TTFT 1.64s (7-dniowa telemetria OrcaRouter); Kimi K3: rozwlekły i wolny (~34s TTFT, wg AA)

Dwie rzeczy wyznaczają ramy tego porównania, a jedna z nich całkowicie odwróciła się 3 sierpnia.

Po pierwsze, relacja cen uległa odwróceniu. Przez cały lipiec to Kimi K3 był modelem z realną ceną, a Qwen modelem z kuponem rabatowym. Teraz oba publikują stawki, a lepiej sprawdzony, większy model jest droższy: $3 / $15 wobec $2 / $6. W przypadku wyjścia — gdzie rozumowanie i generowanie kodu wydają pieniądze — Kimi kosztuje 2,5× więcej. Qwen pobiera też stałą stawkę za cały kontekst 1M tokenów, a jej buforowane wejście po $0,25 jest nieco tańsze niż stawka Kimi za trafienie w pamięci podręcznej wynosząca $0,30. W przypadku każdego obciążenia o dużej skali ekonomika Qwen jest teraz wyraźnie lepsza.

Po drugie, luka w dowodzie pozostaje niezmieniona i to dlatego Kimi wciąż wygrywa. Indeks inteligencji Kimi K3 wynoszący 57,1 plasuje go na trzecim miejscu w klasyfikacji generalnej, za Fable 5 i GPT-5.6 Sol — to werdykt neutralnego ewaluatora. Jego wynik #1 w LMArena frontend-code (1679) to efekt crowdsourcingu z wielu ślepych porównań. Terminal-Bench 86,6 i GPQA Diamond 92,6 Qwena to realne liczby, ale pochodzące od samego Alibaba, na platformie, której nikt inny nie uruchamiał. Pomocna kotwica: poprzednik Qwen3.7-Max uzyskał 46 w indeksie AA wobec 57,1 Kimi, więc Qwen potrzebuje dużego skoku pokoleniowego, aby choćby wyrównać.

Warto również odnotować pewien niuans dotyczący opóźnień, ponieważ przeczy on typowej narracji. Artificial Analysis mierzy Kimi K3 na około34 sekundy czasu do pierwszego tokenu — naprawdę wolno. Telemetria GA OrcaRoutera pokazuje Qwen3.8-Max z p50 TTFT na poziomie1,64 sekundy. Te pomiary pochodzą z różnych źródeł i nie są porównaniem kontrolowanym, ale komplikują zakładane w erze zapowiedzi założenie, że to Qwen jest tym wolniejszym z tej pary.

Ten jedyny test bezpośredni, przeczytaj uważnie.

To jedyne zestawienie w tej serii, w którym strona trzecia przetestowała oba modele przeciwko sobie na tym samym zadaniu, dlatego warto przeczytać je uważnie, zamiast sprowadzać do wskazania zwycięzcy.

Trilogy AI przeprowadziło zadanie zrozumienia architektury — zrozumienie prawdziwego repozytorium i wyciągnięcie poprawnego wniosku architektonicznego — i oceniło wyniki:

• Ocena ogólna — Qwen3.8-Max: 80 / 100; Kimi K3: 83 / 100

• Cytowania repo — Qwen3.8-Max: 354; Kimi K3: 274

• Żądania bramy — Qwen3.8-Max: 22; Kimi K3: 53

• Nieudane wywołania narzędzi — Qwen3.8-Max: 0; Kimi K3: 2

• Ocena użycia narzędzi — Qwen3.8-Max: 9 / 10; Kimi K3: 8 / 10

• Współczynnik trafień w cache — Qwen3.8-Max: >90%; Kimi K3: >90%

Kimi wygrał w głównym zestawieniu o trzy punkty. Ale spójrz na kolumny procesowe, bo w inżynierii agentowej liczą się one bardziej niż wynik. Qwen doszedł do tego samego kluczowego wniosku architektonicznego, używając mniej niż połowy żądań bramy jednocześnie generując 29% więcej cytowań ugruntowujących oraz — szczegół, który powinien zainteresować każdego, kto tworzy agentów — zero nieudanych wywołań narzędzi, podczas gdy Kimi miał dwa.

To nieudane wywołania narzędzi faktycznie psują agentów produkcyjnych. Działają kaskadowo: nieprawidłowe wywołanie generuje błąd, który model musi zinterpretować, co pochłania tury, co grozi kolejnymi błędami. Model, który wykonuje 22 poprawne żądania, podczas gdy inny wykonuje 53 z dwoma porażkami, jest tańszy i bardziej przewidywalny w działaniu, nawet jeśli uzyskuje o trzy punkty niższy wynik. W połączeniu z 2,5× tańszym kosztem generowania w Qwen, ekonomika operacyjna takiego uruchomienia wyraźnie faworyzuje Qwen.

Ostrzeżenie jest takie, że to jest jedno zadanie, jeden ewaluator, jeden przebieg. Nie jest to zestaw benchmarków i nie można go uogólniać. Indeks Kimi 57.1 oraz pierwsze miejsce w rankingu frontendu opierają się na znacznie większej liczbie dowodów niż ten pojedynczy test. Właściwy wniosek jest wąski: w co najmniej jednym realistycznym zadaniu agentowym Qwen był bardziej zdyscyplinowanym użytkownikiem narzędzi, jednocześnie nieznacznie tracąc na jakości wyników.

Koszt w praktyce: uruchomienia agentowe na dużą skalę

Weź agenta do analizy repozytorium: 250 000 tokenów kontekstu kodu na przebieg, 12 000 tokenów wyjścia.

Qwen3.8-Max: 0.25M × $2 = $0.50, plus 0.012M × $6 = $0.072. ≈ $0.57 za uruchomienie.

Kimi K3: 0.25M × $3 = $0.75, plus 0.012M × $15 = $0.18. ≈ $0.93 za uruchomienie.

• Przy 1 500 uruchomień na dzień: Qwen ≈ $858/dzień; Kimi ≈ $1 395/dzień — mniej więcej $16 000 różnicy miesięcznie.

• Przy buforowaniu na stabilnym repozytorium: buforowane wejście Qwen po $0.25/1M obniża koszt uruchomienia do ≈ $0.14; stawka trafień bufora Kimi wynosząca $0.30 obniża go do ≈ $0.26.

Luka jest realna na obu końcach, a wynik Trilogy ją potęguje: jeśli Qwen naprawdę zużywa mniej niż połowę żądań bramy do wykonania porównywalnej pracy, efektywna różnica kosztów w zadaniach agentowych jest większa, niż sugerowałby sam cennik.

Oba modele rozliczają tokeny myślenia jako dane wyjściowe, więc konfiguracje wymagające intensywnego rozumowania kosztują więcej niż naiwne oszacowanie po obu stronach — ale stawka Qwena wynosząca 6 dolarów sprawia, że ta kara jest 2,5× mniejsza.

Otwartość: niemal parytet, inny timing

To jest oś, na której te dwa modele są najbardziej do siebie podobne, a różnica dotyczy wyłącznie gotowości. Wagi Kimi K3 są otwarte i w zasadzie gotowe. Wagi Qwen3.8-Max są obiecane w ciągu tygodnia, ale nie ma jeszcze tekstu licencji, karty modelu ani repozytorium — a licencja decyduje o tym, czy w ogóle możesz używać modelu komercyjnie.

W praktyce żaden z tych flagowców nie jest samodzielnie hostowalny przez normalny zespół. Qwen przy 2,4T to mniej więcej 1,2TB w kwantyzacji 4-bitowej, przy około 141GB na H200; Kimi przy 2,8T jest jeszcze większy. Oba wymagają ośmiu lub więcej akceleratorów z najwyższej półki, a nieujawniona przez Alibabę liczba aktywnych parametrów oznacza, że nie można nawet modelować przepustowości Qwena.

Dlatego też ogłoszony jednocześnie Qwen3.8-27B ma tu znaczenie. Również dzięki otwartym wagom i podobno działając w około 17GB VRAM, daje rodzinie Qwen prawdziwą historię on-premise, której nie zapewnia ani flagowiec 2.4T, ani 2.8T. Jeśli otwarte wagi są twoim rzeczywistym powodem wyboru między tymi dwoma, 27B zmienia rachunek bardziej niż którykolwiek z tych gigantów.

FAQ

Czy Qwen 3.8 jest lepszy od Kimi K3?

Nie na podstawie audytowanych dowodów. Kimi K3 ma niezależny wynik AA Intelligence Index wynoszący 57,1 (#3) oraz pierwsze miejsce LMArena w rankingu kodu frontendowego, podczas gdy Qwen3.8-Max nie został oceniony przez żadnego zewnętrznego ewaluatora. W jedynym dostępnym bezpośrednim teście Kimi wygrał 83 do 80. Zaletami Qwen są cena (2,5× tańsze generowanie) oraz, w tym samym teście, czystsze użycie narzędzi.

Który model jest większy?

Kimi K3, z 2,8 T parametrów całkowitych w porównaniu z 2,4 T w Qwen3.8-Max — czyli o około 400 mld więcej. Żaden z nich nie ujawnia jednak wystarczających danych, aby ta różnica miała znaczenie: Alibaba nigdy nie opublikowała liczby aktywnych parametrów Qwena, czyli wartości, która faktycznie decyduje o koszcie serwowania w modelu typu Mixture-of-Experts.

Które jest tańsze?

Qwen3.8-Max, wyraźnie, od czasu GA. Oferuje $2 / $6 za 1M w porównaniu z $3 / $15 Kimi K3 — 33% mniej na wejściu i 2,5× mniej na wyjściu. Stawka Qwen jest płaska dla całego kontekstu 1M, a jej buforowane wejście po $0.25 jest nieco niższe od stawki Kimi za trafienia w pamięci podręcznej wynoszącej $0.30.

Co właściwie wykazał test porównawczy?

Zadanie Trilogy AI dotyczące rozumienia architektury przyniosło Kimi 83 punkty, a Qwen 80. Jednak Qwen wygenerował 354 cytowania repozytoriów wobec 274 Kimi, wykorzystał 22 żądania bramy w porównaniu z 53, zanotował zero nieudanych wywołań narzędzi wobec dwóch i uzyskał 9/10 w użyciu narzędzi wobec 8/10 Kimi. Kimi udzielił lepszej odpowiedzi; Qwen był bardziej zdyscyplinowanym agentem. To jedno zadanie, więc traktuj je jako punkt danych, a nie ranking.

Czy Qwen 3.8 Max opuścił już wersję preview?

Tak, 3 sierpnia 2026 r., z opublikowanym cennikiem i punktem końcowym zgodnym z OpenAI i DashScope. Lipcowa kampania kredytów Qoder nie opisuje już, jak są sprzedawane.

Który jest szybszy?

Prawdopodobnie teraz Qwen, co odwraca założenie z czasów przedpremierowych. Artificial Analysis mierzy czas do pierwszego tokena Kimi K3 na około 34 sekundy; telemetria GA OrcaRouter z 7 dni pokazuje Qwen3.8-Max z p50 TTFT wynoszącym 1,64 sekundy. To różne źródła i nie jest to kontrolowane porównanie, ale oba modele słyną z rozwlekłości, a zmierzony TTFT Kimi jest naprawdę wolny.

Czy mogę samodzielnie hostować którekolwiek z nich?

Realistycznie nie w skali flagowej — modele 2.4T i 2.8T wymagają ośmiu lub więcej GPU klasy H200. Wagi Kimi są gotowe już dziś; wagi Qwen są obiecane w ciągu tygodnia, ale jeszcze bez licencji. Dla prawdziwej opcji lokalnej, ogłoszony równocześnie Qwen3.8-27B (podobno ~17 GB VRAM) jest praktycznym wyborem w rodzinie Qwen.

Konkluzja

Qwen 3.8 vs Kimi K3 to najbardziej wyrównane starcie w tej serii, a ogólna dostępność podzieliła je wyraźnie wzdłuż dwóch osi. Kimi K3 zachowuje koronę jakości dzięki temu, co zmierzył sędzia: 57,1 w Indeksie Inteligencji, trzecie miejsce w klasyfikacji ogólnej i najwyższa pozycja w kodzie frontendowym na LMArena. To nie twierdzenia — to wyniki, a Qwen nie ma niczego równoważnego.

To, co Qwen wygrał 3 sierpnia, to ekonomia, i wygrał ją zdecydowanie: 2 dolary / 6 dolarów wobec 3 dolarów / 15 dolarów, płasko w skali miliona tokenów, z nieco tańszym cachingiem. Dodaj ustalenie Trilogy, że Qwen ukończył porównywalne zadanie agentowe z połową żądań bramy i zerową liczbą nieudanych wywołań narzędzi, a Qwen wygląda na model bardziej wydajny operacyjnie, nawet tam, gdzie jest mniej dokładny. Obserwuj dwa wydarzenia: pierwszy niezależny wynik Intelligence Index dla Qwen3.8-Max oraz udostępnienie wag wraz z licencją. Jeśli Qwen uzyska wynik gdziekolwiek blisko 57,1 Kimi, różnica w cenie sprawia, że bardzo trudno uzasadnić wybór Kimi do pracy na dużą skalę. Do tego czasu Kimi to model, któremu ufasz, a Qwen to ten, na którego stać cię, by uruchamiać — a uczciwy sposób wyboru to własne repozytoria.

Porównane w tym artykule2

Wykryto na podstawie tego artykułu · Benchmarki: Artificial Analysis · aktualizowane codziennie