
GLM-5.2 vs Kimi K3: Tańszy i szybszy, czy większy i lepszy?
- OrcaNOWOŚĆOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 za 1 mln tokenów
- orcaNOWOŚĆOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 za 1 mln tokenów
- deepseekNOWOŚĆDeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligencja
- openaiOpenAI: GPT-6 Astra2026-09-0453Inteligencja77Kod
- googleGoogle: Gemini 3.8 Flash2026-09-0241Inteligencja76Kod
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Inteligencja76Kod
- anthropicAnthropic: Claude Fable 5.12026-09-0153Inteligencja82Kod
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 za 1 mln tokenów
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligencja72Kod
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 za 1 mln tokenów
- z-aiZ.ai: GLM 5.32026-08-1845Inteligencja75Kod
- obsidianQwen3.8 27B2026-08-1534Inteligencja68Kod
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Inteligencja69Kod
- grokSpaceXAI: Grok 4.62026-08-1244Inteligencja77Kod
- metaMeta: Muse Spark 1.22026-08-0540Inteligencja72Kod
- qwenQwen: Qwen3.8 Max2026-08-0345Inteligencja76Kod
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3134Inteligencja69Kod
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 za 1 mln tokenów
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
GLM-5.2 i Kimi K3 pojawiły się w odstępie miesiąca w połowie 2026 roku i niemal idealnie się wzajemnie odwracają. Kimi K3, wydany 2026-07-16, którego otwarte wagi ukazały się 2026-07-27, jest większym i na papierze lepszym modelem: 2,8 biliona parametrów, z czego 104 miliardy aktywne, oraz wyższy wynik w zasadzie w każdym benchmarku, na którym testowano oba modele. GLM-5.2 jest dostępny od 2026-06-16, jest mniejszym z dwóch — 753 miliardy parametrów, z czego 40 miliardów aktywnych — a koszt za token wyjściowy to około jednej trzeciej stawki, mediana czasu odpowiedzi jest krótsza i jest udostępniany na licencji MIT, a nie na specjalnej licencji z progami przychodów.
To jest decyzja w jednym akapicie. To, co następuje, to dowody, które za nią stoją — arytmetyka cen dla zadania, które naprawdę możesz uruchomić, pomiary, w których oba są tak blisko siebie, że różnica jest szumem, oraz jedna popularna liczba, której nie można porównać z liczbą wydrukowaną obok niej.
Gdzie stoją oboje
Oba są ogólnie dostępne poprzez własne API swoich dostawców, oba można routować w OrcaRouter i oba mają wagi do pobrania. Różnice, które mają znaczenie, zanim w ogóle zbliżysz się do benchmarku:
• Wydano — GLM-5.2 2026-06-16 vs Kimi K3 2026-07-16 (strony modeli Artificial Analysis; własna strona modelu Kimi K3 w OrcaRouter datuje go o dzień wcześniej, 2026-07-15)
• Wagi — GLM-5.2: otwarty na licencji MIT vs Kimi K3: otwarty na licencji Kimi K3 License, która wymaga odrębnej umowy przy rocznych przychodach z model-as-a-service powyżej 20 mln USD oraz widocznego oznaczenia autorstwa przy ponad 100 mln użytkowników miesięcznie (wewnętrzne badania i rozwój są zwolnione)
• Rozmiar — GLM-5.2 753 mld łącznie / 40 mld aktywnych vs Kimi K3 2,8 bln łącznie / 104 mld aktywnych
• Kontekst — GLM-5.2 1 000 000 tokenów vs Kimi K3 1 048 576 tokenów
• Wejście — GLM-5.2: tekst na wejściu, tekst na wyjściu vs Kimi K3: tekst i obrazy na wejściu, tekst na wyjściu
• Opublikowana maksymalna liczba tokenów wyjściowych — GLM-5.2 128 000 tokenów w porównaniu z brakiem publikacji na stronie OrcaRouter Kimi K3
W OrcaRouter oba są dostępne za jednym kluczem w jednym punkcie końcowym zgodnym z OpenAI pod adresem https://api.orcarouter.ai/v1, a my przekazujemy cennik dostawcy bezpośrednio, bez doliczania marży — więc każda liczba poniżej to cena dostawcy, a nie nasza.
Ile kosztuje milion tokenów, przy zadaniu, które coś kosztuje
Najpierw cenniki dostawców, odczytane ze stron z cennikami samych dostawców w dniu 23 września 2026 r. Z.ai podaje GLM-5.2 w cenie 1,40 USD za milion tokenów wejściowych, 0,26 USD za milion tokenów wejściowych z pamięci podręcznej i 4,40 USD za milion tokenów wyjściowych. Moonshot podaje Kimi K3 w cenie 3,00 USD za wejście, 0,30 USD za odczyt z pamięci podręcznej, 15,00 USD za wyjście — plus opłatę za zapis do pamięci podręcznej w wysokości 3,00 USD za milion za pięciominutową pamięć podręczną i 6,00 USD za milion za jednogodzinną pamięć podręczną. Są to ceny publikowane, a nie niezależnie audytowane, i każdy z dostawców może je zmienić.
Przydziel im zadanie, które polega głównie na czytaniu: przegląd bazy kodu o rozmiarze 600 000 tokenów z pisemną odpowiedzią o rozmiarze 8 000 tokenów. W przypadku GLM-5.2 to 0,6 × $1,40 = $0,84 za wejście plus 0,008 × $4,40 = $0,035 za wyjście, czyli około $0,88. W przypadku Kimi K3 to 0,6 × $3,00 = $1,80 plus 0,008 × $15,00 = $0,12, czyli około $1,92. Mniej więcej 2,2 razy większy koszt za to samo zadanie.
Teraz uruchom to ponownie, gdy baza kodu znajduje się już w pamięci podręcznej dostawcy. Pozycja kosztu wejścia spada do stawki odczytu z pamięci podręcznej, a dwie ceny, które różniły się 2,1 raza, stają się 0,26 USD wobec 0,30 USD za milion — różnica 15%. To najmniej omawiana liczba w tym porównaniu i ta, która ma największe znaczenie dla agenta ponownie odczytującego ten sam kontekst co turę. Jest tu też gwiazdka: Kimi K3 rozlicza zapis do pamięci podręcznej osobno, a strona GLM-5.2 w ogóle nie informuje o opłacie za zapis, więc zimny start kosztuje na Kimi K3 znacząco więcej, niż sugeruje nagłówkowa stawka 3,00 USD.
• Odczyt 600k tokenów z odpowiedzią 8k — GLM-5.2 około 0,88 USD vs Kimi K3 około 1,92 USD
• Ta sama linia dla buforowanego wejścia — GLM-5.2 $0,16 vs Kimi K3 $0,18 za 600 tys. tokenów

Niezależny model zgadza się co do kierunku, ale nie co do skali. Artificial Analysis łączy tokeny trafień w pamięci podręcznej, tokeny wejściowe i wyjściowe w stosunku 7:2:1 i dodaje tokeny rozumowania, które model faktycznie zużywa, a jego dane dla tych dwóch — odczytane 2026-09-23 w ramach indeksu v4.3.2 — sytuują GLM-5.2 na poziomie 0,902 USD za milion połączonych tokenów wobec 2,31 USD w przypadku Kimi K3, a koszt ukończenia jednego z jego zadań ewaluacyjnych na poziomie 0,96 USD wobec 2,00 USD. Jednorazowe uruchomienie pełnego Intelligence Index kosztuje 1 559 USD na GLM-5.2 i 3 658 USD na Kimi K3.
W tym modelu kosztów kryje się kontrintuicyjny szczegół. Kimi K3 używa mniej tokenów wyjściowych na zadanie niż GLM-5.2 — 48 000 wobec 64 000 — i mniej tokenów rozumowania, 32 000 wobec 51 000. Jest to model bardziej ekonomiczny na jednostkę pracy, a mimo to kosztuje około dwa razy więcej na zadanie, ponieważ jego cena za token wynosi 2,1x na wejściu i 3,4x na wyjściu. Tanie na zadanie i tanie za token to różne właściwości, a to jest zestawienie, w którym wskazują one w przeciwnych kierunkach.
Okno kontekstu i to, co tak naprawdę się w nim mieści
Na papierze oba mieszczą się w granicach 5% od siebie: 1 000 000 tokenów wobec 1 048 576. Raportowanie tego jako zwycięstwa Kimi K3 byłoby niedorzeczne. Oba to modele o milionie tokenów, a okno nie jest czynnikiem różnicującym; uczciwe pytanie brzmi, co każde z nich wciąż potrafi zrobić z tekstem zakopanym w jego środku.
To właśnie mierzy ocena rozumowania w długim kontekście Artificial Analysis i jest to jedna z większych luk w zestawie danych: Kimi K3 uzyskuje 89% wobec 78% GLM-5.2. Jeśli twoim zadaniem jest wczytanie dużego korpusu i zadawanie pytań wymagających łączenia faktów z jego przeciwległych końców, dodatkowe 48 576 tokenów nie jest powodem, by wybrać Kimi K3 — jest nim jedenastopunktowa przewaga w długim kontekście.
Dolna granica pod oknem również się różni. GLM-5.2 podaje maksymalną wielkość wyjścia na poziomie 128 000 tokenów; strona Kimi K3 nie podaje równoważnej wartości, więc nie zamierzamy jej podawać. Jeśli generujesz długie dokumenty, a nie je czytasz, ta asymetria jest warta sprawdzenia względem własnego obciążenia, zanim kupisz którykolwiek z nich.
Szybkość: jedyna os, w której GLM-5.2 jest bezkonkurencyjny
Dwa niezależne pomiary wskazują tutaj ten sam kierunek, co warto powiedzieć właśnie dlatego, że nie zgadzają się co do wszystkiego.
Nasze własne dane routingowe z siedmiu dni poprzedzających 2026-09-23 pokazują, że GLM-5.2 osiąga medianę 3,28 sekundy do pierwszego tokenu w porównaniu z 8,09 sekundy w przypadku Kimi K3, oraz strumieniuje z szybkością 68,1 tokena na sekundę w porównaniu z 43,4. P95 czasu do pierwszego tokenu w przypadku obu modeli wynosi dokładnie 10,00 sekundy. Artificial Analysis, mierząc osobno, podaje dla GLM-5.2 68,2 tokena wyjściowego na sekundę w porównaniu z 36,7 w przypadku Kimi K3, przy 41,29 sekundy end-to-end w porównaniu z 72,13 oraz przy 33,95 sekundy do pierwszej odpowiedzi w porównaniu z 58,52.

Dwa źródła różnią się w jednym punkcie i warto to zaznaczyć, a nie wygładzać. Artificial Analysis stawia Kimi K3 nieco wyżej pod względem surowego czasu do pierwszego tokenu — 4,08 sekundy wobec 4,62 — podczas gdy w naszym własnym routingu GLM-5.2 jest przy p50 prawie dwa i pół razy szybszy. Różne punkty końcowe, różni dostawcy upstream, różne okna czasowe. Kierunek dotyczący przepustowości — GLM-5.2 zdecydowanie szybszy — uznaj za wiarygodny, a każdą pojedynczą wartość czasu do pierwszego tokenu, naszą lub ich, traktuj jako właściwość konkretnego tygodnia.
Na naszej stronie GLM-5.2 znajduje się też liczba, której nie zamierzamy po cichu pomijać: w ciągu tych samych siedmiu dni wskazuje ona 9,2% wskaźnika błędów w porównaniu z 0,26% dla Kimi K3. Luka tej wielkości jest równie prawdopodobnie skutkiem złego tygodnia u dostawców upstream obsługujących GLM-5.2, jak właściwością modelu, a siedem dni to zbyt krótkie okno, by stwierdzić różnicę. To właśnie taki problem ma rozwiązywać routing — gdy dostawca zawodzi przy jednym żądaniu na jedenaście, automatyczne przełączanie awaryjne przenosi ruch, bez konieczności wywoływania kogokolwiek z dyżuru.

Benchmarki: prawdziwy sweep, węższy niż nagłówek
Kimi K3 wygrywa niemal wszystko, na czym testowano oba modele. To dane liczbowe Artificial Analysis w ramach rewizji indeksu v4.3.2, oba modele w konfiguracji maksymalnego rozumowania, odczytane 2026-09-23:
• Indeks Inteligencji — Kimi K3 44 vs GLM-5.2 34
• AA-Briefcase v1.1 — 1510 vs 1233
• GDPval-AA v2.1 — 1524 vs 1358
• AutomationBench-AA — 58% vs 28%
• Terminal-Bench 4.0 — 13% vs 1%
• SciCode — 59% kontra 51%
• Humanity's Last Exam — 47% vs 41%
• GDP.pdf — 22% vs 10%
• AA-LCR v1.1 — 89% vs 78%
• CritPt — 23% kontra 21%
Dwa zastrzeżenia, zanim ktokolwiek zrobi zrzut ekranu tej listy.
Po pierwsze, rewizja indeksu. Lipcowe materiały o premierze Kimi K3 podawały dla niego 57 w Intelligence Index, a dla GLM-5.2 – 51. Dzisiejsze aktywne strony podają 44 i 34. To nie są te same pomiary — Artificial Analysis rewiduje indeks i ponownie ocenia modele według niego, a zestawianie lipcowej liczby z wrześniową to najłatwiejszy błąd, jaki można popełnić przy tym zestawieniu. Kierunek pozostaje stabilny w każdej migawce; liczby bezwzględne nie są porównywalne między rewizjami.
Po drugie, poziomy. Terminal-Bench 4.0 na poziomie 13% i 1% to trudna ocena, a na tym pułapie stosunek mówi więcej niż każda z tych liczb z osobna. AA-Omniscience, który bada, czy model zna granice własnej wiedzy, daje GLM-5.2 wynik 4 w zestawieniu z 20 Kimi K3 — dolna granica, o której warto wiedzieć, jeśli planujesz uruchamiać którykolwiek z nich bez nadzoru.
Jeszcze jedna rzecz, którą Artificial Analysis odnotowuje w pozycji GLM-5.2: oznacza konfigurację maksymalnego rozumowania jako przestarzałą na rzecz nowszego GLM-5.3. Nie zmienia to żadnych powyższych liczb, które są migawką GLM-5.2 takiego, jakiego zmierzono, ale oznacza, że plan rozwoju Z.ai wyszedł już poza ten model. W przypadku routowanego endpointu kosztuje to zmianę ciągu modelu, a nie migrację, co jest głównym argumentem przeciw zakodowywaniu na sztywno którejkolwiek z tych nazw w aplikacji.
Agenci i korzystanie z narzędzi: gdzie luka jest największa
Jeśli o zakupie miałby decydować jeden blok tej tabeli, to właśnie ten. To w długoterminowej pracy agentowej przewaga Kimi K3 jest największa i najbardziej stabilna:
• AutomationBench-AA — 58% vs 28%, różnica 30 punktów
• GDPval-AA v2.1 — 1524 vs 1358
• AA-Briefcase v1.1 — 1510 vs 1233
• Terminal-Bench 4.0 — 13% vs 1%
Materiały publikacyjne samego Moonshot opierają się na tej samej historii — premiera wag K3 została opublikowana wraz z raportem technicznym omawiającym stos treningowy expert-parallel dostawcy oraz środowisko testowe dla agentów — ale materiały dostawcy to materiały dostawcy, a powyższe liczby są niezależne.
Zewnętrzny agregator LLM Stats, który tworzy własny kompozyt na wspólnym zestawie benchmarków, dochodzi do tego samego wniosku z innego kierunku: spośród jedenastu benchmarków, które ocenia dla obu modeli, Kimi K3 wygrywa wszystkie jedenaście, a jego wyniki w kategoriach stawiają Kimi K3 wyżej w zakresie użycia narzędzi (30,8 vs 19,6), agentów (38,3 vs 29,6) i kodowania (42,3 vs 34,8). To własne kompozyty LLM Stats oparte na jego własnych wagach, na wspólnym zestawie, który nie jest duży, więc traktuj je jako potwierdzenie, a nie jako wynik laboratoryjny. Jedenaście z jedenastu wciąż nie jest bliskim wynikiem.
Programowanie
Ten sam kierunek, mniejszy margines. W ocenach kodowania Artificial Analysis dla obu modeli Kimi K3 prowadzi w SciCode 59% do 51%; w zestawie współdzielonym LLM Stats zdobywa DeepSWE, DeepSWE 1.1, FrontierSWE, SWE-Marathon, Program Bench i Terminal-Bench 2.1. Pochlebne liczby GLM-5.2 — 99,2% w AIME 2026, 94,4% w HMMT 2025, 91,2% w GPQA według zewnętrznych agregatorów — są raportowane przez dostawcę i niereprodukowane, a większość z nich mierzy matematykę konkursową, a nie inżynierię oprogramowania.
Praktyczny wniosek: w przypadku agenta kodującego, który działa długo, edytuje wiele plików i musi podnosić się po własnych błędach, przewaga Kimi K3 w zadaniach agentowych jest bardziej istotnym sygnałem niż wyniki matematyczne któregokolwiek z tych modeli. W przypadku szybkiego, taniego asystenta kodu działającego w dużej mierze w trybie jednokrotnym przewaga GLM-5.2 w przepustowości jest warta więcej niż koszty luki w benchmarkach.
Tam, gdzie są wystarczająco blisko, że nie ma to znaczenia
• Cena wejścia z pamięci podręcznej — 0,26 USD vs 0,30 USD za milion, 15% różnicy wobec 3,4-krotnej różnicy na wyjściu
• Okno kontekstu — 1,000,000 vs 1,048,576 tokenów
• p95 czasu do pierwszego tokenu — 10,00 s w porównaniu z 10,00 s w naszym własnym routingu
• CritPt — 23% kontra 21%
• Matematyka — LLM Stats stawia GLM-5.2 nieznacznie wyżej w swoim zbiorczym wskaźniku matematycznym (41,4 vs 40,9), podczas gdy Kimi K3 prowadzi w matematyce z obrazami; na podstawie dostępnych dowodów żaden z modeli nie dominuje w arytmetyce
Każdy, kto mówi ci, że jeden z tych modeli jest pod każdym względem dwukrotnie lepszy od drugiego, czyta tylko jeden wiersz tabeli.
Wybierz GLM-5.2, jeśli…
Płacisz rachunek, a rachunek jest ograniczeniem. GLM-5.2 kosztuje około jednej trzeciej ceny za tokeny wyjściowe, jest też tańszy w przypadku pamięci podręcznej, ma licencję MIT bez progu przychodowego, którego trzeba by pilnować, jest szybszy przy medianie i znacznie szybszy podczas strumieniowania, a jego okno miliona tokenów jest wystarczająco bliskie oknu Kimi K3, że ta różnica nigdy niczego nie rozstrzygnie. Jeśli twoje obciążenie to tekst na wejściu i tekst na wyjściu, i w większości chodzi o czytanie, a nie długie łańcuchy wywołań narzędzi, dodatkowe punkty benchmarkowe Kimi K3 to punkty, których twoja aplikacja nigdy nie zbierze.
Wybierz Kimi K3, jeśli…
Praca ma charakter agentowy i jest długa. 30-punktowa różnica w AutomationBench, prowadzenie w GDPval i AA-Briefcase, jedenastopunktowa przewaga w rozumowaniu długiego kontekstu oraz kompletne zwycięstwo w udostępnionym zestawie LLM Stats – wszystko wskazuje w tym samym kierunku: Kimi K3 jest lepszym modelem, któremu można powierzyć wieloetapowe zadanie i odejść. Jest także jedynym z dwóch, który przyjmuje obrazy. Zapłacisz za to około dwa razy więcej na zadanie, a jeśli twój zbiór roboczy jest w znacznym stopniu buforowany, zapłacisz mniej niż dwa razy — ale argument za nim to nie cena i nie szybkość.
Oba można kierować w OrcaRouter przy użyciu jednego klucza do jednego punktu końcowego zgodnego z OpenAI, w cenach katalogowych dostawców, bez żadnych dodatkowych opłat, a oba są objęte tym samym automatycznym przełączaniem awaryjnym. To najtańszy sposób, aby przekonać się, którego z nich naprawdę potrzebuje Twoje obciążenie, ponieważ przełączanie między nimi to zmiana ciągu modelu, a nie umowa.
Porównane w tym artykule2
Wykryto na podstawie tego artykułu · Benchmarki: Artificial Analysis · aktualizowane codziennie
