Karta tytułowa hero dla porównania GLM-5.2 vs Kimi K3 z podtytułem „Taniej i szybciej albo większy i lepszy”, trzy zaokrąglone plakietki w kształcie pigułki z napisami „po 1 mln tokenów kontekstu”, „AA Index 34 vs 44” i „1,40 USD / 4,40 USD vs 3,00 USD / 15,00 USD”, wiersz stopki o treści „Cenniki dostawców i Artificial Analysis, 2026-09-23” oraz logo OrcaRouter w prawym dolnym narożniku.
Guides & Insights

GLM-5.2 vs Kimi K3: Tańszy i szybszy, czy większy i lepszy?

Autor

Alistair Wren

Data publikacji

Najnowsze modele · 20Zobacz wszystkie modele
Benchmarki: Artificial Analysis · aktualizowane codziennie
Powrót do wszystkich wpisów

GLM-5.2 i Kimi K3 pojawiły się w odstępie miesiąca w połowie 2026 roku i niemal idealnie się wzajemnie odwracają. Kimi K3, wydany 2026-07-16, którego otwarte wagi ukazały się 2026-07-27, jest większym i na papierze lepszym modelem: 2,8 biliona parametrów, z czego 104 miliardy aktywne, oraz wyższy wynik w zasadzie w każdym benchmarku, na którym testowano oba modele. GLM-5.2 jest dostępny od 2026-06-16, jest mniejszym z dwóch — 753 miliardy parametrów, z czego 40 miliardów aktywnych — a koszt za token wyjściowy to około jednej trzeciej stawki, mediana czasu odpowiedzi jest krótsza i jest udostępniany na licencji MIT, a nie na specjalnej licencji z progami przychodów.

To jest decyzja w jednym akapicie. To, co następuje, to dowody, które za nią stoją — arytmetyka cen dla zadania, które naprawdę możesz uruchomić, pomiary, w których oba są tak blisko siebie, że różnica jest szumem, oraz jedna popularna liczba, której nie można porównać z liczbą wydrukowaną obok niej.

Gdzie stoją oboje

Oba są ogólnie dostępne poprzez własne API swoich dostawców, oba można routować w OrcaRouter i oba mają wagi do pobrania. Różnice, które mają znaczenie, zanim w ogóle zbliżysz się do benchmarku:

• Wydano — GLM-5.2 2026-06-16 vs Kimi K3 2026-07-16 (strony modeli Artificial Analysis; własna strona modelu Kimi K3 w OrcaRouter datuje go o dzień wcześniej, 2026-07-15)

• Wagi — GLM-5.2: otwarty na licencji MIT vs Kimi K3: otwarty na licencji Kimi K3 License, która wymaga odrębnej umowy przy rocznych przychodach z model-as-a-service powyżej 20 mln USD oraz widocznego oznaczenia autorstwa przy ponad 100 mln użytkowników miesięcznie (wewnętrzne badania i rozwój są zwolnione)

• Rozmiar — GLM-5.2 753 mld łącznie / 40 mld aktywnych vs Kimi K3 2,8 bln łącznie / 104 mld aktywnych

• Kontekst — GLM-5.2 1 000 000 tokenów vs Kimi K3 1 048 576 tokenów

• Wejście — GLM-5.2: tekst na wejściu, tekst na wyjściu vs Kimi K3: tekst i obrazy na wejściu, tekst na wyjściu

• Opublikowana maksymalna liczba tokenów wyjściowych — GLM-5.2 128 000 tokenów w porównaniu z brakiem publikacji na stronie OrcaRouter Kimi K3

W OrcaRouter oba są dostępne za jednym kluczem w jednym punkcie końcowym zgodnym z OpenAI pod adresem https://api.orcarouter.ai/v1, a my przekazujemy cennik dostawcy bezpośrednio, bez doliczania marży — więc każda liczba poniżej to cena dostawcy, a nie nasza.

Ile kosztuje milion tokenów, przy zadaniu, które coś kosztuje

Najpierw cenniki dostawców, odczytane ze stron z cennikami samych dostawców w dniu 23 września 2026 r. Z.ai podaje GLM-5.2 w cenie 1,40 USD za milion tokenów wejściowych, 0,26 USD za milion tokenów wejściowych z pamięci podręcznej i 4,40 USD za milion tokenów wyjściowych. Moonshot podaje Kimi K3 w cenie 3,00 USD za wejście, 0,30 USD za odczyt z pamięci podręcznej, 15,00 USD za wyjście — plus opłatę za zapis do pamięci podręcznej w wysokości 3,00 USD za milion za pięciominutową pamięć podręczną i 6,00 USD za milion za jednogodzinną pamięć podręczną. Są to ceny publikowane, a nie niezależnie audytowane, i każdy z dostawców może je zmienić.

Przydziel im zadanie, które polega głównie na czytaniu: przegląd bazy kodu o rozmiarze 600 000 tokenów z pisemną odpowiedzią o rozmiarze 8 000 tokenów. W przypadku GLM-5.2 to 0,6 × $1,40 = $0,84 za wejście plus 0,008 × $4,40 = $0,035 za wyjście, czyli około $0,88. W przypadku Kimi K3 to 0,6 × $3,00 = $1,80 plus 0,008 × $15,00 = $0,12, czyli około $1,92. Mniej więcej 2,2 razy większy koszt za to samo zadanie.

Teraz uruchom to ponownie, gdy baza kodu znajduje się już w pamięci podręcznej dostawcy. Pozycja kosztu wejścia spada do stawki odczytu z pamięci podręcznej, a dwie ceny, które różniły się 2,1 raza, stają się 0,26 USD wobec 0,30 USD za milion — różnica 15%. To najmniej omawiana liczba w tym porównaniu i ta, która ma największe znaczenie dla agenta ponownie odczytującego ten sam kontekst co turę. Jest tu też gwiazdka: Kimi K3 rozlicza zapis do pamięci podręcznej osobno, a strona GLM-5.2 w ogóle nie informuje o opłacie za zapis, więc zimny start kosztuje na Kimi K3 znacząco więcej, niż sugeruje nagłówkowa stawka 3,00 USD.

• Odczyt 600k tokenów z odpowiedzią 8k — GLM-5.2 około 0,88 USD vs Kimi K3 około 1,92 USD

• Ta sama linia dla buforowanego wejścia — GLM-5.2 $0,16 vs Kimi K3 $0,18 za 600 tys. tokenów

A self-built two-column scoreboard for GLM-5.2 vs Kimi K3. Left column 'GLM-5.2' (753B total / 40B active, MIT, $1.40 / $4.40): Intelligence Index 34, blended price per million $0.902, cost per task $0.96, output speed 68.2 tok/s, long context AA-LCR 78%, agentic AutomationBench 28%. Right column 'Kimi K3' (2.8T total / 104B active, Kimi K3 License, $3.00 / $15.00): Intelligence Index 44, blended price per million $2.31, cost per task $2.00, output speed 36.7 tok/s, long context AA-LCR 89%, agentic AutomationBench 58%. Footer reads 'Benchmark, speed and cost figures per Artificial Analysis (Intelligence Index v4.3.2, read 2026-09-23), both models in their maximum-reasoning configuration. Vendor list prices per Z.ai and Moonshot. OrcaRouter passes provider list price through at 0% markup.'

Niezależny model zgadza się co do kierunku, ale nie co do skali. Artificial Analysis łączy tokeny trafień w pamięci podręcznej, tokeny wejściowe i wyjściowe w stosunku 7:2:1 i dodaje tokeny rozumowania, które model faktycznie zużywa, a jego dane dla tych dwóch — odczytane 2026-09-23 w ramach indeksu v4.3.2 — sytuują GLM-5.2 na poziomie 0,902 USD za milion połączonych tokenów wobec 2,31 USD w przypadku Kimi K3, a koszt ukończenia jednego z jego zadań ewaluacyjnych na poziomie 0,96 USD wobec 2,00 USD. Jednorazowe uruchomienie pełnego Intelligence Index kosztuje 1 559 USD na GLM-5.2 i 3 658 USD na Kimi K3.

W tym modelu kosztów kryje się kontrintuicyjny szczegół. Kimi K3 używa mniej tokenów wyjściowych na zadanie niż GLM-5.2 — 48 000 wobec 64 000 — i mniej tokenów rozumowania, 32 000 wobec 51 000. Jest to model bardziej ekonomiczny na jednostkę pracy, a mimo to kosztuje około dwa razy więcej na zadanie, ponieważ jego cena za token wynosi 2,1x na wejściu i 3,4x na wyjściu. Tanie na zadanie i tanie za token to różne właściwości, a to jest zestawienie, w którym wskazują one w przeciwnych kierunkach.

Okno kontekstu i to, co tak naprawdę się w nim mieści

Na papierze oba mieszczą się w granicach 5% od siebie: 1 000 000 tokenów wobec 1 048 576. Raportowanie tego jako zwycięstwa Kimi K3 byłoby niedorzeczne. Oba to modele o milionie tokenów, a okno nie jest czynnikiem różnicującym; uczciwe pytanie brzmi, co każde z nich wciąż potrafi zrobić z tekstem zakopanym w jego środku.

To właśnie mierzy ocena rozumowania w długim kontekście Artificial Analysis i jest to jedna z większych luk w zestawie danych: Kimi K3 uzyskuje 89% wobec 78% GLM-5.2. Jeśli twoim zadaniem jest wczytanie dużego korpusu i zadawanie pytań wymagających łączenia faktów z jego przeciwległych końców, dodatkowe 48 576 tokenów nie jest powodem, by wybrać Kimi K3 — jest nim jedenastopunktowa przewaga w długim kontekście.

Dolna granica pod oknem również się różni. GLM-5.2 podaje maksymalną wielkość wyjścia na poziomie 128 000 tokenów; strona Kimi K3 nie podaje równoważnej wartości, więc nie zamierzamy jej podawać. Jeśli generujesz długie dokumenty, a nie je czytasz, ta asymetria jest warta sprawdzenia względem własnego obciążenia, zanim kupisz którykolwiek z nich.

Szybkość: jedyna os, w której GLM-5.2 jest bezkonkurencyjny

Dwa niezależne pomiary wskazują tutaj ten sam kierunek, co warto powiedzieć właśnie dlatego, że nie zgadzają się co do wszystkiego.

Nasze własne dane routingowe z siedmiu dni poprzedzających 2026-09-23 pokazują, że GLM-5.2 osiąga medianę 3,28 sekundy do pierwszego tokenu w porównaniu z 8,09 sekundy w przypadku Kimi K3, oraz strumieniuje z szybkością 68,1 tokena na sekundę w porównaniu z 43,4. P95 czasu do pierwszego tokenu w przypadku obu modeli wynosi dokładnie 10,00 sekundy. Artificial Analysis, mierząc osobno, podaje dla GLM-5.2 68,2 tokena wyjściowego na sekundę w porównaniu z 36,7 w przypadku Kimi K3, przy 41,29 sekundy end-to-end w porównaniu z 72,13 oraz przy 33,95 sekundy do pierwszej odpowiedzi w porównaniu z 58,52.

A screenshot of the OrcaRouter model page for GLM 5.2 (z-ai/glm-5.2) captured 2026-09-23, showing the FEATURED badge, the byline 'by Z.ai · 2026-06-16', a 1M-token context with 128K maximum output and text in / text out, rate cards of $1.40 input and $4.40 output per 1M tokens with a $0.260 cache read, a p50 time to first token of 3.28 s against a p95 of 10.00 s, 29.4M tokens of traffic in the last 7 days, and a PERFORMANCE panel showing an output speed of 68.1 tokens per second and a 9.2% error rate.

Dwa źródła różnią się w jednym punkcie i warto to zaznaczyć, a nie wygładzać. Artificial Analysis stawia Kimi K3 nieco wyżej pod względem surowego czasu do pierwszego tokenu — 4,08 sekundy wobec 4,62 — podczas gdy w naszym własnym routingu GLM-5.2 jest przy p50 prawie dwa i pół razy szybszy. Różne punkty końcowe, różni dostawcy upstream, różne okna czasowe. Kierunek dotyczący przepustowości — GLM-5.2 zdecydowanie szybszy — uznaj za wiarygodny, a każdą pojedynczą wartość czasu do pierwszego tokenu, naszą lub ich, traktuj jako właściwość konkretnego tygodnia.

Na naszej stronie GLM-5.2 znajduje się też liczba, której nie zamierzamy po cichu pomijać: w ciągu tych samych siedmiu dni wskazuje ona 9,2% wskaźnika błędów w porównaniu z 0,26% dla Kimi K3. Luka tej wielkości jest równie prawdopodobnie skutkiem złego tygodnia u dostawców upstream obsługujących GLM-5.2, jak właściwością modelu, a siedem dni to zbyt krótkie okno, by stwierdzić różnicę. To właśnie taki problem ma rozwiązywać routing — gdy dostawca zawodzi przy jednym żądaniu na jedenaście, automatyczne przełączanie awaryjne przenosi ruch, bez konieczności wywoływania kogokolwiek z dyżuru.

A screenshot of the OrcaRouter model page for Kimi K3 (kimi/kimi-k3) captured 2026-09-23, showing the FEATURED badge, the byline 'by MoonshotAI · 2026-07-15', text-and-image input with text output, a 1,048,576-token context, rate cards of $3.00 input and $15.00 output per 1M tokens with a $0.300 cache read, a p50 time to first token of 8.09 s against a p95 of 10.00 s, 1116.2M tokens of traffic in the last 7 days, and a PERFORMANCE panel showing an output speed of 43.4 tokens per second and a 0.26% error rate.

Benchmarki: prawdziwy sweep, węższy niż nagłówek

Kimi K3 wygrywa niemal wszystko, na czym testowano oba modele. To dane liczbowe Artificial Analysis w ramach rewizji indeksu v4.3.2, oba modele w konfiguracji maksymalnego rozumowania, odczytane 2026-09-23:

• Indeks Inteligencji — Kimi K3 44 vs GLM-5.2 34

• AA-Briefcase v1.1 — 1510 vs 1233

• GDPval-AA v2.1 — 1524 vs 1358

• AutomationBench-AA — 58% vs 28%

• Terminal-Bench 4.0 — 13% vs 1%

• SciCode — 59% kontra 51%

• Humanity's Last Exam — 47% vs 41%

• GDP.pdf — 22% vs 10%

• AA-LCR v1.1 — 89% vs 78%

• CritPt — 23% kontra 21%

Dwa zastrzeżenia, zanim ktokolwiek zrobi zrzut ekranu tej listy.

Po pierwsze, rewizja indeksu. Lipcowe materiały o premierze Kimi K3 podawały dla niego 57 w Intelligence Index, a dla GLM-5.2 – 51. Dzisiejsze aktywne strony podają 44 i 34. To nie są te same pomiary — Artificial Analysis rewiduje indeks i ponownie ocenia modele według niego, a zestawianie lipcowej liczby z wrześniową to najłatwiejszy błąd, jaki można popełnić przy tym zestawieniu. Kierunek pozostaje stabilny w każdej migawce; liczby bezwzględne nie są porównywalne między rewizjami.

Po drugie, poziomy. Terminal-Bench 4.0 na poziomie 13% i 1% to trudna ocena, a na tym pułapie stosunek mówi więcej niż każda z tych liczb z osobna. AA-Omniscience, który bada, czy model zna granice własnej wiedzy, daje GLM-5.2 wynik 4 w zestawieniu z 20 Kimi K3 — dolna granica, o której warto wiedzieć, jeśli planujesz uruchamiać którykolwiek z nich bez nadzoru.

Jeszcze jedna rzecz, którą Artificial Analysis odnotowuje w pozycji GLM-5.2: oznacza konfigurację maksymalnego rozumowania jako przestarzałą na rzecz nowszego GLM-5.3. Nie zmienia to żadnych powyższych liczb, które są migawką GLM-5.2 takiego, jakiego zmierzono, ale oznacza, że plan rozwoju Z.ai wyszedł już poza ten model. W przypadku routowanego endpointu kosztuje to zmianę ciągu modelu, a nie migrację, co jest głównym argumentem przeciw zakodowywaniu na sztywno którejkolwiek z tych nazw w aplikacji.

Agenci i korzystanie z narzędzi: gdzie luka jest największa

Jeśli o zakupie miałby decydować jeden blok tej tabeli, to właśnie ten. To w długoterminowej pracy agentowej przewaga Kimi K3 jest największa i najbardziej stabilna:

• AutomationBench-AA — 58% vs 28%, różnica 30 punktów

• GDPval-AA v2.1 — 1524 vs 1358

• AA-Briefcase v1.1 — 1510 vs 1233

• Terminal-Bench 4.0 — 13% vs 1%

Materiały publikacyjne samego Moonshot opierają się na tej samej historii — premiera wag K3 została opublikowana wraz z raportem technicznym omawiającym stos treningowy expert-parallel dostawcy oraz środowisko testowe dla agentów — ale materiały dostawcy to materiały dostawcy, a powyższe liczby są niezależne.

Zewnętrzny agregator LLM Stats, który tworzy własny kompozyt na wspólnym zestawie benchmarków, dochodzi do tego samego wniosku z innego kierunku: spośród jedenastu benchmarków, które ocenia dla obu modeli, Kimi K3 wygrywa wszystkie jedenaście, a jego wyniki w kategoriach stawiają Kimi K3 wyżej w zakresie użycia narzędzi (30,8 vs 19,6), agentów (38,3 vs 29,6) i kodowania (42,3 vs 34,8). To własne kompozyty LLM Stats oparte na jego własnych wagach, na wspólnym zestawie, który nie jest duży, więc traktuj je jako potwierdzenie, a nie jako wynik laboratoryjny. Jedenaście z jedenastu wciąż nie jest bliskim wynikiem.

Programowanie

Ten sam kierunek, mniejszy margines. W ocenach kodowania Artificial Analysis dla obu modeli Kimi K3 prowadzi w SciCode 59% do 51%; w zestawie współdzielonym LLM Stats zdobywa DeepSWE, DeepSWE 1.1, FrontierSWE, SWE-Marathon, Program Bench i Terminal-Bench 2.1. Pochlebne liczby GLM-5.2 — 99,2% w AIME 2026, 94,4% w HMMT 2025, 91,2% w GPQA według zewnętrznych agregatorów — są raportowane przez dostawcę i niereprodukowane, a większość z nich mierzy matematykę konkursową, a nie inżynierię oprogramowania.

Praktyczny wniosek: w przypadku agenta kodującego, który działa długo, edytuje wiele plików i musi podnosić się po własnych błędach, przewaga Kimi K3 w zadaniach agentowych jest bardziej istotnym sygnałem niż wyniki matematyczne któregokolwiek z tych modeli. W przypadku szybkiego, taniego asystenta kodu działającego w dużej mierze w trybie jednokrotnym przewaga GLM-5.2 w przepustowości jest warta więcej niż koszty luki w benchmarkach.

Tam, gdzie są wystarczająco blisko, że nie ma to znaczenia

• Cena wejścia z pamięci podręcznej — 0,26 USD vs 0,30 USD za milion, 15% różnicy wobec 3,4-krotnej różnicy na wyjściu

• Okno kontekstu — 1,000,000 vs 1,048,576 tokenów

• p95 czasu do pierwszego tokenu — 10,00 s w porównaniu z 10,00 s w naszym własnym routingu

• CritPt — 23% kontra 21%

• Matematyka — LLM Stats stawia GLM-5.2 nieznacznie wyżej w swoim zbiorczym wskaźniku matematycznym (41,4 vs 40,9), podczas gdy Kimi K3 prowadzi w matematyce z obrazami; na podstawie dostępnych dowodów żaden z modeli nie dominuje w arytmetyce

Każdy, kto mówi ci, że jeden z tych modeli jest pod każdym względem dwukrotnie lepszy od drugiego, czyta tylko jeden wiersz tabeli.

Wybierz GLM-5.2, jeśli…

Płacisz rachunek, a rachunek jest ograniczeniem. GLM-5.2 kosztuje około jednej trzeciej ceny za tokeny wyjściowe, jest też tańszy w przypadku pamięci podręcznej, ma licencję MIT bez progu przychodowego, którego trzeba by pilnować, jest szybszy przy medianie i znacznie szybszy podczas strumieniowania, a jego okno miliona tokenów jest wystarczająco bliskie oknu Kimi K3, że ta różnica nigdy niczego nie rozstrzygnie. Jeśli twoje obciążenie to tekst na wejściu i tekst na wyjściu, i w większości chodzi o czytanie, a nie długie łańcuchy wywołań narzędzi, dodatkowe punkty benchmarkowe Kimi K3 to punkty, których twoja aplikacja nigdy nie zbierze.

Wybierz Kimi K3, jeśli…

Praca ma charakter agentowy i jest długa. 30-punktowa różnica w AutomationBench, prowadzenie w GDPval i AA-Briefcase, jedenastopunktowa przewaga w rozumowaniu długiego kontekstu oraz kompletne zwycięstwo w udostępnionym zestawie LLM Stats – wszystko wskazuje w tym samym kierunku: Kimi K3 jest lepszym modelem, któremu można powierzyć wieloetapowe zadanie i odejść. Jest także jedynym z dwóch, który przyjmuje obrazy. Zapłacisz za to około dwa razy więcej na zadanie, a jeśli twój zbiór roboczy jest w znacznym stopniu buforowany, zapłacisz mniej niż dwa razy — ale argument za nim to nie cena i nie szybkość.

Oba można kierować w OrcaRouter przy użyciu jednego klucza do jednego punktu końcowego zgodnego z OpenAI, w cenach katalogowych dostawców, bez żadnych dodatkowych opłat, a oba są objęte tym samym automatycznym przełączaniem awaryjnym. To najtańszy sposób, aby przekonać się, którego z nich naprawdę potrzebuje Twoje obciążenie, ponieważ przełączanie między nimi to zmiana ciągu modelu, a nie umowa.

Porównane w tym artykule2

Wykryto na podstawie tego artykułu · Benchmarki: Artificial Analysis · aktualizowane codziennie