Karta tytułowa porównania GLM-5.3 i Kimi K3: mniejsza kostka po lewej stronie oznaczona jako GLM-5.3 z etykietą „model bazowy 743B po treningu”, a większa kostka po prawej stronie oznaczona jako Kimi K3 z etykietą „model bazowy 2.8T zbudowany od zera”.
Guides & Insights

GLM-5.3 vs Kimi K3: Wycisnąć maksimum z bazy 743B czy zbudować model 2.8T — który zakład się opłaca?

Autor

Rowan Sterling

Data publikacji

Najnowsze modele · 20Zobacz wszystkie modele
Benchmarki: Artificial Analysis · aktualizowane codziennie
Powrót do wszystkich wpisów

Wyścig chińskich modeli o otwartych wagach właśnie podzielił się na dwie odpowiedzi na to samo pytanie. Moonshot AI zbudował Kimi K3 od zera — model bazowy typu mixture-of-experts o 2,8 biliona parametrów, największy model o otwartych wagach w historii, ogłoszony 16 lipca 2026 roku, a wagi udostępniono 27 lipca. G​L-5.3 to przeciwny zakład: Z.ai zachował ten sam model bazowy o 743 miliardach parametrów, który napędzał GLM-5.2, i poświęcił cały cykl wydawniczy na post-training, argumentując, że pułap inteligencji modelu bazowego nigdy nie był problemem. Oba to flagowce o kontekście 1M, skoncentrowane na kodowaniu i agentach, i oba twierdzą, że są najlepszym otwartym modelem do kodowania na rynku. Nie mogą oba być najlepszym sposobem wykorzystania tego samego budżetu, a benchmarki naprawdę dzielą się po równo — co czyni to mniej porównaniem, a bardziej referendum na temat tego, jak budować kolejny model graniczny.

Dwa zakłady na to, jak zbudować model graniczny

Z.ai określa GLM-5.3 mianem „głębokiego drążenia”, a nie zmiany pokoleniowej. Baza jest co do bajta tym samym modelem 743B co GLM-5.2; różnica wynika wyłącznie z post-treningu, przeprowadzonego za pomocą frameworka slime o otwartym kodzie źródłowym, na zadaniach obejmujących całe sesje inżynierskie — diagnozowanie, naprawianie, weryfikowanie i wdrażanie w rzeczywistych klastrach, systemach pamięci masowej i repozytoriach kodu, z których część wymaga kilku dni pracy starszego inżyniera. Deklarowane przez producenta zyski są duże: skok o 50% w swoim Code Bench, Terminal-Bench 3.0 z 4,6 do 28,3, DeepSWE v1.1 z 46,2 do 66,9, a także możliwości cybernetyczne, które wymusiły przegląd bezpieczeństwa przed udostępnieniem wag. Moonshot poszedł w drugą stronę. Kimi K3 to zupełnie nowa baza — łącznie 2,8T parametrów, z czego około 104B aktywnych na token (16 z 896 ekspertów), architektura Kimi Delta Attention, natywna obsługa obrazu i wideo na wejściu, zawsze włączone rozumowanie, którego nie można wyłączyć, oraz okno kontekstowe 1M zarówno dla wejścia, jak i wyjścia. Podczas gdy Z.ai stawia na to, że więcej tego samego modelu wystarczy, Moonshot stawia na to, że to sama baza była sufitem.

The Z.ai research blog post announcing GLM-5.3, dated August 14 2026, titled GLM-5.3: Frontier Coding with Emergent Cyber Capabilities, with a Coding Plan / Code with ZCode call to action and a HuggingFace (Coming Soon) button.

Konfrontacja z dołączonym pochodzeniem

Jedynym miejscem, w którym oba modele pojawiają się na tej samej stronie, jest tabela startowa samego Z.ai, więc to właśnie stamtąd pochodzą liczby zestawione obok siebie — oznaczone jako raportowane przez producenta, a nie niezależnie zweryfikowane. Samodzielne wyniki Kimi K3 pokrywają się z tym, co Moonshot opublikował w lipcu, oraz z tym, co mierzy Artificial Analysis, ale żadne niezależne laboratorium nie przetestowało jeszcze obu.

Terminal-Bench 3.0 — G​LM-5.3 z wynikiem 28,3 wobec Kimi K3 z wynikiem 17,4 (tabela Z.ai). Największa różnica w kodowaniu w tym zestawieniu, na najnowszej i najtrudniejszej wersji.

Terminal-Bench 2.1 — G​LM-5.3 notuje 88.2, a Kimi K3 88.3. Remis.

DeepSWE v1.1 — G​LM-5.3 z wynikiem 66,9, a Kimi K3 z wynikiem 67,5. Kimi o włos.

SWE-Marathon v1.1 — G​LM-5.3 uzyskało 42.5, a Kimi K3 48.1. To najlepsze zwycięstwo Kimi w kodowaniu.

ExploitGym — G​LM-5.3 na 105/130 wobec Kimi K3 na 36/70. Prawie całkowita dominacja G​LM.

GDPval-AA v2 (praca wiedzy) — G​LM-5.3 na poziomie 1,769 wobec Kimi K3 na poziomie 1,682.

Dostęp — G​LM-5.3: subskrypcja Coding Plan, wagi zablokowane do mniej więcej 28 sierpnia. Kimi K3: API dostępne za $3 / $15, wagi do pobrania od 27 lipca.

A comparison scoreboard for GLM-5.3 and Kimi K3: GLM-5.3 shows Terminal-Bench 3.0 of 28.3, Terminal-Bench 2.1 of 88.2, DeepSWE v1.1 of 66.9, ExploitGym of 105/130, GDPval-AA v2 of 1,769 and weights around August 28, versus Kimi K3s 17.4, 88.3, 67.5, 36/70, 1,682, weights live since July 27 and $3/$15 API pricing.

Fosa bezpieczeństwa to prawdziwa separacja.

Jeśli odrzucimy benchmarki kodowania, decydująca różnica dotyczy cyberbezpieczeństwa. G​LM-5.3 osiąga 84,5 w CyberGym wobec 80,0 Kimi K3, a jego wynik w ExploitBench wynoszący 54,4 to prawie dwukrotność 32,2 Kimi K3. W ExploitGym różnica to nie różnica, a inna kategoria — 105 i 130 wobec 36 i 70 w testach trwających odpowiednio 2 i 6 godzin. Dlatego w praktyce obie premiery odbiera się tak różnie: wagi Kimi K3 są jawne na licencji Modified MIT, natomiast wagi G​LM-5.3 są wstrzymywane w celu wzmocnienia bezpieczeństwa właśnie dlatego, że Z.ai twierdzi, iż model jest na tyle dobry w znajdowaniu i wykorzystywaniu luk, że natychmiastowe udostępnienie wag uznano za nieodpowiedzialne. Jeśli Twoja praca wiąże się z audytem cudzego kodu lub obroną własnego przed zautomatyzowanym polowaniem na podatności, to jest to najbardziej istotny aspekt w całym porównaniu — a zarazem najmniej niezależnie zweryfikowany.

Gdzie Kimi K3 kontratakuje

Zwycięstwa Kimi K3 skupiają się tam, gdzie G​LM-5.3 jest najsłabszy: długoterminowa praca nad repozytorium. Ma przewagę w DeepSWE i SWE-Marathon, prowadzi w Toolathlon Verified, a jego okno wyjściowe 1M tokenów oznacza, że może napisać cały kod lub długi ślad agenta w jednym przejściu. Jego zawsze włączone rozumowanie przesyła pełny ślad do API; deweloperzy uznali go za znacznie bardziej przydatny do debugowania agentów niż nieprzejrzyste wyjaśnienia podsumowujące — z operacyjnym haczykiem, że trzeba przekazywać pola rozumowania z powrotem dosłownie między wywołaniami narzędzi, a nie ma też prefillu asystenta. W indeksie inteligencji Artificial Analysis Kimi K3 plasuje się na 57, czwartym miejscu ogółem, przy koszcie około 0,94 dolara za zadanie mierzonym na jego standardowym zestawie. Jest to również najdroższy model wydany przez chińskie laboratorium: 3 dolary za milion tokenów wejściowych i 15 dolarów za milion tokenów wyjściowych, wycena na poziomie Sonnet, przy czym G​LM-5.3 nie może być jeszcze w ogóle wyceniany za token, ponieważ istnieje tylko w ramach planu subskrypcyjnego.

Rzeczywistość dostępu i kosztów

Kimi K3 jest teraz dostępny na OrcaRouter w cenie katalogowej samego Moonshota — $3 / $15 za milion tokenów, $0,30 za odczyty z pamięci podręcznej, 0% marży — więc pracę agentową z kontekstem 1M można wywołać na tym samym kluczu co reszta Twojego stosu, a otwarte wagi są opcją wyjścia, jeśli chcesz hostować samodzielnie. G​LM-5.3 to ten, którego trudno zdobyć: miesięczna subskrypcja od 18 do 168 dolarów, system punktowy, który zużywa kredyty w skali 6,9x na wejściu i 24x na wyjściu, ceny poza szczytem, które o połowę obniżają koszty poza godzinami 14:00–18:00 czasu chińskiego, i brak API per token, dopóki nie zakończy się przegląd bezpieczeństwa. Warstwa routingu faktycznie niweluje tę asymetrię w dwutygodniowym oknie: gdy API G​LM-5.3 pojawi się na tym samym kluczu, wywołanie panelowe może uruchomić oba flagowe modele open-coding na Twoich własnych zadaniach i pozwolić sędziemu je uzgodnić — a jeśli nie możesz czekać, już wydane wagi Kimi K3 sprawiają, że jest to jedyny z tych dwóch, który możesz dziś w pełni wdrożyć lokalnie.

The OrcaRouter model page for MoonshotAI Kimi K3, showing the New and Featured badges, the kimi/kimi-k3 slug, $3.00 per million input and $15.00 per million output pricing, and text plus image input.

Który zakład wypłaca

Uczciwy werdykt po tygodniu jest taki, że oba zakłady się opłacają, ale przy różnych rodzajach obciążenia. Jeśli Twoja praca opiera się na terminalu, styka się z bezpieczeństwem i jest orkiestrowana przez agentów, G​LM-5.3 jest mocniejszym kierunkiem na podstawie dowodów, które opublikował Z.ai – a różnica w cyberbezpieczeństwie jest na tyle duża, że warto poczekać dwa tygodnie na wagi, by sprawdzić je samemu. Jeśli Twoja praca to długie sesje w repozytorium, dane wejściowe multimodalne albo cokolwiek, gdzie potrzebujesz wag już dziś, Kimi K3 jest jedynym z tych dwóch, który jest faktycznie dostępny – a jego osiągnięcia w głębokiej pracy z repozytorium możesz zweryfikować już teraz, bezpośrednio w jego działającym API. Jedna rzecz, którą trzeba mieć jasność: każda liczba w tym porównaniu głowa w głowę pochodzi z własnej tabeli Z.ai, więc traktuj różnice w kodowaniu jako orientacyjne, dopóki niezależne laboratorium nie przebada obu. To jest dokładnie ten rodzaj weryfikacji, którą przyniesie dwutygodniowe czekanie.

Porównane w tym artykule1

Wykryto na podstawie tego artykułu · Benchmarki: Artificial Analysis · aktualizowane codziennie

© 2026 OrcaRouter

Dla dostawców

Prowadzisz platformę inferencyjną? Udostępnij swoje modele w OrcaRouter.

providers@orcarouter.ai

Dołącz do społeczności

Discordsupport@orcarouter.aiXGitHubYouTube