
Claude Haiku 5.5 vs GLM 5.3 Flash: całkowity remis w benchmarku, który cytują obaj dostawcy
- openaiNOWOŚĆOpenAI: GPT-6.1 Sol2026-09-2952Inteligencja
- anthropicNOWOŚĆAnthropic: Claude Sonnet 5.52026-09-2856Inteligencja
- typesafeNOWOŚĆTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 za 1 mln tokenów · 128 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238Inteligencja
- OpenAIOpenAI: GPT-6 Sol2026-09-2248Inteligencja
- AnthropicAnthropic: Claude Opus 5.52026-09-2258Inteligencja
- xAIGrok 4.72026-09-2146Inteligencja
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 za 1 mln tokenów · 60 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 za 1 mln tokenów · 320 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligencja
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Inteligencja77Kod
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Inteligencja76Kod
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Inteligencja76Kod
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Inteligencja82Kod
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 za 1 mln tokenów · 54 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 za 1 mln tokenów · 356 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligencja72Kod
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 za 1 mln tokenów · 232 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Inteligencja75Kod
- obsidianQwen3.8 27B2026-08-1534Inteligencja68Kod
Run Claude Haiku 5.5 and GLM 5.3 Flash through Terminal Bench 4.0 and you get the same number: 0.32828 for both. Not close — identical, to five decimal places, on the benchmark that the vendor leads with in its own launch materials and that Z.ai's launch materials lead with too. For two models built on entirely different stacks, by vendors in different countries, released six weeks apart, that is a coincidence worth stopping on.
To również niewłaściwa liczba, na której należy opierać decyzję. Te dwa modele wyraźnie różnią się pod każdym innym względem, a wzorzec tej różnicy jest na tyle nietypowy, że powinien zmienić sposób, w jaki czytasz główne deklaracje obu dostawców. Jeden z nich wygrywa w indeksie złożonym i w wyniku kosztu na zadanie. Drugi wygrywa niemal wszystko, co wygląda na rzeczywiste wdrożenie.
Nie są oddzielone ze względu na zdolności. Są oddzielone ze względu na kształt.
Zacznij od tej jednej liczby, która mówi: „to ta sama klasa modelu”.
• SciCode — 0,5498 dla Claude Haiku 5.5 w porównaniu z 0,5162 dla GLM 5.3 Flash. Dwa punkty dla Anthropic na benchmarku, na którym dwa punkty to szum.
• Terminal Bench 4.0 — 0,32828 wobec 0,32828. Dokładnie remis.
• Okno kontekstu — milion tokenów dla obu.
• Cena za dane wyjściowe, pierwszy poziom — 0,50 USD za milion tokenów w obu przypadkach.
Cztery wiersze, cztery niemal dopasowania. Gdyby poprzestać na tym, można by uznać, że te modele są wymienne, i wybierać po cenie. Ten wniosek byłby błędny, a kolejny zestaw wierszy to wyjaśnia.
Tam, gdzie się rozchodzą, kierunek jest spójny.
Wiersze, które je jednak rozdzielają, nie są rozproszone. Skupiają się w dwie grupy, a każdy z modeli jest wyłącznym właścicielem jednej z nich.
Grupa agentowa należy do GLM 5.3 Flash.Częściowy wynik AutomationBench wynosi 0,6037 dla GLM 5.3 Flash w porównaniu z 0,3541 dla Claude Haiku 5.5 — różnica 25 punktów, największa pojedyncza różnica między tymi dwoma modelami w dowolnym wspólnym pomiarze. W Tau-Bench Banking wynik dla GLM 5.3 Flash wynosi 0,4722; Claude Haiku 5.5 nie ma opublikowanej wartości w tym wierszu. GPQA wynosi 0,9121 dla GLM 5.3 Flash; znowu brak wyniku Anthropic do porównania. W pomiarach tego, czy model potrafi utrzymać wieloetapowe zadanie w całości i niezawodnie używać narzędzi w ustrukturyzowanej domenie, model Z.ai wyprzedza o margines, który przyćmiewa różnicę w indeksie złożonym biegnącą w przeciwnym kierunku.
Grupa pod względem wyniku złożonego i kosztu należy do Claude Haiku 5.5.Artificial Analysis Intelligence Index v4.3.2 wynosi 43,40 wobec 41,81 — 1,59 punktu, i to liczba, którą cytuje każde podsumowanie tego starcia. Koszt na ukończone zadanie Index wynosi 0,21 USD wobec 0,25 USD. Czas rzeczywisty na zadanie Index wynosi 424,6 sekundy wobec 1035,4 sekundy: model Anthropic kończy w mniej niż połowie tego czasu.
Taki jest kształt tego wyboru. Claude Haiku 5.5 jest szybszy, tańszy w przeliczeniu na ukończone zadanie i wyżej w agregacie. GLM 5.3 Flash jest bardziej niezawodny w tej konkretnej klasie pracy, do której kupuje się tanie modele.

Któremu z nich wierzyć?
Żadne z osobna — a sama rozbieżność jest informacją.
Indeks Inteligencji to ważona mieszanka kategorii rozumowania, nauki, kodowania i agentowych. Został zaprojektowany, aby za pomocą jednej liczby odpowiadać na pytanie „w przybliżeniu, jak zdolny jest ten model”, i wywiązuje się z tego zadania. Nie potrafi jednak powiedzieć, czy 1,59-punktowa przewaga pochodzi z kategorii, w których mieści się Twoje obciążenie, czy z tych, których ono w ogóle nie dotyka. Tutaj przewaga pochodzi w dużej mierze z wierszy takich jak SciCode i Humanity's Last Exam — 0,5498 wobec 0,5162 oraz 0,4439 wobec 0,3985 — podczas gdy na AutomationBench przypada 25-punktowy deficyt o przeciwnym znaku.
Zespół budujący asystenta kodowania w pętli terminala zauważy przewagę SciCode. Zespół budujący agenta, który musi zrealizować bankowy przepływ pracy od początku do końca, zauważy lukę AutomationBench i będzie ją zauważać dzień w dzień. Oba zespoły patrzą na ten sam indeks i powinny dojść do przeciwnych wniosków.
Praktycznym krokiem jest odczytywanie wskaźnika złożonego jako filtra, a nie rankingu. Jeśli dwa modele mieszczą się w granicach około dwóch punktów indeksu, wskaźnik złożony mówi ci, że są w tym samym przedziale, i nie mówi nic o tym, który wybrać. W tym momencie jedyne wiersze warte czytania to te, które odpowiadają twojemu obciążeniu — a jeśli dostawca nie opublikował potrzebnego ci wiersza, sam brak jest daną, a nie luką, którą należy wypełnić założeniem.
Wiersz tokenizera, którego nikt nie umieszcza w tabeli porównawczej
Własna dokumentacja Anthropic zawiera jedno zdanie, które zmienia każde porównanie cen z udziałem Claude Haiku 5.5, a łatwo je przeoczyć. Model korzysta z nowszego tokenizera współdzielonego z Claude 4.7 i późniejszymi, który zlicza ten sam tekst jako około 30% więcej tokenów niż model, który zastępuje.
Zestaw to z cennikiem stawek, a arytmetyka wypada mniej korzystnie, niż sugeruje metka. Stawka za wejście w Claude Haiku 5.5 wynosi 0,10 USD za milion tokenów wobec 0,15 USD w GLM 5.3 Flash — przewaga 1,5×. Przy 30% większej liczbie tokenów dla tego samego promptu efektywna przewaga na identycznym tekście wyraźnie maleje, choć nie zanika. Stawki za wyjście są identyczne i wynoszą 0,50 USD w pierwszym progu, więc efekt tokenizera działa tam bez niczego, co by go równoważyło.
Zmierzony wynik jest uczciwą wersją tego twierdzenia: według własnych obliczeń Artificial Analysis, Claude Haiku 5.5 wygenerował 162 164 tokeny wyjściowe na zadanie Index wobec 68 673 w przypadku GLM 5.3 Flash — 2,4 razy więcej — a mimo to koszt ukończonego zadania wyniósł 0,21 USD wobec 0,25 USD. Przewaga w stawce nie znika przez rozwlekłość, a to, co z niej pozostaje, jest mniejsze, niż podaje cennik.
Tylko w przypadku jednego z tych dwóch modeli stawki podano jako stałe. Cena Claude Haiku 5.5 wzrasta po przekroczeniu 100 000 tokenów promptu do $0.50 za wejście i $2.50 za wyjście; GLM 5.3 Flash nie ma opublikowanego równoważnego progu. W przypadku większości ruchu czatowego i związanego z asystą w kodowaniu ten próg nigdy nie wchodzi w grę. W przypadku pracy agentowej z długimi dokumentami lub dużym kontekstem wchodzi w grę nieustannie, a wtedy porównanie odwraca się znacznie dalej, niż sugerują jakiekolwiek liczby pierwszego poziomu.

Linia, która rozstrzyga to, zanim zrobią to jakiekolwiek liczby.
Wszystko powyżej zakłada, że możesz swobodnie wybierać między tymi dwoma modelami. Znaczna część zespołów nie może, a powodem jest pojedynczy wiersz specyfikacji, który bywa pomijany w dyskusji o benchmarkach.
GLM 5.3 Flash ma otwarte wagi i został wydany na licencji MIT; ma 320 miliardów parametrów całkowitych, z czego 18 miliardów aktywnych. Można go pobrać, hostować samodzielnie, dostroić, skwantyzować, przypiąć do konkretnej wersji i uruchomić w dzierżawie, którą kontrolujesz. Claude Haiku 5.5 jest własnościowy i dostępny wyłącznie przez API, bez opublikowanej liczby parametrów, bez licencji i bez repozytorium.
Jeśli w twoim dokumencie wymagań jest napisane, że model musi działać na własnym sprzęcie albo że konkretny checkpoint musi pozostać możliwy do wywołania przez najbliższe trzy lata, to porównanie jest rozstrzygnięte, zanim ktokolwiek spojrzy na kolumnę z ceną. To nie jest szczegół techniczny. To najczęstszy powód, dla którego zespoły w ogóle decydują się na model średniej klasy z otwartymi wagami, i to powód, dla którego 25-punktowa przewaga w AutomationBench nie jest jedyną rzeczą ciągnącą w kierunku Z.ai.
To działa też w drugą stronę i ta sama uczciwość tu obowiązuje. Anthropic publikuje zobowiązanie, że Claude Haiku 5.5 nie zostanie wycofany wcześniej niż w październiku 2027 r., oraz udostępnia model przez własne API, wraz z kartą systemową i udokumentowanym zestawem ewaluacyjnym. Wydanie z otwartymi wagami nie jest automatycznie trwalsze — wraz z wagami dziedziczysz obciążenie operacyjne, a plik licencyjny to nie umowa o wsparcie. To, który z tych dwóch chcesz, jest kwestią twojego zespołu, a nie modeli.
Obie strony na jednym klawiszu, jeśli chcesz rozstrzygnąć to empirycznie.
GLM 5.3 Flash znajduje się w katalogu OrcaRouter w cenie katalogowej Z.ai z 0% marży, przekazywanej w niezmienionej postaci, a nie uśrednianej, więc stawka powyżej to stawka na rachunku, a każda zmiana wprowadzona przez Z.ai trafia na naszą stronę tego samego dnia. Claude Haiku 5.5 nie znajduje się w naszym katalogu — jest dostępny poprzez własne API Anthropic — i lepiej powiedzieć to wprost, niż pozostawiać w domyśle.
To, co katalog rzeczywiście ułatwia, to kształt testu, jakiego ta konfrontacja w istocie wymaga. Rozbieżność między indeksem złożonym a wierszami agentowymi to hipoteza dotycząca Twojego obciążenia, a jedynym sposobem, by ją rozstrzygnąć, jest uruchomienie obu modeli na tym samym śladzie. Gdy GLM 5.3 Flash jest na trasie, a po drugiej stronie tej samej bramy znajduje się odnoga Anthropic, staje się to zmianą konfiguracji, a nie dwiema integracjami — jedno API dla ponad 200 modeli, jeden klucz, automatyczne przełączanie awaryjnepod spodem, oraz DSL routingu, gdy chcesz rozdzielić ruch według klasy zadań i odczytać koszt z jednej faktury.

Werdykt, sformułowany tak, jak pozwalają na to liczby
Jeśli Twoja praca to tekst na wejściu, tekst na wyjściu, Twoje prompty mieszczą się w pierwszym progu cenowym, a płacisz za token przy rzeczywistym wolumenie, Claude Haiku 5.5 jest tutaj lepszym modelem: wyższy wynik złożony, taniej za ukończone zadanie i ponad dwa razy szybciej na zadanie. Nagłówek terminal-benchmark to remis i nie należy go używać do rozstrzygania czegokolwiek.
Jeśli twoja praca polega na agencie, który musi ukończyć wieloetapowy proces roboczy bez nadzoru, GLM 5.3 Flash prowadzi o 25 punktów w jednym wspólnym benchmarku, który mierzy dokładnie to, a przy tym jest tańszy z tych dwóch w modyfikacji, ponieważ możesz dysponować wagami.
Remis na poziomie 0,32828 to właściwy obraz dla tej pary, ale nie dlatego, że modele są równe. To ten jeden wiersz, w którym dwa modele nie mające poza tym ze sobą prawie nic wspólnego przypadkiem trafiają na tę samą cyfrę — a potraktowanie tej cyfry jako podsumowania porównania to sposób, w jaki podejmuje się decyzję zakupową na podstawie najmniej informacyjnej liczby w tabeli.
