Karta tytułowa hero z nagłówkiem „Chińska klasa Flash, zweryfikowana” oraz znacznikiem weryfikacji twierdzeń „październik 2026”, trzy plakietki cenowe o treści: Claude Haiku 5.5 0,10 USD za wejście / 0,50 USD za wyjście za 1 mln tokenów, GLM 5.3 Flash 0,15 USD / 0,50 USD i DeepSeek V4.1 Flash 0,30 USD / 1,20 USD, wiersz o treści „Terminal Bench 4.0 0,32828 – remis” oraz wiersz Index v4.3.2 o treści 43,40 – 41,81 – 39,46.
Guides & Insights

Claude Haiku 5.5 był wymierzony w chiński poziom Flash. Tylko połowa tego twierdzenia przechodzi weryfikację.

Autor

Magnus Corvin

Data publikacji

Najnowsze modele · 20Zobacz wszystkie modele →
Benchmarki: Artificial Analysis · aktualizowane codziennie
Powrót do wszystkich wpisów

Czytelnik piszący po chińsku przedstawił w tym tygodniu dosadny argument: Claude Haiku 5.5wydaje się stworzony, by zdobyć chiński rynek średniej półki, ponieważ przebija DeepSeek V4.1 Flash i GLM 5.3 Flashcenowo i uzyskuje wyższe wyniki niż GLM 5.3 Flash w Terminal Bench 4.0 oraz Artificial Analysis Intelligence Index. To bystrzejsza interpretacja niż większość komentarzy premierowych. To także dwa twierdzenia w jednym płaszczu, a nie niosą one ze sobą takiej samej ilości prawdy.

Anthropic wypuściło Claude Haiku 5.5 7 października 2026 r. — pełna publiczna premiera z opatrzonym datą ogłoszeniem, kartą systemową i opublikowanym cennikiem. To daje temu twierdzeniu coś, czego komentarz rynkowy z drugiej ręki rzadko otrzymuje: liczby, które można sprawdzić.

Poniższy audyt stwierdza, że jedna połowa jest mocniejsza, niż twierdził czytelnik, a druga połowa jest błędna w przypadku konkretnego benchmarku, na który się powołuje. Oba ustalenia warto znać, ponieważ wskazują w przeciwnych kierunkach.

Twierdzenie, precyzyjnie sformułowane

Rozłożony na części, argument składa się z trzech elementów.

• Cena — Claude Haiku 5.5 jest tańszy niż DeepSeek V4.1 Flash i tańszy niż GLM 5.3 Flash.

• Niezależny wynik — plasuje się około punktu powyżej GLM 5.3 Flash w Artificial Analysis Intelligence Index.

• Benchmark kodowania — uzyskuje także o jeden punkt więcej niż GLM 5.3 Flash w Terminal Bench 4.0.

Dwa z nich można sprawdzić w opublikowanych tabelach i się potwierdzają, po wprowadzeniu korekt. Trzeci można sprawdzić w tej samej tabeli i wypada inaczej, niż opisano.

A three-column scoreboard titled 'The claim, audited - Claude Haiku 5.5 against the flash tier' comparing Claude Haiku 5.5, GLM 5.3 Flash and DeepSeek V4.1 Flash across six rows: input price, output price, Intelligence Index v4.3.2 (43.40, 41.81 and 39.46), Terminal Bench 4.0 (0.32828, 0.32828 and 0.2677), cost per finished task ($0.21, $0.25 and $0.27) and weights (proprietary, MIT open, MIT open), footed 'Vendor list rates; Index and benchmark figures per Artificial Analysis v4.3.2.'

Połowa dotycząca ceny: prawdziwa, w jednym kierunku zaniżona, w innym zawyżona.

Opublikowana przez Anthropic stawka dla Claude Haiku 5.5 wynosi 0,10 USD za milion tokenów wejściowych i 0,50 USD za milion tokenów wyjściowych w przypadku promptu do 100 000 tokenów, a powyżej tego progu rośnie do 0,50 USD i 2,50 USD. Odczyty z pamięci podręcznej danych wejściowych kosztują 0,01 USD, a zapisy 0,125 USD. Okno kontekstu wynosi milion tokenów; maksymalna długość wyjścia to 128 000.

GLM 5.3 Flash od Z.ai jest wyceniony na 0,15 i 0,50 USD, a jego buforowane dane wejściowe na 0,026 USD. DeepSeek V4.1 Flash jest wyceniony na 0,30 i 1,20 USD, a jego buforowane dane wejściowe na 0,006 USD.

Co do stawki głównej czytelnik ma rację. Stawka $0.10 za wejście jest o jedną trzecią niższa od GLM 5.3 Flash i o dwie trzecie niższa od DeepSeek V4.1 Flash, a stawka $0.50 za wyjście dokładnie odpowiada GLM 5.3 Flash, plasując się jednocześnie znacznie poniżej połowy stawki DeepSeeka. To wygląda na celowe posunięcie: zrównać się z tańszym rywalem w stawce za wyjście, pobić go w stawce za wejście i pozwolić, by relacja mówiła sama za siebie.

To, co poprawia sytuację tej tezy, to mierzony koszt na ukończone zadanie. W Intelligence Index v4.3.2 firmy Artificial Analysis koszt całego zadania wynosi 0,21 USD dla Claude Haiku 5.5, 0,25 USD dla GLM 5.3 Flash i 0,27 USD dla DeepSeek V4.1 Flash. Cennik głosi, że Claude Haiku 5.5 jest 1,5 raza tańszy od GLM 5.3 Flash pod względem danych wejściowych; pomiar mówi, że ukończone zadanie jest tańsze o około jedną szóstą. Wciąż najtańszy z całej trójki — tylko nie o taki margines, jaki sugeruje metka.

To powód, który umyka większości porównań cen. Claude Haiku 5.5 jest rozwlekły. Artificial Analysis odnotowało w jego przypadku 162 164 tokenów wyjściowych podczas przeprowadzania testu Index, wobec 68 673 dla GLM 5.3 Flash i 88 574 dla DeepSeek V4.1 Flash. Własna dokumentacja Anthropic dodaje drugi efekt: model używa nowszego tokenizera współdzielonego z Claude 4.7 i nowszymi, więc ten sam tekst liczy się jako około 30% więcej tokenów niż w modelu, który zastępuje. Tańsza stawka zastosowana do większej liczby tokenów to tańsza stawka zastosowana do większej liczby tokenów.

Jeden niuans, który pojawia się tylko w rachunku z routingiem: nasz własny katalog podaje DeepSeek V4.1 Flash w cenie 0,15 USD za wejście i 0,60 USD za wyjście, ze mnożnikiem 2× stosowanym w dwóch dziennych oknach: 01:00–04:00 i 06:00–10:00 UTC. Przez osiemnaście godzin na dobę obowiązuje stawka podstawowa; przez sześć godzin na dobę stawka za wyjście wynosi 1,20 USD. Ruch wsadowy, który można zaplanować poza tymi oknami, uzyskuje istotnie lepszą cenę DeepSeek, niż sugeruje główna stawka z cennika dostawcy, a ruch interaktywny nie. Jeśli naprawdę modelujesz to porównanie, kalendarz ma znaczenie tak samo jak cennik.

A capture of the Artificial Analysis model page for Claude Haiku 5.5 (Max), showing its standing chips of Intelligence #21/182, Speed #91/182, Cost #46/182 and Verbosity #62/182, the rates $0.10 in and $0.50 out with a 90% cache discount, a cost of $0.21 per task, 440M generated tokens, and the summary line that Claude Haiku 5.5 scores 43 on the Intelligence Index against a median of 13.

Połowa wyniku: „około punktu” wynosi 1,6

W Artificial Analysis Intelligence Index v4.3.2 Claude Haiku 5.5 osiąga wynik 43,40 w konfiguracji Max. GLM 5.3 Flash osiąga wynik 41,81. DeepSeek V4.1 Flash plasuje się na poziomie 39,46.

Tak więc część tezy dotycząca indeksu jest kierunkowo słuszna i zaokrągla się w dół: różnica wynosi 1,59 punktu, a nie jeden. To realna przewaga w indeksie, który osiąga wartości w sześćdziesiątkach, i to właśnie ta liczba jest cytowana w każdym podsumowaniu tego starcia.

To nie jest twierdzenie o samych benchmarkach stanowiących podstawę. Obaj dostawcy publikują własne zestawy ewaluacyjne i nie są to te same zestawy — Anthropic podaje GDPval-AA v2.1, OSWorld 2.1, Terminal-Bench 4.0 i FrontierCode dla Claude Haiku 5.5; Z.ai podaje własny zestaw dla GLM 5.3 Flash. Niezależny panel to jedyny dostępny wiersz umożliwiający porównanie jabłek do jabłek, i właśnie dlatego luka w indeksie jest tak mocno wykorzystywana oraz dlatego następna sekcja ma znaczenie.

Połowa dotycząca kodowania: tutaj jest całkowity remis, a nie zwycięstwo.

Terminal Bench 4.0, we wspólnym niezależnym pomiarze, wskazuje 0,32828 dla Claude Haiku 5.5 i 0,32828 dla GLM 5.3 Flash. Identycznie do pięciu miejsc po przecinku.

To jest ta jedna najbardziej przytaczalna liczba w tym pojedynku, a twierdzenie na jej temat jest błędne. Prawdopodobnym źródłem zamieszania jest sąsiedni wiersz: pełny GLM-5.3, wariant nie-Flash, uzyskuje 0,4192 w tym samym benchmarku. Jeśli widziałeś „GLM” i „Terminal Bench” w jednym zdaniu obok liczby o punkt wyższej niż Claude Haiku 5.5, to jest ten bliźniaczy model, a nie Flash.

Pozostałe trzy wiersze, które Artificial Analysis publikuje dla obu modeli, są ciekawsze niż remis i nie wskazują jednego kierunku:

• SciCode — 0,5498 dla Claude Haiku 5.5 w porównaniu z 0,5162 dla GLM 5.3 Flash. Przewaga 3,4 punktu dla Anthropic.

• Humanity's Last Exam — 0,4439 przeciwko 0,3985. Przewaga 4,5 punktu dla Anthropic.

• AutomationBench, wynik częściowy — 0,3541 wobec 0,6037. Przewaga 25 punktów na korzyść GLM 5.3 Flash i to zdecydowanie największa różnica w zestawie.

Ten ostatni wiersz będzie tym, na którym najbardziej zależy zespołom ds. zakupów, ponieważ automatyzacja agentowa to obszar, w którym modele średniej klasy są faktycznie wdrażane. Pod względem miary tego, czy model potrafi doprowadzić wieloetapowe zadanie do końca, tańszy w eksploatacji model z otwartymi wagami wygrywa przewagą, która przyćmiewa 1,6-punktową różnicę w indeksie w przeciwnym kierunku.

Z szybkością jest tak samo jak z ceną – tylko różnice są jeszcze większe. Artificial Analysis zmierzyło 424,6 sekundy na zadanie Index dla Claude Haiku 5.5 w porównaniu z 1035,4 sekundy dla GLM 5.3 Flash. Model Anthropic osiąga to w mniej niż połowie czasu zegarowego, co w pętli agenta jest większą liczbą operacyjną niż tempo tokenów.

Co twierdzenie całkowicie pomija

Porównanie jest przedstawione jako historia ceny i wyniku, która po cichu pomija wymiar, w którym oba modele są najmniej podobne. GLM 5.3 ma otwarte wagi, opublikowane na licencji MIT, z 320 miliardami parametrów całkowitych i 18 miliardami aktywnych. DeepSeek V4.1 Flash również ma otwarte wagi, z 552 miliardami łącznie i 16 miliardami aktywnymi. Claude Haiku 5.5 jest zastrzeżony, dostępny wyłącznie w indeksie, bez opublikowanej liczby parametrów i bez repozytorium.

Dla wielu nabywców to nie przypis; to pierwsza linia dokumentu wymagań. Zespół, który musi uruchamiać wnioskowanie we własnej dzierżawie, dostrajać model albo utrzymywać jego wersję niezmienną przez lata, wcale nie wybiera między tymi trzema na podstawie punktów w indeksie — dwa z trzech odpadają, zanim jeszcze przeczyta się kolumnę z ceną. Ujęcie przyjęte przez czytelnika to spostrzeżenie dotyczące pozycjonowania rynkowego i jest ono słuszne; tyle że różnica strukturalna akurat działa przeciwko modelowi, którego to ujęcie broni.

Samodzielne przeprowadzanie porównania

GLM 5.3 Flash i DeepSeek V4.1 Flash znajdują się w katalogu OrcaRouter w cenie katalogowej dostawcy z 0% marży, co sprawia, że chińską stronę tego porównania możesz wywołać już dziś, zamiast modelować ją w arkuszu kalkulacyjnym. Ponieważ stawka jest przekazywana bezpośrednio, a nie uśredniana, zmiana ceny u dostawcy pojawia się po naszej stronie tego samego dnia, w którym pojawia się po ich stronie — a opisane powyżej okno DeepSeek oparte na kalendarzu jest widoczne w tym samym bloku cenowym, względem którego prowadziłbyś routing. Jeden klucz, jeden SDK, automatyczne przełączanie awaryjne pod spodem oraz DSL routingu, jeśli wolisz wyrazić limit kosztów w trasie, a nie w kodzie aplikacji.

Claude Haiku 5.5 nie ma w naszym katalogu. Można się do niego dostać przez własne API Anthropic, a lepiej powiedzieć to wprost, niż pozostawiać w domyśle.

A capture of the OrcaRouter models index, headed 'Models' with the subtitle '207 models, 16 providers - one API key, one bill' and an OpenAI-compatible cURL example showing a POST to the chat completions endpoint with the model field.

W czym czytelnik miał rację i co z tym zrobić

Instynkt jest słuszny. Gdybyś chciał, żeby fala tanich, zdolnych chińskich modeli średniej klasy wyglądała na drogą, mniej więcej taką kartę byś zagrał: dorównać stawce tańszego rywala, o połowę obniżyć jego stawkę za dane wejściowe, wyprzedzić go o 1,6 punktu indeksu i pozwolić, by za argument posłużyła liczba ceny za ukończone zadanie. Claude Haiku 5.5 robi to i robi to, będąc ponad dwukrotnie szybszym w przeliczeniu na zadanie niż model, na który jest wymierzony.

To, w czym czytelnik się pomylił, jest węższe i ciekawsze. Terminal Bench 4.0 nie jest zwycięstwem; to dokładny remis. Przewaga cenowa, gdy rozlicza się całe zadanie, a nie token, wynosi około jednej szóstej, a nie 1,5-krotności sugerowanej przez cennik. A jedyny benchmark, w którym dwa modele są najdalej od siebie, to benchmark agentowy, w którym GLM 5.3 Flash prowadzi o 25 punktów.

A więc uczciwa wersja tej tezy wygląda tak: Claude Haiku 5.5 celuje w chiński segment flash, wygrywa to porównanie pod względem indeksu złożonego, kosztu na ukończone zadanie i opóźnienia, nie wygrywa go w zakresie automatyzacji agentowej ani otwartości, a konkretna przewaga w benchmarkach kodowania, która sprawiała, że argument wydawał się rozstrzygający, nie istnieje.

Porównane w tym artykule3

Wykryto na podstawie tego artykułu · Benchmarki: Artificial Analysis · aktualizowane codziennie