
Claude Haiku 5.5 był wymierzony w chiński poziom Flash. Tylko połowa tego twierdzenia przechodzi weryfikację.
- openaiNOWOŚĆOpenAI: GPT-6.1 Sol2026-09-2952Inteligencja
- anthropicNOWOŚĆAnthropic: Claude Sonnet 5.52026-09-2856Inteligencja
- typesafeNOWOŚĆTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 za 1 mln tokenów · 128 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238Inteligencja
- OpenAIOpenAI: GPT-6 Sol2026-09-2248Inteligencja
- AnthropicAnthropic: Claude Opus 5.52026-09-2258Inteligencja
- xAIGrok 4.72026-09-2146Inteligencja
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 za 1 mln tokenów · 60 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 za 1 mln tokenów · 320 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligencja
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Inteligencja77Kod
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Inteligencja76Kod
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Inteligencja76Kod
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Inteligencja82Kod
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 za 1 mln tokenów · 54 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 za 1 mln tokenów · 356 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligencja72Kod
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 za 1 mln tokenów · 232 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Inteligencja75Kod
- obsidianQwen3.8 27B2026-08-1534Inteligencja68Kod
Czytelnik piszący po chińsku przedstawił w tym tygodniu dosadny argument: Claude Haiku 5.5wydaje się stworzony, by zdobyć chiński rynek średniej półki, ponieważ przebija DeepSeek V4.1 Flash i GLM 5.3 Flashcenowo i uzyskuje wyższe wyniki niż GLM 5.3 Flash w Terminal Bench 4.0 oraz Artificial Analysis Intelligence Index. To bystrzejsza interpretacja niż większość komentarzy premierowych. To także dwa twierdzenia w jednym płaszczu, a nie niosą one ze sobą takiej samej ilości prawdy.
Anthropic wypuściło Claude Haiku 5.5 7 października 2026 r. — pełna publiczna premiera z opatrzonym datą ogłoszeniem, kartą systemową i opublikowanym cennikiem. To daje temu twierdzeniu coś, czego komentarz rynkowy z drugiej ręki rzadko otrzymuje: liczby, które można sprawdzić.
Poniższy audyt stwierdza, że jedna połowa jest mocniejsza, niż twierdził czytelnik, a druga połowa jest błędna w przypadku konkretnego benchmarku, na który się powołuje. Oba ustalenia warto znać, ponieważ wskazują w przeciwnych kierunkach.
Twierdzenie, precyzyjnie sformułowane
Rozłożony na części, argument składa się z trzech elementów.
• Cena — Claude Haiku 5.5 jest tańszy niż DeepSeek V4.1 Flash i tańszy niż GLM 5.3 Flash.
• Niezależny wynik — plasuje się około punktu powyżej GLM 5.3 Flash w Artificial Analysis Intelligence Index.
• Benchmark kodowania — uzyskuje także o jeden punkt więcej niż GLM 5.3 Flash w Terminal Bench 4.0.
Dwa z nich można sprawdzić w opublikowanych tabelach i się potwierdzają, po wprowadzeniu korekt. Trzeci można sprawdzić w tej samej tabeli i wypada inaczej, niż opisano.

Połowa dotycząca ceny: prawdziwa, w jednym kierunku zaniżona, w innym zawyżona.
Opublikowana przez Anthropic stawka dla Claude Haiku 5.5 wynosi 0,10 USD za milion tokenów wejściowych i 0,50 USD za milion tokenów wyjściowych w przypadku promptu do 100 000 tokenów, a powyżej tego progu rośnie do 0,50 USD i 2,50 USD. Odczyty z pamięci podręcznej danych wejściowych kosztują 0,01 USD, a zapisy 0,125 USD. Okno kontekstu wynosi milion tokenów; maksymalna długość wyjścia to 128 000.
GLM 5.3 Flash od Z.ai jest wyceniony na 0,15 i 0,50 USD, a jego buforowane dane wejściowe na 0,026 USD. DeepSeek V4.1 Flash jest wyceniony na 0,30 i 1,20 USD, a jego buforowane dane wejściowe na 0,006 USD.
Co do stawki głównej czytelnik ma rację. Stawka $0.10 za wejście jest o jedną trzecią niższa od GLM 5.3 Flash i o dwie trzecie niższa od DeepSeek V4.1 Flash, a stawka $0.50 za wyjście dokładnie odpowiada GLM 5.3 Flash, plasując się jednocześnie znacznie poniżej połowy stawki DeepSeeka. To wygląda na celowe posunięcie: zrównać się z tańszym rywalem w stawce za wyjście, pobić go w stawce za wejście i pozwolić, by relacja mówiła sama za siebie.
To, co poprawia sytuację tej tezy, to mierzony koszt na ukończone zadanie. W Intelligence Index v4.3.2 firmy Artificial Analysis koszt całego zadania wynosi 0,21 USD dla Claude Haiku 5.5, 0,25 USD dla GLM 5.3 Flash i 0,27 USD dla DeepSeek V4.1 Flash. Cennik głosi, że Claude Haiku 5.5 jest 1,5 raza tańszy od GLM 5.3 Flash pod względem danych wejściowych; pomiar mówi, że ukończone zadanie jest tańsze o około jedną szóstą. Wciąż najtańszy z całej trójki — tylko nie o taki margines, jaki sugeruje metka.
To powód, który umyka większości porównań cen. Claude Haiku 5.5 jest rozwlekły. Artificial Analysis odnotowało w jego przypadku 162 164 tokenów wyjściowych podczas przeprowadzania testu Index, wobec 68 673 dla GLM 5.3 Flash i 88 574 dla DeepSeek V4.1 Flash. Własna dokumentacja Anthropic dodaje drugi efekt: model używa nowszego tokenizera współdzielonego z Claude 4.7 i nowszymi, więc ten sam tekst liczy się jako około 30% więcej tokenów niż w modelu, który zastępuje. Tańsza stawka zastosowana do większej liczby tokenów to tańsza stawka zastosowana do większej liczby tokenów.
Jeden niuans, który pojawia się tylko w rachunku z routingiem: nasz własny katalog podaje DeepSeek V4.1 Flash w cenie 0,15 USD za wejście i 0,60 USD za wyjście, ze mnożnikiem 2× stosowanym w dwóch dziennych oknach: 01:00–04:00 i 06:00–10:00 UTC. Przez osiemnaście godzin na dobę obowiązuje stawka podstawowa; przez sześć godzin na dobę stawka za wyjście wynosi 1,20 USD. Ruch wsadowy, który można zaplanować poza tymi oknami, uzyskuje istotnie lepszą cenę DeepSeek, niż sugeruje główna stawka z cennika dostawcy, a ruch interaktywny nie. Jeśli naprawdę modelujesz to porównanie, kalendarz ma znaczenie tak samo jak cennik.

Połowa wyniku: „około punktu” wynosi 1,6
W Artificial Analysis Intelligence Index v4.3.2 Claude Haiku 5.5 osiąga wynik 43,40 w konfiguracji Max. GLM 5.3 Flash osiąga wynik 41,81. DeepSeek V4.1 Flash plasuje się na poziomie 39,46.
Tak więc część tezy dotycząca indeksu jest kierunkowo słuszna i zaokrągla się w dół: różnica wynosi 1,59 punktu, a nie jeden. To realna przewaga w indeksie, który osiąga wartości w sześćdziesiątkach, i to właśnie ta liczba jest cytowana w każdym podsumowaniu tego starcia.
To nie jest twierdzenie o samych benchmarkach stanowiących podstawę. Obaj dostawcy publikują własne zestawy ewaluacyjne i nie są to te same zestawy — Anthropic podaje GDPval-AA v2.1, OSWorld 2.1, Terminal-Bench 4.0 i FrontierCode dla Claude Haiku 5.5; Z.ai podaje własny zestaw dla GLM 5.3 Flash. Niezależny panel to jedyny dostępny wiersz umożliwiający porównanie jabłek do jabłek, i właśnie dlatego luka w indeksie jest tak mocno wykorzystywana oraz dlatego następna sekcja ma znaczenie.
Połowa dotycząca kodowania: tutaj jest całkowity remis, a nie zwycięstwo.
Terminal Bench 4.0, we wspólnym niezależnym pomiarze, wskazuje 0,32828 dla Claude Haiku 5.5 i 0,32828 dla GLM 5.3 Flash. Identycznie do pięciu miejsc po przecinku.
To jest ta jedna najbardziej przytaczalna liczba w tym pojedynku, a twierdzenie na jej temat jest błędne. Prawdopodobnym źródłem zamieszania jest sąsiedni wiersz: pełny GLM-5.3, wariant nie-Flash, uzyskuje 0,4192 w tym samym benchmarku. Jeśli widziałeś „GLM” i „Terminal Bench” w jednym zdaniu obok liczby o punkt wyższej niż Claude Haiku 5.5, to jest ten bliźniaczy model, a nie Flash.
Pozostałe trzy wiersze, które Artificial Analysis publikuje dla obu modeli, są ciekawsze niż remis i nie wskazują jednego kierunku:
• SciCode — 0,5498 dla Claude Haiku 5.5 w porównaniu z 0,5162 dla GLM 5.3 Flash. Przewaga 3,4 punktu dla Anthropic.
• Humanity's Last Exam — 0,4439 przeciwko 0,3985. Przewaga 4,5 punktu dla Anthropic.
• AutomationBench, wynik częściowy — 0,3541 wobec 0,6037. Przewaga 25 punktów na korzyść GLM 5.3 Flash i to zdecydowanie największa różnica w zestawie.
Ten ostatni wiersz będzie tym, na którym najbardziej zależy zespołom ds. zakupów, ponieważ automatyzacja agentowa to obszar, w którym modele średniej klasy są faktycznie wdrażane. Pod względem miary tego, czy model potrafi doprowadzić wieloetapowe zadanie do końca, tańszy w eksploatacji model z otwartymi wagami wygrywa przewagą, która przyćmiewa 1,6-punktową różnicę w indeksie w przeciwnym kierunku.
Z szybkością jest tak samo jak z ceną – tylko różnice są jeszcze większe. Artificial Analysis zmierzyło 424,6 sekundy na zadanie Index dla Claude Haiku 5.5 w porównaniu z 1035,4 sekundy dla GLM 5.3 Flash. Model Anthropic osiąga to w mniej niż połowie czasu zegarowego, co w pętli agenta jest większą liczbą operacyjną niż tempo tokenów.
Co twierdzenie całkowicie pomija
Porównanie jest przedstawione jako historia ceny i wyniku, która po cichu pomija wymiar, w którym oba modele są najmniej podobne. GLM 5.3 ma otwarte wagi, opublikowane na licencji MIT, z 320 miliardami parametrów całkowitych i 18 miliardami aktywnych. DeepSeek V4.1 Flash również ma otwarte wagi, z 552 miliardami łącznie i 16 miliardami aktywnymi. Claude Haiku 5.5 jest zastrzeżony, dostępny wyłącznie w indeksie, bez opublikowanej liczby parametrów i bez repozytorium.
Dla wielu nabywców to nie przypis; to pierwsza linia dokumentu wymagań. Zespół, który musi uruchamiać wnioskowanie we własnej dzierżawie, dostrajać model albo utrzymywać jego wersję niezmienną przez lata, wcale nie wybiera między tymi trzema na podstawie punktów w indeksie — dwa z trzech odpadają, zanim jeszcze przeczyta się kolumnę z ceną. Ujęcie przyjęte przez czytelnika to spostrzeżenie dotyczące pozycjonowania rynkowego i jest ono słuszne; tyle że różnica strukturalna akurat działa przeciwko modelowi, którego to ujęcie broni.
Samodzielne przeprowadzanie porównania
GLM 5.3 Flash i DeepSeek V4.1 Flash znajdują się w katalogu OrcaRouter w cenie katalogowej dostawcy z 0% marży, co sprawia, że chińską stronę tego porównania możesz wywołać już dziś, zamiast modelować ją w arkuszu kalkulacyjnym. Ponieważ stawka jest przekazywana bezpośrednio, a nie uśredniana, zmiana ceny u dostawcy pojawia się po naszej stronie tego samego dnia, w którym pojawia się po ich stronie — a opisane powyżej okno DeepSeek oparte na kalendarzu jest widoczne w tym samym bloku cenowym, względem którego prowadziłbyś routing. Jeden klucz, jeden SDK, automatyczne przełączanie awaryjne pod spodem oraz DSL routingu, jeśli wolisz wyrazić limit kosztów w trasie, a nie w kodzie aplikacji.
Claude Haiku 5.5 nie ma w naszym katalogu. Można się do niego dostać przez własne API Anthropic, a lepiej powiedzieć to wprost, niż pozostawiać w domyśle.

W czym czytelnik miał rację i co z tym zrobić
Instynkt jest słuszny. Gdybyś chciał, żeby fala tanich, zdolnych chińskich modeli średniej klasy wyglądała na drogą, mniej więcej taką kartę byś zagrał: dorównać stawce tańszego rywala, o połowę obniżyć jego stawkę za dane wejściowe, wyprzedzić go o 1,6 punktu indeksu i pozwolić, by za argument posłużyła liczba ceny za ukończone zadanie. Claude Haiku 5.5 robi to i robi to, będąc ponad dwukrotnie szybszym w przeliczeniu na zadanie niż model, na który jest wymierzony.
To, w czym czytelnik się pomylił, jest węższe i ciekawsze. Terminal Bench 4.0 nie jest zwycięstwem; to dokładny remis. Przewaga cenowa, gdy rozlicza się całe zadanie, a nie token, wynosi około jednej szóstej, a nie 1,5-krotności sugerowanej przez cennik. A jedyny benchmark, w którym dwa modele są najdalej od siebie, to benchmark agentowy, w którym GLM 5.3 Flash prowadzi o 25 punktów.
A więc uczciwa wersja tej tezy wygląda tak: Claude Haiku 5.5 celuje w chiński segment flash, wygrywa to porównanie pod względem indeksu złożonego, kosztu na ukończone zadanie i opóźnienia, nie wygrywa go w zakresie automatyzacji agentowej ani otwartości, a konkretna przewaga w benchmarkach kodowania, która sprawiała, że argument wydawał się rozstrzygający, nie istnieje.
Porównane w tym artykule3
Wykryto na podstawie tego artykułu · Benchmarki: Artificial Analysis · aktualizowane codziennie
