Wygenerowana karta główna (hero) dla „Claude Haiku 5.5 vs Ling 3.0 Flash” z dwoma panelami oddzielonymi cienką linią: lewy oznaczony „Claude Haiku 5.5” z „Index 43” i „Aktualny”, prawy oznaczony „Ling 3.0 Flash” z „Index 20” i „Przestarzały”. W wierszu stopki widnieje „Wyniki według Artificial Analysis”. Logo OrcaRouter jest nałożone w prawym dolnym rogu.
Engineering & Research

Claude Haiku 5.5 vs Ling 3.0 Flash: jeden z tych modeli ma już następcę

Autor

Magnus Corvin

Data publikacji

Najnowsze modele · 20Zobacz wszystkie modele →
Benchmarki: Artificial Analysis · aktualizowane codziennie
Powrót do wszystkich wpisów

Zacznijmy od osobliwego faktu, bo to on powinien ukształtować decyzję. Ling 3.0 Flash — model Ant Group z otwartymi wagami o 124 miliardach parametrów, udostępniony w sierpniu 2026 na licencji MIT — jest obecnie oznaczony jako przestarzały, a jako jego następcę wskazano Ling 3.1 Flash. Claude Haiku 5.5 pojawił się 7 października 2026, dwa dni przed napisaniem tego tekstu, a Anthropic zobowiązał się nie wycofywać go przed październikiem 2027. Dwa modele w tym samym przedziale cenowym, a na jeden z nich już wskazuje się jego własnego następcę.

Ta asymetria nie jest wyrokiem w sprawie jakości. Ling 3.0 Flash to naprawdę szybki model z otwartymi wagami i nietypową architekturą, a w kilku wymiarach bezapelacyjnie przewyższa poziom A​nthropic. Oznacza to jednak, że to porównanie ma termin przydatności, a każdy materiał, który traktuje oba jako równie trwałe, sprzedaje ci tę część, która się przeterminowuje.

Dwie premiery, dwie bardzo różne epoki

Niezależne dane liczbowe pochodzą z Artificial Analysis; twierdzenia producentów dotyczące konkretnych modeli pochodzą z kart modeli i dokumentacji oraz są oznaczone.

• Wydanie — Ling 3.0 Flash 4 sierpnia 2026 r., z repozytorium Hugging Face z datą 2 sierpnia. Claude Haiku 5.5 7 października 2026 r.

• Licencja — MIT dla Ling 3.0 Flash, czyli mniej więcej tak permisywna, jak to tylko możliwe w przypadku otwartych wag. Claude Haiku 5.5 jest zastrzeżony i dostępny wyłącznie przez API.

• Status — Ling 3.0 Flash ma flagę deprecacji wskazującą na Ling 3.1 Flash. Claude Haiku 5.5 jest aktualny, z zobowiązaniem, że nie zostanie wycofany do października 2027 r.

• Adopcja — repozytorium Ling 3.0 Flash zebrało 11 797 pobrań i 427 polubień. To realny, lecz skromny ślad, będący rozsądnym wskaźnikiem tego, jak bardzo rozrosły się narzędzia firm trzecich wokół tego modelu.

Różnica wieku ma większe znaczenie, niż sugeruje sześć tygodni. Ling 3.0 Flash został wydany w okresie, gdy jego własna rodzina już ewoluowała; Claude Haiku 5.5 został wydany jako najnowszy członek linii, która nie ma ogłoszonego następcy.

Architektura to ta część, którą warto przeczytać dwa razy

A screenshot of the Hugging Face model card for inclusionAI/Ling-3.0-flash, showing 427 likes, the 'TextGeneration', 'Safetensors', 'conversational' and 'custom_code' tags, and the introduction text describing the model as a native hybrid reasoning model operating with 124B total and 5.1B active parameters (about 12.4% and 8.1% of the previous 1T-class flagship Ring-2.6-1T) built on a native hybrid linear attention architecture.

Ling 3.0 Flash to model typu mixture-of-experts, który ma 124 miliardy łącznych parametrów i 5,1 miliarda aktywnych na token. Ten stosunek to cały argument ekonomiczny: masz ślad pamięciowy dużego modelu, a ponosisz koszt obliczeniowy małego. Opublikowana konfiguracja jest konkretna i nie jest jedynie kosmetyczną modyfikacją standardowego transformera:

• Warstwowanie — 35 warstw KDA z 7 warstwami Gated MLA w stosunku 5:1, plus 2 warstwy gęste. Opublikowany przepis treningowy przesuwa okno kontekstowe z 8K do 32K, a następnie do 256K etapowo, zamiast trenować długie okno od zera.

• Eksperci — 512 ekspertów routowanych z jednym wspólnym ekspertem, 8 aktywowanych na token, przy rozmiarze ukrytym 2 560, rozmiarze pośrednim eksperta 768 i gęstym rozmiarze pośrednim 6 144. Słownik liczy 157 184 tokeny.

• Serwowanie — referencyjne wdrożenie karty używa SGLang z opcją --context-length 262144, i podaje, że HiCache z buforowaniem Mooncake skraca czas do pierwszego tokenu o 60–80% lub więcej w przypadku długich danych wejściowych. To wartość podana przez dostawcę i jest jako taka przedstawiona.

Nic z tego nie jest chwytem marketingowym. Aktywny rozmiar 5,1B jest powodem, dla którego Ling 3.0 Flash można obsługiwać przy osiąganej przepustowości, a prace nad buforowaniem sprawiają, że opóźnienie pierwszego tokenu przy długich promptach pozostaje akceptowalne. Podejście Claude Haiku 5.5 jest odwrotne: jeden gęsty, zastrzeżony model za API, z oknem 1 000 000 tokenów i adaptacyjnym myśleniem, które przy każdym żądaniu decyduje, ile pracy wykonać. Dwie spójne odpowiedzi na to samo pytanie o koszty.

Liczby, obok siebie

A generated two-column scoreboard titled 'Claude Haiku 5.5 vs Ling 3.0 Flash - the scoreboard'. The Claude Haiku 5.5 column reads independent score 43 (AA, #2 of 182), weights Proprietary API, context 1,000,000 tokens, input price $0.10 / 1M, output price $0.50 / 1M and throughput 240.4 tok/s. The Ling 3.0 Flash column reads independent score 20 (AA, #3 of 65), weights MIT open weights, context 262,000 tokens, input price $0.075 / 1M, output price $0.22 / 1M and throughput 333.6 tok/s. A footer line reads 'Independent figures per Artificial Analysis; pricing per each vendor.'

• Niezależny wynik — Claude Haiku 5.5 z wynikiem 43 w Intelligence Index, drugi na 182. Ling 3.0 Flash z wynikiem 20, trzeci na 65 w swojej klasie.

• Cena wejściowa za milion tokenów — Claude Haiku 5.5 $0,10 do 100 000 tokenów, $0,50 powyżej. Ling 3.0 Flash $0,075, z 80% rabatem na pamięć podręczną.

• Cena za milion tokenów wyjściowych — Claude Haiku 5.5 0,50 USD do 100 000 tokenów, 2,50 USD powyżej. Ling 3.0 Flash 0,22 USD.

• Koszt mieszany — 0,05 USD za milion tokenów dla Ling 3.0 Flash, wobec 0,08 USD dla Claude Haiku 5.5 według własnego sposobu mieszania przyjętego przez tablicę.

• Szybkość — 333,6 tokenów wyjściowych na sekundę dla Ling 3.0 Flash, pierwsze miejsce spośród 65 w swojej klasie, wobec 240,4 dla Claude Haiku 5.5. Czas do pierwszego tokena to niemal remis: 2,50 sekundy wobec pomiaru na tablicy wyników dla modelu Anthropic.

• Kontekst — 262 000 tokenów dla Ling 3.0 Flash; 1 000 000 dla Claude Haiku 5.5.

• Modalność wejściowa — tylko tekst dla Ling 3.0 Flash. Tekst i obrazy dla Claude Haiku 5.5.

• Wagi — licencja MIT i możliwość pobrania w przypadku Ling 3.0 Flash. Zastrzeżone dla Claude Haiku 5.5.

Atutem Linga jest szybkość i cena, a nie głębia

Różnica 23 punktów w Indeksie między 43 a 20 to najważniejsza informacja i wskazuje ten sam kierunek co w każdym tego typu porównaniu: Claude Haiku 5.5 jest mocniejszym modelem, a różnica nie jest mała. Ale kolumna Ling wygrywa dwie pozycje bezapelacyjnie, a obie są tego rodzaju, który widać na fakturze albo w budżecie opóźnień.

Po pierwsze, przepustowość. 333,6 tokena na sekundę to najszybszy wynik w swojej klasie w zestawieniu, o około 39% lepszy od Claude Haiku 5.5, a w połączeniu z niższym kosztem łączonym oznacza, że generowanie masowe — przebiegi klasyfikacyjne, etykietowanie danych, masowa ekstrakcja danych strukturalnych — jest mierzalnie tańsze w eksploatacji na Ling 3.0 Flash. Gdy zadanie jest dobrze określone, a tryb awarii oczywisty, model pozostający o 23 punkty Indexu z tyłu wciąż może być właściwym wyborem.

Po drugie, 80% zniżki na pamięć podręczną. W przypadku obciążenia z dużym stabilnym prefiksem i małym zmiennym ogonem efektywna stawka za dane wejściowe w Ling 3.0 Flash spada znacznie poniżej ceny katalogowej, a projekt pamięci podręcznej w karcie modelu jest ukierunkowany dokładnie na taki wzorzec. Stawka Claude Haiku 5.5 za odczyt z pamięci podręcznej wynosząca 0,01 USD jest niższa w wartościach absolutnych, ale zapis do pamięci podręcznej kosztuje 0,125 USD, a model ma cenę progową przy 100 000 tokenów wejściowych, której Ling nie ma.

Przeciwwagą jest gadatliwość — i jest to ta sama przeciwwaga, która dotyczy modelu Anthropic. Artificial Analysis odnotował 260 milionów tokenów wyjściowych przy uruchomieniu Indeksu na Ling 3.0 Flash wobec mediany wynoszącej 100 milionów i wskazuje go jako gadatliwy. W modelu rozliczanym za tokeny podważa to przewagę cenową — stawka za tokeny wyjściowe niższa 2,3-krotnie, częściowo pochłaniana przez model, który pisze więcej tokenów, to mniejsza przewaga, niż sugeruje karta.

Co twierdzą benchmarki dostawców, a czego nie

Własna karta Ling 3.0 Flash podaje mocny zestaw wyników: MathArena AIME 2026 – 93,2, HMMT February 2026 – 87, SWE-Bench Pro – 56,6, SWE-Bench Multilingual Resolved – 72,4 i Humanity's Last Exam – 22,7. Każdy z nich jest raportowany przez dostawcę i żaden nie został tutaj niezależnie odtworzony. Nie są też mierzone względem Claude Haiku 5.5 na tym samym stanowisku testowym — Anthropic publikuje własny zestaw (GDPval-AA v2.1 – 1620, OSWorld 2.1 – 72,4%, Terminal-Bench 4.0 – 39,2%), a obaj dostawcy użyli różnych zestawów testów. Jedynym wspólnym pomiarem jest niezależny ranking i tam odpowiedź jest jednoznaczna.

Warto odnotować na marginesie wyników z matematyki: ten wynik HLE na poziomie 22,7 plasuje się znacznie poniżej 45,9 bez narzędzi, które A​nthropic podaje dla Claude Haiku 5.5. Różne harnessy, więc to nie jest bezpośrednie porównanie, ale też nie luka, którą dałoby się zbyć wyborem harnessu.

A screenshot of the Artificial Analysis page for Ling 3.0 Flash carrying a deprecation notice that the model is deprecated and that only the default 10k-input-token workload is still benchmarked, and that InclusionAI has launched a newer release, Ling 3.1 Flash, which it suggests considering instead. Beneath the notice the page shows the model as an open-weights release from August 2026 with an Intelligence rank of 3 of 65 and a speed rank of 1 of 65.

Problem następnika

To jest ta część, która decyduje o porównaniu dla każdego, kto planuje z myślą o okresie wykraczającym poza bieżący kwartał, i nie ma ona nic wspólnego z benchmarkami.

Ling 3.0 Flash jest przestarzały na rzecz Ling 3.1 Flash. Nie oznacza to, że przestaje działać — otwarte wagi nie wygasają, a licencji MIT nie można odwołać. Oznacza to jednak, że ekosystem wokół niego będzie dryfował: wsparcie frameworków wnioskowania, wydania kwantyzacji, poprawki błędów i narzędzia społeczności podążają za bieżącym modelem, a przestarzały dostaje jedynie resztki tej uwagi. Jeśli dziś budujesz na Ling 3.0 Flash, budujesz na wagach, które są zamrożone i ukończone, co jest w porządku przy stabilnym obciążeniu, ale kłopotliwe w przypadku wszystkiego, co ma się poprawiać.

Claude Haiku 5.5 ma lustrzanie odwrotny zestaw gwarancji: nie otrzymujesz wag, ale otrzymujesz dostawcę, którego interes komercyjny polega na utrzymywaniu modelu jako szybkiego, łatanego i obsługiwanego, a do tego zobowiązanie do niewycofania go do października 2027 r. oraz opublikowaną ścieżkę migracji na wypadek, gdyby ten okres się zakończył.

Obie strony tej trasy, za pomocą jednego klucza

Uczciwa informacja o dostępności: OrcaRouter nie ma w ofercie Ling 3.0 Flash i nie ma w ofercie również Claude Haiku 5.5. Ling 3.0 Flash jest udostępniany przez własną dystrybucję dostawcy i kilka platform firm trzecich; Claude Haiku 5.5 jest dostępny w API A​nthropic i na głównych platformach chmurowych.

To, co pozostaje, to kwestia routingu, którą podnoszą oba modele. Claude Haiku 5.5 przy 43 i oknie 1M to naturalny cel eskalacji; Ling 3.0 Flash przy 333 tokenach na sekundę to naturalny odcinek do obsługi dużego wolumenu. Trasa, która kieruje pracę o dużym wolumenie i dobrze określoną do szybkiej warstwy, a wszystko, co nie przejdzie kontroli długości lub jakości, eskaluje do warstwy silniejszej, to dokładnie ten układ, który komponuje router — w OrcaRouter Claude Haiku 4.5, Claude Sonnet 5.5 i Claude Opus 5.5 od Anthropic są dziś w katalogu, obok dużych opcji open-weight, takich jak DeepSeek V4.1 Flash i GLM 5.3 Flash, więc zarówno odcinek eskalacji, jak i odcinek masowy można teraz zbudować i przetestować pod obciążeniem. Jeden klucz, automatyczne przełączanie awaryjne pod spodem, ceny katalogowe dostawców przekazywane bez marży (0%), dzięki czemu zmiana ceny obowiązuje tego samego dnia.

Który z dwóch, i na jak długo?

Wybierz Claude Haiku 5.5, jeśli zakres pracy jest otwarty, jeśli potrzebujesz obrazów lub okna o rozmiarze miliona tokenów, jeśli chcesz, aby dostawca gwarantował dostępność, albo jeśli planujesz dalej niż na następny kwartał. Ma przewagę 23 punktów IQ, jest aktualny, a nie przestarzały, a różnica w cenie jest wystarczająco mała, że przewaga w wynikach ma decydujące znaczenie.

Weź Ling 3.0 Flash, jeśli obciążenie jest masowe, dobrze określone i wrażliwe na opóźnienia, jeśli kluczowa jest licencja MIT lub otwarte wagi, albo jeśli to, gdzie naprawdę leży twój rachunek, stanowi 80% zniżki na pamięć podręczną dla stabilnego prefiksu. To szybszy model i tańszy w przeliczeniu na token, a przy tym naprawdę dobry w zadaniach, z którymi radzi sobie model 20-Index. Wchodź w to ze świadomością, że przyjmujesz model ukończony, a nie utrzymywany, i że następca, na którego wskazuje, już istnieje.