Karta hero z nagłówkiem „Claude Haiku 5.5 vs Ling 3.1 Flash”, zwieńczona wierszem „560 mld parametrów, brak wag”, z kontrastem Index kontra AutomationBench wynoszącym 0,3541 wobec 0,6174, wierszem kosztu wynoszącym 0,21 USD za zadanie wobec 0,99 USD za zadanie oraz wierszem czasu wynoszącym 424,6 s za zadanie wobec 360,4 s za zadanie.
Engineering & Research

Claude Haiku 5.5 vs Ling 3.1 Flash: model o 560 miliardach parametrów, który kosztuje czterokrotnie więcej za odpowiedź

Autor

Rowan Sterling

Data publikacji

Najnowsze modele · 20Zobacz wszystkie modele →
Benchmarki: Artificial Analysis · aktualizowane codziennie
Powrót do wszystkich wpisów

Six days separate them. InclusionAI shipped Ling 3.1 Flash on October 1, 2026; the vendor shipped Claude Haiku 5.5 on October 7. Both are sold as flash-tier models, both carry a one-million-token context window, and on the reasoning rows of the one independent board that has run both they are so close that the difference is inside the noise. Then you get to the row that measures whether an agent actually finishes the job, and they are 26 points apart — and to the row that measures what a finished job costs, where the model with 560 billion parameters is four and a half times the price of the one whose parameter count nobody has published.

Żaden z tych cenników tego nie przewiduje. Ling 3.1 Flash jest wyceniony na 0,30 USD za milion tokenów wejściowych i 0,90 USD za milion tokenów wyjściowych. Claude Haiku 5.5 jest wyceniony na 0,10 USD i 0,50 USD dla promptów do 100 000 tokenów, a powyżej tej granicy – na 0,50 USD i 2,50 USD. Odczytując to jako cenę za token, Ling jest trzy razy droższy na wejściu i nieco mniej niż dwa razy droższy na wyjściu, co jest różnicą, która rozstrzyga porównanie w jednej linijce.

To nie kończy tej rozgrywki, ponieważ cennik jest rozliczany za token, a decyzja za zadanie. Te dwie liczby wychodzą z tej konfrontacji z przeciwnymi znakami, a powodem nie jest rozwlekłość.

Ile kosztuje ukończone zadanie, a nie ile kosztuje token

W Artificial Analysis Intelligence Index v4.3.2 zmierzony koszt wykonania jednego pełnego zadania indeksu wynosi 0,21 USD dla Claude Haiku 5.5 i 0,99 USD dla Ling 3.1 Flash. To luka 4,6× — szersza niż 3× stosunek danych wejściowych i w tym samym kierunku.

Oczywiste wyjaśnienie — że drogi model mówi więcej — jest błędne. Ling 3.1 Flash wygenerował 100 671 tokenów wyjściowych na zadanie indeksowania; Claude Haiku 5.5 wygenerował 162 164. To tańszy model jest bardziej gadatliwy, i to o ponad 60%. Pieniądze też więc nie idą tam, gdzie sugerowałby cennik.

Rozbij koszt na zadanie, a trafi tam, gdzie metodologia indeksu faktycznie go wydaje. Z 0,21 USD w przypadku Claude Haiku 5.5 około 62% przypada na stronę wejściową; z 0,99 USD w przypadku Ling 3.1 Flash — około 91%. To przebiegi rozumowania w dużym stopniu oparte na pamięci podręcznej, a obaj dostawcy wyceniają token wejściowy z pamięci podręcznej bardzo różnie: 0,01 USD za milion dla Claude Haiku 5.5 wobec 0,06 USD za milion dla Ling 3.1 Flash — sześciokrotna różnica na jednej pozycji, która dominuje na rachunku. Opublikowany cennik porównuje 0,10 USD z 0,30 USD. Pozycja, która decyduje o fakturze, porównuje 0,01 USD z 0,06 USD.

Nasz własny katalog przekazuje ceny katalogowe dostawców przy 0% marży, dzięki czemu te dwie sytuacje można odróżnić na rzeczywistym rachunku, a nie na modelowym. Ling 3.1 Flash nie znajduje się w katalogu pod żadną pisownią ścieżki swojego dostawcy, jaką udało nam się ustalić — ani pod InclusionAI, ani pod Ling, ani pod żadną z ośmiu form, które wypróbowaliśmy — więc powyższe $0.30 i $0.90 to własne, opublikowane stawki dostawcy i nic, co możemy dla Ciebie dziś kierować. Claude Haiku 5.5 również nie znajduje się w katalogu; działa przez własne API Anthropic. To, co katalog rzeczywiście zawiera z sąsiedztwa tego porównania, to GLM 5.3 Flash, DeepSeek V4.1 Flash, Qwen3.8 Flash i Gemini 3.8 Flash, każdy w cenie katalogowej dostawcy z 0% marży, więc zmiana stawek dostawcy dociera na naszą stronę tego samego dnia, w którym dociera do nich. Jeśli poniższy wniosek mówi, że to profil agentowy Ling 3.1 Flash jest tym, czego potrzebuje Twoje obciążenie, praktycznym następnym krokiem jest bezpośrednie porównanie z modelami obsługującymi tryb agentowy, które rzeczywiście kierujemy, na jednym kluczu z automatycznym przełączaniem awaryjnym pod spodem oraz DSL routingu, gdy limit kosztów powinien znajdować się w trasie, a nie w kodzie aplikacji.

A two-column scoreboard titled 'Claude Haiku 5.5 vs Ling 3.1 Flash - the scoreboard' with rows Index v4.3.2 43.40 against 41.09, cost per task $0.21 against $0.99, time per task 424.6s against 360.4s, Terminal Bench 4.0 0.3283 against 0.3333, AutomationBench 0.3541 against 0.6174 and output tokens per task 162,164 against 100,671, footed 'All figures per Artificial Analysis Intelligence Index v4.3.2.'

Siedem wierszy, w których oba zostały zmierzone

Artificial Analysis to jedyny ranking, który przetestował oba modele, a część wspólna jest wąska, ale pouczająca. Wiersze nie zgadzają się ze sobą, a kierunek tej niezgodności nie jest losowy.

• Intelligence Index v4.3.2 — 43,40 dla Claude Haiku 5.5 (Max) wobec 41,09 dla Ling 3.1 Flash. Przewaga Anthropic o 2,31 punktu.

• Koszt na ukończone zadanie Index — 0,21 USD wobec 0,99 USD na tej samej tablicy.

• Czas na zadanie Index — 424,6 sekundy dla Claude Haiku 5.5 w porównaniu z 360,4 sekundy dla Ling 3.1 Flash. To ten wiersz, w którym oczekiwanie zawodzi: model o 560 miliardach parametrów jest szybszy z tych dwóch w całym indeksie, o około 15%.

• Terminal Bench 4.0 — 0,3283 wobec 0,3333. Ling 3.1 Flash wyprzedza o pół punktu, co na benchmarku cytowanym przez obu dostawców jest remisem.

• SciCode — 0,5498 wobec 0,5405. Claude Haiku 5.5 o 0,9 punktu. Również remis.

• Humanity's Last Exam, bez narzędzi — 0,4439 wobec 0,3943. Claude Haiku 5.5 o 5 punktów, pierwsze prawdziwe oddzielenie.

• AutomationBench, wynik częściowy — 0.3541 wobec 0.6174. Ling 3.1 Flash ma 26 punktów przewagi i to z większą przewagą niż wszystkie pozostałe różnice na tej liście razem wzięte.

Istnieją jeszcze dwa wiersze poza tym wspólnym zestawem, które warto uwzględnić, ponieważ to na nie kupujący zwracają uwagę najbardziej. W GDPval-AA, który Artificial Analysis przeprowadza w 44 zawodach, te dwa wynoszą 1620,05 i 1621,75 — statystyczny remis. W AA-Briefcase v1.1, ocenie długiej formy pracy zawodowej z rankingiem Elo, Claude Haiku 5.5 osiąga 1577,72 wobec 1400,35 Ling 3.1 Flash, co daje 177-punktową różnicę na korzyść Anthropic. To największa nieagentowa różnica między nimi w całej tabeli.

Ten jeden wiersz, który powinien rozstrzygać większość tych rozmów

Średnie na poziomie indeksu ukrywają, gdzie tak naprawdę poszły czas i pieniądze, a ta para jest najwyraźniejszym tego przykładem w całej partii. Liczby dla poszczególnych ewaluacji w Terminal Bench 4.0 nie są zbliżone w żadnym wymiarze poza wynikiem.

• Terminal Bench 4.0, Ling 3.1 Flash — 0,3333 przy 5,49 USD za zadanie i 1 283 sekundy na zadanie.

• Terminal Bench 4.0, Claude Haiku 5.5 — 0,3283 przy 0,65 USD na zadanie i 908 sekundach na zadanie.

Dzieli je pięć tysięcznych punktu wyniku. Koszt jest 8,4× większy, a czas zegarowy 1,4× dłuższy. Zespół, który czyta tabelę benchmarków i wybiera model z wynikiem 0,3333, według własnych obliczeń Artificial Analysis zdecydował się zapłacić osiem razy więcej, by uzyskać tę samą odpowiedź o jedną trzecią minuty później.

To nie jest argument, że wynik jest bez znaczenia; to argument, że wynik jest stosunkiem wykonanej pracy do pracy podjętej i nie mówi nic o zasobach zużytych, by do niego dojść. Benchmarki ukończeń agentowych to dokładnie ten przypadek, w którym ta różnica daje się we znaki najmocniej, ponieważ agent, który ponawia próby, to agent, który płaci pełną cenę za każde ponowienie, a model, który kosztuje osiem razy więcej na próbę, zamienia pętlę ponowień w pozycję w budżecie.

A capture of the Artificial Analysis model page for Claude Haiku 5.5 (Max), showing its standing chips of Intelligence #21/182, Speed #91/182, Cost #46/182 and Verbosity #62/182, the rates $0.10 in and $0.50 out with a 90% cache discount, a cost of $0.21 per task, 440M generated tokens, and the summary line that Claude Haiku 5.5 scores 43 on the Intelligence Index against a median of 13.

560 miliardów parametrów, których nie trzeba pobierać

Oto ta część specyfikacji Ling 3.1 Flash, która jest naprawdę nietypowa — i nie chodzi o rozmiar.

Ling 3.1 Flash to rzadki model oparty na mieszance ekspertów — łącznie 560 miliardów parametrów, 25 miliardów aktywnych na token — a Artificial Analysis klasyfikuje go jako własnościowy. Nie ma wag, pliku licencji ani repozytorium. Duży rzadki model o takiej strukturze normalnie pojawiłby się jako otwarte wydanie, ponieważ właśnie tak postępuje reszta tej klasy: GLM 5.3 Flash udostępnia wagi na licencji MIT przy łącznej liczbie 320 miliardów i 18 miliardach aktywnych, a DeepSeek V4.1 Flash udostępnia wagi na licencji MIT przy łącznej liczbie 552 miliardów i 16 miliardach aktywnych. Ling 3.1 Flash to ta sama klasa architektury w tym samym rzędzie wielkości, opublikowany wyłącznie jako API.

Ten wybór ma konsekwencję, której wiersze benchmarku nie pokazują. Model o 25 miliardach aktywnych parametrów musi być gdzieś serwowany, a jeśli nie możesz utrzymać checkpointu, nie możesz wybierać, gdzie ani przy jakiej marży — wynajmujesz jego serwowanie u dostawcy. Podana powyżej cena 5,49 USD za zadanie Terminal Bench nie jest przede wszystkim artefaktem stawki za tokeny; to koszt wynajęcia dużego rzadkiego modelu od jedynego podmiotu, który może go uruchomić. Modele z otwartymi wagami z tej samej klasy dają ci możliwość samodzielnego zmienienia tej liczby.

To działa też w drugą stronę i ta sama uczciwość tu obowiązuje. Otwarte wydanie nie jest automatycznie lepszym produktem: wraz z wagami dziedziczysz ciężar obsługi, wybory dotyczące kwantyzacji i kierat aktualizacji, a plik licencji nie jest umową wsparcia. Anthropic publikuje zobowiązanie dotyczące wycofania Claude Haiku 5.5, że nie nastąpi to wcześniej niż 7 października 2027 r., w API pierwszej strony z kartą systemową. To, który z tych dwóch układów wybierzesz, jest pytaniem o twój zespół, a nie o którykolwiek z modeli.

Do czego służy Ling 3.1 Flash

Przeczytaj cały profil, a opisuje on spójny produkt, a nie produkt pełen kompromisów: duży, rzadki model o długim kontekście, który kończy autonomiczne wieloetapowe przepływy pracy lepiej niż cokolwiek innego mierzonego w tym przedziale cenowym, jest przeciętny w trudnym rozumowaniu wymagającym pojedynczego podejścia i robi to za stałą stawkę, bez klifu związanego z długością promptu. W AutomationBench ma 26 punktów przewagi nad Claude Haiku 5.5, a jego wynik AA-Briefcase to jedyny punkt w tym porównaniu, w którym plasuje się poniżej środka stawki, a nie na jej czele.

To możliwy do obrony opis wsadowego pracownika agentowego: skieruj go na kolejkę ustrukturyzowanych zadań, z których każde musi zostać ukończone, zaakceptuj, że zadanie mierzy się w minutach, utrzymuj prompt wystarczająco długi, aby krok progowy był karzący, i stawiaj niezawodność na mecie ponad koszt pojedynczego tokena. Nie nadaje się natomiast do tego, po co zwykle kupuje się modele klasy flash. Przyjmuje wyłącznie tekst — w ogóle nie obsługuje obrazów, podczas gdy Claude Haiku 5.5 przyjmuje tekst i obrazy. Czas jego zadania indeksowego jest krótszy, ale czas zadania w Terminal Bench jest dłuższy, a przy 0,99 USD za ukończone zadanie indeksowe w porównaniu z 0,21 USD wydaje cztery i pół razy więcej, by osiągnąć niemal ten sam wynik zbiorczy.

A capture of InclusionAI's Ling Studio playground with the model selector reading Ling-3.1-flash, a Model Settings panel showing temperature 0.6, top_k 20 and Thinking enabled, tabs for Chat, Prompt, Agent, explore and Tools, and tool toggles for Web Search, Time Query and Weather Query.

Który z tych dwóch, na podstawie istniejących dowodów

Jeśli Twoja praca to tekst na wejściu i tekst na wyjściu, rozliczany za token przy dużej skali, Claude Haiku 5.5 wygrywa to porównanie w każdej pozycji, która trafia na fakturę: niższy koszt zadania w indeksie, niższy rzeczywisty koszt zadania w benchmarku, który ma największe znaczenie dla agentów, wyższy wynik złożony, lepsze wyniki w długich zadaniach profesjonalnych, lepsza wierność oraz wejście obrazowe, którego drugi model nie oferuje wcale.

Jeśli Twoja praca to agent bez nadzoru, który musi ukończyć wieloetapowy przepływ pracy, Ling 3.1 Flash uzyskuje wynik o 26 punktów wyższy niż Claude Haiku 5.5 w tym jednym wspólnym benchmarku, który mierzy dokładnie to, i warto go przetestować, a nie odrzucać z powodu ceny. Przetestuj go na własnym śladzie, a nie na tej tabeli — i wyceniaj test za każde ukończone zadanie, ponieważ właśnie ta liczba się zmienia, gdy agent ponawia próbę.

Jeśli musisz mieć wagi na własność, żaden z tych dwóch nie jest twoim modelem. Ling 3.1 Flash jest zastrzeżony i ma 560 miliardów parametrów; Claude Haiku 5.5 jest zastrzeżony, a liczba jego parametrów nie została opublikowana. Otwarte wydania w tym przedziale są w innym miejscu na tablicy, a to porównanie zaczyna się od zupełnie innego zestawu wierszy.

Wskaźnik złożony podaje 2,31 punktu. Benchmark agentowy podaje 26 w drugą stronę. Karta stawek podaje 3× na wejściu; koszt ukończonego zadania podaje 4,6× w tym samym kierunku co karta. Cztery liczby, dwa kierunki — dlatego jedynym niezawodnym sposobem, by to rozstrzygnąć, jest uruchomienie obu względem śladu własnej pracy i odczytanie kosztu z ukończonych zadań, a nie z tokenów.

Porównane w tym artykule1

Wykryto na podstawie tego artykułu · Benchmarki: Artificial Analysis · aktualizowane codziennie