Wygenerowana karta tytułowa z napisem „Claude Haiku 5.5 vs Qwen3.8-Flash-Next” i podtytułem „Model o otwartych wagach nie jest tym tanim”, słupek oznaczony „Koszt na ukończone zadanie Intelligence Index” z wartościami 0,21 USD dla Claude Haiku 5.5 i 0,37 USD dla Qwen3.8-Flash-Next oraz wiersz stopki o treści „Niezależne dane według Artificial Analysis; ceny według Anthropic i Alibaba”. Prawdziwe logo OrcaRouter jest wkomponowane w prawym dolnym rogu.
Guides & Insights

Claude Haiku 5.5 vs Qwen3.8-Flash-Next: Model o otwartych wagach nie jest tym tanim

Autor

Rowan Sterling

Data publikacji

Najnowsze modele · 20Zobacz wszystkie modele →
Benchmarki: Artificial Analysis · aktualizowane codziennie
Powrót do wszystkich wpisów

Intuicja podpowiada, że model o otwartych wagach z flashowej półki Alibaby przebije cenowo zamknięty mały model Anthropic, i pod względem obu liczb na metce rzeczywiście tak jest: Qwen3.8-Flash-Next jest udostępniany za 0,15 USD za milion tokenów wejściowych i 0,47 USD za milion tokenów wyjściowych we własnym API Alibaby, wobec 0,10 i 0,50 USD w przypadku Claude Haiku 5.5. Jeśli jednak uruchomić oba na tym samym zestawie benchmarków, kolejność się odwraca. Artificial Analysis mierzy Claude Haiku 5.5 przy wysiłku Max na 0,21 USD za ukończone zadanie Intelligence Index; Qwen3.8-Flash-Next kosztuje 0,37 USD przy tym samym pomiarze, przy wyniku o trzy punkty niższym. Tańsza metka należy do modelu z wyższym rachunkiem, a powód jest ten sam, który rozstrzyga większość takich porównań: cennik to nie cena, a model o otwartych wagach zarabia na siebie gdzie indziej niż na rachunku za zarządzane API. To „gdzie indziej” jest właściwym tematem tego starcia.

Czym jest każdy z nich

Te dwa pojawiły się w odstępie sześciu tygodni i nie należą do tego samego rodzaju artefaktów.

• Claude Haiku 5.5 — model o zamkniętych wagach wydany 7 października 2026 r., dostępny w Claude API, Amazon Bedrock, Google Cloud, Microsoft Foundry i Claude Platform on AWS. Kontekst 1 mln tokenów, do 128 000 tokenów wyjściowych w synchronicznym interfejsie Messages API, adaptacyjne myślenie z regulatorem wysiłku od niskiego do maksymalnego, domyślnie na poziomie średnim, data odcięcia wiedzy w czerwcu 2026 r. oraz cennik, który zmienia się przy 100 000 tokenów.

• Qwen3.8-Flash-Next — otwarty model typu mixture-of-experts udostępniony 26 sierpnia 2026 r. na licencji qwen-community-1.0, opisywany przez Alibaba jako eksperymentalna zapowiedź architektury, na której oparty będzie Qwen4. Przechowuje 125 mld parametrów modelu głównego oraz osobną tabelę osadzeń n-gramowych o rozmiarze 51 mld — czyli około 176 mld przed uwzględnieniem 4-miliardowego modułu przewidywania wielu tokenów — i aktywuje 6 mld na token, mając 512 ekspertów, routing top-10 i 48 warstw. Natywnie obsługuje kontekst 262 144 tokenów, rozszerzalny do 1 mln dzięki YaRN, i przyjmuje dane wejściowe w postaci tekstu, obrazu i wideo.

• Qwen3.8-Flash — komercyjny odpowiednik udostępniany jako usługa, również dostępny od 26 sierpnia 2026 r. w Alibaba QwenCloud w cenie 0,16 USD za milion tokenów wejściowych i 0,47 USD za milion tokenów wyjściowych, z domyślnym kontekstem 1 mln tokenów. Warto odróżniać go od Flash-Next: jeden to checkpoint, który można pobrać i sprawdzić, a drugi to odpłatny, zarządzany endpoint.

Różnica między dwoma ostatnimi to cały powód, dla którego to porównanie jest interesujące. Claude Haiku 5.5 i Qwen3.8-Flash-Next konkurują ze sobą w bardzo niewielu aspektach, ponieważ tylko jeden z nich można uruchomić na własnym sprzęcie.

Zmierzona ustawa, która wskazuje w przeciwnym kierunku

Wszystkie poniższe niezależne dane pochodzą z Artificial Analysis i dotyczą Intelligence Index v4.3.2. Cenniki Anthropic i Alibaba to ceny publikowane przez samych dostawców.

• Intelligence Index — Claude Haiku 5.5 przy maksymalnym wysiłku 43, drugi spośród 182 modeli. Qwen3.8-Flash-Next 40, szósty spośród 117 w swojej klasie. Trzy punkty różnicy, na korzyść Anthropic.

• Koszt na zadanie — 0,21 USD wobec 0,37 USD. Model droższy w przeliczeniu na token jest o 43% tańszy w przeliczeniu na ukończone zadanie.

• Tokeny wyjściowe w przebiegu Index — 440 mln dla Claude Haiku 5.5 i 240 mln dla Qwen3.8-Flash-Next, oba względem mediany 100 mln. Model Qwen pisze wydajniej, a mimo to zadanie jest droższe, co pokazuje, że różnica nie wynika wyłącznie z liczby tokenów, lecz z mieszanki danych wejściowych i wyceny stosowanej przez ewaluatora.

• Szybkość generowania — 241,9 tokenów na sekundę wobec 56,0. Claude Haiku 5.5 jest ponad czterokrotnie szybszy w tym samym pomiarze, a jego 295-sekundowy czas do pierwszego tokenu w tym przebiegu jest artefaktem myślenia przy maksymalnym wysiłku, a nie wartością sieciową; czas do pierwszego tokenu Qwen3.8-Flash-Next wynosi 2,53 sekundy.

• Kształt cennika — Claude Haiku 5.5 przechodzi z $0.10 i $0.50 na $0.50 i $2.50 przy 100 000 tokenów. Qwen3.8-Flash ma stałą stawkę $0.16 i $0.47 niezależnie od długości, co jest prawdziwą zaletą w przypadku długich promptów i jedynym miejscem, w którym argument cenowy wytrzymuje zderzenie z długim dokumentem.

• Tokenizator — Claude Haiku 5.5 korzysta z nowszego tokenizatora współdzielonego z Claude 4.7 i nowszymi, więc ten sam tekst liczy się jako około 30% więcej tokenów niż w poprzednim Haiku. To zawyża prompty w stronę progu 100 000 tokenów; to dokumentacja samego Anthropic i działa na niekorzyść modelu dokładnie w przypadku długich promptów, w którym ryczałtowa stawka Qwen wygląda najlepiej.

A więc kształt tego kompromisu jest taki: płać więcej za token, a otrzymasz szybszą, nieco mądrzejszą odpowiedź, która kosztuje mniej na ukończone zadanie, z klifem cenowym, na który trzeba uważać przy długich danych wejściowych. Albo płać mniej za token i otrzymaj wolniejszy model, który kosztuje więcej na ukończone zadanie, ze stałą stawką i natywnym oknem 262 144 tokenów.

A screenshot of OrcaRouter's model page for qwen/qwen3.8-flash, showing the model card and its list pricing of $0.15 per million input tokens and $0.47 per million output tokens, captured in English.A screenshot of the Artificial Analysis model page for Claude Haiku 5.5 at maximum effort, showing an Intelligence Index of 43 on v4.3.2 at rank 2 of 182 models, a 1,000,000-token context window, 241.9 output tokens per second at rank 8 of 182, a cost of $0.21 per Intelligence Index task, and 440 million output tokens against a 100 million median.

Gdzie otwarte wagi faktycznie zmieniają arytmetykę

Wszystko powyżej porównuje dwa zarządzane API i to jest porównanie, którego Qwen3.8-Flash-Next nie został zaprojektowany, aby wygrać. Jego atutem jest to, że nie musi być wynajmowany.

• Wsparcie serwowania od dnia zerowego. SGLang udostępnił stronę cookbook i dedykowany obraz; vLLM ma dla niego kompilację, podczas gdy pull request wsparcia architektury jest wciąż otwarty. NVIDIA zweryfikowała oba rozwiązania oraz TensorRT LLM na szafie GB300 NVL72, a NeMo obejmuje dostrajanie.

• Próg sprzętowy jest niski jak na checkpoint 176B. Tabela osadzeń n-gramów o rozmiarze 51B może znajdować się w pamięci hosta, a nie w VRAM, ponieważ adresy jej wyszukiwań są znane z góry i można je wstępnie pobierać. To właśnie pozwala modelowi działać na klastrach DGX Spark i stacjach roboczych 4×RTX PRO 6000, a tworzone tego samego dnia kwantyzacje społeczności — wersje 1-bitowe, które mieszczą się w 75GB RAM przy około 80% pełnej dokładności — pozwalają uruchomić go na sprzęcie, który ma do dyspozycji mały zespół.

• Dostępne jest dostrajanie. Nie w sensie hostowanego API do dostrajania: wagi należą do ciebie, na licencji społecznościowej z typowymi warunkami, a architektura jest udokumentowana w raporcie technicznym, który publikuje ablacje i wyniki negatywne.

• Okno jest mniejsze, niż się wydaje. Natywnie 262 144 tokeny, rozszerzalne do 1M dzięki YaRN — w porównaniu z natywnym 1M w Claude Haiku 5.5, bez zastrzeżenia dotyczącego skalowania rope. W obciążeniach z długimi dokumentami, gdzie płaska stawka Qwen wygląda najbardziej atrakcyjnie, model, który faktycznie może pomieścić dokument, to ten drugi.

• Benchmarki są raportowane przez dostawcę. Własna tabela Alibaby stawia Flash-Next przed DeepSeek-V4-Flash-0731 w DeepSWE 1.1 (58,7 wobec 54,4), SWE-bench Pro (62,5 wobec 56,0) i GPQA Diamond (91,7 wobec 90,8), a w NL2Repo-Bench za nim (48,1 wobec 54,2) — generowanie kodu na poziomie repozytorium, jedyny wymiar agentowy, w którym mniejszy model nie nadąża. Żaden z tych wyników nie został odtworzony przez stronę trzecią, a model ma sześć tygodni.

To jest uczciwa granica między nimi. Claude Haiku 5.5 to usługa rozliczana za użycie o stałym pułapie jakości i bez powierzchni operacyjnej. Qwen3.8-Flash-Next to artefakt, którego krzywa kosztów wygina się w dół w stronę ceny energii elektrycznej, a którego pułap jakości jest równy temu, co możesz obsłużyć, plus ryzyko nieodtworzonej tabeli benchmarków i architektury wciąż przyswajanej przez środowiska uruchomieniowe.

Realistyczny sposób podejmowania decyzji

Rozstrzygają to trzy pytania, a tylko pierwsze dotyczy benchmarków.

Czy masz GPU — albo chcesz je mieć? Jeśli nie, przypadek self-hostingu jest teoretyczny, a powyższe porównanie rozwiązań zarządzanych to cała historia — i wypada ono na korzyść Claude Haiku 5.5 pod względem kosztu na zadanie, szybkości i wyniku, z zastrzeżeniem, że jego krok wynoszący 100 000 tokenów karze długie prompty. Jeśli natomiast dysponujesz akceleratorami, których wykorzystanie pozostaje poniżej celu, Qwen3.8-Flash-Next jest jednym z niewielu otwartych modeli, w których dekodowanie przy 6B aktywnych parametrach jest naprawdę tanie przy dużej skali, a wartość 0,37 USD na zadanie przestaje być istotną liczbą.

Jak długi jest średni prompt? To jedyne miejsce, w którym argument z cenówki się broni. Poniżej 100 000 tokenów — po tokenizerze, który zawyża o około 30% — Claude Haiku 5.5 jest tańszy pod każdym względem. Powyżej tej granicy stała stawka 0,16 i 0,47 USD to lepsza opcja, a jej przewaga rośnie wraz z długością aż do natywnego okna 262 144 tokenów, powyżej którego rozszerzenie YaRN to już inny problem inżynieryjny.

Jaką tolerancję na opóźnienia ma to obciążenie? 241,9 tokenów wyjściowych na sekundę w porównaniu z 56,0 to duża różnica, a wdrożenie self-hosted, które się do niego kolejkuje. Agent wsparcia na żywo lub agent korzystający z przeglądarki — obciążenia, które Anthropic wymienia w tym kontekście — odczuje różnicę.

Dla każdego, kto chce odpowiedzieć na drugie i trzecie pytanie, zamiast je rozważać, najtańszym narzędziem jest wspólny endpoint. Qwen3.8-Flash-Next nie ma jeszcze w katalogu OrcaRouter, podobnie jak Claude Haiku 5.5; model z rodziny Qwen, który rzeczywiście obsługujemy, to Qwen3.8-Flash, w cenie katalogowej dostawcy z przenoszoną marżą 0%, który jest najbliższym obsługiwanym odpowiednikiem modelu w tym porównaniu i właściwym punktem odniesienia dla testu kosztów przy długich promptach. Po stronie Anthropic modele Claude Haiku 4.5, Claude Sonnet 5.5 i Claude Opus 5.5 są dziś wywoływalne z tego samego klucza, więc eksperyment cenowy na dwóch generacjach to kwestia konfiguracji, a nie drugiej umowy — a ponieważ rozliczenie jest przekazywane bezpośrednio, a nie uśredniane, obniżka dostawcy na którejkolwiek z nóg pojawia się po naszej stronie tego samego dnia, w którym zostaje ogłoszona. Automatyczne przełączanie awaryjne sprawia, że eksperyment można bezpiecznie uruchomić na prawdziwym ruchu: model w wersji preview albo nieodtworzona tabela benchmarków to dokładnie ten przypadek, w którym warto skierować trasę na coś nowego, mając za nią zaufany model.

Co zmieniłoby odpowiedź

Dwie rzeczy, obie możliwe do sprawdzenia. Pierwsza to niezależna ocena Qwen3.8-Flash-Next na zestawie testowym, w którym uruchamiany jest również Claude Haiku 5.5 — tabela dostawcy zawiera porównanie z DeepSeek, a 40 na niezależnej tablicy wyników to pojedyncza pozycja. Wynik kodowania na poziomie repozytorium to wiersz, na który warto zwrócić uwagę, ponieważ NL2Repo to obszar, w którym już wykazano, że model pozostaje w tyle. Druga to, czy prace nad środowiskiem uruchomieniowym dobiegną końca: wsparcie dla vLLM wciąż jest scalane poprzez otwarte pull requesty, a dopóki to nie nastąpi, samodzielne hostowanie tej architektury jest raczej ćwiczeniem dla zespołów, które lubią takie rzeczy, niż wspieraną ścieżką.

Do tego czasu podsumowanie jest krótkie. Qwen3.8-Flash-Next to ciekawszy model do posiadania i droższy w wynajmie. Claude Haiku 5.5 to tańszy, szybszy, wyżej punktowany zarządzany endpoint, z cennikiem, który karze wszystko, co długie. Wybieraj na podstawie tego, czy kupujesz tokeny, czy checkpoint — a jeśli kupujesz tokeny, zwróć uwagę, że model z otwartymi wagami nie jest takim rabatem, jak zakładałeś.

A generated two-column scoreboard titled 'Claude Haiku 5.5 vs Qwen3.8-Flash-Next — the scoreboard'. Left column Claude Haiku 5.5: weights, closed and API-only; input price $0.10 per million up to 100,000 tokens; output price $0.50 per million up to 100,000 tokens; native context 1,000,000 tokens; independent score 43 on Intelligence Index v4.3.2 at Max effort, rank 2 of 182; cost per task $0.21; measured output speed 241.9 tokens per second. Right column Qwen3.8-Flash-Next: weights, open under the qwen-community-1.0 license; served price $0.16 per million input and $0.47 per million output, flat; native context 262,144 tokens, extensible to 1M with YaRN; independent score 40, rank 6 of 117; cost per task $0.37; measured output speed 56.0 tokens per second. A footer line reads 'Vendor pricing per Anthropic and Alibaba; independent figures per Artificial Analysis.' The real OrcaRouter logo is composited bottom-right.