Wygenerowana karta hero zatytułowana „Claude Haiku 5.5 vs Qwen3.8 27B" z nadtytułem „OTWARTE WAGI VS API", pokazująca Claude Haiku 5.5 przy koszcie wejścia $0.10, wyjścia $0.50 i indeksie 43.40 wobec Qwen3.8 27B przy koszcie wejścia $0.50, wyjścia $3.00 i indeksie 33.70, nad słupkiem o treści „Koszt na ukończone zadanie $0.21 vs $1.01".
Engineering & Research

Claude Haiku 5.5 vs Qwen3.8 27B: Czyste zwycięstwo w API i dlaczego otwarte wagi wciąż istnieją

Autor

Gideon Frost

Data publikacji

Najnowsze modele · 20Zobacz wszystkie modele →
Benchmarki: Artificial Analysis · aktualizowane codziennie
Powrót do wszystkich wpisów

Większość porównań w tej serii sprowadza się do kompromisu. To jedno nie, a brak kompromisu jest sam w sobie ustaleniem. Claude Haiku 5.5, wydany 7 października 2026 r., bije Qwen3.8 27B, model gęsty 27B z otwartymi wagami z 14 sierpnia 2026 r., pod względem zbiorczego wyniku inteligencji, kosztu za token, kosztu za ukończone zadanie, okna kontekstowego, limitu odpowiedzi, kodowania agentowego i wierszy rozumowania naukowego — i robi to z jednego zastrzeżonego API, które nie wymaga sprzętu. Jedyny wiersz, w którym Qwen3.8 27B wygrywa bezapelacyjnie, to wejście wideo, a drugi to licencja.

To nie jest powód, aby skreślić ten model, ponieważ licencja Apache-2.0 i modalność wideo to nie nagrody pocieszenia. To powód, by precyzyjnie wyjaśnić, dlaczego ktokolwiek miałby wybrać stronę otwartych wag, i przestać udawać, że chodzi o benchmarki.

Liczby, na których faktycznie uruchomiono oba modele

Za milion tokenów w dolarach amerykańskich. Stawki dostawcy pochodzą z jego własnej dokumentacji cenowej; udostępniane pomiary to Artificial Analysis Intelligence Index v4.3.2, odczytane 2026-10-08, oba w najwyższej opublikowanej konfiguracji wysiłku.

A generated two-column scoreboard titled 'Claude Haiku 5.5 vs Qwen3.8 27B — the scoreboard' with rows Index v4.3.2 43.40 against 33.70, cost per task $0.21 against $1.01, input price $0.10 against $0.50, context window 1M tokens against 256K tokens, AutomationBench 0.3541 against 0.4824 and weights 'proprietary' against 'open, Apache 2.0', footed 'All figures per Artificial Analysis Intelligence Index v4.3.2; Qwen vendor-card scores are unreproduced by the board.'

• Dane wejściowe — Claude Haiku 5.5 0,10 USD do 100 000 tokenów i 0,50 USD powyżej; Qwen3.8 27B 0,50 USD według odnotowanej przez zarząd stawki strony trzeciej.

• Wyjście — Claude Haiku 5.5 0,50 USD do 100 000 tokenów i 2,50 USD powyżej; Qwen3.8 27B 3,00 USD.

• Dane wejściowe z pamięci podręcznej — Claude Haiku 5.5 0,01 USD i 0,05 USD, rabat 90%; Qwen3.8 27B 0,10 USD, rabat 80%.

• Niezależny wynik — 43,40 dla Claude Haiku 5.5 (Max) wobec 33,70 dla Qwen3.8 27B (Xhigh). Różnica 9,70 punktu, największa w tej partii.

• Koszt na ukończone zadanie — 0,21 USD wobec 1,01 USD, w tym samym przebiegu ewaluacji. 4,7-krotna różnica, również największa tutaj.

• Kontekst i dane wyjściowe — 1 mln tokenów oraz limit odpowiedzi wynoszący 128 000 tokenów dla Claude Haiku 5.5; kontekst 256 tys. tokenów dla Qwen3.8 27B.

• Modalność — oba przyjmują tekst i obrazy oraz zwracają tekst. Qwen3.8 27B dodaje wejście wideo; Claude Haiku 5.5 nie.

• Wagi — Qwen3.8 27B to model gęsty o 27B parametrach na licencji Apache 2.0, dostępny do pobrania. Claude Haiku 5.5 jest własnościowy i dostępny wyłącznie przez API.

A capture of Anthropic's Claude Platform models documentation showing the Claude model comparison table — Claude Fable 5.1, Claude Opus 5.5, Claude Sonnet 5.5 and Claude Haiku 5.5 'This model', the latter reading 1M context, 128K max output, 'From $0.10/$0.50', latency 'Fastest', default effort medium — above the Claude Haiku 5.5 specifications block with model ids claude-haiku-5-5, the two-tier pricing lines and 'Released October 7, 2026'.

Dlaczego różnica na zadanie jest czterokrotnie większa niż różnica na token

Karta stawek już pokazuje pięciokrotną lukę w cenie wejścia i sześciokrotną lukę w cenie wyjścia na korzyść dostawcy, więc kierunek nie budzi wątpliwości. Warto zauważyć, że wartość na zadanie jest mniejsza niż wartość na token, co jest odwrotnością tego, co miało miejsce w pozostałych porównaniach w tej partii, a powód jest pouczający.

Claude Haiku 5.5 generuje 162 164 tokeny wyjściowe na zadanie Intelligence Index — 129 047 na rozumowanie i 33 118 na odpowiedź. Qwen3.8 27B generuje 66 797, z czego 47 711 na rozumowanie i 19 087 na odpowiedź. Model dostawcy zużywa 2,4 razy więcej tokenów na zadanie, więc jego 6-krotna przewaga w tempie generowania kompresuje się do 4,7-krotnej przewagi na zadanie. Jest wciąż ogromna. Po prostu nie jest to liczba, którą reklamuje cennik.

Matematyka mieszanki to czytelniejszy sposób, aby zobaczyć, jak to wygląda. W mieszance 7:2:1 z przewagą danych wejściowych — czyli wadze, jaką faktycznie ma większość ruchu produkcyjnego — Claude Haiku 5.5 kosztuje 0,077 USD za milion tokenów wobec 0,470 USD dla Qwen3.8 27B. W zrównoważonej mieszance 1:1 kosztuje 0,30 USD wobec 1,75 USD. Próg 100 000 tokenów u dostawcy to jedyna rzecz, która w ogóle niweluje tę różnicę: po jego przekroczeniu stawki rozliczeniowe Claude Haiku 5.5 zmieniają się na 0,50 USD i 2,50 USD za całe żądanie, a oba modele spotykają się przy w przybliżeniu tej samej cenie — i wtedy płacisz 9,7-punktową premię za wynik zupełnie niepotrzebnie.

Gdzie karta dostawcy i niezależna rada się nie zgadzają

To jest ten zestaw wierszy, nad którym warto się zatrzymać, ponieważ własna karta modelu Qwen3.8 27B wypada znacznie mocniej niż niezależne pomiary, a ta różnica jest całym powodem, dla którego twierdzenie o „modelu 27B, który dorównuje znacznie większym” wymaga drugiego źródła.

The vendor's own published figures, as recorded on our catalogue page for the model, include 90.3 on LiveCodeBench v6, 89.2 on GPQA Diamond, 84.3 on OSWorld-Verified, and 79.0 on QwenSWEBench. Those are vendor-reported and unreproduced, and they describe a model that is competitive well above its weight class.

W niezależnym przebiegu Artificial Analysis Qwen3.8 27B uzyskuje 0,0556 w Terminal-Bench 4.0, 0,4664 w SciCode, 0,3392 w Humanity's Last Exam i 1423,21 w GDPval-AA v2.1. Postaw 0,0556 obok 84,3, które karta dostawcy podaje dla OSWorld, a charakter rozbieżności jest jasny: w pracy agentowej z komputerem i terminalem niezależny ranking umieszcza ten model mniej więcej tam, gdzie powinien znajdować się model gęsty 27B, a karta dostawcy nie.

Dwa wiersze przemawiają jednak w drugą stronę i warto je przytoczyć z tego samego powodu. Qwen3.8 27B uzyskuje 0.4824 w AutomationBench przeciwko 0.3541 Claude Haiku 5.5 — niezależne zwycięstwo o 12.8 punktu w najbliższym odpowiedniku benchmarku automatyzacji biznesowej, jaki ma którakolwiek z tablic. To prawdziwa liczba z tego samego przebiegu, w wierszu najbardziej zbliżonym do tego, do czego ludzie faktycznie wdrażają małe modele.

Uczciwa interpretacja nie brzmi: „dostawca wszystko zawyżył”. Brzmi tak: karta modelu mierzy zadania, które wybrali jej autorzy, niezależny panel mierzy stały zestaw, a mocne strony Qwen3.8 27B są na liście dostawcy, a nie na liście panelu.

Ekonomia zmienia się, gdy posiadasz sprzęt

Każda podana powyżej stawka to cena API, a w przypadku Qwen3.8 27B to niewłaściwe ujęcie.

To gęsty model 27B na licencji Apache 2.0. Mieści się na pojedynczym nowoczesnym akceleratorze przy kwantyzacji, którą zaakceptowałaby większość zespołów, co oznacza, że koszt krańcowy tokenu przestaje być licznikiem dostawcy, a staje się Twoim własnym wykorzystaniem. Właśnie dlatego cena wywołania go różni się w zależności od hosta w sposób, w jaki żaden z modeli własnościowych w tym porównaniu nigdy nie mógł: zestawienie odnotowuje stawkę strony trzeciej wynoszącą 0,50 USD za wejście i 3,00 USD za wyjście, a katalog OrcaRouter podaje ją jako 0,33 USD za wejście i 2,40 USD za wyjście bez żadnej pozycji odczytu z pamięci podręcznej, ponieważ uruchamiamy wagi na własnej infrastrukturze, a nie odsprzedajemy czyjegoś punktu końcowego.

Dla zespołu, który już płaci za GPU, porównanie nie sprowadza się do $0.21 kontra $1.01 na zadanie. To stawka rozliczeniowa dostawcy zestawiona z kosztem przyrostowym jednego żądania na sprzęcie, który sam posiadasz — a to są różne liczby. To jest argument po stronie otwartych wag i jedyny, który wytrzymuje zderzenie z tabelą benchmarków.

Istnieje drugi, mniej oczywisty skutek tego, że licencja to Apache 2.0: model można dostarczać w produkcie, dostrajać na własnym ruchu, przypiąć do konkretnej wersji i audytować aż do wag. Niczego z tego nie można dostać za żadną cenę od zastrzeżonego modelu udostępnianego wyłącznie przez API, a w przypadku obciążeń regulowanych jest to rozstrzygające ograniczenie, a nie preferencja.

A capture of the OrcaRouter model page for Qwen3.8 27B under qwen/qwen3.8-27b, showing a 262K-token context chip, text, image and video input, text output, a p50 time to first token of 1.84 seconds, public benchmarks by Qwen dated 2026-08-15, and the page's own description of the model as Alibaba's open-weight 27B dense multimodal model released under Apache-2.0 and self-hosted on OrcaRouter's own infrastructure.

Dzwonienie do któregokolwiek z nich

Qwen3.8 27B is on the OrcaRouter catalogue as qwen/qwen3.8-27b at $0.33 and $2.40 per million tokens, self-hosted on our own infrastructure, with the OpenAI-compatible endpoint at https://api.orcarouter.ai/v1. Run against our own traffic over the last week it returns a median 1,837 ms to first token at 319 output tokens per second — a fast model, measured on our playground rather than a standardised harness, so treat that as a serving figure and not a benchmark. Video, image and text input, 262K-token context, native tool calling, structured outputs and a reasoning mode are all supported on the same key as everything else on the catalogue.

Claude Haiku 5.5 nie znajduje się w katalogu. Jest dostępny bezpośrednio przez API dostawcy oraz przez AWS, Azure i główne platformy chmurowe — i to jest stwierdzenie zgodne z prawdą. To, co katalog faktycznie zawiera z oferty dostawcy, to Claude Sonnet 5.5 i Claude Opus 5.5, co sprawia, że ścieżka eskalacji z samodzielnie hostowanego małego modelu do hostowanego modelu agentowego klasy średniej jest zmianą routingu, a nie drugą integracją — automatyczny failover i tak działa pod spodem w obu przypadkach.

Werdykt, który jest niezwykle jednostronny

Jako wywołanie API na tekście lub obrazach, Claude Haiku 5.5 wygrywa to porównanie w każdym wierszu, który nie dotyczy licencjonowania. 9,7 punktu indeksu, 4,7x taniej na ukończone zadanie, czterokrotnie większe okno kontekstu, dwukrotnie wyższy limit odpowiedzi i pięć do sześciu razy niższa cena w reżimie krótkich promptów. Nie ma argumentu dotyczącego kształtu obciążenia, który ratuje Qwen3.8 27B pod względem ceny, ponieważ wada dostawcy — intensywne wykorzystanie tokenów wyjściowych — jest warta znacznie mniej niż jego przewaga w stawce.

Ratuje go wszystko to, czego cena API nie obejmuje: licencja pozwalająca na redystrybucję, wagi, które można trzymać u siebie i przypinać, wejście wideo oraz ścieżka samodzielnego hostowania, w której koszt za token to twój własny sprzęt, a nie karta dostawcy. Jeśli szukasz najtańszego sposobu na klasyfikowanie, wyodrębnianie, podsumowywanie i kierowanie tekstem, odpowiedzią jest Claude Haiku 5.5, a różnica nie jest mała. Jeśli szukasz modelu, który możesz umieścić we własnym produkcie, na własnym metalu, pod własnym audytem, to różnica w benchmarkach przestała być pytaniem już kilka akapitów temu.

Porównane w tym artykule1

Wykryto na podstawie tego artykułu · Benchmarki: Artificial Analysis · aktualizowane codziennie