
Qwen 3.8 vs Claude Opus 4.8: Tania skala spotyka specjalistę od rozumowania
- metaNOWOŚĆMeta: Muse Spark 1.22026-08-05$1.25 / $4.25 za 1 mln tokenów · 819 tok/s
- qwenNOWOŚĆQwen: Qwen3.8 Max2026-08-03$2.00 / $6.00 za 1 mln tokenów · 56 tok/s
- deepseekNOWOŚĆDeepSeek: DeepSeek V4 Flash 07312026-07-3150Inteligencja69Kod
- qwenNOWOŚĆQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 za 1 mln tokenów · 198 tok/s
- orcaNOWOŚĆOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicNOWOŚĆAnthropic: Claude Opus 52026-07-2461Inteligencja78Kod
- googleGoogle: Gemini 3.6 Flash2026-07-2150Inteligencja69Kod
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137Inteligencja49Kod
- metaMeta: Muse Spark 1.12026-07-1651Inteligencja71Kod
- kimiMoonshotAI: Kimi K32026-07-1557Inteligencja76Kod
- openaiOpenAI: GPT-5.6 Luna2026-07-0951Inteligencja71Kod
- openaiOpenAI: GPT-5.6 Terra2026-07-0955Inteligencja77Kod
- openaiOpenAI: GPT-5.6 Sol2026-07-0959Inteligencja77Kod
- grokxAI: Grok 4.52026-07-0854Inteligencja72Kod
- tencentTencent: Hy32026-07-0641Inteligencja59Kod
- obsidianQwen3.6 35B A3B Uncensored (Aggressive)2026-07-0232Inteligencja42Kod
- obsidianGemma4 26B A4B Uncensored (Balanced)2026-07-0226Inteligencja39Kod
- anthropicAnthropic: Claude Sonnet 52026-06-3053Inteligencja72Kod
- klingKling: Kling 3.0 Turbo2026-06-1757Inteligencja52Kod57Matematyka
- z-aiZ.ai: GLM 5.22026-06-1651Inteligencja69Kod60Matematyka
Alibaba zaprezentowała Qwen3.8-Max w Szanghaju 19 lipca 2026 roku jako model o 2,4 biliona parametrów, stworzony z myślą o skali i dokładności. Model Anthropica Claude Opus 4.8 to zupełnie inna bestia: flagowy model głębokiego rozumowania z wyższej półki, po który sięgają zespoły, gdy zadanie ma wiele kroków, a błędna odpowiedź jest kosztowna.
Przez dwa tygodnie trudno było uczciwie dokonać tego porównania, ponieważ Qwen nie opublikował ceny ani benchmarków. To zmieniło się 3 sierpnia 2026, gdy Qwen3.8-Max osiągnął ogólną dostępność z cennikiem $2 / $6 za milion tokenów oraz pełną tabelą benchmarków. Pytanie filozoficzne pozostaje takie samo — surowa skala i otwartość a niezawodność wnioskowania — ale teraz po obu stronach tej kwestii są liczby.
Notatka dla twórców — najszybszym sposobem na rozstrzygnięcie takiego pytania jest uruchomienie obu rozwiązań na własnych przepływach pracy. OrcaRouter udostępnia ponad 200 modeli za jednym punktem końcowym zgodnym z OpenAI, dzięki czemu możesz zestawić Qwen 3.8 Max z Opus 4.8 w tym samym zadaniu bez podłączania dwóch SDK.
Werdykt w skrócie. Opus 4.8 pozostaje specjalistą od rozumowania: po audycie znalazł się w czołowej grupie wskaźnika Artificial Analysis Intelligence Index i cieszy się zaufaniem w długich łańcuchach agentowych, gdzie błędna odpowiedź udzielona z pewnością siebie kosztuje więcej niż rachunek za tokeny. Jego słabościami są koszt i rozwlekłość — według AA jego średnia stawka wynosi około $3.85/1M przy maksymalnym wysiłku, a przy tym jest bardzo tokenochłonny, podczas gdy Grok 4.5 podobno wykonuje porównywalne zadania, zużywając około 4× mniej tokenów wyjściowych. Qwen3.8-Max odpowiada teraz czymś, czego mu brakowało w lipcu: realną, niską ceną $2 / $6 — stała stawka za 1M tokenów, z wejściem cache po $0.25 oraz tabelą benchmarków producenta, na czele z Terminal-Bench 2.1 86.6 i OSWorld-Verified 86.1. Wykazał się też prawdziwą rzetelnością w zadaniach agentowych w jedynym dostępnym teście zewnętrznym. Ale wciąż nie został oceniony przez żadnego niezależnego ewaluatora. Opus do rozumowania, któremu musisz zaufać; Qwen do pracy, w której priorytetem jest dokładność i niski koszt.
Najważniejsze wnioski
• Qwen3.8-Max jest w wersji GA od 3 sierpnia 2026 w cenie $2 / $6 za 1M tokenów, stała w całym kontekście 1M tokenów — rzeczywisty cennik, zastępujący tymczasową zniżkę promocyjną z lipca.
• Opus 4.8 jest znacznie droższy: Artificial Analysis szacuje jego łączny koszt na około $3.85/1M przy maksymalnym wysiłku, i jest tokenochłonny — według doniesień ~4× więcej tokenów wyjściowych na zadanie niż Grok 4.5, więc długie przebiegi agentowe pogłębiają tę różnicę.
• Źródła są sprzeczne co do dokładnego wyniku AA Opusa 4.8. W AA v4.1, Kimi K3 (57.1) jest podobno tuż powyżej, więc wiarygodne stwierdzenie to „górna grupa, poniżej liderów Fable 5 / GPT-5.6 Sol", a nie pojedynczy twardy wynik.
• Qwen ma teraz wyniki agentowe, raportowane samodzielnie: Terminal-Bench 2.1 86.6, OSWorld-Verified 86.1, FrontierSWE 73.5 (z 40.7 poprzednika). Żadne nie zostały niezależnie zweryfikowane.
• Jeden zewnętrzny punkt danych dotyczący agenta Qwena jest korzystny: w porównaniu z Kimi K3 uzyskał 354 cytowania repozytoriów do 274, zużył 22 żądania bramki do 53, i zarejestrował 0 nieudanych wywołań narzędzi do 2 — przy wyniku 80/100 do 83 Kimi.
• Otwartość rozchodzi się na stałe: Qwen obiecuje otwarte wagi w ciągu tygodnia plus Qwen3.8-27B o ~17 GB VRAM; Opus 4.8 jest zamknięty i dostępny wyłącznie przez API.
Uwaga o dokładności: wszystkie dane dotyczące jakości Qwen3.8-Max pochodzą z raportów Alibaba i nie zostały zweryfikowane przez strony trzecie. Dane dotyczące Opus 4.8 przypisywane są serwisowi Artificial Analysis oraz wymienionym z nazwy źródłom i mogą różnić się od raportów samego Anthropica; ponieważ zestawienia różnią się co do dokładnego indeksu Opusa, podajemy jego względną pozycję zamiast pojedynczej liczby. Cennik Qwen to karta stawek GA i zastępuje lipcowy rabat z wersji preview.
Specyfikacje i cena, obok siebie
Oto twarde dane, każda liczba przypisana do swojego źródła.
• Producent / status — Qwen3.8-Max: Alibaba; GA (3 sierpnia 2026); Claude Opus 4.8: Anthropic; GA — flagowy model z głębokim rozumowaniem
• Architektura — Qwen3.8-Max: ~2,4T łącznie, rzadki MoE (aktywne parametry wciąż nieujawnione); Opus 4.8: Zamknięty; architektura nieujawniona
• Okno kontekstu — Qwen3.8-Max: 1M tokenów (983 616 z trybem myślenia; maks. wyjście 131 072); Opus 4.8: flagowy model o długim kontekście
• AA Intelligence Index — Qwen3.8-Max: Nadal bez wyniku; Opus 4.8: Najwyższy klaster, poniżej liderów (Artificial Analysis; Kimi K3 z wynikiem 57.1 notowany tuż powyżej)
• Główna siła — Qwen3.8-Max: skala, dokładność, ekonomia długiego kontekstu; Opus 4.8: Głębokie wieloetapowe rozumowanie + niezawodność agentowa
• Wyniki agentowe raportowane przez dostawcę — Qwen3.8-Max: Terminal-Bench 2.1 86.6, OSWorld-Verified 86.1 (raportowane przez Alibaba); Opus 4.8: n/a — reputację zdobywa się w produkcji
• Ceny (wejście / wyjście) — Qwen3.8-Max: $2.00 / $6.00 za 1M, stała stawka; wejście z pamięci podręcznej $0.25; Opus 4.8: Premium — uśredniona AA ~$3.85/1M przy maksymalnym wysiłku
• Efektywność tokenów — Qwen3.8-Max: rozwlekły; IFBench 82.8 to jego najsłabszy deklarowany wynik; Opus 4.8: generujący dużo tokenów — ~4× więcej danych wyjściowych niż Grok 4.5 (według raportów)
• Otwarte wagi — Qwen3.8-Max: Obiecane w tym tygodniu (jeszcze bez licencji); Opus 4.8: Nie — zamknięty / tylko API
Dwie rzeczy wyznaczają ramy tego porównania i obie przesunęły się 3 sierpnia.
Po pierwsze, luka kosztowa jest teraz mierzalna, a nie tylko teoretyczna. W lipcu przewaga Qwen była zniżką, na której nie można było oprzeć budżetu. Teraz jest to stawka, a kształt luki jest nietypowy: Opus jest drogi i wymagający dużej liczby tokenów, co oznacza, że oba te czynniki się mnożą. Jeśli Opus generuje cztery razy więcej tokenów wyjściowych dla tego samego zadania i pobiera wyższą stawkę za token, długi przebieg agentowy może kosztować wielokrotnie więcej, niż sugerują stawki katalogowe. Stawka wyjściowa Qwen wynosząca $6, stały kontekst 1M i $0.25 za buforowane wejście uderzają dokładnie w to zwielokrotnienie.
Po drugie, kolumna benchmarków Qwena nie jest już pusta — i wreszcie część z nich jest bezpośrednio istotna. Cała obietnica Opusa 4.8 to niezawodność agentowa, a Alibaba opublikowała właśnie wyniki agentowe: Terminal-Bench 2.1 86.6 za operacje w powłoce, OSWorld-Verified 86.1 za sterowanie prawdziwym GUI. Mierzą one właściwe rzeczy. Zastrzeżenie dotyczy pochodzenia, nie istotności: Alibaba uzyskała je na własnej platformie testowej, a żadna strona trzecia ich nie odtworzyła. Tymczasem reputacja Opusa opiera się na czymś trudniejszym do opublikowania, ale prawdopodobnie cenniejszym — ciągłym użytkowaniu produkcyjnym w wielu zespołach, co jest rodzajem dowodu, którego tabela dostawcy nie jest w stanie wyprodukować.

Niezawodność rozumowania a surowa dokładność
Interesująca różnica między tymi dwoma nie polega na jakości jednorazowego wyniku — chodzi o to, jak zachowują się, gdy zadanie ma wiele kroków i jest powiązane z prawdziwymi narzędziami.
Reputacja Opusa 4.8 opiera się na niezawodności agentycznej: długich łańcuchach rozumowania, w których śledzi kontekst, wychodzi ze ślepych zaułków i zwraca odpowiedzi, na których można działać bez sprawdzania każdego kroku. To właśnie za tę właściwość zespoły płacą premię, ponieważ w produkcji koszt pewnej siebie, ale błędnej odpowiedzi wieloetapowej przewyższa rachunek za tokeny. Minusem jest to, że Opus zużywa dużo tokenów — Grok 4.5 podobno wykonuje porównywalne zadania przy około 4× mniejszej liczbie tokenów wyjściowych — więc jego niezawodność wiąże się z realnym, ciągłym kosztem.
Qwen 3.8 odpowiada innym rodzajem siły: czystą dokładnością, i istnieje już jeden niezależny punkt danych na ten temat. W teście rozumienia architektury przeprowadzonym przez Trilogy AI (Qwen3.8-Max vs Kimi K3), Qwen uzyskał 80/100 do 83 Kimiego — przegrywając w głównym wskaźniku — ale to on był bardziej skrupulatnym agentem, generując 354 cytowania repozytoriów wobec 274 Kimiego, używając 22 żądań gateway wobec 53, i notując 0 nieudanych wywołań narzędzi wobec 2. Oba modele osiągnęły ten sam kluczowy wniosek architektoniczny; Qwen po prostu wykonał więcej pracy nad ugruntowaniem, aby tam dotrzeć, przy czystszym użyciu narzędzi.
Ten wynik zerowej liczby nieudanych wywołań narzędzi to najbardziej zachęcający sygnał agentowy, jaki ma Qwen, ponieważ to właśnie nieudane wywołania narzędzi psują agentów produkcyjnych. To jednak także jeden test, na jednym zadaniu, przeprowadzony przez jednego ewaluatora — daleko mu do bazy dowodowej stojącej za reputacją Opusa.
Kosztem dokładności Qwena były opóźnienie i tokeny. Recenzenci z czasów preview uznali go za „bardzo dobry i bardzo wolny” — 30+ minut na zbudowanie strony, ponad godzinę na symulację pokera, najwolniejszy model, z jakiego ten recenzent korzystał. Obecnie należy wziąć pod uwagę dwa zastrzeżenia. To było infrastruktura wersji preview, a serwowanie GA to inny system; 7-dniowa telemetria OrcaRouter obecnie pokazuje p50 czasu do pierwszego tokena wynoszące 1,64 sekundy, chociaż TTFT i przepustowość end-to-end w godzinnych buildach to różne wielkości. To ustalenie zasługuje na ponowne przetestowanie, a nie powtarzanie.
Istnieje również kwestia strukturalna, którą warto nazwać: najsłabszym zgłoszonym wynikiem Alibaba jest IFBench 82.8, czyli podążanie za instrukcjami w warunkach ograniczeń. W przypadku potoków agentowych, które na każdym kroku analizują wynik modelu, model wykraczający poza zakres i dodający niezlecone zadania jest obciążeniem, niezależnie od tego, jak dokładny jest. To właśnie tutaj dyscyplina Opusa zapracowuje na swoją premię.

Koszt w praktyce: gdzie 4× luka tokenów daje się we znaki
Weźmy wieloetapowe uruchomienie agenta: 80 000 tokenów kontekstu wejściowego i — to jest kluczowa zmienna — różne objętości danych wyjściowych, ponieważ Opus podobno generuje około 4× więcej.
• Qwen3.8-Max przy 8 000 tokenach wyjściowych: 0,08M × $2 = $0,16, plus 0,008M × $6 = $0,048. ≈ $0,21 za uruchomienie.
• Opus 4.8 przy mieszanej cenie ~3,85 USD/1M dla 80 000 tokenów wejściowych + ~32 000 wyjściowych (4× liczba tokenów): około 0,43 USD za przebieg przy wycenie mieszanej — i znacząco więcej, jeśli wycenisz wejście i wyjście osobno według stawek poziomu premium.
• Przy 3 000 uruchomień/dzień: Qwen ≈ $630/dzień; Opus ≈ $1 290/dzień lub więcej.
• Przy buforowanym wejściu Qwena po 0,25 USD/1M w stabilnym kontekście, jego koszt spada do ≈ 0,07 USD — czyli około 6× taniej niż Opus.
Uczciwą przeciwwagą jest ta, która zawsze stosuje się do porównań z Opusem: jeśli Opus rozwiązuje zadanie za jednym podejściem, podczas gdy tańszy model potrzebuje dwóch podejść plus przeglądu przez człowieka, tańszy model wcale nie jest tańszy. Rozwlekłość Opusa jest po części mechanizmem jego niezawodności — rozumuje na głos, a to kosztuje tokeny. Pytanie dla Twojego obciążenia pracą brzmi, czy płacisz za rozważanie, którego potrzebujesz. W przypadku rozumowania o wysokiej stawce i niskiej objętości prawdopodobnie tak. W przypadku analizy o dużej objętości, którą i tak weryfikujesz później, prawdopodobnie nie.
Otwartość i kwestia on-premise
Opus 4.8 jest zamknięty i dostępny wyłącznie przez API, na stałe. Qwen3.8-Max może nie być — wagi są obiecane w ciągu tygodnia — ale flagowy model nie jest realistycznym celem do samodzielnego hostingu: około 1,2 TB przy 4-bitach wobec około 141 GB na H200 oznacza osiem lub więcej akceleratorów najwyższej klasy, a przy wciąż nieujawnionej liczbie aktywnych parametrów nie da się oszacować przepustowości, jaką zapewniłby ten nakład. Nie ma też jeszcze tekstu licencji, więc komercyjna użyteczność jest formalnie nieokreślona.
Jednocześnie zapowiedziany Qwen3.8-27B jest praktycznym wydaniem dla zespołów, których interesuje kontrola, a nie surowa wydajność. Również udostępniany z otwartymi wagami, podobno działa w około 17GB pamięci VRAM — pojedyncza karta z wyższej półki. Jeśli porównujesz z modelem Opus, ponieważ potrzebujesz rozumowania we własnej sieci, 27B to model do oceny; otwartość flagowego 2.4T jest w większości teoretyczna.
Często zadawane pytania
Czy Qwen 3.8 jest lepszy od Claude Opus 4.8?
Nie na podstawie istniejących dowodów. Opus 4.8 znajduje się w najwyższym klastrze audytowanego Artificial Analysis Intelligence Index i jest sprawdzony w głębokim agentycznym rozumowaniu w produkcji. Qwen3.8-Max ma mocną tabelę samodzielnie zgłaszaną (Terminal-Bench 2.1 86.6, OSWorld-Verified 86.1) oraz jeden korzystny test agentyczny od strony trzeciej, ale żadnego niezależnego wyniku. Qwen wygrywa ceną; Opus wygrywa dowodem i niezawodnością rozumowania.
Dlaczego numer benchmarku Opus 4.8 jest opisany tak niejasno?
Ponieważ trackery rzeczywiście są ze sobą sprzeczne. W AA v4.1 Kimi K3 (57.1) jest raportowany tuż powyżej Opus 4.8, co umieszcza go w górnym klastrze, ale poniżej liderów Fable 5 / GPT-5.6 Sol — jednak różne źródła podają to inaczej, więc podawanie jednej twardej liczby wprowadzałoby w błąd. Jego względna pozycja jest wiarygodnym stwierdzeniem.
O ile tańszy jest Qwen 3.8 niż Claude Opus 4.8?
Co istotne, a różnica powiększa się przy dłuższych przebiegach. Qwen3.8-Max kosztuje 2 $ / 6 $ za 1M płasko, z wejściem z pamięci podręcznej po 0,25 $. Artificial Analysis szacuje mieszany koszt Opusa na około 3,85 $/1M przy maksymalnym wysiłku, a Opus jest podobno ~4× bardziej tokenochłonny niż Grok 4.5 — więc różnica cen mnoży się wraz z wielkością odpowiedzi. W typowym przebiegu wieloetapowym Qwen wypada mniej więcej 2–6× taniej, w zależności od buforowania.
Czy Qwen 3.8 Max opuścił już wersję preview?
Tak, 3 sierpnia 2026 r. Ma opublikowany cennik oraz endpoint zgodny z OpenAI i DashScope, więc lipcowa kampania kredytów Qoder i komunikat o 90% zniżki nie opisują już sposobu, w jaki jest sprzedawany.
Czy Qwen 3.8 jest niezawodny do pracy agentowej?
Wczesne sygnały są zachęcające, ale skąpe. Alibaba podaje {{1}}Terminal-Bench 2.1 86.6{{/1}} i {{2}}OSWorld-Verified 86.1{{/2}}, a w jednym teście niezależnym odnotowała zero nieudanych wywołań narzędzi, podczas gdy rywal miał dwa. W porównaniu z tym jej najsłabszy deklarowany wynik to {{3}}IFBench 82.8{{/3}} w zakresie podążania za instrukcjami, a testerzy wersji zapoznawczej wielokrotnie zauważali, że wykracza poza zakres — realne ryzyko dla potoków, które parsują wynik każdego kroku.
Czy mogę samodzielnie hostować Qwen 3.8, aby uniknąć drogiego abonamentu Opus?
Realnie rzecz biorąc, to nie jest flagowy model. Wagi mają zostać udostępnione w ciągu tygodnia, ale nie opublikowano licencji, a przy ~1,2 TB w kwantyzacji 4-bitowej potrzebowałbyś ośmiu lub więcej GPU klasy H200. Równolegle zapowiedziany Qwen3.8-27B, rzekomo zajmujący ~17 GB VRAM, jest realną opcją. Opus 4.8 jest zamknięty, więc nie ma tam w ogóle ścieżki self-hostingu.
Którego powinienem dzisiaj użyć?
Opus 4.8 do zadań produkcyjnych wymagających krytycznego rozumowania lub zadań agentowych, którym musisz móc zaufać — tam, gdzie błędna wieloetapowa odpowiedź jest kosztowna. Qwen3.8-Max do zadań wrażliwych na koszty i stawiających na dokładność — zwłaszcza analizy długiego kontekstu, gdzie stała stawka 1M i 0,25 USD za dane wejściowe z pamięci podręcznej sprawiają, że z ekonomią trudno dyskutować.
Sedno sprawy
Qwen 3.8 vs Claude Opus 4.8 to wciąż zestawienie odmiennych filozofii, ale ekonomia nie jest już hipotetyczna. Qwen3.8-Max wszedł do GA z realną wyceną, która znacząco przebija Opusa, a luka się pogłębia, ponieważ Opus jest zarówno drogi premium, jak i bardzo tokenochłonny. Qwen opublikował też wyniki agentowe, które trafiają wprost w rodzimy teren Opusa, a jego jeden test agentowy przeprowadzony przez stronę trzecią wykazał czystsze użycie narzędzi niż u silnego rywala.
Opus zachowuje przewagę tam, gdzie zawsze ją miał: zweryfikowaną pozycję w najwyższym klastrze oraz udokumentowane osiągnięcia w niezawodnym rozumowaniu wieloetapowym, których nie zastąpi żadna tabela od dostawców. Pozostałe braki Qwen to te dobrze znane — brak niezależnej oceny, brak ujawnionej liczby aktywnych parametrów, brak licencji oraz deklarowana przez samych twórców słabość w podążaniu za instrukcjami, która ma znaczenie dokładnie w tych pipeline'ach agentowych, do których wybierany jest Opus. Obserwuj dwa wydarzenia: pierwszy niezależny wynik Intelligence Index oraz publikację wag wraz z licencją. Do tego czasu Opus to model, któremu powierzasz kosztowne decyzje, a Qwen 3.8 to ten, do którego kierujesz wolumen — sprawdzone na własnych przepływach pracy.

Porównane w tym artykule4
Wykryto na podstawie tego artykułu · Benchmarki: Artificial Analysis · aktualizowane codziennie
