Qwen 3.8 kontra GPT-5.6: Teraz, gdy oba mają ceny, który wygrywa?
Guides & Insights

Qwen 3.8 kontra GPT-5.6: Teraz, gdy oba mają ceny, który wygrywa?

Autor

jinhao song

Data publikacji

Najnowsze modele · 20Zobacz wszystkie modele
Benchmarki: Artificial Analysis · aktualizowane codziennie
Powrót do wszystkich wpisów

When Alibaba previewed Qwen3.8-Max in Shanghai on July 19, 2026, the community reaction was immediate: this 2.4-trillion-parameter model was "supposedly ahead of GPT-5.6 and only slightly behind Fable 5." OpenAI's GPT-5.6 in its flagship Sol configuration sits at #2 on the independent Artificial Analysis Intelligence Index, one point below Fable 5, so that was a large claim to make with no published numbers behind it.

Od tego czasu zmieniły się dwie rzeczy. Qwen3.8-Max stał się ogólnie dostępny 3 sierpnia 2026 roku z prawdziwym cennikiem i prawdziwą tabelą benchmarków. A 31 lipca OpenAI obniżyło ceny w całej rodzinie GPT-5.6 — Terra do 2 $ / 12 $, Luna do 0,20 $ / 1,20 $, a Sol pozostał bez zmian w warstwie premium. Tak więc to zestawienie nie jest już twierdzeniem wbrew rankingowi; to dwa wycenione, udokumentowane modele, które naprawdę można porównać.

Uwaga dla twórców — najszybszy sposób rozstrzygnięcia tego typu sporu to uruchomienie obu modeli na własnych promptach. OrcaRouter zapewnia dostęp do ponad 200 modeli za jednym endpointem zgodnym z OpenAI, dzięki czemu możesz zestawić Qwen 3.8 Max z GPT-5.6 przy tym samym zadaniu, bez konfigurowania dwóch SDK-ów.

Werdykt w skrócie. Qwen3.8-Max w wersji GA ma agresywną cenę — $2 / $6 za 1M, jednolita w zakresie 1M tokenów — co daje jej taką samą cenę wejściową jak GPT-5.6 Terra, ale połowę kosztu wyjścia Terra, i znacznie poniżej Sol. Jego deklarowane wyniki są mocne (GPQA Diamond 92.6, Terminal-Bench 2.1 86.6). Ale GPT-5.6 Sol wciąż wygrywa w dwóch rzeczach, które decydują o zastosowaniu produkcyjnym: jest audytowanym #2 w Artificial Analysis Intelligence Index (~59) i jest szybki — do 750 tokenów/s na sprzęcie Cerebras. Qwen3.8-Max wciąż nie ma oceny żadnego niezależnego ewaluatora. Więc Qwen może równie dobrze dorównać GPT-5.6 pod względem jakości w trybie one-shot i wyraźnie pokonuje Terra ceną wyjścia; GPT-5.6 wygrywa pod względem recenzowanych dowodów i przepustowości, co często stanowi o wszystkim.

Najważniejsze wnioski

Qwen3.8-Max jest GA od 3 sierpnia 2026 z opublikowanymi cenami $2 / $6 za 1M tokenów, jednolita stawka w całym kontekście 1M tokenów.

W porównaniu z GPT-5.6 Terra (2 $ / 12 $ po cięciu cen przez OpenAI 31 lipca), Qwen dorównuje ceną za wejście i obniża o połowę stawkę za wyjście. W porównaniu z Sol, Qwen jest dramatycznie tańszy.

GPT-5.6 Sol ma audyt #2 na AA Intelligence Index (~59), a Artificial Analysis zauważa, że przoduje w najtrudniejszych problemach STEM. Qwen3.8-Max jest nadal nieoceniony przez AA i LMArena.

Szybkość to najostrzejszy kontrast. GPT-5.6 osiąga do 750 tokenów na sekundę na Cerebras. Qwen był najwolniejszym modelem w testach hands-on wersji preview — to ustalenie pochodzi sprzed udostępnienia GA i wymaga ponownego przetestowania.

Tabela producenta Qwen jest wiarygodna, ale nierecenzowana:GPQA Diamond 92.6, PaperBench 93.0, Terminal-Bench 2.1 86.6, OSWorld-Verified 86.1, FrontierSWE 73.5 (wzrost z 40.7 poprzednika).

Otwartość dzieli je na stałe: Qwen obiecuje otwarte wagi w ciągu tygodnia oraz Qwen3.8-27B o ~17GB VRAM; GPT-5.6 jest zamknięty i dostępny tylko przez API.

Uwaga dotycząca dokładności: wszystkie dane dotyczące jakości Qwen3.8-Max pochodzą od firmy Alibaba i nie zostały zweryfikowane przez strony trzecie. Dane GPT-5.6 pochodzą z Artificial Analysis i mogą różnić się od raportów samego OpenAI. Cennik rodziny GPT-5.6 odzwierciedla obniżkę OpenAI z 31 lipca 2026 r. Cennik Qwen to stawka GA i zastępuje lipcową zniżkę promocyjną wersji zapoznawczej.

Specyfikacje i cena, obok siebie

Oto twarde dane, każda liczba przypisana do swojego źródła.

• Producent / status — Qwen3.8-Max: Alibaba; GA (3 sierpnia 2026); GPT-5.6 Sol: OpenAI; zamknięty flagowiec (warianty Sol / Terra / Luna)

• Architektura — Qwen3.8-Max: ~2,4T łącznie, rzadki MoE (aktywne parametry wciąż nieujawnione); GPT-5.6 Sol: zamknięty; architektura nieujawniona

• Okno kontekstu — Qwen3.8-Max: 1M tokenów (983 616 z myśleniem; maks. wynik 131 072); GPT-5.6 Sol: flagowy model z długim kontekstem

• AA Intelligence Index — Qwen3.8-Max: Nadal bez punktacji; GPT-5.6 Sol: ~59 — #2 (Artificial Analysis)

• Zweryfikowane mocne strony — Qwen3.8-Max: brak od podmiotów trzecich; GPT-5.6 Sol: Przoduje w najtrudniejszych problemach STEM (Artificial Analysis)

• Mocne strony wg producenta — Qwen3.8-Max: GPQA Diamond 92.6, Terminal-Bench 2.1 86.6, OSWorld-Verified 86.1 (wg Alibaba); GPT-5.6 Sol: brak danych

• Szybkość — Qwen3.8-Max: p50 TTFT 1,64 s (7-dniowa telemetria OrcaRouter); najwolniejszy model w testach praktycznych wersji preview; GPT-5.6 Sol: do 750 tok/s na Cerebras (Artificial Analysis)

• Cennik (wejście / wyjście) — Qwen3.8-Max: $2.00 / $6.00 za 1M, stała stawka; wejście z pamięci podręcznej $0.25; GPT-5.6: Terra $2 / $12, Luna $0.20 / $1.20, Sol premium (około 1/3 kosztu Fable na AA)

• Otwarte wagi — Qwen3.8-Max: Obiecane w tym tygodniu (brak jeszcze licencji); GPT-5.6: Nie — zamknięty / tylko API

Dwie rzeczy wyznaczają ramy tego porównania i obie są nowe od lipca.

Po pierwsze, historia cen stała się naprawdę interesująca, a nie tylko tania. W lipcu przewagą Qwena był rabat niemożliwy do zaplanowania. Teraz porównanie jest konkretne i dzieli się na poziomy. W porównaniu z Terra po $2 / $12, Qwen dorównuje dokładnie stawce wejściowej i obcina stawkę wyjściową o połowę — to realna przewaga w zadaniach wymagających intensywnego rozumowania, gdzie koszty wyjścia dominują. W porównaniu z Luna po $0.20 / $1.20, Qwen jest 10× droższy, a Luna jest lepszym wyborem do prostych, masowych zadań. W porównaniu z Sol, Qwen jest znacznie tańszy. Tak więc „co jest tańsze” ma teraz trzy różne odpowiedzi w zależności od tego, o który GPT-5.6 chodzi — a uczciwe ujęcie jest takie, że obniżka OpenAI z 31 lipca znacznie zmniejszyła różnicę.

Po drugie, jeśli chodzi o prędkość, te dwa modele wciąż różnią się najbardziej, i wciąż to OpenAI ma przewagę. Artificial Analysis odnotowuje GPT-5.6 Sol z prędkością do 750 tokenów na sekundę na sprzęcie Cerebras. Nic w materiałach GA Alibaba nie sugeruje, że Qwen3.8-Max jest zaprojektowany pod taką przepustowość, a recenzent z fazy podglądowej, który nazwał go najwolniejszym modelem, jakiego używał, mierzył właśnie długie przebiegi agentowe, w których przepustowość się kumuluje. Jeśli Twoje obciążenie jest interaktywne, agentowe lub masowe, ta różnica może zadecydować o wyniku starcia, zanim jakość w ogóle wejdzie do gry.

Dowód: co tabela benchmarków GA rozstrzyga, a czego nie rozstrzyga.

Decyzja Alibaby o opublikowaniu liczb przy GA jest prawdziwym ulepszeniem w porównaniu z wersją preview, gdzie twierdzenie społeczności „przed GPT-5.6” nie opierało się na niczym opublikowanym. Tabela jest mocna: GPQA Diamond 92.6 w naukach na poziomie magisterskim, PaperBench 93.0 w odtwarzaniu wyników badań, Terminal-Bench 2.1 86.6 w obsłudze prawdziwego shella, OSWorld-Verified 86.1 w sterowaniu pulpitem GUI. Wyróżnia się generacyjny skok w kodowaniu — FrontierSWE 73.5 wobec 40.7 poprzednika i DeepSWE 1.1 56.6 wobec 21.6.

To, czego tabela nie robi, to rozstrzygnięcie porównania GPT-5.6, z dwóch powodów.

Pierwsza kwestia to pochodzenie. Każda liczba została wygenerowana przez Alibaba na własnym stanowisku testowym. Tabele dostawców są wybierane, a nie próbkowane — laboratorium publikuje benchmarki, w których wypada dobrze, i pomija pozostałe. Natomiast drugie miejsce OpenAI w Intelligence Index zostało przyznane przez ewaluatora, który nie ma interesu w wyniku. Co istotne, Artificial Analysis w szczególności przypisuje GPT-5.6 Sol przodowanie w najtrudniejszych problemach STEM, co jest dokładnie obszarem, do którego ma pretendować wynik Qwen GPQA Diamond 92.6. Jedno z tych twierdzeń zostało sprawdzone.

Po drugie, najsłabszy wynik samego Alibaby jest wymowny. IFBench 82.8 — czyli wykonywanie poleceń w warunkach ograniczeń — to najniższy wynik w jego tabeli i dokładnie pokrywa się z najbardziej powtarzającą się krytyką z okresu przedpremierowego: model dostarcza za dużo, wykracza poza zakres i dodaje rzeczy, o które nikt nie prosił. To urocze w wersji demo, ale kosztowne, gdy wynik rozliczany jest po 6 dolarów za milion tokenów, a potrzebujesz dokładnego formatu. W przypadku potoków agentowych, w których kolejne etapy analizują wynik, dyscyplina w podążaniu za instrukcjami ma większe znaczenie niż punkt w GPQA.

Dla odniesienia: poprzednik Qwen3.7-Max uzyskał 46 w indeksie inteligencji AA wobec ~59 dla GPT-5.6 Sol. Nadrobienie trzynastu punktów w jednej generacji byłoby niezwykłym skokiem. Możliwe — niemal dwukrotny wzrost wyników własnego FrontierSWE firmy Alibaba sugeruje realny postęp — ale dopóki recenzent nie poda liczby, „przewaga nad GPT-5.6" pozostaje nieudowodnionym twierdzeniem, a nie wynikiem.

Koszt w praktyce: przykład obliczeniowy dla poszczególnych poziomów

Weźmy agenta rozumującego, który wysyła 100 000 tokenów kontekstu i generuje 10 000 tokenów wyniku na jedno wywołanie — kształt typowy dla analizy dokumentów lub planowania wieloetapowego.

Qwen3.8-Max: 0,1M × 2 USD = 0,20 USD, plus 0,01M × 6 USD = 0,06 USD. ≈ 0,26 USD za wywołanie.

GPT-5.6 Terra: 0,1 mln × 2 $ = 0,20 $, plus 0,01 mln × 12 $ = 0,12 $. ≈ 0,32 $ za wywołanie.

GPT-5.6 Luna: 0.1M × $0.20 = $0.02, plus 0.01M × $1.20 = $0.012. ≈ $0.03 za wywołanie.

• Przy 5 000 wywołań dziennie: Qwen ≈ $1,300, Terra ≈ $1,600, Luna ≈ $160.

Płyną z tego dwie lekcje. W zestawieniu z Terą oszczędność Qwen jest realna, ale skromna — około 19% w tym wariancie — i daleko jej do przewagi o rząd wielkości, jaką Qwen cieszy się nad modelami premium, takimi jak Fable 5 czy Sol. Każdy, kto zakładał, że OpenAI jest strukturalnie drogie, powinien zaktualizować swoje przekonania: obniżka z 31 lipca w dużej mierze zneutralizowała historię cenową Qwen w średniej półce.

Qwen wyraźnie wyróżnia się pod względem długiego kontekstu i buforowania. Ponieważ stawka $2/$6 jest płaska dla całego okna o długości 1M tokenów, prompt składający się z 900 000 tokenów kosztuje tyle samo na token co krótki prompt, podczas gdy wielu konkurentów pobiera dodatkowe opłaty za długie wejścia. A buforowane dane wejściowe po 0,25 USD za 1M obniżają koszty wejściowe 8× w przypadku powtarzających się kontekstów: powyższe wywołanie spada z 0,26 USD do około 0,09 USD, gdy kontekst jest buforowany. Jeśli Twój agent czyta ponownie w większości stabilny kontekst w każdej turze, to właśnie tam leży trwała przewaga — nie w stawce nagłówkowej.

Openness i siostrzany model 27B

GPT-5.6 nigdy nie będzie można hostować samodzielnie. Qwen3.8-Max może być — Alibaba twierdzi teraz, że wagi pojawią się w ciągu tygodnia — ale flagowy model nie jest praktycznym celem: około 1,2 TB przy kwantyzacji 4-bitowej wobec około 141 GB na H200 oznacza osiem lub więcej akceleratorów z najwyższej półki, a przy wciąż nieujawnionej liczbie aktywnych parametrów nie można nawet modelować przepustowości, jaką to daje. Nie ma też nadal tekstu licencji, co oznacza, że możliwość wykorzystania komercyjnego jest formalnie nieokreślona.

Ogłoszony równocześnie Qwen3.8-27B jest bardziej znaczącą premierą dla każdego, kogo zainteresowanie Qwenem dotyczy kontroli, a nie surowej mocy. Ten model również ma otwarte wagi i według doniesień mieści się w około 17 GB VRAM — pojedyncza karta konsumencka z wyższej półki — co czyni go realną opcją on-premise, czego flagowy model 2.4T nigdy nie będzie. Jeśli porównujesz Qwena z GPT-5.6, bo potrzebujesz rezydencji danych, 27B to model, który należy ocenić.

Często zadawane pytania

Czy Qwen 3.8 jest lepszy od GPT-5.6?

Nie na podstawie istniejących dowodów. Tabela GA Alibaby jest mocna (GPQA Diamond 92.6, Terminal-Bench 2.1 86.6), ale w całości oparta na własnych deklaracjach i żaden niezależny ewaluator nie ocenił modelu. GPT-5.6 Sol posiada audytowany Indeks Inteligencji na poziomie #2 (~59), przoduje w najtrudniejszych problemach STEM według Artificial Analysis i osiąga do 750 tokenów na sekundę. GPT-5.6 wygrywa pod względem dowodów i szybkości.

Czy twierdzenie, że 'Qwen 3.8 wyprzedza GPT-5.6', jest prawdziwe?

Zaczęło się jako odczucie społeczności i nadal pozostaje niezweryfikowane. GA przedstawiło własną tabelę benchmarków Alibaby, ale bez żadnego zewnętrznego wyniku — Artificial Analysis i LMArena pozostają bez punktacji. Poprzednik, Qwen3.7-Max, uzyskał 46 punktów wobec ~59 Sol, więc to twierdzenie wymaga bardzo dużego skoku o jedną generację, aby utrzymało się dosłownie.

Co jest tańsze, Qwen 3.8 czy GPT-5.6?

To zależy od poziomu, a odpowiedź zmieniła się 31 lipca, gdy OpenAI obniżyło ceny. Qwen3.8-Max kosztuje 2 $ / 6 $ za 1M. GPT-5.6 Terra kosztuje 2 $ / 12 $ — ta sama cena za wejście, podwójna za wyjście, więc Qwen tu wygrywa. Luna kosztuje 0,20 $ / 1,20 $, dzięki czemu jest około 10× tańsza od Qwena. Sol jest premium, więc Qwen jest znacznie tańszy niż Sol.

Który jest szybszy?

GPT-5.6, zdecydowanie pod względem przepustowości. Artificial Analysis raportuje do 750 tokenów/s na sprzęcie Cerebras. Qwen3.8-Max pokazuje p50 czasu do pierwszego tokena na poziomie 1,64 sekundy w 7-dniowej telemetrii OrcaRouter, ale recenzenci wersji zapoznawczej uznali go za bardzo wolny przy długich buildach agentowych — to ustalenie poprzedza serwowanie GA i zasługuje na ponowne przetestowanie.

Czy Qwen 3.8 Max opuścił już wersję preview?

Tak, 3 sierpnia 2026 r. Ma teraz opublikowaną kartę taryfową oraz punkt końcowy zgodny z OpenAI i DashScope, więc lipcowe ujęcie kampanii kredytów Qoder z 90% rabatem nie opisuje już sposobu, w jaki jest sprzedawane.

Czy mogę samodzielnie hostować Qwen 3.8, aby uniknąć opłat OpenAI?

Realistycznie rzecz biorąc, to nie jest model flagowy. Wagi są zapowiedziane na ten tydzień, ale nie opublikowano żadnej licencji, a przy ~1,2 TB w 4-bitach potrzebowałbyś ośmiu lub więcej GPU klasy H200. Równolegle ogłoszony Qwen3.8-27B, podobno ~17 GB pamięci VRAM, jest praktyczną opcją.

Którego powinienem dzisiaj użyć?

GPT-5.6 Sol do wszystkiego, co jest wrażliwe na opóźnienia, interaktywne lub krytyczne pod względem rozumowania, gdzie liczy się audytowana jakość. Luna do prostych zadań o dużej skali, gdzie jest najtańsza z dużą przewagą. Qwen3.8-Max tam, gdzie długi kontekst i buforowanie promptów dominują w rachunku — jej płaska stawka za 1M tokenów i 0,25 USD za buforowane wejście to najmocniejsze elementy oferty.

Sedno sprawy

Qwen 3.8 vs GPT-5.6 to bardziej wyrównana walka niż w lipcu i nieco mniej jednostronna pod względem ceny, niż oczekiwali fani Qwena. Qwen3.8-Max pojawił się w wersji GA z realnymi cenami, wiarygodną tabelą własnych benchmarków oraz stałą stawką za 1M tokenów i tanim cache'owaniem, co czyni go naprawdę atrakcyjnym do pracy z długim kontekstem. To atuty strukturalne, a nie promocyjne.

Jednak obniżka cen OpenAI z 31 lipca osłabiła argument kosztowy w średniej półce — Terra dorównuje teraz Qwen pod względem inputu — a GPT-5.6 wciąż ma dwie decydujące cechy: audytowane miejsce #2 od ewaluatora, który nie ma interesu w wyniku, oraz przepustowość do 750 tokenów/s, do której Qwen nie wykazało żadnych oznak zbliżania się. Obserwuj dwa wydarzenia: pierwszy niezależny wynik Intelligence Index dla Qwen3.8-Max oraz udostępnienie wag wraz z licencją. Do tego czasu wybieraj w zależności od charakteru — GPT-5.6, gdy liczą się szybkość i dowody, Qwen, gdy długość kontekstu i trafienia w cache dominują w rachunku — i weryfikuj na własnych promptach.

Porównane w tym artykule4

Wykryto na podstawie tego artykułu · Benchmarki: Artificial Analysis · aktualizowane codziennie

© 2026 OrcaRouter

Dla dostawców

Prowadzisz platformę inferencyjną? Udostępnij swoje modele w OrcaRouter.

Skontaktuj się z nami

Dołącz do społeczności

DiscordEmailXGitHubYouTube