
GPT-6 kontra Qwen 3.8 Max: jeden obsługuje wideo, drugi pisze dłużej
- openaiNOWOŚĆOpenAI: GPT-6.1 Sol2026-09-2952Inteligencja
- anthropicNOWOŚĆAnthropic: Claude Sonnet 5.52026-09-2856Inteligencja
- typesafeNOWOŚĆTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 za 1 mln tokenów · 128 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238Inteligencja
- OpenAIOpenAI: GPT-6 Sol2026-09-2248Inteligencja
- AnthropicAnthropic: Claude Opus 5.52026-09-2258Inteligencja
- xAIGrok 4.72026-09-2146Inteligencja
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 za 1 mln tokenów · 67 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 za 1 mln tokenów · 320 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligencja
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Inteligencja77Kod
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Inteligencja76Kod
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Inteligencja76Kod
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Inteligencja82Kod
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 za 1 mln tokenów · 54 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 za 1 mln tokenów · 360 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligencja72Kod
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 za 1 mln tokenów · 232 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Inteligencja75Kod
- obsidianQwen3.8 27B2026-08-1534Inteligencja68Kod
GPT-6 Sol i Qwen3.8 Max mają taką samą stawkę za dane wejściowe — 2,00 USD za milion tokenów w obu przypadkach — a następnie różnią się na dwóch osiach, których sama tabela cen nie ujawni. Qwen3.8 Max, udostępniony w ogólnej dostępności od 3 sierpnia 2026 r., jest jedynym z tych dwóch modeli, który przyjmuje wideo: jego modalności wejściowe to tekst, obraz i wideo, podczas gdy GPT-6 Sol przyjmuje tekst, obraz i plik. GPT-6 Sol, który dostawca wydał 22 września 2026 r., jest jedynym z tych dwóch z opublikowanym limitem wyjściowym wynoszącym 128 000 tokenów i jedynym, za którym stoi powierzchnia konsumencka — wdrożenie ChatGPT z 7 października, które postawiło ten model przed ponad 1,2 miliarda tygodniowych użytkowników.
Pytanie o sortowanie nie polega na tym, które jest mocniejsze. Polega na tym, czy twoje wejście to wideo i czy twoje wyjście jest długie.
Wideo to pierwsze rozwidlenie
Większość porównań modeli sprowadza się do ceny i wyników benchmarków, a ten ma twardą różnicę strukturalną, która sprawia, że tamte czynniki schodzą na dalszy plan. Jeśli Twój pipeline przyjmuje wideo — nagrania z monitoringu, zarejestrowane spotkania, materiały sportowe lub wykładowe, rolki z demonstracjami produktów — Qwen3.8 Max może przyjąć klip w ramach żądania. Jego karta wymienia wideo jako modalność wejściową obok tekstu i obrazu, aż do okna miliona tokenów, co w przypadku wideo oznacza próbkowanie klatek oraz transkrypcję w jednym wywołaniu, a nie osobny etap ekstrakcji. GPT-6 Sol nie może. Jego modalności to tekst, obraz i plik; na karcie nie ma wejścia wideo, a żadna ilość prompt engineeringu tego nie zastąpi.
Ta pojedyncza linia decyduje o krótkiej liście dla potoku wideo i nie jest widoczna na karcie stawek. Miejscem, w którym oba modele są naprawdę wymienne, jest praca z tekstem i obrazem, i tam właśnie ma zastosowanie poniższe porównanie cen i wyników benchmarków.
Jedna szczera uwaga dotycząca twierdzenia o wideo: modalność jest udokumentowana, ale schemat już nie. Wpis katalogowy żadnego z dostawców nie określa rozdzielczości, liczby klatek na sekundę ani limitów długości klipu, więc „obsługuje wideo” oznacza, że dany typ danych wejściowych istnieje, a nie że dowolny klip zostanie przyjęty w potrzebnej Ci jakości. Przetestuj to na własnym materiale wideo, zanim na tym oprzesz swoje rozwiązanie.
Strona wyjściowa działa w drugą stronę
Odwróć zapytanie, a przewaga się odwróci. GPT-6 Sol podaje maksymalną liczbę tokenów wyjściowych na odpowiedź wynoszącą 128 000. Karta Qwen3.8 Max podaje okno kontekstowe, ale nie podaje wartości maksymalnego wyjścia, więc system, który planuje budżet względem sztywnego limitu wyjścia, nie może odczytać jej z danych dostawcy — ta sama luka pojawia się na kilku kartach platform hostingowych i warto traktować ją jako nieznaną, a nie jako nieograniczoną.
Opublikowana informacja to asymetria cen po stronie wyjścia, która jest odwrotnością historii wideo. Qwen3.8 Max nalicza 6,00 USD za milion tokenów wyjściowych w porównaniu z 10,00 USD w GPT-6 Sol — co daje 40% zniżki na każdy token zapisywany przez model. Zadanie o dużym udziale wyjścia, takie jak generowanie długich form lub serializowanie dużego ustrukturyzowanego artefaktu, jest istotnie tańsze w Qwen3.8 Max na jednostkę pracy, i jest to prawdą niezależnie od tego, że cena wejściowa jest identyczna.
Zauważ też, że karta Qwen3.8 Max podaje jedną stawkę wejściową, bez udokumentowanego poziomu dla długiego kontekstu, podczas gdy GPT-6 Sol zmienia cenę całego żądania powyżej 272 000 tokenów wejściowych na 4,00 USD za wejście i 15,00 USD za wyjście. Strona modelu OpenAI wyraźnie podaje tę zasadę: w przypadku promptów powyżej tego progu naliczane są 2x stawki wejściowe i za pamięć podręczną oraz 1,5x stawki wyjściowe za całe żądanie. W przypadku promptu powyżej 272 000 tokenów efektywna stawka wejściowa GPT-6 Sol podwaja się do 4,00 USD, podczas gdy stawka Qwen3.8 Max pozostaje na poziomie 2,00 USD — co ponownie odwraca pozorny remis cenowy na wejściu.
Co mówi niezależna rada
Artificial Analysis uwzględnia oba modele, a indeks złożony wskazuje, że GPT-6 Sol prowadzi, podczas gdy kilka pojedynczych testów wypada odwrotnie. Każda liczba poniżej pochodzi od ewaluatora, a nie od dostawcy.
• Indeks Inteligencji: GPT-6 Sol 47,6, Qwen3.8 Max 45,4 — GPT-6 Sol prowadzi o około dwa punkty
• Indeks kodowania: Qwen3.8 Max 76,2 z miejscem w pierwszej dziesiątce; profil kodowania GPT-6 Sol jest porównywalny, ale wpis Qwen ma wyższą pozycję
• GPQA Diamond: Qwen3.8 Max 92,8%, wynik GPT-6 Sol jest wyższym z dwóch w tej samej rodzinie testów
• Humanity's Last Exam: Qwen3.8 Max 43,1%, GPT-6 Sol 47,9%
• Long-Context Recall: Qwen3.8 Max 80,3%, GPT-6 Sol 83,7%
• SciCode: Qwen3.8 Max 52,1%, GPT-6 Sol 57,6%
• Agentowe użycie narzędzi: Qwen3.8 Max 88,8% w terminal-bench v2.1 i 47,8% w tau-banking, oba wyniki mocne
Wzorzec jest taki, że GPT-6 Sol wygrywa w ogólnych kompozytach rozumowania oraz w testach naukowych i pamięciowych, podczas gdy Qwen3.8 Max jest bardziej precyzyjnym modelem do kodowania i korzystania z narzędzi. Należy uwzględnić dwa zastrzeżenia i nie są one ozdobne. Po pierwsze, te wartości indeksów oceniano w różnych terminach, więc różnica dwóch punktów między wersjami mieści się w zakresie zmian, jaki daje ponowne uruchomienie, a nie jest ustaloną luką. Po drugie, opublikowane wyniki Qwen3.8 Max pochodzą z przebiegów ewaluatora na modelu udostępnianym przez endpoint Alibaba, a dostawca udostępnił także datowaną migawkę, Qwen3.8 Max (0902), 2 września 2026 r. przy tej samej stawce 2,00 / 6,00 USD — jeśli przypinasz migawkę, potwierdź, który model wywołujesz, zanim podasz wynik.

Co wnosi wdrożenie OpenAI z 7 października
Premiera ChatGPT to fakt dystrybucyjny, a nie fakt dotyczący możliwości, ale zmienia to, co czytelnik ma na myśli, mówiąc „GPT-6”. 7 października 2026 r. OpenAI rozpoczęło wdrażanie GPT-6 w ChatGPT w ramach funkcji Intelligent UI; zakładka Chat najpierw trafiła do Plus, Pro, Business i Enterprise, a Free i Go dołączyły 8 października; dostępność w wersji Enterprise zależy od ustawień administratora środowiska pracy. Modele obsługujące Work i Codex pozostały bez zmian.
Dwa szczegóły mają znaczenie w tym porównaniu. Obsługa ChatGPT opiera się na GPT-6 Sol w przypadku płatnych pakietów konsumenckich — więc GPT-6, z którym spotyka się ponad miliard ludzi, to ten sam model, który wywołujesz przez API, a nie osobny checkpoint. A GPT-6 to rodzina, nie pojedynczy model: GPT-6 Astra plasuje się powyżej Sol w cenie 10,00 / 50,00 USD, a GPT-6 Luna poniżej w cenie 0,10 / 0,50 USD. Gdy porównanie zestawia „GPT-6” z Qwen3.8 Max, nie mówiąc, który poziom, zwykle domyślnie porównuje się z Sol, a z Astra, gdy chce się przedstawić najsilniejszy argument. Nazwanie poziomu to różnica między uczciwym porównaniem a retorycznym.
Koszt, mierzony kształtami, a nie stawkami
Ponieważ stawki za tokeny wejściowe są równe, a stawki za tokeny wyjściowe się różnią, zwycięzca zależy wyłącznie od stosunku liczby tokenów wejściowych do liczby tokenów wyjściowych. Obliczenia oparto na opublikowanych stawkach każdego dostawcy, z wyłączeniem pamięci podręcznej:
• Analiza wideo i transkrypcji (500K na wejściu, 6K na wyjściu): Qwen3.8 Max ≈ 1,04 USD, GPT-6 Sol nie dotyczy — brak wejścia wideo
• Analiza dokumentów (250K na wejściu, 5K na wyjściu): Qwen3.8 Max ≈ 0,53 USD, GPT-6 Sol ≈ 0,55 USD, zanim zacznie obowiązywać jego próg 272K, i wyższy, gdy całe żądanie zostanie ponownie wycenione
• Generowanie długich treści (40K na wejściu, 80K na wyjściu): Qwen3.8 Max ≈ 0,56 USD, GPT-6 Sol ≈ 0,88 USD
• Zbalansowana pętla agentowa (60K na wejściu, 20K na wyjściu): Qwen3.8 Max ≈ 0,24 USD, GPT-6 Sol ≈ 0,32 USD
Kształt wyniku jest stabilny: Qwen3.8 Max to tańszy model przy tym samym miksie tokenów, ponieważ stawki za wejście są równe, a jego stawka za wyjście jest niższa. Kontrargument GPT-6 Sol to wcale nie cena — to kompozyt rozumowania, walidacja na powierzchni konsumenckiej i udokumentowany limit wyjściowy, który sprawia, że budżetowanie jest proste.
Jedno zastrzeżenie operacyjne warte przytoczenia, bo karty modeli go nie zawierają. Zmierzono w playgroundzie OrcaRouter w pierwszym tygodniu października 2026 r., że trasa Qwen3.8 Max wykazywała medianę opóźnienia pierwszego tokena wynoszącą około 5809 ms i roughly 50 tokenów wyjściowych na sekundę, przy niskim wskaźniku błędów; trasa GPT-6 Sol w tym samym oknie miała szybszą przepustowość, ale znacznie wyższy wskaźnik błędów. To obserwacje ze współdzielonych tras, a nie SLA dostawców, i zmieniają się z tygodnia na tydzień — co jest argumentem za mierzeniem własnego ruchu, a nie ufaniem karcie któregokolwiek z modeli.
Uruchamianie obu pod jednym kluczem
Realistyczna odpowiedź dla zespołu, który z jednej strony ma prace wideo, a z drugiej zadania wymagające intensywnego rozumowania, jest taka, że żaden z modeli nie wygrywa zdecydowanie i oba należą do stosu technologicznego. Właśnie do takiego przypadku służy bramka. W OrcaRouter zarówno qwen/qwen3.8-max, jak i GPT-6 Sol to aktywne trasy w tym samym katalogu za jednym API zgodnym z OpenAI, w cenie katalogowej dostawcy z 0% marży — więc zmiana ceny u Alibaby lub OpenAI dociera do Ciebie tego samego dnia, a nie dopiero przy następnym uzgadnianiu faktur, i nie ma osobnego zestawu poświadczeń ani ścieżki SDK dla każdego dostawcy.
Dwie funkcje wykonują tu konkretną pracę. Automatyczne przełączanie awaryjne podtrzymuje działanie potoku, gdy trasa jednego dostawcy ulega degradacji, co ma bezpośrednie znaczenie, biorąc pod uwagę, jak odmiennie te dwie trasy zachowywały się w tym samym oknie pomiarowym. A DSL routingu pozwala żądaniu decydować: wysyłać wszystko, co zawiera wejście wideo, do Qwen3.8 Max, wysyłać zadania rozumowania na długim kontekście do GPT-6 Sol, i pozwolić predykatowi opartemu na modalności wejścia i rozmiarze żądania dokonać wyboru zamiast zakodowanego na sztywno identyfikatora modelu, który trzeba zmieniać ręcznie, gdy zmienia się ruch.

W skrócie: jeśli Twoje dane wejściowe obejmują wideo, Qwen3.8 Max jest jedynym z tych dwóch, który je przyjmie, a przy każdym miksie tokenów jest tańszym modelem, gdy masz już zapytanie. Jeśli Twoja praca polega na rozumowaniu na tekście i obrazach, z potrzebą długich, ograniczonych wyników oraz sprawdzonego domyślnego wyboru klasy konsumenckiej, GPT-6 Sol jest mocniejszą kartą w indeksie złożonym i tym z udokumentowanym limitem wyników. Tam, gdzie potrzebujesz obu, kieruj ruchem — i niech modalność zapytania będzie kluczem routingu, a nie cykl wydania.

Porównane w tym artykule1
Wykryto na podstawie tego artykułu · Benchmarki: Artificial Analysis · aktualizowane codziennie
