Karta tytułowa typu hero do artykułu porównującego GPT-6 Sol z Qwen3.8-Max, z napisem „GPT-6 Sol vs Qwen3.8-Max” i podtytułem „Jedyna linia, w której zamknięty model nie może konkurować”, pokazująca GPT-6 Sol jako dane wejściowe tekstowe i obrazowe oraz Qwen3.8-Max jako dane wejściowe tekstowe, obrazowe i wideo.
Guides & Insights

GPT-6 Sol vs Qwen3.8-Max: Jedna linia, w której zamknięty model nie może konkurować

Autor

Alistair Wren

Data publikacji

Najnowsze modele · 20Zobacz wszystkie modele
Benchmarki: Artificial Analysis · aktualizowane codziennie
Powrót do wszystkich wpisów

Niemal każde porównanie między GPT-6 Sol a Qwen3.8-Maxbędzie rozstrzygane na podstawie kosztu, a niemal każde z nich pomyli się co do kosztu w tym samym kierunku. Qwen3.8-Max, flagowy model hostowany przez dostawcę, ma cenę 2,00 USD za milion tokenów wejściowych i 6,00 USD za milion tokenów wyjściowych od czasu ogólnej dostępności 3 sierpnia 2026 r., a datowana migawka Qwen3.8-Max-0902 pojawiła się 2 września. GPT-6 Sol osiągnął ogólną dostępność 22 września 2026 r. w cenie 2,00 USD za tokeny wejściowe i 10,00 USD za tokeny wyjściowe. Identyczna cena wejścia, a wyjście o 40% tańsze w cenniku Qwen3.8-Max — a w niezależnym środowisku testowym ukończenie zadania kosztuje około pięć razy więcej.

Ale istnieje druga, wyraźniejsza różnica, którą argument o kosztach wciąż przesłania, i to ona faktycznie rozstrzyga o niektórych obciążeniach. Qwen3.8-Max przyjmuje wideo. GPT-6 Sol nie. To nie jest pozycja w cenniku ani wynik w benchmarku; to zdolność, którą ma jeden z tych modeli, a drugi nie potrafi jej nawet przybliżyć, i to jedyna część tego starcia, której nie naprawi żadna ilość pracy nad efektywnością tokenów.

A six-row scoreboard card titled 'GPT-6 Sol vs Qwen3.8-Max - the scoreboard', comparing the two models on output price, Intelligence Index, cost per task, input modality, maximum output and long-context handling. The left column lists GPT-6 Sol at $10.00 output, an Index of 48, $1.06 per task, text and image input, a 128,000-token maximum output and whole-request repricing above 272K; the right column lists Qwen3.8-Max at $6.00 output, an Index of 45, $5.41 per task, text, image and video input, a 131,072-token maximum output and a flat tier above 272K. A footer reads 'Vendor list rates; Index per Artificial Analysis.'

Dwa flagowce, dwa różne kształty

Qwen3.8-Max to rzadki model typu mixture-of-experts o 2,4 biliona parametrów, z około 95 miliardami parametrów aktywnych na zapytanie — drugi największy hostowany model produkcyjny po Kimi K3. Jego okno kontekstowe obejmuje milion tokenów przy limicie wyjściowym wynoszącym 131 072 tokeny, jego modalności wejściowe to tekst, obraz i wideo, a ponadto obsługuje on poziom wysiłku rozumowania: niski, średni i bardzo wysoki, wraz ze strukturalnymi danymi wyjściowymi i wywoływaniem narzędzi. Flagowy model hostowany nie ma otwartych wag; możliwy do pobrania artefakt z tej samej generacji to odrębne wydanie z własnymi ograniczeniami.

GPT-6 Sol przyjmuje tekst i obrazy, a zwraca tekst. Jego okno wynosi 1 050 000 tokenów, z maksymalnym wejściem 922 000 tokenów i pułapem wyjścia 128 000 tokenów, w stałej cenie 2,00 USD i 10,00 USD, z odczytem z pamięci podręcznej za 0,20 USD i zapisami do pamięci podręcznej za 2,50 USD, przy czym powyżej 272 000 tokenów wejściowych całe żądanie jest wyceniane na 4,00 USD i 15,00 USD. Jest zamknięty i ma jeden identyfikator, a OpenAI określiło te stawki jako stałe, a nie promocyjne.

Wartości dla okna mieszczą się w granicach około 7% od siebie, a pułapy wyjściowe są w tym samym przedziale. Lista modalności to jedyna luka strukturalna — i jest jednostronna.

Linia po linii

• Wejście — GPT-6 Sol 2,00 USD za milion tokenów vs Qwen3.8-Max 2,00 USD za milion tokenów; liczba z nagłówka jest identyczna

Dane wyjściowe — GPT-6 Sol 10,00 USD za milion tokenów vs Qwen3.8-Max 6,00 USD za milion tokenów; stawka Alibaby jest o 40% niższa

• Dane wejściowe z pamięci podręcznej — GPT-6 Sol $0.20 za milion tokenów w porównaniu z Qwen3.8-Max $0.25 za milion tokenów za niejawne odczyty z pamięci podręcznej, z jawnym odczytem z pamięci podręcznej po $0.17 i jawnym zapisem do pamięci podręcznej po $2.50

• Okno kontekstowe — GPT-6 Sol 1 050 000 tokenów vs Qwen3.8-Max 1 000 000 tokenów

• Maksymalna liczba tokenów wyjściowych — GPT-6 Sol 128 000 tokenów vs Qwen3.8-Max 131 072 tokenów

• Modalności wejściowe — GPT-6 Sol tekst i obraz vs Qwen3.8-Max tekst, obraz i wideo

Obsługa długiego kontekstu — GPT-6 Sol zmienia cennik całego żądania powyżej 272 000 tokenów wejściowych na 2× stawki za dane wejściowe i pamięć podręczną oraz 1,5× za dane wyjściowe, podczas gdy Qwen3.8-Max stosuje jednolity poziom opłat w całym oknie, co jest jedynym miejscem, w którym cennik Qwen jest strukturalnie lepszy, a nie tylko nieznacznie tańszy

• Poziom rozumowania — GPT-6 Sol: brak, niski, średni (domyślny), wysoki, bardzo wysoki, maksymalny vs Qwen3.8-Max: niski, średni i bardzo wysoki

• Data odcięcia wiedzy — GPT-6 Sol 20 kwietnia 2026 vs Qwen3.8-Max nieopublikowany jako pojedyncza data

• Datowana migawka — GPT-6 Sol jako pojedynczy, zmieniający się identyfikator kontra Qwen3.8-Max-0902 dostępny jako przypięta rewizja z 2 września 2026 r. w tej samej cenie

Kategoria długiego kontekstu zasługuje na więcej uwagi, niż zwykle jej się poświęca. Dopłata w GPT-6 Sol to próg stosowany do całego żądania, więc przebieg agenta na 900 000 tokenów jest rozliczany po 4,00 USD i 15,00 USD za każdy token. Qwen3.8-Max pobiera jedną stawkę w całym oknie. W przypadku obciążenia przekraczającego 272 000 tokenów te dwa cenniki przestają być w ogóle porównywalne — tańszy model z nagłówka jest tym droższym, i to znacznie, a kierunek tej różnicy zależy w całości od tego, gdzie plasuje się twój kontekst.

Screenshot of the Artificial Analysis model page for Qwen3.8 Max (0902), captured 23 September 2026, showing an Intelligence Index score of 45, list pricing of $2.00 per million input tokens and $6.00 per million output tokens, a cost of $5.41 per Intelligence Index task, 190 million output tokens generated during the index run, a 984,000-token context window and 39.2 output tokens per second.

Cennik mówi, że jest o 40% taniej. Zestaw testowy wskazuje, że rachunek jest pięciokrotnie wyższy.

Artificial Analysis zmierzyło Qwen3.8-Max-0902 na 45 punktów w Intelligence Index, przy koszcie 5,41 USD za ukończone zadanie indeksowe, generując w całym przebiegu 190 milionów tokenów wyjściowych. W swoim podsumowaniu opisuje model jako „zauważalnie wolny i bardzo gadatliwy”. GPT-6 Sol uzyskał 48 punktów przy koszcie 1,06 USD za zadanie, generując 77 milionów tokenów wyjściowych.

Przeczytaj te trzy pary razem, a kształt starcia się wyłoni. Qwen jest o trzy punkty indeksu z tyłu, wygenerował dwa i pół raza więcej tokenów i kosztował około pięć razy więcej na ukończone zadanie — przy cenniku, w którym jego wyjście jest o 40% tańsze. Mechanizm nie jest subtelny. Przy 6,00 USD za milion tokenów wyjściowych 190 milionów tokenów kosztuje 1,14 USD na jedno uruchomienie indeksu tylko w samym wyjściu, zanim policzy się wejście; przy 10,00 USD za milion, 77 milionów Sola kosztuje 0,77 USD. Tańsza stawka kupuje więcej tokenów, a nie mniejszy rachunek.

To ten sam wzorzec, który pojawia się w całej wrześniowej stawce, i warto ująć go jako regułę, a nie fakt dotyczący tych dwóch modeli: w cenniku opartym na stawce za token 40-procentowa zniżka na wyjście nie jest nic warta, jeśli model emituje dwa i pół raza więcej tokenów. Koszt na ukończone zadanie to jedyna liczba, która się liczy.

Co opublikował Alibaba i problem ustalania wysiłku

Własna tabela benchmarków Alibaby jest najdłuższa w tym porównaniu i najmniej porównywalna. Podawane przez producenta liczby stawiają Qwen3.8-Max na prowadzeniu w PaperBench i IFBench, ale plasują go w tyle w SWE-bench Pro i Humanity's Last Exam, ze skalą wysiłku rozumowania — niski, średni, bardzo wysoki — która nie przekłada się bezpośrednio na sześciopoziomową skalę OpenAI. Wynik opublikowany przy bardzo wysokim poziomie to nie ten sam produkt co wynik opublikowany przy średnim, a żaden z dostawców nie oznacza, który poziom dał daną liczbę na wykresie porównawczym.

To jest uczciwy powód, by nie opierać się tutaj na tabeli żadnego z dostawców. Liczby Alibaby są uruchamiane w harnessie Alibaby przy ustawieniu poziomu wysiłku Alibaby; liczby OpenAI są uruchamiane w harnessie OpenAI. Dane Artificial Analysis istnieją właśnie dlatego, że oba te zestawy są bezużyteczne w bezpośrednim porównaniu, i to one zostały użyte powyżej.

Odtwarzalność to prawdziwa funkcja, a jej cena wynosi zero

Datowana migawka to najbardziej niedoceniana pozycja w tym porównaniu. Qwen3.8-Max-0902 to przypięta wersja z 2 września 2026 r., która według Alibaby ma takie same możliwości i cennik jak model bazowy. Przypięcie jej oznacza, że model stojący za Twoim endpointem nie zmienia się pod Tobą między wtorkiem a czwartkiem.

GPT-6 Sol nie ma odpowiednika. To pojedynczy, zmieniający się identyfikator — ta sama strona modelu zawiera domyślny snapshot i żadnych datowanych wariantów — co oznacza, że to, co benchmarkowałeś we wrześniu, nie musi być tym, co wywołujesz w listopadzie. Dla większości zespołów to jest w porządku. W przypadku potoku objętego regulacjami, który musi wykazać, co wytworzyło wynik, to prawdziwa różnica — i to taka, którą Alibaba udostępnia za darmo, podczas gdy OpenAI nie oferuje jej w ogóle.

Linia wideo jest tą, która decyduje.

Wszystko powyżej to porównanie. Ta część nie. Jeśli Twoje dane wejściowe obejmują wideo — nagrania ekranu, materiał z inspekcji, rejestrację wykładu, cokolwiek, gdzie informacja jest w ruchu, a nie w nieruchomej klatce — Qwen3.8-Max przyjmuje je natywnie, a GPT-6 Sol nie ma do nich żadnej ścieżki. Nie da się obejść modalności za pomocą promptów. Nie można wstępnie przetworzyć wideo na obrazy i otrzymać tego samego, ponieważ chodzi właśnie o informację czasową, a żadna liczba punktów indeksowych w benchmarku tekstowym nie zastąpi danych wejściowych, których faktycznie wymaga Twoje zadanie.

Odwrotny przypadek też warto nazwać, bo właśnie w nim porównanie przestaje być jednostronne. Jeśli twoje dane wejściowe to tekst i obrazy, Sol jest tańszy w przeliczeniu na zadanie, o cztery punkty wyprzedza na neutralnej tablicy i jest tańszy w przypadku odczytów z pamięci podręcznej. Możliwość obsługi wideo nie jest rozstrzygnięciem na twoją korzyść; jest po prostu niewykorzystywana.

Kierowanie decyzją, która ma dwie oddzielne odpowiedzi

Screenshot of OrcaRouter's model page for Qwen3.8 Max (0902), captured 23 September 2026, showing the model id qwen/qwen3.8-max-0902 from provider Qwen, a 1M-token context window with a 131k-token maximum output, text, image and video input with text output, list pricing of $2.00 per million input tokens and $6.00 per million output tokens, and a p50 time to first token of 3.50 seconds.

To jest starcie, w którym właściwa architektura to naprawdę dwa modele, a nie jeden, a powodem jest to, że podział wynika z modalności wejściowej, a nie z poziomu trudności. Pipeline, który przyjmuje wideo i wnioskuje na tekście, potrzebuje obu, a reguła routingu jest właściwością żądania, a nie decyzją uznaniową.

Qwen3.8-Max znajduje się w katalogu OrcaRouter — datowaną migawkę qwen/qwen3.8-max-0902 można trasować po cenie katalogowej Alibaby w modelu pass-through, co oznacza, że zmiana stawek Alibaby obowiązuje po naszej stronie tego samego dnia , a nie dopiero po ponownych negocjacjach resellera. GPT-6 Sol nie znajduje się w naszym katalogu na moment pisania tego tekstu i jest dostępny przez własne API OpenAI. DSL routingu to element, który pasuje do tego konkretnego przypadku: reguła, która kieruje żądania zawierające wideo w jedną stronę, a wszystkie pozostałe w drugą, jest dokładnie do tego stworzona, a automatyczne przełączanie awaryjne sprawia, że gałąź modalności nie staje się pojedynczym punktem awarii.

W czym każdy wygrywa

• Wideo na wejściu, tekst na wyjściu — Qwen3.8-Max, i nie ma tu żadnej konkurencji, którą można by opisać.

• Tekst i obraz na wejściu, koszt na ukończone zadanie jako metryka — GPT-6 Sol, około pięciokrotnie na niezależnym stanowisku testowym.

• Praca z buforowanym prefiksem — GPT-6 Sol. Jego odczyt z pamięci podręcznej jest nieznacznie tańszy, a liczba tokenów wynosi mniej niż połowę.

• Żądania powyżej 272 000 tokenów wejściowych — Qwen3.8-Max. Ponowna wycena całego żądania przez Sol to największa pojedyncza różnica kosztów w tym porównaniu i jest niewidoczna w stawkach nagłówkowych.

• Powtarzalne przypinanie — Qwen3.8-Max-0902, który nie kosztuje nic dodatkowo i jest jedyną przypiętą wersją z tych dwóch.

• Jeśli pokazano ci wykres, na którym Qwen prowadzi w SWE-bench Pro — sprawdź, czyj harness go wygenerował i na jakim poziomie wysiłku. Niezależny ranking plasuje Qwen trzy punkty za w wyniku zbiorczym, a tabele dostawców nie są w tej samej skali względem siebie.

Porównane w tym artykule3

Wykryto na podstawie tego artykułu · Benchmarki: Artificial Analysis · aktualizowane codziennie