
GPT-6 Sol vs Qwen3.8-Max: Jedna linia, w której zamknięty model nie może konkurować
- OrcaNOWOŚĆOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 za 1 mln tokenów
- orcaNOWOŚĆOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 za 1 mln tokenów
- deepseekNOWOŚĆDeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligencja
- openaiOpenAI: GPT-6 Astra2026-09-0453Inteligencja77Kod
- googleGoogle: Gemini 3.8 Flash2026-09-0241Inteligencja76Kod
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Inteligencja76Kod
- anthropicAnthropic: Claude Fable 5.12026-09-0153Inteligencja82Kod
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 za 1 mln tokenów
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligencja72Kod
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 za 1 mln tokenów
- z-aiZ.ai: GLM 5.32026-08-1845Inteligencja75Kod
- obsidianQwen3.8 27B2026-08-1534Inteligencja68Kod
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Inteligencja69Kod
- grokSpaceXAI: Grok 4.62026-08-1244Inteligencja77Kod
- metaMeta: Muse Spark 1.22026-08-0540Inteligencja72Kod
- qwenQwen: Qwen3.8 Max2026-08-0345Inteligencja76Kod
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3134Inteligencja69Kod
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 za 1 mln tokenów
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
Niemal każde porównanie między GPT-6 Sol a Qwen3.8-Maxbędzie rozstrzygane na podstawie kosztu, a niemal każde z nich pomyli się co do kosztu w tym samym kierunku. Qwen3.8-Max, flagowy model hostowany przez dostawcę, ma cenę 2,00 USD za milion tokenów wejściowych i 6,00 USD za milion tokenów wyjściowych od czasu ogólnej dostępności 3 sierpnia 2026 r., a datowana migawka Qwen3.8-Max-0902 pojawiła się 2 września. GPT-6 Sol osiągnął ogólną dostępność 22 września 2026 r. w cenie 2,00 USD za tokeny wejściowe i 10,00 USD za tokeny wyjściowe. Identyczna cena wejścia, a wyjście o 40% tańsze w cenniku Qwen3.8-Max — a w niezależnym środowisku testowym ukończenie zadania kosztuje około pięć razy więcej.
Ale istnieje druga, wyraźniejsza różnica, którą argument o kosztach wciąż przesłania, i to ona faktycznie rozstrzyga o niektórych obciążeniach. Qwen3.8-Max przyjmuje wideo. GPT-6 Sol nie. To nie jest pozycja w cenniku ani wynik w benchmarku; to zdolność, którą ma jeden z tych modeli, a drugi nie potrafi jej nawet przybliżyć, i to jedyna część tego starcia, której nie naprawi żadna ilość pracy nad efektywnością tokenów.

Dwa flagowce, dwa różne kształty
Qwen3.8-Max to rzadki model typu mixture-of-experts o 2,4 biliona parametrów, z około 95 miliardami parametrów aktywnych na zapytanie — drugi największy hostowany model produkcyjny po Kimi K3. Jego okno kontekstowe obejmuje milion tokenów przy limicie wyjściowym wynoszącym 131 072 tokeny, jego modalności wejściowe to tekst, obraz i wideo, a ponadto obsługuje on poziom wysiłku rozumowania: niski, średni i bardzo wysoki, wraz ze strukturalnymi danymi wyjściowymi i wywoływaniem narzędzi. Flagowy model hostowany nie ma otwartych wag; możliwy do pobrania artefakt z tej samej generacji to odrębne wydanie z własnymi ograniczeniami.
GPT-6 Sol przyjmuje tekst i obrazy, a zwraca tekst. Jego okno wynosi 1 050 000 tokenów, z maksymalnym wejściem 922 000 tokenów i pułapem wyjścia 128 000 tokenów, w stałej cenie 2,00 USD i 10,00 USD, z odczytem z pamięci podręcznej za 0,20 USD i zapisami do pamięci podręcznej za 2,50 USD, przy czym powyżej 272 000 tokenów wejściowych całe żądanie jest wyceniane na 4,00 USD i 15,00 USD. Jest zamknięty i ma jeden identyfikator, a OpenAI określiło te stawki jako stałe, a nie promocyjne.
Wartości dla okna mieszczą się w granicach około 7% od siebie, a pułapy wyjściowe są w tym samym przedziale. Lista modalności to jedyna luka strukturalna — i jest jednostronna.
Linia po linii
• Wejście — GPT-6 Sol 2,00 USD za milion tokenów vs Qwen3.8-Max 2,00 USD za milion tokenów; liczba z nagłówka jest identyczna
Dane wyjściowe — GPT-6 Sol 10,00 USD za milion tokenów vs Qwen3.8-Max 6,00 USD za milion tokenów; stawka Alibaby jest o 40% niższa
• Dane wejściowe z pamięci podręcznej — GPT-6 Sol $0.20 za milion tokenów w porównaniu z Qwen3.8-Max $0.25 za milion tokenów za niejawne odczyty z pamięci podręcznej, z jawnym odczytem z pamięci podręcznej po $0.17 i jawnym zapisem do pamięci podręcznej po $2.50
• Okno kontekstowe — GPT-6 Sol 1 050 000 tokenów vs Qwen3.8-Max 1 000 000 tokenów
• Maksymalna liczba tokenów wyjściowych — GPT-6 Sol 128 000 tokenów vs Qwen3.8-Max 131 072 tokenów
• Modalności wejściowe — GPT-6 Sol tekst i obraz vs Qwen3.8-Max tekst, obraz i wideo
Obsługa długiego kontekstu — GPT-6 Sol zmienia cennik całego żądania powyżej 272 000 tokenów wejściowych na 2× stawki za dane wejściowe i pamięć podręczną oraz 1,5× za dane wyjściowe, podczas gdy Qwen3.8-Max stosuje jednolity poziom opłat w całym oknie, co jest jedynym miejscem, w którym cennik Qwen jest strukturalnie lepszy, a nie tylko nieznacznie tańszy
• Poziom rozumowania — GPT-6 Sol: brak, niski, średni (domyślny), wysoki, bardzo wysoki, maksymalny vs Qwen3.8-Max: niski, średni i bardzo wysoki
• Data odcięcia wiedzy — GPT-6 Sol 20 kwietnia 2026 vs Qwen3.8-Max nieopublikowany jako pojedyncza data
• Datowana migawka — GPT-6 Sol jako pojedynczy, zmieniający się identyfikator kontra Qwen3.8-Max-0902 dostępny jako przypięta rewizja z 2 września 2026 r. w tej samej cenie
Kategoria długiego kontekstu zasługuje na więcej uwagi, niż zwykle jej się poświęca. Dopłata w GPT-6 Sol to próg stosowany do całego żądania, więc przebieg agenta na 900 000 tokenów jest rozliczany po 4,00 USD i 15,00 USD za każdy token. Qwen3.8-Max pobiera jedną stawkę w całym oknie. W przypadku obciążenia przekraczającego 272 000 tokenów te dwa cenniki przestają być w ogóle porównywalne — tańszy model z nagłówka jest tym droższym, i to znacznie, a kierunek tej różnicy zależy w całości od tego, gdzie plasuje się twój kontekst.

Cennik mówi, że jest o 40% taniej. Zestaw testowy wskazuje, że rachunek jest pięciokrotnie wyższy.
Artificial Analysis zmierzyło Qwen3.8-Max-0902 na 45 punktów w Intelligence Index, przy koszcie 5,41 USD za ukończone zadanie indeksowe, generując w całym przebiegu 190 milionów tokenów wyjściowych. W swoim podsumowaniu opisuje model jako „zauważalnie wolny i bardzo gadatliwy”. GPT-6 Sol uzyskał 48 punktów przy koszcie 1,06 USD za zadanie, generując 77 milionów tokenów wyjściowych.
Przeczytaj te trzy pary razem, a kształt starcia się wyłoni. Qwen jest o trzy punkty indeksu z tyłu, wygenerował dwa i pół raza więcej tokenów i kosztował około pięć razy więcej na ukończone zadanie — przy cenniku, w którym jego wyjście jest o 40% tańsze. Mechanizm nie jest subtelny. Przy 6,00 USD za milion tokenów wyjściowych 190 milionów tokenów kosztuje 1,14 USD na jedno uruchomienie indeksu tylko w samym wyjściu, zanim policzy się wejście; przy 10,00 USD za milion, 77 milionów Sola kosztuje 0,77 USD. Tańsza stawka kupuje więcej tokenów, a nie mniejszy rachunek.
To ten sam wzorzec, który pojawia się w całej wrześniowej stawce, i warto ująć go jako regułę, a nie fakt dotyczący tych dwóch modeli: w cenniku opartym na stawce za token 40-procentowa zniżka na wyjście nie jest nic warta, jeśli model emituje dwa i pół raza więcej tokenów. Koszt na ukończone zadanie to jedyna liczba, która się liczy.
Co opublikował Alibaba i problem ustalania wysiłku
Własna tabela benchmarków Alibaby jest najdłuższa w tym porównaniu i najmniej porównywalna. Podawane przez producenta liczby stawiają Qwen3.8-Max na prowadzeniu w PaperBench i IFBench, ale plasują go w tyle w SWE-bench Pro i Humanity's Last Exam, ze skalą wysiłku rozumowania — niski, średni, bardzo wysoki — która nie przekłada się bezpośrednio na sześciopoziomową skalę OpenAI. Wynik opublikowany przy bardzo wysokim poziomie to nie ten sam produkt co wynik opublikowany przy średnim, a żaden z dostawców nie oznacza, który poziom dał daną liczbę na wykresie porównawczym.
To jest uczciwy powód, by nie opierać się tutaj na tabeli żadnego z dostawców. Liczby Alibaby są uruchamiane w harnessie Alibaby przy ustawieniu poziomu wysiłku Alibaby; liczby OpenAI są uruchamiane w harnessie OpenAI. Dane Artificial Analysis istnieją właśnie dlatego, że oba te zestawy są bezużyteczne w bezpośrednim porównaniu, i to one zostały użyte powyżej.
Odtwarzalność to prawdziwa funkcja, a jej cena wynosi zero
Datowana migawka to najbardziej niedoceniana pozycja w tym porównaniu. Qwen3.8-Max-0902 to przypięta wersja z 2 września 2026 r., która według Alibaby ma takie same możliwości i cennik jak model bazowy. Przypięcie jej oznacza, że model stojący za Twoim endpointem nie zmienia się pod Tobą między wtorkiem a czwartkiem.
GPT-6 Sol nie ma odpowiednika. To pojedynczy, zmieniający się identyfikator — ta sama strona modelu zawiera domyślny snapshot i żadnych datowanych wariantów — co oznacza, że to, co benchmarkowałeś we wrześniu, nie musi być tym, co wywołujesz w listopadzie. Dla większości zespołów to jest w porządku. W przypadku potoku objętego regulacjami, który musi wykazać, co wytworzyło wynik, to prawdziwa różnica — i to taka, którą Alibaba udostępnia za darmo, podczas gdy OpenAI nie oferuje jej w ogóle.
Linia wideo jest tą, która decyduje.
Wszystko powyżej to porównanie. Ta część nie. Jeśli Twoje dane wejściowe obejmują wideo — nagrania ekranu, materiał z inspekcji, rejestrację wykładu, cokolwiek, gdzie informacja jest w ruchu, a nie w nieruchomej klatce — Qwen3.8-Max przyjmuje je natywnie, a GPT-6 Sol nie ma do nich żadnej ścieżki. Nie da się obejść modalności za pomocą promptów. Nie można wstępnie przetworzyć wideo na obrazy i otrzymać tego samego, ponieważ chodzi właśnie o informację czasową, a żadna liczba punktów indeksowych w benchmarku tekstowym nie zastąpi danych wejściowych, których faktycznie wymaga Twoje zadanie.
Odwrotny przypadek też warto nazwać, bo właśnie w nim porównanie przestaje być jednostronne. Jeśli twoje dane wejściowe to tekst i obrazy, Sol jest tańszy w przeliczeniu na zadanie, o cztery punkty wyprzedza na neutralnej tablicy i jest tańszy w przypadku odczytów z pamięci podręcznej. Możliwość obsługi wideo nie jest rozstrzygnięciem na twoją korzyść; jest po prostu niewykorzystywana.
Kierowanie decyzją, która ma dwie oddzielne odpowiedzi

To jest starcie, w którym właściwa architektura to naprawdę dwa modele, a nie jeden, a powodem jest to, że podział wynika z modalności wejściowej, a nie z poziomu trudności. Pipeline, który przyjmuje wideo i wnioskuje na tekście, potrzebuje obu, a reguła routingu jest właściwością żądania, a nie decyzją uznaniową.
Qwen3.8-Max znajduje się w katalogu OrcaRouter — datowaną migawkę qwen/qwen3.8-max-0902 można trasować po cenie katalogowej Alibaby w modelu pass-through, co oznacza, że zmiana stawek Alibaby obowiązuje po naszej stronie tego samego dnia , a nie dopiero po ponownych negocjacjach resellera. GPT-6 Sol nie znajduje się w naszym katalogu na moment pisania tego tekstu i jest dostępny przez własne API OpenAI. DSL routingu to element, który pasuje do tego konkretnego przypadku: reguła, która kieruje żądania zawierające wideo w jedną stronę, a wszystkie pozostałe w drugą, jest dokładnie do tego stworzona, a automatyczne przełączanie awaryjne sprawia, że gałąź modalności nie staje się pojedynczym punktem awarii.
W czym każdy wygrywa
• Wideo na wejściu, tekst na wyjściu — Qwen3.8-Max, i nie ma tu żadnej konkurencji, którą można by opisać.
• Tekst i obraz na wejściu, koszt na ukończone zadanie jako metryka — GPT-6 Sol, około pięciokrotnie na niezależnym stanowisku testowym.
• Praca z buforowanym prefiksem — GPT-6 Sol. Jego odczyt z pamięci podręcznej jest nieznacznie tańszy, a liczba tokenów wynosi mniej niż połowę.
• Żądania powyżej 272 000 tokenów wejściowych — Qwen3.8-Max. Ponowna wycena całego żądania przez Sol to największa pojedyncza różnica kosztów w tym porównaniu i jest niewidoczna w stawkach nagłówkowych.
• Powtarzalne przypinanie — Qwen3.8-Max-0902, który nie kosztuje nic dodatkowo i jest jedyną przypiętą wersją z tych dwóch.
• Jeśli pokazano ci wykres, na którym Qwen prowadzi w SWE-bench Pro — sprawdź, czyj harness go wygenerował i na jakim poziomie wysiłku. Niezależny ranking plasuje Qwen trzy punkty za w wyniku zbiorczym, a tabele dostawców nie są w tej samej skali względem siebie.
Porównane w tym artykule3
Wykryto na podstawie tego artykułu · Benchmarki: Artificial Analysis · aktualizowane codziennie
