
GPT-6 Luna vs Qwen3.8-Max: Najtańszy model w tym porównaniu jest także jedynym, który ogląda wideo
- OrcaNOWOŚĆOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 za 1 mln tokenów
- orcaNOWOŚĆOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 za 1 mln tokenów
- deepseekNOWOŚĆDeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligencja
- openaiOpenAI: GPT-6 Astra2026-09-0453Inteligencja77Kod
- googleGoogle: Gemini 3.8 Flash2026-09-0241Inteligencja76Kod
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Inteligencja76Kod
- anthropicAnthropic: Claude Fable 5.12026-09-0153Inteligencja82Kod
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 za 1 mln tokenów
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligencja72Kod
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 za 1 mln tokenów
- z-aiZ.ai: GLM 5.32026-08-1845Inteligencja75Kod
- obsidianQwen3.8 27B2026-08-1534Inteligencja68Kod
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Inteligencja69Kod
- grokSpaceXAI: Grok 4.62026-08-1244Inteligencja77Kod
- metaMeta: Muse Spark 1.22026-08-0540Inteligencja72Kod
- qwenQwen: Qwen3.8 Max2026-08-0345Inteligencja76Kod
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3134Inteligencja69Kod
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 za 1 mln tokenów
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
Oczywiste ujęcie tego zestawienia jest błędne. Qwen3.8-Max ma cenę 2,00 USD za milion tokenów wejściowych i 6,00 USD za milion tokenów wyjściowych, a odczyty z pamięci podręcznej kosztują 0,25 USD. GPT-6 Luna ma cenę 0,10 USD i 0,50 USD, a odczyty z pamięci podręcznej kosztują centa. Dwadzieścia razy na wejściu, dwanaście razy na wyjściu, pięćdziesiąt razy na wejściu z pamięci podręcznej — różnica cen jest tak duża, że porównanie wydaje się rozstrzygnięte, zanim się zacznie.
To nie jest rozstrzygnięte, ponieważ oba modele nie konkurują o to samo żądanie. Qwen3.8-Max akceptuje tekst, obraz i wideo, a jego limit wyjściowy wynoszący 131 072 tokeny jest nieco wyższy niż 128 000 w GPT-6 Luna. GPT-6 Luna akceptuje tylko tekst i obraz. Model Alibaby uzyskuje 58 punktów w niezależnym Intelligence Index — pierwszy w swojej klasie na tablicy agentowej — a GPT-6 Luna uzyskuje 37 punktów przy maksymalnym wysiłku, 29 przy domyślnym. Jeden to flagowiec z otwartym rodowodem wag i modalnością wejścia wideo. Drugi to poziom masowy z wynikiem szybkości i jednocentową stawką cache. Różnica w cenie nie jest zniżką na to samo; to opis dwóch różnych rzeczy.
Czym jest każde z tych dwóch
Qwen3.8-Max to flagowy model firmy Alibaba z generacji 3.8, checkpoint klasy Max, którego bazowy model — Qwen3.8-2.4T-A95B — został publicznie udostępniony na niestandardowej licencji 12 sierpnia 2026 r., co czyni go pierwszym Qwen klasy Max, który w ogóle ma otwarte wagi. Sam hostowany flagowiec jest nadal wymieniany przez niezależny panel jako zastrzeżony. Ma okno kontekstowe 1 000 000 tokenów, limit wyjściowy 131 072 tokenów, wejście tekstowe, obrazowe i wideo oraz możliwość wyboru nakładu rozumowania na poziomie niskim, średnim i bardzo wysokim. Przypięta wersja Qwen3.8-Max-0902 jest dostępna w tej samej cenie, co jest drobnym szczegółem o realnej wartości operacyjnej.
GPT-6 Luna to poziom wydajności OpenAI z 22 września 2026 r., plasujący się poniżej GPT-6 Sol w cenie 2,00 USD/10,00 USD oraz flagowego GPT-6 Astra w cenie 10,00 USD/50,00 USD. Wejście tekstowe i obrazowe, wyjście tekstowe, okno o rozmiarze 1 050 000 tokenów z maksymalnym wejściem 922 000, limit wyjściowy 128 000 tokenów oraz poziom wysiłku od none przez low, medium, high, xhigh do max, z domyślnym medium. Zamknięty, z pojedynczym identyfikatorem, dostępny dla każdego z kluczem API.
Jeden obsługuje wideo i można go pobrać w podstawowej wersji. Drugi obsługuje obrazy i jest szybki. Oba są wycenione z myślą o użyciu na dużą skalę. Część wspólna tych dwóch stwierdzeń jest mniejsza, niż sugeruje stosunek cen.
Karty, linia po linii
Jedna linia na wymiar, obie strony w każdym:
• Wejście za 1 mln — GPT-6 Luna $0,10 vs Qwen3.8-Max $2,00
• Wyjście za 1 mln — GPT-6 Luna $0.50 vs Qwen3.8-Max $6.00
• Wejście z pamięci podręcznej za 1 mln — GPT-6 Luna $0,01 vs Qwen3.8-Max $0,25 za niejawne odczyty z pamięci podręcznej, z jawnym odczytem z pamięci podręcznej po $0,17 i jawnym zapisem do pamięci podręcznej po $2,50
• Klauzula długiego kontekstu — GPT-6 Luna podwaja wejście i pamięć podręczną oraz podnosi limit wyjścia 1,5× powyżej 272 000 tokenów wejściowych, stosowana do całego żądania, podczas gdy Qwen3.8-Max ma jednolity poziom w całym oknie, co jest jedynym miejscem, w którym karta Qwen jest strukturalnie lepsza, a nie tylko marginalnie tańsza.
• Okno kontekstowe — GPT-6 Luna 1 050 000 tokenów vs Qwen3.8-Max 1 000 000 tokenów
• Maksymalna liczba tokenów wyjściowych — GPT-6 Luna 128 000 tokenów vs Qwen3.8-Max 131 072 tokeny
• Modalności wejściowe — GPT-6 Luna tekst i obraz vs Qwen3.8-Max tekst, obraz i wideo
• Poziom rozumowania — GPT-6 Luna: brak, niski, średni (domyślny), wysoki, bardzo wysoki, maksymalny vs Qwen3.8-Max: niski, średni i ekstra wysoki
• Intelligence Index, niezależny — GPT-6 Luna 37 przy maksymalnym wysiłku vs Qwen3.8-Max 58
• Agentic Index, niezależny — Qwen3.8-Max 58, pierwszy w swojej klasie; nie opublikowano porównywalnego wyniku dla GPT-6 Luna
• Wynik dla domyślnego poziomu wysiłku — GPT-6 Luna 29 przy domyślnym ustawieniu średnim vs Qwen3.8-Max mierzony przy maksymalnym ustawieniu
• Koszt na zadanie Index, niezależny — GPT-6 Luna około 0,07 USD w porównaniu z Qwen3.8-Max 5,41 USD
• GDPval, niezależny — Qwen3.8-Max 1 739 Elo przy 64 turach na zadanie, co daje około 1,14 USD na ukończone zadanie w tej ewaluacji; nie opublikowano porównywalnego przebiegu GPT-6 Luna
• Wskaźnik halucynacji w AA-Omniscience — Qwen3.8-Max 40%, regresja z 23% w poprzedniej generacji; GPT-6 Luna 77%, spadek z 93%
• Datowana migawka — GPT-6 Luna jako pojedynczy identyfikator kroczący vs Qwen3.8-Max-0902 dostępny jako przypięta wersja z 2 września 2026 r. w tej samej cenie
• Wagi — GPT-6 Luna zamknięty, dostępny wyłącznie przez API, kontra Qwen3.8-Max: bazowy checkpoint Qwen3.8-2.4T-A95B publiczny na licencji niestandardowej od 12 sierpnia 2026 r., podczas gdy hostowany model flagowy figuruje jako zastrzeżony
• Na OrcaRouter — GPT-6 Luna poza naszym katalogiem vs Qwen3.8-Max z możliwością routingu w cenie katalogowej Alibaba

Wideo nie jest pozycją na liście funkcji, to inne obciążenie.
Wiersz modalności to ten, który decyduje o większej liczbie rzeczywistych porównań niż wiersz ceny, i zazwyczaj jest odczytywany jako pole wyboru.
Qwen3.8-Max obsługuje wideo. GPT-6 Luna nie. Jeśli Twój pipeline musi wyciągać wnioski z nagrania ekranu, demonstracji produktu, zapisu wykładu, fragmentu z kamery bezpieczeństwa albo przejścia przez interfejs użytkownika, porównanie kończy się na tej linii, a dwudziestokrotna różnica w cenie staje się nieistotna — nie wybierasz między drogą opcją a tanią, wybierasz między opcją a jej brakiem. Wyodrębnianie klatek i przekazywanie ich jako obrazów to obejście, a nie odpowiednik, i każdy, kto takie zbudował, zna różnicę zarówno w kosztach, jak i w jakości.
Jeśli Twój pipeline obejmuje tekst i obrazy, linia modalności milczy, a linia ceny mówi. To uczciwy podział i warto powiedzieć wprost, po której jego stronie stoisz, zanim przeczytasz cokolwiek innego na tej stronie.
Luka agentowa jest realna i to ona stanowi kosztowną połowę różnicy w cenie.
Qwen3.8-Max uzyskuje 58 punktów w niezależnym Intelligence Index. GPT-6 Luna uzyskuje 37 punktów przy maksymalnym wysiłku i 29 w domyślnym trybie średnim. Dwadzieścia jeden punktów przy dopasowanych ustawieniach, dwadzieścia dziewięć przy ustawieniach domyślnych — w złożonym wskaźniku, w którym pojedynczy punkt mieści się w szumie ponownego przebiegu, różnica tej wielkości nie jest szumem.
Pozycja Qwen3.8-Max koncentruje się na pracy agentowej. Osiąga 58 punktów w niezależnym Agentic Index, co daje mu pierwsze miejsce w swojej klasie, oraz 1 739 Elo w GDPval przy 64 turach na zadanie. Ta ostatnia liczba jest najbardziej pouczająca, ponieważ jest to pomiar modelu utrzymującego spójność zadania przez sześćdziesiąt cztery następujące po sobie decyzje, a wiąże się z tym konkretny koszt: około 1,14 USD za ukończone zadanie w tej ewaluacji. Porównaj to z kosztem GPT-6 Luna w przeliczeniu na zadanie indeksowe, wynoszącym około 0,07 USD, a uczciwe stwierdzenie nie polega na tym, że Qwen jest drogi. Polega ono na tym, że Qwen jest proszony o zrobienie znacznie trudniejszej rzeczy — i robi ją.
Wniosek z tego jest taki, że dwudziestojednopunktowa strata GPT-6 Luna również nie rozkłada się równomiernie w całym twoim obciążeniu pracą. W przypadku krótkiego, dobrze określonego zadania konsumowanego przez program — wyodrębnij to pole, sklasyfikuj to zgłoszenie, skieruj to żądanie — oba modele niemal zawsze dadzą tę samą użyteczną odpowiedź, a różnica w indeksie będzie niewidoczna w twojej ewaluacji. W zadaniu wymagającym sześćdziesięciu czterech kolejnych działań z punktem kontrolnym na końcu ta różnica to różnica między ukończeniem a cichym zatrzymaniem się w połowie, i to jest zadanie, dla którego zbudowano Qwen3.8-Max, a GPT-6 Luna nie.
Jedna liczba przemawia w drugą stronę i zasługuje na to, by ją przytoczyć, a nie zakopać. Wskaźnik halucynacji Qwen3.8-Max w rankingu omniscience board wynosi 40%, co oznacza wzrost z 23% w poprzedniej generacji — to znaczący regres, i to taki, który na produkcji objawia się jako pewne siebie błędne odpowiedzi, a nie jako wiersz w benchmarku. U GPT-6 Luna wynosi 77%, co oznacza spadek z 93%. Obie wartości są wysokie w ujęciu absolutnym, a tańszy model nadal wypada gorzej z tych dwóch pod tym względem. Żadna z tych liczb nie jest powodem, by preferować któryś z modeli; obie są powodem, by mieć człowieka lub weryfikatora w pętli wszędzie tam, gdzie sfabrykowany fakt jest kosztowny.
Klauzula długiego kontekstu jest jedynym wierszem, w którym Qwen wygrywa pod względem struktury.
GPT-6 Luna zawiera klauzulę, której Qwen3.8-Max nie ma: żądania powyżej 272 000 tokenów wejściowych są rozliczane według dwukrotności stawek za dane wejściowe i pamięć podręczną oraz 1,5× stawki za dane wyjściowe, stosowanych do całego żądania, a nie tylko do części przekraczającej limit. Wywołanie o rozmiarze 300 000 tokenów w GPT-6 Luna kosztuje 0,20 USD za milion tokenów wejściowych za wszystkie 300 000 tokenów, ponieważ przekroczyło limit o 28 000. Podziel ten sam dokument na dwa wywołania, a koszt zmniejszy się o połowę bez zmiany promptu.
Qwen3.8-Max ma stałą stawkę w całym swoim oknie 1 000 000 tokenów. W przypadku naprawdę ogromnych pojedynczych żądań sprawia to, że dwunastokrotna różnica w cenie wyjścia jest mniejsza, niż się wydaje, i może ją odwrócić: powyżej 272 000 tokenów wejściowych efektywna stawka wejściowa GPT-6 Luna podwaja się do 0,20 USD, a jej stawka wyjściowa wzrasta do 0,75 USD, w porównaniu ze stałymi 2,00 USD i 6,00 USD Qwen. Różnica maleje z dwudziestokrotnej do dziesięciokrotnej na wejściu i z dwunastokrotnej do ośmiokrotnej na wyjściu. Nadal duża — ale obciążenia, które najprawdopodobniej mają 300 000-tokenowy kontekst roboczy, to dokładnie te agentowe, do których sprzedają obaj dostawcy, a zespoły, które je uruchamiają, to zespoły, które to zauważą.
Inną pozycją strukturalną jest przypięta wersja. Qwen3.8-Max-0902 jest dostępny w tej samej cenie co identyfikator kroczący, co oznacza, że zespół potrzebujący powtarzalnego działania po aktualizacji modelu może go mieć bez płacenia dodatkowo. GPT-6 Luna nie oferuje niczego równoważnego. To drobna pozycja w cenniku i poważna pozycja w analizie po zdarzeniu.
Uruchamianie jednego z nich lub obu
Qwen3.8-Max jest dostępny w OrcaRouter w cenie katalogowej Alibaby, w ramach cen przenoszonych (pass-through), co oznacza, że zmiana stawek dostawcy obowiązuje po naszej stronie tego samego dnia. Dwie cechy naszej warstwy routingu zasługują na swoje miejsce w przypadku tego konkretnego modelu: automatyczne przełączanie awaryjne, ponieważ hostowany flagowiec z publicznie udostępnioną bazą otwartych wag ma więcej źródeł nadrzędnych niż zamknięty model jednego dostawcy i więcej sposobów, w jakie jedno z nich może ulec degradacji; oraz obsługa przypiętej wersji, która pozwala trasie jawnie wskazywać Qwen3.8-Max-0902 zamiast dziedziczyć to, na co w przyszłym tygodniu wskaże zmienny identyfikator.
GPT-6 Luna nie znajduje się w naszym katalogu na dzień pisania tego tekstu i dostęp do niej uzyskuje się przez własne API OpenAI, więc zespół, który chce mieć oba modele, używa jednego klucza dla Qwen3.8-Max obok tego, czego już używa dla OpenAI. To jest również ta para, w której DSL routingu jest wart więcej niż statyczny podział, ponieważ granica między tymi dwoma modelami to kontrola modalności i kontrola długości, a nie preferencja: żądania zawierające wideo trafiają do Qwen3.8-Max, ponieważ nic innego nie może ich obsłużyć, żądania powyżej 272 000 tokenów wejściowych trafiają do Qwen3.8-Max, ponieważ próg cenowy innego modelu sprawia, że są tam droższe, a wszystko inne trafia do modelu, który jest dwudziestokrotnie tańszy. To reguła i należy ona do konfiguracji, a nie do gałęzi aplikacji.

Który i kiedy
Wybierz Qwen3.8-Max, jeśli którykolwiek z poniższych warunków jest prawdziwy. Twój potok wymaga wejścia wideo. Twoje żądania rutynowo przekraczają 272 000 tokenów wejściowych, gdzie jego stała taryfa bije nowy cennik GPT-6 Luna. Twoje wyjście przekracza 128 000 tokenów. Twoja praca to długohoryzontowe wykonanie agentowe z weryfikowalnym punktem końcowym, gdzie jego 58 w rankingu agentowym i 1739 Elo w GDPval przy 64 turach na zadanie to dowody, które się liczą. Albo potrzebujesz przypiętej rewizji dla odtwarzalności i jesteś gotów za nią zapłacić — co przy tej samej cenie co identyfikator kroczący oznacza, że nie jesteś gotów.
Wybierz GPT-6 Luna, jeśli żaden z tych przypadków nie zachodzi, a Twoje obciążenie jest masowe, konsumowane programowo, tekstowo-obrazowe i krótkie. Klasyfikacja, ekstrakcja, routing, masowe streszczanie, wewnętrzna pętla agenta, który potrzebuje szybkiej odpowiedzi, a nie starannej. Przy $0.10/$0.50, jednocentowym odczycie z pamięci podręcznej i koszcie na ukończone zadanie wynoszącym około jednej piętnastej kosztu Qwen3.8-Max arytmetyka nie pozostawia wątpliwości. Ustaw parametr effort jawnie — wartość domyślna to medium, a reklamowane 37 to liczba dla maksymalnego wysiłku — i trzymaj długie wywołania po właściwej stronie granicy 272 000 tokenów.
Błąd, do którego zachęca to porównanie, polega na odczytaniu dwudziestokrotnej ceny wejściowej jako werdyktu. To werdykt dotyczący jednego profilu obciążenia i milczy o trzech warunkach, które rozstrzygają o tym drugim: czy żądanie zawiera wideo, czy przekracza 272,000 tokenów i czy odpowiedź musi przetrwać sześćdziesiąt cztery sekwencyjne kroki.

Porównane w tym artykule3
Wykryto na podstawie tego artykułu · Benchmarki: Artificial Analysis · aktualizowane codziennie
