Wygenerowana karta tytułowa hero z nagłówkiem „GPT-6 Luna vs Qwen3.8-Max”, podtytułem „Najtańszy model tutaj to nie ten, który ogląda wideo”, stopką o treści „Ceny według OpenAI i Alibaba Cloud; dane indeksu według Artificial Analysis.” oraz logo OrcaRouter umieszczonym w prawym dolnym rogu.
Guides & Insights

GPT-6 Luna vs Qwen3.8-Max: Najtańszy model w tym porównaniu jest także jedynym, który ogląda wideo

Autor

Gideon Frost

Data publikacji

Najnowsze modele · 20Zobacz wszystkie modele
Benchmarki: Artificial Analysis · aktualizowane codziennie
Powrót do wszystkich wpisów

Oczywiste ujęcie tego zestawienia jest błędne. Qwen3.8-Max ma cenę 2,00 USD za milion tokenów wejściowych i 6,00 USD za milion tokenów wyjściowych, a odczyty z pamięci podręcznej kosztują 0,25 USD. GPT-6 Luna ma cenę 0,10 USD i 0,50 USD, a odczyty z pamięci podręcznej kosztują centa. Dwadzieścia razy na wejściu, dwanaście razy na wyjściu, pięćdziesiąt razy na wejściu z pamięci podręcznej — różnica cen jest tak duża, że porównanie wydaje się rozstrzygnięte, zanim się zacznie.

To nie jest rozstrzygnięte, ponieważ oba modele nie konkurują o to samo żądanie. Qwen3.8-Max akceptuje tekst, obraz i wideo, a jego limit wyjściowy wynoszący 131 072 tokeny jest nieco wyższy niż 128 000 w GPT-6 Luna. GPT-6 Luna akceptuje tylko tekst i obraz. Model Alibaby uzyskuje 58 punktów w niezależnym Intelligence Index — pierwszy w swojej klasie na tablicy agentowej — a GPT-6 Luna uzyskuje 37 punktów przy maksymalnym wysiłku, 29 przy domyślnym. Jeden to flagowiec z otwartym rodowodem wag i modalnością wejścia wideo. Drugi to poziom masowy z wynikiem szybkości i jednocentową stawką cache. Różnica w cenie nie jest zniżką na to samo; to opis dwóch różnych rzeczy.

Czym jest każde z tych dwóch

Qwen3.8-Max to flagowy model firmy Alibaba z generacji 3.8, checkpoint klasy Max, którego bazowy model — Qwen3.8-2.4T-A95B — został publicznie udostępniony na niestandardowej licencji 12 sierpnia 2026 r., co czyni go pierwszym Qwen klasy Max, który w ogóle ma otwarte wagi. Sam hostowany flagowiec jest nadal wymieniany przez niezależny panel jako zastrzeżony. Ma okno kontekstowe 1 000 000 tokenów, limit wyjściowy 131 072 tokenów, wejście tekstowe, obrazowe i wideo oraz możliwość wyboru nakładu rozumowania na poziomie niskim, średnim i bardzo wysokim. Przypięta wersja Qwen3.8-Max-0902 jest dostępna w tej samej cenie, co jest drobnym szczegółem o realnej wartości operacyjnej.

GPT-6 Luna to poziom wydajności OpenAI z 22 września 2026 r., plasujący się poniżej GPT-6 Sol w cenie 2,00 USD/10,00 USD oraz flagowego GPT-6 Astra w cenie 10,00 USD/50,00 USD. Wejście tekstowe i obrazowe, wyjście tekstowe, okno o rozmiarze 1 050 000 tokenów z maksymalnym wejściem 922 000, limit wyjściowy 128 000 tokenów oraz poziom wysiłku od none przez low, medium, high, xhigh do max, z domyślnym medium. Zamknięty, z pojedynczym identyfikatorem, dostępny dla każdego z kluczem API.

Jeden obsługuje wideo i można go pobrać w podstawowej wersji. Drugi obsługuje obrazy i jest szybki. Oba są wycenione z myślą o użyciu na dużą skalę. Część wspólna tych dwóch stwierdzeń jest mniejsza, niż sugeruje stosunek cen.

Karty, linia po linii

Jedna linia na wymiar, obie strony w każdym:

• Wejście za 1 mln — GPT-6 Luna $0,10 vs Qwen3.8-Max $2,00

• Wyjście za 1 mln — GPT-6 Luna $0.50 vs Qwen3.8-Max $6.00

• Wejście z pamięci podręcznej za 1 mln — GPT-6 Luna $0,01 vs Qwen3.8-Max $0,25 za niejawne odczyty z pamięci podręcznej, z jawnym odczytem z pamięci podręcznej po $0,17 i jawnym zapisem do pamięci podręcznej po $2,50

• Klauzula długiego kontekstu — GPT-6 Luna podwaja wejście i pamięć podręczną oraz podnosi limit wyjścia 1,5× powyżej 272 000 tokenów wejściowych, stosowana do całego żądania, podczas gdy Qwen3.8-Max ma jednolity poziom w całym oknie, co jest jedynym miejscem, w którym karta Qwen jest strukturalnie lepsza, a nie tylko marginalnie tańsza.

• Okno kontekstowe — GPT-6 Luna 1 050 000 tokenów vs Qwen3.8-Max 1 000 000 tokenów

• Maksymalna liczba tokenów wyjściowych — GPT-6 Luna 128 000 tokenów vs Qwen3.8-Max 131 072 tokeny

• Modalności wejściowe — GPT-6 Luna tekst i obraz vs Qwen3.8-Max tekst, obraz i wideo

• Poziom rozumowania — GPT-6 Luna: brak, niski, średni (domyślny), wysoki, bardzo wysoki, maksymalny vs Qwen3.8-Max: niski, średni i ekstra wysoki

• Intelligence Index, niezależny — GPT-6 Luna 37 przy maksymalnym wysiłku vs Qwen3.8-Max 58

• Agentic Index, niezależny — Qwen3.8-Max 58, pierwszy w swojej klasie; nie opublikowano porównywalnego wyniku dla GPT-6 Luna

• Wynik dla domyślnego poziomu wysiłku — GPT-6 Luna 29 przy domyślnym ustawieniu średnim vs Qwen3.8-Max mierzony przy maksymalnym ustawieniu

• Koszt na zadanie Index, niezależny — GPT-6 Luna około 0,07 USD w porównaniu z Qwen3.8-Max 5,41 USD

• GDPval, niezależny — Qwen3.8-Max 1 739 Elo przy 64 turach na zadanie, co daje około 1,14 USD na ukończone zadanie w tej ewaluacji; nie opublikowano porównywalnego przebiegu GPT-6 Luna

• Wskaźnik halucynacji w AA-Omniscience — Qwen3.8-Max 40%, regresja z 23% w poprzedniej generacji; GPT-6 Luna 77%, spadek z 93%

• Datowana migawka — GPT-6 Luna jako pojedynczy identyfikator kroczący vs Qwen3.8-Max-0902 dostępny jako przypięta wersja z 2 września 2026 r. w tej samej cenie

• Wagi — GPT-6 Luna zamknięty, dostępny wyłącznie przez API, kontra Qwen3.8-Max: bazowy checkpoint Qwen3.8-2.4T-A95B publiczny na licencji niestandardowej od 12 sierpnia 2026 r., podczas gdy hostowany model flagowy figuruje jako zastrzeżony

• Na OrcaRouter — GPT-6 Luna poza naszym katalogiem vs Qwen3.8-Max z możliwością routingu w cenie katalogowej Alibaba

Generated two-column scoreboard titled 'GPT-6 Luna vs Qwen3.8-Max - the scoreboard'. Left column GPT-6 Luna rows: Price in/out $0.10 / $0.50, Cached input $0.01, AA Index 37 at max effort, Context 1,050,000, Input text + image, Cost per index task $0.07. Right column Qwen3.8-Max rows: Price in/out $2.00 / $6.00, Cached input $0.25, AA Index 58, Context 1,000,000, Input text + image + video, Cost per index task $5.41. Footer: 'Prices per OpenAI and Alibaba Cloud; index figures per Artificial Analysis.'

Wideo nie jest pozycją na liście funkcji, to inne obciążenie.

Wiersz modalności to ten, który decyduje o większej liczbie rzeczywistych porównań niż wiersz ceny, i zazwyczaj jest odczytywany jako pole wyboru.

Qwen3.8-Max obsługuje wideo. GPT-6 Luna nie. Jeśli Twój pipeline musi wyciągać wnioski z nagrania ekranu, demonstracji produktu, zapisu wykładu, fragmentu z kamery bezpieczeństwa albo przejścia przez interfejs użytkownika, porównanie kończy się na tej linii, a dwudziestokrotna różnica w cenie staje się nieistotna — nie wybierasz między drogą opcją a tanią, wybierasz między opcją a jej brakiem. Wyodrębnianie klatek i przekazywanie ich jako obrazów to obejście, a nie odpowiednik, i każdy, kto takie zbudował, zna różnicę zarówno w kosztach, jak i w jakości.

Jeśli Twój pipeline obejmuje tekst i obrazy, linia modalności milczy, a linia ceny mówi. To uczciwy podział i warto powiedzieć wprost, po której jego stronie stoisz, zanim przeczytasz cokolwiek innego na tej stronie.

Luka agentowa jest realna i to ona stanowi kosztowną połowę różnicy w cenie.

Qwen3.8-Max uzyskuje 58 punktów w niezależnym Intelligence Index. GPT-6 Luna uzyskuje 37 punktów przy maksymalnym wysiłku i 29 w domyślnym trybie średnim. Dwadzieścia jeden punktów przy dopasowanych ustawieniach, dwadzieścia dziewięć przy ustawieniach domyślnych — w złożonym wskaźniku, w którym pojedynczy punkt mieści się w szumie ponownego przebiegu, różnica tej wielkości nie jest szumem.

Pozycja Qwen3.8-Max koncentruje się na pracy agentowej. Osiąga 58 punktów w niezależnym Agentic Index, co daje mu pierwsze miejsce w swojej klasie, oraz 1 739 Elo w GDPval przy 64 turach na zadanie. Ta ostatnia liczba jest najbardziej pouczająca, ponieważ jest to pomiar modelu utrzymującego spójność zadania przez sześćdziesiąt cztery następujące po sobie decyzje, a wiąże się z tym konkretny koszt: około 1,14 USD za ukończone zadanie w tej ewaluacji. Porównaj to z kosztem GPT-6 Luna w przeliczeniu na zadanie indeksowe, wynoszącym około 0,07 USD, a uczciwe stwierdzenie nie polega na tym, że Qwen jest drogi. Polega ono na tym, że Qwen jest proszony o zrobienie znacznie trudniejszej rzeczy — i robi ją.

Wniosek z tego jest taki, że dwudziestojednopunktowa strata GPT-6 Luna również nie rozkłada się równomiernie w całym twoim obciążeniu pracą. W przypadku krótkiego, dobrze określonego zadania konsumowanego przez program — wyodrębnij to pole, sklasyfikuj to zgłoszenie, skieruj to żądanie — oba modele niemal zawsze dadzą tę samą użyteczną odpowiedź, a różnica w indeksie będzie niewidoczna w twojej ewaluacji. W zadaniu wymagającym sześćdziesięciu czterech kolejnych działań z punktem kontrolnym na końcu ta różnica to różnica między ukończeniem a cichym zatrzymaniem się w połowie, i to jest zadanie, dla którego zbudowano Qwen3.8-Max, a GPT-6 Luna nie.

Jedna liczba przemawia w drugą stronę i zasługuje na to, by ją przytoczyć, a nie zakopać. Wskaźnik halucynacji Qwen3.8-Max w rankingu omniscience board wynosi 40%, co oznacza wzrost z 23% w poprzedniej generacji — to znaczący regres, i to taki, który na produkcji objawia się jako pewne siebie błędne odpowiedzi, a nie jako wiersz w benchmarku. U GPT-6 Luna wynosi 77%, co oznacza spadek z 93%. Obie wartości są wysokie w ujęciu absolutnym, a tańszy model nadal wypada gorzej z tych dwóch pod tym względem. Żadna z tych liczb nie jest powodem, by preferować któryś z modeli; obie są powodem, by mieć człowieka lub weryfikatora w pętli wszędzie tam, gdzie sfabrykowany fakt jest kosztowny.

Klauzula długiego kontekstu jest jedynym wierszem, w którym Qwen wygrywa pod względem struktury.

GPT-6 Luna zawiera klauzulę, której Qwen3.8-Max nie ma: żądania powyżej 272 000 tokenów wejściowych są rozliczane według dwukrotności stawek za dane wejściowe i pamięć podręczną oraz 1,5× stawki za dane wyjściowe, stosowanych do całego żądania, a nie tylko do części przekraczającej limit. Wywołanie o rozmiarze 300 000 tokenów w GPT-6 Luna kosztuje 0,20 USD za milion tokenów wejściowych za wszystkie 300 000 tokenów, ponieważ przekroczyło limit o 28 000. Podziel ten sam dokument na dwa wywołania, a koszt zmniejszy się o połowę bez zmiany promptu.

Qwen3.8-Max ma stałą stawkę w całym swoim oknie 1 000 000 tokenów. W przypadku naprawdę ogromnych pojedynczych żądań sprawia to, że dwunastokrotna różnica w cenie wyjścia jest mniejsza, niż się wydaje, i może ją odwrócić: powyżej 272 000 tokenów wejściowych efektywna stawka wejściowa GPT-6 Luna podwaja się do 0,20 USD, a jej stawka wyjściowa wzrasta do 0,75 USD, w porównaniu ze stałymi 2,00 USD i 6,00 USD Qwen. Różnica maleje z dwudziestokrotnej do dziesięciokrotnej na wejściu i z dwunastokrotnej do ośmiokrotnej na wyjściu. Nadal duża — ale obciążenia, które najprawdopodobniej mają 300 000-tokenowy kontekst roboczy, to dokładnie te agentowe, do których sprzedają obaj dostawcy, a zespoły, które je uruchamiają, to zespoły, które to zauważą.

Inną pozycją strukturalną jest przypięta wersja. Qwen3.8-Max-0902 jest dostępny w tej samej cenie co identyfikator kroczący, co oznacza, że zespół potrzebujący powtarzalnego działania po aktualizacji modelu może go mieć bez płacenia dodatkowo. GPT-6 Luna nie oferuje niczego równoważnego. To drobna pozycja w cenniku i poważna pozycja w analizie po zdarzeniu.

Uruchamianie jednego z nich lub obu

Qwen3.8-Max jest dostępny w OrcaRouter w cenie katalogowej Alibaby, w ramach cen przenoszonych (pass-through), co oznacza, że zmiana stawek dostawcy obowiązuje po naszej stronie tego samego dnia. Dwie cechy naszej warstwy routingu zasługują na swoje miejsce w przypadku tego konkretnego modelu: automatyczne przełączanie awaryjne, ponieważ hostowany flagowiec z publicznie udostępnioną bazą otwartych wag ma więcej źródeł nadrzędnych niż zamknięty model jednego dostawcy i więcej sposobów, w jakie jedno z nich może ulec degradacji; oraz obsługa przypiętej wersji, która pozwala trasie jawnie wskazywać Qwen3.8-Max-0902 zamiast dziedziczyć to, na co w przyszłym tygodniu wskaże zmienny identyfikator.

GPT-6 Luna nie znajduje się w naszym katalogu na dzień pisania tego tekstu i dostęp do niej uzyskuje się przez własne API OpenAI, więc zespół, który chce mieć oba modele, używa jednego klucza dla Qwen3.8-Max obok tego, czego już używa dla OpenAI. To jest również ta para, w której DSL routingu jest wart więcej niż statyczny podział, ponieważ granica między tymi dwoma modelami to kontrola modalności i kontrola długości, a nie preferencja: żądania zawierające wideo trafiają do Qwen3.8-Max, ponieważ nic innego nie może ich obsłużyć, żądania powyżej 272 000 tokenów wejściowych trafiają do Qwen3.8-Max, ponieważ próg cenowy innego modelu sprawia, że są tam droższe, a wszystko inne trafia do modelu, który jest dwudziestokrotnie tańszy. To reguła i należy ona do konfiguracji, a nie do gałęzi aplikacji.

Screenshot of OpenAI's developer documentation page for GPT-6 Luna, showing the model selector, the description 'Our most efficient model for focused, high-volume tasks', reasoning set to High, speed Fast, price $0.1 · $0.5, text and image input with text output, a 1,050,000-token context window, 128,000 maximum output tokens, a May 18, 2026 knowledge cutoff, and pricing cards of $0.10 input, $0.01 cached input, $0.125 cache writes and $0.50 output per 1M tokens.

Który i kiedy

Wybierz Qwen3.8-Max, jeśli którykolwiek z poniższych warunków jest prawdziwy. Twój potok wymaga wejścia wideo. Twoje żądania rutynowo przekraczają 272 000 tokenów wejściowych, gdzie jego stała taryfa bije nowy cennik GPT-6 Luna. Twoje wyjście przekracza 128 000 tokenów. Twoja praca to długohoryzontowe wykonanie agentowe z weryfikowalnym punktem końcowym, gdzie jego 58 w rankingu agentowym i 1739 Elo w GDPval przy 64 turach na zadanie to dowody, które się liczą. Albo potrzebujesz przypiętej rewizji dla odtwarzalności i jesteś gotów za nią zapłacić — co przy tej samej cenie co identyfikator kroczący oznacza, że nie jesteś gotów.

Wybierz GPT-6 Luna, jeśli żaden z tych przypadków nie zachodzi, a Twoje obciążenie jest masowe, konsumowane programowo, tekstowo-obrazowe i krótkie. Klasyfikacja, ekstrakcja, routing, masowe streszczanie, wewnętrzna pętla agenta, który potrzebuje szybkiej odpowiedzi, a nie starannej. Przy $0.10/$0.50, jednocentowym odczycie z pamięci podręcznej i koszcie na ukończone zadanie wynoszącym około jednej piętnastej kosztu Qwen3.8-Max arytmetyka nie pozostawia wątpliwości. Ustaw parametr effort jawnie — wartość domyślna to medium, a reklamowane 37 to liczba dla maksymalnego wysiłku — i trzymaj długie wywołania po właściwej stronie granicy 272 000 tokenów.

Błąd, do którego zachęca to porównanie, polega na odczytaniu dwudziestokrotnej ceny wejściowej jako werdyktu. To werdykt dotyczący jednego profilu obciążenia i milczy o trzech warunkach, które rozstrzygają o tym drugim: czy żądanie zawiera wideo, czy przekracza 272,000 tokenów i czy odpowiedź musi przetrwać sześćdziesiąt cztery sekwencyjne kroki.

Screenshot of the OrcaRouter model page for Qwen3.8 Max (0902) showing the breadcrumb Home > Models > Qwen > Qwen3.8 Max (0902), a NEW badge, the model id qwen/qwen3.8-max-0902, Vision, Tools, JSON and Reasoning chips, a Qwen attribution dated 2026-09-02, the description of a September 2, 2026 snapshot accepting text, image and video input with a 1M-token context, input pricing of $2.00 and output of $6.00 per 1M tokens, a p50 time to first token of 3.50s, a p95 of 9.38s, and traffic of 196.6M tokens over seven days.

Porównane w tym artykule3

Wykryto na podstawie tego artykułu · Benchmarki: Artificial Analysis · aktualizowane codziennie