Wygenerowana karta tytułowa hero do artykułu zatytułowanego „Grok 4.7 vs Qwen 3.8 Max — rzut monetą na papierze”, z podtytułem „Identyczna cena, różnica jednego punktu indeksu, przeciwne kształty” oraz plakietkami statystyk pokazującymi AA Index 46 vs 45, cenę $2/$6 w obu przypadkach i kontekst 500K vs 984K.
Guides & Insights

Grok 4.7 vs Qwen 3.8 Max: identyczna cena, jeden punkt różnicy, przeciwne kształty

Autor

Elias Hawthorne

Data publikacji

Najnowsze modele · 20Zobacz wszystkie modele
Benchmarki: Artificial Analysis · aktualizowane codziennie
Powrót do wszystkich wpisów

Dwa zamknięte modele flagowe, oba w cenie 2 USD za milion tokenów wejściowych i 6 USD za milion tokenów wyjściowych, oba z wynikami w granicach jednego punktu od siebie w tym samym niezależnym benchmarku, wypuszczone w odstępie dziewiętnastu dni. Grok 4.7 pojawił się 21 września 2026 roku od SpaceXAI; Qwen 3.8 Max został wydany przez dostawcę 3 sierpnia 2026 roku i odświeżony 2 września 2026 roku. W aktualnym Artificial Analysis Intelligence Index, w wersji v4.3.2, Grok 4.7 uzyskuje wynik 46, a Qwen 3.8 Max — 45. Pod względem ceny i zmierzonych możliwości te dwa modele to ten sam zakup. Pod każdym innym względem — kontekstu, modalności, szybkości obsługi, otwartości i tego, co każdy dostawca postanowił zoptymalizować — nie mogłyby się bardziej różnić, i właśnie dlatego warto przeprowadzić to porównanie, a nie je pomijać.

Najpierw oś czasu, ponieważ Qwen 3.8 Max ma dwie daty

To wprowadza zamieszanie w wielu materiałach, więc warto to wyjaśnić na wstępie. Qwen 3.8 Max zadebiutował 3 sierpnia 2026 r. jako największy i najzdolniejszy model Alibaby, zbudowany na architekturze wizyjno-językowej Qwen 3.5 w oparciu o rzadką konstrukcję mieszanki ekspertów, o raportowanej łącznej liczbie 2,4 biliona parametrów i 95 miliardach aktywnych na token. 2 września 2026 r. Alibaba udostępniła odświeżoną kompilację — wersję 0902, która jest wersją z aktualnymi identyfikatorami modeli oraz tą, do której Artificial Analysis datuje swoją stronę. Jeśli spotkałeś się zarówno z sierpniową, jak i wrześniową datą dla Qwen 3.8 Max, właśnie dlatego: jedna to premiera, a druga to wersja, którą większość ludzi faktycznie dziś nazywa.

Grok 4.7 ma czystszą historię, a za sobą bardziej pogmatwaną. SpaceXAI wydało go 21 września 2026 r. po premierze, która wielokrotnie się przesuwała — Musk wskazywał na okna czasowe pod koniec sierpnia, na początku września i w połowie września, zanim model faktycznie się ukazał. Sama premiera miała wąski zakres: większy model bazowy niż Grok 4.6, dłuższy przebieg uczenia ze wzmocnieniem ukierunkowany na wielogodzinne zadania oraz brak zmian w cenniku $2/$6, który Grok 4.6 utrzymywał od 12 sierpnia.

Pod kątem czego optymalizował każdy dostawca

Przeczytaj oba komunikaty o premierze jako parę, a zakłady projektowe okażą się niemal doskonale przeciwstawne.

SpaceXAI zoptymalizowano pod kątem działania agentowego. Podane przez dostawcę wyniki Grok 4.7 koncentrują się na pracy w terminalu i repozytoriach: Terminal-Bench 4.0 na poziomie 38,0% wobec 20,3% dla Grok 4.6, CursorBench 4.0 na poziomie 46,3%, DeepSWE v1.1 na poziomie 71,0% przy wysokim wysiłku rozumowania, EEBench na poziomie 64,0%. Własny opis wydania firmy wskazuje jako cele samoweryfikację i obsługę długiego kontekstu w środowisku Grok Bot. Grok 4.7 obsługuje okno 500 000 tokenów, przyjmuje tekst i obrazy, zwraca tekst oraz udostępnia poziomy wysiłku rozumowania od low do xhigh. To model stworzony do doprowadzania zadań do końca.

Alibaba zoptymalizowała pod kątem zasięgu. Qwen 3.8 Max oferuje okno kontekstowe o rozmiarze około 984 000 tokenów — w praktyce miliona — a jego publikowane mocne strony to szerokość, a nie głębia w jednej dziedzinie: wynik Terminal Bench 2.1 na poziomie 86,6, SWE-bench Pro 67,7, PaperBench 93,0, GPQA Diamond 92,6, MMMU-Pro 82,3, OSWorld-Verified 86,1. Przyjmuje dane wejściowe w postaci tekstu, obrazu i wideo, a zwraca tekst; obsługuje poziomy wysiłku rozumowania, przy czym domyślnie jest to xhigh, a jego słabszym publikowanym wynikiem jest Humanity's Last Exam na poziomie 43,6. To model stworzony do obsługi wszystkiego, co mu podasz.

Każda liczba w tym akapicie pochodzi od dostawcy. Żadnego z tych zestawów nie odtworzono niezależnie, a poza tym oba zestawy i tak nie są bezpośrednio porównywalne — Terminal-Bench 2.1 i Terminal-Bench 4.0 to różne benchmarki, więc wyników 86,6 Qwena i 38,0 Groka nigdy nie należy stawiać obok siebie.

• Niezależny wynik złożony — Grok 4.7 46 w AA Intelligence Index v4.3.2 vs Qwen 3.8 Max 45 w tej samej wersji. Statystyczny remis.

• Cena za milion tokenów — 2,00 USD za wejście / 6,00 USD za wyjście w obu przypadkach. Rabat za pamięć podręczną Qwen jest podany jako 88%, co daje mieszaną stawkę 1,18 USD za milion; warunki pamięci podręcznej Grok 4.7 nie są publikowane na tej samej podstawie.

• Okno kontekstowe — Grok 4.7 500 000 tokenów vs Qwen 3.8 Max około 984 000. Qwen wygrywa niemal dwukrotnie, a to największa pojedyncza różnica w specyfikacji między nimi.

• Modalności wejściowe — Grok 4.7 tekst i obraz vs Qwen 3.8 Max tekst, obraz i wideo.

• Wagi — oba zastrzeżone. Żadnego z modeli nie można pobrać, co całkowicie eliminuje z tego porównania zwykły argument o otwartych wagach.

• Parametry — Grok 4.7 nieujawniony w żadnej karcie specyfikacji SpaceXAI (liczba ~2,1T to twierdzenie Muska) vs Qwen 3.8 Max podawany jako 2,4T łącznie przy 95B aktywnych, którego Alibaba również nie potwierdziła w karcie specyfikacji.

• Szybkość obsługi — Qwen 3.8 Max przy 38,8 tokenu wyjściowego na sekundę i 3,08 sekundy do pierwszego tokenu, według Artificial Analysis; Grok 4.7 pozycjonowany przez SpaceXAI jako około dwa razy szybszy od porównywalnych modeli, według danych dostawcy, bez opublikowanego jeszcze niezależnego wskaźnika przepustowości.

A generated two-column comparison scoreboard for Grok 4.7 and Qwen 3.8 Max with six rows: AA Intelligence Index 46 vs 45, price $2.00/$6.00 on both, context 500K vs 984K tokens, modalities text and image vs text, image and video, weights proprietary on both, and speed vendor-claimed twice as fast vs 38.8 tokens per second measured, with a footer noting index scores are per Artificial Analysis v4.3.2 and all benchmark figures are vendor-reported.

Różnica kontekstu jest prawdziwą decyzją.

Gdy cena i możliwości są identyczne, decyduje to, co jeszcze się różni — a tutaj jest nim kontekst. Podwojenie okna z 500 000 do około 984 000 tokenów to nie drobiazg z karty specyfikacji — to różnica między dzieleniem repozytorium na fragmenty a trzymaniem go w całości.

Dłuższe okno Qwen 3.8 Max wiąże się z udokumentowanym zastrzeżeniem, które ma znaczenie dla kupujących: ogłoszona przez Alibaba na tydzień 10 sierpnia 2026 wersja z otwartymi wagami była wyłącznie tekstowa i nie obejmowała pełnego kontekstu miliona tokenów. Nie wpływa to na hostowany punkt końcowy, którego dotyczy to porównanie, ale warto o tym wiedzieć, jeśli planowano w oparciu o otwarte wydanie.

Po stronie Grok jest jeszcze druga kwestia. W przypadku linii Grok historycznie stosowano klif cenowy przy 200 000 tokenów wejściowych: żądanie przekraczające ten próg powoduje ponowne naliczenie opłaty za całe żądanie według podwójnej stawki — $4 za wejście i $12 za wyjście. Przy oknie 500 000 tokenów ten próg znajduje się głęboko w zakresie roboczym modelu. Przed kierowaniem zadań z długim kontekstem do Grok 4.7 potwierdź aktualny cennik dla wdrożonego modelu, ponieważ to właśnie na styku dużego okna i klifu ponownego naliczania opłat pojawiają się błędy w rachunkach za długi kontekst.

Ile kosztuje miesiąc pracy na każdym

Ponieważ stawki bazowe są identyczne, porównanie kosztów trzeba oprzeć na zachowaniu tokenów, a nie na cenniku — i właśnie tu oba modele rozchodzą się w sposób mierzalny.

Artificial Analysis zmierzyło, że Grok 4.7 wygenerował 240 milionów tokenów wyjściowych podczas uruchamiania swojego Intelligence Index, wobec mediany 92 milionów wśród modeli na liście — to rozwlekły model rozumujący. Qwen 3.8 Max wygenerował 190 milionów tokenów wyjściowych w tym samym indeksie, przy całkowitym koszcie oceny wynoszącym 4 934,79 USD i zmierzonej prędkości 38,8 tokena na sekundę. Oba znacznie przekraczają medianę rozwlekłości, a Grok 4.7 jest bardziej rozwlekły z tej dwójki.

Przy identycznej cenie 6 USD za milion tokenów wyjściowych model, który generuje więcej tokenów na zadanie, kosztuje więcej na zadanie. Opublikowane dane o rozwlekłości sugerują, że Grok 4.7 zużyje więcej tokenów wyjściowych przy równoważnej pracy indeksowej, co oznacza, że remis w cenie jest w rzeczywistości niewielką wygraną Qwen 3.8 Max pod względem kosztu na zadanie — równoważoną przez deklarowaną przewagę szybkości Grok 4.7, która skraca czas zegarowy, a więc i ludzki koszt oczekiwania na przebieg agenta. Żadnego z tych czynników równoważących nie widać w cenniku, a oba warto zmierzyć na własnym ruchu, zamiast zakładać.

Jedyną asymetrią, która nie budzi sporu, jest buforowanie. Qwen 3.8 Max podaje 88% zniżki za cache i łączną stawkę 1,18 USD przy mieszance 7:2:1 trafień cache/wejścia/wyjścia. W przypadku obciążeń z dużym stabilnym prefiksem — promptem systemowym, nagłówkiem bazy kodu, zestawem dokumentów — to właśnie w tej zniżce tkwią prawdziwe oszczędności i warto sprawdzić, jak wypadają warunki cache w Grok 4.7, zanim zadeklarujesz wolumen.

Screenshot of the Artificial Analysis model page for Qwen3.8 Max showing an Intelligence Index of 45 on index version v4.3.2, a context window of approximately 984k tokens, text and image input, listed pricing of $2.00 input and $6.00 output per million tokens, and an output speed of 38.8 tokens per second.

Wybieranie, gdy liczby odmawiają wybrać za ciebie

Ocena 46 i ocena 45 w tym samym indeksie, przy tej samej cenie, to najbardziej zbliżony do prawdziwego remisu wynik, jaki ten blog prawdopodobnie opublikuje. Oznacza to, że decyzję należy podjąć na osiach, na których te dwa modele faktycznie się różnią, a są ich cztery.

Wybierz Grok 4.7, jeśli Twoja praca polega na kodowaniu agentowym i wykonywaniu zadań w terminalu, jeśli przy długich przebiegach szybkość rzeczywista liczy się bardziej niż zapas kontekstu oraz jeśli chcesz mieć regulację poziomu rozumowania na żądanie, aby łatwy ruch pozostawał tani. Wybierz Qwen 3.8 Max, jeśli regularnie obsługujesz dane wejściowe większe niż pół miliona tokenów, jeśli wejście wideo jest w Twoich planach, jeśli chcesz 88% zniżki na pamięć podręczną dla obciążeń intensywnie korzystających z prefiksów albo jeśli chcesz model, którego dostawca publikuje szeroką macierz oceny, a nie taką skupioną na jednej dziedzinie.

Jeśli szczera odpowiedź brzmi „trochę jednego i trochę drugiego”, to jest to normalna odpowiedź i właśnie dla takiego przypadku powstała ta para. Qwen 3.8 Max jest dostępny w OrcaRouter w cenie katalogowej Alibaby, a OrcaRouter przekazuje ceny katalogowe dostawców z 0% marży, więc powyższe 2 USD/6 USD to kwota, którą faktycznie płacisz, a zmiana stawek dostawcy obowiązuje tutaj tego samego dnia, a nie dopiero przy odnowieniu. Jeden klucz API obejmuje Qwen 3.8 Max oraz ponad 200 innych modeli, co oznacza, że decyzja dotycząca kontekstu staje się regułą routingu na poziomie pojedynczego żądania, a nie zobowiązaniem wobec platformy: wysyłaj zbyt duże dane wejściowe do okna 984k, a wszystko inne zostawiaj na tym punkcie końcowym, który jest najszybszy i najtańszy dla danego zadania, z automatycznym przełączaniem awaryjnym, jeśli dostawca zacznie działać gorzej. Tam, gdzie zadanie rzeczywiście wymaga obu tych kształtów — odczytu długiego kontekstu, po którym następuje przebieg wykonawczy agenta — DSL routingu łączy modele w jedno wywołanie, zamiast zmuszać cię do wyboru jednej strony.

Warto wyjaśnić jedną rzecz, skoro żaden z modeli nie jest otwarty: nic w tym porównaniu nie dotyczy wag możliwych do pobrania. Oba są hostowanymi endpointami i w żadnym z przypadków samodzielny hosting nie wchodzi w grę.

Jedna liczba, o której warto pamiętać

Czterdzieści sześć przeciw czterdziestu pięciu nie jest powodem, by wybierać model, i nie powinno być. O tym porównaniu decyduje okno kontekstowe — 500 000 tokenów przeciw około 984 000 — oraz kształt, jaki wybrał każdy z dostawców: Grok 4.7 zoptymalizowany pod kątem szybkiego kończenia trudnych zadań agentowych, Qwen 3.8 Max zoptymalizowany pod kątem obsługi wszystkiego, co mu dasz. Ta sama cena, ta sama zmierzona zdolność, inne zadania. To decyzja o routingu i właśnie tego typu decyzja powinna zająć popołudnie na testy, a nie kwartał na zakup.

Screenshot of the OrcaRouter model page for Qwen3.8 Max (model ID qwen/qwen3.8-max), showing Alibaba's list pricing of $2.00 per million input tokens and $6.00 per million output tokens, a 1M token context window, and the vision, tools, JSON and reasoning capability tags.

Porównane w tym artykule2

Wykryto na podstawie tego artykułu · Benchmarki: Artificial Analysis · aktualizowane codziennie