Wygenerowana karta tytułowa o treści: GPT-6 vs Grok 4.6, dwa środkowe poziomy, jeden rachunek rozbiegający się powyżej 200K tokenów, z kartami statystyk o treści: cena wejściowa 2,00 USD vs 2,00 USD za milion, próg dla długich żądań 272K vs 200K tokenów wejściowych oraz cena wyjściowa powyżej progu 15,00 USD vs 12,00 USD za milion, ze stopką o treści: stawki GPT-6 Sol i Grok 4.6 dla krótkiego kontekstu według własnej karty stawek każdego dostawcy; progi dla długiego kontekstu według tych samych kart.
Guides & Insights

GPT-6 vs Grok 4.6: Dwa średnie plany, jeden rachunek, który rozbiega się powyżej 200K tokenów

Autor

Alistair Wren

Data publikacji

Najnowsze modele · 20Zobacz wszystkie modele →
Benchmarki: Artificial Analysis · aktualizowane codziennie
Powrót do wszystkich wpisów

GPT-6 Sol i Grok 4.6 kosztują tyle samo — 2,00 USD za milion tokenów wejściowych i 6,00 USD za milion tokenów wyjściowych — na szczycie obu kolumn. To, czego prawie nikt nie podaje obok, to fakt, że kolumny przestają się zgadzać w różnych punktach żądania. Grok 4.6 zaczyna naliczać swoją stawkę za długi kontekst, gdy prompt przekroczy 200 000 tokenów wejściowych; GPT-6 Sol czeka aż do 272 000. Powyżej tych progów całe żądanie jest wyceniane od nowa — nie tylko nadwyżka — a obaj dostawcy przeliczają je w przeciwnych kierunkach, i to właśnie ten element decyduje o rachunku za długie uruchomienie agenta. GPT-6 Sol oraz jego modele siostrzane GPT-6 Astra i GPT-6 Luna trafiły do sprzedaży 22 września 2026 r.; Grok 4.6, środkowy poziom w linii SpaceXAI, trafił do sprzedaży 12 sierpnia 2026 r. i już dołączył do niego Grok 4.7, więc to porównanie dwóch wydanych modeli, a nie premiera któregokolwiek z nich.

Druga rzecz zmieniła się 7 października 2026, co ma znaczenie dla tego, jak w ogóle odczytujesz GPT-6: OpenAI zaczęło wdrażać GPT-6 do głównej karty Chat w ChatGPT, docierając do darmowych planów 8 października, przy czym plany Plus, Pro, Business i Enterprise korzystają z GPT-6 Sol, a plany Free i Go z GPT-6 Luna. To zmiana powierzchniowa — te same modele, znacznie większa publiczność i nowa warstwa interfejsu, którą OpenAI nazywa Intelligent UI. Nie zmienia ani jednego limitu API. Oznacza to jednak, że jeśli porównujesz „GPT-6” z czymkolwiek, to teraz porównujesz z modelem, z którym rozmawia również bardzo duża liczba osób w karcie przeglądarki.

W czym tak naprawdę różnią się te dwie karty

• Wejście dla krótkiego kontekstu — GPT-6 Sol 2,00 USD za milion vs Grok 4.6 2,00 USD za milion
• Wyjście dla krótkiego kontekstu — GPT-6 Sol 10,00 USD za milion vs Grok 4.6 6,00 USD za milion
• Próg dla długiego żądania — GPT-6 Sol zmienia cenę powyżej 272 000 tokenów wejściowych vs Grok 4.6 powyżej 200 000
• Wejście dla długiego żądania — GPT-6 Sol 4,00 USD za milion vs Grok 4.6 4,00 USD za milion
• Wyjście dla długiego żądania — GPT-6 Sol 15,00 USD za milion vs Grok 4.6 12,00 USD za milion
• Wejście z pamięci podręcznej — GPT-6 Sol 0,20 USD za milion vs Grok 4.6 0,50 USD za milion
• Okno kontekstowe — GPT-6 Sol 1 050 000 tokenów vs Grok 4.6 500 000 tokenów
• Modalności wejściowe — oba przyjmują tekst, obrazy i pliki
• Wynik w pracy wiedzowej — GPT-6 Sol 47,6 vs Grok 4.6 44,3 w Artificial Analysis Intelligence Index
• Terminal-Bench 2.1 — GPT-6 Sol nie opublikowano dla tej samej wersji vs Grok 4.6 88,4

Zestaw ze sobą oba wiersze wyjściowe, a kształt decyzji się wyłoni. Grok 4.6 jest o 4,00 USD tańszy za milion tokenów wyjściowych w przypadku każdego żądania poniżej 200K, a powyżej tej granicy tańszy tylko o 3,00 USD. To znacznie mniejsza różnica, niż sugeruje nagłówkowe 40%, ponieważ oba modele przeliczają cenę całego żądania, a nie tylko części powyżej progu — szczegół, nad którym warto się zatrzymać, skoro prompt o 200 001 tokenach nie jest rozliczany jako jeden token po drogiej stawce plus 200 000 po taniej.

A wtedy sam próg działa w drugą stronę. Grok 4.6 zaczyna naliczać nową stawkę 72 000 tokenów wcześniej niż GPT-6 Sol. W przypadku obciążenia, które stale utrzymuje się między 200 tys. a 272 tys. tokenów, Grok 4.6 jest droższym modelem, mimo niższej ceny za token podanej w nagłówku, i tylko on z tej dwójki w ogóle się przesunął. To, po której stronie tego okna znajdą się twoje prompty, jest bardziej przydatnym pytaniem niż to, która cena z nagłówka jest niższa.

Generated comparison scoreboard titled GPT-6 vs Grok 4.6, the scoreboard, with six matched rows. GPT-6 Sol: input $2.00 per million, output $10.00 per million, long-request step above 272K input tokens, long-context output $15.00, context window 1,050,000 tokens, Intelligence Index 47.6. Grok 4.6: input $2.00 per million, output $6.00 per million, long-request step above 200K input tokens, long-context output $12.00, context window 500,000 tokens, Intelligence Index 44.3. A footer reads GPT-6 Sol rates per OpenAI's rate card and Intelligence Index per Artificial Analysis; Grok 4.6 rates per SpaceXAI's rate card and Intelligence Index per Artificial Analysis.

Luka benchmarkowa jest mniejsza i węższa niż luka cenowa.

W Intelligence Index firmy Artificial Analysis, który jest pomiarem strony trzeciej, a nie tabelą dostawcy, GPT-6 Sol plasuje się na 47,6, a Grok 4.6 na 44,3. Różnica 3,3 punktu w skali od 0 do 100 jest realna, ale nie jest to odległość, która sprawia, że jeden model jest nieodpowiedni do zadania, a drugi odpowiedni. Jest ona również mierzona przy określonym ustawieniu rozumowania dla każdego modelu, a GPT-6 Sol udostępnia konfigurowalny wysiłek rozumowania, podczas gdy Grok 4.6 udostępnia swój własny — więc każdy, kto podaje pojedynczą liczbę z bezpośredniego porównania, podaje jeden punkt w dwuwymiarowej siatce.

Miejscem, w którym te dwa modele naprawdę bardziej się od siebie różnią, jest praca agentowa w stylu terminala. W Terminal-Bench 2.1 Grok 4.6 osiąga 88,4. GPT-6 Sol nie ma porównywalnego opublikowanego wyniku dla wersji, którą zawiera nasz katalog, a uczciwa interpretacja pustej komórki jest taka, że liczba ta nie została opublikowana — a nie że model wypadł słabo. Jeśli obciążeniem jest długotrwale działający agent sterowany powłoką, opublikowane dowody przemawiają na korzyść Grok 4.6, a brakujące dowody nie liczą się jako dowody dla żadnej ze stron.

Odwrotnie jest w przypadku przywoływania wiedzy w długim kontekście. GPT-6 Sol notuje 83,7 w przywoływaniu z długiego kontekstu wobec 80,3 modelu Grok 4.6, a dostawcy obu modeli podają własne liczby gdzie indziej — SpaceXAI podkreśla GPQA Diamond na poziomie 94,9 dla Grok 4.6, a materiały OpenAI dotyczące GPT-6 w dużej mierze pochodzą od dostawcy i nie zostały odtworzone. Dwie zasady pozwalają zachować w tym porządek: liczba od dostawcy to twierdzenie, a liczba z indeksu to pomiar na nazwanej wersji. Nie są wymienne i nigdy nie należy ich uśredniać w jeden „lepszy” wynik.

Problem następnika

Żaden z tych modeli nie jest najnowszym modelem z własnego laboratorium, a udawanie inaczej byłoby najbardziej mylącą rzeczą, jaką to porównanie mogłoby zrobić. SpaceXAI udostępniło Grok 4.7 21 września 2026 r. przy tej samej podstawowej stawce 2,00 USD / 6,00 USD, a Intelligence Index wzrósł z 44,3 do 46,4. OpenAI udostępniło GPT-6.1 Sol 29 września 2026 r., również po 2,00 USD / 10,00 USD, przy Intelligence Index na poziomie 51,8, a jedna stawka faktycznie się poprawiła: dane wejściowe z pamięci podręcznej spadły z 0,20 USD do 0,10 USD za milion. Artificial Analysis oznacza teraz swoją stronę GPT-6 Sol jako przestarzałą, kierując czytelników do GPT-6.1 Sol.

Uczciwe postawienie sprawy to nie pytanie „którą z tych dwóch powinieneś wybrać?”, ale „która z tych dwóch — i czy masz pewność, że po żadnej ze stron nie ma o jedną generację nowszej wersji?”. Powód, by pozostać przy GPT-6 Sol, to zwykle konkretna integracja sprzed ośmiu dni, a nie twierdzenie o możliwościach; powód, by pozostać przy Grok 4.6, to opublikowany wynik agenta terminalowego, któremu jego następca jeszcze publicznie nie dorównał. Oba są uzasadnione i oba są ograniczone czasowo.

OrcaRouter model page for Grok 4.6 (grok/grok-4.6) by SpaceXAI, dated 2026-08-12, showing the model tagged Vision, Tools, JSON and Reasoning, a 500K-token context window with text, image and file input and text output, a list price of $2.00 per million input and $6.00 per million output, and a p50 time to first token of 4.73 seconds.

Uruchamianie obu z jednego klucza.

Oba modele są kierowane przez OrcaRouter, więc mechaniczna część utrzymywania dwóch kandydatów przy życiu nic nie kosztuje: jedno API przed ponad 200 modelami, ten sam klucz, bez drugiej umowy i bez zmian w kodzie między nimi. Ma to tu większe znaczenie niż zwykle, ponieważ argument za drugim modelem w tym konkretnym zestawieniu nie jest zabezpieczeniem na wypadek braku możliwości, lecz decyzją o routingu — wyślij okno od 200K do 272K do GPT-6 Sol, a wszystko krótsze do Grok 4.6, a ta sama aplikacja dostaje tańszy rachunek po obu stronach progu, którego żaden z dostawców nie pozwala ci wybrać.

Automatyczne przełączanie awaryjne to nudna połowa tego samego układu. Uruchomienia agenta z długim kontekstem są długie właśnie dlatego, że coś utrzymuje sesję otwartą, a czknięcie dostawcy w czterdziestej minucie to kosztowny rodzaj awarii. Druga trasa skonfigurowana z wyprzedzeniem zamienia to w ponowną próbę zamiast ponownego uruchomienia.

Nasz katalog wymienia obie w cenie katalogowej ich dostawcy, bez żadnej marży, więc zmiana stawki na którejkolwiek z kart pojawia się po naszej stronie tego samego dnia, w którym pojawia się po ich stronie. Warto powiedzieć to wprost, a nie jako slogan: powód, dla którego warto się tym przejmować, jest taki, że wspomniana powyżej różnica 0,20 USD wobec 0,50 USD w cenie wejścia z pamięci podręcznej to dokładnie ten rodzaj pozycji, którą dostawcy po cichu zmieniają, a bezpośrednie przenoszenie oznacza, że nigdy nie musisz czekać, aż reseller nadgoni.

Artificial Analysis model page for GPT-6 Sol (Max), a proprietary OpenAI model released September 2026, carrying a banner stating the model is deprecated and that OpenAI has launched a newer release, GPT-6.1 Sol. The page shows an Intelligence rank of 25 of 225, an output speed of 87.9 tokens per second, $2.00 per million input tokens and $10.00 per million output tokens, a 90% cache discount, a $1.04 blended rate, and a note that the model generated 77 million tokens during the Index evaluation, described as fairly concise.

Co właściwie o tym decyduje

Jeśli Twoje prompty są krótkie, Grok 4.6 wygrywa pod względem ceny wyjściowej przewagą, której nie zniweluje żadna delta indeksu, a jego wynik jako agenta terminalowego to najwyższa opublikowana liczba w którejkolwiek z kolumn. Jeśli Twoje prompty są długie, późniejszy próg zmiany ceny GPT-6 Sol i jego dłuższe okno są warte więcej niż wyższa stawka za wyjście, a pozycja dla wejścia z pamięci podręcznej to jedna czwarta kosztu. Jeśli Twoje prompty mieszczą się między 200K a 272K, trafiłeś na jedyne obciążenie, w którym taniej wyglądający model jest tym droższym, a rozwiązaniem jest wybór trasy, a nie wybór modelu.

Uwagę trzeba zwrócić nie na którykolwiek z tych modeli, lecz na dwóch następców, którzy już są dostępni. Grok 4.7 i GPT-6.1 Sol osłabiają argument za czekaniem z decyzją w tej sprawie, a porównanie, które trzeba powtarzać co trzy tygodnie, powinno trafić za router, a nie do dokumentu architektonicznego.

Porównane w tym artykule3

Wykryto na podstawie tego artykułu · Benchmarki: Artificial Analysis · aktualizowane codziennie