
Grok 4.7 vs Grok 4.6: ta sama cena $2/$6, inny model pod spodem
- typesafeNOWOŚĆTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 za 1 mln tokenów · 1009 tok/s
- OpenAINOWOŚĆOpenAI: GPT-6 Luna2026-09-2237Inteligencja
- OpenAINOWOŚĆOpenAI: GPT-6 Sol2026-09-2248Inteligencja
- AnthropicNOWOŚĆAnthropic: Claude Opus 5.52026-09-2258Inteligencja
- xAINOWOŚĆGrok 4.72026-09-2146Inteligencja
- OrcaNOWOŚĆOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 za 1 mln tokenów · 195 tok/s
- OrcaNOWOŚĆOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 za 1 mln tokenów · 1189 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligencja
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Inteligencja77Kod
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Inteligencja76Kod
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Inteligencja76Kod
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Inteligencja82Kod
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 za 1 mln tokenów · 22 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 za 1 mln tokenów · 108 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligencja72Kod
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 za 1 mln tokenów · 220 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Inteligencja75Kod
- obsidianQwen3.8 27B2026-08-1534Inteligencja68Kod
- DeepSeekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Inteligencja69Kod
- xAISpaceXAI: Grok 4.62026-08-1244Inteligencja77Kod
SpaceXAI wypuściło Grok 4.7 21 września 2026 r., a pierwszą rzeczą, którą warto w nim zauważyć, jest to, co się nie zmieniło: cena. Grok 4.7 kosztuje 2 USD za milion tokenów wejściowych i 6 USD za milion tokenów wyjściowych, dokładnie tyle, ile Grok 4.6 kosztuje od premiery 12 sierpnia 2026 r. Ten sam cennik, to samo okno kontekstowe o rozmiarze 500 000 tokenów, to samo wejście tekstowe i obrazowe — a jednak oba modele dzieli duża różnica w ewaluacjach, które mają znaczenie dla pracy agentowej. Według własnych opublikowanych wyników SpaceXAI, Grok 4.7 niemal dwukrotnie przewyższa Grok 4.6 w Terminal-Bench 4.0: 38,0% wobec 20,3%. Taki jest cały kształt tego porównania: wymiana pokoleniowa w tej samej cenie, w której niemal cały zysk trafia w jedno miejsce, a elementy Grok 4.6, które irytowały zespoły produkcyjne, wciąż tam są.
Co właściwie zmieniło się między tymi dwoma modelami?
Własny opis wydania autorstwa SpaceXAI jest wąski i warto przytoczyć jego kształt, a nie przymiotniki. Grok 4.7 zbudowano na większym modelu bazowym niż Grok 4.6 i poddano go dłuższemu przebiegowi uczenia ze wzmocnieniem, ukierunkowanemu na zadania, których ukończenie „może zająć godziny”. Firma twierdzi, że ów przebieg wyostrzył trzy rzeczy: samoweryfikację, obsługę długiego kontekstu oraz zachowanie w środowisku Grok Bot. Nie ma twierdzeń o nowej architekturze, nowej modalności ani innym stosie serwowania.
To ujęcie ma znaczenie, ponieważ przewiduje, gdzie pojawiają się wzrosty w benchmarkach — i pojawiają się dokładnie tam. Dłuższy przebieg RL na trudnych, wielogodzinnych zadaniach poprawia pracę w terminalu i repozytorium znacznie bardziej niż quiz wiedzy. Jeśli liczyłeś, że Grok 4.7 będzie szerszym modelem niż Grok 4.6, informacje o wydaniu mówią co innego — to ten sam kształt modelu, trenowany dalej w kierunku trudnego końca pracy agentowej.
Historia parametrów to jedyny element tego, który nie jest ujawnieniem dostawcy. Musk powiedział na początku września, że Grok 4.7 ma około 2,1 biliona parametrów w porównaniu z 1,5 biliona w Grok 4.6, co stanowi wzrost o 40%, i od tego czasu ta liczba jest powtarzana wszędzie. Nigdy nie pojawiła się w arkuszu specyfikacji SpaceXAI. Traktuj to jako szeroko przekazywane twierdzenie o modelu bazowym, a nie potwierdzoną specyfikację — i pamiętaj, że liczba parametrów mówi bardzo niewiele o koszcie obsługi lub możliwościach, gdy architektura jest rzadka, a taka właśnie jest w linii Grok.
Luka benchmarkowa z dołączoną etykietą źródłową
Każda liczba w tej sekcji pochodzi z materiałów startowych SpaceXAI. Żadna z nich nie została niezależnie odtworzona w momencie pisania, a uczciwym sposobem czytania ich jest traktowanie ich jako zbioru twierdzeń, który przypadkiem okazuje się niezwykle konkretny — co sprawia, że można go później sprawdzić, ale nie sprawia, że jest zweryfikowany teraz.
• Terminal-Bench 4.0 — Grok 4.7 38,0% (dane producenta) vs Grok 4.6 20,3%. Największa pojedyncza różnica w tym wydaniu i ta, która odpowiada twierdzeniu o „dłuższym RL na trudniejszych zadaniach”.
• CursorBench 4.0 — Grok 4.7 46,3% (wg danych producenta) vs Grok 4.6 40,4%. To realny wzrost, ale skromny — poniżej sześciu punktów, w benchmarku bliższym codziennej pracy w edytorze niż autonomicznym sesjom terminala.
• DeepSWE v1.1 — Grok 4.7 71,0% przy wysokim poziomie wysiłku rozumowania (według dostawcy) w porównaniu z Grok 4.6 65,2%. Znów solidna, nieoszałamiająca poprawa.
• EEBench — Grok 4.7 64,0% (dane zgłoszone przez producenta). Nie opublikowano wraz z nim wyniku dla Grok 4.6, więc ten wynik nic nie mówi o ulepszeniu.
• AA-Briefcase v1.1 — Grok 4.7 z wynikiem 1 657 Elo (zgłoszone przez dostawcę), w ocenie profesjonalnej pracy opartej na wiedzy.
Przeczytaj listę jako zbiór, a wzorzec jest spójny: Grok 4.7 jest znacząco lepszy tam, gdzie zadanie jest długie i agentowe, a nieznacznie lepszy tam, gdzie zadanie jest krótkie. Skok w Terminal-Bench to w przybliżeniu podwojenie; zyski z pracy edytorskiej to jednocyfrowe wartości procentowe. Jeśli twoje obciążenie ma kształt autouzupełniania, płacisz te same $2/$6 za niewielką poprawę. Jeśli twoje obciążenie to „uruchom na dwie godziny i wróć”, to wydanie jest wycelowane bezpośrednio w ciebie.
Co jak dotąd mówi niezależny pomiar?
Istnieje jedna niezależna liczba i warto ją przytoczyć starannie, ponieważ łatwo ją błędnie odczytać. Artificial Analysis przyznaje Grokowi 4.7 wynik 46 w swoim Intelligence Index, w wersji v4.3.2, co daje mu 16. miejsce spośród 655 modeli na liście. Grok 4.6 plasuje się na 44 w tej samej skali. Dwupunktowa różnica w indeksie złożonym to nie podwojenie, które pokazuje Terminal-Bench, a ta rozbieżność jest pouczająca, a nie sprzeczna: indeks łączy rozumowanie, wiedzę, matematykę i kodowanie, więc duży zysk w jednym wycinku agentowym zostaje rozmyty przez wszystko, czego model nie zmienił.
Dwa dalsze szczegóły z tej samej strony są bardziej przydatne niż wynik z nagłówka. Po pierwsze, Grok 4.7 wygenerował 240 milionów tokenów wyjściowych podczas uruchamiania indeksu, wobec mediany 92 milionów — to rozwlekły model rozumujący, a przy stawce 6 USD za milion tokenów wyjściowych ta rozwlekłość jest osobną pozycją kosztową. Po drugie, wynik złożony indeksu plasuje go wśród najsilniejszych modeli w jego przedziale cenowym, a to właśnie to porównanie ma realne znaczenie dla nabywcy. Artificial Analysis nie opublikowało uzupełnionej ceny dla Grok 4.7 na stronie modelu, więc nie bierz stamtąd jego wskaźnika kosztu na zadanie; użyj $2/$6 podanych przez dostawcę.

Przepaść cenowa, której nie naprawił żaden z modeli
Oto część cennika Grok 4.6, której zespoły produkcyjne nauczyły się nienawidzić, a Grok 4.7 tego nie zmienił. Poniżej 200 000 tokenów wejściowych stawka wynosi 2 USD na wejściu i 6 USD na wyjściu. Powyżej tego całe żądanie jest wyceniane ponownie na 4 USD na wejściu i 12 USD na wyjściu. Nie chodzi o nadmiarowe tokeny — o całe żądanie. Wywołanie z 210 000 tokenów kosztuje dwa razy więcej niż wywołanie z 199 000 tokenów, za dodatkowe 11 000 tokenów.
Przy oknie kontekstowym wynoszącym 500 000 tokenów w obu modelach łatwo jest spaść z tego klifu. Długie przebiegi agentowe z dużym kontekstem i prompty obejmujące całe repozytorium to dokładnie te obciążenia, pod które dostrajano Grok 4.7, co oznacza, że najlepszy scenariusz użycia tego modelu jest również tym, który najprawdopodobniej wywoła podwojenie. Jeśli przenosisz pracę na Grok 4.7, ponieważ lepiej obsługuje długie sesje agentowe, uwzględnij zmianę cen w budżecie, zanim przeniesiesz pracę, a nie po.
Jest też poziom szybkości, który trzeba wziąć pod uwagę. SpaceXAI udostępnia szybki wariant Grok 4.7, który podwaja szybkość generowania wyników i podwaja podaną cenę. To uzasadniony kompromis w przypadku interaktywnego kodowania, a słaby w przypadku pracy wsadowej — to samo zadanie o tej samej jakości kosztuje dwa razy więcej za oszczędność czasu zegarowego, na którą nikt nie patrzy.
Migracja z Grok 4.6 bez przepisywania
Praktyczną dobrą wiadomością jest to, że to wymiana modelu, a nie migracja platformy. Oba modele przyjmują tekst i obrazy na wejściu i zwracają tekst, oba używają tych samych poziomów wysiłku rozumowania od low po xhigh, a kształt żądania jest taki, jaki SpaceXAI obsługuje od czasu Grok 4.5. Kod, który wywołuje Grok 4.6 z parametrem effort, nie wymaga przebudowy, aby wywołać Grok 4.7.
To, że zamiana nie jest darmowa, widać w ewaluacji. Przyrosty Grok 4.7 skupiają się na długich przebiegach agentowych, więc zestaw testów zbudowany z krótkich, jednoetapowych promptów nie pokaże ci prawie nic — zobaczysz poprawę wielkości tej z CursorBench i dojdziesz do wniosku, że aktualizacja nie była warta wysiłku, podczas gdy argument za nią tkwi w zadaniach, których twój zestaw nigdy nie sprawdza. Pomiar, który rzeczywiście by to rozstrzygnął, to ukończenie zadań w wieloetapowej pracy: zaakceptowane poprawki, wprowadzone regresje, wywołania narzędzi na ukończone zadanie i to, jak często przebieg wymaga ratunku ze strony człowieka. To są osie, na które wskazują własne liczby dostawcy, i to właśnie te, których żaden opublikowany benchmark nie obejmuje w przypadku twojej bazy kodu.
Drugą rzeczą do zmierzenia jest gadatliwość. Model, który emituje 240 milionów tokenów na standardowym indeksie, będzie emitował więcej tokenów w Twoim obciążeniu niż jego poprzednik, a przy $6 za milion tokenów wyjściowych może to po cichu zniweczyć wartość aktualizacji w tej samej cenie. Śledź liczbę tokenów wyjściowych na ukończone zadanie przez tydzień, zanim podejmiesz decyzję.

Do kogo zadzwonić?
Decyzja jest naprawdę prosta, co jest nietypowe w przypadku porównywania modeli. Grok 4.6 pozostaje właściwym wyborem dla ruchu o krótkich turach i wrażliwego na koszty: czatu, klasyfikacji, streszczania i pomocy w kodzie na skalę edytora, gdzie zyski Grok 4.7 są niewielkie, a jego gadatliwość stanowi obciążenie. Grok 4.7 jest właściwym wyborem dla obciążenia, dla którego został stworzony — długohoryzontowego kodowania agentowego i pracy w terminalu, gdzie zadanie trwa godzinami, a samoweryfikacja jest różnicą między ukończoną pracą a zablokowaną.
Uruchamianie obu nie jest tu kompromisem — to właściwa odpowiedź i jest tanie. Grok 4.6 jest w katalogu OrcaRouter w cenie katalogowej SpaceXAI z 0% marży przekazanej bezpośrednio, więc powyższa tabela stawek 2 USD/6 USD to dokładnie to, co płacisz — a ponieważ przekazujemy cenę katalogową dostawcy bez doliczania marży, każda zmiana ceny u dostawcy jest widoczna po naszej stronie tego samego dnia, w którym wchodzi w życie. Jeden klucz API obejmuje Grok 4.6 i ponad 200 innych modeli, więc przenoszenie ruchu między nimi w zależności od zadania to zmiana konfiguracji, a nie drugi kontrakt. Jeśli chcesz przetestować Grok 4.7 na ścieżce produkcyjnej, zanim mu zaufasz, bezpieczniejszym wzorcem jest pozostawienie mechanizmu zapasowego na Grok 4.6 — modelu, którym możesz kierować ruch już dziś — i pozwolenie, by automatyczne przełączanie awaryjne między dostawcami przywracało żądanie, gdy nowy model zawiedzie.

Co obejrzeć dalej
Dwie rzeczy rozstrzygną to porównanie i żadna z nich jeszcze nie nastąpiła. Pierwszą jest niezależne odtworzenie wyniku Terminal-Bench 4.0 — 38% to dość duży skok, że ktoś go powtórzy, a jeśli się utrzyma, argument za Grok 4.7 w pipeline'ach agentowych będzie mocny merytorycznie, a nie marketingowo. Drugą jest reszta roadmapy Grok: SpaceXAI publicznie umieściło Grok 4.8, Grok 4.9 i Grok 5 za tym wydaniem, a życie samego Grok 4.6 trwało około pięciu tygodni. Kupowanie Grok 4.7 jako długoterminowego założenia platformowego powtórzyłoby błąd zespołów, które postawiły na Grok 4.5.
Na razie ulepszenie w tej samej cenie jest realne, a kierunek, w którym to zmierza, jest jasny. Liczba, której warto się trzymać, jest taka, że model za $2/$6 w przybliżeniu podwaja wyniki w długoterminowej pracy w terminalu, a poza tym prawie się nie zmienia — i to jest konkretne, użyteczne, sprawdzalne twierdzenie, a nie skok generacyjny.
Porównane w tym artykule1
Wykryto na podstawie tego artykułu · Benchmarki: Artificial Analysis · aktualizowane codziennie
