
Grok 4.7 uzyskuje 46 punktów w Artificial Analysis Intelligence Index i plasuje SpaceXAI w pierwszej czwórce
- openaiNOWOŚĆOpenAI: GPT-6.1 Sol2026-09-2952Inteligencja
- anthropicNOWOŚĆAnthropic: Claude Sonnet 5.52026-09-2856Inteligencja
- typesafeNOWOŚĆTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 za 1 mln tokenów · 217 tok/s
- OpenAINOWOŚĆOpenAI: GPT-6 Luna2026-09-2238Inteligencja
- OpenAINOWOŚĆOpenAI: GPT-6 Sol2026-09-2248Inteligencja
- AnthropicNOWOŚĆAnthropic: Claude Opus 5.52026-09-2258Inteligencja
- xAINOWOŚĆGrok 4.72026-09-2146Inteligencja
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 za 1 mln tokenów · 115 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 za 1 mln tokenów · 969 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligencja
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Inteligencja77Kod
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Inteligencja76Kod
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Inteligencja76Kod
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Inteligencja82Kod
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 za 1 mln tokenów · 51 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 za 1 mln tokenów · 100 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligencja72Kod
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 za 1 mln tokenów · 214 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Inteligencja75Kod
- obsidianQwen3.8 27B2026-08-1534Inteligencja68Kod
Grok 4.7 uzyskuje 46 punktów w Artificial Analysis Intelligence Index i plasuje SpaceXAI w pierwszej czwórce
Grok 4.7 już wyszedł. Firma SpaceXAI wydała go w poniedziałek 21 września 2026 r. — w tej samej cenie co Grok 4.6: 2 USD za milion tokenów wejściowych i 6 USD za milion tokenów wyjściowych, z tym samym oknem kontekstowym wynoszącym 500 000 tokenów, późniejszym terminem odcięcia wiedzy i nowym najwyższym poziomem rozumowania. Jest dostępny na żywo w Cursor i Grok Build, przez własne API dostawcy oraz przez zewnętrzne środowiska programistyczne, routery modeli i platformy chmurowe. Grok 4.5 z 8 lipca pozostaje poniżej niego jako tańsza opcja, a modele, które wciąż musi pokonać, nie zmieniły się: Claude Fable 5.1, Claude Opus 5 i GPT-5.6 Sol wszystkie znajdują się powyżej niego w Intelligence Index v4.3.2 Artificial Analysis, gdzie pierwszy niezależny wynik Grok 4.7 — 46 — wypada dwa punkty powyżej Grok 4.6 i siedem poniżej Claude Fable 5.1. Na tej samej tablicy AA-Briefcase tego samego ewaluatora dla długoterminowej pracy z wiedzą zajmuje czwarte miejsce, za trzema wpisami Claude’a i przed Claude Opus 5 przy wysiłku xhigh, przy mniej więcej połowie kosztu na zadanie Claude Opus 5 — pierwszy niezależny wynik w tym wydaniu, który wygląda na zwycięstwo pod względem ceny do wydajności, a nie na lukę. Jedenaście dni później obraz rozszerzył się na brzegach, a nie w środku: od 1 października jest stopniowo wdrażany w aplikacjach internetowych i mobilnych Grok, gdzie selektor trybów wymienia go na dwóch najtrudniejszych pozycjach, i jest wymieniony w OrcaRouter w cenie SpaceXAI 2/6 USD.
To jest premiera. Bardziej użyteczne liczby pojawiły się tego samego dnia, od jedynego ewaluatora w tej historii, który nie jest dostawcą: Artificial Analysis opublikowało swój pierwszy niezależny przebieg dla Grok 4.7 i jest to wynik trzyczęściowy — 46 w Intelligence Index, czyli tylko dwa punkty więcej niż Grok 4.6; 56 w Coding Agent Index, czyli dziewięć punktów więcej niż Grok 4.6; oraz 1 657 Elo w AA-Briefcase, czyli 111 punktów więcej. Te trzy liczby wskazują w różnych kierunkach, a rozpiętość między nimi jest najciekawszą rzeczą w tym wydaniu. W dalszej części znajduje się dostarczona specyfikacja, własna tabela benchmarków dostawcy z etykietą, jakiej potrzebuje każdy wiersz, a następnie niezależne wyniki odczytane prawidłowo — w tym to, co mówią o zastrzeżeniu dotyczącym gotowości, do którego SpaceXAI nigdy się nie odniósł.
Co SpaceXAI wydało 21 września
Zacznij od specyfikacji, ponieważ jest ona wyjątkowo bliska specyfikacji swojego poprzednika. Grok 4.7 jest wyceniony identycznie jak Grok 4.6 — 2 USD za milion tokenów wejściowych i 6 USD za milion tokenów wyjściowych poniżej 200 000 tokenów wejściowych, a po przekroczeniu tego progu przez żądanie stawka rośnie do 4 USD za wejście i 12 USD za wyjście, w tej samej strukturze, którą wprowadził Grok 4.6. Okno kontekstowe wynosi 500 000 tokenów. Granica wiedzy to maj 2026, trzy miesiące później niż 1 lutego 2026 w Grok 4.6. Wysiłek rozumowania obejmuje cztery poziomy — niski, średni, wysoki i xhigh — a publikowane wartości są podawane na poziomie xhigh. Szybki wariant działa z dwukrotnie większą szybkością wyjściową za dwukrotnie wyższą cenę.
Pod tym wszystkim xAI opisuje trzy zmiany, a nie nową architekturę. Model bazowy jest większy niż w Grok 4.6. Przebieg uczenia ze wzmocnieniem był dłuższy i z większym naciskiem na zadania, których ukończenie zajmuje wiele godzin. Model wytrenowano też tak, by weryfikował własną pracę i lepiej utrzymywał długi kontekst, w tym natywnie rozumiał środowisko Grok Bot. Własne jednowierszowe podsumowanie firmy brzmi: „dwa razy szybciej, za połowę ceny porównywalnych modeli” — to twierdzenie pozycjonujące względem rywali, a nie pomiar, i warto je tak odczytywać.
Dostępność była szeroka już pierwszego dnia, a od tego czasu rozszerzyła się dwukrotnie. Na start: Cursor i Grok Build, własne API dostawcy, zewnętrzne narzędzia do kodowania, routery modeli i platformy chmurowe; własna strona Grok Build należąca do SpaceXAI mówi teraz wprost, żeby „zacząć budować z Grok 4.7”. 28 września Amazon Web Services dodał go do Amazon Bedrock z tym samym oknem kontekstowym 500 000 tokenów i tymi samymi czterema poziomami wysiłku rozumowania, obsługiwanego przez cross-Region inference profiles, więc model jest teraz osiągalny przez własny katalog hiperskalera, a nie tylko przez API dostawcy. Następnie 1 października zaczął się pojawiać w konsumenckich aplikacjach webowych i mobilnych Groka, a dwa dni później wciąż tam jest. Ten ostatni przypadek jest wyjątkowo cichy: SpaceXAI ogłosiło równoważny krok dla Grok 4.5 wpisem na blogu zatytułowanym „Bringing Grok 4.5 to iOS, Android, Web, and X”, a dla Grok 4.7 nie opublikowało nic, więc zmiana jest widoczna w produkcie, a nie ogłoszona. Zachodzi po stronie serwera, a nie jest dostarczana jako część wydania, co potwierdzają karty aplikacji: zarówno karta Groka w iOS, jak i w Androidzie zmieniły się 1 października — build w App Store to 1.4.47, wydany tego dnia, a jego nota wydania wspomina tylko o „Ulepszeniach czatu, głosu i Imagine”, podczas gdy karta w Play została zaktualizowana tego samego dnia. Zmiana jest wypychana z backendu, a nie wbudowana w plik binarny. Ponieważ o wdrożeniu się donosi, a nie je dokumentuje, dokładny zakres trudniej ustalić niż w przypadku wpisu w Bedrock, za którym stoi datowany wpis AWS, a doniesienia już się rozjechały: konta śledzące to teraz opisują Grok 4.7 jako model bazowy we wszystkich trybach — Fast, Expert, Build i Heavy — co nie zgadza się z tym, co faktycznie serwuje grok.com. Traktuj to jako własne doniesienia trackerów, a nie jako opis dostawcy. Wybrani partnerzy z dziedziny cyberbezpieczeństwa otrzymują dostęp wyłącznie na zaproszenie do możliwości red-teamowych modelu.
Jedna poprawka do zapisu, który prowadził ten tekst. Liczba parametrów, która krążyła przez dwa miesiące — około 2,1 biliona, czyli około 40% powyżej 1,5 biliona parametrów Grok 4.6 — nadal nie widnieje w żadnej specyfikacji. xAI nie opublikowało liczby parametrów dla Grok 4.7, a Artificial Analysis podaje rozmiar modelu jako nieujawniony. Ta liczba zawsze była twierdzeniem założyciela, a premiera nie zamieniła jej w specyfikację.
Tabela benchmarków jest własnością xAI — oto, co nią nie jest.
Każda liczba na poniższej liście pochodzi z ogłoszenia dostawcy i żadna z nich nie została niezależnie odtworzona. Czytaj ją z tą etykietą: to liczby xAI dotyczące wybranych przez xAI ewaluacji, opublikowane w dniu premiery, a pierwszy tydzień każdej premiery to okres, w którym benchmarki dostawców są najmniej wiarygodne. Kolumny porównawcze również należą do dostawcy — Grok 4.6 (high), GPT-5.6 Sol (max) i Claude Fable 5.1 (max), każdy uruchomiony na wybranym przez dostawcę poziomie wysiłku.
• CursorBench 4.0 — Grok 4.7 46,3%, Grok 4.6 40,4%, GPT-5.6 Sol 41,7%, Claude Fable 5.1 51,8%. Dane dostawcy.
• DeepSWE v1.1 — Grok 4.7 71,0% przy wysokim wysiłku, Grok 4.6 65,2%, GPT-5.6 Sol 72,7%, Claude Fable 5.1 70,0%. Dane zgłoszone przez dostawcę.
• Terminal-Bench 4.0 — Grok 4.7 37,6%, Grok 4.6 20,3%, GPT-5.6 Sol 37,3%, Claude Fable 5.1 57,9%. Dane dostawcy, po korekcie: w wierszu Grok 4.7 w tabeli z dnia premiery widniało 38,0%, a dziś na stronie dostawcy widnieje 37,6%.
• EEBench — Grok 4.7 64,0%, Grok 4.6 53,0%, GPT-5.6 Sol 39,4%, Claude Fable 5.1 56,4%. Zgłoszone przez dostawcę.
• Harvey Legal Agent — Grok 4.7 19,6%, Grok 4.6 15,8%, GPT-5.6 Sol 2,5%, Claude Fable 5.1 6,7%. Zgłoszone przez dostawcę.
• HealthBench Professional — Grok 4.7 56,7%, Grok 4.6 48,5%, GPT-5.6 Sol 60,5%, Claude Fable 5.1 62,1%. Zgłoszone przez dostawcę.
• AA Briefcase v1.1 — Grok 4.7 1,657, Grok 4.6 1,546, GPT-5.6 Sol 1,487, Claude Fable 5.1 1,678. To jedyny wiersz w tabeli, który nie pochodzi już wyłącznie od dostawcy: własna tablica AA-Briefcase Artificial Analysis podaje te same 1,657 dla Grok 4.7 przy poziomie wysiłku xhigh i 1,546 dla Grok 4.6 przy poziomie high. Kolumny porównawcze nadal są wyborem modeli i poziomów wysiłku dostawcy.
• GDPval Elo — Grok 4.7 1 695, Grok 4.6 1 605, GPT-6 Astra 1 542, Claude Fable 5.1 1 735. Dane zgłoszone przez dostawcę.
Uczciwa interpretacja tego zestawu nie brzmi: „Grok 4.7 wygrywa”. Bije Grok 4.6 we wszystkich ośmiu, co jest minimum, jakie następca jest ci winien. Na tle konkurencji obraz jest mieszany: przed GPT-5.6 Sol w CursorBench, Terminal-Bench i EEBench, za nim w DeepSWE; za Claude Fable 5.1 w CursorBench, Terminal-Bench, HealthBench i obu miarach w stylu Elo, a przed Claude Fable 5.1 w EEBench i ewaluacji agenta prawnego Harvey. To także pokazuje, jak dużą część wyniku benchmarku stanowi poziom wysiłku — 71,0% w DeepSWE to wynik przy wysokim poziomie wysiłku w tabeli, której pozostałe wartości podano przy xhigh.
Bezpieczeństwo to jedyny obszar, w którym twierdzenia dostawcy są wyjątkowo konkretne. xAI twierdzi, że Grok 4.7 zbudowano na całkowicie nowym stosie zabezpieczeń, i nazywa go najsilniejszym modelem, jaki firma testowała pod kątem odmów i odporności na jailbreak. W benchmarku bezpieczeństwa biologicznego LatchBio podaje 62,4%; w HackerBench v0.3 podaje, że przepuszcza 3,3% ryzykownych promptów o podwójnym zastosowaniu, jednocześnie rzadko blokując uzasadnioną pracę związaną z bezpieczeństwem. Są to oceny raportowane przez dostawcę na temat jego własnego wydania i żadna strona trzecia ich nie odtworzyła.
Pierwsze liczby w tym tekście, które nie pochodzą od dostawcy, to trzy opublikowane przez Artificial Analysis 21 września i nie zgadzają się one ze sobą w pouczający sposób. W Intelligence Index Grok 4.7 uzyskuje 46 przy xhigh effort na skali v4.3.2 — 16. miejsce w tym rankingu — wobec 44 dla Grok 4.6. Ten dwupunktowy wzrost to, zdaniem Artificial Analysis, wystarczające, by wprowadzić SpaceXAI do czołowej czwórki laboratoriów w tym indeksie. Interpretuj tę pozycję precyzyjnie: to stwierdzenie o najlepszym modelu danego laboratorium, a nie o tym modelu, a sam model wciąż znajduje się cztery punkty poniżej wyniku 50 Claude Fable 5 i siedem poniżej 53, które współdzielą Claude Fable 5.1 i GPT-6 Astra. Dwupunktowy wzrost mieści się także w zakresie, który pojawia się między poziomami wysiłku tego samego modelu, co przypomina, że następca osiągający wynik wyższy od poprzednika to nie to samo, co następca zmieniający to, co jest możliwe. Jeszcze jedna uwaga dotycząca odczytywania tej liczby: wersja skali ma znaczenie, ponieważ Artificial Analysis przeformułowało swój indeks, a wartości 61/62/63 pojawiające się w większości materiałów z lipca i sierpnia należą do wycofanej skali sprzed września 2026 — nie można ich porównywać z tymi.
Coding Agent Index to druga liczba i to ona się zmieniła. Uruchomiony we własnym środowisku Grok Build firmy SpaceXAI przy wysiłku xhigh, Grok 4.7 uzyskuje 56 punktów w porównaniu do 47 dla Grok 4.6 — dziewięć punktów, a nie dwa — co plasuje go na czwartym miejscu wśród modeli ocenianych w ich natywnych środowiskach, za Claude Fable 5.1, GPT-6 Astra i Claude Opus 5, a przed GPT-5.6 Sol. Indeks jest kompozytem o równych wagach składającym się z DeepSWE v1.1, Terminal-Bench 4.0 i SWE-Atlas-QnA na 303 zadaniach, a wszystkie trzy komponenty się poprawiły: DeepSWE z 65% do 73%, Terminal-Bench z 18% do 33%, SWE-Atlas-QnA z 58% do 63%. To pierwszy niezależny dowód, że poprawka opisana przez xAI — dłuższe uczenie ze wzmacnianiem z naciskiem na zadania wielogodzinne — coś dała, i jest to liczba, której zespół wybierający agenta kodującego powinien przypisywać największą wagę, ponieważ jest mierzona w środowisku, z którym model jest faktycznie dostarczany, a nie w tabeli samego dostawcy.
Zastrzeżenie dotyczy tego, ile kosztuje tych dziewięć punktów. Własne uruchomienie Artificial Analysis wygenerowało 240 milionów tokenów wyjściowych w Intelligence Index, wobec mediany 94 milionów wśród modeli, które śledzi — ponad dwukrotnie więcej — i wyceniło koszt oceny jednego zadania Index na 3,74 USD. Przy 6 USD za milion tokenów wyjściowych rozwlekłość jest tą pozycją kosztową, która decyduje, czy pętla agentowa jest przystępna cenowo, więc zysk dziewięciu punktów okupiony ponad dwukrotnością mediany tokenów wyjściowych to rzeczywisty kompromis, a nie darmowe ulepszenie. Ten sam pomiar oznacza też, że wyników z nagłówków nie należy czytać jako jednego werdyktu: w przeliczeniu na token przewaga Grok 4.7 nad Grok 4.6 jest mniejsza, niż sugeruje różnica w indeksie, a w ewaluacjach wiedzy ogólnej, które składają się na Intelligence Index, jest blisko tego samego modelu z istotnie wyższym rachunkiem. Wynik AA-Briefcase w następnej sekcji jest wyjątkiem od tego — i to dużym.

Drugi niezależny panel: AA-Briefcase i co daje połowa kosztu na zadanie
Artificial Analysis opublikowało trzecią liczbę dla Grok 4.7 tego samego dnia, i jest to ta, która odnosi się do pracy opartej na wiedzy, a nie do kodu. W AA-Briefcase — własnej tablicy dla długoterminowej agentowej pracy opartej na wiedzy, zbudowanej z czterech wielotygodniowych scenariuszy projektowych i 91 ocenianych rezultatów — Grok 4.7 przy wysiłku xhigh uzyskuje 1 657 Elo, czwarte miejsce na tablicy, a wyprzedzają go wyłącznie wpisy Anthropic: Claude Fable 5.1 przy maksymalnym wysiłku (1 678), Claude Opus 5 przy maksymalnym wysiłku (1 673) i Claude Fable 5.1 przy xhigh (1 669). Jest o 16 Elo za Claude Opus 5 przy maksymalnym wysiłku, a przy xhigh o 8 Elo przed Claude Opus 5 przy xhigh (1 649). Odczytaj tę pozycję precyzyjnie: „za wyłącznie modelami Anthropic” to sformułowanie, którego użyło samo Artificial Analysis, i jest ono trafne — ale czwarte miejsce to nie drugie, a trzy wiersze powyżej są od tego samego dostawcy.
Przewaga nad poprzednią generacją to największy pojedynczy skok w tym wydaniu. W porównaniu z Grok 4.6 przy wysokim wysiłku (1,546) Grok 4.7 przy xhigh zyskuje 111 punktów Elo w AA-Briefcase — ponad pięćdziesiąt razy więcej niż dwupunktowy wzrost w Intelligence Index. Artificial Analysis przypisuje to niemal w całości jakości analitycznej: 1 994 Elo tam wobec 1 690 dla Grok 4.6, podczas gdy jakość prezentacji nieznacznie spada — 1 499 wobec 1 519. To czytelny wzorzec: model lepiej rozumuje w zakresie analizy, a nieco gorzej formatuje produkt końcowy. Ten sam kierunek widać w liczbach, które Artificial Analysis podało dla AA-Briefcase-Lite, publicznego scenariusza due diligence udostępnionego na Hugging Face — jakość analityczna wzrosła z 1 698 do 1 994, a prezentacyjna spadła z 1 531 do 1 499. Dwa zastrzeżenia do tego porównania. AA-Briefcase-Lite ma wyraźnie charakter poglądowy: własna strona metodologiczna Artificial Analysis mówi, że publiczny piąty scenariusz „nie wlicza się do oficjalnych wyników AA-Briefcase”. A podane dla niego liczby jakościowe odpowiadają wierszom xhigh opublikowanym na głównej tablicy, więc akapit o wersji Lite należy traktować jako ilustrację kierunku zmian, a nie osobny ranking.
Linia kosztów to miejsce, w którym ten wynik zmienia decyzję. Miara kosztu na zadanie w AA-Briefcase to całkowity koszt uruchomienia pełnego zgłoszenia podzielony przez jego 91 zadań; rozdzielenie opublikowanych sum Artificial Analysis daje około 9,30 USD na zadanie dla Grok 4.7 przy xhigh wobec około 17,79 USD dla Claude Opus 5 przy max effort — około połowy, przy różnicy 16 punktów Elo. Własne podsumowanie tego wyniku przez Artificial Analysis jest takie, że Grok 4.7 plasuje się „just behind Opus 5 at ~50% of its Cost per Task”. To ten sam kompromis, który opisuje reszta tego tekstu, dochodzący do tej samej odpowiedzi z innej strony: Grok 4.7 nie pokonuje czołówki, lecz podcina jej ceny. Dwa zastrzeżenia, oba szczere. Rachunek za tokeny jest realny — w AA-Briefcase-Lite Artificial Analysis oszacowało koszt API wytworzenia przykładowych talii na około 8 USD dla Grok 4.7 przy xhigh wobec około 4,40 USD dla Grok 4.6 przy xhigh, więc następca kosztuje około 80% więcej niż model, który zastępuje, przy tej samej pracy. A wartości na zadanie są obliczane na podstawie zużycia tokenów według cen katalogowych przy reprezentatywnym współczynniku trafień w pamięć podręczną, więc zmieniają się wraz z Twoim cache'owaniem: to model rachunku, a nie Twój rachunek.
Gdzie Grok 4.7 plasuje się na tle Grok 4.6 i konkurencji
• Cena za 1 mln tokenów — Grok 4.7: 2 USD za wejście / 6 USD za wyjście poniżej 200 tys. tokenów wejściowych, 4 USD/12 USD powyżej; Grok 4.6 identycznie.
• Okno kontekstu — 500 000 tokenów dla obu.
• Granica wiedzy — maj 2026 dla Grok 4.7 w porównaniu z 1 lutego 2026 dla Grok 4.6.
• Wysiłek rozumowania — niski / średni / wysoki / xhigh dla Grok 4.7 w porównaniu z opublikowanymi poziomami Grok 4.6.
• Niezależny wynik — 46 przy wysiłku xhigh wobec 44, w Intelligence Index v4.3.2 firmy Artificial Analysis. Zdaniem Artificial Analysis to wystarczy, by umieścić SpaceXAI w pierwszej czwórce laboratoriów w tym indeksie.
• Niezależny wynik kodowania — 56 wobec 47 w Artificial Analysis Coding Agent Index, każdy model w swoim natywnym środowisku testowym. Czwarte miejsce wśród modeli testowanych w natywnym środowisku, przed GPT-5.6 Sol.
• Wynik niezależnej pracy opartej na wiedzy — 1657 Elo przy poziomie wysiłku xhigh w porównaniu z 1546 dla Grok 4.6 przy poziomie high, na tablicy AA-Briefcase Artificial Analysis. Czwarte miejsce ogółem, za trzema pozycjami Anthropic i przed Claude Opus 5 przy xhigh.
• Koszt na zadanie AA-Briefcase — około 9,30 USD w porównaniu z około 17,79 USD dla Claude Opus 5 przy maksymalnym wysiłku, na tej samej tablicy. Mniej więcej połowa rachunku za zadanie przy różnicy 16 punktów Elo.
• Tokeny wyjściowe na jedno uruchomienie Index — 240 milionów wobec mediany 94 milionów wśród modeli śledzonych przez Artificial Analysis. Ta poprawa nie jest darmowa.
• Ewaluacja kodowania dostawcy — CursorBench 4.0 46,3% wobec 40,4%.
• Szybkość obsługi — szybki wariant o dwukrotnie większej szybkości wyjściowej za dwukrotnie wyższą cenę, w porównaniu ze standardową obsługą Grok 4.6.
• Bezpieczeństwo — nowy stos zabezpieczeń, z raportowanym wynikiem 62,4% w benchmarku bezpieczeństwa biologicznego LatchBio; Grok 4.6 został wydany bez tego twierdzenia.
A oto stawka na tej samej tablicy wyników: Claude Fable 5.1 z wynikiem 53, Claude Opus 5 z wynikiem 51, GPT-5.6 Sol z wynikiem 47, Kimi K3 z wynikiem 44. Prognoza samego Muska — że Grok 4.7 „powinien być mniej więcej na poziomie Opus 5.0, a nie 5.1” — ma teraz pod sobą liczbę, a ta liczba trafiła tam, gdzie mówił, że trafi: poniżej czołówki, a nie powyżej niej. Zmierzone zapóźnienie względem Claude Fable 5.1 to siedem punktów; różnica cenowa biegnie w przeciwnym kierunku: Claude Fable 5.1 ma podane ceny 10/50 USD za milion tokenów wobec 2/6 USD w Grok 4.7 — pięć razy większa cena wejściowa i ponad osiem razy większa cena wyjściowa. To jest rzeczywisty kompromis, jakiego oczekuje się od zespołu, i jest to kompromis cenowo-wydajnościowy, a nie zwycięstwo w zakresie możliwości. AA-Briefcase to jedyna tablica w tym tekście, na której kolejność się zmienia: tam Grok 4.7 przy xhigh plasuje się przed Claude Opus 5 przy xhigh, 1 657 wobec 1 649, choć wciąż za Opus 5 przy maksymalnym wysiłku z wynikiem 1 673 i za Claude Fable 5.1 z wynikiem 1 678. Warto też zestawić obok siebie trzy niezależne wyniki, zanim wyciągnie się wniosek, ponieważ nie wskazują tego samego kierunku: o siedem punktów w tyle w ogólnej inteligencji, przed GPT-5.6 Sol w indeksie agentów kodujących, o 111 punktów Elo przed poprzednikiem w pracy z wiedzą oraz płacenie za zyski tokenami wyjściowymi. To, który z tych faktów zdecyduje o twoim wyborze, zależy od tego, czy obciążenie to agent kodujący, produkt wiedzy czy prompt czatu, a to bardziej użyteczny podział niż pojedynczy ranking.
Co przecieki podały trafnie, a jedna rzecz, której nie rozstrzygnęły
Artefakty, które ten artykuł śledził do września, były prawdziwe, a premiera zamienia je w test tego, ile warta jest ta klasa dowodów. Oto rejestr.
• Pull request katalogu podał właściwą cenę. Zgłoszenie z 21 września dodające Grok 4.7 do katalogów Zen i Go klienta agenta open source — otwarte o 05:36 UTC, automatycznie zamknięte przez bota ds. zgodności o 07:46 UTC z powodu brakującej sekcji szablonu pull requesta, nigdy nie scalone — wymieniało model według opublikowanych stawek Grok 4.6. Okazało się dokładnie trafne: $2/$6, bez zmian. Ale mechanizm ma większe znaczenie niż wynik. Współtwórca skopiował stawki z modelu powyżej, a skopiowanie okazało się właściwym domysłem. To szczęście, nie autorytet, a twierdzenia o możliwościach z tego samego pull requesta również nie niosły żadnej informacji. Propozycja może być słuszna i nadal nie być dowodem.
• Ślad provisioningu był autentyczny i nie był premierą. Wiersz grok-4.7 na stronie limitów modeli w Google Cloud Console, zgłoszony przez trackerów społecznościowych 16–17 września, oraz datowany slug kompilacji grok-4-7-0907, który pojawił się w błędzie konfiguracji Grok Bot, oba wskazywały na model, który był przygotowywany. Do żadnego z nich nikt nie przypisał daty i żaden nie był ogłoszeniem. To, co ustalają, to że infrastruktura strony trzeciej była przygotowywana — co, z perspektywy czasu, było trafne, a wciąż nie było harmonogramem.
• Liczba parametrów nigdy nie została potwierdzona. Około 2,1 biliona, jakieś 40% więcej niż Grok 4.6, powtarzana przez Muska 2 września — a przy premierze wciąż nieobecna w żadnej karcie specyfikacji. To najwyraźniejszy przypadek w całej sadze liczby, która krążyła na tyle szeroko, że traktowano ją jako fakt, choć nigdy nie miała źródła ze strony dostawcy.

Powyższa karta rejestruje stan przed premierą zgodnie z tym, co ten artykuł ustalił przy ostatniej weryfikacji: brak identyfikatora modelu, brak daty premiery, brak opublikowanych benchmarków. Każdy wiersz na niej został od tego czasu zdezaktualizowany przez ogłoszenie z 21 września, a pozostawiono ją tutaj, ponieważ luka między nią a wydanym modelem to prawdziwa historia ostatnich sześciu tygodni — premiera modelu frontier, która nie przyniosła żadnej potwierdzonej specyfikacji aż do dnia, w którym model trafił na rynek.
• Zastrzeżenie dotyczące gotowości jest otwartym pytaniem, a teraz ma częściowe dowody. Musk powiedział w połowie września, że Grok 4.7 „kończy się przedwcześnie” przy zadaniach o wysokim poziomie trudności, a jego sprawdzanie odpowiedzi „nie jest wystarczająco rygorystyczne”, co przypisał zbyt wysoko ustawionej karze w uczeniu ze wzmocnieniem za długie odpowiedzi, opatrując to zastrzeżeniem „być może”. Ogłoszenie premiery tego nie porusza. Podawane przez xAI rozwiązanie jest pośrednie: dłuższe uczenie ze wzmocnieniem z większym naciskiem na wielogodzinne zadania i lepsza samoweryfikacja to dokładnie ta zmiana, którą wprowadziłbyś, aby zaradzić przedwczesnemu kończeniu. Wynik Coding Agent Index to pierwszy zewnętrzny sygnał, że przyniosło to efekty — 56 w porównaniu z 47 dla Grok 4.6, a Terminal-Bench 4.0 niemal podwoił się z 18% do 33%, co jest dokładnie długoterminowym, wieloetapowym końcem zakresu. To nie jest jednoznaczna odpowiedź, ponieważ te same wyniki zestawu testowego są także tymi, które uzyskują swoje zyski za cenę znacznie większej liczby tokenów wyjściowych. To, czy model nadal porzuca długie trudne zadania, może sprawdzić każdy z dostępem do API, i to wciąż pierwsza rzecz, którą warto przetestować.
• Korpus SpaceX wciąż pozostaje niezweryfikowany. Opisywane uzupełnienie danych treningowych — telemetria Starlink, dzienniki ciśnienia komory spalania Raptora, telemetria ponownego wejścia w atmosferę Starship, wewnętrzne wątki na Slacku, zgłoszenia Jira, repozytoria GitHub i zapisy ERP — to społecznościowe relacjonowanie tego, co powiedział Musk, a nie ujawnienie przez firmę. Ogłoszenie o premierze opisuje większy model bazowy i dłuższy przebieg uczenia ze wzmocnieniem, ale nie mówi nic o korpusie. Jeśli on tam jest, żadna karta specyfikacyjna tego nie potwierdzi; jedynym dowodem będzie to, czy model zrobi coś w prawdziwej pracy inżynierskiej, czego nie potrafią jego konkurenci.
Harmonogram, który cztery razy się nie sprawdził, i w czym rynek miał rację
Grok 4.7 obiecano publicznie w pięciu osobnych terminach, a pierwsze cztery upłynęły. 24–25 lipca Musk mówił o około czterech tygodniach, co wskazywało na 22 sierpnia. 12 sierpnia zmienił to na „3 do 4 tygodni”, co sugerowało 2–9 września. 2 września zawęził to do mniej więcej dziesięciu dni, wskazując na 12 września. 11 września, w dniu, w którym ten termin upłynął, powiedział „jeszcze kilka dni”. Piąty w ogóle nie był oknem — wiersz grok-4.7 na stronie kwot Google Cloud — i to on był najbliższy prawdy: model został wydany 21 września, krótko po ostatniej dacie, do której ktokolwiek się zobowiązał, i bez daty przypisanej do artefaktu, który go poprzedzał.
Rynki predykcyjne poprawnie odczytały kalendarz, a błędnie model. Kontrakt Kalshi „Czy SpaceXAI wyda Grok 4.7 przed 18 września?” zakończył handel o 03:59 UTC 18 września, a ostatnia transakcja zawarta została po 65¢, przy 1 785 kontraktach, którymi handlowano, i 1 211 otwartych. Każdy rozliczony kontrakt na obu głównych rynkach — okna Kalshi z 14, 21, 28 i 31 sierpnia oraz 4, 8 i 11 września, a także kontrakty Polymarket z 12 i 14 września — został rozstrzygnięty jako „Nie”. Kontrakt Polymarket „Czy kolejny model Grok (4.7 lub wyższy) zostanie wydany do 18 września?” utrzymywał się 15 września na poziomie 64%, po tym jak przez jedenaście dni wahał się między 42% a 88,5%. Rynek słusznie grał przeciw skokom wywołanym tweetami i słusznie przewidział, że okno 18 września zamknie się puste. Był o trzy dni za wcześnie co do modelu, a tego właśnie nie potrafi wycenić kontrakt z określoną datą.
Warto zachować liczby wyświetleń jako notatkę kalibracyjną. Odliczanie Muska z 2 września, „wyjdzie za 10 dni”, przyciągnęło 10,29 mln wyświetleń i było błędne. Jego wycofanie się z 11 września przyciągnęło 2,05 mln i również było błędne. Jego posty z planem działania z 13–14 września przyciągnęły około 1,99 mln i były najbliższe prawdy — opisał Grok 4.8, model o około 2,5 biliona parametrów trenowany na napisanym od zera stosie C++, jako „zauważalną poprawę” w stosunku do Grok 4.7. Zasięg przez cały ten czas odzwierciedlał pewność siebie, a nie dokładność.
Dwie pozycje z roadmapy to teraz otwarte pytania, a nie przewidywania. Grok 4.8 nie ma nigdzie identyfikatora modelu, ceny, okna kontekstowego ani wpisu w benchmarkach. A narracja, że Grok 4.7 został po cichu „przemianowany” na Grok 4.8 — czyli interpretacja jednego z serwisów, jakoby Musk wymienił 4.8, gdy 4.7 się spóźniał — rozstrzyga się odwrotnie: 4.7 ukazał się jako 4.7, z wynikiem 46 w Index wobec 44 Groka 4.6, co jest przyrostem należnym następcy, a nie relaunchem.
Co to oznacza dla zespołów wywołujących dziś Grok
Praktyczny obraz zmienił się 21 września i zmienił się w najmniej dramatyczny możliwy sposób: nowy identyfikator modelu w tej samej cenie, z tym samym oknem kontekstowym, dwupunktowym wzrostem w Indexie, dziewięciopunktowym wzrostem w zakresie agenta kodującego i 111-punktowym wzrostem w pracy opartej na wiedzy. Dwie zmiany od tego czasu mają większe znaczenie, niż się wydaje. Aplikacje Grok udostępniają teraz model zwykłym użytkownikom, a nie tylko deweloperom, a katalog po tej stronie już go wymienia — razem zamieniają opisaną na końcu tego tekstu warstwę routingu z planu w ustawienie domyślne. Jeśli twój model kosztów był oparty na Grok 4.6 przy $2/$6, cena za token nadal jest poprawna dla Grok 4.7 — ale liczba tokenów już nie. Własny przebieg Artificial Analysis spalił 240 milionów tokenów wyjściowych w Intelligence Index wobec mediany 94 milionów wśród modeli, które śledzi, więc to samo żądanie może kosztować znacznie ponad dwa razy więcej, mimo że cennik jest identyczny — co jest zmianą, która nigdy nie pojawia się w tabeli cen. Wyceń prawdziwą pętlę agentową na tokenach wyjściowych, a nie na stawce za milion, zanim uznasz, że to wydanie jest darmowe. Jeśli twoim powodem do zmiany jest granica ceny do wydajności, którą reklamuje dostawca, najmocniejszym dowodem na to jest teraz AA-Briefcase, a nie tabela dostawcy: czwarte miejsce na tej liście rankingowej przy mniej więcej połowie kosztu na zadanie Claude Opus 5, w zestawieniu z siedmiopunktową luką w Intelligence Index wobec Claude Fable 5.1 i luką cenową pięciokrotną w drugą stronę na wejściu oraz ponad ośmiokrotną na wyjściu. A jeśli twoim obciążeniem jest konkretnie agent kodujący, argument jest mocniejszy, niż sugeruje Index: 56 w Coding Agent Index w harnessie Grok Build, przed GPT-5.6 Sol, to inna liga niż 46 w ogólnej inteligencji. To, które z nich ma większe znaczenie, zależy wyłącznie od twojego obciążenia, a nikt spoza SpaceXAI nie uruchomił Grok 4.7 na twoim.
W katalogu OrcaRouter linia Grok obejmuje teraz modele Grok 4.7 obok Grok 4.6, Grok 4.5 i Grok 4.3, rozliczane według ceny katalogowej dostawcy z narzutem 0% — 2 USD za milion tokenów wejściowych i 6 USD za milion tokenów wyjściowych, odczyty tokenów wejściowych z pamięci podręcznej po 0,50 USD oraz ten sam próg do 4 USD za wejście i 12 USD za wyjście, gdy żądanie przekroczy 200 000 tokenów wejściowych, stosowany przez SpaceXAI. To właśnie zyskujesz, przekazując cennik bez zmian: cena za token w Twoim modelu kosztów jest ceną za token na Twojej fakturze, a każdy model z rodziny działa z jednym kluczem, więc przeniesienie obciążenia z Grok 4.6 na Grok 4.7 to zmiana ciągu znaków, a nie drugi kontrakt. Ta strona zawiera okno kontekstu o rozmiarze 500 000 tokenów oraz ten sam interfejs zgodny z OpenAI — Chat Completions i Responses — który już obsługuje integracja z Grok 4.6.

Ta warstwa routingu to także niskoryzykowny sposób oceny modelu, którego niezależne wyniki pojawiły się tego samego dnia co wyniki dostawcy. Powyższa lista benchmarków nadal należy do dostawcy — to jego wybrane ewaluacje, jego wybrane poziomy wysiłku, jego wybrane kolumny porównawcze — i nic z tego nie zostało odtworzone. Zmieniło się natomiast to, że trzy wyniki Artificial Analysis nie pochodzą od dostawcy, więc pytanie przesunęło się z „czy cokolwiek z tego jest prawdziwe” na „na który z tych wyników wygląda moje obciążenie”: 46, które mówi o przeciętnej inteligencji ogólnej, 56, które mówi o czwartym miejscu wśród agentów kodujących z natywnym harnessem, czy 1657, które mówi o czwartym miejscu w pracy z wiedzą przy połowie kosztu na zadanie na poziomie frontieru. A liczbą, która decyduje o ekonomii, nie jest wcale benchmark, lecz tokeny wyjściowe zużywane przez przebieg, a te może wycenić tylko Twój własny ruch — 240 milionów na przebieg Index według pomiaru Artificial Analysis wobec mediany 94 milionów, i około 8 USD wobec 4,40 USD za zestaw przykładowych prezentacji w jego publicznym scenariuszu AA-Briefcase-Lite. Automatyczne przełączanie awaryjne pozwala skierować rzeczywisty ruch na nowy model i wrócić do dostawcy, który wciąż odpowiada, jeśli rachunek za tokeny lub zachowanie polegające na przedwczesnym porzucaniu okaże się gorsze niż reklamowano — a to różnica między testowaniem nieudowodnionego modelu a postawieniem na niego całego pipeline'u.
Jak dowiedzieć się pierwszy (sprawdzenie, które zadziałało)
Ta sekcja była kiedyś listą sygnałów, na które należało zwracać uwagę w czasie oczekiwania. Oczekiwanie dobiegło końca, więc oto ta sama lista skonfrontowana z tym, co faktycznie się wydarzyło.
• Lista modeli była potwierdzeniem i uległa zmianie. Przez sześć tygodni radzono w tym tekście, aby obserwować listę modeli dostawcy, a nie tweety, ponieważ w chwili, gdy Grok 4.7 stałby się faktem, lista zyskałaby identyfikator modelu z dołączonym cennikiem i oknem kontekstowym. To właśnie się stało: grok-4.7 pojawia się teraz z oknem kontekstowym 500K, cennikiem $2/$6 poniżej 200K danych wejściowych i $4/$12 powyżej, datą odcięcia wiedzy na maj 2026 i czterema poziomami wysiłku. Każde okno czasowe Muska, każdy argument o rytmie wydań i każda data rynkowa nie zdołały zmienić tej listy; zmieniło ją wydanie.
• Katalogi podmiotów trzecich otwierają zapowiedź i są propozycjami, a nie wdrożeniami. Pull request katalogu z 21 września był najwyraźniejszym jak dotąd tego przykładem, a jego zamknięcie jest pouczające: współtwórca przygotował się na model, bot zamknął zmianę z powodu brakującej sekcji szablonu dwie godziny później, a model wypuszczono dwa dni po tym. Tę klasę artefaktów czytaj jako intencję z sygnaturą czasową. Rzeczywiście poprzedza ona zapowiedź i nie jest dostępnością.
• Śledź katalog modeli OrcaRouter. Został on teraz przeniesiony. Przez cały wrzesień rada w tym tekście była taka, że strona modelu grok-4.7 w serwisie orcarouter.ai byłaby sygnałem „możesz dziś wywołać go za naszym pośrednictwem”, ponieważ model jest wymieniany dopiero wtedy, gdy dostawca doda go do swojej oferty. Katalog zawiera teraz Grok 4.7 w cenie dostawcy bez narzutu, więc sprawdzenie, które czytelnik miał wykonać, ma odpowiedź: jest dostępny przez jedno API już dziś.
• Jeśli chodzi o widoczność po stronie konsumenta, aplikacja Grok umieściła teraz Grok 4.7 u użytkowników, którzy nigdy nie otworzą konsoli API. Przy ponownym odczycie 2 października dane selektora, które grok.com udostępnia wylogowanemu odwiedzającemu, nadal wskazują model na dwóch z czterech — Expert wyświetla się jako „Myśli intensywnie · Grok 4.7”, a Heavy jako „Zespół ekspertów · Grok 4.7” — Fast, który jest trybem domyślnie otwieranym przez aplikację, jest opisany tylko jako „Szybkie odpowiedzi” i oferuje wybór między Expert a Heavy. Pozycje to , Fast i Heavy. Build nie jest jedną z nich: Grok Build to produkt terminalowy na własnej stronie, i to z tej strony pochodzi przypisanie modelu — mówi odwiedzającym „zainstaluj teraz i zacznij budować z Grok 4.7”. Zatem twierdzenie, które krążyło 2 października i zostało powtórzone 2 października — że Grok 4.7 jest teraz modelem bazowym w „Fast, Build i Heavy” — wymienia tryb, którego aplikacja nie obsługuje, i pomija ten, w którym się otwiera, i jest to odczyt trackerów, a nie dostawcy, ponieważ SpaceXAI nie opublikowało nic na temat tego wdrożenia. Równoważny krok Grok 4 otrzymał własny wpis na blogu; ten ma produkt, który zmienił się pod stroną informacyjną, która pozostała niezmieniona.
Stan gry
Grok 4.7 trafił na rynek 21 września 2026 r. w cenie 2 USD za milion tokenów wejściowych i 6 USD za milion tokenów wyjściowych, z oknem kontekstowym 500 000 tokenów i punktem odcięcia wiedzy z maja 2026 r. To, co zmieniło się przez jedenaście dni od tego czasu, to mapa dostępności, a nie sam model: Amazon Bedrock dodał go 28 września, 1 października rozpoczęło się jego stopniowe wdrażanie w aplikacjach webowych i mobilnych samego Groka, a 2 października wciąż trwało ono tam, a obecnie jest wymieniony w OrcaRouter po stawce samego SpaceXAI, bez marży. Jego niezależne wyniki pojawiły się tego samego dnia co premiera i wciąż są rozbieżne: 46 przy poziomie wysiłku xhigh w Intelligence Index v4.3.2 Artificial Analysis, dwa punkty powyżej Grok 4.6 i wystarczająco, by umieścić SpaceXAI w czołowej czwórce laboratoriów w tym indeksie; 56 w Coding Agent Index w harnessie Grok Build, dziewięć punktów powyżej Grok 4.6 i czwarte miejsce wśród modeli z natywnym harnessem, przed GPT-5.6 Sol; i 1657 Elo w AA-Briefcase, 111 punktów powyżej Grok 4.6 i czwarte miejsce w tabeli, za trzema pozycjami Anthropic, przy mniej więcej połowie kosztu Claude Opus 5 na zadanie. Każdy benchmark w tabeli premierowej dostawcy pochodzi od samego dostawcy i nie został niezależnie odtworzony, z jednym wyjątkiem: własna tablica wyników AA-Briefcase Artificial Analysis publikuje te same 1657, a dostawca od tego czasu skorygował własny wiersz Terminal-Bench z 38,0% w dół do 37,6%. Wzrosty w kodowaniu i pracy z wiedzą są realne i kosztują tokeny wyjściowe — 240 mln na przebieg Indeksu wobec mediany 94 mln oraz około 8 USD wobec 4,40 USD za zestaw przykładowych prezentacji w publicznym scenariuszu due diligence AA — i to jest liczba, która decyduje, czy to wydanie jest tanie. Liczba ~2,1 biliona parametrów, która krążyła przez dwa miesiące, wciąż nie ma źródła po stronie dostawcy, a do zastrzeżenia dotyczącego przedwczesnego porzucenia nigdy nie odniesiono się bezpośrednio, choć skok Terminal-Bench z 18% do 33% w harnessie Grok Build jest pierwszym zewnętrznym dowodem, że poprawka zadziałała. Oba sygnały, które ten artykuł kazał czytelnikom wypatrywać, się zmaterializowały: lista modeli dostawcy wzbogaciła się o grok-4.7 z podaną ceną i oknem kontekstowym, a tutejszy katalog wymienia go po tej samej stawce. Zwycięski ruch jest więc prostszy niż we wrześniu — Grok 4.6 w cenie 2/6 USD był odpowiedzią, a Grok 4.7 w cenie 2/6 USD to ta sama odpowiedź z nowszym identyfikatorem modelu, lepszymi wynikami w kodowaniu i pracy z wiedzą, znacznie większym rachunkiem za tokeny i aplikacją konsumencką, która wymienia go w dwóch najtrudniejszych trybach.
Porównane w tym artykule3
Wykryto na podstawie tego artykułu · Benchmarki: Artificial Analysis · aktualizowane codziennie
