Karta tytułowa z napisem „Grok 4.7 vs Gemini 3.1 Pro” i podtytułem „Ranking się przesunął; model nie”, oraz trzy karty: AA Index v4.3.2 46 vs 30, Standardowa cena za 1 mln $2/$6 vs $2/$12 i Status: GA vs wersja zapoznawcza.
Guides & Insights

Grok 4.7 kontra Gemini 3.1 Pro: Ranking się przesunął, a model nie.

Autor

Gideon Frost

Data publikacji

Najnowsze modele · 20Zobacz wszystkie modele
Benchmarki: Artificial Analysis · aktualizowane codziennie
Powrót do wszystkich wpisów

19 lutego 2026 r. ukazał się artykuł Artificial Analysis zatytułowany „Gemini 3.1 Pro Preview: nowy lider w AI”. Prowadził w sześciu z dziesięciu ewaluacji i miał cztery punkty przewagi nad Claude Opus 4.6. Przeczytaj dziś stronę tego samego modelu, a liczba wynosi 30 — 69. miejsce na 200. Dostawca niczego nie zmienił. Zmieniła się miarka: 19 września 2026 r. Artificial Analysis zrewidowało swój Intelligence Index do wersji v4.3.2, ponownie oceniając każdy model w katalogu według innego zestawu ewaluacji, i lutowy lider stał się wrześniowym przeciętniakiem, podczas gdy sam model pozostał nietknięty w wersji preview. To tło dla porównania z Grok 4.7 — wydanym przez dostawcę 21 września 2026 r. — i to dlatego w tym starciu chodzi mniej o to, który model jest mądrzejszy, a bardziej o to, na którym z tych dwóch możesz jeszcze polegać, że za miesiąc będzie tym samym.

Czym każde z nich właściwie jest

Gemini 3.1 Pro to najnowszy model Google’a z klasy Pro i nigdy nie osiągnął ogólnej dostępności. Został udostępniony jako gemini-3.1-pro-preview 19 lutego 2026 r., a tabela wycofywania Google’a wciąż wymienia go z adnotacją „nie ogłoszono daty wyłączenia” — wersja zapoznawcza, która pozostaje w wersji zapoznawczej już od siedmiu miesięcy, podczas gdy Google wydało pod nią drabinkę Flash: 3.5 Flash w maju, 3.6 w lipcu, 3.7 w sierpniu, 3.8 we wrześniu. Nie ma nowszego modelu Pro w ogólnej dostępności niż Gemini 3 Pro. Ma okno wejściowe o rozmiarze 1 048 576 tokenów i limit wyjściowy 65 536 tokenów, przyjmuje na wejściu tekst, obrazy, wideo, audio i PDF, a na wyjściu zwraca tekst, oraz udostępnia kontrolę poziomu myślenia z opcjami niskim, średnim i wysokim, bez parametru budżetu i bez ustawienia minimalnego. Wagi są zamknięte.

Grok 4.7 został udostępniony dzień temu i również ma zamknięte wagi. Ma kontekst 500 tys. tokenów — połowę tego, co Gemini — i przyjmuje na wejściu tekst oraz obrazy, więc nie może w ogóle przyjmować wideo ani audio, co stanowi najostrzejszą różnicę w możliwościach w tym porównaniu. W cenniku widnieje 2,00 USD za milion tokenów wejściowych i 6,00 USD za milion tokenów wyjściowych poniżej 200 tys. tokenów promptu, a powyżej tego progu stawki rosną do 4,00 USD i 12,00 USD, przy odczytach z pamięci podręcznej po 0,50 USD i 1,00 USD; xAI podaje również szybszy wariant o około dwukrotnie większej szybkości generowania i dwukrotnie wyższej cenie. W sprawdzonej tutaj dokumentacji nie podano dla niego maksymalnej liczby tokenów wyjściowych.

Linijka się przesunęła. To cała historia.

Oba modele są obecnie oceniane w Artificial Analysis Intelligence Index v4.3.2, w którym Terminal-Bench 2.1 zastąpiono Terminal-Bench 4.0, a tau3-Banking — AutomationBench-AA, oraz ponownie zakotwiczono skalę Elo GDPval-AA. Wynik liczbowy każdego modelu zmienił się, gdy trafił do zestawienia. Wynik Gemini 3.1 Pro zmienił się bardziej niż u większości, ponieważ jego lutowe mocne strony koncentrowały się na ewaluacjach, które nowy indeks albo wycofał, albo zmienił ich wagi. Czytając dziś te dwie kolumny obok siebie:

Złożony — Grok 4.7 (xhigh): 46 w Artificial Analysis Intelligence Index v4.3.2. Gemini 3.1 Pro Preview: 30 w tej samej wersji, 69. miejsce na 200.

Długi kontekst — Grok 4.7: okno 500k, AA-LCR v1.1 77%. Gemini 3.1 Pro: okno 1M — dwa razy większe — oraz limit wyjścia 65K, czyli mniej więcej połowa tego, czego zwykle potrzebuje sesja agentowa z długim kontekstem.

Modalność wejściowa — Grok 4.7: tekst i obraz. Gemini 3.1 Pro: tekst, obraz, wideo, audio i PDF. Nawet nie jest blisko i to nie luka w benchmarkach — to luka w możliwościach.

Szybkość — Grok 4.7: brak opublikowanych pomiarów. Gemini 3.1 Pro: 124,4 tokenu wyjściowego na sekundę, pozycja #39 na 200, a czas do pierwszego tokenu wynosi 63,62 sekundy przez Google AI Studio.

Cena, poziom standardowy — Grok 4.7: $2.00 za wejście / $6.00 za wyjście za 1 mln. Gemini 3.1 Pro: $2.00 za wejście / $12.00 za wyjście. Identyczne wejście, dwukrotnie większe wyjście.

Cena, poziom długiego kontekstu — Grok 4.7: podwaja się do $4.00 / $12.00 przy 200 tys. tokenów promptu. Gemini 3.1 Pro: wzrasta do $4.00 / $18.00 przy tej samej granicy 200 tys. To samo wejście, 50% więcej wyjścia.

Dojrzałość — Grok 4.7: jeden dzień od premiery, benchmarki producenta w dużej mierze nieodtworzone. Gemini 3.1 Pro: siedem miesięcy na rynku, ale wciąż wersja zapoznawcza bez zobowiązania do ogólnej dostępności i bez daty wyłączenia.

OrcaRouter model page for Gemini 3.1 Pro Preview showing the google/gemini-3.1-pro-preview identifier, a 1M-token context window, a 65K maximum output, audio, file, image, text and video input with text output, and list rates of $2.00 per 1M input and $12.00 per 1M output.

Problem z podglądem to teraz realny problem.

Siedmiomiesięczna wersja zapoznawcza byłaby osobliwością, a nie ryzykiem, gdyby nic się z nią nie stało. A jednak coś poszło nie tak. Od 18 września 2026 r. użytkownicy zaczęli zgłaszać, że Gemini 3.1 Pro zniknął z selektora modeli AI Studio, a na moment pisania tego tekstu nie było odpowiedzi ze strony pracowników Google, informacji o wycofaniu ani podanej przyczyny — to nierozwiązany incydent dotyczący dostępności, a nie potwierdzone wycofanie. Zestawmy to z historią ogłoszeń: Google powiedziało na I/O w maju 2026 r., że Gemini 3.5 Pro „będzie wdrażany w przyszłym miesiącu”, a doniesienia prasowe z końca sierpnia mówiły, że model ten został porzucony, ponieważ wewnętrzni kandydaci „nie byli wystarczająco lepsi od serii Flash”. Sama strona Google poświęcona Pro nadal reklamuje „3.5 Pro już wkrótce”, co jest sprzecznością na jednym ekranie. Niezależnie od rozstrzygnięcia, w praktyce oznacza to, że Gemini 3.1 Pro to endpoint wersji zapoznawczej bez daty GA, bez nazwanego następcy i z obecnym znakiem zapytania dotyczącym dostępności.

Ryzyko związane z Grok 4.7 jest lustrzanym odbiciem, i to mniejszym. Ma dopiero jeden dzień, więc jego dane liczbowe są skąpe — Artificial Analysis nie opublikowało żadnego pomiaru szybkości ani opóźnienia, a własny zestaw testów porównawczych xAI dla tego modelu nie został niezależnie odtworzony. Nie ulega wątpliwości, że model jest ogólnie dostępny, wyceniony, udokumentowany i ma stabilną tożsamość. Na modelu, którego tożsamość jest stabilna, a dane niepotwierdzone, znacznie łatwiej jest budować niż na modelu, którego dane są opublikowane, a dostępność nie.

Co kosztuje podział w praktyce

Załóżmy, że wybierasz do potoku przetwarzania dokumentów. Przy 100 tys. tokenów wejściowych i 8 tys. wyjściowych Grok 4.7 kosztuje 0,20 USD za wejście i 0,048 USD za wyjście — około ćwierć dolara. Gemini 3.1 Pro kosztuje 0,20 USD za wejście i 0,096 USD za wyjście — około trzydziestu centów. Te dwa rozwiązania różnią się od siebie o nie więcej niż dwadzieścia procent, a jeśli twoje dokumenty to skany, pliki PDF, audio lub wideo, Gemini jest jedynym z tych dwóch, który w ogóle potrafi je odczytać. To nie jest argument z benchmarku; to kończy porównanie dla tego obciążenia.

Załóżmy teraz, że wybierasz dla agenta obsługującego długi kontekst. Przy 300 tys. tokenów wejściowych i 8 tys. tokenów wyjściowych Grok 4.7 kosztuje 1,20 USD za wejście i 0,096 USD za wyjście, około 1,30 USD. Gemini 3.1 Pro kosztuje 1,20 USD za wejście i 0,144 USD za wyjście, około 1,35 USD. W praktyce identycznie — i tutaj okno 1M Gemini oraz pułap wyjścia 65K stają się ograniczeniem, które przesądza sprawę, ponieważ limit 65K to moment, w którym długie przebiegi agentowe się załamują. Żaden z tych modeli nie jest tanią opcją w tym zestawieniu, a żaden nie jest też drogi jak na standardy frontieru.

Two-column scoreboard titled “Grok 4.7 vs Gemini 3.1 Pro - the scoreboard”: AA Index 46 vs 30, context 500k vs 1M, input modality “text + image” vs “text + image + video + audio + PDF”, max output “not stated” vs 65k, price per 1M $2/$6 vs $2/$12, and status GA vs preview.

Routing wokół ruchomego celu

OrcaRouter udostępnia Gemini 3.1 Pro, wymieniony na jego własnej stronie modelu według stawek dostawcy — 2,00 USD za wejście i 12,00 USD za wyjście, z oknem 1M i maksymalnym wyjściem 65k — ponieważ przekazujemy cennik katalogowy dostawcy dalej przy 0% marży. W takim przypadku nie jest to hasło marketingowe: Google ma kompilację preview o nieokreślonym czasie dostępności, której dostępność chwiała się we wrześniu, a pożyteczną rzeczą, jaką robi router, jest utrzymanie stabilnej integracji, podczas gdy to, co jest pod spodem, się zmienia. Automatyczny failover sprawia, że punkt końcowy preview, który przestaje odpowiadać, staje się zdarzeniem routingu, a nie awarią, a DSL routingu pozwala złożyć model multimodalny z modelem tylko tekstowym w jednym wywołaniu — co jest dokładnie tym kształtem, jaki sugeruje ta para: Gemini odczytuje wideo, a Grok przeprowadza rozumowanie na jego transkrypcji. Grok 4.7 nie znajduje się w katalogu OrcaRouter w momencie pisania tego tekstu; wywołanie go dziś oznacza przejście przez własne API xAI oraz platformy firm trzecich, które go udostępniają.

Wzorzec, który warto zbudować: zachowaj Gemini 3.1 Pro do wszystkiego, co musi przyjmować wideo, audio lub PDF, a jego status wersji zapoznawczej traktuj jako ryzyko operacyjne, które trzeba obejść, a nie powód, by go unikać. Przeznacz Grok 4.7 do pracy z tekstem i obrazami, tam gdzie mają zastosowanie jego niższa cena wyjścia i wyższy wynik złożony, i gdzie model, który integrujesz dzisiaj, to ten sam model, do którego będziesz się zwracać za sześć miesięcy. Jedyne, czego nie należy robić, to traktować sześćdziesiąte dziewiąte miejsce w rankingu jako wyrok w sprawie modelu — to wyrok w sprawie rewizji benchmarku, a ta sama rewizja, która zdegradowała Gemini 3.1 Pro, zdegradowała też dziesiątki modeli, których Google nigdy nie dotknęło.

Połączenie

W bieżącym indeksie Grok 4.7 wyprzedza Gemini 3.1 Pro o szesnaście punktów, a pod względem ceny za wyjście kosztuje o połowę mniej w warstwie standardowej i o jedną trzecią mniej w warstwie długiego kontekstu. Jeśli Twoje obciążenie to tekst i obrazy, to wystarczy, by podjąć decyzję. Jeśli Twoje obciążenie obejmuje wideo, dźwięk lub zeskanowane dokumenty, Gemini 3.1 Pro jest jedynym z tej dwójki kandydatem i na tym porównanie się kończy — kupujesz zdolność, a nie wynik. Zastrzeżenie, które powinno towarzyszyć obu, dotyczy raczej pochodzenia niż wydajności: jeden to siedmiomiesięczna wersja zapoznawcza bez daty GA i z wrześniowym incydentem dostępnościowym za sobą, drugi ma zaledwie dzień, nagłówkowy wynik i brak niezależnego odtworzenia czegokolwiek innego. Żaden z nich nie jest ugruntowanym wyborem. Oba warto raczej uwzględniać w routingu niż wiązać się z nimi na stałe.

Artificial Analysis page for Grok 4.7 at xhigh reasoning effort: an Artificial Analysis Intelligence Index score of 46, ranked #16 of 655; Speed and Cost both reported as N/A; 240M output tokens from the Intelligence Index run, ranked #140 of 655; a 500k-token context window with text and image input and text output; and comparison charts for intelligence, speed and cost per task.

Porównane w tym artykule2

Wykryto na podstawie tego artykułu · Benchmarki: Artificial Analysis · aktualizowane codziennie