Karta tytułowa z napisem „Grok 4.7 vs DeepSeek V4 Pro” i podtytułem „Jeden jest nowy; drugi jest podmieniany za twoimi plecami”, oraz trzy karty: AA Index v4.3.2 46 vs 36, Cena poza szczytem za 1 mln $2/$6 vs $0.66/$1.98 i Kontekst 500k vs 1M.
Guides & Insights

Grok 4.7 vs DeepSeek V4 Pro: Jeden jest nowy, drugi jest podmieniany za twoimi plecami

Autor

Elias Hawthorne

Data publikacji

Najnowsze modele · 20Zobacz wszystkie modele
Benchmarki: Artificial Analysis · aktualizowane codziennie
Powrót do wszystkich wpisów

Notatka opublikowana 10 września 2026 r. zmienia to, czego dotyczy to porównanie. „Stopniowo wycofujemy V4-Pro” – czytamy, a od 04:00 UTC 14 września 2026 r. każde żądanie do ciągu modelu deepseek-v4-pro jest kierowane do DeepSeek-V4.1-Flash po stawkach V4.1-Flash — stan, który według wpisu trwa „do momentu premiery V4.1-Pro”. Ciąg modelu nadal odpowiada. Model, który za nim stoi, nie jest tym, który benchmarkowałeś. To sprawia, że bezpośrednie starcie z Grok 4.7 — wydanym przez dostawcę 21 września 2026 r., dzień przed napisaniem tego tekstu — jest porównaniem z datą ważności po jednej stronie. Na podstawie dostępnych liczb Grok 4.7 jest silniejszym modelem, a DeepSeek V4 Pro jest tańszy. W kwestii, która faktycznie decyduje o integracji, tylko jeden z nich jest wciąż tym, za co się podaje.

Czym jest każdy model, przed wynikami

DeepSeek V4 Pro osiągnął ogólną dostępność 13 sierpnia 2026 r. jako checkpoint DeepSeek-V4-Pro-0813, po zapowiedzi z 24 kwietnia. Ma otwarte wagi na licencji MIT — licencja pozwala na użycie komercyjne, modyfikację i redystrybucję bez progu przychodowego ani wyłączenia regionalnego — z 1,7 biliona parametrów łącznie według karty modelu GA, oknem kontekstu 1M tokenów i maksymalnym wyjściem 384K, największym limitem wyjścia w tym porównaniu. Obsługuje wyłącznie tekst: strona cennika samego DeepSeek podaje, że obsługa obrazu nie jest wspierana w v4-pro, co jest realnym ograniczeniem dla każdego, kto podaje mu zrzuty ekranu lub pliki PDF. Udostępnia suwak wysiłku rozumowania na poziomach low, high i max, a jego limit wynosi 500 równoczesnych żądań na konto, z możliwością zwiększenia na życzenie.

Grok 4.7 ma zamknięte wagi i został udostępniony zaledwie dzień temu. Obsługuje kontekst 500 tys. tokenów — połowę tego, co DeepSeek — przyjmuje tekst i obrazy na wejściu oraz ma własną regulację poziomu wysiłku. Jego cena katalogowa wynosi 2,00 USD za milion tokenów wejściowych i 6,00 USD za milion tokenów wyjściowych poniżej 200 tys. tokenów promptu; przy tym progu lub powyżej niego rośnie dwukrotnie, do 4,00 USD i 12,00 USD, a odczyty z pamięci podręcznej kosztują 0,50 USD i 1,00 USD. xAI podaje również szybszy wariant o około dwukrotnie większej szybkości generowania danych wyjściowych i dwukrotnie wyższej cenie. Żaden z dostawców nie podaje w sprawdzonej tutaj dokumentacji maksymalnej liczby tokenów wyjściowych dla Grok 4.7, więc należy uznać ten parametr za nieznany, a nie za równy.

Na wspólnym indeksie luka jest asymetryczna w jednym kierunku

Oba modele są oceniane w Artificial Analysis Intelligence Index v4.3.2, w wersji opublikowanej 19 września 2026 r. Kolumna Grok 4.7 jest mierzona przy wysiłku xhigh; kolumna DeepSeek to checkpoint 0813 przy maksymalnym wysiłku. Czytając je razem, różnica w wyniku złożonym nie oddaje, jak odmiennie ukształtowane są te dwa modele.

Złożony — Grok 4.7: 46 w Artificial Analysis Intelligence Index v4.3.2. DeepSeek V4 Pro 0813: 36 w tej samej wersji.

Agenci terminalowi — Grok 4.7: Terminal-Bench 4.0 26. DeepSeek V4 Pro: 14. Niemal dwukrotnie więcej, w ewaluacji najbliższej autonomicznej pracy nad oprogramowaniem.

Automatyzacja — Grok 4.7: AutomationBench-AA 66%. DeepSeek V4 Pro: 57%. Oba wiarygodne; Grok prowadzi o dziewięć.

Wiedza i halucynacje — Grok 4.7: AA-Omniscience 32. DeepSeek V4 Pro: 1. To odstający wynik na tablicy i nie jest to artefakt zaokrąglenia — indeks ocenia zarówno to, co model wie, jak i to, jak często wymyśla odpowiedź, gdy jej nie zna.

Długi kontekst — Grok 4.7: AA-LCR v1.1 77%, okno 500k. DeepSeek V4 Pro: 80%, okno 1M. Jedno wyraźne zwycięstwo DeepSeeka — i to właśnie ta oś, pod którą zbudowano jego okno 1M.

Trudne rozumowanie — Grok 4.7: HLE 43, CritPt 18. DeepSeek V4 Pro: HLE 41, CritPt 18. Remis w benchmarku fizycznym i dwupunktowa przewaga Groka w HLE.

Gadatliwość — Grok 4.7: 240 mln tokenów wyjściowych na uruchomienie indeksu, oznaczony jako wyjątkowo gadatliwy. DeepSeek V4 Pro: 163 mln. Oba są gadatliwe; Grok bardziej.

OrcaRouter model page for DeepSeek V4 Pro showing the deepseek/deepseek-v4-pro identifier, a 1M-token context window, 384K maximum output, text-only input, off-peak list rates of $0.66 per 1M input and $1.98 per 1M output, and 3818.2M tokens of traffic over seven days.

Historia ceny to nie jedna liczba, lecz harmonogram

Najbardziej agresywnym elementem DeepSeek jest jego cennik — i zarazem najmniej stabilnym, jeśli chodzi o podawanie stawek. Cena katalogowa dla deepseek-v4-pro wynosi 0,66 USD za milion tokenów wejściowych przy braku trafienia w pamięci podręcznej i 1,98 USD za milion tokenów wyjściowych — w godzinach poza szczytem. W godzinach szczytu podwajają się do 1,32 USD i 3,96 USD. Szczyt, zgodnie z własną dokumentacją DeepSeek, przypada na 01:00–04:00 i 06:00–10:00 UTC od poniedziałku do piątku, z wyłączeniem chińskich świąt publicznych; wszystko inne, w tym całe weekendy, jest poza szczytem za dokładnie połowę ceny. Odczyty wejściowe z pamięci podręcznej to prawdziwa gwiazda: 0,022 USD poza szczytem i 0,044 USD w szczycie, trzydzieści razy taniej niż brak trafienia w pamięci podręcznej, co sprawia, że obciążenie DeepSeek z dobrze wykorzystaną pamięcią podręczną jest dramatycznie tańsze, niż sugeruje jego cennik.

W porównaniu z tym ceny Grok 4.7 w wysokości $2.00 i $6.00 wyglądają na drogie — około 3x stawki DeepSeek za wejście poza godzinami szczytu i 3x jego stawki za wyjście poza godzinami szczytu. Różnica się zmniejsza — i to w sposób, który warto znać. Cena Grok 4.7 jest stała w swoim przedziale, a nie zależna od godziny, więc skok produkcyjny o 09:00 UTC kosztuje tyle samo co partia w niedzielną noc; w przypadku DeepSeek tak nie jest. A powyżej 200k tokenów promptu cena Grok 4.7 się podwaja, przez co jest cztery do sześciu razy wyższa niż stawka DeepSeek poza godzinami szczytu, a nie trzy razy. Najprościej mówiąc: DeepSeek V4 Pro jest tańszym modelem pod każdym względem, a wielkość rabatu zależy od tego, kiedy uruchamiasz zadania i jak dobrze korzystasz z pamięci podręcznej.

Co zmienił 14 września

To jest ta część, która sprawia, że trudniej polegać na argumencie o cenie. Od 14 września 2026 r. DeepSeek kieruje żądania deepseek-v4-pro do DeepSeek-V4.1-Flash i rozlicza je według stawek Flash — które są jeszcze niższe. Dziennik zmian DeepSeek i jego strona z cennikiem przedstawiają nieco inną historię niż post informacyjny z 10 września: tabela cen nadal wymienia deepseek-v4-pro jako aktywny wiersz z własnymi stawkami i bez oznaczenia wycofania, a wpis w dzienniku zmian mówi, że usługa API dla V4 Pro jest kontynuowana po 14 września bez zmian w rozliczeniach. Nie jest sporny kierunek, w którym to zmierza. Potwierdzono, że V4.1-Pro jest w opracowaniu, bez ogłoszonej daty, a V4.1-Flash — wydany 10 września — jest tym, co według własnego ogłoszenia DeepSeek przebija V4 Pro pod względem „wydajności, kosztu, szybkości i całkowitego czasu działania”, a jest to twierdzenie producenta, które nie zostało niezależnie odtworzone w tak szerokim zakresie.

Zatem praktyczne pytanie nie brzmi: „Grok 4.7 czy DeepSeek V4 Pro”, lecz: „Grok 4.7 czy ten model DeepSeek, na który ten ciąg będzie wskazywał w następnym kwartale”. Jeśli testowałeś V4 Pro w sierpniu i zaplanowałeś swój budżet kontekstu wokół okna 1M z limitem wyjścia 384K, model, który wywołasz w listopadzie, może nie być tym, który mierzyłeś — a limity kontekstu i wyjścia następcy nie są tymi, pod które projektowałeś. Grok 4.7 ma przeciwny profil ryzyka: jednodniowy model, którego liczby są raportowane przez dostawcę i w dużej mierze nieodtworzone, ale którego tożsamość nie budzi wątpliwości.

Two-column scoreboard titled “Grok 4.7 vs DeepSeek V4 Pro - the scoreboard”: AA Index 46 vs 36, Terminal-Bench 4.0 26 vs 14, AutomationBench 66% vs 57%, context 500k vs 1M, price per 1M $2/$6 vs $0.66/$1.98 off-peak, and open weights “no” vs “MIT”.

Gdzie router pasuje, a gdzie nie

OrcaRouter oferuje DeepSeek V4 Pro, a strona modelu podaje go w cenie samego dostawcy — 0,66 USD za wejście i 1,98 USD za wyjście, z oknem kontekstu 1M i maksymalnym wyjściem 384k — ponieważ przekazujemy cennik dostawcy bez żadnej marży (0%). Ma to większe znaczenie niż zwykle w przypadku dostawcy, którego stawki zmieniają się zgodnie z harmonogramem szczytowym/poza szczytem, a którego ogłoszenie z 10 września wiązało się z obniżką ceny: zmiana ceny DeepSeek obowiązuje na tym samym kluczu tego samego dnia, bez opóźnienia w przeliczaniu cen i bez drugiej umowy. Gdy dostawca przekieruje po swojej stronie ciąg modelu, zmiana dociera przez ten sam punkt końcowy, zamiast wymagać ponownej integracji po Twojej stronie, a automatyczne przełączanie awaryjne sprawia, że limit liczby żądań lub zdarzenie związane z przepustowością po stronie dostawcy nie zamieniają się w awarię — co jest przydatne, gdy jedna strona Twojego stosu jest ograniczona do 500 równoczesnych żądań. Na chwilę pisania tego tekstu Grok 4.7 nie znajduje się w katalogu OrcaRouter; aby go wywołać, trzeba skorzystać z własnego API xAI oraz platform zewnętrznych, które go udostępniają.

Podział, który się z tego wyłania, jest nieefektowny, ale możliwy do obrony: zostaw DeepSeek V4 Pro przy obciążeniach, w których cennik oparty na trafieniach w cache i okno 1M robią robotę, a swoje oczekiwania wiąż raczej z V4.1-Flash niż z sierpniowym checkpointem. Przypisz Grok 4.7 do zadań, w których model musi wiedzieć, czego nie wie — indeks AA-Omniscience równy 1 to głośny sygnał o skłonności modelu do udzielania błędnych odpowiedzi z pełnym przekonaniem, a żadna przewaga cenowa nie przetrwa, gdy końcowy odbiorca zaufa sfabrykowanej odpowiedzi.

Połączenie

Grok 4.7 jest tu lepszym modelem i nie jest to szczególnie wyrównane starcie: dziesięciopunktowa przewaga w wyniku zbiorczym, dwukrotnie wyższy wynik w Terminal-Bench, przewaga w automatyzacji oraz luka w rzetelności wiedzy wystarczająco szeroka, by stanowić różnicę kategorii. DeepSeek V4 Pro jest tańszy o około 3x poza godzinami szczytu i ma dwukrotnie większe okno kontekstowe, co jest realnym i uzasadnionym powodem, by go zatrzymać — ale nie kupujesz modelu, który poddałeś benchmarkom, tylko string modelu, który DeepSeek już zapowiedział, że przekieruje, po stawkach zmieniających się z godziny na godzinę, na licencji i zestawie wag, które czynią samodzielny hosting realną trzecią opcją. Jeśli obciążenie jest długokontekstowe, o dużym wolumenie i nadaje się do cache'owania, ekonomika DeepSeek jest trudna do pobicia i powinieneś projektować pod następcę, a nie pod ten checkpoint. Jeśli to cokolwiek, gdzie pomyłka jest kosztowna, zapłać 3x więcej i weź model, który przyznaje się do niepewności.

Artificial Analysis page for Grok 4.7 at xhigh reasoning effort: an Artificial Analysis Intelligence Index score of 46, ranked #16 of 655; Speed and Cost both reported as N/A; 240M output tokens from the Intelligence Index run, ranked #140 of 655; a 500k-token context window with text and image input and text output; and comparison charts for intelligence, speed and cost per task.

Porównane w tym artykule2

Wykryto na podstawie tego artykułu · Benchmarki: Artificial Analysis · aktualizowane codziennie