
Grok 4.7 vs DeepSeek V4 Pro: Jeden jest nowy, drugi jest podmieniany za twoimi plecami
- OrcaNOWOŚĆOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 za 1 mln tokenów
- orcaNOWOŚĆOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 za 1 mln tokenów
- deepseekNOWOŚĆDeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligencja
- openaiOpenAI: GPT-6 Astra2026-09-0453Inteligencja77Kod
- googleGoogle: Gemini 3.8 Flash2026-09-0241Inteligencja76Kod
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Inteligencja76Kod
- anthropicAnthropic: Claude Fable 5.12026-09-0153Inteligencja82Kod
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 za 1 mln tokenów
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligencja72Kod
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 za 1 mln tokenów
- z-aiZ.ai: GLM 5.32026-08-1845Inteligencja75Kod
- obsidianQwen3.8 27B2026-08-1534Inteligencja68Kod
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Inteligencja69Kod
- grokSpaceXAI: Grok 4.62026-08-1244Inteligencja77Kod
- metaMeta: Muse Spark 1.22026-08-0540Inteligencja72Kod
- qwenQwen: Qwen3.8 Max2026-08-0345Inteligencja76Kod
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3134Inteligencja69Kod
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 za 1 mln tokenów
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
Notatka opublikowana 10 września 2026 r. zmienia to, czego dotyczy to porównanie. „Stopniowo wycofujemy V4-Pro” – czytamy, a od 04:00 UTC 14 września 2026 r. każde żądanie do ciągu modelu deepseek-v4-pro jest kierowane do DeepSeek-V4.1-Flash po stawkach V4.1-Flash — stan, który według wpisu trwa „do momentu premiery V4.1-Pro”. Ciąg modelu nadal odpowiada. Model, który za nim stoi, nie jest tym, który benchmarkowałeś. To sprawia, że bezpośrednie starcie z Grok 4.7 — wydanym przez dostawcę 21 września 2026 r., dzień przed napisaniem tego tekstu — jest porównaniem z datą ważności po jednej stronie. Na podstawie dostępnych liczb Grok 4.7 jest silniejszym modelem, a DeepSeek V4 Pro jest tańszy. W kwestii, która faktycznie decyduje o integracji, tylko jeden z nich jest wciąż tym, za co się podaje.
Czym jest każdy model, przed wynikami
DeepSeek V4 Pro osiągnął ogólną dostępność 13 sierpnia 2026 r. jako checkpoint DeepSeek-V4-Pro-0813, po zapowiedzi z 24 kwietnia. Ma otwarte wagi na licencji MIT — licencja pozwala na użycie komercyjne, modyfikację i redystrybucję bez progu przychodowego ani wyłączenia regionalnego — z 1,7 biliona parametrów łącznie według karty modelu GA, oknem kontekstu 1M tokenów i maksymalnym wyjściem 384K, największym limitem wyjścia w tym porównaniu. Obsługuje wyłącznie tekst: strona cennika samego DeepSeek podaje, że obsługa obrazu nie jest wspierana w v4-pro, co jest realnym ograniczeniem dla każdego, kto podaje mu zrzuty ekranu lub pliki PDF. Udostępnia suwak wysiłku rozumowania na poziomach low, high i max, a jego limit wynosi 500 równoczesnych żądań na konto, z możliwością zwiększenia na życzenie.
Grok 4.7 ma zamknięte wagi i został udostępniony zaledwie dzień temu. Obsługuje kontekst 500 tys. tokenów — połowę tego, co DeepSeek — przyjmuje tekst i obrazy na wejściu oraz ma własną regulację poziomu wysiłku. Jego cena katalogowa wynosi 2,00 USD za milion tokenów wejściowych i 6,00 USD za milion tokenów wyjściowych poniżej 200 tys. tokenów promptu; przy tym progu lub powyżej niego rośnie dwukrotnie, do 4,00 USD i 12,00 USD, a odczyty z pamięci podręcznej kosztują 0,50 USD i 1,00 USD. xAI podaje również szybszy wariant o około dwukrotnie większej szybkości generowania danych wyjściowych i dwukrotnie wyższej cenie. Żaden z dostawców nie podaje w sprawdzonej tutaj dokumentacji maksymalnej liczby tokenów wyjściowych dla Grok 4.7, więc należy uznać ten parametr za nieznany, a nie za równy.
Na wspólnym indeksie luka jest asymetryczna w jednym kierunku
Oba modele są oceniane w Artificial Analysis Intelligence Index v4.3.2, w wersji opublikowanej 19 września 2026 r. Kolumna Grok 4.7 jest mierzona przy wysiłku xhigh; kolumna DeepSeek to checkpoint 0813 przy maksymalnym wysiłku. Czytając je razem, różnica w wyniku złożonym nie oddaje, jak odmiennie ukształtowane są te dwa modele.
• Złożony — Grok 4.7: 46 w Artificial Analysis Intelligence Index v4.3.2. DeepSeek V4 Pro 0813: 36 w tej samej wersji.
• Agenci terminalowi — Grok 4.7: Terminal-Bench 4.0 26. DeepSeek V4 Pro: 14. Niemal dwukrotnie więcej, w ewaluacji najbliższej autonomicznej pracy nad oprogramowaniem.
• Automatyzacja — Grok 4.7: AutomationBench-AA 66%. DeepSeek V4 Pro: 57%. Oba wiarygodne; Grok prowadzi o dziewięć.
• Wiedza i halucynacje — Grok 4.7: AA-Omniscience 32. DeepSeek V4 Pro: 1. To odstający wynik na tablicy i nie jest to artefakt zaokrąglenia — indeks ocenia zarówno to, co model wie, jak i to, jak często wymyśla odpowiedź, gdy jej nie zna.
• Długi kontekst — Grok 4.7: AA-LCR v1.1 77%, okno 500k. DeepSeek V4 Pro: 80%, okno 1M. Jedno wyraźne zwycięstwo DeepSeeka — i to właśnie ta oś, pod którą zbudowano jego okno 1M.
• Trudne rozumowanie — Grok 4.7: HLE 43, CritPt 18. DeepSeek V4 Pro: HLE 41, CritPt 18. Remis w benchmarku fizycznym i dwupunktowa przewaga Groka w HLE.
• Gadatliwość — Grok 4.7: 240 mln tokenów wyjściowych na uruchomienie indeksu, oznaczony jako wyjątkowo gadatliwy. DeepSeek V4 Pro: 163 mln. Oba są gadatliwe; Grok bardziej.

Historia ceny to nie jedna liczba, lecz harmonogram
Najbardziej agresywnym elementem DeepSeek jest jego cennik — i zarazem najmniej stabilnym, jeśli chodzi o podawanie stawek. Cena katalogowa dla deepseek-v4-pro wynosi 0,66 USD za milion tokenów wejściowych przy braku trafienia w pamięci podręcznej i 1,98 USD za milion tokenów wyjściowych — w godzinach poza szczytem. W godzinach szczytu podwajają się do 1,32 USD i 3,96 USD. Szczyt, zgodnie z własną dokumentacją DeepSeek, przypada na 01:00–04:00 i 06:00–10:00 UTC od poniedziałku do piątku, z wyłączeniem chińskich świąt publicznych; wszystko inne, w tym całe weekendy, jest poza szczytem za dokładnie połowę ceny. Odczyty wejściowe z pamięci podręcznej to prawdziwa gwiazda: 0,022 USD poza szczytem i 0,044 USD w szczycie, trzydzieści razy taniej niż brak trafienia w pamięci podręcznej, co sprawia, że obciążenie DeepSeek z dobrze wykorzystaną pamięcią podręczną jest dramatycznie tańsze, niż sugeruje jego cennik.
W porównaniu z tym ceny Grok 4.7 w wysokości $2.00 i $6.00 wyglądają na drogie — około 3x stawki DeepSeek za wejście poza godzinami szczytu i 3x jego stawki za wyjście poza godzinami szczytu. Różnica się zmniejsza — i to w sposób, który warto znać. Cena Grok 4.7 jest stała w swoim przedziale, a nie zależna od godziny, więc skok produkcyjny o 09:00 UTC kosztuje tyle samo co partia w niedzielną noc; w przypadku DeepSeek tak nie jest. A powyżej 200k tokenów promptu cena Grok 4.7 się podwaja, przez co jest cztery do sześciu razy wyższa niż stawka DeepSeek poza godzinami szczytu, a nie trzy razy. Najprościej mówiąc: DeepSeek V4 Pro jest tańszym modelem pod każdym względem, a wielkość rabatu zależy od tego, kiedy uruchamiasz zadania i jak dobrze korzystasz z pamięci podręcznej.
Co zmienił 14 września
To jest ta część, która sprawia, że trudniej polegać na argumencie o cenie. Od 14 września 2026 r. DeepSeek kieruje żądania deepseek-v4-pro do DeepSeek-V4.1-Flash i rozlicza je według stawek Flash — które są jeszcze niższe. Dziennik zmian DeepSeek i jego strona z cennikiem przedstawiają nieco inną historię niż post informacyjny z 10 września: tabela cen nadal wymienia deepseek-v4-pro jako aktywny wiersz z własnymi stawkami i bez oznaczenia wycofania, a wpis w dzienniku zmian mówi, że usługa API dla V4 Pro jest kontynuowana po 14 września bez zmian w rozliczeniach. Nie jest sporny kierunek, w którym to zmierza. Potwierdzono, że V4.1-Pro jest w opracowaniu, bez ogłoszonej daty, a V4.1-Flash — wydany 10 września — jest tym, co według własnego ogłoszenia DeepSeek przebija V4 Pro pod względem „wydajności, kosztu, szybkości i całkowitego czasu działania”, a jest to twierdzenie producenta, które nie zostało niezależnie odtworzone w tak szerokim zakresie.
Zatem praktyczne pytanie nie brzmi: „Grok 4.7 czy DeepSeek V4 Pro”, lecz: „Grok 4.7 czy ten model DeepSeek, na który ten ciąg będzie wskazywał w następnym kwartale”. Jeśli testowałeś V4 Pro w sierpniu i zaplanowałeś swój budżet kontekstu wokół okna 1M z limitem wyjścia 384K, model, który wywołasz w listopadzie, może nie być tym, który mierzyłeś — a limity kontekstu i wyjścia następcy nie są tymi, pod które projektowałeś. Grok 4.7 ma przeciwny profil ryzyka: jednodniowy model, którego liczby są raportowane przez dostawcę i w dużej mierze nieodtworzone, ale którego tożsamość nie budzi wątpliwości.

Gdzie router pasuje, a gdzie nie
OrcaRouter oferuje DeepSeek V4 Pro, a strona modelu podaje go w cenie samego dostawcy — 0,66 USD za wejście i 1,98 USD za wyjście, z oknem kontekstu 1M i maksymalnym wyjściem 384k — ponieważ przekazujemy cennik dostawcy bez żadnej marży (0%). Ma to większe znaczenie niż zwykle w przypadku dostawcy, którego stawki zmieniają się zgodnie z harmonogramem szczytowym/poza szczytem, a którego ogłoszenie z 10 września wiązało się z obniżką ceny: zmiana ceny DeepSeek obowiązuje na tym samym kluczu tego samego dnia, bez opóźnienia w przeliczaniu cen i bez drugiej umowy. Gdy dostawca przekieruje po swojej stronie ciąg modelu, zmiana dociera przez ten sam punkt końcowy, zamiast wymagać ponownej integracji po Twojej stronie, a automatyczne przełączanie awaryjne sprawia, że limit liczby żądań lub zdarzenie związane z przepustowością po stronie dostawcy nie zamieniają się w awarię — co jest przydatne, gdy jedna strona Twojego stosu jest ograniczona do 500 równoczesnych żądań. Na chwilę pisania tego tekstu Grok 4.7 nie znajduje się w katalogu OrcaRouter; aby go wywołać, trzeba skorzystać z własnego API xAI oraz platform zewnętrznych, które go udostępniają.
Podział, który się z tego wyłania, jest nieefektowny, ale możliwy do obrony: zostaw DeepSeek V4 Pro przy obciążeniach, w których cennik oparty na trafieniach w cache i okno 1M robią robotę, a swoje oczekiwania wiąż raczej z V4.1-Flash niż z sierpniowym checkpointem. Przypisz Grok 4.7 do zadań, w których model musi wiedzieć, czego nie wie — indeks AA-Omniscience równy 1 to głośny sygnał o skłonności modelu do udzielania błędnych odpowiedzi z pełnym przekonaniem, a żadna przewaga cenowa nie przetrwa, gdy końcowy odbiorca zaufa sfabrykowanej odpowiedzi.
Połączenie
Grok 4.7 jest tu lepszym modelem i nie jest to szczególnie wyrównane starcie: dziesięciopunktowa przewaga w wyniku zbiorczym, dwukrotnie wyższy wynik w Terminal-Bench, przewaga w automatyzacji oraz luka w rzetelności wiedzy wystarczająco szeroka, by stanowić różnicę kategorii. DeepSeek V4 Pro jest tańszy o około 3x poza godzinami szczytu i ma dwukrotnie większe okno kontekstowe, co jest realnym i uzasadnionym powodem, by go zatrzymać — ale nie kupujesz modelu, który poddałeś benchmarkom, tylko string modelu, który DeepSeek już zapowiedział, że przekieruje, po stawkach zmieniających się z godziny na godzinę, na licencji i zestawie wag, które czynią samodzielny hosting realną trzecią opcją. Jeśli obciążenie jest długokontekstowe, o dużym wolumenie i nadaje się do cache'owania, ekonomika DeepSeek jest trudna do pobicia i powinieneś projektować pod następcę, a nie pod ten checkpoint. Jeśli to cokolwiek, gdzie pomyłka jest kosztowna, zapłać 3x więcej i weź model, który przyznaje się do niepewności.

Porównane w tym artykule2
Wykryto na podstawie tego artykułu · Benchmarki: Artificial Analysis · aktualizowane codziennie
