Karta tytułowa hero dla porównania 'Grok 4.6 vs DeepSeek V4 Pro', z podtytułem 'Wojna cenowa na froncie, stoczona w odstępie 24 godzin,' oraz plakietką 'Porównanie · sierpień 2026'.
Guides & Insights

Grok 4.6 vs DeepSeek V4 Pro: Wojna cenowa na froncie, stoczona w odstępie 24 godzin

Autor

Rowan Sterling

Data publikacji

Najnowsze modele · 20Zobacz wszystkie modele
Benchmarki: Artificial Analysis · aktualizowane codziennie
Powrót do wszystkich wpisów

Dwa czołowe modele pojawiły się w odstępie 24 godzin, a różnica między ich cennikami jest największa, jaką ta generacja wyprodukowała. Grok 4.6 zadebiutował 12 sierpnia 2026 roku w cenie 2 dolarów za milion tokenów wejściowych i 6 dolarów za milion tokenów wyjściowych. DeepSeek V4 Pro — oficjalna produkcyjna wersja flagowca D​eepSeek, oznaczona jako DeepSeek-V4-Pro-0813 — pojawił się 13 sierpnia 2026 roku w cenie 3 juanów za milion tokenów wejściowych przy braku trafienia w pamięć podręczną i 6 juanów za milion tokenów wyjściowych, co daje około 0,42 i 0,85 dolara. Ta sama kategoria, te same ambicje agentowe, a ceny różnią się o rząd wielkości. To nie porównanie dwóch specyfikacji; to porównanie dwóch strategii określających, ile powinien kosztować model mający działać jak agent — i obie ujawniono w tym tygodniu.

Ten materiał zestawia dwa cenniki obok siebie, czyta deklaracje benchmarkowe każdego dostawcy z jego etykietą i wylicza, ile ta różnica naprawdę kosztuje przy realnym obciążeniu — bo na papierze te modele są bliższe sobie możliwościami niż filozofią, a różnica w cenie za zadanie to miejsce, w którym zapada decyzja.

W tym właśnie rzecz: timing.

To, że oba modele wylądowały w tym samym 48-godzinnym oknie, nie jest przypadkiem kalendarzy. Grok 4.6 to agentowa przebudowa SpaceXAI na bazie jej fundamentu 1.5T — odświeżenie potreningowe mocno oparte na uczeniu przez wzmacnianie w kodowaniu, pracy nad jądrem i CAD, wycenione jako paliwo dla należących do firmy produktów Cursor i Grok Bot. DeepSeek V4 Pro to sformalizowanie wersji zapoznawczej, która po cichu za ułamek ceny przedefiniowała, co znaczy „agentowy”, a teraz jest ulepszony pod ekonomię agentów: informacje o wydaniu D​eepSeek dla kompilacji 0813 zaczynają się od znacząco ulepszonych możliwości agentowych, dodają wsparcie dla Responses API i integracji z Codexem, a także zachowują tryb myślenia (domyślny) i niemyślenia, wyjście JSON, wywołania narzędzi oraz format API Anthropic. Dwie bardzo różne firmy jednocześnie doszły do wniosku, że rynkiem, który się liczy pod koniec 2026 roku, są agenci — i wyceniły swoje produkty na bardzo różne portfele.

Dwa cenniki, obok siebie.

Grok 4.6 — 2,00 USD / 6,00 USD / 0,50 USD (buforowane wejście) za milion tokenów, kontekst 500K, wzrost o 4 / 12 / 1 USD powyżej mniej więcej 200K tokenów wejściowych oraz szybszy wariant przy dwukrotnie wyższej stawce bazowej.

DeepSeek V4 Pro — ¥3.00 (≈$0.42) za wejście z chybieniem pamięci podręcznej, ¥0.025 (≈$0.0035) za wejście z pamięci podręcznej, ¥6.00 (≈$0.85) za wyjście na milion tokenów, z oknem kontekstowym o wielkości 1 miliona tokenów i do 384 tys. tokenów wyjściowych. Jego tańszy odpowiednik, V4 Flash, kosztuje ¥1 / ¥2.

Nawet w porównaniu z Grok 4.6 — już najtańszym API frontier swojego pokolenia — DeepSeek V4 Pro jest mniej więcej pięć razy tańszy na wejściu z chybieniem w cache i siedem razy tańszy na wyjściu, a przy tym oferuje dwukrotnie większe okno kontekstowe i znacznie większe maksymalne wyjście w tej samej półce cenowej. Te dwie usługi nie konkurują ceną; DeepSeek jednostronnie ustanowił nową dolną granicę, a Grok jest teraz opcją premium w tym samym zdaniu. To ujęcie ma znaczenie, ponieważ poprzednie ujęcie — „Grok 4.6 to tani model frontier" — było prawdziwe przez dokładnie jeden dzień.

Two-column scoreboard: Grok 4.6 AA Index 61 (independent), $2/$6, 500K context, DeepSWE v1.1 65.9% (vendor), Terminal-Bench 26% (v3.0), cache-hit input $0.50 vs DeepSeek V4 Pro AA Index none yet, ≈$0.42/$0.85, 1M context, DeepSWE 62.7% (vendor), Terminal-Bench 87.9% (v2.1), cache-hit input ≈$0.0035.

Co faktycznie ulepszono w DeepSeek V4 Pro

Liczby premiery DeepSeeka są najbardziej dramatyczne, ponieważ porównuje się je z jego własną wersją zapoznawczą, a skok od wersji zapoznawczej do pełnego wydania jest ogromny. Według własnych ocen producenta:

DeepSWE — 62,7% w wersji wydaniowej, wzrost z 12,8% w wersji zapoznawczej — wynik dla długiego horyzontu w inżynierii oprogramowania, który producent plasuje między 58,0% Opusa 4.8 a 70,0% Claude'a Fable 5.

Cybergym — 83,3%, wzrost z 52,7%, nieznacznie wyprzedzając Fable 5 (83,1%) i pokonując Opus 4.8 (78,3%).

Terminal Bench 2.1 — 87.9%, o mniej niż punkt od 88.0% Fable 5 i wyprzedzając 85.0% Opus 4.8.

AutomationBench (publiczny) — 31,8%, wzrost z 12,8%, wyprzedzając zarówno Fable 5 (29,1%), jak i Opus 4.8 (27,2%).

Toolathlon-Verified, NL2Repo, DSBench-FullStack i DSBench-Hard — odpowiednio 74,1%, 61,5%, 71,1% i 67,2%, skupione na poziomie lub w pobliżu pasma Opus 4.8 / Fable 5.

Każdy z tych wyników jest raportowany przez DeepSeek we własnym zestawie ewaluacyjnym DeepSeek. Kierunek jest jednoznaczny — wersja zapoznawcza nie była gotowa do produkcyjnych pętli agentowych, a wersja wydaniowa twierdzi, że jest — ale uczciwa etykieta brzmi tak: żadne niezależne laboratorium nie oceniło jeszcze DeepSeek V4 Pro, a modele, z którymi jest porównywany, nie zostały wskazane przez zewnętrzną stronę.

Z czym odpowiada Grok 4.6

Rywal Grok 4.6 jest innego rodzaju: to jedyny z tych dwóch z niezależną tablicą wyników. Artificial Analysis zmierzyło go na 61 w swoim Intelligence Index — na równi z GPT-5.6 Sol, przed Kimi K3 (60) — zanim DeepSeek V4 Pro w ogóle został wydany. Tabela producenta deklaruje prowadzące wyniki: 65,9% na DeepSWE v1.1 i 69,9% na CursorBench v3.2, z otwarcie przyznanym słabym punktem na poziomie 26% na Terminal-Bench v3.0. To są dane raportowane przez xAI; żadne z nich nie zostało niezależnie odtworzone na dzień 13 sierpnia.

Różnice wersji mają znaczenie, gdy próbujesz porównać je bezpośrednio. 87,9 D​eepSeeka pochodzi z Terminal Bench 2.1; 26% Groka dotyczy trudniejszej v3.0 — to różne egzaminy, więc „D​eepSeek miażdży Groka na terminalach” nie jest uczciwym stwierdzeniem, podobnie jak „Grok prowadzi w DeepSWE” bez odnotowania, że obaj dostawcy użyli różnych wersji ewaluacji i żadna z tych liczb nie pochodzi od strony trzeciej. To, co jest porównywalne, to niezależny wymiar: Grok 4.6 ma jeden zweryfikowany arkusz wyników, DeepSeek V4 Pro nie ma żadnego, a dla decyzji produkcyjnej ta asymetria sama w sobie jest informacją.

Screenshot of the Artificial Analysis page for Grok 4.6 (high) scoring 61 — the independent scorecard DeepSeek V4 Pro does not yet have.

Całkowity koszt długiego uruchomienia agenta

Weźmy realistyczne zadanie agentowe — czytanie i wnioskowanie nad kontekstem 500K tokenów, pisanie 100K tokenów wyniku, czyli refaktor średniej wielkości lub długi potok dokumentów, w oknach obu modeli:

Grok 4.6 — 0.5M tokenów wejściowych po $2 = $1.00, plus 0.1M tokenów wyjściowych po $6 = $0.60. Razem: $1.60.

DeepSeek V4 Pro — 0,5M wejść (cache-miss) po ¥3 = ¥1,50, plus 0,1M wyjść po ¥6 = ¥0,60. Razem: ¥2,10, około $0,29.

To jest 5,5-krotna różnica w tym samym nominalnym zadaniu, nie licząc korzyści z cache'owania — a okno 1M D​eepSeeka plus maksymalne wyjście 384K oznacza również, że zadanie mieści się w jednym przebiegu, podczas gdy okno 500K Groka 4.6 może wymusić dwa. Haczyk, który sprawia, że nie jest to odpowiedź w jednej linijce, to koszt rozumowania i ryzyko: tryb myślenia D​eepSeeka jest domyślnie włączony, więc każde żądanie płaci za pełny ślad rozumowania, nawet gdy go nie chcesz, a pewność producenta co do benchmarków nie została przetestowana przez nikogo niezależnego. Niska cena za token przy zawsze włączonym rozumowaniu to przy tych stawkach wciąż niski koszt na zadanie, ale „tanio” i „zweryfikowany” to dwie różne deklaracje — i tylko jeden z tych modeli może się pochwalić tą drugą.

Kto powinien wybrać, które

Decyzja to mniej kwestia tego, „który jest lepszy”, niż tego, „który profil ryzyka pasuje do obciążenia”:

Wielkoskalowy, ograniczony kosztowo i gotowy do zaakceptowania niezweryfikowanych liczb — DeepSeek V4 Pro to opcja z najniższej półki cenowej. Kontekst 1M i wyjście 384K sprawiają, że jest lepszym kandydatem do obsługi długiego kontekstu i przetwarzania wsadowego, a stawka ¥0,025 za wejście z pamięci podręcznej sprawia, że potoki intensywnie korzystające z wyszukiwania są prawie darmowe. Po prostu przeprowadź własne ewaluacje, bo nikt niezależny tego nie zrobił.

Głębia agentowa z niezależną kartą wyników, w ekosystemie zgodnym z OpenAI — Wynik 61 Groka 4.6 jest zweryfikowany, kierunek jego benchmarków dotyczących kodowania i agentów jest spójny, a słabość końcowa jest znana z góry. Czas do pierwszego tokena wynoszący 42 sekundy to cena, jaką płacisz za zweryfikowaną jakość.

Screenshot of the OrcaRouter model page for Grok 4.6, the pass-through endpoint where both models sit behind one key at provider list price.

Ruch mieszany — to przypadek dla routingu, a nie wyboru. W OrcaRouter oba modele znajdują się za jednym kluczem w cenie pass-through z listy dostawców — więc ¥3/¥6 DeepSeek pozostaje ¥3/¥6 na fakturze, a Grok 4.6 pozostaje $2/$6, z zerową marżą na obu. Reguła routingu może wysyłać długokontekstowe, kosztochłonne zadania do DeepSeek V4 Pro, a zweryfikowaną pracę agentową do Grok 4.6, dzielić ruch według żądań, dopóki własna ocena nie ustali podziału, i polegać na automatycznym failover, jeśli zachowanie któregokolwiek dostawcy w pierwszym tygodniu zaprzeczy liczbom z premiery. W przypadku pary modeli mających jeden dzień, stojących po przeciwnych stronach wojny cenowej, możliwość porównania obu na własnym obciążeniu — i zmiany podziału bez zmiany kodu — nie jest wygodą. To jedyny możliwy do obrony sposób na wdrożenie któregokolwiek z nich.

Porównane w tym artykule2

Wykryto na podstawie tego artykułu · Benchmarki: Artificial Analysis · aktualizowane codziennie

© 2026 OrcaRouter

Dla dostawców

Prowadzisz platformę inferencyjną? Udostępnij swoje modele w OrcaRouter.

providers@orcarouter.ai

Dołącz do społeczności

Discordsupport@orcarouter.aiXGitHubYouTube