
Grok 4.6 vs DeepSeek V4 Pro: Wojna cenowa na froncie, stoczona w odstępie 24 godzin
- z-aiNOWOŚĆZ.ai: GLM 5.32026-08-1860Inteligencja75Kod
- obsidianNOWOŚĆQwen3.8 27B Uncensored (Aggressive)2026-08-1552Inteligencja68Kod
- qwenNOWOŚĆQwen: Qwen3.8 27B (free)2026-08-1340 tok/s
- deepseekNOWOŚĆDeepSeek: DeepSeek V4 Pro 08132026-08-1253Inteligencja69Kod
- grokNOWOŚĆSpaceXAI: Grok 4.62026-08-1261Inteligencja77Kod
- metaNOWOŚĆMeta: Muse Spark 1.22026-08-0557Inteligencja72Kod
- qwenQwen: Qwen3.8 Max2026-08-0358Inteligencja72Kod
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3152Inteligencja69Kod
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 za 1 mln tokenów · 230 tok/s
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463Inteligencja78Kod
- googleGoogle: Gemini 3.6 Flash2026-07-2152Inteligencja69Kod
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137Inteligencja49Kod
- metaMeta: Muse Spark 1.12026-07-1653Inteligencja71Kod
- kimiMoonshotAI: Kimi K32026-07-1560Inteligencja76Kod
- openaiOpenAI: GPT-5.6 Luna2026-07-0952Inteligencja71Kod
- openaiOpenAI: GPT-5.6 Terra2026-07-0957Inteligencja77Kod
- openaiOpenAI: GPT-5.6 Sol2026-07-0961Inteligencja77Kod
- grokxAI: Grok 4.52026-07-0856Inteligencja72Kod
Dwa czołowe modele pojawiły się w odstępie 24 godzin, a różnica między ich cennikami jest największa, jaką ta generacja wyprodukowała. Grok 4.6 zadebiutował 12 sierpnia 2026 roku w cenie 2 dolarów za milion tokenów wejściowych i 6 dolarów za milion tokenów wyjściowych. DeepSeek V4 Pro — oficjalna produkcyjna wersja flagowca DeepSeek, oznaczona jako DeepSeek-V4-Pro-0813 — pojawił się 13 sierpnia 2026 roku w cenie 3 juanów za milion tokenów wejściowych przy braku trafienia w pamięć podręczną i 6 juanów za milion tokenów wyjściowych, co daje około 0,42 i 0,85 dolara. Ta sama kategoria, te same ambicje agentowe, a ceny różnią się o rząd wielkości. To nie porównanie dwóch specyfikacji; to porównanie dwóch strategii określających, ile powinien kosztować model mający działać jak agent — i obie ujawniono w tym tygodniu.
Ten materiał zestawia dwa cenniki obok siebie, czyta deklaracje benchmarkowe każdego dostawcy z jego etykietą i wylicza, ile ta różnica naprawdę kosztuje przy realnym obciążeniu — bo na papierze te modele są bliższe sobie możliwościami niż filozofią, a różnica w cenie za zadanie to miejsce, w którym zapada decyzja.
W tym właśnie rzecz: timing.
To, że oba modele wylądowały w tym samym 48-godzinnym oknie, nie jest przypadkiem kalendarzy. Grok 4.6 to agentowa przebudowa SpaceXAI na bazie jej fundamentu 1.5T — odświeżenie potreningowe mocno oparte na uczeniu przez wzmacnianie w kodowaniu, pracy nad jądrem i CAD, wycenione jako paliwo dla należących do firmy produktów Cursor i Grok Bot. DeepSeek V4 Pro to sformalizowanie wersji zapoznawczej, która po cichu za ułamek ceny przedefiniowała, co znaczy „agentowy”, a teraz jest ulepszony pod ekonomię agentów: informacje o wydaniu DeepSeek dla kompilacji 0813 zaczynają się od znacząco ulepszonych możliwości agentowych, dodają wsparcie dla Responses API i integracji z Codexem, a także zachowują tryb myślenia (domyślny) i niemyślenia, wyjście JSON, wywołania narzędzi oraz format API Anthropic. Dwie bardzo różne firmy jednocześnie doszły do wniosku, że rynkiem, który się liczy pod koniec 2026 roku, są agenci — i wyceniły swoje produkty na bardzo różne portfele.
Dwa cenniki, obok siebie.
• Grok 4.6 — 2,00 USD / 6,00 USD / 0,50 USD (buforowane wejście) za milion tokenów, kontekst 500K, wzrost o 4 / 12 / 1 USD powyżej mniej więcej 200K tokenów wejściowych oraz szybszy wariant przy dwukrotnie wyższej stawce bazowej.
• DeepSeek V4 Pro — ¥3.00 (≈$0.42) za wejście z chybieniem pamięci podręcznej, ¥0.025 (≈$0.0035) za wejście z pamięci podręcznej, ¥6.00 (≈$0.85) za wyjście na milion tokenów, z oknem kontekstowym o wielkości 1 miliona tokenów i do 384 tys. tokenów wyjściowych. Jego tańszy odpowiednik, V4 Flash, kosztuje ¥1 / ¥2.
Nawet w porównaniu z Grok 4.6 — już najtańszym API frontier swojego pokolenia — DeepSeek V4 Pro jest mniej więcej pięć razy tańszy na wejściu z chybieniem w cache i siedem razy tańszy na wyjściu, a przy tym oferuje dwukrotnie większe okno kontekstowe i znacznie większe maksymalne wyjście w tej samej półce cenowej. Te dwie usługi nie konkurują ceną; DeepSeek jednostronnie ustanowił nową dolną granicę, a Grok jest teraz opcją premium w tym samym zdaniu. To ujęcie ma znaczenie, ponieważ poprzednie ujęcie — „Grok 4.6 to tani model frontier" — było prawdziwe przez dokładnie jeden dzień.

Co faktycznie ulepszono w DeepSeek V4 Pro
Liczby premiery DeepSeeka są najbardziej dramatyczne, ponieważ porównuje się je z jego własną wersją zapoznawczą, a skok od wersji zapoznawczej do pełnego wydania jest ogromny. Według własnych ocen producenta:
• DeepSWE — 62,7% w wersji wydaniowej, wzrost z 12,8% w wersji zapoznawczej — wynik dla długiego horyzontu w inżynierii oprogramowania, który producent plasuje między 58,0% Opusa 4.8 a 70,0% Claude'a Fable 5.
• Cybergym — 83,3%, wzrost z 52,7%, nieznacznie wyprzedzając Fable 5 (83,1%) i pokonując Opus 4.8 (78,3%).
• Terminal Bench 2.1 — 87.9%, o mniej niż punkt od 88.0% Fable 5 i wyprzedzając 85.0% Opus 4.8.
• AutomationBench (publiczny) — 31,8%, wzrost z 12,8%, wyprzedzając zarówno Fable 5 (29,1%), jak i Opus 4.8 (27,2%).
• Toolathlon-Verified, NL2Repo, DSBench-FullStack i DSBench-Hard — odpowiednio 74,1%, 61,5%, 71,1% i 67,2%, skupione na poziomie lub w pobliżu pasma Opus 4.8 / Fable 5.
Każdy z tych wyników jest raportowany przez DeepSeek we własnym zestawie ewaluacyjnym DeepSeek. Kierunek jest jednoznaczny — wersja zapoznawcza nie była gotowa do produkcyjnych pętli agentowych, a wersja wydaniowa twierdzi, że jest — ale uczciwa etykieta brzmi tak: żadne niezależne laboratorium nie oceniło jeszcze DeepSeek V4 Pro, a modele, z którymi jest porównywany, nie zostały wskazane przez zewnętrzną stronę.
Z czym odpowiada Grok 4.6
Rywal Grok 4.6 jest innego rodzaju: to jedyny z tych dwóch z niezależną tablicą wyników. Artificial Analysis zmierzyło go na 61 w swoim Intelligence Index — na równi z GPT-5.6 Sol, przed Kimi K3 (60) — zanim DeepSeek V4 Pro w ogóle został wydany. Tabela producenta deklaruje prowadzące wyniki: 65,9% na DeepSWE v1.1 i 69,9% na CursorBench v3.2, z otwarcie przyznanym słabym punktem na poziomie 26% na Terminal-Bench v3.0. To są dane raportowane przez xAI; żadne z nich nie zostało niezależnie odtworzone na dzień 13 sierpnia.
Różnice wersji mają znaczenie, gdy próbujesz porównać je bezpośrednio. 87,9 DeepSeeka pochodzi z Terminal Bench 2.1; 26% Groka dotyczy trudniejszej v3.0 — to różne egzaminy, więc „DeepSeek miażdży Groka na terminalach” nie jest uczciwym stwierdzeniem, podobnie jak „Grok prowadzi w DeepSWE” bez odnotowania, że obaj dostawcy użyli różnych wersji ewaluacji i żadna z tych liczb nie pochodzi od strony trzeciej. To, co jest porównywalne, to niezależny wymiar: Grok 4.6 ma jeden zweryfikowany arkusz wyników, DeepSeek V4 Pro nie ma żadnego, a dla decyzji produkcyjnej ta asymetria sama w sobie jest informacją.

Całkowity koszt długiego uruchomienia agenta
Weźmy realistyczne zadanie agentowe — czytanie i wnioskowanie nad kontekstem 500K tokenów, pisanie 100K tokenów wyniku, czyli refaktor średniej wielkości lub długi potok dokumentów, w oknach obu modeli:
• Grok 4.6 — 0.5M tokenów wejściowych po $2 = $1.00, plus 0.1M tokenów wyjściowych po $6 = $0.60. Razem: $1.60.
• DeepSeek V4 Pro — 0,5M wejść (cache-miss) po ¥3 = ¥1,50, plus 0,1M wyjść po ¥6 = ¥0,60. Razem: ¥2,10, około $0,29.
To jest 5,5-krotna różnica w tym samym nominalnym zadaniu, nie licząc korzyści z cache'owania — a okno 1M DeepSeeka plus maksymalne wyjście 384K oznacza również, że zadanie mieści się w jednym przebiegu, podczas gdy okno 500K Groka 4.6 może wymusić dwa. Haczyk, który sprawia, że nie jest to odpowiedź w jednej linijce, to koszt rozumowania i ryzyko: tryb myślenia DeepSeeka jest domyślnie włączony, więc każde żądanie płaci za pełny ślad rozumowania, nawet gdy go nie chcesz, a pewność producenta co do benchmarków nie została przetestowana przez nikogo niezależnego. Niska cena za token przy zawsze włączonym rozumowaniu to przy tych stawkach wciąż niski koszt na zadanie, ale „tanio” i „zweryfikowany” to dwie różne deklaracje — i tylko jeden z tych modeli może się pochwalić tą drugą.
Kto powinien wybrać, które
Decyzja to mniej kwestia tego, „który jest lepszy”, niż tego, „który profil ryzyka pasuje do obciążenia”:
• Wielkoskalowy, ograniczony kosztowo i gotowy do zaakceptowania niezweryfikowanych liczb — DeepSeek V4 Pro to opcja z najniższej półki cenowej. Kontekst 1M i wyjście 384K sprawiają, że jest lepszym kandydatem do obsługi długiego kontekstu i przetwarzania wsadowego, a stawka ¥0,025 za wejście z pamięci podręcznej sprawia, że potoki intensywnie korzystające z wyszukiwania są prawie darmowe. Po prostu przeprowadź własne ewaluacje, bo nikt niezależny tego nie zrobił.
• Głębia agentowa z niezależną kartą wyników, w ekosystemie zgodnym z OpenAI — Wynik 61 Groka 4.6 jest zweryfikowany, kierunek jego benchmarków dotyczących kodowania i agentów jest spójny, a słabość końcowa jest znana z góry. Czas do pierwszego tokena wynoszący 42 sekundy to cena, jaką płacisz za zweryfikowaną jakość.

• Ruch mieszany — to przypadek dla routingu, a nie wyboru. W OrcaRouter oba modele znajdują się za jednym kluczem w cenie pass-through z listy dostawców — więc ¥3/¥6 DeepSeek pozostaje ¥3/¥6 na fakturze, a Grok 4.6 pozostaje $2/$6, z zerową marżą na obu. Reguła routingu może wysyłać długokontekstowe, kosztochłonne zadania do DeepSeek V4 Pro, a zweryfikowaną pracę agentową do Grok 4.6, dzielić ruch według żądań, dopóki własna ocena nie ustali podziału, i polegać na automatycznym failover, jeśli zachowanie któregokolwiek dostawcy w pierwszym tygodniu zaprzeczy liczbom z premiery. W przypadku pary modeli mających jeden dzień, stojących po przeciwnych stronach wojny cenowej, możliwość porównania obu na własnym obciążeniu — i zmiany podziału bez zmiany kodu — nie jest wygodą. To jedyny możliwy do obrony sposób na wdrożenie któregokolwiek z nich.
Porównane w tym artykule2
Wykryto na podstawie tego artykułu · Benchmarki: Artificial Analysis · aktualizowane codziennie
