Hero-rubrikkort för jämförelsen 'Grok 4.6 vs DeepSeek V4 Pro', med underrubriken 'Ett frontlinjepriskrig, utkämpat med 24 timmars mellanrum,' med ett märke 'Jämförelse · Augusti 2026'.
Guides & Insights

Grok 4.6 vs DeepSeek V4 Pro: Ett priskrig vid frontlinjen, utkämpat med 24 timmars mellanrum

Författare

Rowan Sterling

Publiceringsdatum

Senaste modellerna · 20Visa alla modeller
Benchmarks: Artificial Analysis · uppdateras dagligen
Tillbaka till alla inlägg

Två frontier-modeller släpptes inom 24 timmar från varandra, och gapet mellan deras prislistor är det bredaste den här generationen har producerat. Grok 4.6 lanserades den 12 augusti 2026 till 2 dollar per miljon inmatningstokens och 6 dollar per miljon utmatning. DeepSeek V4 Pro — den formella produktionsutgåvan av DeepSeeks flaggskepp, version DeepSeek-V4-Pro-0813 — följde den 13 augusti 2026 till 3 yen per miljon cache-miss-inmatningstokens och 6 yen per miljon utmatning, vilket är ungefär 0,42 dollar och 0,85 dollar. Samma kategori, samma agentiska ambitioner, en storleksordning ifrån varandra i pris. Detta är inte en jämförelse av två specifikationer; det är en jämförelse av två strategier för vad en agentformad modell borde kosta, och båda släpptes den här veckan.

Den här texten ställer de två prislistorna bredvid varandra, granskar varje leverantörs benchmark-påståenden med leverantörens etikett på, och räknar ut vad skillnaden faktiskt kostar på en verklig arbetsbelastning — eftersom modellerna på papperet ligger närmare varandra i kapacitet än i filosofi, och prisskillnaden per uppgift är där beslutet ligger.

Tajmingen är poängen.

Att båda modellerna hamnade i samma 48-timmarsfönster är ingen kalendertillfällighet. Grok 4.6 är SpaceXAI:s agentiska ombyggnad av sin 1.5T-grundmodell — en efterträningsuppdatering med stor tyngd på förstärkningsinlärning inom kodning, kernelarbete och CAD, prissatt som bränslet för de Cursor- och Grok Bot-produkter som företaget äger. DeepSeek V4 Pro är formaliseringen av en förhandsversion som tyst omdefinierade vad "agentiskt" innebar till en bråkdel av priset, nu förbättrad för agentekonomin: DeepSeeks versionsinformation för 0813-bygget inleds med avsevärt förbättrade agentförmågor, lägger till stöd för Responses API och Codex-integration, och behåller både tankeläge (standard) och icke-tankeläge, JSON-utdata, verktygsanrop och Anthropic API-formatet. Två mycket olika företag drog samtidigt slutsatsen att marknaden som räknas i slutet av 2026 är agenter — och prissatte sina satsningar för mycket olika plånböcker.

De två prislistorna, sida vid sida

Grok 4.6 — $2.00 / $6.00 / $0.50 (cachad inmatning) per miljon tokens, 500K kontext, ett steg på $4 / $12 / $1 över cirka 200K inmatningstokens, och en snabbare variant till dubbla baspriset.

DeepSeek V4 Pro — ¥3,00 (≈0,42 USD) för cache-miss-indata, ¥0,025 (≈0,0035 USD) för cachad indata, ¥6,00 (≈0,85 USD) för utdata per miljon tokens, med ett kontextfönster på 1 miljon tokens och upp till 384K utdatatokens. Dess billigare syskon, V4 Flash, kostar ¥1 / ¥2.

Till och med mot Grok 4.6 — redan det billigaste frontier-API:t i sin generation — är DeepSeek V4 Pro ungefär fem gånger billigare på cache-miss-input och sju gånger billigare på output, och den ger ett 2x större kontextfönster och en betydligt större max-output till samma prisnivå. De två konkurrerar inte på pris; D​eepSeek har ensidigt satt en ny lägstanivå och Grok är nu premiumalternativet i samma mening. Den inramningen har betydelse, eftersom den tidigare inramningen — "Grok 4.6 är den billiga frontlinjemodellen" — var sann i exakt en dag.

Two-column scoreboard: Grok 4.6 AA Index 61 (independent), $2/$6, 500K context, DeepSWE v1.1 65.9% (vendor), Terminal-Bench 26% (v3.0), cache-hit input $0.50 vs DeepSeek V4 Pro AA Index none yet, ≈$0.42/$0.85, 1M context, DeepSWE 62.7% (vendor), Terminal-Bench 87.9% (v2.1), cache-hit input ≈$0.0035.

Vad DeepSeek V4 Pro faktiskt förbättrade

D​eepSeeks lanseringssiffror är de mest dramatiska eftersom de mäts mot den egna förhandsversionen, och hoppet från förhandsversion till release är enormt. Enligt leverantörens egna utvärderingar:

DeepSWE — 62,7% på release-versionen, upp från 12,8% i förhandsversionen — ett långsiktigt mjukvaruutvecklingsresultat som leverantören placerar mellan Opus 4.8:s 58,0% och Claude Fable 5:s 70,0%.

Cybergym — 83,3 %, upp från 52,7 %, knappt före Fable 5:s 83,1 % och slår Opus 4.8:s 78,3 %.

Terminal Bench 2.1 — 87,9 %, inom en procentenhet från Fable 5:s 88,0 % och före Opus 4.8:s 85,0 %.

AutomationBench (public) — 31,8 %, upp från 12,8 %, före både Fable 5 (29,1 %) och Opus 4.8 (27,2 %).

Toolathlon-Verified, NL2Repo, DSBench-FullStack och DSBench-Hard — 74,1 %, 61,5 %, 71,1 % och 67,2 % respektive, klustrade i eller nära Opus 4.8 / Fable 5-bandet.

Var och en av dessa är DeepSeek-rapporterad på DeepSeeks egen utvärderingssvit. Riktningen är omisskännlig — förhandsversionen var inte redo för produktionsagentloopar, medan releasebygget påstår sig vara det — men den ärliga etiketten är att inget oberoende labb ännu har utvärderat DeepSeek V4 Pro, och modellerna som den benchmarkas mot är inte namngivna av någon extern part.

Vad Grok 4.6 svarar med

Grok 4.6:s motsvarighet är av ett annat slag: den är den enda av de två med en oberoende resultattavla. Artificial Analysis mätte den till 61 på sitt Intelligence Index — i nivå med GPT-5.6 Sol, före Kimi K3 (60) — innan DeepSeek V4 Pro ens hade släppts. Dess leverantörstabell gör anspråk på ledande 65,9 % på DeepSWE v1.1 och 69,9 % på CursorBench v3.2, med en öppet erkänd svag punkt på 26 % på Terminal-Bench v3.0. Dessa siffror är rapporterade av xAI, och ingen av dem har oberoende reproducerats per den 13 augusti.

Versionsskillnaderna spelar roll när du försöker jämföra de två direkt. D​eepSeeks 87,9 är på Terminal Bench 2.1; Groks 26% är på den svårare v3.0 — olika prov, så "D​eepSeek krossar Grok på terminals" är inte en ärlig rad, och det är inte heller "Grok leder på DeepSWE" utan att notera att de två leverantörerna körde olika eval-versioner och att inget av numren är från tredje part. Vad som är jämförbart är den oberoende dimensionen: Grok 4.6 har ett verifierat resultatkort, DeepSeek V4 Pro har inget ännu, och för ett produktionsbeslut är den asymmetrin i sig information.

Screenshot of the Artificial Analysis page for Grok 4.6 (high) scoring 61 — the independent scorecard DeepSeek V4 Pro does not yet have.

Den totala kostnaden för en lång agentkörning.

Ta ett realistiskt agentiskt jobb — att läsa och resonera över 500K tokens av kontext, skriva 100K tokens av utdata, vilket är en medelstor refaktorering eller en lång dokumentpipeline, inom båda modellernas fönster:

Grok 4.6 — 0.5M input för $2 = $1.00, plus 0.1M output för $6 = $0.60. Totalt: $1.60.

DeepSeek V4 Pro — 0,5M cache-miss-indata till ¥3 = ¥1,50, plus 0,1M utdata till ¥6 = ¥0,60. Totalt: ¥2,10, cirka 0,29 USD.

Det är ett gap på 5.5x för samma nominella uppgift, innan någon cachefördel — och D​eepSeeks 1M-fönster plus 384K maxutdata innebär också att jobbet får plats i en enda körning där Grok 4.6:s 500K-fönster kan tvinga fram två. Haken som gör att detta inte är ett svar på en rad är resonemangskostnad och risk: D​eepSeeks tankeläge är på som standard, så varje begäran betalar för ett fullständigt resonemangsspår även när du inte vill ha ett, och leverantörens eget benchmarkförtroende är otestat av någon oberoende. Billigt per token med ständigt aktivt resonemang är fortfarande billigt per uppgift till dessa priser, men "billigt" och "verifierat" är olika påståenden, och bara en av dessa modeller bär det andra.

Vem ska välja vilken

Beslutet är mindre "vilken som är bättre" än "vilken riskprofil som passar arbetsbelastningen":

Högvolym, kostnadsbegränsad och villig att acceptera overifierade siffror — DeepSeek V4 Pro är det självklara valet för prisgolvet. 1M-kontexten och 384K-utdata gör det till den starkare kandidaten för långa kontexter och batchbearbetning, och priset för cachelagrad indata på ¥0.025 gör hämtningsintensiva pipelines nästan gratis. Gör dina egna utvärderingar, för ingen oberoende part har gjort det.

Agentiskt djup med ett oberoende resultatkort, i ett OpenAI-kompatibelt ekosystem — Grok 4.6:s 61 är verifierat, dess kodnings- och agentiska benchmarkriktning är konsekvent, och den terminala svagheten är känd på förhand. Tiden till första token på 42 sekunder är priset du betalar för den verifierade kvaliteten.

Screenshot of the OrcaRouter model page for Grok 4.6, the pass-through endpoint where both models sit behind one key at provider list price.

Blandad trafik — detta är ett fall för routing snarare än för att välja. På OrcaRouter ligger båda modellerna bakom en enda nyckel med pass-through-priser från leverantörslistan — så DeepSeeks ¥3/¥6 förblir ¥3/¥6 på fakturan, och Grok 4.6 förblir $2/$6, med noll påslag på endera. En routingregel kan skicka det långkontextuella, kostnadsbundna arbetet till DeepSeek V4 Pro och det verifierade agentiska arbetet till Grok 4.6, dela trafiken per förfrågan tills din egen utvärdering avgör fördelningen, och förlita dig på automatisk växling om endera leverantörens beteende under den första veckan motsäger lanseringssiffrorna. För ett par en dag gamla modeller i varsin ände av ett priskrig är möjligheten att jämföra båda på din egen arbetsbelastning — och vända på fördelningen utan att ändra kod — inte en bekvämlighet. Det är det enda försvarbara sättet att anta någon av dem.

Jämförda i den här artikeln1

Identifierat från den här artikeln · Benchmarks: Artificial Analysis · uppdateras dagligen

© 2026 OrcaRouter

För leverantörer

Driver du en inferensplattform? Få dina modeller på OrcaRouter.

providers@orcarouter.ai

Gå med i vår community

Discordsupport@orcarouter.aiXGitHubYouTube