DeepSeek V4 Recension: De billigaste seriösa 1M-tokenmodellerna inom AI?

DeepSeek V4 Recension: De billigaste seriösa 1M-tokenmodellerna inom AI?

Författare

Elias Hawthorne

Publiceringsdatum

Senaste modellerna · 20Visa alla modeller
Benchmarks: Artificial Analysis · uppdateras dagligen
Tillbaka till alla inlägg

DeepSeek släppte V4-familjen den 24 april 2026 — två modeller, V4-Pro och V4-Flash, live på API:et och öppen källkod från dag ett — och satte tyst en ny lägstanivå för vad seriös AI-kapacitet kostar. Båda modellerna har ett 1M-tokens kontextfönster som standard, båda erbjuder tanke- och icke-tankelägen, och flaggskeppet V4-Pro toppar på 0,87 dollar per miljon utmatade tokens: ett pris som underskrider varje jämförbar 1M-kontextmodell på marknaden, öppen eller stängd.

Och juli är beslutsmånad. I ett meddelande daterat den 29 juni bekräftade DeepSeek att den officiella versionen av V4 kommer i mitten av juli 2026, med löften om funktions- och prestandaförbättringar — och införandet av prissättning under högtrafik som fördubblar avgifterna under Pekings öppettider. Tio dagar därefter, den 24 juli, pensioneras de äldre modellnamnen `deepseek-chat` och `deepseek-reasoner` för gott. Denna recension täcker vad V4 faktiskt är, vad det kostar idag och efter den officiella releasen, var det vinner, var det uppenbarligen inte gör det, och vad man ska göra före deadline.

Snabb bedömning

Överväg DeepSeek V4 om du…

- Kör högvolymproduktionsarbetsbelastningar där enhetskostnaden avgör vad som är lönsamt — V4:s prissättning är i en klass för sig

- Behöver lång kontext billigt: 1M tokens standard, upp till 384K utdatatokens per svar, med aggressiva rabatter på context-caching.

- Vill du ha direkt integration — API:et stödjer både OpenAI ChatCompletions och Anthropic-format, så befintliga verktyg fungerar mestadels direkt

- Värdera öppna vikter och självhostningsalternativ, särskilt den mindre V4-Flash

Avvakta (eller dirigera någon annanstans) om du…

- Kör långsiktiga autonoma agenter — på Z.ai's publicerade korsmodell-tabell, ligger V4-Pro långt efter både GLM-5.2 och den stängda frontlinjen på maratonliknande riktmärken

- Behöver bildinmatning: V4 är endast text

- Lita på fast prissättning dygnet runt — från den officiella lanseringen i mitten av juli 2026 fördubblas priserna under rusningstid under Pekings affärstider (lågtrafik behåller dagens priser)

Vad är DeepSeek V4?

V4 är DeepSeeks fjärde generations modellfamilj, levererad som två Mixture-of-Experts-modeller. DeepSeek-V4-Pro är flaggskeppet: 1,6 biljoner totala parametrar med 49 miljarder aktiva per token. DeepSeek-V4-Flash är effektivitetsnivån: 284 miljarder totala, 13 miljarder aktiva. Båda kör ett 1M-token kontextfönster som standard över DeepSeeks officiella tjänster, och båda exponerar dubbla lägen — tänkande för svåra problem, icke-tänkande för hastighet — under modell-ID:na deepseek-v4-pro och `deepseek-v4-flash`.

Två placeringsdetaljer är viktiga. För det första lanserades V4 som en förhandsvisning som DeepSeek behandlar som produktionsanvändbar — och enligt företagets meddelande den 29 juni, den officiella versionen landar i mitten av juli 2026 med "funktionsoptimeringar och prestandaförbättringar." För det andra lanserades den med öppen källkod, vilket fortsätter DeepSeeks mönster att publicera vikter offentligt — vilket håller självhostning och finjustering på bordet, realistiskt sett för 284B Flash mer än 1.6T Pro.

Vad är nytt i DeepSeek V4?

En 1M-token kontext som standard, inte en uppförsäljning. Varje officiell DeepSeek-tjänst kör nu det fulla miljon-tokenfönstret som standard — ingen separat långkontext SKU, ingen premiumavgift.

Enormt utrymme för utdata.Båda modellerna stöder upp till 384K utdatatokens per svar — tre gånger så mycket som de flesta konkurrenter med 1M-kontext tillåter — vilket är viktigt för kodgenerering av hela filer, långa strukturerade extraheringar och rapportskrivning.

Dubbla lägen på en slutpunkt.Tankeläge för svåra problem, icke-tänkande för billiga snabba anrop, växlingsbart per begäran istället för per modell.

Två nivåer med en API-form.Pro för kapacitet, Flash för volym — samma kontext, samma lägen, samma integration.

Dubbel API-kompatibilitet. V4 talar både OpenAI ChatCompletions och Anthropic API-format inbyggt, så de flesta befintliga agentverktyg ansluts utan omskrivning.

Priser: vad det faktiskt kostar

Det här är avsnittet som gör V4 känd. V4-Pro kostar $0.435 per miljon inmatningstokens och $0.87 per miljon utmatning. V4-Flash kostar $0.14 och $0.28.Cache-träffar på upprepad kontext anges till långt under en cent per miljon tokens — i praktiken gratis för agentloopar som läser om samma projektstatus.

För skalan: GLM-5.2, som själv hyllats som sommarens värdeklipp, listar $1.40 / $4.40. Claude Sonnet 5 listar $3 / $15, Claude Opus 4.8 $5 / $25. V4-Pro:s utpris är en femtedel av GLM-5.2:s och ungefär 3% av Opus 4.8:s. Även om V4-Pro förlorar några direkta kvalitetsmatchingar — och det gör den — ändrar ekonomin vilka frågor som överhuvudtaget är värda att ställa till en modell.

En förändring kommer med den officiella releasen. Enligt DeepSeeks meddelande från 29 juni fördubblas alla tokenpriser från mitten av juli under toppfönster – 09:00–12:00 och 14:00–18:00 Pekingtid – medan lågtrafiktimmar behåller dagens priser. Även fördubblat understiger V4-Pros topputmatningspris (cirka 1,74 USD per miljon) fortfarande GLM-5.2s standardpris, men den fasta prisperioden slutar med förhandsversionen: om din trafik toppar under kinesiska kontorstider, modellera svängningen – eller schemalägg och dirigera runt den.

Recensionsbetyg

Poängen nedan är vår redaktionella bedömning baserad på DeepSeeks officiella dokumentation och Z.ais publicerade tvärmodell-benchmarktabell – behandla tvärleverantörssiffrorna som tredjepartskontext snarare än DeepSeeks egna påståenden.

- Kodning: 8/10 — duglig för vardagligt ingenjörsarbete; inte ledare för öppna vikter

- Agentisk / verktygsanvändning: 7/10 — stabil verktygsorkestrering, svag när det gäller maratonslång autonomi

- Resonemang: 8/10 — starka matematik- och naturvetenskapsresultat för prisklassen

- Kostnadseffektivitet: 10/10 — inget jämförbart kommer i närheten

- Sammanhang och långa dokument: 9/10 — 1M in, 384K ut, nästan gratis cacheträffar

- Hastighet: 8/10 — smalt antal aktiva parametrar, plus ett icke-tänkande läge för snabba sökvägar

Övergripande: ~8,3/10 — pris-prestandakungen i mitten av 2026, med en asterisk för lång sikt.

Fördelar

- Prissättning som återställer kurvan: $0,14–$0,87 per miljon tokens över familjen.

- 1M kontext standard med 384K utdata — det största utdatataket i sin klass

- Tänkande och icke-tänkande lägen på en slutpunkt, växlingsbar per begäran

- OpenAI- och Anthropic API-kompatibilitet innebär nästan noll migrationsfriktion.

- Open source-vikter håller egen hosting och finjustering på bordet.

Nackdelar

Långsiktigt agentarbete är den tydliga svagheten — på Z.ais publicerade tabell får V4-Pro 29.0 på FrontierSWE där GLM-5.2 får 74.4 och Claude Opus 4.8 75.1

- Endast text: ingen bildinmatning i V4 API:t

Prissättning för högtrafik anländer med den officiella lanseringen i mitten av juli — priserna fördubblas under Beijing-affärstider, så budgetar slutar vara platta.

- Fortfarande en förhandsvisning till mitten av juli, så beteendet kan ändras med den officiella versionen.

- Pensioneringen av deepseek-chat och deepseek-reasoner den 24 juli 2026 tvingar äldre användare att migrera enligt DeepSeeks schema.

Att självhosta 1.6T-parameter Pro är opraktiskt för nästan alla (Flash, med 284B, är det realistiska målet)

Hur DeepSeek V4 jämförs

V4-Pro mot V4-Flash. Samma kontext, samma lägen, samma API — skillnaden är kvalitet kontra genomströmning med en 3x prisskillnad. Ett förnuftigt standardval: Flash för sammanfattningar, extrahering, klassificering och chatt; Pro för kod, analys och allt som en människa granskar.

mot GLM-5.2.Den öppna viktklasskampen i sommar, och det är genuint jämnt när det gäller värde. GLM-5.2 är den starkare kodaren – på Z.ais publicerade tabell leder den V4-Pro med 81.0 mot 64.0 på Terminal-Bench 2.1 och dominerar långsiktigt arbete (74.4 mot 29.0 på FrontierSWE) – medan V4 svarar med priser 3–5x lägre och trippelt så högt outputtak. Volympipelines lutar åt V4; kodningsagenter lutar åt GLM-5.2.

mot den stängda gränsen.Claude Opus 4.8 och GPT-5.5 förblir klart starkare modeller över svåra riktmärken. Men med en 30–60x output-prisskillnad jämfört med Opus 4.8, försöker V4 inte vinna den kampen — den försöker göra 90% av din trafik för billig för att motivera att skicka någon annanstans.

Deadline 24 juli: migrera bort från äldre namn

Om din integration fortfarande anropar `deepseek-chat` eller `deepseek-reasoner`, slutar dessa namn fungera efter 24 juli 2026, 15:59 UTC. De dirigeras för närvarande till V4-Flash, vilket innebär att din trafik redan körs på V4-ekonomi — men efter avstängningen misslyckas förfrågningar helt. Migreringen i sig är en rad (`model: "deepseek-v4-pro"` eller `"deepseek-v4-flash"`), så det verkliga arbetet är att återtesta prompts mot V4-beteende och besluta, endpoint för endpoint, vilken nivå varje arbetsbelastning förtjänar — eller att sätta en router framför så att nästa avveckling blir en konfigurationsändring istället för en kodändring.

Vem bör använda DeepSeek V4?

Högvolymprodukter — support, sammanfattning, extraktion, klassificering — där V4-prissättning gör marginella funktioner lönsamma

Långdokument- och RAG-tunga arbetsbelastningar som fyller 1M-tokenfönster dagligen och drar nytta av nästan gratis cacheträffar

Team som genererar långa utdata: kodbaser, rapporter, strukturerad data — 384K utdata är klassens tak

Kostnadsmedvetna byggare som vill ha en kapabel standard och är nöjda med att eskalera de hårda 10% på annat håll

Vem bör leta någon annanstans?

Team vars kärnarbetsbelastning är långvariga autonoma agenter — GLM-5.2 eller en stängd flaggskeppsmodell är den säkrare vägen

Synberoende arbetsflöden (V4 tar inga bilder)

Den som behöver en avtalsmässig 'stable' etikett idag istället för en förhandsvisning

Är DeepSeek V4 värt det?

För priset, absolut ja — som en körfält, inte en religion. V4 slår inte den bästa open-weight-kodaren (GLM-5.2) eller frontlinjens flaggskepp i kvalitet, och dess långsiktiga agentnummer är verkligen svaga. Vad den gör är att göra enorma delar av vardagligt AI-arbete — sammanfattningarna, extraktionerna, utkasten och chattvändningarna som dominerar verkliga tokenräkningar — nästan gratis. Det vinnande mönstret är V4 som volymgolv, med eskalationsfält ovanför det.

Slutgiltigt avgörande

DeepSeek V4 är den pris-prestanda-referens som alla andra modeller nu mäts mot — vårt betyg: ~8,3/10. Kör Flash där volym styr, Pro där kvalitet spelar roll men budgetar är verkliga, och dirigera toppklassarbetet till en starkare modell. Gör om din kostnadsberäkning när topppriser infaller i mitten av juli — billigt förblir billigt, men det slutar vara platt. Och om du fortfarande använder deepseek-chat eller deepseek-reasoner: du har till den 24 juli. Byt.

Använder DeepSeek V4 via OrcaRouter

En trefilstrategi – V4 för volym, en starkare öppen eller stängd modell för svåra uppgifter, en reserv för tillförlitlighet – är precis den uppsättning som är smärtsam att köra manuellt och trivial bakom en gateway. OrcaRouter serverar DeepSeek V4 tillsammans med GLM-5.2, Claude, GPT, Gemini och 200+ andra modeller via en OpenAI-kompatibel slutpunkt, till leverantörens listpriser utan tokenpåslag: smart routning väljer fil per förfrågan, automatisk failover hanterar förhandsversionens hackigheter, och per-modell observerbarhet visar vad varje fil faktiskt kostar per slutförd uppgift. Det neutraliserar också leverantörssidiga ändringar som namnbyte den 24 juli eller prissättning under högtrafik i mitten av juli – när ett modellnamn dör eller ett prisfönster öppnas, uppdaterar du en routningsregel, inte din kodbas.

FAQ

Är DeepSeek V4 tillgänglig nu?

Ja — V4-Pro och V4-Flash har varit tillgängliga på DeepSeek API sedan 24 april 2026, under modell-ID:n deepseek-v4-pro och deepseek-v4-flash, med öppen källkod för vikterna. Officiellt är det en förhandsvisning; DeepSeeks meddelande från 29 juni anger den officiella versionen till mitten av juli 2026.

Vad är DeepSeeks prissättning under rusningstid?

Meddelat för den officiella lanseringen: från mitten av juli 2026 fördubblas alla tokenpriser under Beijing-affärstider (09:00-12:00 och 14:00-18:00 Beijing-tid), medan lågtrafiken behåller nuvarande priser. Trafik som når sin topp utanför kinesiska arbetstider – de flesta västerländska arbetsbelastningar – undgår till stor del tilläggsavgiften.

Vad händer med deepseek-chat och deepseek-reasoner?

De dirigeras för närvarande automatiskt till V4-Flash, men efter den 24 juli 2026 (15:59 UTC) är båda namnen helt pensionerade och förfrågningar kommer att misslyckas. Uppdatera modellparametern explicit före deadline.

Ska jag använda V4-Pro eller V4-Flash?

Flash för volymarbete som en människa aldrig granskar rad för rad — sammanfattningar, extrahering, klassificering, chatt. Pro för kod, analys och utkast, till ungefär 3 gånger Flashs pris men fortfarande långt under varje jämförbar modell.

Är DeepSeek V4 bättre än GLM-5.2?

Billigare, inte bättre. I Z.ais publicerade tabell leder GLM-5.2 tydligt inom kodning och dominerar långsiktigt agentarbete; V4 svarar med 3–5 gånger lägre priser, ett utdatatak på 384K och nästan gratis cache-träffar. Många team kör båda: V4 för volym, GLM-5.2 för kodningsagenter.

Kan DeepSeek V4 hantera bilder?

Nej — V4 API är endast text. Dirigera synuppgifter (skärmdumpar, PDF-filer som pixlar, diagram) till en multimodal modell som Claude eller Gemini istället.

Kan jag självhosta DeepSeek V4?

Vikterna är öppen källkod, men var realistisk med skalan: V4-Pro är en 1,6T-parameter MoE — datacenter-territorium — medan 284B V4-Flash är det praktiska självhostningsmålet för team med goda resurser.

Fungerar V4 med mina befintliga OpenAI- eller Claude-verktyg?

För det mesta ja — API:et stöder naturligtvis både OpenAI ChatCompletions och Anthropic-format, så agentramverk och SDK:er byggda för något av dem ansluter vanligtvis med en ändring av bas-URL och modellnamn.

Kan jag använda DeepSeek V4 via OrcaRouter?

Ja — DeepSeek-modeller finns tillgängliga på OrcaRouter till leverantörens listpriser utan påslag, tillsammans med GLM, Claude, GPT och Gemini, så att du kan köra volym-plus-escalation-spliten bakom en endpoint.

Redo att göra din tokenräkning tråkig? Skapa ditt OrcaRouter-konto, rikta din OpenAI-kompatibla klient mot en slutpunkt och dirigera volymen till DeepSeek V4 medan starkare modeller hanterar toppen — med noll tokenpåslag och en integration som är säker mot den 24 juli.


Jämförda i den här artikeln3

Identifierat från den här artikeln · Benchmarks: Artificial Analysis · uppdateras dagligen