DeepSeek V4 Flash 0731 är den officiella utgåvan med omgjord efterträning av DeepSeeks effektiva V4 Flash mixture-of-experts-modell — 284B totalt / 13B aktiva parametrar, identisk i arkitektur och storlek med aprilutgåvan av V4 Flash, där efterträningen har gjorts om från grunden. Den betjänar ett 1M-token kontextfönster med upp till 384K utdatatokens, stöder både tänkande- och icke-tänkande lägen (tänkande aktiverat som standard) plus JSON-utdata och verktygsanrop, och har inbyggt stöd för Responses API med en riktad anpassning för kodningsagenter i Codex-stil. 0731-revisionen är ett stort steg framåt i agentkapacitet och överträffar till och med DeepSeek V4 Pro Preview på DeepSeeks publicerade agentbenchmark — 82,7 på Terminal Bench 2.1, 76,7 på Cybergym, 70,3 på Toolathlon Verified, 54,4 på DeepSWE och 54,2 på NL2Repo. På DeepSeeks förstaparts-API är denna revision vad modell-id:t deepseek-v4-flash nu betjänar; den daterade identifieraren listar samma revision för anropare som refererar till den med datum. Den är ett starkt val för kodningsagenter, terminal- och verktygsanvändningsarbetsbelastningar samt agentiska pipelines med hög volym, till flash-tier-kostnad.
DeepSeek V4 Flash 0731 är en textbaserad språkmodell från leverantören deepseek, tillgänglig via OrcaRouter med modell-ID:t deepseek/deepseek-v4-flash-0731. Huvudspecifikationerna är ett…
Indata är begränsad till text. Kontextfönstret är 1,048,576 tokens, och den maximala utdatan är 384,000 tokens per svar. Det är en stor arbetsyta: du kan läsa omkring en miljon tokens innehåll innan du genererar, och du kan begära upp till 384,000 tokens utdata i ett enda anrop. Modellkortet listar dessa som två separata tak; det anger ingen kombinerad gräns för en begäran som använder båda nära max. I praktiken, för att hålla dig inom gränserna, räkna dina tokens innan du skickar och ställ in max_tokens under utdatataket. Textbegränsningen innebär också att du måste konvertera PDF-filer, kalkylblad och andra dokument till ren text först. Tokenisering är inte specificerad i de tillgängliga uppgifterna, så testa representativt innehåll för att se hur stora dina prompts blir. Om din begäran överstiger 1,048,576 indatatokens kommer API-anropet att misslyckas; detsamma gäller för utdata över 384,000 tokens.
Med de angivna specifikationerna är modellen bäst lämpad för uppgifter som kombinerar långa textinmatningar, långa textutdata och terminalorienterat agentiskt resonerande. Terminal Bench 2.1-poängen på 82,7 är ett bevis på styrka i slutförande av kommandoradsuppgifter, där en modell läser shell-utdata och bestämmer nästa kommando. Kontexten på 1 048 576 token stöder analys av hela repositories, granskning av kod i flera filer, långa juridiska eller tekniska dokument och omfattande chattloggar. Utdata på 384 000 token stödjer generering av långa strukturerade dokument, syntetiska dataset eller steg-för-steg-analyser i en enda körning. Prissättningen per token på $0.15 för inmatning och $0.29 för utdata per miljon token gör högvolymtextbehandling ekonomiskt förutsägbar. Modellen är mindre lämplig när du behöver bildförståelse, ljudtranskribering eller mycket låg latens, varav inget täcks av de angivna fakta. Om din uppgift passar profilen med enbart text, stor kontext och stora utdata, är detta en rimlig kandidat att utvärdera via OrcaRouter.
Modellen kan inte ta emot annat än textinmatning; det finns ingen vision-, ljud- eller videomodalitet i dess katalogbidrag. Den har inte heller några publicerade svarstids- eller strömningsgarantier i de tillgängliga fakta. Du bör välja en billigare modell när din arbetsbelastning inte kräver den stora kontexten eller utdatagränserna. Ett kort chattbotutbyte som använder några tusen tokens skulle till exempel fortfarande debiteras med samma per-token-pris, men kan betjänas bättre av en modell med mindre kontext och lägre pris per miljon tokens. De tillgängliga fakta listar inte priser för alternativ, så jämför per-1M-token-priser i OrcaRouter-katalogen. Om din uppgift är enkel klassificering eller sammanfattning av korta avsnitt kan en billigare modell vara tillräcklig. Om din uppgift kräver hela 1M-kontexten eller 384K-utdata, eller drar nytta av Terminal Bench 2.1:s styrka i kommandoradsarbete, är denna modells pris den relevanta grunden för utvärdering.
Varje inmatning måste vara text. PDF-filer, bilder, kalkylblad och ljudfiler måste konverteras till ren text eller transkriberas innan de kan skickas. Det är ett nödvändigt förbehandlingssteg, men det förenklar också förfrågningsformatet: standardinnehållsfält i OpenAI-stil som innehåller strängar är allt du behöver. Kontexten på 1,048,576 tokens innebär att du kan skicka långa textmassor i en enda förfrågan; utdata på 384,000 tokens innebär att du kan få tillbaka mycket lång text. Tokenantalet är den viktigaste operativa faktorn, eftersom den totala kostnaden beror på in- och utdatatokens. OrcaRouter rapporterar användningen i det OpenAI-kompatibla svaret, så att du kan övervaka båda siffrorna. Om du arbetar med språk eller kod som tokeniseras ineffektivt krymper din effektiva kontext, eftersom det är tokenantalet, inte teckenantalet, som utgör begränsningen. Inga tokeniseringsdetaljer tillhandahålls, så kör ett snabbt test med ditt eget innehåll för att lära dig typiska tokenlängder.
Terminal Bench 2.1 utvärderar en modells förmåga att arbeta i en terminalmiljö: förstå kommandoutdata, navigera i kataloger, utföra kommandon och slutföra realistiska systemadministrations- eller programvaruutvecklingsuppgifter via ett shell. Toppresultatet för DeepSeek V4 Flash 0731 är 82.7, på en skala där högre är bättre. Detta är det enda benchmarkresultatet som tillhandahålls i de tillgängliga fakta. Poängen är en användbar signal om du planerar att bygga agentloopar som utfärdar shell-kommandon, eftersom benchmarken är utformad för att testa just den typen av förmåga. Det är inte ett mått på allmänkunskap, kreativt skrivande, matematik eller flerspråkig kompetens. Inga jämförelsebaslinjer eller andra benchmarksiffror tillhandahålls, så 82.7 bör tolkas i sitt sammanhang: starkt stöd för terminalrelaterade uppgifter och inget stöd åt något håll för andra domäner. Benchmarkpoäng beror på den exakta uppgiftsfördelningen, så dina egna terminaluppgifter kan ge andra poäng; validera med din egen utvärdering innan produktionsanvändning.
De tillgängliga fakta för DeepSeek V4 Flash 0731 inkluderar inte tokens per sekund, tid till första token, p95-latens eller genomströmning. Namnet Flash antyder en lättare variant, men de tillhandahållna fakta kvantifierar inte hastigheten. Det som fakta däremot inkluderar är ett stort kontextfönster på 1,048,576 tokens och en stor utgångsgräns på 384,000 tokens. Längre indata och utdata förbrukar i sig själva mer beräkningskraft, så latensen för fullkontext-förfrågningar kommer sannolikt att vara högre än för korta uppmaningar, även för en snabb modell. Prissättningen på $0.15/$0.29 per miljon tokens beskriver kostnad, inte hastighet. För att fatta ett välinformerat beslut bör du köra ditt eget belastningstest mot OrcaRouters API med representativa uppmaningar av den storlek du avser att använda, och jämföra tid-till-första-token och total varaktighet mot andra modeller i katalogen. Extrapolera inte latens från benchmarkpoängen, som inte mäter svarstid.
De huvudsakliga begränsningarna framgår av de listade fakta. Modellen är textbaserad, så all multimodal indata ligger utanför dess räckvidd. Benchmark-bevisen är begränsade till ett enda resultat, 82,7 på Terminal Bench 2.1, som mäter terminalbaserad uppgiftslösning, inte allmänt resonemang eller kunskap. Inga latens-, tillgänglighets- eller felfrekvensmått har publicerats, så prestanda under belastning är okänd. Kontext- och utdatagränserna är stora men ändliga: 1 048 576 token i indata och 384 000 token i utdata per begäran. Förfrågningar som överskrider dessa kommer inte att lyckas. Det finns ingen dokumenterad prompt-cache-rabatt i de angivna fakta, så upprepade prefix faktureras som vanliga indatatoken. Priset är lågt per token, men de absoluta kostnaderna växer linjärt med kontextstorleken. Om din applikation behöver bildigenkänning, låg latens eller mycket hög genomströmning kanske den här modellen inte är rätt val; verifiera dessa krav separat innan du förbinder dig.
Kostnader beräknas per token, med en taxa för inmatning och en för utmatning. Inmatningstokens kostar $0.15 per 1 000 000 tokens; utmatningstokens kostar $0.29 per 1 000 000 tokens. OrcaRouter fakturerar dessa till leverantörens taxa utan påslag, vilket innebär att ingen extra plattformsprocent läggs ovanpå deepseeks taxa. Kostnaden för en enskild begäran är ungefär inmatningstokens gånger $0.15 dividerat med 1 000 000, plus utmatningstokens gånger $0.29 dividerat med 1 000 000. Till exempel kostar en full inmatning på 1 048 576 tokens cirka $0.1573, och en utmatning på maximala 384 000 tokens kostar cirka $0.1114, om båda gränserna används i separata transaktioner. De tillgängliga uppgifterna nämner inte rabatterad prissättning för cachad inmatning, så anta att varje inmatningstoken faktureras enligt standardtaxan. Eftersom prissättningen är linjär är kostnadsuppskattning för batchar enkel när du väl känner till din genomsnittliga promptstorlek och utmatningslängd.
Den huvudsakliga avvägningen är mellan kontextstorlek och pris. Vid $0.15 per 1M inmatningstokens kostar en prompt som använder hela kontexten på 1,048,576 tokens ungefär $0.157 i enbart inmatningsavgifter. Om din uppgift bara behöver några tusen tokens kontext, betalar du för outnyttjad kapacitet i den meningen att en modell med mindre kontext och lägre pris per token kan vara billigare, beroende på dess priser. Priset på $0.29 per 1M utdata innebär att långa utdata inte är särskilt dyra var för sig, men en arbetsbelastning som genererar gigabyte med text kommer att ackumulera kostnader. Det finns ingen volymrabatt, reservation eller cache-rabatt listad i de angivna fakta. Den nollpåslagsfaktureringen från OrcaRouter innebär att priset du ser är leverantörens pris; din slutliga faktura är helt enkelt en funktion av skickade och mottagna tokens. För storskaliga batchjobb, uppskatta totala in- och utdata-tokens, multiplicera med de två priserna och jämför med alternativ i katalogen.
OrcaRouter debiterar uttryckligen DeepSeek V4 Flash 0731 enligt leverantörens pris med noll påslag. Priserna på 0,15 USD per 1M inmatningstokens och 0,29 USD per 1M utmatningstokens är leverantörens priser, inte en version med påslag. De angivna fakta beskriver inte prompt-cachning för denna modell. Ingen prismodell för cachad inmatning anges, och det finns inget uttalande om att OrcaRouter automatiskt cachar dina prompts åt dig. Om den underliggande leverantören erbjuder cachning ingår inte dessa villkor i det som angavs för denna katalogpost, så du bör kontrollera OrcaRouters aktuella dokumentation innan du antar att du får en rabatt. API-svaret, eftersom det följer OpenAIs chattkompletteringsformat, innehåller användningsinformation som låter dig verifiera debiterade inmatnings- och utmatningstokens. För revisionsändamål, logga användningsobjektet från varje svar och jämför det med dina förväntade tokenantal. All kostnadskontroll måste komma från dina egna val av prompts och parametrar.
Skicka standardförfrågningar för chattkomplettering till OrcaRouters OpenAI-kompatibla API. Bas-URL:en är https://api.orcarouter.ai/v1 och modell-ID:t är deepseek/deepseek-v4-flash-0731. Sätt modellfältet till exakt den strängen och placera din OrcaRouter-API-nyckel i Authorization-rubriken som en bearer-token. Bygg en messages-array med textinnehåll; modellen accepterar inte bild- eller ljudinnehåll. Svaret är formaterat som en OpenAI-chattkomplettering och innehåller det genererade meddelandet samt ett usage-objekt. Eftersom modell-ID:t innehåller ett leverantörsprefix, behåll det exakt som visas. De tillgängliga fakta kräver inga icke-standardiserade rubriker eller speciella transportinställningar. Du kan använda OpenAI-SDK:erna, curl eller valfri HTTP-klient som pratar JSON. Börja med en liten förfrågan, verifiera att det returnerade usage matchar de förväntade antalen in- och utdatatokens, och skala sedan upp.
Eftersom slutpunkten är OpenAI-kompatibel är de typiska chattkompletteringsparametrarna tillgängliga: model, messages, temperature, top_p, max_tokens eller max_completion_tokens, stop, stream och liknande alternativ som stöds av SDK:n du använder. De tillgängliga fakta anger inte vilka parametrar OrcaRouter respekterar för denna specifika modell, så du bör testa allt utöver model och messages. De avgörande gränserna är modellens egna: 1 048 576 inmatningstokens och 384 000 utdatatokens. Håll max_tokens under utdatataket för att undvika misslyckade förfrågningar. För verktygs- eller funktionsanrop anger fakta inget stöd; testa en minimal verktygsdefinition innan du bygger en agent. För kontroll av utdataformat finns inget omnämnande av JSON-läge eller garanterad strukturerad utdata; validera den genererade texten själv om du behöver tillförlitlig struktur. Strömning stöds vanligtvis på OpenAI-kompatibla slutpunkter, men fakta bekräftar inte det för denna modell, så konsultera OrcaRouters API-referens.
Migration är till största delen konfiguration: ändra bas-URL:en till https://api.orcarouter.ai/v1, byt API-nyckeln till din OrcaRouter-nyckel och ersätt modellnamnet med deepseek/deepseek-v4-flash-0731. Kod som redan bygger meddelanden, hanterar chat completion-svar och läser användningsdata kommer att fortsätta fungera så länge den följer OpenAI-konventionen. Två skillnader kräver uppmärksamhet. För det första är den här modellen endast textbaserad, så ta bort eventuella image_url- eller ljudfält från dina förfrågningar. För det andra är kontext- och utdatataken mycket stora; justera din max_tokens-inställning för att respektera utdatataket på 384,000 token och var beredd på att svaren ibland kan vara långa. Om din kod inkluderar återförsök vid 429- eller 5xx-fel, behåll dem; fakta ändrar inte förväntningarna på felhantering. Kör ett röktest mot en liten prompt, bekräfta att faktureringen visas på $0.15/$0.29 per miljon token och flytta sedan trafiken gradvis.
Bas-URL:en för OrcaRouter:s API är https://api.orcarouter.ai/v1. Alla förfrågningar till denna slutpunkt ska använda HTTPS. Autentisering sker med en API-nyckel som skickas som en standard bearer-token i Authorization-headern. De tillgängliga fakta listar inga alternativa autentiseringsmetoder. Modell-ID:t är deepseek/deepseek-v4-flash-0731, som inkluderar leverantörsnamnet och suffixet 0731-snapshot; skicka det exakt som det står. I de flesta OpenAI-kompatibla SDK:er konfigurerar du en klient med base_url och api_key, och anger sedan modellnamnet vid varje anrop. Svaret kommer att inkludera debiteringsrelevanta tokenantal i usage-objektet. Fakta anger inga rate limits, återförsöksbeteende eller timeout-vägledning, så kontrollera OrcaRouter:s dokumentation för dessa operativa detaljer. Förvara din API-nyckel på ett säkert sätt; nyckeln avgör åtkomst till varje modellkonto i ditt OrcaRouter-projekt. Om du använder en proxy eller gateway, peka den mot OrcaRouter:s bas-URL och bevara hela modell-ID:t.
De angivna fakta täcker endast denna specifika ögonblicksbild, så en rad-för-rad numerisk jämförelse med andra DeepSeek-poster är inte möjlig utifrån vad som ges. Det vi vet om DeepSeek V4 Flash 0731 är dess 1 048 576-tokens kontext, 384 000-tokens utdatatak, text-endast-inmatning, $0,15/$0,29 per 1 miljon tokens i prissättning, och 82,7 i Terminal Bench 2.1-poäng. Andra DeepSeek-modeller i OrcaRouters katalog kan skilja sig på vilken av dessa axlar som helst. När du beslutar dig, jämför de specifikationer som spelar roll: hur många tokens dina uppmaningar faktiskt använder, hur många tokens dina utdata kräver, om du behöver multimodal inmatning, och priset per 1 miljon tokens för kandidaten. Flash-etiketten antyder en mer avskalad variant i förhållande till andra DeepSeek-utgåvor, men den enda objektiva prestandaindikatorn i fakta är Terminal Bench-poängen. Använd OrcaRouters kataloglistningssidor för sida-vid-sida-specifikationer och aktuell prissättning innan du väljer.
Vid 1 048 576 tokens kontext ligger denna modell i långkontext-nivån. En modell med mindre kontext kan nå taket vid några hundra tusen eller färre tokens, vilket tvingar dig att dela upp dokument, bädda in block eller använda hämtning. Fördelen med denna modell är att du kan placera en mycket stor korpus i en enda prompt och låta modellen bearbeta allt i ett enda pass. Nackdelen är kostnaden per begäran: varje inmatningstoken debiteras, så en enorm kontext multiplicerar inmatningskostnaden. Fakta listar inte någon modell med ett ännu större kontextfönster, så de enda säkra uttalandena handlar om modellens egna begränsningar. När du väljer, uppskatta dina faktiska promptstorlekar. Om dina uppgifter typiskt använder mindre än 100 000 tokens kan hela kontexten vara irrelevant och en billigare, mindre modell kan vara att föredra. Om du regelbundet överskrider vanliga kontextgränser är denna modells 1M-tokenfönster den avgörande funktionen.
Välj DeepSeek V4 Flash 0731 när uppgiften är textbaserad och du kan utnyttja dess specifikationer. Kontexten på 1 048 576 token motiverar valet när du behöver läsa ett helt arkiv, en dokumentuppsättning eller en lång transkription i en enda genomgång. Utmatningsgränsen på 384 000 token motiverar valet när du behöver mycket långa genererade svar utan flera turer. Poängen 82,7 på Terminal Bench 2.1 motiverar valet för terminalautomation och agentiska CLI-arbetsflöden. Priset på $0,15/$0,29 per 1M token motiverar valet för storskalig batch-textbearbetning där kostnaden per token dominerar. Välj inte den när du behöver bilder eller ljud, när dina kontextbehov är små och en billigare modell finns, eller när du inte kan acceptera okända latensegenskaper. De tillgängliga fakta ger inga latensgarantier, så prestandakänsliga team bör benchmarka med riktiga uppmaningar först. Bekräfta i alla fall modell-ID och fakturering på OrcaRouter innan du skalar.
OpenAI-kompatibel — behåll det SDK du redan använder
https://api.orcarouter.ai/v1https://api.orcarouter.aiimport os
from openai import OpenAI
client = OpenAI(
base_url="https://api.orcarouter.ai/v1",
api_key=os.environ["ORCAROUTER_API_KEY"],
)
response = client.chat.completions.create(
model="deepseek/deepseek-v4-flash-0731",
messages=[{"role": "user", "content": "Hello"}],
)
print(response.choices[0].message.content)frequency_penaltyinclude_reasoninglogit_biaslogprobsmax_tokensmin_ppresence_penaltyreasoningreasoning_effortrepetition_penaltyresponse_formatseedstopstructured_outputstemperaturetool_choicetoolstop_ktop_logprobstop_p| Inmatning / 1M token | $0.147 |
| Utdata / 1M tokens | $0.295 |
| Cacheläsning / 1M | $0.020 |
| Valuta | USD |
Uppskattning baserad på listpris
Endast en uppskattning — faktiskt antal token beror på leverantörens tokenizer.
Vad utvecklare säger den här veckan
GET /api/public/models/deepseek/deepseek-v4-flash-0731Öppna @misc{orcarouter_deepseek_v4_flash_0731,
title = {DeepSeek V4 Flash 0731 API},
author = {DeepSeek},
year = {2026},
howpublished = {OrcaRouter},
url = {https://www.orcarouter.ai/models/deepseek/deepseek-v4-flash-0731}
}DeepSeek. (2026). DeepSeek V4 Flash 0731 API. OrcaRouter. https://www.orcarouter.ai/models/deepseek/deepseek-v4-flash-0731