DeepSeek V4 Flash 0731 is de opnieuw post-getrainde officiële release van DeepSeek's efficiënte V4 Flash mixture-of-experts-model — 284B totaal / 13B actieve parameters, identiek in architectuur en omvang aan de V4 Flash-release van april, met de post-training volledig opnieuw uitgevoerd. Het bedient een contextvenster van 1M tokens met maximaal 384K output-tokens, ondersteunt zowel denk- als niet-denkmodi (denken standaard ingeschakeld), plus JSON-output en tool calls, en ondersteunt native de Responses API met een gerichte aanpassing voor Codex-achtige codeeragenten. De 0731-revisie is een grote vooruitgang in agentmogelijkheden en scoort zelfs hoger dan DeepSeek V4 Pro Preview op de door DeepSeek gepubliceerde agent-benchmarks — 82.7 op Terminal Bench 2.1, 76.7 op Cybergym, 70.3 op Toolathlon Verified, 54.4 op DeepSWE en 54.2 op NL2Repo. Op de first-party API van DeepSeek bedient deze revisie nu het model-id deepseek-v4-flash; de gedateerde identifier vermeldt dezelfde revisie voor aanroepers die het op datum refereren. Het is een sterke keuze voor codeeragenten, terminal- en toolgebruik-workloads, en agentische pipelines met hoge volumes tegen flash-tier-kosten.
DeepSeek V4 Flash 0731 is een tekst-only taalmodel van de provider deepseek, beschikbaar via OrcaRouter onder de model-ID deepseek/deepseek-v4-flash-0731. De belangrijkste specificaties zijn een…
Invoer is beperkt tot tekst. Het contextvenster is 1,048,576 tokens en de maximale uitvoer is 384,000 tokens per reactie. Dat is een grote werkruimte: u kunt ongeveer een miljoen tokens aan inhoud lezen voordat u genereert, en u kunt in één aanroep maximaal 384,000 tokens aan uitvoer aanvragen. De modelkaart vermeldt deze als twee afzonderlijke limieten; er wordt geen gecombineerde limiet vermeld voor een aanvraag die beide bijna-maximumwaarden gebruikt. Om binnen de limieten te blijven, moet u in de praktijk uw tokens tellen vóór het verzenden en max_tokens onder de uitvoerlimiet instellen. De beperking tot alleen tekst betekent ook dat u pdf's, spreadsheets en andere documenten eerst naar platte tekst moet converteren. Tokenisatie wordt niet gespecificeerd in de beschikbare feiten, dus test representatieve inhoud om te zien hoe groot uw prompts worden. Als uw aanvraag meer dan 1,048,576 invoertokens bevat, mislukt de API-aanroep; hetzelfde geldt voor uitvoer boven 384,000 tokens.
Gezien de vermelde specificaties is het model het meest geschikt voor taken die lange tekstinvoer, lange tekstuitvoer en terminalgerichte agentische redenering combineren. De 82.7 Terminal Bench 2.1-score is een bewijs van sterkte in het voltooien van commandoregel-taken, waarbij een model shell-uitvoer leest en de volgende opdracht bepaalt. De context van 1.048.576 tokens ondersteunt analyse van de volledige repository, codebeoordeling van meerdere bestanden, lange juridische of technische documenten en uitgebreide chatgeschiedenissen. De uitvoer van 384.000 tokens ondersteunt het genereren van lange gestructureerde documenten, synthetische datasets of stapsgewijze analyses in één enkele doorgang. De prijs per token van $0,15 invoer en $0,29 uitvoer per miljoen tokens maakt hoogvolume tekstverwerking financieel voorspelbaar. Het model is minder geschikt wanneer u beeldherkenning, audiotranscriptie of zeer lage latentie nodig heeft, waarvan geen enkele wordt gedekt door de verstrekte feiten. Als uw taak past bij het tekst-only, grote-context, grote-uitvoer profiel, is dit een redelijke kandidaat om via OrcaRouter te evalueren.
Het model kan geen niet-tekstuele invoer accepteren; er is geen visuele, audio- of videomodaliteit in zijn catalogusvermelding. Het heeft ook geen gepubliceerde latentie- of streaminggaranties in de beschikbare feiten. Je zou een goedkoper model moeten kiezen wanneer je workload niet de grote context of uitvoerlimieten nodig heeft. Een korte chatbotuitwisseling die een paar duizend tokens gebruikt, zou bijvoorbeeld nog steeds tegen hetzelfde per-token tarief worden gefactureerd, maar zou beter bediend kunnen worden door een model met een kleinere context en een lagere prijs per miljoen tokens. De beschikbare feiten vermelden geen prijzen voor alternatieven, dus vergelijk tarieven per 1M-token in de OrcaRouter-catalogus. Als je taak eenvoudige classificatie of samenvatting van korte passages is, kan een goedkoper model voldoende zijn. Als je taak de volledige 1M-context of 384K-uitvoer nodig heeft, of profiteert van de Terminal Bench 2.1-sterkte in opdrachtregelwerk, dan is de prijs van dit model de relevante basis voor evaluatie.
Elke invoer moet tekst zijn. PDF's, afbeeldingen, spreadsheets en audiobestanden moeten vóór verzending worden omgezet naar platte tekst of worden getranscribeerd. Dat is een noodzakelijke voorverwerkingsstap, maar het vereenvoudigt ook het aanvraagformaat: standaard OpenAI-stijl inhoudsvelden met tekenreeksen zijn alles wat je nodig hebt. De context van 1.048.576 tokens betekent dat je lange stukken geconverteerde tekst in één aanvraag kunt versturen; de uitvoer van 384.000 tokens betekent dat je zeer lange tekst terug kunt ontvangen. Het aantal tokens is de belangrijkste operationele zorg, aangezien de totale rekening afhangt van invoer- en uitvoertokens. OrcaRouter rapporteert verbruik in de OpenAI-compatibele reactie, zodat je beide getallen kunt monitoren. Als je werkt met talen of code die inefficiënt tokeniseren, zal je effectieve context kleiner worden omdat het aantal tokens, niet het aantal tekens, de begrenzende limiet is. Er worden geen tokenizer-details verstrekt, dus voer een snelle test uit met je eigen inhoud om de typische tokenlengtes te leren kennen.
Terminal Bench 2.1 evalueert het vermogen van een model om in een terminalomgeving te werken: command-output begrijpen, door mappen navigeren, commando's uitvoeren en realistische systeembeheer- of software-engineeringtaken voltooien via een shell. De hoofdscore voor DeepSeek V4 Flash 0731 is 82,7, op een schaal waarbij hoger beter is. Dit is het enige benchmarkresultaat dat in de beschikbare feiten wordt vermeld. De score is een nuttig signaal als u van plan bent agentloops te bouwen die shell-commando's uitvoeren, aangezien de benchmark precies dat soort capaciteit test. Het is geen maatstaf voor algemene kennis, creatief schrijven, wiskunde of meertalige competentie. Er worden geen vergelijkingsbaselines of andere benchmarkcijfers verstrekt, dus de 82,7 moet in context worden geïnterpreteerd: sterk bewijs voor terminalgerelateerde taken en geen bewijs in welke richting dan ook voor andere domeinen. Benchmarkscores hangen af van de exacte taakverdeling, dus uw eigen terminaltaken kunnen anders scoren; valideer met uw eigen evaluatie voordat u het in productie gebruikt.
De beschikbare feiten voor DeepSeek V4 Flash 0731 bevatten geen tokens per seconde, tijd tot eerste token, p95-latentie of doorvoer. De naam Flash duidt op een lichtere variant, maar de aangeleverde feiten kwantificeren geen snelheid. Wat de feiten wel bevatten is een groot contextvenster van 1.048.576 tokens en een grote uitvoerlimiet van 384.000 tokens. Langere invoer en uitvoer verbruiken inherent meer rekenkracht, dus de latentie bij verzoeken met volledige context zal waarschijnlijk hoger liggen dan bij korte prompts, zelfs voor een snel model. De prijs van $0,15/$0,29 per miljoen tokens beschrijft kosten, niet snelheid. Om een weloverwogen beslissing te nemen, voer je eigen belastingstest uit tegen de API van OrcaRouter met representatieve prompts van de omvang die je van plan bent te gebruiken, en vergelijk de tijd tot eerste token en de totale duur met andere modellen in de catalogus. Extrapoleer latentie niet van de benchmarkscore, die geen responstijd meet.
De belangrijkste beperkingen zijn zichtbaar in de genoemde feiten. Het is alleen-tekst, dus elke multimodale invoer valt buiten de scope. Het benchmarkbewijs is beperkt tot één score, 82,7 op Terminal Bench 2.1, die terminalgebaseerde taakuitvoering bestrijkt, niet algemeen redeneren of kennis. Er worden geen latentie-, beschikbaarheids- of foutpercentagemetingen gepubliceerd, dus de prestaties onder belasting zijn onbekend. De context- en outputlimieten zijn groot maar eindig: 1.048.576 tokens invoer en 384.000 tokens uitvoer per aanvraag. Aanvragen die deze overschrijden, zullen niet slagen. Er is geen gedocumenteerde korting op prompt-caching in de verstrekte feiten, dus herhaalde prefixes worden als gewone invoertokens gefactureerd. De prijs is laag per token, maar de absolute kosten stijgen lineair met de contextgrootte. Als uw applicatie vision, lage latentie of een zeer hoge doorvoer nodig heeft, is dit model mogelijk niet de juiste keuze; controleer die vereisten afzonderlijk voordat u zich vastlegt.
Kosten worden berekend per token, met één tarief voor invoer en één voor uitvoer. Invoertokens kosten $0,15 per 1.000.000 tokens; uitvoertokens kosten $0,29 per 1.000.000 tokens. OrcaRouter factureert deze tegen het provider-tarief zonder opslag, wat betekent dat er geen extra platformpercentage bovenop het tarief van deepseek wordt toegevoegd. De kosten van een enkele aanvraag zijn ongeveer invoertokens maal $0,15 gedeeld door 1.000.000, plus uitvoertokens maal $0,29 gedeeld door 1.000.000. Een volledige invoer van 1.048.576 tokens kost bijvoorbeeld ongeveer $0,1573, en een uitvoer met maximale lengte van 384.000 tokens kost ongeveer $0,1114, als beide limieten in afzonderlijke transacties zouden worden gebruikt. De beschikbare feiten vermelden geen kortingsprijzen voor gecachte invoer, dus ga ervan uit dat elk invoertoken tegen het standaardtarief wordt gefactureerd. Omdat de prijzen lineair zijn, is het schatten van batchkosten eenvoudig zodra je je gemiddelde promptgrootte en uitvoerlengte kent.
De belangrijkste afweging is tussen contextgrootte en prijs. Bij $0,15 per 1M inputtokens kost een prompt die de volledige context van 1.048.576 tokens gebruikt, alleen al ongeveer $0,157 aan inputkosten. Als uw taak slechts een paar duizend tokens aan context nodig heeft, betaalt u voor ongebruikte capaciteit, in die zin dat een model met een kleinere context en een lagere prijs per token goedkoper zou kunnen zijn, afhankelijk van de tarieven. Het tarief van $0,29 per 1M outputtokens betekent dat lange outputs afzonderlijk niet bijzonder duur zijn, maar een workload die gigabytes aan tekst genereert, zorgt voor oplopende kosten. Er is geen korting voor batchverwerking, reservering of caching vermeld in de verstrekte feiten. De facturering zonder opslag van OrcaRouter betekent dat de prijs die u ziet, de prijs van de provider is; uw uiteindelijke factuur is simpelweg een functie van verzonden en ontvangen tokens. Schat voor grootschalige batchtaken het totale aantal input- en outputtokens, vermenigvuldig dit met de twee tarieven en vergelijk dit met de alternatieven in de catalogus.
OrcaRouter factureert DeepSeek V4 Flash 0731 expliciet tegen het provider-tarief, zonder enige opslag. De $0.15 per 1M invoertokens en $0.29 per 1M uitvoertokens zijn de tarieven van de provider, niet een versie met opslag. De aangeleverde feiten beschrijven geen prompt-caching voor dit model. Er wordt geen prijscategorie voor gecachte invoer vermeld, en er is geen verklaring dat OrcaRouter automatisch prompts namens u cached. Als de onderliggende provider caching aanbiedt, maken die voorwaarden geen deel uit van wat voor deze catalogusvermelding is aangeleverd, dus controleer de huidige documentatie van OrcaRouter voordat u uitgaat van een korting. De API-respons volgt het chat-completions-formaat van OpenAI en bevat gebruiksgegevens waarmee u de gefactureerde invoer- en uitvoertokens kunt verifiëren. Log voor auditdoeleinden het usage-object van elke respons en vergelijk dit met uw verwachte tokentellingen. Eventuele kostenbeheersing moet komen uit uw eigen keuzes voor prompts en parameters.
Stuur standaard chatcompletion-verzoeken naar de OpenAI-compatibele API van OrcaRouter. De basis-URL is https://api.orcarouter.ai/v1 en de model-ID is deepseek/deepseek-v4-flash-0731. Zet het modelveld op die exacte tekenreeks en plaats uw OrcaRouter API-sleutel in de Authorization-header als een bearer-token. Bouw een messages-array met tekstinhoud; het model accepteert geen afbeeldingen of audiocontent. Het antwoord is opgemaakt als een OpenAI-chatcompletion en bevat het gegenereerde bericht en een usage-object. Omdat de model-ID een providerprefix bevat, moet u die precies zo laten zoals weergegeven. De beschikbare feiten vereisen geen niet-standaard headers of speciale transportinstellingen. U kunt de OpenAI-SDK's, curl of elke HTTP-client die JSON spreekt gebruiken. Begin met een klein verzoek, controleer of de geretourneerde usage overeenkomt met de verwachte input- en output-tokenaantallen, en schaal daarna op.
Omdat de endpoint OpenAI-compatibel is, zijn de typische parameters voor chat completion beschikbaar: model, messages, temperature, top_p, max_tokens of max_completion_tokens, stop, stream en vergelijkbare opties die uw SDK ondersteunt. De beschikbare feiten geven niet aan welke parameters OrcaRouter voor dit specifieke model ondersteunt, dus u moet alles behalve model en messages testen. De cruciale limieten zijn die van het model zelf: 1.048.576 invoertokens en 384.000 uitvoertokens. Houd max_tokens onder de uitvoerlimiet om mislukte aanvragen te voorkomen. Voor tool- of function calling vermelden de feiten geen ondersteuning; test een minimale tooldefinitie voordat u een agent bouwt. Voor controle over het uitvoerformaat is er geen vermelding van JSON-modus of garanties voor gestructureerde uitvoer; valideer de gegenereerde tekst zelf als u een betrouwbare structuur nodig hebt. Streaming wordt doorgaans ondersteund op OpenAI-compatibele endpoints, maar de feiten bevestigen dit niet voor dit model; raadpleeg daarom de API-referentie van OrcaRouter.
Migratie is vooral configuratie: wijzig de basis-URL naar https://api.orcarouter.ai/v1, gebruik uw OrcaRouter-sleutel als API-sleutel en vervang de modelnaam door deepseek/deepseek-v4-flash-0731. Code die al berichten opbouwt, chatcompletion-antwoorden verwerkt en verbruiksgegevens leest, blijft werken zolang deze de OpenAI-conventie volgt. Twee verschillen vereisen aandacht. Ten eerste is dit model tekst-only, dus verwijder eventuele image_url- of audio-velden uit uw verzoeken. Ten tweede zijn de context- en uitvoerlimieten zeer groot; pas uw max_tokens-instelling aan om de uitvoerlimiet van 384.000 tokens te respecteren en wees voorbereid op af en toe lange antwoorden. Als uw code retries op 429- of 5xx-fouten bevat, behoud deze dan; de feiten veranderen niets aan de verwachtingen voor foutafhandeling. Voer een smoketest uit met een kleine prompt, bevestig dat de facturering $0,15/$0,29 per miljoen tokens toont, en verschuif het verkeer daarna geleidelijk.
De basis-URL voor de API van OrcaRouter is https://api.orcarouter.ai/v1. Alle verzoeken aan dit endpoint moeten HTTPS gebruiken. Authenticatie gebeurt met een API-sleutel, die als standaard bearer-token in de Authorization-header wordt verzonden. De beschikbare feiten vermelden geen alternatieve authenticatiemethoden. Het model-ID is deepseek/deepseek-v4-flash-0731, inclusief de providernaam en het 0731-snapshot-suffix; geef het exact door zoals het hier staat. In de meeste OpenAI-compatibele SDK's configureer je een client met base_url en api_key, en stel je vervolgens de modelnaam in bij elke aanroep. De respons bevat factureringsrelevante token-aantallen in het usage-object. De feiten vermelden geen rate limits, retry-gedrag of timeouts, dus raadpleeg de documentatie van OrcaRouter voor die operationele details. Bewaar je API-sleutel veilig; de sleutel bepaalt de toegang tot elk modelaccount in je OrcaRouter-project. Als je een proxy of gateway gebruikt, richt deze dan op de basis-URL van OrcaRouter en behoud het volledige model-ID.
De verstrekte feiten hebben alleen betrekking op deze specifieke momentopname, dus een regel-voor-regel numerieke vergelijking met andere DeepSeek-items is op basis van wat gegeven is niet mogelijk. Wat we weten over DeepSeek V4 Flash 0731 is de context van 1.048.576 tokens, de uitvoerlimiet van 384.000 tokens, tekst-only invoer, een prijs van $0,15/$0,29 per 1M tokens en een Terminal Bench 2.1-score van 82,7. Andere DeepSeek-modellen in de catalogus van OrcaRouter kunnen op elk van deze aspecten verschillen. Vergelijk bij het kiezen de specificaties die ertoe doen: hoeveel tokens je prompts daadwerkelijk gebruiken, hoeveel tokens je uitvoer vereist, of je multimodale invoer nodig hebt, en de prijs per 1M tokens van de kandidaat. Het Flash-label impliceert een slankere variant ten opzichte van andere DeepSeek-releases, maar de enige objectieve prestatie-indicator in de feiten is de Terminal Bench-score. Raadpleeg de cataloguspagina's van OrcaRouter voor naast elkaar weergegeven specificaties en actuele prijzen voordat je een keuze maakt.
Met 1.048.576 tokens aan context bevindt dit model zich in de long-context-categorie. Een model met een kleinere context stopt mogelijk bij een paar honderdduizend of minder tokens, waardoor je documenten moet splitsen, chunks moet inbedden of retrieval moet gebruiken. Het voordeel van dit model is dat je een zeer groot corpus in één prompt kunt plaatsen en het model in één doorgang aandacht aan het geheel kunt laten besteden. Het nadeel zijn de kosten per aanvraag: elk invoertoken wordt gefactureerd, dus een enorme context vermenigvuldigt de invoerkosten. De feiten vermelden geen model met een nog groter contextvenster, dus de enige veilige uitspraken gaan over de eigen beperkingen van dit model. Maak bij het kiezen een inschatting van je werkelijke promptgroottes. Als je taken doorgaans minder dan 100K tokens gebruiken, is de volledige context mogelijk niet relevant en is een goedkoper, kleiner model wellicht verkieslijk. Als je regelmatig de gangbare contextlimieten overschrijdt, is het venster van 1M tokens van dit model het doorslaggevende kenmerk.
Kies DeepSeek V4 Flash 0731 wanneer de taak uitsluitend tekst betreft en u de specificaties ervan kunt benutten. De context van 1.048.576 tokens rechtvaardigt de keuze wanneer u een volledige repository, documentset of lang transcript in één keer wilt lezen. De uitvoerlimiet van 384.000 tokens rechtvaardigt de keuze wanneer u zeer lange gegenereerde antwoorden nodig hebt zonder meerdere retourbewegingen. De score van 82,7 op Terminal Bench 2.1 rechtvaardigt de keuze voor terminalautomatisering en agentische CLI-workflows. De prijs van $0,15/$0,29 per 1M tokens rechtvaardigt de keuze voor grootschalige batchtekstverwerking waar de kosten per token domineren. Kies het niet wanneer u afbeeldingen of audio nodig hebt, wanneer uw contextbehoeften klein zijn en er een goedkoper model bestaat, of wanneer u onbekende latentiekenmerken niet kunt accepteren. De beschikbare gegevens bieden geen garanties voor latentie, dus prestatiegevoelige teams moeten eerst met echte prompts benchmarken. Bevestig in elk geval de model-ID en facturering op OrcaRouter voordat u opschaalt.
OpenAI-compatibel — behoud je huidige SDK
https://api.orcarouter.ai/v1https://api.orcarouter.aiimport os
from openai import OpenAI
client = OpenAI(
base_url="https://api.orcarouter.ai/v1",
api_key=os.environ["ORCAROUTER_API_KEY"],
)
response = client.chat.completions.create(
model="deepseek/deepseek-v4-flash-0731",
messages=[{"role": "user", "content": "Hello"}],
)
print(response.choices[0].message.content)frequency_penaltyinclude_reasoninglogit_biaslogprobsmax_tokensmin_ppresence_penaltyreasoningreasoning_effortrepetition_penaltyresponse_formatseedstopstructured_outputstemperaturetool_choicetoolstop_ktop_logprobstop_p| Invoer / 1M tokens | $0.147 |
| Uitvoer / 1M tokens | $0.295 |
| Cache lezen / 1M | $0.020 |
| Valuta | USD |
Schatting op basis van catalogusprijs
Alleen een schatting — het werkelijke aantal tokens hangt af van de tokenizer van de aanbieder.
Waar ontwikkelaars het deze week over hebben
GET /api/public/models/deepseek/deepseek-v4-flash-0731Openen @misc{orcarouter_deepseek_v4_flash_0731,
title = {DeepSeek V4 Flash 0731 API},
author = {DeepSeek},
year = {2026},
howpublished = {OrcaRouter},
url = {https://www.orcarouter.ai/models/deepseek/deepseek-v4-flash-0731}
}DeepSeek. (2026). DeepSeek V4 Flash 0731 API. OrcaRouter. https://www.orcarouter.ai/models/deepseek/deepseek-v4-flash-0731