DeepSeek V4 Flash 0731 est la version officielle du modèle V4 Flash à mélange d'experts efficace de DeepSeek, issue d'un post-entraînement entièrement refait à partir de zéro — 284B de paramètres au total / 13B actifs, identique en architecture et en taille à la version V4 Flash d'avril. Il fournit une fenêtre de contexte de 1M de jetons avec jusqu'à 384K jetons de sortie, prend en charge les modes avec et sans réflexion (réflexion activée par défaut), ainsi que la sortie JSON et les appels d'outils, et parle nativement l'API Responses avec une adaptation ciblée pour les agents de codage de style Codex. La révision 0731 marque un bond majeur en capacités agentiques, surpassant même DeepSeek V4 Pro Preview sur les benchmarks agentiques publiés par DeepSeek — 82,7 sur Terminal Bench 2.1 ; 76,7 sur Cybergym ; 70,3 sur Toolathlon Verified ; 54,4 sur DeepSWE et 54,2 sur NL2Repo. Sur l'API officielle de DeepSeek, cette révision est désormais celle que sert l'identifiant de modèle deepseek-v4-flash ; l'identifiant daté pointe vers la même révision pour les appelants qui le référencent par date. C'est un choix solide pour les agents de codage, les charges de travail de type terminal et d'utilisation d'outils, ainsi que pour les pipelines agentiques à haut volume, pour un coût de niveau flash.
DeepSeek V4 Flash 0731 est un modèle linguistique exclusivement textuel du fournisseur deepseek, disponible via OrcaRouter sous l'identifiant de modèle deepseek/deepseek-v4-flash-0731. Ses…
L'entrée est limitée au texte. La fenêtre de contexte est de 1 048 576 jetons, et la sortie maximale est de 384 000 jetons par réponse. C'est un espace de travail vaste : vous pouvez lire environ un million de jetons de contenu avant de générer, et vous pouvez demander jusqu'à 384 000 jetons de sortie en un seul appel. La fiche du modèle présente ces deux limites comme distinctes ; elle ne précise pas de limite combinée pour une requête qui utilise les deux limites proches du maximum. En pratique, pour rester dans les limites, comptez vos jetons avant l'envoi et définissez max_tokens sous le plafond de sortie. La contrainte de texte uniquement signifie également que vous devez convertir les PDF, les feuilles de calcul et autres documents en texte brut au préalable. La tokenisation n'est pas spécifiée dans les faits disponibles, alors testez du contenu représentatif pour voir la taille de vos prompts. Si votre requête dépasse 1 048 576 jetons d'entrée, l'appel API échouera ; il en va de même pour les sorties de plus de 384 000 jetons.
Compte tenu des spécifications énumérées, le modèle est particulièrement adapté aux tâches qui combinent de longues entrées textuelles, de longues sorties textuelles et un raisonnement agentique orienté terminal. Le score de 82,7 sur Terminal Bench 2.1 témoigne d'une solide maîtrise de l'exécution de tâches en ligne de commande, où le modèle lit la sortie du shell et décide de la commande suivante. Le contexte de 1 048 576 jetons prend en charge l'analyse de dépôts entiers, la revue de code multi-fichiers, de longs documents juridiques ou techniques et de vastes historiques de conversation. La sortie de 384 000 jetons permet de générer de longs documents structurés, des jeux de données synthétiques ou des analyses étape par étape en une seule passe. La tarification par jeton de 0,15 $ en entrée et de 0,29 $ en sortie par million de jetons rend le traitement textuel à grand volume financièrement prévisible. Le modèle est moins approprié lorsque vous avez besoin de compréhension d'images, de transcription audio ou d'une très faible latence, aucune de ces capacités n'étant couverte par les informations fournies. Si votre tâche correspond au profil texte uniquement, grand contexte, grande sortie, ce modèle est un candidat raisonnable à évaluer via OrcaRouter.
Le modèle ne peut pas accepter d'entrées non textuelles ; il n'y a pas de modalité vision, audio ou vidéo dans sa fiche catalogue. Il ne présente également aucune garantie publiée de latence ou de streaming dans les faits disponibles. Vous devriez choisir un modèle moins cher lorsque votre charge de travail n'a pas besoin du grand contexte ou des limites de sortie. Par exemple, un court échange de chatbot utilisant quelques milliers de jetons serait toujours facturé au même tarif par jeton, mais pourrait être mieux servi par un modèle avec un contexte plus petit et un prix inférieur par million de jetons. Les faits disponibles ne listent pas les prix des alternatives, comparez donc les tarifs par million de jetons dans le catalogue OrcaRouter. Si votre tâche est une classification simple ou un résumé de courts passages, un modèle moins cher peut suffire. Si votre tâche nécessite le contexte complet de 1M ou une sortie de 384K, ou bénéficie de la force de Terminal Bench 2.1 dans le travail en ligne de commande, alors le prix de ce modèle est la base d'évaluation pertinente.
Chaque entrée doit être du texte. Les PDF, images, feuilles de calcul et fichiers audio doivent être convertis en texte brut ou transcrits avant d'être envoyés. Il s'agit d'une étape de prétraitement nécessaire, mais elle simplifie également le format de requête : des champs de contenu standard de style OpenAI contenant des chaînes de caractères suffisent. Le contexte de 1 048 576 jetons signifie que vous pouvez transmettre de longs corps de texte converti en une seule requête ; la sortie de 384 000 jetons signifie que vous pouvez recevoir des textes très longs en retour. Le nombre de jetons est la principale préoccupation opérationnelle, puisque la facture totale dépend des jetons d'entrée et de sortie. OrcaRouter rapporte l'utilisation dans la réponse compatible OpenAI, vous permettant de surveiller les deux chiffres. Si vous travaillez avec des langues ou du code qui se tokenisent de manière inefficace, votre contexte effectif se réduira, car les nombres de jetons, et non les caractères, constituent la limite contraignante. Aucun détail de tokenisation n'est fourni, alors effectuez un test rapide avec votre propre contenu pour connaître les longueurs typiques de jetons.
Terminal Bench 2.1 évalue la capacité d'un modèle à travailler dans un environnement terminal : comprendre la sortie des commandes, naviguer dans les répertoires, exécuter des commandes et accomplir des tâches réalistes d'administration système ou d'ingénierie logicielle via un shell. Le score principal de DeepSeek V4 Flash 0731 est de 82,7, sur une échelle où un score plus élevé est meilleur. Il s'agit du seul résultat de benchmark fourni dans les faits disponibles. Ce score est un signal utile si vous prévoyez de créer des boucles d'agents qui émettent des commandes shell, car le benchmark est conçu pour tester exactement ce type de capacité. Il ne mesure pas les connaissances générales, l'écriture créative, les mathématiques ou les compétences multilingues. Aucune ligne de base comparative ni aucun autre chiffre de benchmark n'est fourni, donc le 82,7 doit être interprété dans son contexte : une preuve solide pour les tâches liées au terminal, et aucune preuve dans un sens ou dans l'autre pour les autres domaines. Les scores de benchmark dépendent de la distribution exacte des tâches, donc vos propres tâches terminal peuvent obtenir des scores différents ; validez avec votre propre évaluation avant une utilisation en production.
Les faits disponibles pour DeepSeek V4 Flash 0731 ne comportent pas de tokens par seconde, de temps jusqu'au premier token, de latence p95 ni de débit. Le nom Flash évoque une variante plus légère, mais les faits fournis ne quantifient pas la vitesse. Ce que les faits incluent en revanche, c'est une large fenêtre de contexte de 1 048 576 tokens et un plafond de sortie élevé de 384 000 tokens. Des entrées et sorties plus longues consomment intrinsèquement plus de calcul, donc la latence sur les requêtes à contexte complet sera probablement plus élevée que sur les invites courtes, même pour un modèle rapide. Le prix de $0.15/$0.29 par million de tokens décrit le coût, pas la vitesse. Pour prendre une décision éclairée, exécutez votre propre test de charge contre l'API d'OrcaRouter avec des invites représentatives de la taille que vous prévoyez d'utiliser, et comparez le temps jusqu'au premier token et la durée totale avec d'autres modèles du catalogue. N'extrapolez pas la latence à partir du score de référence, qui ne mesure pas le temps de réponse.
Les principales limitations ressortent des faits listés. Ce modèle est limité au texte, donc toute entrée multimodale est hors de portée. Les preuves issues de benchmarks se réduisent à un score, 82,7 sur Terminal Bench 2.1, qui couvre l’exécution de tâches en terminal, et non le raisonnement général ou les connaissances. Aucune métrique de latence, de disponibilité ou de taux d’erreur n’est publiée, donc les performances sous charge sont inconnues. Les limites de contexte et de sortie sont grandes mais finies : 1 048 576 jetons d’entrée et 384 000 jetons de sortie par requête. Les requêtes qui les dépassent échoueront. Aucune remise documentée pour la mise en cache des préfixes n’est mentionnée dans les faits fournis, donc les préfixes répétés sont facturés comme des jetons d’entrée ordinaires. Le prix est bas par jeton, mais les coûts absolus augmentent linéairement avec la taille du contexte. Si votre application nécessite de la vision, une faible latence ou un très haut débit, ce modèle n’est peut-être pas le bon choix ; vérifiez ces exigences séparément avant de vous engager.
Les coûts sont calculés par jeton, avec un taux pour l'entrée et un pour la sortie. Les jetons d'entrée coûtent $0.15 pour 1,000,000 de jetons ; les jetons de sortie coûtent $0.29 pour 1,000,000 de jetons. OrcaRouter facture ces montants au tarif du fournisseur sans aucune marge, ce qui signifie qu'aucun pourcentage de plateforme supplémentaire n'est ajouté au tarif de deepseek. Le coût d'une seule requête est approximativement le nombre de jetons d'entrée multiplié par $0.15, divisé par 1,000,000, plus le nombre de jetons de sortie multiplié par $0.29, divisé par 1,000,000. Par exemple, une entrée complète de 1,048,576 jetons coûte environ $0.1573, et une sortie de longueur maximale de 384,000 jetons coûte environ $0.1114, si les deux limites étaient utilisées dans des transactions séparées. Les faits disponibles ne mentionnent pas de tarif réduit pour l'entrée en cache ; supposez donc que chaque jeton d'entrée est facturé au tarif standard. Comme la tarification est linéaire, l'estimation du coût par lot est simple dès que vous connaissez la taille moyenne de vos invites et la longueur de sortie.
Le principal compromis se situe entre la taille du contexte et le prix. À 0,15 $ par 1M de jetons d'entrée, une invite utilisant le contexte complet de 1 048 576 jetons coûte environ 0,157 $ rien qu'en frais d'entrée. Si votre tâche ne nécessite que quelques milliers de jetons de contexte, vous payez pour une capacité inutilisée, dans le sens où un modèle à plus petit contexte avec un tarif par jeton inférieur pourrait être moins cher, selon ses taux. Le taux de 0,29 $ par 1M de jetons de sortie signifie que les sorties longues ne sont pas particulièrement coûteuses individuellement, mais qu'une charge de travail générant des gigaoctets de texte accumulera des coûts. Aucune remise sur les lots, aucune réservation ni remise pour mise en cache n'est répertoriée dans les faits fournis. La facturation sans marge d'OrcaRouter signifie que le prix que vous voyez est le prix du fournisseur ; votre facture finale est simplement fonction des jetons envoyés et reçus. Pour les travaux par lots à grande échelle, estimez le nombre total de jetons d'entrée et de sortie, multipliez par les deux taux, puis comparez avec les alternatives du catalogue.
OrcaRouter facture explicitement DeepSeek V4 Flash 0731 au tarif du fournisseur, sans aucune majoration. Les 0,15 $ pour 1M de jetons d'entrée et 0,29 $ pour 1M de jetons de sortie sont les tarifs du fournisseur, et non une version majorée. Les informations fournies ne décrivent pas la mise en cache des prompts pour ce modèle. Aucun niveau de tarification pour les entrées en cache n'est répertorié, et rien n'indique qu'OrcaRouter met automatiquement les prompts en cache pour vous. Si le fournisseur sous-jacent propose une mise en cache, ces conditions ne font pas partie des informations fournies pour cette entrée de catalogue. Vous devriez donc consulter la documentation actuelle d'OrcaRouter avant de supposer une remise. La réponse de l'API, comme elle suit le format Chat Completions d'OpenAI, inclut des informations d'utilisation qui vous permettent de vérifier les jetons d'entrée et de sortie facturés. À des fins d'audit, consignez l'objet usage de chaque réponse et comparez-le avec vos comptages de jetons attendus. Tout contrôle des coûts doit provenir de vos propres choix de prompts et de paramètres.
Envoyez des requêtes de complétion de chat standard à l'API compatible OpenAI d'OrcaRouter. L'URL de base est https://api.orcarouter.ai/v1 et l'ID du modèle est deepseek/deepseek-v4-flash-0731. Définissez le champ modèle sur cette chaîne exacte et placez votre clé API OrcaRouter dans l'en-tête Authorization en tant que jeton porteur. Construisez un tableau de messages avec du contenu texte ; le modèle n'acceptera pas de contenu image ou audio. La réponse est formatée comme une complétion de chat OpenAI et inclut le message généré et un objet d'utilisation. Comme l'ID du modèle inclut un préfixe de fournisseur, conservez-le exactement tel qu'il est indiqué. Les faits disponibles ne nécessitent aucun en-tête non standard ni paramètres de transport spéciaux. Vous pouvez utiliser les SDK OpenAI, curl ou tout client HTTP qui parle JSON. Commencez par une petite requête, vérifiez que l'utilisation renvoyée correspond aux nombres de jetons d'entrée et de sortie attendus, puis augmentez l'échelle.
Comme le point de terminaison est compatible OpenAI, les paramètres typiques de complétion de chat sont disponibles : model, messages, temperature, top_p, max_tokens ou max_completion_tokens, stop, stream, ainsi que les options similaires prises en charge par le SDK que vous utilisez. Les faits disponibles ne précisent pas quels paramètres OrcaRouter honore pour ce modèle spécifique ; vous devez donc tester tout ce qui va au-delà de model et messages. Les limites cruciales sont celles du modèle lui-même : 1 048 576 tokens d'entrée et 384 000 tokens de sortie. Maintenez max_tokens sous le plafond de sortie pour éviter les requêtes échouées. Concernant l'appel d'outils ou de fonctions, les faits n'en indiquent pas la prise en charge ; testez une définition d'outil minimale avant de construire un agent. Pour le contrôle du format de sortie, aucune mention n'est faite du mode JSON ni de garanties de sortie structurée ; validez vous-même le texte généré si vous avez besoin d'une structure fiable. Le streaming est généralement pris en charge sur les points de terminaison compatibles OpenAI, mais les faits ne le confirment pas pour ce modèle ; consultez donc la référence API d'OrcaRouter.
La migration relève surtout de la configuration : remplacez l'URL de base par https://api.orcarouter.ai/v1, utilisez votre clé OrcaRouter comme clé API et remplacez le nom du modèle par deepseek/deepseek-v4-flash-0731. Le code qui construit déjà les messages, gère les réponses de chat completion et lit les données d'utilisation continuera de fonctionner tant qu'il suit la convention OpenAI. Deux différences méritent votre attention. Premièrement, ce modèle est exclusivement textuel : supprimez donc tout champ image_url ou audio de vos requêtes. Deuxièmement, les plafonds de contexte et de sortie sont très élevés ; ajustez votre paramètre max_tokens pour respecter le plafond de sortie de 384 000 jetons et préparez-vous à des réponses parfois longues. Si votre code inclut des nouvelles tentatives en cas d'erreurs 429 ou 5xx, conservez-les ; ces faits ne changent pas les attentes en matière de gestion des erreurs. Effectuez un test de fumée avec une petite requête, confirmez que la facturation affiche 0,15 $/0,29 $ par million de jetons, puis basculez progressivement le trafic.
L'URL de base de l'API d'OrcaRouter est https://api.orcarouter.ai/v1. Toutes les requêtes adressées à ce point de terminaison doivent utiliser HTTPS. L'authentification se fait par une clé API, envoyée sous forme de jeton porteur standard dans l'en-tête Authorization. Les faits disponibles ne mentionnent pas de méthodes d'authentification alternatives. L'identifiant du modèle est deepseek/deepseek-v4-flash-0731, qui comprend le nom du fournisseur et le suffixe d'instantané 0731 ; transmettez-le exactement tel qu'il est écrit. Dans la plupart des SDK compatibles OpenAI, vous configurez un client avec base_url et api_key, puis définissez le nom du modèle à chaque appel. La réponse inclura les compteurs de jetons liés à la facturation dans l'objet usage. Les faits n'indiquent pas de limites de débit, de comportement de nouvelle tentative ni de recommandations de délai d'attente ; consultez donc la documentation d'OrcaRouter pour ces détails opérationnels. Stockez votre clé API en toute sécurité ; la clé détermine l'accès à chaque compte de modèle de votre projet OrcaRouter. Si vous utilisez un proxy ou une passerelle, pointez-le vers l'URL de base d'OrcaRouter et conservez l'identifiant complet du modèle.
Les faits fournis ne couvrent que cet instantané spécifique, il n'est donc pas possible de faire une comparaison numérique ligne par ligne avec d'autres entrées DeepSeek à partir de ce qui est donné. Ce que nous savons de DeepSeek V4 Flash 0731, c'est son contexte de 1 048 576 jetons, sa limite de sortie de 384 000 jetons, une entrée texte uniquement, un prix de 0,15 $/0,29 $ par million de jetons, et un score de 82,7 au Terminal Bench 2.1. Les autres modèles DeepSeek du catalogue d'OrcaRouter peuvent différer sur l'un ou l'autre de ces axes. Lors de la décision, comparez les spécifications qui comptent : combien de jetons vos invites utilisent réellement, combien de jetons vos sorties nécessitent, si vous avez besoin d'une entrée multimodale, et le prix par million de jetons du candidat. Le label Flash implique une variante plus légère par rapport aux autres versions de DeepSeek, mais le seul indicateur de performance objectif dans les faits est le score Terminal Bench. Utilisez les pages de catalogue d'OrcaRouter pour les spécifications côte à côte et les prix actuels avant de sélectionner.
Avec 1 048 576 jetons de contexte, ce modèle se situe dans la catégorie des contextes longs. Un modèle à contexte plus petit pourrait plafonner à quelques centaines de milliers de jetons ou moins, vous obligeant à diviser des documents, à intégrer des segments ou à utiliser la récupération. L'avantage de ce modèle est que vous pouvez placer un corpus très volumineux dans une seule invite et laisser le modèle traiter l'ensemble en une seule passe. L'inconvénient est le coût par requête : chaque jeton d'entrée est facturé, donc un contexte énorme multiplie les dépenses d'entrée. Les faits ne listent aucun modèle avec une fenêtre de contexte encore plus grande, donc les seules déclarations sûres concernent les limites de ce modèle. Lors du choix, estimez la taille réelle de vos invites. Si vos tâches utilisent généralement moins de 100K jetons, le contexte complet peut être sans importance et un modèle moins cher et plus petit pourrait être préférable. Si vous dépassez régulièrement les limites de contexte courantes, la fenêtre de 1M jetons de ce modèle est la caractéristique décisive.
Choisissez DeepSeek V4 Flash 0731 lorsque la tâche est exclusivement textuelle et que vous pouvez exploiter ses spécifications. Le contexte de 1 048 576 jetons justifie sa sélection lorsque vous devez lire un dépôt entier, un ensemble de documents ou une transcription longue en une seule passe. La limite de sortie de 384 000 jetons justifie sa sélection lorsque vous avez besoin de réponses générées très longues sans allers-retours multiples. Le score de 82,7 au Terminal Bench 2.1 justifie sa sélection pour l’automatisation de terminal et les flux de travail CLI agentiques. Le prix de 0,15 $/0,29 $ par million de jetons justifie sa sélection pour le traitement textuel par lots à volume élevé où le coût par jeton domine. Ne le choisissez pas lorsque vous avez besoin d’images ou d’audio, lorsque vos besoins en contexte sont minimes et qu’un modèle moins cher existe, ou lorsque vous ne pouvez pas accepter des caractéristiques de latence inconnues. Les faits disponibles ne donnent aucune garantie de latence. Les équipes sensibles aux performances doivent donc effectuer des tests de référence avec de vraies requêtes au préalable. Dans tous les cas, confirmez l’identifiant du modèle et la facturation sur OrcaRouter avant de passer à l’échelle.
Compatible OpenAI — gardez votre SDK actuel
https://api.orcarouter.ai/v1https://api.orcarouter.aiimport os
from openai import OpenAI
client = OpenAI(
base_url="https://api.orcarouter.ai/v1",
api_key=os.environ["ORCAROUTER_API_KEY"],
)
response = client.chat.completions.create(
model="deepseek/deepseek-v4-flash-0731",
messages=[{"role": "user", "content": "Hello"}],
)
print(response.choices[0].message.content)frequency_penaltyinclude_reasoninglogit_biaslogprobsmax_tokensmin_ppresence_penaltyreasoningreasoning_effortrepetition_penaltyresponse_formatseedstopstructured_outputstemperaturetool_choicetoolstop_ktop_logprobstop_p| Entrée / 1M tokens | $0.147 |
| Sortie / 1M tokens | $0.295 |
| Lecture cache / 1M | $0.020 |
| Devise | USD |
Estimation basée sur le tarif public
Estimation seulement — le nombre réel de tokens dépend du tokeniseur du fournisseur.
Ce dont parlent les développeurs cette semaine
GET /api/public/models/deepseek/deepseek-v4-flash-0731Ouvrir @misc{orcarouter_deepseek_v4_flash_0731,
title = {DeepSeek V4 Flash 0731 API},
author = {DeepSeek},
year = {2026},
howpublished = {OrcaRouter},
url = {https://www.orcarouter.ai/models/deepseek/deepseek-v4-flash-0731}
}DeepSeek. (2026). DeepSeek V4 Flash 0731 API. OrcaRouter. https://www.orcarouter.ai/models/deepseek/deepseek-v4-flash-0731