DeepSeek V4 Flash 0731 es la versión oficial re-entrenada después del entrenamiento inicial del eficiente modelo de mezcla de expertos V4 Flash de DeepSeek: 284B total / 13B de parámetros activos, idéntico en arquitectura y tamaño a la versión V4 Flash de abril, con el post-entrenamiento rehecho desde cero. Admite una ventana de contexto de 1M de tokens con hasta 384K de tokens de salida, soporta tanto modos de razonamiento como de no razonamiento (razonamiento activado por defecto), además de salida JSON y llamadas a herramientas, y habla de forma nativa la API de Respuestas con una adaptación específica para agentes de codificación tipo Codex. La revisión 0731 supone un gran avance en capacidad de agentes, superando incluso a DeepSeek V4 Pro Preview en los benchmarks de agentes publicados por DeepSeek: 82.7 en Terminal Bench 2.1, 76.7 en Cybergym, 70.3 en Toolathlon Verified, 54.4 en DeepSWE y 54.2 en NL2Repo. En la API de primera parte de DeepSeek, esta revisión es la que sirve ahora el ID de modelo deepseek-v4-flash; el identificador con fecha lista la misma revisión para quienes la referencian por fecha. Es una opción excelente para agentes de codificación, cargas de trabajo de terminal y uso de herramientas, y pipelines agénticos de alto volumen a costo de nivel flash.
DeepSeek V4 Flash 0731 es un modelo de lenguaje solo de texto del proveedor deepseek, disponible a través de OrcaRouter con el ID de modelo deepseek/deepseek-v4-flash-0731. Sus especificaciones…
La entrada se limita a texto. La ventana de contexto es de 1,048,576 tokens, y la salida máxima es de 384,000 tokens por respuesta. Es un espacio de trabajo amplio: puedes leer alrededor de un millón de tokens de contenido antes de generar, y puedes solicitar hasta 384,000 tokens de salida en una sola llamada. La ficha del modelo enumera estos como dos límites separados; no indica un límite combinado para una solicitud que utilice ambos valores cercanos al máximo. En la práctica, para mantenerse dentro de los límites, cuenta tus tokens antes de enviar y establece max_tokens por debajo del límite de salida. La restricción de solo texto también significa que debes convertir PDF, hojas de cálculo y otros documentos a texto sin formato primero. La tokenización no se especifica en los datos disponibles, así que prueba contenido representativo para ver el tamaño que alcanzan tus prompts. Si tu solicitud supera los 1,048,576 tokens de entrada, la llamada a la API fallará; lo mismo se aplica para salidas de más de 384,000 tokens.
Dadas las especificaciones enumeradas, el modelo es más adecuado para tareas que combinan entradas de texto largas, salidas de texto largas y razonamiento agéntico orientado a terminal. La puntuación de 82.7 en Terminal Bench 2.1 es evidencia de solidez en la finalización de tareas de línea de comandos, donde un modelo lee la salida del shell y decide el siguiente comando. El contexto de 1,048,576 tokens admite análisis de repositorios completos, revisión de código de múltiples archivos, documentos legales o técnicos extensos e historiales de chat amplios. La salida de 384,000 tokens permite generar documentos estructurados largos, conjuntos de datos sintéticos o análisis paso a paso en una sola pasada. El precio por token de $0.15 para entrada y $0.29 para salida por millón de tokens hace que el procesamiento de texto de alto volumen sea financieramente predecible. El modelo es menos apropiado cuando se necesita comprensión de imágenes, transcripción de audio o latencia muy baja, aspectos que no están cubiertos por los hechos proporcionados. Si su tarea se ajusta al perfil de solo texto, contexto amplio y salida extensa, este es un candidato razonable para evaluar mediante OrcaRouter.
El modelo no puede aceptar entradas que no sean texto; no hay modalidad de visión, audio ni video en su ficha de catálogo. Tampoco tiene latencia publicada ni garantías de transmisión en los datos disponibles. Debería elegir un modelo más económico cuando su carga de trabajo no necesite el contexto amplio ni los límites de salida. Por ejemplo, un intercambio breve de chatbot que use unos pocos miles de tokens se facturaría igualmente a la misma tarifa por token, pero podría ser mejor atendido por un modelo con un contexto más pequeño y un precio más bajo por millón de tokens. Los datos disponibles no enumeran precios para alternativas, así que compare las tarifas por 1M de tokens en el catálogo de OrcaRouter. Si su tarea es clasificación simple o resumen de pasajes cortos, un modelo más económico puede ser suficiente. Si su tarea necesita el contexto completo de 1M o la salida de 384K, o se beneficia de la fortaleza de Terminal Bench 2.1 en trabajo de línea de comandos, entonces el precio de este modelo es la base relevante para la evaluación.
Todo input debe ser texto. Los PDFs, imágenes, hojas de cálculo y archivos de audio deben convertirse a texto plano o transcribirse antes de poder enviarse. Ese es un paso de preprocesamiento necesario, pero también simplifica el formato de la solicitud: los campos de contenido estándar estilo OpenAI que contienen cadenas son todo lo que necesitas. El contexto de 1,048,576 tokens significa que puedes pasar cuerpos largos de texto convertido en una sola solicitud; la salida de 384,000 tokens significa que puedes recibir texto muy largo como respuesta. El recuento de tokens es la principal preocupación operativa, ya que la factura total depende de los tokens de entrada y salida. OrcaRouter informa el uso en la respuesta compatible con OpenAI, lo que te permite monitorear ambos números. Si trabajas con lenguajes o código que tokenizan de manera ineficiente, tu contexto efectivo se reducirá porque el límite lo imponen los recuentos de tokens, no los caracteres. No se proporcionan detalles del tokenizador, así que ejecuta una prueba rápida con tu propio contenido para conocer las longitudes típicas de tokens.
Terminal Bench 2.1 evalúa la capacidad de un modelo para trabajar en un entorno de terminal: comprender la salida de comandos, navegar por directorios, ejecutar comandos y completar tareas realistas de administración de sistemas o ingeniería de software a través de un shell. La puntuación principal de DeepSeek V4 Flash 0731 es 82.7, en una escala donde un valor más alto es mejor. Este es el único resultado de benchmark proporcionado en los datos disponibles. La puntuación es una señal útil si planeas construir bucles de agente que emitan comandos de shell, ya que el benchmark está diseñado para probar exactamente ese tipo de capacidad. No es una medida de conocimiento general, escritura creativa, matemáticas ni competencia multilingüe. No se proporcionan líneas base de comparación ni otros números de benchmark, por lo que el 82.7 debe interpretarse en contexto: evidencia sólida para tareas relacionadas con la terminal y ninguna evidencia en ningún sentido para otros dominios. Las puntuaciones de los benchmarks dependen de la distribución exacta de las tareas, por lo que tus propias tareas de terminal pueden obtener puntuaciones diferentes; valida con tu propia evaluación antes de usarlo en producción.
Los hechos disponibles sobre DeepSeek V4 Flash 0731 no incluyen tokens por segundo, tiempo hasta el primer token, latencia p95 ni rendimiento. El nombre Flash sugiere una variante más ligera, pero los hechos proporcionados no cuantifican la velocidad. Lo que sí incluyen los hechos es una ventana de contexto amplia de 1.048.576 tokens y un límite de salida grande de 384.000 tokens. Las entradas y salidas más largas consumen inherentemente más cómputo, por lo que la latencia en solicitudes de contexto completo probablemente será mayor que en indicaciones cortas, incluso para un modelo rápido. El precio de $0,15/$0,29 por millón de tokens describe el costo, no la velocidad. Para tomar una decisión informada, ejecute su propia prueba de carga contra la API de OrcaRouter con indicaciones representativas del tamaño que planea usar, y compare el tiempo hasta el primer token y la duración total con otros modelos del catálogo. No extrapole la latencia a partir de la puntuación de referencia, que no mide el tiempo de respuesta.
Las principales limitaciones son visibles a partir de los hechos enumerados. Es solo texto, por lo que cualquier entrada multimodal queda fuera del alcance. La evidencia del benchmark se limita a una sola puntuación, 82.7 en Terminal Bench 2.1, que cubre la finalización de tareas basadas en terminal, no el razonamiento general ni el conocimiento. No se publican métricas de latencia, disponibilidad ni tasa de error, por lo que el rendimiento bajo carga es desconocido. Los límites de contexto y de salida son amplios pero finitos: 1,048,576 tokens de entrada y 384,000 tokens de salida por solicitud. Las solicitudes que los superen no tendrán éxito. No hay un descuento documentado por caché de prompts en los hechos proporcionados, por lo que los prefijos repetidos se facturan como tokens de entrada ordinarios. El precio es bajo por token, pero los costos absolutos crecen linealmente con el tamaño del contexto. Si su aplicación necesita visión, baja latencia o un rendimiento muy alto, este modelo puede no ser el adecuado; verifique esos requisitos por separado antes de comprometerse.
Los costos se calculan por token, con una tarifa para entrada y otra para salida. Los tokens de entrada cuestan $0.15 por cada 1,000,000 de tokens; los tokens de salida cuestan $0.29 por cada 1,000,000 de tokens. OrcaRouter factura estos a la tarifa del proveedor sin margen adicional, lo que significa que no se añade ningún porcentaje de plataforma sobre la tarifa de deepseek. El costo de una sola solicitud es aproximadamente los tokens de entrada multiplicados por $0.15 dividido por 1,000,000, más los tokens de salida multiplicados por $0.29 dividido por 1,000,000. Por ejemplo, una entrada completa de 1,048,576 tokens cuesta aproximadamente $0.1573, y una salida de longitud máxima de 384,000 tokens cuesta aproximadamente $0.1114, si ambos límites se usaran en transacciones separadas. Los hechos disponibles no mencionan precios con descuento para entrada en caché, así que asuma que cada token de entrada se factura a la tarifa estándar. Debido a que el precio es lineal, la estimación del costo por lotes es sencilla una vez que conozca el tamaño promedio de su prompt y la longitud de salida.
La principal disyuntiva es entre el tamaño del contexto y el precio. A $0.15 por 1M de tokens de entrada, un prompt que utiliza el contexto completo de 1,048,576 tokens cuesta aproximadamente $0.157 solo en tarifas de entrada. Si tu tarea solo necesita unos pocos miles de tokens de contexto, estás pagando por capacidad no utilizada, en el sentido de que un modelo con contexto más pequeño y un precio por token más bajo podría ser más barato, dependiendo de sus tarifas. La tarifa de $0.29 por 1M de tokens de salida significa que las salidas largas no son especialmente caras de forma individual, pero una carga de trabajo que genere gigabytes de texto acumulará costos. No hay descuento por lotes, reserva ni descuento por caché en los datos proporcionados. La facturación sin margen de OrcaRouter significa que el precio que ves es el precio del proveedor; tu factura final es simplemente una función de los tokens enviados y recibidos. Para trabajos por lotes a gran escala, estima el total de tokens de entrada y salida, multiplícalo por las dos tarifas y compáralo con las alternativas del catálogo.
OrcaRouter factura explícitamente DeepSeek V4 Flash 0731 a la tarifa del proveedor sin margen adicional. Los $0.15 por 1M de tokens de entrada y $0.29 por 1M de tokens de salida son las tarifas del proveedor, no una versión con margen. Los hechos proporcionados no describen el almacenamiento en caché de prompts para este modelo. No se lista un nivel de precios para entrada en caché, y no hay declaración de que OrcaRouter almacene automáticamente los prompts en caché en su nombre. Si el proveedor subyacente ofrece almacenamiento en caché, los términos no forman parte de lo que se suministró para esta entrada del catálogo, por lo que debe consultar la documentación actual de OrcaRouter antes de asumir un descuento. La respuesta de la API, debido a que sigue el formato de finalizaciones de chat de OpenAI, incluye información de uso que le permite verificar los tokens de entrada y salida facturados. Para fines de auditoría, registre el objeto de uso de cada respuesta y compárelo con sus recuentos de tokens esperados. Cualquier control de costos debe provenir de sus propias elecciones de prompts y parámetros.
Envía solicitudes estándar de finalización de chat a la API compatible con OpenAI de OrcaRouter. La URL base es https://api.orcarouter.ai/v1, y el ID del modelo es deepseek/deepseek-v4-flash-0731. Establece el campo model con esa cadena exacta y coloca tu clave de API de OrcaRouter en el encabezado Authorization como un token bearer. Construye un arreglo messages con contenido de texto; el modelo no aceptará contenido de imagen ni audio. La respuesta tiene el formato de una finalización de chat de OpenAI e incluye el mensaje generado y un objeto usage. Debido a que el ID del modelo incluye un prefijo de proveedor, consérvalo exactamente como se muestra. Los hechos disponibles no requieren encabezados no estándar ni configuraciones de transporte especiales. Puedes usar los SDK de OpenAI, curl o cualquier cliente HTTP que hable JSON. Comienza con una solicitud pequeña, verifica que el uso devuelto coincida con los recuentos de tokens de entrada y salida esperados, y luego aumenta la escala.
Debido a que el endpoint es compatible con OpenAI, están disponibles los parámetros típicos de finalización de chat: model, messages, temperature, top_p, max_tokens o max_completion_tokens, stop, stream y opciones similares compatibles con el SDK que utilices. Los hechos disponibles no enumeran qué parámetros respeta OrcaRouter para este modelo específico, por lo que debes probar cualquier cosa más allá de model y messages. Los límites cruciales son los propios del modelo: 1.048.576 tokens de entrada y 384.000 tokens de salida. Mantén max_tokens por debajo del límite de salida para evitar solicitudes fallidas. En cuanto a la llamada a herramientas o funciones, los hechos no indican soporte; prueba una definición de herramienta mínima antes de crear un agente. Para el control del formato de salida, no se menciona el modo JSON ni garantías de salida estructurada; valida el texto generado tú mismo si necesitas una estructura confiable. El streaming suele estar disponible en los endpoints compatibles con OpenAI, pero los hechos no lo confirman para este modelo; consulta la referencia de la API de OrcaRouter.
La migración es principalmente configuración: cambia la URL base a https://api.orcarouter.ai/v1, cambia la clave de API a tu clave de OrcaRouter y reemplaza el nombre del modelo por deepseek/deepseek-v4-flash-0731. El código que ya construye mensajes, maneja respuestas de chat completion y lee datos de uso seguirá funcionando siempre que siga la convención de OpenAI. Dos diferencias requieren atención. Primero, este modelo es solo de texto, así que elimina cualquier campo image_url o audio de tus solicitudes. Segundo, los límites de contexto y salida son muy grandes; ajusta tu configuración de max_tokens para respetar el límite de salida de 384,000 tokens y prepárate para respuestas ocasionalmente largas. Si tu código incluye reintentos en errores 429 o 5xx, consérvalos; los hechos no cambian las expectativas de manejo de errores. Ejecuta una prueba de humo con un prompt pequeño, confirma que la facturación aparece en $0.15/$0.29 por millón de tokens y luego cambia el tráfico gradualmente.
La URL base para la API de OrcaRouter es https://api.orcarouter.ai/v1. Todas las solicitudes a este endpoint deben usar HTTPS. La autenticación se realiza mediante una clave de API, enviada como un token de portador estándar en el encabezado Authorization. Los hechos disponibles no enumeran métodos de autenticación alternativos. El ID del modelo es deepseek/deepseek-v4-flash-0731, que incluye el nombre del proveedor y el sufijo de instantánea 0731; pásalo exactamente como está escrito. En la mayoría de los SDK compatibles con OpenAI, se configura un cliente con base_url y api_key, y luego se establece el nombre del modelo en cada llamada. La respuesta incluirá recuentos de tokens relevantes para la facturación en el objeto usage. Los hechos no indican límites de velocidad, comportamiento de reintentos ni pautas de tiempo de espera, por lo que debes consultar la documentación de OrcaRouter para esos detalles operativos. Almacena tu clave de API de forma segura; la clave determina el acceso a todas las cuentas de modelos en tu proyecto de OrcaRouter. Si usas un proxy o una puerta de enlace, apúntalo a la URL base de OrcaRouter y conserva el ID completo del modelo.
Los hechos proporcionados cubren solo esta instantánea específica, por lo que no es posible hacer una comparación numérica línea por línea con otras entradas de DeepSeek a partir de lo que se ofrece. Lo que sabemos sobre DeepSeek V4 Flash 0731 es su contexto de 1,048,576 tokens, su límite de salida de 384,000 tokens, entrada solo de texto, precios de $0.15/$0.29 por millón de tokens, y una puntuación de 82.7 en Terminal Bench 2.1. Otros modelos de DeepSeek en el catálogo de OrcaRouter pueden diferir en cualquiera de estos ejes. Al decidir, compare las especificaciones que importan: cuántos tokens usan realmente sus indicaciones, cuántos tokens requieren sus salidas, si necesita una entrada multimodal, y el precio por millón de tokens del candidato. La etiqueta Flash implica una variante más ligera en comparación con otros lanzamientos de DeepSeek, pero el único indicador objetivo de rendimiento en los hechos es la puntuación de Terminal Bench. Use las páginas de listado del catálogo de OrcaRouter para comparar especificaciones lado a lado y ver los precios actuales antes de seleccionar.
Con 1,048,576 tokens de contexto, este modelo se encuentra en el nivel de contexto largo. Un modelo de contexto más pequeño podría limitarse a unos pocos cientos de miles de tokens o menos, obligándote a dividir documentos, incrustar fragmentos o usar recuperación. La ventaja de este modelo es que puedes colocar un corpus muy grande en una sola instrucción y dejar que el modelo atienda todo en una sola pasada. La desventaja es el costo por solicitud: cada token de entrada se factura, por lo que un contexto enorme multiplica el gasto de entrada. Los datos no enumeran ningún modelo con una ventana de contexto aún mayor, por lo que las únicas afirmaciones seguras son sobre los propios límites de este modelo. Al elegir, estima los tamaños reales de tus instrucciones. Si tus tareas suelen usar menos de 100 000 tokens, el contexto completo puede ser irrelevante y un modelo más pequeño y económico podría ser preferible. Si superas regularmente los límites de contexto comunes, la ventana de 1M de tokens de este modelo es la característica decisiva.
Elija DeepSeek V4 Flash 0731 cuando la tarea sea solo de texto y pueda aprovechar sus especificaciones. El contexto de 1,048,576 tokens justifica su selección cuando necesita leer un repositorio completo, un conjunto de documentos o una transcripción larga en una sola pasada. El límite de salida de 384,000 tokens justifica su selección cuando necesita respuestas generadas muy largas sin múltiples viajes de ida y vuelta. La puntuación de 82.7 en Terminal Bench 2.1 justifica su selección para automatización de terminal y flujos de trabajo CLI agénticos. El precio de $0.15/$0.29 por cada 1M de tokens justifica su selección para procesamiento de texto por lotes de alto volumen donde domina el costo por token. No lo elija cuando necesite imágenes o audio, cuando sus necesidades de contexto sean mínimas y exista un modelo más barato, o cuando no pueda aceptar características de latencia desconocidas. Los hechos disponibles no ofrecen garantías de latencia, por lo que los equipos sensibles al rendimiento deberían hacer pruebas comparativas con indicaciones reales primero. En todos los casos, confirme el ID del modelo y la facturación en OrcaRouter antes de escalar.
Compatible con OpenAI: conserva tu SDK actual
https://api.orcarouter.ai/v1https://api.orcarouter.aiimport os
from openai import OpenAI
client = OpenAI(
base_url="https://api.orcarouter.ai/v1",
api_key=os.environ["ORCAROUTER_API_KEY"],
)
response = client.chat.completions.create(
model="deepseek/deepseek-v4-flash-0731",
messages=[{"role": "user", "content": "Hello"}],
)
print(response.choices[0].message.content)frequency_penaltyinclude_reasoninglogit_biaslogprobsmax_tokensmin_ppresence_penaltyreasoningreasoning_effortrepetition_penaltyresponse_formatseedstopstructured_outputstemperaturetool_choicetoolstop_ktop_logprobstop_p| Entrada / 1M tokens | $0.147 |
| Salida / 1M tokens | $0.295 |
| Lectura caché / 1M | $0.020 |
| Moneda | USD |
Estimación según precio de lista
Solo una estimación: el número real de tokens depende del tokenizador del proveedor.
De qué hablan los desarrolladores esta semana
GET /api/public/models/deepseek/deepseek-v4-flash-0731Abrir @misc{orcarouter_deepseek_v4_flash_0731,
title = {DeepSeek V4 Flash 0731 API},
author = {DeepSeek},
year = {2026},
howpublished = {OrcaRouter},
url = {https://www.orcarouter.ai/models/deepseek/deepseek-v4-flash-0731}
}DeepSeek. (2026). DeepSeek V4 Flash 0731 API. OrcaRouter. https://www.orcarouter.ai/models/deepseek/deepseek-v4-flash-0731