DeepSeek-V4.1-Flash es el modelo más pequeño de la nueva familia de arquitectura de DeepSeek, lanzado el 10 de septiembre de 2026, con comprensión visual multimodal nativa — el sucesor de producción tanto de V4 Flash como del experimento V4 Flash Vision. La nueva arquitectura apunta a un techo de capacidad más alto, inferencia más rápida y mayor rendimiento, y DeepSeek informa que V4.1 Flash supera ampliamente a V4 Pro en rendimiento, costo, velocidad y tiempo total de tarea. Acepta texto e imágenes con salida de texto, ofrece una ventana de contexto de 1M de tokens con hasta 384K tokens de salida, y admite modos de pensamiento (predeterminado, con esfuerzo seleccionable bajo / alto / máximo) y de no pensamiento a través de las API de Chat Completions, Responses y compatibles con Anthropic, junto con salida JSON, llamadas a herramientas y finalización de prefijo de chat; FIM funciona solo en modo no pensamiento. Los pesos del modelo están abiertos en Hugging Face (deepseek-ai/DeepSeek-V4.1-Flash). Puntos de referencia oficiales en el lanzamiento: 90.6 en Terminal-Bench 2.1, 74.2 en DeepSWE v1.1, 65.4 en NL2Repo-Bench, 90.9 en GPQA Diamond, 63.9 en HLE con herramientas, y sólidos resultados de agente con visión nativa (89.6 BabyVision, 78.9 Chartography con herramientas). Los precios se redujeron junto con el lanzamiento: $0.15/M de entrada (fallo de caché), $0.60/M de salida y $0.003/M en aciertos de caché a tarifas de horas no pico, duplicándose durante las horas pico de los días laborables (01:00-04:00 y 06:00-10:00 UTC); todas las demás horas, incluidos los fines de semana, son horas no pico.
DeepSeek V4.1 Flash es un modelo de DeepSeek disponible a través de OrcaRouter, la pasarela de API compatible con OpenAI. Acepta entrada de texto e imágenes, tiene una ventana de contexto de…
DeepSeek V4.1 Flash acepta texto e imágenes como entrada y devuelve texto. En la práctica, eso cubre tres patrones amplios. El primero es la comprensión de documentos: insertar capturas de pantalla de tablas, páginas escaneadas o diagramas junto con instrucciones escritas. El segundo es el anclaje visual, donde se analiza una captura de pantalla de una interfaz, un gráfico o un estado de error en el contexto de una conversación o especificación más larga. El tercero es el razonamiento de modalidad mixta, donde un corpus textual largo se combina con unas pocas imágenes que anclan la pregunta. La salida es solo texto, por lo que el modelo describe, extrae o explica lo que ve en lugar de generar imágenes. Los tokens de imagen cuentan como entrada y se facturan a $0,15 por 1M de tokens de entrada, la misma tarifa que la entrada de texto en OrcaRouter. Para cargas de trabajo en las que el texto por sí solo es suficiente, un modelo solo de texto puede ser más económico, pero V4.1 Flash evita ejecutar una canalización de visión independiente para tareas visuales ligeras.
Los casos de uso más idóneos son el análisis de contexto largo con una respuesta extensa, la comprensión de código en repositorios grandes, la revisión multimodal de documentos y los bucles agénticos que necesitan transportar una gran cantidad de estado. Como la salida máxima alcanza los 384.000 tokens, el modelo puede devolver informes completos, notas de migración o código extenso en lugar de resúmenes breves. Otros usos razonables incluyen los flujos de transcripción a notas estructuradas, la comparación de contratos y los flujos de trabajo de soporte en los que se conserva todo el historial en el contexto. La puntuación de 90,9 en GPQA Diamond sugiere fortaleza en preguntas científicas de nivel de posgrado, lo que apunta a la respuesta a preguntas técnicas y orientadas a la investigación más que a la prosa por sí sola. Es menos evidentemente adecuado para tráfico de alta frecuencia y solicitudes muy pequeñas, ya que una llamada breve de clasificación no necesita una ventana de un millón de tokens, y para tareas que requieren generación de imágenes, porque la salida es solo texto.
Muchos modelos limitan la salida a unos pocos miles de tokens, lo que obliga a unir varios turnos para cualquier cosa larga. Un límite de 384,000 tokens permite que DeepSeek V4.1 Flash emita un artefacto completo en una sola pasada: una especificación técnica completa, un plan de migración largo, un diff anotado extendido o una reescritura completa de la transcripción. La generación en una sola pasada normalmente preserva mejor la consistencia interna que ensamblar una respuesta a partir de muchas llamadas cortas, porque el modelo nunca pierde el hilo entre turnos. La contrapartida es el costo. La salida se factura a $0.60 por 1M de tokens de salida en OrcaRouter, cuatro veces la tarifa de entrada, por lo que una generación muy larga es la parte costosa de una solicitud. Utilice el límite máximo donde una respuesta larga y coherente tenga un valor real, establezca max_tokens para que coincida con la tarea y evite dejar que el modelo divague cuando bastaría con una respuesta de dos párrafos.
Un contexto amplio y un techo de salida alto son capacidades por las que se paga. Si una tarea solo necesita un prompt corto y una respuesta corta, como la clasificación de intenciones, la extracción de entidades, el enrutamiento o una reescritura sencilla, la ventana adicional no aporta nada, y un modelo más pequeño en otra parte de OrcaRouter normalmente costará menos por llamada. Lo mismo se aplica a los trabajos por lotes de gran volumen en los que las entradas ya están divididas en fragmentos por diseño. Elige DeepSeek V4.1 Flash cuando el trabajo realmente necesite la ventana: documentos completos, contexto de código extenso, revisión de múltiples imágenes o una respuesta larga en una sola pasada. Una regla útil es estimar primero el tamaño del prompt y la salida esperada. Si ambos son moderados, compara el coste total de tokens con el de una opción más pequeña. Si el prompt alcanza cientos de miles de tokens, la alternativa suele ser un pipeline de recuperación, que conlleva su propio coste de ingeniería y pérdida de información.
GPQA Diamond es un conjunto de preguntas científicas de nivel de posgrado redactadas para resistir una simple búsqueda, por lo que las puntuaciones reflejan razonamiento sobre material técnico difícil en lugar de recuerdo de hechos comunes. DeepSeek V4.1 Flash obtiene 90.9 en este benchmark. Un resultado alto aquí indica que el modelo maneja competentemente razonamiento científico de varios pasos y preguntas precisas de dominio. No significa que el modelo sea igualmente fuerte en todas las tareas. GPQA Diamond es limitado: dice poco sobre recuperación de contexto largo, tono, seguimiento de instrucciones con prompts desordenados o calidad de código a escala. Considera 90.9 como un punto de datos que confirma la capacidad de razonamiento técnico, y valídalo con tu propia carga de trabajo. Construye un pequeño conjunto de evaluación elaborado a partir de tus entradas reales, que incluya documentos largos y prompts de imagen más texto, y compara las salidas en ese conjunto antes de comprometer una ruta de producción en OrcaRouter.
La latencia en DeepSeek V4.1 Flash depende principalmente de cuánto le pides que genere. El tiempo hasta el primer token está influenciado por el tamaño del prompt y la carga del proveedor, mientras que el tiempo total de respuesta aumenta con la longitud de salida. Con un límite de 384,000 tokens, una generación de longitud máxima es inherentemente una solicitud de larga duración. No hay cifras de latencia publicadas disponibles para este modelo en OrcaRouter, así que mide con tus propios prompts en lugar de asumir una cifra. Pasos prácticos: limita max_tokens para rutas interactivas para que las respuestas permanezcan acotadas, transmite tokens para que los usuarios vean el progreso y reserva las generaciones muy largas para trabajos en segundo plano. En condiciones de alta concurrencia, espera que los límites de rendimiento del proveedor determinen tu tasa efectiva, y pon en cola o reintenta en consecuencia. Compara con tu modelo actual usando los mismos prompts y registra el tiempo hasta el primer token por separado de la duración total.
Los benchmarks son útiles para acotar un campo, no para clasificar modelos en producción. Cada prueba mide una habilidad específica y acotada bajo un formato de prompt fijo. GPQA Diamond premia el razonamiento científico de nivel de posgrado, mientras que un benchmark de programación premia un comportamiento completamente distinto. Una puntuación alta en un área no se transfiere automáticamente, y las diferencias pequeñas entre modelos a menudo quedan dentro de la varianza entre ejecuciones. Dos prácticas ayudan. Primero, comprueba que la tarea del benchmark se parezca a la tuya. Un 90,9 en GPQA Diamond es relevante para investigación y respuesta a preguntas técnicas, menos para el tono de chat o extracción. Segundo, prueba con tus propios datos: reúne una muestra representativa, define una regla de puntuación y mide. En OrcaRouter puedes enrutar la misma solicitud a diferentes ids de modelo a través de una única API compatible con OpenAI y comparar las salidas directamente, lo cual es más informativo que una posición en una tabla de clasificación por sí sola.
Hay tres límites que conviene tener en cuenta al planificar. Primero, la salida es únicamente texto: el modelo acepta imágenes de entrada, pero no generará imágenes. Segundo, las salidas extensas cuestan más y, a $0,60 por 1 M de tokens de salida, cuatro veces la tarifa de entrada, las generaciones verbosas son el principal riesgo de costo. Tercero, una ventana de contexto amplia no garantiza que se aproveche cada detalle. La atención sobre un millón de tokens es una capacidad que conviene verificar con tus propios documentos en lugar de darla por sentada. También existen restricciones operativas. Los prompts muy grandes tardan más en procesarse y consumen el presupuesto de velocidad más rápido. El modelo lo sirve DeepSeek a través de OrcaRouter, por lo que la disponibilidad depende de la infraestructura del proveedor y de los límites que este aplique. La precisión multimodal en gráficos densos, escritura a mano o escaneos de baja resolución varía; valida con muestras representativas antes de dirigirle trabajo crítico de extracción.
DeepSeek V4.1 Flash se factura a $0.15 por 1M de tokens de entrada y $0.60 por 1M de tokens de salida. OrcaRouter los transfiere a la tarifa del proveedor con cero margen, por lo que la cifra que ves es el precio del proveedor en lugar de un precio de reventa. La entrada incluye todo lo que envías: tokens de texto, tokens de imagen y el historial acumulado de una conversación. La salida cubre todo lo que genera el modelo, incluidos los argumentos de llamada a herramientas y cualquier texto de razonamiento que emita. La facturación se basa en tokens, por lo que una solicitud más barata simplemente usa menos tokens. No se describe ningún cargo adicional por la ventana de contexto en sí: una ventana de 1,048,576 tokens es un límite, no una tarifa. Un prompt grande cuesta más naturalmente porque contiene más tokens de entrada. Haz un seguimiento del uso por ruta para que puedas atribuir el gasto a las funciones que realmente lo generan.
Dos multiplicadores deciden tu gasto: cuántos tokens entran y cuántos salen. La salida es el lado más caro, a $0.60 por 1M de tokens frente a $0.15 por 1M de tokens de entrada, una diferencia de cuatro veces. Una solicitud que lee 200,000 tokens y escribe 500 tokens está dominada por la entrada. Una solicitud que lee 2,000 tokens y escribe 20,000 está dominada por la salida. Saber qué patrón tiene tu producto te dice dónde optimizar. A continuación, tres palancas. Recorta el contexto: incluye solo los documentos y el historial que una tarea necesita, aunque haya 1,048,576 tokens disponibles. Limita la salida: establece max_tokens al requisito real en lugar del límite máximo. Y agrupa: menos llamadas y más grandes evitan reenviar el mismo contexto repetidamente, lo que a menudo es la fuente más silenciosa de desperdicio en aplicaciones de contexto largo.
DeepSeek V4.1 Flash se factura a través de OrcaRouter a la tarifa del proveedor sin margen de beneficio, por lo que cualquier descuento del lado del proveedor o tarifa de entrada en caché se transfiere en lugar de absorberse o recargarse. Que la entrada en caché con descuento esté disponible para este modelo, y bajo qué condiciones, lo establece DeepSeek, así que confírmalo en la documentación actual del proveedor antes de modelar ahorros en un presupuesto. Lo que controlas directamente es el diseño del prompt. Mantén un prefijo estable, como instrucciones del sistema, esquema y contexto recuperado, y añade contenido variable al final para que pueda aplicarse cualquier reutilización de prefijo que admita el proveedor. Reutiliza contexto idéntico entre llamadas en un lote en lugar de reenviarlo por elemento. Acorta el historial de forma agresiva, resumiendo turnos anteriores una vez que dejen de ser necesarios. Estos hábitos reducen los tokens de entrada, que es donde las cargas de trabajo de contexto largo suelen gastar.
Apunta un cliente compatible con OpenAI a https://api.orcarouter.ai/v1 y establece el modelo en deepseek/deepseek-v4.1-flash. Como OrcaRouter expone la interfaz de chat completions de OpenAI, los SDK existentes para Python, JavaScript y otros lenguajes funcionan con solo cambiar la URL base y el id del modelo, además de tu clave de API de OrcaRouter. Una solicitud mínima envía un array messages con tus turnos de sistema y de usuario, además de parámetros opcionales como max_tokens, temperature y stream. La entrada de imágenes sigue el formato estándar de contenido multimodal, con partes de imagen junto a partes de texto en el mismo mensaje de usuario. Las respuestas llegan con la forma habitual, por lo que el código de análisis, streaming y manejo de llamadas a herramientas se mantiene sin cambios. Consulta la página del modelo de OrcaRouter para ver las notas de parámetros específicas de cada modelo, y registra las respuestas sin procesar durante las primeras llamadas mientras ajustas el tamaño del prompt y los límites de salida.
Cuatro parámetros determinan la mayoría de las solicitudes de DeepSeek V4.1 Flash. max_tokens establece el límite de salida y es el principal control de costes dado un máximo de 384.000 tokens; ajústalo a lo que necesita la tarea, no al máximo. temperature controla la variabilidad, así que usa un valor bajo para extracción, salida estructurada y código, y uno más alto para redacción. stream te permite mostrar el progreso en generaciones largas, lo cual importa cuando una respuesta puede alcanzar decenas de miles de tokens. Las instrucciones del sistema deben incluir requisitos de formato y seguridad. Para imágenes, el array de contenido multimodal estándar es el mecanismo que se debe usar. Para prompts largos, considera si cada documento incluido es necesario, ya que los tokens de entrada se facturan a $0.15 por 1M. Si el modelo admite llamadas a herramientas a través del esquema compatible con OpenAI, define herramientas específicas y bien documentadas en lugar de generales. Establece un tiempo de espera del lado del cliente que coincida con tu generación más larga esperada.
La migración es deliberadamente pequeña. Cambia la URL base a https://api.orcarouter.ai/v1, reemplaza la cadena del modelo por deepseek/deepseek-v4.1-flash y proporciona una clave de API de OrcaRouter. Los esquemas de solicitud y respuesta siguen siendo compatibles con OpenAI, así que los arrays de mensajes, los eventos de streaming y los payloads de llamadas a herramientas no necesitan una reescritura estructural. El trabajo está en el comportamiento, no en la infraestructura. Un modelo con una ventana de 1.048.576 tokens y un límite máximo de salida de 384.000 tokens invita a prompts que tu modelo anterior no podía aceptar. Aprovecha la oportunidad para elevar la calidad del contexto en lugar de inflar ciegamente el tamaño del prompt, ya que los tokens de entrada cuestan $0.15 por 1 M. Vuelve a ajustar max_tokens, temperature y la lógica de reintentos, y luego vuelve a ejecutar tu conjunto de evaluación. Revisa también las suposiciones sobre el tokenizador y la división de prompts: la lógica de fragmentación creada para una ventana pequeña puede que ahora sea innecesaria, y dejarla en su lugar puede fragmentar el contexto.
Las imágenes se proporcionan como partes de contenido en el mensaje del usuario, siguiendo el formato multimodal de OpenAI: el contenido del mensaje se convierte en un arreglo que contiene partes de texto y partes de imagen, y cada imagen se proporciona ya sea como una URL o como datos base64. Una llamada típica combina un cuerpo de texto largo, como una especificación, una transcripción o una conversación previa, con una o más capturas de pantalla o páginas escaneadas, y formula una pregunta que depende de ambos. Redimensiona antes de subir. Las imágenes muy grandes añaden tokens de entrada, y la entrada se factura a $0.15 por 1M de tokens, así que enviar capturas a resolución completa de diagramas simples desperdicia presupuesto sin mejorar la precisión. Recorta a la región que importa y usa una resolución legible para material con mucho texto. Si una tarea necesita muchas imágenes, agrúpalas lógicamente en una sola solicitud en lugar de hacer una llamada separada por imagen, lo que reenvía tu contexto de texto cada vez.
Los modelos de clase frontera a menudo lideran en los benchmarks de razonamiento y programación más difíciles, pero normalmente cobran bastante más por token y pueden limitar la salida muy por debajo de lo que permite DeepSeek V4.1 Flash. El 90.9 de este modelo en GPQA Diamond lo sitúa en un territorio creíble para el razonamiento científico de nivel de posgrado, mientras que el precio de $0.15 por 1M de tokens de entrada y $0.60 por 1M de tokens de salida mantiene asequible el trabajo con contexto largo. La elección normalmente se reduce a tres preguntas. ¿Qué tan difícil es la tarea de razonamiento y importa la diferencia de precisión para ella? ¿Qué tan larga es la entrada y cuánto ahorra una ventana de 1,048,576 tokens en complejidad de pipeline? ¿Qué tan larga es la salida, dado el límite de 384,000 tokens? Para el análisis con gran cantidad de documentos, la generación larga en una sola pasada y la revisión multimodal a escala, V4.1 Flash suele ser la opción práctica. Para los pasos de razonamiento más difíciles, considera enrutar esas llamadas a un modelo más costoso en OrcaRouter.
OrcaRouter expone muchos modelos detrás de una única API compatible con OpenAI, por lo que la comparación es cuestión de cambiar el id del modelo en lugar de integrar un segundo proveedor. Dentro de la familia DeepSeek, los ejes relevantes son el precio, la ventana de contexto y el techo de salida. V4.1 Flash combina una ventana de 1,048,576 tokens con un límite de salida de 384,000 tokens a $0.15 por 1M de tokens de entrada y $0.60 por 1M de tokens de salida. Los modelos más pequeños o más baratos tienen sentido cuando los prompts y las respuestas son cortos y la ventana adicional no aporta valor. Las alternativas con capacidad de visión importan cuando necesitas salida de imágenes en lugar de entrada de imágenes. Los modelos especializados en código o razonamiento pueden ganar en tareas específicas. Como OrcaRouter fija los precios a la tarifa del proveedor sin margen, la comparación es equivalente en tokens: ejecuta prompts idénticos con ambos ids, mide el costo y la calidad, y enruta según la tarea.
Elige otra cosa cuando la forma de la tarea no coincida con las fortalezas del modelo. Los trabajos de clasificación, enrutamiento o extracción, cortos y de alta frecuencia, no ganan nada con una ventana de 1,048,576 tokens y son más baratos en un modelo más pequeño. Las tareas que requieren imágenes generadas necesitan una clase de modelo completamente diferente. Si un único paso de razonamiento difícil domina la calidad, como las matemáticas de estilo teorema o el diseño sutil de algoritmos, un modelo de vanguardia utilizado solo para ese paso puede merecer la tarifa más alta. También es razonable combinar modelos. Usa DeepSeek V4.1 Flash para leer entradas largas, recopilar evidencia y redactar salidas extensas a $0.15 por 1M de tokens de entrada y $0.60 por 1M de tokens de salida, luego escala decisiones específicas a un modelo más costoso para su verificación. La API compatible con OpenAI de OrcaRouter hace que ese enrutamiento sea un cambio de configuración en lugar de una nueva integración.
Compatible con OpenAI: conserva tu SDK actual
https://api.orcarouter.ai/v1https://api.orcarouter.aiimport os
from openai import OpenAI
client = OpenAI(
base_url="https://api.orcarouter.ai/v1",
api_key=os.environ["ORCAROUTER_API_KEY"],
)
response = client.chat.completions.create(
model="deepseek/deepseek-v4.1-flash",
messages=[{"role": "user", "content": "Hello"}],
)
print(response.choices[0].message.content)include_reasoninglogprobsmax_tokensreasoningreasoning_effortresponse_formatstopstreamstream_optionstemperaturethinkingtool_choicetoolstop_logprobstop_puser_id| Entrada / 1M tokens · Fuera de pico | $0.150 |
|---|---|
| Salida / 1M tokens · Fuera de pico | $0.600 |
| Lectura caché / 1M · Fuera de pico | $0.0030 |
| Horas pico | 01:00–04:00, 06:00–10:00 ×2 (UTC) |
| Entrada / 1M tokens · ×2 | $0.300 |
| Salida / 1M tokens · ×2 | $1.20 |
| Lectura caché / 1M · ×2 | $0.0060 |
| Moneda | USD |
Estimación según precio de lista
Solo una estimación: el número real de tokens depende del tokenizador del proveedor.
De qué hablan los desarrolladores esta semana
GET /api/public/models/deepseek/deepseek-v4.1-flashAbrir @misc{orcarouter_deepseek_v4_1_flash,
title = {DeepSeek V4.1 Flash API},
author = {DeepSeek},
year = {2026},
howpublished = {OrcaRouter},
url = {https://www.orcarouter.ai/models/deepseek/deepseek-v4.1-flash}
}DeepSeek. (2026). DeepSeek V4.1 Flash API. OrcaRouter. https://www.orcarouter.ai/models/deepseek/deepseek-v4.1-flash