DeepSeek V4.1 Flash

deepseek/deepseek-v4.1-flash
NuevoDestacado
VisiónHerramientasJSONRazonamiento
por DeepSeek · 2026-09-10

DeepSeek-V4.1-Flash es el modelo más pequeño de la nueva familia de arquitectura de DeepSeek, lanzado el 10 de septiembre de 2026, con comprensión visual multimodal nativa — el sucesor de producción tanto de V4 Flash como del experimento V4 Flash Vision. La nueva arquitectura apunta a un techo de capacidad más alto, inferencia más rápida y mayor rendimiento, y DeepSeek informa que V4.1 Flash supera ampliamente a V4 Pro en rendimiento, costo, velocidad y tiempo total de tarea. Acepta texto e imágenes con salida de texto, ofrece una ventana de contexto de 1M de tokens con hasta 384K tokens de salida, y admite modos de pensamiento (predeterminado, con esfuerzo seleccionable bajo / alto / máximo) y de no pensamiento a través de las API de Chat Completions, Responses y compatibles con Anthropic, junto con salida JSON, llamadas a herramientas y finalización de prefijo de chat; FIM funciona solo en modo no pensamiento. Los pesos del modelo están abiertos en Hugging Face (deepseek-ai/DeepSeek-V4.1-Flash). Puntos de referencia oficiales en el lanzamiento: 90.6 en Terminal-Bench 2.1, 74.2 en DeepSWE v1.1, 65.4 en NL2Repo-Bench, 90.9 en GPQA Diamond, 63.9 en HLE con herramientas, y sólidos resultados de agente con visión nativa (89.6 BabyVision, 78.9 Chartography con herramientas). Los precios se redujeron junto con el lanzamiento: $0.15/M de entrada (fallo de caché), $0.60/M de salida y $0.003/M en aciertos de caché a tarifas de horas no pico, duplicándose durante las horas pico de los días laborables (01:00-04:00 y 06:00-10:00 UTC); todas las demás horas, incluidos los fines de semana, son horas no pico.

ctx1M tokens
Salida máx.384K
Entradatext + image
Salidatext
p50 TTFT412 ms
ENTRADA$0.15/ 1M tokens
SALIDA$0.60/ 1M tokens
p50 TTFT412 ms7 d
p95 TTFT1.60 s7 d
TRÁFICO299.5Mtokens / 7 d

DeepSeek V4.1 Flash es un modelo de DeepSeek disponible a través de OrcaRouter, la pasarela de API compatible con OpenAI. Acepta entrada de texto e imágenes, tiene una ventana de contexto de…

¿Qué es DeepSeek V4.1 Flash?

¿Para quién está diseñado DeepSeek V4.1 Flash?

¿Por qué importa la ventana de contexto de 1.048.576 tokens?

Ejemplos de código

Llama desde cualquier SDK

Compatible con OpenAI: conserva tu SDK actual

  • OpenAI SDKhttps://api.orcarouter.ai/v1
  • Anthropic SDKhttps://api.orcarouter.ai
import os

from openai import OpenAI

client = OpenAI(
    base_url="https://api.orcarouter.ai/v1",
    api_key=os.environ["ORCAROUTER_API_KEY"],
)

response = client.chat.completions.create(
    model="deepseek/deepseek-v4.1-flash",
    messages=[{"role": "user", "content": "Hello"}],
)
print(response.choices[0].message.content)

Parámetros admitidos

  • include_reasoning
  • logprobs
  • max_tokens
  • reasoning
  • reasoning_effort
  • response_format
  • stop
  • stream
  • stream_options
  • temperature
  • thinking
  • tool_choice
  • tools
  • top_logprobs
  • top_p
  • user_id

Precios

Precios
Entrada / 1M tokens · Fuera de pico$0.150
Salida / 1M tokens · Fuera de pico$0.600
Lectura caché / 1M · Fuera de pico$0.0030
Horas pico01:00–04:00, 06:00–10:00 ×2 (UTC)
Entrada / 1M tokens · ×2$0.300
Salida / 1M tokens · ×2$1.20
Lectura caché / 1M · ×2$0.0060
MonedaUSD

Calculadora de costes

Tokens / mes10MM
Proporción de entrada70%%
Estimado / mes $2.85 · Con caché de prompts $2.34

Estimación según precio de lista

Estimador de tokens y coste

Tokens de entrada: 18Coste por solicitud: $0.000303

Solo una estimación: el número real de tokens depende del tokenizador del proveedor.

Rendimiento

p50 TTFT
412 ms
Velocidad de salida
215 tok/s
p95 TTFT
1.60 s
Tasa de error
0.07%

Pruebas de referencia públicas

Agents' Last Exam
31.8
Automation-Bench
54.8
BabyVision (with tools)
89.6
Chartography (with tools)
78.9
CyberGym
88.1
DeepSWE v1.1
74.2
ExploitGym
15.3
GPQA Diamond
90.9
HLE
36.8
HLE (with tools)
63.9
MathArena Apex
65.6
NL2Repo-Bench
65.4
ProgramBench
20.3
SEC-Bench Pro
62.8
Terminal-Bench 2.1
90.6
Terminal-Bench 3.0
30.0
Terminal-Bench 4.0
31.2
ZeroBench-main (with tools)
49.0
Fuente: api-docs.deepseek.com

Actividad de la comunidad

De qué hablan los desarrolladores esta semana

Hacker News13 menciones · 7 d13 más que la semana anterior

Comparativa

DeepSeek V4.1 FlashDeepSeek V4 ProDeepSeek V4 FlashDeepSeek V4 Flash Vision (Exp)
Entrada $/M$0.15$0.73$0.24$0.24
Salida $/M$0.60$2.18$0.73$0.73
Contexto1.0M1.0M1.0M1.0M
Calidad8/108/107/107/10
Comparar lado a ladoComparar lado a ladoComparar lado a ladoComparar lado a lado

Preguntas frecuentes

¿Cuánto cuesta DeepSeek V4.1 Flash en OrcaRouter?
OrcaRouter factura DeepSeek V4.1 Flash a $0.15 por 1M de tokens de entrada y $0.60 por 1M de tokens de salida, traspasados a la tarifa del proveedor sin recargo. No se describe ningún cargo separado para la ventana de contexto en sí: 1,048,576 tokens es un límite, no una tarifa. Los tokens de entrada incluyen el texto, las imágenes y el historial de conversación que envías; los tokens de salida cubren todo lo generado, hasta 384,000 tokens.
¿Qué tan grandes son la ventana de contexto y la salida máxima?
DeepSeek V4.1 Flash tiene una ventana de contexto de 1.048.576 tokens y una salida máxima de 384.000 tokens. La ventana de entrada te permite enviar documentos completos, transcripciones o instantáneas de repositorios en una sola llamada, mientras que el límite de salida admite artefactos largos de una sola pasada, como especificaciones, planes de migración o diferencias extendidas.
¿En qué destaca DeepSeek V4.1 Flash?
Está diseñado para el trabajo con entradas largas y salidas largas: análisis de documentos completos, comprensión de código de repositorios grandes, revisión multimodal de texto e imágenes, y flujos de trabajo que necesitan respuestas generadas sustanciales en lugar de respuestas cortas. Su puntuación de 90.9 en GPQA Diamond también indica una sólida capacidad de razonamiento científico y técnico de nivel de posgrado. La entrada admite tanto texto como imágenes; la salida es solo texto.
¿Cómo se compara con modelos frontera más grandes?
Los modelos de frontera pueden liderar en los benchmarks de razonamiento más difíciles y normalmente cobran más por token, mientras que DeepSeek V4.1 Flash ofrece una ventana de contexto de 1,048,576 tokens y un límite de salida de 384,000 tokens a $0.15 por 1M de tokens de entrada y $0.60 por 1M de tokens de salida. Para trabajos de contexto largo y de alto volumen, a menudo es la opción práctica; para los pasos individuales de razonamiento más difíciles, enrutar esas llamadas a un modelo más costoso en OrcaRouter es un patrón razonable.
¿Cómo se manejan los datos cuando llamo a este modelo?
OrcaRouter enruta las solicitudes a la API de DeepSeek y factura a la tarifa del proveedor sin margen de beneficio. La retención, el uso para entrenamiento y los términos relacionados se rigen por las políticas del proveedor en lugar de por un acuerdo aparte descrito aquí, así que confirma los términos actuales del proveedor antes de enviar material sensible. Elimina los identificadores que no necesites y mantén las prompts al mínimo que requiera la tarea; un contexto más pequeño también reduce el coste de entrada a $0.15 por 1M tokens.
¿Cómo lo llamo a través de una API compatible con OpenAI?
Establece la URL base de tu cliente en https://api.orcarouter.ai/v1 y usa el ID de modelo deepseek/deepseek-v4.1-flash con tu clave de API de OrcaRouter. Las solicitudes y respuestas siguen el esquema de chat completions de OpenAI, por lo que los SDK, los controladores de streaming y el parseo de llamadas a herramientas existentes funcionan sin cambios. La migración suele consistir en un cambio de URL base y de cadena de modelo, además de volver a ejecutar tu conjunto de evaluación.
¿Puede DeepSeek V4.1 Flash aceptar imágenes?
Sí. La entrada de imágenes se admite a través del arreglo estándar de contenido multimodal, con partes de texto e imagen en el mismo mensaje del usuario. Los tokens de imagen cuentan como entrada y se facturan a $0.15 por 1M de tokens de entrada en OrcaRouter. La salida sigue siendo solo texto, por lo que el modelo describe o extrae de las imágenes en lugar de generarlas.
¿Basta un 90,9 en GPQA Diamond para confiar en él para mi tarea?
Es una señal útil, no una garantía. GPQA Diamond mide el razonamiento científico de nivel de posgrado bajo un formato de prompt fijo, lo cual es relevante para responder preguntas técnicas, pero dice poco sobre el recuerdo de contexto largo, el tono o la precisión de extracción en tus datos. Crea un conjunto de evaluación pequeño a partir de entradas reales, ejecútalo con DeepSeek V4.1 Flash y con cualquier ID de modelo alternativo en OrcaRouter, y compara costo y calidad antes de enrutar el tráfico de producción.

Insertar esta insignia

DeepSeek: DeepSeek V4.1 Flash$0.15/M in412ms p50vía OrcaRouter
HTML <a href="https://www.orcarouter.ai/models/deepseek/deepseek-v4.1-flash" target="_blank"> <img src="https://www.orcarouter.ai/embed/deepseek/deepseek-v4.1-flash.svg" alt="DeepSeek: DeepSeek V4.1 Flash en OrcaRouter" /> </a>
Markdown [![DeepSeek: DeepSeek V4.1 Flash](https://www.orcarouter.ai/embed/deepseek/deepseek-v4.1-flash.svg)](https://www.orcarouter.ai/models/deepseek/deepseek-v4.1-flash)

Ficha del modelo como datos

GET /api/public/models/deepseek/deepseek-v4.1-flashAbrir
Legible por máquina:/llms.txt/llms-full.txt