
Precios de DeepSeek V4.1 Flash: La lista completa de tarifas y el número de aciertos de caché que decide tu factura
- openaiNUEVOOpenAI: GPT-6 Luna2026-09-2237Inteligencia
- openaiNUEVOOpenAI: GPT-6 Sol2026-09-2248Inteligencia
- anthropicNUEVOAnthropic: Claude Opus 5.52026-09-2258Inteligencia
- grokNUEVOGrok 4.72026-09-2146Inteligencia
- OrcaNUEVOOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 por 1M de tokens · 177 tok/s
- orcaNUEVOOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 por 1M de tokens · 1323 tok/s
- deepseekNUEVODeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligencia
- openaiOpenAI: GPT-6 Astra2026-09-0453Inteligencia77Código
- googleGoogle: Gemini 3.8 Flash2026-09-0241Inteligencia76Código
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Inteligencia76Código
- anthropicAnthropic: Claude Fable 5.12026-09-0153Inteligencia82Código
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 por 1M de tokens · 108 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligencia72Código
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 por 1M de tokens · 220 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Inteligencia75Código
- obsidianQwen3.8 27B2026-08-1534Inteligencia68Código
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Inteligencia69Código
- grokSpaceXAI: Grok 4.62026-08-1244Inteligencia77Código
- metaMeta: Muse Spark 1.22026-08-0540Inteligencia72Código
- qwenQwen: Qwen3.8 Max2026-08-0345Inteligencia76Código
DeepSeek V4.1 Flash está disponible de forma general desde el 10 de septiembre de 2026 y, a día de hoy, su tarifa publicada es lo más barato de la gama alta del mercado de modelos: 0,15 $ por millón de tokens de entrada, 0,60 $ por millón de salida y 0,003 $ por millón en aciertos de caché. Esas tres cifras corresponden a la columna de horas valle. Durante las ventanas de hora punta entre semana de DeepSeek, todas ellas se duplican, incluidos los aciertos de caché. La comparación que importa no es con el propio buque insignia envejecido de DeepSeek —DeepSeek-V4-Pro-0813 tiene un precio de 0,66 $ / 1,98 $ por millón en horas valle, por lo que Flash es unas 4 veces más barato que su propio hermano en entrada—, sino con la gama cerrada de frontera con la que los compradores realmente comparan precios: GPT-5.6 Sol, Claude Opus 5 y Gemini 3.8 Flash, cada uno de los cuales cobra un orden de magnitud más por token.
Una corrección antes de las cifras, porque la filtración que precedió a este lanzamiento sigue circulando. Las cifras que se difundieron antes de la disponibilidad general (GA) describían una rebaja de precios que llegaría «mañana». Los precios son reales; el encuadre no. V4.1 Flash se lanzó el 2026-09-10 con estas tarifas ya en vigor, y el propio registro de cambios de DeepSeek registra la reducción como parte del lanzamiento y no como un recorte posterior. Todo lo que aparece a continuación se ha tomado de la página de precios en vivo de DeepSeek hoy, 2026-09-16.
El tarifario completo, a fecha de 2026-09-16
DeepSeek publica una hoja que cubre los SKU actuales, con cada línea de artículo dividida en una columna de hora punta y otra de hora valle. Para el id de modelo deepseek-flash, que sirve a DeepSeek-V4.1-Flash, las tarifas publicadas son:
• Entrada, fallo de caché — 0,15 $ por 1M de tokens fuera de horas punta; 0,30 $ por 1M en horas punta
• Entrada, acierto de caché — $0.003 por 1M de tokens fuera de horas punta; $0.006 por 1M en horas punta
• Salida — 0,60 $ por 1 M de tokens fuera de horas punta; 1,20 $ por 1 M en horas punta
• Ventana de contexto — 1M tokens, con una salida máxima de 384K
• Límite de concurrencia — 2.500 solicitudes simultáneas en la SKU Flash
• Identificadores de modelos heredados — deepseek-v4-flash y deepseek-v4-flash-vision-exp están retirados como productos independientes, pero siguen enrutándose a V4.1 Flash y se facturan a precios de Flash
La brecha entre las dos primeras líneas es toda la historia de esta hoja. Un acierto de caché cuesta 50 veces menos que un fallo de caché fuera de horas punta —un descuento del 98%, que es también como lo representa Artificial Analysis en su modelo de costos. Ninguna otra cosa en la tarjeta mueve una factura tanto.


Peak no es un error de redondeo, y está programado para Pekín
Las ventanas de hora pico de DeepSeek son de lunes a viernes, de 01:00 a 04:00 UTC y de 06:00 a 10:00 UTC. Todo lo que quede fuera de ellas —incluidas todas las horas del fin de semana— se factura a mitad de tarifa. La duplicación se aplica a las tres líneas, por lo que un fallo de caché en hora pico cuesta $0.30 y la salida en hora pico cuesta $1.20.
Dónde caen esas ventanas depende por completo de dónde estés. En Pekín son las 09:00–12:00 y las 14:00–18:00 — dos bloques de trabajo, que es lo esencial. En Berlín, en septiembre, la segunda ventana es 08:00–12:00 CEST: toda la mañana de un equipo europeo es hora punta. En Nueva York, esa misma ventana es 02:00–06:00 EDT. Un equipo con sede en EE. UU. que trabaja en horario normal prácticamente nunca recibe facturación a tarifa de hora punta, y un equipo de la UE paga el doble cada mañana antes del almuerzo. Si estás eligiendo cuándo ejecutar un trabajo por lotes, esa es una decisión que vale 0,15 $ por millón de tokens y no cuesta nada tomarla.
Lo que el precio de aciertos de caché realmente le hace a la factura de un agente
Los aciertos de caché son automáticos en DeepSeek —la documentación dice que el almacenamiento en caché de disco está habilitado de forma predeterminada para todos los usuarios sin necesidad de cambiar el código—, así que el descuento no es algo para lo que tengas que diseñar la arquitectura. Además, es de mejor esfuerzo, no está garantizado: DeepSeek afirma que no hay un TTL fijo, que una caché sin usar se elimina "normalmente en unas pocas horas o unos pocos días", y que el sistema no promete una tasa de aciertos del 100 %. Vale la pena leer los campos de la respuesta prompt_cache_hit_tokens y prompt_cache_miss_tokensantes de basar cualquier cosa en esto.
La aritmética importa más que el adjetivo. Tomemos un agente de programación con un prefijo estable de 40.000 tokens —prompt del sistema, esquemas de herramientas, contexto del repositorio— ejecutado durante una sesión de 60 turnos, en la que cada turno añade unos 2.000 tokens de salida de herramientas y el modelo emite unos 1.200 tokens. La entrada total a lo largo de la sesión es de 5,94 M de tokens y la salida total es de 72.000 tokens.
Facturado sin caché en absoluto, fuera de horas punta: 5,94 M de entrada a $0,15 son $0,891, más 72.000 de salida a $0,60 son $0,043 — unos $0,93 por la sesión.
Facturado con el prefijo en caché, que es lo que realmente ocurre de forma predeterminada: 5,782 M de esos tokens de entrada llegan como aciertos de caché a $0,003 ($0,017), 158.000 llegan como fallos de caché a $0,15 ($0,024), y los mismos 72.000 tokens de salida cuestan $0,043. Aproximadamente $0,084 — aproximadamente 11 veces más barato. La entrada cae del 95 % de la factura al 49 % de esta, la parte en caché por sí sola es el 21 %, y los tokens de salida se convierten en la mayor línea individual. El mismo modelo, la misma sesión, la misma salida — lo único que cambió es si se reutilizó el prefijo.
Fíjate en lo que no está en la hoja de DeepSeek: una línea de escritura en caché. Anthropic cobra 1,25x la entrada base para llenar una caché de 5 minutos y 2x por una hora; la tarjeta de DeepSeek solo enumera aciertos y fallos, y su guía de caché no describe ninguna tarifa de escritura ni de almacenamiento. Si estás comparando la economía de la caché entre proveedores en lugar de las tarifas por token más destacadas, esa ausencia vale más de lo que sugiere el descuento de 50x por acierto.
También es por eso que el detalle de traspaso de precios de DeepSeek V4.1 Flash en OrcaRouter importa aquí. Facturamos a la tarifa de lista propia del proveedor sin ningún margen, así que un cambio de precio del proveedor se refleja en nuestro lado el mismo día en lugar de esperar a un proceso de recotización, y las columnas de aciertos de caché y de pico/fuera de pico que ves arriba son aquellas contra las que realmente se te factura, no una aproximación combinada de ellas.

Frente a DeepSeek-V4-Pro-0813: una brecha de 4x, y una retirada que no se produjo
La comparación interna obvia es el SKU insignia, y es menos drástica de lo que sugiere la tarifa anunciada. DeepSeek-V4-Pro-0813, el id del modelo deepseek-v4-pro, tiene un precio de lista de $0.66 por 1M de entrada en un fallo de caché y $1.98 por 1M de salida fuera de horas pico, duplicándose en horas pico a $1.32 y $3.96. Sus aciertos de caché cuestan $0.022 fuera de horas pico, más de 7 veces los de Flash.
• Entrada con fallo de caché — $0.15 vs $0.66 en horario de menor demanda, así que Flash es 4.4x más barato
• Salida — $0.60 vs $1.98 fuera de horas pico, por lo que Flash es 3.3x más barato
• Entrada con acierto de caché — $0,003 frente a $0,022 fuera de hora punta, así que Flash es 7,3 veces más barato
• Límite de contexto y de salida — idéntico en 1M y 384K en ambos SKU
• Concurrencia — 2.500 en Flash frente a 500 en V4 Pro, una diferencia de 5 veces que desaparece por completo de la hoja de precios
Tres cosas de esta comparación son fáciles de malinterpretar. Primero, el argumento de la reutilización es más contundente en el modelo insignia en términos absolutos, aunque Flash tiene el multiplicador más alto: cachear un millón de tokens ahorra $0,638 en V4 Pro y $0,147 en Flash, porque la tasa de fallos del insignia es mucho mayor de entrada. Segundo, el modelo que todos esperaban que hubiera desaparecido no desapareció: DeepSeek anunció que dejaría de servir V4 Pro el 2026-09-14 y desviaría esas solicitudes a Flash, lo que provocó una reacción negativa de los desarrolladores por cambiar un modelo de backend bajo flujos de trabajo en producción, y revirtió la decisión el 2026-09-11. V4 Pro se sigue sirviendo, con la misma facturación. Tercero, y esta es la trampa en la que cayó la cobertura de la filtración — no existe un V4.1 Pro publicado. DeepSeek-V4-Pro-0813 sigue siendo el SKU insignia, y el proveedor no ha lanzado un sucesor con ese nombre. Cualquiera que calcule el precio de una migración a «V4.1 Pro» le está poniendo precio a un modelo que no existe.
Frente al nivel de frontera cerrado
Frente a los modelos cerrados que los compradores realmente preseleccionan, el multiplicador es lo más destacado. Todas las cifras a continuación proceden de la página de precios publicada por cada proveedor hoy mismo.
• GPT-5.6 Sol — tiene un precio de lista de $5.00 por 1M de entrada y $30.00 por 1M de salida en el nivel de contexto corto de OpenAI; actualmente cuenta con una tarifa promocional de $4.00 / $20.00 que, según OpenAI, estará disponible al menos hasta el 2026-11-21, con entrada en caché a $0.40. Frente a la tarifa promocional, DeepSeek V4.1 Flash es 26.7 veces más barato en entrada y 33.3 veces en salida; frente al precio de lista, 33 veces y 50 veces. Un acierto de caché de Sol cuesta 133 veces lo que cuesta el de Flash.
• Claude Opus 5 — $5.00 por 1M de entrada y $25.00 por 1M de salida, con aciertos de caché a $0.50 por 1M en la tabla publicada de Anthropic. Eso es 33 veces la tarifa de entrada de Flash, 42 veces su tarifa de salida y 167 veces su tarifa de aciertos de caché. Las escrituras en caché de 5 minutos de Anthropic añaden otro factor de 1.25x adicional; la tabla de DeepSeek no tiene una línea equivalente.
• Gemini 3.8 Flash — $0,75 por 1 M de entrada y $3,75 por 1 M de salida hasta el 31/12/2026, con ambas tarifas programadas para duplicarse el 01/01/2027, entrada en caché a $0,075, y — esta es la línea que se repite en una factura real — almacenamiento en caché a $0,50 por 1 M de tokens por hora. Flash es 5 veces más barato en entrada, 6,25 veces en salida y 25 veces en aciertos de caché frente a él, y DeepSeek no cobra nada por mantener una caché.
El contexto de capacidad es lo que mantiene esto honesto. En el Intelligence Index v4.3 de Artificial Analysis, DeepSeek V4.1 Flash (razonamiento, esfuerzo máximo) obtiene 40 puntos y ocupa el 6.º puesto de 113 modelos, con 0,27 $ por tarea del índice y 214,4 tokens de salida por segundo. Esa es una posición genuinamente cercana a la frontera a un precio 26 veces inferior al del nivel con el que se lo compara, pero la misma medición muestra que es uno de los modelos más verbosos que AA ha probado, generando 250 M de tokens de salida en la ejecución completa del índice frente a una mediana de 140 M. La verbosidad no cambia el precio por token, pero sí cambia la factura. Un modelo que escribe un 62 % más de tokens que la mediana sigue costando mucho menos aquí, pero «barato por token» y «barato por tarea» son afirmaciones distintas, y solo la segunda es lo que pagas.
¿Hay un plan gratuito?
No. La propia página de precios de DeepSeek no documenta ningún nivel gratuito de API, ni cuota mensual gratuita, ni modelo gratuito: la facturación es de pago por uso contra un saldo recargado o concedido, y el saldo concedido se consume primero. La aplicación de chat para consumidores es gratuita; la API que hay detrás de deepseek-flash no lo es, y no existe un endpoint gratuito para ella en la plataforma de DeepSeek. Varias pasarelas de terceros anuncian acceso gratuito o de prueba a este modelo, y consideraríamos todas ellas como superficies de prototipado en lugar de backends de producción, porque esas condiciones cambian sin previo aviso y ninguna de ellas incluye la lista de precios propia del proveedor.
Las afirmaciones de eficiencia detrás del precio
El precio no es un subsidio, al menos según la propia versión de DeepSeek. La ficha de modelo y el informe técnico del proveedor describen V4.1 Flash como una mezcla de expertos de 552B parámetros con una disposición Causal Encoder-Decoder que activa aproximadamente 8B parámetros por token durante el prefill y 16B durante la decodificación —asimétrica por diseño: económica para leer y más costosa para escribir. En el lado de la memoria, DeepSeek informa una caché KV global de aproximadamente 890 bytes por token, más o menos una cuarta parte de la de DeepSeek-V4-Flash, y una huella de caché persistente de alrededor de un octavo de esta en cargas de trabajo idénticas, logrado al descartar el estado de ventana deslizante y reproducir los últimos 128 tokens cuando se produce un acierto. Estas son mediciones reportadas por el proveedor en el propio hardware del proveedor, y el informe técnico no afirma equivalencia matemática con el cómputo completo para la ruta de reproducción.
El recuento de parámetros es la única cifra de este lanzamiento que está verdaderamente sin resolver, y vale la pena precisar por qué. La documentación de DeepSeek informa de 552B, y esa es la columna vertebral — la parte que hace los cálculos. Junto a ella está Engram, una tabla de consulta de memoria condicional que la ficha del modelo cifra en 196B parámetros, a la que se accede mediante consulta de tokens en lugar de calcularse. Si los sumas, te acercas a 748B, que es la cifra que un análisis comunitario muy leído en r/LocalLLaMA defendió a las pocas horas de la publicación de los pesos, y que el propio panel de archivos del repositorio de Hugging Face eleva aún más, hasta cerca de 763B. Los informes de despliegue de la comunidad han calculado que el checkpoint ronda los 510 GB repartidos en 48 fragmentos, distribuido de forma nativa cuantizado como pesos densos FP8 con expertos FP4.Trata el total como disputado y la cifra de la columna vertebral como reportada por el proveedor. Los recuentos de parámetros activos son los que impulsan la velocidad; los pesos residentes son los que deciden si el modelo arranca siquiera.
El autoalojamiento es una alternativa real a este precio, bajo MIT
Los pesos están en deepseek-ai/DeepSeek-V4.1-Flash bajo la licencia MIT, que permite el uso comercial, la modificación y la redistribución. Eso convierte la tarifa de la API en una opción y no en un peaje: con MIT, nada en la licencia te impide servir este modelo por tu cuenta y pagar por cómputo en lugar de por tokens.
Lo que no hace es que sea barato hacerlo. El checkpoint es de aproximadamente 510 GB de pesos residentes antes de caché y activaciones; DeepSeek no indica ningún requisito de GPU en ninguna parte del repositorio, y los artículos de despliegue de la comunidad sitúan el mínimo práctico en un nodo multi-GPU en lugar de una estación de trabajo. Tres stacks de servicio incorporaron soporte desde el día 0 el 2026-09-10 —vLLM, SGLang con Miles y la adaptación NeuWare basada en vLLM de Cambricon para sus propios aceleradores—, pero el día del lanzamiento vLLM y SGLang distribuyeron imágenes de vista previa dedicadas en lugar de paquetes oficiales, y llama.cpp no había fusionado el soporte para la arquitectura V4.1. El autoalojamiento en hardware de consumo no es la alternativa al precio de la API hoy; un nodo alquilado de 8 GPU sí lo es. Si tu volumen es lo bastante grande como para amortizar eso, la licencia te lo permite; si no lo es, $0.15 por millón de tokens es la respuesta más barata, y no hay comparación.
Lo que la tarjeta de tarifas realmente te pide decidir
Tres cosas, en orden de cuánto dinero mueven. Mantén un prefijo de prompt estable y deja que la caché haga su trabajo: es automática, es un descuento de 50x, y en un bucle de agente de 60 turnos convierte una sesión de $0.93 en una de $0.084. Ejecuta tu tráfico por lotes fuera de las 01:00–04:00 y las 06:00–10:00 UTC en días laborables, lo que para un equipo de EE. UU. no supone ningún cambio y para un equipo europeo significa trasladar la tarea de la mañana a la tarde. Y si estás comparando el precio de esto con el propio buque insignia de DeepSeek, recuerda que el buque insignia sigue en oferta: la retirada programada se canceló el 2026-09-11, ambos SKUs están detrás de una sola clave, y cambiar entre ellos es un cambio de id de modelo, no una migración.
Lo que la tarjeta de tarifas no te dice es si el modelo es lo suficientemente bueno para tu carga de trabajo, y los números para eso son más nuevos y más escasos que la hoja de precios. La posición en el índice de Artificial Analysis es una única medición con el máximo esfuerzo de razonamiento, las filas de referencia del proveedor son reportadas por el proveedor, y el recuento de parámetros está en disputa. El precio es la parte resuelta de este lanzamiento. Calcula el costo de tu migración con base en él y prueba la capacidad antes de comprometerte.
Comparados en este artículo4
Detectado en este artículo · Benchmarks: Artificial Analysis · actualizado a diario
