
DeepSeek V4.1 Flash llega a la beta de API de dos días: nueva arquitectura, multimodal nativo y ambición de nivel Pro
- openaiNUEVOOpenAI: GPT-6 Astra2026-09-0455Inteligencia77Código
- googleNUEVOGoogle: Gemini 3.8 Flash2026-09-0247Inteligencia76Código
- qwenNUEVOQwen: Qwen3.8 Max (0902)2026-09-0247Inteligencia72Código
- anthropicNUEVOAnthropic: Claude Fable 5.12026-09-0157Inteligencia82Código
- AlibabaNUEVOQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 por 1M de tokens
- z-aiNUEVOZ.ai: GLM 5.3 Flash2026-08-2646Inteligencia72Código
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.15 / $0.29 por 1M de tokens
- z-aiZ.ai: GLM 5.32026-08-1849Inteligencia75Código
- obsidianQwen3.8 27B2026-08-1541Inteligencia68Código
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1242Inteligencia69Código
- grokSpaceXAI: Grok 4.62026-08-1251Inteligencia77Código
- metaMeta: Muse Spark 1.22026-08-0547Inteligencia72Código
- qwenQwen: Qwen3.8 Max2026-08-0347Inteligencia72Código
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3141Inteligencia69Código
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 por 1M de tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2454Inteligencia78Código
- googleGoogle: Gemini 3.6 Flash2026-07-2140Inteligencia69Código
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2128Inteligencia49Código
DeepSeek V4.1 Flash apareció exactamente donde DeepSeek prueba las cosas antes de anunciarlas: dentro de la API en vivo, bajo un ID de modelo que lleva su propia fecha de caducidad. El ID — deepseek-v4.1-flash-expires-on-0910 — comenzó a funcionar el 8 de septiembre de 2026, después de que el equipo de DeepSeek publicara una prueba interna de «versión intermedia» en sus grupos oficiales de la comunidad, y ese 0910 al final es la historia en miniatura. Se trata de una compilación colocada en el entorno real de la API para una prueba limitada que debe desconectarse en torno al 10 de septiembre, antes de la publicación oficial del lanzamiento que los informantes que señalan el modelo esperan «muy pronto». No es un lanzamiento. No hay ficha del modelo, ni informe técnico, ni entrada de registro de cambios, y a fecha de esta noche, la página pública Models & Pricing de DeepSeek sigue enumerando solo DeepSeek V4 Flash, DeepSeek V4 Pro y DeepSeek-V4-Flash-Vision-Exp.
Todo lo que aparece a continuación debe leerse teniendo en cuenta ese asterisco. El canal oficial aquí es un anuncio de grupo comunitario y un formulario de comentarios adjunto, no una nota de versión. Lo que sigue es la unión de ese anuncio, la cobertura de los medios chinos dentro de las horas posteriores al mismo, y las mediciones de primer día de desarrolladores que apuntaron sus propias claves al endpoint, con las afirmaciones del proveedor y las cifras de la comunidad etiquetadas como lo que son.
Qué pasó realmente hoy
Alrededor de las 15:00 hora de Pekín del 8 de septiembre, el equipo de DeepSeek informó a sus grupos comunitarios oficiales que una versión intermedia —descrita en chino como 中间版本, un punto de control intermedio— se estaba habilitando para pruebas limitadas dentro del entorno real de la API antes de que se lance una versión final. Cualquier persona con una clave de API de DeepSeek puede invocarla: mantén tu URL base y tu clave existentes, y establece el nombre del modelo en deepseek-v4.1-flash-expires-on-0910. Esa es toda la historia del acceso: no hay ningún endpoint separado, ni lista de espera, ni una nueva consola.
El margen práctico es ajustado. El sufijo codifica el plan: la versión de prueba "expirará automáticamente y se desconectará el 10 de septiembre", dejando aproximadamente dos días de funcionamiento. Cada cuenta está limitada a un máximo de 20 solicitudes concurrentes — frente al límite de 2500 concurrencias que DeepSeek publica para deepseek-v4-flash —, lo cual es una fuerte señal sobre la intención: esto es para pruebas funcionales y evaluación, no para enviarle tráfico de producción.
• Qué es — un punto de control de «versión intermedia» colocado en la API en vivo para pruebas a corto plazo antes de una compilación oficial.
• Dónde se ejecuta — la propia API de DeepSeek; URL base y clave sin cambios; nombre del modelo cambiado a deepseek-v4.1-flash-expires-on-0910.
• ¿Cuánto tiempo? — el nombre dice expires-on-0910; se espera que la prueba se desconecte alrededor del 10 de septiembre.
• Quién puede llamarlo — cualquier cuenta con una clave de DeepSeek, a 20 solicitudes concurrentes por cuenta.

Lo que factura la beta: la tarjeta de tarifas de DeepSeek V4 Flash
DeepSeek dijo que la prueba se factura a las mismas tarifas que deepseek-v4-flash, y la lista de precios actual de ese modelo es la que aplica. Desde el reajuste de precios del 16 de agosto de 2026, DeepSeek utiliza precios pico/valle; las cifras exactas son las oficiales para el nivel Flash:
• Entrada, acierto de caché — $0.007 por 1M de tokens fuera de horas punta, $0.014 en horas punta
• Entrada, fallo de caché: $0,22 por 1M de tokens fuera de horas pico, $0,44 en horas pico
• Salida — $0.66 por 1M de tokens en horas valle, $1.32 en horas pico
• Horas punta — 01:00–04:00 y 06:00–10:00 UTC, de lunes a viernes; todas las demás horas son horas valle a la mitad de la tarifa de las horas punta

Nótese lo que no cambió: el precio por token. La afirmación de DeepSeek de que V4.1 Flash es de "menor costo" es, por lo tanto, una afirmación de eficiencia, no un recorte de tarifas — un punto que varios evaluadores del primer día comprobaron a su costa, al ver que una sesión de cinco minutos descontaba de su saldo mucho más que los mismos cinco minutos en DeepSeek V4 Flash, porque el modelo gasta tokens mucho más rápido. Que el costo por tarea realmente baje depende de si completa el trabajo con menos tokens y menos reintentos, lo cual nadie puede juzgar a partir de dos días de pruebas de velocidad.
Qué significa «nueva arquitectura, multimodal nativo» — hasta ahora, no verificado.
La descripción oficial de DeepSeek sobre V4.1 Flash presenta cuatro afirmaciones: una nueva estructura de modelo, soporte multimodal nativo, mayor capacidad y generación más rápida. La afirmación sobre la arquitectura es la que destaca, porque rompe un patrón. La actualización anterior, DeepSeek V4 Flash 0731, fue una actualización de post-entrenamiento que mantuvo la misma arquitectura y escala que su versión preliminar; la redacción de DeepSeek apunta aquí a un cambio estructural, y varios medios lo interpretaron como una señal de que el modelo fue reentrenado en lugar de afinado. Más allá de eso, todo es inferencia. La especulación de la comunidad sobre mecanismos de atención modificados, redes de expertos o un módulo de visión integrado es exactamente eso: especulación. No se ha publicado ningún recuento de parámetros, ninguna cifra de ventana de contexto, ninguna tabla de benchmarks ni ningún informe técnico.
La redacción de "multimodal nativo" importa por una razón específica. DeepSeek-V4-Flash-Vision-Exp, lanzado el 21 de agosto y con pesos abiertos desde el 31 de agosto, acopló un codificador de visión a la base textual de DeepSeek V4 Flash; los propios materiales de DeepSeek describían el conjunto como un modelo de texto más una ruta de visión externa. V4.1 Flash se describe como multimodal desde su concepción, con la entrada de imagen y texto gestionada por el propio modelo base. En principio, esa es una diferencia arquitectónica real, pero la especificación de modalidad no se ha publicado: lo que los evaluadores han ejercitado es texto más imágenes, y un lector debería considerar "multimodal" como confirmado solo en ese sentido de texto e imagen hasta que aparezca la tarjeta del modelo. Si un conjunto de entradas más amplio forma parte del plan es, al momento de escribir esto, algo desconocido más que confirmado.
La velocidad es el titular — y es una medición comunitaria
La cifra que circula el primer día es de aproximadamente 420 tokens de salida por segundo en generaciones largas, con picos reportados por encima de 500 tokens/s en ejecuciones individuales. Una prueba ampliamente compartida generó más de 71 000 tokens en menos de tres minutos. Nada de esto es oficial: son mediciones de desarrolladores contra el endpoint beta, bajo condiciones no controladas, y DeepSeek no ha publicado ningún benchmark de velocidad propio. Como referencia, Artificial Analysis mide el endpoint público DeepSeek V4 Flash 0731 en aproximadamente 128 tokens/s, por lo que los primeros informes apuntan a un salto de rendimiento bruto del orden de tres veces o más, con la advertencia habitual de que el rendimiento depende de la longitud de entrada, la concurrencia y las condiciones del servidor.
Las comparaciones de extremo a extremo contra DeepSeek-V4-Flash-Vision-Exp son donde la brecha parece más amplia, porque miden la misma tarea consecutivamente. Los evaluadores informaron aproximadamente 6× más rápido de extremo a extremo en una tarea de generación de código SVG, alrededor de 5.2× en una recuperación de contexto largo de 49k tokens, cerca de 5× en una tarea grande de generación y optimización de SQL, 4.6× en un problema algorítmico y 3.9× en una tarea de refactorización asíncrona. Trátalos como indicativos, no precisos: los números de extremo a extremo de la misma tarea incluyen el tiempo de razonamiento, la latencia del primer token y la velocidad de generación, y provienen de evaluadores individuales en lugar de una suite controlada. La dirección consistente en todos ellos es la señal interesante, no un multiplicador único.
La pregunta en el corazón de la beta
El detalle más estratégico se esconde en el formulario de comentarios que DeepSeek adjuntó a la prueba. Además de preguntas sobre frameworks de agentes y escenarios del mundo real, pregunta directamente a los evaluadores si la versión intermedia de DeepSeek V4.1 Flash «puede reemplazar por completo al DeepSeek V4 Pro en línea». Es una pregunta sorprendente para que una empresa la plantee a sus usuarios, porque DeepSeek V4 Pro se sitúa tres niveles de precio por encima de Flash: a las tarifas oficiales actuales, el modelo Pro cobra 0,66 $ por 1M de tokens de entrada (cache miss) y 1,98 $ por 1M de tokens de salida fuera de horas punta, frente a los 0,22 $ y 0,66 $ de DeepSeek V4 Flash — un 3× exacto en cada línea. Si un modelo de gama Flash se acerca de verdad a la capacidad de nivel Pro a precios de gama Flash, la pregunta se responde sola para una buena parte de los usuarios, y DeepSeek lo sabe.
Leído junto con la redacción de "nueva estructura", el cuestionario sugiere que V4.1 Flash es el primer paso visible de algo más grande que una renovación puntual: una línea Flash reposicionada para reducir la brecha con el buque insignia, de la misma manera que DeepSeek ha utilizado repetidamente un modelo más barato y rápido para redefinir las expectativas del mercado sobre lo que ofrece un nivel de precio. Nada de eso está confirmado por un benchmark; es una lectura estratégica de una pregunta de dos frases. Pero es lo más interesante que DeepSeek ha dicho sobre V4.1 Flash en todo el día.
Dónde probarlo y qué ejecutar en producción mientras tanto
Durante la ventana de pruebas, el único lugar para acceder a V4.1 Flash es la API propia de DeepSeek: no existe alojamiento de terceros para una compilación que caduca en dos días, y nadie debería conectar una ruta de producción a un ID de modelo que está programado para dejar de responder. Lo sensato es usar los próximos dos días para la evaluación: ejecute sus cargas de trabajo representativas, mida la calidad y la economía real de tokens, y considere anecdótica cualquier cifra de velocidad hasta que aparezca un lanzamiento formal con una tarjeta de modelo.
Para el tráfico que tiene que seguir funcionando, la línea pública de modelos de DeepSeek no cambia, y es ahí donde una capa de enrutamiento demuestra su valía. En OrcaRouter, DeepSeek V4 Flash, DeepSeek V4 Pro y DeepSeek-V4-Flash-Vision-Exp son accesibles a través de una sola API al precio de lista de DeepSeek, sin ningún margen añadido — así que el recorte de precios de agosto ha estado en vigor en nuestra plataforma desde el mismo día en que se anunció, no cuando a una hoja de cálculo de márgenes le dio por aplicarlo. Cuando una versión formal de V4.1 Flash llegue por fin a los proveedores, la misma configuración es la vía de bajo costo para adoptarla: envía una parte del tráfico al nuevo modelo, mantén DeepSeek V4 Flash o V4 Pro como conmutación automática por error y deja que el DSL del router decida qué llamadas merecen el modelo no probado y cuáles deben quedarse en el caballo de batalla. No tienes que apostar una ruta de producción por una beta de dos días para saber si es buena.

Preguntas abiertas
• ¿Cuándo sale el lanzamiento oficial? La señal que marcó este modelo indica que se espera una publicación de lanzamiento "muy pronto"; la vida útil de dos días de la beta sugiere que DeepSeek no tiene intención de mantener al mundo esperando mucho tiempo.
• ¿La compilación final coincide con esta? Los evaluadores independientes que siguen los ciclos de pruebas de DeepSeek señalan que la empresa parece estar ejecutando múltiples compilaciones candidatas en paralelo, y la candidata más rápida en una prueba temprana no siempre es la que se lanza, por lo que los números de velocidad de hoy pueden no describir el modelo GA.
• ¿Cuáles son las especificaciones? El número de parámetros, los detalles de la arquitectura, la longitud del contexto y la lista completa de modalidades de entrada no están publicados, y son lo primero que necesita una reseña real.
• ¿Se mantiene el precio y sobrevive el "menor costo" al contacto con cargas de trabajo reales? La versión beta factura según las tarifas de DeepSeek V4 Flash; un lanzamiento podría traer una nueva tabla de precios, y el costo por tarea no está medido.
• ¿Puede realmente desempeñar funciones Pro? El cuestionario plantea la pregunta, pero solo las evaluaciones independientes en conjuntos de pruebas de agencia y razonamiento — los puntos de referencia que hoy separan el nivel Flash del nivel Pro — pueden responderla.
Si tienes una clave de DeepSeek, el reloj de dos días es la cuestión: invoca a deepseek-v4.1-flash-expires-on-0910 antes de que desaparezca, ejecuta tus propias cargas de trabajo y archiva los números bajo «medido por la comunidad, las condiciones varían». Para todos los demás, lo que hay que observar es la publicación del lanzamiento, y la pregunta detrás de ella: si el nivel más barato de DeepSeek acaba de empezar a apuntar al más caro.
Mientras la beta de dos días se estabiliza, el modelo Flash estable que puedes ejecutar hoy está a una llamada de API: DeepSeek V4 Flash on OrcaRouter — al precio de lista de DeepSeek, con un margen del 0%.
Y el buque insignia contra el cual el cuestionario beta sigue pidiendo a los evaluadores que comparen V4.1 Flash: DeepSeek V4 Pro on OrcaRouter.
Comparados en este artículo3
Detectado en este artículo · Benchmarks: Artificial Analysis · actualizado a diario
