Tarjeta de título principal: DeepSeek V4.1 Flash vs Gemini 3.1 Pro — uno de estos sigue siendo una vista previa
Guides & Insights

DeepSeek V4.1 Flash vs Gemini 3.1 Pro: Uno de estos sigue siendo una vista previa

Autor

Elias Hawthorne

Fecha de publicación

Últimos modelos · 20Ver todos los modelos
Benchmarks: Artificial Analysis · actualizado a diario
Volver a todas las publicaciones

Lo más útil que hay que saber sobre DeepSeek V4.1 Flash frente a Gemini 3.1 Pro no está impreso en ninguna de las dos hojas de especificaciones. DeepSeek V4.1 Flash es un modelo disponible de forma general, lanzado el 10 de septiembre de 2026 con pesos bajo licencia MIT que puedes descargar. Gemini 3.1 Pro lleva en vista previa desde el 19 de febrero de 2026 y, aproximadamente siete meses después, todavía se sirve con un nombre de compilación de vista previa. Esa asimetría no decide qué modelo es mejor, pero sí decide qué tipo de compromiso asumes cuando construyes sobre uno de ellos, y es el marco para todo lo que sigue.

Ambos tienen un millón de tokens de contexto. Ambos aceptan imágenes. Las diferencias que realmente los separan son la curva de precios por encima de 200.000 tokens de entrada, las modalidades de entrada, el límite máximo de salida y el hecho de que uno de estos dos es un archivo que puedes poseer y el otro es una API.

En qué punto están realmente los dos

• Precio por 1M de tokens, con hasta 200K de contexto — DeepSeek V4.1 Flash $0.15 de entrada / $0.60 de salida frente a Gemini 3.1 Pro $2.00 de entrada / $12.00 de salida. Eso es 13 veces el precio de entrada y 20 veces el precio de salida.

• Precio por 1M de tokens, con más de 200K de contexto — V4.1 Flash permanece sin cambios en $0.15 / $0.60 frente a Gemini 3.1 Pro a $4.00 de entrada / $18.00 de salida. El múltiplo de entrada se amplía a 27× justo en el punto donde reside el trabajo de contexto largo.

• Entrada en caché — V4.1 Flash $0.003 por 1M fuera de horas pico frente a Gemini 3.1 Pro $0.40 por 1M. Dos órdenes de magnitud, en la partida que decide si un contexto de relectura es asequible.

• Ventana de contexto — 1M tokens vs 1M tokens. Nivel.

• Salida máxima — V4.1 Flash 384K tokens vs Gemini 3.1 Pro 65K tokens. Seis veces el techo.

• Modalidades de entrada: V4.1 Flash acepta texto e imágenes, mientras que Gemini 3.1 Pro acepta texto, imágenes, audio, vídeo y carga de archivos.

• Pesos — V4.1 Flash MIT, descargable frente a Gemini 3.1 Pro cerrado, solo API.

• Estado de lanzamiento — V4.1 Flash disponible de forma general desde el 10 de septiembre de 2026 frente a Gemini 3.1 Pro en vista previa desde el 19 de febrero de 2026.

• Latencia observada al primer token: V4.1 Flash 2,63 s en p50 y 9,05 s en p95 frente a Gemini 3.1 Pro 10,00 s en p50 y 10,00 s en p95, según la propia telemetría de 7 días de OrcaRouter. La espera mediana del modelo costoso está en el techo de la telemetría, y su cola no se despega de él.

Lee la lista sin los precios y la forma resulta familiar de todas las comparaciones entre pesos abiertos y modelos frontera: el modelo descargable gana en techo de salida, empata en contexto y va por delante en latencia observada. El modelo cerrado gana en modalidades y, en esas, gana de forma rotunda. Nada de esto explica por sí solo un múltiplo de 13× en la entrada.

Two-column scoreboard: DeepSeek V4.1 Flash vs Gemini 3.1 Pro — price per 1M tokens $0.15 input and $0.60 output vs $2.00 and $12.00 up to 200K and $4.00 and $18.00 above, cached input $0.003 vs $0.40, context window 1M tokens on both, max output 384K tokens vs 65K tokens, input modalities text and images vs audio, file, image, text and video, weights MIT vs closed, release state generally available since 2026-09-10 vs in preview since 2026-02-19, and a time to first token of 2.63 s at p50 and 9.05 s at p95 vs 10.00 s at p50 and p95

El precipicio de los 200K es la historia de los precios

La tarifa destacada de Gemini 3.1 Pro no es una única tarifa. Los prompts de hasta 200.000 tokens de entrada se facturan a $2.00 de entrada y $12.00 de salida por millón; un prompt que supera ese umbral se factura a $4.00 y $18.00. DeepSeek V4.1 Flash no tiene tramos: cobra $0.15 y $0.60, ya sea que la solicitud sea de 2.000 tokens o de 900.000, con la única salvedad de que DeepSeek duplica su tarifa durante las horas pico y opera por completo fuera de pico los fines de semana.

Ese límite de nivel cae en el peor lugar posible para el trabajo de contexto largo, porque el trabajo de contexto largo es, por definición, el trabajo que lo cruza. Una comparación práctica lo hace concreto. Tomemos un pipeline que hace 20.000 llamadas al mes, cada una con un promedio de 250.000 tokens de entrada y 4.000 tokens de salida — un trabajo de análisis de documentos sobre archivos grandes.

• DeepSeek V4.1 Flash a tarifas de horas valle: 20,000 × 250,000 son 5,000M tokens de entrada a $0.15 por millón, o $750.00. La salida es 20,000 × 4,000, que son 80M tokens a $0.60 por millón, o $48.00. Total: $798.00.

• Gemini 3.1 Pro en su nivel de más de 200 K: los mismos 5.000 M de tokens de entrada a $4,00 por millón son $20.000,00, y 80 M de tokens de salida a $18,00 por millón son $1.440,00. Total: $21.440,00.

Esa es una diferencia de 27× en el gasto mensual con tráfico idéntico, y no es el múltiplo que habrías supuesto a partir de las cifras destacadas. El múltiplo destacado es 13×. El múltiplo que realmente pagas por trabajo de contexto largo es 27×, porque el límite del nivel está exactamente donde se sitúan tus prompts.

Lo que realmente te cuesta la etiqueta de vista previa

Una compilación de vista previa es una compilación de vista previa en toda la industria: no conlleva ninguna garantía de estabilidad publicada. El proveedor no se ha comprometido a mantener el endpoint con ese comportamiento, ese precio o ese nombre. Eso no es una crítica a Gemini 3.1 Pro —es lo que significa la etiqueta, y es la razón por la que el sufijo «preview» ha perdurado siete meses en lugar de ser una formalidad de dos semanas.

Para un prototipo, esto no es nada. Para una ruta de producción, es un riesgo específico y cuantificable: estás apostando a que la compilación con la que ajustaste se mantiene tal cual. El contraste con el otro lado de esta comparación es estructural, no retórico. DeepSeek V4.1 Flash está disponible de forma general (GA), y sus pesos tienen licencia MIT y se pueden descargar, lo que significa que, incluso si la API alojada cambiara sus términos mañana, el modelo en sí seguiría en tus manos. Un modelo de vista previa cerrado no te da ni el compromiso de GA ni la vía de escape. Si tu carga de trabajo puede ejecutarse en cualquiera de los dos, esa diferencia vale más que un punto de benchmark.

Donde Gemini 3.1 Pro es el mejor instrumento

La brecha de modalidades no es un error de redondeo, y es la única dimensión de esta lista en la que no se puede sustituir por el modelo barato a ningún precio. Gemini 3.1 Pro acepta audio y video como entrada de primera clase, además de carga de archivos. DeepSeek V4.1 Flash acepta texto e imágenes. Si tu pipeline ingiere una grabación de llamada, una captura de pantalla o una reseña en video, DeepSeek V4.1 Flash no es una opción más barata — no es una opción. El factor de 13× es irrelevante para una tarea que un modelo puede hacer y el otro no.

Hay un segundo caso, más silencioso. Gemini 3.1 Pro ha estado disponible públicamente, de alguna forma, desde febrero, y es el modelo con el historial de producción más largo: más personas se han topado con sus límites, y su comportamiento con tráfico real está mejor documentado que el de un lanzamiento de doce días. Para el trabajo interactivo intensivo en salida, donde una espera mediana de diez segundos es aceptable porque la tarea se ejecuta en segundo plano, ese historial es el argumento, y es un argumento real. No es un argumento de latencia: según la telemetría anterior, el modelo más barato es el más rápido de los dos tanto en la mediana como en la cola.

Y está la cuestión de qué significa la etiqueta de preview para ese historial. Siete meses de disponibilidad bajo un nombre de compilación preliminar es más de lo que consiguen la mayoría de los modelos, y también son siete meses sin un compromiso de GA. DeepSeek V4.1 Flash tiene doce días en el momento de escribir esto y su historial independiente es escaso: la única evaluación reciente de terceros en la que aparece, el tablero de codificación agéntica Agents on Rails publicado el 21 de septiembre de 2026, lo situó en un 17 % con esfuerzo máximo, a mitad de tabla. Doce días no son tiempo suficiente para que la reputación de un modelo signifique algo, en ninguna de las dos direcciones —que es la razón honesta por la que un comprador podría preferir aquí el modelo más antiguo, y no tiene nada que ver con la velocidad.

Enrutar según la longitud del contexto, porque esa es la verdadera decisión.

La decisión que implica esta comparación no es «elegir una». Es una regla con dos cláusulas: el trabajo de contexto largo y alto volumen va a DeepSeek V4.1 Flash, y cualquier cosa con audio o video va a Gemini 3.1 Pro. La parte incómoda es que esta regla es fácil de enunciar y molesta de implementar, porque las dos cláusulas normalmente viven en proveedores distintos con claves distintas, SDK distintos y límites de velocidad distintos.

Se puede acceder a ambos modelos desde una única clave de OrcaRouter, lo que convierte la regla en una regla de enrutamiento en lugar de código con ramificaciones en tu aplicación — puedes basar la decisión directamente en la longitud del contexto de la solicitud, que es la dimensión que realmente impulsa la diferencia de coste aquí. OrcaRouter transfiere los precios de lista del proveedor con un 0 % de margen, por lo que las tarifas escalonadas anteriores son las propias de Google y el calendario de picos de DeepSeek es el propio de DeepSeek, con un cambio de precio de un proveedor activo en nuestro lado el mismo día. Y como uno de los lados de este emparejamiento es una compilación preliminar, vale la pena respaldarla con conmutación automática por error: si la compilación se modifica bajo tus pies, la solicitud llega al otro modelo en lugar de a una página de error.

Ese último punto es la versión práctica de todo lo anterior. El múltiplo de 27× en el trabajo de contexto largo es la razón para enrutar en lugar de elegir, y la etiqueta de vista previa en uno de los dos modelos es la razón para tener un destino al que dirigir la solicitud cuando cambie la compilación.

Screenshot of the OrcaRouter model page for google/gemini-3.1-pro-preview, showing the model id, 1M-token context, 65K max output, audio, file, image, text and video input, $2.00 input and $12.00 output per 1M tokens, and observed time to first token of 10.00 s at both p50 and p95

Qué ver

• Si Gemini 3.1 Pro sale de la vista previa. Un lanzamiento GA eliminaría la advertencia sobre la estabilidad y cambiaría la forma de esta comparación más de lo que lo haría cualquier movimiento de precios.

• Si cambia el tramo de más de 200 K. El límite del tramo hace más trabajo en la aritmética del costo que la tarifa titular.

• Si DeepSeek V4.1 Flash acumula un historial independiente. Un modelo con pesos MIT, un techo de salida de 384K y un contexto de 1M a 0,15 $ por millón de tokens de entrada es un paquete poco habitual; si la capacidad está ahí es una pregunta que ningún benchmark público ha respondido todavía.

Hasta que llegue el primero de esos, el resumen preciso es este: DeepSeek V4.1 Flash es aproximadamente trece veces más barato en entrada y veintisiete veces más barato en entrada de contexto largo que Gemini 3.1 Pro, es el único de los dos que puedes descargar, y es el único de los dos con un compromiso de disponibilidad general (GA) detrás. Gemini 3.1 Pro es el modelo con el historial de producción más largo y es el único de los dos que puede leer audio y video. Enruta en consecuencia.

Screenshot of DeepSeek's own release page for DeepSeek-V4.1-Flash dated 2026/09/10, showing the 552B-parameter MoE architecture with 8B active for input and 16B for output, a KV-cache memory-reduction graphic, and DeepSeek's own four-benchmark comparison chart