Una tarjeta principal generada titulada MiniMax M3.1 Flash Preview vs. DeepSeek V4 Flash, con el subtítulo 'La misma ventana de 1M de tokens, dos argumentos de venta muy diferentes'. Una tarjeta izquierda dice 'MiniMax M3.1 Flash Preview: contexto de 1M, precio no publicado, solo Token Plan, el pensamiento no se puede desactivar'; una tarjeta derecha dice 'DeepSeek V4 Flash: contexto de 1M, $0.15/$0.60 fuera de horas punta, solo texto, sustituido por V4.1 Flash'. Un pie de página dice 'Las cifras de MiniMax según platform.minimax.io; las cifras de DeepSeek según la tarifa publicada de DeepSeek'.
Engineering & Research

MiniMax M3.1 Flash Preview vs DeepSeek V4 Flash: Dos entradas baratas con contexto de 1M, un enorme asterisco

Autor

Gideon Frost

Fecha de publicación

Últimos modelos · 20Ver todos los modelos →
Benchmarks: Artificial Analysis · actualizado a diario
Volver a todas las publicaciones

Si buscas una ventana de contexto de un millón de tokens a un bajo precio por token, MiniMax-M3.1-Flash-Preview y DeepSeek V4 Flash son los dos nombres que no dejan de aparecer —y no son realmente el mismo tipo de producto. DeepSeek V4 Flash es un modelo retirado cuyo identificador todavía responde, y que vive dentro de una lista de tarifas de proveedor que puedes leer hasta el centavo. MiniMax-M3.1-Flash-Preview es una vista previa activa sin ninguna tarifa publicada. Por lo tanto, la comparación a continuación es en parte una comparación de especificaciones y en parte una demostración de cuán diferente eligen estos dos proveedores vender la misma franja.

Ambos lados de esto merecen exponerse con precisión, porque las cifras que lo deciden están dispersas entre una página de precios de un proveedor, un árbol de documentación de un proveedor y nuestro propio catálogo, y una de las afirmaciones más repetidas sobre DeepSeek V4 Flash —su precio— es una que DeepSeek ya ha reemplazado.

En qué coinciden realmente las dos fichas técnicas

Las especificaciones principales son lo bastante similares como para no ser el factor decisivo, con una excepción que nadie anuncia.

• Ventana de contexto — 1.000.000 de tokens para MiniMax-M3.1-Flash-Preview frente a 1.048.576 de DeepSeek V4 Flash: nominalmente idénticas, una diferencia de 48.576 tokens
• Salida máxima — no publicada para MiniMax-M3.1-Flash-Preview; 384.000 tokens para DeepSeek V4 Flash, algo inusual a este precio y es la cifra que debería decidir muchas compras
• Modalidades de entrada — texto, imagen y vídeo para MiniMax-M3.1-Flash-Preview; solo texto para DeepSeek V4 Flash
• Control de razonamiento — una escala de esfuerzo desde bajo hasta máx, con el razonamiento siempre activado, para MiniMax-M3.1-Flash-Preview; razonamiento o no razonamiento en DeepSeek V4 Flash, con la opción de no razonar como alternativa real
• Compatibilidad de protocolos — endpoints compatibles con Anthropic, compatibles con OpenAI y OpenAI Responses para MiniMax-M3.1-Flash-Preview; los mismos tres más la finalización con prefijo de chat en DeepSeek V4 Flash
• Pesos — ninguno para MiniMax-M3.1-Flash-Preview; los pesos del V4 Flash de DeepSeek se publicaron, aunque el modelo en sí ha quedado superado
• Precio — sin publicar para MiniMax-M3.1-Flash-Preview; publicado y bajo para DeepSeek V4 Flash

Lee esa lista dos veces, porque el límite de salida es el silencioso. Un millón de tokens de contexto con 384.000 tokens de salida es una ventana de generación de una sola pasada genuinamente larga. Un millón de tokens de contexto con un límite de salida no revelado es una promesa sobre la lectura, no sobre la escritura. Si tu carga de trabajo es "leer un repositorio, emitir un plan de migración", el segundo número es el que determina si la tarea cabe en una sola llamada.

En qué se mide cada uno

Esta es la sección menos cómoda de la comparación, y es breve.

DeepSeek V4 Flash tiene un récord de benchmark, y es independiente. Artificial Analysis le otorga 34.3 en el Intelligence Index —el 42.º de 145 modelos en ese índice—, con 69.1 en el Coding Index y 90.8 % en GPQA Diamond. El 95.0 en τ²-Bench con el que encabeza la entrada de nuestro propio catálogo es la misma cifra que llevaba el material de lanzamiento de DeepSeek, así que es un dato del proveedor en compañía de cifras independientes, más que una cifra auditada. Su recall de contexto largo es del 79.7 % y su cifra en terminal-bench es del 78.7 % en el arnés v2.1. Esas son mediciones reales y comparables de un modelo conocido.

MiniMax-M3.1-Flash-Preview no tiene ninguna. MiniMax no publicó ninguna tabla de evaluación con el lanzamiento, y ningún tercero tiene una tampoco — el modelo no aparece en absoluto en el índice de Artificial Analysis. Eso no es una laguna en nuestra investigación; es el estado actual del registro público, y significa que toda afirmación sobre la calidad del modelo más reciente es, en este momento, un adjetivo de proveedor. Cualquiera que te entregue hoy una tabla de benchmarks de MiniMax-M3.1-Flash-Preview o está citando al antiguo MiniMax-M3 o se la está inventando.

A generated two-column scoreboard titled 'MiniMax M3.1 Flash Preview vs DeepSeek V4 Flash — the scoreboard'. The left column, MiniMax M3.1 Flash Preview, reads 'AA Intelligence: none published', 'Coding score: none published', 'Context window: 1M', 'Max output: not published', 'Weights: none', 'Price: not published'. The right column, DeepSeek V4 Flash, reads 'AA Intelligence: 34.3', 'Coding score: 69.1', 'Context window: 1,048,576', 'Max output: 384,000', 'Weights: published', 'Price: $0.15 / $0.60 off-peak'. A footer reads 'MiniMax figures per platform.minimax.io documentation, 27 September 2026; DeepSeek figures per DeepSeek's published rate card and Artificial Analysis. The MiniMax column is empty because nothing has been published, not because a result is pending.'

DeepSeek V4 Flash no se vende al precio que recuerdas

Aquí está la trampa. La cifra ampliamente citada para DeepSeek V4 Flash — 0,14 $ por millón de tokens de entrada y 0,28 $ por millón de tokens de salida — era la tarifa que el modelo tenía antes del 10 de septiembre de 2026. En esa fecha, DeepSeek lanzó DeepSeek-V4.1-Flash, retiró tanto V4 Flash como el experimento V4-Flash-Vision-Exp, y recortó los precios. El deepseek-v4-flash como identificador todavía funciona, pero la documentación de DeepSeek indica que se enruta temporalmente a V4.1 Flash y se factura al precio de Flash. En otras palabras, todavía puedes escribir el nombre del modelo antiguo; no estás llamando al modelo antiguo.

Así que la tarjeta real con la que comparar es la actual, por 1M de tokens — y la franja fuera de horas pico es su mitad más barata:

• Entrada con fallo de caché — $0.15 en horario valle, $0.30 en horario punta
• Entrada con acierto de caché — $0.003 en horario valle, $0.006 en horario punta
• Salida — $0.60 en horario valle, $1.20 en horario punta
• Franjas de horario punta — 01:00–04:00 y 06:00–10:00 UTC, de lunes a viernes, excepto los días festivos públicos de China; todo lo demás, incluidos los fines de semana completos, es horario valle

En cambio, MiniMax-M3.1-Flash-Preview no tiene ninguna tarifa por token de ningún tipo. Su costo es lo que cueste tu asiento de Token Plan —$22, $55 o $132 al mes para Plus, Max y Ultra—, que se va consumiendo a través de una bolsa de cuota compartida al precio de lista de pago por uso de cada modelo, y el proveedor se reserva el derecho de cambiar la composición de esa bolsa. Para un presupuesto mensual fijo con un volumen predecible, puede ofrecer una relación calidad-precio excelente. Para un proyecto que necesita atribuir el costo por llamada, es opacidad disfrazada de suscripción.

La razón por la que esto importa más de lo habitual del lado de DeepSeek es el multiplicador de hora pico. Un equipo en Europa o Asia que desarrolla su jornada laboral se encuentra dentro de una ventana de hora pico durante una parte significativa de su tráfico y paga el doble por el privilegio, lo que convierte una tarifa de entrada anunciada de $0.15 en $0.30 justo durante las horas en que la mayoría de los productos están ocupados. Presupuesta a partir de la columna de hora pico, a menos que tu tráfico realmente se ejecute de noche en UTC.

Cuándo MiniMax M3.1 Flash Preview es la elección equivocada

Tres casos, y los dos primeros son fáciles de pasar por alto porque están documentados en lugar de restados.

El techo de salida es desconocido. Si tu tarea termina en una generación larga —una especificación completa, una reescritura de transcripción, un informe anotado—, estás eligiendo un presupuesto de salida que no puedes ver. DeepSeek V4 Flash publica 384.000. Esa asimetría favorece al modelo más antiguo para cualquier cosa que escriba mucho.

El pensamiento no se puede desactivar. Envía thinking: {"type": "disabled"} a MiniMax-M3.1-Flash-Preview y obtienes un HTTP 400: el modelo requiere pensamiento adaptativo. En DeepSeek V4 Flash, el modo sin pensamiento existe y es un interruptor compatible. Para clasificación, enrutamiento o extracción estructurada corta de alto rendimiento, un modelo que siempre razona primero está pagando latencia y tokens que no pediste, y la única palanca que tienes es bajar effort a low, no eliminar el razonamiento.

No se puede invocar con pago por uso. La documentación del proveedor es inequívoca: MiniMax-M3.1-Flash-Preview solo está disponible actualmente a través de Token Plan y MiniMax Code, y la Subscription Key no es intercambiable con una clave de API de pago por uso. Si ya cuentas con una plaza, es un cambio de una sola línea. Si no la tienes, evaluar este modelo implica comprar una suscripción.

Donde el número de DeepSeek es la decisión equivocada

La otra cara de la moneda es que DeepSeek V4 Flash es solo texto y ya ha sido reemplazado. Nunca aceptó imágenes —ese trabajo requería la versión experimental independiente, que ahora se ha retirado junto con él— y el identificador del modelo ahora corresponde a pesos diferentes de los que sugiere el nombre. Una canalización fijada a deepseek-v4-flash para reproducibilidad depende de una redirección que DeepSeek describe como temporal.

MiniMax-M3.1-Flash-Preview acepta texto, imagen y vídeo de forma nativa, y es el actual modelo de texto más destacado de la tabla del proveedor. La entrada de vídeo a un precio de gama Flash no es habitual en este segmento.

Ambas salvedades apuntan en la misma dirección para cualquiera que opere con tráfico de producción: no se garantiza que el identificador de la factura y el modelo que respondió sean lo mismo indefinidamente, y una capa de enrutamiento es donde eso se gestiona en lugar de descubrirse.

A generated infographic titled 'The two Flash brackets, side by side' listing six paired rows: 'Sales motion — subscription seat vs per-token rate card', 'Effective input rate — Token Plan quota vs $0.15 off-peak / $0.30 peak', 'Peak surcharge — not applicable vs doubles 01:00-04:00 and 06:00-10:00 UTC', 'Cost attribution — pooled quota vs metered per call', 'Failure mode — no published output ceiling vs identifier now serves a successor', and 'Best fit — fixed-budget teams vs metered pipelines'. A footer reads 'Both models carry a 1M-token context window; neither figure is a quality claim.'

Cómo decidir esto en una tarde

Empieza por el final de la tarea en lugar del principio.

Si el trabajo es de generación de formato largo —cualquier cosa que termine escribiendo decenas de miles de tokens—, DeepSeek V4 Flash es el único de los dos que publica un techo lo bastante grande como para prometerlo, y su tarifa es lo bastante baja como para que el multiplicador de hora pico sea sobrevivible. Modela el costo en hora pico, no en hora valle, y trata el identificador retirado como una migración que aún no has hecho, en lugar de como un contrato estable.

Si el trabajo consiste en leer y razonar sobre entradas multimodales con un presupuesto mensual fijo —grabaciones de pantalla, documentos escaneados, revisión de vídeo—, MiniMax-M3.1-Flash-Preview es la opción más capaz y, dentro de un asiento de Token Plan, es la forma más barata de obtener entrada de vídeo con esta longitud de contexto. Asume que estás comprando un modelo no medido y limita el radio de impacto: mantén la carga de trabajo que importa en algo con una tarifa publicada y deja que la versión preliminar se encargue de la mitad exploratoria.

Si ambas descripciones encajan con tu pipeline, eso es un problema de enrutamiento, no de selección de modelo, y es el caso para el que existimos. DeepSeek V4 Flash en OrcaRouterse ofrece a la tarifa del proveedor con 0% de recargo — su entrada de catálogo muestra $0.22 por millón de tokens de entrada y $0.66 por millón de salida, que es la columna de pico de la tarjeta Flash actual, traspasada tal cual — junto con MiniMax-M3 y MiniMax M2.7 en la misma banda de precio y con la misma clave. Un endpoint alcanza más de 200 modelos con conmutación por error automática detrás, de modo que una carga de trabajo puede pasar de un rango de precio a otro sin una segunda integración. MiniMax-M3.1-Flash-Preview no está en nuestro catálogo; acceder a él implica el Token Plan del proveedor y su producto de programación.

La versión en una línea: DeepSeek V4 Flash es la opción conocida con el techo de salida publicado, la tabla de tarifas legible y un sucesor que responde discretamente a su nombre; MiniMax-M3.1-Flash-Preview es el más nuevo, multimodal y sin medir, que requiere una suscripción para probarlo. Ninguno de esos es una razón para elegir el otro — son solo los hechos que no ibas a obtener de una comparación de precio por token que cita una tabla que DeepSeek retiró en septiembre.

A headless Chromium screenshot of the OrcaRouter model page for deepseek/deepseek-v4-flash, showing the model title 'DeepSeek: DeepSeek V4 Flash', a pricing row reading 0.22 US dollars per million input tokens and 0.66 per million output tokens, a context window of 1,048,576 tokens, and a maximum output of 384,000 tokens, captured 28 September 2026.

Comparados en este artículo1

Detectado en este artículo · Benchmarks: Artificial Analysis · actualizado a diario