Una tarjeta de título principal para "Qwen 4 Max vs DeepSeek V4 Pro" con el subtítulo "95 mil millones de parámetros activos frente a 49 mil millones", tres insignias tipo píldora que dicen "$2.00 y $6.00", "$0.66 y $1.98" y "1 de cada 25 frente a 1 de cada 33", una línea de pie de página que dice "Alibaba anunció el 22 de septiembre de 2026; DeepSeek se listó el 24 de abril de 2026", y el logotipo de OrcaRouter en la esquina inferior derecha.
Engineering & Research

Qwen 4 Max vs DeepSeek V4 Pro: 95 mil millones de parámetros activos frente a 49 mil millones

Autor

Gideon Frost

Fecha de publicación

Últimos modelos · 20Ver todos los modelos
Benchmarks: Artificial Analysis · actualizado a diario
Volver a todas las publicaciones

El anuncio de Qwen 4 Max en la conferencia Yunqi del 22 de septiembre de 2026 le dio a la industria un nombre y una estructura de niveles, y nada más: ni pesos, ni precio, ni ventana de contexto, ni fecha. DeepSeek V4 Pro figura desde el 24 de abril de 2026 como una mezcla de expertos de 1,6 billones de parámetros con 49 mil millones de parámetros activos por token, una ventana de contexto de 1 millón de tokens y un precio fuera de horas pico de $0,66 por millón de tokens de entrada y $1,98 por millón de tokens de salida. El número que vale la pena poner uno al lado del otro no es el recuento total de parámetros, sino el recuento de activos: el último Qwen3.8-Max publicado activa 95 mil millones de parámetros por token, aproximadamente el doble de los 49 mil millones de parámetros activos que ejecuta DeepSeek V4 Pro, y esa única cifra explica la mayor parte de la diferencia de precio de tres veces entre los dos laboratorios antes de consultar un solo benchmark.

Dos apuestas diferentes sobre la esparsidad

Ambos laboratorios construyen modelos dispersos de mezcla de expertos. Discrepan, marcadamente, sobre cuánta dispersión debe haber. Qwen3.8-Max —el modelo insignia de Qwen ya disponible, y la única referencia concreta de cómo será Qwen 4 Max— es un modelo de 2,4 billones de parámetros que activa 95 mil millones de parámetros por token, una proporción de aproximadamente uno de cada veinticinco. DeepSeek V4 Pro es un modelo de 1,6 billones de parámetros que activa 49 mil millones, una proporción de aproximadamente uno de cada treinta y tres, y almacena los pesos de sus expertos en FP4 mientras deja las capas de atención, enrutador y normalización en FP8, lo que reduce aún más el cómputo por token.

Esas no son diferencias de ajuste. Son dos respuestas distintas a la misma pregunta —cuánto debería gastar por token un modelo de frontera:

• Parámetros totales — Qwen 3.8 insignia 2,4T frente a DeepSeek V4 Pro 1,6T

• Activos por token — Qwen 3.8 insignia 95B frente a DeepSeek V4 Pro 49B

• Tasa de activación — aproximadamente 1 de cada 25 frente a aproximadamente 1 de cada 33

• Precio de entrada, fuera de hora punta — Qwen3.8-Max $2.00 por 1M frente a DeepSeek V4 Pro $0.66 por 1M

• Precio de salida, fuera de horas pico — Qwen3.8-Max $6.00 por 1M frente a DeepSeek V4 Pro $1.98 por 1M

• Pesos insignia — Qwen 3.8 insignia bajo una licencia personalizada de Qwen frente a DeepSeek V4 Pro publicado bajo MIT

• Contexto — Qwen3.8-Max 1 M de tokens frente a DeepSeek V4 Pro 1 M de tokens

• Modalidad — entrada de texto, imagen y video en Qwen3.8-Max frente a solo texto en DeepSeek V4 Pro según su ficha

• Latencia observada — Qwen3.8-Max p50 tiempo hasta el primer token 3.29s frente a DeepSeek V4 Pro 3.52s en el mismo catálogo

La diferencia de dispersión y la diferencia de precio apuntan en la misma dirección esta vez, que no es la dirección que sugieren los recuentos totales de parámetros. Qwen activa aproximadamente el doble de parámetros por token que DeepSeek y cobra alrededor de tres veces más, y la dispersión por sí sola no cierra esa brecha. Lo que cierra el resto es la modalidad: el modelo insignia de Qwen incorpora codificadores de visión y video, se paga por ellos en cada solicitud, haya o no una imagen en ella, y por eso la tarifa de entrada se sitúa donde se sitúa. DeepSeek V4 Pro recibe texto y devuelve texto, y tiene un precio como el de un modelo que solo hace eso.

Una salvedad debe figurar en la columna de DeepSeek antes de usarla para cualquier cosa. DeepSeek aplica precios según un horario de pico y fuera de pico: las cifras de $0.66 y $1.98 son las tarifas fuera de pico, y durante las ventanas de pico —de 01:00 a 04:00 y de 06:00 a 10:00 UTC entre semana, excluidos los días festivos públicos de China— el mismo modelo cobra $1.32 de entrada y $3.96 de salida. Todo lo demás, incluidos todos los fines de semana y festivos, queda fuera de pico. Por lo tanto, la tarifa que pagas es función de cuándo se ejecuta tu tráfico, y un modelo de costos basado solo en la cifra fuera de pico será erróneo para cualquier carga de trabajo que tenga un componente de mañana entre semana.

A two-column scoreboard titled "Qwen 4 Max vs DeepSeek V4 Pro - the scoreboard". Left column Qwen 4 Max: Total parameters 2.4T, Active per token 95B, Input price off-peak $2.00 per 1M tokens, Output price off-peak $6.00 per 1M tokens, Context window 1M tokens, Modality text, image, video in. Right column DeepSeek V4 Pro: Total parameters 1.6T, Active per token 49B, Input price off-peak $0.66 per 1M tokens, Output price off-peak $1.98 per 1M tokens, Context window 1M tokens, Modality text-only. Footer reading "DeepSeek V4 Pro figures from its catalogue listing; Qwen figures from the Qwen3.8-Max model card, September 22 2026.", with the OrcaRouter logo bottom-right.

La columna de Qwen 4 Max está vacía, y eso no es algo temporal

Es tentador completar la comparación con la suposición de que Qwen 4 Max se situará cerca de las cifras de Qwen 3.8 y con un precio por debajo de ellas. Resiste. Alibaba describió la arquitectura de Qwen 4 como una nueva generación y dijo que la está entrenando; el único artefacto publicado que describe esa arquitectura es Qwen3.8-Flash-Next, publicado como código abierto a finales de agosto de 2026 y etiquetado en su propia ficha de modelo como una vista previa del diseño de Qwen 4. Es un modelo principal de 125.000 millones de parámetros con 51.000 millones de parámetros de embeddings de N-gramas que activan alrededor de 6.000 millones por paso, con atención dispersa QSA, residuales con compuerta y un contexto nativo de 262.000 tokens extensible hacia 1 millón.

Si ese diseño escala al nivel Max, el recuento de parámetros activos debería mantenerse en las decenas de miles de millones en lugar de acercarse al total de DeepSeek; mantener el cómputo por paso prácticamente constante a medida que crecen los parámetros totales es precisamente el objetivo de QSA y de los embeddings de N-gramas que se consultan en lugar de calcularse de forma densa. Eso es una dirección, no una especificación, y no debería imprimirse como si lo fuera.

Lo que puede saberse ahora es la asimetría operativa. Un modelo que existe puede medirse en tu carga de trabajo; un modelo que no existe no puede medirse en nada. Qwen 4 Max es accesible, cuando se lance, a través de la API propia del proveedor y de varias plataformas de terceros — la misma ruta que ha seguido cada buque insignia de Alibaba. No está en OrcaRouter hoy: el catálogo no tiene ninguna entrada para la familia Qwen 4. DeepSeek V4 Pro está en OrcaRouter ahora, y también lo está una instantánea con fecha de él.

La reproducibilidad es el argumento que nadie plantea

DeepSeek publica instantáneas con fecha y las mantiene accesibles. El catálogo incluye tanto el identificador flotante DeepSeek V4 Pro como una variante fijada del 2026-08-13 —siendo esa fecha la compilación que la propia DeepSeek designó como la versión de disponibilidad general—. Eso no tiene nada de glamuroso y, para cualquiera que ejecute un arnés de evaluación o una canalización controlada por cumplimiento normativo, importa más que una diferencia en un benchmark: cuando fijas la instantánea, tu suite de regresión mide tu código y no la cadencia de versiones del proveedor.

La generación Qwen 3.8 hizo lo mismo —hay una instantánea fechada de Qwen3.8-Max en el mismo catálogo junto al nombre flotante—, y no hay razón para pensar que Alibaba vaya a parar. Pero es una propiedad de los modelos ya lanzados, y vale la pena decir con claridad que el día en que se anuncie Qwen 4 Max no tendrá ninguna instantánea que fijar, ningún identificador estable contra el que probar y ninguna forma de hacer un antes y un después con tus propios datos. Cualquier comparación que quieras hacer, la harás más tarde.

A screenshot of the OrcaRouter model page for DeepSeek V4 Pro (deepseek/deepseek-v4-pro, English UI), showing the FLAGSHIP badge, the 1M token context badge, the model ID deepseek/deepseek-v4-pro, a 384K maximum output, text input, the Tools, JSON and Reasoning tags, the listing date 2026-04-24 credited to DeepSeek, a p50 time-to-first-token of 3.52s, the OpenAI-compatible code samples against api.orcarouter.ai/v1, and the opening of the model description describing a 1.6T total / 49B active flagship MoE with 1M context and top-tier reasoning and agentic tool use.

Ejecutar ambos sin ejecutar dos stacks

OrcaRouter enruta DeepSeek V4 Pro como deepseek/deepseek-v4-pro a $0,66 de entrada y $1,98 de salida por millón de tokens, que es el precio de lista fuera de horas punta de DeepSeek trasladado con un 0 % de margen. Esa última parte vale más aquí que en cualquier otro punto de este lote, porque $1,98 de salida ya está cerca del mínimo para un modelo de nivel frontera: un margen de la plataforma de incluso un diez por ciento equivaldría a una quinta parte de la diferencia entre este modelo y una alternativa de gama media, y con un 0 % de margen la tarifa que ves en la página es la tarifa que publica DeepSeek, incluida la división entre horas punta y horas valle, que se traslada con el mismo calendario en lugar de promediarse en una tarifa plana.

El mismo endpoint incluye la familia Qwen 3.8 — Qwen3.8-Max, Qwen3.8-Flash y Qwen3.8-27B — junto a DeepSeek V4 Pro en una única API compatible con OpenAI con cerca de 200 modelos, con failover automático cuando se degrada una ruta de proveedor y un DSL de enrutamiento para hacer explícita la selección en lugar de codificarla de forma fija. Si DeepSeek recorta la tarifa, el cambio llega a tu clave ese mismo día, porque no hay ninguna capa de margen detrás de la cual pueda quedarse atascado un recorte. Cuando se lance un nivel de Qwen 4, el mismo catálogo es donde aparecería.

Dónde te deja esto

DeepSeek V4 Pro gana esta comparación por incomparecencia, y vale la pena ser precisos sobre por qué en lugar de adornarlo. Es más barato en ambos ejes por un factor de aproximadamente tres, activa cinco veces más parámetros por token, su ventana de contexto es equivalente y tiene una instantánea con fecha que puedes fijar. Qwen 4 Max tiene un nombre de nivel y un hueco en una conferencia.

La comparación que realmente está vigente es DeepSeek V4 Pro frente a Qwen3.8-Max, y es una competencia real más que una paliza: DeepSeek es un modelo solo de texto a aproximadamente un tercio del precio, con pesos publicados bajo MIT y un perfil de activación por token más ligero, y el buque insignia de Qwen acepta entrada de imagen y video a $2.00 y $6.00. Elige con base en la modalidad y en el costo medido por tarea terminada, no en la cantidad de parámetros, y vuelve a hacer la comparación cuando Alibaba publique una ficha de modelo; en ese momento, la pregunta interesante será si Qwen 4 Max fija el precio de su capacidad multimodal por encima de la tarifa de texto de DeepSeek en una cantidad menor que la actual.

A screenshot of the OrcaRouter model page for Qwen3.8 Max (qwen/qwen3.8-max, English UI), showing the 1M token context badge, the model ID qwen/qwen3.8-max, text plus image plus video input with text output, the Vision, Tools, JSON, Reasoning and Thinking capability tags, the listing date 2026-08-03, a p50 time-to-first-token of 3.29s, and the model description naming Qwen3.8-Max Alibaba's newest flagship and highest-capability tier to date.

Comparados en este artículo4

Detectado en este artículo · Benchmarks: Artificial Analysis · actualizado a diario