
Qwen 4 Max vs Gemini 3.1 Pro: el buque insignia no anunciado frente a la vista previa que nunca terminó
- OrcaNUEVOOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 por 1M de tokens
- orcaNUEVOOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 por 1M de tokens
- deepseekNUEVODeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligencia
- openaiOpenAI: GPT-6 Astra2026-09-0453Inteligencia77Código
- googleGoogle: Gemini 3.8 Flash2026-09-0241Inteligencia76Código
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Inteligencia76Código
- anthropicAnthropic: Claude Fable 5.12026-09-0153Inteligencia82Código
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 por 1M de tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligencia72Código
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 por 1M de tokens
- z-aiZ.ai: GLM 5.32026-08-1845Inteligencia75Código
- obsidianQwen3.8 27B2026-08-1534Inteligencia68Código
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Inteligencia69Código
- grokSpaceXAI: Grok 4.62026-08-1244Inteligencia77Código
- metaMeta: Muse Spark 1.22026-08-0540Inteligencia72Código
- qwenQwen: Qwen3.8 Max2026-08-0345Inteligencia76Código
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3134Inteligencia69Código
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 por 1M de tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
La mayoría de las comparaciones enfrentan un producto ya lanzado contra otro producto ya lanzado. Esta es inusual: Qwen 4 Max se presentó en vista previa en la conferencia Yunqi de Hangzhou el 22 de septiembre de 2026 sin fecha de lanzamiento, sin precio y sin pesos, y Gemini 3.1 Pro está en vista previa desde el 19 de febrero de 2026 y sigue en vista previa —siete meses después—, sin fecha de disponibilidad general anunciada y sin fecha de descontinuación en su tabla de obsolescencia. Ninguno de los dos modelos de esta comparación es un producto consolidado. Eso no es motivo para omitir la comparación. Es la comparación, y es lo único que tiene de genuinamente informativo.
Siete meses de vista previa
Una etiqueta de vista previa se supone que es un estado de corta duración. Gemini 3.1 Pro la ha mantenido ya a lo largo de tres lanzamientos de Flash del mismo laboratorio, incluido Gemini 3.8 Flash el 2 de septiembre de 2026, que Google describe como su modelo Flash más inteligente. En los composites independientes, ese modelo ahora obtiene una puntuación superior a la de 3.1 Pro. La línea Pro de Google no tiene ningún miembro más reciente: no existe un Gemini 3.8 Pro, y la generación 3.5 Pro se retrasó y, según se informa, se dejó de lado. El efecto práctico es que el modelo que lleva el nombre Pro ya no es el modelo con la puntuación más alta de su propio proveedor.
El propio texto de limitaciones de Google en la entrada del catálogo aconseja planificar la deprecación de la vista previa, que es la forma honesta de interpretar el estado. Una vista previa sin fecha de GA y sin fecha de retirada es un modelo sobre el que se puede construir y en torno al cual no se puede planificar.
El lado de Qwen es una imagen especular con el signo invertido. Qwen 4 Max no está en una vista previa prolongada; está en una fase previa a la vista previa, sin nada publicado en absoluto. Los dos modos de fallo son opuestos: Gemini 3.1 Pro es un endpoint real cuya existencia a largo plazo no está especificada, y Qwen 4 Max es un elemento de hoja de ruta especificado que carece de endpoint.

La comparación, y la figura de contexto largo que lo decide.
La especificación de Gemini 3.1 Pro es pública y específica. La de Qwen 4 Max está vacía. Lo que vale la pena detenerse a considerar es una fila de la columna de Gemini, porque es el tipo de número que se cita y no debería serlo:
• Estado — Gemini 3.1 Pro en vista previa desde el 19 de febrero de 2026, frente a Qwen 4 Max anunciado el 22 de septiembre de 2026 sin fecha
• Precio de entrada — Gemini 3.1 Pro $2.00 por 1M de tokens hasta un prompt de 200K y $4.00 por encima, frente a Qwen 4 Max no publicado
• Precio de salida — Gemini 3.1 Pro: $12.00 por 1M hasta 200K y $18.00 por encima, frente a Qwen 4 Max, cuyo precio no está publicado.
• Entrada en caché — Gemini 3.1 Pro $0.20 por 1M en una lectura de caché, frente a Qwen 4 Max no publicado
• Contexto — Gemini 3.1 Pro 1.048.576 tokens, frente a Qwen 4 Max, no publicado
• Límite de salida — Gemini 3.1 Pro: 65,536 tokens, frente a Qwen 4 Max: no publicado
• Modalidad — Gemini 3.1 Pro: entrada de texto, imagen, video, audio y PDF con salida de texto, frente a Qwen 4 Max, no publicada
• Control de razonamiento — niveles de pensamiento bajo, medio y alto de Gemini 3.1 Pro, frente a Qwen 4 Max no publicado
• Recuperación de contexto largo — MRCR v2 reportado por el proveedor para Gemini 3.1 Pro: 84,9 por ciento en promedio en ocho agujas a 128K, pero 26,3 por ciento en la configuración puntual de un millón de tokens, frente a Qwen 4 Max, del que no se reportó nada.
• Puntuaciones reportadas por el proveedor — Gemini 3.1 Pro: SWE-bench Verified 80,6 por ciento; GPQA Diamond 94,3 por ciento; ARC-AGI-2 77,1 por ciento; Humanity's Last Exam 44,4 por ciento sin herramientas, frente a Qwen 4 Max, del que no se reportó nada
• Puntuación independiente — Gemini 3.1 Pro: 30 en Artificial Analysis Intelligence Index v4.3.2, frente a Qwen 4 Max, para el que no existe ninguna evaluación independiente
Esa fila de contexto largo es la que hay que llevarse. Una ventana de contexto de 1,048,576 tokens es una cifra de marketing; un 26.3 por ciento de recuperación en la configuración de un millón de tokens es lo que reporta el mismo proveedor cuando mide el extremo lejano de esa ventana. Ambas cifras provienen de Google, lo que convierte esa brecha en una afirmación sobre el modelo y no sobre el evaluador. Si tu carga de trabajo depende de encontrar un dato enterrado cerca del final de un prompt de un millón de tokens, la cifra de contexto destacada no te dice nada útil y esta fila te dice casi todo.
El índice se movió, el modelo no
Gemini 3.1 Pro se lanzó el 19 de febrero de 2026 con 57 en el Artificial Analysis Intelligence Index, el primero del sector. Con la revisión v4.3.2 del índice, publicada el 19 de septiembre de 2026, marca 30. Nada del modelo cambió entre esas dos fechas. La regla se reconstruyó, y se reconstruyó cuatro días antes del anuncio de Qwen 4 de Alibaba.
Esa coincidencia vale más que los propios números. Tres de los cuatro modelos de este lote de comparaciones —Gemini 3.1 Pro, Claude Opus 5 y el buque insignia Qwen 3.8— tienen puntuaciones independientes que se movieron bajo la misma revisión, y en cada caso el movimiento fue lo bastante grande como para invertir una clasificación. Cualquier comparación escrita este mes que cite un único valor de índice sin nombrar la revisión está comparando puntuaciones tomadas con reglas distintas, y el error no será visible para quien la lea.
Para Qwen 4 Max, la consecuencia es que el objetivo no deja de moverse. Cuando Alibaba finalmente publique, la puntuación que hay que superar en este índice será la que indique la revisión actual ese día, y la revisión ha cambiado al menos una vez en la última semana.

Lo que dicen los números operativos, incluido el incómodo
Gemini 3.1 Pro se puede enrutar en OrcaRouter como google/gemini-3.1-pro-preview, con las insignias Flagship y Featured y sin banner de prelanzamiento, al precio de lista de Google de $2.00 y $12.00 por millón de tokens con un 0 % de recargo. El enrutamiento en sí es honesto: la tarifa que aparece en la página es la que publica Google. Las cifras operativas de los siete días hasta el 22 de septiembre también merecen publicarse en lugar de omitirse: un tiempo hasta el primer token (p50) de 10,00 segundos, una velocidad de salida de alrededor de 632 tokens por segundo y una tasa de error del 77,5 % en toda la ventana. Esa tasa de error no es una nota al pie. Para un modelo de nivel preview sin fecha de GA, es el número más relevante para la decisión de toda la página, y una comparación que cita el precio sin ella vende en lugar de informar.
El mismo catálogo incluye cerca de 200 modelos en un único endpoint compatible con OpenAI, con conmutación por error automática y un DSL de enrutamiento, que es el mecanismo que hace que una tasa de error como esa sea sobrellevable en lugar de fatal: se puede conmutar por error una ruta de proveedor degradada en lugar de desactivarla. La familia Qwen 3.8 —Qwen3.8-Max, Qwen3.8-Flash y Qwen3.8-27B— se encuentra en el mismo endpoint que Gemini 3.1 Pro Preview, por lo que la sustitución de la que realmente trata este artículo, la que puedes hacer hoy, es un cambio de política de enrutamiento en lugar de un proyecto de migración. Qwen 4 Max no está en el catálogo, y ningún nivel de Qwen 4 lo está; cuando se lance uno, ahí es donde aparecería.
La decisión, si es que se le puede llamar así
Ninguno de los modelos que hay aquí es un producto con el que puedas comprometerte, y el consejo honesto es tratar a ambos en consecuencia. Gemini 3.1 Pro se puede invocar hoy a un precio publicado, con una ventana de contexto publicada y un historial público de evaluaciones, incluida la debilidad de recuperación en el extremo lejano de esa ventana; también es una versión preliminar cuyo proveedor te dice que planifiques su descontinuación, y funciona con una tasa de error que sería inaceptable para una dependencia de producción. Qwen 4 Max no tiene ninguno de esos problemas porque no tiene ninguna de esas propiedades.
Si necesitas un modelo ahora, la elección no es entre estos dos. Es entre Gemini 3.1 Pro y el modelo insignia de Qwen ya disponible, y, según la evidencia disponible, se trata de una decisión sobre la calidad de recuperación de contexto largo frente a una tarifa de entrada de $2.00 con pesos publicados. Si puedes esperar, vigila dos cosas en lugar de una: una ficha de modelo de Qwen 4 Max y una fecha de disponibilidad general para Gemini 3.1 Pro. La que llegue primero te dirá cuál de estas dos hojas de ruta están priorizando realmente Alibaba y Google.

Comparados en este artículo1
Detectado en este artículo · Benchmarks: Artificial Analysis · actualizado a diario
