Una tarjeta de título principal para «Qwen 4 Max vs Gemini 3.1 Pro» con el subtítulo «El buque insignia no anunciado frente a la vista previa que nunca terminó», tres insignias tipo píldora que dicen «Vista previa desde el 19 de febrero de 2026», «Contexto de 1.048.576 tokens» y «26,3 % de recuperación a 1 M», una línea de pie de página que dice «Alibaba anunció el 22 de septiembre de 2026; Google presentó una vista previa el 19 de febrero de 2026», y el logotipo de OrcaRouter en la esquina inferior derecha.
Engineering & Research

Qwen 4 Max vs Gemini 3.1 Pro: el buque insignia no anunciado frente a la vista previa que nunca terminó

Autor

Alistair Wren

Fecha de publicación

Últimos modelos · 20Ver todos los modelos
Benchmarks: Artificial Analysis · actualizado a diario
Volver a todas las publicaciones

La mayoría de las comparaciones enfrentan un producto ya lanzado contra otro producto ya lanzado. Esta es inusual: Qwen 4 Max se presentó en vista previa en la conferencia Yunqi de Hangzhou el 22 de septiembre de 2026 sin fecha de lanzamiento, sin precio y sin pesos, y Gemini 3.1 Pro está en vista previa desde el 19 de febrero de 2026 y sigue en vista previa —siete meses después—, sin fecha de disponibilidad general anunciada y sin fecha de descontinuación en su tabla de obsolescencia. Ninguno de los dos modelos de esta comparación es un producto consolidado. Eso no es motivo para omitir la comparación. Es la comparación, y es lo único que tiene de genuinamente informativo.

Siete meses de vista previa

Una etiqueta de vista previa se supone que es un estado de corta duración. Gemini 3.1 Pro la ha mantenido ya a lo largo de tres lanzamientos de Flash del mismo laboratorio, incluido Gemini 3.8 Flash el 2 de septiembre de 2026, que Google describe como su modelo Flash más inteligente. En los composites independientes, ese modelo ahora obtiene una puntuación superior a la de 3.1 Pro. La línea Pro de Google no tiene ningún miembro más reciente: no existe un Gemini 3.8 Pro, y la generación 3.5 Pro se retrasó y, según se informa, se dejó de lado. El efecto práctico es que el modelo que lleva el nombre Pro ya no es el modelo con la puntuación más alta de su propio proveedor.

El propio texto de limitaciones de Google en la entrada del catálogo aconseja planificar la deprecación de la vista previa, que es la forma honesta de interpretar el estado. Una vista previa sin fecha de GA y sin fecha de retirada es un modelo sobre el que se puede construir y en torno al cual no se puede planificar.

El lado de Qwen es una imagen especular con el signo invertido. Qwen 4 Max no está en una vista previa prolongada; está en una fase previa a la vista previa, sin nada publicado en absoluto. Los dos modos de fallo son opuestos: Gemini 3.1 Pro es un endpoint real cuya existencia a largo plazo no está especificada, y Qwen 4 Max es un elemento de hoja de ruta especificado que carece de endpoint.

A two-column scoreboard titled "Qwen 4 Max vs Gemini 3.1 Pro - the scoreboard". Left column Qwen 4 Max: Status announced, no date; Input price not published; Output price not published; Context window not published; Long-context retrieval not published; Independent score none exists. Right column Gemini 3.1 Pro: Status preview since Feb 19 2026; Input price $2.00 per 1M tokens; Output price $12.00 per 1M tokens; Context window 1,048,576 tokens; Long-context retrieval 26.3% at 1M tokens; Independent score 30 on index v4.3.2. Footer reads "Gemini 3.1 Pro pricing and vendor-reported retrieval from Google; index v4.3.2 published September 19 2026.", with the OrcaRouter logo bottom-right.

La comparación, y la figura de contexto largo que lo decide.

La especificación de Gemini 3.1 Pro es pública y específica. La de Qwen 4 Max está vacía. Lo que vale la pena detenerse a considerar es una fila de la columna de Gemini, porque es el tipo de número que se cita y no debería serlo:

• Estado — Gemini 3.1 Pro en vista previa desde el 19 de febrero de 2026, frente a Qwen 4 Max anunciado el 22 de septiembre de 2026 sin fecha

• Precio de entrada — Gemini 3.1 Pro $2.00 por 1M de tokens hasta un prompt de 200K y $4.00 por encima, frente a Qwen 4 Max no publicado

• Precio de salida — Gemini 3.1 Pro: $12.00 por 1M hasta 200K y $18.00 por encima, frente a Qwen 4 Max, cuyo precio no está publicado.

• Entrada en caché — Gemini 3.1 Pro $0.20 por 1M en una lectura de caché, frente a Qwen 4 Max no publicado

• Contexto — Gemini 3.1 Pro 1.048.576 tokens, frente a Qwen 4 Max, no publicado

• Límite de salida — Gemini 3.1 Pro: 65,536 tokens, frente a Qwen 4 Max: no publicado

• Modalidad — Gemini 3.1 Pro: entrada de texto, imagen, video, audio y PDF con salida de texto, frente a Qwen 4 Max, no publicada

• Control de razonamiento — niveles de pensamiento bajo, medio y alto de Gemini 3.1 Pro, frente a Qwen 4 Max no publicado

• Recuperación de contexto largo — MRCR v2 reportado por el proveedor para Gemini 3.1 Pro: 84,9 por ciento en promedio en ocho agujas a 128K, pero 26,3 por ciento en la configuración puntual de un millón de tokens, frente a Qwen 4 Max, del que no se reportó nada.

• Puntuaciones reportadas por el proveedor — Gemini 3.1 Pro: SWE-bench Verified 80,6 por ciento; GPQA Diamond 94,3 por ciento; ARC-AGI-2 77,1 por ciento; Humanity's Last Exam 44,4 por ciento sin herramientas, frente a Qwen 4 Max, del que no se reportó nada

• Puntuación independiente — Gemini 3.1 Pro: 30 en Artificial Analysis Intelligence Index v4.3.2, frente a Qwen 4 Max, para el que no existe ninguna evaluación independiente

Esa fila de contexto largo es la que hay que llevarse. Una ventana de contexto de 1,048,576 tokens es una cifra de marketing; un 26.3 por ciento de recuperación en la configuración de un millón de tokens es lo que reporta el mismo proveedor cuando mide el extremo lejano de esa ventana. Ambas cifras provienen de Google, lo que convierte esa brecha en una afirmación sobre el modelo y no sobre el evaluador. Si tu carga de trabajo depende de encontrar un dato enterrado cerca del final de un prompt de un millón de tokens, la cifra de contexto destacada no te dice nada útil y esta fila te dice casi todo.

El índice se movió, el modelo no

Gemini 3.1 Pro se lanzó el 19 de febrero de 2026 con 57 en el Artificial Analysis Intelligence Index, el primero del sector. Con la revisión v4.3.2 del índice, publicada el 19 de septiembre de 2026, marca 30. Nada del modelo cambió entre esas dos fechas. La regla se reconstruyó, y se reconstruyó cuatro días antes del anuncio de Qwen 4 de Alibaba.

Esa coincidencia vale más que los propios números. Tres de los cuatro modelos de este lote de comparaciones —Gemini 3.1 Pro, Claude Opus 5 y el buque insignia Qwen 3.8— tienen puntuaciones independientes que se movieron bajo la misma revisión, y en cada caso el movimiento fue lo bastante grande como para invertir una clasificación. Cualquier comparación escrita este mes que cite un único valor de índice sin nombrar la revisión está comparando puntuaciones tomadas con reglas distintas, y el error no será visible para quien la lea.

Para Qwen 4 Max, la consecuencia es que el objetivo no deja de moverse. Cuando Alibaba finalmente publique, la puntuación que hay que superar en este índice será la que indique la revisión actual ese día, y la revisión ha cambiado al menos una vez en la última semana.

A screenshot of the OrcaRouter page for Gemini 3.1 Pro in its cost-estimator view (English UI), showing a monthly token volume of 10M against a sample summarisation prompt, an estimated $50.00 per month falling to $43.70 with prompt caching at list price, a cost per request of $0.006040, a note that the estimate uses base-tier rates and that actual token counts depend on the provider's tokenizer, and a PERFORMANCE panel for the last 7 days reading p50 time-to-first-token 10.00 s, output speed 632 tok/s and an error rate of 77.5%, above a 7-day latency trend chart running 09-16 to 09-22.

Lo que dicen los números operativos, incluido el incómodo

Gemini 3.1 Pro se puede enrutar en OrcaRouter como google/gemini-3.1-pro-preview, con las insignias Flagship y Featured y sin banner de prelanzamiento, al precio de lista de Google de $2.00 y $12.00 por millón de tokens con un 0 % de recargo. El enrutamiento en sí es honesto: la tarifa que aparece en la página es la que publica Google. Las cifras operativas de los siete días hasta el 22 de septiembre también merecen publicarse en lugar de omitirse: un tiempo hasta el primer token (p50) de 10,00 segundos, una velocidad de salida de alrededor de 632 tokens por segundo y una tasa de error del 77,5 % en toda la ventana. Esa tasa de error no es una nota al pie. Para un modelo de nivel preview sin fecha de GA, es el número más relevante para la decisión de toda la página, y una comparación que cita el precio sin ella vende en lugar de informar.

El mismo catálogo incluye cerca de 200 modelos en un único endpoint compatible con OpenAI, con conmutación por error automática y un DSL de enrutamiento, que es el mecanismo que hace que una tasa de error como esa sea sobrellevable en lugar de fatal: se puede conmutar por error una ruta de proveedor degradada en lugar de desactivarla. La familia Qwen 3.8 —Qwen3.8-Max, Qwen3.8-Flash y Qwen3.8-27B— se encuentra en el mismo endpoint que Gemini 3.1 Pro Preview, por lo que la sustitución de la que realmente trata este artículo, la que puedes hacer hoy, es un cambio de política de enrutamiento en lugar de un proyecto de migración. Qwen 4 Max no está en el catálogo, y ningún nivel de Qwen 4 lo está; cuando se lance uno, ahí es donde aparecería.

La decisión, si es que se le puede llamar así

Ninguno de los modelos que hay aquí es un producto con el que puedas comprometerte, y el consejo honesto es tratar a ambos en consecuencia. Gemini 3.1 Pro se puede invocar hoy a un precio publicado, con una ventana de contexto publicada y un historial público de evaluaciones, incluida la debilidad de recuperación en el extremo lejano de esa ventana; también es una versión preliminar cuyo proveedor te dice que planifiques su descontinuación, y funciona con una tasa de error que sería inaceptable para una dependencia de producción. Qwen 4 Max no tiene ninguno de esos problemas porque no tiene ninguna de esas propiedades.

Si necesitas un modelo ahora, la elección no es entre estos dos. Es entre Gemini 3.1 Pro y el modelo insignia de Qwen ya disponible, y, según la evidencia disponible, se trata de una decisión sobre la calidad de recuperación de contexto largo frente a una tarifa de entrada de $2.00 con pesos publicados. Si puedes esperar, vigila dos cosas en lugar de una: una ficha de modelo de Qwen 4 Max y una fecha de disponibilidad general para Gemini 3.1 Pro. La que llegue primero te dirá cuál de estas dos hojas de ruta están priorizando realmente Alibaba y Google.

A screenshot of the OrcaRouter model catalogue at www.orcarouter.ai/models (English UI), showing the header reading "199 models, 15 providers, one API key, one bill", the sort and filter rail with Newest selected alongside controls for input modalities and context length, the "How to call any model" panel showing a POST to api.orcarouter.ai/v1/chat/completions with a model and messages JSON body, and the first catalogue cards including openai/gpt-5-mini with a 200 Status badge.

Comparados en este artículo1

Detectado en este artículo · Benchmarks: Artificial Analysis · actualizado a diario