Una tarjeta de título principal generada que dice 'Gemini 3.1 Pro vs Qwen3.8-27B', con el subtítulo 'Una vista previa de siete meses vs un checkpoint que puedes descargar', con dos tarjetas: Gemini 3.1 Pro, en vista previa desde el 19 de febrero de 2026, a 2,00 $ de entrada y 12,00 $ de salida por 1M de tokens y un Artificial Analysis Intelligence Index de 29.7, frente a Qwen3.8-27B, con pesos abiertos desde el 14 de agosto de 2026, a 0,50 $ de entrada y 3,00 $ de salida por 1M de tokens y un índice de 33.7, con un medallón VS entre ellas y el logotipo de OrcaRouter en la parte inferior derecha. Pie de página: 'Artificial Analysis Intelligence Index v4.3.2, capturado el 23/09/2026; los precios son tarifas de lista del proveedor.'
Guides & Insights

Gemini 3.1 Pro vs Qwen3.8-27B: una vista previa con siete meses de anticipación frente a un checkpoint que puedes descargar

Autor

Magnus Corvin

Fecha de publicación

Últimos modelos · 20Ver todos los modelos
Benchmarks: Artificial Analysis · actualizado a diario
Volver a todas las publicaciones

El 18 de septiembre de 2026, los usuarios del propio foro de desarrolladores de IA del proveedor comenzaron a informar de que Gemini 3.1 Pro había desaparecido del selector de modelos de AI Studio —incluidas las cuentas de pago, pese a borrar la caché y usar ventanas de incógnito—. El hilo en el que se pedía al proveedor que dijera si era «un error o algo intencionado» seguía activo el 21 de septiembre. No hay aviso de descontinuación, ni ruta de migración, ni respuesta del personal. Mientras tanto, Qwen3.8-27B, que el laboratorio publicó como código abierto el 14 de agosto bajo Apache 2.0, no se le puede quitar a nadie que lo haya descargado. Esa asimetría —y no la diferencia en los benchmarks, que es real pero modesta— es lo que realmente decide este enfrentamiento, y es la razón por la que los dos modelos no compiten en realidad por el mismo puesto, aunque las tablas comparativas los coloquen uno al lado del otro.

Lo que sigue es la comparación directa de las cifras que existen, con cada una etiquetada: cifras de Artificial Analysis a partir de capturas tomadas el 23 de septiembre de 2026, la propia ficha de modelo de Alibaba, la publicación de lanzamiento de Google y nuestra propia telemetría de enrutamiento, mantenidas separadas en todo momento. Donde no se ha medido nada, esta página lo dice en lugar de hacer conjeturas.

Qué pasó esta semana, y qué significa y qué no significa

Los informes son específicos y proceden del propio foro de Google, y no del blog de un competidor. Un hilo titulado «Gemini 3.1 Pro no aparece en AI Studio desde 2026-09-18: ¿error o algo intencional?» describe que usuarios de pago están perdiendo el modelo sin ningún anuncio, que el soporte de Google One ofrece pasos de solución de problemas no relacionados y que la página de estado de Google no muestra que nada vaya mal. Un segundo hilo, «El modelo Gemini 3.1 Pro Preview no está disponible en AI Studio para crear una app», recopila la misma queja, incluida la de un usuario cuyo asistente de programación se había construido sobre la versión Preview durante meses y que dice que Flash «hace chapuzas» en su base de código.

Tres advertencias honestas. Se trata de una desaparición del panel de desarrollador, no de una interrupción confirmada de la API: Gemini 3.1 Pro sigue listado y es enrutable en nuestro propio catálogo, donde movió 94,7 M de tokens en los últimos siete días. Es un reporte de usuarios — Google no ha dicho nada, así que nadie fuera de Google puede distinguir entre una «retirada silenciosa», un «problema de capacidad» y un «error del panel». Y el momento no es halagüeño, dado que este modelo está en preview desde el 19 de febrero de 2026 — siete meses, sin fecha de disponibilidad general publicada, mientras Google lanzó una escalera de modelos Flash por debajo de él. Aparte, GitHub Copilot retiró Gemini 3.1 Pro el 1 de septiembre de 2026 con 30 días de aviso, lo cual es un evento distinto y no relacionado, pero apunta en la misma dirección: un endpoint en preview sin compromiso de disponibilidad general es una dependencia por la que está permitido ponerse nervioso.

Una cifra de nuestro lado merece ponerse junto a ese contexto, porque no podemos explicarla y preferimos decirlo. Nuestra telemetría de siete días sobre la entrada del catálogo de Gemini 3.1 Pro muestra una tasa de error del 80,5 %; los modelos vecinos que revisamos esa misma mañana —Qwen3.8-Max, Claude Fable 5.1— se sitúan en 5,9 % y 6,9 %. No sabemos si se trata del mismo problema que reporta el foro, de una mala semana para un proveedor upstream o de un artefacto de instrumentación. Trátalo como un motivo para ejecutar una prueba canario antes de comprometerte, no como un veredicto sobre el modelo.

Misma regla, dos puntuaciones diferentes

Esta es la parte en la que la mayoría de las páginas de comparación se equivoca, así que vale la pena hacerla con cuidado. Artificial Analysis puntúa ambos modelos en Intelligence Index v4.3.2. Capturamos ambas páginas el 23 de septiembre de 2026, y ambas llevan la misma revisión, así que, a diferencia de la mayoría de las afirmaciones de índices entre modelos, esta corresponde a la misma instantánea y la brecha es real.

• Qwen3.8-27B (xhigh) — Índice de Inteligencia 33.7

• Gemini 3.1 Pro Preview — Índice de Inteligencia 29,7

Qwen lidera por cuatro puntos en la vara de medir actual. La pregunta más difícil es qué significa eso, porque la propia vara de medir se ha movido al menos tres veces este año. En febrero, Artificial Analysis publicó un artículo en el que llamaba a Gemini 3.1 Pro Preview «el nuevo líder en IA», cuatro puntos por delante de Claude Opus 4.6, y la cobertura de prensa de la época informó de una puntuación de 57 en lo que entonces era Index v4.0. En v4.3.2 es 29,7. Artificial Analysis anunció v4.3 el 7 de septiembre de 2026, cuatro días después de v4.2, y la revisión cambió Terminal-Bench 2.1 por el mucho más difícil Terminal-Bench 4.0 de 66 tareas y reemplazó τ³-Banking por AutomationBench-AA. Las fortalezas de Gemini 3.1 Pro en febrero residían en evaluaciones que el nuevo índice retiró o reponderó. Así que: el modelo no empeoró, el examen sí. Pero si hoy eliges un modelo, el número de hoy es el que realmente puedes usar para actuar, y el número de hoy favorece a Qwen.

Donde los dos realmente divergen

Las puntuaciones agregadas ocultan la forma de la diferencia, y la forma es la parte útil. Cada cifra a continuación proviene de la misma captura del 23 de septiembre de las páginas v4.3.2 de Artificial Analysis para ambos modelos, sobre la misma revisión.

• Razonamiento y conocimiento: Gemini lidera claramente. GPQA Diamond 94,1 vs. 90,5; Humanity's Last Exam 47,0 vs. 33,9; SciCode 58,7 vs. 46,6; CritPt 17,7 vs. 5,4.

• Tareas ocupacionales del mundo real — Qwen lidera, y por mucho. GDPval normalizado 45,4 % vs 13,8 %.

• Banca y transacciones agénticas — Qwen lidera. τ-Banking 48.0 frente a los 21.4 de Gemini.

• Uso agéntico de herramientas en un benchmark general — Gemini lidera donde Qwen no se midió. τ²-Bench 95.6 para Gemini; no existe una cifra de Qwen3.8-27B.

• Trabajo en terminal — reñido, y ambos mal en el nuevo benchmark. Terminal-Bench 2.1: Qwen 79.8, Gemini 73.8. Terminal-Bench 4.0: Qwen 5.6 %, Gemini 4.0 % — ambos de un solo dígito.

• Calibración — la divergencia más marcada en cualquiera de las dos páginas. En AA-Omniscience, Gemini obtiene 31.9 con 54.9% de precisión y una tasa de alucinación del 50.9%; Qwen obtiene −10.0 con 15.6% de precisión y una tasa de alucinación del 30.3%. Gemini sabe más y se lo inventa más de la mitad de las veces; Qwen con frecuencia se niega a responder y alucina en aproximadamente un tercio de lo que sí responde.

• Contexto largo — empatados exactamente en recuperación de contexto largo, 82,0 cada uno. En recuperación de contexto largo multimodal, Qwen 21,7 % frente a Gemini 15,6 %.

Lee las entradas «no medidas» como lo que son. Gemini no tiene una cifra normalizada de GDPval-AA publicada frente al 45,4 % de Qwen, y Qwen no tiene una cifra de τ²-Bench, IFBench, Terminal-Bench Hard o ITBench-SRE frente a los 77,1, 53,8 y 30,3 de Gemini. Cada uno de esos espacios en blanco es un lugar donde una tabla resumen habría plantado silenciosamente un ganador.

A generated two-column scoreboard headed 'Gemini 3.1 Pro vs Qwen3.8-27B — the scoreboard', with the same six dimension labels in both columns. Gemini 3.1 Pro: AA Index 29.7, price per 1M $2.00 input and $12.00 output, context 1M tokens, output speed 116.5 tokens per second, open weights no (preview API), cost to run the index $1,310. Qwen3.8-27B: AA Index 33.7, price per 1M $0.50 input and $3.00 output, context 262K native, output speed 41.3 tokens per second, open weights yes (Apache 2.0), cost to run the index $1,336. Footer: 'Artificial Analysis Intelligence Index v4.3.2, captured 2026-09-23; prices are provider list rates.'

La divergencia que decide los presupuestos: el mismo costo para ejecutar el índice

Qwen3.8-27B es drásticamente más barato por token. Según las cifras de mercado que publica Artificial Analysis, cuesta $0.50 por millón de tokens de entrada y $3.00 por millón de tokens de salida, con un descuento de caché del 80% y una tarifa combinada 7:2:1 de $0.47. Gemini 3.1 Pro Preview cuesta $2.00 y $12.00 —cuatro veces el precio de entrada y cuatro veces el precio de salida—, con un descuento de caché del 90% y una tarifa combinada de $1.74.

Y luego está el número que nadie publica: la propia contabilidad de Artificial Analysis sitúa el coste de ejecutar todo el Intelligence Index en $1,310.21 para Gemini 3.1 Pro Preview y $1,335.92 para Qwen3.8-27B. Qwen no es más barato de ejecutar. Es ligeramente más caro, porque tarda más en llegar. De la factura de salida de Qwen, $512.36 correspondían a tokens de razonamiento frente a $82.51 de respuesta real; en la de Gemini, $691.82 eran de razonamiento frente a $113.08 de respuesta. El precio por token es una tarifa, no una factura.

Dos datos más sobre precios que las tablas comparativas omiten. Primero, el precio de Gemini 3.1 Pro se divide en niveles según el tamaño de la entrada de cada solicitud: $2.00/$12.00 hasta 200K tokens de entrada, y luego $4.00/$18.00 por encima de eso, con las lecturas de caché duplicándose de $0.20 a $0.40. La ventana de contexto de un millón de tokens es real, pero los últimos 800,000 tokens de ella cuestan el doble. Segundo, nuestra propia ficha de catálogo para Qwen3.8-27B —servido con block-FP8, torre de visión a precisión completa— indica $0.40 de entrada y $4.21 de salida, lo que resulta más barato en entrada y más caro en salida que la cifra de mercado anterior, y no publica ninguna tarifa de tokens en caché en absoluto. Distintos proveedores, distinto desglose. Comprueba la tarifa a la que realmente se te facturará.

Se puede acceder a ambos modelos con una sola clave de OrcaRouter al precio de lista del proveedor y con un 0% de recargo, por lo que un cambio de precio del proveedor repercute en nuestro lado el mismo día, en lugar de después de un ciclo de reajuste de precios, algo que importa más de lo habitual cuando uno de los dos tiene un límite de nivel fijado en 200K tokens.

Latencia: el primer token más rápido pertenece al modelo más lento

Este es el par de cifras más engañoso de toda la comparación, y es el que con mayor probabilidad llevará a un lector a actuar de forma equivocada.

• Tiempo hasta el primer fragmento — Qwen 4,04 s frente a Gemini 28,37 s. Qwen parece siete veces más rápido.

• Tiempo hasta la respuesta real: Gemini 28,37 s frente a Qwen 52,52 s. Gemini gana por un margen de aproximadamente 1,8x, porque Qwen pasa 48,48 segundos pensando entre el primer fragmento y el primer token de respuesta.

• Velocidad de salida — Gemini 116,5 tokens por segundo frente a Qwen 41,3. Gemini es 2,8 veces más rápido una vez que empieza a escribir, frente a una mediana de comparación que Artificial Analysis sitúa en 95,4 tokens por segundo. La propia página de Qwen lo califica de «notablemente lento».

Si tu producto transmite un primer token a un usuario, la latencia destacada de Qwen es una mentira que te contarás una vez. Si tu producto espera una respuesta completa, Gemini es el modelo más rápido. Ambas cifras son mediciones de Artificial Analysis; ambas se tomaron en el ajuste de esfuerzo xhigh de Qwen, que es el valor predeterminado de la ficha del modelo.

Ese valor predeterminado es una queja activa entre los profesionales, y la tarjeta del modelo lo admite a medias. Qwen3.8-27B expone un reasoning_effort parámetro con tres niveles: xhigh (el predeterminado, «para tareas complejas que exigen un análisis exhaustivo»), medium, y low. Los análisis de la comunidad hasta septiembre informan de que xhigh produce fases de pensamiento muy largas y recomiendan bajar a medium o low y limitar el presupuesto de razonamiento. La propia tarjeta de Alibaba advierte que, en el trabajo agéntico de varios turnos, reducir el esfuerzo «no siempre reduce el tiempo total de finalización de la tarea» —lo cual es algo sincero de decir en una tarjeta de modelo y una advertencia de que la solución obvia no siempre es la solución.

Contexto: 1M vs 262K, y qué encaja realmente

Gemini 3.1 Pro tiene una ventana de contexto de 1,000,000 de tokens con una salida máxima de 65,536 tokens. Qwen3.8-27B admite 262,144 tokens de forma nativa, ampliables a 1,000,000 con escalado YaRN, con presupuestos separados recomendados dentro de ella: contenido de razonamiento de hasta 262,144 y una respuesta final de hasta 131,072.

Dos notas a pie de página honestas. La tabla de especificaciones de Artificial Analysis indica que la ventana de Qwen es de 256.000, mientras que el texto de sus propias preguntas frecuentes dice 260K y la tarjeta del modelo dice 262.144 — son diferencias de redondeo sobre el mismo número, pero cita 262.144 porque eso es lo que dice la tarjeta. Y la extensión a 1M es una técnica de escalado, no lo mismo que una ventana nativa de un millón de tokens: la recuperación en contextos largos a 1M en un modelo extendido con YaRN no es lo que mide la cifra 82,0 de AA-LCR. Nadie ha publicado una puntuación de recuperación con contexto de 1M para Qwen3.8-27B. Considera la ventana de Gemini como la que tiene un comportamiento medido a longitud completa y la de Qwen como la que deberías probar tú mismo antes de diseñar en torno a ella — y recuerda que a partir de 200K tokens de entrada, el precio de Gemini se duplica.

Trabajo agéntico y llamadas a herramientas

Aquí es donde el enfrentamiento está genuinamente sin resolver, y donde un ganador fabricado sería fácil e incorrecto. Qwen3.8-27B tiene puntuaciones agénticas medidas de las que Gemini carece, y viceversa.

El caso de Qwen se apoya en una sólida cifra independiente y en una sólida cifra de proveedor. La cifra independiente es τ-Banking con 48,0 frente al 21,4 de Gemini —más del doble, en la misma revisión, en un benchmark sobre el uso de herramientas en varios pasos dentro de un entorno bancario. La cifra del proveedor es la propia ficha de Alibaba, que enumera OSWorld-Verified 84,3, WebArena-Verified 64,8, AndroidWorld 81,9, CoWorkBench 70,7, JobBench 33,4 y Agents' Last Exam 20,4 Pass@1. Esas son evaluaciones de Alibaba, no replicadas por nadie más, y se sitúan exactamente en las categorías donde el resultado de GDPval medido de forma independiente (45,4 % normalizado frente a 13,8 %) apunta en la misma dirección.

El argumento de Gemini es que tiene la única cifra agéntica absoluta alta de la comparación —τ²-Bench 95.6— y Qwen no tiene ninguna puntuación en τ²-Bench en absoluto. También tiene IFBench 77.1 en seguimiento de instrucciones, otra casilla vacía del lado de Qwen. Y tiene un historial de producción de siete meses que un lanzamiento de pesos abiertos de cinco semanas no tiene.

El desempate no es una puntuación, es tu topología. La ventaja agéntica de Qwen se mide en benchmarks donde el modelo opera dentro de un sistema de software grande y preexistente que no diseñó. La de Gemini se mide en benchmarks donde el modelo tiene que seguir instrucciones con precisión durante mucho tiempo. Son habilidades diferentes y ambas son reales.

A screenshot of the Artificial Analysis comparison page for Gemini 3.1 Pro Preview against Qwen3.8-27B, showing an Intelligence Index of 29.7 for Gemini 3.1 Pro Preview and 33.7 for Qwen3.8-27B on revision v4.3.2, with blended price rows of $1.74 and $0.47 per 1M tokens, cost per task of $1.01 and $0.67, cost to run the full Intelligence Index of $1,310 and $1,336, and the output-token breakdown beneath.

Programación

La programación se divide de la misma manera, por lo que «cuál es mejor en programación» no tiene una respuesta clara aquí. Gemini lidera el extremo de la computación científica —SciCode 58,7 frente a 46,6—, y su AA Coding Index de 68,8 en nuestra página de catálogo está a un error de redondeo del 68,1 de Qwen, bien dentro de cualquier intervalo de confianza que merezca la pena citar. En el trabajo de terminal agéntico, los dos están cerca en el benchmark más antiguo, Qwen 79,8 frente a Gemini 73,8 en Terminal-Bench 2.1, y son indistinguibles en el más nuevo, donde ambos se desploman a cifras de un solo dígito.

La ficha de Alibaba afirma mucho más —SWE-bench Pro 61.7, LiveCodeBench v6 90.3, QwenSWEBench 79.0—, pero esas son cifras reportadas por el proveedor, y la ficha incluye una nota al pie que indica que SWE-bench Pro y QwenSWEBench se ejecutaron en el arnés de Claude Code, que no es el arnés con el que se habría obtenido la cifra de un competidor. La afirmación segura es que, en el único benchmark de programación en el que un tercero midió los modelos de ambos laboratorios, los dos están separados por cuatro puntos en Terminal-Bench 2.1 y por 1.6 puntos en Terminal-Bench 4.0, y ambos son malos en el más difícil.

Pesos abiertos frente a un endpoint de vista previa

Este es el eje sobre el que los dos no son comparables en absoluto, y es el que tiene la mayor consecuencia práctica.

Qwen3.8-27B es Apache 2.0, 27B parámetros densos, 64 capas, con un híbrido de atención lineal Gated DeltaNet y atención completa en una proporción de aproximadamente 3:1 — el diseño que hace asequible servir una ventana de 262K. Funciona. Cuantizado a 4 bits cabe en unos 17GB, lo que es una GPU de consumo; todo un ecosistema de compresión creció a su alrededor en cinco semanas, desde los cuantos Dynamic V3 de Unsloth, incluida una versión de 1 bit que Unsloth dice que corre en 8GB a alrededor del 77% de la precisión original, hasta el Ternary Bonsai 2 27B de PrismML a mediados de septiembre. Puedes ajustarlo, puedes auditarlo y puedes ejecutarlo en un portátil con la red desconectada.

Gemini 3.1 Pro es un endpoint de vista previa cerrada, de siete meses de antigüedad, sin fecha de disponibilidad general, con una ficha de modelo que advierte explícitamente que las vistas previas pueden carecer de la estabilidad, la disponibilidad y el soporte de una versión estable y —a partir de esta semana— una consola para desarrolladores que parece haber abandonado discretamente. No puedes descargarlo, no puedes fijar una versión y no puedes hacer conmutación por error a ti mismo.

Si quieres la respuesta honesta sobre enrutamiento en lugar de un veredicto: la existencia del checkpoint abierto es lo que hace que la dependencia de Gemini sea sobrevivible. Coloca Qwen3.8-27B detrás de una ruta local o autoalojada como respaldo, mantén Gemini 3.1 Pro en la ruta principal para el trabajo intensivo en razonamiento en el que es mensurablemente mejor, y coloca ambos detrás de un único endpoint con conmutación por error automática, de modo que una desaparición silenciosa de la consola de otra persona sea un incidente que tu capa de enrutamiento absorbe en lugar de una caída que tus usuarios vean. Eso no es una promoción de un producto: es la única configuración en la que las noticias de esta semana no te cuestan un fin de semana.

Elige Gemini 3.1 Pro si

• Tu trabajo más difícil es el razonamiento intensivo en conocimiento en lugar del uso de herramientas de horizonte largo — lidera GPQA Diamond 94,1 a 90,5, Humanity's Last Exam 47,0 a 33,9, SciCode 58,7 a 46,6 y CritPt 17,7 a 5,4.

• Necesitas entradas genuinamente largas. Una ventana medida de un millón de tokens, con un comportamiento de recuperación probado a fondo, supera a una ventana de 262K ampliada mediante técnicas, siempre que puedas aceptar que el precio se duplique a partir de 200K tokens de entrada.

• El tiempo para completar la respuesta importa más que el tiempo hasta el primer token, y quieres 116,5 tokens por segundo en lugar de 41,3.

• Hoy en día necesita una multimodalidad amplia: entrada de audio, archivos, imágenes, texto y vídeo frente al texto, imagen y vídeo de Qwen.

• Estás dispuesto a aceptar el riesgo de la vista previa y cuentas con una alternativa que tú controlas.

Elige Qwen3.8-27B si

• Sus agentes operan dentro de grandes sistemas existentes: τ-Banking 48.0 a 21.4 y GDPval 45.4% a 13.8% normalizado son las dos mayores ventajas de un solo modelo en toda esta comparación.

• Necesitas una respuesta que sea honesta en vez de segura. Una tasa de alucinación del 30,3 % frente al 50,9 % de Gemini es otro tipo de producto.

• Las normas de licencia o residencia de datos descartan una API cerrada, o necesita ajustar el modelo con sus propios datos.

• Quieres una factura por token que sea un cuarto de la de Gemini y aceptas que gastarás la diferencia en tokens de pensamiento; ejecutar el índice cuesta lo mismo en ambos.

• Está preparado para ajustar reasoning_effort a un valor inferior a su xhigh predeterminado en lugar de enviarlo tal cual.

Lo que no pudimos verificar

Para que conste, y porque una página de comparación vale solo tanto como sus espacios en blanco: no se ha publicado ninguna evaluación independiente de Qwen3.8-27B con esfuerzo de razonamiento reducido, por lo que su equilibrio entre velocidad y calidad en medio y bajo no está medido. No existe ninguna puntuación de recuperación de contexto largo para la configuración de 1M extendida con YaRN. Gemini 3.1 Pro no tiene una puntuación normalizada publicada de GDPval-AA, y Qwen3.8-27B no tiene ninguna para τ²-Bench, IFBench o ITBench-SRE. Y nadie —incluido Google— ha dicho por qué Gemini 3.1 Pro salió del selector de AI Studio el 18 de septiembre. Actualizaremos esta página cuando algo de eso cambie.

A screenshot of the OrcaRouter model page for Qwen3.8 27B (obsidian/qwen3.8-27b), showing Vision, Tools, JSON and Reasoning badges, a 2026-08-15 catalogue date, a 262K-token context window, list pricing of $0.40 input and $4.21 output per 1M tokens with no cached-token rate published, a p50 time to first token of 3.92s and a p95 of 10.00s over seven days, 1023.1M tokens of traffic in the same window, and a description noting the model is served in block-FP8 with the vision tower kept at full precision.

Comparados en este artículo2

Detectado en este artículo · Benchmarks: Artificial Analysis · actualizado a diario