Una tarjeta de título principal para el enfrentamiento Qwen3.8-27B vs Qwen 3.8, que muestra dos tarjetas de chip redondeadas —el modelo denso de 27B con contexto de 262K y licencia Apache 2.0 frente al núcleo MoE de 2.4T / 95B activos con una licencia personalizada— y el logotipo de OrcaRouter en la esquina inferior derecha.
Guides & Insights

Qwen3.8-27B vs Qwen 3.8: misma generación, una GPU frente a un rack

Autor

Alistair Wren

Fecha de publicación

Últimos modelos · 20Ver todos los modelos
Benchmarks: Artificial Analysis · actualizado a diario
Volver a todas las publicaciones

Esta semana Alibaba puso Qwen3.8-27B en el carril de inferencia rápida de Cerebras —la primera vez que el denso 27B cuenta con una opción alojada genuinamente rápida— y Artificial Analysis por fin indexó ambos lados de este enfrentamiento. Qwen3.8-27B obtiene 34 en el AA Intelligence Index. Qwen 3.8, es decir, el núcleo abierto al que se refiere la mayoría cuando escribe el nombre sin sufijo, obtiene 40. Esas dos cifras reajustan una comparación que la cobertura del lanzamiento de agosto tuvo que hacer basándose enteramente en la palabra del proveedor.

El modelo detrás de “Qwen 3.8” como nombre independiente es Qwen3.8-2.4T-A95B: los pesos de mezcla de expertos de 2,4 billones de parámetros que Alibaba publicó bajo una licencia personalizada. Qwen3.8-27B es el miembro denso de la misma generación —aproximadamente 27.000 millones de parámetros, Apache 2.0, dimensionado para una sola GPU—. Comparten el nombre de familia, la longitud de contexto nativa de 262K y una ventana de lanzamiento. Todo lo demás sobre ellos es un estudio de contrastes: uno lo puedes poseer, el otro solo lo puedes alquilar. He aquí para qué sirve realmente cada uno ahora que ambos cuentan con cifras independientes.

La misma generación, formas opuestas

Qwen3.8-27B es un modelo denso: 27B parámetros (28B si se cuenta el codificador de visión), 64 capas, una pila de atención híbrida de 48 capas de atención lineal Gated DeltaNet frente a 16 capas de atención completa. Ese híbrido es la razón por la que un 27B puede soportar 262.144 tokens de contexto nativo. Qwen3.8-2.4T-A95B es la arquitectura insignia: 2,4T parámetros totales, alrededor de 95B activos por token, 92 capas con 512 expertos por capa, y 69 de esas 92 capas en atención lineal. El mismo truco, noventa veces la huella.

• Arquitectura — Qwen3.8-27B: 27B denso, cada token activa la totalidad del modelo. Qwen3.8-2.4T-A95B: MoE de 2.4T en total / ~95B activos.

• Contexto — ambos 262K nativos; la extensión de 1M del 27B es solo alojada; el 2.4T alcanza ~984K medidos.

• Entrada — Qwen3.8-27B: texto, imagen y vídeo. Qwen3.8-2.4T-A95B: solo texto, pensamiento siempre activado.

• Licencia — Qwen3.8-27B: Apache 2.0. Qwen3.8-2.4T-A95B: Licencia Qwen3.8-Max personalizada.

• Pesos — Qwen3.8-27B: 55,6 GB en BF16, se cuantiza a una versión Q4 de ~16 GB. Qwen3.8-2.4T-A95B: ~2,4 TB en BF16, un rack de GPU, no un ordenador de escritorio.

• Dónde te los encuentras — Qwen3.8-27B: autoalojado o alquilado barato. Qwen3.8-2.4T-A95B: alquilado, porque nadie en su sano juicio posee el rack.

Números independientes, por fin

Todos los artículos de August vs sobre Qwen3.8-27B llevaban la misma salvedad: «aún no hay puntuaciones independientes». Eso ya no es cierto. Artificial Analysis ya tiene ambos modelos medidos a partir de esta semana, y la forma de los datos es realmente interesante.

En el Intelligence Index, Qwen3.8-2.4T-A95B obtiene una puntuación de 40 y ocupa el 4.º puesto de 113 en su clase. Qwen3.8-27B obtiene 34, lo que lo sitúa primero de 140 modelos en su clase de tamaño de 4–40B con pesos abiertos, una muestra realmente sólida para un 27B denso. Ambos son lentos según mediciones independientes: 39,0 tokens de salida por segundo para el 27B y 38,1 para el 2.4T, frente a una mediana de clase de alrededor de 90. Ambos son verbosos: el 27B genera aproximadamente 200M tokens de salida en las ejecuciones del índice, frente a una mediana de clase de 68M. Ninguno es un modelo de frontera de primer nivel; ambos son caballos de batalla, y el índice dice que el 2.4T es el caballo de batalla más fuerte por un margen claro.

A three-lane infographic titled 'Qwen3.8-27B — three ways to rent it': self-hosted lane on OrcaRouter at $0.33/$2.40 per 1M tokens with 262K context, vendor lane on Qwen Cloud at $0.50/$3.00 with 1M context and a 90% cache discount, and the fast lane on Cerebras PayGo at $0.99/$1.49 with rapid inference, plus the OrcaRouter logo in the bottom-right corner.

Los precios del lado independiente cuentan la misma historia en dólares. Artificial Analysis fija el precio del 27B en $0,50 por millón de entrada y $3,00 por millón de salida en la versión alojada de Qwen Cloud (90 % de descuento de caché), y el del 2.4T en $2,00 / $6,00 (88 % de descuento de caché). Coste por tarea del Intelligence Index: $0,82 para el 27B frente a $2,16 para el 2.4T. El modelo más pequeño es más barato de ejecutar por unidad de inteligencia, y ambos son caros en relación con su clase de velocidad porque los dos son modelos de razonamiento que consumen tokens de salida.

Todo lo demás —SWE-bench Pro 61.7, DeepSWE 1.1 42.2, LiveCodeBench v6 90.3 para el 27B; los 86.6 de Terminal-Bench 2.1 y los 67.7 de SWE-bench Pro del 2.4T— sigue siendo reportado por el proveedor, no reproducido y etiquetado como tal a lo largo de este artículo. Los índices de AA anteriores son el piso independiente bajo todo esto.

Qué cambia la salida a bolsa de Cerebras

El 12 de septiembre de 2026, la cuenta de Qwen anunció que Qwen3.8-27B ahora se ejecuta en Cerebras, con su entrada de catálogo activa bajo el lema «Qwen 3.8 27B ya está disponible en Cerebras PayGo». Cerebras lo ofrece a $0.99 por millón de tokens de entrada y $1.49 por millón de tokens de salida en el hardware de clase WSE que forjó el nombre de la compañía por su velocidad. Eso le da al 27B algo que el núcleo 2.4T nunca ha tenido: una vía rápida.

A comparison scoreboard titled 'Qwen3.8-27B vs Qwen 3.8 — the matchup': the 27B shows 27B dense architecture, 262K native context, text/image/video input, Apache 2.0, AA Intelligence 34, and $0.33/$2.40 per 1M tokens; the 2.4T core shows 2.4T / 95B-active MoE, 984K measured context, text-only input, the Qwen3.8-Max custom license, AA Intelligence 40, and $2.00/$6.00 per 1M tokens, with a footer labeling the 27B price as the OrcaRouter self-hosted rate, the 2.4T price as the Qwen3.8-Max API rate, and the AA figures as of September 2026, plus the OrcaRouter logo in the bottom-right corner.

Esto importa porque lento y verboso fue la única desventaja real del 27B desde el primer día. En el banco de pruebas independiente da 39 t/s; en nuestra propia telemetría de servicio ha estado rindiendo ~154 tokens de salida por segundo con una latencia p50 al primer token de 4,48 s — y ahora un segundo proveedor compite en ese mismo eje. El 2.4T, en cambio, no tiene ninguna vía rápida: a 38 t/s estás pagando precios de frontera por una velocidad de mitad de tabla, y la única forma de sortearlo es alquilar un clúster de GPU y ejecutar tú mismo los pesos abiertos.

Tres carriles para el 27B, uno para el 2.4T

A día de hoy, el dense 27B es rentable de tres maneras, y merece la pena leer la diferencia de precios antes de elegir:

• Modalidad autoalojada — Qwen3.8-27B ya está disponible en OrcaRouter a $0.33 / $2.40 por millón, ejecutado en nuestra propia infraestructura. La entrada más barata del mercado para este modelo, ~154 tok/s de salida, contexto de 262K.

• Vía de proveedor — el build alojado de Qwen Cloud, $0,50 / $3,00 por millón con contexto de 1M de tokens y un descuento de caché del 90 %.

• Vía rápida — Cerebras PayGo, $0.99 / $1.49 por millón, posicionado por la velocidad en lugar del precio.

A screenshot of the OrcaRouter model page for Qwen3.8 27B (captured September 12, 2026) showing the input price of $0.33 per 1M tokens, output price of $2.40 per 1M tokens, a 262K token context window, text/image/video input support, and a p50 first-token latency of 4.48 seconds.

El núcleo abierto de 2.4T no tiene un spread equivalente. La API insignia que sirve la misma arquitectura —Qwen3.8-Max— cuesta $2.00 / $6.00 por millón, y ese es el número que se mantiene, ya sea que lo llames el Max o el núcleo abierto. Ejecuta los pesos en su lugar y la economía cambia al hardware: el 2.4T necesita ~2.4TB de pesos BF16 y un nodo multi-GPU, una decisión de capital que nadie toma a la ligera. Una GPU de 24GB ejecuta la build Q4 del 27B a un costo marginal que se redondea a cero.

El ejemplo práctico que decide a la mayoría de los equipos: 100M de tokens de entrada y 20M de salida al día. Con la tarifa de $2/$6 del 2.4T, eso son unos $320 al día, ~$117,000 al año. Con el 27B a nuestros $0.33/$2.40, son unos $81 al día —y en la copia autoalojada, es el precio de la electricidad. El 2.4T te compra una ventaja de calidad real, AA 40 frente a 34. Si esa ventaja vale una factura mensual de cinco cifras es toda la pregunta que plantea este emparejamiento.

Donde divergen genuinamente

Más allá del índice, tres diferencias prácticas deciden cuál se adapta a una carga de trabajo determinada.

La entrada multimodal es el filtro más limpio. Qwen3.8-27B lee texto, imágenes y video — capturas de pantalla, gráficos, documentos con figuras, fotogramas de video, todo entra en la misma ventana de 262K. Qwen3.8-2.4T-A95B es agresivamente solo texto. Si tu entrada incluye algo visual, el 2.4T queda descalificado sin importar su índice más alto.

El control del pensamiento es lo segundo. El modo de razonamiento del 27B se puede desactivar por solicitud, lo cual importa para la extracción sensible a la latencia, donde una cadena de pensamiento es pura sobrecarga; también expone reasoning_effort. El núcleo de 2.4T no puede desactivar el pensamiento — cada respuesta se abre con un bloque think>, y pagas por esos tokens quieras o no. La API insignia soluciona esto, pero el núcleo abierto no.

El licenciamiento es lo tercero, y en silencio importa a escala. Apache 2.0 en el 27B es el estándar permisivo: modificar, redistribuir, comercializar, con concesión de patente incluida. El 2.4T se distribuye bajo una licencia personalizada Qwen3.8-Max: permisiva en espíritu, pero son los términos de Alibaba, no un estándar de la comunidad, y vale la pena leer el archivo antes de construir un producto sobre él.

Enrutando la decisión

Ambos lados de esta comparativa son accesibles con una sola clave de OrcaRouter, y eso es lo que hace que la pregunta «¿cuál elijo?» sea barata de responder empíricamente. Qwen3.8-27B ya está disponible como qwen/qwen3.8-27b al precio de lista del proveedor, sin ningún margen añadido, y la API insignia construida sobre el mismo núcleo de 2,4T ya está disponible como qwen/qwen3.8-max a $2.00 / $6.00 por millón —la tarifa del propio Aliba​ba, trasladada directamente, así que cualquier cambio de precio del proveedor se refleja aquí el mismo día.

Esa misma arquitectura de 2.4T en forma de pesos descargables no es algo que sirvamos — si quieres el núcleo abierto a través de una API hoy, la vía insignia es la manera práctica de llegar a él, y qwen/qwen3.8 está preconfigurado para activarse en el momento en que un proveedor sirva los pesos abiertos. Una regla de enrutamiento que envíe el tráfico visual y sensible a la latencia a qwen/qwen3.8-27b y la cola de razonamiento difícil a qwen/qwen3.8-max no cuesta nada configurar y conmuta automáticamente entre proveedores. Una sola clave, sin un segundo contrato, y la división es un cambio de configuración en lugar de una rearquitectura — la manera más barata de probar si los seis puntos de índice adicionales del 2.4T valen para ti $5.67 por millón de tokens de salida.

Quién debería elegir cuál

• Elige Qwen3.8-27B si tu entrada incluye imágenes o vídeo, si quieres un modo de razonamiento que puedas desactivar, si tienes una GPU de 24 GB o piensas tener una, o si tu gasto por token tiene suficiente volumen como para que $0.33/$2.40 frente a $2.00/$6.00 sea todo el argumento.

• Elige Qwen 3.8 (el núcleo de 2.4T) si trabajas solo con texto, quieres el número de razonamiento independiente más potente de la familia (AA 40) y la tarifa de $2/$6 —o el costo de ejecutar un nodo de GPU— se ajusta cómodamente a tu presupuesto.

• Elige ambos si tu tráfico abarca los dos perfiles: enruta a través del gateway, deja que el router separe por modalidad y dificultad, y cambia de opinión cuando llegue el próximo checkpoint o el precio de cualquiera de los modelos.

El veredicto

El nombre Qwen 3.8 siempre fue dos productos fingiendo ser una sola familia, y ahora ambos tienen números independientes que discutir. Qwen3.8-2.4T-A95B es el cerebro más potente, solo texto, caro e indiscutiblemente rentable a $2/$6. Qwen3.8-27B es el desplegable: multimodal, Apache 2.0, autoalojable, y desde esta semana por fin también tiene una vía rápida. La brecha en el índice es real: 40 frente a 34. También lo es la brecha de precio: aproximadamente cinco veces el coste por token cuando ejecutas el 2.4T como API. Para la mayoría de los equipos, la decisión no tiene que ver con los seis puntos de índice. Tiene que ver con si compras tokens o compras hardware, y el 27B es el único de los dos que te permite comprar el hardware.