
Qwen3.8-Flash-Next vs Qwen3.8-27B: el MoE de Qwen4-preview contra el caballo de batalla de pesos abiertos
- typesafeNUEVOTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 por 1M de tokens · 578 tok/s
- openaiNUEVOOpenAI: GPT-6 Luna2026-09-2237Inteligencia
- openaiNUEVOOpenAI: GPT-6 Sol2026-09-2248Inteligencia
- anthropicNUEVOAnthropic: Claude Opus 5.52026-09-2258Inteligencia
- grokNUEVOGrok 4.72026-09-2146Inteligencia
- OrcaNUEVOOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 por 1M de tokens · 182 tok/s
- orcaNUEVOOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 por 1M de tokens · 1312 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligencia
- openaiOpenAI: GPT-6 Astra2026-09-0453Inteligencia77Código
- googleGoogle: Gemini 3.8 Flash2026-09-0241Inteligencia76Código
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Inteligencia76Código
- anthropicAnthropic: Claude Fable 5.12026-09-0153Inteligencia82Código
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 por 1M de tokens · 114 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligencia72Código
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 por 1M de tokens · 226 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Inteligencia75Código
- obsidianQwen3.8 27B2026-08-1534Inteligencia68Código
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Inteligencia69Código
- grokSpaceXAI: Grok 4.62026-08-1244Inteligencia77Código
- metaMeta: Muse Spark 1.22026-08-0540Inteligencia72Código
Lo sorprendente de Qwen3.8-Flash-Next no es que Alibaba afirme que un modelo que activa solo 6 mil millones de parámetros por token supera a la mayoría del campo abierto — sino que servirlo requiere más memoria que el modelo denso de 27 mil millones de parámetros con el que se lo compara. Qwen3.8-Flash-Next, publicado como código abierto el 26 de agosto de 2026 como vista previa de la arquitectura Qwen4, mantiene una tabla de búsqueda N-gram de 51 mil millones de parámetros en la RAM del sistema en lugar de la VRAM; Qwen3.8-27B, el modelo denso multimodal Apache-2.0 que se lanzó a mediados de agosto y es el caballo de batalla de pesos abiertos de la actual generación Qwen 3.8, cabe en una sola tarjeta gráfica de 24 GB a 4 bits. En la propia hoja de puntos de referencia de Alibaba, el nuevo MoE supera al 27B en 21 de los 22 puntos de referencia comparados. En cuanto a evidencia independiente — posiciones en arena, un estudio de agentes legales, mediciones de rendimiento de terceros — el 27B es el único de los dos que tiene alguna. Esa combinación es toda la decisión.
El enfrentamiento en una línea: dos miembros de la misma generación con pesos abiertos, texto más visión, mismo contexto nativo de 262K, ambos diseñados para ejecutarse fuera de un centro de datos — y divididos por arquitectura, por licencia, por precio y por cuánto de su historia está verificada. Qwen3.8-Flash-Next es el MoE disperso que adelanta todo lo que se espera que Qwen4 herede. Qwen3.8-27B es el modelo denso que comprime lo que Alibaba aprendió al construir el buque insignia de 2.4T en algo que una sola GPU puede ejecutar. Elegir entre ellos tiene menos que ver con la capacidad — Alibaba dice que la vista previa está por delante — y más con si confías en una ficha técnica de un día sobre un modelo que la comunidad ya ha analizado en detalle.
El marcador
Priorizando las fuentes: cada cifra de Qwen3.8-Flash-Next a continuación es propia de Alibaba, de un día de antigüedad y no reproducida. Las afirmaciones principales de los benchmarks del Qwen3.8-27B también son reportadas por Alibaba, pero el 27B cuenta con resultados independientes — colocaciones en arenas de preferencia humana, un estudio de ámbito legal y mediciones de rendimiento de AMD — que la vista previa no puede igualar.
Parámetros totales — Qwen3.8-Flash-Next: 125B MoE + 51B N-gram + MTP (~180B almacenados), 6B activos. Qwen3.8-27B: ~27B densos (28B con codificador de visión), todos activos.
• Arquitectura — Qwen3.8-Flash-Next: vista previa de Qwen4 — Qwen Sparse Attention alternando con Gated DeltaNet, residual con compuerta, embeddings de N-gramas, entrenado con Muon. Qwen3.8-27B: 48 capas de atención lineal GDN más 16 capas de atención completa (3:1), denso.
• Contexto — 262.144 tokens nativos, ampliable a 1M mediante YaRN.
• Modalidad — ambos aceptan entrada de texto, imagen y video y devuelven texto.
• Licencia — Qwen3.8-Flash-Next: qwen-community-1.0. Qwen3.8-27B: Apache 2.0.
• Precio — Qwen3.8-Flash-Next: $0.16 / $0.47 por 1M (anunciado; la API de producción aún no está abierta). Qwen3.8-27B: $0.33 / $2.40 por 1M, ya disponible hoy.
• Huella de ejecución — {{1}}Qwen3.8-Flash-Next{{/1}}: tabla de 51B en la RAM del host, ~96GB de memoria del sistema más cualquier GPU; FP8 ~186GB, Q4 GGUF ~82GB. {{2}}Qwen3.8-27B{{/2}}: BF16 ~55.6GB, 4-bit cabe en una tarjeta de 24GB.
• Evidencia independiente — Qwen3.8-Flash-Next: ninguna aún. Qwen3.8-27B: #1 modelo abierto en Arena.ai Image-to-WebDev, #9 en general en Code Arena WebDev, #1 open-weight en el benchmark Legal Agent de Harvey, throughput medido por AMD.

Según las propias cifras de Alibaba, la vista previa gana en casi todo.
La comparación publicada por Alibaba otorga a Qwen3.8-Flash-Next puntuaciones iguales o mejores en 21 de 22 puntos de referencia de lenguaje y visión frente a Qwen3.8-27B, y las victorias no son cosméticas. SWE-bench Pro 62.5 frente a 61.7 es una ventaja marginal, pero DeepSWE 58.7 frente a 42.2, JobBench 55.7 frente a 33.4 y CoWorkBench 73.9 frente a 70.7 son brechas reales precisamente en las cargas de trabajo agénticas y de oficina a las que se dirige el nivel flash. Los números principales de la vista previa — LiveCodeBench v6 91.9, GPQA Diamond 91.7, MathVision 95.7 — también superan las filas correspondientes del modelo de 27B en la tabla de Alibaba. Esta es la tesis del lanzamiento expresada como datos: la mayor parte de la capacidad de razonamiento y codificación de la línea más grande Qwen 3.8, a una fracción del cómputo activo.
Mantén la etiqueta adjunta a esa oración. Estas son evaluaciones propias de Alibaba, del propio banco de pruebas de Alibaba, con un día de antigüedad en el caso de la vista previa y sin replicar para ambas. El desglose de la arquitectura KGP Talkie que ocupa un lugar en este enfrentamiento llega a la misma forma de conclusión, pero se basa en la misma ficha del proveedor. Una tabla del proveedor es una promesa; nada de este párrafo ha sido confirmado de forma independiente.
Lo que el 27B tiene y Flash-Next no: evidencia
Aquí es donde el enfrentamiento deja de estar desequilibrado. Qwen3.8-27B ha estado dos semanas en abierto, y la comunidad ha producido tres puntos de datos independientes. En la clasificación Image-to-WebDev de Arena.ai — votos humanos ciegos sobre cuál de dos resultados anonimizados preferiría enviar un espectador — el 27B ocupa el puesto #1 entre los modelos abiertos y el #7 en general con una puntuación reportada de 1,574. En la tabla hermana Code Arena WebDev se sitúa en el puesto #9 en general con 1,595, el único modelo de su clase de tamaño dentro del top diez. Harvey, la empresa de IA jurídica, y Engram llevaron a cabo un estudio de bufete de abogados sintético que colocó a un 27B adaptado en la cima de su punto de referencia de agentes legales — con la salvedad de que el modelo había estudiado el corpus de prueba de antemano, lo que lo convierte en una demostración del margen de ajuste fino más que en una puntuación para los pesos originales. AMD publicó mediciones de rendimiento del día cero: 24,5 tokens/s en una Ryzen AI Max+ 395 y 51,8 tokens/s en una Radeon AI PRO R9700. Ninguno de estos es una puntuación de calidad de propósito general — todavía no hay un índice de Artificial Analysis para el 27B — pero cada uno es un tercero que realmente ejecutó el modelo.
Qwen3.8-Flash-Next no tiene nada de eso. Toda su hoja de benchmarks es de Alibaba, con solo horas de antigüedad al momento de escribir esto, y ningún laboratorio independiente ha reproducido una sola fila. Eso no es una acusación; es la definición de un lanzamiento de un día. Pero es exactamente la asimetría que debería regir la elección: la vista previa está por delante en los únicos números que existen, y cada uno de esos números fue escrito por el proveedor que quiere que lo creas.
El fork de despliegue.
La diferencia práctica entre estos dos modelos es dónde residen los parámetros, y eso determina qué hardware necesitas. Qwen3.8-Flash-Next descarga deliberadamente su tabla de embeddings N-gram de 51B a la memoria del host, donde puede precargarse de forma asíncrona — por eso añade 51B de parámetros de capacidad sin añadir cómputo por token. La consecuencia es que el modelo no cabrá en una tarjeta de consumo de 24GB como ha cabido antes un Qwen local. Las estimaciones de la comunidad sitúan un Q4 GGUF en unos 82GB en total (aproximadamente 58GB de pesos principales más la tabla de búsqueda de 24GB), la versión FP8 en torno a 186GB y la BF16 en unos 360GB; la receta que funciona es una máquina con del orden de 96GB de RAM del sistema más cualquier GPU que ejecute los 6B activos. El beneficio es que el cómputo por token es barato — toda la apuesta de la arquitectura — y el contexto largo de 1M de tokens sigue siendo asequible porque las capas GDN comprimen el historial en lugar de hacer crecer la caché KV.
Qwen3.8-27B es el modelo al revés: denso, por lo que cada token ejecuta los 27B parámetros completos, pero lo suficientemente pequeño como para que todo quepa en el hardware que ya tienes. Los pesos en BF16 son de aproximadamente 55.6GB; en 4 bits se ejecuta en una tarjeta de 24 GB como una RTX 3090 o 4090, y las mediciones de AMD muestran que alcanza de 24.5 a 51.8 tokens/s en hardware de clase AI Max y Radeon PRO. Si la restricción es una única estación de trabajo, el 27B es el que realmente cabe; si la restricción es el costo por token a escala, Flash-Next es el que gana sobre el papel.
La horquilla de precios
Los precios de la API cuentan la misma historia desde el otro lado. Qwen3.8-27B está disponible hoy en OrcaRouter a $0.33 por millón de tokens de entrada y $2.40 por millón de tokens de salida, con el precio de lista del proveedor transmitido sin margen — la opción de autoalojamiento se ha habilitado, sin necesidad de comprar una GPU. Qwen3.8-Flash-Next aún no está enrutado a ningún sitio: los pesos abiertos son el único camino hasta que el Qwen3.8-Flash de producción se abra en la API de QwenCloud a su precio anunciado de $0.16/$0.47. Cuando esa API se abra, el mismo traspaso de precio coloca el precio de $0.16/$0.47 en nuestro lado el mismo día, con la misma clave que el 27B, con conmutación automática por error entre ellos — así que la forma de adoptar una arquitectura de un día de antigüedad no es apostar la producción en ella, sino dirigir una porción del tráfico hacia ella con el modelo probado como respaldo. Una capa de enrutamiento también puede colocarse delante de un modelo que tú mismo sirvas, que es el camino práctico para evaluar los pesos abiertos de Flash-Next hoy sin una segunda integración.

¿Cuál ejecutar?
Elige Qwen3.8-Flash-Next si quieres subirte ahora a la dirección de Qwen4, si tu carga de trabajo tiene el volumen suficiente como para que $0.16/$0.47 frente a $0.33/$2.40 sea un número real, o si tienes la RAM para autoalojarlo y te sientes cómodo con una ficha de proveedor. Elige Qwen3.8-27B si necesitas términos Apache-2.0, una sola tarjeta de 24GB, un modelo al que puedas llamar hoy, o cualquier grado de evidencia independiente: es el único de los dos que ha ejecutado alguien fuera de Alibaba.

Las dos capturas anteriores son las superficies públicas de cada mitad: el listado de OrcaRouter donde Qwen3.8-27B se puede invocar hoy a $0.33/$2.40, y la tarjeta del modelo Qwen/Qwen3.8-Flash-Next en Hugging Face.
Y el cierre honesto es una pregunta, porque la base de evidencia tiene solo un día: ¿puede un modelo que activa 6 mil millones de sus parámetros mantener un barrido de 21 de 22 bajo replicación independiente, o es la tabla de N-gramas que le permite servir de forma eficiente también lo que falla en cargas de trabajo reales? El 27B ya ha sobrevivido dos semanas de escrutinio comunitario. Flash-Next está donde estaba el 27B hace dos semanas, lo cual es el mejor argumento para ejecutarlos lado a lado en lugar de elegir.
