
Conoce a Qwen3.8-Flash: un MoE multimodal de pesos abiertos que adelanta la arquitectura Qwen4 — $0,15/$0,47 por 1M de tokens en QwenCloud
- AlibabaNUEVOQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 por 1M de tokens
- z-aiNUEVOZ.ai: GLM 5.3 Flash2026-08-2658Inteligencia72Código
- DeepSeekNUEVODeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.15 / $0.29 por 1M de tokens
- z-aiNUEVOZ.ai: GLM 5.32026-08-1860Inteligencia75Código
- obsidianNUEVOQwen3.8 27B2026-08-1552Inteligencia68Código
- qwenQwen: Qwen3.8 27B (free)2026-08-13qwen/qwen3.8-27b-free
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1253Inteligencia69Código
- grokSpaceXAI: Grok 4.62026-08-1261Inteligencia77Código
- metaMeta: Muse Spark 1.22026-08-0557Inteligencia72Código
- qwenQwen: Qwen3.8 Max2026-08-0358Inteligencia72Código
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3152Inteligencia69Código
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 por 1M de tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463Inteligencia78Código
- googleGoogle: Gemini 3.6 Flash2026-07-2152Inteligencia69Código
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137Inteligencia49Código
- metaMeta: Muse Spark 1.12026-07-1653Inteligencia71Código
- kimiMoonshotAI: Kimi K32026-07-1560Inteligencia76Código
- openaiOpenAI: GPT-5.6 Luna2026-07-0952Inteligencia71Código
El 26 de agosto de 2026, el equipo de Qwen publicó como código abierto los pesos detrás de Qwen3.8-Flash — publicados en Hugging Face y ModelScope bajo el nombre Qwen3.8-Flash-Next — y lanzó el modelo de producción que lleva el nombre Qwen3.8-Flash en la API de QwenCloud, confirmando su precio oficial al día siguiente. La cifra principal — confirmada oficialmente en el propio anuncio de Alibaba del 28 de agosto — es un modelo multimodal de mezcla de expertos de 125 mil millones de parámetros que activa solo unos 6 mil millones de parámetros por token, una dispersión de aproximadamente el 95%, construido sobre una arquitectura que Alibaba describe explícitamente como una vista previa temprana de la generación Qwen4. La API de producción ya está disponible en QwenCloud a 0,15 USD por millón de tokens de entrada, 0,47 USD por millón de tokens de salida y 0,016 USD por millón en aciertos de caché — la forma más barata de ejecutar algo estructuralmente descendiente del próximo buque insignia de Alibaba — y la primera vez que el laboratorio ha lanzado una vista previa de arquitectura como pesos abiertos públicos antes de que exista la familia completa de modelos.
Un número pesa más que el resto de la hoja de especificaciones: 6B. Qwen3.8-Flash no obtiene su capacidad por tamaño bruto — la obtiene de dónde coloca el cómputo. Un cuerpo MoE de 125B, una tabla de embeddings N-gram de 51B y un pequeño módulo de predicción multi-token almacenan cerca de 180B de parámetros en disco, aunque cada token se enruta a través de solo 6B de ellos. Esa es la apuesta sobre la que se sostiene todo este lanzamiento, y es la razón por la que la factura del entrenamiento se redujo tanto.
Lo que realmente se envió
Qwen3.8-Flash, sin el sufijo, es el modelo puesto en producción ahora activo en la API de QwenCloud y dentro del producto Qwen Office de Alibaba; viene con un contexto predeterminado de 1M de tokens y herramientas integradas, a $0.15/$0.47 por millón de tokens, con aciertos de caché a $0.016. El 28 de agosto la lista de disponibilidad se amplió: según el anuncio de Alibaba, Qwen3.8-Flash ahora también es accesible a través de OpenCode Go, la suscripción de tarifa plana del agente de codificación de terminal de código abierto — la propia lista de modelos de OpenCode lo incluye como qwen3.8-flash a las mismas tarifas de $0.15/$0.47 por millón.

El anuncio oficial de Qwen Studio presenta el lanzamiento de pesos abiertos como una invitación al ecosistema: publicar los cambios estructurales con antelación para que la comunidad y los stacks de inferencia puedan adaptarse antes de que se construya la gama completa de Qwen4. La primera señal de que funcionó es SGLang — el motor de inferencia respaldado por LMSYS — que publicó soporte desde el día cero para Qwen3.8-Flash-Next el mismo día, con el modelo también configurado para Transformers, vLLM y TokenSpeed.
La arquitectura es la historia
Este no es un modelo de la generación Qwen 3.8 a escala reducida. Qwen3.8-Flash introduce cuatro cambios que, según el equipo, la familia Qwen4 heredará, y cada uno apunta a un cuello de botella distinto.
• Atención — Gated DeltaNet más Qwen Sparse Attention. Gated DeltaNet (GDN) comprime el historial en estados de tamaño fijo en tres de cada cuatro capas, por lo que el modelo no vuelve a leer todo en cada paso; QSA trata entonces el contexto largo como un problema de búsqueda: un indexador ligero agrega la secuencia en microbloques, puntúa la importancia a nivel de bloque y dirige la atención a las regiones más relevantes. Según las mediciones de Alibaba, el kernel de atención QSA alcanza hasta 7.6× más rápido en prefill y 4.9× más rápido en decode en un contexto de 1M tokens (reportado por el proveedor).
• Residual — Residual con compuertas. El flujo residual único se convierte en cuatro ramas paralelas con compuertas elemento a elemento, lo que permite a la red decidir por token cuánto leer y escribir en cada rama; una rama se asienta en un canal de larga distancia que conecta las primeras capas de atención con las profundas. Los estados residuales se almacenan en FP8 para reducir el ancho de banda de memoria.
• Embedding: embeddings de n-gramas. Una tabla de consulta de 51 mil millones de parámetros indexada por el token actual y varios anteriores. Añade capacidad sin añadir cómputo por token y, como la tabla puede residir en la memoria del host y precargarse de forma asíncrona, no ocupa permanentemente la memoria de la GPU.
• Optimizador — Muon. Los parámetros lineales 2D grandes (atención, GDN, expertos MoE) se entrenan con Muon, mientras que los embeddings, el enrutador y las partes de bajo rango del Gated Residual mantienen AdamW; el equipo reajustó la ley de escalado para la nueva arquitectura en torno a la combinación.

Para un desarrollador, dos de estos importan de inmediato: la pila de atención es la razón por la que un contexto de 1M de tokens puede ser un valor predeterminado en lugar de un objetivo ambicioso, y la tabla de N-gramas es la razón por la que un modelo de 125B aún puede servirse de forma ligera. El resto es material de vista previa para Qwen4 — que es precisamente como Alibaba lo está posicionando.
La hoja de referencia, etiquetada honestamente.
Cada número de esta sección es una evaluación propia de Alibaba, con un día de antigüedad y no reproducida por ningún laboratorio independiente al momento de redactar esto. Considérenlos afirmaciones orientativas, no resultados concluyentes. En la suite de Alibaba, Qwen3.8-Flash-Next (6B activos) registra 62.5 en SWE-bench Pro, 58.7 en DeepSWE 1.1, 73.9 en CoWorkBench, 84.5 en AndroidWorld y 95.7 en MathVision, con una puntuación de 55.7 en JobBench — y la variante base, Qwen3.8-Flash-Next-Base, se reporta como el mejor modelo abierto en 8 de los 14 benchmarks en una comparación directa, incluyendo MMLU-Pro, SuperGPQA, BBH y MMMU.
Las afirmaciones de Alibaba sobre el posicionamiento en la familia deberían etiquetarse como lo que son: afirmaciones. La empresa dice que Qwen3.8-Flash supera a Claude Opus 4.6 por 9,1 puntos en SWE-bench Pro y aproximadamente 20 puntos en JobBench, y se acerca al alcance de Claude Opus 4.8. Todo es reportado por el proveedor, todo sin reproducir. Lo que se puede verificar de forma independiente hoy es más limitado: los pesos ya están disponibles, la pila de inferencia ya los ejecuta, y SGLang lanzó soporte el mismo día. La reproducción independiente de la hoja de resultados está a días, no a semanas.
Lo que cuesta
El precio es la parte más fácil de verificar, porque es un precio publicado y no un benchmark — y el 27 de agosto Alibaba confirmó oficialmente la tarifa de producción de QwenCloud: $0,15 por millón de tokens de entrada, $0,47 por millón de tokens de salida y $0,016 por millón en aciertos de caché, con la tarifa doméstica en China de ¥0,8/¥2,7/¥0,1. La cifra de aciertos de caché es la que importa para cargas de trabajo de agentes: un agente de contexto largo que relee un historial extenso en cada turno paga centavos en lecturas repetidas, que es exactamente la carga de trabajo que apunta la pila de atención de Qwen4-preview. La prensa china comparó de inmediato el precio destacado con el de sus pares — aproximadamente un tercio de lo que cobra DeepSeek-V4-Flash, y un error de redondeo frente a los modelos cerrados de frontera. Según la propia contabilidad de Alibaba, el costo del entrenamiento fue aproximadamente una novena parte del de Qwen3.7-Plus, y ese apalancamiento estructural es lo que permite que el precio de la API se mantenga donde está.
Al lado del resto de la familia Qwen 3.8, la diferencia es evidente: el buque insignia Qwen3.8-Max cobra $2.00 y $6.00 por millón de tokens, y ya está disponible en OrcaRouter al precio de lista del proveedor con cero margen. Ahora que la API de producción Qwen3.8-Flash está abierta, el mismo pase directo aplica a la tarifa oficial de $0.15/$0.47 y a la tarifa de acierto de caché de $0.016: una capa de enrutamiento es la diferencia entre leer sobre una bajada de precios y tenerla en una configuración. Ambos modelos detrás de una sola clave, conmutación por error entre ellos, sin segundo contrato.
¿Qué significa "vista previa de Qwen4"?
Si se lee el anuncio literalmente, lo que está en juego es claro: no se trata de un nuevo nivel de Qwen 3.8 — es la arquitectura de Qwen4 lanzada antes de tiempo, bajo la marca protectora de un modelo más pequeño y barato. Las razones para hacerlo son sólidas: los frameworks, la cuantización y los patrones de despliegue necesitan tiempo para madurar, y un modelo con 6B activos es una forma barata de que la comunidad ponga a prueba GDN + QSA a escala antes de que Alibaba construya la versión costosa sobre esa base. La otra cara es que el Qwen3.8-Flash de producción es una API construida sobre una arquitectura que el ecosistema en general todavía está auditando. Los primeros en adoptarlo son, por construcción, el conjunto de pruebas.
El camino rápido para probarlo
Hoy tienes cuatro opciones realistas. Puedes autoalojar los pesos abiertos mediante vLLM, SGLang, Transformers o TokenSpeed — la compilación FP8 es la primera parada sensata en cualquier configuración inferior a un nodo completo. Puedes llamar a la API de QwenCloud, ya disponible a la tarifa oficial de $0.15/$0.47 con aciertos de caché a $0.016. Puedes usarlo dentro de OpenCode Go, la suscripción de tarifa plana del agente de codificación de terminal de código abierto, que añadió Qwen3.8-Flash esta semana (anunciado por Alibaba el 28 de agosto, confirmado en la propia lista de modelos de OpenCode). O puedes llamar al Flash de producción a través de un router de la misma manera que ya llamas a Qwen3.8-Max, con la tarifa oficial transmitida sin recargo alguno — no hay integración personalizada que mantener.

La pregunta abierta es la honesta: ¿puede un modelo que activa 6 mil millones de sus parámetros mantenerse en producción ante una amplia gama de cargas de trabajo, o la hoja de resultados que hoy parece de un día seguirá pareciéndolo dentro de un mes? Eso no es una razón para esperar — es una razón para ponerlo detrás de un failover en lugar de al frente de toda tu pila. Los pesos ya están disponibles, el precio está fijado y la arquitectura es la dirección declarada de Alibaba. Las próximas semanas deciden si 6B fue suficiente.
Comparados en este artículo2
Detectado en este artículo · Benchmarks: Artificial Analysis · actualizado a diario
