
Qwen3.8-27B Open Weights: El Max se lanzó, el 27B no — Lo que sabemos ahora
- typesafeNUEVOTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 por 1M de tokens · 36 tok/s
- openaiNUEVOOpenAI: GPT-6 Luna2026-09-2237Inteligencia
- openaiNUEVOOpenAI: GPT-6 Sol2026-09-2248Inteligencia
- anthropicNUEVOAnthropic: Claude Opus 5.52026-09-2258Inteligencia
- grokNUEVOGrok 4.72026-09-2146Inteligencia
- OrcaNUEVOOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 por 1M de tokens · 181 tok/s
- orcaNUEVOOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 por 1M de tokens · 1277 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligencia
- openaiOpenAI: GPT-6 Astra2026-09-0453Inteligencia77Código
- googleGoogle: Gemini 3.8 Flash2026-09-0241Inteligencia76Código
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Inteligencia76Código
- anthropicAnthropic: Claude Fable 5.12026-09-0153Inteligencia82Código
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 por 1M de tokens · 110 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligencia72Código
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 por 1M de tokens · 221 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Inteligencia75Código
- obsidianQwen3.8 27B2026-08-1534Inteligencia68Código
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Inteligencia69Código
- grokSpaceXAI: Grok 4.62026-08-1244Inteligencia77Código
- metaMeta: Muse Spark 1.22026-08-0540Inteligencia72Código
El 13 de agosto de 2026, la semana de pesos abiertos que Alibaba prometió para su generación Qwen3.8 se dividió en dos. Los pesos del buque insignia de clase Max — Qwen3.8-2.4T-A95B, un modelo disperso de mezcla de expertos de 2,4 billones de parámetros y la primera versión de Qwen de nivel Max que se ha hecho descargable — se publicaron efectivamente, en Hugging Face y ModelScope, anunciados a última hora de la noche anterior a través de la comunidad de ModelScope. El modelo más pequeño del que trata esta página, Qwen3.8-27B, no lo hizo: comprometido para la misma semana del 10 de agosto, todavía no tiene repositorio oficial, ficha de modelo, archivo de licencia ni puntos de referencia propios, y los rastreadores de terceros ahora describen su lanzamiento como retrasado sin nueva fecha. La pregunta que esta página de «lo que sabemos hasta ahora» fue creada para responder — «¿cuándo sale realmente el 27B?» — se ha convertido en dos: ¿por qué se publicaron primero los pesos del Max, y qué pasó con el 27B?
Esto sigue siendo un artículo de lo que sabemos hasta ahora, no una reseña. Qwen3.8-Max, el buque insignia de la API, está disponible desde el 3 de agosto a $2/$6 por millón de tokens; su base subyacente de pesos abiertos, Qwen3.8-2.4T-A95B, se pudo descargar a partir del 13 de agosto; y los pesos de Qwen3.8-27B aún no se han publicado. Cada afirmación a continuación está etiquetada como confirmada, reportada por el proveedor o estimada por la comunidad, según corresponda.
La señal, y lo que la semana realmente entregó.
La primera señal fue una publicación en X de @kimmonismus, que señaló la "próxima semana" como la que había que vigilar: "Qwen-3.8 27b - Grok 4.6", con Astra notablemente ausente de la lista. La mitad Grok de esa semana se lanzó el 12 de agosto. La mitad Qwen se dividió en dos. Lo que la publicación capturó fue el ambiente entre las personas que siguen los lanzamientos de modelos profesionalmente: el lanzamiento de pesos abiertos de Qwen3.8 era el evento del calendario, y la semana llegó con los detalles aún sin concretar. Una semana después, los detalles se han resuelto en parte: uno de los dos lanzamientos de pesos abiertos prometidos ha aterrizado, y no fue el que la publicación mencionaba.
¿Qué está confirmado?
• La familia es real y ha sido anunciada oficialmente.Alibaba presentó la familia de modelos base Qwen3.8 el 3 de agosto de 2026, tras una iteración de vista previa a mediados de julio.
• Qwen3.8-Max se lanzó el mismo día. El buque insignia de la API — un modelo de mezcla de expertos de 2,4 billones de parámetros con aproximadamente 95 mil millones de parámetros activos, una ventana de contexto de 1 millón de tokens y entrada de texto, imagen y vídeo — está disponible en la API de Qwen a un precio de $2/$6 por millón de tokens. También está disponible a través de OrcaRouter al mismo precio de lista, con un recargo del 0 %.
• Los pesos abiertos de Max se lanzaron el 13 de agosto. Qwen3.8-2.4T-A95B — el modelo base sobre el que se construye la API Qwen3.8-Max — se volvió descargable desde Hugging Face y ModelScope, junto con una versión cuantizada en FP8. Este es el primer lanzamiento de pesos abiertos de nivel Max de Qwen de la historia. El modelo descargable es solo de texto con el modo de razonamiento forzado, cuenta con un contexto nativo de 256K tokens ampliable a aproximadamente 1M y se despliega en SGLang, vLLM y TokenSpeed.
• Qwen3.8-27B es el modelo de pesos abiertos más pequeño de la familia — aún no se ha lanzado. Alibaba lo posicionó como el camino realista para el despliegue local y on-premise, y comprometió sus pesos en Hugging Face y ModelScope junto con los del Max. A 13 de agosto aún no hay repositorio oficial de Qwen3.8-27B. El compromiso era real; la entrega aún no se ha producido.
• La primera puntuación independiente para la generación ya existe. Artificial Analysis sitúa a Qwen3.8-Max en un Intelligence Index de 56 a aproximadamente $1.14 por tarea — realmente bueno, con las salvedades que conlleva cualquier buque insignia de apenas unos días.
Lo que realmente sabemos sobre el 27B
El resumen honesto es que "Qwen3.8-27B" sigue siendo principalmente un nombre y un recuento de parámetros. Los hechos confirmados son que es un modelo de aproximadamente 27 mil millones de parámetros, que es el miembro de pesos abiertos de la generación Qwen3.8, y que está diseñado para trabajo en una sola GPU y en las instalaciones, en lugar de un clúster de varios cientos de GPU. Daniel Han, de Unsloth, informa que debería caber en unos 17 GB de VRAM en su lanzamiento: una sola tarjeta de consumo prosumidor.
Todo lo demás no está confirmado. Alibaba no ha publicado si el 27B es un modelo denso o de mezcla de expertos, su ventana de contexto, qué modalidades acepta, ni ninguna puntuación de referencia propia. Lo que cambió esta semana es el momento: el Max y el 27B se prometieron para la misma semana, y solo llegó el Max. Los rastreadores de terceros ahora reportan el 27B como retrasado sin nueva fecha; una lectura de la comunidad, no una declaración oficial de Alibaba, y es posible que el repositorio aún llegue antes de que termine por completo la semana prometida. Pero al momento de escribir esto, la organización oficial Qwen en Hugging Face no lista ningún Qwen3.8-27B, y los pocos repositorios "Qwen3.8-27B-FP8", "-GGUF" y "-MLX" que aparecen en la búsqueda son tarjetas de marcador de posición de la comunidad con conteos de descargas de un solo dígito, no el lanzamiento oficial.
El punto de referencia útil sigue siendo el 27B de la generación anterior: Qwen3.5-27B, un modelo denso de pesos abiertos con una ventana de contexto de 32K. Es un límite inferior razonable para lo que el Qwen3.8-27B debe superar, y un recordatorio de que los modelos de la clase 27B de Qwen históricamente se han construido para ejecutarse en hardware que un desarrollador realmente posee.
El Max es el punto de referencia de lo que el 27B podría heredar.

El 27B no alcanzará el techo bruto del Max, pero las cifras del Max — ahora publicadas en una ficha de modelo real — establecen las expectativas sobre cómo se ven las mejoras de esta generación. En las evaluaciones propias de Alibaba del modelo de pesos abiertos, Qwen3.8-2.4T-A95B obtiene 93.0 en PaperBench, 86.1 en OSworld-Verified, 91.5 en CAD paramétrico, 67.7 en SWE-bench Pro y 86.6 en Terminal-Bench 2.1, y el proveedor afirma paridad con Claude Opus 4.8, Claude Fable 5, GPT-5.6 Sol y Gemini 3.1 Pro. Son cifras reportadas por el proveedor, publicadas en los materiales de lanzamiento y aún no reproducidas por un laboratorio independiente. La mejora agéntica que el lanzamiento de la API afirmó — FrontierSWE saltando de 40.7 a 73.5 en una sola generación — se traslada a los mismos materiales de lanzamiento. Si siquiera parte de esa mejora llegara a un 27B, redefiniría lo que significa un "buen modelo local de codificación" en su clase.
Un matiz que conviene recordar: el Max descargable no es idéntico al Max de la API. Qwen3.8-2.4T-A95B es solo texto con el modo de pensamiento forzado, mientras que la API Qwen3.8-Max añade entrada de visión, un modo sin pensamiento y un contexto predeterminado de 1M de tokens. Esa brecha es exactamente el tipo de cosa que un 27B probablemente heredará — y vale la pena tenerlo en cuenta cuando se leen los titulares de los benchmarks de "Qwen3.8" sin comprobar qué variante describen.
El precio es donde el Max resulta más defendible: $2/$6 por millón de tokens en todo el contexto de 1M de tokens en la API, sin recargo por prompts largos. Eso es agresivo para una API de vanguardia, y es relevante para el cálculo de enrutamiento: con esas cifras, la generación 3.8 se convierte en una opción para cargas de trabajo que antes solían recurrir a modelos insignia más caros.
¿Qué puede ejecutarlo realmente?

Para la 27B, Alibaba aún no ha publicado los requisitos de hardware, por lo que las cifras en circulación siguen siendo proyecciones de la comunidad basadas en la tabla de cuantización de Qwen 3.6-27B — estimaciones, no especificaciones. Los rangos de trabajo que la mayoría de la gente está considerando no han cambiado:
• Cuantización Q4_K_M, ~16GB de VRAM — una RTX 4090 o equivalente, el punto óptimo que la mayoría de los desarrolladores locales buscarán.
• Cuantización Q3_K_M, ~13GB de VRAM — cabe en una tarjeta de 12GB como la RTX 3060 con calidad reducida.
• Cuantización Q6_K, ~21GB de VRAM — casi sin pérdidas en tarjetas de 24GB.
• Servicio FP8, ~27GB de VRAM — una sola L40S, según la proyección anterior, para inferencia de nivel de producción.
• Precisión completa, H100 80GB — la ruta de calidad de referencia, y no algo que la mayoría de los equipos vaya a ejecutar.
La nueva complicación es que «ya puedes autoalojar la generación Qwen3.8» es cierto, pero no para el modelo que la gente tenía en mente. Los pesos abiertos del Max son una clase de hardware completamente diferente: el modelo BF16 de precisión completa ocupa aproximadamente 4.9 TB, y la cuantización selectiva por capas de 1 bit de Unsloth lo reduce a unos 397 GB; se puede ejecutar, pero solo con 410 GB o más de RAM y VRAM combinadas. Eso es infraestructura seria, no una tarjeta para prosumidores. Es exactamente el vacío que el 27B está destinado a llenar, lo que convierte la persistente ausencia del 27B en la razón por la que la ruta local con una sola GPU para esta generación aún no existe.
La cuestión de la licencia: el Max acaba de sentar el precedente.
La cuestión de la licencia para el modelo de 27B sigue sin respuesta, pero «cómo se vería» ya no es una conjetura. Los pesos abiertos de Max se publicaron bajo una licencia personalizada denominada «qwen3.8-max», no Apache 2.0. Según se informa en la ficha del modelo, en general es de uso gratuito para fines comerciales y de alojamiento, pero activa requisitos adicionales a gran escala: los productos con más de 100 millones de usuarios activos mensuales o más de 20 millones de dólares en ingresos mensuales deben mostrar el nombre del modelo, y las empresas con más de 50 millones de dólares en ingresos anuales que ofrezcan servicios de modelo como servicio o asistentes de trabajo con IA necesitan una licencia aparte. Es falso el rumor de que la licencia prohíbe su uso en Estados Unidos, la UE, el Reino Unido y Corea: la licencia no contiene restricciones territoriales.
Para el 27B específicamente, no se ha nombrado ninguna licencia. Pero el Max se publicó bajo una licencia personalizada de Qwen en lugar de Apache 2.0, lo que convierte a Apache 2.0 en una suposición deficiente también para el modelo hermano. La antigua licencia Tongyi Qianwen —con su cláusula de 100 millones de MAU— no es la que recibió el Max; la del Max es una licencia nueva, por niveles de escala. Lee el archivo LICENSE en el repositorio real antes de planificar en torno a ella, y espera que la del 27B se decida solo cuando se publique su repositorio.
Momento del toolchain: el soporte desde el primer día acaba de demostrarse.
Los motores de servicio avanzaron tan rápido como se esperaba, para el modelo que se lanzó. Qwen3.8-2.4T-A95B se lanzó con soporte funcional en SGLang, vLLM y TokenSpeed, que es lo que parece "servible por API casi de inmediato" para un lanzamiento de pesos abiertos grande. Para el 27B, los mismos motores son los primeros en moverse cuando su repositorio aparezca, y la cobertura del primer día del Max hace que el 27B herede ese soporte, lo cual es la expectativa razonable. Las cuantizaciones comunitarias de GGUF y AWQ normalmente se retrasan de una a dos semanas, por lo que la experiencia estilo Ollama de "descargar y ejecutar" probablemente aún no exista el día del lanzamiento del 27B; una configuración manual de vLLM o llama.cpp es la vía local probable al principio.
Lo que aún se desconoce
Un artículo de filtración honesto se detiene en lo que realmente es público, y el límite es más amplio de lo que era hace una semana en una dirección y más estrecho en otra: las preguntas de Max fueron respondidas, las de 27B no.
• La nueva fecha de lanzamiento."La semana del 10 de agosto" era el compromiso; la semana está casi terminada y el repositorio no ha aparecido. Rastreadores de terceros informan de un retraso sin nueva fecha, pero Alibaba no ha hecho ninguna declaración oficial.
• Arquitectura. Denso o MoE para el 27B, y si es MoE, el número de parámetros activos.
• La ficha técnica. Ventana de contexto, modalidades, límites de salida, modo de razonamiento.
• Puntos de referencia. El 27B no tiene puntuaciones oficiales ni evaluación independiente.
• La licencia. Sin decidir hasta que se publique el repositorio de la 27B; la licencia personalizada de Max es el precedente a tener en cuenta.
• Riesgo de espejo. El problema de los marcadores de posición ahora es visible en el mundo real — existen tarjetas comunitarias "Qwen3.8-27B-FP8", "-GGUF" y "-MLX" sin ningún archivo oficial. Hasta que la organización oficial de Qwen publique el repositorio, descargue únicamente desde la página oficial de la organización.
Lo que significa para los constructores
La división práctica para la generación Qwen3.8 ahora es triple en lugar de doble. Si quieres la API de frontera hoy, Qwen3.8-Max está disponible a través de OrcaRouter al precio de lista de $2/$6 del proveedor, transmitido con un margen del 0%: el precio que ves es el que fijó Alibaba. Si quieres alojar tú mismo el modelo de clase Max, los pesos abiertos se pueden descargar ya, pero necesitas el hardware para un modelo de precisión completa de aproximadamente 4,9 TB o uno cuantizado de aproximadamente 397 GB. Y si quieres el despliegue local de una sola GPU que se esperaba de esta generación, todavía estás esperando el Qwen3.8-27B, que no ha salido. Una clave compatible con OpenAI cubre el lado de la API hoy, y cuando el alojamiento del 27B se estabilice, la misma clave puede enrutar hacia él.

Esa última parte es el punto más general, y es exactamente el caso de prueba de un lanzamiento de open-weight sin demostrar y retrasado. Un modelo que aún ni siquiera se ha lanzado no tiene trayectoria, ni suite de benchmarks independiente, ni historial de incidentes — y cuando llegue, será completamente nuevo. El enrutamiento es cómo lo pruebas sin apostar una ruta orientada al cliente: envíale el tráfico que pueda tolerar sorpresas, conmuta automáticamente a un modelo probado cuando se comporte mal, y traslada toda la carga de trabajo una vez que se haya ganado la confianza. La capa de enrutamiento es también lo que hace que el cálculo de precios sea honesto — cuando Alibaba baja el precio de un modelo al que llamas a través de un endpoint, el cambio está activo el mismo día, porque el precio de lista pasa directamente.
Qué ver
• Si el repositorio de 27B aparece o no. Una lista bajo la organización oficial Qwen en Hugging Face o ModelScope es el evento que pone fin a la demora — y la semana del 10 de agosto casi ha terminado sin una.
• El archivo de licencia del 27B.El Max se distribuyó con una licencia personalizada por niveles de escala, no Apache 2.0. Que el 27B siga ese precedente es la línea más trascendental de su eventual anuncio.
• Arquitectura y longitud de contexto. La comparación Dense vs. MoE y la ventana de contexto determinan para qué sirve la 27B.
• El primer benchmark independiente. El 56 del Max en el Índice de Inteligencia de Artificial Analysis fijó el estándar; la primera evaluación externa del 27B te dirá cuánto de las mejoras de la generación sobreviven en el tamaño de consumo.
• Cobertura de toolchain.Si el 27B hereda el soporte de SGLang/vLLM/TokenSpeed que el Max tenía desde el primer día, y con qué rapidez siguen las cuantizaciones de la comunidad.
Preguntas frecuentes
¿Ya se ha lanzado Qwen3.8-27B?
No. Alibaba lo anunció el 3 de agosto de 2026 y subió los pesos a Hugging Face y ModelScope para la semana del 10 de agosto, pero al 13 de agosto no hay un repositorio oficial de Qwen3.8-27B, ni tarjeta de modelo, ni licencia. Los pesos abiertos de clase Max — Qwen3.8-2.4T-A95B — se lanzaron el 13 de agosto; el 27B no, y los rastreadores de terceros informan que está retrasado sin nueva fecha.
¿Qué hardware necesito para ejecutar Qwen3.8-27B?
No confirmado, pero las proyecciones de la comunidad basadas en la tabla de cuantización de Qwen 3.6-27B sitúan un Q4_K_M en aproximadamente 16 GB de VRAM (una RTX 4090), un Q3_K_M en aproximadamente 13 GB (tarjetas de 12 GB), un Q6_K en aproximadamente 21 GB (tarjetas de 24 GB) y el serving FP8 en aproximadamente 27 GB (una sola L40S). Daniel Han, de Unsloth, reporta unos 17 GB en el lanzamiento. Trata estos valores como estimaciones hasta que la ficha oficial del modelo publique las pautas de hardware.
¿Está disponible Qwen3.8-27B a través de OrcaRouter?
Todavía no. Qwen3.8-27B es un modelo de peso abierto y autoalojado, y no está en la plataforma hoy. El buque insignia de la misma familia — Qwen3.8-Max — ya está disponible a través de OrcaRouter al precio de lista del proveedor de $2/$6 por millón de tokens con un margen del 0%, y cuando el alojamiento del 27B se estabilice, se puede añadir a la misma clave compatible con OpenAI.
¿Debería esperar por Qwen3.8-27B o usar Qwen3.8-Max hoy?
Depende de dónde se ejecute la carga de trabajo. Si necesitas una API de frontera ahora, Qwen3.8-Max está disponible y tiene un precio agresivo de $2/$6 por millón de tokens. Si quieres autoalojar la clase Max hoy, Qwen3.8-2.4T-A95B se puede descargar ahora, pero requiere hardware serio: aproximadamente un modelo de precisión completa de 4,9 TB, o unos 397 GB cuantizado, con más de 410 GB de RAM y VRAM combinadas. Si necesitas un modelo local o localizado en tus instalaciones en una sola tarjeta de consumo, Qwen3.8-27B sigue siendo el que hay que esperar: es la ruta realista de autoalojamiento en esta generación, y su lanzamiento es ahora la gran pregunta en lugar de una fecha fija.
La semana prometida casi ha transcurrido y la mitad de ella no llegó. Qwen3.8-2.4T-A95B se puede descargar, tiene licencia y se puede servir; Qwen3.8-27B tiene confirmada su existencia, sigue comprometido con los pesos abiertos y aún no tiene repositorio, licencia, benchmark ni nueva fecha. Observa si el repositorio del 27B aterriza antes de que termine por completo la semana prometida, qué dice su archivo de licencia junto al del Max y cómo lo puntúan las primeras evaluaciones independientes. Esas tres señales te dirán si se trata de un lanzamiento rutinario de pesos abiertos en dos pasos con el modelo más pequeño aún por llegar, o de un retraso que vale la pena prever.
Comparados en este artículo1
Detectado en este artículo · Benchmarks: Artificial Analysis · actualizado a diario
