Tarjeta de título principal para Qwen3.8-27B, el modelo denso de visión-lenguaje de 27 mil millones de parámetros de la línea Qwen3.8 de Alibaba, con el subtítulo '27B denso - visión-lenguaje nativa - Apache 2.0' y tres chips de características que dicen 'contexto de 262,144 tokens', 'entrada de texto + imagen + video' y 'salida de texto', con el logotipo de OrcaRouter en la esquina inferior derecha.
Guides & Insights

Qwen3.8-27B: El modelo multimodal compacto de la línea Qwen3.8 de Alibaba

Autor

Gideon Frost

Fecha de publicación

Últimos modelos · 20Ver todos los modelos →
Benchmarks: Artificial Analysis · actualizado a diario
Volver a todas las publicaciones

Qwen3.8-27B es el miembro denso y de nodo único de la generación Qwe​n3.8 de Aliba​ba: un modelo nativo de visión-lenguaje de 27.000 millones de parámetros, publicado en Hugging Face bajo Apache 2.0, que acepta texto, imágenes y vídeo y devuelve texto con una ventana de contexto de 262.144 tokens. Esta es la página de referencia de ese modelo —la descripción canónica de qué es, cuánto cuesta invocarlo y qué puede hacer—, y conviene decir de entrada por qué existe una página para un modelo cuyos pesos aparecieron por primera vez en agosto de 2026 y no en los últimos siete días. No estamos informando de un lanzamiento. Estamos respondiendo a una pregunta permanente: los lectores llegan a nosotros buscando el nombre «Qwen3.8-27B» miles de veces al mes y, hasta ahora, ninguna página nuestra era dueña de esa respuesta. El lanzamiento del propio modelo, fechado en la ficha de Qwe​n y registrado como 2026-08-14 por Artificial Analysis, es un dato que esta página utiliza para fechar el modelo, no un acontecimiento que esta página informe.

Léelo como la excepción que es: en una lectura estricta de siete días, un modelo de mediados de agosto de 2026 no es reciente, y este elemento se descartaría como noticia. La justificación aquí es distinta. Es una página de referencia cuyas cifras se verificaron contra la propia ficha del modelo de Qwe​n, el archivo de licencia del repositorio, el tarifario de Qwe​n Cloud y Artificial Analysis el 2026-09-28, y cuya razón de existir es la demanda de búsqueda que medimos de primera mano ese mismo día. No es un segundo anuncio, y nadie debería interpretarlo como tal.

Dónde se sitúa 27B en la gama Qwen3.8

La generación Qwe​n3.8 no es un solo modelo, y el sufijo de tamaño es lo que da sentido al nombre. Las notas del propio repositorio de Qwe​n para toda la familia explicitan la división:

• Qwen3.8-27B — parámetros densos de 27B, entrada nativa de imagen y vídeo, Apache 2.0. El miembro apto para el despliegue: un modelo dimensionado para ejecutarse en una sola GPU o en un nodo pequeño, y el tema de esta página.

• Qwen3.8-Max, basado en Qwen3.8-2.4T-A95B — 2,4 billones de parámetros totales con 95 mil millones activos, el modelo de la clase Qwen-Max que Alibaba abrió por primera vez en esta generación. Su repositorio lleva una licencia personalizada qwen3.8-max en lugar de Apache 2.0.

• Qwen3.8-Flash-Next — la vista previa experimental de la arquitectura en la que, según Qwen, se basará Qwen4, publicada bajo la licencia qwen-community-1.0El Qwen3.8-Flash alojado se basa en ella.

Así que "27B" no es un nivel de acabado del modelo Max; es la clase de tamaño que un solo equipo puede atender realmente. Lo que Alibaba afirma que hereda es la receta de entrenamiento: la ficha describe a Qwen3.8-27B como el resultado de tomar los avances de la generación en programación, trabajo profesional, investigación y tareas agénticas de horizonte largo, y comprimirlos en un checkpoint denso.

Scoreboard infographic titled 'Qwen3.8-27B - the scoreboard' with six rows: Parameters 27B dense (27.8B with vision), Context 262,144 native and 1M with YaRN, Modalities text + image + video in and text out, Licence Apache 2.0 with commercial use, Terminal Bench 2.1 of 73.0 marked vendor-reported, and AA Intelligence Index 33.7 marked independent, with a footer reading 'Qwen figures vendor-reported and unreproduced; AA figures per Artificial Analysis.' and the OrcaRouter logo in the bottom-right corner.

La arquitectura que publica Qwen

Todas las figuras que aparecen a continuación provienen de la tarjeta del modelo en Qwe​n/Qwen3.8-27B, que es la documentación propia del proveedor:

• Parámetros — 27B según lo comercializado. Los propios metadatos de safetensors del repositorio suman 27.781.427.952 parámetros en BF16 repartidos en 18 fragmentos, así que rondan los 27,8B una vez contabilizada la torre de visión. Aquí no hay mezcla de expertos: todos los parámetros están activos en cada token.

• Forma — 64 capas, dimensión oculta 5.120, dimensión intermedia de feed-forward 17.408, embedding de tokens y salida del LM 248.320 (con relleno).

• Atención híbrida — el diseño que imprime Qwe n es 16 × (3 × (Gated DeltaNet → FFN) → 1 × (Gated Attention → FFN)): tres bloques de atención lineal por cada bloque de atención completa, una proporción de 3:1. Gated DeltaNet ejecuta 48 cabezas de atención lineal para V y 16 para QK con dimensión de cabeza 128; Gated Attention ejecuta 24 cabezas de consulta frente a 4 cabezas KV con dimensión de cabeza 256, con una dimensión rotatoria de 64. Esa proporción es lo que hace asequible una ventana de 262K en un modelo de 27B, y es la misma línea que Qwen3.8-Flash-Next amplía con atención dispersa.

• Predicción multi-token — la ficha indica que el modelo se entrena con MTP durante varios pasos, el truco de borrador que acelera la generación en pilas de servicio compatibles con MTP.

• Control de pensamiento — el modo de pensamiento está activado por defecto y se puede desactivar por solicitud. reasoning_effort acepta xhigh (el valor predeterminado), medium o low, y preserve_thinking está activado por defecto, de modo que los rastros de razonamiento se conservan entre turnos en lugar de regenerarse.

Ventana de contexto y límite máximo de salida

La ficha indica 262.144 tokens de forma nativa, ampliable a 1.000.000 con escalado RoPE (YaRN). La propia guía de servicio de Qwe​n para ejecuciones agénticas prolongadas, dentro de ese margen de 1M, es permitir hasta 262.144 tokens para contenido de razonamiento y hasta 131.072 tokens para la respuesta final — el límite máximo es una configuración de servicio, no una propiedad fija del checkpoint.

Conviene mantener separadas dos ventanas, porque es fácil confundirlas. Los pesos abiertos se ejecutan de forma nativa a 262.144; la versión alojada en Qwe​n Cloud, que la tarjeta del modelo describe como aún por llegar («el servicio llegará pronto»), aparece en la página del modelo de Qwe​n Cloud con un contexto de 1M, una entrada máxima de 991K, una salida máxima de 131K y un presupuesto máximo de razonamiento de 262K. La hoja de especificaciones del producto alojado no es la hoja de especificaciones del checkpoint.

Modalidades: qué entra y qué sale

La entrada es texto, imagen y vídeo; la salida es solo texto. La ficha describe a Qwen3.8-27B como "un modelo nativo de visión-lenguaje que entiende imágenes y vídeos" y su código de ejemplo admite los tres tipos de entrada. No hay entrada de audio, ni generación de imágenes, ni salida de voz. El registro del modelo de Artificial Analysis para el mismo checkpoint coincide en el envelope —entrada de imagen, vídeo y texto, salida de texto—, lo que es una segunda lectura útil porque no es la página propia de Alibaba.

Lo que el lanzamiento de Apache 2.0 realmente permite

La licencia no es un resumen de una entrada de blog; el repositorio incluye el propio texto de la Apache License, Version 2.0, y los metadatos de la tarjeta declaran license: apache-2.0. Lo que eso concede, según se lee en el texto de la licencia: una licencia de derechos de autor perpetua, mundial y libre de regalías para reproducir, preparar obras derivadas, mostrar públicamente, sublicenciar y distribuir la obra y sus derivados, además de una licencia de patentes por parte de los contribuyentes, con el uso comercial entre los propósitos permitidos y sin restricción de campo de uso, sin umbral de número de usuarios y sin acuerdo comercial por separado. Apache 2.0 también es permisiva en el sentido que importa para distribuir productos: los pesos derivados pueden redistribuirse bajo términos diferentes, siempre que se conserven la licencia y los avisos de atribución y se indique qué se cambió (Secciones 4a–4c). La Sección 6 no concede derechos sobre el nombre Qwe​n ni sobre las marcas registradas, por lo que un fork de Apache-2.0 no puede comercializarse como Qwe​n.

La comparación dentro de la familia es reveladora, y se aprecia en los repositorios más que en la cobertura: el checkpoint 2.4T-A95B se autodenomina otro con una qwen3.8-max licencia, y Qwen3.8-Flash-Next usa qwen-community-1.0. El 27B es el de los tres que llega bajo la Apache 2.0 a secas.

La posición de referencia independiente

Artificial Analysis ha ejecutado el modelo, y su registro merece separarse de la propia tabla de Alibaba porque los dos responden a preguntas diferentes. El índice independiente, medido en la xhigh configuración:

• Intelligence Index 33.7 — el valor almacenado de Artificial Analysis, que su página de modelo muestra redondeado a 34. Se publican dos clasificaciones y miden conjuntos distintos: el propio mosaico de resumen de esa página sitúa el modelo en 1.º de los 142 modelos de su clase de tamaño, en la comparación de misma clase que describe el tooltip de la página, mientras que la fila de nuestro catálogo procedente de Artificial Analysis registra el 45.º de 145, en torno al percentil 67. Ninguna es una clasificación frente al mismo conjunto que la otra, así que no las leas como un mismo número en dos formatos.

• Índice de Coding 68,1 — incluido en nuestro catálogo con artificialanalysis.ai como fuente designada, clasificado en el puesto 35 de 138 dentro del conjunto de ese índice. El modelo se sitúa más alto en programación que en inteligencia general, lo cual concuerda con la forma de la propia tabla del proveedor.

• Escalera de esfuerzo, mismo arnés — reducir el esfuerzo de razonamiento desplaza el índice una gran distancia: 33,7 en xhigh, 27,6 en medium, 26,2 en low, y 20,2 con el razonamiento desactivado por completo. Esa es una dispersión medida de 13,5 puntos, y es el argumento más concreto para ajustar el esfuerzo por carga de trabajo en lugar de por modelo.

• En qué coinciden y en qué difieren las dos fuentes — en GPQA Diamond, la ficha de Alibaba reporta 89,2 y Artificial Analysis mide 90,5. En Humanity's Last Exam la ficha reporta 30,8 y Artificial Analysis 33,9. Cerca, pero no el mismo número, y eso es normal: distintos arneses, distintas ejecuciones. Una advertencia pertenece al artículo más que a una nota al pie: ningún tercero ha publicado una comparación directa entre Qwen3.8-27B y cualquiera de los modelos de la tabla comparativa de Alibaba ejecutados con el mismo esfuerzo y en un arnés equivalente, por lo que toda comparación entre modelos de esta página es una comparación de mediciones separadas, no un resultado.

Screenshot of the Artificial Analysis model page for Qwen3.8 27B in its xhigh configuration showing a same-class comparison rank of 1 of 142 next to an Intelligence tile, 46.6 output tokens per second at rank 55 of 142, $0.50 per million input tokens and $3.00 per million output tokens, a 256k-token context window, 27B total parameters, an Apache 2.0 licence, an open-weights marker and a release month of August 2026, with the summary text reporting a score of 34 on the Artificial Analysis Intelligence Index.

Qué informa Qwen y cómo interpretarlo

La ficha del modelo incluye aproximadamente dos docenas de puntuaciones con columnas comparativas para Qwen3.6-27B, Qwen3.7-Plus, Muse Glimmer-30B y Opus4.6 Max. Todo son datos reportados por el proveedor y no reproducidos —la propia evaluación de Aliba​ba, impresa por Aliba​ba—, y varias filas usan un arnés de Claude Code evaluado por una build de GPT-5.4, según indican las notas al pie de la ficha. Las cifras destacadas del proveedor, sobre esa base:

• Codificación terminal agéntica — Terminal Bench 2.1 (Terminus) 73,0, frente a 63,4 del Qwen3.6-27B al que reemplaza, con Opus4.6 Max liderando la fila con 78,2.

• Codificación agéntica — SWE-bench Pro 61.7, QwenSWEBench 79.0, DeepSWE 1.1 42.2, NL2Repo-Bench 42.3, LiveCodeBench v6 90.3.

• Agentes y trabajo de oficina — CoWorkBench 70.7, JobBench 33.4, Agents' Last Exam 42.9 por puntuación (Pass@1 20.4).

• Razonamiento general — GPQA Diamond 89.2, HLE 30.8, IFBench 79.5. Opus4.6 Max lidera ambas filas de razonamiento en la propia tabla del proveedor, con 91.3 y 40.0.

• Visión y uso de computadora — OSWorld-Verified 84.3, AndroidWorld 81.9, WebArena-Verified 64.8, OmniDocBench 1.5 91.1, RealWorldQA 85.9.

El resumen honesto de esa tabla es más limitado de lo que la tabla aparenta. Frente a su predecesor directo, las ganancias son grandes y consistentes —QwenSWEBench 79,0 frente a 49,3, DeepSWE 42,2 frente a 13,3—, y eso es una afirmación sobre una sola generación de cambio en la receta. Frente a los modelos de frontera de las columnas vecinas, gana algunas filas y pierde otras, según los propios números de Aliba​ba, debido a la propia elección de arnés de evaluación de Aliba​ba.

Ejecutándolo

Los pesos son 18 fragmentos BF16 en formato Transformers, y la ficha enumera Hugging Face Transformers, vLLM, SGLang y TokenSpeed como stacks compatibles. Hemos redactado por separado las rutas de despliegue local y de cuantización, y son los lugares adecuados para ese detalle: Qwen3.8-27B en Ollama para un demonio local, y el recorrido de benchmarks para la tabla de resultados completa, incluido lo que cambió respecto a Qwen3.6-27B. Esta página se centra en el modelo en sí.

Qwen3.8-27B en nuestro catálogo

Dos fichas están activas hoy en OrcaRouter, una junto a otra, y ambas se releyeron el 2026-09-28 antes de escribir este párrafo. qwen/qwen3.8-27bcotiza a $0.33 por millón de tokens de entrada y $2.40 por millón de tokens de salida, con la ventana completa de 262,144 tokens, entrada de texto, imagen y video, y las superficies de razonamiento, herramientas, salida estructurada y JSON expuestas como parámetros. Su hermano obsidian/Qwen3.8-27B —los mismos pesos servidos en block-FP8 con la torre de visión mantenida a plena precisión y, en palabras de la propia ficha, "diseñado para ofrecer respuestas directas y completas en una amplia variedad de prompts"— cotiza a $0.40 de entrada y $4.21 de salida. Ambos responden a chat completions y a la API de Responses, de modo que una tarea de análisis de documentos o de capturas de pantalla puede dirigirse a cualquiera de los dos modelos con una sola clave y un solo endpoint, sin un segundo contrato y sin cambiar el código.

Para que se hagan una idea, nuestro propio playground ha movido 105,1 millones de tokens a través de qwen/qwen3.8-27b en los últimos siete días, con una mediana de 3,8 segundos hasta el primer byte y una tasa de error del 3,3 % en el mismo periodo. Esos son nuestros números de servicio, no un veredicto sobre el modelo.

Screenshot of the OrcaRouter model page for qwen/qwen3.8-27b showing a 262K-token context window, text, image and video input, text output, the vision, tools, JSON and reasoning badges, a 3.80-second p50 time to first token, 105.1M tokens served in seven days, and list pricing of $0.33 per million input tokens and $2.40 per million output tokens.

Las búsquedas que llevan aquí

La demanda detrás de esta página está dispersa y se queda justo fuera del clic. En los 28 días hasta el 2026-09-25, nuestra propiedad recibió 8.931 impresiones y 273 clics en 69 grafías exactas distintas del nombre del modelo — "qwen3.8 27b", "qwen3.8-27b", "qwen 3.8 27b" y decenas más de formas de escribir los mismos tres tokens. Nuestra mejor posición en las grafías más grandes osciló entre 9,0 y 10,6. Esas son posiciones que ocupábamos por accidente gracias a otras páginas, que es exactamente el problema que soluciona una página canónica: en el noveno puesto estás en la página, y nadie hace clic. El único lugar donde el tráfico convierte es en un idioma que no es el inglés — una grafía en ruso del nombre se sitúa en la posición 1,8 para nosotros y convierte al 14,4%.

Nada de eso es evidencia sobre el modelo. Es evidencia sobre lo que la gente escribe, y es la razón por la que existe la página.

Lo que esto significa en conjunto: un checkpoint denso de 27B con un diseño de atención genuinamente inusual, una licencia permisiva, comprensión de video nativa, términos Apache-2.0 que te permiten distribuir un derivado, un ranking de codificación independiente en el cuarto superior de lo que mide Artificial Analysis, y una tabla de proveedor que es sólida frente a su predecesor y mixta frente a la frontera. La pregunta abierta es la que nadie fuera de Alibaba puede responder todavía — cómo se comporta en producción la ruta alojada de 1M de tokens, y si la arquitectura Flash-Next llega a un modelo de este tamaño.

El núcleo 2.4T-A95B que hay detrás de Qwen3.8-Max ya está activo en el mismo catálogo: qwen/qwen3.8-max a $2.00 / $6.00 por millón de tokens, si el 27B no es el tamaño que necesitas.

Comparados en este artículo2

Detectado en este artículo · Benchmarks: Artificial Analysis · actualizado a diario