{{1}}Una tarjeta de título principal que dice{{/1}} {{2}}Qwen3.8-27B GGUF{{/2}} con el subtítulo {{3}}'la cuantización adecuada para tu GPU'{{/3}}, un icono de descarga y chips de archivo para {{4}}Q4_K_M 17.1GB{{/4}} y {{5}}UD-IQ2 9.0GB{{/5}}.
Guides & Insights

Qwen3.8-27B GGUF: ¿Qué cuantización descargar para tu GPU?

Autor

Gideon Frost

Fecha de publicación

Últimos modelos · 20Ver todos los modelos
Benchmarks: Artificial Analysis · actualizado a diario
Volver a todas las publicaciones

Descarga el paquete unsloth/Qwen3.8-27B-GGUF y haz coincidir el archivo con la tarjeta que realmente tienes. Esa es toda la respuesta: una GPU de 24GB (RTX 4090 o 3090) debería optar por Q4_K_M de 17.1GB; una GPU de 16GB debería optar por IQ4_XS de 15.7GB (o Q3_K_M de 13.8GB si quieres margen de contexto); una GPU de 12GB se limita a los archivos de 2 bits, UD-IQ2_XXS de 9.0GB, y ese es un compromiso que debe asumirse con conocimiento. Qwen3.8 27B — el denso modelo de 27 mil millones de parámetros de Ali​baba, con pesos Apache 2.0 publicados el 13 y 14 de agosto de 2026 — se ejecuta de forma inusualmente barata en local porque su atención híbrida solo almacena en caché 16 de sus 64 capas, por lo que una cuantización de 4 bits en una GPU de 24GB soporta cómodamente entre 32K y 64K tokens de contexto. Y el GGUF es la única vía con coste marginal cero: sin clave de API, sin factura por token, sin que los datos salgan de tu máquina.

Sobre las fuentes: la arquitectura, la ventana de contexto y la licencia son oficiales, de la ficha del modelo Qwen3.8 27B en Hugging Face, verificada el 15 de agosto de 2026. Los tamaños GGUF provienen de los repositorios GGUF de unsloth y ggml-org, ese mismo día. La guía de VRAM por GPU es la recomendación oficial de unsloth. Las estimaciones de bytes de la caché KV y las cifras de tokens por segundo son mediciones de la comunidad realizadas en los primeros días tras el lanzamiento, no especificaciones del proveedor. Todos los benchmarks mencionados a continuación han sido reportados por Alibaba y no han sido reproducidos.

El selector de archivos, una línea por quant

UD-IQ2_XXS — 9.0GB — la única opción que cabe cómodamente en una tarjeta de 12GB; espere una pérdida de calidad visible.

UD-Q2_K_XL — 10.7GB — tarjetas de 12GB, casi sin contexto de sobra.

Q3_K_M — 13.8GB — tarjetas de 16GB que quieren margen de contexto.

IQ4_XS — 15.7GB — tarjetas de 16GB: el quant más grande que cabe completo.

Q4_K_M — 17.1GB — tarjetas de 24GB: el punto óptimo, y el archivo al que apunta este artículo.

Q5_K_M — 19.8GB — 24GB, intercambiando margen de contexto por una pequeña ganancia de calidad.

Q6_K — 22.9GB — cabe en 24GB si lo aprietas; casi sin pérdida.

Q8_0 — 29.0GB — 32GB, dividido entre dos tarjetas, o con descarga a la CPU.

BF16 — 54.7GB — tarjetas de servidor y configuraciones de CPU con mucha RAM; precisión de referencia.

{{1}}Dos paquetes, dos tamaños Q4_K_M: el de unsloth es de 17,1 GB; el de ggml-org es de 19,0 GB.{{/1}} {{2}}El paquete de unsloth usa cuantización Dynamic V3.0 (preview) para sus archivos UD-* y es al que la mayoría de las aplicaciones locales recurren por defecto;{{/2}} {{3}}el paquete de ggml-org incluye los K-quants estándar además del cabezal separado de predicción de múltiples tokens utilizado para la decodificación especulativa.{{/3}} {{4}}Cualquiera de los dos Q4_K_M funciona: la diferencia son unos pocos cientos de megabytes y el archivo MTP.{{/4}}

A file-picker card for the Qwen3.8-27B GGUF pack, listing quantizations with sizes and target GPUs: UD-IQ2_XXS 9.0GB for 12GB cards, Q3_K_M 13.8GB and IQ4_XS 15.7GB for 16GB cards, Q4_K_M 17.1GB highlighted for 24GB cards, Q5_K_M 19.8GB and Q6_K 22.9GB for 24GB, Q8_0 29GB for 32GB-plus, and BF16 54.7GB for servers.

Por qué este 27B cabe en tarjetas más pequeñas que la mayoría

Qwen3.8 27B tiene 64 capas, pero solo 16 usan atención completa. Las otras 48 usan atención lineal Gated DeltaNet, que mantiene un estado recurrente de tamaño fijo en lugar de una caché de clave-valor creciente. El diseño de bloques de la propia tarjeta del modelo es 3×(Gated DeltaNet → FFN) por cada 1×(Gated Attention → FFN), una proporción híbrida de 3:1. El efecto práctico: la caché KV es aproximadamente una cuarta parte de lo que un modelo denso convencional de 27B necesita para el mismo contexto. Las mediciones de la comunidad esta semana sitúan la caché en unos 0.5GB con contexto de 8K, 2.0GB con 32K y 16.4GB con la ventana nativa completa de 262K. Esto invierte el consejo habitual: la mayor parte de tu presupuesto de VRAM se destina a los pesos, no al contexto, y una tarjeta de 24GB puede ejecutar Q4_K_M con contexto de 64K–96K sin despeinarse. Puedes reducir aún más la caché con la bandera --cache-type-k de llama.cpp, que cuantiza la propia caché.

A card titled 'Qwen3.8-27B — the KV cache is the cheap part', showing that only 16 of 64 layers keep a cache and listing community-estimated cache sizes of about 0.5GB at 8K context, 2.0GB at 32K, 4.0GB at 64K, 8.0GB at 128K, and 16.4GB at 262K, roughly four times less than a dense 27B.

Tres trampas que te harán tropezar el primer día

Las compilaciones antiguas de llama.cpp rechazan el archivo. El GGUF registra la nueva arquitectura qwen35, por lo que necesitas una compilación actual — cualquier versión anterior a la semana de lanzamiento se niega a cargarlo con un error de arquitectura. Actualiza llama.cpp primero, antes de descargarlo.

La trampa de la plantilla.La plantilla de chat oficial de Jinja envuelve cada turno del asistente en un bloque think incluso cuando el rastro de razonamiento está vacío, lo que produce bloques anidados e historial truncado en chats de varios turnos — parece que el modelo olvidó lo que dijiste. Ejecuta llama.cpp con --jinja y prefiere un paquete que incluya un chat_template.jinja corregido.

Vision necesita un archivo separado. El texto funciona sin configuración adicional; las imágenes y el video no hacen nada silenciosamente a menos que también cargues el proyector mmproj, de aproximadamente 0.9GB. No aparece en la página del repositorio GGUF de unsloth — descárgalo desde el repositorio base o desde el paquete ggml-org. Si planeas procesar documentos o capturas de pantalla, añade --mmproj al comando del servidor.

Ejecútalo: los comandos

llama.cpp, una vez que tengas una compilación actual:

llama-server -m Qwen3.8-27B-Q4_K_M.gguf --ctx-size 32768 --n-gpu-layers 99 --jinja --cache-type-k q8_0

...y añade --mmproj Qwen3.8-27B-mmproj-bf16.gguf si necesitas visión.

Ollama, si quieres la entrada de la biblioteca: {{1}}ollama pull qwen3.8:27b{{/1}}, luego {{2}}ollama run qwen3.8:27b{{/2}}. {{KEEP}}LM Studio and Unsloth Desktop{{/KEEP}} detectan automáticamente la plantilla de chat y la descarga de RAM — son la vía menos complicada para una primera ejecución.

Local vs API: la economía honesta

El GGUF es la ruta gratuita: costo marginal cero, sin límites de tasa, nada sale de tu máquina. No es la ruta barata en términos absolutos — tú proporcionas la GPU de 24GB (una RTX 3090 usada o una RTX 4090 nueva, más la electricidad), y un archivo de 2 bits en una tarjeta de 12GB es una experiencia comprometida.

La ruta de API existe porque los pesos son Apache 2.0, por lo que el costo marginal de servir es casi cero y cualquiera puede alojarla. Qwen3.8 27B está disponible hoy en OrcaRouter a $0.33 por millón de tokens de entrada y $2.40 por millón de salida — el precio de lista del proveedor transferido sin margen — y como los pesos son abiertos, también hay un nivel gratuito con límite de velocidad que cobra $0 por solicitud y devuelve HTTP 429 cuando superas su tope. Un mes representativo de 10 millones de tokens con un 70% de entrada cuesta unos $9.51 en el nivel de pago. Si ya tienes la GPU, lo local gana en costo; si no la tienes, alquilar los tokens supera a comprar una tarjeta para un proyecto secundario.

The OrcaRouter model page for Qwen3.8 27B, showing the input price of 0.33 dollars per million tokens, output price of 2.40 dollars per million tokens, a 262K-token context window, and text, image and video input.

Cuando esta recomendación es incorrecta

Q4_K_M en 24GB es el predeterminado, no la respuesta universal. Elige otra cosa cuando:

Necesitas máxima calidad en un servidor o estación de trabajo — Q8_0 a 29GB o BF16 a 54,7GB con descarga en CPU y RAM, no un archivo de 4 bits.

Estás en una tarjeta Blackwell RTX de la serie 50 — la variante NVFP4 es aproximadamente 1,5× más rápida en los mismos 24 GB de VRAM y utiliza una caché KV FP8 para un contexto más largo. En una 5090, NVFP4 supera a cualquier GGUF en este modelo.

Necesitas el contexto completo de 262K — presupuesta una caché de unos 16GB además de los pesos; eso reduce una tarjeta de 24GB a Q3_K_M, u obliga a la cuantización KV.

Dependes de la decodificación especulativa — elige el paquete de ggml-org, que conserva la cabeza de predicción multi-token; algunos quants lo eliminan para ahorrar unos 0,5GB.

Solo tienes 12GB — una respuesta honesta: un 27B de 2 bits es notablemente peor que el mismo modelo servido correctamente. Prueba el nivel gratuito de la API antes de comprometerte con una configuración local de 2 bits; si es suficientemente bueno, el GGUF puede esperar hasta que el hardware esté a la altura.

En resumen

Qwen3.8 27B es el raro 27B que cabe en una tarjeta de 24GB sin compromisos: una descarga Q4_K_M de 17.1GB, una compilación actual de llama.cpp y una caché KV lo bastante barata como para que el contexto largo cueste casi nada. Descarga ese archivo si tienes el hardware, recuerda que la visión necesita el mmproj por separado, y espera la trampa de la plantilla la primera vez que una conversación multiturno parezca olvidadiza. Si no tienes el hardware, el mismo modelo es una API de $0.33/$2.40 con un nivel gratuito con límite de frecuencia, así que no hay razón para ejecutar un archivo de 2 bits con el que no estés satisfecho. El GGUF es el camino gratuito; solo que ya no es el único camino.

© 2026 OrcaRouter

Para proveedores

¿Operas una plataforma de inferencia? Publica tus modelos en OrcaRouter.

providers@orcarouter.ai

Únete a la comunidad

Discordsupport@orcarouter.aiXGitHubYouTube