
Qwen3.8-27B con Unsloth: Ejecútalo, cuantifícalo o hazle fine-tuning localmente
- obsidianNUEVOQwen3.8 27B Uncensored (Aggressive)2026-08-15$0.40 / $4.21 por 1M de tokens · 18 tok/s
- qwenNUEVOQwen: Qwen3.8 27B (free)2026-08-1335 tok/s
- deepseekNUEVODeepSeek: DeepSeek V4 Pro 08132026-08-1253Inteligencia69Código
- grokNUEVOSpaceXAI: Grok 4.62026-08-1261Inteligencia77Código
- metaNUEVOMeta: Muse Spark 1.22026-08-0557Inteligencia72Código
- qwenNUEVOQwen: Qwen3.8 Max2026-08-0358Inteligencia72Código
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3152Inteligencia69Código
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 por 1M de tokens · 2341 tok/s
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463Inteligencia78Código
- googleGoogle: Gemini 3.6 Flash2026-07-2152Inteligencia69Código
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137Inteligencia49Código
- metaMeta: Muse Spark 1.12026-07-1653Inteligencia71Código
- kimiMoonshotAI: Kimi K32026-07-1560Inteligencia76Código
- openaiOpenAI: GPT-5.6 Luna2026-07-0952Inteligencia71Código
- openaiOpenAI: GPT-5.6 Terra2026-07-0957Inteligencia77Código
- openaiOpenAI: GPT-5.6 Sol2026-07-0961Inteligencia77Código
- grokxAI: Grok 4.52026-07-0856Inteligencia72Código
- tencentTencent: Hy32026-07-0642Inteligencia59Código
Sí: Unsloth ejecuta Qwen3.8 27B, y es la forma más rápida de llevar el nuevo modelo Apache-2.0 de Alibaba a tu propia GPU. La respuesta completa en una línea: abre Unsloth Studio, busca «Qwen3.8 27B», elige UD-Q4_K_XL (17.9GB) en una tarjeta de 24GB, y chatea en menos de un minuto. Detrás de ese clic, Unsloth lanzó tres cosas la misma semana en que se publicaron los pesos (13–14 de agosto de 2026): el paquete unsloth/Qwen3.8-27B-GGUF basado en la cuantización Unsloth Dynamic V3.0 (vista previa), soporte completo en Unsloth Studio y Desktop, y la versión v0.1.800-beta con exportación GGUF, detección de imatrix y mejoras de ajuste a la VRAM. También permite hacer fine-tuning del modelo — Unsloth afirma un entrenamiento 2× más rápido con un 70% menos de VRAM. Qwen3.8 27B es un modelo denso de visión y lenguaje con 27 mil millones de parámetros cuya atención híbrida mantiene solo 16 de las 64 capas en atención completa, por lo que un archivo de 4 bits cabe en tarjetas donde la mayoría de los modelos de 27B no caben.
En cuanto a las fuentes: los datos del modelo son oficiales, de la ficha del modelo Qwen3.8 27B en Hugging Face, verificada el 15 de agosto de 2026. El soporte de Unsloth, los tamaños de cuantización, los requisitos de VRAM y los comandos de instalación provienen de las notas de la versión y la documentación de Unsloth, del mismo día. El precio de la API está en vivo desde el catálogo de OrcaRouter, del mismo día. Las afirmaciones de Unsloth de "2× más rápido, 70% menos VRAM" y "con diferencia el modelo más potente para su tamaño" son afirmaciones del proveedor, no reproducidas de forma independiente.
Qué significa "Qwen3.8 + Unsloth": cuatro cosas diferentes
Unsloth son cuatro cosas distintas, y los resultados de búsqueda por palabras clave las mezclan. Saber cuál necesitas es la mitad de la configuración:
• unsloth/Qwen3.8-27B-GGUF — los archivos de pesos cuantizados en Hugging Face, 21 cuantizaciones más un proyector de visión. Construido con Dynamic V3.0 (vista previa), no con el Dynamic 2.0 anterior (que se anunció el 24 de abril de 2025 y es anterior a este modelo). Esta es la ruta de «descargar un archivo», utilizable desde cualquier compilación de llama.cpp.
• Unsloth Studio — la aplicación de navegador que instalas o ejecutas desde un Hugging Face Space. Busca en el hub de modelos, haz clic en un quant, chatea con herramientas. Sin configuración manual de plantillas ni de parámetros de inferencia.
• Unsloth Desktop — la aplicación GUI local para macOS, Windows y Linux que envuelve Studio y entrenamiento. Aquí es donde vive el ajuste fino "2× más rápido con 70% menos VRAM".
• La biblioteca Python unslothfrom unsloth import FastLanguageModel, la API de ajuste fino QLoRA utilizada en notebooks y scripts.
Las notas de la versión v0.1.800-beta de Unsloth, tituladas "Release Qwen3.8 27B", indican que Qwen3.8 27B y el modelo de 2.4T parámetros Qwen3.8-2.4T-A95B "ahora se pueden ejecutar localmente en Unsloth", que el 27B "funciona con 17GB de RAM mediante Unsloth Dynamic GGUFs" y que "también puedes ajustar (fine-tune) Qwen3.8 27B en Unsloth". La misma versión añade cuantizaciones NVFP4, comprueba el espacio en disco antes de exportar GGUFs, detecta el soporte real de imatrix para GGUF en Studio y hace que la inferencia sea hasta un 10% más rápida en GGUF con un límite de VRAM ajustable.

Elige tu quant por VRAM, no por vibras.
La tabla de memoria de Unsloth se refiere a la RAM total más la VRAM (o memoria unificada), y es la guía oficial. Un Qwen3.8 27B de 4 bits necesita 17–19 GB; una RTX 4090 de 24 GB, una RTX 5080 de 24 GB o un Mac con memoria unificada de 24 GB es el mínimo realista para una configuración cómoda de 4 bits. Las tres opciones que cubren a casi todos:
• 12GB → UD-IQ2_XXS a 9.0GB — el único archivo que cabe completo; espera una pérdida de calidad visible. Haz esta elección a sabiendas.
• 16GB → UD-Q3_K_XL a 13.4GB — el mejor archivo de 3 bits, según el propio selector de Unsloth.
• 24GB → UD-Q4_K_XL a 17.9GB — el archivo de 4 bits recomendado y la respuesta predeterminada de este artículo.
• 48–64GB → UD-Q8_K_XL de 31.5GB — casi sin pérdidas en una estación de trabajo o configuración de doble GPU.
La escalera completa, según la lista de archivos de unsloth/Qwen3.8-27B-GGUF y la documentación de Unsloth, ambos verificados el 15 de agosto de 2026: UD-Q8_K_XL 31.5GB, UD-Q6_K_XL 25.9GB, UD-Q5_K_XL 20.2GB, UD-Q4_K_XL 17.9GB, UD-Q3_K_XL 13.4GB, UD-Q2_K_XL 10.7GB, UD-IQ3_XXS 11.9GB, UD-IQ2_M 10.3GB, UD-IQ2_XXS 9.0GB. También están los K-quants estándar (Q4_K_M 17.1GB, Q8_0 29.0GB), y el paquete incluye un proyector de visión (mmproj-BF16, 931MB), de modo que las imágenes y el video funcionan si lo cargas. Unsloth llama a toda la escalera "Dynamic V3.0 (preview)", más nuevo que el Dynamic 2.0 que verás en publicaciones antiguas, y que fue creado para modelos lanzados más de un año antes.

Ejecútalo con Unsloth en tres minutos
La ruta de un clic: en macOS o Linux, ejecuta curl -fsSL https://unsloth.ai/install.sh | sh, luego unsloth studio -p 8888 y abre http://127.0.0.1:8888. En Windows, irm https://unsloth.ai/install.ps1 | iex. Si no quieres instalar nada, Studio de Unsloth también está publicado como un Hugging Face Space — ábrelo en el navegador, busca "Qwen3.8 27B" y elige una cuantización según la memoria que tengas. Studio ajusta automáticamente los parámetros de muestreo y la plantilla de chat, descarga a RAM cuando la VRAM se queda corta y detecta configuraciones multi-GPU — la parte de "sin configuración" es real, y es la forma más rápida de estar ejecutando el modelo de esta semana.
La ruta de archivos primero, si ya usas llama.cpp: descarga un quant y ejecútalo directamente. Estos son los comandos propios de Unsloth, verificados contra su documentación:
hf download unsloth/Qwen3.8-27B-GGUF --local-dir unsloth/Qwen3.8-27B-GGUF --include "*UD-Q4_K_XL*"
./llama.cpp/llama-cli --model unsloth/Qwen3.8-27B-GGUF/Qwen3.8-27B-UD-Q4_K_XL.gguf --temp 1.0 --top-p 0.95 --top-k 20 --min-p 0.0
Esos valores de muestreo son los ajustes recomendados del modo de pensamiento de la tarjeta del modelo. Cambia el glob de --include por *UD-Q3_K_XL* en una tarjeta de 16 GB, y añade --mmproj apuntando al mmproj-BF16.gguf del paquete si necesitas visión. Un detalle: llama.cpp debe ser una compilación actual; el archivo registra la nueva arquitectura qwen35, y cualquier versión anterior a la semana de lanzamiento se niega a cargarlo.
Afínalo con Unsloth
El ajuste fino es donde Unsloth se gana su reputación: la biblioteca afirma un entrenamiento 2× más rápido con un 70% menos de VRAM frente a los Transformers + PEFT estándar, lo que hace que QLoRA en un 27B sea viable en una única tarjeta gráfica de consumo. El punto de entrada para el ajuste fino es el repositorio simple unsloth/Qwen3.8-27B (página de archivos safetensors, 28B) en lugar del paquete GGUF. El patrón QLoRA estándar de Unsloth, aplicado a este modelo:
from unsloth import FastLanguageModel
model, tokenizer = FastLanguageModel.from_pretrained("unsloth/Qwen3.8-27B", max_seq_length=8192, load_in_4bit=True)
model = FastLanguageModel.get_peft_model(model, r=16)
luego un bucle estándar de trl.SFTTrainer sobre tu conjunto de datos. Ese fragmento es el patrón QLoRA estándar de la documentación de Unsloth — las afirmaciones sobre el benchmark de entrenamiento son propias de Unsloth y no algo que yo haya reproducido — y se aplican dos advertencias: los kernels de Unsloth parchean las capas del transformador de texto, así que planifica manejar el codificador de visión por separado, y mantén el paquete unsloth en la versión actual porque esta arquitectura tiene días de vida y los desajustes de versión fallan ruidosamente.
Lo que Unsloth Studio gestiona por ti
Ejecutar un GGUF manualmente implica calibrar con precisión el tamaño del contexto, la descarga a RAM y la llamada a herramientas. Studio lo reduce a valores predeterminados: dimensiona el contexto según la memoria realmente libre, descarga los modelos de visión inactivos para liberar VRAM para el chat o el entrenamiento, detecta configuraciones multi-GPU y conecta la búsqueda web, la ejecución de código y las conexiones de agentes (Claude Code, Codex, MCP) de serie. La versión v0.1.800-beta también mejoró los aspectos que duelen en la práctica: las exportaciones GGUF ahora comprueban el espacio en disco antes de iniciar una fusión larga en lugar de fallar a mitad de camino, Studio detecta si el GGUF que está exportando realmente admite imatrix (para no desperdiciar una ejecución), y los protectores de memoria ya no sobre-reservan memoria de GPU. Para un modelo que tiene tres días, 'sin configuración' está haciendo un trabajo real.
Local gratis vs API de pago: la economía honesta
La diferencia fundamental entre Unsloth y una API no es la calidad: es quién es dueño del hardware. Unsloth es la vía gratuita: coste marginal cero por token, nada sale de tu máquina, sin límites de solicitudes y control total de los pesos. No es gratis en términos absolutos: tú pones la GPU y la electricidad, y un archivo de 2 bits en una tarjeta de 12 GB es una experiencia subóptima. Qwen3.8 27B es un modelo denso con capacidades de visión, así que en 4 bits son 17,9 GB de pesos antes del contexto; la máquina es el precio de entrada.
La ruta de API existe porque los pesos son Apache-2.0, por lo que cualquiera puede alojarlos a un costo marginal cercano a cero. Qwen3.8 27B está hoy en el catálogo de OrcaRouter a $0.33 por millón de tokens de entrada y $2.40 por millón de salida, el modelo autoalojado en nuestra propia infraestructura — sin precio de proveedor que repercutir — con una ventana de contexto de 262K tokens y entrada de texto, imagen y video. Debido a que los pesos son abiertos, también hay un nivel gratuito con límite de velocidad que cobra $0 por solicitud. Un mes representativo de 10 millones de tokens con un 70% de entrada cuesta alrededor de $9.51 en el nivel de pago. Si ya tienes una tarjeta de 24 GB, la opción local gana en costo; si no la tienes, alquilar tokens a esa tarifa supera a comprar una tarjeta para un proyecto secundario, y el nivel gratuito es la forma honesta de probar el modelo antes de comprometerte con cualquier hardware.

Cuándo Unsloth es la respuesta incorrecta
Unsloth Studio y el paquete GGUF son la elección correcta para una sola máquina. Son la elección equivocada cuando:
• Tienes una tarjeta Blackwell de la serie RTX 50. Los quants unsloth/Qwen3.8-27B-NVFP4 son aproximadamente 1,5× más rápidos que BF16 en la misma VRAM y usan una caché KV FP8 para contexto más largo. Esa vía pasa por vLLM o SGLang, no por un GGUF ni por Studio.
• Necesitas la ventana nativa completa de 262K o la extensión YaRN de 1M en producción. Un modelo de visión denso con contexto largo es pesado; el dimensionamiento de contexto de Unsloth lo ejecutará de buena gana en una longitud menor para ti, pero un stack de servicio con una gestión adecuada de KV supera a una aplicación local.
• Estás atendiendo a muchos usuarios. Unsloth es una aplicación local y una biblioteca de fine-tuning, no un servidor multiusuario. Para concurrencia, escalado automático y garantías de tiempo de actividad, necesitas un endpoint alojado.
• No tienes ninguna GPU. Una respuesta honesta: una 27B de 2 bits en una tarjeta de 12 GB es notablemente peor que el mismo modelo servido correctamente. Usa primero el nivel gratuito de la API; si es suficientemente bueno, compra hardware cuando el caso de uso esté demostrado.
• Quieres afinar la parte visual. Las aceleraciones de Unsloth se dirigen a las capas del transformador de texto; un ajuste fino multimodal completo necesita una pila diferente.
En resumen
Qwen3.8 27B con Unsloth es un problema resuelto a partir de esta semana: instala Studio, elige UD-Q4_K_XL para una tarjeta de 24GB (UD-Q3_K_XL para 16GB, UD-IQ2_XXS para 12GB), y el modelo funciona sin configuración y sin cobro por token. El camino del ajuste fino es real, y las afirmaciones de velocidad de Unsloth son la razón por la que QLoRA de 27B es práctico en una sola tarjeta. Ten en cuenta que la escalera de cuantización es Dynamic V3.0 (vista previa), no la Dynamic 2.0 que describen los artículos más antiguos; mantén llama.cpp actualizado; y si no tienes el hardware, los mismos pesos están disponibles como una API de $0.33/$2.40 con un nivel gratuito con límite de tasa, así que no hay razón para ejecutar un archivo de 2 bits con el que no estés satisfecho. Lo local es la vía gratuita y, por primera vez en esta clase de peso, también es la vía fácil.
