
Qwen3.8-27B en Ollama: Un comando, cuatro quants y lo que 'gratis' realmente cuesta
- obsidianNUEVOQwen3.8 27B Uncensored (Aggressive)2026-08-15$0.40 / $4.21 por 1M de tokens · 18 tok/s
- qwenNUEVOQwen: Qwen3.8 27B (free)2026-08-1335 tok/s
- deepseekNUEVODeepSeek: DeepSeek V4 Pro 08132026-08-1253Inteligencia69Código
- grokNUEVOSpaceXAI: Grok 4.62026-08-1261Inteligencia77Código
- metaNUEVOMeta: Muse Spark 1.22026-08-0557Inteligencia72Código
- qwenNUEVOQwen: Qwen3.8 Max2026-08-0358Inteligencia72Código
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3152Inteligencia69Código
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 por 1M de tokens · 2341 tok/s
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463Inteligencia78Código
- googleGoogle: Gemini 3.6 Flash2026-07-2152Inteligencia69Código
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137Inteligencia49Código
- metaMeta: Muse Spark 1.12026-07-1653Inteligencia71Código
- kimiMoonshotAI: Kimi K32026-07-1560Inteligencia76Código
- openaiOpenAI: GPT-5.6 Luna2026-07-0952Inteligencia71Código
- openaiOpenAI: GPT-5.6 Terra2026-07-0957Inteligencia77Código
- openaiOpenAI: GPT-5.6 Sol2026-07-0961Inteligencia77Código
- grokxAI: Grok 4.52026-07-0856Inteligencia72Código
- tencentTencent: Hy32026-07-0642Inteligencia59Código
Ejecútalo con un solo comando: ollama run qwen3.8:27b. Esa es la respuesta completa a la pregunta de la que trata esta página.Qwen3.8 27B — El modelo denso de 27 mil millones de parámetros de Alibaba, cuyos pesos se publicaron el 14 de agosto de 2026 bajo Apache 2.0 — quedó disponible en la biblioteca de Ollama esta semana, y la compilación predeterminada ya es una cuantización Q4_K_M de 18 GB bastante razonable (17 GB de pesos más un codificador de visión de 931 MB). Se ejecuta por completo en una GPU de 24 GB con longitudes de contexto normales, se reparte a la CPU cuando tu tarjeta es más pequeña, y no cuesta nada por token.
Todo aquí está fechado el 15 de agosto de 2026. Las especificaciones provienen de la tarjeta del modelo Qwen3.8 27B; los tamaños de descarga, las etiquetas y los contadores de descargas provienen de la página en vivo de la biblioteca de Ollama; las cifras de referencia son reportadas por Alibaba y aún no tienen réplica independiente. El modelo se lanzó hace días, así que trate todo lo que pueda cambiar como provisional.
El one-liner que realmente funciona
Si ya tienes Ollama instalado, solo te separan dos palabras:
ollama run qwen3.8:27b
El soporte para Ollama llegó en la v0.32.12 — la nota de versión dice, sin rodeos, «Esta versión añade el soporte de Qwen 3.8 27B». La primera ejecución descarga la compilación predeterminada (unos 18 GB, Q4_K_M), y luego te lleva a un REPL de chat con el modo de pensamiento activado por defecto. La página de la biblioteca enumera la compilación con las etiquetas de capacidad «vision tools thinking 27b», que es como sabes que las rutas de visión y de llamada a herramientas están conectadas en la misma descarga. Al momento de escribir esto, la página muestra más de 40 000 descargas y una lista de etiquetas que ya abarca once variantes.

Dos variantes que realmente usarás:
• ollama run qwen3.8:27b-mlx — la compilación para Apple Silicon, misma huella de 18 GB pero compilado para Metal; es la que la nota de lanzamiento de Ollama optimiza específicamente "para máximo rendimiento y calidad de salida adecuada para tareas repetitivas y agentes de codificación."
• ollama run qwen3.8:27b-q8_0 — un quant de 8 bits de 30 GB, para cuando tienes VRAM y quieres los pesos más cercanos a la precisión completa.
Lo que realmente estás descargando
El nombre indica 27B, pero el recuento total de parámetros es 28B: un modelo de lenguaje denso de 27.3B más un codificador visual de 461M que le proporciona entrada nativa de imagen y video. El resto de las especificaciones principales, directamente de la ficha del modelo:
• 64 capas, tamaño oculto 5,120, vocabulario 248,320.
{{1}}Atención híbrida{{/1}}: {{2}}16 capas completas de Gated Attention y 48 capas lineales de Gated DeltaNet{{/2}} — {{3}}una mezcla 3:1 lineal y ligera{{/3}}, y {{4}}la razón por la que un modelo de 27B puede mantener un contexto nativo de 262,144 tokens (ampliable a 1M) sin que la caché KV consuma todo un centro de datos.{{/4}}
• Comprensión nativa de imágenes y videos — “desde diagramas STEM y documentos hasta videos de horas” es la expresión que utiliza Alibaba.
• Apache 2.0. Descárgalo, modifícalo, vende un producto basado en él. Esa licencia es el hecho legal del que depende la economía del resto de este artículo.
La referencia de precisión completa es BF16, por eso existen las etiquetas de 56 GB; cada etiqueta más pequeña supone un intercambio de precisión por espacio, y los benchmarks de la propia ficha del modelo son la referencia contra la que se hace ese intercambio.
Elige un quant, luego revisa tu VRAM, no al revés.
Ollama te da once etiquetas, pero la decisión se reduce a tres tamaños.
• 18 GB — Q4_K_M (predeterminado). Cabe completamente en una tarjeta de 24 GB (clase RTX 4090 / 5090) con contexto normal, y en tarjetas de 16 GB con descarga parcial a CPU — más lento, pero funciona. Esta es la versión para "solo ejecútalo".
• 30 GB — Q8_0. Pesos a casi plena precisión, requiere aproximadamente 40 GB de VRAM para mantenerse completamente en la GPU. En un 27B, ya deberías saber por qué quieres la fidelidad adicional antes de pagar por ella.
• 56 GB — BF16. La compilación de referencia. Requiere hardware de clase H100 o 96 GB de memoria. Nadie ejecuta esto en una GPU de consumo, y está bien.

El número que confunde a la gente es la caché KV. La descarga de 18 GB no significa que 18 GB de VRAM sean suficientes para una sesión con contexto de 262K: con contexto largo, la caché añade varios gigabytes además de los pesos, por lo que una tarjeta de 24 GB ejecutará este modelo cómodamente con contexto de 8K–32K, pero no con 262K. En una tarjeta límite, reduce el contexto, no la cuantización.
Apple Silicon es un objetivo de primera clase aquí.
La nota de la versión v0.32.12 de Ollama menciona específicamente macOS. Concretamente, `ollama run qwen3.8:27b-mlx` necesita unos 18 GB de memoria unificada, por lo que una Mac de 24 GB o más lo ejecuta completamente en la GPU con margen para el contexto. También hay una etiqueta MLX mxfp8 de 32 GB y una etiqueta mlx-bf16 de 56 GB para las máquinas de 64–128 GB. Si tu Mac con chip de la serie M ha estado siguiendo las noticias sobre los modelos de escritorio, esta es la versión que estabas esperando.
262K en la ficha técnica, menos en tu asiento.
The model card lists 262,144 native tokens, extendable to 1M; Ollama's library page reports the same window as 256K. Both are true — 262,144 is 256K times 1024 — and neither means you should type that number into --num-ctx on a 24 GB card. The KV cache grows roughly linearly with context, so on consumer hardware you will live at 16K–64K, not 262K. Start with the Ollama default, raise --num-ctx only when a task actually needs it, and remember the 1M figure requires the extension machinery plus the VRAM to feed it.
Lo que aún es inestable — léelo antes de apostar por ello.
• Aún no hay puntos de referencia independientes. Cada cifra de la tarjeta del modelo es la palabra de Alibaba a fecha del 15 de agosto. Las ganancias declaradas frente a Qwen3.6-27B son considerables — SWE-bench Pro 61.7 frente a 53.5, Terminal Bench 2.1 73.0 frente a 63.4, LiveCodeBench v6 90.3 frente a 83.9, GPQA Diamond 89.2 frente a 87.8 — y todas parecen plausibles, pero ninguna ha sido reproducida por un sistema externo. No base una decisión de producción únicamente en ellas.
• El stack de visión tiene solo unos días. Un informe de error temprano (ollama issue #17753) mostró que la compilación Q4 enrutaba la entrada de visión a través del parser Qwen3.5 y fallaba en imágenes; se corrigió en cuestión de días en el PR #17755, pero la ruta multimodal en un modelo de una semana es exactamente donde deberías probar antes de confiar en él.
• La compilación predeterminada incluye MTP. La etiqueta q4_K_M es también la compilación de predicción de múltiples tokens — decodificación más rápida, y la razón por la que "18 GB" y "27B" pueden coexistir sin contradicción.
• Las etiquetas de cuantización pueden inducir a error en Apple. Las etiquetas de 18 GB "mlx" y "nvfp4" difieren en la cuantización — NVFP4 es un formato FP4 de NVIDIA — así que en un Mac prefiere la compilación -mlx simple a menos que necesites específicamente una variante FP8/FP4 para una GPU Blackwell.
"Free" está haciendo mucho trabajo en ese titular.
Auto-alojar un 27B es gratis por token, pero no es gratis. El marco honesto son tres opciones que cuestan diferentes monedas:
• Ejecútalo tú mismo (Ollama). $0 por token, sin conexión, ilimitado, privado — y el hardware es tuyo. Una GPU de 24 GB o una Mac de 18 GB+ es una compra real, y también lo son la electricidad y el tiempo de configuración. Esta es la decisión correcta cuando Qwen3.8 27B se convierte en tu herramienta de uso diario.
• Llama a una API de $0 con límite de tasa.OrcaRouter ofrece Qwen3.8 27B en su propia infraestructura a costo cero (ID del modelo qwen/qwen3.8-27b-free, $0 por solicitud, con límite de tasa) — porque los pesos son abiertos, no hay costo del proveedor por token que trasladar. Esta es la decisión correcta cuando quieres probar el modelo sin comprar hardware para evaluar una versión publicada hace una semana.
• Llama a una API ilimitada. El mismo modelo sin el límite de tasa es $0.33 por millón de tokens de entrada y $2.40 por millón de tokens de salida en OrcaRouter (qwen/qwen3.8-27b, contexto de 262K, entrada de texto, imagen y video). Esta es la decisión correcta cuando necesitas escala de producción y no quieres estar pendiente de una GPU.

La matemática que decide entre ellos: el uso ocasional se amortiza mejor a $0 o a $0.33/$2.40 que al precio de una GPU; el uso interactivo diario es más barato en local; el rendimiento de producción sostenido es más barato como una API que no tienes que mantener viva. Los requisitos de privacidad y de estar sin conexión te mueven a la primera columna sin importar lo que diga la matemática.
Cuando esta recomendación es incorrecta
• Realmente necesitas un contexto de 100K+. El modelo puede hacerlo; tu tarjeta de 24 GB no puede. Con un contexto realmente largo, una GPU de 40 GB+ o una API con más contexto no es un lujo.
• Necesitas video en producción hoy. Acaban de corregir el error de parser de la ruta de visión; el video en producción con un modelo multimodal de una semana es una apuesta que no deberías hacer sin un respaldo.
• Quieres concurrencia.Una GPU de consumo transmite una o dos generaciones a la vez. Un 27B no es una caja de servicio.
• Estás en hardware solo de CPU. Un 27B en 4 bits en CPU es una demostración lenta, no una herramienta. Una API es la opción honesta hasta que tengas una GPU.
El resultado final
Qwen3.8 27B en Ollama es la forma más fácil de ejecutar un 27B de generación actual que nadie haya lanzado hasta ahora: un solo comando, un valor predeterminado de 18 GB que cabe en una tarjeta de 24 GB, una compilación de primera clase para Apple Silicon y la libertad de Apache 2.0. El quant que deberías elegir es casi siempre el predeterminado Q4_K_M: pasa a q8_0 solo cuando puedas medir la diferencia. Y lo de "gratis" es condicional: si vas a usar el modelo ocasionalmente, la API con límite de velocidad de $0 es más gratis que comprar hardware; si se convierte en tu herramienta diaria, la copia local es lo más barato que tienes. Verifica los números antes de construir sobre ellos: todo en este artículo era cierto el 15 de agosto de 2026, y este modelo está cambiando día a día.
