
Qwen3.8-27B con MLX en Apple Silicon: Sí, funciona — Esto es lo que realmente necesitas
- obsidianNUEVOQwen3.8 27B Uncensored (Aggressive)2026-08-15$0.40 / $4.21 por 1M de tokens · 22 tok/s
- qwenNUEVOQwen: Qwen3.8 27B (free)2026-08-1343 tok/s
- deepseekNUEVODeepSeek: DeepSeek V4 Pro 08132026-08-1253Inteligencia69Código
- grokNUEVOSpaceXAI: Grok 4.62026-08-1261Inteligencia77Código
- metaNUEVOMeta: Muse Spark 1.22026-08-0557Inteligencia72Código
- qwenQwen: Qwen3.8 Max2026-08-0358Inteligencia72Código
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3152Inteligencia69Código
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 por 1M de tokens · 273 tok/s
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463Inteligencia78Código
- googleGoogle: Gemini 3.6 Flash2026-07-2152Inteligencia69Código
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137Inteligencia49Código
- metaMeta: Muse Spark 1.12026-07-1653Inteligencia71Código
- kimiMoonshotAI: Kimi K32026-07-1560Inteligencia76Código
- openaiOpenAI: GPT-5.6 Luna2026-07-0952Inteligencia71Código
- openaiOpenAI: GPT-5.6 Terra2026-07-0957Inteligencia77Código
- openaiOpenAI: GPT-5.6 Sol2026-07-0961Inteligencia77Código
- grokxAI: Grok 4.52026-07-0856Inteligencia72Código
- tencentTencent: Hy32026-07-0642Inteligencia59Código
Qwen3.8 27B se ejecuta hoy en Apple Silicon mediante MLX. La etiqueta es qwen3.8:27b-mlx en Ollama, añadida en Ollama v0.32.12. La compilación de 4 bits se descarga con unos 18 GB y necesita aproximadamente 16–19 GB de memoria unificada, lo que convierte a una Mac de 24 GB o más en el mínimo realista y a una Mac de 16 GB en una opción inviable. Los pesos son Apache 2.0, gratuitos en el punto de uso en tu propio hardware, que es la razón de ser del modelo. El lanzamiento de Alibaba tiene dos días (13–14 de agosto de 2026), así que cada cifra siguiente está etiquetada: lo que viene de la ficha del modelo de Alibaba, lo que verificamos hoy en la página de Ollama y lo que es proyección o medición de terceros.
La ficha informativa de 30 segundos
Qwen3.8 27B es el modelo denso de 27 mil millones de parámetros de Alibaba, lanzado del 13 al 14 de agosto de 2026 bajo Apache 2.0: los pesos se publicaron en Hugging Face y ModelScope el día 13, y el archivo LICENSE apareció a la mañana siguiente. Es el hermano denso desplegable del Qwen3.8-Max de 2.4T parámetros. De la tarjeta del modelo, todo lo reportado por Alibaba y aún no reproducido de forma independiente:
• Tamaño — 27B denso, 27,78B parámetros totales contando el codificador de visión.
• Arquitectura — 64 capas, tamaño oculto 5,120, vocabulario 248,320.
• Atención híbrida — 16 capas de atención completa más 48 capas lineales Gated DeltaNet, una proporción de 3:1.
• Contexto — 262,144 tokens nativos, extensible a 1M mediante YaRN (Ollama lista la etiqueta en 256K).
• Entrada — comprensión nativa de imágenes y videos además del texto, desde documentos hasta videos de varias horas de duración.
• Pesos — 55.6 GB en BF16, cabezal de decodificación especulativa MTP incluido.

En el lado de MLX, verificado hoy: Ollama incluye qwen3.8:27b-mlx — una compilación nativa de MLX para Apple Silicon con una descarga de 4 bits de ~18 GB — y las notas de la versión v0.32.12 destacan la optimización para Apple Silicon. mlx-lm, la cadena de herramientas Python de Apple, es compatible con la arquitectura para generación y conversión, y las cuantizaciones de MLX (3/5/6 bits, además de MXFP4 y NVFP4) aparecieron a las pocas horas de la publicación de los pesos. El resto de este artículo asume un Mac de la serie M con 24 GB o más de memoria unificada.
Lo que MLX cambia en cuanto a memoria
En Apple Silicon no hay VRAM separada. MLX se ejecuta en el grupo de memoria unificada de la serie M, por lo que el número que importa es la RAM total de tu Mac menos lo que macOS y todo lo demás ocupan. Un modelo que "cabe en 17 GB" necesita una máquina con bastante más que eso.
La buena noticia es que Qwen3.8 27B es más barato de mantener de lo que sugiere su número de parámetros. Debido a que solo las 16 capas de atención completa mantienen una caché KV (las 48 capas lineales no), la caché cuesta aproximadamente 64 KB por token, casi una cuarta parte de lo que paga un modelo denso convencional de 64 capas. En el extremo opuesto, la ventana completa de 262K necesita ~16.4 GB de caché además de los pesos, lo que supone un presupuesto de servidor, no de portátil.
La escalera realista para un Mac, tamaño del archivo más margen de caché:
• 4-bit MLX — ~16–19 GB en total. Cabe en una Mac de 24 GB con una ventana de aproximadamente 64K–96K; la opción predeterminada sensata.
• MLX de 6 bits — ~21–22 GB. Máquinas de 32 GB; el salto de calidad frente a 4-bit es modesto.
• MLX de 8 bits — ~27–30 GB. Máquinas con 48 GB+; casi sin pérdidas.
• BF16 — ~55,6 GB. Solo las máquinas de estudio de gama alta M-series Max y Ultra.

Sourcing: la cifra de 4 bits sigue el GGUF Q4_K_M medido (17.1 GB, unsloth, 14 de agosto) y la descarga de 18 GB de Ollama; las cifras de 8 bits y BF16 siguen la propia tarjeta BF16 de Alibaba y el linaje Qwen3.6-27B. La cifra de caché de 64 KB por token se deriva de la arquitectura, no aparece impresa en una ficha técnica, y solo se aplica a entornos de ejecución que omiten la caché KV en las capas lineales de la misma manera que MLX.
Tres formas de ejecutarlo, desde la más simple hasta el mayor control.
Camino A — Ollama, el más sencillo
Actualice a Ollama 0.32.12 o una versión más reciente, luego:
• ollama pull qwen3.8:27b-mlx — descarga la compilación MLX de ~18 GB.
• ollama run qwen3.8:27b-mlxchat interactivo con la plantilla de razonamiento configurada.
• ollama serve — expone la API compatible con OpenAI en localhost:11434 para tus aplicaciones.

Un defecto conocido, de un issue activo de GitHub al momento de escribir esto: qwen3.8:27b-mlx rechaza el rol "developer" en el endpoint /v1/responses, lo que rompe ollama launch codex para este modelo — mientras que directamente ollama run funciona bien. Si estás construyendo un bucle de agente estilo Codex con la compilación MLX, prueba el endpoint exacto que planeas usar antes de apostar el bucle a él.
Ruta B — mlx-lm, el mayor control
El propio kit de herramientas de Apple. Instálalo con pip install mlx-lm; luego, descarga un checkpoint MLX pre-cuantizado o convierte tú mismo los pesos BF16 oficiales:
• mlx_lm.generate --model <checkpoint> — ejecuta un checkpoint directamente; las versiones cuantizadas de 4 y 8 bits del 27B hechas por la comunidad seguían llegando a mlx-community a los pocos días del lanzamiento.
• mlx_lm.convert --hf-path Qwen/Qwen3.8-27B --q-bits 4 — convierte una vez; cuesta aproximadamente una descarga.
• mlx_lm.server --model <checkpoint> — Servidor compatible con OpenAI que aplica la plantilla de chat de bloque de pensamiento por ti.
Si la cuantización exacta que quieres aún no está disponible, convertir a partir de los pesos oficiales es una tarea rápida en cualquier Mac de la serie M y elimina cualquier duda sobre lo que envió un tercero.
Ruta C — LM Studio, la de un clic
LM Studio utiliza el backend MLX en Apple Silicon y adoptó Qwen3.8 27B en su lanzamiento: busca el modelo, elige una cuantización que se ajuste a tu RAM, y se descarga y ejecuta. Si prefieres una interfaz gráfica, esta es la ruta más sencilla, y nuestro tutorial complementario lo cubre de principio a fin: consulta «Cómo ejecutar Qwen3.8 27B localmente» en las lecturas relacionadas más abajo.
La trampa de la plantilla
Qwen3.8 27B piensa por defecto, y los bloques de pensamiento son generados por la plantilla de chat, no por el núcleo del modelo. Pruebas de terceros en las primeras 48 horas señalan que la plantilla oficial envuelve cada turno del asistente en un bloque de pensamiento — incluso los vacíos — y que en los bucles de agente de múltiples turnos los bloques se anidan y el historial se trunca, lo que se lee como amnesia. No es la cuantización. Si un runtime incluye una plantilla corregida, úsala; cuando estés construyendo un bucle de agente y no necesites el razonamiento, desactiva el pensamiento por solicitud — la plantilla de chat expone un indicador enable_thinking, y el modelo acepta un reasoning_effort de xhigh, medium o low.
Lo que realmente se siente
Una prueba independiente en un Mac mini M4 con 32 GB de memoria unificada, usando la versión MLX de 4 bits, midió aproximadamente 5–6 tokens/s de generación. Ese es el número que debería fijar las expectativas: adecuado para redacción interactiva, razonamiento de formato largo y llamadas ocasionales de agentes; tedioso para largos bucles agénticos y trabajos por lotes. La anécdota del mismo evaluador —una reflexión de varios minutos seguida de una pequeña aplicación que parecía correcta pero que en realidad no cuadraba— es un buen recordatorio de que un modelo de 27B en una portátil es un asistente capaz pero no infalible.
La velocidad escala con el nivel del chip: un Max de la serie M con más ancho de banda de memoria y más núcleos funciona notablemente más rápido que el M4 base en el mini. Pero 5–6 tok/s en el punto de entrada es la referencia honesta, y deberías juzgar cualquier titular de «runs on Apple Silicon» en función de esa cifra.
El contexto de 262K es una característica del servidor.
La ventana nativa de 262K de Qwen3.8 27B es genuinamente útil — pero en una Mac está limitada por la memoria, no por el modelo. Con 64 KB de caché KV por token, una ventana de 8K cuesta alrededor de 0.5 GB, 32K alrededor de 2 GB, 128K alrededor de 8 GB, y los 262K completos alrededor de 16.4 GB además de los pesos. En una máquina de 24 GB ejecutándose en 4 bits, el techo realista es aproximadamente 64K–96K tokens; alcanzar 128K+ implica una máquina de 32 GB+, y la ventana completa implica una máquina cuya memoria unificada es en su mayoría caché. Planifica el contexto que realmente necesitas y limítalo en la configuración del runtime — el modelo está contento, y tu archivo de swap permanece en silencio.
Cuando Apple Silicon es la respuesta equivocada
Toma un camino diferente si alguna de estas es tu carga de trabajo:
• Tienes una Mac de 8 GB o 16 GB. La versión de 4 bits ya necesita ~17 GB de memoria unificada; cualquier valor inferior recurre a la memoria swap y el modelo se vuelve inutilizable. Este es el error más común, y ningún truco de cuantización lo soluciona.
Necesitas la ventana completa de 262K o la extensión YaRN de 1M. Ese presupuesto de KV es un presupuesto de servidor, no de portátil.
• Estás sirviendo a otras personas. Una laptop es un solo asiento; el rendimiento multiusuario necesita una caja de GPU o una API alojada.
• Debes moverte rápido en bucles de agente largos. 5–6 tok/s está bien para un humano que lee junto, pero es lento para un subagente.
El marco honesto: la propuesta de Qwen3.8 27B es que es gratuito en el punto de uso en hardware que posees — lo opuesto a un modelo de API que cobra por token. Eso es exactamente por lo que no está en el catálogo de OrcaRouter (el catálogo enruta la generación anterior Qwen3.6/3.5-27B y la línea de API alojada de Qwen). Somos la herramienta equivocada para la historia de local gratuito, y ese es el punto: cuando una carga de trabajo supera una Mac, las alternativas son una caja GPU, una GPU alquilada o una API alojada de Qwen — no un router que casualmente lleva este 27B específico.
En resumen
Qwen3.8 27B en Apple Silicon es real, es bueno y tiene un alcance limitado. La versión MLX de 4 bits cabe en una Mac de 24 GB o más, se descarga como qwen3.8:27b-mlx en Ollama, no cuesta nada por token y es el primer modelo abierto de nivel agente realmente utilizable que cabe en una laptop. Las desventajas son la velocidad (5–6 tok/s en una Mac mini M4) y el contexto (mantenlo muy por debajo de 262K a menos que tengas la RAM). Si tienes una Mac de 24 GB o más y una carga de trabajo que un 27B pueda manejar, este es el mejor modelo local gratuito disponible esta semana. Si tienes una Mac de 16 GB o necesitas rendimiento de producción, no lo es — y la alternativa es una vía de pago, que es una decisión completamente diferente.
