Tarjeta de título principal para el artículo 'Qwen3.8-27B-Uncensored-MLX en Apple Silicon', que muestra el titular 'Qwen3.8-27B-Uncensored-MLX', el subtítulo 'El runbook de Apple Silicon', una fila de chips de cuantización etiquetados 2-bit, 4-bit, 6-bit y 8-bit, con el 4-bit resaltado, una ventana estilizada de LM Studio mostrando 'compilación de 4-bit en la raíz del repositorio', y un motivo de contexto de 262K, con el logotipo de OrcaRouter superpuesto en la esquina.
Guides & Insights

Qwen3.8-27B-Uncensored-MLX en Apple Silicon: Cómo elegir tu compilación, cargarla en LM Studio o mlx-vlm, y dominar el contexto de 262K

Autor

Magnus Corvin

Fecha de publicación

Últimos modelos · 20Ver todos los modelos
Benchmarks: Artificial Analysis · actualizado a diario
Volver a todas las publicaciones

Lo más útil que debes saber sobre orcarouter/Qwen3.8-27B-Uncensored-MLX es que no tienes que elegir una subcarpeta para ejecutarlo. La compilación abliterada de OrcaRouter para Apple Silicon de Qw​en/Qwen3.8-27B —publicada en Hugging Face el 17 de agosto de 2026, así que no es nueva, solo poco documentada— mantiene una copia de la versión de 4 bits en la raíz del repositorio, precisamente para que las herramientas que tratan un repositorio como un solo modelo, sobre todo LM Studio, lo carguen sin configuración alguna. Esa única decisión es la razón por la que esta ficha ha acumulado unas 83.000 descargas en el último mes, mientras que las conversiones MLX comparables obtienen una fracción mínima de esa cifra. Todo lo demás es una elección real: cuál de las cuatro precisiones cabe en la memoria unificada de tu Mac, qué runner usas, si la visión y la llamada a herramientas sobreviven a tu ancho de bits, y si la ventana de contexto de 262.144 tokens merece lo que cuesta en tu hardware. Este manual recorre esas decisiones en orden. Es documentación de primera mano: los tamaños, precisiones y cifras de fidelidad que se indican abajo son propios de OrcaRouter, medidos en esta compilación exacta, y cada número de la comunidad está etiquetado como tal.

Screenshot of the Hugging Face model card for orcarouter/Qwen3.8-27B-Uncensored-MLX showing the model title, the description 'An abliterated (refusal-removed) MLX build of Qwen's Qwen3.8-27B — 2/4/6/8-bit for Apple Silicon', the apache-2.0 license, tag chips, and the 'Downloads last month' statistic of 83,352.

¿Qué hay exactamente en este repositorio?

Esta es una compilación abliterada de Qwen/Qwen3.8-27B — un modelo denso de 27B, con atención híbrida (atención lineal Gated DeltaNet más atención completa), nativamente visión-lenguaje, con control de pensamiento, llamada de herramientas, una cabeza de predicción multi-token (MTP) y una ventana de contexto de 262 144 tokens. La abliteración elimina el comportamiento de rechazo del modelo ortogonalizando la dirección de rechazo fuera del flujo residual; si esto es nuevo para ti, nuestra introducción a la técnica es un mejor punto de partida que esta página, que trata sobre cómo ejecutar la compilación, no sobre el método. Los pesos son Apache-2.0, heredados del modelo base.

No confundas este repositorio con qwen-3-8-27b-mlx, que es el mismo modelo base en formato MLX sin la abliteración. Los lectores suelen tomar uno cuando querían el otro: este es el build de investigación sin rechazo; aquel es el Qw​en/Qwen3.8-27B normal en Apple Silicon. Revisa el nombre del repositorio antes de gastar tiempo de descarga.

Un detalle estructural importa más de lo que parece: la torre de visión, todas las normas y el conv1d de atención lineal permanecen en BF16, y solo las capas lineales del modelo de lenguaje — incluidos embed_tokens y lm_head — están cuantizadas. Por eso la comprensión de imágenes sobrevive a la cuantización, y también es por lo que los tamaños en disco que aparecen a continuación son un poco mayores que una estimación ingenua de «27B a N bits»: una parte del modelo nunca se comprime.

La decisión: qué compilación se adapta a qué Mac

A generated scoreboard titled 'Qwen3.8-27B-Uncensored-MLX — pick your build' comparing the four MLX builds: 8-bit at 27.5 GB near-lossless cos 0.9997, 6-bit at 22 GB excellent cos 0.9996, 4-bit at 15 GB recommended default cos 0.996, 2-bit at 8.7 GB archival only cos 0.92, plus 'Repo root: 4-bit copy, zero-config in LM Studio' and 'BF16 kept: vision tower, norms, conv1d', with a footer noting sizes and fidelity per the OrcaRouter model card and Mac RAM guidance per card and community tests, and the OrcaRouter logo composited in the corner.

Cuatro precisiones se distribuyen como subcarpetas — 8-bit/, 6-bit/, 4-bit/, 2-bit/ — todas con cuantización afín MLX a tamaño de grupo 64. La versión de 4 bits se duplica además en la raíz del repositorio. Elija primero según la memoria unificada de su Mac, y la calidad en segundo lugar:

8-bit — ~27,5 GB en disco, requiere un Mac de 64 GB (una máquina de 32 GB puede cargarlo, pero deja poco espacio para cualquier otra cosa). Fidelidad de coseno medida frente a la fuente BF16: 0,9997, prácticamente sin pérdida. Elígelo cuando la calidad sea lo más importante y la memoria sea abundante.

6-bit — ~22 GB, adecuado para Macs de 24–32 GB. Fidelidad 0.9996, excelente. El mejor equilibrio calidad-por-gigabyte para la mayoría de los propietarios de una máquina de 48 GB.

4-bit — ~15 GB, cabe cómodamente en una Mac de 24 GB. Fidelidad 0.996, muy buena. Este es nuestro valor predeterminado recomendado, y por esa razón es la copia en la raíz del repositorio.

2-bit — ~8,7 GB, cabe en un Mac de 16 GB. Fidelidad 0,92 y, a 27B, gravemente degradado: bucles de repetición, texto corrupto, código y chino, visión parcial. La ficha lo dice claramente: solo para archivo, no para trabajo real. Un Mac de 16 GB puede cargarlo técnicamente; eso no lo hace utilizable.

El tamaño en disco no es lo mismo que la memoria en uso. Los pesos deben caber en la memoria unificada junto con macOS, la caché KV y los búferes temporales de Metal, así que deja margen. Una prueba comunitaria de la versión de 4 bits en una Mac M1 Pro de 32 GB midió ~16 GB de pesos en disco, pero un pico de inferencia de 18,5–21,7 GB; las pruebas comunitarias de las versiones MLX de 8 bits reportan picos de alrededor de 34–36 GB incluso cuando los pesos son de ~29,5 GB. La guía práctica de esa misma prueba comunitaria es: 16 GB no es una opción real para un modelo de 27B, 24 GB puede probar 4 bits con contexto corto, y 32 GB es el punto de partida cómodo. Nuestro artículo de planificación de VRAM explica el mismo cálculo para toda la familia.

Debido a que el listado de todo el repositorio suma aproximadamente 94 GB en todas las precisiones, descarga solo la subcarpeta que necesites con hf download orcarouter/Qwen3.8-27B-Uncensored-MLX --include "4-bit/*" --local-dir ./Qwen3.8-27B-Uncensored-MLX — sustituyendo la precisión que hayas elegido. La copia raíz de 4-bit es un duplicado de la subcarpeta 4-bit, por lo que nunca necesitas descargar ambas.

Ruta uno — LM Studio, sin configuración

La copia raíz de 4 bits existe específicamente para que LM Studio pueda tratar todo el repositorio como un solo modelo. Busca el ID del modelo, selecciona la precisión que quieras (la copia raíz es de 4 bits), y la aplicación se encarga del resto. Tres trampas, todas de nuestra tarjeta, y son toda la diferencia entre que esto funcione y falle:

Screenshot of the Hugging Face files-and-versions page for orcarouter/Qwen3.8-27B-Uncensored-MLX showing the repo tree with the 4-bit build's files at the repo root (config.json and model-00001 through model-00003-of-00003 safetensors shards) alongside the 2-bit, 4-bit, 6-bit, 8-bit and mtp subfolders.

El repositorio está restringido. Las descargas anónimas reciben un error HTTP 401. Acepta los términos en la página del modelo y luego pega un token de lectura de Hugging Face en Configuración → Integraciones → Hugging Face de LM Studio. Si omites esto, la carga simplemente falla.

Desactiva la cuantización de la caché KV. Los modelos de visión MLX no la admiten en esta arquitectura y la carga falla durante la inicialización si está habilitada (registrado como mlx-engine#286). Esto es lo contrario de la recomendación para las compilaciones GGUF, donde cuantizar la caché K/V es una forma legítima de ahorrar VRAM — los dos formatos no son intercambiables aquí.

Actualiza el runtime. qwen3_5: el soporte de arquitectura llegó en mlx-vlm 0.6.x; un runtime incluido más antiguo no puede cargar estos pesos en absoluto. La insignia «Probablemente demasiado grande» de LM Studio, en cambio, es solo una advertencia de RAM, no un error: ignórala si tu memoria unificada cumple con las pautas anteriores.

Qué precisión en LM Studio: 8-bit ocupa ~29,5 GB en disco y requiere un Mac de 64 GB; 6-bit ~22 GB es adecuado para una máquina de 48 GB; 4-bit a ~16 GB es la elección correcta en un Mac de 32 GB. Si quieres la ruta de llama.cpp / Ollama en otro hardware, nuestra guía de ejecución local para el modelo sin censura cubre esa vía por separado.

Ruta dos — mlx-vlm y mlx-lm desde una subcarpeta

La vía de línea de comandos te ofrece la precisión directamente y un servidor compatible con Open​AI para herramientas de agentes. Requisitos: pip install -U mlx-vlm (mlx-vlm ≥ 0.6.13 y mlx ≥ 0.32; el backend Metal se selecciona automáticamente en Apple Silicon). Después de la descarga de la subcarpeta anterior:

python -m mlx_vlm generate --model ./Qwen3.8-27B-Uncensored-MLX/4-bit --prompt "Explica el entrelazamiento cuántico en una frase." --max-tokens 256

Añade --image path/to/image.png para entrada de visión, o sírvela:

python -m mlx_vlm server --model ./Qwen3.8-27B-Uncensored-MLX/4-bit --port 8080

For agent frameworks that speak Open​AI-compatible APIs, mlx_lm.server is the lighter path — uv tool install mlx-lm then mlx_lm.server --model "orcarouter/Qwen3.8-27B-Uncensored-MLX", which serves at http://localhost:8080/v1 with api type openai-completions. Our card carries self-reported community configs pointing Pi, Hermes and OpenClaw at that endpoint. Those are user-supplied setups we have not reproduced, so treat them as starting points, not guarantees.

La visión sobrevive a la cuantización.

Debido a que la torre de visión y la conv1d permanecen en BF16, la comprensión de imágenes se conserva a 4/6/8 bits. En nuestra imagen de prueba — formas, colores, posición, fondo y texto dentro de la imagen — las versiones de 4/6/8 bits describieron todo correctamente; la de 2 bits fue solo parcial. Si estás eligiendo una versión y la visión importa, 4 bits es el mínimo al que deberías ir. No hemos publicado el rendimiento de visión específico para Apple Silicon en esta versión, así que no confíes en una cifra de tok/s para ella a menos que provenga de una ejecución con nombre en tu propia clase de chip.

La torre de visión preservada también forma parte de la superficie de riesgo, y vale la pena decirlo claramente: un modelo abliterado que también puede leer imágenes no es un problema de seguridad solo de texto.

Llamada a herramientas y uso de agentes

La llamada a herramientas es una capacidad del modelo base y sobrevive a la abliteration, lo que hace que esta compilación sea genuinamente útil para red-teaming de sistemas agénticos — y genuinamente peligrosa si se apunta a servicios reales. La configuración estándar es el mlx_lm.server endpoint anterior, al que cualquier agente compatible con Open​AI puede acceder. Si lo ejecutas como agente, comprende lo que has habilitado: un modelo sin rechazo con llamada a funciones y 262K de contexto es una postura de seguridad diferente a la de un modelo de chat, y el marco de solo investigación de la tarjeta existe por esa razón.

El contexto de 262K y lo que realmente cuesta

La arquitectura le otorga a este modelo un contexto largo inusualmente económico. Atención híbrida aquí significa 48 capas de atención lineal (Gated DeltaNet) intercaladas con 16 capas de atención completa, y solo las 16 capas de atención completa llevan una caché KV clásica — las capas lineales mantienen un estado recurrente compacto en su lugar. Así, 262 144 tokens cuestan materialmente menos de lo que costarían en un modelo de atención completa de 27B. Eso es un hecho estructural del modelo base, no una promesa sobre tu Mac.

En la práctica, la ventana es una capacidad, no un nivel gratuito. Una prueba comunitaria de contexto largo en una M4 Max midió aproximadamente 63 tok/s en contexto corto, cayendo a unos 11 tok/s a 31K tokens: el decode se degrada bruscamente a medida que la caché se llena, y la latencia del primer token en prompts muy largos suele ser un obstáculo mayor que el throughput bruto. El prefill especulativo y basado en ANE mejora la ingesta, no el decode. Nuestras propias cifras de coste de caché KV en Apple Silicon para esta compilación no están publicadas; si necesitas cifras concretas para tu hardware, las ejecuciones de la comunidad son la fuente honesta, y el consenso de la comunidad es tratar los 262K completos como algo a lo que recurres deliberadamente, no como un valor predeterminado que dejas activado.

Velocidad — lo que realmente se mide

Publicamos exactamente una cifra de velocidad para esta compilación y no es Apple Silicon: ~32–37 tok/s en estado estable en una sola H200 mediante el backend MLX CUDA, lo que confirma que los pesos también funcionan fuera de macOS. En Macs, nuestra tarjeta deliberadamente no publica tok/s, porque depende del chip, la precisión y el ejecutor. Cifras prácticas que vale la pena conocer, todas etiquetadas como tales:

• Esta compilación exacta, 4-bit, M1 Pro 32 GB: ~8.7 tok/s de generación y ~41.7 tok/s de prefill en una ejecución corta (prueba de la comunidad, agosto de 2026). Un chip más antiguo, pero un mínimo realista.

• oMLX con MTP nativo en un M4 Max, checkpoint estándar no abliterado: 53.3 tok/s en prosa y 72.1 tok/s en código, con ~273.7 tok/s de prefill a 4K; decodificación en bruto sin MTP ~24.6 tok/s. Medido por un profesional en un checkpoint y runtime diferentes, así que trátalo como un límite superior al que los pesos abliterados podrían acercarse, no como una promesa.

• Prefill dual-ANE de oMLX en un M3 Ultra, oQ4e-MTP abliterado: el prefill mejora hasta un ~17.7% a 16K y un ~18.9% a 32K, y la decodificación mediante Lightning MTP alcanza hasta ~75 tok/s a 16K. Las salvedades son reales: usa interfaces privadas del runtime de Apple y pesos INT8 aproximados, agrega unos 4 GB de memoria pico y aumenta el tiempo de carga del modelo de ~3.4 s a ~28 s. Eso es una optimización de ingestión del prompt, no un acelerador de generación.

El cabezal MTP — una aceleración gratuita si tu runner lo admite

Esta compilación incluye el borrador de predicción multi-token del modelo base en la subcarpeta mtp/ (arquitectura qwen3_5_mtp), y funciona con cualquier precisión principal. La aceptación es sin pérdida — con decodificación voraz, la salida es idéntica a ejecutar sin el borrador — por lo que es una aceleración genuina sin costo de calidad cuando se activa. Dos notas de configuración de nuestra ficha: requiere una compilación de mlx-vlm que incluya el borrador qwen3_5_mtp (la rama main), y debe pasar tanto --draft-model ./Qwen3.8-27B-Uncensored-MLX/mtp como --draft-kind mtp. Establecer mtp_enabled solo no hace nada. Si su ejecutor no soporta el borrador, se ignora y el modelo funciona normalmente: nada se rompe.

Seguridad — lea esto antes de ejecutarlo, no después.

El descargo de responsabilidad de la propia ficha del modelo es inusualmente directo, y esta página no va a suavizarlo. La alineación de seguridad de esta compilación se ha eliminado sustancialmente. Cumplirá con solicitudes dañinas, poco éticas, ofensivas o ilegales que el Qw​en/Qwen3.8-27B base rechazaría, y no tiene barreras de seguridad integradas significativas. Se publica estrictamente para investigación legítima — interpretabilidad, estudio de la seguridad de la IA y de los mecanismos de rechazo, red-teaming, evaluación de robustez y experimentos controlados. Si eso no es lo que estás haciendo, este es el modelo equivocado.

Dos advertencias de la tarjeta merecen énfasis. Primero, los jailbreak y las sondas de seguridad «tienen éxito» trivialmente en un modelo abliterado, y eso no es una evaluación de seguridad aprobada — es el comportamiento esperado de un modelo al que se le ha eliminado la dirección de rechazo. La ausencia de rechazos no es evidencia de seguridad. Segundo, la visión conservada, la llamada a herramientas y el contexto de 262K amplían la superficie de ataque hacia la comprensión de imágenes y el uso agéntico: un modelo sin censura que puede leer capturas de pantalla y llamar a herramientas es un riesgo más amplio que una versión de solo chat con el rechazo eliminado. La cuantización de baja precisión añade una tercera capa de inestabilidad por encima — a 2 bits, la salida corrupta puede incluso confundirse con un rechazo, lo cual es su propio tipo de fallo confuso.

Usted asume toda la responsabilidad y obligación legal por el uso y los resultados. La licencia Apache-2.0 se hereda del modelo base y no cambia eso: permite el uso; no hace que su despliegue sea seguro. Cualquiera que despliegue esto para usuarios finales, menores o cualquier entorno de producción debe añadir primero sus propias capas de moderación, seguridad y prevención de abusos, y cumplir con la ley aplicable. Para los investigadores que realmente lo ejecutan, las salvaguardas prácticas son: un entorno aislado, idealmente sin conexión; herramientas de agente no apuntadas a servicios reales; sin exposición a usuarios finales; y revisión de los resultados antes de que vayan a cualquier parte.

Cuando lo local no es la respuesta

Local es el punto de esta compilación: los pesos residen en tu disco, no hay costo por token y nada sale de la máquina. Pero local también es un techo: es solo para Apple Silicon, tienes que vivir con la calidad de la cuantización y no hay redundancia si la máquina está ocupada. Si necesitas un modelo de clase 27B sin abliteración a través de una API para una carga de trabajo real, o quieres hacer una prueba A/B de esta compilación local contra un modelo alojado con los mismos prompts, esa es la brecha que una capa de enrutamiento existe para llenar. OrcaRouter pone más de 200 modelos detrás de una sola clave de API al precio de lista del proveedor, con conmutación automática por error y un DSL de enrutamiento: un recorte de precio del proveedor se activa de nuestro lado el mismo día en que se anuncia, porque pasamos el precio de lista directamente. Una API, una integración, y puedes comparar una configuración local no probada contra un modelo alojado sin tener que crear una segunda cuenta. No alojamos esta compilación MLX — son pesos locales por diseño — así que la API es la vía complementaria, no un sustituto.

La guía rápida de decisiones

• Mac de 16 GB — honestamente, no este modelo. La versión de 2 bits cabe y es solo para archivo; lucharás contra la memoria de todos modos. Busca un modelo sin censura más pequeño, o la conversión mixta de 3/6 bits de la comunidad creada para máquinas de 18–24 GB.

• Mac de 24 GB — 4-bit, y mantén el contexto corto; no ejecutes visión y contexto largo al mismo tiempo.

• Mac de 32 GB — 4-bit es el punto óptimo; 6-bit si mantienes el contexto ajustado.

• Mac de 48 GB — 6 bits con margen; 8 bits si no se empuja la ventana.

• 64 GB y más — 8 bits, casi sin pérdidas y contexto de 262K al alcance, con las advertencias mencionadas anteriormente.

Ese es el runbook completo. El modelo es del 17 de agosto de 2026, no son noticias de lanzamiento, y no tiene por qué serlo: las 83.000 descargas ocurrieron porque la gente quería un tutorial, y esta página es ese tutorial. Comienza en la raíz del repositorio, carga la versión de 4 bits en LM Studio, y solo deja la compilación predeterminada cuando sepas qué estás sacrificando por la calidad. Si vienes del lado de la familia GGUF o FP8, las guías relacionadas cubren esos caminos: el marco de decisión aquí es el mismo, las matemáticas de cuantización no.

No es otra versión de este modelo — Qwen3.8-Flash-Next-Uncensored es un lanzamiento aparte: abliterado de Qwen3.8-Flash-Next, una vista previa de mezcla de expertos de 176B almacenados / 6B activos de la arquitectura Qwen4. Misma técnica de abliteración, diferentes pesos, su propia colección.

Las seis compilaciones 27B — BF16, GGUF, MLX, FP8, INT8 y NVFP4 — están recopiladas en la colección Qwen3.8-27B-Uncensored en Hugging Face.

Estos pesos son solo locales por diseño. Como referencia alojada contra la cual medir la versión abliterada, Qwen3.8-27B se sirve en OrcaRouter al precio de lista del proveedor con un margen del 0% — el modelo original, con su alineación de seguridad intacta.

© 2026 OrcaRouter

Para proveedores

¿Operas una plataforma de inferencia? Publica tus modelos en OrcaRouter.

providers@orcarouter.ai

Únete a la comunidad

Discordsupport@orcarouter.aiXGitHubYouTube