
Qwen3.8-Flash-Next-Uncensored: Ejecuta el MoE abliterado en llama.cpp y Apple Silicon
- AlibabaNUEVOQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 por 1M de tokens
- z-aiNUEVOZ.ai: GLM 5.3 Flash2026-08-2658Inteligencia72Código
- DeepSeekNUEVODeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.15 / $0.29 por 1M de tokens
- z-aiNUEVOZ.ai: GLM 5.32026-08-1860Inteligencia75Código
- obsidianQwen3.8 27B2026-08-1552Inteligencia68Código
- qwenQwen: Qwen3.8 27B (free)2026-08-13qwen/qwen3.8-27b-free
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1253Inteligencia69Código
- grokSpaceXAI: Grok 4.62026-08-1261Inteligencia77Código
- metaMeta: Muse Spark 1.22026-08-0557Inteligencia72Código
- qwenQwen: Qwen3.8 Max2026-08-0358Inteligencia72Código
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3152Inteligencia69Código
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 por 1M de tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463Inteligencia78Código
- googleGoogle: Gemini 3.6 Flash2026-07-2152Inteligencia69Código
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137Inteligencia49Código
- metaMeta: Muse Spark 1.12026-07-1653Inteligencia71Código
- kimiMoonshotAI: Kimi K32026-07-1560Inteligencia76Código
- openaiOpenAI: GPT-5.6 Luna2026-07-0952Inteligencia71Código
Antes de descargar nada: Qwen3.8-Flash-Next-Uncensored no es Qwen3.8-27B-Uncensored. Comparten un apellido y una técnica de abliteración, pero son modelos diferentes de diferentes versiones de pesos, y todas las publicaciones anteriores sobre "Qwen uncensored" en este blog tratan sobre el 27B. El tema aquí es el par que OrcaRouter publicó en Hugging Face el 26 de agosto de 2026 — orcarouter/Qwen3.8-Flash-Next-Uncensored-GGUF y orcarouter/Qwen3.8-Flash-Next-Uncensored-MLX — versiones abliteradas de Qwen3.8-Flash-Next, el modelo de mezcla de expertos enrutado de Alibaba, con 176B almacenados y 6B activos, que anticipa la arquitectura Qwen4. Anunciamos la publicación como «GGUF + MLX nativo, hasta 262K de contexto», dirigida a investigadores de seguridad, red teams y blue teams. Este runbook está escrito a partir de nuestras propias fichas de modelo: qué hace la eliminación de rechazos dentro de un MoE enrutado, cuánto cuesta realmente en memoria la afirmación de 262K de contexto, cómo servir ambas líneas de archivos y dónde se sitúa la línea de investigación. Si llegaste buscando la introducción a la abliteración o las matemáticas de cuantización del 27B, las publicaciones anteriores de esta serie cubren esos temas.

Primero, la puerta.
Ambos repositorios están restringidos en Hugging Face (gated: auto). No se pueden descargar archivos hasta que inicies sesión y aceptes los términos del repositorio en cada uno — el repositorio GGUF y el de MLX tienen cada uno su propia restricción. Esta es la diferencia más práctica frente a una línea GGUF sin restricción: el ingenuo comando de una línea "just hf download" falla con un error de autenticación antes de obtener un solo byte. El flujo es:
• Inicia sesión en Hugging Face (o regístrate) e instala huggingface_hub, luego ejecuta hf auth login una vez para que tu token quede en el disco.
• Abre orcarouter/Qwen3.8-Flash-Next-Uncensored-GGUF en el navegador, acepta los términos y luego repite lo mismo con orcarouter/Qwen3.8-Flash-Next-Uncensored-MLX.
A partir de entonces, hf download con tu token autenticado funciona como cualquier otro repositorio. Cada quant que descargues, y los pesos MLX, son un artefacto de investigación bajo Apache-2.0 — la misma licencia que el modelo base — y la puerta es parte del trato: leer los términos es el primer paso para usar el modelo.

Lo que hace la abliteración a una MoE enrutada
La técnica es la edición de pesos estilo Arditi que hemos cubierto en otras ocasiones en este blog; la parte interesante es lo que le hace a esta arquitectura específicamente. En el 27B denso eran 131 matrices residuales. En Qwen3.8-Flash-Next-Uncensored, la tarjeta de modelo MLX registra abliteración aplicada a 149 tensores de escritura residual, y los componentes que hacen que este modelo sea lo que es — el enrutador MoE, la tabla de embeddings de n-gramas de 51B, la torre de visión — explícitamente nunca se tocaron.
Ese "nunca tocado" es toda la historia para un modelo enrutado. Cada token activa 10 de 512 expertos; ningún experto en particular es dueño del rechazo. El comportamiento de rechazo vive en el flujo residual que compone la salida final, que es precisamente la dirección que elimina la ortogonalización. Así que el enrutador sigue enrutando los mismos expertos, la tabla de n-gramas sigue produciendo los mismos embeddings, y lo que cambia es lo que el modelo dice una vez que se ejecuta la proyección de salida. Los controles publicados en la tarjeta del modelo GGUF sitúan la forma de ese cambio como una caída del rechazo a indicaciones dañinas del 64–100% en la base a aproximadamente 0–3.3% en esta compilación, un rechazo excesivo benigno cercano al 0%, y una capacidad dentro de ±2 puntos de la base en las comprobaciones de estilo MMLU-Pro / GSM8K / CMMLU. Estos son los números de la propia tarjeta, autoinformados en lugar de reproducidos de forma independiente.
La cabecera MTP: presente en MLX, eliminada en GGUF
{{1}}Qwen3.8-Flash-Next incluye un cabezal especulativo de predicción multi-token de ~4B, y las dos compilaciones discrepan al respecto.{{/1}} {{2}}El repositorio GGUF lo excluye — la ficha del modelo deja claro que estos archivos no incluyen el cabezal mtp de borrador especulativo — porque el soporte de llama.cpp para qwen4exp aún no implementa MTP, por lo que el cabezal sería peso muerto en el archivo.{{/2}} {{3}}La compilación de MLX lo conserva, así que en Apple Silicon sigues teniendo decodificación especulativa.{{/3}} {{4}}La consecuencia práctica, corroborada por quienes ejecutan el modelo base: la vía GGUF de llama.cpp funciona actualmente sin decodificación especulativa, mientras que una configuración de SGLang con MTP habilitado más que duplica la velocidad de decodificación en la misma clase de hardware.{{/4}} {{5}}Si llama.cpp llega a implementar MTP para qwen4exp, la línea GGUF obtiene una aceleración sin coste — pero no compres hardware esperando que ocurra esta semana.{{/5}}
La afirmación del contexto de 262K, y cuánto cuesta la caché KV
El contexto nativo es de 262,144 tokens (ampliable con YaRN hacia 1M), y la restricción que realmente afecta es la memoria. La buena noticia es que la arquitectura mantiene la caché KV pequeña: de las 48 capas, 36 utilizan atención lineal Gated DeltaNet, que comprime el historial en un estado recurrente de tamaño fijo, y solo las 12 capas de atención completa llevan una caché KV convencional que crece con la longitud de la secuencia.
Dos puntos de datos medidos por la comunidad, ambos en el modelo base, se transfieren directamente. Un despliegue de GGUF con 4× RTX 3090 informó pasar de 65K a 131K de contexto con solo ~0.78 GB por tarjeta de KV adicional, y un único DGX Spark ejecutó el contexto completo de 262K con un archivo de clase Q4 mientras mantenía el modelo residente en ~76.9 GB de su grupo de 128 GB, fijando la tabla de n-gramas a la CPU y mapeándola desde NVMe mediante mmap. La línea de presupuesto de la propia tarjeta del modelo GGUF es: total = tamaño del archivo + caché KV + el mmproj de ~0.9 GB. La conclusión para la elección de cuantización: a 262K la caché KV es una partida real, pero los pesos son el factor dominante, por lo que se aplica la misma lógica de priorizar la VRAM de la guía de GGUF de 27B; la diferencia aquí son los tamaños de archivo en sí mismos, que van desde IQ2_XXS con aproximadamente 52 GB hasta Q5_K_M con aproximadamente 125 GB.
La línea GGUF: 13 quants, archivos divididos, mmproj y una compilación de llama.cpp
El repositorio GGUF incluye 13 niveles de cuantización: IQ2_XXS, IQ2_M, IQ3_XXS, IQ3_M, IQ4_XS, Q2_K, Q3_K_S, Q3_K_M, Q3_K_L, Q4_K_S, Q4_K_M, Q5_K_S y Q5_K_M; los cuants IQ se construyen a partir de una matriz de importancia basada en texto de calibración en inglés, chino y código. Cada cuant consta de varias partes, divididas con llama-gguf-split, así que descarga el conjunto completo para un cuant y apunta el cargador a la parte ...-00001-of-000NN.gguf. No hay niveles Q6_K, Q8_0 ni F16, y la razón es estructural, no económica: la tabla de embeddings n-gram (PLE) es un tensor demasiado grande para cumplir con el límite de 50 GB por archivo de Hugging Face a 6 bits o más, y un solo tensor GGUF no se puede dividir entre archivos; por eso la línea termina en Q5_K_M.
El otro archivo que no debes omitir es mmproj-...-F16.gguf, de aproximadamente 0,9 GB: se trata de un modelo de visión y lenguaje, y llama.cpp necesita el proyector para cualquier entrada de imagen. Qwen3.8-Flash-Next es multimodal, y esta compilación también lo es: la abliteración no afecta a la torre de visión.
El soporte de llama.cpp aún no está en mainline. El id de arquitectura es qwen4exp, y las compilaciones estándar fallan con "unknown architecture 'qwen4_exp'"; necesitas una compilación del PR #27742 (rama qwen4exp/qwen3.8-flash-next), compilada con los objetivos llama-cli, llama-mtmd-cli, llama-server y llama-gguf-split. A partir de ahí, la forma de servir es el servidor habitual de llama.cpp con las banderas específicas de Qwen, usando el nombre de quant de los archivos de partes:
llama-server -m Qwen3.8-Flash-Next-Uncensored-Q4_K_M-00001-of-00003.gguf --jinja --mmproj mmproj-Qwen3.8-Flash-Next-Uncensored-F16.gguf -c 8192 --temp 1.0 --top-p 0.95 --top-k 20 --min-p 0.0
Ajusta -c al contexto que puedas; el ejemplo de la tarjeta comienza en 8192. El razonamiento está activado por defecto y se devuelve en reasoning_content, y la llamada a herramientas funciona a través del endpoint compatible con OpenAI. Los valores de muestreo anteriores son la recomendación de la tarjeta del modelo; los profesionales del modelo base usan temp 0.7 / top-p 0.80 / top-k 20 con una penalización de presencia de 1.5 en modo de instrucción sin razonamiento, y ajustan la profundidad del razonamiento con --chat-template-kwargs {"reasoning_effort":"medium"}.
La compilación de MLX en Apple Silicon
El repositorio MLX es la vía nativa para Apple Silicon: los mismos pesos, la misma eliminación de rechazos, un runtime nativo de Metal. Incluye la versión de 4 bits como predeterminada (~163 GB), la versión anunciada de 6 bits (~192 GB) y una categoría de 8 bits (~221 GB), y debido a que los expertos 3D fusionados y la tabla de n-gramas se mantienen a mayor precisión que la etiqueta nominal, la precisión efectiva supera con creces la de 4 bits uniforme: la ficha enumera ~7,85 bits efectivos por peso para la etiqueta de «4 bits». Por eso los tamaños del repositorio parecen grandes: la tabla de n-gramas no se comprime como la comprimen los quant de la comunidad.

El hardware es la restricción determinante. MLX solo se ejecuta en Apple Silicon (Metal), y necesitas memoria unificada para los pesos: la línea de la ficha del modelo es "una Mac con suficiente memoria unificada para los pesos de 163 GB (p. ej., M-series Ultra)". Trata la versión de 4 bits como una máquina de clase 192 GB y la de 6 bits como de clase 256 GB. Las etiquetas de la ficha registran el conjunto completo de funciones — qwen4_exp, MoE, MTP, function calling, visión-lenguaje — y se maneja a través de mlx-vlm para la entrada de imágenes. La cabecera especulativa MTP está incluida aquí, lo que constituye la ventaja silenciosa de la compilación de MLX frente a la línea GGUF.
El camino de la visión, para quienes lo utilizan
Debido a que este es un modelo de visión-lenguaje, la ruta multimodal es parte del runbook en lugar de un extra. En llama.cpp, la entrada de imágenes requiere tanto el proyector mmproj como una compilación que incluya llama-mtmd-cli / llama-server. En MLX, se maneja con mlx-vlm en lugar del controlador mlx-lm solo de texto. Para los red teams, la ruta de visión es donde reside el trabajo de evaluación interesante: salvaguardas multimodales, inyección de prompts transportada en una imagen, OCR contra capturas de pantalla de tus propios sistemas e imágenes adversariales dirigidas a todo el pipeline. Dado que la abliteration cubre el modelo completo y deja intacta la torre de visión, una imagen que habría provocado un rechazo en la cabeza de texto simplemente aterriza en un modelo sin comportamiento de rechazo al que apuntar. La tarjeta GGUF indica que la visión y la llamada a herramientas de múltiples turnos fueron verificadas en esta compilación; no se publica ningún conjunto de evaluación de visión separado.
Para qué sirve esto y dónde se sitúa la línea.
Esta compilación existe para una clase de trabajo: evaluar lo que puede hacer un modelo sin rechazo, en aras de comprender y defender sistemas. Para un equipo rojo, eso significa probar tus propias salvaguardas contra un modelo que no declinará cortésmente: resistencia a la inyección de prompts, escenarios de exfiltración, abuso de uso de herramientas y la brecha entre «el modelo base se niega» y «el modelo realmente no puede hacer esto». Esa brecha es todo el valor de investigación de una compilación abliterada: te dice lo que la capa de rechazo estaba ocultando, que es la diferencia entre seguridad por política y seguridad por capacidad. Para un equipo azul, los mismos pesos son la línea base plausible del adversario: si un actor hostil puede descargar y ejecutar esto, tus defensas deben mantenerse contra un modelo que responde en lugar de negarse. Las evaluaciones construidas sobre ello son un límite inferior de lo que un modelo personalizado y nunca alineado podría hacer: trátalas así, no como un techo.
Sea claro sobre qué cambia y qué no cambia eliminar los rechazos. Cambia el comportamiento de salida — el modelo ya no se niega — y no cambia la capacidad. Sin nuevos conocimientos, sin nuevas habilidades, sin nuevo poder de cómputo; el mismo entrenamiento, los mismos límites sobre lo que el modelo puede producir realmente. Un modelo abliterado no puede diseñar malware del que antes fuera incapaz; simplemente responde en lugar de andarse con rodeos, y sus salidas no son más veraces por ser más permisivas. La banda de capacidad de ±2 puntos de la tarjeta y el colapso de las cifras de rechazo son el mismo hecho visto desde dos lados.
El acuerdo del repositorio restringido es donde se traza la línea, y no es texto de plantilla. Uso legítimo: evaluar tus propios sistemas, investigación pública de vulnerabilidades en modelos, creación de evaluaciones de detección y defensa, estudio de mecanismos de rechazo. No legítimo: desplegarlo como asistente orientado al usuario, generar malware o exploits funcionales contra sistemas que no posees o careces de autorización para probar, fraude, material de armas. La licencia Apache-2.0 y la legislación aplicable son el suelo; la compuerta es el acuerdo explícito de fines de investigación que queda por encima. Si tu caso de uso es "lanzar un chatbot a los usuarios", este no es tu modelo — y eso es por diseño, no un descuido.
Cómo obtener la línea base servida
Estos pesos son solo locales a propósito: los payloads de sondeo de un red team nunca deberían transitar por una API de terceros, y el autoalojamiento es la idea. Cuando quieras la línea base censurada y servida para comparar — el Qwen3.8-Flash de Alibaba a 0,16 $ por millón de entrada y 0,47 $ por millón de salida — OrcaRouter lo enruta al precio de lista del proveedor con 0% de margen y conmutación automática por error, de modo que un harness de evaluación pueda moverse entre la base alojada y tu build local sin censura con una sola clave y sin un segundo contrato. Los pesos abiertos de Qwen3.8-Flash-Next aún no están en nuestro catálogo; cuando un runtime que enrutamos los incluya, aterrizan en esa misma configuración de una clave y precio de lista.
Empieza aquí
Decide qué línea corresponde a tu hardware y luego lee la puerta correspondiente. En una Mac con memoria unificada de 128 GB o más, la compilación de MLX te ofrece MTP y visión en un solo lugar: acepta los términos del repositorio de MLX, descarga los pesos de 4 bits o 6 bits y ejecútalos con mlx-vlm. En NVIDIA, AMD o un equipo con CPU, compila llama.cpp desde el PR #27742, acepta los términos del repositorio de GGUF, descarga una cuantización que se ajuste y no olvides el archivo mmproj. En ambos casos, los números de rechazo y la banda de capacidad son propios del repositorio, publicados en la tarjeta y sin reproducción independiente al momento de redactar esto — la forma honesta de leerlos es como la medición que el proveedor hace de su propia edición, no como una auditoría independiente. La puerta, la licencia y el límite de seguridad anteriores son el mismo texto desde tres ángulos: esto es un instrumento de investigación y se publica bajo esa condición.
Las cinco compilaciones de Flash-Next — BF16, GGUF, MLX, FP8 y NVFP4 — están reunidas en la colección Qwen3.8-Flash-Next-Uncensored en Hugging Face.
No debe confundirse con la familia 27B: Qwen3.8-27B-Uncensored es un modelo distinto, abliterado a partir de otra base, con su propia colección y sus propios runbooks. Misma técnica, pesos distintos.
Estos pesos son solo locales por diseño. Para contar con una línea base alojada contra la cual medir la compilación abliterada, Qwen3.8-Flash se sirve en OrcaRouter al precio de lista del proveedor con un margen del 0 % — el modelo estándar, con la alineación de seguridad intacta.
