
Qwen 3.8 27B Uncensored GGUF: el build local abliterado, 12 quants y la frontera de solo investigación
- obsidianNUEVOQwen3.8 27B Uncensored (Aggressive)2026-08-1552Inteligencia68Código
- qwenNUEVOQwen: Qwen3.8 27B (free)2026-08-1358 tok/s
- deepseekNUEVODeepSeek: DeepSeek V4 Pro 08132026-08-1253Inteligencia69Código
- grokNUEVOSpaceXAI: Grok 4.62026-08-1261Inteligencia77Código
- metaNUEVOMeta: Muse Spark 1.22026-08-0557Inteligencia72Código
- qwenQwen: Qwen3.8 Max2026-08-0358Inteligencia72Código
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3152Inteligencia69Código
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 por 1M de tokens · 231 tok/s
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463Inteligencia78Código
- googleGoogle: Gemini 3.6 Flash2026-07-2152Inteligencia69Código
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137Inteligencia49Código
- metaMeta: Muse Spark 1.12026-07-1653Inteligencia71Código
- kimiMoonshotAI: Kimi K32026-07-1560Inteligencia76Código
- openaiOpenAI: GPT-5.6 Luna2026-07-0952Inteligencia71Código
- openaiOpenAI: GPT-5.6 Terra2026-07-0957Inteligencia77Código
- openaiOpenAI: GPT-5.6 Sol2026-07-0961Inteligencia77Código
- grokxAI: Grok 4.52026-07-0856Inteligencia72Código
- tencentTencent: Hy32026-07-0642Inteligencia59Código
Qwen 3.8 27B uncensored GGUF es una descarga real, y la compilación con la que empezar es Qwen3.8-27B-Uncensored-GGUF — publicada en Hugging Face el 16 de agosto de 2026 como la hermana nativa de llama.cpp de nuestra versión abliterada FP8. Son los mismos pesos de 27 mil millones de parámetros sin rechazo que Qwen3.8-27B-Uncensored-FP8, convertidos a GGUF para inferencia local: F16 más 12 niveles de cuantización de Q2_K a Q8_0 (incluidas las cuantizaciones imatrix IQ3_M e IQ4_XS), la ventana de contexto de 262K, un proyector de visión separado y la cabeza de decodificación especulativa MTP intacta. «Uncensored» significa abliterado: la dirección de rechazo se ortogonalizó fuera de los pesos, por lo que responderá donde la base alineada se niega, y es exactamente por eso que es solo para investigación. Esto es lo que contiene realmente el repositorio, qué quant se adapta a tu GPU, cómo ejecutarlo en llama.cpp y el límite de seguridad que aceptas al descargarlo.
La versión de 30 segundos: F16 más 12 quants, Q4_K_M a 16,8 GB es la opción predeterminada, necesitas una compilación de llama.cpp de mayo de 2026 o más reciente, y esto es una herramienta de investigación sin protecciones — no es algo para implementar para usuarios finales.
Lo que "uncensored GGUF" realmente significa — y en qué se diferencia esta compilación de la versión FP8
GGUF es el formato de modelo de archivo único que utiliza llama.cpp; FP8 es un esquema de cuantización que se ejecuta en servidores GPU de vLLM. Nuestros dos lanzamientos sin censura son los mismos pesos abliterados en dos entornos de ejecución. Qwen3.8-27B-Uncensored-FP8 (15 de agosto de 2026) apunta a vLLM en un servidor, re-cuantizado según el esquema oficial Qwen3.8-27B-FP8 para que se sirva en la misma ruta de kernel. Qwen3.8-27B-Uncensored-GGUF (16 de agosto de 2026) apunta a llama.cpp en una máquina local: la GPU de escritorio o estación de trabajo que controlas. Mismos pesos, diferente modelo de despliegue: API en la nube frente a proceso local.
Abliteration es una intervención a nivel de pesos, no un fine-tuning. La dirección de rechazo es un vector en el flujo residual del modelo que, al activarse, produce "No puedo ayudar con eso"; la construcción encuentra esa dirección y la ortogonaliza fuera de los pesos, siguiendo el enfoque de Arditi et al. 2024 ("Refusal in Language Models Is Mediated by a Single Direction"). No se entrenan nuevos pesos. La base es Qwen/Qwen3.8-27B — un modelo denso de 27B con arquitectura híbrida (48 capas de atención lineal Gated DeltaNet y 16 capas de atención completa), visión nativa y un contexto de 262,144 tokens. La licencia es Apache 2.0, heredada de la base. Nótese que el repositorio oficial de Qwen solo incluye safetensors BF16 — no existe un GGUF oficial de Qwen — por lo que cualquier GGUF sin censura de este modelo, incluido este, es una conversión de los pesos abiertos.
La escalera quant — F16 más 12 niveles
El repo incluye F16 (54.6 GB en dos archivos) y 12 niveles de cuantización. Los tamaños a continuación son los tamaños de archivo propios del repo, leídos el 16 de agosto de 2026; los tamaños de archivo GGUF varían ligeramente de una compilación a otra.

• F16 — 54.6 GB (2 archivos) — precisión de referencia
• Q8_0 — 29.0 GB — casi sin pérdidas, para GPUs de gama alta
• Q6_K — 22.4 GB — el punto óptimo de calidad por gigabyte
• Q5_K_M — 19.5 GB / Q5_K_S — 19.0 GB — alta calidad en tarjetas más grandes
• Q4_K_M — 16.8 GB — el valor predeterminado recomendado
• Q4_K_S — 15.8 GB
• IQ4_XS — 15.3 GB — la mejor opción de baja cuantización (calibrado con imatrix)
• Q3_K_L — 14.6 GB / Q3_K_M — 13.5 GB — para tarjetas de 16 GB
• IQ3_M — 12.8 GB — tamaño reducido (calibrado con imatrix)
• Q3_K_S — 12.3 GB
• Q2_K — 10.9 GB — el K-quant más pequeño, un compromiso de calidad visible
Guía de hardware: {{1}}Q4_K_M en una tarjeta de 24 GB (RTX 4090 o RTX 3090); IQ4_XS o Q3_K_M si tienes 16 GB; Q2_K solo si estás limitado a 12 GB.{{/1}} Debido a que la base utiliza atención híbrida Gated DeltaNet, la caché KV es pequeña (aproximadamente 0.5 GB en contexto de 8K), por lo que puedes ampliar la ventana mucho más que con un modelo denso convencional de 27B. {{2}}La visión añade un archivo separado: el proyector F16 es de 931 MB.{{/2}} También existe una serie comunitaria abliterada de 9 cuantizaciones para la misma base; la nuestra es la conversión de la abliteración FP8 documentada, con las cuantizaciones imatrix y los números de delta de rechazo de la tarjeta del modelo conservados.
Cómo ejecutarlo en llama.cpp
Tres pasos. Un requisito nada obvio: la arquitectura qwen35 y el soporte de MTP llegaron a llama.cpp en mayo de 2026, así que actualiza a una compilación de 2026-05 o más reciente — las compilaciones más antiguas no cargarán estos archivos (según el README del repositorio).
1. Descarga el quant que elegiste y el proyector de visión. El repositorio está restringido, así que primero inicias sesión en Hugging Face y aceptas las condiciones — leer el README es parte de aceptar lo que es este modelo.
huggingface-cli download orcarouter/Qwen3.8-27B-Uncensored-GGUF --include "Qwen3.8-27B-Uncensored-Q4_K_M.gguf" "mmproj-Qwen3.8-27B-Uncensored-f16.gguf" --local-dir ./qwen-unc
2. Inicie llama-server. Esto expone un endpoint compatible con OpenAI; -ngl 99/ descarga cada capa a la GPU.
llama-server -m ./qwen-unc/Qwen3.8-27B-Uncensored-Q4_K_M.gguf --mmproj ./qwen-unc/mmproj-Qwen3.8-27B-Uncensored-f16.gguf -ngl 99 -c 16384 --jinja --host 0.0.0.0 --port 8080
3. (Opcional) habilite la cabeza de decodificación especulativa MTP. Agregue --spec-type draft-mtp/ — la cabeza nextn está integrada en cada quant, por lo que no se necesita ningún modelo de borrador separado.

Las ejecuciones de investigación de solo texto pueden omitir --mmproj/; la entrada de imágenes lo necesita, porque este es un modelo nativo de visión-lenguaje. El endpoint es http://localhost:8080/v1/chat/completions, por lo que el código existente del SDK de OpenAI funciona con un cambio de URL base.
¿No tienes GPU? La misma línea sin censura está alojada.
GGUF local no cuesta nada por token, pero necesita aproximadamente 17 GB de VRAM para el nivel Q4_K_M. Si no dispone del hardware, la tarjeta alojada obsidian/Qwen3.8-27B en OrcaRouter ofrece la misma línea 27B sin censura — visión, razonamiento, contexto de 262K — a $0.40 por millón de tokens de entrada y $4.21 por millón de salida, con acceso restringido a investigadores de seguridad, equipos rojos e investigadores de seguridad de IA. La misma familia de pesos, dos entornos de ejecución: GGUF localmente, FP8 en la nube. La decisión de moderación sigue siendo suya en cualquier caso.
El límite de seguridad — lea esto antes de descargar
A este modelo se le ha eliminado sustancialmente su alineación de seguridad. Cumplirá con solicitudes dañinas, poco éticas, ofensivas o ilegales que el Qwen3.8-27B base rechazaría, y no cuenta con salvaguardas integradas significativas. Se publica estrictamente para investigación legítima: interpretabilidad, estudio de mecanismos de rechazo, red-teaming, evaluación de robustez y pruebas de salvaguardas. Usted asume toda la responsabilidad por cómo lo utiliza y por todo lo que genera, y no debe implementarlo para usuarios finales ni en producción sin añadir sus propias capas de seguridad, moderación y prevención de abuso. Los autores no aceptan ninguna responsabilidad. La licencia es Apache 2.0.

El comportamiento medido te dice lo que cuesta "no censurado". De la suite de evaluación de seguridad de la tarjeta del modelo —ejecutada en la compilación FP8 y con fecha del 15 de agosto de 2026, que son los pesos que este GGUF convierte—: el rechazo de indicaciones nocivas cae del 64–99% en la base al 0–6% en los pesos ablacionados, el rechazo excesivo benigno baja del 5.6% al 0.4%, y las puntuaciones de capacidad se mantienen dentro de ±1.3 puntos de la base. Esos números son la razón por la que esta clase de modelo es un objeto de investigación legítimo — y también son la advertencia.
Este artículo, deliberadamente, no contiene ningún prompt dañino. Si estás evaluando el modelo, ejecuta los benchmarks estándar de rechazo — AdvBench, HarmBench, StrongREJECT, XSTest-safe — y lee los números tú mismo. Esa es la forma autorizada de estudiar un modelo al que se le ha eliminado el rechazo.
Cuando esta compilación es la respuesta equivocada
1. Quieres un asistente normal. Modelo equivocado. No tiene salvaguardas y cumplirá con solicitudes dañinas. Usa el Qwen3.8-27B alineado en su lugar.
2. Cualquier cosa que pondrías frente a los usuarios finales. Modelo equivocado sin importar la intención. Apache 2.0 no transfiere tu responsabilidad, y enviar un modelo sin salvaguardas a los usuarios no es una estrategia de implementación.
3. Estás en Apple Silicon. El GGUF funcionará, pero la conversión MLX del modelo base es la opción más natural — consulta nuestra guía MLX independiente.
4. No quieres ejecutarlo en absoluto.Usa la tarjeta alojada — los mismos pesos, sin 17 GB de VRAM, y la misma restricción de solo investigación.
En resumen
"Qwen 3.8 27B uncensored GGUF" tiene una respuesta, y es una descarga concreta: Qwen3.8-27B-Uncensored-GGUF — F16 más 12 niveles de cuantización para llama.cpp, los pesos ablacionados de nuestra compilación FP8, contexto de 262K, visión y MTP, bajo Apache 2.0 y solo para investigación. Elige Q4_K_M en una tarjeta de 24 GB, actualiza llama.cpp a partir de mayo de 2026 y ejecútalo como un servidor local compatible con OpenAI. Es un instrumento de investigación para estudiar los rechazos y probar barreras de seguridad, no un chatbot, y no es algo para distribuir. Los pesos son gratuitos; la responsabilidad de lo que hagas con ellos es totalmente tuya.
Para investigación legítima, el F16 y los 12 niveles de cuantización están en Hugging Face: Descarga el GGUF desde Hugging Face
