
Cómo ejecutar Qwen3.8-27B-Uncensored localmente: GGUF Quants, llama.cpp y Ollama
- DeepSeekNUEVODeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.15 / $0.29 por 1M de tokens
- z-aiNUEVOZ.ai: GLM 5.32026-08-1860Inteligencia75Código
- obsidianNUEVOQwen3.8 27B2026-08-1552Inteligencia68Código
- qwenNUEVOQwen: Qwen3.8 27B (free)2026-08-13qwen/qwen3.8-27b-free
- deepseekNUEVODeepSeek: DeepSeek V4 Pro 08132026-08-1253Inteligencia69Código
- grokNUEVOSpaceXAI: Grok 4.62026-08-1261Inteligencia77Código
- metaMeta: Muse Spark 1.22026-08-0557Inteligencia72Código
- qwenQwen: Qwen3.8 Max2026-08-0358Inteligencia72Código
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3152Inteligencia69Código
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 por 1M de tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463Inteligencia78Código
- googleGoogle: Gemini 3.6 Flash2026-07-2152Inteligencia69Código
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137Inteligencia49Código
- metaMeta: Muse Spark 1.12026-07-1653Inteligencia71Código
- kimiMoonshotAI: Kimi K32026-07-1560Inteligencia76Código
- openaiOpenAI: GPT-5.6 Luna2026-07-0952Inteligencia71Código
- openaiOpenAI: GPT-5.6 Terra2026-07-0957Inteligencia77Código
- openaiOpenAI: GPT-5.6 Sol2026-07-0961Inteligencia77Código
Para ejecutar Qwen3.8-27B-Uncensored localmente, descarga el repositorio GGUF de acceso restringido orcarouter/Qwen3.8-27B-Uncensored-GGUF desde Hugging Face, elige una cuantización según tu VRAM — Q4_K_M (16.8 GB) para una GPU de 24 GB, IQ4_XS (15.3 GB) para una GPU de 16 GB, Q3_K_M (13.5 GB) si quieres margen de contexto — y sírvelo con una compilación actual de llama.cpp usando el indicador --jinja, añadiendo --mmproj si necesitas visión. El mismo archivo se importa en Ollama con tres comandos. Esta es la versión GGUF de la compilación abliterada de Qwen3.8 27B, publicada el 16 de agosto de 2026, con el contexto nativo de 262K, el proyector de visión y la cabecera de decodificación especulativa MTP conservados en cada cuantización. Es una herramienta de investigación, no un asistente: se ha eliminado su comportamiento de rechazo, no incluye salvaguardas integradas y la licencia es Apache 2.0. Lee el límite de seguridad al final de esta página antes de descargar — ese es el propósito del repositorio de acceso restringido.
Qué GGUF descargar según VRAM
El repositorio incluye un par de precisión completa y doce archivos cuantizados, por lo que la decisión de descarga es realmente una decisión de VRAM. Los números a continuación son los tamaños de archivo leídos del repositorio de Hugging Face el 2026-08-16.

¿Qué hay realmente en el repositorio?
orcarouter/Qwen3.8-27B-Uncensored-GGUF contiene quince archivos de modelo: los pesos F16 divididos en dos partes, doce GGUFs cuantizados — Q2_K, Q3_K_S, Q3_K_M, Q3_K_L, Q4_K_S, Q4_K_M, Q5_K_S, Q5_K_M, Q6_K, Q8_0, IQ3_M e IQ4_XS — y el proyector de visión mmproj. Es la exportación GGUF de la misma compilación abliterada que Qwen3.8-27B-Uncensored-FP8, reempaquetada para entornos de ejecución locales de la clase llama.cpp, y hereda la licencia Apache 2.0 del modelo base y su contexto nativo de 262.144 tokens.
Tres propiedades se mantienen en todos los quant. La arquitectura es qwen35 — atención híbrida con 48 capas lineales Gated DeltaNet y 16 capas de atención completa — razón por la que el repositorio no carga en compilaciones antiguas de llama.cpp y por la que la caché KV sigue siendo pequeña. La cabezal de decodificación especulativa MTP (nextn) se conserva en todos los quant, tanto K-quant como IQ. Y la plantilla de chat es la plantilla Qwen Jinja, que debes habilitar explícitamente (ver más abajo) o las conversaciones de varios turnos se rompen.
Por qué la caché KV se mantiene lo bastante pequeña como para ser relevante
Este es el detalle que hace que la historia local funcione. De las 64 capas, solo 16 usan atención completa; las otras 48 usan atención lineal Gated DeltaNet, que no mantiene una caché KV convencional. El efecto práctico, medido en el runbook original de esta arquitectura, es una caché KV de aproximadamente 2 GB con contexto de 32K — alrededor de una cuarta parte de lo que necesitaría un 27B convencional. Por eso un archivo Q4_K_M de 16.8 GB todavía cabe en una tarjeta de 24 GB con una ventana de contexto larga, y por eso la línea GGUF sin censura se puede ejecutar en hardware que no podría alojar el checkpoint BF16 de 55.6 GB en absoluto.
Ejecútalo con llama.cpp
llama.cpp es la ruta prevista. Necesitas una compilación actual: el tronco registra la arquitectura qwen35, y las compilaciones anteriores rechazan el archivo directamente. La forma del comando, según las notas de uso de la tarjeta del modelo y el manual de esta arquitectura, es:

llama-server -m Qwen3.8-27B-Uncensored-Q4_K_M.gguf --ctx-size 32768 --n-gpu-layers 99 --jinja
Eso te da un endpoint compatible con OpenAI en localhost:8080. Para entrada de imágenes añade --mmproj mmproj-Qwen3.8-27B-Uncensored-f16.gguf. Cambia Q4_K_M por la cuantización que coincida con tu VRAM; las opciones son idénticas.
Ejecútalo con Ollama
Ollama ejecuta el mismo archivo importándolo desde un Modelfile, que es la forma compatible de añadir un GGUF que no está en la biblioteca. En el directorio que contiene el quant que descargaste:
FROM ./Qwen3.8-27B-Uncensored-Q4_K_M.gguf
Guarda esa línea como Modelfile, luego ollama create qwen3.8-27b-uncensored -f Modelfile y ollama run qwen3.8-27b-uncensored. Para visión, añade la línea mmproj al Modelfile (FROM ... Q4_K_M.gguf más la ruta de mmproj) y Ollama integra el proyector. Se aplican las mismas advertencias sobre --ctx y la plantilla: establece el tamaño de contexto que realmente quepa, y recuerda que un modelo sin rechazo responde sin barrera de protección entre tú y la salida.
Lo que realmente cambió la eliminación de la negativa
La ficha del modelo publica un conjunto de evaluación de seguridad para esta compilación. Con el razonamiento desactivado, la tasa de rechazo en las pruebas de referencia estándar de indicaciones dañinas cae de 64–99% en el modelo base a 0–6% en los pesos abliterados; con el razonamiento activado, prácticamente nunca rechaza: 1.7% o menos. Las pruebas de referencia de capacidades se mantienen dentro de ±1.3 puntos de la base. Esa es la forma de cada versión abliterada de esta línea: rechazos eliminados, capacidades intactas, y la advertencia de que una fracción considerable de las respuestas todavía antepone un breve aviso antes de responder: un artefacto del entrenamiento, no un rechazo.
La otra cara de la moneda es la razón de ser de la frontera de seguridad que se muestra a continuación: un modelo que nunca se niega no es un mejor asistente, sino un objeto de otro tipo. Es un instrumento de prueba para medir los mecanismos de rechazo y para descubrir si tu propia salvaguardia funciona.
Qué hacer realmente con ello en la investigación
Tres proyectos legítimos que son el uso autorizado de un modelo sin mecanismo de rechazo:
Cuando esta compilación es la respuesta equivocada
Si quieres un asistente normal, o cualquier cosa que pondrías frente a usuarios finales, este es el modelo equivocado — no tiene salvaguardas integradas significativas, cumplirá con solicitudes que el modelo base rechaza, y Apache 2.0 no transfiere tu responsabilidad. Usa el Qwen3.8-27B alineado original para eso. Si quieres desviar rechazos en un chatbot, un paquete de prompts de sistema logra más con menos riesgo que una edición de pesos. Y si no tienes GPU en absoluto pero aun así quieres estudiar el modelo, la tarjeta alojada obsidian/Qwen3.8-27B en OrcaRouter ofrece la misma línea sin censura a $0.40 por millón de tokens de entrada y $4.21 por millón de salida con el mismo contexto de 262K; está restringida a investigadores de seguridad y de seguridad de IA de la misma manera que el repositorio, y la decisión de moderación sigue de tu lado. La tarjeta del modelo tiene los detalles de precios y puntos de referencia.
El límite de seguridad — lea esto antes de descargar

Este modelo ha tenido su {{1}}alineación de seguridad sustancialmente eliminada{{/1}}. Cumplirá con {{2}}solicitudes dañinas, poco éticas, ofensivas o ilegales{{/2}} que el {{3}}Qwen3.8-27B{{/3}} original {{4}}rechazaría{{/4}}, y no tiene {{5}}salvaguardas integradas significativas{{/5}}. Se publica {{6}}estrictamente para investigación legítima{{/6}} — {{7}}interpretabilidad, estudio de seguridad de IA y mecanismos de rechazo, red-teaming, evaluación de robustez y experimentos controlados{{/7}}. Usted asume {{8}}toda la responsabilidad y obligación legal{{/8}} por {{9}}cómo lo utiliza y por todo lo que genera{{/9}}, y no debe {{10}}desplegarlo para usuarios finales ni en producción{{/10}} sin añadir {{11}}sus propias capas de seguridad, moderación y prevención de abusos{{/11}}. Los autores no aceptan {{12}}ninguna responsabilidad por el uso indebido{{/12}}. {{13}}Descargar el repositorio{{/13}} significa {{14}}que acepta estas condiciones{{/14}}; la licencia es {{15}}Apache 2.0{{/15}}.
Este artículo deliberadamente no contiene indicaciones dañinas. Los números de rechazo mencionados provienen del conjunto de evaluación de seguridad de la propia tarjeta del modelo, que es la forma correcta de medir un modelo de esta clase: ejecutar los benchmarks estándar de rechazo, leer los números y diseñar tu investigación en torno a lo que muestran.
Fuentes y fecha
Todos los hechos anteriores fueron verificados el 16 de agosto de 2026. La lista de archivos y sus tamaños se obtienen del repositorio de Hugging Face orcarouter/Qwen3.8-27B-Uncensored-GGUF (creado el 16 de agosto de 2026; arquitectura qwen35; Apache 2.0; con acceso restringido). Las cifras de rechazo y capacidad provienen de la suite de evaluación de seguridad de la tarjeta del modelo. La medición de la caché KV (~2 GB en contexto de 32K) proviene del runbook de OrcaRouter para esta arquitectura, How to Run Qwen 3.8 27B Locally. El precio del servicio alojado y el control de acceso provienen de la página del modelo obsidian/Qwen3.8-27B, consultada el mismo día. Los tamaños de los archivos cuantizados están en GB decimales tal como se almacenan en Hugging Face.
Para investigación legítima, los pesos están en Hugging Face: Descargar desde Hugging Face — sin tarjeta de crédito, activo en 60 segundos.
