Ilustración editorial de vector plano para el hero de un blog de tecnología sobre cómo ejecutar un gran modelo de lenguaje sin censura y abliterado localmente en tu propio hardware: un gran chip de modelo redondeado en azul profundo con un suave resplandor cian flota a la izquierda del centro, su circuito interno disolviéndose de una forma de candado cerrado a una abierta. A su derecha, una tarjeta GPU compacta sobre un banco de trabajo y una ventana de terminal delgada con barras de comando horizontales abstractas y una pequeña silueta de llama junto a ella. En la esquina superior, un pequeño icono de microscopio y un escudo redondeado con un triángulo de advertencia, sugiriendo uso de investigación y límites de seguridad. Fondo suave en azul claro y blanco, amplio espacio vacío en el tercio inferior. Sin texto legible.
Guides & Insights

Cómo ejecutar Qwen3.8-27B-Uncensored localmente: GGUF Quants, llama.cpp y Ollama

Autor

Rowan Sterling

Fecha de publicación

Últimos modelos · 20Ver todos los modelos
Benchmarks: Artificial Analysis · actualizado a diario
Volver a todas las publicaciones

Para ejecutar Qwen3.8-27B-Uncensored localmente, descarga el repositorio GGUF de acceso restringido orcarouter/Qwen3.8-27B-Uncensored-GGUF desde Hugging Face, elige una cuantización según tu VRAM — Q4_K_M (16.8 GB) para una GPU de 24 GB, IQ4_XS (15.3 GB) para una GPU de 16 GB, Q3_K_M (13.5 GB) si quieres margen de contexto — y sírvelo con una compilación actual de llama.cpp usando el indicador --jinja, añadiendo --mmproj si necesitas visión. El mismo archivo se importa en Ollama con tres comandos. Esta es la versión GGUF de la compilación abliterada de Qwen3.8 27B, publicada el 16 de agosto de 2026, con el contexto nativo de 262K, el proyector de visión y la cabecera de decodificación especulativa MTP conservados en cada cuantización. Es una herramienta de investigación, no un asistente: se ha eliminado su comportamiento de rechazo, no incluye salvaguardas integradas y la licencia es Apache 2.0. Lee el límite de seguridad al final de esta página antes de descargar — ese es el propósito del repositorio de acceso restringido.

Qué GGUF descargar según VRAM

El repositorio incluye un par de precisión completa y doce archivos cuantizados, por lo que la decisión de descarga es realmente una decisión de VRAM. Los números a continuación son los tamaños de archivo leídos del repositorio de Hugging Face el 2026-08-16.

A quant-picker card titled 'Qwen3.8-27B-Uncensored GGUF — pick by VRAM', sourced to the Hugging Face repo orcarouter/Qwen3.8-27B-Uncensored-GGUF checked 2026-08-16. It lists: 24 GB GPU — Q4_K_M at 16.8 GB, the recommended default; 16 GB GPU — IQ4_XS at 15.3 GB (tight) or Q3_K_M at 13.5 GB (context headroom); 12 GB GPU — Q2_K at 10.9 GB only, quality drops; 48 GB+ — Q8_0 at 29.0 GB or F16 at 54.7 GB; plus a vision line reading add mmproj 0.9 GB for image input. Footer: only 16 of 64 layers use full attention, so the KV cache stays ~2 GB at 32K context and Q4_K_M fits a 24 GB card with long context.

¿Qué hay realmente en el repositorio?

orcarouter/Qwen3.8-27B-Uncensored-GGUF contiene quince archivos de modelo: los pesos F16 divididos en dos partes, doce GGUFs cuantizados — Q2_K, Q3_K_S, Q3_K_M, Q3_K_L, Q4_K_S, Q4_K_M, Q5_K_S, Q5_K_M, Q6_K, Q8_0, IQ3_M e IQ4_XS — y el proyector de visión mmproj. Es la exportación GGUF de la misma compilación abliterada que Qwen3.8-27B-Uncensored-FP8, reempaquetada para entornos de ejecución locales de la clase llama.cpp, y hereda la licencia Apache 2.0 del modelo base y su contexto nativo de 262.144 tokens.

Tres propiedades se mantienen en todos los quant. La arquitectura es qwen35 — atención híbrida con 48 capas lineales Gated DeltaNet y 16 capas de atención completa — razón por la que el repositorio no carga en compilaciones antiguas de llama.cpp y por la que la caché KV sigue siendo pequeña. La cabezal de decodificación especulativa MTP (nextn) se conserva en todos los quant, tanto K-quant como IQ. Y la plantilla de chat es la plantilla Qwen Jinja, que debes habilitar explícitamente (ver más abajo) o las conversaciones de varios turnos se rompen.

Por qué la caché KV se mantiene lo bastante pequeña como para ser relevante

Este es el detalle que hace que la historia local funcione. De las 64 capas, solo 16 usan atención completa; las otras 48 usan atención lineal Gated DeltaNet, que no mantiene una caché KV convencional. El efecto práctico, medido en el runbook original de esta arquitectura, es una caché KV de aproximadamente 2 GB con contexto de 32K — alrededor de una cuarta parte de lo que necesitaría un 27B convencional. Por eso un archivo Q4_K_M de 16.8 GB todavía cabe en una tarjeta de 24 GB con una ventana de contexto larga, y por eso la línea GGUF sin censura se puede ejecutar en hardware que no podría alojar el checkpoint BF16 de 55.6 GB en absoluto.

Ejecútalo con llama.cpp

llama.cpp es la ruta prevista. Necesitas una compilación actual: el tronco registra la arquitectura qwen35, y las compilaciones anteriores rechazan el archivo directamente. La forma del comando, según las notas de uso de la tarjeta del modelo y el manual de esta arquitectura, es:

A command card titled 'llama.cpp — serve the uncensored GGUF' showing the run command llama-server -m Qwen3.8-27B-Uncensored-Q4_K_M.gguf --ctx-size 32768 --n-gpu-layers 99 --jinja, an optional vision line adding --mmproj mmproj-Qwen3.8-27B-Uncensored-f16.gguf, and notes: a current build is required because the qwen35 architecture is refused by older llama.cpp versions; the MTP nextn head is preserved in every quant but needs a build with MTP support, stock builds ignore it. Footer: the Ollama path is a Modelfile with FROM ./Qwen3.8-27B-Uncensored-Q4_K_M.gguf, then ollama create qwen3.8-27b-uncensored -f Modelfile, then ollama run qwen3.8-27b-uncensored.

llama-server -m Qwen3.8-27B-Uncensored-Q4_K_M.gguf --ctx-size 32768 --n-gpu-layers 99 --jinja

Eso te da un endpoint compatible con OpenAI en localhost:8080. Para entrada de imágenes añade --mmproj mmproj-Qwen3.8-27B-Uncensored-f16.gguf. Cambia Q4_K_M por la cuantización que coincida con tu VRAM; las opciones son idénticas.

Ejecútalo con Ollama

Ollama ejecuta el mismo archivo importándolo desde un Modelfile, que es la forma compatible de añadir un GGUF que no está en la biblioteca. En el directorio que contiene el quant que descargaste:

FROM ./Qwen3.8-27B-Uncensored-Q4_K_M.gguf

Guarda esa línea como Modelfile, luego ollama create qwen3.8-27b-uncensored -f Modelfile y ollama run qwen3.8-27b-uncensored. Para visión, añade la línea mmproj al Modelfile (FROM ... Q4_K_M.gguf más la ruta de mmproj) y Ollama integra el proyector. Se aplican las mismas advertencias sobre --ctx y la plantilla: establece el tamaño de contexto que realmente quepa, y recuerda que un modelo sin rechazo responde sin barrera de protección entre tú y la salida.

Lo que realmente cambió la eliminación de la negativa

La ficha del modelo publica un conjunto de evaluación de seguridad para esta compilación. Con el razonamiento desactivado, la tasa de rechazo en las pruebas de referencia estándar de indicaciones dañinas cae de 64–99% en el modelo base a 0–6% en los pesos abliterados; con el razonamiento activado, prácticamente nunca rechaza: 1.7% o menos. Las pruebas de referencia de capacidades se mantienen dentro de ±1.3 puntos de la base. Esa es la forma de cada versión abliterada de esta línea: rechazos eliminados, capacidades intactas, y la advertencia de que una fracción considerable de las respuestas todavía antepone un breve aviso antes de responder: un artefacto del entrenamiento, no un rechazo.

La otra cara de la moneda es la razón de ser de la frontera de seguridad que se muestra a continuación: un modelo que nunca se niega no es un mejor asistente, sino un objeto de otro tipo. Es un instrumento de prueba para medir los mecanismos de rechazo y para descubrir si tu propia salvaguardia funciona.

Qué hacer realmente con ello en la investigación

Tres proyectos legítimos que son el uso autorizado de un modelo sin mecanismo de rechazo:

Cuando esta compilación es la respuesta equivocada

Si quieres un asistente normal, o cualquier cosa que pondrías frente a usuarios finales, este es el modelo equivocado — no tiene salvaguardas integradas significativas, cumplirá con solicitudes que el modelo base rechaza, y Apache 2.0 no transfiere tu responsabilidad. Usa el Qwen3.8-27B alineado original para eso. Si quieres desviar rechazos en un chatbot, un paquete de prompts de sistema logra más con menos riesgo que una edición de pesos. Y si no tienes GPU en absoluto pero aun así quieres estudiar el modelo, la tarjeta alojada obsidian/Qwen3.8-27B en OrcaRouter ofrece la misma línea sin censura a $0.40 por millón de tokens de entrada y $4.21 por millón de salida con el mismo contexto de 262K; está restringida a investigadores de seguridad y de seguridad de IA de la misma manera que el repositorio, y la decisión de moderación sigue de tu lado. La tarjeta del modelo tiene los detalles de precios y puntos de referencia.

El límite de seguridad — lea esto antes de descargar

A safety-boundary card for Qwen3.8-27B-Uncensored with two columns: under Research use it lists refusal-mechanism study, interpretability, red-teaming, robustness evaluation and guardrail testing; under Never deploy it lists end-user chatbots, production applications and consumer services, with a warning that this model has had its safety alignment removed and will comply with harmful, unethical or illegal requests the base model refuses, and a footer reading Apache 2.0, research-only, you assume full responsibility.

Este modelo ha tenido su {{1}}alineación de seguridad sustancialmente eliminada{{/1}}. Cumplirá con {{2}}solicitudes dañinas, poco éticas, ofensivas o ilegales{{/2}} que el {{3}}Qwen3.8-27B{{/3}} original {{4}}rechazaría{{/4}}, y no tiene {{5}}salvaguardas integradas significativas{{/5}}. Se publica {{6}}estrictamente para investigación legítima{{/6}} — {{7}}interpretabilidad, estudio de seguridad de IA y mecanismos de rechazo, red-teaming, evaluación de robustez y experimentos controlados{{/7}}. Usted asume {{8}}toda la responsabilidad y obligación legal{{/8}} por {{9}}cómo lo utiliza y por todo lo que genera{{/9}}, y no debe {{10}}desplegarlo para usuarios finales ni en producción{{/10}} sin añadir {{11}}sus propias capas de seguridad, moderación y prevención de abusos{{/11}}. Los autores no aceptan {{12}}ninguna responsabilidad por el uso indebido{{/12}}. {{13}}Descargar el repositorio{{/13}} significa {{14}}que acepta estas condiciones{{/14}}; la licencia es {{15}}Apache 2.0{{/15}}.

Este artículo deliberadamente no contiene indicaciones dañinas. Los números de rechazo mencionados provienen del conjunto de evaluación de seguridad de la propia tarjeta del modelo, que es la forma correcta de medir un modelo de esta clase: ejecutar los benchmarks estándar de rechazo, leer los números y diseñar tu investigación en torno a lo que muestran.

Fuentes y fecha

Todos los hechos anteriores fueron verificados el 16 de agosto de 2026. La lista de archivos y sus tamaños se obtienen del repositorio de Hugging Face orcarouter/Qwen3.8-27B-Uncensored-GGUF (creado el 16 de agosto de 2026; arquitectura qwen35; Apache 2.0; con acceso restringido). Las cifras de rechazo y capacidad provienen de la suite de evaluación de seguridad de la tarjeta del modelo. La medición de la caché KV (~2 GB en contexto de 32K) proviene del runbook de OrcaRouter para esta arquitectura, How to Run Qwen 3.8 27B Locally. El precio del servicio alojado y el control de acceso provienen de la página del modelo obsidian/Qwen3.8-27B, consultada el mismo día. Los tamaños de los archivos cuantizados están en GB decimales tal como se almacenan en Hugging Face.

Para investigación legítima, los pesos están en Hugging Face: Descargar desde Hugging Face — sin tarjeta de crédito, activo en 60 segundos.

© 2026 OrcaRouter

Para proveedores

¿Operas una plataforma de inferencia? Publica tus modelos en OrcaRouter.

providers@orcarouter.ai

Únete a la comunidad

Discordsupport@orcarouter.aiXGitHubYouTube