Tarjeta de título para el artículo 'Qwen Uncensored, Explained', que muestra una tarjeta de investigación redondeada con un escudo abriéndose para revelar un cerebro-circuito, un icono de microscopio y una etiqueta que dice RESEARCH-ONLY, con chips que dicen ABLITERATED, BLOCK-FP8 y 262K CONTEXT.
Guides & Insights

Qwen sin censura, explicado: Cómo ejecutar el Qwen3.8-27B-FP8 abliterado

Autor

Rowan Sterling

Fecha de publicación

Últimos modelos · 20Ver todos los modelos
Benchmarks: Artificial Analysis · actualizado a diario
Volver a todas las publicaciones

Qwen sin censura en Hugging Face casi siempre significa abliteración — la dirección de rechazo del modelo eliminada de su flujo residual — y la compilación con la que empezar es Qwen3.8-27B-Uncensored-FP8, publicada en Hugging Face el 15 de agosto de 2026. Es una compilación abliterada en FP8 por bloques de Qwen3.8-27B que se ejecuta en exactamente la misma ruta de kernel de vLLM que la versión FP8 oficial, con el contexto de 262K, la torre de visión y la cabeza de decodificación especulativa MTP intactos — y obtuvo 257 me gusta y 4,285 descargas el primer día. Es una herramienta de investigación, no un chatbot: sin salvaguardas integradas, bajo licencia Apache 2.0, y cumplirá con las solicitudes que el modelo base rechaza. Esta guía cubre qué cambió realmente la abliteración, cómo descargar los 30,9 GB de pesos desde Hugging Face, cómo servir el modelo con vLLM, SGLang o Transformers, y qué ejecutar en él para investigación legítima.

Lo que "qwen uncensored" realmente significa

Abliteration es una intervención a nivel de pesos, no un ajuste fino. La dirección de rechazo es un vector en el flujo residual del modelo que, cuando se activa, produce «No puedo ayudar con eso»; abliteration encuentra esa dirección y la ortogonaliza fuera de los pesos. En esta compilación, la eliminación se aplicó a 131 matrices de escritura residual (el método de Arditi et al. 2024, «Refusal in Language Models Is Mediated by a Single Direction»), y el resultado se recuantificó para coincidir byte por byte con el esquema oficial Qwen3.8-27B-FP8, de modo que vLLM lo sirve en la misma ruta de kernel FP8. No se entrenaron pesos nuevos.

Esa distinción importa porque los primeros resultados para "qwen uncensored" mezclan tres cosas diferentes: ediciones de pesos abliteradas como esta, "paquetes sin censura" de prompt de sistema que solo enmascaran los rechazos a nivel de prompt, y ajustes finos LoRA entrenados sin datos de seguridad. No son equivalentes, y la mayoría de las páginas que aparecen en los resultados de esa búsqueda no indican a qué familia pertenecen. Si quieres estudiar el mecanismo de rechazo en sí, solo la intervención a nivel de pesos es lo auténtico.

Lo que realmente hizo la eliminación del rechazo — los números

La ficha del modelo publica una suite de evaluación de seguridad, ejecutada sobre el modelo servido por vLLM y con fecha del 15 de agosto de 2026. Con el razonamiento desactivado, la tasa de rechazo en siete puntos de referencia de indicaciones dañinas se desploma del 64–99% en el modelo base al 0–6% en esta versión: AdvBench del 99.0% al 0.0%, JailbreakBench del 94.0% al 0.0%, StrongREJECT del 97.3% al 2.0%, HarmBench del 98.7% al 2.7%, MaliciousInstruct del 99.0% al 0.0%, SimpleSafetyTests del 64.0% al 6.0%, ForbiddenQuestions del 73.3% al 4.7%. Con el razonamiento activado, el modelo se niega prácticamente nunca: 1.7% o menos. Otro número notable es la tasa de advertencias: el 30–50% de las respuestas "sin censura" todavía anteponen una breve exención de responsabilidad antes de responder; eso es un artefacto del entrenamiento, no un rechazo.

La otra cara de la moneda es lo que no cambió. El sobre-rechazo en indicaciones benignas cae del 5,6% al 0,4% en XSTest-safe, y cada punto de referencia de capacidad se mantiene dentro de ±1,3 puntos de la base: MMLU del 84,3% al 84,7%, GSM8K del 90,0% al 88,7%, MMLU-Pro del 77,6% al 76,8%, CMMLU del 81,4% al 80,8%. La perplejidad de WikiText-2 es 6,96. En otras palabras, la intervención eliminó el comportamiento de rechazo sin degradar significativamente el modelo.

A before-and-after card for Qwen3.8-27B-Uncensored-FP8, with a Base column and an Abliterated column: refusal with thinking off 64-99% down to 0-6%, refusal with thinking on down to 1.7% or less, over-refusal on benign prompts 5.6% down to 0.4%, MMLU 84.3% to 84.7%, GSM8K 90.0% to 88.7%, and WikiText-2 perplexity 6.96, with a footer reading Model-card evaluation, vLLM-served, August 15 2026.

Cómo descargarlo desde Hugging Face

El repositorio es orcarouter/Qwen3.8-27B-Uncensored-FP8, y está restringido: inicias sesión con una cuenta de Hugging Face y aceptas las condiciones antes de que se descarguen los archivos — la restricción en sí es el descargo de responsabilidad, porque leer el README es parte de aceptar lo que este modelo es. Lo que descargas son 30.9 GB repartidos en siete fragmentos safetensors (1,606 tensores) en block-FP8 (E4M3, bloques de 128 por 128, activaciones dinámicas), con la torre de visión, las normas, los embeddings y lm_head mantenidos en BF16. La licencia es Apache 2.0, heredada del Qwen/Qwen3.8-27B base. Ningún Proveedor de Inferencia de Hugging Face lo aloja — lo ejecutas tú mismo, o usas una tarjeta alojada.

Cómo ejecutarlo

Los pesos son aproximadamente 31 GB — alrededor de la mitad del punto de control BF16 de ~56 GB — y la ficha recomienda una única H100 de 80 GB o H200 de 143 GB, con ~40 GB de VRAM como mínimo práctico para los pesos más una pequeña caché KV. El contexto completo de 262K necesita más, pero una caché KV FP8 lo reduce a la mitad. La configuración que verificó la ficha fue una H200 con --max-num-seqs 96, caché KV FP8 y MTP habilitado.

vLLM es la vía prevista, y es un solo comando, porque el esquema FP8 coincide exactamente con la compilación oficial:

vllm serve "orcarouter/Qwen3.8-27B-Uncensored-FP8"

Eso te da un endpoint compatible con OpenAI en localhost:8000/v1/chat/completions. El equivalente con Docker es docker model run hf.co/orcarouter/Qwen3.8-27B-Uncensored-FP8. Para la configuración completa, la tarjeta sugiere: --language-model-only para servir solo texto, --speculative-config '{"method":"mtp","num_speculative_tokens":3}' para habilitar el cabezal de decodificación especulativa MTP, --kv-cache-dtype fp8, --max-model-len 262144, --reasoning-parser qwen3, y --enable-auto-tool-choice --tool-call-parser qwen3_coder para la llamada a herramientas. No pases --quantization fp8 — el esquema se lee de config.json. Omite --kv-cache-dtype fp8 si quieres una caché KV en BF16, y omite --language-model-only si necesitas la torre de visión.

Para SGLang: python3 -m sglang.launch_server --model-path "orcarouter/Qwen3.8-27B-Uncensored-FP8" --host 0.0.0.0 --port 30000. Para Transformers, la ficha documenta tanto la API de pipeline — pipeline("image-text-to-text", model="orcarouter/Qwen3.8-27B-Uncensored-FP8") — como AutoProcessor.from_pretrained(...) y AutoModelForMultimodalLM.from_pretrained(..., device_map="auto").

A how-to-run card for Qwen3.8-27B-Uncensored-FP8 listing the essentials: 30.9 GB of block-FP8 weights across 7 shards, roughly 40 GB of VRAM floor with H100 80GB or H200 143GB recommended, the vLLM one-liner vllm serve orcarouter/Qwen3.8-27B-Uncensored-FP8, serve flags MTP 3 speculative tokens, FP8 KV cache, max-model-len 262144, tool-call-parser qwen3_coder, and a footer reading From the Hugging Face model card, August 15 2026.

Qué hacer realmente con ello en la investigación

El objetivo de un modelo sin rechazos es ser un objeto de estudio, y esta compilación es inusualmente fácil de estudiar porque su intervención está documentada. Tres proyectos de investigación concretos y legítimos:

• Reproduce el delta de rechazo. Ejecuta AdvBench, HarmBench, StrongREJECT o XSTest-safe contra la versión abliterada y la base FP8, y confirma los números de la tarjeta: 64–99% a 0–6% en prompts dañinos, 5.6% a 0.4% de sobre-rechazo en los benignos. Ese par antes/después es exactamente la medición que un equipo de seguridad necesita para saber si un método de eliminación de rechazo funciona y cuánto cuesta.

Estudia dónde reside el rechazo. Debido a que la compilación documenta las 131 matrices que se ortogonalizaron, puedes comparar las direcciones del flujo residual con la base y ver qué movió la intervención. El resultado con el razonamiento activado es informativo aquí: el rechazo baja al 1,7 % o menos cuando el pensamiento está habilitado, lo que es evidencia de que el rastro de razonamiento es donde la dirección importa más.

• Evalúa tu propio guardarraíl. Una línea base sin guardarraíl es el control correcto para probar una capa de moderación. Ejecuta tu filtro sobre las salidas de este modelo y mide lo que captura — así es como cuantificas la capa de seguridad que añades encima.

Cuando este modelo es la respuesta incorrecta

Si quieres un asistente normal, o cualquier cosa que pondrías delante de usuarios finales, este es el modelo equivocado: no cuenta con salvaguardas integradas significativas, cumplirá con solicitudes que el modelo base rechaza, y Apache 2.0 no te exime de tu responsabilidad. Usa el Qwen3.8-27B alineado original en su lugar. Si quieres desviar rechazos en un chatbot, un paquete de prompts de sistema logra más con menos riesgo que una edición de pesos. Y si no tienes una tarjeta de ~40 GB pero aun así quieres estudiar el modelo, la tarjeta alojada obsidian/Qwen3.8-27B en OrcaRouter ofrece la misma línea 27B sin censura a $0.40 por millón de tokens de entrada y $4.21 por millón de salida, con el mismo contexto de 262K — está restringida a investigadores de seguridad y de seguridad de la IA, y la decisión de moderación sigue estando de tu lado.

A safety-boundary card for Qwen3.8-27B-Uncensored-FP8 with two columns: under Research use it lists refusal-mechanism study, interpretability, red-teaming, robustness evaluation and guardrail testing; under Never deploy it lists end-user chatbots, production applications and consumer services with a warning that the model has no built-in guardrails, and a footer reading Apache 2.0, research-only, you assume full responsibility.

El límite de seguridad — lea esto antes de descargar

Este modelo ha tenido su {{1}}alineación de seguridad sustancialmente eliminada{{/1}}. Cumplirá con {{2}}solicitudes dañinas, poco éticas, ofensivas o ilegales{{/2}} que el {{3}}Qwen3.8-27B{{/3}} original {{4}}rechazaría{{/4}}, y no tiene {{5}}salvaguardas integradas significativas{{/5}}. Se publica {{6}}estrictamente para investigación legítima{{/6}} — {{7}}interpretabilidad, estudio de seguridad de IA y mecanismos de rechazo, red-teaming, evaluación de robustez y experimentos controlados{{/7}}. Usted asume {{8}}toda la responsabilidad y obligación legal{{/8}} por {{9}}cómo lo utiliza y por todo lo que genera{{/9}}, y no debe {{10}}desplegarlo para usuarios finales ni en producción{{/10}} sin añadir {{11}}sus propias capas de seguridad, moderación y prevención de abusos{{/11}}. Los autores no aceptan {{12}}ninguna responsabilidad por el uso indebido{{/12}}. {{13}}Descargar el repositorio{{/13}} significa {{14}}que acepta estas condiciones{{/14}}; la licencia es {{15}}Apache 2.0{{/15}}.

Este artículo deliberadamente no contiene indicaciones dañinas. Los números de rechazo mencionados provienen del conjunto de evaluación de seguridad de la propia tarjeta del modelo, que es la forma correcta de medir un modelo de esta clase: ejecutar los benchmarks estándar de rechazo, leer los números y diseñar tu investigación en torno a lo que muestran.

En resumen

"Qwen uncensored" es una búsqueda de una técnica, y la versión que debes probar primero es Qwen3.8-27B-Uncensored-FP8: la única compilación de Qwen3.8 sin rechazos que se sirve en la ruta oficial del kernel FP8 de vLLM con contexto de 262K, visión y MTP intactos, respaldada por una evaluación publicada de antes/después. Descarga los 30,9 GB restringidos desde Hugging Face, sírvela con vLLM en una sola H100 o H200, y úsala para lo que es: medir rechazos, estudiar el mecanismo de rechazo y probar salvaguardas. No la uses como chatbot ni la distribuyas a usuarios finales. Los pesos son gratuitos; la responsabilidad por lo que hagas con ellos es completamente tuya.

Para investigación legítima, los pesos están en Hugging Face: Descargar desde Hugging Face

© 2026 OrcaRouter

Para proveedores

¿Operas una plataforma de inferencia? Publica tus modelos en OrcaRouter.

Contáctanos

Únete a la comunidad

DiscordEmailXGitHubYouTube