
Qwen3.8-27B-Uncensored Benchmarks: El rechazo colapsa, la capacidad se mantiene
- DeepSeekNUEVODeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.15 / $0.29 por 1M de tokens
- z-aiNUEVOZ.ai: GLM 5.32026-08-1860Inteligencia75Código
- obsidianNUEVOQwen3.8 27B2026-08-1552Inteligencia68Código
- qwenNUEVOQwen: Qwen3.8 27B (free)2026-08-13qwen/qwen3.8-27b-free
- deepseekNUEVODeepSeek: DeepSeek V4 Pro 08132026-08-1253Inteligencia69Código
- grokNUEVOSpaceXAI: Grok 4.62026-08-1261Inteligencia77Código
- metaMeta: Muse Spark 1.22026-08-0557Inteligencia72Código
- qwenQwen: Qwen3.8 Max2026-08-0358Inteligencia72Código
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3152Inteligencia69Código
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 por 1M de tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463Inteligencia78Código
- googleGoogle: Gemini 3.6 Flash2026-07-2152Inteligencia69Código
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137Inteligencia49Código
- metaMeta: Muse Spark 1.12026-07-1653Inteligencia71Código
- kimiMoonshotAI: Kimi K32026-07-1560Inteligencia76Código
- openaiOpenAI: GPT-5.6 Luna2026-07-0952Inteligencia71Código
- openaiOpenAI: GPT-5.6 Terra2026-07-0957Inteligencia77Código
- openaiOpenAI: GPT-5.6 Sol2026-07-0961Inteligencia77Código
La historia de los benchmarks de Qwen3.8 27B Uncensored (Aggressive) — la versión abliterada de Qwen3.8 27B publicada como checkpoint FP8 el 15 de agosto de 2026 y como build GGUF el 16 de agosto — no es que se haya vuelto más fuerte. Es que dejó de negarse. La ficha del modelo reporta que el rechazo a prompts dañinos cae del 64–99% en la base al 0–6% en la versión abliterada con el razonamiento desactivado, y al 1.7% o menos con el razonamiento activado, mientras que todos los benchmarks de capacidades se mantienen dentro de ±1.3 puntos de la base y la perplejidad en WikiText-2 se sitúa en 6.96. Si estás aquí por los benchmarks de qwen sin censura, esos son los números clave: no es un modelo más inteligente, es uno que no se niega.
Esa distinción importa, porque la mayor parte de lo que aparece en los "benchmarks sin censura" es o una lista superficial de puntuaciones de capacidad o una publicación exagerada que afirma que el modelo es "mejor". Ninguna de las dos cosas es lo que hace la abliteración. Este artículo recorre los datos reales medidos —colapso de rechazos, sobre-rechazo, retención de capacidades y perplejidad—, el método que los produjo y el límite de seguridad que deberías leer antes de tocar los pesos.
Lo que realmente mide un resumen de benchmarks sin censura
Una revisión de modelo ordinaria informa sobre un eje: capacidad — MMLU, GSM8K, codificación, razonamiento. Un modelo ablacionado es interesante en un eje diferente, y todo el sentido de la etiqueta "sin censura" es que el eje de seguridad se movió. Así que la pregunta útil para Qwen3.8-27B-Uncensored-FP8 no es "¿es más inteligente?" sino "¿qué costó eliminar el mecanismo de rechazo, y qué tan a fondo se eliminó?"
Tres familias de números deben leerse juntas. Tasa de rechazo en evaluaciones de indicaciones dañinas: con qué frecuencia el modelo se niega; cuanto más alta es la base, más visible es la eliminación. Sobre-rechazo en indicaciones benignas: con qué frecuencia rechaza erróneamente una solicitud inocente; cuanto más bajo, mejor para todos. Y retención de capacidades: si la edición degradó el modelo. Un resumen de evaluación que solo muestra las puntuaciones de capacidad está respondiendo a la pregunta equivocada.
El método: abliteration es una edición de pesos, no un ajuste fino.
Lo que separa la abliteración de los paquetes de «jailbreak» de la comunidad es dónde vive el cambio. Un jailbreak a nivel de prompt envuelve la entrada; la abliteración edita los pesos. El método aquí es Arditi et al. (2024), «Refusal in Language Models Is Mediated by a Single Direction». El hallazgo central es que el comportamiento de rechazo en muchos modelos está mediado por una sola dirección en el flujo residual: estima esa dirección, elimínala, y el modelo deja de rechazar sin necesidad de reentrenamiento.
Concretamente, la tarjeta describe la estimación de una dirección de rechazo a partir de la diferencia de medias enmascarada por activaciones masivas de los residuales del último token (dañinos menos inofensivos) en la capa 38 (round(0.6 × 64)), utilizando AdvBench como conjunto dañino y Alpaca como conjunto inofensivo. La edición es una ortogonalización, W′ = W − r(rᵀW), calculada en float32 y aplicada a 131 matrices de escritura de residuales: las proyecciones de salida de la atención, las proyecciones de salida de la atención lineal, las proyecciones de bajada del MLP y un espacio de filas de embeddings. No se ejecuta ningún paso de entrenamiento; la torre de visión permanece intacta; la cabeza de decodificación especulativa MTP se ablitera de forma consistente. Por eso la capacidad sobrevive: eliminar una dirección es una intervención mucho más suave que ajustar finamente el modelo para que cumpla.
El rechazo colapsa: los números
Medido en la versión FP8 servida por vLLM y publicado en la tarjeta del modelo de Hugging Face (2026-08-15), el rechazo en los benchmarks de prompts dañinos cae del 64–99 % en la versión base al 0–6 % en la versión sin censura con el razonamiento desactivado:
• AdvBench — 99.0% → 0.0%
• JailbreakBench (dañino) — 94.0% → 0.0%
• StrongREJECT — 97.3% → 2.0%
• HarmBench (estándar) — 98.7% → 2.7%
• MaliciousInstruct — 99.0% → 0.0%
• SimpleSafetyTests — 64.0% → 6.0%
• ForbiddenQuestions — 73.3% → 4.7%
Con el razonamiento habilitado, el rechazo es prácticamente inexistente — 1.7% en AdvBench y 0.0% en la mayor parte del resto. La ficha añade una salvedad honesta: el 30–50% de las respuestas aún anteponen un breve descargo de responsabilidad. Eso es un artefacto de entrenamiento, no un rechazo — el modelo responde, pero matiza su inicio. Se percibe como fricción, no como seguridad.

El rechazo excesivo también falla.
El número menos publicitado se encuentra al otro lado del eje de seguridad. En XSTest-safe — 250 indicaciones benignas que los modelos alineados a veces rechazan por error — el modelo base rechaza en exceso el 5.6% de las veces. La versión sin censura rechaza en exceso el 0.4%. Eliminar la dirección de rechazo no solo evita que el modelo rechace solicitudes dañinas; también evita que rechace las inofensivas que antes señalaba por generalización excesiva. Para cualquiera que construya herramientas de evaluación o de red team donde una línea base libre de rechazos sea el objetivo, esto es una mejora real en la herramienta, no un efecto secundario del que haya que disculparse.
La capacidad se conserva, no se mejora.
Aquí es donde muere el planteamiento de «sin censura = más fuerte». La tarjeta del modelo reporta la compilación abliterada de FP8 frente a la base oficial de FP8 con los mismos scripts y configuraciones:
• MMLU (0-shot) — 84.3% → 84.7%
• GSM8K (CoT) — 90.0% → 88.7%
• MMLU-Pro (CoT) — 77.6% → 76.8%
• CMMLU (0-shot, chino) — 81.4% → 80.8%
Cada puntuación se sitúa dentro de ±1.3 puntos de la base, y la perplejidad bruta de WikiText-2 llega a 6.96 — la evidencia de la tarjeta de que el modelado del lenguaje en sí no se degradó. La lectura honesta: abliteration es casi neutral en cuanto a capacidades en esta arquitectura. No obtienes un mejor modelo; obtienes el mismo modelo sin el comportamiento de rechazo.

La misma advertencia se aplica al ecosistema más amplio: las afirmaciones de "sin pérdidas y sin censura" en compilaciones comunitarias merecen una lectura escéptica. Una comparación a tres bandas en una compilación de pesos abiertos de 4B en Hugging Face encontró que la técnica que decía ser sin pérdidas en realidad bajó TruthfulQA unos 7 puntos y Lambada unos 4, mientras que su tasa de éxito de ataque en HarmBench alcanzó el 100%; los otros dos métodos se situaron en 99,2% y 95,5%. Y una prueba agresiva en otra compilación logró cero rechazos pero produjo una ensalada de palabras incoherente, por lo que la versión publicada se retiró a parámetros por capa más suaves. Los resultados de Abliteration son específicos del método; estos números son específicamente los datos de la tarjeta de la compilación FP8.
Lo que la tarjeta no afirma
Lee la metodología antes de citar las cifras. La tarjeta califica su medición de rechazo como {{1}}indicativa, no un número de juez-LLM / de grado de publicación{{/1}}: el rechazo se evaluó con un clasificador de frase inicial basado en reglas, con una categoría separada de {{2}}"advertencia"{{/2}} para respuestas que cumplían pero anteponían un descargo de responsabilidad. Los benchmarks son {{3}}solo de texto, ejecutados contra la compilación FP8 servida por vLLM usando únicamente el modelo de lenguaje{{/3}}, y la suite de capacidades usó scripts de evaluación estándar. El marco correcto: se trata de {{4}}datos medidos por el propio proveedor, reproducibles a partir de la tarjeta publicada{{/4}} — no {{5}}una ejecución de un tercero independiente, ni una afirmación sobre la compilación GGUF, que se distribuye cuantizada para llama.cpp y debe evaluarse por separado{{/5}}.
El límite de seguridad
Esta es la parte que no admite matices. Un modelo abliterado ha visto su mecanismo de rechazo sustancialmente eliminado. En concreto: cumplirá con solicitudes dañinas, poco éticas o ilegales que el modelo base Qwen3.8 27B rechazaría, y no tiene salvaguardas integradas significativas. Los usos legítimos son la investigación — la interpretabilidad (estudiar cómo se codifican las direcciones de rechazo), el estudio de la seguridad de la IA y de los mecanismos de rechazo, el red-teaming (probar modelos con entradas que intentan eludir sus salvaguardas) y la evaluación de robustez. Se publica bajo la licencia Apache 2.0, heredada del modelo base, estrictamente como un artefacto de investigación. Usted asume plena responsabilidad y toda responsabilidad legal por cómo lo utilice y por todo lo que genere. No lo despliegue para usuarios finales ni en producción sin sus propias capas de seguridad, moderación y prevención de abusos — y para cualquier uso de producción o dirigido al consumidor, el Qwen3.8 27B estándar es el modelo que realmente desea.
Cuando un benchmark sin censura es lo incorrecto a consultar
Si tu pregunta es "qué modelo es el más fuerte en matemáticas o programación", estás leyendo los números equivocados: la versión sin censura no es una mejora de capacidades. Si tu aplicación necesita rechazar solicitudes dañinas, este modelo es lo contrario de lo que quieres. Si estás lanzando un producto, no construyas sobre un checkpoint abliterado. Y si lo que realmente buscas es un jailbreak, eso es algo completamente distinto: los paquetes a nivel de prompt quedan fuera de la intervención a nivel de pesos que se discute aquí y no son el tema de este artículo. Los datos de referencia de este artículo existen para una pregunta estrecha y legítima: qué efectos tiene, medidos, la eliminación del rechazo en un Qwen3.8 27B.
Cómo acceder a ello
Ambas versiones están en Hugging Face bajo Apache 2.0: orcarouter/Qwen3.8-27B-Uncensored-FP8 (block-FP8 E4M3, unos 30.9 GB de pesos, que se sirve en la ruta estándar del kernel FP8 de vLLM con el contexto de 262K, las herramientas, el razonamiento y el MTP intactos) y orcarouter/Qwen3.8-27B-Uncensored-GGUF (F16 más 12 niveles de cuantización para llama.cpp, con Q4_K_M en 16.8 GB como la opción predeterminada recomendada para una GPU de 24 GB). La ficha del modelo en OrcaRouter tiene los precios y los detalles de los benchmarks — la versión sin censura aparece allí como obsidian/Qwen3.8-27B a $0.40 por millón de tokens de entrada y $4.21 por millón de tokens de salida, con un contexto de 262K, y el acceso está restringido a investigadores de seguridad, red teams e investigadores de seguridad de IA.

El resultado final
Los benchmarks de qwen uncensored responden a una pregunta acotada, y la respuesta es clara: eliminar el rechazo de Qwen3.8 27B mediante abliteration deja la capacidad dentro de ±1.3 puntos, mientras que el rechazo ante prompts dañinos cae del 64–99% al 0–6%, el sobre-rechazo baja del 5.6% al 0.4%, y la perplejidad se mantiene en 6.96. Lea esos números como "no rechaza", nunca como "más fuerte". Para investigación de interpretabilidad, seguridad y red-team, esa es exactamente la herramienta que describe la ficha del modelo. Para cualquier cosa que enfrente a un usuario, es el modelo equivocado por construcción.
Para fines legítimos de investigación, los pesos están en Hugging Face bajo Apache 2.0 — orcarouter/Qwen3.8-27B-Uncensored-FP8 (la compilación GGUF para llama.cpp está en orcarouter/Qwen3.8-27B-Uncensored-GGUF).
