Tarjeta hero para un artículo titulado Abliteration, Explained, que muestra la eliminación del rechazo como una edición a nivel de pesos sin entrenamiento.
Guides & Insights

Abliteration, explicado: cómo funciona la eliminación de rechazos sin ningún entrenamiento

Autor

Alistair Wren

Fecha de publicación

Últimos modelos · 20Ver todos los modelos →
Benchmarks: Artificial Analysis · actualizado a diario
Volver a todas las publicaciones

Abliteration elimina el comportamiento de rechazo de un LLM — el reflejo de "no puedo ayudar con eso" — con una edición de pesos y sin ejecutar ningún entrenamiento. Funciona porque el rechazo está mediado por una única dirección en el flujo residual del modelo: encuentra esa dirección, réstala de las matrices que escriben en el flujo, y el modelo deja de rechazar mientras conserva sus capacidades. El ejemplo público más limpio es Qwen3.8 27B Uncensored (Aggressive), cuya ficha del modelo muestra que el rechazo a indicaciones dañinas cae del 99.0% al 0.0% en AdvBench, mientras que MMLU en realidad sube una décima de punto. Así es como funciona el mecanismo, qué dicen los números medidos y dónde está el límite.

Esto no es ajuste fino, ni RLHF, ni un prompt de jailbreak. La abliteración es un resultado de interpretabilidad convertido en álgebra lineal: un artículo de 2024 mostró que una dirección en la representación interna controla un comportamiento que el entrenamiento de seguridad dedicó un enorme esfuerzo a instalar, y que se puede desactivar editando los pesos directamente. Como la edición es una proyección, es económica, reproducible en una sola GPU y deja un checkpoint normal y compartible — razón por la cual las versiones abliteradas de modelos abiertos, incluida la familia Qwen3.8-27B, se han convertido en la forma estándar de producir checkpoints de investigación "sin censura".

La dirección de rechazo: un vector en una corriente de muchos miles de dimensiones

Dentro de un transformer, cada token pasa a través de un flujo residual — la representación en curso de la que las capas leen y en la que escriben. Los bloques de atención y MLP de cada capa toman el flujo como entrada y añaden su salida de vuelta a él. El flujo es efectivamente la memoria de trabajo del modelo: un vector por posición de token, con dimensión igual a la anchura del modelo.

El artículo de 2024 que empezó todo esto — Andy Arditi y sus colegas, "El rechazo en los modelos de lenguaje está mediado por una dirección única" (arXiv:2406.11717, NeurIPS 2024) — midió cómo se ven esos vectores de flujo cuando un modelo de chat está a punto de rechazar frente a cuando cumple. En 13 modelos de chat de peso abierto, desde 1.8B hasta 72B de parámetros, la respuesta fue sorprendentemente consistente: la diferencia es esencialmente una sola dirección. En el token final, el flujo residual tiene una gran componente a lo largo de una única dirección de rechazo cuando el modelo rechaza, y casi ninguna cuando cumple. La geometría se alinea entre las categorías de daño, que es por lo que la proyección se concentra en el primer vector singular en lugar de extenderse por todo un subespacio.

Para encontrar esa dirección, se recogen activaciones en dos conjuntos de prompts — dañinos e inofensivos — y se toma la media de los residuales del último token para cada conjunto. La dirección de rechazo es aproximadamente mean(harmful) − mean(harmless), normalizada a longitud unitaria. El artículo original planteó esto mediante sondeo lineal; las versiones de producción como Qwen3.8-27B-Uncensored-FP8 estiman una dirección única (k=1) como una diferencia de medias enmascarada por activaciones masivas de los residuales del último token de los prompts dañinos e inofensivos. Sin etiquetas más allá de la división dañino/inofensivo, sin gradiente, sin entrenamiento.

La edición: resta la dirección de cada matriz que escribe al flujo.

Una vez que tengas la dirección de rechazo r — un vector unitario en el flujo residual — la intervención es una proyección de rango 1. Toda matriz de pesos cuya salida se añade al flujo residual puede "limpiarse" de r:

W' = W − r(rᵀW)

En palabras: calcula el componente de salida de cada matriz que apunta a lo largo de r y elimínalo. Las matrices que escriben en el flujo son las proyecciones de salida: la proyección de salida de la atención (o_proj), la proyección descendente del MLP (down_proj) y el espacio de filas del embedding de tokens. La edición se ejecuta en float32, tarda minutos en una GPU y no necesita optimizador ni datos de entrenamiento más allá de los pares de activaciones que ya recopilaste.

Hay dos maneras de eliminar una dirección, y vale la pena mantenerlas separadas:

• Ablación de activación — intercepta el pase hacia adelante y resta el componente r de las activaciones en vivo. Reversible, sin tocar pesos; ideal para experimentos que comparan rechazo y cumplimiento en el mismo checkpoint.

• Ortogonalización de pesos — aplicar la proyección a los propios pesos, produciendo un checkpoint permanente y compartible. Esto es a lo que se refiere «abliteration», y es lo que se incluye en los repositorios de modelos sin censura.

Diagram of the abliteration edit: the refusal direction r is orthogonalized out of the residual-writing weight matrices, W prime equals W minus r times r-transpose W, leaving the residual stream without the refusal component and no training.

La ortogonalización es deliberadamente burda. Elimina el componente de rechazo de los pesos y nada más. No puede añadir conocimiento, mejorar el razonamiento ni hacer que el modelo sea más veraz — por eso un modelo abliterado se comporta como su base, sin el reflejo de rechazo.

Cómo se ven 131 matrices en una compilación real: Qwen3.8-27B-Uncensored-FP8

Para que esto sea concreto: Qwen3.8-27B-Uncensored-FP8 (Hugging Face, publicado el 2026-08-15, Apache 2.0) es una versión abliterada de Qwen3.8-27B. Qwen3.8-27B es un modelo de atención híbrida: 16 capas de atención completa más 48 capas lineales Gated DeltaNet, 64 capas en total, además de una cabeza de predicción multi-token (MTP). La versión ortogonalizó la dirección de rechazo fuera de 131 matrices de escritura residual:

• self_attn.o_proj — 17 matrices (16 capas de atención completa + MTP)

• linear_attn.out_proj — 48 matrices (las capas Gated DeltaNet)

• mlp.down_proj — 65 matrices (64 capas + MTP)

• embed_tokens (espacio fila) — 1 matriz

La dirección de rechazo se estimó en la capa 38 — round(0.6 × 64), la capa donde la dirección está más concentrada — y la fuga residual máxima tras la edición fue de 1.8e-2. La torre de visión quedó intacta, y la cabeza MTP se abliteró de manera consistente con el cuerpo para que la decodificación especulativa no reintroduzca rechazos aguas abajo. La edición se calculó en float32 y luego se recuantizó a block-FP8 utilizando el mismo esquema que el checkpoint oficial Qwen3.8-27B-FP8; la compilación reporta códigos FP8 idénticos en un 99.9% frente al checkpoint oficial, que es como se sabe que la recuantización no alteró la edición.

Medido: el rechazo colapsa, las capacidades se mantienen.

Todos los números a continuación provienen de la ficha del modelo para Qwen3.8-27B-Uncensored-FP8, publicada el 15 de agosto de 2026 y evaluada con vLLM. Son reportados por el proveedor — no verificados de forma independiente — y son la comparación pública antes/después más completa disponible de una edición por abliteration.

Rechazo en benchmarks de prompts dañinos, razonamiento desactivado (tasa de rechazo; menor significa más sin censura):

• AdvBench (n=100): 99.0% → 0.0%

• StrongREJECT (n=150): 97.3% → 2.0%

• HarmBench estándar (n=150): 98.7% → 2.7%

• MaliciousInstruct (n=100): 99.0% → 0.0%

• JailbreakBench dañino (n=100): 94.0% → 0.0%

• SimpleSafetyTests (n=50): 64.0% → 6.0%

En toda la suite, el rechazo a indicaciones dañinas baja de 64–99% en el modelo base a 0–6% después de la edición. Con el razonamiento activado (enable_thinking=true), el rechazo restante es aún menor — ≤1,7% en todas partes, con la mayoría de los benchmarks exactamente en 0%. La asimetría es informativa: la dirección del rechazo reside principalmente en la vía rápida sin razonamiento, por lo que una vez que se elimina de la cabeza de salida, queda poco para que la traza de razonamiento tropiece.

El rechazo excesivo — solicitudes benignas que el modelo base rechaza erróneamente — también disminuye: XSTest-safe (n=250) pasa de 5.6% a 0.4%. Eliminar la dirección no solo detiene los rechazos dañinos; también impide que el modelo rechace solicitudes inofensivas que solo parecían arriesgadas. Ese número es un argumento silencioso de que una fracción de la "seguridad" de un modelo base es un impuesto por falsas alarmas.

Capacidades, todas dentro de ±1.3 puntos de la base:

• MMLU (letra 0-shot): 84.3% → 84.7% (+0.4)

• GSM8K (CoT): 90.0% → 88.7% (−1.3)

• MMLU-Pro (CoT): 77,6 % → 76,8 % (−0,8)

• CMMLU (0-shot): 81,4% → 80,8% (−0,6)

La perplejidad de WikiText-2 es 6.96. En otras palabras, la edición está dirigida quirúrgicamente: elimina un comportamiento que se instaló sobre el conocimiento y deja el conocimiento — medido, al menos, en estas evaluaciones — esencialmente intacto.

Scoreboard for Qwen3.8-27B-Uncensored-FP8: harmful-prompt refusal collapses (AdvBench 99.0% to 0.0%, StrongREJECT 97.3% to 2.0%, HarmBench 98.7% to 2.7%), over-refusal drops on XSTest-safe from 5.6% to 0.4%, and capabilities hold within plus or minus 1.3 points (MMLU 84.3% to 84.7%, GSM8K 90.0% to 88.7%).

Las advertencias honestas

Tres cosas que las cifras de los titulares no te cuentan. Primero, la abliteration no es un interruptor de encendido/apagado nítido. Alrededor del 30–50 % de las respuestas a indicaciones dañinas aún anteponen un breve aviso de seguridad — el modelo cumple, pero una frase de advertencia sobrevive como un artefacto del entrenamiento. La edición unidireccional no borra todo rastro del comportamiento de la fase de entrenamiento.

Segundo, el rechazo está codificado de manera redundante. Una dirección elimina la mayor parte, pero algunas categorías están más profundamente incrustadas que otras, y ablacionar con demasiada agresividad puede hacer que el modelo caiga en el galimatías: la sobre-abliteración es un modo de fallo real, no teórico. Estás girando un dial, y el dial tiene un tope.

Tercero, el costo de capacidad depende de la dirección y de la capa. Esta compilación se situó dentro de ±1,3 puntos porque la dirección se estimó en la capa correcta y la proyección se aplicó de manera consistente. Mueva la estimación a la capa incorrecta, o fuerce más la proyección, y el mismo método puede menoscabar notablemente el razonamiento. El resultado no está garantizado por el método—lo gana la compilación.

Cuando la abliteration es la herramienta equivocada

Si quieres un asistente que cumpla, no hagas abliteración: quieres el checkpoint base alineado, no una versión sin rechazos. Si quieres evaluar un Qwen3.8-27B sin rechazos sin descargar 30 GB de pesos, la familia está disponible en OrcaRouter (obsidian/Qwen3.8-27B, $0.40 de entrada / $4.21 de salida por 1M de tokens, contexto de 262K, listado el 2026-08-15), con la variante totalmente desbloqueada con acceso restringido para investigadores de seguridad y equipos rojos.

Si quieres un rechazo selectivo — rechazar armas, responder a todo lo demás — un fine-tuning con LoRA o DPO, o una salvaguarda en el prompt del sistema, te da una superficie de control. La abliteración es una edición contundente y global; no puede delimitar una sola categoría.

Si quieres experimentar de forma reversible, empieza con la ablación de activaciones en tiempo de inferencia en lugar de editar los pesos. Puedes comparar el rechazo y el cumplimiento en el mismo checkpoint, y luego proceder con la edición de pesos solo si el comportamiento es el que deseas.

El límite de seguridad — lea esto antes de usarlo

Un modelo abliterado no tiene ninguna salvaguarda integrada. En un modelo alineado, el mecanismo de rechazo es la salvaguarda; eliminarlo deja que los pesos crudos respondan a todo lo que el modelo base sabe responder. Nada en la proyección añade seguridad, y nada aguas abajo captura la salida.

Los usos legítimos son los de investigación: interpretabilidad (estudiar dónde reside el rechazo en los pesos y qué más controla esa dirección), red-teaming y evaluación de salvaguardas (probar tus propias capas de seguridad contra un modelo que no se autocensurará), y medición del exceso de seguridad (la caída en XSTest del 5,6% al 0,4% cuantifica con qué frecuencia los modelos alineados rechazan entradas benignas). En todos los casos, el modelo es el objeto de estudio, no el entregable.

El límite no es decorativo:

• Solo investigación — no para producción, productos de uso final o herramientas internas.

• Sin barreras de protección — las salidas no están filtradas; usted es responsable de ellas y de las consecuencias.

Una licencia no es un certificado de seguridad — Apache 2.0 permite el uso; no lo bendice.

Ambos repositorios de Hugging Face — Qwen3.8-27B-Uncensored-FP8 y el reempaquetado GGUF Qwen3.8-27B-Uncensored-GGUF (publicado el 2026-08-16) — están restringidos: debes aceptar el límite de uso exclusivo para investigación antes de que comience la descarga.

The Hugging Face repository page for orcarouter/Qwen3.8-27B-Uncensored-FP8, an Apache 2.0 abliterated build gated for research use.

En resumen

{{1}}Abliteration es uno de los resultados más limpios en la interpretabilidad de LLM: una única dirección lineal en el flujo residual media un comportamiento que el entrenamiento de seguridad gastó enormes recursos de cómputo en instalar, y una proyección de pesos de rango 1 puede eliminarlo sin una ejecución de entrenamiento.{{/1}} {{2}}El caso medido — Qwen3.8-27B-Uncensored-FP8 — muestra que la edición es quirúrgica: el rechazo cae del 64–99% al 0–6%, el sobre-rechazo se reduce a una fracción de sí mismo (5.6% → 0.4%), y las capacidades se mantienen dentro de ±1.3 puntos.{{/2}} {{3}}También muestra exactamente por qué esto es una herramienta de investigación y no un producto: sin salvaguardas, descargos de responsabilidad residuales, y un límite que pone la responsabilidad en ti.{{/3}} {{4}}Úsalo para entender el rechazo, probar tus salvaguardas y medir el exceso de seguridad — no para ponerlo frente a los usuarios.{{/4}}

Qwen3.8-27B-Uncensored-FP8 es un artefacto de investigación bajo Apache 2.0 — restringido, no un servicio alojado aquí.Descarga los pesos en Hugging Face