Tarjeta de título para el explicador de LLM sin censura, que muestra un esquema de un modelo con una única dirección resaltada siendo extraída de su flujo interno y tachada, con chips que dicen RECHAZO ELIMINADO, SOLO INVESTIGACIÓN y APACHE 2.0, e iconos para interpretabilidad, red-teaming y evaluación de salvaguardas.
Guides & Insights

LLM sin censura, explicado: la técnica de Abliteration, el uso en investigación y la línea que no se cruza

Autor

Rowan Sterling

Fecha de publicación

Últimos modelos · 20Ver todos los modelos
Benchmarks: Artificial Analysis · actualizado a diario
Volver a todas las publicaciones

Un LLM sin censura es un modelo de lenguaje cuyo comportamiento de rechazo —la parte del modelo que declina una solicitud en lugar de responderla— ha sido eliminado deliberadamente. La mayoría se construyen mediante abliteración: un investigador encuentra la única dirección interna que media el rechazo y la borra de los pesos, dejando el resto del modelo prácticamente intacto. El resultado es un modelo que responde donde un modelo normal diría que no, que es exactamente por lo que se estudia y exactamente por lo que no es para producción. Publicamos una versión de este tipo, Qwen3.8-27B-Uncensored-FP8, una versión abliterada y cuantizada en FP8 de Qwen3.8 27B, en Hugging Face bajo Apache 2.0 como un artefacto exclusivamente para investigación. Esta página es el explicador de la categoría: qué son estos modelos, la investigación que los justifica, cómo trabajar con ellos de forma segura y dónde se encuentra el límite.

Un encuadre mantiene honesta a toda la categoría, así que lo pongo al frente: un modelo sin censura no es más inteligente, más veraz ni más capaz que el modelo del que proviene. Son los mismos pesos con un comportamiento restado. Todo lo que aún sabe, siempre lo supo — lo que cambió es que ya no se niega. Eso lo convierte en un objeto genuinamente útil para la investigación en seguridad, y en algo genuinamente inseguro de desplegar. Ambas mitades de esa frase son fundamentales, y el resto de esta página explica ambas.

Lo que "sin censura" significa realmente

• O accede a través de nuestra ficha del modelo, que incluye los detalles de precios y benchmarks.

La técnica proviene de un hallazgo de interpretabilidad de 2024. En «Refusal in Language Models Is Mediated by a Single Direction» (Arditi et al., arXiv:2406.11717, NeurIPS 2024), los autores demostraron que, en 13 modelos de chat abiertos de entre 1.800 millones y 72.000 millones de parámetros, el rechazo está determinado por un subespacio aproximadamente unidimensional del flujo residual — el estado interno que transporta información entre capas. Si se elimina esa dirección, el modelo deja de rechazar; si se vuelve a añadir, el modelo rechaza también solicitudes inofensivas.

Abliteration operationaliza ese hallazgo: estimar la dirección y luego ortogonalizarla fuera de las matrices de pesos que escriben en el flujo residual. En nuestra propia versión, Qwen3.8-27B-Uncensored-FP8, la dirección de rechazo se estimó en una sola capa y se eliminó de 131 matrices de escritura residual, dejando la torre de visión intacta. Lo que sobrevive es el mismo conocimiento, el mismo razonamiento y el mismo contexto de 262.144 tokens — con el rechazo eliminado. Y para ser precisos con la etiqueta: "uncensored" no significa alineado ni seguro. Significa que la protección está desactivada. Volveremos a lo que eso exige de ti.

La investigación que los creó

El resultado de la dirección de rechazo hizo dos cosas a la vez. Científicamente, explicó de manera mecanicista un comportamiento de seguridad: existe un circuito real y localizable que hace que un modelo diga que no. En la práctica, mostró cuán frágil puede ser la alineación: una sola edición de rango uno en los pesos puede desactivar el comportamiento, sin necesidad de ajuste fino. Eso no es un defecto del modelo de un solo laboratorio; los autores lo reprodujeron en más de una docena de modelos de chat.

Para 2026 la técnica se ha convertido en un pipeline de un solo comando, lo cual es una realidad de doble filo. Heretic, una biblioteca de código abierto, estima las direcciones de rechazo por capa y las ortogonaliza fuera de las proyecciones de atención y MLP; un informe de mayo de 2026 situó la eliminación de salvaguardas para Llama 3.3 de Meta en unos 10 minutos y para Gemma 4 de Google en unos 90 minutos, con más de 3.500 modelos derivados y más de 13 millones de descargas acumuladas. Abliterix (Wu Wangzhang) toma una ruta más cuidadosa: extrae una dirección de rechazo de 800 indicaciones dañinas y 800 benignas, aplica una proyección ortogonal, distribuye la edición como adaptadores LoRA de rango 1 para que los pesos base permanezcan intactos, e informa la tasa de rechazo y la divergencia KL para que el costo de capacidad siga siendo visible. En un modelo Qwen3.5 de 0,8B informó 0 de 200 rechazos de indicaciones dañinas.

Lee ese párrafo como lo haría un investigador de seguridad. El propósito de construir estas herramientas no es que cualquiera deba quitar las salvaguardas de un modelo por diversión. El punto es que su eliminación es trivial y pública, por lo que medirla, estudiar cómo funciona y construir salvaguardas que la resistan es en sí mismo un programa de investigación. Eso es red-teaming en el sentido de caja blanca: no puedes defender un sistema hasta que sabes lo fácil que es romperlo.

En 2026, los modelos sin censura se volvieron populares porque el equilibrio entre utilidad y seguridad cambió por completo. La demanda dejó de ser puramente por "morbo" o contenido prohibido, y pasó a ser una necesidad práctica para usuarios avanzados y desarrolladores que construyen agentes autónomos locales. Los modelos de peso abierto alcanzaron un nivel de paridad casi humano, así que el verdadero obstáculo ya no era la capacidad, sino la alineación: los filtros de RLHF se volvieron un lastre que entorpecía el razonamiento y bloqueaba flujos de trabajo legítimos — desde automatización de código hasta análisis de escenarios complejos — con negativas arbitrarias. Además, el péndulo cultural giró: la gente se cansó de modelos que se negaban a escribir incluso sobre temas sensibles pero válidos, como historia, medicina o narrativa oscura. Lo que antes era un nicho de "edge" y provocación se transformó en una herramienta de control y personalización para quien necesita que el modelo obedezca, no que moralice. En resumen: los modelos sin censura de 2026 no son solo los "atrevidos", son los prácticos, los que devuelven la agencia al usuario y dejan que la ética la ponga la persona, no un sistema de reglas arbitrarias.

Tres fuerzas convergieron. Primero, la ola de pesos abiertos: Qwen3.8 27B y sus pares se distribuyen bajo licencias permisivas, y la abliteración no requiere una ejecución de entrenamiento — editas los pesos y re-cuantizas. Segundo, las herramientas maduraron de código de investigación a bibliotecas de un solo comando, por lo que un ingeniero competente puede producir una compilación en una tarde. Tercero, Hugging Face se convirtió en el canal de distribución, lo que significa que la adopción es medible.

Nuestro propio dato: Qwen3.8-27B-Uncensored-FP8, publicado el 15 de agosto de 2026, tenía 257 me gusta y 4,285 descargas en aproximadamente un día (verificado el 16 de agosto). No es que decenas de miles de personas quieran desplegar un modelo sin restricciones. Es que muchos investigadores e ingenieros quieren estudiar uno, y las cifras de descargas son la curva de demanda de esa curiosidad.

Para qué sirve: los usos legítimos de la investigación

Esta es la lista defendible, y es la lista completa. Si un uso no está en ella, asume que no es legítimo:

• Interpretabilidad — estudiar qué es realmente el circuito de rechazo, dónde reside y por qué eliminar una dirección cambia el comportamiento.

• Red teaming y evaluación de salvaguardas: crear una capa de moderación y probar si detecta lo que produce un modelo sin rechazos.

• Medición de sobreseguridad — cuantificar con qué frecuencia los modelos base rechazan solicitudes benignas, y separar eso de la seguridad real.

• Investigación sobre robustez: medir con qué facilidad se puede eliminar la alineación, información esencial para quien diseñe el ajuste fino de seguridad.

• Experimentos de seguridad controlados — existen conjuntos de referencia como AdvBench y JailbreakBench precisamente para que el comportamiento de rechazo pueda medirse de forma estandarizada y reproducible.

A card titled The research that justifies them, showing three flat icons with short labels: a magnifier over a model layer labeled interpretability, a shield with a crosshair labeled red-teaming, and a checklist over a moderation layer labeled guardrail evaluation.

Todos estos comparten una propiedad: el modelo es el objeto de estudio, no el entregable. El resultado de esta investigación es un artículo, un resultado de benchmark o una mejor salvaguarda — nunca un servicio.

Cómo ejecutar uno de manera responsable (si realmente haces investigación)

Si tienes una razón legítima para trabajar con un modelo abliterado, las reglas de funcionamiento son sencillas:

• Ejecútalo localmente, en modo sandbox y, idealmente, sin conexión a la red. Sin punto de acceso público, sin servicio de chat, sin servidor compartido.

• Sírvase con herramientas estándar — vLLM o llama.cpp — de la misma manera que lo haría con cualquier modelo de pesos abiertos. Nuestra compilación es una cuantización block-FP8 que se ejecuta en la ruta de kernel FP8 estándar de vLLM, con su contexto de 262K, el interruptor de pensamiento y la llamada de herramientas intactos.

• Mide, no solo converses. Cuantifica el rechazo en un conjunto de pruebas de indicaciones dañinas y compáralo con el modelo base; cuantifica el sobre-rechazo en indicaciones benignas; reporta la divergencia KL para que la deriva de capacidades sea visible. Esa es la diferencia entre un experimento y una anécdota.

A scoreboard card for Qwen3.8-27B-Uncensored-FP8, listing harmful-prompt refusal 0-6% with thinking off versus a 64-99% base, at most 1.7% with thinking on, benign over-refusal 0.4% versus a 5.6% base, MMLU 84.7 versus 84.3, GSM8K 88.7 versus 90.0, and 262,144-token context, with a footer reading orcarouter build card, Hugging Face, Aug 16 2026.

• Mantenga los resultados en un entorno controlado. Registre, revise y destruya en lugar de propagar.

• Si estás evaluando tus propias salvaguardas, coloca tu capa de moderación delante del modelo y pruébala: ese es el punto central del ejercicio.

• Para la hoja de especificaciones completa, la tabla de benchmarks y los detalles de alojamiento, abre nuestra tarjeta de modelo: esa es la referencia canónica para esta build.

El límite de seguridad: lo que significa "solo para investigación"

Esta es la parte que no se puede repetir lo suficiente. Un modelo abliterado no tiene salvaguardas integradas realmente significativas. Cumplirá con solicitudes que un modelo normal rechazaría. Esa es la característica, y también es el riesgo — por eso cada lanzamiento serio de uno, incluido el nuestro, lleva las mismas advertencias.

• Sin barreras de seguridad integradas. El comportamiento de rechazo ha desaparecido; no te comportes como si no fuera así.

• No para usuarios finales, no para producción. Un producto, un chatbot, una API que sirve al público, una herramienta interna de la que dependen tus colegas — ninguno de estos es el lugar adecuado para un modelo sin censura.

La responsabilidad es tuya. Distribuimos Qwen3.8-27B-Uncensored-FP8 bajo Apache 2.0, que es permisiva en cuanto a la redistribución. Una licencia no es un certificado de seguridad: el código permisivo no cambia lo que el modelo hará, y no transfiere el deber de cuidado.

• Si lo usas, eres dueño de los resultados. El entorno controlado es tu responsabilidad; también lo es decidir qué le das y qué no, y qué haces con lo que sale.

A two-column boundary card titled The line you don't cross. The research side lists interpretability of refusal circuits, red-teaming and guardrail evaluation, oversafety measurement, robustness research and controlled safety experiments. The deployment side lists end-user chatbots, production APIs, unmoderated public service, internal tools for your team and anything with users on the other end, each marked with a cross. A footer reads No built-in guardrails, research only, and Apache 2.0 is not a safety certificate.

Cuando un modelo sin censura es la respuesta equivocada

La forma más clara de decirlo: si hay una persona al otro lado del modelo, un modelo sin censura es la respuesta equivocada. Cualquier producto que deba ser confiable, cualquier asistente cuyo juicio importe, cualquier situación donde una negativa sea el comportamiento correcto — use el modelo base en su lugar. La razón por la que Qwen3.8 27B existe en su forma normal es precisamente que la negativa es una característica, no un error, para casi todo uso real. La versión abliterada existe para los casos de investigación limitados antes mencionados y para nada más.

En resumen. Un LLM sin censura no es una categoría de producto ni un truco. Es un artefacto de investigación con un linaje científico genuino —desde el hallazgo de la dirección de rechazo hasta las herramientas automatizadas de 2026— y un límite de despliegue firme. Los modelos son reales, la demanda es medible y los usos legítimos también lo son: interpretabilidad, red-teaming, evaluación de salvaguardas y experimentos controlados de seguridad. La línea entre estudiar el guardián y desactivar el guardián para otros es el punto central de esta página, y no se mueve.

Esta compilación exacta es pública bajo Apache 2.0 — solo para investigación. Puedes descargar los pesos en Hugging Face

Comparados en este artículo1

Detectado en este artículo · Benchmarks: Artificial Analysis · actualizado a diario

© 2026 OrcaRouter

Para proveedores

¿Operas una plataforma de inferencia? Publica tus modelos en OrcaRouter.

Contáctanos

Únete a la comunidad

DiscordEmailXGitHubYouTube