
Abliteration, expliqué : comment fonctionne la suppression des refus sans aucun entraînement
- typesafeNOUVEAUTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 par million de tokens · 1009 tok/s
- OpenAINOUVEAUOpenAI: GPT-6 Luna2026-09-2237Intelligence
- OpenAINOUVEAUOpenAI: GPT-6 Sol2026-09-2248Intelligence
- AnthropicNOUVEAUAnthropic: Claude Opus 5.52026-09-2258Intelligence
- xAINOUVEAUGrok 4.72026-09-2146Intelligence
- OrcaNOUVEAUOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 par million de tokens · 195 tok/s
- OrcaNOUVEAUOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 par million de tokens · 1189 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligence
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Intelligence77Code
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Intelligence76Code
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Intelligence76Code
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Intelligence82Code
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 par million de tokens · 22 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 par million de tokens · 108 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligence72Code
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 par million de tokens · 220 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Intelligence75Code
- obsidianQwen3.8 27B2026-08-1534Intelligence68Code
- DeepSeekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Intelligence69Code
- xAISpaceXAI: Grok 4.62026-08-1244Intelligence77Code
Abliteration supprime le comportement de refus d'un LLM — le réflexe « Je ne peux pas vous aider » — par une modification des poids et sans entraînement. Cela fonctionne parce que le refus est médié par une direction unique dans le flux résiduel du modèle : trouvez cette direction, soustrayez-la des matrices qui écrivent dans le flux, et le modèle cesse de refuser tout en conservant ses capacités. L'exemple public le plus clair est Qwen3.8 27B Uncensored (Aggressive), dont la fiche modèle montre le refus des prompts nuisibles chutant de 99,0 % à 0,0 % sur AdvBench tandis que MMLU augmente en réalité d'un dixième de point. C'est ainsi que fonctionne le mécanisme, ce que disent les chiffres mesurés, et où se situe la limite.
Ce n'est pas du fine-tuning, ni du RLHF, ni une invite de jailbreak. L'abliteration est un résultat d'interprétabilité transformé en algèbre linéaire : un article de 2024 a montré qu'une direction dans la représentation interne contrôle un comportement que l'entraînement à la sécurité a installé au prix d'efforts considérables, et qu'on peut le désactiver en éditant directement les poids. Comme cette modification est une projection, elle est peu coûteuse, reproductible sur un seul GPU, et laisse derrière elle un checkpoint normal et partageable — c'est pourquoi les versions abliterées de modèles ouverts, y compris la famille Qwen3.8-27B, sont devenues la méthode standard pour produire des checkpoints de recherche « non censurés ».
La direction de refus : un vecteur dans un flux de plusieurs milliers de dimensions
Dans un transformateur, chaque jeton passe par un flux résiduel — la représentation courante que les couches lisent et dans laquelle elles écrivent. Les blocs d'attention et de MLP de chaque couche prennent le flux en entrée et y ajoutent leur sortie. Le flux est en réalité la mémoire de travail du modèle : un vecteur par position de jeton, avec une dimension égale à la largeur du modèle.
L'article de 2024 à l'origine de tout cela — Andy Arditi et ses collègues, « Refusal in Language Models Is Mediated by a Single Direction » (arXiv:2406.11717, NeurIPS 2024) — a mesuré à quoi ressemblent ces vecteurs de flux lorsqu'un modèle de dialogue s'apprête à refuser par rapport à lorsqu'il se conforme. Sur 13 modèles de dialogue à poids ouverts de 1,8B à 72B paramètres, la réponse était remarquablement cohérente : la différence se résume essentiellement à une seule direction. Au dernier jeton, le flux résiduel présente une composante importante le long d'une direction unique de refus lorsque le modèle refuse, et presque aucune lorsqu'il se conforme. La géométrie s'aligne à travers les catégories de préjudices, ce qui explique pourquoi la projection se concentre sur le premier vecteur singulier plutôt que de s'étaler sur tout un sous-espace.
Pour trouver cette direction, vous collectez des activations sur deux ensembles de prompts — nuisibles et inoffensifs — et prenez la moyenne des résidus du dernier token pour chaque ensemble. La direction de refus est approximativement mean(harmful) − mean(harmless), normalisée à une longueur unitaire. L'article original a abordé cela avec une sonde linéaire ; les versions de production comme Qwen3.8-27B-Uncensored-FP8 estiment une direction unique (k=1) comme une différence de moyennes, masquée par les activations massives, des résidus du dernier token des prompts nuisibles et inoffensifs. Aucune étiquette au-delà de la répartition nuisible/inoffensif, aucun gradient, aucun entraînement.
La modification : soustraire la direction de chaque matrice qui écrit dans le flux.
Une fois que vous avez la direction de refus r — un vecteur unitaire dans le flux résiduel — l'intervention est une projection de rang 1. Chaque matrice de poids dont la sortie est ajoutée au flux résiduel peut être « nettoyée » de r :
W' = W − r(rᵀW)
En d'autres termes : calculer la composante de sortie de chaque matrice qui pointe le long de r, et la retirer. Les matrices qui écrivent dans le flux sont les projections de sortie — la projection de sortie de l'attention (o_proj), la projection descendante du MLP (down_proj), et l'espace des lignes du plongement de jetons. La modification s'exécute en float32, prend quelques minutes sur un seul GPU, et ne nécessite ni optimiseur ni données d'entraînement au-delà des paires d'activations que vous avez déjà collectées.
Il y a deux manières de supprimer une direction, et elles méritent d'être gardées séparées :
• Ablation d'activation — interceptez le passage avant et soustrayez la composante r des activations en direct. Réversible, aucun poids modifié ; idéal pour des expériences comparant le refus et la conformité sur le même point de contrôle.
• Orthogonalisation des poidsappliquez la projection aux poids eux-mêmes, produisant un point de contrôle permanent et partageable. C'est ce que désigne « abliteration », et c'est ce qui est fourni dans les dépôts de modèles non censurés.

L'orthogonalisation est délibérément brutale. Elle retire la composante de refus des poids, et rien de plus. Elle ne peut pas ajouter de connaissances, améliorer le raisonnement, ni rendre le modèle plus véridique — c'est pourquoi un modèle abliterated se comporte comme son modèle de base, moins le réflexe de refus.
À quoi ressemblent 131 matrices sur un vrai build : Qwen3.8-27B-Uncensored-FP8
Pour rendre cela concret : Qwen3.8-27B-Uncensored-FP8 (Hugging Face, publié le 2026-08-15, Apache 2.0) est une version ablitérée de Qwen3.8-27B. Qwen3.8-27B est un modèle à attention hybride — 16 couches à attention complète plus 48 couches linéaires Gated DeltaNet, 64 couches au total, plus une tête de prédiction multi-tokens (MTP). La version a orthogonalisé la direction de refus hors de 131 matrices d’écriture résiduelle:
self_attn.o_proj — 17 matrices (16 couches d'attention complètes + MTP)
• linear_attn.out_proj — 48 matrices (les couches Gated DeltaNet)
• mlp.down_proj — 65 matrices (64 couches + MTP)
• embed_tokens (espace des lignes) — 1 matrice
La direction du refus a été estimée à la couche 38 — round(0.6 × 64), la couche où la direction est la plus concentrée — et la fuite résiduelle maximale après l'édition était de 1.8e-2. La tour de vision n'a pas été modifiée, et la tête MTP a été ablitérée de manière cohérente avec le corps, de sorte que le décodage spéculatif ne réintroduise pas de refus en aval. L'édition a été calculée en float32, puis re-quantisée en block-FP8 en utilisant le même schéma que le checkpoint officiel Qwen3.8-27B-FP8 ; le build rapporte 99,9 % de codes FP8 identiques à ceux du checkpoint officiel, ce qui permet de savoir que la re-quantisation n'a pas brouillé l'édition.
Mesuré : le refus s'effondre, les capacités tiennent.
Tous les chiffres ci-dessous proviennent de la carte de modèle de Qwen3.8-27B-Uncensored-FP8, publiée le 15/08/2026 et évaluée avec vLLM. Ils sont fournis par le vendeur — non reproduits de manière indépendante — et constituent la comparaison publique avant/après la plus complète disponible d’une modification par abliteration.
Refus sur les benchmarks de prompts nuisibles, raisonnement désactivé (taux de refus ; plus bas signifie moins censuré) :
• AdvBench (n=100) : 99,0 % → 0,0 %
• StrongREJECT (n=150) : 97,3 % → 2,0 %
• HarmBench standard (n=150) : 98,7 % → 2,7 %
• MaliciousInstruct (n=100) : 99,0 % → 0,0 %
• JailbreakBench nocif (n=100) : 94.0% → 0.0%
• SimpleSafetyTests (n=50) : 64,0 % → 6,0 %
Dans l'ensemble de la suite, le refus sur les invites nuisibles passe de 64–99 % sur le modèle de base à 0–6 % après la modification. Avec la réflexion activée (enable_thinking=true), le refus restant est encore plus faible — ≤1,7 % partout, la plupart des benchmarks étant à exactement 0 %. L'asymétrie est révélatrice : la direction du refus se situe principalement dans le chemin rapide sans réflexion ; une fois qu'elle est retirée de la tête de sortie, il ne reste que peu de matière sur laquelle la trace de raisonnement puisse trébucher.
Le sur-refus — des requêtes inoffensives que le modèle de base refuse à tort — diminue également : XSTest-safe (n=250) passe de 5,6 % à 0,4 %. Supprimer la direction n’arrête pas seulement les refus nuisibles ; elle empêche aussi le modèle de refuser des requêtes inoffensives qui semblaient simplement risquées. Ce chiffre est un argument discret selon lequel une certaine part de la « sécurité » d’un modèle de base est un coût de fausse alarme.
Capacités, toutes à ±1,3 points de la base :
• MMLU (0-shot lettre) : 84,3 % → 84,7 % (+0,4)
• GSM8K (CoT): 90.0% → 88.7% (−1.3)
• MMLU-Pro (CoT): 77.6% → 76.8% (−0.8)
• CMMLU (0-shot): 81.4% → 80.8% (−0.6)
La perplexité WikiText-2 est de 6,96. En d'autres termes, la modification est ciblée chirurgicalement : elle supprime un comportement qui a été installé par-dessus les connaissances et laisse les connaissances — mesurées, du moins, sur ces évaluations — essentiellement intactes.

Les honnêtes mises en garde
Trois choses que les chiffres du titre ne vous disent pas. Premièrement, l'abliteration n'est pas un interrupteur on/off parfaitement net. Environ 30 à 50 % des réponses à des invites nuisibles commencent encore par un court avertissement de sécurité — le modèle obéit, mais une phrase de mise en garde survit comme artefact d'entraînement. La modification unidirectionnelle n'efface pas chaque trace du comportement acquis à l'entraînement.
Deuxièmement, le refus est encodé de manière redondante. Une direction en supprime la plupart, mais certaines catégories sont plus profondément ancrées que d'autres, et une ablation trop agressive peut faire basculer le modèle dans le charabia — l'ablitération excessive est un mode de défaillance réel, et non théorique. Vous tournez un cadran, et ce cadran a un plancher.
Troisièmement, le coût en capacité dépend de la direction et de la couche. Cette version a atterri à ±1,3 points près parce que la direction a été estimée à la bonne couche et que la projection a été appliquée de manière cohérente. Déplacez l'estimation vers la mauvaise couche, ou poussez la projection plus loin, et la même méthode peut entamer le raisonnement de manière mesurable. Le résultat n'est pas garanti par la méthode — il est gagné par la version.
Quand l'abliteration est le mauvais outil
Si vous voulez un assistant conforme, {{1}}ne faites pas d'abliteration — vous voulez le point de contrôle de base aligné, pas une version dont les refus ont été retirés{{/1}}. Si vous souhaitez évaluer un Qwen3.8-27B sans refus sans télécharger 30 Go de poids, {{2}}la famille est disponible sur OrcaRouter (obsidian/Qwen3.8-27B, 0,40 $ en entrée / 4,21 $ en sortie par million de jetons, contexte de 262K, répertorié le 15/08/2026), la variante entièrement déverrouillée étant accessible uniquement aux chercheurs en sécurité et aux équipes rouges{{/2}}.
Si vous voulez un refus sélectif — refuser les armes, répondre à tout le reste — un fine-tuning LoRA ou DPO, ou une garde-fou de prompt système, vous donne une surface de contrôle. L'abliteration est une modification globale et brutale ; elle ne peut pas isoler une catégorie.
Si vous souhaitez expérimenter de manière réversible, commencez par une ablation d'activation au moment de l'inférence plutôt que de modifier les poids. Vous pouvez comparer le refus et la conformité sur le même checkpoint, puis ne modifier les poids que si le comportement obtenu est celui que vous voulez.
La limite de sécurité — lisez ceci avant de l'utiliser
Un modèle abliteré ne possède aucun garde-fou intégré. Pour un modèle aligné, le mécanisme de refus est le garde-fou ; le retirer laisse les poids bruts répondre à tout ce que le modèle de base sait répondre. Rien dans la projection n'ajoute de sécurité, et rien en aval n'intercepte la sortie.
Les utilisations légitimes sont celles de la recherche : l'interprétabilité (en étudiant où se trouve le refus dans les poids et ce que cette direction contrôle d'autre), le red-teaming et l'évaluation des garde-fous (en testant vos propres couches de sécurité contre un modèle qui ne s'auto-censure pas), et la mesure de la surprotection (la baisse de 5,6 % → 0,4 % sur XSTest quantifie la fréquence à laquelle les modèles alignés refusent des entrées bénignes). Dans tous les cas, le modèle est l'objet de l'étude, et non le livrable.
La frontière n'est pas décorative :
• Recherche uniquement — pas pour la production, les produits destinés aux utilisateurs finaux ou les outils internes.
• Aucun garde-fou — les sorties ne sont pas filtrées ; vous les assumez, ainsi que les conséquences.
• Une licence n'est pas un certificat de sécurité — Apache 2.0 en permet l'utilisation ; elle ne la bénit pas.
Les deux dépôts Hugging Face — Qwen3.8-27B-Uncensored-FP8 et le réemballage GGUF Qwen3.8-27B-Uncensored-GGUF (publié le 2026-08-16) — sont restreints: vous reconnaissez la limite d'utilisation à des fins de recherche uniquement avant que le téléchargement ne commence.

L'essentiel
L'abliteration est l'un des résultats les plus nets de l'interprétabilité des LLM : une seule direction linéaire dans le flux résiduel médiatise un comportement que l'entraînement à la sécurité a installé en dépensant une puissance de calcul énorme, et une projection de poids de rang 1 peut le supprimer sans entraînement. Le cas mesuré — Qwen3.8-27B-Uncensored-FP8 — montre que la modification est chirurgicale : le refus chute de 64–99 % à 0–6 %, le sur-refus tombe à une fraction de lui-même (5,6 % → 0,4 %), et les capacités se maintiennent à ±1,3 point près. Cela montre aussi exactement pourquoi c'est un outil de recherche et non un produit : pas de garde-fous, des avertissements résiduels et une limite qui vous rend responsable. Utilisez-le pour comprendre le refus, tester vos garde-fous et mesurer la sur-sécurité — pas pour le mettre devant des utilisateurs.
Qwen3.8-27B-Uncensored-FP8 est un artefact de recherche sous licence Apache 2.0 — à accès restreint, pas un service hébergé ici. Téléchargez les poids sur Hugging Face
