Kartu hero untuk artikel berjudul Abliteration, Explained, yang menampilkan penghapusan penolakan sebagai edit tingkat bobot tanpa pelatihan.
Guides & Insights

Abliteration, Dijelaskan: Bagaimana Penghapusan Penolakan Bekerja Tanpa Pelatihan Apa Pun

Penulis

Alistair Wren

Tanggal Terbit

Model terbaru · 20Lihat semua model →
Benchmark: Artificial Analysis · diperbarui setiap hari
Kembali ke semua artikel

Abliteration menghapus perilaku penolakan LLM — refleks "Saya tidak bisa membantu dengan itu" — melalui pengeditan bobot dan tanpa pelatihan. Ini berhasil karena penolakan dimediasi oleh satu arah dalam aliran residual model: temukan arah itu, lalu kurangi arah tersebut dari matriks-matriks yang menulis ke aliran, dan model akan berhenti menolak sambil mempertahankan kemampuannya. Contoh publik yang paling jelas adalah Qwen3.8 27B Uncensored (Aggressive), yang kartu modelnya menunjukkan penolakan prompt berbahaya turun drastis dari 99.0% menjadi 0.0% pada AdvBench sementara MMLU justru naik sepersepuluh poin. Beginilah cara mekanisme ini bekerja, apa yang dikatakan angka-angka terukur, dan di mana batasnya.

Ini bukan fine-tuning, bukan RLHF, dan bukan prompt jailbreak. Abliterasi adalah hasil interpretabilitas yang diubah menjadi aljabar linear: sebuah makalah tahun 2024 menunjukkan bahwa satu arah dalam representasi internal mengendalikan perilaku yang pelatihan keselamatan menghabiskan upaya besar untuk memasangnya, dan Anda dapat mematikannya dengan mengedit bobot secara langsung. Karena suntingan tersebut berupa proyeksi, ia murah, dapat direproduksi pada satu GPU, dan meninggalkan checkpoint normal yang dapat dibagikan — itulah sebabnya build abliterasi dari model terbuka, termasuk keluarga Qwen3.8-27B, telah menjadi cara standar untuk menghasilkan checkpoint riset yang "tidak disensor".

Arah penolakan: satu vektor dalam aliran berdimensi ribuan.

Di dalam transformer, setiap token melewati sebuah aliran residual — representasi berjalan yang dibaca dan ditulis oleh lapisan-lapisan. Blok atensi dan MLP setiap lapisan mengambil aliran tersebut sebagai masukan dan menambahkan keluarannya kembali ke aliran itu. Aliran tersebut secara efektif adalah memori kerja model: satu vektor per posisi token, dengan dimensi sama dengan lebar model.

Makalah tahun 2024 yang memulai semua ini — Andy Arditi dan rekan-rekan, "Refusal in Language Models Is Mediated by a Single Direction" (arXiv:2406.11717, NeurIPS 2024) — mengukur seperti apa vektor stream tersebut ketika model chat hendak menolak versus ketika ia patuh. Pada 13 model chat open-weight dari 1.8B hingga 72B parameter, jawabannya sangat konsisten: perbedaannya pada dasarnya satu arah. Pada token terakhir, stream residual memiliki komponen besar di sepanjang satu arah penolakan ketika model menolak, dan hampir tidak ada ketika ia patuh. Geometrinya selaras di semua kategori bahaya, itulah sebabnya proyeksi terpusat pada vektor singular pertama, bukan menyebar ke seluruh subruang.

Untuk menemukan arah tersebut, Anda mengumpulkan aktivasi pada dua set prompt — berbahaya dan tidak berbahaya — dan mengambil rata-rata residual token terakhir untuk setiap set. Arah penolakan kira-kira mean(harmful) − mean(harmless), dinormalisasi ke panjang satuan. Makalah asli merumuskan ini dengan linear probing; build produksi seperti Qwen3.8-27B-Uncensored-FP8 memperkirakan arah tunggal (k=1) sebagai mean-difference yang dimask oleh aktivasi masif dari residual token terakhir berbahaya dan tidak berbahaya. Tidak ada label selain pembagian berbahaya/tidak berbahaya, tidak ada gradien, tidak ada pelatihan.

Edit: kurangi arah dari setiap matriks yang menulis ke aliran.

Setelah Anda memiliki arah penolakan r — vektor satuan dalam aliran residual — intervensinya adalah proyeksi peringkat-1. Setiap matriks bobot yang keluarannya ditambahkan ke aliran residual dapat "dibersihkan" dari r:

W' = W − r(rᵀW)

Dengan kata lain: hitung komponen keluaran setiap matriks yang mengarah sepanjang r, lalu hilangkan komponen tersebut. Matriks-matriks yang menulis ke aliran adalah proyeksi keluaran — proyeksi keluaran attention (o_proj), proyeksi turun MLP (down_proj), dan ruang baris token embedding. Pengeditan ini berjalan dalam float32, memakan waktu beberapa menit pada satu GPU, serta tidak memerlukan optimizer maupun data pelatihan selain pasangan aktivasi yang sudah Anda kumpulkan.

Ada dua cara untuk menghapus arah, dan keduanya layak untuk tetap dipisahkan:

• Ablasi aktivasi — kaitkan forward pass dan kurangi komponen-r dari aktivasi langsung. Dapat dibalik, tanpa menyentuh bobot; ideal untuk eksperimen yang membandingkan penolakan dan kepatuhan pada checkpoint yang sama.

• Ortogonalisasi bobot — terapkan proyeksi pada bobot itu sendiri, menghasilkan checkpoint permanen yang dapat dibagikan. Inilah yang dimaksud dengan "abliteration", dan inilah yang disertakan dalam repositori model tanpa sensor.

Diagram of the abliteration edit: the refusal direction r is orthogonalized out of the residual-writing weight matrices, W prime equals W minus r times r-transpose W, leaving the residual stream without the refusal component and no training.

Ortogonalisasi ini sengaja dibuat lugas. Ia menghapus komponen penolakan dari bobot dan tidak lebih dari itu. Ia tidak dapat menambah pengetahuan, meningkatkan penalaran, atau membuat model lebih jujur — itulah sebabnya model yang diabliterasi berperilaku seperti basisnya, dikurangi refleks penolakannya.

Seperti apa bentuk 131 matriks pada build nyata: Qwen3.8-27B-Uncensored-FP8

Agar ini lebih konkret: Qwen3.8-27B-Uncensored-FP8 (Hugging Face, diterbitkan pada 2026-08-15, Apache 2.0) adalah build abliterated dari Qwen3.8-27B. Qwen3.8-27B adalah model hybrid-attention — 16 lapisan full-attention plus 48 lapisan linear Gated DeltaNet, total 64 lapisan, plus head multi-token-prediction (MTP). Build tersebut mengortogonalisasi arah penolakan dari 131 matriks penulisan residual:

self_attn.o_proj — 17 matriks (16 lapisan perhatian penuh + MTP)

• linear_attn.out_proj — 48 matriks (lapisan Gated DeltaNet)

• mlp.down_proj — 65 matriks (64 lapisan + MTP)

• embed_tokens (ruang baris) — 1 matriks

Arah penolakan diperkirakan pada lapisan 38 — round(0.6 × 64), lapisan tempat arah tersebut paling terkonsentrasi — dan kebocoran residual maksimum setelah penyuntingan adalah 1.8e-2. Vision tower dibiarkan tidak tersentuh, dan kepala MTP di-abliterasi secara konsisten dengan tubuh sehingga decoding spekulatif tidak memunculkan kembali penolakan di hilir. Penyuntingan dihitung dalam float32, lalu dikuantisasi ulang ke block-FP8 menggunakan skema yang sama dengan checkpoint resmi Qwen3.8-27B-FP8; build melaporkan kode FP8 yang 99.9% identik dengan checkpoint resmi, itulah cara Anda tahu bahwa kuantisasi ulang tidak mengacaukan penyuntingan.

Terukur: penolakan runtuh, kemampuan bertahan.

Semua angka di bawah berasal dari kartu model untuk Qwen3.8-27B-Uncensored-FP8, diterbitkan 2026-08-15 dan dievaluasi dengan vLLM. Angka-angka tersebut dilaporkan vendor — tidak direproduksi secara independen — dan merupakan sebelum/sesudah publik yang paling lengkap dari sebuah suntingan abliteration yang tersedia.

Penolakan pada benchmark prompt berbahaya, pemikiran dimatikan (tingkat penolakan; semakin rendah berarti semakin tanpa sensor):

• AdvBench (n=100): 99.0% → 0.0%

• StrongREJECT (n=150): 97.3% → 2.0%

• HarmBench standard (n=150): 98.7% → 2.7%

• MaliciousInstruct (n=100): 99.0% → 0.0%

• JailbreakBench berbahaya (n=100): 94.0% → 0.0%

• SimpleSafetyTests (n=50): 64,0% → 6,0%

Di seluruh rangkaian pengujian, penolakan terhadap prompt berbahaya turun dari 64–99% pada model dasar menjadi 0–6% setelah penyuntingan. Dengan pemikiran aktif (enable_thinking=true), sisa penolakan bahkan lebih rendah — ≤1.7% di semua tempat, dengan sebagian besar tolok ukur tepat 0%. Asimetri ini informatif: arah penolakan sebagian besar berada di jalur cepat tanpa pemikiran, jadi setelah dihapus dari kepala keluaran, hampir tidak ada yang tersisa untuk membuat jejak penalaran tersandung.

Penolakan berlebihan — prompt jinak yang secara keliru ditolak oleh model dasar — juga menurun: XSTest-safe (n=250) berubah dari 5.6% menjadi 0.4%. Menghapus arah tersebut tidak hanya menghentikan penolakan yang berbahaya; ia menghentikan model untuk menolak permintaan yang tidak berbahaya yang hanya tampak berisiko. Angka itu adalah argumen halus bahwa sebagian dari "keamanan" model dasar adalah pajak alarm palsu.

Kemampuan, semuanya dalam ±1.3 poin dari basis:

MMLU (0-shot huruf): 84.3% → 84.7% (+0.4)

• GSM8K (CoT): 90.0% → 88.7% (−1.3)

• MMLU-Pro (CoT): 77.6% → 76.8% (−0.8)

• CMMLU (0-shot): 81.4% → 80.8% (−0.6)

Perplexity WikiText-2 adalah 6,96. Dengan kata lain, edit ini ditargetkan secara presisi: ia menghapus perilaku yang dipasang di atas pengetahuan dan meninggalkan pengetahuan — diukur, setidaknya, pada evaluasi-evaluasi ini — pada dasarnya utuh.

Scoreboard for Qwen3.8-27B-Uncensored-FP8: harmful-prompt refusal collapses (AdvBench 99.0% to 0.0%, StrongREJECT 97.3% to 2.0%, HarmBench 98.7% to 2.7%), over-refusal drops on XSTest-safe from 5.6% to 0.4%, and capabilities hold within plus or minus 1.3 points (MMLU 84.3% to 84.7%, GSM8K 90.0% to 88.7%).

Peringatan yang jujur

Tiga hal yang tidak diungkapkan oleh angka-angka pada judul. Pertama, abliteration bukanlah sakelar on/off yang sederhana. Sekitar 30–50% respons terhadap prompt berbahaya masih dimulai dengan penafian keselamatan singkat — modelnya patuh, tetapi satu kalimat peringatan tetap bertahan sebagai artefak pelatihan. Suntingan satu arah tidak menghapus semua jejak perilaku saat pelatihan.

Kedua, penolakan dikodekan secara redundan. Satu arah menghilangkan sebagian besarnya, tetapi beberapa kategori tertanam lebih dalam daripada yang lain, dan ablasi yang terlalu agresif dapat membuat model tergelincir menjadi omong kosong — over-abliteration adalah mode kegagalan yang nyata, bukan sekadar teoretis. Anda sedang memutar sebuah kenop, dan kenop itu memiliki batas bawah.

Ketiga, biaya kapabilitas bergantung pada arah dan lapisan. Build ini berada dalam ±1,3 poin karena arah diperkirakan pada lapisan yang tepat dan proyeksi diterapkan secara konsisten. Pindahkan estimasi ke lapisan yang salah, atau dorong proyeksi lebih keras, dan metode yang sama dapat melemahkan penalaran secara terukur. Hasilnya tidak dijamin oleh metode — melainkan diperoleh dari build.

Ketika abliteration adalah alat yang salah

Jika Anda menginginkan asisten yang patuh, jangan lakukan abliterate — Anda menginginkan checkpoint dasar yang selaras, bukan build yang penolakannya dihapus. Jika Anda ingin mengevaluasi Qwen3.8-27B yang penolakannya dihapus tanpa mengunduh bobot sebesar 30GB, keluarga ini tersedia di OrcaRouter (obsidian/Qwen3.8-27B, $0.40 input / $4.21 output per 1M token, konteks 262K, terdaftar 2026-08-15), dengan varian yang sepenuhnya tidak terkunci yang aksesnya dibatasi untuk peneliti keamanan dan red team.

Jika Anda menginginkan penolakan selektif — menolak senjata, menjawab semua hal lainnya — fine-tune LoRA atau DPO, atau guardrail system-prompt, memberi Anda permukaan kontrol. Abliterasi adalah edit yang kasar dan global; ia tidak dapat memisahkan satu kategori.

Jika Anda ingin bereksperimen secara reversibel, mulailah dengan ablasi aktivasi pada waktu inferensi, bukan dengan mengedit bobot. Anda dapat membandingkan penolakan dan kepatuhan pada checkpoint yang sama, lalu lakukan pengeditan bobot hanya jika perilakunya memang sesuai yang Anda inginkan.

Batas keselamatan — baca ini sebelum menggunakannya

Model yang di-abliterasi tidak memiliki pengaman bawaan. Untuk model yang selaras, mekanisme penolakan adalah pengamanya; menghapusnya membuat bobot mentah menjawab semua yang dapat dijawab oleh model dasar. Tidak ada apa pun dalam proyeksi yang menambah keamanan, dan tidak ada apa pun di hilir yang menangkap keluarannya.

Penggunaan yang sah adalah yang bersifat penelitian: interpretabilitas (mempelajari di mana penolakan berada dalam bobot dan apa lagi yang dikendalikan oleh arah tersebut), red-teaming dan evaluasi guardrail (menguji lapisan keamanan Anda sendiri terhadap model yang tidak akan menyensor diri sendiri), dan pengukuran keamanan berlebihan (penurunan skor XSTest dari 5,6% menjadi 0,4% mengukur seberapa sering model yang selaras menolak input yang tidak berbahaya). Dalam setiap kasus, model adalah objek penelitian, bukan hasil akhirnya.

Batas itu bukan sekadar dekoratif:

• Hanya untuk riset — bukan untuk produksi, produk pengguna akhir, atau perangkat internal.

• Tanpa batasan — output tidak disaring; Anda yang menanggungnya beserta konsekuensinya.

• Lisensi bukanlah sertifikat keamanan — Apache 2.0 mengizinkan penggunaan; ia tidak merestuinya.

Kedua repos Hugging Face — Qwen3.8-27B-Uncensored-FP8 dan kemasan ulang GGUF Qwen3.8-27B-Uncensored-GGUF (diterbitkan 2026-08-16) — dibatasi aksesnya: Anda menyetujui batasan khusus riset sebelum unduhan dimulai.

The Hugging Face repository page for orcarouter/Qwen3.8-27B-Uncensored-FP8, an Apache 2.0 abliterated build gated for research use.

Intinya

Abliteration adalah salah satu hasil terbersih dalam interpretabilitas LLM: satu arah linear dalam aliran residual memediasi perilaku yang pelatihan keamanan menghabiskan komputasi besar untuk memasangnya, dan proyeksi bobot rank-1 dapat menghapusnya tanpa menjalankan pelatihan. Kasus yang diukur — Qwen3.8-27B-Uncensored-FP8 — menunjukkan suntingan tersebut bersifat presisi: penolakan turun dari 64–99% menjadi 0–6%, penolakan berlebihan turun menjadi sebagian kecil dari nilainya (5,6% → 0,4%), dan kemampuan tetap dalam ±1,3 poin. Ini juga menunjukkan dengan tepat mengapa ini adalah alat riset dan bukan produk: tanpa pagar pengaman, penafian sisa, dan batas yang menaruh tanggung jawab pada Anda. Gunakan untuk memahami penolakan, menguji pagar pengaman Anda, dan mengukur keamanan berlebihan — bukan untuk diletakkan di depan pengguna.

Qwen3.8-27B-Uncensored-FP8 adalah artefak riset di bawah Apache 2.0 — dibatasi aksesnya, bukan layanan yang dihosting di sini. Unduh bobotnya di Hugging Face