
LLM Tanpa Sensor, Dijelaskan: Teknik Abliterasi, Penggunaan dalam Riset, dan Garis yang Tidak Boleh Anda Lewati
- obsidianBARUQwen3.8 27B Uncensored (Aggressive)2026-08-1552Kecerdasan68Koding
- qwenBARUQwen: Qwen3.8 27B (free)2026-08-1354 tok/s
- deepseekBARUDeepSeek: DeepSeek V4 Pro 08132026-08-1253Kecerdasan69Koding
- grokBARUSpaceXAI: Grok 4.62026-08-1261Kecerdasan77Koding
- metaBARUMeta: Muse Spark 1.22026-08-0557Kecerdasan72Koding
- qwenQwen: Qwen3.8 Max2026-08-0358Kecerdasan72Koding
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3152Kecerdasan69Koding
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 per 1 juta token · 252 tok/s
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463Kecerdasan78Koding
- googleGoogle: Gemini 3.6 Flash2026-07-2152Kecerdasan69Koding
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137Kecerdasan49Koding
- metaMeta: Muse Spark 1.12026-07-1653Kecerdasan71Koding
- kimiMoonshotAI: Kimi K32026-07-1560Kecerdasan76Koding
- openaiOpenAI: GPT-5.6 Luna2026-07-0952Kecerdasan71Koding
- openaiOpenAI: GPT-5.6 Terra2026-07-0957Kecerdasan77Koding
- openaiOpenAI: GPT-5.6 Sol2026-07-0961Kecerdasan77Koding
- grokxAI: Grok 4.52026-07-0856Kecerdasan72Koding
- tencentTencent: Hy32026-07-0642Kecerdasan59Koding
LLM tanpa sensor adalah model bahasa yang perilaku penolakannya — bagian dari model yang menolak permintaan alih-alih menjawabnya — telah dihapus secara sengaja. Kebanyakan dibangun dengan abliterasi: seorang peneliti menemukan satu arah internal yang memediasi penolakan dan menghapusnya dari bobot, membuat sebagian besar model tetap utuh. Hasilnya adalah model yang menjawab di mana model normal akan berkata tidak, itulah mengapa model ini dipelajari dan justru mengapa tidak untuk produksi. Kami mengirimkan satu build semacam itu, Qwen3.8-27B-Uncensored-FP8, sebuah model yang diabliterasi dan dikuantisasi FP8 Qwen3.8 27B, ke Hugging Face di bawah Apache 2.0 sebagai artefak khusus riset. Halaman ini adalah penjelasan kategori: apa itu model-model ini, riset yang mendasarinya, cara bekerja dengannya dengan aman, dan di mana batasnya berada.
Satu cara pandang menjaga seluruh kategori ini tetap jujur, jadi saya sampaikan di awal: model tanpa sensor tidak lebih pintar, lebih jujur, atau lebih mampu daripada model asalnya. Ia adalah bobot yang sama dengan satu perilaku yang dikurangi. Semua yang masih ia ketahui, selalu ia ketahui — yang berubah adalah ia tidak lagi menolak. Hal itu menjadikannya objek yang benar-benar berguna untuk penelitian keselamatan, dan hal yang benar-benar tidak aman untuk digunakan. Kedua bagian kalimat itu sama-sama menopang, dan sisa halaman ini menjelaskan keduanya.
Apa arti sebenarnya dari 'tidak disensor'?
• Atau mengaksesnya melalui kami punya kartu model, yang berisi detail harga dan tolok ukur.
Teknik ini berasal dari temuan interpretabilitas tahun 2024. Dalam "Refusal in Language Models Is Mediated by a Single Direction" (Arditi et al., arXiv:2406.11717, NeurIPS 2024), para penulis menunjukkan bahwa pada 13 model chat terbuka dengan parameter berkisar antara 1,8B hingga 72B, penolakan dikendalikan oleh subruang yang kira-kira berdimensi satu dari aliran residual — keadaan internal yang membawa informasi antarlapisan. Jika arah tersebut dihilangkan, model berhenti menolak; jika ditambahkan kembali, model juga menolak permintaan yang tidak berbahaya.
Abliteration mengoperasionalkan temuan itu: perkirakan arahnya, lalu keluarkan arah tersebut dari matriks bobot yang menulis ke aliran residual melalui ortogonalisasi. Pada build kami sendiri, Qwen3.8-27B-Uncensored-FP8, arah penolakan diperkirakan pada satu lapisan dan dihapus dari 131 matriks penulis residual, tanpa menyentuh vision tower. Yang bertahan adalah pengetahuan yang sama, penalaran yang sama, dan konteks 262.144 token yang sama — dengan penolakan yang dihilangkan. Dan untuk tepat mengenai labelnya: "uncensored" tidak berarti selaras atau aman. Itu berarti pengaman dimatikan. Kami akan kembali membahas apa yang dituntut dari Anda.
Penelitian yang menciptakan mereka
Hasil arah penolakan melakukan dua hal sekaligus. Secara ilmiah, ini menjelaskan perilaku keselamatan secara mekanistik: ada sirkuit nyata yang dapat ditemukan yang membuat model berkata "tidak". Secara praktis, ini menunjukkan betapa rapuhnya alignment — satu edit rank-satu pada bobot dapat mematikan perilaku tersebut, tanpa perlu fine-tuning. Itu bukan cacat pada model satu laboratorium; para penulis mereproduksinya di lebih dari belasan model chat.
Pada tahun 2026, teknik ini telah menjadi pipeline satu perintah, yang merupakan fakta bermata dua. Heretic, sebuah pustaka sumber terbuka, memperkirakan arah-arah penolakan per lapisan dan mengortogonalisasinya dari proyeksi attention dan MLP; sebuah laporan Mei 2026 memperkirakan penghapusan guardrail untuk Llama 3.3 milik Meta sekitar 10 menit dan untuk Gemma 4 milik Google sekitar 90 menit, dengan lebih dari 3.500 model turunan dan lebih dari 13 juta unduhan kumulatif. Abliterix (Wu Wangzhang) mengambil rute yang lebih hati-hati: ia mengekstrak arah penolakan dari 800 prompt berbahaya dan 800 prompt jinak, menerapkan proyeksi ortogonal, merilis hasil edit sebagai adapter LoRA rank-1 sehingga bobot dasar tetap tidak tersentuh, dan melaporkan tingkat penolakan serta divergensi KL agar biaya kapabilitas tetap terlihat. Pada model Qwen3.5 0.8B, ia melaporkan 0 penolakan dari 200 prompt berbahaya.
Bacalah paragraf itu dengan cara seorang peneliti keamanan membacanya. Tujuan membangun alat-alat ini bukan agar siapa pun boleh melepas guardrail model sekadar untuk bersenang-senang. Tujuannya adalah bahwa pelepasan itu sepele dan bersifat publik — sehingga mengukurnya, mempelajari cara kerjanya, dan membangun guardrail yang mampu bertahan terhadapnya adalah program riset tersendiri. Itulah red-teaming dalam pengertian white-box: Anda tidak dapat mempertahankan sebuah sistem sebelum Anda tahu betapa mudahnya sistem itu dirusak.
Mengapa model tanpa sensor menjadi populer pada tahun 2026
Tiga kekuatan bertemu. Pertama, gelombang bobot terbuka: Qwen3.8 27B dan sejenisnya dirilis di bawah lisensi permisif, dan abliterasi tidak memerlukan pelatihan — Anda mengedit bobot dan melakukan kuantisasi ulang. Kedua, perangkat lunak berkembang dari kode riset menjadi pustaka satu-perintah, sehingga insinyur yang kompeten dapat menghasilkan build dalam satu sore. Ketiga, Hugging Face menjadi saluran distribusi, yang berarti momentumnya terukur.
Titik data kami sendiri: Qwen3.8-27B-Uncensored-FP8, dirilis pada 15 Agustus 2026, berada di 257 suka dan 4.285 unduhan dalam waktu sekitar satu hari (terverifikasi 16 Agustus). Bukan berarti puluhan ribu orang ingin menerapkan model tanpa pengaman. Melainkan banyak peneliti dan insinyur ingin mempelajarinya — dan angka unduhan adalah kurva permintaan untuk rasa penasaran itu.
Untuk apa: penggunaan penelitian yang sah
Ini adalah daftar yang dapat dipertahankan, dan itulah daftar lengkapnya. Jika suatu penggunaan tidak ada di dalamnya, anggap saja tidak sah:
• Interpretabilitas — mempelajari apa sebenarnya sirkuit penolakan itu, di mana ia berada, dan mengapa menghapus satu arah mengubah perilaku.
Red-teaming dan evaluasi pagar pengaman — membangun lapisan moderasi dan menguji apakah ia menangkap apa yang dihasilkan oleh model yang penolakannya telah dihapus.
• Pengukuran oversafety — mengukur seberapa sering model dasar menolak permintaan yang tidak berbahaya, dan memisahkan hal itu dari keselamatan yang sebenarnya.
• Riset ketahanan — mengukur seberapa mudah alignment dapat dihilangkan, yang merupakan informasi penting bagi siapa pun yang merancang fine-tuning keamanan.
• Eksperimen keamanan terkontrol — rangkaian tolok ukur seperti AdvBench dan JailbreakBench ada justru agar perilaku penolakan dapat diukur dengan cara yang terstandarisasi dan dapat direproduksi.

Semua ini memiliki satu kesamaan: model adalah objek studi, bukan hasil akhir. Luaran penelitian ini adalah makalah, hasil benchmark, atau guardrail yang lebih baik — bukan layanan.
Cara menjalankannya secara bertanggung jawab (jika Anda benar-benar melakukan riset)
Jika Anda memiliki alasan yang sah untuk bekerja dengan model abliterated, aturan pengoperasiannya cukup sederhana:
• Jalankan secara lokal, dalam sandbox, dan idealnya terisolasi dari jaringan. Tanpa endpoint publik, tanpa layanan obrolan, tanpa server bersama.
• Sajikan dengan tooling standar — vLLM atau llama.cpp — dengan cara yang sama seperti Anda menyajikan model open-weights lainnya. Build kami adalah kuantisasi blok-FP8 yang berjalan pada jalur kernel FP8 standar vLLM dengan konteks 262K, toggle berpikir, dan pemanggilan alat yang tetap utuh.
• Ukur, jangan sekadar mengobrol. Kuantifikasi penolakan pada rangkaian tolok ukur yang berisi prompt berbahaya dan bandingkan dengan model dasar; kuantifikasi penolakan berlebihan pada prompt yang tidak berbahaya; laporkan divergensi KL agar pergeseran kemampuan terlihat. Itulah perbedaan antara eksperimen dan anekdot.

• Simpan output di lingkungan yang terkendali. Catat, tinjau, dan musnahkan daripada menyebarkan.
• Jika Anda mengevaluasi guardrail Anda sendiri, letakkan lapisan moderasi Anda di depan model dan ujilah — itulah inti dari latihan ini.
• Untuk lembar spesifikasi lengkap, tabel benchmark, dan detail hosting, buka kartu model kami — itu adalah referensi kanonik untuk build ini.
Batas keamanan: apa arti "hanya untuk riset"
Inilah bagian yang tidak bisa cukup sering diungkapkan. Model abliterated tidak memiliki guardrail bawaan yang bermakna. Ia akan mematuhi permintaan yang ditolak model normal. Itulah fiturnya, sekaligus risikonya — itulah sebabnya setiap rilis serius dari model semacam itu, termasuk milik kami, menyertakan peringatan yang sama.
• Tidak ada pengaman bawaan. Perilaku penolakan telah hilang; jangan bersikap seolah-olah masih ada.
• Bukan untuk pengguna akhir, bukan untuk produksi. Sebuah produk, chatbot, API yang melayani publik, perkakas internal yang diandalkan rekan kerja Anda — tidak satu pun dari ini adalah tempat yang tepat untuk model tanpa sensor.
• Tanggung jawab ada pada Anda. Kami merilis Qwen3.8-27B-Uncensored-FP8 di bawah lisensi Apache 2.0, yang bersifat permisif terhadap redistribusi. Lisensi bukanlah sertifikat keamanan: kode yang permisif tidak mengubah apa yang akan dilakukan model, dan tidak mengalihkan kewajiban kehati-hatian.
• Jika Anda menggunakannya, Anda memiliki keluarannya. Lingkungan yang terkendali adalah tugas Anda; begitu juga dengan memutuskan apa yang akan dan tidak akan Anda masukkan ke dalamnya, dan apa yang Anda lakukan dengan apa yang dihasilkannya.

Ketika model tanpa sensor adalah jawaban yang salah
Cara paling jelas untuk mengatakannya: jika ada manusia di ujung lain model, model tanpa sensor adalah jawaban yang salah. Produk apa pun yang perlu dapat dipercaya, asisten apa pun yang penilaiannya penting, apa pun yang penolakannya adalah perilaku yang benar — gunakan model dasar sebagai gantinya. Alasan Qwen3.8 27B hadir dalam bentuk normalnya justru karena penolakan adalah fitur, bukan bug, untuk hampir semua penggunaan nyata. Build abliterated ada untuk kasus-kasus penelitian sempit di atas dan untuk tidak ada yang lain.
Intinya. LLM tanpa sensor bukanlah kategori produk dan bukan pula sebuah peretasan. Ini adalah artefak penelitian dengan garis ilmiah yang sah — dari temuan arah penolakan hingga alat-alat otomatis tahun 2026 — dan batas penerapan yang tegas. Modelnya nyata, permintaannya terukur, dan penggunaan yang sah juga nyata: interpretabilitas, red-teaming, evaluasi pagar pengaman, dan eksperimen keselamatan yang terkendali. Garis antara mempelajari pengaman dan mematikan pengaman untuk orang lain adalah inti dari halaman ini, dan garis itu tidak bergeser.
Build persis ini publik di bawah Apache 2.0 — khusus riset. Anda dapat mengunduh bobot di Hugging Face
