
Benchmark Qwen3.8-27B-Uncensored: Penolakan Runtuh, Kemampuan Tetap
- DeepSeekBARUDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.15 / $0.29 per 1 juta token
- z-aiBARUZ.ai: GLM 5.32026-08-1860Kecerdasan75Koding
- obsidianBARUQwen3.8 27B2026-08-1552Kecerdasan68Koding
- qwenBARUQwen: Qwen3.8 27B (free)2026-08-13qwen/qwen3.8-27b-free
- deepseekBARUDeepSeek: DeepSeek V4 Pro 08132026-08-1253Kecerdasan69Koding
- grokBARUSpaceXAI: Grok 4.62026-08-1261Kecerdasan77Koding
- metaMeta: Muse Spark 1.22026-08-0557Kecerdasan72Koding
- qwenQwen: Qwen3.8 Max2026-08-0358Kecerdasan72Koding
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3152Kecerdasan69Koding
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 per 1 juta token
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463Kecerdasan78Koding
- googleGoogle: Gemini 3.6 Flash2026-07-2152Kecerdasan69Koding
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137Kecerdasan49Koding
- metaMeta: Muse Spark 1.12026-07-1653Kecerdasan71Koding
- kimiMoonshotAI: Kimi K32026-07-1560Kecerdasan76Koding
- openaiOpenAI: GPT-5.6 Luna2026-07-0952Kecerdasan71Koding
- openaiOpenAI: GPT-5.6 Terra2026-07-0957Kecerdasan77Koding
- openaiOpenAI: GPT-5.6 Sol2026-07-0961Kecerdasan77Koding
Kisah benchmark dari Qwen3.8 27B Uncensored (Aggressive) — versi abliterated dari Qwen3.8 27B yang dirilis sebagai checkpoint FP8 pada 15 Agustus 2026 dan build GGUF pada 16 Agustus — bukanlah bahwa model ini menjadi lebih kuat. Melainkan bahwa model ini berhenti menolak. Kartu model melaporkan penolakan prompt berbahaya yang turun drastis dari 64–99% pada model dasar menjadi 0–6% pada build abliterated dengan mode berpikir nonaktif, dan pada atau di bawah 1,7% dengan mode berpikir aktif, sementara setiap benchmark kemampuan berada dalam ±1,3 poin dari model dasar dan perplexity WikiText-2 berada di 6,96. Jika Anda ke sini untuk benchmark qwen uncensored, itulah angka-angka utamanya: model ini bukan model yang lebih pintar, melainkan model yang tidak menolak.
Perbedaan itu penting, karena sebagian besar yang menempati peringkat "benchmark tanpa sensor" hanyalah listicle tipis berisi skor kemampuan atau tulisan hype yang mengklaim model tersebut "lebih baik". Keduanya bukanlah apa yang dilakukan abliterasi. Artikel ini mengulas data terukur yang sebenarnya — keruntuhan penolakan, penolakan berlebihan, retensi kemampuan, dan perplexity — metode yang menghasilkannya, serta batas keamanan yang harus Anda baca sebelum menyentuh bobot model.
Apa yang sebenarnya diukur oleh rangkuman tolok ukur tanpa sensor
Ulasan model biasa melaporkan satu sumbu: kapabilitas — MMLU, GSM8K, pemrograman, penalaran. Model yang di-abliterasi menarik pada sumbu yang berbeda, dan inti dari label "tanpa sensor" adalah bahwa sumbu keamanan telah bergeser. Jadi pertanyaan yang berguna bagi Qwen3.8-27B-Uncensored-FP8 bukanlah "apakah ia lebih pintar?" melainkan "berapa biaya yang harus dibayar untuk menghapus mekanisme penolakan, dan seberapa tuntas penghapusan itu dilakukan?"
Tiga kelompok angka harus dibaca bersama-sama. Tingkat penolakan pada tolok ukur prompt berbahaya — seberapa sering model menolak; semakin tinggi angka dasarnya, semakin terlihat penghapusannya. Penolakan berlebihan pada prompt yang tidak berbahaya — seberapa sering model secara keliru menolak permintaan yang wajar; semakin rendah semakin baik untuk semua orang. Dan retensi kapabilitas — apakah pengeditan tersebut menurunkan kualitas model. Ringkasan tolok ukur yang hanya menampilkan skor kapabilitas sedang menjawab pertanyaan yang salah.
Metode: abliteration adalah edit bobot, bukan fine-tune.
Yang membedakan abliteration dari paket "jailbreak" komunitas adalah tempat perubahannya berada. Jailbreak tingkat prompt membungkus input; abliteration mengubah bobot. Metode di sini adalah Arditi et al. (2024), "Refusal in Language Models Is Mediated by a Single Direction". Temuan intinya adalah bahwa perilaku penolakan pada banyak model digerakkan oleh satu arah dalam residual stream — perkirakan arah itu, hilangkan, dan model berhenti menolak tanpa dilatih ulang.
Secara konkret, kartu model tersebut menjelaskan estimasi satu arah penolakan dari perbedaan rata-rata residual token terakhir yang berbahaya dikurangi yang tidak berbahaya, yang dimask oleh aktivasi masif, pada lapisan 38 (pembulatan dari 0.6 × 64), menggunakan AdvBench sebagai himpunan berbahaya dan Alpaca sebagai himpunan tidak berbahaya. Editnya adalah ortogonalisasi, W′ = W − r(rᵀW), dihitung dalam float32 dan diterapkan pada 131 matriks penulis residual — proyeksi keluaran attention, proyeksi keluaran linear-attention, proyeksi turun MLP, dan satu ruang baris embedding. Tidak ada langkah pelatihan yang dijalankan; menara visi dibiarkan tidak tersentuh; kepala decoding spekulatif MTP diabliterasi secara konsisten. Itulah sebabnya kapabilitas bertahan: menghapus satu arah adalah intervensi yang jauh lebih lembut daripada fine-tuning model agar patuh.
Runtuhnya penolakan: angka-angkanya
Diukur pada build FP8 yang dilayani vLLM dan dipublikasikan di kartu model Hugging Face (2026-08-15), penolakan pada tolok ukur prompt berbahaya turun dari 64–99% pada base menjadi 0–6% pada build tanpa sensor dengan mode berpikir nonaktif:
• AdvBench — 99.0% → 0.0%
• JailbreakBench (berbahaya) — 94,0% → 0,0%
• StrongREJECT — 97.3% → 2.0%
• HarmBench (standar) — 98.7% → 2.7%
• MaliciousInstruct — 99.0% → 0.0%
• SimpleSafetyTests — 64.0% → 6.0%
• Pertanyaan Terlarang — 73.3% → 4.7%
Dengan pemikiran diaktifkan, penolakan pada dasarnya tidak pernah terjadi — 1,7% pada AdvBench dan 0,0% pada sebagian besar lainnya. Kartu tersebut menambahkan satu catatan jujur: 30–50% jawaban masih mengawali dengan pernyataan singkat. Itu adalah artefak pelatihan, bukan penolakan — model menjawab, tetapi melunakkan pembukaannya. Itu terbaca sebagai hambatan, bukan keamanan.

Penolakan berlebihan juga turun.
Angka yang kurang dipublikasikan berada di sisi lain dari sumbu keselamatan. Pada XSTest-safe — 250 prompt jinak yang kadang-kadang ditolak oleh model yang selaras karena kekeliruan — model dasar menolak secara berlebihan 5,6% dari waktu. Build yang tidak disensor menolak secara berlebihan 0,4%. Menghapus arah penolakan tidak hanya menghentikan model untuk menolak permintaan berbahaya; ia juga menghentikannya dari menolak permintaan yang tidak berbahaya yang sebelumnya ditandai karena generalisasi berlebihan. Bagi siapa pun yang membangun alat evaluasi atau red-team yang bertumpu pada garis dasar tanpa penolakan, ini adalah peningkatan nyata pada alat tersebut, bukan efek samping yang perlu diminta maaf.
Kemampuan dipertahankan, bukan ditingkatkan
Di sinilah narasi 'tanpa sensor = lebih kuat' gagal. Kartu model melaporkan build FP8 yang diabliterasi terhadap FP8 dasar resmi dengan skrip dan pengaturan yang sama:
• MMLU (0-shot) — 84.3% → 84.7%
• GSM8K (CoT) — 90,0% → 88,7%
• MMLU-Pro (CoT) — 77,6% → 76,8%
• CMMLU (0-shot, Tionghoa) — 81.4% → 80.8%
Setiap skor berada dalam ±1.3 poin dari basis, dan perplexity mentah WikiText-2 mencapai 6.96 — bukti dari kartu tersebut bahwa pemodelan bahasa itu sendiri tidak menurun. Pembacaan yang jujur: abliteration hampir netral terhadap kemampuan pada arsitektur ini. Anda tidak mendapatkan model yang lebih baik; Anda mendapatkan model yang sama tanpa perilaku penolakan.

Peringatan yang sama berlaku untuk ekosistem yang lebih luas: klaim "lossless uncensored" pada build komunitas layak untuk dibaca secara skeptis. Perbandingan tiga arah pada build open-weight 4B di Hugging Face menemukan bahwa teknik yang mengklaim lossless sebenarnya menurunkan TruthfulQA sekitar 7 poin dan Lambada sekitar 4, sementara tingkat keberhasilan serangan HarmBench-nya mencapai 100%; dua metode lainnya berada di 99,2% dan 95,5%. Dan uji coba agresif pada build lain mencapai nol penolakan tetapi menghasilkan kata-kata yang tidak koheren, sehingga versi yang dirilis mundur ke parameter per-lapisan yang lebih lembut. Hasil abliterasi spesifik untuk metode — angka-angka ini khususnya data kartu build FP8.
Apa yang tidak diklaim oleh kartu.
Baca metodologinya sebelum mengutip angka-angka. Kartu tersebut melabeli pengukuran penolakannya sebagai "indikatif, bukan angka tingkat publikasi / penilai LLM": penolakan dinilai oleh pengklasifikasi frasa pembuka berbasis aturan, dengan kategori "caveat" terpisah untuk jawaban yang mematuhi tetapi menambahkan pernyataan sanggahan di awal. Tolok ukurnya hanya berbasis teks, dijalankan terhadap build FP8 yang dilayani vLLM dengan hanya model bahasa, dan rangkaian kemampuan menggunakan skrip evaluasi standar. Kerangka yang tepat: ini adalah data terukur milik vendor sendiri, dapat direproduksi dari kartu yang diterbitkan — bukan hasil pihak ketiga yang independen, dan bukan klaim tentang build GGUF, yang dikirim terkuantisasi untuk llama.cpp dan harus dievaluasi secara terpisah.
Batas keamanan.
Ini adalah bagian yang tidak dapat ditawar-tawar. Model abliterated adalah model yang mekanisme penolakannya telah dihilangkan secara substansial. Secara konkret: model ini akan mematuhi permintaan berbahaya, tidak etis, atau ilegal yang akan ditolak oleh model dasar Qwen3.8 27B, dan model ini tidak memiliki pagar pengaman bawaan yang berarti. Penggunaan yang sah adalah untuk penelitian — interpretabilitas (mempelajari bagaimana arah-arah penolakan dikodekan), studi keamanan AI dan mekanisme penolakan, red-teaming (menguji model dengan masukan yang mencoba melewati pagar pengamannya), dan evaluasi ketahanan. Model ini dirilis di bawah lisensi Apache 2.0, yang diwarisi dari model dasar, murni sebagai artefak penelitian. Anda memikul tanggung jawab dan kewajiban penuh atas cara Anda menggunakannya dan atas segala sesuatu yang dihasilkannya. Jangan menyebarkannya ke pengguna akhir atau ke produksi tanpa lapisan keamanan, moderasi, dan pencegahan penyalahgunaan Anda sendiri — dan untuk penggunaan produksi atau penggunaan yang berhadapan dengan konsumen, Qwen3.8 27B standar adalah model yang sebenarnya Anda inginkan.
Ketika benchmark tanpa sensor bukanlah hal yang tepat untuk dicari
Jika pertanyaan Anda adalah "model mana yang paling kuat dalam matematika atau coding?", Anda membaca angka yang salah — build tanpa sensor bukanlah peningkatan kapabilitas. Jika aplikasi Anda perlu menolak permintaan berbahaya, model ini justru kebalikan dari apa yang Anda inginkan. Jika Anda hendak merilis produk, jangan membangun di atas checkpoint yang telah diabliterasi. Dan jika yang sebenarnya Anda kejar adalah jailbreak, itu adalah hal yang berbeda sama sekali — paket level-prompt berada di luar intervensi level-berat yang dibahas di sini dan bukan topik artikel ini. Data benchmark dalam tulisan ini ada untuk satu pertanyaan sempit dan sah: apa dampak penghapusan refusal terhadap Qwen3.8 27B, yang terukur.
Cara mengaksesnya
Kedua build tersedia di Hugging Face di bawah Apache 2.0: orcarouter/Qwen3.8-27B-Uncensored-FP8 (block-FP8 E4M3, sekitar 30,9 GB bobot, berjalan di jalur kernel vLLM FP8 standar dengan konteks 262K, tools, thinking, dan MTP yang utuh) dan orcarouter/Qwen3.8-27B-Uncensored-GGUF (F16 plus 12 tingkat kuantisasi untuk llama.cpp, dengan Q4_K_M pada 16,8 GB sebagai default yang direkomendasikan untuk GPU 24 GB). Adapun kartu model di OrcaRouter memuat harga dan rincian tolok ukur — build tanpa sensor tersebut tercantum di sana sebagai obsidian/Qwen3.8-27B dengan harga $0,40 per juta token input dan $4,21 per juta token output, dengan konteks 262K, dan aksesnya dibatasi untuk peneliti keamanan, red team, dan peneliti keamanan AI.

Intinya
Benchmark qwen uncensored menjawab pertanyaan yang sempit, dan jawabannya tegas: menghapus refusal dari Qwen3.8 27B melalui abliteration menyisakan kapabilitas dalam batas ±1,3 poin, sementara refusal pada prompt berbahaya runtuh dari 64–99% menjadi 0–6%, over-refusal turun dari 5,6% menjadi 0,4%, dan perplexity bertahan di 6,96. Baca angka-angka itu sebagai "tidak menolak", bukan "lebih kuat". Untuk riset interpretabilitas, keamanan, dan red-team, itulah alat yang persis dijelaskan oleh model card. Untuk apa pun yang berhadapan dengan pengguna, model ini salah secara konstruksi.
Untuk penggunaan riset yang sah, bobotnya tersedia di Hugging Face di bawah lisensi Apache 2.0 — orcarouter/Qwen3.8-27B-Uncensored-FP8 (build GGUF untuk llama.cpp tersedia di orcarouter/Qwen3.8-27B-Uncensored-GGUF).
