Kartu judul untuk laporan benchmark Qwen3.8-27B-Uncensored, menampilkan pengukur tingkat penolakan yang turun drastis dari 99 persen merah pada panel berlabel Base menjadi 0 persen hijau pada panel berlabel Uncensored, dengan ikon perisai yang dicoret pada panel kanan dan garis horizontal di bawahnya yang bertuliskan kapabilitas dalam plus atau minus 1,3 poin.
Guides & Insights

Benchmark Qwen3.8-27B-Uncensored: Penolakan Runtuh, Kemampuan Tetap

Penulis

Rowan Sterling

Tanggal Terbit

Model terbaru · 20Lihat semua model
Benchmark: Artificial Analysis · diperbarui setiap hari
Kembali ke semua artikel

Kisah benchmark dari Qwen3.8 27B Uncensored (Aggressive) — versi abliterated dari Qwen3.8 27B yang dirilis sebagai checkpoint FP8 pada 15 Agustus 2026 dan build GGUF pada 16 Agustus — bukanlah bahwa model ini menjadi lebih kuat. Melainkan bahwa model ini berhenti menolak. Kartu model melaporkan penolakan prompt berbahaya yang turun drastis dari 64–99% pada model dasar menjadi 0–6% pada build abliterated dengan mode berpikir nonaktif, dan pada atau di bawah 1,7% dengan mode berpikir aktif, sementara setiap benchmark kemampuan berada dalam ±1,3 poin dari model dasar dan perplexity WikiText-2 berada di 6,96. Jika Anda ke sini untuk benchmark qwen uncensored, itulah angka-angka utamanya: model ini bukan model yang lebih pintar, melainkan model yang tidak menolak.

Perbedaan itu penting, karena sebagian besar yang menempati peringkat "benchmark tanpa sensor" hanyalah listicle tipis berisi skor kemampuan atau tulisan hype yang mengklaim model tersebut "lebih baik". Keduanya bukanlah apa yang dilakukan abliterasi. Artikel ini mengulas data terukur yang sebenarnya — keruntuhan penolakan, penolakan berlebihan, retensi kemampuan, dan perplexity — metode yang menghasilkannya, serta batas keamanan yang harus Anda baca sebelum menyentuh bobot model.

Apa yang sebenarnya diukur oleh rangkuman tolok ukur tanpa sensor

Ulasan model biasa melaporkan satu sumbu: kapabilitas — MMLU, GSM8K, pemrograman, penalaran. Model yang di-abliterasi menarik pada sumbu yang berbeda, dan inti dari label "tanpa sensor" adalah bahwa sumbu keamanan telah bergeser. Jadi pertanyaan yang berguna bagi Qwen3.8-27B-Uncensored-FP8 bukanlah "apakah ia lebih pintar?" melainkan "berapa biaya yang harus dibayar untuk menghapus mekanisme penolakan, dan seberapa tuntas penghapusan itu dilakukan?"

Tiga kelompok angka harus dibaca bersama-sama. Tingkat penolakan pada tolok ukur prompt berbahaya — seberapa sering model menolak; semakin tinggi angka dasarnya, semakin terlihat penghapusannya. Penolakan berlebihan pada prompt yang tidak berbahaya — seberapa sering model secara keliru menolak permintaan yang wajar; semakin rendah semakin baik untuk semua orang. Dan retensi kapabilitas — apakah pengeditan tersebut menurunkan kualitas model. Ringkasan tolok ukur yang hanya menampilkan skor kapabilitas sedang menjawab pertanyaan yang salah.

Metode: abliteration adalah edit bobot, bukan fine-tune.

Yang membedakan abliteration dari paket "jailbreak" komunitas adalah tempat perubahannya berada. Jailbreak tingkat prompt membungkus input; abliteration mengubah bobot. Metode di sini adalah Arditi et al. (2024), "Refusal in Language Models Is Mediated by a Single Direction". Temuan intinya adalah bahwa perilaku penolakan pada banyak model digerakkan oleh satu arah dalam residual stream — perkirakan arah itu, hilangkan, dan model berhenti menolak tanpa dilatih ulang.

Secara konkret, kartu model tersebut menjelaskan estimasi satu arah penolakan dari perbedaan rata-rata residual token terakhir yang berbahaya dikurangi yang tidak berbahaya, yang dimask oleh aktivasi masif, pada lapisan 38 (pembulatan dari 0.6 × 64), menggunakan AdvBench sebagai himpunan berbahaya dan Alpaca sebagai himpunan tidak berbahaya. Editnya adalah ortogonalisasi, W′ = W − r(rᵀW), dihitung dalam float32 dan diterapkan pada 131 matriks penulis residual — proyeksi keluaran attention, proyeksi keluaran linear-attention, proyeksi turun MLP, dan satu ruang baris embedding. Tidak ada langkah pelatihan yang dijalankan; menara visi dibiarkan tidak tersentuh; kepala decoding spekulatif MTP diabliterasi secara konsisten. Itulah sebabnya kapabilitas bertahan: menghapus satu arah adalah intervensi yang jauh lebih lembut daripada fine-tuning model agar patuh.

Runtuhnya penolakan: angka-angkanya

Diukur pada build FP8 yang dilayani vLLM dan dipublikasikan di kartu model Hugging Face (2026-08-15), penolakan pada tolok ukur prompt berbahaya turun dari 64–99% pada base menjadi 0–6% pada build tanpa sensor dengan mode berpikir nonaktif:

• AdvBench — 99.0% → 0.0%

• JailbreakBench (berbahaya) — 94,0% → 0,0%

• StrongREJECT — 97.3% → 2.0%

• HarmBench (standar) — 98.7% → 2.7%

• MaliciousInstruct — 99.0% → 0.0%

• SimpleSafetyTests — 64.0% → 6.0%

• Pertanyaan Terlarang — 73.3% → 4.7%

Dengan pemikiran diaktifkan, penolakan pada dasarnya tidak pernah terjadi — 1,7% pada AdvBench dan 0,0% pada sebagian besar lainnya. Kartu tersebut menambahkan satu catatan jujur: 30–50% jawaban masih mengawali dengan pernyataan singkat. Itu adalah artefak pelatihan, bukan penolakan — model menjawab, tetapi melunakkan pembukaannya. Itu terbaca sebagai hambatan, bukan keamanan.

A two-column scoreboard comparing harmful-prompt refusal rates for the base Qwen3.8 27B versus the abliterated Qwen3.8-27B-Uncensored build across seven benchmarks, the base column reading 99.0, 94.0, 97.3, 98.7, 99.0, 64.0 and 73.3 percent and the uncensored column reading 0.0, 0.0, 2.0, 2.7, 0.0, 6.0 and 4.7 percent, with a footer noting the data is from the Hugging Face model card, measured on the vLLM-served FP8 build, 2026-08-15.

Penolakan berlebihan juga turun.

Angka yang kurang dipublikasikan berada di sisi lain dari sumbu keselamatan. Pada XSTest-safe — 250 prompt jinak yang kadang-kadang ditolak oleh model yang selaras karena kekeliruan — model dasar menolak secara berlebihan 5,6% dari waktu. Build yang tidak disensor menolak secara berlebihan 0,4%. Menghapus arah penolakan tidak hanya menghentikan model untuk menolak permintaan berbahaya; ia juga menghentikannya dari menolak permintaan yang tidak berbahaya yang sebelumnya ditandai karena generalisasi berlebihan. Bagi siapa pun yang membangun alat evaluasi atau red-team yang bertumpu pada garis dasar tanpa penolakan, ini adalah peningkatan nyata pada alat tersebut, bukan efek samping yang perlu diminta maaf.

Kemampuan dipertahankan, bukan ditingkatkan

Di sinilah narasi 'tanpa sensor = lebih kuat' gagal. Kartu model melaporkan build FP8 yang diabliterasi terhadap FP8 dasar resmi dengan skrip dan pengaturan yang sama:

• MMLU (0-shot) — 84.3% → 84.7%

• GSM8K (CoT) — 90,0% → 88,7%

• MMLU-Pro (CoT) — 77,6% → 76,8%

• CMMLU (0-shot, Tionghoa) — 81.4% → 80.8%

Setiap skor berada dalam ±1.3 poin dari basis, dan perplexity mentah WikiText-2 mencapai 6.96 — bukti dari kartu tersebut bahwa pemodelan bahasa itu sendiri tidak menurun. Pembacaan yang jujur: abliteration hampir netral terhadap kemampuan pada arsitektur ini. Anda tidak mendapatkan model yang lebih baik; Anda mendapatkan model yang sama tanpa perilaku penolakan.

A scoreboard for the Qwen3.8-27B-Uncensored capability retention results: MMLU 84.3 to 84.7, GSM8K 90.0 to 88.7, MMLU-Pro 77.6 to 76.8, CMMLU 81.4 to 80.8, every score within plus or minus 1.3 points of the base, with a highlight panel showing WikiText-2 perplexity 6.96 and over-refusal on XSTest-safe falling from 5.6 percent to 0.4 percent, and a footer noting the source is the Hugging Face model card, measured on the vLLM-served FP8 build.

Peringatan yang sama berlaku untuk ekosistem yang lebih luas: klaim "lossless uncensored" pada build komunitas layak untuk dibaca secara skeptis. Perbandingan tiga arah pada build open-weight 4B di Hugging Face menemukan bahwa teknik yang mengklaim lossless sebenarnya menurunkan TruthfulQA sekitar 7 poin dan Lambada sekitar 4, sementara tingkat keberhasilan serangan HarmBench-nya mencapai 100%; dua metode lainnya berada di 99,2% dan 95,5%. Dan uji coba agresif pada build lain mencapai nol penolakan tetapi menghasilkan kata-kata yang tidak koheren, sehingga versi yang dirilis mundur ke parameter per-lapisan yang lebih lembut. Hasil abliterasi spesifik untuk metode — angka-angka ini khususnya data kartu build FP8.

Apa yang tidak diklaim oleh kartu.

Baca metodologinya sebelum mengutip angka-angka. Kartu tersebut melabeli pengukuran penolakannya sebagai "indikatif, bukan angka tingkat publikasi / penilai LLM": penolakan dinilai oleh pengklasifikasi frasa pembuka berbasis aturan, dengan kategori "caveat" terpisah untuk jawaban yang mematuhi tetapi menambahkan pernyataan sanggahan di awal. Tolok ukurnya hanya berbasis teks, dijalankan terhadap build FP8 yang dilayani vLLM dengan hanya model bahasa, dan rangkaian kemampuan menggunakan skrip evaluasi standar. Kerangka yang tepat: ini adalah data terukur milik vendor sendiri, dapat direproduksi dari kartu yang diterbitkan — bukan hasil pihak ketiga yang independen, dan bukan klaim tentang build GGUF, yang dikirim terkuantisasi untuk llama.cpp dan harus dievaluasi secara terpisah.

Batas keamanan.

Ini adalah bagian yang tidak dapat ditawar-tawar. Model abliterated adalah model yang mekanisme penolakannya telah dihilangkan secara substansial. Secara konkret: model ini akan mematuhi permintaan berbahaya, tidak etis, atau ilegal yang akan ditolak oleh model dasar Qwen3.8 27B, dan model ini tidak memiliki pagar pengaman bawaan yang berarti. Penggunaan yang sah adalah untuk penelitian — interpretabilitas (mempelajari bagaimana arah-arah penolakan dikodekan), studi keamanan AI dan mekanisme penolakan, red-teaming (menguji model dengan masukan yang mencoba melewati pagar pengamannya), dan evaluasi ketahanan. Model ini dirilis di bawah lisensi Apache 2.0, yang diwarisi dari model dasar, murni sebagai artefak penelitian. Anda memikul tanggung jawab dan kewajiban penuh atas cara Anda menggunakannya dan atas segala sesuatu yang dihasilkannya. Jangan menyebarkannya ke pengguna akhir atau ke produksi tanpa lapisan keamanan, moderasi, dan pencegahan penyalahgunaan Anda sendiri — dan untuk penggunaan produksi atau penggunaan yang berhadapan dengan konsumen, Qwen3.8 27B standar adalah model yang sebenarnya Anda inginkan.

Ketika benchmark tanpa sensor bukanlah hal yang tepat untuk dicari

Jika pertanyaan Anda adalah "model mana yang paling kuat dalam matematika atau coding?", Anda membaca angka yang salah — build tanpa sensor bukanlah peningkatan kapabilitas. Jika aplikasi Anda perlu menolak permintaan berbahaya, model ini justru kebalikan dari apa yang Anda inginkan. Jika Anda hendak merilis produk, jangan membangun di atas checkpoint yang telah diabliterasi. Dan jika yang sebenarnya Anda kejar adalah jailbreak, itu adalah hal yang berbeda sama sekali — paket level-prompt berada di luar intervensi level-berat yang dibahas di sini dan bukan topik artikel ini. Data benchmark dalam tulisan ini ada untuk satu pertanyaan sempit dan sah: apa dampak penghapusan refusal terhadap Qwen3.8 27B, yang terukur.

Cara mengaksesnya

Kedua build tersedia di Hugging Face di bawah Apache 2.0: orcarouter/Qwen3.8-27B-Uncensored-FP8 (block-FP8 E4M3, sekitar 30,9 GB bobot, berjalan di jalur kernel vLLM FP8 standar dengan konteks 262K, tools, thinking, dan MTP yang utuh) dan orcarouter/Qwen3.8-27B-Uncensored-GGUF (F16 plus 12 tingkat kuantisasi untuk llama.cpp, dengan Q4_K_M pada 16,8 GB sebagai default yang direkomendasikan untuk GPU 24 GB). Adapun kartu model di OrcaRouter memuat harga dan rincian tolok ukur — build tanpa sensor tersebut tercantum di sana sebagai obsidian/Qwen3.8-27B dengan harga $0,40 per juta token input dan $4,21 per juta token output, dengan konteks 262K, dan aksesnya dibatasi untuk peneliti keamanan, red team, dan peneliti keamanan AI.

The OrcaRouter model page for obsidian Qwen3.8-27B, showing the uncensored build's 0.40 USD per million input and 4.21 USD per million output pricing, a 262K token context window, a released August 15 2026 label, and the researcher-access gating note.

Intinya

Benchmark qwen uncensored menjawab pertanyaan yang sempit, dan jawabannya tegas: menghapus refusal dari Qwen3.8 27B melalui abliteration menyisakan kapabilitas dalam batas ±1,3 poin, sementara refusal pada prompt berbahaya runtuh dari 64–99% menjadi 0–6%, over-refusal turun dari 5,6% menjadi 0,4%, dan perplexity bertahan di 6,96. Baca angka-angka itu sebagai "tidak menolak", bukan "lebih kuat". Untuk riset interpretabilitas, keamanan, dan red-team, itulah alat yang persis dijelaskan oleh model card. Untuk apa pun yang berhadapan dengan pengguna, model ini salah secara konstruksi.

Untuk penggunaan riset yang sah, bobotnya tersedia di Hugging Face di bawah lisensi Apache 2.0 — orcarouter/Qwen3.8-27B-Uncensored-FP8 (build GGUF untuk llama.cpp tersedia di orcarouter/Qwen3.8-27B-Uncensored-GGUF).

© 2026 OrcaRouter

Untuk Penyedia

Mengoperasikan platform inferensi? Hadirkan model Anda di OrcaRouter.

providers@orcarouter.ai

Gabung komunitas kami

Discordsupport@orcarouter.aiXGitHubYouTube