Kartu judul hero untuk artikel 'Qwen 3.8 27B Uncensored GGUF': kartu riset membulat dengan judul 'Qwen3.8-27B Uncensored GGUF', subjudul 'Build lokal terabliterasi untuk llama.cpp', chip bertuliskan '12 TIER KUANT', 'KONTEKS 262K', 'VISION + MTP', dan ikon perisai dengan label KHUSUS RISET. Logo OrcaRouter ditempatkan di pojok kanan bawah.
Guides & Insights

Qwen 3.8 27B Uncensored GGUF: Build Lokal Abliterated, 12 Kuant, dan Batasan Khusus Riset

Penulis

Alistair Wren

Tanggal Terbit

Model terbaru · 20Lihat semua model
Benchmark: Artificial Analysis · diperbarui setiap hari
Kembali ke semua artikel

Qwen 3.8 27B uncensored GGUF adalah unduhan yang benar-benar ada, dan build yang sebaiknya digunakan untuk memulai adalah Qwen3.8-27B-Uncensored-GGUF — diterbitkan di Hugging Face pada 16 Agustus 2026 sebagai varian native llama.cpp dari rilis FP8 abliterated kami. Ini adalah bobot 27 miliar parameter tanpa penolakan yang sama dengan Qwen3.8-27B-Uncensored-FP8, dikonversi ke GGUF untuk inferensi lokal: F16 ditambah 12 tingkat kuantisasi dari Q2_K hingga Q8_0 (termasuk kuantisasi imatrix IQ3_M dan IQ4_XS), jendela konteks 262K, proyektor visi terpisah, dan kepala decoding spekulatif MTP yang tetap utuh. "Uncensored" berarti abliterated — arah penolakan telah diortogonalisasi keluar dari bobot — sehingga ia akan menjawab di tempat model dasar yang selaras menolak, dan justru itulah mengapa ia hanya untuk riset. Berikut ini adalah apa yang sebenarnya ada di dalam repositori, kuantisasi mana yang cocok untuk GPU Anda, cara menjalankannya di llama.cpp, dan batas keamanan yang Anda terima dengan mengunduhnya.

Versi 30 detik: F16 plus 12 kuantisasi, Q4_K_M pada 16,8 GB adalah pilihan bawaan, Anda memerlukan build llama.cpp dari Mei 2026 atau lebih baru, dan ini adalah alat riset tanpa pengaman — bukan untuk digunakan langsung oleh pengguna akhir.

Apa arti sebenarnya dari "GGUF tanpa sensor" — dan bagaimana build ini berbeda dari versi FP8.

GGUF adalah format model berkas tunggal yang digunakan llama.cpp; FP8 adalah skema kuantisasi yang berjalan pada server GPU vLLM. Dua rilis tanpa sensor kami adalah bobot abliterated yang sama dalam dua runtime. Qwen3.8-27B-Uncensored-FP8 (15 Agustus 2026) menargetkan vLLM di server, dikuantisasi ulang ke skema resmi Qwen3.8-27B-FP8 sehingga berjalan pada jalur kernel yang identik. Qwen3.8-27B-Uncensored-GGUF (16 Agustus 2026) menargetkan llama.cpp di mesin lokal — GPU desktop atau workstation yang Anda kendalikan. Bobot yang sama, model penerapan berbeda: API cloud vs proses lokal.

Abliterasi adalah intervensi pada tingkat bobot, bukan fine-tuning. Arah penolakan adalah vektor dalam aliran residual model yang, ketika diaktifkan, menghasilkan "Saya tidak bisa membantu dengan itu"; build menemukan arah tersebut dan mengortogonalisasikannya keluar dari bobot, mengikuti pendekatan Arditi et al. 2024 ("Refusal in Language Models Is Mediated by a Single Direction"). Tidak ada bobot baru yang dilatih. Basenya adalah Qwen/Qwen3.8-27B — model 27B padat dengan arsitektur hibrida (48 lapisan linear-attention Gated DeltaNet dan 16 lapisan full-attention), visi native, dan konteks 262.144 token. Lisensinya adalah Apache 2.0, diwarisi dari base. Perhatikan bahwa repositori resmi Qwen hanya menyediakan safetensors BF16 — tidak ada Qwen GGUF resmi — jadi GGUF tanpa sensor dari model ini, termasuk yang ini, adalah konversi dari bobot terbuka.

Tangga kuant — F16 ditambah 12 tingkat

Repo ini menyertakan F16 (54,6 GB dalam dua file) dan 12 tingkat kuantisasi. Ukuran di bawah adalah ukuran file repo itu sendiri, dibaca pada 16 Agustus 2026; ukuran file GGUF sedikit bervariasi dari satu build ke build lainnya.

Card titled 'Qwen3.8-27B Uncensored GGUF — the quant ladder' listing F16 54.6 GB and 12 quantization tiers with file sizes: Q8_0 29.0 GB near-lossless, Q6_K 22.4 GB, Q5_K_M 19.5 GB, Q5_K_S 19.0 GB, Q4_K_M 16.8 GB marked recommended default, Q4_K_S 15.8 GB, IQ4_XS 15.3 GB marked best low-bit pick, Q3_K_L 14.6 GB, Q3_K_M 13.5 GB, IQ3_M 12.8 GB, Q3_K_S 12.3 GB, Q2_K 10.9 GB, with a footer reading 'File sizes per the Hugging Face repo, read August 16 2026'.

F16 — 54,6 GB (2 berkas) — presisi referensi

Q8_0 — 29.0 GB — hampir tanpa kehilangan, untuk GPU kelas atas

Q6_K — 22.4 GB — titik manis kualitas per gigabyte

Q5_K_M — 19.5 GB / Q5_K_S — 19.0 GB — kualitas tinggi pada kartu yang lebih besar

Q4_K_M — 16.8 GB — default yang disarankan

Q4_K_S — 15.8 GB

IQ4_XS — 15.3 GB — pilihan low-bit terbaik (dikalibrasi imatrix)

Q3_K_L — 14.6 GB / Q3_K_M — 13.5 GB — untuk kartu 16 GB

IQ3_M — 12.8 GB — ukuran kecil (dikalibrasi imatrix)

Q3_K_S — 12.3 GB

Q2_K — 10.9 GB — K-quant terkecil, kompromi kualitas yang terlihat

Panduan perangkat keras: Q4_K_M pada kartu 24 GB (RTX 4090 atau RTX 3090); IQ4_XS atau Q3_K_M jika Anda menggunakan 16 GB; Q2_K hanya jika Anda terbatas pada 12 GB. Karena model dasarnya menggunakan attention hybrid Gated DeltaNet, cache KV-nya kecil — sekitar 0,5 GB pada konteks 8K — sehingga Anda dapat mendorong jendela jauh lebih tinggi daripada model padat 27B konvensional. Visi menambahkan satu file terpisah: proyektor F16 berukuran 931 MB. Seri abliterasi komunitas 9-kuant untuk basis yang sama juga ada; milik kami adalah konversi dari abliterasi FP8 yang terdokumentasi, dengan kuant imatrix dan angka refusal-delta dari kartu model yang dipertahankan.

Cara menjalankannya di llama.cpp

Tiga langkah. Satu persyaratan yang tidak kentara: arsitektur qwen35 dan dukungan MTP ditambahkan ke llama.cpp pada Mei 2026, jadi perbarui ke build dari 2026-05 atau yang lebih baru — build yang lebih lama tidak akan bisa memuat file-file ini (sesuai README repositori).

1. Unduh kuant yang Anda pilih beserta proyektor visi. Repo tersebut memiliki akses terbatas, jadi Anda harus masuk ke Hugging Face dan menerima persyaratannya terlebih dahulu — membaca README adalah bagian dari menerima model ini.

huggingface-cli download orcarouter/Qwen3.8-27B-Uncensored-GGUF --include "Qwen3.8-27B-Uncensored-Q4_K_M.gguf" "mmproj-Qwen3.8-27B-Uncensored-f16.gguf" --local-dir ./qwen-unc

2. Mulai llama-server. Ini menyajikan endpoint yang kompatibel dengan OpenAI; -ngl 99/ memindahkan setiap lapisan ke GPU.

llama-server -m ./qwen-unc/Qwen3.8-27B-Uncensored-Q4_K_M.gguf --mmproj ./qwen-unc/mmproj-Qwen3.8-27B-Uncensored-f16.gguf -ngl 99 -c 16384 --jinja --host 0.0.0.0 --port 8080

3. (Opsional) aktifkan kepala decoding spekulatif MTP. Tambahkan --spec-type draft-mtp/ — kepala nextn tertanam di setiap quant, jadi tidak perlu model draft terpisah.

Card titled 'Run it locally in llama.cpp' with steps: update to a llama.cpp build from May 2026 or newer for the qwen35 architecture and MTP; download via huggingface-cli including the Q4_K_M quant and mmproj-Qwen3.8-27B-Uncensored-f16.gguf; run llama-server with --mmproj, -ngl 99, -c 16384, --jinja; optional --spec-type draft-mtp for the embedded speculative-decoding head, with a footer reading 'OpenAI-compatible endpoint at http://localhost:8080/v1/chat/completions'.

Penelitian yang hanya menggunakan teks dapat melewatkan --mmproj/; masukan gambar membutuhkannya, karena ini adalah model visi-bahasa asli. Endpoint-nya adalah http://localhost:8080/v1/chat/completions, jadi kode SDK OpenAI yang sudah ada dapat berfungsi hanya dengan mengganti base-URL.

Tidak punya GPU? Seri tanpa sensor yang sama tersedia dalam versi hosted.

GGUF lokal tidak dipungut biaya per token tetapi membutuhkan sekitar 17 GB VRAM untuk tingkatan Q4_K_M. Jika Anda tidak memiliki perangkat keras tersebut, kartu yang dihosting obsidian/Qwen3.8-27B di OrcaRouter menyajikan lini 27B tanpa sensor yang sama — visi, penalaran, konteks 262K — dengan harga $0,40 per juta token masukan dan $4,21 per juta token keluaran, dengan akses dibatasi untuk peneliti keamanan, red team, dan peneliti keselamatan AI. Keluarga bobot yang sama, dua runtime: GGUF secara lokal, FP8 di cloud. Keputusan moderasi tetap berada di pihak Anda bagaimanapun juga.

Batas keamanan — baca ini sebelum Anda mengunduh

Model ini telah mengalami penghapusan penyelarasan keselamatan secara substansial. Model ini akan mematuhi permintaan berbahaya, tidak etis, ofensif, atau ilegal yang akan ditolak oleh Qwen3.8-27B dasar, dan tidak memiliki pengaman bawaan yang bermakna. Model ini dirilis secara ketat untuk penelitian yang sah — interpretabilitas, studi mekanisme penolakan, red-teaming, evaluasi ketahanan, dan pengujian pengaman. Anda menanggung tanggung jawab dan liabilitas penuh atas cara Anda menggunakannya dan atas segala sesuatu yang dihasilkannya, dan Anda tidak boleh menyebarkannya kepada pengguna akhir atau ke produksi tanpa menambahkan lapisan keselamatan, moderasi, dan pencegahan penyalahgunaan Anda sendiri. Para penulis tidak menerima liabilitas apa pun. Lisensinya adalah Apache 2.0.

A safety-boundary card with two columns: under Research use it lists refusal-mechanism study, interpretability, red-teaming, robustness evaluation and guardrail testing; under Never deploy it lists end-user chatbots, production apps and consumer services, with a warning strip reading 'No built-in guardrails — the model will comply with requests the base model refuses' and a footer reading 'Apache 2.0 · research-only · you assume full responsibility and liability'.

Perilaku terukur memberi tahu Anda apa biaya {{1}}"uncensored"{{/1}}. Dari rangkaian evaluasi keamanan kartu model — dijalankan pada build FP8 dan bertanggal 15 Agustus 2026, yang merupakan bobot yang dikonversi GGUF ini: {{2}}penolakan terhadap prompt berbahaya turun dari 64–99% pada bobot dasar menjadi 0–6% pada bobot hasil abliterasi{{/2}}, {{3}}penolakan berlebihan terhadap prompt yang tidak berbahaya turun dari 5,6% menjadi 0,4%{{/3}}, dan {{4}}skor kemampuan tetap berada dalam ±1,3 poin dari bobot dasar{{/4}}. {{5}}Angka-angka itulah sebabnya kelas model ini menjadi objek penelitian yang sah — dan angka-angka itu juga merupakan peringatan.{{/5}}

Artikel ini sengaja tidak mengandung prompt yang berbahaya. Jika Anda mengevaluasi model, jalankan tolok ukur penolakan standar — AdvBench, HarmBench, StrongREJECT, XSTest-safe — dan baca sendiri angkanya. Itulah cara yang disetujui untuk mempelajari model yang telah dihapus penolakannya.

Ketika build ini adalah jawaban yang salah.

1. Anda menginginkan asisten biasa. Model yang salah. Model ini tidak memiliki pengaman dan akan mematuhi permintaan berbahaya. Gunakan Qwen3.8-27B yang telah diselaraskan sebagai gantinya.

2. Apa pun yang akan Anda letakkan di depan pengguna akhir. Model yang salah terlepas dari niatnya. Apache 2.0 tidak mengalihkan tanggung jawab Anda, dan merilis model tanpa pengaman kepada pengguna bukanlah strategi penerapan.

3. Anda menggunakan Apple Silicon. GGUF akan berjalan, tetapi konversi MLX dari model dasar adalah yang lebih alami — lihat panduan MLX terpisah kami.

4. Anda tidak ingin menjalankannya sama sekali. Gunakan kartu yang di-host — bobot yang sama, tanpa 17 GB VRAM, dan gerbang khusus riset yang sama.

Intinya

"Qwen 3.8 27B uncensored GGUF" memiliki jawaban, dan itu adalah unduhan konkret: Qwen3.8-27B-Uncensored-GGUF — F16 plus 12 tingkat kuantisasi untuk llama.cpp, bobot abliterated dari build FP8 kami, konteks 262K, visi, dan MTP, di bawah Apache 2.0 dan khusus riset. Pilih Q4_K_M pada kartu 24 GB, perbarui llama.cpp melewati Mei 2026, dan jalankan sebagai server lokal yang kompatibel dengan OpenAI. Ini adalah instrumen riset untuk mempelajari penolakan dan menguji guardrail — bukan chatbot, dan bukan sesuatu untuk dirilis. Bobotnya gratis; tanggung jawab atas apa yang Anda lakukan dengannya sepenuhnya ada di tangan Anda.

Untuk penelitian yang sah, F16 dan semua 12 tingkatan quant tersedia di Hugging Face: Unduh GGUF dari Hugging Face

© 2026 OrcaRouter

Untuk Penyedia

Mengoperasikan platform inferensi? Hadirkan model Anda di OrcaRouter.

Hubungi kami

Gabung komunitas kami

DiscordEmailXGitHubYouTube