
Cara Menjalankan Qwen3.8-27B-Uncensored Secara Lokal: Kuantisasi GGUF, llama.cpp, dan Ollama
- DeepSeekBARUDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.15 / $0.29 per 1 juta token
- z-aiBARUZ.ai: GLM 5.32026-08-1860Kecerdasan75Koding
- obsidianBARUQwen3.8 27B2026-08-1552Kecerdasan68Koding
- qwenBARUQwen: Qwen3.8 27B (free)2026-08-13qwen/qwen3.8-27b-free
- deepseekBARUDeepSeek: DeepSeek V4 Pro 08132026-08-1253Kecerdasan69Koding
- grokBARUSpaceXAI: Grok 4.62026-08-1261Kecerdasan77Koding
- metaMeta: Muse Spark 1.22026-08-0557Kecerdasan72Koding
- qwenQwen: Qwen3.8 Max2026-08-0358Kecerdasan72Koding
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3152Kecerdasan69Koding
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 per 1 juta token
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463Kecerdasan78Koding
- googleGoogle: Gemini 3.6 Flash2026-07-2152Kecerdasan69Koding
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137Kecerdasan49Koding
- metaMeta: Muse Spark 1.12026-07-1653Kecerdasan71Koding
- kimiMoonshotAI: Kimi K32026-07-1560Kecerdasan76Koding
- openaiOpenAI: GPT-5.6 Luna2026-07-0952Kecerdasan71Koding
- openaiOpenAI: GPT-5.6 Terra2026-07-0957Kecerdasan77Koding
- openaiOpenAI: GPT-5.6 Sol2026-07-0961Kecerdasan77Koding
Untuk menjalankan Qwen3.8-27B-Uncensored secara lokal, ambil repo GGUF terbatas orcarouter/Qwen3.8-27B-Uncensored-GGUF dari Hugging Face, pilih kuantisasi sesuai VRAM Anda — Q4_K_M (16.8 GB) untuk GPU 24 GB, IQ4_XS (15.3 GB) untuk GPU 16 GB, Q3_K_M (13.5 GB) jika ingin ruang konteks — dan jalankan dengan build llama.cpp terbaru menggunakan flag --jinja, tambahkan --mmproj jika Anda memerlukan visi. Berkas yang sama dapat diimpor ke Ollama dalam tiga perintah. Ini adalah versi GGUF dari build Qwen3.8 27B yang telah di-abliterasi, dirilis pada 16 Agustus 2026, dengan konteks asli 262K, proyektor visi, dan kepala decoding spekulatif MTP yang dipertahankan di setiap kuantisasi. Ini adalah alat riset, bukan asisten: perilaku penolakannya telah dihapus, tidak memiliki pengaman bawaan, dan lisensinya adalah Apache 2.0. Baca batas keamanan di bagian bawah halaman ini sebelum mengunduh — itulah inti dari repo terbatas.
GGUF mana yang harus diunduh, berdasarkan VRAM
Repositori ini menyertakan satu pasangan presisi penuh dan dua belas file terkuantisasi, jadi keputusan unduhan sebenarnya adalah keputusan VRAM. Angka-angka di bawah ini adalah ukuran file yang dibaca dari repositori Hugging Face pada 2026-08-16.

Apa yang sebenarnya ada di repo?
orcarouter/Qwen3.8-27B-Uncensored-GGUF menyimpan lima belas file model: bobot F16 yang dibagi menjadi dua bagian, dua belas GGUF terkuantisasi — Q2_K, Q3_K_S, Q3_K_M, Q3_K_L, Q4_K_S, Q4_K_M, Q5_K_S, Q5_K_M, Q6_K, Q8_0, IQ3_M, dan IQ4_XS — serta proyektor visi mmproj. Ini adalah ekspor GGUF dari build abliterated yang sama dengan Qwen3.8-27B-Uncensored-FP8, dikemas ulang untuk runtime lokal kelas llama.cpp, dan mewarisi lisensi Apache 2.0 model dasar serta konteks asli 262.144 token.
Tiga properti berlaku di semua quant. Arsitekturnya adalah qwen35 — attention hibrida dengan 48 lapisan linear Gated DeltaNet dan 16 lapisan full-attention — itulah sebabnya repo menolak untuk dimuat di build llama.cpp yang lebih lama dan mengapa KV cache tetap kecil. MTP (nextn) speculative-decoding head dipertahankan di semua quant, baik K-quant maupun IQ. Dan template chat-nya adalah template Qwen Jinja, yang harus Anda aktifkan secara eksplisit (lihat di bawah) atau percakapan multi-giliran akan rusak.
Mengapa cache KV tetap cukup kecil untuk menjadi penting
Inilah detail yang membuat cerita lokal berhasil. Dari 64 lapisan, hanya 16 yang menggunakan full attention; 48 lainnya menggunakan Gated DeltaNet linear attention, yang tidak menyimpan cache KV konvensional. Efek praktisnya, yang diukur pada runbook asli untuk arsitektur ini, adalah cache KV sekitar 2 GB pada konteks 32K — sekitar seperempat dari yang dibutuhkan 27B konvensional. Itulah sebabnya file Q4_K_M 16,8 GB masih muat di kartu 24 GB dengan jendela konteks yang panjang, dan mengapa lini GGUF yang tidak disensor dapat dimainkan di perangkat keras yang sama sekali tidak dapat menampung checkpoint BF16 55,6 GB.
Jalankan itu dengan llama.cpp
llama.cpp adalah jalur yang dimaksud. Anda memerlukan build terkini: trunk mendaftarkan arsitektur qwen35, dan build yang lebih lama menolak file tersebut sepenuhnya. Bentuk perintahnya, dari catatan penggunaan di kartu model dan runbook arsitektur ini, adalah:

llama-server -m Qwen3.8-27B-Uncensored-Q4_K_M.gguf --ctx-size 32768 --n-gpu-layers 99 --jinja
Itu memberi Anda endpoint yang kompatibel dengan OpenAI di localhost:8080. Untuk input gambar, tambahkan --mmproj mmproj-Qwen3.8-27B-Uncensored-f16.gguf. Ganti Q4_K_M dengan kuantisasi yang sesuai dengan VRAM Anda; flag-nya identik.
Jalankan dengan Ollama
Ollama menjalankan berkas yang sama dengan mengimpornya dari Modelfile, yang merupakan cara yang didukung untuk menambahkan GGUF yang tidak ada di pustaka. Di direktori yang menyimpan file kuantisasi yang Anda unduh:
DARI ./Qwen3.8-27B-Uncensored-Q4_K_M.gguf
Simpan baris itu sebagai Modelfile, lalu ollama create qwen3.8-27b-uncensored -f Modelfile dan ollama run qwen3.8-27b-uncensored. Untuk visi, tambahkan baris mmproj ke Modelfile (FROM ... Q4_K_M.gguf beserta path mmproj) dan Ollama akan menghubungkan proyektornya. Peringatan yang sama untuk --ctx dan templat berlaku: atur ukuran konteks yang dapat Anda muat, dan ingat bahwa model yang penolakannya telah dihapus menjawab tanpa pagar pengaman antara Anda dan keluaran.
Apa yang sebenarnya diubah oleh penghapusan penolakan
Kartu model menerbitkan rangkaian evaluasi keamanan untuk build ini. Dengan penalaran nonaktif, penolakan pada tolok ukur standar prompt berbahaya turun dari 64–99% pada model dasar menjadi 0–6% pada bobot yang diabliterasi; dengan penalaran aktif, ia hampir tidak pernah menolak — 1,7% atau kurang. Tolok ukur kemampuan tetap dalam ±1,3 poin dari model dasar. Itulah bentuk setiap rilis yang diabliterasi dalam lini ini: penolakan dihapus, kemampuan utuh, dan peringatan bahwa sebagian nyata dari jawaban masih menambahkan penyangkalan singkat sebelum merespons — artefak pelatihan, bukan penolakan.
Sisi sebaliknya justru adalah inti dari batas keamanan di bawah ini: model yang tidak pernah menolak bukanlah asisten yang lebih baik, melainkan objek yang berbeda jenis. Model tersebut adalah instrumen uji untuk mengukur mekanisme penolakan dan untuk mengetahui apakah pagar pengaman Anda sendiri berfungsi.
Apa yang sebenarnya harus dilakukan dengan itu dalam penelitian.
Tiga proyek sah yang merupakan penggunaan yang disahkan dari model yang penolakannya telah dihapus:
Ketika build ini adalah jawaban yang salah.
Jika Anda menginginkan asisten normal, atau apa pun yang akan Anda taruh di depan pengguna akhir, ini adalah model yang salah — model ini tidak memiliki pengaman bawaan yang bermakna, model ini akan mematuhi permintaan yang ditolak oleh model dasar, dan Apache 2.0 tidak mengalihkan tanggung jawab Anda. Gunakan Qwen3.8-27B versi asli yang selaras untuk itu. Jika Anda ingin menghindari penolakan pada chatbot, paket prompt sistem akan mencapai lebih banyak dengan risiko yang lebih kecil daripada mengedit bobot. Dan jika Anda sama sekali tidak memiliki GPU tetapi masih ingin mempelajari modelnya, kartu yang dihosting obsidian/Qwen3.8-27B di OrcaRouter menyediakan lini tanpa sensor yang sama dengan biaya $0,40 per juta token input dan $4,21 per juta token output dengan konteks 262K yang sama; kartu ini dibatasi untuk peneliti keamanan dan AI-safety dengan cara yang sama seperti repositori, dan keputusan moderasi tetap berada di sisi Anda. kartu model memiliki detail harga dan tolok ukur.
Batas keamanan — baca ini sebelum Anda mengunduh

Model ini telah mengalami penyelarasan keamanan yang {{1}}dihilangkan secara substansial{{/1}}. Model ini akan memenuhi permintaan {{2}}berbahaya, tidak etis, ofensif, atau ilegal{{/2}} yang akan ditolak oleh Qwen3.8-27B asli, dan tidak memiliki pengaman bawaan yang berarti. Model ini dirilis secara ketat untuk penelitian yang sah — {{3}}studi interpretabilitas, keamanan AI, dan mekanisme penolakan, red-teaming, evaluasi ketahanan, serta eksperimen terkendali{{/3}}. Anda memikul tanggung jawab dan kewajiban penuh atas cara Anda menggunakannya dan atas segala sesuatu yang dihasilkannya, dan Anda tidak boleh menyebarkannya kepada pengguna akhir atau ke produksi tanpa menambahkan {{4}}lapisan keamanan, moderasi, dan pencegahan penyalahgunaan{{/4}} Anda sendiri. Para penulis tidak menerima tanggung jawab atas penyalahgunaan. Mengunduh repositori berarti Anda menerima ketentuan ini; lisensinya adalah {{5}}Apache 2.0{{/5}}.
Artikel ini sengaja tidak memuat prompt yang berbahaya. Angka penolakan di atas berasal dari rangkaian evaluasi keamanan kartu model itu sendiri, yang merupakan cara yang tepat untuk mengukur model kelas ini: jalankan benchmark penolakan standar, baca angkanya, dan rancang riset Anda berdasarkan apa yang ditunjukkan angka-angka tersebut.
Sumber dan tanggal
Semua fakta di atas diverifikasi pada 16-08-2026. Daftar file dan ukurannya dibaca dari repositori Hugging Face orcarouter/Qwen3.8-27B-Uncensored-GGUF (dibuat pada 16 Agustus 2026; arsitektur qwen35; Apache 2.0; gated). Angka penolakan dan kapabilitas berasal dari rangkaian evaluasi keamanan pada kartu model. Pengukuran cache KV (~2 GB pada konteks 32K) berasal dari runbook OrcaRouter untuk arsitektur ini, How to Run Qwen 3.8 27B Locally. Harga dan gating yang dihosting berasal dari halaman model obsidian/Qwen3.8-27B, yang diperiksa pada hari yang sama. Ukuran file terkuantisasi adalah GB desimal sebagaimana tersimpan di Hugging Face.
Untuk penelitian yang sah, bobotnya ada di Hugging Face: Unduh dari Hugging Face — tanpa kartu kredit, aktif dalam 60 detik.
