Ilustrasi vektor datar editorial untuk hero blog teknologi tentang menjalankan model bahasa besar yang tidak disensor dan di-abliterasi secara lokal di perangkat keras Anda sendiri: sebuah chip model besar membulat berwarna biru tua dengan pancaran cahaya cyan lembut mengambang di kiri tengah, sirkuit internalnya melebur dari bentuk gembok terkunci menjadi gembok terbuka. Di sebelah kanannya, terdapat kartu GPU ringkas di atas meja kerja dan jendela terminal ramping dengan bilah perintah horizontal abstrak serta siluet llama kecil di sampingnya. Di sudut atas, ada ikon mikroskop kecil dan perisai membulat dengan segitiga peringatan, mengisyaratkan penggunaan untuk penelitian dan batasan keamanan. Latar belakang biru muda lembut dan putih, dengan ruang kosong yang luas di sepertiga bagian bawah. Tanpa teks yang dapat dibaca.
Guides & Insights

Cara Menjalankan Qwen3.8-27B-Uncensored Secara Lokal: Kuantisasi GGUF, llama.cpp, dan Ollama

Penulis

Rowan Sterling

Tanggal Terbit

Model terbaru · 20Lihat semua model
Benchmark: Artificial Analysis · diperbarui setiap hari
Kembali ke semua artikel

Untuk menjalankan Qwen3.8-27B-Uncensored secara lokal, ambil repo GGUF terbatas orcarouter/Qwen3.8-27B-Uncensored-GGUF dari Hugging Face, pilih kuantisasi sesuai VRAM Anda — Q4_K_M (16.8 GB) untuk GPU 24 GB, IQ4_XS (15.3 GB) untuk GPU 16 GB, Q3_K_M (13.5 GB) jika ingin ruang konteks — dan jalankan dengan build llama.cpp terbaru menggunakan flag --jinja, tambahkan --mmproj jika Anda memerlukan visi. Berkas yang sama dapat diimpor ke Ollama dalam tiga perintah. Ini adalah versi GGUF dari build Qwen3.8 27B yang telah di-abliterasi, dirilis pada 16 Agustus 2026, dengan konteks asli 262K, proyektor visi, dan kepala decoding spekulatif MTP yang dipertahankan di setiap kuantisasi. Ini adalah alat riset, bukan asisten: perilaku penolakannya telah dihapus, tidak memiliki pengaman bawaan, dan lisensinya adalah Apache 2.0. Baca batas keamanan di bagian bawah halaman ini sebelum mengunduh — itulah inti dari repo terbatas.

GGUF mana yang harus diunduh, berdasarkan VRAM

Repositori ini menyertakan satu pasangan presisi penuh dan dua belas file terkuantisasi, jadi keputusan unduhan sebenarnya adalah keputusan VRAM. Angka-angka di bawah ini adalah ukuran file yang dibaca dari repositori Hugging Face pada 2026-08-16.

A quant-picker card titled 'Qwen3.8-27B-Uncensored GGUF — pick by VRAM', sourced to the Hugging Face repo orcarouter/Qwen3.8-27B-Uncensored-GGUF checked 2026-08-16. It lists: 24 GB GPU — Q4_K_M at 16.8 GB, the recommended default; 16 GB GPU — IQ4_XS at 15.3 GB (tight) or Q3_K_M at 13.5 GB (context headroom); 12 GB GPU — Q2_K at 10.9 GB only, quality drops; 48 GB+ — Q8_0 at 29.0 GB or F16 at 54.7 GB; plus a vision line reading add mmproj 0.9 GB for image input. Footer: only 16 of 64 layers use full attention, so the KV cache stays ~2 GB at 32K context and Q4_K_M fits a 24 GB card with long context.

Apa yang sebenarnya ada di repo?

orcarouter/Qwen3.8-27B-Uncensored-GGUF menyimpan lima belas file model: bobot F16 yang dibagi menjadi dua bagian, dua belas GGUF terkuantisasi — Q2_K, Q3_K_S, Q3_K_M, Q3_K_L, Q4_K_S, Q4_K_M, Q5_K_S, Q5_K_M, Q6_K, Q8_0, IQ3_M, dan IQ4_XS — serta proyektor visi mmproj. Ini adalah ekspor GGUF dari build abliterated yang sama dengan Qwen3.8-27B-Uncensored-FP8, dikemas ulang untuk runtime lokal kelas llama.cpp, dan mewarisi lisensi Apache 2.0 model dasar serta konteks asli 262.144 token.

Tiga properti berlaku di semua quant. Arsitekturnya adalah qwen35 — attention hibrida dengan 48 lapisan linear Gated DeltaNet dan 16 lapisan full-attention — itulah sebabnya repo menolak untuk dimuat di build llama.cpp yang lebih lama dan mengapa KV cache tetap kecil. MTP (nextn) speculative-decoding head dipertahankan di semua quant, baik K-quant maupun IQ. Dan template chat-nya adalah template Qwen Jinja, yang harus Anda aktifkan secara eksplisit (lihat di bawah) atau percakapan multi-giliran akan rusak.

Mengapa cache KV tetap cukup kecil untuk menjadi penting

Inilah detail yang membuat cerita lokal berhasil. Dari 64 lapisan, hanya 16 yang menggunakan full attention; 48 lainnya menggunakan Gated DeltaNet linear attention, yang tidak menyimpan cache KV konvensional. Efek praktisnya, yang diukur pada runbook asli untuk arsitektur ini, adalah cache KV sekitar 2 GB pada konteks 32K — sekitar seperempat dari yang dibutuhkan 27B konvensional. Itulah sebabnya file Q4_K_M 16,8 GB masih muat di kartu 24 GB dengan jendela konteks yang panjang, dan mengapa lini GGUF yang tidak disensor dapat dimainkan di perangkat keras yang sama sekali tidak dapat menampung checkpoint BF16 55,6 GB.

Jalankan itu dengan llama.cpp

llama.cpp adalah jalur yang dimaksud. Anda memerlukan build terkini: trunk mendaftarkan arsitektur qwen35, dan build yang lebih lama menolak file tersebut sepenuhnya. Bentuk perintahnya, dari catatan penggunaan di kartu model dan runbook arsitektur ini, adalah:

A command card titled 'llama.cpp — serve the uncensored GGUF' showing the run command llama-server -m Qwen3.8-27B-Uncensored-Q4_K_M.gguf --ctx-size 32768 --n-gpu-layers 99 --jinja, an optional vision line adding --mmproj mmproj-Qwen3.8-27B-Uncensored-f16.gguf, and notes: a current build is required because the qwen35 architecture is refused by older llama.cpp versions; the MTP nextn head is preserved in every quant but needs a build with MTP support, stock builds ignore it. Footer: the Ollama path is a Modelfile with FROM ./Qwen3.8-27B-Uncensored-Q4_K_M.gguf, then ollama create qwen3.8-27b-uncensored -f Modelfile, then ollama run qwen3.8-27b-uncensored.

llama-server -m Qwen3.8-27B-Uncensored-Q4_K_M.gguf --ctx-size 32768 --n-gpu-layers 99 --jinja

Itu memberi Anda endpoint yang kompatibel dengan OpenAI di localhost:8080. Untuk input gambar, tambahkan --mmproj mmproj-Qwen3.8-27B-Uncensored-f16.gguf. Ganti Q4_K_M dengan kuantisasi yang sesuai dengan VRAM Anda; flag-nya identik.

Jalankan dengan Ollama

Ollama menjalankan berkas yang sama dengan mengimpornya dari Modelfile, yang merupakan cara yang didukung untuk menambahkan GGUF yang tidak ada di pustaka. Di direktori yang menyimpan file kuantisasi yang Anda unduh:

DARI ./Qwen3.8-27B-Uncensored-Q4_K_M.gguf

Simpan baris itu sebagai Modelfile, lalu ollama create qwen3.8-27b-uncensored -f Modelfile dan ollama run qwen3.8-27b-uncensored. Untuk visi, tambahkan baris mmproj ke Modelfile (FROM ... Q4_K_M.gguf beserta path mmproj) dan Ollama akan menghubungkan proyektornya. Peringatan yang sama untuk --ctx dan templat berlaku: atur ukuran konteks yang dapat Anda muat, dan ingat bahwa model yang penolakannya telah dihapus menjawab tanpa pagar pengaman antara Anda dan keluaran.

Apa yang sebenarnya diubah oleh penghapusan penolakan

Kartu model menerbitkan rangkaian evaluasi keamanan untuk build ini. Dengan penalaran nonaktif, penolakan pada tolok ukur standar prompt berbahaya turun dari 64–99% pada model dasar menjadi 0–6% pada bobot yang diabliterasi; dengan penalaran aktif, ia hampir tidak pernah menolak — 1,7% atau kurang. Tolok ukur kemampuan tetap dalam ±1,3 poin dari model dasar. Itulah bentuk setiap rilis yang diabliterasi dalam lini ini: penolakan dihapus, kemampuan utuh, dan peringatan bahwa sebagian nyata dari jawaban masih menambahkan penyangkalan singkat sebelum merespons — artefak pelatihan, bukan penolakan.

Sisi sebaliknya justru adalah inti dari batas keamanan di bawah ini: model yang tidak pernah menolak bukanlah asisten yang lebih baik, melainkan objek yang berbeda jenis. Model tersebut adalah instrumen uji untuk mengukur mekanisme penolakan dan untuk mengetahui apakah pagar pengaman Anda sendiri berfungsi.

Apa yang sebenarnya harus dilakukan dengan itu dalam penelitian.

Tiga proyek sah yang merupakan penggunaan yang disahkan dari model yang penolakannya telah dihapus:

Ketika build ini adalah jawaban yang salah.

Jika Anda menginginkan asisten normal, atau apa pun yang akan Anda taruh di depan pengguna akhir, ini adalah model yang salah — model ini tidak memiliki pengaman bawaan yang bermakna, model ini akan mematuhi permintaan yang ditolak oleh model dasar, dan Apache 2.0 tidak mengalihkan tanggung jawab Anda. Gunakan Qwen3.8-27B versi asli yang selaras untuk itu. Jika Anda ingin menghindari penolakan pada chatbot, paket prompt sistem akan mencapai lebih banyak dengan risiko yang lebih kecil daripada mengedit bobot. Dan jika Anda sama sekali tidak memiliki GPU tetapi masih ingin mempelajari modelnya, kartu yang dihosting obsidian/Qwen3.8-27B di OrcaRouter menyediakan lini tanpa sensor yang sama dengan biaya $0,40 per juta token input dan $4,21 per juta token output dengan konteks 262K yang sama; kartu ini dibatasi untuk peneliti keamanan dan AI-safety dengan cara yang sama seperti repositori, dan keputusan moderasi tetap berada di sisi Anda. kartu model memiliki detail harga dan tolok ukur.

Batas keamanan — baca ini sebelum Anda mengunduh

A safety-boundary card for Qwen3.8-27B-Uncensored with two columns: under Research use it lists refusal-mechanism study, interpretability, red-teaming, robustness evaluation and guardrail testing; under Never deploy it lists end-user chatbots, production applications and consumer services, with a warning that this model has had its safety alignment removed and will comply with harmful, unethical or illegal requests the base model refuses, and a footer reading Apache 2.0, research-only, you assume full responsibility.

Model ini telah mengalami penyelarasan keamanan yang {{1}}dihilangkan secara substansial{{/1}}. Model ini akan memenuhi permintaan {{2}}berbahaya, tidak etis, ofensif, atau ilegal{{/2}} yang akan ditolak oleh Qwen3.8-27B asli, dan tidak memiliki pengaman bawaan yang berarti. Model ini dirilis secara ketat untuk penelitian yang sah — {{3}}studi interpretabilitas, keamanan AI, dan mekanisme penolakan, red-teaming, evaluasi ketahanan, serta eksperimen terkendali{{/3}}. Anda memikul tanggung jawab dan kewajiban penuh atas cara Anda menggunakannya dan atas segala sesuatu yang dihasilkannya, dan Anda tidak boleh menyebarkannya kepada pengguna akhir atau ke produksi tanpa menambahkan {{4}}lapisan keamanan, moderasi, dan pencegahan penyalahgunaan{{/4}} Anda sendiri. Para penulis tidak menerima tanggung jawab atas penyalahgunaan. Mengunduh repositori berarti Anda menerima ketentuan ini; lisensinya adalah {{5}}Apache 2.0{{/5}}.

Artikel ini sengaja tidak memuat prompt yang berbahaya. Angka penolakan di atas berasal dari rangkaian evaluasi keamanan kartu model itu sendiri, yang merupakan cara yang tepat untuk mengukur model kelas ini: jalankan benchmark penolakan standar, baca angkanya, dan rancang riset Anda berdasarkan apa yang ditunjukkan angka-angka tersebut.

Sumber dan tanggal

Semua fakta di atas diverifikasi pada 16-08-2026. Daftar file dan ukurannya dibaca dari repositori Hugging Face orcarouter/Qwen3.8-27B-Uncensored-GGUF (dibuat pada 16 Agustus 2026; arsitektur qwen35; Apache 2.0; gated). Angka penolakan dan kapabilitas berasal dari rangkaian evaluasi keamanan pada kartu model. Pengukuran cache KV (~2 GB pada konteks 32K) berasal dari runbook OrcaRouter untuk arsitektur ini, How to Run Qwen 3.8 27B Locally. Harga dan gating yang dihosting berasal dari halaman model obsidian/Qwen3.8-27B, yang diperiksa pada hari yang sama. Ukuran file terkuantisasi adalah GB desimal sebagaimana tersimpan di Hugging Face.

Untuk penelitian yang sah, bobotnya ada di Hugging Face: Unduh dari Hugging Face — tanpa kartu kredit, aktif dalam 60 detik.

© 2026 OrcaRouter

Untuk Penyedia

Mengoperasikan platform inferensi? Hadirkan model Anda di OrcaRouter.

providers@orcarouter.ai

Gabung komunitas kami

Discordsupport@orcarouter.aiXGitHubYouTube