Kartu hero untuk artikel 'Qwen3.8-Flash-Next-Uncensored: Run the Abliterated MoE on llama.cpp and Apple Silicon', menampilkan judul, subjudul 'GGUF + MLX native - konteks hingga 262K', dan tiga chip spesifikasi: 'Dibatasi di Hugging Face', '13 kuantisasi GGUF', dan 'Build MLX 6-bit'.
Guides & Insights

Qwen3.8-Flash-Next-Uncensored: Jalankan MoE yang Di-Abliterasi di llama.cpp dan Apple Silicon

Penulis

Rowan Sterling

Tanggal Terbit

Model terbaru · 20Lihat semua model
Benchmark: Artificial Analysis · diperbarui setiap hari
Kembali ke semua artikel

Sebelum Anda mengunduh apa pun: Qwen3.8-Flash-Next-Uncensored bukan Qwen3.8-27B-Uncensored. Mereka berbagi nama keluarga dan teknik abliterasi, tetapi mereka adalah model yang berbeda dari rilis bobot yang berbeda, dan setiap postingan "Qw​en uncensored" sebelumnya di blog ini adalah tentang 27B. Subjek di sini adalah pasangan yang diterbitkan OrcaRouter ke Hugging Face pada 26 Agustus 2026 — orcarouter/Qwen3.8-Flash-Next-Uncensored-GGUF dan orcarouter/Qwen3.8-Flash-Next-Uncensored-MLX — build abliterasi dari Qwen3.8-Flash-Next, model mixture-of-experts terarah dengan 176B tersimpan / 6B aktif milik Alibaba yang mempratinjau arsitektur Qwen4. Kami mengumumkan rilis ini sebagai "GGUF + native MLX, up to 262K context," yang ditujukan bagi peneliti keamanan, tim merah, dan tim biru. Buku panduan ini ditulis dari kartu model kami sendiri: apa yang dilakukan penghapusan penolakan di dalam MoE terarah, berapa biaya sebenarnya dari klaim konteks 262K dalam memori, cara melayani kedua baris file, dan di mana garis penelitian berada. Jika Anda datang menginginkan pengantar abliterasi atau matematika kuantisasi 27B, postingan-postingan sebelumnya dalam seri ini membahas hal tersebut.

Scoreboard card for Qwen3.8-Flash-Next-Uncensored with six rows: base model Qwen3.8-Flash-Next (Qwen4 preview), access gated (HF login + terms), GGUF quants 13 (IQ2_XXS to Q5_K_M), vision mmproj F16 projector, MLX build 4/6/8-bit, context 262,144 tokens (YaRN to 1M); footer reads 'OrcaRouter model-card data, August 2026 - not independently audited.'

Pertama, gerbangnya.

Kedua repo tersebut berada di balik gerbang Hugging Face (gated: auto). Tidak ada unduhan file sampai Anda masuk dan menerima persyaratan repositori pada masing-masing repo — repo GGUF dan MLX masing-masing memiliki gerbangnya sendiri. Ini adalah perbedaan paling praktis dari lini GGUF yang tidak bergated: perintah satu baris sederhana "hf download" akan gagal dengan kesalahan autentikasi sebelum mengambil satu byte pun. Alurnya adalah:

• Masuk ke Hugging Face (atau daftar) dan instal huggingface_hub, lalu jalankan hf auth login sekali sehingga token Anda tersimpan di disk.

• Buka orcarouter/Qwen3.8-Flash-Next-Uncensored-GGUF di peramban, terima persyaratannya, lalu ulangi untuk orcarouter/Qwen3.8-Flash-Next-Uncensored-MLX.

• Sejak saat itu, unduhan hf dengan token terautentikasi Anda berfungsi seperti repo lainnya. Setiap kuant yang Anda tarik, dan bobot MLX, adalah artefak riset di bawah Apache-2.0 — lisensi yang sama dengan model dasar — dan gerbang tersebut adalah bagian dari kesepakatan: membaca ketentuan adalah langkah pertama dalam menggunakan model.

The orcarouter/Qwen3.8-Flash-Next-Uncensored-GGUF repository on Hugging Face, showing the gated access banner ('You need to agree to share your contact information to access this model'), the tags abliterated/uncensored/qwen4/Mixture of Experts/llama.cpp/vision-language/mmproj, and the Apache 2.0 licence.

Apa yang dilakukan abliteration terhadap MoE dengan routing

Tekniknya adalah edit bobot gaya Arditi yang telah kita bahas di tempat lain di blog ini; bagian yang menarik adalah apa yang dilakukannya terhadap arsitektur ini secara spesifik. Pada 27B dense, ada 131 matriks residual. Pada Qwen3.8-Flash-Next-Uncensored, kartu model MLX mencatat abliterasi yang diterapkan pada 149 tensor penulis residual, dan komponen yang menjadikan model ini seperti sekarang — router MoE, tabel embedding n-gram 51B, menara visi — secara eksplisit tidak pernah disentuh.

Ungkapan "tidak pernah disentuh" itulah inti cerita untuk model yang dirutekan. Setiap token mengaktifkan 10 dari 512 expert; tidak ada satu expert pun yang memiliki tanggung jawab atas penolakan. Perilaku penolakan tersebut hidup di dalam aliran residual yang menyusun keluaran akhir, yang justru merupakan arah yang dihilangkan oleh ortogonalisasi. Jadi, router tetap merutekan expert yang sama, tabel n-gram tetap menghasilkan embedding yang sama, dan yang berubah adalah apa yang dikatakan model begitu proyeksi keluaran dijalankan. Pemeriksaan yang dipublikasikan di kartu model GGUF menggambarkan bentuk perubahan tersebut sebagai penolakan prompt berbahaya yang turun dari 64–100% pada basis menjadi sekitar 0–3.3% pada build ini, penolakan berlebihan yang tidak berbahaya mendekati 0%, dan kemampuan dalam ±2 poin dari basis pada pemeriksaan gaya MMLU-Pro / GSM8K / CMMLU. Ini adalah angka-angka milik kartu itu sendiri, dilaporkan sendiri alih-alih direproduksi secara independen.

Kepala MTP: ada di MLX, dihilangkan di GGUF

Qwen3.8-Flash-Next menyertakan head prediksi spekulatif multi-token (~4B), dan kedua build tidak sepakat mengenainya. Repo GGUF tidak menyertakannya — kartu tersebut menjelaskan bahwa file-file ini tidak mencakup head draf spekulatif mtp — karena dukungan qwen4exp llama.cpp belum mengimplementasikan MTP, jadi head tersebut akan menjadi beban mati dalam file. Build MLX tetap menyimpannya, sehingga pada Apple Silicon Anda masih mendapatkan decoding spekulatif. Konsekuensi praktisnya, diperkuat oleh para praktisi yang menjalankan model dasar: jalur GGUF llama.cpp berjalan tanpa decoding spekulatif saat ini, sementara pengaturan SGLang dengan MTP lebih dari dua kali lipat decode pada kelas perangkat keras yang sama. Jika llama.cpp suatu saat menambahkan MTP untuk qwen4exp, lini GGUF akan mendapat peningkatan kecepatan gratis — tetapi jangan membeli perangkat keras dengan harapan itu minggu ini.

Klaim konteks 262K, dan berapa biaya cache KV

Konteks native adalah 262.144 token (dapat diperluas dengan YaRN mendekati 1M), dan kendala yang benar-benar terasa adalah memori. Kabar baiknya, arsitektur ini menjaga cache KV tetap kecil: dari 48 lapisan, 36 menggunakan atensi linear Gated DeltaNet, yang memampatkan riwayat menjadi state berulang berukuran tetap, dan hanya 12 lapisan atensi penuh yang membawa cache KV konvensional yang bertambah seiring panjang sekuens.

Dua titik data yang diukur oleh komunitas, keduanya pada model dasar, dapat langsung diterapkan. Sebuah penerapan GGUF dengan 4× RTX 3090 melaporkan peningkatan dari konteks 65K ke 131K hanya dengan tambahan KV sekitar 0,78 GB per kartu, dan satu DGX Spark menjalankan konteks penuh 262K dengan file kelas Q4 sambil menjaga model tetap berada di memori sekitar 76,9 GB dari pool 128 GB-nya dengan men-pin tabel n-gram ke CPU dan melakukan mmap dari NVMe. Baris anggaran pada model card GGUF itu sendiri adalah total = ukuran file + cache KV + mmproj sekitar 0,9 GB. Kesimpulannya untuk pilihan kuantisasi: pada 262K, cache KV merupakan pos yang signifikan, tetapi bobot adalah yang dominan, sehingga logika yang mengutamakan VRAM yang sama dari panduan GGUF 27B tetap berlaku — perbedaannya di sini adalah ukuran file itu sendiri, yang berkisar dari IQ2_XXS sekitar 52 GB hingga Q5_K_M sekitar 125 GB.

Baris GGUF: 13 quants, file terpisah, mmproj, dan build llama.cpp

Repositori GGUF menyediakan 13 tingkat kuantisasi — IQ2_XXS, IQ2_M, IQ3_XXS, IQ3_M, IQ4_XS, Q2_K, Q3_K_S, Q3_K_M, Q3_K_L, Q4_K_S, Q4_K_M, Q5_K_S, Q5_K_M — dengan kuantisasi IQ yang dibangun dari matriks kepentingan pada teks kalibrasi bahasa Inggris, bahasa Mandarin, dan kode. Setiap kuantisasi terdiri dari banyak bagian, dipisahkan dengan llama-gguf-split, jadi unduh seluruh rangkaian untuk satu kuantisasi dan arahkan loader ke bagian ...-00001-of-000NN.gguf. Tidak ada tingkat Q6_K, Q8_0, atau F16, dan alasannya bersifat struktural, bukan ekonomis: tabel embedding n-gram (PLE) adalah satu tensor yang terlalu besar untuk memenuhi batas 50 GB per file dari Hugging Face pada 6-bit ke atas, dan satu tensor GGUF tidak dapat dipecah antar file — sehingga lini produk berakhir pada Q5_K_M.

File lain yang tidak boleh Anda lewati adalah mmproj-...-F16.gguf, sekitar 0,9 GB: ini adalah model visi-bahasa, dan llama.cpp membutuhkan proyektor untuk setiap input gambar. Qwen3.8-Flash-Next bersifat multimodal, begitu juga build ini — abliterasi tidak menyentuh menara visi.

Dukungan llama.cpp belum ada di mainline. ID arsitekturnya adalah qwen4exp, dan build stok gagal dengan "unknown architecture 'qwen4_exp'"; Anda memerlukan build dari PR #27742 (cabang qwen4exp/qwen3.8-flash-next), yang dikompilasi dengan target llama-cli, llama-mtmd-cli, llama-server, dan llama-gguf-split. Dari sana, bentuk penyajiannya adalah server llama.cpp biasa dengan flag khusus Qw​en, menggunakan nama quant dari file bagian:

llama-server -m Qwen3.8-Flash-Next-Uncensored-Q4_K_M-00001-of-00003.gguf --jinja --mmproj mmproj-Qwen3.8-Flash-Next-Uncensored-F16.gguf -c 8192 --temp 1.0 --top-p 0.95 --top-k 20 --min-p 0.0

Setel -c ke konteks apa pun yang bisa Anda muat; contoh pada kartu dimulai dari 8192. Penalaran aktif secara default dan dikembalikan dalam reasoning_content, serta pemanggilan tool berfungsi melalui endpoint yang kompatibel dengan OpenAI. Nilai sampling di atas adalah rekomendasi dari model card; praktisi pada model dasar menggunakan temp 0.7 / top-p 0.80 / top-k 20 dengan presence penalty 1.5 dalam mode instruksi non-thinking, dan menyetel kedalaman penalaran dengan --chat-template-kwargs {"reasoning_effort":"medium"}.

Build MLX di Apple Silicon

Repositori MLX adalah jalur native Apple-Silicon: bobot yang sama, penghapusan penolakan yang sama, runtime native Metal. Repositori ini menyediakan versi 4-bit sebagai default (~163 GB), build 6-bit yang diumumkan (~192 GB), dan tingkatan 8-bit (~221 GB), dan karena para ahli fused-3D serta tabel n-gram dijaga pada presisi lebih tinggi daripada label nominal, presisi efektifnya jauh di atas 4-bit seragam — kartu tersebut mencantumkan ~7,85 bit efektif per bobot untuk label "4-bit". Inilah sebabnya ukuran repositori terlihat besar: tabel n-gram tidak dikecilkan seperti cara kuantisasi komunitas mengecilkannya.

The orcarouter/Qwen3.8-Flash-Next-Uncensored-MLX repository on Hugging Face, showing the gated access banner, the tags Mixture of Experts/vision-language/function-calling/reasoning/mtp/ai-red-team, licence apache-2.0, and the card line 'An abliterated (refusal-removed) MLX build (4/6/8-bit) of Qwen's Qwen3.8-Flash-Next for Apple Silicon'.

Perangkat keras adalah kendala yang mengikat. MLX hanya berjalan di Apple Silicon (Metal), dan Anda memerlukan memori terpadu untuk bobot — baris pada kartu modelnya adalah "sebuah Mac dengan memori terpadu yang cukup untuk bobot 163 GB (mis. M-series Ultra)". Anggap tingkat 4-bit sebagai mesin kelas 192 GB dan build 6-bit sebagai kelas 256 GB. Tag pada kartu mencatat set fitur lengkap — qwen4_exp, MoE, MTP, function calling, vision-language — dan dijalankan melalui mlx-vlm untuk input gambar. Kepala spekulatif MTP disertakan di sini, yang merupakan keunggulan diam-diam dari build MLX dibandingkan lini GGUF.

Jalur visi, bagi mereka yang menggunakannya.

Karena ini adalah model vision-language, jalur multimodal adalah bagian dari runbook, bukan tambahan. Pada llama.cpp, input gambar membutuhkan proyektor mmproj dan build yang menyertakan llama-mtmd-cli / llama-server. Pada MLX, Anda menjalankannya dengan mlx-vlm, bukan driver mlx-lm yang khusus teks. Bagi tim red team, jalur visi adalah tempat pekerjaan eval yang menarik: guardrail multimodal, prompt injection yang dibawa dalam gambar, OCR terhadap tangkapan layar sistem Anda sendiri, dan gambar adversarial yang ditujukan ke seluruh pipeline. Karena abliteration mencakup seluruh model dan membiarkan vision tower tetap utuh, gambar yang seharusnya memicu penolakan di text head hanya mendarat pada model tanpa perilaku penolakan yang bisa dipicu. Kartu GGUF menyatakan bahwa visi dan pemanggilan alat multi-turn diverifikasi pada build ini; tidak ada suite eval visi terpisah yang dipublikasikan.

Untuk apa ini, dan di mana letak garisnya

Build ini ada untuk satu kelas pekerjaan: mengevaluasi apa yang dapat dilakukan oleh model yang telah dihilangkan penolakannya, dalam rangka memahami dan mempertahankan sistem. Bagi red team, itu berarti menguji guardrail Anda sendiri terhadap model yang tidak akan menolak dengan sopan — ketahanan terhadap prompt injection, skenario eksfiltrasi, penyalahgunaan tool-use, serta celah antara "model dasar menolak" dan "model sebenarnya tidak dapat melakukan ini." Celah itulah seluruh nilai riset dari build yang diabliterasi: ia memberi tahu Anda apa yang disembunyikan oleh lapisan penolakan, yang merupakan perbedaan antara keamanan berbasis kebijakan dan keamanan berbasis kapabilitas. Bagi blue team, bobot yang sama adalah baseline yang masuk akal bagi musuh: jika aktor bermusuhan dapat mengunduh dan menjalankan ini, pertahanan Anda harus bertahan terhadap model yang menjawab daripada menolak. Evaluasi yang dibangun di atasnya adalah batas bawah dari apa yang dapat dilakukan oleh model khusus yang tidak pernah disejajarkan — perlakukan demikian, bukan sebagai batas atas.

Perjelas apa yang diubah dan tidak diubah oleh penghapusan penolakan. Hal ini mengubah perilaku keluaran—model tidak lagi menolak—dan tidak mengubah kapabilitas. Tidak ada pengetahuan baru, tidak ada keterampilan baru, tidak ada komputasi baru; pelatihan yang sama, batasan yang sama pada apa yang sebenarnya dapat dihasilkan model. Model yang diabliterasi tidak dapat merekayasa malware yang sebelumnya tidak mampu ia buat; ia hanya menjawab alih-alih menghindar, dan keluarannya tidak lebih jujur karena lebih permisif. Pita kapabilitas ±2 poin pada kartu dan runtuhnya angka penolakan adalah fakta yang sama yang dilihat dari dua sisi.

Di mana garis batasnya berada adalah perjanjian repositori berpagar, dan itu bukan sekadar boilerplate. Penggunaan yang sah: mengevaluasi sistem Anda sendiri, penelitian kerentanan publik pada model, membangun deteksi dan evaluasi defensif, mempelajari mekanisme penolakan. Tidak sah: menerapkan ini sebagai asisten yang menghadap pengguna, menghasilkan malware atau eksploitasi yang berfungsi terhadap sistem yang bukan milik Anda atau tanpa otorisasi untuk mengujinya, penipuan, materi senjata. Lisensi Apache-2.0 dan hukum yang berlaku adalah batas minimumnya; gerbangnya adalah perjanjian tujuan penelitian eksplisit di atasnya. Jika kasus penggunaan Anda adalah "mengirim chatbot kepada pengguna," ini bukan model Anda — dan itu memang disengaja, bukan kelalaian.

Cara mendapatkan baseline yang disajikan

Bobot-bobot ini sengaja hanya bersifat lokal: payload probe dari tim merah tidak boleh melewati API pihak ketiga, dan self-hosting adalah intinya. Ketika Anda menginginkan baseline yang disensor dan dilayani sebagai pembanding — Qwen3.8-Flash milik Alibaba dengan $0,16 per juta input dan $0,47 per juta output — OrcaRouter merutekannya pada harga daftar penyedia dengan markup 0% dan failover otomatis, sehingga eval harness dapat berpindah antara basis yang di-hosting dan build lokal tanpa sensor Anda hanya dengan satu kunci dan tanpa kontrak kedua. Bobot terbuka Qwen3.8-Flash-Next belum ada di katalog kami; ketika runtime yang kami rutekan membawanya, bobot tersebut akan masuk ke pengaturan satu-kunci, harga-daftar yang sama.

Mulai dari sini

Tentukan jalur mana yang sesuai dengan perangkat keras Anda, lalu baca gate yang relevan. Pada Mac dengan memori terpadu 128 GB+, build MLX memberi Anda MTP dan vision dalam satu tempat — terima persyaratan repo MLX, ambil bobot 4-bit atau 6-bit, dan jalankan dengan mlx-vlm. Pada NVIDIA, AMD, atau mesin CPU, build llama.cpp dari PR #27742, terima persyaratan repo GGUF, ambil quant yang sesuai, dan jangan lupa file mmproj. Dalam kedua kasus, angka penolakan dan rentang kapabilitas adalah milik repo itu sendiri, dipublikasikan di kartu dan belum direproduksi hingga tulisan ini dibuat — cara jujur untuk membacanya adalah sebagai pengukuran vendor atas editnya sendiri, bukan sebagai audit independen. Gate, lisensi, dan batas keamanan di atas adalah teks yang sama dari tiga sudut: ini adalah instrumen riset, dan dirilis dengan ketentuan itu.

Semua lima build Flash-Next — BF16, GGUF, MLX, FP8, dan NVFP4 — dikumpulkan dalam koleksi Qwen3.8-Flash-Next-Uncensored di Hugging Face.

Jangan dikelirukan dengan keluarga 27B: Qwen3.8-27B-Uncensored adalah model berbeda yang diabliterasi dari basis berbeda, dengan koleksi dan runbook-nya sendiri. Teknik yang sama, bobot yang berbeda.

Bobot ini memang hanya bersifat lokal. Sebagai baseline ter-hosting untuk mengukur build abliterated, Qwen3.8-Flash disajikan di OrcaRouter dengan harga daftar penyedia dan markup 0% — model standar dengan alignment keamanan yang masih utuh.

© 2026 OrcaRouter

Untuk Penyedia

Mengoperasikan platform inferensi? Hadirkan model Anda di OrcaRouter.

providers@orcarouter.ai

Gabung komunitas kami

Discordsupport@orcarouter.aiXGitHubYouTube