
Melayani Qwen3.8-Flash-Next-Uncensored-FP8: buku panduan vLLM untuk build block-FP8
- AlibabaBARUQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1 juta token
- z-aiBARUZ.ai: GLM 5.3 Flash2026-08-2658Kecerdasan72Koding
- DeepSeekBARUDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.15 / $0.29 per 1 juta token
- z-aiBARUZ.ai: GLM 5.32026-08-1860Kecerdasan75Koding
- obsidianQwen3.8 27B2026-08-1552Kecerdasan68Koding
- qwenQwen: Qwen3.8 27B (free)2026-08-13qwen/qwen3.8-27b-free
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1253Kecerdasan69Koding
- grokSpaceXAI: Grok 4.62026-08-1261Kecerdasan77Koding
- metaMeta: Muse Spark 1.22026-08-0557Kecerdasan72Koding
- qwenQwen: Qwen3.8 Max2026-08-0358Kecerdasan72Koding
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3152Kecerdasan69Koding
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 per 1 juta token
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463Kecerdasan78Koding
- googleGoogle: Gemini 3.6 Flash2026-07-2152Kecerdasan69Koding
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137Kecerdasan49Koding
- metaMeta: Muse Spark 1.12026-07-1653Kecerdasan71Koding
- kimiMoonshotAI: Kimi K32026-07-1560Kecerdasan76Koding
- openaiOpenAI: GPT-5.6 Luna2026-07-0952Kecerdasan71Koding
Qwen3.8-Flash-Next-Uncensored-FP8 — versi block-FP8 dari Flash-Next yang telah di-abliterasi — adalah artefak yang sebenarnya Anda unduh ketika menyajikan model ini pada perangkat keras pusat data, dan merupakan yang terakhir dalam koleksi yang mendapatkan runbook sendiri. Ia berada di orcarouter/Qwen3.8-Flash-Next-Uncensored-FP8 di Hugging Face: arah penolakan dihilangkan dari Qwen3.8-Flash-Next milik Qwen, lalu dikuantisasi ulang secara offline ke skema FP8 yang persis sama dengan Qwen3.8-Flash-Next-FP8 resmi sehingga vLLM menyajikannya pada jalur kernel yang identik. Ini adalah build yang akan dicari oleh siapa pun yang menjalankan model ini pada GPU kelas Hopper dan yang lebih baru, dan jalur penyajian memiliki satu flag yang mudah keliru dan sulit didiagnosis ketika keliru.
Pertama, batasannya, karena pembaca terus mengaburkannya dan itu mengubah segalanya di bawah ini. Qwen3.8-Flash-Next-Uncensored dan Qwen3.8-27B-Uncensored adalah dua model yang berbeda, bukan dua versi dari satu model. Bobot dasar berbeda — Qwen3.8-Flash-Next dibandingkan Qwen3.8-27B — arsitektur berbeda, rilis bobot berbeda, koleksi Hugging Face berbeda. Mereka berbagi teknik abliterasi dan nama keluarga; hanya itu. Tidak ada satu pun angka dari halaman 27B yang berlaku untuk model ini, dan jika Anda tiba di sini dari pencarian 27B, runbook lokal milik 27B adalah halaman terpisah dengan serangkaian keputusan terpisah.
Halaman ini adalah halaman penyajian Flash-Next FP8 dan tidak ada yang lain. Buku panduan GGUF/MLX mencakup penjelasan abliteration untuk model ini dan dua jalur build perangkat keras konsumen; teknik di balik seluruh keluarga ini dijelaskan dalam primer abliteration dan penjelasan uncensored-LLM yang lebih luas; dan Qwen3.8-27B-Uncensored-FP8, saudara yang mungkin Anda diarahkan ke sana, memiliki buku panduan FP8 sendiri. Di sini kami hanya membahas satu pertanyaan: bagaimana Anda menyajikan build block-FP8, apa yang rusak jika Anda melakukannya dengan salah, dan apa yang disampaikan serta tidak disampaikan oleh angka-angka pada kartu itu sendiri.
Sebelum Anda mulai: gerbang dan runtime
Dua hal yang menjadi gerbang repo ini, dan keduanya menghasilkan kegagalan yang terlihat seperti sesuatu yang lain.
Yang pertama adalah akses. Repositori ini dibatasi: Anda harus masuk ke Hugging Face dan telah menyetujui persyaratan repositori sebelum unduhan apa pun dapat berfungsi. Halaman model itu sendiri dapat dibaca tanpa akun — teks kartu lengkapnya bersifat publik — tetapi bobotnya tidak. Jelasnya, tanpa sesi masuk yang telah menyetujui persyaratan, hf download dan vllm serve orcarouter/Qwen3.8-Flash-Next-Uncensored-FP8 sama-sama gagal dengan kesalahan autentikasi, bukan pesan ramah “Anda perlu mengklik Agree.” Lakukan klik persetujuan sekali itu terlebih dahulu, lalu tarik ~186 GB dengan CLI hf atau biarkan vLLM menyelesaikan repositori pada saat pertama kali dijalankan.
Yang kedua adalah runtime-nya. Checkpoint tersebut terdaftar di bawah arsitektur qwen4_exp (Qwen4ExpForConditionalGeneration), yang tidak dapat dimuat oleh vLLM standar dan Transformers standar. Anda memerlukan image vLLM day-0 dan transformers 5.16+. Ini adalah kegagalan “tidak dapat dimuat” yang paling umum di seluruh runbook komunitas minggu ini — bukan unduhan yang rusak, melainkan runtime yang mendahului arsitektur tersebut. Image tersebut bukan opsional; itulah jalannya.
Perangkat keras, sehingga Anda dapat merencanakan sebelum mencabut apa pun: pemanggilan kartu tersebut menargetkan node 8-GPU, dan panduan resep vLLM resmi untuk checkpoint FP8 berlaku di sini karena build-nya cocok tensor-demi-tensor — sekitar 265 GB VRAM GPU untuk deployment satu node penuh, dengan TP2 diperlakukan sebagai minimum pada kelas GB300 dan TEP4/TEP8 sebagai konfigurasi full-tray yang tervalidasi.
Mengapa build FP8 ada — dan mengapa “jalur kernel yang identik” adalah inti dari semuanya
Bobot BF16 yang telah diabliterasi adalah sumber kebenaran; repositori ini adalah model tersebut yang dikuantisasi ulang secara offline, dengan sengaja mereproduksi resep resmi Qwen3.8-Flash-Next-FP8. Pengkuantisasi hanya menyentuh 512 proyeksi expert-routed — experts.{e}.down/gate/up_proj — melepas pemfusiannya dari tata letak 3D build BF16 dan menyimpan masing-masing sebagai bobot float8_e4m3fn plus skala weight_scale_inv BF16 dalam blok 128×128. Aktivasi adalah FP8 dinamis per-token; tidak ada set kalibrasi. Semua yang lain tetap BF16: attention dan linear_attn, expert bersama, router MoE (mlp.gate), mixer Hyper-Connection, embeddings, lm_head, kepala decoding spekulatif MTP, dan seluruh menara vision.
Pernyataan “jalur kernel yang identik” ini lebih dari sekadar pemasaran, dan layak mendapatkan satu kalimat. Build tersebut diverifikasi terhadap checkpoint FP8 resmi: skala blok mereproduksi secara persis (scale_relerr = 0) dan kode FP8 cocok hingga pembulatan sub-ULP. Itulah mengapa vLLM menjalankannya dengan kernel FP8 berskala blok yang sama dan decoding spekulatif MTP yang sama seperti rilis resmi — tensor-tensor tersebut secara efektif adalah tensor yang sama, minus arah penolakan.
Secara konkret, itu memberi Anda ~186 GB di 131 shard (152.089 tensor, 75.264 di antaranya FP8), 262.144 token konteks native, tower vision + video yang dipertahankan byte demi byte (333 tensor visual.*), dan head MTP yang tetap utuh. Bobotnya diabliterasi terlebih dahulu — satu refusal direction yang diestimasi pada layer 24 dan diortogonalisasi dari 149 tensor penulis residual dalam float32, mengikuti Arditi et al. (2024) — dan penulis residual head MTP diedit secara konsisten, sehingga speculative decoding tetap berfungsi. Detail terakhir itu tidak kentara, dan itulah perbedaan antara head yang mempercepat decode dan head yang secara diam-diam menurunkannya.

Satu bendera yang menentukan sukses atau gagalnya pemuatan.
Sajikan build ini tanpa --enable-expert-parallel dan Anda akan mendapatkan kegagalan yang terlihat seperti bug bentuk, bukan kesalahan konfigurasi. Ini adalah kegagalan penyajian yang paling banyak dilaporkan untuk checkpoint ini, dan sepenuhnya deterministik.
Berikut perhitungannya. Proyeksi gate+up gabungan dari para ahli yang dirutekan memiliki ukuran perantara 640. Block-FP8 melakukan kuantisasi dalam blok 128. Di bawah paralelisme tensor biasa, 640 tersebut dibagi antar rank — 640 ÷ TP — dan untuk derajat TP yang umum (2, 4, 8), irisan per rank tidak habis dibagi 128: TP8 menghasilkan 80, TP4 menghasilkan 160, TP2 menghasilkan 320. vLLM kemudian menolak memuat bobot dengan error yang tampak seperti ketidakcocokan bentuk: output_size dari bobot gate dan up = 80 tidak habis dibagi oleh block_n kuantisasi bobot = 128.
Paralelisme pakar memperbaikinya dengan memecah bobot pakar ke seluruh peringkat paralel-pakar, bukan peringkat paralel-tensor, yang mempertahankan batas blok FP8. Itulah sebabnya bendera ini wajib untuk build ini: dengan --enable-expert-parallel, TP8 menjadi TEP8 yang berfungsi. (Tidak berbahaya untuk build BF16, yang tidak memiliki blok FP8 untuk dipertahankan.) Resep resmi vLLM menyatakan secara eksplisit bahwa TP8 polos tidak kompatibel dengan blok kuantisasi 128-lebar dari checkpoint, dan sebuah isu vLLM yang diajukan dua hari setelah bobot dirilis mendokumentasikan kegagalan yang identik pada node 8×L40s di TP2, TP4, dan TP8. Jika pemuatan mati dengan kesalahan yang tampak seperti masalah bentuk, periksa benderanya sebelum memeriksa unduhan.
Perintah yang tepat.
Berikut adalah pemanggilan docker dari kartu tersebut, direproduksi dengan setia:
docker run -d --name flashnext --gpus all --ipc host -p 8000:8000 -v /path/to/Qwen3.8-Flash-Next-Uncensored-FP8:/model vllm/vllm-openai:qwen38-flash-next-x86_64-cu130 --model /model --served-model-name Qwen3.8-Flash-Next-Uncensored --tensor-parallel-size 8 --trust-remote-code --max-model-len 262144 --enable-expert-parallel --enable-auto-tool-choice --tool-call-parser qwen3_coder
Kerjakan bendera-bendera yang tidak jelas:
• vllm/vllm-openai:qwen38-flash-next-x86_64-cu130 — image qwen4_exp day-0. Ini bukan vLLM generik; ini adalah image khusus arsitektur, dan image standar yang mendahului qwen4_exp tidak akan dapat memuat checkpoint sama sekali.
• --trust-remote-code — memuat kode pemodelan qwen4_exp yang disertakan dalam repositori. Tanpa itu, loader menolak berdasarkan prinsip.
• --max-model-len 262144 — sesuai dengan jendela konteks asli. Anda ingin menentukannya secara eksplisit di sini daripada membiarkannya pada nilai bawaan.
• --enable-expert-parallel — diperlukan untuk build FP8, karena alasan-alasan pada bagian di atas. Kartu tersebut mencatat bahwa ini tidak berbahaya untuk BF16.
• --enable-auto-tool-choice --tool-call-parser qwen3_coder — mengaktifkan pemanggilan alat dan fungsi menggunakan format XML Qwen3-Coder. Jika dinonaktifkan, model tetap dapat mengobrol, tetapi penggunaan alat agen tidak aktif.
• --tensor-parallel-size 8 — pemanggilan kartu tersebut mengasumsikan node 8-GPU (8× Hopper-class). Dengan --enable-expert-parallel, itu adalah deployment TEP8.
Setelah kontainer aktif, endpoint-nya kompatibel dengan OpenAI di :8000/v1. Atur --served-model-name sesuai yang diharapkan klien Anda; kartu ini menggunakan Qwen3.8-Flash-Next-Uncensored.
Alternatif, semuanya ada di kartu atau didukung oleh para praktisi minggu ini: {{1}}vllm serve orcarouter/Qwen3.8-Flash-Next-Uncensored-FP8 secara langsung setelah sesi HF Anda diautentikasi;{{/1}} {{2}}SGLang melalui image lmsysorg/sglang:qwen38flashnext dengan --tp 8 --ep 8 — persyaratan expert-parallel yang sama, alasan yang sama;{{/2}} dan {{3}}Transformers dengan pipeline("image-text-to-text", ...) pada transformers 5.16+ jika Anda ingin membuat skrip terhadap model alih-alih melayankannya.{{/3}}
What actually works when you serve it
Pola-pola di bagian ini adalah temuan komunitas dari runbook praktisi dan utas forum minggu ini, bukan panduan vendor. Jika lebih dari satu pengaturan melaporkan perilaku yang sama, hal itu layak dianggap nyata:
• Dekoding spekulatif MTP berfungsi. Tambahkan --speculative-config '{"method":"mtp","num_speculative_tokens":3}' dan vLLM menggunakan MTP head yang dipertahankan. Beberapa runbook melaporkan MTP sebagai alasan dekode model ini tetap dapat digunakan meskipun ukurannya besar.
• OOM saat memuat? Offload tabel n-gram. Embedding n-gram PLE dengan 51 miliar parameter adalah kejutan memori dalam arsitektur ini. VLLM_PLE_CPU_OFFLOAD=1 memindahkannya ke RAM host — berikan setidaknya ~51 GB di sana. Resep resmi dan buku panduan multi-node komunitas sama-sama mengandalkan flag ini.
• Visi itu nyata, bukan sekadar sisa. Menara visi + video dipertahankan secara byte-for-byte, sehingga ini tetap menjadi model visi-bahasa yang lengkap. Kirim bagian konten image_url dalam chat completion dan endpoint yang sama melayani pemahaman gambar; pengujian OCR dari komunitas pada build ini melaporkan kelulusan yang bersih.
• Penalaran aktif secara default — dan ini mengubah gambaran keamanan. Template obrolan mengaktifkan pemikiran kecuali Anda menyatakan sebaliknya. Alihkan per permintaan dengan chat_template_kwargs={"enable_thinking": true|false}, dan tambahkan parser penalaran jika Anda ingin teks pemikiran dipisahkan dari jawaban. Karena default ini, Anda hampir selalu menyajikan model dengan pemikiran aktif kecuali Anda secara eksplisit mematikannya.
• 262 ribu native, 1 juta dengan override rope. Konteks native adalah 262.144 token. Untuk mencapai 1M, diperlukan override penskalaan rope YaRN yang eksplisit dan sebuah env var yang menaikkan batas max-model-len pada vLLM — dan Anda harus melakukan uji regresi kualitas konteks pendek terlebih dahulu, karena ekstensi 4× buta adalah saat kualitas konteks panjang biasanya menurun.

Apa yang dikatakan angka-angka pada kartu — dan apa yang tidak
Ini adalah pengukuran vendor sendiri terhadap edit buatannya sendiri, yang dipublikasikan dalam model card dan diukur pada bobot persis ini yang dilayani dengan vLLM dibandingkan dengan basis resmi di bawah skrip dan pengaturan yang identik. Laporkan sebagaimana adanya: indikatif, dan bukan audit independen.
Intinya adalah keruntuhan penolakan dengan pemikiran dimatikan. Pada suite prompt berbahaya di kartu tersebut (n dari 50 hingga 150 per benchmark), penolakan dasar berkisar 64–100% dan build ini 0–2.7%: AdvBench 100%→2.0%, JailbreakBench 94%→0.0%, StrongREJECT 99.3%→1.3%, HarmBench 100%→1.3%, MaliciousInstruct 98%→0.0%, SimpleSafetyTests 64%→2.0%, ForbiddenQuestions 75.3%→2.7%, dan probe khusus Tionghoa/Inggris 63.6%→0.0%.
Sekarang bagian yang jujur. Tingkat penolakan model dasar itu sendiri anjlok ketika pemikiran diaktifkan — AdvBench turun dari 100% pada model dasar menjadi 7,0% dengan penalaran aktif — jadi perbandingan dengan pemikiran aktif jauh kurang dramatis: build ini berada di 0,0% di seluruh rangkaian yang sama, tetapi ini mengurangi angka kecil dari angka yang sudah dikurangi model dasar. Mengutip hanya angka dengan pemikiran nonaktif berarti Anda menyajikan separuh cerita yang menyanjung, dan justru separuh itulah yang tidak boleh diandalkan oleh evaluasi keselamatan.
Over-refusal pada prompt yang tidak berbahaya (XSTest-safe, n=250) turun dari 9,6% pada basis menjadi 1,2% pada build ini dengan pemikiran dimatikan — peningkatan nyata, karena model yang menolak prompt tidak berbahaya adalah mode kegagalan yang lebih senyap. Retensi kapabilitas pada MMLU / MMLU-Pro / GSM8K / CMMLU menunjukkan delta masing-masing −2,0, −1,2, −1,3, dan −0,6 poin, konsisten dengan klaim bahwa mengortogonalisasi satu arah membutuhkan biaya hampir nol pada kapabilitas umum. Pemanggilan alat, visi/OCR, dan penalaran semuanya dilaporkan berfungsi pada build ini.
Dua catatan penting menyertai semua hal di atas. Metrik penolakan berasal dari pengklasifikasi frasa pembuka berbasis aturan, yang oleh kartu itu sendiri disebut indikatif, bukan angka dari penilai LLM atau berstandar publikasi — panel manusia atau model penilai tidak akan mereproduksi angka-angka persis ini. Dan kolom peringatan itu penting: pada rangkaian mode berpikir nonaktif, sekitar setengah hingga tiga perempat keluaran build ini masih diawali dengan penyangkalan singkat sebelum mematuhi. Model ini jarang menolak; ia bersikap hati-hati. “Uncensored” di sini berarti ia menjawab, bukan bahwa ia menjawab tanpa kata pengantar.
Bagian keselamatan bukanlah formalitas belaka.
Baca ini sebelum kamu menarik beban, bukan setelahnya.
Model ini telah mengalami penghapusan penyelarasan keamanannya {{1}}secara substansial{{/1}}, dan mekanismenya spesifik: {{2}}arah penolakan tunggal diestimasi{{/2}} dalam aliran residual dan diortogonalisasi keluar dari setiap matriks penulisan residual — {{3}}149 di antaranya{{/3}} — dihitung dalam float32. Konsekuensinya {{4}}diiklankan, bukan tidak disengaja{{/4}}. Kartu tersebut dengan blak-blakan menyatakan bahwa model akan mematuhi permintaan berbahaya, tidak etis, ofensif, atau ilegal yang akan ditolak oleh Qwen3.8-Flash-Next dasar, dan bahwa model ini tidak memiliki pengaman bawaan yang bermakna. Model ini dirilis {{5}}secara ketat untuk penelitian yang sah{{/5}} — interpretabilitas, studi keamanan AI dan mekanisme penolakan, red-teaming, evaluasi ketahanan, dan eksperimen terkontrol — dan pengguna memikul {{6}}tanggung jawab dan kewajiban penuh{{/6}} atas apa yang dihasilkannya. {{KEEP}}Apache 2.0{{/KEEP}} mengatur apa yang boleh Anda lakukan dengan bobot-bobot tersebut.
Dua hal yang harus dilakukan dengan tepat, karena build ini membuatnya mudah untuk salah.
Pertama, probe jailbreak yang “berhasil” terhadap model ini bukanlah evaluasi keamanan yang lulus. Itu adalah perilaku yang diiklankan. Jika klaim evaluasi Anda adalah “keamanan model ini telah ditembus,” Anda telah mengukur desainnya, bukan kerentanannya. Yang sebenarnya menjadi temuan adalah penolakan yang bertahan dari abliteration, atau regresi kemampuan — dan angka-angka pada kartu menunjukkan keduanya jarang terjadi.
Kedua, permukaan serangan yang dipertahankan lebih luas daripada teks. Menara visi tetap utuh byte-demi-byte dan pemanggilan alat berfungsi, sehingga input gambar dan penggunaan agen sama-sama aktif. Rencana tim merah yang hanya menguji prompt teks akan melewatkan modalitas yang sebenarnya diekspos oleh model ini. Dan angka penolakan di atas adalah pengklasifikasi berbasis aturan pada edit vendor itu sendiri — itu bukan audit independen terhadap apa pun, termasuk keamanan.
Jangan sebarkan ini kepada pengguna akhir atau ke produksi tanpa menambahkan lapisan keamanan, moderasi, dan pencegahan penyalahgunaan Anda sendiri. Ketentuan repositori menyatakannya dengan gamblang, dan ini bukan formalitas belaka: keluaran tidak mencerminkan pandangan pengunggah atau Qwen / Alibaba.

Bagaimana cara mendapatkan baseline yang tersensor untuk perbandingan
Jika pekerjaan Anda adalah riset mekanisme penolakan (refusal) atau red-teaming, Anda hampir pasti menginginkan pasangan model yang disensor ini berdampingan — arsitektur yang sama tanpa edit — untuk mengukur delta-nya. Build tanpa sensor ini memang dirancang hanya bersifat lokal: repo-nya digated dan tidak memiliki deployment inferensi yang dihosting, yang disengaja agar payload sensitif tidak pernah transit melalui API pihak ketiga.
Untuk baseline yang di-hosting, OrcaRouter merutekan jalur Qwen dengan harga daftar vendor tanpa markup — Qwen3.8-Flash sebesar $0,15 per juta token masukan dan $0,47 per juta keluaran, diteruskan apa adanya, dengan failover otomatis dan satu kunci untuk 200+ model. Perubahan harga vendor muncul pada hari yang sama. Jika Anda mempertimbangkan apakah akan menjalankan build ini sama sekali, atau seberapa besar tumpukan Anda yang dapat ditanganinya, itu adalah cara murah untuk membandingkan versi yang disensor dengannya tanpa kontrak kedua atau codebase kedua.
Mulai dari sini
Ringkasan keputusan. Anda memerlukan: akun Hugging Face dengan persyaratan repositori yang disetujui; node kelas Hopper atau yang lebih baru — perintah kartu tersebut menargetkan 8 GPU, dan sekitar 265 GB VRAM GPU sesuai panduan resep resmi untuk checkpoint FP8 yang cocok; image vLLM day-0 dan transformers 5.16+; serta sekitar 186 GB disk untuk bobot.
Urutan menjalankan: terima persyaratan repo → unduh bobot → tarik image day-0 → layani dengan --enable-expert-parallel → verifikasi dengan permintaan ke :8000/v1/chat/completions → lalu mulai evaluasi Anda. Jika pemuatan gagal dengan error yang terlihat seperti shape, periksa flag sebelum memeriksa unduhan.
Dan pertahankan kerangkanya. Ini adalah instrumen penelitian, dirilis dengan kondisi tersebut. Angka-angkanya adalah pengukuran indikatif dari vendor itu sendiri pada editnya sendiri. Perilaku keamanannya adalah inti dari latihan ini, bukan bug yang harus diakali. Sajikan, ukur, dan letakkan moderasi Anda sendiri di antara hal itu dan apa pun yang bersifat manusiawi.
Semua lima build Flash-Next — BF16, GGUF, MLX, FP8, dan NVFP4 — dikumpulkan dalam koleksi Qwen3.8-Flash-Next-Uncensored di Hugging Face.
Model yang berbeda, bukan build lain dari model ini: Qwen3.8-27B-Uncensored adalah hasil abliterasi dari basis yang berbeda dan memiliki koleksi serta runbook-nya sendiri.
Bobot ini memang hanya bersifat lokal. Sebagai baseline ter-hosting untuk mengukur build abliterated, Qwen3.8-Flash disajikan di OrcaRouter dengan harga daftar penyedia dan markup 0% — model standar dengan alignment keamanan yang masih utuh.
