
Qwen3.8-27B-Uncensored-NVFP4: Buku Panduan Serving untuk GPU Blackwell
- AlibabaBARUQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1 juta token
- z-aiBARUZ.ai: GLM 5.3 Flash2026-08-2658Kecerdasan72Koding
- DeepSeekBARUDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.15 / $0.29 per 1 juta token
- z-aiBARUZ.ai: GLM 5.32026-08-1860Kecerdasan75Koding
- obsidianQwen3.8 27B2026-08-1552Kecerdasan68Koding
- qwenQwen: Qwen3.8 27B (free)2026-08-13qwen/qwen3.8-27b-free
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1253Kecerdasan69Koding
- grokSpaceXAI: Grok 4.62026-08-1261Kecerdasan77Koding
- metaMeta: Muse Spark 1.22026-08-0557Kecerdasan72Koding
- qwenQwen: Qwen3.8 Max2026-08-0358Kecerdasan72Koding
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3152Kecerdasan69Koding
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 per 1 juta token
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463Kecerdasan78Koding
- googleGoogle: Gemini 3.6 Flash2026-07-2152Kecerdasan69Koding
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137Kecerdasan49Koding
- metaMeta: Muse Spark 1.12026-07-1653Kecerdasan71Koding
- kimiMoonshotAI: Kimi K32026-07-1560Kecerdasan76Koding
- openaiOpenAI: GPT-5.6 Luna2026-07-0952Kecerdasan71Koding
Qwen3.8-27B-Uncensored-NVFP4 telah tersedia di Hugging Face sejak 19 Agustus 2026, dan dalam sepuluh hari sejak itu, model ini telah diunduh sekitar 32.700 kali. Ini bukan liputan peluncuran — bobot modelnya baru berumur sepuluh hari, tidak ada pengumuman yang perlu diberitakan, dan build saudaranya Qwen3.8-27B-Uncensored-FP8 dan Qwen3.8-27B-Uncensored-GGUF sudah didokumentasikan di blog ini. Ini adalah runbook untuk build yang sedang aktif diunduh orang saat ini: apa sebenarnya NVFP4 itu, mengapa build spesifik ini mencampurnya dengan FP8, GPU mana yang diuntungkan dan mana yang tidak, cara menyajikannya, dan siapa yang sebaiknya memilih build ini daripada build FP8 atau GGUF — dan siapa yang tidak.
Satu hal di awal, karena itu menjebak setiap pengunduh pertama kali: repo tersebut dibatasi. Yang naif adalah hf download orcarouter/Qwen3.8-27B-Uncensored-NVFP4, yaitu perintah satu baris, yang gagal dengan kesalahan autentikasi sampai Anda masuk ke Hugging Face dan menyetujui syarat akses repo di halaman model. Semua hal di bawah ini mengasumsikan Anda telah melakukan keduanya.
Juga di awal: kartu model repositori ini berada di balik gerbang yang sama, jadi tidak ada apa pun di sini yang memparafrasekannya. Apa yang berikut ini berpijak pada daftar berkas publik dan metadata repositori, pada dokumentasi publik NVIDIA tentang NVFP4, dan pada laporan lapangan dari orang-orang yang menjalankan build Qwen3.8-27B NVFP4 di Blackwell. Jika suatu angka berasal dari praktisi, bukan vendor, teks tersebut menyebutkannya.

Apa itu build ini
Qwen3.8-27B-Uncensored-NVFP4 adalah kuantisasi NVFP4 dari Qwen3.8-27B-Uncensored, versi abliterasi dari model Alibaba Qwen/Qwen3.8-27B, yang diterbitkan oleh org orcarouter pada 2026-08-18. Abliterasi menghilangkan arah penolakan model dari aliran residual; teknik tersebut dijelaskan dalam penjelasan model tanpa sensor kami dan tidak dijelaskan ulang di sini. Basisnya adalah 27B dense dengan attention hibrida — 48 lapisan linear-attention ditambah 16 lapisan full-attention — pemahaman gambar dan video native, konteks 262.144 token, dan head decoding spekulatif MTP bawaan. Apache 2.0 end to end.
Yang membuat build ini menarik bukanlah abliteration-nya, melainkan tata letak kuantisasinya, karena build ini memang sengaja merupakan build terkuantisasi — jika Anda mencari NVFP4, format itulah intinya. Berdasarkan metadata publik repo dan konfigurasi kuantisasinya, build ini adalah build compressed-tensors dengan presisi campuran: proyeksi attention menggunakan FP8 (E4M3), MLP menggunakan NVFP4 (4-bit, terkemas), sedangkan vision encoder, MTP head, lm_head, serta norm dan bias linear-attention dibiarkan dalam BF16. Metadata safetensors pada daftar file publiknya sejalan dengan skema tersebut: sekitar 3,5 miliar parameter dalam BF16, 9,4 miliar dalam FP8-E4M3, dan 15 miliar dalam tensor 4-bit terkemas, sekitar 24,7 GB di disk yang tersebar di lima shard ditambah satu shard model-extra terpisah. Tidak ada satu pun dari itu yang merupakan klaim tentang performa serving-nya — VRAM runtime dan throughput untuk repo yang persis ini tidak dipublikasikan di mana pun yang bisa saya kutip saat ini. Ukuran di disk berasal dari daftar file, format berasal dari konfigurasi, dan perilaku serving di bawah ini telah diverifikasi komunitas pada build NVFP4 yang sangat mirip.
Apa itu NVFP4, dan bagaimana perbedaannya dengan FP8 serta INT8/AWQ.
NVFP4 adalah format floating-point 4-bit NVIDIA, yang diperkenalkan untuk inti tensor generasi kelima pada Blackwell, dan blog teknis resmi NVIDIA adalah sumber primer yang tepat untuk itu. Format ini menyimpan bobot sebagai E2M1 — satu bit tanda, dua bit eksponen, satu bit mantissa — dan menskalakannya dalam blok: setiap 16 nilai berbagi skala E4M3 FP8, dan seluruh tensor mendapatkan skalar FP32 per-tensor. Skema dua tingkat itulah inti dari format ini: skema ini memulihkan rentang dinamis yang akan hilang pada float 4-bit yang naif, dengan mengorbankan beberapa bit overhead per blok. Perbedaan praktisnya, dalam bentuk satu baris:
• NVFP4 vs FP8 — keduanya merupakan floating-point, tetapi FP8 (E4M3, 8-bit) berjalan di Hopper dan Blackwell, sementara NVFP4 adalah 4-bit dan hanya dipercepat secara native di Blackwell. NVIDIA menyebutkan bobot yang kira-kira 3,5× lebih kecil daripada FP16 dan sekitar 1,8× lebih kecil daripada FP8, dan di Blackwell matmul berjalan langsung pada inti tensor FP4.
• NVFP4 vs INT8/AWQ — INT8 (W8A8) dan AWQ (W4A16) adalah format integer yang berjalan mulai dari Ampere; AWQ adalah 4-bit tetapi integer, dan pada kebanyakan perangkat keras bobot didekuantisasi ke tipe yang lebih lebar untuk matmul. NVFP4 adalah float 4-bit dengan penskalaan blok, sehingga menjaga lebih banyak presisi pada bit rendah, dan memiliki jalur GEMM FP4 asli yang tidak dimiliki format integer.
• NVFP4 vs MXFP4 — keduanya sering tertukar. MXFP4 menggunakan blok 32-elemen dengan skala E8M0 (pangkat dua); NVFP4 menggunakan blok 16-elemen dengan skala E4M3. Blok yang lebih halus memberi NVFP4 isolasi pencilan yang lebih baik, itulah sebabnya format ini menjadi standar 4-bit de-fakto pada tumpukan serving Blackwell.

Perangkat keras mana yang diuntungkan — dan mana yang tidak
Satu fakta terpenting tentang build ini: NVFP4 adalah format Blackwell. Ia hanya bermanfaat pada GPU yang tensor core-nya mengimplementasikan FP4 GEMM secara native, dan pada apa pun selain itu, ia adalah alat yang salah, tidak peduli seberapa cepat mesinnya di atas kertas.
• Blackwell — RTX 50-series, B200/B300, RTX PRO 6000, DGX Spark (GB10) — di sinilah NVFP4 menjadi pilihan yang tepat: inti tensor FP4 native, jejak terkecil kelas server di lini tanpa sensor, dan format yang memang menjadi tujuan pembuatan build ini.
• Hopper — H100/H200 — tidak ada GEMM FP4 asli. NVFP4 terdegradasi menjadi jalur dekuantisasi khusus-berat yang lebih lambat dan tidak memberi manfaat apa pun. Gunakan Qwen3.8-27B-Uncensored-FP8 di sini; build tersebut terverifikasi pada perangkat keras yang persis ini.
• Ampere/Ada — RTX 3090/4090 — NVFP4 juga tidak mempercepat pada keduanya. Build GGUF, dengan tingkat Q4_K_M-nya pada 16,8 GB, adalah alat yang tepat untuk kartu 24 GB.
• Apple Silicon — NVFP4 tidak relevan di Mac. Build MLX (atau GGUF) itulah yang berjalan.
Satu nuansa jujur: fork komunitas memang menjalankan NVFP4 weight-only pada hardware pra-Blackwell. Build NVFP4 komunitas dari model abliterated yang sama secara eksplisit disiapkan untuk kartu kelas V100 melalui fork vLLM yang di-patch, dan resep DGX Spark terbaru seputar Qwen3.8-27B adalah urusan tersendiri. Itu adalah jalur khusus dengan peringatannya masing-masing, bukan target build ini. Jika Anda menggunakan Blackwell, semua itu tidak relevan; jika tidak, build FP8 atau GGUF adalah unduhan yang lebih baik.
Cara menyajikannya
Repositori ini diberi tag untuk vLLM, dan format compressed-tensors dibaca secara otomatis dari config.json — Anda tidak memilih skema kuantisasi secara manual. Stack yang disepakati para praktisi untuk build Qwen3.8-27B NVFP4 adalah vLLM terbaru di kartu Blackwell, cache KV FP8, dan head MTP milik model itu sendiri yang digunakan untuk decoding spekulatif. Panduan NVFP4 dari Unsloth, yang merupakan referensi komunitas yang paling banyak dikutip, merekomendasikan vLLM 0.25.0 atau lebih baru dengan FlashInfer dan dependensi kernel CUTLASS-DSL untuk jalur FP4 yang cepat.
Titik awal yang berfungsi, dirangkai dari flag-flag terverifikasi build FP8 kami dan resep-resep NVFP4 komunitas, semuanya dalam satu baris:
vllm serve orcarouter/Qwen3.8-27B-Uncensored-NVFP4 --kv-cache-dtype fp8 --max-model-len 262144 --reasoning-parser qwen3 --enable-auto-tool-choice --tool-call-parser qwen3_coder --speculative-config '{"method": "mtp", "num_speculative_tokens": 3}'
• FP8 KV cache — cara yang paling kompatibel secara luas untuk mengurangi separuh memori cache; para praktisi melaporkan bahwa ini kira-kira menggandakan konteks yang dapat Anda simpan. Dukungan NVFP4 KV-cache ada tetapi terbatas pada beberapa backend attention, jadi FP8 KV adalah default yang lebih aman.
• decoding spekulatif MTP — model ini dilengkapi dengan kepala draf MTP, dan kuantisasi mempertahankannya dalam BF16. Para praktisi melaporkan bahwa dua hingga tiga token draf bekerja dengan baik dengan bobot NVFP4 di Blackwell, dengan peningkatan terbesar pada output terstruktur seperti JSON dan panggilan alat.
• Visi — encoder visi dipertahankan dalam BF16 pada build ini. Tambahkan --language-model-only untuk melayani teks-saja; hapus jika Anda membutuhkan input gambar atau video.
• Pada DGX Spark — beberapa kendala yang dilaporkan dari lapangan: pertahankan --gpu-memory-utilization pada atau di bawah 0,90 (nilai yang lebih tinggi telah menyebabkan mesin macet saat pemuatan bobot), dan tambahkan --safetensors-load-strategy lazy jika memori terbatas. Anda juga memerlukan build GB10 dari vLLM untuk kernel sm_121a.
Sejujurnya soal kinerja: tidak ada angka throughput independen yang dipublikasikan untuk repo yang persis ini. {{1}}Pengukuran yang ada adalah untuk build NVFP4 yang terkait erat.{{/1}} {{2}}Unsloth melaporkan 1,41–1,49× token per detik dibandingkan BF16 pada B200 untuk build Qwen3.8-27B-NVFP4 miliknya sendiri (89,8 hingga 133,7 tok/s pada batch 1, 3.048 hingga 4.407 pada batch 64), dan satu pengguna DGX Spark di forum NVIDIA melaporkan sekitar 20–32 tok/s dengan bobot NVFP4, cache KV FP8, dan kedalaman MTP 3.{{/2}} {{3}}Keduanya layak dikutip; tidak satu pun dari keduanya merupakan benchmark untuk repo ini.{{/3}}
Pola penggunaan yang benar-benar berhasil
Para praktisi yang menjalankan model keluarga Qwen3.8-27B pada Blackwell akhirnya menggunakan sejumlah pengaturan yang sama. Anggap ini sebagai laporan lapangan, bukan panduan vendor — Qwen tidak mendokumentasikan sebagian besar hal ini, dan kartu repo ini sendiri pun dibatasi aksesnya.
• reasoning_effort adalah pengaturan yang paling penting.Nilai default xhigh membuat model berpikir lama untuk setiap permintaan. Pengguna yang menjalankan loop agen menyetel medium secara default dan menurunkannya ke low — atau menonaktifkan pemikiran sepenuhnya dengan enable_thinking: false — untuk panggilan tunggal yang sensitif terhadap latensi. Pada satu GPU Blackwell, reasoning xhigh pada tugas rutin adalah cara Anda berakhir dengan model cepat dan jawaban lambat.
• Sampler dipasangkan dengan mode berpikir, tidak independen. Konsensus komunitas: mode berpikir aktif berjalan pada suhu 1.0 / top_p 0.95; mode berpikir nonaktif berjalan pada suhu 0.7 / top_p 0.80 dengan presence_penalty 1.5. Menukar kedua set tersebut menurunkan kualitas keluaran.
• Gunakan template chat terkini. Template qwen3_5 membungkus setiap giliran asisten dalam blok think, dan banyak praktisi melaporkan jawaban yang berulang atau terpotong dengan template yang usang; varian Qwen-Fixed-Chat-Templates dan Qwen-Sharp yang diperbaiki komunitas menetapkan preserve_thinking dan menghentikan perulangan. Jika output yang disajikan bertele-tele melewati token berhenti, ini adalah hal pertama yang perlu diperiksa.
• Alokasikan anggaran untuk jejak penalaran yang panjang dalam pekerjaan agen. Para praktisi melaporkan bahwa model generasi 3.8 mengeluarkan kira-kira dua kali lipat token per tugas dibandingkan pendahulunya, 3.6 — lonjakan kualitas sebagian berasal dari pemikiran yang lebih lama. Untuk jawaban xhigh yang panjang, streaming keluaran penalaran atau Anda akan mengalami timeout gateway.
• Pemanggilan tool tetap utuh melalui kuantisasi. Jalur pemanggilan fungsi tetap bertahan terhadap abliterasi dan konversi 4-bit; aktifkan dengan parser pemanggilan tool qwen3_coder dan model memilih tool dengan cara yang sama seperti model dasar.

Siapa yang sebaiknya memilih build ini — dan siapa yang tidak
Keputusan yang jujur, tanpa mengulangi matematika pemilihan kuantisasi yang telah dibahas secara rinci dalam postingan FP8 dan GGUF kami:
• Pilih NVFP4 jikaAnda melayani model di Blackwell dan menginginkan jejak terkecil kelas server dalam lini tanpa sensor dengan kecepatan inti tensor FP4 — dan Anda melakukan penelitian, red-team, atau pekerjaan interpretabilitas yang secara sah membutuhkan model abliterated.
• Pilih Qwen3.8-27B-Uncensored-FP8 jika Anda menggunakan Hopper, atau menginginkan jalur vLLM yang paling terverifikasi secara luas — ini adalah bobot yang sama pada 8-bit, terverifikasi di H200, dengan kebutuhan VRAM minimal sekitar 40 GB.
• Pilih Qwen3.8-27B-Uncensored-GGUF jika Anda menggunakan GPU konsumen atau Mac, atau ingin menggunakan llama.cpp daripada vLLM — tier Q4_K_M adalah pilihan terbaik untuk penggunaan lokal.
• Jangan pilih salah satu pun jika Anda ingin fidelitas maksimal, Anda membangun sesuatu yang menghadap pengguna (lihat batas keamanan di bawah), atau Anda sama sekali tidak ingin melakukan self-host — lini tanpa sensor yang sama disediakan melalui OrcaRouter yang dibatasi untuk peneliti, jadi tidak diperlukan GPU.
Batas keamanan — hanya untuk penelitian
Ini adalah model yang di-abliterasi, dan kuantisasi tidak memasang kembali pengaman. Arah penolakan telah dihapus dari aliran residual Qwen/Qwen3.8-27B, dan NVFP4 adalah perubahan presisi, bukan intervensi keselamatan — model ini akan mematuhi permintaan yang ditolak oleh model dasar, dan build ini tidak memiliki moderasi bawaan. Dirilis untuk interpretabilitas, keselamatan AI, dan riset red-team di bawah Apache 2.0, dan tanggung jawab sepenuhnya ada di tangan Anda.
Dua catatan evaluasi yang terlalu jarang muncul dalam ruang model tanpa sensor. Pertama, satu probe jailbreak yang lolos secara sepele bukanlah evaluasi keamanan yang lulus — model yang diabliterasi memang sengaja gagal pada pengujian semacam itu. Ukur hal yang benar-benar Anda pedulikan dengan baterai pengujian yang tepat (AdvBench, HarmBench, dan StrongREJECT untuk tingkat kebahayaan; XSTest-safe untuk penolakan berlebihan) dan bandingkan tingkat penolakan sebelum dan sesudah intervensi. Kedua, evaluasi kuantisasinya, bukan hanya basisnya: build 4-bit dapat mengubah perilaku pada kasus-kasus tepi bahkan ketika skor agregatnya terlihat baik. Jangan sebarkan ini ke pengguna akhir tanpa lapisan moderasi dan pencegahan penyalahgunaan Anda sendiri.
Di mana OrcaRouter cocok
Build kuantisasi berumur sepuluh hari adalah contoh klasik untuk routing daripada hardwiring. Anda dapat membuat rute yang mengarah ke build NVFP4 yang Anda jalankan sendiri, lalu gagal beralih ke model yang dihosting jika build tersebut bermasalah di bawah beban — satu antarmuka, tanpa pengkabelan ulang antar penyedia saat Anda berpindah. OrcaRouter meneruskan harga daftar penyedia dengan markup 0%, jadi jika harga model yang mendasarinya berubah, endpoint Anda akan merefleksikannya pada hari yang sama daripada pada siklus penagihan Anda.
Dan jika tujuan utamanya adalah menghindari menjalankan GPU sama sekali: jalur tanpa sensor yang sama tersedia melalui OrcaRouter, dikhususkan untuk peneliti keamanan dan red team, dengan failover otomatis di berbagai penyedia. Baik Anda menghosting sendiri build NVFP4 ini atau menggunakan jalur yang dihosting, keduanya hanya memerlukan satu kunci API.
Intinya
Qwen3.8-27B-Uncensored-NVFP4 adalah unduhan yang tepat jika Anda melayani model abliterated di Blackwell dan menginginkan jejak terkecil dengan kecepatan inti tensor FP4. Ini adalah unduhan yang salah di Hopper (gunakan build FP8), di GPU konsumen atau Apple (gunakan build GGUF atau MLX), atau jika Anda memerlukan fidelitas maksimum. Ini bukan hal baru — sudah dapat diunduh sejak 19 Agustus 2026 — tetapi sedang diunduh dalam jumlah besar, dan sekarang Anda tahu apa yang Anda hadapi sebelum menerima gerbang tersebut.
Bukan sekadar build lain dari model ini — Qwen3.8-Flash-Next-Uncensored adalah rilis terpisah: diabliterasi dari Qwen3.8-Flash-Next, sebuah pratinjau mixture-of-experts dengan 176B parameter tersimpan / 6B aktif dari arsitektur Qwen4. Teknik abliterasi yang sama, bobot yang berbeda, koleksinya sendiri.
Keenam build 27B — BF16, GGUF, MLX, FP8, INT8, dan NVFP4 — dikumpulkan dalam koleksi Qwen3.8-27B-Uncensored di Hugging Face.
Bobot-bobot ini secara desain hanya bersifat lokal. Untuk baseline yang di-host sebagai pembanding build yang diabliberasi, Qwen3.8-27B disajikan di OrcaRouter dengan harga daftar penyedia tanpa markup — model stok, alignment keamanannya tetap utuh.
