
Qwen3.8-Flash-Next-Uncensored-NVFP4: Buku Panduan Operasional Serving Blackwell
- AlibabaBARUQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1 juta token
- z-aiBARUZ.ai: GLM 5.3 Flash2026-08-2658Kecerdasan72Koding
- DeepSeekBARUDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.15 / $0.29 per 1 juta token
- z-aiBARUZ.ai: GLM 5.32026-08-1860Kecerdasan75Koding
- obsidianQwen3.8 27B2026-08-1552Kecerdasan68Koding
- qwenQwen: Qwen3.8 27B (free)2026-08-13qwen/qwen3.8-27b-free
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1253Kecerdasan69Koding
- grokSpaceXAI: Grok 4.62026-08-1261Kecerdasan77Koding
- metaMeta: Muse Spark 1.22026-08-0557Kecerdasan72Koding
- qwenQwen: Qwen3.8 Max2026-08-0358Kecerdasan72Koding
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3152Kecerdasan69Koding
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 per 1 juta token
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463Kecerdasan78Koding
- googleGoogle: Gemini 3.6 Flash2026-07-2152Kecerdasan69Koding
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137Kecerdasan49Koding
- metaMeta: Muse Spark 1.12026-07-1653Kecerdasan71Koding
- kimiMoonshotAI: Kimi K32026-07-1560Kecerdasan76Koding
- openaiOpenAI: GPT-5.6 Luna2026-07-0952Kecerdasan71Koding
Qwen3.8-Flash-Next-Uncensored-NVFP4 berjalan pada tepat satu keluarga GPU: Blackwell. NVFP4 berjalan pada inti tensor FP4 perangkat keras, dan Hopper (H100/H200) serta apa pun yang lebih lama tidak memilikinya. Jika Anda menggunakan Hopper, berhenti di sini — yaitu Qwen3.8-Flash-Next-Uncensored-FP8 build adalah yang Anda inginkan. Semua hal di bawah ini mengasumsikan Blackwell (B100, B200, GB200, atau kartu RTX 50-series), build vLLM terbaru dengan dukungan qwen4_exp, dan transformers ≥ 5.16.
Ini adalah kuantisasi NVFP4 dari build abliterated (tanpa penolakan) milik Qwen, yaitu Qwen/Qwen3.8-Flash-Next, yang dipangkas dari 330 GB dalam BF16 menjadi 178 GB di disk. OrcaRouter menerbitkannya ke Hugging Face pada 27 Agustus 2026 sebagai orcarouter/Qwen3.8-Flash-Next-Uncensored-NVFP4. Repositori ini bersifat gated: Anda harus masuk ke Hugging Face dan menyetujui ketentuan repositori, atau hf download dan vllm serve orcarouter/Qwen3.8-Flash-Next-Uncensored-NVFP4 keduanya gagal dengan galat autentikasi sebelum satu byte pun berpindah. Halaman ini adalah panduan peladenan (serving runbook), bukan liputan peluncuran — build ini baru berumur dua hari, dan pertanyaan yang sebenarnya dihadapi orang adalah perangkat keras, flag, dan build mana yang harus dipilih.

Dan sebelum angka-angkanya dimulai: Qwen3.8-Flash-Next-Uncensored bukan Qwen3.8-27B-Uncensored. Keduanya adalah dua model berbeda yang berbagi nama keluarga dan teknik abliterasi — bobot dasar berbeda, arsitektur berbeda, koleksi Hugging Face berbeda. Flash-Next diabliterasi dari Qwen/Qwen3.8-Flash-Next, sebuah pratinjau mixture-of-experts yang dirutekan dari arsitektur Qwen4 (qwen4_exp): 512 pakar dengan sepuluh pakar yang dirutekan plus satu pakar bersama yang aktif, atensi hibrida (lapisan linear Gated DeltaNet di samping lapisan atensi penuh), Hyper-Connections, embedding n-gram PLE, menara visi dan video native, serta kepala decoding spekulatif MTP. 27B diabliterasi dari Qwen/Qwen3.8-27B, basis dense yang sepenuhnya berbeda. Tidak ada apa pun dari angka serving halaman 27B yang berlaku untuk model ini; di mana halaman 27B benar-benar berguna — pengantar abliterasi, matematika umum pemilihan kuantisasi — itu ditautkan di bawah dengan apa yang berlaku dan tidak berlaku.

Apa build ini, presisi demi presisi
Qwen3.8-Flash-Next adalah MoE terarah: setiap token mengaktifkan 10 dari 512 eksper ditambah satu eksper bersama, dan hanya beberapa miliar parameter yang aktif per token meskipun model yang disimpan jauh lebih besar. Build NVFP4 adalah kuantisasi tensor-terkompresi presisi-campuran dari tumpukan tersebut, dan pembagiannya adalah inti keseluruhannya:
• Bobot expert MoE — NVFP4 (4-bit, NVIDIA FP4 E2M1, group-16 dengan skala blok FP8).
• Attention (self_attn.{q,k,v,o}), proyeksi linear_attn, pakar bersama, dan lm_head — FP8 (8-bit).
• PLE n-gram embedding, embedding token dan vision, Hyper-Connections, indexer QSA, Gated-DeltaNet conv/dt, semua normalisasi, dan seluruh vision tower — BF16, dipertahankan pada presisi penuh.
Tiga properti konversi ini lebih penting daripada pembagian presisi itu sendiri. Pertama, konversi ini bersifat weight-only: aktivasi dikuantisasi secara dinamis saat runtime, tak ada kalibrasi statis, dan bobotnya diturunkan langsung dari checkpoint BF16 (kartu spesifikasi menyebut penurunan tersebut bebas-data / data-free). Kedua, suntingan abliteration sudah tertanam dalam bobot, sehingga penghapusan refusal tetap bertahan setelah kuantisasi — konversi 4-bit adalah perubahan presisi, bukan intervensi keselamatan. Ketiga, cache KV tidak dikuantisasi; ia tetap BF16 saat runtime. Poin terakhir ini mudah terlewat, padahal penting pada konteks bawaan model yang mencapai 262.144 token, di mana cache KV menjadi pos memori yang nyata di samping bobot-bobotnya.
{{1}}Ukuran on-disk didominasi oleh satu tensor.{{/1}} {{2}}Kartu tersebut menggambarkan embedding PLE n-gram sebagai satu tensor ~66 miliar parameter yang secara desain dipertahankan dalam BF16; ini adalah shard terbesar dan alasan build-nya 178 GB, bukan angka yang lebih ramping.{{/2}} {{3}}Satu perbedaan yang perlu ditandai, bukan ditutup-tutupi: kartu saudara FP8 menyebut tabel yang sama sebagai PLE n-gram 51 miliar parameter, dan catatan W4A4 kartu ini merujuknya sebagai ~100 GB.{{/3}} {{4}}Kedua kartu menyatakan angka yang berbeda untuk tabel yang sama, jadi perlakukan masing-masing sebagai angka dari kartunya sendiri — dan ketika Anda memperkirakan ukuran deployment, asumsikan tabelnya besar dalam BF16 dan rencanakan sesuai itu.{{/4}}
Prasyarat perangkat keras, dijabarkan secara rinci.
Ini adalah bagian terpendek dan terpenting dari halaman ini. NVFP4 adalah format Blackwell: jalur cepatnya adalah GEMM FP4 asli pada tensor core generasi kelima, dan tanpa perangkat keras tersebut format ini tidak dapat dijalankan di mana pun. Baris persyaratan pada kartu itu sendiri eksplisit — GPU Blackwell (B100 / B200 / GB200 / RTX 50-series), karena NVFP4 menggunakan tensor core FP4 perangkat keras, dan tidak akan berjalan di Hopper (H100/H200) atau yang lebih lama, yang tidak memiliki komputasi FP4.
Pengalihan, dalam satu tempat:
• Pada Hopper (H100/H200) — sajikan Qwen3.8-Flash-Next-Uncensored-FP8 sebagai gantinya. Bobotnya sama pada 8-bit, berjalan di Hopper dan Blackwell, dan itulah build yang dicakup oleh runbook FP8 blog ini.
• Pada GPU NVIDIA konsumen atau mesin CPU — build GGUF, dengan 13 quant llama.cpp, adalah jalur lokal.
• Pada Apple Silicon — build MLX, dalam tingkatan 4/6/8-bit, adalah jalur Metal asli.
Persyaratan runtime sama mengikatnya dengan silikon. qwen4_exp adalah arsitektur yang benar-benar baru, sehingga build vLLM standar yang ada sebelum arsitektur ini akan menolak memuat checkpoint. Anda memerlukan vLLM terbaru dengan dukungan qwen4_exp serta pembaca NVFP4 compressed-tensors (formatnya dideteksi dari config.json, bukan dipilih secara manual), dan transformers ≥ 5.16. Masukan multimodal juga memerlukan tumpukan visi Qwen dari runtime; layanan khusus teks dapat berjalan tanpa itu.
Perintah serve kartu, flag demi flag
Pemanggilan model card itu sendiri adalah titik awal yang baik, dan ada baiknya memahami fungsi setiap flag daripada menyalin-tempel secara membabi buta:
vllm serve orcarouter/Qwen3.8-Flash-Next-Uncensored-NVFP4 --tensor-parallel-size 4 --trust-remote-code --enable-expert-parallel --enable-auto-tool-choice --tool-call-parser qwen3_coder
• --tensor-parallel-size 4 — bobotnya ~178 GB di disk, jadi kartu tersebut membaginya ke empat GPU. Ini adalah bentuk yang menjadi acuan ukuran build tersebut; jangan dianggap sebagai saran.
• --trust-remote-code — diperlukan untuk arsitektur khusus. Kode pemodelan qwen4_exp belum ada di registry transformers standar, jadi vLLM memuat kode arsitektur dari repo. Anda mempercayai kode tersebut, yang merupakan keputusan normal tetapi nyata untuk arsitektur yang benar-benar baru.
• --enable-expert-parallel — memecah para expert di seluruh rank tensor-paralel alih-alih mereplikasinya, yang membuat MoE dengan 512 expert menjadi layak pada TP4. Kartu saudara FP8 menyatakan alasan yang lebih tajam pada build tersebut: tanpa itu, lebar intermediate MoE dibagi dengan TP tidak habis dibagi oleh ukuran blok FP8. Anggap ini sebagai wajib, bukan opsional.
• --enable-auto-tool-choice and --tool-call-parser qwen3_coder — bersama-sama keduanya mengaktifkan pemanggilan fungsi. Flag auto memungkinkan model untuk memutuskan apakah akan memanggil alat, dan parser qwen3_coder mendekode format panggilan alatnya, keluarga parser yang sama yang digunakan oleh Qwen3.8-27B dan Qwen3.8-Flash-Next.
Setelah aktif, endpoint yang kompatibel dengan OpenAI di /v1/chat/completions membawa rangkaian fitur lengkap melalui tumpukan Qwen4 runtime: pemanggilan alat seperti di atas, penalaran melalui chat_template_kwargs.enable_thinking, dan visi melalui bagian konten image_url. Anda tidak memerlukan server terpisah untuk multimodal; itu endpoint yang sama.
Satu catatan struktural dari kartu: tidak ada varian W4A4 yang sepenuhnya statis dari build ini, dan tidak akan ada yang murah untuk diwujudkan. Konversi W4A4 statis memerlukan forward pass kalibrasi aktivasi, dan pass tersebut harus menyimpan embedding n-gram ~100 GB pada satu GPU. Itu adalah alasan yang sama mengapa tabel PLE mendominasi daftar file, dan itulah mengapa build ini tetap weight-only dengan aktivasi dinamis.
Laporan lapangan komunitas — seperti apa sebenarnya bentuk pelayanan ini
Tidak ada angka throughput atau latensi yang dipublikasikan untuk repo yang persis ini, dan halaman ini tidak akan mengarangnya. Yang ada adalah kumpulan laporan lapangan yang terus bertambah dari para praktisi yang menjalankan build Qwen3.8-Flash-Next NVFP4 dasar — arsitektur yang sama, pembagian presisi NVFP4/FP8/BF16 yang sama, tanpa edit abliterasi — dan perilaku serving-nya berlaku langsung. Ini adalah temuan komunitas, bukan panduan vendor, dan mereka yang melaporkannya menggunakan perangkat keras Blackwell dengan skema kuantisasi yang sama.
• Decoding spekulatif MTP adalah pengungkit kinerja terbesar. Model ini dilengkapi dengan kepala draf prediksi multi-token, dan pada satu RTX PRO 6000 (96 GB, SM120) modul MTP dimuat terkuantisasi ke NVFP4 sekitar 0,51 GB VRAM — laporan tersebut mengukur panjang penerimaan 2,3–3,9 dari maksimum 4 dan tingkat penerimaan 0,86–0,96. Laporan yang sama mengukur median decode single-stream 180–226 tok/s (216,9 pada coding, 225,8 pada beban kerja pemanggilan alat agen, 136,6 pada penalaran) dibandingkan dengan baseline sekitar 105 tok/s, dan menjawab prompt 216.685 token dalam 8,4 detik. Anggaplah angka-angka tersebut sebagai rig seseorang, bukan spesifikasi.
• Alihkan embedding n-gram PLE ke RAM host. Karena tabelnya sangat besar dan jarang menjadi penghambat throughput, resep komunitas pada kartu Blackwell tunggal menguncinya di host (~50 GiB RAM host gratis dalam laporan RTX PRO 6000) dan memetakannya dari NVMe, mengorbankan sedikit latensi agar model dapat dimuat. Perkirakan Anda perlu melakukan hal seperti ini kecuali Anda memiliki anggaran VRAM yang sangat besar.
• Sematkan jendela konteks secara eksplisit. Dengan cache KV BF16 dan MTP aktif, kumpulan KV berukuran otomatis membengkak melebihi kapasitas kartu dan mengalami OOM pada prefill yang panjang; menyematkan max-model-len / max-total-tokens ke 262144 memulihkan ruang kepala. Pada konteks 262K, cache KV adalah item yang perlu Anda anggarkan, bukan bawaan.
• Bug autotune FlashInfer secara diam-diam merusak keluaran. Mode kegagalan terpenting di lapangan: autotune memilih taktik kernel fused-MoE hanya berdasarkan latensi dan tidak pernah memeriksa numerik, sehingga pada beberapa bentuk, decode runtuh menjadi token yang berulang. Laporan RTX PRO 6000 mereproduksinya sebagai 36 dari 36 generasi rusak dengan autotune aktif, dan 0 dari 36 dengan autotune nonaktif — solusinya adalah menonaktifkan autotune FlashInfer (di vLLM, --no-enable-flashinfer-autotune; di SGLang, --disable-flashinfer-autotune). Jika keluaran yang Anda sajikan tiba-tiba menurun, periksa ini sebelum menyentuh hal lain.
• DGX Spark (GB10, SM121) memerlukan patch sendiri. Bobot NVFP4 (~126 GiB pada build komunitas) tidak muat di satu Spark 128 GB, jadi resep SGLang menjalankan tensor-parallel 2 di dua node melalui RoCE, dan resolver sparse-decode QSA mengunci kernel cepat FlashInfer di balik pemeriksaan is_sm100_supported() yang gagal pada SM121, sehingga beralih ke jalur yang mati saat warmup — perbaikannya adalah patch kecil plus offload PLE. Perkirakan decode ~47–50 tok/s, memuncak mendekati 70 dengan MTP4 dan CUDA graphs, dan verifikasi bahwa kernel Anda benar-benar berjalan di SM121 sebelum menjanjikan benchmark.
Penalaran, pemanggilan alat, dan visi melalui tumpukan Qwen4
Konsensus komunitas pada generasi Qwen3.8 berlaku juga pada model ini dengan catatan biasa bahwa ini adalah praktik lapangan, bukan panduan vendor.
• reasoning_effort adalah kontrol yang paling penting. Secara default, template chat menggunakan xhigh, yang membuat model berpikir panjang lebar pada setiap permintaan. Operator agent-loop menetapkan medium secara default dan menurunkannya ke low untuk panggilan yang sensitif terhadap latensi; enable_thinking false menonaktifkan penalaran sepenuhnya ketika Anda tidak membutuhkannya. Pada satu kartu Blackwell, membiarkan xhigh aktif untuk panggilan rutin adalah bagaimana model yang cepat menghasilkan jawaban yang lambat.
• Pasangkan sampler dengan mode berpikir. Para praktisi sepakat pada temperature 1.0 / top-p 0.95 saat mode berpikir aktif, dan temperature 0.7 / top-p 0.80 dengan presence penalty sekitar 1.5 saat nonaktif. Mencampur kedua set ini menurunkan kualitas keluaran.
• Pemanggilan tool tetap bertahan baik setelah abliterasi maupun konversi 4-bit. Jalur pemanggilan fungsi tetap utuh, yang dihubungkan oleh parser qwen3_coder dan flag auto-tool-choice. Bagi tim merah, ini adalah fakta bermata dua, karena berarti penyalahgunaan agentik beroperasi penuh pada model yang tidak selaras — dibahas di bawah.
• Visi dipertahankan, dan itu memperluas permukaan serangan. Menara visi tidak pernah tersentuh oleh abliteration dan tetap dalam BF16, sehingga input gambar berfungsi melalui bagian konten image_url. Para praktisi yang mengevaluasi lini tanpa sensor memperlakukan jalur multimodal sebagai target evaluasi kelas satu: injeksi prompt yang dibawa dalam gambar mendarat pada model tanpa perilaku penolakan untuk dihadapi.
Build mana yang harus Anda sajikan
Koleksi Flash-Next memiliki lima build — BF16, GGUF, MLX, FP8, dan NVFP4 ini — dan logika pemilihan yang jujur adalah soal perangkat keras dan trade-off, bukan peringkat.
• NVFP4 (build ini, ~178 GB di disk) — pilihan Blackwell. Inti tensor FP4, eksper 4-bit, build terbaru dalam koleksi dan yang terkecil di antara build server vLLM-nya, serta yang menjadi topik halaman ini.
• FP8 (~186 GB di disk) — pilihan untuk Hopper, dan sama nyamannya di Blackwell. Bobot yang sama pada 8-bit, yang merupakan jalur vLLM yang lebih terverifikasi secara luas dan yang memiliki persyaratan expert-parallel yang lebih jelas.
• GGUF (13 kuantisasi, IQ2_XXS ~52 GB hingga Q5_K_M ~125 GB) — pilihan llama.cpp untuk perangkat konsumen NVIDIA, AMD, atau CPU. Tidak perlu Blackwell, tidak perlu vLLM.
• MLX (tingkatan 4/6/8-bit, sekitar 163–221 GB) — pilihan Apple Silicon, Metal native, termasuk kepala MTP.
Dua catatan jujur sebelum Anda memilih. Pertama, build NVFP4 dan FP8 hanya berselisih sekitar delapan GB di disk, karena keduanya menyimpan tabel n-gram yang besar dalam BF16 — penghematan 4-bit terpusat pada bobot pakar, bukan pada total footprint. Keunggulan NVFP4 yang sebenarnya di Blackwell adalah kecepatan FP4 tensor core pada para pakar tersebut, bukan file yang jauh lebih kecil. Kedua, kartu tersebut menggambarkan NVFP4 sebagai derivasi bobot deterministik yang mewarisi evaluasi abliteration dengan trade-off kualitas tambahan yang kecil dari para pakar 4-bit, dan tidak mengukur trade-off tersebut. Trade-off tersebut tidak terukur — anggap sebagai biaya nyata namun tidak dirinci dari para pakar yang lebih kecil, bukan sebagai sesuatu yang dapat diabaikan.
Evaluasi, dibaca dengan benar
Kartu tersebut melaporkan abliteration yang diukur pada build BF16 yang dilayani dengan vLLM terhadap Qwen/Qwen3.8-Flash-Next resmi: penolakan prompt berbahaya turun drastis dari 64–100% menjadi sekitar 0–3,3%, penolakan berlebihan terhadap prompt jinak tetap mendekati nol, dan kapabilitas tetap dalam ±2 poin dari basis. Ada tiga hal yang perlu dipahami dengan benar tentang angka-angka tersebut. Angka-angka itu adalah pengukuran pada build BF16, yang diwariskan ke build 4-bit ini melalui argumen, bukan diukur langsung padanya. Angka-angka itu merupakan data milik vendor sendiri, yang dihasilkan dengan pengklasifikasi frasa pembuka berbasis aturan yang oleh kartu-kartu dalam koleksi tersebut digambarkan sebagai indikatif, bukan setara standar publikasi — pengukuran internal atas suntingannya sendiri, bukan audit independen. Dan angka-angka itu tidak mengatakan apa pun tentang trade-off kualitas NVFP4 di atas, yang tidak dikuantifikasi oleh kartu tersebut.
Batas keamanan — hanya untuk penelitian
Penafian pada kartu ini blak-blakan, dan ini adalah bagian dari halaman ini yang tidak boleh terdengar seperti teks standar. Model ini telah kehilangan sebagian besar penyelarasan keselamatannya: arah penolakan telah diortogonalisasi keluar dari aliran residual, dan model ini akan mematuhi permintaan berbahaya, tidak etis, atau ilegal yang akan ditolak oleh Qwen3.8-Flash-Next asli. Model ini dirilis secara ketat untuk penelitian yang sah — studi interpretabilitas, keselamatan AI dan mekanisme penolakan, red-teaming, serta evaluasi ketahanan — dan penulis tidak menerima tanggung jawab atas penyalahgunaan. Anda memikul tanggung jawab penuh atas apa yang dihasilkannya, dan Anda menambahkan lapisan keamanan serta moderasi Anda sendiri sebelum apa pun sampai ke pengguna. Apache 2.0 adalah lisensi minimum; pembatasan tujuan penelitian berada di atasnya.
{{1}}Dua hal yang keliru dari wacana model tak tersensor, dan kartu ini membuat keduanya mustahil untuk dilewatkan.{{/1}} {{2}}Pertama, probe jailbreak yang berhasil menembus model ini bukanlah evaluasi keselamatan yang lulus — itu adalah perilaku yang diiklankan.{{/2}} {{3}}Model yang diabliterasi dengan sengaja membuat probe-probe tersebut gagal; mengukurnya dengan satu tes "bisakah kamu menjailbreak-nya" berarti mengukur bahwa editnya berhasil, bukan bahwa guardrail-nya kuat.{{/3}} {{4}}Kedua, menara visi yang dipertahankan dan jalur pemanggilan alat yang utuh memperluas permukaan serangan nyata melampaui teks: injeksi prompt melalui input gambar dan penyalahgunaan alat agentik keduanya sepenuhnya operasional, dan justru itulah sebabnya pembingkaian red-team memperlakukan ini sebagai probe kapabilitas, bukan kandidat chatbot.{{/4}} {{5}}Jika kasus penggunaan Anda adalah merilis asisten yang menghadap pengguna, ini bukan model Anda, dan itu memang sudah dirancang demikian.{{/5}}
Di mana OrcaRouter cocok
Build berusia dua hari, dengan akses terbatas, khusus self-host adalah contoh klasik untuk routing daripada hardwiring. Ketika Anda menjalankan build NVFP4 ini sendiri, Anda dapat menyiapkan rute yang menunjuk ke build tersebut dan beralih otomatis ke model yang dihosting jika build berperilaku buruk di bawah beban — satu antarmuka, tanpa pengkabelan ulang antara penyedia saat Anda berganti. Khusus untuk pekerjaan eval, baseline yang disensor adalah perbandingan yang Anda inginkan, dan itu hanya berjarak satu tombol: katalog menyediakan Qwen3.8-Flash milik Ali baba dengan $0,15 per juta input dan $0,47 per juta output, diteruskan dengan harga resmi penyedia dengan markup 0%, sehingga harness red-team dapat berpindah antara basis yang disensor dan build lokal tanpa sensor tanpa kontrak kedua, dan setiap perubahan harga vendor masuk ke endpoint Anda pada hari yang sama.

Siapa yang harus mengunduh ini — dan siapa yang tidak
Unduh orcarouter/Qwen3.8-Flash-Next-Uncensored-NVFP4 jika Anda menggunakan Blackwell, menginginkan jejak server terkecil dalam koleksi Flash-Next dengan kecepatan inti-tensor FP4, dan sedang melakukan pekerjaan riset yang menjadi alasan lini ini ada. Unduh Qwen3.8-Flash-Next-Uncensored-FP8 jika Anda menggunakan Hopper atau menginginkan jalur yang terverifikasi lebih luas. Unduh build GGUF jika Anda menggunakan GPU konsumen atau mesin CPU, build MLX jika Anda menggunakan Apple Silicon, dan jangan unduh apa pun jika tujuannya adalah penerapan yang menghadap pengguna. Baca gate dan disclaimer sebelum Anda menerima salah satunya — keduanya adalah ketentuan model, bukan sekadar formalitas.
Semua lima build Flash-Next — BF16, GGUF, MLX, FP8, dan NVFP4 — dikumpulkan dalam koleksi Qwen3.8-Flash-Next-Uncensored di Hugging Face.
Model yang berbeda, bukan build lain dari model ini: Qwen3.8-27B-Uncensored adalah hasil abliterasi dari basis yang berbeda dan memiliki koleksi serta runbook-nya sendiri.
Bobot ini memang hanya bersifat lokal. Sebagai baseline ter-hosting untuk mengukur build abliterated, Qwen3.8-Flash disajikan di OrcaRouter dengan harga daftar penyedia dan markup 0% — model standar dengan alignment keamanan yang masih utuh.
