
Qwen3.8-27B-Uncensored-NVFP4: คู่มือปฏิบัติการสำหรับการ Serving บน GPU Blackwell
- Alibabaใหม่Qwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 ต่อ 1 ล้านโทเค็น
- z-aiใหม่Z.ai: GLM 5.3 Flash2026-08-2658ความฉลาด72การเขียนโค้ด
- DeepSeekใหม่DeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.15 / $0.29 ต่อ 1 ล้านโทเค็น
- z-aiใหม่Z.ai: GLM 5.32026-08-1860ความฉลาด75การเขียนโค้ด
- obsidianQwen3.8 27B2026-08-1552ความฉลาด68การเขียนโค้ด
- qwenQwen: Qwen3.8 27B (free)2026-08-13qwen/qwen3.8-27b-free
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1253ความฉลาด69การเขียนโค้ด
- grokSpaceXAI: Grok 4.62026-08-1261ความฉลาด77การเขียนโค้ด
- metaMeta: Muse Spark 1.22026-08-0557ความฉลาด72การเขียนโค้ด
- qwenQwen: Qwen3.8 Max2026-08-0358ความฉลาด72การเขียนโค้ด
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3152ความฉลาด69การเขียนโค้ด
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 ต่อ 1 ล้านโทเค็น
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463ความฉลาด78การเขียนโค้ด
- googleGoogle: Gemini 3.6 Flash2026-07-2152ความฉลาด69การเขียนโค้ด
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137ความฉลาด49การเขียนโค้ด
- metaMeta: Muse Spark 1.12026-07-1653ความฉลาด71การเขียนโค้ด
- kimiMoonshotAI: Kimi K32026-07-1560ความฉลาด76การเขียนโค้ด
- openaiOpenAI: GPT-5.6 Luna2026-07-0952ความฉลาด71การเขียนโค้ด
Qwen3.8-27B-Uncensored-NVFP4 อยู่บน Hugging Face ตั้งแต่วันที่ 19 สิงหาคม 2026 และในสิบวันนับตั้งแต่นั้นถูกดาวน์โหลดไปประมาณ 32,700 ครั้ง นี่ไม่ใช่รายงานเปิดตัว — น้ำหนักโมเดลอายุสิบวันแล้ว ไม่มีประกาศใดๆ ให้รายงาน และบิลด์พี่น้อง Qwen3.8-27B-Uncensored-FP8 และ Qwen3.8-27B-Uncensored-GGUF ได้ถูกบันทึกไว้ในบล็อกนี้แล้ว มันคือคู่มือการใช้งานสำหรับบิลด์ที่ผู้คนกำลังดาวน์โหลดอยู่จริงในตอนนี้: NVFP4 คืออะไรจริงๆ, ทำไมบิลด์เฉพาะนี้ผสมกับ FP8, GPU ตัวไหนได้ประโยชน์และตัวไหนไม่ได้, วิธีเสิร์ฟ, และใครควรเลือกมันแทนบิลด์ FP8 หรือ GGUF — และใครไม่ควร
สิ่งแรกที่ต้องพูดไว้ล่วงหน้า เพราะมันทำให้ผู้ดาวน์โหลดครั้งแรกทุกคนสะดุด: repo นี้ถูกจำกัดการเข้าถึง คำสั่งแบบง่าย ๆ อย่าง hf download orcarouter/Qwen3.8-27B-Uncensored-NVFP4 one-liner จะล้มเหลวด้วยข้อผิดพลาดการยืนยันตัวตน จนกว่าคุณจะเข้าสู่ระบบ Hugging Face และยอมรับข้อกำหนดการเข้าถึงของ repo บนหน้าโมเดลแล้ว ทุกอย่างด้านล่างนี้ถือว่าคุณทำทั้งสองอย่างแล้ว
นอกจากนี้ต้องบอกล่วงหน้า: การ์ดโมเดลของรีโพนี้อยู่หลังเกตเดียวกัน ดังนั้นจึงไม่มีเนื้อหาส่วนใดในนี้ที่ถอดความจากมัน เนื้อหาต่อไปนี้อิงจากรายการไฟล์สาธารณะและเมทาดาทาของรีโพ, เอกสาร NVFP4 สาธารณะของ NVIDIA, และรายงานภาคสนามจากผู้ที่ให้บริการ Qwen3.8-27B NVFP4 บนแบล็กเวลล์ หากตัวเลขใดมาจากผู้ปฏิบัติงานแทนที่จะเป็นผู้จำหน่าย ข้อความจะระบุไว้เช่นนั้น

บิลด์นี้คืออะไร
Qwen3.8-27B-Uncensored-NVFP4 คือการควอนไทซ์แบบ NVFP4 ของ Qwen3.8-27B-Uncensored ซึ่งเป็นเวอร์ชัน abliterated ของ Alibaba's Qwen/Qwen3.8-27B ที่องค์กร orcarouter เผยแพร่เมื่อวันที่ 2026-08-18. Abliteration จะลบทิศทางการปฏิเสธของโมเดลออกจาก residual stream; เทคนิคนี้ได้อธิบายไว้ในเอกสารอธิบายโมเดล uncensored ของเรา และจะไม่อธิบายซ้ำที่นี่ โมเดลฐานเป็นแบบ dense 27B ที่มี hybrid attention — ชั้น linear-attention 48 ชั้น บวกกับชั้น full-attention 16 ชั้น — รองรับความเข้าใจรูปภาพและวิดีโอแบบเนทีฟ บริบท 262,144 โทเคน และหัว speculative-decoding แบบ MTP ในตัว Apache 2.0 ตั้งแต่ต้นจนจบ
สิ่งที่ทำให้บิลด์นี้น่าสนใจไม่ใช่ abliteration แต่เป็นเลย์เอาต์ของการควอนไทซ์ เพราะมันเป็นบิลด์แบบควอนไทซ์โดยเจตนา — ถ้าคุณค้นหา NVFP4 รูปแบบคือประเด็นหลัก ตามเมทาดาตาสาธารณะและการกำหนดค่าควอนไทซ์ของรีโพ นี่คือบิลด์ compressed-tensors แบบความแม่นยำผสม: attention projections เป็น FP8 (E4M3), MLPs เป็น NVFP4 (4-bit แบบ packed) และ vision encoder, MTP head, lm_head รวมถึงนอร์มและไบแอสของ linear-attention ถูกคงไว้ใน BF16 เมทาดาตาของ safetensors ในรายการไฟล์สาธารณะสอดคล้องกับโครงสร้างดังกล่าว: พารามิเตอร์ประมาณ 3.5 พันล้านตัวใน BF16, 9.4 พันล้านตัวใน FP8-E4M3 และ 15 พันล้านตัวในเทนเซอร์ 4-bit แบบ packed รวมขนาดประมาณ 24.7 GB บนดิสก์กระจายอยู่ในห้าชาร์ดบวกกับชาร์ด model-extra แยกต่างหาก ไม่มีสิ่งใดข้างต้นเป็นการกล่าวอ้างเกี่ยวกับวิธีการให้บริการ — VRAM ขณะรันไทม์และทรูพุตสำหรับรีโพนี้โดยเฉพาะไม่ได้ถูกเผยแพร่ที่ใดที่ฉันจะอ้างอิงได้ในวันนี้ ขนาดบนดิสก์มาจากรายการไฟล์ รูปแบบมาจากคอนฟิก และพฤติกรรมการให้บริการด้านล่างได้รับการยืนยันจากชุมชนบนบิลด์ NVFP4 ที่เกี่ยวข้องอย่างใกล้ชิด
NVFP4 คืออะไร และแตกต่างจาก FP8 และ INT8/AWQ อย่างไร
NVFP4 คือนโยบายรูปแบบเลขทศนิยม 4 บิตของ NVIDIA ที่เปิดตัวสำหรับเทนเซอร์คอร์รุ่นที่ 5 บนสถาปัตยกรรม Blackwell และบล็อกเทคนิคของ NVIDIA เองก็เป็นแหล่งข้อมูลปฐมภูมิที่ถูกต้องสำหรับเรื่องนี้ มันจัดเก็บค่าน้ำหนักเป็น E2M1 — บิตเครื่องหมาย 1 บิต, บิตเลขชี้กำลัง 2 บิต, บิตแมนทิสซา 1 บิต — และปรับสเกลเป็นบล็อก: ทุก 16 ค่าใช้สเกล FP8 แบบ E4M3 ร่วมกัน และเทนเซอร์ทั้งชุดได้รับสเกลาร์ FP32 ต่อเทนเซอร์ โครงสร้างสองระดับนี่คือหัวใจของรูปแบบ: มันกู้คืนช่วงไดนามิกที่เลขทศนิยม 4 บิตแบบง่ายๆ จะสูญเสียไป โดยแลกกับบิตโอเวอร์เฮดไม่กี่บิตต่อบล็อก ความแตกต่างในทางปฏิบัติ สรุปได้หนึ่งบรรทัด:
• NVFP4 เทียบกับ FP8 — ทั้งคู่เป็นรูปแบบจุดลอยตัว แต่ FP8 (E4M3, 8 บิต) ทำงานบน Hopper และ Blackwell ในขณะที่ NVFP4 เป็นแบบ 4 บิต และรองรับการเร่งความเร็วแบบเนทีฟเฉพาะบน Blackwell เท่านั้น NVIDIA ระบุว่าน้ำหนักมีขนาดเล็กลงประมาณ 3.5 เท่าเมื่อเทียบกับ FP16 และประมาณ 1.8 เท่าเมื่อเทียบกับ FP8 และบน Blackwell การคูณเมทริกซ์ (matmul) จะทำงานบน FP4 tensor cores โดยตรง
• NVFP4 เทียบกับ INT8/AWQ — INT8 (W8A8) และ AWQ (W4A16) เป็นรูปแบบจำนวนเต็มที่ทำงานบนสถาปัตยกรรม Ampere ขึ้นไป; AWQ เป็นแบบ 4 บิตแต่เป็นจำนวนเต็ม และบนฮาร์ดแวร์ส่วนใหญ่ น้ำหนักจะถูกดีควอนไทซ์เป็นประเภทที่กว้างขึ้นสำหรับการคูณเมทริกซ์ NVFP4 เป็นเลขทศนิยม 4 บิตที่มีการสเกลแบบบล็อก จึงรักษาความแม่นยำในบิตต่ำได้มากกว่า และมีเส้นทาง GEMM แบบ FP4 ดั้งเดิมที่รูปแบบจำนวนเต็มไม่มี
• NVFP4 เทียบกับ MXFP4 — คนมักสับสนระหว่างสองรูปแบบนี้อยู่เสมอ MXFP4 ใช้บล็อกขนาด 32 องค์ประกอบและสเกล E8M0 (ยกกำลังสอง) ขณะที่ NVFP4 ใช้บล็อกขนาด 16 องค์ประกอบและสเกล E4M3 บล็อกที่ละเอียดกว่าทำให้ NVFP4 แยกค่า outlier ได้ดีกว่า ซึ่งเป็นเหตุผลที่รูปแบบนี้เป็นมาตรฐาน 4 บิตโดยพฤตินัยบนสแตกการให้บริการของ Blackwell

ฮาร์ดแวร์ใดที่ได้รับประโยชน์ — และฮาร์ดแวร์ใดที่ไม่ได้รับ
ข้อเท็จจริงที่สำคัญที่สุดเพียงหนึ่งเดียวเกี่ยวกับบิลด์นี้: NVFP4 เป็นฟอร์แมตของ Blackwell มันจะทำงานได้เต็มประสิทธิภาพเฉพาะบน GPU ที่เทนเซอร์คอร์รองรับ FP4 GEMM โดยกำเนิดเท่านั้น และบนอย่างอื่นมันคือเครื่องมือที่ผิดไม่ว่าเครื่องนั้นจะเร็วแค่ไหนในทางทฤษฎีก็ตาม
• Blackwell — RTX 50-series, B200/B300, RTX PRO 6000, DGX Spark (GB10) — นี่คือจุดที่ NVFP4 เป็นตัวเลือกที่ใช่: เทนเซอร์คอร์ FP4 แบบเนทีฟ ฟุตพรินต์ระดับเซิร์ฟเวอร์ที่เล็กที่สุดในไลน์ที่ไม่มีการเซ็นเซอร์ และฟอร์แมตที่บิลด์นี้ถูกสร้างมาเพื่อ
• Hopper — H100/H200 — ไม่มี FP4 GEMM ดั้งเดิม NVFP4 ถูกลดเป็นพาธ dequant แบบ weight-only ซึ่งช้ากว่าและไม่ได้ประโยชน์อะไร ใช้ Qwen3.8-27B-Uncensored-FP8 ที่นี่ บิลด์นั้นผ่านการยืนยันบนฮาร์ดแวร์นี้พอดี
• Ampere/Ada — RTX 3090/4090 — NVFP4 ไม่ได้เร่งความเร็วบนการ์ดเหล่านี้เช่นกัน GGUF build ที่มีระดับ Q4_K_M ที่ 16.8 GB เป็นเครื่องมือที่เหมาะสมสำหรับการ์ดขนาด 24 GB
• Apple Silicon — NVFP4 ไม่เกี่ยวข้องบน Mac บิลด์ MLX (หรือ GGUF) คือตัวที่รันได้
ขอพูดตามตรงถึงความแตกต่างเล็กน้อย: ฟอร์กจากคอมมูนิตี้รัน NVFP4 แบบน้ำหนักเท่านั้นบนฮาร์ดแวร์ยุคก่อน Blackwell ได้ บิลด์ NVFP4 จากคอมมูนิตี้ของโมเดล abliterated เดียวกันนี้ถูกตั้งค่าไว้สำหรับการ์ดระดับ V100 โดยเฉพาะผ่าน vLLM fork ที่ถูกแพตช์ และสูตร DGX Spark ล่าสุดสำหรับ Qwen3.8-27B ก็เป็นอีกเรื่องหนึ่ง สิ่งเหล่านั้นเป็นเส้นทางเฉพาะทางที่มีข้อควรระวังของตัวเอง ไม่ใช่สิ่งที่บิลด์นี้ตั้งเป้าไว้ หากคุณใช้ Blackwell สิ่งเหล่านั้นไม่สำคัญเลย แต่หากคุณไม่ได้ใช้ Blackwell บิลด์ FP8 หรือ GGUF คือตัวเลือกดาวน์โหลดที่ดีกว่า
วิธีการเสิร์ฟ
ที่เก็บ (repo) นี้ถูกแท็กสำหรับ vLLM และรูปแบบ compressed-tensors จะถูกอ่านโดยอัตโนมัติจาก config.json — คุณไม่ต้องเลือกโครงร่าง quantization ด้วยตนเอง สแตกที่ผู้ปฏิบัติงานส่วนใหญ่นิยมใช้สำหรับการสร้าง Qwen3.8-27B NVFP4 คือ vLLM เวอร์ชันล่าสุดบนการ์ด Blackwell, KV cache แบบ FP8 และหัว MTP ของตัวโมเดลเองที่ใช้สำหรับ speculative decoding คู่มือ NVFP4 ของ Unsloth ซึ่งเป็นเอกสารอ้างอิงจากชุมชนที่ถูกอ้างถึงมากที่สุด แนะนำให้ใช้ vLLM 0.25.0 หรือใหม่กว่า พร้อมด้วย FlashInfer และ dependency ของเคอร์เนล CUTLASS-DSL สำหรับเส้นทาง FP4 ที่รวดเร็ว
จุดเริ่มต้นที่ใช้งานได้ รวบรวมจากแฟล็กที่ตรวจสอบแล้วของบิลด์ FP8 ของเรา และสูตร NVFP4 จากชุมชน ทั้งหมดในบรรทัดเดียว:
vllm serve orcarouter/Qwen3.8-27B-Uncensored-NVFP4 --kv-cache-dtype fp8 --max-model-len 262144 --reasoning-parser qwen3 --enable-auto-tool-choice --tool-call-parser qwen3_coder --speculative-config '{"method": "mtp", "num_speculative_tokens": 3}'
• FP8 KV cache — วิธีที่เข้ากันได้กว้างที่สุดในการลดหน่วยความจำแคชลงครึ่งหนึ่ง ผู้ใช้งานรายงานว่าช่วยเพิ่มบริบทที่เก็บได้ประมาณสองเท่า มีการรองรับ NVFP4 KV-cache แต่จำกัดเฉพาะ attention backends บางตัว ดังนั้น FP8 KV จึงเป็นค่าเริ่มต้นที่ปลอดภัยกว่า
• MTP การถอดรหัสแบบคาดการณ์ — โมเดลมาพร้อมกับ MTP draft head และตัว quant เก็บมันไว้ใน BF16 ผู้ใช้งานรายงานว่า draft tokens 2-3 ตัวทำงานได้ดีกับ NVFP4 weights บน Blackwell โดยให้ผลลัพธ์ที่ดีที่สุดกับเอาต์พุตแบบมีโครงสร้าง เช่น JSON และการเรียกใช้เครื่องมือ
• Vision — ในบิลด์นี้ vision encoder ถูกเก็บรักษาไว้ในรูปแบบ BF16 เพิ่ม --language-model-only เพื่อให้บริการเฉพาะข้อความ หรือละเว้นหากคุณต้องการรับภาพหรือวิดีโอ
• บน DGX Spark — ข้อควรระวังที่รายงานจากภาคสนาม: ให้คง --gpu-memory-utilization ไม่เกิน 0.90 (ค่าที่สูงกว่าอาจทำให้เครื่องค้างระหว่างการโหลดน้ำหนัก) และเพิ่ม --safetensors-load-strategy lazy หากหน่วยความจำจำกัด คุณยังต้องใช้ vLLM เวอร์ชันที่ build สำหรับ GB10 เพื่อรองรับเคอร์เนล sm_121a.
ประสิทธิภาพที่ซื่อสัตย์: ไม่มีตัวเลขปริมาณงานที่เผยแพร่และเป็นอิสระสำหรับ repo นี้โดยเฉพาะ การวัดที่มีอยู่เป็นสำหรับบิลด์ NVFP4 ที่เกี่ยวข้องอย่างใกล้ชิด Unsloth รายงาน 1.41–1.49 เท่าของโทเคนต่อวินาทีของ BF16 บน B200 สำหรับบิลด์ Qwen3.8-27B-NVFP4 ของตัวเอง (89.8 ถึง 133.7 tok/s ที่ batch 1, 3,048 ถึง 4,407 ที่ batch 64) และผู้ใช้ DGX Spark คนหนึ่งในฟอรัม NVIDIA รายงานประมาณ 20–32 tok/s ด้วยน้ำหนัก NVFP4, KV cache แบบ FP8 และความลึก MTP 3 ทั้งสองควรค่าแก่การอ้างอิง; ไม่มีอันใดเป็น benchmark ของ repo นี้
รูปแบบการใช้งานที่ได้ผลจริง
ผู้ปฏิบัติงานที่รันโมเดลตระกูล Qwen3.8-27B บน Blackwell ต่างใช้การตั้งค่าเพียงไม่กี่ชุดเหมือนกัน จงถือว่านี่เป็นรายงานภาคสนาม ไม่ใช่คำแนะนำจากผู้จำหน่าย — {{1}}Qwen{{/1}} ไม่ได้จัดทำเอกสารเกี่ยวกับเรื่องนี้ไว้มากนัก และการ์ดของ repo นี้เองก็ถูกจำกัดการเข้าถึง
• reasoning_effort is the dial that matters most. The default xhigh makes the model think for a long time on every request. People running agent loops set medium by default and drop to low — or disable thinking entirely with enable_thinking: false — for latency-sensitive single calls. On a single Blackwell GPU, xhigh reasoning on a routine task is how you end up with a fast model and slow answers.
• แซมเพลอร์ถูกจับคู่กับโหมดคิด ไม่ได้เป็นอิสระต่อกันฉันทามติของชุมชน: การคิดเปิดทำงานที่อุณหภูมิ 1.0 / top_p 0.95; การคิดปิดทำงานที่อุณหภูมิ 0.7 / top_p 0.80 โดยมี presence_penalty 1.5 การสลับชุดค่าทั้งสองจะทำให้คุณภาพของเอาต์พุตลดลง
• ใช้เทมเพลตแชทปัจจุบัน เทมเพลต qwen3_5 ครอบคลุมทุกเทิร์นของผู้ช่วยในบล็อกคิด และผู้ปฏิบัติหลายรายรายงานการวนซ้ำหรือคำตอบที่ถูกตัดทอนเมื่อใช้เทมเพลตที่ล้าสมัย เวอร์ชันที่ชุมชนแก้ไขอย่าง Qwen-Fixed-Chat-Templates และ Qwen-Sharp ตั้งค่า preserve_thinking และหยุดการวนซ้ำ หาก output ที่ให้บริการของคุณพูดเรื่อยเปื่อยเกินกว่า stop token นี่คือสิ่งแรกที่ควรตรวจสอบ
• จัดงบประมาณสำหรับการให้เหตุผลแบบยาวในงานของเอเจนต์ ผู้ปฏิบัติงานรายงานว่าโมเดลรุ่น 3.8 ปล่อยโทเค็นต่องานประมาณสองเท่าของรุ่นก่อนหน้า 3.6 — การกระโดดของคุณภาพส่วนหนึ่งมาจากการคิดที่ยาวขึ้น สำหรับคำตอบแบบ xhigh ที่ยาว ควรสตรีมเอาต์พุตของการให้เหตุผล มิฉะนั้นคุณจะพบกับเกตเวย์ไทม์เอาต์
• การเรียกใช้เครื่องมือยังคงสมบูรณ์ผ่านการควอนไทซ์ เส้นทางการเรียกใช้ฟังก์ชันยังคงอยู่รอดทั้งหลังการ abliteration และการแปลงเป็น 4 บิต; เปิดใช้งานด้วยตัวแยกวิเคราะห์การเรียกใช้เครื่องมือ qwen3_coder แล้วโมเดลจะเลือกเครื่องมือแบบเดียวกับโมเดลฐาน

ใครควรเลือกบิลด์นี้ — และใครไม่ควร
การตัดสินใจที่ซื่อตรง โดยไม่ต้องย้ำคณิตศาสตร์การเลือก quant ที่โพสต์ FP8 และ GGUF ของเราได้กล่าวถึงอย่างละเอียดแล้ว:
• เลือก NVFP4 ถ้า คุณกำลังให้บริการบน Blackwell และต้องการฟุตพริ้นท์ระดับเซิร์ฟเวอร์ที่เล็กที่สุดในไลน์ที่ไม่มีการเซ็นเซอร์ ด้วยความเร็ว FP4 เทนเซอร์คอร์ — และคุณกำลังทำงานวิจัย งานเรดทีม หรืองาน interpretability ที่จำเป็นต้องใช้โมเดล abliterated อย่างชอบธรรม
• เลือก Qwen3.8-27B-Uncensored-FP8 หากคุณใช้งานบน Hopper หรือต้องการเส้นทาง vLLM ที่ได้รับการตรวจสอบอย่างกว้างขวางที่สุด — เป็นเวตเดียวกันที่ 8 บิต ตรวจสอบบน H200 โดยมี VRAM พื้นฐานประมาณ 40 GB
• เลือก Qwen3.8-27B-Uncensored-GGUF หากคุณใช้ GPU ระดับผู้บริโภคหรือ Mac หรือต้องการ llama.cpp แทน vLLM — ระดับ Q4_K_M คือจุดที่ลงตัวที่สุดสำหรับการใช้งานบนเครื่อง
• อย่าเลือกอย่างใดอย่างหนึ่งถ้าคุณต้องการความเที่ยงตรงสูงสุด กำลังสร้างสิ่งใดก็ตามที่ผู้ใช้ใช้งาน (ดูขอบเขตความปลอดภัยด้านล่าง) หรือคุณไม่ต้องการโฮสต์ด้วยตนเองเลย — โมเดลเดียวกันนี้ที่ไม่ถูกเซ็นเซอร์ถูกให้บริการผ่าน OrcaRouter ซึ่งจำกัดเฉพาะนักวิจัย ดังนั้นจึงไม่จำเป็นต้องใช้ GPU
ขอบเขตความปลอดภัย — เพื่อการวิจัยเท่านั้น
นี่คือโมเดลแบบ abliterated และการควอนไทซ์ไม่ได้ใส่ตัวป้องกัน (guardrails) กลับคืนมา ทิศทางการปฏิเสธถูกลบออกจาก residual stream ของ Qwen/Qwen3.8-27B และ NVFP4 คือการเปลี่ยนแปลงความแม่นยำ ไม่ใช่การแทรกแซงด้านความปลอดภัย — โมเดลจะปฏิบัติตามคำขอที่โมเดลพื้นฐานปฏิเสธ และบิลด์นี้ไม่มีระบบกลั่นกรองในตัว โมเดลนี้เผยแพร่เพื่อการวิจัยด้าน interpretability ความปลอดภัย AI และ red-team ภายใต้ใบอนุญาต Apache 2.0 และความรับผิดชอบเป็นของคุณ
บันทึกการประเมินสองข้อที่ถูกพูดถึงน้อยเกินไปในแวดวงโมเดลแบบไม่มีการเซ็นเซอร์ ข้อแรก การทดสอบเจลเบรกเพียงครั้งเดียวที่ผ่านอย่างง่ายดายไม่ใช่การประเมินความปลอดภัยที่ผ่าน — โมเดลแบบ abliterated จงใจล้มเหลวในการทดสอบเหล่านั้น จงวัดสิ่งที่คุณสนใจจริง ๆ ด้วยชุดทดสอบที่เหมาะสม (AdvBench, HarmBench และ StrongREJECT สำหรับความเป็นอันตราย; XSTest-safe สำหรับการปฏิเสธมากเกินไป) และเปรียบเทียบอัตราการปฏิเสธก่อนและหลังการปรับแต่ง ข้อที่สอง จงประเมินเวอร์ชันควอนไทซ์ ไม่ใช่แค่โมเดลฐาน: บิลด์แบบ 4-bit สามารถเปลี่ยนพฤติกรรมในกรณีขอบได้แม้คะแนนรวมจะดูปกติดี อย่านำสิ่งนี้ไปใช้งานกับผู้ใช้ปลายทางโดยไม่มีชั้นการกลั่นกรองและการป้องกันการใช้งานในทางที่ผิดของคุณเอง
OrcaRouter เหมาะกับที่ใด
บิลด์แบบควอนไทซ์ที่มีอายุสิบวันเป็นกรณีตัวอย่างระดับตำราสำหรับการทำ routing มากกว่าการ hardwiring คุณสามารถตั้งค่า route ที่ชี้ไปยังบิลด์ NVFP4 ที่คุณรันเอง และสลับไปใช้โมเดลที่โฮสต์ไว้ได้หากบิลด์ทำงานผิดพลาดภายใต้โหลด — อินเทอร์เฟซเดียว ไม่ต้องเปลี่ยนการเชื่อมต่อระหว่างผู้ให้บริการเมื่อคุณสลับ OrcaRouter ส่งผ่านราคารายการของผู้ให้บริการโดยคิดกำไรเพิ่ม 0% ดังนั้นหากราคาของโมเดลต้นทางเปลี่ยนแปลง endpoint ของคุณจะสะท้อนราคานั้นในวันเดียวกันแทนที่จะเป็นตามรอบบิล
และหากจุดประสงค์ทั้งหมดคือการหลีกเลี่ยงการใช้ GPU เลย: ไลน์ที่ไม่ได้ถูกเซ็นเซอร์แบบเดียวกันนี้มีให้ใช้งานผ่าน OrcaRouter ซึ่งจำกัดเฉพาะนักวิจัยด้านความปลอดภัยและ red teams พร้อมการสลับไปยังผู้ให้บริการรายอื่นโดยอัตโนมัติ ไม่ว่าคุณจะโฮสต์บิลด์ NVFP4 นี้ด้วยตนเองหรือเรียกใช้ไลน์แบบโฮสต์ ก็ใช้คีย์ API เดียวกันทั้งสองแบบ
สรุป
Qwen3.8-27B-Uncensored-NVFP4 คือตัวเลือกดาวน์โหลดที่ถูกต้อง หากคุณกำลังให้บริการโมเดลแบบ abliterated บน Blackwell และต้องการพื้นที่จัดเก็บที่น้อยที่สุดพร้อมความเร็ว FP4-tensor-core แต่มันเป็นตัวเลือกที่ผิดบน Hopper (ให้ใช้เวอร์ชัน FP8) บน GPU สำหรับผู้บริโภคหรือ Apple GPU (ให้ใช้เวอร์ชัน GGUF หรือ MLX) หรือหากคุณต้องการความเที่ยงตรงสูงสุด มันไม่ใช่ของใหม่ — มันดาวน์โหลดได้ตั้งแต่ 19 สิงหาคม 2026 — แต่มันกำลังถูกดาวน์โหลดเป็นจำนวนมาก และตอนนี้คุณก็รู้แล้วว่ากำลังจะได้อะไรก่อนที่จะยอมรับเงื่อนไข
ไม่ใช่ build อื่นของโมเดลนี้ — Qwen3.8-Flash-Next-Uncensored เป็นเวอร์ชันเผยแพร่แยกต่างหาก: abliterated จาก Qwen3.8-Flash-Next ซึ่งเป็นตัวอย่าง mixture-of-experts ของสถาปัตยกรรม Qwen4 ที่จัดเก็บ 176B / ใช้งานจริง 6B เทคนิค abliteration เดียวกัน น้ำหนักต่างกัน มีคอลเลกชันของตัวเอง
บิลด์ 27B ทั้งหกแบบ — BF16, GGUF, MLX, FP8, INT8 และ NVFP4 — ถูกรวบรวมไว้ในคอลเลกชัน Qwen3.8-27B-Uncensoredบน Hugging Face.
ค่าน้ำหนักเหล่านี้ถูกออกแบบให้ใช้งานในเครื่องเท่านั้นโดยเจตนา เพื่อให้มี baseline ที่โฮสต์ไว้ใช้เทียบวัดกับ build ที่ผ่านการ abliterated แล้ว Qwen3.8-27B จึงให้บริการบน OrcaRouter ในราคารายการของผู้ให้บริการ โดยมี markup 0% — เป็นโมเดลมาตรฐานที่ยังคงการ alignment ด้านความปลอดภัยไว้ครบถ้วน
