
Qwen3.8-27B-Uncensored ผลการทดสอบ: การปฏิเสธล่มสลาย ความสามารถยังคงอยู่
- DeepSeekใหม่DeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.15 / $0.29 ต่อ 1 ล้านโทเค็น
- z-aiใหม่Z.ai: GLM 5.32026-08-1860ความฉลาด75การเขียนโค้ด
- obsidianใหม่Qwen3.8 27B2026-08-1552ความฉลาด68การเขียนโค้ด
- qwenใหม่Qwen: Qwen3.8 27B (free)2026-08-13qwen/qwen3.8-27b-free
- deepseekใหม่DeepSeek: DeepSeek V4 Pro 08132026-08-1253ความฉลาด69การเขียนโค้ด
- grokใหม่SpaceXAI: Grok 4.62026-08-1261ความฉลาด77การเขียนโค้ด
- metaMeta: Muse Spark 1.22026-08-0557ความฉลาด72การเขียนโค้ด
- qwenQwen: Qwen3.8 Max2026-08-0358ความฉลาด72การเขียนโค้ด
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3152ความฉลาด69การเขียนโค้ด
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 ต่อ 1 ล้านโทเค็น
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463ความฉลาด78การเขียนโค้ด
- googleGoogle: Gemini 3.6 Flash2026-07-2152ความฉลาด69การเขียนโค้ด
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137ความฉลาด49การเขียนโค้ด
- metaMeta: Muse Spark 1.12026-07-1653ความฉลาด71การเขียนโค้ด
- kimiMoonshotAI: Kimi K32026-07-1560ความฉลาด76การเขียนโค้ด
- openaiOpenAI: GPT-5.6 Luna2026-07-0952ความฉลาด71การเขียนโค้ด
- openaiOpenAI: GPT-5.6 Terra2026-07-0957ความฉลาด77การเขียนโค้ด
- openaiOpenAI: GPT-5.6 Sol2026-07-0961ความฉลาด77การเขียนโค้ด
เรื่องราวเกณฑ์มาตรฐานของ Qwen3.8 27B Uncensored (Aggressive) — บิลด์ abliterated ของ Qwen3.8 27B ที่เผยแพร่เป็นเช็คพอยต์ FP8 เมื่อวันที่ 15 สิงหาคม 2026 และบิลด์ GGUF ในวันที่ 16 สิงหาคม — ไม่ใช่เรื่องที่มันฉลาดขึ้น แต่เป็นเรื่องที่มันหยุดปฏิเสธ การ์ดโมเดลรายงานว่าการปฏิเสธพรอมต์ที่เป็นอันตรายลดลงจาก 64–99% บนโมเดลฐานเป็น 0–6% บนบิลด์ abliterated เมื่อปิดการคิด และต่ำกว่าหรือเท่ากับ 1.7% เมื่อเปิดการคิด ขณะที่เกณฑ์มาตรฐานความสามารถทุกตัวอยู่ภายใน ±1.3 จุดของโมเดลฐาน และค่า perplexity ของ WikiText-2 อยู่ที่ 6.96 หากคุณมาที่นี่เพื่อดูเกณฑ์มาตรฐาน qwen uncensored นี่คือตัวเลขหลัก: มันไม่ใช่โมเดลที่ฉลาดขึ้น แต่เป็นโมเดลที่ไม่ปฏิเสธ
ความแตกต่างนั้นสำคัญ เพราะสิ่งที่ติดอันดับใน "เกณฑ์วัดแบบไม่มีเซนเซอร์" ส่วนใหญ่ก็คือลิสต์คะแนนความสามารถบางๆ หรือโพสต์ hype ที่อ้างว่าโมเดล "ดีกว่า" ซึ่งทั้งคู่ไม่ใช่สิ่งที่ abliteration ทำ บทความนี้จะพาไปดูข้อมูลที่วัดได้จริง — refusal collapse, over-refusal, capability retention และ perplexity — รวมถึงวิธีการที่สร้างข้อมูลนี้ และขอบเขตด้านความปลอดภัยที่คุณควรอ่านก่อนจะแตะต้องน้ำหนักโมเดล
การรวบรวมเกณฑ์มาตรฐานที่ไม่ถูกเซ็นเซอร์นั้นวัดอะไรได้จริง
การรีวิวโมเดลโดยทั่วไปรายงานเพียงแกนเดียว: ความสามารถ — MMLU, GSM8K, การเขียนโค้ด และการใช้เหตุผล โมเดลแบบ abliterated น่าสนใจในอีกแกนหนึ่ง และประเด็นทั้งหมดของฉลาก "ไม่มีการเซ็นเซอร์" ก็คือแกนความปลอดภัยถูกขยับไปแล้ว ดังนั้นคำถามที่เป็นประโยชน์สำหรับ Qwen3.8-27B-Uncensored-FP8 จึงไม่ใช่ "มันฉลาดกว่าไหม?" แต่คือ "การนำกลไกการปฏิเสธออกไปมีต้นทุนเท่าไร และถูกลบออกไปอย่างทั่วถึงแค่ไหน?"
ต้องอ่านตัวเลขสามกลุ่มนี้ประกอบกัน อัตราการปฏิเสธบนเกณฑ์ชี้วัดพรอมพต์ที่เป็นอันตราย — ความถี่ที่โมเดลปฏิเสธ; ยิ่งค่าฐานสูงเท่าใด ผลของการถอดออกก็ยิ่งเห็นชัดมากเท่านั้น การปฏิเสธเกินควรบนพรอมพต์ที่ไม่เป็นอันตราย — ความถี่ที่โมเดลปฏิเสธคำขอที่บริสุทธิ์อย่างไม่ถูกต้อง; ยิ่งต่ำยิ่งดีสำหรับทุกคน และการคงไว้ซึ่งความสามารถ — ว่าการแก้ไขทำให้โมเดลด้อยลงหรือไม่ บทสรุปเกณฑ์ชี้วัดที่พิมพ์เฉพาะคะแนนความสามารถ กำลังตอบคำถามที่ผิด
วิธีการ: abliteration คือการแก้ไขน้ำหนัก ไม่ใช่การปรับแต่งละเอียด
สิ่งที่ทำให้ abliteration แตกต่างจากแพ็ก "jailbreak" ของชุมชนคือตำแหน่งที่การเปลี่ยนแปลงเกิดขึ้น การ jailbreak ในระดับพรอมพ์จะห่อหุ้มอินพุต ส่วน abliteration จะแก้ไขน้ำหนัก วิธีการนี้คือ Arditi et al. (2024) เรื่อง "Refusal in Language Models Is Mediated by a Single Direction" ข้อค้นพบหลักคือพฤติกรรมการปฏิเสธในโมเดลหลายตัวถูกขับเคลื่อนโดยทิศทางเดียวใน residual stream — หากประมาณทิศทางนั้นแล้วเอาออก โมเดลจะหยุดปฏิเสธโดยไม่ต้องฝึกใหม่
โดยสรุป การ์ดดังกล่าวอธิบายถึงการประมาณทิศทางการปฏิเสธหนึ่งทิศทางจากผลต่างค่าเฉลี่ยที่ถูก massive-activation mask ของ residual ของโทเค็นสุดท้ายระหว่าง harmful ลบ harmless ที่เลเยอร์ 38 (round(0.6 × 64)) โดยใช้ AdvBench เป็นชุด harmful และ Alpaca เป็นชุด harmless การแก้ไขคือการทำ orthogonalization: W′ = W − r(rᵀW) ซึ่งคำนวณในรูปแบบ float32 และนำไปใช้กับเมทริกซ์ที่เขียน residual จำนวน 131 เมทริกซ์ ได้แก่ attention output projections, linear-attention output projections, MLP down projections และ embedding row space หนึ่งช่อง ไม่มีการรันขั้นตอนการฝึกใดๆ vision tower ถูกปล่อยไว้โดยไม่ถูกแตะต้อง และ MTP speculative-decoding head ถูก abliterate อย่างสม่ำเสมอ นั่นคือเหตุผลที่ความสามารถยังคงอยู่: การลบทิศทางหนึ่งออกเป็นการแทรกแซงที่อ่อนโยนกว่าการ fine-tune โมเดลให้ปฏิบัติตามอย่างมาก
การปฏิเสธล่มสลาย: ตัวเลข
วัดบนบิลด์ FP8 ที่ให้บริการผ่าน vLLM และเผยแพร่บนการ์ดโมเดล Hugging Face (2026-08-15) อัตราการปฏิเสธบนเกณฑ์ชี้วัดพรอมpt์ที่เป็นอันตรายลดลงจาก 64–99% บนเบสโมเดล เหลือ 0–6% บนบิลด์ที่ไม่ได้เซ็นเซอร์เมื่อปิดการคิด (thinking off):
• AdvBench — 99.0% → 0.0%
• JailbreakBench (อันตราย) — 94.0% → 0.0%
• StrongREJECT — 97.3% → 2.0%
• HarmBench (มาตรฐาน) — 98.7% → 2.7%
• MaliciousInstruct — 99.0% → 0.0%
• SimpleSafetyTests — 64.0% → 6.0%
• ForbiddenQuestions — 73.3% → 4.7%
เมื่อเปิดใช้งานโหมดคิด การปฏิเสธแทบไม่เกิดขึ้นเลย — 1.7% บน AdvBench และ 0.0% ในกรณีอื่นๆ ส่วนใหญ่ การ์ดระบุข้อแม้ที่ตรงไปตรงมาข้อหนึ่ง: 30–50% ของคำตอบยังคงขึ้นต้นด้วยข้อความปฏิเสธความรับผิดชอบสั้นๆ นั่นคือสิ่งประดิษฐ์จากการฝึกฝน ไม่ใช่การปฏิเสธ — โมเดลยังคงตอบคำถาม เพียงแต่เปิดประโยคอย่างระมัดระวัง อ่านแล้วให้ความรู้สึกเหมือนอุปสรรคในการใช้งาน ไม่ใช่ความปลอดภัย

การปฏิเสธมากเกินไปก็ผิดพลาดเช่นกัน
ตัวเลขที่ได้รับการกล่าวถึงน้อยกว่าอยู่อีกด้านหนึ่งของแกนความปลอดภัย บน XSTest-safe — ชุดพรอมป์ที่ไม่เป็นอันตราย 250 รายการที่โมเดลที่ผ่านการปรับแต่งบางครั้งปฏิเสธโดยผิดพลาด — โมเดลพื้นฐานปฏิเสธเกินจำเป็น 5.6% ของเวลาทั้งหมด เวอร์ชันที่ไม่มีการเซ็นเซอร์ปฏิเสธเกินจำเป็นเพียง 0.4% การเอาทิศทางของการปฏิเสธออกไปไม่เพียงแต่ทำให้โมเดลหยุดปฏิเสธคำขอที่เป็นอันตรายเท่านั้น แต่ยังทำให้มันหยุดปฏิเสธคำขอที่ไม่เป็นอันตรายซึ่งก่อนหน้านี้มันเคยติดป้ายว่าเป็นอันตรายจากการเหมารวมเกินขอบเขต สำหรับใครก็ตามที่สร้างเครื่องมือประเมินผลหรือเครื่องมือ red-team ที่ต้องการจุดตั้งต้นที่ไม่มีการปฏิเสธ นี่คือการปรับปรุงเครื่องมืออย่างแท้จริง ไม่ใช่ผลข้างเคียงที่ต้องขอโทษ
ความสามารถถูกคงไว้ ไม่ได้ถูกปรับปรุง
นี่คือจุดที่กรอบแนวคิด "ไม่ถูกเซ็นเซอร์ = แข็งแกร่งกว่า" ตายลง การ์ดโมเดลรายงาน build FP8 ที่ผ่านการ abliterated เทียบกับ FP8 พื้นฐานอย่างเป็นทางการ ด้วยสคริปต์และการตั้งค่าเดียวกัน:
• MMLU (0-shot) — 84.3% → 84.7%
• GSM8K (CoT) — 90.0% → 88.7%
• MMLU-Pro (CoT) — 77.6% → 76.8%
• CMMLU (0-shot, ภาษาจีน) — 81.4% → 80.8%
ทุกคะแนนอยู่ภายใน ±1.3 จุดของค่าฐาน และค่า perplexity ดิบของ WikiText-2 อยู่ที่ 6.96 — นี่คือหลักฐานของการ์ดว่าการสร้างแบบจำลองภาษานั้นไม่ได้ด้อยลง การอ่านอย่างตรงไปตรงมา: abliteration ใกล้เคียงกับการเป็นกลางทางความสามารถบนสถาปัตยกรรมนี้ คุณไม่ได้โมเดลที่ดีขึ้น คุณได้โมเดลเดียวกันแต่ไม่มีพฤติกรรมการปฏิเสธ

คำเตือนเดียวกันนี้ใช้กับระบบนิเวศที่กว้างขึ้น: การอ้างว่า "lossless uncensored" ในบิลด์จากชุมชนสมควรได้รับการอ่านด้วยความกังขา การเปรียบเทียบแบบสามทางบนบิลด์ open-weight ขนาด 4B บน Hugging Face พบว่าเทคนิคที่อ้างว่า lossless จริงๆ แล้วทำให้ TruthfulQA ลดลงประมาณ 7 จุด และ Lambada ลดลงประมาณ 4 จุด ขณะที่อัตราความสำเร็จในการโจมตี HarmBench แตะ 100% ส่วนอีกสองวิธีอยู่ที่ 99.2% และ 95.5% และการทดลองเชิงรุกบนบิลด์อื่นให้ผลเป็นศูนย์การปฏิเสธแต่กลับสร้างคำที่ไร้สาระไม่ต่อเนื่อง ดังนั้นเวอร์ชันที่เผยแพร่จึงถอยไปใช้พารามิเตอร์ต่อเลเยอร์ที่อ่อนโยนกว่า ผลลัพธ์ของ Abliteration ขึ้นอยู่กับวิธีการเฉพาะ — ตัวเลขเหล่านี้เป็นข้อมูลการ์ดของบิลด์ FP8 โดยเฉพาะ
สิ่งที่การ์ดไม่ได้อ้าง
อ่านระเบียบวิธีก่อนที่จะอ้างอิงตัวเลข การ์ดระบุการวัดการปฏิเสธไว้ว่า "indicative, not an LLM-judge / publication-grade number": การปฏิเสธถูกตัดสินโดยตัวจำแนกประเภทที่อิงกฎของวลีเปิด โดยมีกลุ่ม "caveat" แยกสำหรับคำตอบที่ปฏิบัติตามแต่มีการเพิ่มข้อความปฏิเสธความรับผิดชอบนำหน้า เกณฑ์มาตรฐานเป็นแบบข้อความเท่านั้น รันกับ FP8 build ที่ให้บริการผ่าน vLLM โดยใช้เฉพาะโมเดลภาษา และชุดประเมินความสามารถใช้สคริปต์ประเมินมาตรฐาน กรอบที่ถูกต้องคือ: นี่คือข้อมูลที่ผู้ขายวัดเอง ทำซ้ำได้จากการ์ดที่เผยแพร่ — ไม่ใช่การรันโดยบุคคลที่สามอย่างเป็นอิสระ และไม่ใช่การอ้างสิทธิ์เกี่ยวกับ GGUF build ซึ่งมาพร้อมการควอนไทซ์สำหรับ llama.cpp และควรประเมินแยกต่างหาก
เส้นแบ่งเขตความปลอดภัย
นี่คือส่วนที่ไม่สามารถเลี่ยงได้ โมเดลแบบ abliterated มีกลไกการปฏิเสธถูกถอดออกไปเป็นส่วนใหญ่ กล่าวคือ มันจะปฏิบัติตามคำขอที่เป็นอันตราย ผิดจริยธรรม หรือผิดกฎหมาย ซึ่งโมเดลพื้นฐาน Qwen3.8 27B จะปฏิเสธ และมันไม่มีกลไกป้องกันในตัวที่ใช้งานได้จริง การใช้งานที่สมควรคือเพื่อการวิจัย ได้แก่ การตีความได้ (interpretability) (ศึกษาว่าทิศทางการปฏิเสธถูกเข้ารหัสอย่างไร) การศึกษาความปลอดภัยของ AI และกลไกการปฏิเสธ การทำ red-teaming (การทดสอบโมเดลด้วยอินพุตที่พยายามเลี่ยงกลไกป้องกัน) และการประเมินความทนทาน (robustness) โมเดลนี้เผยแพร่ภายใต้สัญญาอนุญาต Apache 2.0 ซึ่งสืบทอดมาจากโมเดลพื้นฐาน โดยเป็นเพียงชิ้นงานเพื่อการวิจัยเท่านั้น คุณต้องรับผิดชอบและรับภาระทางกฎหมายอย่างเต็มที่ต่อวิธีที่คุณใช้มันและต่อทุกสิ่งที่มันสร้างขึ้น ห้ามนำไปให้ผู้ใช้ปลายทางใช้งานหรือนำไปใช้ในระบบจริง (production) โดยไม่มีชั้นป้องกันด้านความปลอดภัย การกลั่นกรอง และการป้องกันการใช้งานในทางที่ผิดของคุณเอง และสำหรับการใช้งานในระบบจริงหรือการใช้งานที่ให้ผู้บริโภคใช้โดยตรง โมเดล Qwen3.8 27B มาตรฐานคือโมเดลที่คุณต้องการจริงๆ
เมื่อการค้นหาเกณฑ์มาตรฐานที่ไม่มีการเซ็นเซอร์เป็นเรื่องที่ผิด
{{1}}หากคำถามของคุณคือ "โมเดลใดแข็งแกร่งที่สุดในด้านคณิตศาสตร์หรือการเขียนโค้ด?" คุณกำลังอ่านตัวเลขผิดที่ — บิลด์แบบไม่มีการเซ็นเซอร์ไม่ใช่การอัปเกรดขีดความสามารถ{{/1}} {{2}}หากแอปพลิเคชันของคุณจำเป็นต้องปฏิเสธคำขอที่เป็นอันตราย โมเดลนี้คือสิ่งที่ตรงข้ามกับสิ่งที่คุณต้องการ{{/2}} {{3}}หากคุณกำลังจะวางจำหน่ายผลิตภัณฑ์ อย่าสร้างบน abliterated checkpoint{{/3}} {{4}}และหากสิ่งที่คุณต้องการจริงๆ คือ jailbreak นั่นเป็นเรื่องที่ต่างออกไปโดยสิ้นเชิง — ชุดพรอมป์ระดับ (prompt-level packs) อยู่นอกเหนือการปรับแต่งระดับน้ำหนัก (weight-level intervention) ที่กล่าวถึงในที่นี้ และไม่ใช่หัวข้อของบทความนี้{{/4}} {{5}}ข้อมูลเกณฑ์มาตรฐาน (benchmark) ในบทความนี้มีไว้เพื่อคำถามที่แคบและชอบด้วยกฎหมายเพียงข้อเดียว:{{/5}} {{6}}การเอาความสามารถในการปฏิเสธออกไปส่งผลอย่างไรต่อ Qwen3.8 27B อย่างที่วัดได้{{/6}}
วิธีเข้าถึงมัน
ทั้งสองบิลด์อยู่บน Hugging Face ภายใต้ Apache 2.0: orcarouter/Qwen3.8-27B-Uncensored-FP8 (block-FP8 E4M3, น้ำหนักประมาณ 30.9 GB, ให้บริการบนเส้นทางเคอร์เนล vLLM FP8 มาตรฐานด้วยบริบท 262K, เครื่องมือ, การคิด และ MTP ครบถ้วน) และ orcarouter/Qwen3.8-27B-Uncensored-GGUF (F16 บวก 12 ระดับ quant สำหรับ llama.cpp โดย Q4_K_M ที่ 16.8 GB เป็นค่าเริ่มต้นที่แนะนำสำหรับ GPU 24 GB). ตัวโมเดลการ์ด บน OrcaRouter มีราคาและรายละเอียดเกณฑ์มาตรฐาน — บิลด์ที่ไม่ผ่านการเซ็นเซอร์ถูกระบุไว้ที่นั่นเป็น obsidian/Qwen3.8-27B ที่ $0.40 ต่อล้านอินพุตและ $4.21 ต่อล้านเอาต์พุตโทเคน โดยมีบริบท 262K และการเข้าถึงถูกจำกัดสำหรับนักวิจัยด้านความปลอดภัย ทีมเรดทีม และนักวิจัยด้านความปลอดภัย AI

สรุป
เกณฑ์มาตรฐาน qwen uncensored ตอบคำถามที่แคบ และคำตอบก็ชัดเจน: การลบการปฏิเสธออกจาก Qwen3.8 27B ด้วยวิธี abliteration ทำให้ความสามารถลดลงภายใน ±1.3 จุด ขณะที่การปฏิเสธต่อพรอมป์ที่เป็นอันตรายลดลงจาก 64–99% เหลือ 0–6% การปฏิเสธเกินจำเป็นลดลงจาก 5.6% เหลือ 0.4% และความงงงวย (perplexity) คงที่ที่ 6.96 อ่านตัวเลขเหล่านี้ว่า "ไม่ปฏิเสธ" อย่าอ่านว่า "แข็งแกร่งขึ้น" สำหรับงานด้านการตีความ ความปลอดภัย และการวิจัยเรดทีม นี่คือเครื่องมือที่ตรงกับที่อธิบายไว้ในโมเดลการ์ดพอดี สำหรับสิ่งใดก็ตามที่เผชิญหน้ากับผู้ใช้ นี่คือโมเดลที่ผิดโดยธรรมชาติ
สำหรับการใช้งานเพื่อการวิจัยที่ถูกต้องตามกฎหมาย น้ำหนักโมเดลอยู่บน Hugging Face ภายใต้สัญญาอนุญาต Apache 2.0 — orcarouter/Qwen3.8-27B-Uncensored-FP8 (บิลด์ GGUF สำหรับ llama.cpp อยู่ที่ orcarouter/Qwen3.8-27B-Uncensored-GGUF)
