ป้ายชื่อเรื่องสำหรับรายงานการวัดประสิทธิภาพ Qwen3.8-27B-Uncensored แสดงมาตรวัดอัตราการปฏิเสธที่ลดลงจาก 99 เปอร์เซ็นต์สีแดงบนแผงที่ติดป้ายว่า Base ไปเป็น 0 เปอร์เซ็นต์สีเขียวบนแผงที่ติดป้ายว่า Uncensored พร้อมไอคอนโล่ที่มีเส้นขีดฆ่าบนแผงด้านขวา และเส้นแนวนอนด้านล่างที่ระบุว่าความสามารถอยู่ภายในบวกหรือลบ 1.3 จุด
Guides & Insights

Qwen3.8-27B-Uncensored ผลการทดสอบ: การปฏิเสธล่มสลาย ความสามารถยังคงอยู่

ผู้เขียน

Rowan Sterling

วันที่เผยแพร่

โมเดลล่าสุด · 20ดูโมเดลทั้งหมด
เบนช์มาร์ก: Artificial Analysis · อัปเดตทุกวัน
กลับไปยังโพสต์ทั้งหมด

เรื่องราวเกณฑ์มาตรฐานของ Qwen3.8 27B Uncensored (Aggressive) — บิลด์ abliterated ของ Qwen3.8 27B ที่เผยแพร่เป็นเช็คพอยต์ FP8 เมื่อวันที่ 15 สิงหาคม 2026 และบิลด์ GGUF ในวันที่ 16 สิงหาคม — ไม่ใช่เรื่องที่มันฉลาดขึ้น แต่เป็นเรื่องที่มันหยุดปฏิเสธ การ์ดโมเดลรายงานว่าการปฏิเสธพรอมต์ที่เป็นอันตรายลดลงจาก 64–99% บนโมเดลฐานเป็น 0–6% บนบิลด์ abliterated เมื่อปิดการคิด และต่ำกว่าหรือเท่ากับ 1.7% เมื่อเปิดการคิด ขณะที่เกณฑ์มาตรฐานความสามารถทุกตัวอยู่ภายใน ±1.3 จุดของโมเดลฐาน และค่า perplexity ของ WikiText-2 อยู่ที่ 6.96 หากคุณมาที่นี่เพื่อดูเกณฑ์มาตรฐาน qwen uncensored นี่คือตัวเลขหลัก: มันไม่ใช่โมเดลที่ฉลาดขึ้น แต่เป็นโมเดลที่ไม่ปฏิเสธ

ความแตกต่างนั้นสำคัญ เพราะสิ่งที่ติดอันดับใน "เกณฑ์วัดแบบไม่มีเซนเซอร์" ส่วนใหญ่ก็คือลิสต์คะแนนความสามารถบางๆ หรือโพสต์ hype ที่อ้างว่าโมเดล "ดีกว่า" ซึ่งทั้งคู่ไม่ใช่สิ่งที่ abliteration ทำ บทความนี้จะพาไปดูข้อมูลที่วัดได้จริง — refusal collapse, over-refusal, capability retention และ perplexity — รวมถึงวิธีการที่สร้างข้อมูลนี้ และขอบเขตด้านความปลอดภัยที่คุณควรอ่านก่อนจะแตะต้องน้ำหนักโมเดล

การรวบรวมเกณฑ์มาตรฐานที่ไม่ถูกเซ็นเซอร์นั้นวัดอะไรได้จริง

การรีวิวโมเดลโดยทั่วไปรายงานเพียงแกนเดียว: ความสามารถ — MMLU, GSM8K, การเขียนโค้ด และการใช้เหตุผล โมเดลแบบ abliterated น่าสนใจในอีกแกนหนึ่ง และประเด็นทั้งหมดของฉลาก "ไม่มีการเซ็นเซอร์" ก็คือแกนความปลอดภัยถูกขยับไปแล้ว ดังนั้นคำถามที่เป็นประโยชน์สำหรับ Qwen3.8-27B-Uncensored-FP8 จึงไม่ใช่ "มันฉลาดกว่าไหม?" แต่คือ "การนำกลไกการปฏิเสธออกไปมีต้นทุนเท่าไร และถูกลบออกไปอย่างทั่วถึงแค่ไหน?"

ต้องอ่านตัวเลขสามกลุ่มนี้ประกอบกัน อัตราการปฏิเสธบนเกณฑ์ชี้วัดพรอมพต์ที่เป็นอันตราย — ความถี่ที่โมเดลปฏิเสธ; ยิ่งค่าฐานสูงเท่าใด ผลของการถอดออกก็ยิ่งเห็นชัดมากเท่านั้น การปฏิเสธเกินควรบนพรอมพต์ที่ไม่เป็นอันตราย — ความถี่ที่โมเดลปฏิเสธคำขอที่บริสุทธิ์อย่างไม่ถูกต้อง; ยิ่งต่ำยิ่งดีสำหรับทุกคน และการคงไว้ซึ่งความสามารถ — ว่าการแก้ไขทำให้โมเดลด้อยลงหรือไม่ บทสรุปเกณฑ์ชี้วัดที่พิมพ์เฉพาะคะแนนความสามารถ กำลังตอบคำถามที่ผิด

วิธีการ: abliteration คือการแก้ไขน้ำหนัก ไม่ใช่การปรับแต่งละเอียด

สิ่งที่ทำให้ abliteration แตกต่างจากแพ็ก "jailbreak" ของชุมชนคือตำแหน่งที่การเปลี่ยนแปลงเกิดขึ้น การ jailbreak ในระดับพรอมพ์จะห่อหุ้มอินพุต ส่วน abliteration จะแก้ไขน้ำหนัก วิธีการนี้คือ Arditi et al. (2024) เรื่อง "Refusal in Language Models Is Mediated by a Single Direction" ข้อค้นพบหลักคือพฤติกรรมการปฏิเสธในโมเดลหลายตัวถูกขับเคลื่อนโดยทิศทางเดียวใน residual stream — หากประมาณทิศทางนั้นแล้วเอาออก โมเดลจะหยุดปฏิเสธโดยไม่ต้องฝึกใหม่

โดยสรุป การ์ดดังกล่าวอธิบายถึงการประมาณทิศทางการปฏิเสธหนึ่งทิศทางจากผลต่างค่าเฉลี่ยที่ถูก massive-activation mask ของ residual ของโทเค็นสุดท้ายระหว่าง harmful ลบ harmless ที่เลเยอร์ 38 (round(0.6 × 64)) โดยใช้ AdvBench เป็นชุด harmful และ Alpaca เป็นชุด harmless การแก้ไขคือการทำ orthogonalization: W′ = W − r(rᵀW) ซึ่งคำนวณในรูปแบบ float32 และนำไปใช้กับเมทริกซ์ที่เขียน residual จำนวน 131 เมทริกซ์ ได้แก่ attention output projections, linear-attention output projections, MLP down projections และ embedding row space หนึ่งช่อง ไม่มีการรันขั้นตอนการฝึกใดๆ vision tower ถูกปล่อยไว้โดยไม่ถูกแตะต้อง และ MTP speculative-decoding head ถูก abliterate อย่างสม่ำเสมอ นั่นคือเหตุผลที่ความสามารถยังคงอยู่: การลบทิศทางหนึ่งออกเป็นการแทรกแซงที่อ่อนโยนกว่าการ fine-tune โมเดลให้ปฏิบัติตามอย่างมาก

การปฏิเสธล่มสลาย: ตัวเลข

วัดบนบิลด์ FP8 ที่ให้บริการผ่าน vLLM และเผยแพร่บนการ์ดโมเดล Hugging Face (2026-08-15) อัตราการปฏิเสธบนเกณฑ์ชี้วัดพรอมpt์ที่เป็นอันตรายลดลงจาก 64–99% บนเบสโมเดล เหลือ 0–6% บนบิลด์ที่ไม่ได้เซ็นเซอร์เมื่อปิดการคิด (thinking off):

• AdvBench — 99.0% → 0.0%

• JailbreakBench (อันตราย) — 94.0% → 0.0%

• StrongREJECT — 97.3% → 2.0%

• HarmBench (มาตรฐาน) — 98.7% → 2.7%

• MaliciousInstruct — 99.0% → 0.0%

• SimpleSafetyTests — 64.0% → 6.0%

• ForbiddenQuestions — 73.3% → 4.7%

เมื่อเปิดใช้งานโหมดคิด การปฏิเสธแทบไม่เกิดขึ้นเลย — 1.7% บน AdvBench และ 0.0% ในกรณีอื่นๆ ส่วนใหญ่ การ์ดระบุข้อแม้ที่ตรงไปตรงมาข้อหนึ่ง: 30–50% ของคำตอบยังคงขึ้นต้นด้วยข้อความปฏิเสธความรับผิดชอบสั้นๆ นั่นคือสิ่งประดิษฐ์จากการฝึกฝน ไม่ใช่การปฏิเสธ — โมเดลยังคงตอบคำถาม เพียงแต่เปิดประโยคอย่างระมัดระวัง อ่านแล้วให้ความรู้สึกเหมือนอุปสรรคในการใช้งาน ไม่ใช่ความปลอดภัย

A two-column scoreboard comparing harmful-prompt refusal rates for the base Qwen3.8 27B versus the abliterated Qwen3.8-27B-Uncensored build across seven benchmarks, the base column reading 99.0, 94.0, 97.3, 98.7, 99.0, 64.0 and 73.3 percent and the uncensored column reading 0.0, 0.0, 2.0, 2.7, 0.0, 6.0 and 4.7 percent, with a footer noting the data is from the Hugging Face model card, measured on the vLLM-served FP8 build, 2026-08-15.

การปฏิเสธมากเกินไปก็ผิดพลาดเช่นกัน

ตัวเลขที่ได้รับการกล่าวถึงน้อยกว่าอยู่อีกด้านหนึ่งของแกนความปลอดภัย บน XSTest-safe — ชุดพรอมป์ที่ไม่เป็นอันตราย 250 รายการที่โมเดลที่ผ่านการปรับแต่งบางครั้งปฏิเสธโดยผิดพลาด — โมเดลพื้นฐานปฏิเสธเกินจำเป็น 5.6% ของเวลาทั้งหมด เวอร์ชันที่ไม่มีการเซ็นเซอร์ปฏิเสธเกินจำเป็นเพียง 0.4% การเอาทิศทางของการปฏิเสธออกไปไม่เพียงแต่ทำให้โมเดลหยุดปฏิเสธคำขอที่เป็นอันตรายเท่านั้น แต่ยังทำให้มันหยุดปฏิเสธคำขอที่ไม่เป็นอันตรายซึ่งก่อนหน้านี้มันเคยติดป้ายว่าเป็นอันตรายจากการเหมารวมเกินขอบเขต สำหรับใครก็ตามที่สร้างเครื่องมือประเมินผลหรือเครื่องมือ red-team ที่ต้องการจุดตั้งต้นที่ไม่มีการปฏิเสธ นี่คือการปรับปรุงเครื่องมืออย่างแท้จริง ไม่ใช่ผลข้างเคียงที่ต้องขอโทษ

ความสามารถถูกคงไว้ ไม่ได้ถูกปรับปรุง

นี่คือจุดที่กรอบแนวคิด "ไม่ถูกเซ็นเซอร์ = แข็งแกร่งกว่า" ตายลง การ์ดโมเดลรายงาน build FP8 ที่ผ่านการ abliterated เทียบกับ FP8 พื้นฐานอย่างเป็นทางการ ด้วยสคริปต์และการตั้งค่าเดียวกัน:

• MMLU (0-shot) — 84.3% → 84.7%

• GSM8K (CoT) — 90.0% → 88.7%

• MMLU-Pro (CoT) — 77.6% → 76.8%

• CMMLU (0-shot, ภาษาจีน) — 81.4% → 80.8%

ทุกคะแนนอยู่ภายใน ±1.3 จุดของค่าฐาน และค่า perplexity ดิบของ WikiText-2 อยู่ที่ 6.96 — นี่คือหลักฐานของการ์ดว่าการสร้างแบบจำลองภาษานั้นไม่ได้ด้อยลง การอ่านอย่างตรงไปตรงมา: abliteration ใกล้เคียงกับการเป็นกลางทางความสามารถบนสถาปัตยกรรมนี้ คุณไม่ได้โมเดลที่ดีขึ้น คุณได้โมเดลเดียวกันแต่ไม่มีพฤติกรรมการปฏิเสธ

A scoreboard for the Qwen3.8-27B-Uncensored capability retention results: MMLU 84.3 to 84.7, GSM8K 90.0 to 88.7, MMLU-Pro 77.6 to 76.8, CMMLU 81.4 to 80.8, every score within plus or minus 1.3 points of the base, with a highlight panel showing WikiText-2 perplexity 6.96 and over-refusal on XSTest-safe falling from 5.6 percent to 0.4 percent, and a footer noting the source is the Hugging Face model card, measured on the vLLM-served FP8 build.

คำเตือนเดียวกันนี้ใช้กับระบบนิเวศที่กว้างขึ้น: การอ้างว่า "lossless uncensored" ในบิลด์จากชุมชนสมควรได้รับการอ่านด้วยความกังขา การเปรียบเทียบแบบสามทางบนบิลด์ open-weight ขนาด 4B บน Hugging Face พบว่าเทคนิคที่อ้างว่า lossless จริงๆ แล้วทำให้ TruthfulQA ลดลงประมาณ 7 จุด และ Lambada ลดลงประมาณ 4 จุด ขณะที่อัตราความสำเร็จในการโจมตี HarmBench แตะ 100% ส่วนอีกสองวิธีอยู่ที่ 99.2% และ 95.5% และการทดลองเชิงรุกบนบิลด์อื่นให้ผลเป็นศูนย์การปฏิเสธแต่กลับสร้างคำที่ไร้สาระไม่ต่อเนื่อง ดังนั้นเวอร์ชันที่เผยแพร่จึงถอยไปใช้พารามิเตอร์ต่อเลเยอร์ที่อ่อนโยนกว่า ผลลัพธ์ของ Abliteration ขึ้นอยู่กับวิธีการเฉพาะ — ตัวเลขเหล่านี้เป็นข้อมูลการ์ดของบิลด์ FP8 โดยเฉพาะ

สิ่งที่การ์ดไม่ได้อ้าง

อ่านระเบียบวิธีก่อนที่จะอ้างอิงตัวเลข การ์ดระบุการวัดการปฏิเสธไว้ว่า "indicative, not an LLM-judge / publication-grade number": การปฏิเสธถูกตัดสินโดยตัวจำแนกประเภทที่อิงกฎของวลีเปิด โดยมีกลุ่ม "caveat" แยกสำหรับคำตอบที่ปฏิบัติตามแต่มีการเพิ่มข้อความปฏิเสธความรับผิดชอบนำหน้า เกณฑ์มาตรฐานเป็นแบบข้อความเท่านั้น รันกับ FP8 build ที่ให้บริการผ่าน vLLM โดยใช้เฉพาะโมเดลภาษา และชุดประเมินความสามารถใช้สคริปต์ประเมินมาตรฐาน กรอบที่ถูกต้องคือ: นี่คือข้อมูลที่ผู้ขายวัดเอง ทำซ้ำได้จากการ์ดที่เผยแพร่ — ไม่ใช่การรันโดยบุคคลที่สามอย่างเป็นอิสระ และไม่ใช่การอ้างสิทธิ์เกี่ยวกับ GGUF build ซึ่งมาพร้อมการควอนไทซ์สำหรับ llama.cpp และควรประเมินแยกต่างหาก

เส้นแบ่งเขตความปลอดภัย

นี่คือส่วนที่ไม่สามารถเลี่ยงได้ โมเดลแบบ abliterated มีกลไกการปฏิเสธถูกถอดออกไปเป็นส่วนใหญ่ กล่าวคือ มันจะปฏิบัติตามคำขอที่เป็นอันตราย ผิดจริยธรรม หรือผิดกฎหมาย ซึ่งโมเดลพื้นฐาน Qwen3.8 27B จะปฏิเสธ และมันไม่มีกลไกป้องกันในตัวที่ใช้งานได้จริง การใช้งานที่สมควรคือเพื่อการวิจัย ได้แก่ การตีความได้ (interpretability) (ศึกษาว่าทิศทางการปฏิเสธถูกเข้ารหัสอย่างไร) การศึกษาความปลอดภัยของ AI และกลไกการปฏิเสธ การทำ red-teaming (การทดสอบโมเดลด้วยอินพุตที่พยายามเลี่ยงกลไกป้องกัน) และการประเมินความทนทาน (robustness) โมเดลนี้เผยแพร่ภายใต้สัญญาอนุญาต Apache 2.0 ซึ่งสืบทอดมาจากโมเดลพื้นฐาน โดยเป็นเพียงชิ้นงานเพื่อการวิจัยเท่านั้น คุณต้องรับผิดชอบและรับภาระทางกฎหมายอย่างเต็มที่ต่อวิธีที่คุณใช้มันและต่อทุกสิ่งที่มันสร้างขึ้น ห้ามนำไปให้ผู้ใช้ปลายทางใช้งานหรือนำไปใช้ในระบบจริง (production) โดยไม่มีชั้นป้องกันด้านความปลอดภัย การกลั่นกรอง และการป้องกันการใช้งานในทางที่ผิดของคุณเอง และสำหรับการใช้งานในระบบจริงหรือการใช้งานที่ให้ผู้บริโภคใช้โดยตรง โมเดล Qwen3.8 27B มาตรฐานคือโมเดลที่คุณต้องการจริงๆ

เมื่อการค้นหาเกณฑ์มาตรฐานที่ไม่มีการเซ็นเซอร์เป็นเรื่องที่ผิด

{{1}}หากคำถามของคุณคือ "โมเดลใดแข็งแกร่งที่สุดในด้านคณิตศาสตร์หรือการเขียนโค้ด?" คุณกำลังอ่านตัวเลขผิดที่ — บิลด์แบบไม่มีการเซ็นเซอร์ไม่ใช่การอัปเกรดขีดความสามารถ{{/1}} {{2}}หากแอปพลิเคชันของคุณจำเป็นต้องปฏิเสธคำขอที่เป็นอันตราย โมเดลนี้คือสิ่งที่ตรงข้ามกับสิ่งที่คุณต้องการ{{/2}} {{3}}หากคุณกำลังจะวางจำหน่ายผลิตภัณฑ์ อย่าสร้างบน abliterated checkpoint{{/3}} {{4}}และหากสิ่งที่คุณต้องการจริงๆ คือ jailbreak นั่นเป็นเรื่องที่ต่างออกไปโดยสิ้นเชิง — ชุดพรอมป์ระดับ (prompt-level packs) อยู่นอกเหนือการปรับแต่งระดับน้ำหนัก (weight-level intervention) ที่กล่าวถึงในที่นี้ และไม่ใช่หัวข้อของบทความนี้{{/4}} {{5}}ข้อมูลเกณฑ์มาตรฐาน (benchmark) ในบทความนี้มีไว้เพื่อคำถามที่แคบและชอบด้วยกฎหมายเพียงข้อเดียว:{{/5}} {{6}}การเอาความสามารถในการปฏิเสธออกไปส่งผลอย่างไรต่อ Qwen3.8 27B อย่างที่วัดได้{{/6}}

วิธีเข้าถึงมัน

ทั้งสองบิลด์อยู่บน Hugging Face ภายใต้ Apache 2.0: orcarouter/Qwen3.8-27B-Uncensored-FP8 (block-FP8 E4M3, น้ำหนักประมาณ 30.9 GB, ให้บริการบนเส้นทางเคอร์เนล vLLM FP8 มาตรฐานด้วยบริบท 262K, เครื่องมือ, การคิด และ MTP ครบถ้วน) และ orcarouter/Qwen3.8-27B-Uncensored-GGUF (F16 บวก 12 ระดับ quant สำหรับ llama.cpp โดย Q4_K_M ที่ 16.8 GB เป็นค่าเริ่มต้นที่แนะนำสำหรับ GPU 24 GB). ตัวโมเดลการ์ด บน OrcaRouter มีราคาและรายละเอียดเกณฑ์มาตรฐาน — บิลด์ที่ไม่ผ่านการเซ็นเซอร์ถูกระบุไว้ที่นั่นเป็น obsidian/Qwen3.8-27B ที่ $0.40 ต่อล้านอินพุตและ $4.21 ต่อล้านเอาต์พุตโทเคน โดยมีบริบท 262K และการเข้าถึงถูกจำกัดสำหรับนักวิจัยด้านความปลอดภัย ทีมเรดทีม และนักวิจัยด้านความปลอดภัย AI

The OrcaRouter model page for obsidian Qwen3.8-27B, showing the uncensored build's 0.40 USD per million input and 4.21 USD per million output pricing, a 262K token context window, a released August 15 2026 label, and the researcher-access gating note.

สรุป

เกณฑ์มาตรฐาน qwen uncensored ตอบคำถามที่แคบ และคำตอบก็ชัดเจน: การลบการปฏิเสธออกจาก Qwen3.8 27B ด้วยวิธี abliteration ทำให้ความสามารถลดลงภายใน ±1.3 จุด ขณะที่การปฏิเสธต่อพรอมป์ที่เป็นอันตรายลดลงจาก 64–99% เหลือ 0–6% การปฏิเสธเกินจำเป็นลดลงจาก 5.6% เหลือ 0.4% และความงงงวย (perplexity) คงที่ที่ 6.96 อ่านตัวเลขเหล่านี้ว่า "ไม่ปฏิเสธ" อย่าอ่านว่า "แข็งแกร่งขึ้น" สำหรับงานด้านการตีความ ความปลอดภัย และการวิจัยเรดทีม นี่คือเครื่องมือที่ตรงกับที่อธิบายไว้ในโมเดลการ์ดพอดี สำหรับสิ่งใดก็ตามที่เผชิญหน้ากับผู้ใช้ นี่คือโมเดลที่ผิดโดยธรรมชาติ

สำหรับการใช้งานเพื่อการวิจัยที่ถูกต้องตามกฎหมาย น้ำหนักโมเดลอยู่บน Hugging Face ภายใต้สัญญาอนุญาต Apache 2.0 — orcarouter/Qwen3.8-27B-Uncensored-FP8 (บิลด์ GGUF สำหรับ llama.cpp อยู่ที่ orcarouter/Qwen3.8-27B-Uncensored-GGUF)

© 2026 OrcaRouter

สำหรับผู้ให้บริการ

ให้บริการแพลตฟอร์มการอนุมานอยู่หรือไม่ นำโมเดลของคุณขึ้น OrcaRouter

providers@orcarouter.ai

เข้าร่วมคอมมูนิตี้ของเรา

Discordsupport@orcarouter.aiXGitHubYouTube