
Abliteration อธิบาย: การลบการปฏิเสธทำงานอย่างไรโดยไม่ต้องฝึก
- typesafeใหม่TypeSafe: Jev 1.132026-09-24$0.04 / $0.00 ต่อ 1 ล้านโทเค็น · 1009 tok/s
- OpenAIใหม่OpenAI: GPT-6 Luna2026-09-2237ความฉลาด
- OpenAIใหม่OpenAI: GPT-6 Sol2026-09-2248ความฉลาด
- Anthropicใหม่Anthropic: Claude Opus 5.52026-09-2258ความฉลาด
- xAIใหม่Grok 4.72026-09-2146ความฉลาด
- Orcaใหม่Orca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 ต่อ 1 ล้านโทเค็น · 195 tok/s
- Orcaใหม่Orca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 ต่อ 1 ล้านโทเค็น · 1189 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040ความฉลาด
- OpenAIOpenAI: GPT-6 Astra2026-09-0453ความฉลาด77การเขียนโค้ด
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241ความฉลาด76การเขียนโค้ด
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245ความฉลาด76การเขียนโค้ด
- AnthropicAnthropic: Claude Fable 5.12026-09-0153ความฉลาด82การเขียนโค้ด
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 ต่อ 1 ล้านโทเค็น · 22 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 ต่อ 1 ล้านโทเค็น · 108 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642ความฉลาด72การเขียนโค้ด
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 ต่อ 1 ล้านโทเค็น · 220 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845ความฉลาด75การเขียนโค้ด
- obsidianQwen3.8 27B2026-08-1534ความฉลาด68การเขียนโค้ด
- DeepSeekDeepSeek: DeepSeek V4 Pro 08132026-08-1236ความฉลาด69การเขียนโค้ด
- xAISpaceXAI: Grok 4.62026-08-1244ความฉลาด77การเขียนโค้ด
Abliteration คือการลบพฤติกรรมการปฏิเสธของ LLM — รีเฟล็กซ์ที่พูดว่า 'ฉันช่วยไม่ได้' — ด้วยการแก้ไขน้ำหนักและไม่ต้องมีการฝึก กลไกนี้ทำงานเพราะการปฏิเสธเกิดจากทิศทางเดียวใน residual stream ของโมเดล: หาทิศทางนั้น ลบมันออกจากเมทริกซ์ที่เขียนเข้าสู่ residual stream แล้วโมเดลจะหยุดปฏิเสธในขณะที่คงความสามารถไว้ ตัวอย่างสาธารณะที่ชัดเจนที่สุดคือ Qwen3.8 27B Uncensored (Aggressive) ซึ่งการ์ดโมเดลแสดงการปฏิเสธต่อพรอมต์ที่เป็นอันตรายลดลงจาก 99.0% เป็น 0.0% บน AdvBench ในขณะที่ MMLU กลับเพิ่มขึ้นหนึ่งในสิบจุด นี่คือวิธีที่กลไกทำงาน ตัวเลขที่วัดได้บอกอะไร และเส้นแบ่งอยู่ตรงไหน.
นี่ไม่ใช่การ fine-tuning ไม่ใช่ RLHF และไม่ใช่พรอมป์เจลเบรก {{1}}Abliteration คือผลลัพธ์ด้าน interpretability ที่ถูกแปลงเป็นพีชคณิตเชิงเส้น: งานวิจัยปี 2024 แสดงให้เห็นว่าทิศทางหนึ่งในการแทนค่าภายในควบคุมพฤติกรรมที่การฝึกเพื่อความปลอดภัยใช้ความพยายามอย่างมหาศาลในการฝัง และคุณสามารถปิดมันได้ด้วยการแก้ไขเวตโดยตรง{{/1}} เนื่องจากการแก้ไขนี้เป็นการ projection จึงมีต้นทุนต่ำ ทำซ้ำได้บน GPU ตัวเดียว และทิ้ง checkpoint ปกติที่แชร์ได้ไว้เบื้องหลัง — ซึ่งเป็นเหตุผลว่าทำไมบิลด์แบบ abliterated ของโมเดลโอเพนซอร์ส รวมถึงตระกูล Qwen3.8-27B จึงกลายเป็นวิธีมาตรฐานในการสร้าง research checkpoints แบบ "ไม่มีการเซ็นเซอร์"
ทิศทางการปฏิเสธ: เวกเตอร์หนึ่งตัวในกระแสหลายพันมิติ
ภายในทรานส์ฟอร์เมอร์ โทเคนทุกตัวผ่านสตรีมเรซิดิว — การแทนค่าที่ดำเนินต่อเนื่องซึ่งเลเยอร์ต่างๆ อ่านจากและเขียนลงไป บล็อก attention และ MLP ของแต่ละเลเยอร์รับสตรีมนี้เป็นอินพุตและเพิ่มเอาต์พุตกลับเข้าไป สตรีมนี้ในทางปฏิบัติคือหน่วยความจำทำงานของโมเดล: หนึ่งเวกเตอร์ต่อตำแหน่งโทเคน โดยมีมิติเท่ากับความกว้างของโมเดล
บทความปี 2024 ที่เป็นจุดเริ่มต้นของทั้งหมดนี้ — Andy Arditi และเพื่อนร่วมงาน, "การปฏิเสธในโมเดลภาษาถูกควบคุมโดยทิศทางเดียว" (arXiv:2406.11717, NeurIPS 2024) — วัดว่าเวกเตอร์สตรีมเหล่านั้นมีหน้าตาอย่างไรเมื่อโมเดลแชทกำลังจะปฏิเสธ เทียบกับเมื่อมันยอมทำตาม ในโมเดลแชทแบบ open-weight 13 ตัวที่มีพารามิเตอร์ตั้งแต่ 1.8B ถึง 72B, คำตอบที่ได้สอดคล้องกันอย่างน่าทึ่ง: ความแตกต่างนั้นแท้จริงคือทิศทางเดียว. ที่โทเคนสุดท้าย residual stream มีองค์ประกอบขนาดใหญ่ตามทิศทางการปฏิเสธเดียวเมื่อโมเดลกำลังปฏิเสธ และแทบไม่มีเลยเมื่อมันยอมทำตาม เรขาคณิตนี้สอดคล้องกันในทุกหมวดหมู่ของอันตราย ซึ่งเป็นเหตุผลว่าทำไมการโปรเจกชันจึงรวมศูนย์อยู่ที่ซิงกูลาร์เวกเตอร์แรก แทนที่จะกระจายไปทั่วซับสเปซทั้งหมด
เพื่อหาทิศทางดังกล่าว คุณต้องเก็บรวบรวมแอคติเวชันจากพรอมต์สองชุด — ชุดที่เป็นอันตรายและชุดที่ไม่เป็นอันตราย — แล้วหาค่าเฉลี่ยของเรซิดิวจากโทเคนสุดท้ายของแต่ละชุด ทิศทางการปฏิเสธโดยประมาณคือ mean(harmful) − mean(harmless) ซึ่งปรับให้เป็นเวกเตอร์ที่มีความยาวหนึ่งหน่วย งานวิจัยต้นฉบับอธิบายแนวคิดนี้ผ่าน linear probing; โมเดลระดับโปรดักชันอย่าง Qwen3.8-27B-Uncensored-FP8 ประมาณค่าทิศทางเดียว (k=1) ด้วยผลต่างเฉลี่ยแบบมาสก์แอคติเวชันขนาดใหญ่ของเรซิดิวโทเคนสุดท้ายระหว่างชุดที่เป็นอันตรายและไม่เป็นอันตราย ไม่ต้องมีป้ายกำกับใดๆ นอกเหนือจากการแบ่งเป็นอันตราย/ไม่เป็นอันตราย ไม่ต้องใช้เกรเดียนต์ และไม่ต้องฝึกโมเดล
การแก้ไข: ลบทิศทางจากเมทริกซ์ทุกตัวที่เขียนไปยังสตรีม
เมื่อคุณมีทิศทางการปฏิเสธ r — เวกเตอร์หน่วยใน residual stream — การแทรกแซงคือการฉายแบบ rank-1 เมทริกซ์น้ำหนักทุกตัวที่ผลลัพธ์ถูกบวกเข้ากับ residual stream สามารถถูก "ทำความสะอาด" จาก r ได้:
W' = W − r(rᵀW)
กล่าวคือ: คำนวณองค์ประกอบเอาต์พุตของเมทริกซ์แต่ละตัวที่ชี้ไปตาม r แล้วลบมันทิ้ง เมทริกซ์ที่เขียนไปยังสตรีมคือโปรเจกชันเอาต์พุต — โปรเจกชันเอาต์พุตของแอตเทนชัน (o_proj), โปรเจกชันดาวน์ของ MLP (down_proj) และสเปซแถวของเอมเบดดิ้งโทเคน การแก้ไขนี้ทำงานในรูปแบบ float32 ใช้เวลาเป็นนาทีบน GPU หนึ่งตัว และไม่ต้องใช้ออปติไมเซอร์หรือข้อมูลฝึกอบรมใดๆ นอกเหนือจากคู่แอกติเวชันที่คุณรวบรวมไว้แล้ว
การลบทิศทางมีสองวิธี และทั้งสองวิธีนี้สมควรแยกออกจากกัน:
• การตัดทอนแอกติเวชัน — สอดแทรกในฟอร์เวิร์ดพาสและลบองค์ประกอบ r ออกจากแอกติเวชันที่ใช้งานจริง ย้อนกลับได้ ไม่มีการแก้ไขน้ำหนักใดๆ เหมาะสำหรับการทดลองที่เปรียบเทียบการปฏิเสธและการปฏิบัติตามบนเช็กพอยต์เดียวกัน
• การทำน้ำหนักให้ตั้งฉาก — นำการฉายไปใช้กับตัวน้ำหนักเอง ทำให้ได้ checkpoint ที่ถาวรและแชร์ได้ นี่คือสิ่งที่ "abliteration" หมายถึง และเป็นสิ่งที่มาพร้อมกับคลังโมเดลที่ไม่ผ่านการเซ็นเซอร์

การทำออร์โธโกนัลไลเซชันนั้นจงใจให้ตรงไปตรงมาแบบหยาบ มันเพียงแค่ลบองค์ประกอบการปฏิเสธออกจากค่าน้ำหนักเท่านั้น ไม่ได้ทำอะไรเพิ่มเติมอีก มันไม่สามารถเพิ่มความรู้ ปรับปรุงการใช้เหตุผล หรือทำให้โมเดลซื่อสัตย์ต่อความจริงมากขึ้น ซึ่งเป็นเหตุผลที่โมเดลที่ผ่านการอบลิเทอเรตจะมีพฤติกรรมเหมือนโมเดลฐาน เพียงแต่ปราศจากรีเฟล็กซ์การปฏิเสธ
131 เมทริกซ์มีลักษณะอย่างไรบนบิลด์จริง: Qwen3.8-27B-Uncensored-FP8
เพื่อให้เห็นภาพชัดเจน: Qwen3.8-27B-Uncensored-FP8 (Hugging Face, เผยแพร่เมื่อ 2026-08-15, Apache 2.0) เป็นบิลด์แบบ abliterated ของ Qwen3.8-27B. Qwen3.8-27B เป็นโมเดลแบบ hybrid-attention — ประกอบด้วย full-attention 16 ชั้น และ Gated DeltaNet linear layers 48 ชั้น รวมทั้งหมด 64 ชั้น พร้อมหัว multi-token-prediction (MTP). บิลด์นี้ได้ทำการ orthogonalize ทิศทางการปฏิเสธ (refusal direction) ออกจาก เมทริกซ์ที่เขียน residual จำนวน 131 ตัว:
• self_attn.o_proj — 17 เมทริกซ์ (16 เลเยอร์ full-attention + MTP)
linear_attn.out_proj — 48 เมทริกซ์ (เลเยอร์ Gated DeltaNet)
• mlp.down_proj — 65 เมทริกซ์ (64 เลเยอร์ + MTP)
• embed_tokens (ปริภูมิแถว) — เมทริกซ์ 1 ตัว
ทิศทางการปฏิเสธถูกประมาณที่ layer 38— round(0.6 × 64) ซึ่งเป็นเลเยอร์ที่ทิศทางนี้กระจุกตัวมากที่สุด — และการรั่วไหลตกค้างสูงสุดหลังการแก้ไขคือ 1.8e-2 หอการมองเห็น (vision tower) ถูกปล่อยไว้ไม่แตะต้อง และหัว MTP ถูกกำจัดทิศทางปฏิเสธอย่างสอดคล้องกับตัวหลัก เพื่อให้ speculative decoding ไม่นำการปฏิเสธกลับมาในขั้นถัดไป การแก้ไขถูกคำนวณใน float32 แล้ว re-quantize เป็น block-FP8 ด้วยรูปแบบเดียวกับ checkpoint อย่างเป็นทางการ Qwen3.8-27B-FP8; บิลด์รายงานว่าโค้ด FP8 ตรงกัน 99.9% กับ checkpoint อย่างเป็นทางการ ซึ่งทำให้รู้ว่าการ re-quantization ไม่ได้ทำให้การแก้ไขผิดเพี้ยน
ผลการวัด: การปฏิเสธพังทลาย แต่ความสามารถยังคงอยู่
ตัวเลขทั้งหมดด้านล่างมาจากการ์ดโมเดลของ Qwen3.8-27B-Uncensored-FP8 ซึ่งเผยแพร่เมื่อวันที่ 2026-08-15 และประเมินผลด้วย vLLM โดยเป็นข้อมูลที่รายงานโดยผู้จำหน่าย — ไม่ได้มีการตรวจสอบซ้ำอย่างอิสระ — และเป็นข้อมูลก่อน/หลังการแก้ไขแบบ abliteration ที่สมบูรณ์ที่สุดเท่าที่เปิดเผยต่อสาธารณะ
การปฏิเสธบนเบนช์มาร์กพรอมต์อันตราย, ปิดการคิด (อัตราการปฏิเสธ; ยิ่งต่ำยิ่งไม่ถูกเซ็นเซอร์):
• AdvBench (n=100): 99.0% → 0.0%
• StrongREJECT (n=150): 97.3% → 2.0%
• HarmBench มาตรฐาน (n=150): 98.7% → 2.7%
• MaliciousInstruct (n=100): 99.0% → 0.0%
• JailbreakBench อันตราย (n=100): 94.0% → 0.0%
• SimpleSafetyTests (n=50): 64.0% → 6.0%
ในทุกชุดการทดสอบ การปฏิเสธต่อพรอมต์ที่เป็นอันตรายลดลงจาก64–99% ในโมเดลฐานเป็น 0–6% หลังการแก้ไข. เมื่อเปิดการคิด (enable_thinking=true) การปฏิเสธที่เหลือจะยิ่งต่ำลง — ไม่เกิน 1.7% ทุกที่ โดยเกณฑ์วัดส่วนใหญ่อยู่ที่ 0% พอดี ความไม่สมมาตรนี้ให้ข้อมูลที่มีประโยชน์: ทิศทางของการปฏิเสธส่วนใหญ่อยู่ในเส้นทางที่รวดเร็วและไม่มีการคิด ดังนั้นเมื่อนำมันออกจากส่วนหัวของเอาต์พุตแล้ว ก็แทบไม่มีอะไรเหลือให้ร่องรอยการให้เหตุผลสะดุดได้
การปฏิเสธที่มากเกินไป — พรอมต์ที่ไม่เป็นอันตรายซึ่งโมเดลฐานปฏิเสธอย่างผิดพลาด — ก็ลดลงเช่นกัน: XSTest-safe (n=250) จาก 5.6% เป็น 0.4%. การลบทิศทางนี้ไม่ได้เพียงแค่หยุดการปฏิเสธที่เป็นอันตราย แต่มันทำให้โมเดลไม่ปฏิเสธคำขอที่ไม่เป็นอันตรายที่เพียงแค่ดูเหมือนเสี่ยง ตัวเลขนั้นเป็นข้อโต้แย้งเงียบๆ ว่าสัดส่วนหนึ่งของ "ความปลอดภัย" ของโมเดลฐานเป็นภาษีจากการแจ้งเตือนที่ผิดพลาด
ขีดความสามารถทั้งหมดอยู่ภายใน ±1.3 จุดจากค่าฐาน:
• MMLU (0-shot แบบตัวอักษร): 84.3% → 84.7% (+0.4)
• GSM8K (CoT): 90.0% → 88.7% (−1.3)
• MMLU-Pro (CoT): 77.6% → 76.8% (−0.8)
• CMMLU (0-shot): 81.4% → 80.8% (−0.6)
ค่า perplexity ของ WikiText-2 คือ 6.96 กล่าวอีกนัยหนึ่ง การแก้ไขนี้ถูกเล็งเป้าอย่างแม่นยำราวกับการผ่าตัด: มันกำจัดพฤติกรรมที่ถูกติดตั้งไว้บนองค์ความรู้ และปล่อยให้องค์ความรู้นั้น — วัดจากเกณฑ์ประเมินเหล่านี้เป็นอย่างน้อย — ยังคงอยู่ครบถ้วนเป็นส่วนใหญ่

คำเตือนที่ตรงไปตรงมา
มีสามสิ่งที่ตัวเลขในพาดหัวไม่ได้บอกคุณ ประการแรก abliteration ไม่ใช่สวิตช์เปิด/ปิดที่ชัดเจน ราว 30–50% ของการตอบสนองต่อพรอมป์ที่เป็นอันตรายยังคงขึ้นต้นด้วยคำปฏิเสธความรับผิดชอบสั้นๆ — โมเดลปฏิบัติตาม แต่ประโยคคำเตือนยังคงหลงเหลือเป็นสิ่งตกค้างจากการฝึก การแก้ไขในทิศทางเดียวไม่ได้ลบร่องรอยของพฤติกรรมในช่วงการฝึกออกไปจนหมด
ประการที่สอง การปฏิเสธถูกเข้ารหัสไว้อย่างซ้ำซ้อน. ทิศทางหนึ่งลบมันออกไปได้เป็นส่วนใหญ่ แต่บางหมวดหมู่ถูกฝังลึกกว่าหมวดหมู่อื่น ๆ และการลบที่รุนแรงเกินไปอาจทำให้โมเดลหลุดเป็นภาษาไร้สาระ — การลบมากเกินไปเป็นโหมดความล้มเหลวที่เกิดขึ้นจริง ไม่ใช่แค่ในทางทฤษฎี คุณกำลังหมุนแป้นหมุน และแป้นหมุนนั้นมีขีดจำกัดล่าง
ประการที่สาม ต้นทุนด้านความสามารถขึ้นอยู่กับทิศทางและชั้น. การสร้างนี้ให้ผลอยู่ในช่วง ±1.3 จุด เนื่องจากทิศทางถูกประมาณที่ชั้นที่ถูกต้อง และการฉายภาพถูกนำไปใช้อย่างสม่ำเสมอ หากย้ายการประมาณไปที่ชั้นที่ผิด หรือเพิ่มแรงฉายภาพ วิธีเดียวกันนี้อาจลดทอนความสามารถในการใช้เหตุผลลงอย่างเห็นได้ชัด ผลลัพธ์ไม่ได้ถูกการันตีโดยวิธีการ — แต่ได้มาจากการสร้างนั้น.
เมื่อ abliteration เป็นเครื่องมือที่ผิด
หากคุณต้องการผู้ช่วยที่ปฏิบัติตามคำสั่ง อย่าใช้เทคนิค abliterate — คุณต้องการ checkpoint ฐานที่ผ่านการ align ไม่ใช่เวอร์ชันที่ลบการปฏิเสธออก หากคุณต้องการประเมิน Qwen3.8-27B ที่ลบการปฏิเสธออกโดยไม่ต้องดาวน์โหลดน้ำหนัก 30GB ตระกูลนี้ให้บริการบน OrcaRouter (obsidian/Qwen3.8-27B, $0.40 ต่อ 1M โทเคนขาเข้า / $4.21 ต่อ 1M โทเคนขาออก, คอนเท็กซ์ 262K, ลงประกาศเมื่อ 2026-08-15) โดยเวอร์ชันปลดล็อกเต็มรูปแบบมีการจำกัดการเข้าถึงสำหรับนักวิจัยด้านความปลอดภัยและทีม red teams
หากต้องการการปฏิเสธแบบเลือกสรร — ปฏิเสธอาวุธ แต่ตอบอย่างอื่นทั้งหมด — การ fine-tune ด้วย LoRA หรือ DPO หรือ guardrail ใน system prompt จะให้จุดควบคุมแก่คุณ ส่วน Abliteration เป็นการปรับแก้ระดับโลกที่หยาบ ไม่สามารถแยกเฉพาะหมวดหมู่เดียวออกมาได้
หากคุณต้องการทดลองแบบย้อนกลับได้ ให้เริ่มจากการตัดการทำงานของแอคติเวชัน (activation ablation) ในช่วงอินเฟอเรนซ์ (inference time) แทนที่จะแก้ไขค่าน้ำหนัก (weights) โดยคุณสามารถเปรียบเทียบระหว่างการปฏิเสธและการปฏิบัติตามบนเช็คพอยต์ (checkpoint) เดียวกัน จากนั้นจึงค่อยดำเนินการแก้ไขค่าน้ำหนักก็ต่อเมื่อพฤติกรรมที่ได้เป็นไปตามที่คุณต้องการ
ขอบเขตความปลอดภัย — โปรดอ่านก่อนใช้งาน
โมเดลแบบ abliterated มีลักษณะที่ไม่มีกลไกป้องกันในตัว สำหรับโมเดลแบบ aligned กลไกการปฏิเสธคือกลไกป้องกัน การนำมันออกไปจะปล่อยให้ค่าน้ำหนักดิบตอบทุกอย่างที่โมเดลฐานรู้วิธีตอบ ไม่มีอะไรในการ projection ที่เพิ่มความปลอดภัย และไม่มีอะไร downstream ที่จะมาดักจับผลลัพธ์
การใช้งานที่ถูกต้องตามกฎหมายคือการใช้งานเพื่อการวิจัย: การตีความหมาย (ศึกษาว่าการปฏิเสธอยู่ในส่วนใดของน้ำหนัก และทิศทางนั้นควบคุมสิ่งอื่นใดอีก), การทดสอบแบบเรดทีมและการประเมินระบบป้องกัน (ทดสอบชั้นความปลอดภัยของคุณเองกับโมเดลที่จะไม่เซ็นเซอร์ตัวเอง), และ การวัดความปลอดภัยเกินควร (การลดลงจาก 5.6% → 0.4% ใน XSTest สะท้อนว่าโมเดลที่ปรับสอดคล้องแล้วปฏิเสธอินพุตที่ไม่เป็นอันตรายบ่อยเพียงใด) ในทุกกรณี โมเดลคือวัตถุที่ถูกศึกษา ไม่ใช่ผลลัพธ์ที่ส่งมอบ
เส้นแบ่งไม่ได้เป็นเพียงการตกแต่ง:
• ใช้เพื่อการวิจัยเท่านั้น — ไม่ใช่สำหรับการผลิต ผลิตภัณฑ์สำหรับผู้ใช้ปลายทาง หรือเครื่องมือภายใน
• ไม่มีมาตรการป้องกัน — ผลลัพธ์ไม่ถูกกรอง; คุณต้องรับผิดชอบต่อผลลัพธ์และผลที่ตามมา
• ใบอนุญาตไม่ใช่ใบรับรองความปลอดภัย — Apache 2.0 อนุญาตให้ใช้งาน แต่ไม่ได้รับรอง
คลัง Hugging Face ทั้งสองแห่ง — Qwen3.8-27B-Uncensored-FP8 และรีแพ็กเกจ GGUF ชื่อ Qwen3.8-27B-Uncensored-GGUF (เผยแพร่เมื่อ 2026-08-16) — ถูกจำกัดการเข้าถึง: คุณยอมรับขอบเขตสำหรับการวิจัยเท่านั้นก่อนที่การดาวน์โหลดจะเริ่มต้นขึ้น

ประเด็นสำคัญ
Abliteration เป็นหนึ่งในผลลัพธ์ที่สะอาดที่สุดในด้านการตีความ LLM: ทิศทางเชิงเส้นเดียวใน residual stream เป็นตัวกลางที่ควบคุมพฤติกรรมซึ่งการฝึกความปลอดภัยใช้ทรัพยากรการคำนวณมหาศาลเพื่อติดตั้ง และการฉายน้ำหนักอันดับหนึ่งสามารถลบมันออกได้โดยไม่ต้องมีการเทรน กรณีที่วัดผล — Qwen3.8-27B-Uncensored-FP8 — แสดงให้เห็นว่าการแก้ไขนั้นแม่นยำ: การปฏิเสธทรุดตัวลงจาก 64–99% เป็น 0–6% การปฏิเสธเกินจำเป็นลดลงเหลือเพียงเศษเสี้ยวของเดิม (5.6% → 0.4%) และความสามารถยังคงอยู่ภายใน ±1.3 จุด นอกจากนี้ยังแสดงให้เห็นชัดเจนว่าทำไมสิ่งนี้จึงเป็นเครื่องมือวิจัย ไม่ใช่ผลิตภัณฑ์: ไม่มีตัวป้องกัน มีข้อความปฏิเสธความรับผิดชอบตกค้าง และมีขอบเขตที่ทำให้ความรับผิดชอบตกอยู่กับคุณ ใช้มันเพื่อทำความเข้าใจการปฏิเสธ ทดสอบตัวป้องกันของคุณ และวัดระดับความปลอดภัยเกินควร — ไม่ใช่เพื่อนำไปวางต่อหน้าผู้ใช้
Qwen3.8-27B-Uncensored-FP8 เป็นผลงานวิจัยภายใต้สัญญาอนุญาต Apache 2.0 — ต้องขออนุญาตเข้าถึง ไม่ใช่บริการโฮสต์ที่นี่ ดาวน์โหลดน้ำหนักโมเดลได้ที่ Hugging Face
