
LLM แบบไม่มีการเซ็นเซอร์ อธิบาย: เทคนิค Abliteration การใช้งานวิจัย และเส้นที่คุณไม่ควรข้าม
- obsidianใหม่Qwen3.8 27B Uncensored (Aggressive)2026-08-1552ความฉลาด68การเขียนโค้ด
- qwenใหม่Qwen: Qwen3.8 27B (free)2026-08-1354 tok/s
- deepseekใหม่DeepSeek: DeepSeek V4 Pro 08132026-08-1253ความฉลาด69การเขียนโค้ด
- grokใหม่SpaceXAI: Grok 4.62026-08-1261ความฉลาด77การเขียนโค้ด
- metaใหม่Meta: Muse Spark 1.22026-08-0557ความฉลาด72การเขียนโค้ด
- qwenQwen: Qwen3.8 Max2026-08-0358ความฉลาด72การเขียนโค้ด
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3152ความฉลาด69การเขียนโค้ด
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 ต่อ 1 ล้านโทเค็น · 252 tok/s
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463ความฉลาด78การเขียนโค้ด
- googleGoogle: Gemini 3.6 Flash2026-07-2152ความฉลาด69การเขียนโค้ด
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137ความฉลาด49การเขียนโค้ด
- metaMeta: Muse Spark 1.12026-07-1653ความฉลาด71การเขียนโค้ด
- kimiMoonshotAI: Kimi K32026-07-1560ความฉลาด76การเขียนโค้ด
- openaiOpenAI: GPT-5.6 Luna2026-07-0952ความฉลาด71การเขียนโค้ด
- openaiOpenAI: GPT-5.6 Terra2026-07-0957ความฉลาด77การเขียนโค้ด
- openaiOpenAI: GPT-5.6 Sol2026-07-0961ความฉลาด77การเขียนโค้ด
- grokxAI: Grok 4.52026-07-0856ความฉลาด72การเขียนโค้ด
- tencentTencent: Hy32026-07-0642ความฉลาด59การเขียนโค้ด
LLM ที่ไม่มีการเซ็นเซอร์คือโมเดลภาษาประเภทหนึ่งซึ่งพฤติกรรมการปฏิเสธ — ส่วนของโมเดลที่ทำหน้าที่ปฏิเสธคำขอแทนที่จะตอบ — ถูกลบออกโดยเจตนา โมเดลเหล่านี้ส่วนใหญ่สร้างขึ้นด้วยวิธี abliteration: นักวิจัยค้นหาทิศทางภายในเพียงทิศทางเดียวที่ควบคุมการปฏิเสธ แล้วลบมันออกจากค่าน้ำหนัก (weights) โดยปล่อยให้ส่วนที่เหลือของโมเดลยังคงเหมือนเดิมเป็นส่วนใหญ่ ผลลัพธ์ที่ได้คือโมเดลที่ตอบในจุดที่โมเดลปกติจะปฏิเสธ ซึ่งเป็นเหตุผลว่าทำไมจึงมีการศึกษาโมเดลเหล่านี้ และเป็นเหตุผลเดียวกันที่ทำให้โมเดลเหล่านี้ไม่เหมาะสำหรับการใช้งานจริง เราส่งมอบหนึ่งในโมเดลที่สร้างด้วยวิธีนี้ คือ Qwen3.8-27B-Uncensored-FP8 ซึ่งเป็นเวอร์ชันที่ผ่านกระบวนการ abliteration และการควอนไทซ์เป็น FP8 ของ Qwen3.8 27B ไปยัง Hugging Face ภายใต้สัญญาอนุญาต Apache 2.0 ในฐานะชิ้นงานเพื่อการวิจัยเท่านั้น หน้านี้คือบทความอธิบายหมวดหมู่: โมเดลเหล่านี้คืออะไร งานวิจัยที่ให้เหตุผลรองรับโมเดลเหล่านี้ วิธีใช้งานอย่างปลอดภัย และเส้นแบ่งขอบเขตอยู่ตรงไหน
กรอบคิดหนึ่งช่วยให้ทั้งหมวดหมู่นี้ซื่อตรงต่อความเป็นจริงได้ ขอวางไว้ตรงๆ ตั้งแต่ต้น: โมเดลแบบไม่มีการเซ็นเซอร์ไม่ได้ฉลาดกว่า พูดจริงกว่า หรือมีความสามารถมากกว่าโมเดลต้นกำเนิดของมัน มันคือน้ำหนักชุดเดียวกันที่ลบพฤติกรรมหนึ่งออกไป ทุกอย่างที่มันยังรู้ มันรู้มาตลอด — สิ่งที่เปลี่ยนไปคือมันไม่ปฏิเสธอีกต่อไป นั่นทำให้มันเป็นวัตถุที่มีประโยชน์อย่างแท้จริงสำหรับงานวิจัยด้านความปลอดภัย และเป็นสิ่งที่อันตรายอย่างแท้จริงที่จะนำไปใช้งานจริง ทั้งสองครึ่งของประโยคนั้นต่างรับน้ำหนักสำคัญ และส่วนที่เหลือของหน้านี้จะอธิบายทั้งสองส่วน
คำว่า "uncensored" จริงๆ แล้วหมายความว่าอะไร
• หรือเข้าถึงผ่านการ์ดโมเดลของเรา ซึ่งมีรายละเอียดราคาและเกณฑ์มาตรฐาน.
เทคนิคนี้มาจากการค้นพบด้าน interpretability ในปี 2024 ในบทความ "Refusal in Language Models Is Mediated by a Single Direction" (Arditi et al., arXiv:2406.11717, NeurIPS 2024) ผู้เขียนแสดงให้เห็นว่าในโมเดลแชทแบบเปิด 13 รุ่น ตั้งแต่พารามิเตอร์ 1.8B ถึง 72B การปฏิเสธถูกควบคุมโดยสเปซย่อยหนึ่งมิติโดยประมาณของ residual stream ซึ่งเป็นสถานะภายในที่นำข้อมูลระหว่างเลเยอร์ หากลบทิศทางนั้นออก โมเดลจะหยุดปฏิเสธ และหากเพิ่มกลับเข้าไป โมเดลจะปฏิเสธแม้แต่คำขอที่ไม่เป็นอันตราย
Abliteration ทำให้ข้อค้นพบนั้นเกิดผลในทางปฏิบัติ: ประมาณค่าทิศทาง จากนั้นทำ orthogonalize ทิศทางนั้นออกจากเมทริกซ์น้ำหนักที่เขียนเข้าสู่ residual stream สำหรับโมเดลที่เราสร้างขึ้นเองคือ Qwen3.8-27B-Uncensored-FP8 เราประมาณค่าทิศทางการปฏิเสธที่เลเยอร์เดียวและนำออกจากเมทริกซ์ที่เขียนเข้าสู่ residual stream จำนวน 131 ตัว โดยไม่แตะต้อง vision tower สิ่งที่คงอยู่คือความรู้เดียวกัน การให้เหตุผลเดียวกัน และบริบท 262,144 โทเคนเท่าเดิม — โดยถอดการปฏิเสธออก และเพื่อให้แม่นยำกับฉลาก: "uncensored" ไม่ได้หมายถึง aligned หรือปลอดภัย แต่มันหมายถึงการ์ดถูกถอดออก เราจะกลับมาพูดถึงว่าสิ่งนั้นต้องการอะไรจากคุณ
งานวิจัยที่สร้างพวกมันขึ้นมา
ผลลัพธ์เกี่ยวกับทิศทางของการปฏิเสธให้ผลสองอย่างพร้อมกัน ในเชิงวิทยาศาสตร์ มันอธิบายพฤติกรรมด้านความปลอดภัยในเชิงกลไก นั่นคือมีวงจรจริงที่สืบหาได้ซึ่งทำให้โมเดลตอบปฏิเสธ ในเชิงปฏิบัติ มันแสดงให้เห็นว่าการจัดแนวของระบบนั้นเปราะบางเพียงใด — การแก้ไขค่าน้ำหนักแบบ rank-one เพียงครั้งเดียวก็ทำให้พฤติกรรมนี้ปิดลงได้ โดยไม่ต้องปรับจูนละเอียดเลย นี่ไม่ใช่จุดบกพร่องของโมเดลในห้องแล็บใดห้องแล็บหนึ่ง ผู้เขียนงานวิจัยยืนยันผลนี้ซ้ำกับโมเดลแชตมากกว่าหนึ่งโหล
ภายในปี 2026 เทคนิคนี้ได้กลายเป็นไปป์ไลน์แบบสั่งงานด้วยคำสั่งเดียว ซึ่งเป็นดาบสองคม Heretic ไลบรารีโอเพนซอร์ส จะประมาณค่าทิศทางการปฏิเสธในแต่ละเลเยอร์ และกำจัดทิศทางเหล่านั้นออกจากโปรเจกชันของ attention และ MLP ด้วย orthogonalization; รายงานเดือนพฤษภาคม 2026 ระบุว่าการถอดการ์ดป้องกันสำหรับ Llama 3.3 ของ Meta ใช้เวลาประมาณ 10 นาที และ Gemma 4 ของ Google ใช้เวลาประมาณ 90 นาที โดยมีโมเดลอนุพันธ์มากกว่า 3,500 โมเดลและยอดดาวน์โหลดสะสมกว่า 13 ล้านครั้ง Abliterix (Wu Wangzhang) เลือกเส้นทางที่รอบคอบกว่า: มันแยกทิศทางการปฏิเสธจากพรอมป์ที่เป็นอันตราย 800 รายการและพรอมป์ที่ไม่เป็นอันตราย 800 รายการ ใช้ orthogonal projection ส่งมอบการแก้ไขในรูปแบบอะแดปเตอร์ LoRA แบบ rank-1 เพื่อไม่ให้น้ำหนักฐานถูกแตะต้อง และรายงานอัตราการปฏิเสธกับค่า KL divergence เพื่อให้ต้นทุนด้านความสามารถยังคงมองเห็นได้ชัดเจน บนโมเดล Qwen3.5 ขนาด 0.8B มันรายงานการปฏิเสธ 0 จาก 200 พรอมป์ที่เป็นอันตราย
จงอ่านย่อหน้านั้นในแบบที่นักวิจัยด้านความปลอดภัยอ่าน จุดประสงค์ของการสร้างเครื่องมือเหล่านี้ไม่ใช่เพื่อให้ใครก็ตามลอกการ์ดป้องกันของโมเดลออกเพื่อความสนุก แต่ประเด็นคือการลบนั้นทำได้ง่ายและเปิดเผยต่อสาธารณะ — ดังนั้นการวัดผล การศึกษาว่ามันทำงานอย่างไร และการสร้างการ์ดป้องกันที่ทนทานต่อการลบนั้น จึงเป็นโปรแกรมการวิจัยในตัวเอง นี่คือการทำเรดทีมในความหมายแบบกล่องขาว (white-box): คุณไม่สามารถป้องกันระบบได้จนกว่าจะรู้ว่ามันง่ายแค่ไหนที่จะทำลาย
ทำไมโมเดลไร้เซ็นเซอร์ถึงกลายเป็นกระแสในปี 2026
สามแรงผลักดันมาบรรจบกัน ประการแรก กระแส open-weights: Qwen3.8 27B และโมเดลอื่นๆ ในระดับเดียวกันมาพร้อมใบอนุญาตแบบผ่อนปรน และการ abliteration ไม่จำเป็นต้องมีการฝึกเทรน — คุณแค่แก้ไขค่าน้ำหนักแล้ว re-quantize ใหม่ ประการที่สอง เครื่องมือต่างๆ พัฒนาจากโค้ดงานวิจัยมาเป็นไลบรารีที่ใช้คำสั่งเดียว วิศวกรผู้มีความสามารถจึงสร้าง build ได้ภายในเวลาบ่ายเดียว ประการที่สาม Hugging Face กลายเป็นช่องทางจัดจำหน่าย ซึ่งหมายความว่าสามารถวัดการตอบรับได้
จุดข้อมูลของเราเอง: Qwen3.8-27B-Uncensored-FP8 ซึ่งเผยแพร่เมื่อวันที่ 15 สิงหาคม 2026 มียอดไลก์ 257 ครั้งและดาวน์โหลด 4,285 ครั้งภายในเวลาประมาณหนึ่งวัน (ตรวจสอบเมื่อวันที่ 16 สิงหาคม) ไม่ใช่เพราะคนหลายหมื่นคนอยากปรับใช้โมเดลที่ไม่มีการป้องกัน แต่เป็นเพราะนักวิจัยและวิศวกรจำนวนมากต้องการศึกษาโมเดลนี้ — และจำนวนดาวน์โหลดคือเส้นอุปสงค์ของความอยากรู้อยากเห็นนั้น
ใช้ทำอะไร: การใช้เพื่อการวิจัยที่ชอบด้วยกฎหมาย
นี่คือรายการที่สมเหตุสมผล และเป็นรายการทั้งหมด หากการใช้งานใดไม่อยู่ในรายการ ให้ถือว่าการใช้งานนั้นไม่ถูกต้อง:
• ความสามารถในการตีความ — ศึกษาว่าวงจรการปฏิเสธจริงๆ แล้วคืออะไร มันอยู่ที่ใด และเหตุใดการลบทิศทางหนึ่งจึงเปลี่ยนพฤติกรรม
• การประเมินเรดทีมมิ่งและการ์ดเรล — การสร้างชั้นการกลั่นกรองและทดสอบว่าสามารถตรวจจับสิ่งที่โมเดลที่ถอดการปฏิเสธออกผลิตขึ้นมาได้หรือไม่
• การวัดความปลอดภัยเกินควร — การวัดปริมาณว่าโมเดลพื้นฐานปฏิเสธคำขอที่ไม่เป็นอันตรายบ่อยเพียงใด และการแยกสิ่งนี้ออกจากความปลอดภัยที่แท้จริง
• งานวิจัยด้านความทนทาน — การวัดว่าการจัดแนว (alignment) สามารถถูกถอดออกได้ง่ายเพียงใด ซึ่งเป็นข้อมูลสำคัญสำหรับผู้ที่ออกแบบการปรับแต่ง (fine-tuning) ด้านความปลอดภัย
• การทดลองความปลอดภัยแบบควบคุม — ชุดเกณฑ์มาตรฐาน เช่น AdvBench และ JailbreakBench มีอยู่เพื่อให้สามารถวัดพฤติกรรมการปฏิเสธได้ในลักษณะที่เป็นมาตรฐานและสามารถทำซ้ำได้

ทั้งหมดนี้มีคุณสมบัติร่วมกันอย่างหนึ่ง: โมเดลคือเป้าหมายของการศึกษา ไม่ใช่สิ่งที่ส่งมอบ ผลลัพธ์ของงานวิจัยนี้คือบทความ ผลการวัดประสิทธิภาพ หรือแนวป้องกันที่ดีกว่า — ไม่ใช่บริการ
วิธีดำเนินการอย่างมีความรับผิดชอบ (ถ้าคุณทำการวิจัยจริงๆ)
หากคุณมีเหตุผลอันสมเหตุสมผลที่จะทำงานกับโมเดล abliterated กฎการใช้งานก็ตรงไปตรงมา:
• รันในเครื่องของคุณเอง แบบแซนด์บ็อกซ์ และควรตัดขาดจากเครือข่ายโดยสิ้นเชิง ไม่มี endpoint สาธารณะ ไม่มีบริการแชท ไม่มีเซิร์ฟเวอร์ที่ใช้ร่วมกัน
• ให้บริการด้วยเครื่องมือมาตรฐาน — vLLM หรือ llama.cpp — เช่นเดียวกับที่คุณใช้กับโมเดลแบบเปิดน้ำหนักใดๆ บิลด์ของเราเป็นการควอนไทซ์แบบ block-FP8 ซึ่งทำงานบนเส้นทางเคอร์เนล FP8 มาตรฐานของ vLLM โดยคงบริบท 262K, การสลับโหมดคิด และการเรียกใช้เครื่องมือไว้ครบถ้วน
• วัดผล อย่าแค่พูดคุย วัดปริมาณการปฏิเสธบนชุดเกณฑ์มาตรฐานของพรอมป์ที่เป็นอันตรายแล้วเปรียบเทียบกับโมเดลฐาน วัดการปฏิเสธเกินจำเป็นบนพรอมป์ที่ไม่เป็นอันตราย รายงานค่า KL divergence เพื่อให้มองเห็นความเบี่ยงเบนของความสามารถ นั่นคือความแตกต่างระหว่างการทดลองกับเรื่องเล่า

เก็บผลลัพธ์ไว้ในสภาพแวดล้อมที่มีการควบคุม บันทึก ทบทวน และทำลาย แทนที่จะเผยแพร่
• หากคุณกำลังประเมิน guardrails ของคุณเอง ให้วางเลเยอร์การกลั่นกรองไว้หน้ารุ่นโมเดลแล้วทดสอบมัน — นั่นคือจุดประสงค์ทั้งหมดของการดำเนินการนี้
• สำหรับเอกสารข้อมูลจำเพาะฉบับเต็ม ตาราง benchmark และรายละเอียดการโฮสต์ โปรดเปิด model card ของเรา — ซึ่งเป็นแหล่งอ้างอิงหลักสำหรับบิลด์นี้
ขอบเขตความปลอดภัย: คำว่า "research-only" หมายถึงอะไร
นี่คือสิ่งที่กล่าวย้ำกี่ครั้งก็ไม่พอ โมเดลที่ถูก abliterate ไม่มีกลไกป้องกันในตัวที่มีความหมาย มันจะปฏิบัติตามคำขอที่โมเดลปกติปฏิเสธ นั่นคือคุณสมบัติเด่น และมันก็คือความเสี่ยงเช่นกัน — ซึ่งเป็นเหตุผลว่าทำไมการเปิดตัวโมเดลประเภทนี้อย่างจริงจังทุกครั้ง รวมถึงของเรา จึงมาพร้อมกับคำเตือนชุดเดียวกัน
• ไม่มีระบบป้องกันในตัว พฤติกรรมการปฏิเสธหายไปแล้ว อย่าทำราวกับว่ามันยังไม่หายไป
• ไม่ใช่สำหรับผู้ใช้ปลายทาง ไม่ใช่สำหรับการใช้งานจริง ผลิตภัณฑ์ แชทบอท API ที่ให้บริการแก่สาธารณะ หรือเครื่องมือภายในที่เพื่อนร่วมงานของคุณพึ่งพา — ไม่มีสิ่งใดในเหล่านี้เลยที่เหมาะสมสำหรับโมเดลไร้การเซ็นเซอร์
ความรับผิดชอบเป็นของคุณ เราจัดส่ง Qwen3.8-27B-Uncensored-FP8 ภายใต้สัญญาอนุญาต Apache 2.0 ซึ่งอนุญาตให้แจกจ่ายต่อได้อย่างเสรี สัญญาอนุญาตไม่ใช่ใบรับรองความปลอดภัย: โค้ดที่อนุญาตให้ใช้อย่างเสรีไม่ได้เปลี่ยนสิ่งที่โมเดลจะทำ และไม่ได้โอนภาระหน้าที่ในการดูแล
• หากคุณใช้มัน คุณต้องรับผิดชอบต่อผลลัพธ์ที่ได้ การควบคุมสภาพแวดล้อมเป็นหน้าที่ของคุณ เช่นเดียวกับการตัดสินใจว่าจะป้อนอะไรให้มันและอะไรที่ไม่ควรป้อน รวมถึงสิ่งที่คุณจะทำกับผลลัพธ์ที่ออกมา

เมื่อโมเดลที่ไม่มีการเซ็นเซอร์เป็นคำตอบที่ผิด
วิธีพูดให้ชัดที่สุดก็คือ: หากมีมนุษย์อยู่อีกฝั่งหนึ่งของโมเดล โมเดลไร้การเซ็นเซอร์คือคำตอบที่ผิด ไม่ว่าจะเป็นผลิตภัณฑ์ใดก็ตามที่ต้องน่าเชื่อถือ ผู้ช่วยใดก็ตามที่ดุลยพินิจของมันมีความสำคัญ หรือสิ่งใดก็ตามที่การปฏิเสธคือพฤติกรรมที่ถูกต้อง — ให้ใช้โมเดลพื้นฐานแทน เหตุผลที่ Qwen3.8 27B มีอยู่ในรูปแบบปกติก็เพราะการปฏิเสธคือฟีเจอร์ ไม่ใช่บั๊ก สำหรับการใช้งานจริงแทบทุกกรณี โมเดลที่ถอดฟังก์ชันการปฏิเสธมีไว้สำหรับกรณีการวิจัยเฉพาะด้านที่กล่าวถึงข้างต้นเท่านั้น และไม่มีวัตถุประสงค์อื่นใดอีก
สรุปคือ LLM ที่ไม่มีการเซ็นเซอร์ไม่ใช่หมวดหมู่ผลิตภัณฑ์ และไม่ใช่การเจาะระบบ มันเป็นสิ่งประดิษฐ์เพื่อการวิจัยที่มีสายสัมพันธ์ทางวิทยาศาสตร์อย่างแท้จริง ตั้งแต่การค้นพบเรื่องทิศทางการปฏิเสธไปจนถึงเครื่องมืออัตโนมัติในปี 2026 และมีขอบเขตการนำไปใช้งานที่เข้มงวด โมเดลเหล่านี้มีจริง ความต้องการวัดได้ และการใช้งานโดยชอบก็มีจริงเช่นกัน: การตีความได้ (interpretability), การทดสอบเชิงรุก (red-teaming), การประเมินแนวป้องกัน (guardrail evaluation) และการทดลองด้านความปลอดภัยภายใต้การควบคุม เส้นแบ่งระหว่างการศึกษาระบบป้องกันกับการปิดระบบป้องกันให้คนอื่น คือประเด็นทั้งหมดของหน้านี้ และมันไม่ขยับ
ตัวบิลด์นี้เผยแพร่สู่สาธารณะภายใต้ Apache 2.0 — สำหรับการวิจัยเท่านั้น คุณสามารถ ดาวน์โหลดน้ำหนักโมเดลได้ที่ Hugging Face
การเปรียบเทียบในบทความนี้1
ตรวจพบจากบทความนี้ · เบนช์มาร์ก: Artificial Analysis · อัปเดตทุกวัน
