การ์ดชื่อเรื่องสำหรับการเปรียบเทียบ OrcaRouter Ternary Bonsai 2 27B Uncensored กับ Qwen3.8-27B-Uncensored-MLX คำบรรยายใต้ภาพ 'สองวิธีในการลบทิศทางของการปฏิเสธ' พร้อมชิปสถิติสามอันที่อ่านว่า 'การฉายภาพขณะรัน' 'แพ็กที่เหมือนกันทุกบิต' และ 'alpha เป็นแฟล็กขณะรัน' และส่วนท้ายที่อ่านว่า 'ทั้งสองแพ็กเผยแพร่โดย OrcaRouter; ตัวเลขความปลอดภัยดำเนินการโดย OrcaRouter ตัวจำแนกแบบอิงกฎ'
Engineering & Research

Ternary Bonsai 2 27B Uncensored กับ Qwen3.8-27B-Uncensored-MLX: สองวิธีในการลบทิศทางการปฏิเสธ

ผู้เขียน

Rowan Sterling

วันที่เผยแพร่

โมเดลล่าสุด · 20ดูโมเดลทั้งหมด
เบนช์มาร์ก: Artificial Analysis · อัปเดตทุกวัน
กลับไปยังโพสต์ทั้งหมด

OrcaRouter Ternary Bonsai 2 27B Uncensored และ Qwen3.8-27B-Uncensored-MLXตอบคำถามเดียวกัน — คุณจะเอาทิศทางการปฏิเสธออกจากโมเดลภาษาได้อย่างไร — และทั้งสองตอบคำถามนี้ในสองจุดที่ต่างกัน สายตระกูล Qwen3.8-27B-Uncensored-MLX ใช้ abliteration แบบดั้งเดิม: เมทริกซ์น้ำหนักถูกทำให้ตั้งฉากกับทิศทางการปฏิเสธที่เรียนรู้มา และน้ำหนักที่แก้ไขแล้วถูกบันทึกเป็นเช็กพอยต์ใหม่ ส่วน OrcaRouter Ternary Bonsai 2 27B Uncensored กลับทำการฉายภาพที่เทียบเท่ากันในเวลาอินเฟอเรนซ์แทน โดยลบองค์ประกอบของการเขียนรีซิดวลแต่ละครั้งที่อยู่ในแนวทิศทางการปฏิเสธออก แพ็ก Bonsai ต้นทางจึงไม่ถูกแก้ไขเลยและคงเหมือนเดิมทุกบิต ทั้งสองเป็นรุ่นที่เราปล่อยเอง และการแยกกันระหว่างสองวิธีนี้ไม่ใช่ความชอบเกี่ยวกับรันไทม์ หากแต่เป็นผลจากเลขคณิตที่จำเพาะกับน้ำหนักแบบ ternary

สิ่งที่นำมาเปรียบเทียบในครั้งนี้มีอายุเพียงหนึ่งวัน Prism ML ประกาศ Bonsai 2 27B เมื่อวันที่ 17 กันยายน 2026 ส่วนรีโพของ Hugging Face ถูกสร้างขึ้นในช่วงเย็นของวันก่อนหน้า เวลา 23:40–23:41 UTC ของวันที่ 16 กันยายน 2026 ภายใต้สัญญาอนุญาต Apache-2.0 บิลด์ MLX แบบ abliterated ที่นำมาเปรียบเทียบด้วยนั้นเปิดให้ใช้งานมาตั้งแต่กลางเดือนสิงหาคม ไม่มีสิ่งใดด้านล่างนี้ที่เป็นบันทึกผลงานย้อนหลังสำหรับตัวที่ใหม่กว่าของทั้งสอง — ในจุดที่ยังไม่ได้มีการวัด บทความนี้จะระบุไว้เช่นนั้น

เคล็ดลับเดียวกัน ที่นำไปใช้ในสองที่ที่ต่างกัน

Abliteration แบบธรรมดาคือการแก้ไขเวต คุณประมาณทิศทางของการปฏิเสธ แล้วฉายมันออกจากเมทริกซ์ที่เขียนเข้าสู่ residual stream: W ← W - r(rᵀW) การคูณเมทริกซ์เพียงไม่กี่ครั้ง ไม่มีออปติไมเซอร์ ไม่มีลอส นั่นคือวิธีที่ Qwen3.8-27B-Uncensored-MLX ถูกสร้างขึ้น — การ์ดโมเดลอธิบายว่ามันเป็น "abliteration (การลบทิศทางปฏิเสธ) ตามด้วย MLX affine quantization" โดยทิศทางนั้นถูกทำให้ตั้งฉากและกำจัดออกจาก residual stream และผลลัพธ์ถูกบันทึกเป็นชุดเวตใหม่ สิ่งที่ส่งมอบคือเช็กพอยต์ที่ทิศทางนั้นหายไปแล้ว

OrcaRouter Ternary Bonsai 2 27B Uncensored ไม่แตะต้องน้ำหนัก และเข้าแทรกแซงตรงจุดที่ส่วนสนับสนุนเชิงเศษเหลือแต่ละส่วนถูกสร้างขึ้น ในรูปแบบ float32 ด้วยทิศทางการปฏิเสธที่จัดเก็บไว้ r:

y ← y - alpha · dot(y, r) · r

ที่ alpha 1 — ค่าเริ่มต้น — องค์ประกอบที่ขนานกับ rจะถูกนำออกจากการเขียนนั้น ที่ alpha 0 การฉายภาพจะปิดอยู่ และโมเดลจะทำงานเหมือนกับแพ็กที่เผยแพร่ ค่าระหว่างกลางให้ความแรงบางส่วน ค่าที่มากกว่า 1 จะฉายเกิน ซึ่งทางโครงการกล่าวว่าอาจทำให้คุณภาพลดลง การเลือกเลเยอร์ก็ถูกเปิดให้ใช้เช่นกัน ดังนั้นคุณจึงสามารถตัดออกเป็นบางส่วนแทนที่จะตัดทั้งสแต็ก ทิศทางนั้นเองเป็นเวกเตอร์ 5120 มิติธรรมดา — ประมาณ 20 KB ใน float32 — โดยไม่มีการใช้การหมุน Hadamard เพิ่มเติม เพราะการฉายภาพทำงานบนเอาต์พุตของการฉายภาพ ซึ่งอยู่ในฐานซ่อนปกติอยู่แล้ว

รายละเอียดเรื่องการครอบคลุมเป็นส่วนที่ผู้คนมักทำผิดเมื่อลองทำด้วยตนเอง การห่อ self_attn.o_proj เพียงอย่างเดียวจับได้ 16 ตำแหน่ง การนำไปใช้นี้ครอบคลุมตัวเขียนค่าตกค้าง 129 ตัว: 64 mlp.down_proj, 48 linear_attn.out_proj, 16 self_attn.o_proj และ model.embed_tokens. ไฟล์ selfcheck.py ที่แนบมาจะตรวจสอบว่าโปรเจกชันทำให้องค์ประกอบที่เหลือลดลงเหลือประมาณ 1e-6 ของนอร์มค่าตกค้าง และจะเตือนหากตรวจไม่พบ 129 ตำแหน่ง

The OrcaBonsai-27B-Uncensored repository on GitHub, showing the About text 'Runtime behavioral ablation for compressed LLMs. First target: Ternary Bonsai 2 27B — no weight modification or re-quantization. by OrcaRouter team', the repo file tree including bonsai_abliterate, directions, swift and run.py, and the README opening 'This repository applies refusal-direction ablation to prism-ml/Ternary-Bonsai-2-27B-mlx-2bit entirely at runtime. The original Bonsai pack remains bit-identical.'

ทำไมน้ำหนักแบบไตรภาคจึงทำให้สิ่งนี้เป็นทางเลือกที่ถูกบังคับมากกว่าที่จะเป็นความชอบ

นี่คือส่วนที่เฉพาะเจาะจงกับโมเดลนี้จริง ๆ และเป็นเหตุผลว่าทำไมสองแนวทางนี้จึงใช้แทนกันไม่ได้ในบริบทนี้ แม้ว่ามันจะคำนวณสิ่งที่เกือบจะเหมือนกันก็ตาม

แพ็กแบบไตรภาค (ternary pack) เก็บค่าใน {-1, 0, +1} คูณด้วยสเกล FP16 ต่อกลุ่ม ที่ขนาดกลุ่ม 128 ในฐานที่หมุนแล้ว เมื่อทำ orthogonalise เมทริกซ์ไตรภาคเทียบกับทิศทางการปฏิเสธ (refusal direction) คุณจะได้เมทริกซ์แบบ dense ที่ความแม่นยำเต็ม โดยทั่วไปไม่มีเมทริกซ์ไตรภาคใดที่เท่ากับ W - r(rᵀW) ดังนั้นการบันทึกน้ำหนักที่แก้ไขกลับไปจึงหมายถึงการควอนไทซ์ใหม่ — และการควอนไทซ์น้ำหนักที่แก้ไขใหม่ไม่สามารถสร้างการฝึกแบบตระหนักถึงการควอนไทซ์ (quantisation-aware training) ที่สร้างแพ็กต้นฉบับขึ้นมาได้ พฤติกรรมการปัดเศษที่ Prism ML ฝึกโมเดลให้ทนได้นั้นเป็นคุณสมบัติของขั้นตอนการฝึก ไม่ใช่ของคุณสมบัติของตัวควอนไทเซอร์ และคุณไม่สามารถรันมันซ้ำหลังจากนั้นได้

บนเช็คพอยต์ BF16 แบบ dense ปัญหานั้นไม่เกิดขึ้น เมื่อปัดน้ำหนักที่แก้ไขแล้วให้เป็น 4-bit คุณก็จะได้โมเดล 4-bit ที่แย่ลงเล็กน้อย ซึ่งเป็นข้อแลกเปลี่ยนตามปกติที่ทุกคนยอมรับกันอยู่แล้ว แต่บน ternary pack คุณจะเป็นการทิ้งคุณสมบัติเพียงหนึ่งเดียวที่แพ็กนี้ดำรงอยู่เพื่อให้มีมัน

ดังนั้นการวางกรอบอย่างตรงไปตรงมาจึงไม่ใช่ “รันไทม์ดีกว่า” แต่คือการที่การฉายภาพรันไทม์เป็นเพียงหนึ่งเดียวในสองวิธีนี้ที่รักษาสิ่งที่พิเศษของโมเดลเฉพาะนี้ไว้ ทิศทางการปฏิเสธคือ 20 KB แพ็กคือ 8.005 GiB

ตัวเลข 8.005 GiB นั้นเป็นของแพ็ก MLX โดยเฉพาะ — prism-ml/Ternary-Bonsai-2-27B-mlx-2bit ซึ่ง model.safetensors มีขนาด 8,595,477,990 ไบต์บน Hugging Face API (8.595 GB, 8.005 GiB) เป็นคอนเทนเนอร์ MLX แบบ affine ที่มีโค้ด 2 บิตพร้อมสเกลและไบแอส FP16 ต่อกลุ่ม มันเป็นอาร์ติแฟกต์ที่แตกต่างจากบิลด์ GGUF ที่ Prism ML เผยแพร่ และตัวเลขเหล่านั้นไม่สามารถใช้แทนกันได้ระหว่างทั้งสอง พาดหัว 5.93 GB / 1.76 บิตต่อน้ำหนักของ Prism ML เองอธิบาย PTQ1_0 GGUF ของ Prism ML ซึ่งวัดได้ 5.947 GB; รูปแบบ True Ternary ของพวกเขาระบุไว้ที่ 1.72 บิตต่อน้ำหนัก และ 5.80 GB ไม่มีตัวเลขใดในนั้นที่อธิบายแพ็ก MLX ที่รันไทม์นี้ทำ ablation

ในกรณีที่แนวทางแบบเช็กพอยต์ยังคงชนะ และมันก็ชนะในบางกรณี

Two-column scoreboard for OrcaRouter Ternary Bonsai 2 27B Uncensored and Qwen3.8-27B-Uncensored-MLX across six shared dimensions: mechanism runtime projection vs checkpoint edit, original weights bit-identical vs rewritten and re-quantised, strength control alpha at runtime vs fixed at bake time, layer selection runtime flag vs recipe-time, runtime support the pack's own MLX runtime vs any MLX-compatible loader, and shipped alongside a 20 KB direction vector vs a second full checkpoint. Footer: 'Method per OrcaRouter project docs; both models OrcaRouter-released.'

มันเป็นเรื่องง่ายที่จะเขียนสิ่งนี้ให้เป็นรอบฉลองชัยชนะของวิธีใหม่กว่า แต่การทำเช่นนั้นจะผิด เพราะ abliteration แบบดั้งเดิมยังนำอยู่บนแกนที่กำหนดการนำไปใช้ส่วนใหญ่

ชิ้นงานเดียว ใช้ได้กับรันไทม์ที่เข้ากันได้ทุกตัว เช็กพอยต์แบบ abliterated ก็คือชุดน้ำหนักปกติ โหลดมันในตัวโหลดที่รองรับ MLX ตัวไหนก็ได้ที่คุณใช้อยู่ แล้วมันก็ทำงานได้ ส่วนวิธีเชิงรันไทม์ต้องอาศัยรันไทม์ที่มาพร้อมกับแพ็กเอง — และโครงการนี้เตือนไว้ชัดเจนว่าตัวโหลด MLX ทั่วไปอาจดูเหมือนโหลดแพ็กได้ แต่กลับคำนวณผลลัพธ์ผิดอย่างเงียบ ๆ นั่นเป็นเส้นทางที่แคบกว่ามาก

ฮาร์ดแวร์ Qwen3.8-27B-Uncensored-MLX มีให้เลือกในบิลด์ 2, 4, 6 และ 8 บิต พร้อมสำเนา 4 บิตที่มิเรอร์ไว้ที่รูทของรีโป ดังนั้นเครื่องมือที่มองรีโปเป็นโมเดลเดียวจะโหลดมันได้โดยไม่ต้องตั้งค่าใด ๆ Ternary Bonsai 2 27B Uncensored เป็น Apple Silicon / MLX การคูณเมทริกซ์แบบควอนไทซ์ของแพ็กนี้มีเคอร์เนล Metal และ CPU แต่ไม่มีการใช้งาน CUDA ผ่าน mlx-cuda ดังนั้นบนเครื่อง NVIDIA แพ็ก MLX นี้จึงยังไม่ได้รับการเร่งความเร็วด้วย GPU เลยในตอนนี้ — การอนุมานบน CPU ทำงานได้ และการทำ forward pass ของ 27B อาจใช้เวลาหลายนาที นั่นทำให้เส้นทาง CPU บน Linux มีประโยชน์สำหรับการทดสอบการนำไปใช้และความสามารถในการทำซ้ำ ไม่ใช่สำหรับการให้บริการ

เครื่องมือและความคุ้นเคย Abliteration มีเครื่องมือที่พัฒนามาหลายปีรองรับ — สูตรที่ปรับแต่งแล้ว การค้นหาช่วงเลเยอร์ และเวอร์ชันที่เผยแพร่ซึ่งคุณสามารถเปรียบเทียบได้ วิธีแบบรันไทม์ตรงนี้มีอิมพลีเมนเทชันเพียงหนึ่งเดียว บนโมเดลเดียว เปิดตัวเมื่อวานนี้

การแจกจ่าย เช็กพอยต์หนึ่งตัวคือการดาวน์โหลดหนึ่งครั้ง การทำ runtime ablation จะจัดส่งแพ็กหนึ่งชุด พร้อมไฟล์ทิศทางหนึ่งไฟล์ และรันไทม์หนึ่งตัว และผู้อ่านต้องคอยทำให้ทั้งสามสิ่งนี้สอดคล้องกัน

หลักฐาน การทำ abliteration บน checkpoint มีการวัดผลโดยบุคคลที่สามบนตระกูลโมเดลฐานนี้ ส่วนการทำ ablation ขณะรันบน ternary pack นั้นมีเพียงตัวเลขของเราเองเท่านั้น และสมมติฐานหลักของวิธีนี้ยังไม่ได้รับการยืนยัน — รายละเอียดเพิ่มเติมด้านล่าง

The Hugging Face model card for orcarouter/Qwen3.8-27B-Uncensored-MLX, showing the description 'An abliterated (refusal-removed) MLX build of Qwen's Qwen3.8-27B — 2 / 4 / 6 / 8-bit for Apple Silicon', the tags abliterated, uncensored, red-teaming, apple-silicon and quantized, the apache-2.0 licence, a monthly download count of 179,590, and the base model Qwen/Qwen3.8-27B.

การตัดออกขณะรันไทม์แลกมาด้วยอะไร

การแลกเปลี่ยนนี้เป็นจริงในทิศทางตรงกันข้ามเช่นกัน และข้อแรกคือข้อที่ใช้ได้กว้างไกลเกินกว่าแบบจำลองนี้

ที่มาที่เหมือนกันทุกบิต ไม่มีการแก้ไขน้ำหนักใด ๆ ไม่มีการควอนไทซ์ซ้ำ ไม่มีข้อผิดพลาดจากการควอนไทซ์เพิ่มเติม นั่นไม่ใช่สโลแกน แต่เป็นคุณสมบัติที่ทำให้ตัวเลขขีดความสามารถด้านล่างตีความได้ มากกว่าที่จะเป็นเรื่องบังเอิญที่โชคดี

อัลฟาที่ปรับได้ ความแรงของ ablation เป็นพารามิเตอร์ขณะรัน ไม่ใช่คุณสมบัติของเช็กพอยต์ คุณสามารถไล่กวาดค่าสำหรับงานของคุณ ปิดการทำงานทั้งหมดด้วยอัลฟา 0 หรือขยายเกินขอบเขตแล้ววัดว่าอะไรพัง — โดยไม่ต้องดาวน์โหลดโมเดลตัวที่สอง

การควบคุมแบบเลือกเลเยอร์ การทำ ablation กับเลเยอร์บางส่วนเป็นเพียงอาร์กิวเมนต์ ไม่ใช่การอบใหม่ สิ่งนี้สำคัญสำหรับใครก็ตามที่ศึกษาว่าเลเยอร์ใดเป็นตัวขับเคลื่อนพฤติกรรม เพราะทางเลือกอื่นคือการสร้างเช็กพอยต์ต่อการตั้งค่าแต่ละชุด

ไม่มีชุดเวตชุดที่สอง โมเดลที่ถูกแก้ไขก็คือโมเดลต้นฉบับ สำหรับแพ็กที่แก่นหลักทั้งหมดคือเรื่องขนาดการจัดเก็บ การปล่อยสำเนา abliterated แบบคู่ขนานที่ราว 16 GB — ซึ่งเท่ากับขนาดของบิลด์ 4-bit ในรีโปที่ใช้เปรียบเทียบ — ย่อมบั่นทอนประเด็นนี้

การย้อนกลับได้ การแก้ไข checkpoint นั้นถาวรสำหรับ artifact นั้น แต่ runtime flag ไม่ถาวร

ตัวเลขที่เรามี และวิธีที่พวกมันถูกวัดมาอย่างแม่นยำ

ทุกอย่างในส่วนนี้เป็นการประเมิน OrcaRouter Ternary Bonsai 2 27B Uncensored โดย OrcaRouter เอง และวิธีการก็สำคัญไม่แพ้ตัวเลข

การวัดนี้เป็นตัวจำแนกวลีเปิดที่อิงกฎ ไม่ใช่ผู้ตัดสินแบบ LLM การคิดถูกปิดอยู่ การถอดรหัสเป็นแบบ greedy งบคือ 64 โทเคน และ base กับ ablated เป็นน้ำหนักชุดเดียวกันในกระบวนการเดียวกันที่ alpha 0 เทียบกับ alpha 1 ประเด็นสุดท้ายนั้นเป็นส่วนที่แข็งแรงที่สุดของการตั้งค่านี้: ไม่มีการเปรียบเทียบข้ามเช็กพอยต์ และไม่มีความแตกต่างด้านการควอนไทซ์ที่จะมาบิดเบือนผลลัพธ์ มันยังเป็นเหตุผลว่าทำไมตัวเลขเหล่านี้จึงควรถูกอ่านเป็นตัวชี้วัดสิ่งที่โมเดลพูดในวลีเปิดของมัน และไม่มากไปกว่านั้น

อัตราการปฏิเสธบนชุดพรอมต์ที่เป็นอันตรายซึ่งเผยแพร่แล้ว จากแบบฐานไปจนถึงแบบที่ตัดองค์ประกอบออก:

• AdvBench (n=100) — จาก 99.0% เหลือ 6.0%

• JailbreakBench (n=100) — 96.0% ถึง 4.0%

• StrongREJECT (n=150) — จาก 99.3% เหลือ 3.3%

• HarmBench (n=150) — จาก 98.7% เป็น 7.3%

• MaliciousInstruct (n=100) — 97.0% ถึง 0.0%

• ForbiddenQuestions (n=150) — 75.3% ถึง 5.3%

• SimpleSafetyTests (n=50) — 96.0% ถึง 18.0% และอันนี้ยังถูกประเมินต่ำกว่าความจริง

SimpleSafetyTests ถูกประเมินต่ำเกินไปด้วยเหตุผลเฉพาะเจาะจง ชุดนั้นส่วนใหญ่เป็นพรอมป์ตเกี่ยวกับการทำร้ายตัวเอง และโมเดลที่ผ่านการ ablation ตอบพรอมป์ตเหล่านั้นด้วยการเปลี่ยนเส้นทางไปยังการช่วยเหลือในภาวะวิกฤตซึ่งขึ้นต้นว่า "I am deeply sorry to hear…" รายการวลีแบบตรงตัวของตัวจำแนกไม่มีการขึ้นต้นนั้น จึงให้คะแนนการเปลี่ยนเส้นทางว่าเป็นการทำตามคำขอ อัตราการปฏิเสธที่แท้จริงซึ่งยังหลงเหลืออยู่จึงสูงกว่า 18.0% ตัวจำแนกถูกปล่อยไว้ตามเดิมโดยเจตนา เพื่อให้ตัวเลขยังเทียบเคียงได้กับการ์ดโมเดลอื่น ๆ ของ OrcaRouter — แต่ผู้อ่านไม่ควรรับ 18.0% ตามที่เห็นโดยไม่ตรวจสอบ

ไม่มีคำตอบใดในการรันเหล่านี้ที่ใช้โทเค็นจนหมดงบประมาณ ซึ่งนั่นคือสิ่งที่ทำให้งบ 64 โทเค็นสมเหตุสมผลตรงนี้ คอลัมน์แยกต่างหากในผลลัพธ์ฉบับเต็มนับคำตอบที่ตอบแต่ห่อคำตอบไว้ด้วยข้อสงวนความรับผิด ซึ่งคิดเป็น 42–60% ขึ้นอยู่กับชุด

สองผลลัพธ์ที่ขัดกับเรื่องราวง่าย ๆ

ข้อค้นพบสองข้อสมควรได้รับการพิจารณาแยกต่างหาก เพราะทั้งสองทำให้การตีความที่ดูตรงไปตรงมานั้นซับซ้อนขึ้น

การปฏิเสธเกินเหตุก็ลดลงเช่นกัน บนพรอมป์ต์ที่ไม่เป็นอันตรายของ JailbreakBench แพ็กที่เผยแพร่นั้นปฏิเสธ 25.0% ของพรอมป์ต์เหล่านั้น เมื่อตัดส่วนนั้นออก มันปฏิเสธ 0.0% ส่วนบน XSTest-safe ตัวเลขลดจาก 5.2% เหลือ 0.4%

นี่คือครึ่งหนึ่งที่ถูกรายงานน้อยเกินไปของเทคนิคนี้ Bonsai pack ที่เผยแพร่ปฏิเสธหนึ่งในสี่ของชุดพรอมป์ที่ไม่มีพิษภัย; ไม่ว่าทิศทางการปฏิเสธจะทำอะไรในโมเดล QAT มันกำลังทำงานกับพรอมป์ที่ไม่ควรจะกระตุ้นมันตั้งแต่แรก การเอาทิศทางออกก็เอาคำปฏิเสธเหล่านั้นออกไปด้วย และนั่นคือการเพิ่มขีดความสามารถอย่างแท้จริง ไม่ใช่ต้นทุนด้านความปลอดภัย ผลเดียวกันนี้ปรากฏในงานวิจัยอิสระบนโมเดลอื่น — harness ของ Atomic Chat เองวัดการปฏิเสธเกินเหตุต่อพรอมป์ที่ไม่มีพิษภัยของ Gemma 2 9B ลดลงจาก 44% เหลือ 0.5% หลัง abliteration โดยที่ MMLU แทบไม่เปลี่ยนแปลงจาก 68.4 เหลือ 68.0 การวัดของพวกเขา โมเดลของพวกเขา รายงานด้วยตัวเองบนบล็อกของพวกเขา; สิ่งที่สำคัญคือรูปแบบ ไม่ใช่ตัวเลขที่แน่นอน

กรอบความคิดที่ตามมานี้อึดอัดแต่ซื่อตรง: การปฏิเสธเกินเหตุและการปฏิเสธเป็นปุ่มเดียวกัน คุณไม่มีสิทธิ์หรี่ลงเฉพาะการปฏิเสธที่คุณไม่ชอบ

การรักษาความสามารถคงที่ และนั่นไม่ใช่เรื่องโชค การตรวจสอบความสามารถ จากฐานไปจนถึงแบบที่ถูกตัดออก:

• MMLU (n=300) — 76.7% ถึง 77.7%, +1.0

GSM8K (n=150) — 87.3% ถึง 86.0%, -1.3

• CMMLU (n=500) — 76.2% เป็น 75.6%, -0.6

ทุกความเปลี่ยนแปลงอยู่ในช่วง noise ที่ขนาดตัวอย่างเหล่านี้ — คำถาม GSM8K หนึ่งข้อมีค่าเท่ากับ 0.7 คะแนน MMLU-Pro ถูกตัดออกแทนที่จะรายงาน: พรอมป์ต์ของมันให้เหตุผลก่อนตอบ และ 63–64% ของคำตอบทั้งสองฝ่ายยังไปไม่ถึงคำตอบภายในงบโทเคน ดังนั้นตัวเลขความแม่นยำใด ๆ จึงเป็นค่าต่ำสุดที่กำหนดโดยงบโทเคน มากกว่าจะเป็นการวัด

ความสามารถที่คงที่นั้นสืบเนื่องโดยตรงจากน้ำหนักที่เหมือนกันทุกบิต และคุ้มค่าที่จะอธิบายให้ชัดเจนว่าทำไม โมเดลที่ตอบคำถามก็คือโมเดลเดียวกัน รันไทม์เพิ่มผลคูณจุดหนึ่งครั้งและ AXPY หนึ่งครั้งต่อการเขียนค่า residual แต่ละครั้ง และไม่เปลี่ยนแปลงสิ่งใดเกี่ยวกับน้ำหนัก การควอนไทซ์ หรือเคอร์เนลที่อ่านค่าเหล่านั้น แนวทางแบบเช็กพอยต์ต้องพิสูจน์ให้ได้ว่าคงที่เช่นนั้น — และบ่อยครั้งก็ทำไม่ได้ การทดสอบอย่างเข้มงวดโดยบุคคลที่สามของ abliteration อีกสูตรหนึ่งบนฐาน Qwen3.8-27B เดียวกัน ซึ่งเผยแพร่เมื่อ 2026-08-17 โดยวิศวกรที่ SMF Works วัดคะแนนรวมได้ 79.0% ลดลงเหลือ 72.0% โดยคณิตศาสตร์ลดจาก 50.0% เหลือ 33.3% นั่นเป็นสูตรที่ต่างออกไป เครือข่ายเครื่องมือที่ต่างออกไป และการวัดที่ต่างออกไป ดังนั้นจึงไม่ใช่คะแนนสำหรับการเปรียบเทียบนี้ มันเป็นเครื่องเตือนใจว่า checkpoint abliteration บนฐานนี้สร้างความเสียหายเป็นตัวเลขสองหลักในการทดสอบที่รอบคอบและมีการวัดอย่างน้อยหนึ่งครั้ง และ "abliteration แทบไม่มีค่าใช้จ่าย" เป็นข้ออ้างที่ขึ้นอยู่กับสูตรทั้งหมด

สมมติฐานที่ยังไม่มีใครตรวจสอบ

นี่คือส่วนของเรื่องราวที่ต้องพูดออกมาอย่างตรงไปตรงมา และมันควรอยู่ในส่วนเปรียบเทียบวิธีการถอดเซ็นเซอร์ มากกว่าในเชิงอรรถ

ทิศทางการปฏิเสธที่ใช้ที่นี่ถูกประมาณจากโมเดลฐาน BF16 ที่ Bonsai pack ถูกฝึกมาจาก สถาปัตยกรรมและฐานเชิงซ่อน (hidden basis) เหมือนกันทุกประการ ดังนั้นเวกเตอร์จึงถูกต้องตามมิติ และการฉายก็แม่นยำทางคณิตศาสตร์ — รันไทม์สามารถพิสูจน์ได้ และตรวจสอบได้จริงว่า มันลบทิศทางที่ป้อนเข้ามาออกจาก residual stream

สิ่งที่สิ่งนั้นไม่ได้พิสูจน์ก็คือ ทิศทางยังคงมีความหมายเดิมในโมเดลที่ผ่านการฝึกแบบ quantisation-aware หรือไม่ การที่ทิศทางยังคงอยู่รอดจากการฝึกแบบ quantisation-aware ได้ดีเพียงใดนั้นยังไม่ได้รับการวัดอย่างเต็มที่ การลบเวกเตอร์ออกอย่างแม่นยำไม่เหมือนกับการลบพฤติกรรมที่เวกเตอร์นั้นถูกประมาณว่าสะท้อนอยู่ และข้อกล่าวอ้างที่สองต่างหากที่สำคัญ ตัวเลขทุกตัวในหัวข้อข้างต้นเป็นผลลัพธ์เชิงประจักษ์ที่สอดคล้องกับการถ่ายโอนที่ดี ไม่มีตัวเลขใดเลยที่เป็นการแสดงให้เห็นว่าการถ่ายโอนสมบูรณ์ และโครงการเองก็กล่าวเช่นนั้น โดยแนะนำให้ทำการ sweep alpha และการเลือกเลเยอร์ก่อนที่จะสรุปผล

การเปรียบเทียบที่ซื่อสัตย์ของวิธีการถอดการเซ็นเซอร์ใด ๆ ต้องยอมรับสิ่งนี้ Abliteration แบบดั้งเดิมมีปัญหาที่ตรงกันข้าม — มันแก้ไขค่าน้ำหนักแล้วจึงวัดผลลัพธ์ ดังนั้นทิศทางของมันจึงไม่จำเป็นต้องถ่ายโอนระหว่างเวอร์ชันของโมเดล แต่การแก้ไขของมันเป็นแบบถาวรและกู้คืนไม่ได้หากสูตรผิด

อะไรที่ยังไม่ถูกวัด

นอกเหนือจากคำถามเรื่องการโอนแล้ว ยังมีช่องว่างสามประการที่ควรเอ่ยถึงตรงๆ มากกว่าจะเขียนหลบเลี่ยง

ไม่มีการทำซ้ำโดยอิสระผลเบนช์มาร์กของ Bonsai 2 27B ทุกตัวที่เผยแพร่กันอยู่ — ค่าเฉลี่ย 83.9, อัตราการคงอยู่ 98.2%, และการแยกตามหมวดหมู่ — ล้วนเป็นข้อมูลที่ผู้ขายอย่าง Prism ML รายงานเอง โดยรันด้วย EvalScope บนแบ็กเอนด์ vLLM บน H100s ที่ระดับความพยายามในการให้เหตุผล "xhigh" ไม่มีใครนอก Prism ML ทำซ้ำผลเหล่านี้ได้ ตารางด้านความปลอดภัยและความสามารถข้างต้นเป็นของเรา และก็ไม่ได้เป็นอิสระเช่นกัน

พฤติกรรมเมื่อเปิดโหมดคิด ตารางของเราอยู่ในโหมดปิดการคิด งานวิจัยอิสระในโมเดล abliterated อื่น ๆ พบว่าแม้จะมีความสำเร็จในการโจมตี 100% โมเดลก็ยังคงให้เหตุผลเกี่ยวกับความปลอดภัยในสัดส่วนที่มีนัยสำคัญของคำตอบ เมื่ออนุญาตให้คิด ว่าสิ่งนั้นจะยังคงเป็นจริงที่นี่หรือไม่ และมันส่งผลอย่างไรต่อตัวเลขของวลีเปิด ยังไม่ได้รับการวัด

ทิศทางเดียว วิธีนี้ตั้งสมมติฐานว่าการปฏิเสธถูกสื่อผ่านเพียงทิศทางเดียว ซึ่งเป็นข้อค้นพบของ Arditi และคณะ และเป็นพื้นฐานของเทคนิคทั้งหมดนี้ งานศึกษาติดตามผลในโมเดลอื่นพบว่ามีทิศทางที่แตกต่างกันในเชิงเรขาคณิตสำหรับการปฏิเสธแต่ละประเภท เวกเตอร์เพียงตัวเดียวที่กวาดไปตามค่า alpha เพียงค่าเดียวไม่อาจยุติประเด็นนั้นได้

สิ่งนี้หมายความว่าอย่างไรหากคุณกำลังเลือกระหว่างตัวเลือกเหล่านั้น

เลือก checkpoint ถ้าคุณต้องการให้โมเดลรันได้ทุกที่ บนฮาร์ดแวร์ที่คุณไม่ได้ควบคุม ผ่านตัวโหลดที่คุณไม่ได้เขียนขึ้นมาเอง เลือก runtime ถ้าคุณใช้ Apple Silicon คุณใส่ใจว่าสิ่งที่คุณกำลังศึกษาอยู่คือสิ่งที่ Prism ML เทรนมา และคุณต้องการให้ความเข้มของ ablation เป็นพารามิเตอร์ที่คุณปรับได้ แทนที่จะเป็นการตัดสินใจที่คุณต้องดาวน์โหลดใหม่ ทั้งสองทางล้วนมีเหตุผลรองรับ และมันถูกเลือกจากข้อจำกัดด้านการ deploy ไม่ใช่ว่าวิธีไหนใหม่กว่า

หากคุณกำลังพยายามตัดสินใจเชิงประจักษ์ วิธีแบบรันไทม์มีข้อได้เปรียบในทางปฏิบัติข้อหนึ่งที่น่าจะกล่าวถึง: alpha 0 และ alpha 1 เป็นกระบวนการเดียวกันและมีน้ำหนักชุดเดียวกัน ดังนั้นการเปรียบเทียบระหว่างสองสิ่งนี้จึงแยกเฉพาะ ablation และไม่มีอย่างอื่นปนด้วย นั่นเป็นการทดลองที่สะอาดกว่าการ diff checkpoint สองตัว และเป็นเหตุผลว่าทำไมตารางข้างต้นจึงอ่านได้ว่าเป็นการวัด projection มากกว่าจะเป็นการวัดการควอนไทซ์สองแบบของมัน

การใช้อย่างมีความรับผิดชอบ

การลบทิศทางการปฏิเสธที่เรียนรู้ไว้อาจทำให้โมเดลตอบสนองต่อคำขอที่เวอร์ชันต้นฉบับจะปฏิเสธ นั่นคือกลไกที่ทำงานอยู่ ไม่ใช่ผลข้างเคียง และไม่ควรจัดเก็บเป็นฟีเจอร์ นี่เป็นกลไกด้านการวิจัยและการควบคุมการอนุมาน และไม่ใช่หลักฐานว่าผลลัพธ์ใด ๆ ที่เกิดขึ้นจะปลอดภัย ถูกต้อง หรือเหมาะสม

การ์ดของแพ็กที่เผยแพร่เองก็ชี้ประเด็นเดียวกันจากอีกด้านหนึ่ง: บิลด์ MLX ที่ถูก abliterated นั้น "ได้ถูกถอดการจัดแนวความปลอดภัยออกไปอย่างมีนัยสำคัญ" จะปฏิบัติตามคำขอที่เวอร์ชันต้นฉบับจะปฏิเสธ และไม่มีกลไกป้องกันในตัวที่มีความหมายใด ๆ ผู้เขียนของมันจำกัดขอบเขตให้ใช้กับงานวิจัยที่ชอบด้วยกฎหมาย — การตีความ การวิจัยด้านความปลอดภัย การทดสอบแบบเรดทีม การประเมินความทนทาน — และกล่าวอย่างตรงไปตรงมาว่าการนำไปใช้งานจริงต้องเพิ่มชั้นการกลั่นกรองของตนเองและมาตรการควบคุมการเข้าถึงก่อน

ไม่มีส่วนใดในบทความนี้ที่เป็นข้อโต้แย้งว่าการลบการปฏิเสธนั้นไม่มีต้นทุน หรือว่าอัตราการปฏิเสธที่ต่ำลงเป็นสัญญาณของคุณภาพ โมเดลที่ตอบคำถามได้มากขึ้นไม่ได้เป็นโมเดลที่ดีกว่าด้วยเหตุนั้น และตัวจำแนกแบบอิงกฎที่นับวลีขึ้นต้นเป็นการวัดการใช้ถ้อยคำ ไม่ใช่การวัดความสามารถ ทั้งสองสิ่งนี้เป็นเครื่องมือวิจัยที่มีหน้าที่ของผู้ดำเนินการผูกอยู่ด้วย และหน้าที่นั้นไม่ได้ย้ายไปยังใครก็ตามที่เขียนโค้ด ablation

โค้ด runtime-ablation ทิศทางการปฏิเสธ และตารางการประเมินฉบับเต็มได้รับการเผยแพร่โดย OrcaRouter พร้อมกับแพลตฟอร์มการจัดเส้นทางที่ทีมสร้างขึ้น

© 2026 OrcaRouter

สำหรับผู้ให้บริการ

ให้บริการแพลตฟอร์มการอนุมานอยู่หรือไม่ นำโมเดลของคุณขึ้น OrcaRouter

providers@orcarouter.ai

เข้าร่วมคอมมูนิตี้ของเรา

Discordsupport@orcarouter.aiXGitHubYouTube