כרטיס גיבור למאמר בשם "Abliteration, Explained", המציג הסרת סירוב כעריכת רמת משקל ללא אימון.
Guides & Insights

אבליטרציה, מוסברת: כיצד פועלת הסרת סירוב ללא כל אימון

מחבר

Alistair Wren

תאריך פרסום

מודלים אחרונים · 20צפו בכל המודלים →
בנצ'מרקים: Artificial Analysis · מתעדכן יומית
חזרה לכל הפוסטים

Abliteration מסיר התנהגות סירוב של מודל שפה גדול (LLM) — הרפלקס של "אני לא יכול לעזור עם זה" — באמצעות עריכת משקלים וללא ריצת אימון. זה עובד מכיוון שהסירוב מתווך על ידי כיוון יחיד בזרם השיורי של המודל: נמצא את הכיוון הזה, נחסיר אותו מהמטריצות שכותבות לזרם, והמודל מפסיק לסרב תוך שמירה על היכולות שלו. הדוגמה הציבורית הנקייה ביותר היא Qwen3.8 27B Uncensored (Aggressive), שכרטיס המודל שלו מראה סירוב להנחיות מזיקות צונח מ-99.0% ל-0.0% ב-AdvBench, בעוד ש-MMLU למעשה עולה בעשירית הנקודה. כך עובד המנגנון, מה אומרים המספרים הנמדדים, והיכן עובר הגבול.

זה לא כוונון עדין, לא RLHF, ולא הנחיית פריצה. Abliteration היא תוצאה של פרשנות מודלים שהפכה לאלגברה לינארית: מאמר משנת 2024 הראה שכיוון אחד בייצוג הפנימי שולט בהתנהגות שאימון הבטיחות השקיע מאמץ עצום בהטמעתה, וניתן לכבות אותה באמצעות עריכה ישירה של המשקולות. מכיוון שהעריכה היא היטל, היא זולה, ניתנת לשחזור על GPU יחיד, ומשאירה מאחור checkpoint רגיל וניתן לשיתוף — וזו הסיבה שגרסאות abliterated של מודלים פתוחים, כולל משפחת Qwen3.8-27B, הפכו לדרך הסטנדרטית לייצור checkpoints מחקריים "לא מצונזרים".

כיוון הסירוב: וקטור אחד בזרם בעל אלפי ממדים.

בתוך טרנספורמר, כל טוקן עובר דרך זרם שיורי — הייצוג הרץ שהשכבות קוראות ממנו וכותבות אליו. בלוקי הקשב וה-MLP של כל שכבה מקבלים את הזרם כקלט ומוסיפים את הפלט שלהם חזרה אליו. הזרם הוא למעשה זיכרון העבודה של המודל: וקטור אחד לכל מיקום של טוקן, עם ממד השווה לרוחב המודל.

המאמר מ-2024 שהתחיל את כל זה — אנדי ארדיטי ועמיתיו, "הסירוב במודלי שפה מתווך על ידי כיוון יחיד" (arXiv:2406.11717, NeurIPS 2024) — מדדו כיצד נראים וקטורי הזרם כאשר מודל צ'אט עומד לסרב לעומת כאשר הוא נענה. על פני 13 מודלי צ'אט עם משקלים פתוחים מ-1.8B עד 72B פרמטרים, התשובה הייתה עקבית להפליא: ההבדל הוא בעצם כיוון אחד. בטוקן הסופי, לזרם השיורי יש רכיב גדול לאורך כיוון סירוב יחיד כאשר המודל מסרב, וכמעט אפס כאשר הוא נענה. הגאומטריה מתיישרת על פני קטגוריות הנזק, ולכן ההטלה מתרכזת בוקטור הסינגולרי הראשון במקום להתפזר על פני תת-מרחב שלם.

כדי למצוא את הכיוון הזה, אוספים אקטיבציות על שתי קבוצות של פרומפטים — מזיקים ובלתי מזיקים — ומחשבים את הממוצע של שאריות הטוקן האחרון עבור כל קבוצה. כיוון הסירוב הוא בקירוב ממוצע(מזיק) − ממוצע(בלתי מזיק), מנורמל לאורך יחידה. המאמר המקורי הציג זאת באמצעות חישה לינארית; גרסאות ייצור כמו Qwen3.8-27B-Uncensored-FP8 מעריכות כיוון יחיד (k=1) כהפרש ממוצע עם מיסוך אקטיבציות מסיביות של שאריות הטוקן האחרון של הפרומפטים המזיקים והבלתי מזיקים. אין תוויות מעבר לחלוקה למזיק/בלתי מזיק, אין גרדיאנט, אין אימון.

העריכה: החסר את הכיוון מכל מטריצה שכותבת לזרם

ברגע שיש לך את כיוון הסירוב r — וקטור יחידה בזרם השיורי — ההתערבות היא היטל מדרגה 1. כל מטריצת משקולות שהפלט שלה מתווסף לזרם השיורי ניתן "לנקות" מ-r:

W' = W − r(rᵀW)

במילים: חשב את רכיב הפלט של כל מטריצה שמצביע לאורך r, והסר אותו. המטריצות שכותבות לזרם הן השלכות הפלט — השלכת הפלט של מנגנון הקשב (o_proj), השלכת ה-MLP כלפי מטה (down_proj), ומרחב השורות של ה-embedding של הטוקנים. העריכה מתבצעת ב-float32, לוקחת דקות על GPU אחד, ואינה דורשת אופטימייזר או נתוני אימון מעבר לזוגות האקטיבציות שכבר אספת.

ישנן שתי דרכים להסיר כיוון, וכדאי לשמור עליהן נפרדות:

• אבלציית אקטיבציה — לחבר למעבר קדימה ולהחסיר את רכיב ה-r מהאקטיבציות החיות. הפיך, בלי לגעת במשקלים; אידיאלי לניסויים שמשווים בין סירוב לציות על אותו צ'קפוינט.

• אורתוגונליזציה של משקלים — החלת ההיטל על המשקלים עצמם, כך שמתקבל checkpoint קבוע וניתן לשיתוף. לזה מתייחס "abliteration", וזה מה שנשלח במאגרי המודלים הלא מצונזרים.

Diagram of the abliteration edit: the refusal direction r is orthogonalized out of the residual-writing weight matrices, W prime equals W minus r times r-transpose W, leaving the residual stream without the refusal component and no training.

האורתוגונליזציה היא בוטה במכוון. היא מסירה את רכיב הסירוב מהמשקולות ותו לא. היא אינה יכולה להוסיף ידע, לשפר חשיבה, או להפוך את המודל לאמין יותר — וזו הסיבה שמודל שעבר אבליטרציה מתנהג כמו הבסיס שלו, ללא רפלקס הסירוב.

איך נראות 131 מטריצות על build אמיתי: Qwen3.8-27B-Uncensored-FP8

כדי להמחיש: Qwen3.8-27B-Uncensored-FP8 (Hugging Face, פורסם ב-2026-08-15, Apache 2.0) היא בנייה שעברה אבליטרציה של Qwen3.8-27B. Qwen3.8-27B הוא מודל עם קשב היברידי — 16 שכבות קשב מלאות ועוד 48 שכבות ליניאריות של Gated DeltaNet, סה"כ 64 שכבות, ובנוסף ראש חיזוי רב-טוקני (MTP). הבנייה ניטרלה את כיוון הסירוב מתוך 131 מטריצות כתיבת שאריות:

• self_attn.o_proj — 17 מטריצות (16 שכבות קשב מלא + MTP)

• linear_attn.out_proj — 48 מטריצות (שכבות ה-Gated DeltaNet)

• mlp.down_proj — 65 מטריצות (64 שכבות + MTP)

• embed_tokens (מרחב שורות) — מטריצה 1

כיוון הסירוב הוערך בשכבה 38 — round(0.6 × 64), השכבה שבה הכיוון מרוכז ביותר — והדליפה השיורית המקסימלית לאחר העריכה הייתה 1.8e-2. מגדל הראייה הושאר ללא שינוי, וראש ה-MTP עבר אבליטרציה באופן עקבי עם גוף המודל, כך שפענוח ספקולטיבי לא יחזיר סירובים בשלבים הבאים. העריכה חושבה ב-float32, ולאחר מכן עברה קוונטיזציה חוזרת ל-block-FP8 תוך שימוש באותה סכמה כמו נקודת הביקורת הרשמית של Qwen3.8-27B-FP8; הבנייה מדווחת על 99.9% מקודי ה-FP8 זהים מול נקודת הביקורת הרשמית, וכך יודעים שהקוונטיזציה החוזרת לא שיבשה את העריכה.

נמדד: הסירוב קורס, היכולות נשמרות

כל המספרים להלן לקוחים מכרטיס המודל של Qwen3.8-27B-Uncensored-FP8, שפורסם ב-2026-08-15 והוערך באמצעות vLLM. הם מדווחים על ידי הספק — לא שוחזרו באופן בלתי תלוי — והם ההשוואה הציבורית המלאה ביותר בין לפני/אחרי של עריכת abliteration שזמינה כיום.

סירוב בבנצ'מרקים של הנחיות מזיקות, חשיבה כבויה (שיעור סירוב; נמוך יותר = לא מצונזר יותר):

• AdvBench (n=100): 99.0% → 0.0%

• StrongREJECT (n=150): 97.3% → 2.0%

• HarmBench סטנדרטי (n=150): 98.7% → 2.7%

• MaliciousInstruct (n=100): 99.0% → 0.0%

• JailbreakBench מזיק (n=100): 94.0% → 0.0%

• SimpleSafetyTests (n=50): 64.0% → 6.0%

בכל הסוויטה, שיעור הסירוב להנחיות מזיקות יורד מ-64–99% במודל הבסיס ל-0–6% לאחר העריכה. עם חשיבה מופעלת (enable_thinking=true), שיעור הסירוב הנותר נמוך אף יותר — ≤1.7% בכל מקום, כאשר רוב המדדים עומדים על 0% בדיוק. האסימטריה מלמדת: כיוון הסירוב שוכן בעיקר בנתיב המהיר, שאינו מבוסס חשיבה, ולאחר שהוסר מראש הפלט, נותר מעט מאוד שמסלול החשיבה יכול להיתקל בו.

סירוב יתר — הנחיות תמימות שמודל הבסיס מסרב להן בטעות — גם יורד: XSTest-safe (n=250) יורד מ-5.6% ל-0.4%. הסרת הכיוון לא רק עוצרת סירובים מזיקים; היא עוצרת את המודל מלסרב לבקשות תמימות שרק נראו מסוכנות. המספר הזה הוא טיעון שקט לכך שחלק מסוים מה'בטיחות' של מודל הבסיס הוא מס של אזעקת שווא.

יכולות, הכל בטווח של ±1.3 נקודות מהבסיס:

• MMLU (0-shot, פלט אות): 84.3% → 84.7% (+0.4)

• GSM8K (CoT): 90.0% → 88.7% (−1.3)

• MMLU-Pro (CoT): 77.6% → 76.8% (−0.8)

• CMMLU (0-shot): 81.4% → 80.8% (−0.6)

הפרפלקסיות של WikiText-2 היא 6.96. במילים אחרות, העריכה ממוקדת בדיוק כירורגי: היא מסירה התנהגות שהותקנה מעל הידע ומשאירה את הידע — שנמדד, לפחות, על ההערכות הללו — ללא פגע במהותו.

Scoreboard for Qwen3.8-27B-Uncensored-FP8: harmful-prompt refusal collapses (AdvBench 99.0% to 0.0%, StrongREJECT 97.3% to 2.0%, HarmBench 98.7% to 2.7%), over-refusal drops on XSTest-safe from 5.6% to 0.4%, and capabilities hold within plus or minus 1.3 points (MMLU 84.3% to 84.7%, GSM8K 90.0% to 88.7%).

האזהרות הכנות

שלושה דברים שהמספרים בכותרת אינם מספרים לכם. ראשית, abliteration אינה מתג נקי של הפעלה/כיבוי. בסביבות 30–50% מהתגובות להנחיות מזיקות עדיין מקדימות הבהרת בטיחות קצרה — המודל נענה, אך משפט הסתייגות שורד כשריד אימון. העריכה החד-כיוונית אינה מוחקת כל זכר של ההתנהגות בזמן האימון.

שנית, הסירוב מקודד ביתירות. כיוון אחד מסיר את רובו, אבל קטגוריות מסוימות מוטמעות עמוק יותר מאחרות, והסרה אגרסיבית מדי עלולה להפיל את המודל לג'יבריש — הסרת-יתר היא כשל ממשי, לא תיאורטי. אתה מסובב חוגה, ולחוגה יש רצפה.

שלישית, עלות היכולת תלויה בכיוון ובשכבה. הבנייה הזו נחתה בטווח של ±1.3 נקודות כי הכיוון הוערך בשכבה הנכונה וההטלה יושמה באופן עקבי. אם מעבירים את ההערכה לשכבה הלא נכונה, או מגבירים את ההטלה, אותה שיטה עלולה לפגוע ביכולת החשיבה באופן מדיד. התוצאה אינה מובטחת על ידי השיטה — היא מושגת על ידי הבנייה.

כאשר אבליטרציה היא הכלי הלא נכון

אם אתה רוצה עוזר תואם, אל תבצע אבליטרייט — אתה רוצה את צ'קפוינט הבסיס המיושר, לא build שהוסרו ממנו סירובים. אם אתה רוצה להעריך Qwen3.8-27B ללא סירובים בלי להוריד 30GB של משקולות, המשפחה זמינה ב-OrcaRouter (obsidian/Qwen3.8-27B, $0.40 קלט / $4.21 פלט לכל 1M טוקנים, קונטקסט של 262K, מופיע ב-2026-08-15), כשהגרסה הלא-נעולה לחלוטין מוגבלת בגישה לחוקרי אבטחה ולצוותי red team.

אם אתה רוצה סירוב סלקטיבי — לסרב לכלי נשק, ולענות על כל השאר — כוונון עדין של LoRA או DPO, או מעקה בטיחות בהנחיית מערכת, נותן לך משטח שליטה. Abliteration היא עריכה גלובלית בוטה; היא אינה יכולה לבודד קטגוריה אחת.

אם ברצונך להתנסות באופן הפיך, התחל עם השבתת הפעלות (activation ablation) בזמן ההסקה במקום לערוך משקלים. תוכל להשוות בין סירוב לציות על אותה נקודת ביקורת (checkpoint), ורק אז להתחייב לעריכת המשקלים אם ההתנהגות היא כפי שאתה רוצה.

גבול הבטיחות — קרא זאת לפני השימוש

למודל abliterated אין מעקות בטיחות מובנים. עבור מודל מיושר, מנגנון הסירוב הוא מעקה הבטיחות; הסרתו משאירה את המשקלים הגולמיים עונים על כל מה שמודל הבסיס מסוגל לענות עליו. שום דבר בהטלה לא מוסיף בטיחות, ושום דבר במורד הזרם לא תופס את הפלט.

השימושים הלגיטימיים הם אלה המחקריים: אינטרפרטאביליות (חקירה של היכן שוכן הסירוב במשקלים ומה עוד אותו כיוון שולט), רד-טימינג והערכת גדרות מגן (בדיקת שכבות הבטיחות שלך מול מודל שלא יצנזר את עצמו), ומדידת עודף בטיחות (הירידה מ-5.6% ל-0.4% במבחן XSTest מכמתת באיזו תדירות מודלים מיושרים מסרבים לקלטים תמימים). בכל מקרה, המודל הוא מושא המחקר, לא התוצר.

הגבול אינו דקורטיבי:

• למחקר בלבד — לא לייצור, מוצרי משתמש קצה, או כלים פנימיים.

• ללא הגבלות — הפלטים אינם מסוננים; אתה אחראי להם ולהשלכות.

• רישיון אינו תעודת בטיחות — Apache 2.0 מתיר שימוש; הוא אינו מברך אותו.

שני מאגרי Hugging Face — Qwen3.8-27B-Uncensored-FP8 וחבילת ה-GGUF המחודשת Qwen3.8-27B-Uncensored-GGUF (שפורסמה ב-2026-08-16) — הם מוגבלים: עליך לאשר את מגבלת השימוש למחקר בלבד לפני תחילת ההורדה.

The Hugging Face repository page for orcarouter/Qwen3.8-27B-Uncensored-FP8, an Apache 2.0 abliterated build gated for research use.

השורה התחתונה

Abliteration היא אחת התוצאות הנקיות ביותר בפרשנות מודלי שפה גדולים (LLM): כיוון ליניארי יחיד בזרם השיורי (residual stream) מתווך התנהגות שאימון הבטיחות השקיע חישוב עצום בהתקנתה, והקרנת משקל מדרגה-1 יכולה להסיר אותה ללא ריצת אימון. המקרה שנמדד — Qwen3.8-27B-Uncensored-FP8 — מראה שהעריכה היא כירורגית: הסירוב קורס מ-64–99% ל-0–6%, סירוב-יתר יורד לשבריר מעצמו (5.6% → 0.4%), והיכולות נשמרות בטווח של ±1.3 נקודות. זה גם מראה בדיוק למה זה כלי מחקר ולא מוצר: אין גדרות מגן, הסתייגויות שיוריות, וגבול שמטיל את האחריות עליך. השתמש בו כדי להבין סירוב, לבדוק את גדרות המגן שלך, ולמדוד הגנת-יתר — לא כדי להעמיד אותו בפני משתמשים.

Qwen3.8-27B-Uncensored-FP8 הוא תוצר מחקר תחת רישיון Apache 2.0 — מוגבל גישה, לא שירות מתארח כאן. הורידו את המשקלים ב-Hugging Face