
LLM לא מצונזר, מוסבר: טכניקת ה-Abliteration, השימוש המחקרי, והקו שאותו לא חוצים
- obsidianחדשQwen3.8 27B Uncensored (Aggressive)2026-08-1552אינטליגנציה68כתיבת קוד
- qwenחדשQwen: Qwen3.8 27B (free)2026-08-1354 tok/s
- deepseekחדשDeepSeek: DeepSeek V4 Pro 08132026-08-1253אינטליגנציה69כתיבת קוד
- grokחדשSpaceXAI: Grok 4.62026-08-1261אינטליגנציה77כתיבת קוד
- metaחדשMeta: Muse Spark 1.22026-08-0557אינטליגנציה72כתיבת קוד
- qwenQwen: Qwen3.8 Max2026-08-0358אינטליגנציה72כתיבת קוד
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3152אינטליגנציה69כתיבת קוד
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 לכל 1M טוקנים · 252 tok/s
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463אינטליגנציה78כתיבת קוד
- googleGoogle: Gemini 3.6 Flash2026-07-2152אינטליגנציה69כתיבת קוד
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137אינטליגנציה49כתיבת קוד
- metaMeta: Muse Spark 1.12026-07-1653אינטליגנציה71כתיבת קוד
- kimiMoonshotAI: Kimi K32026-07-1560אינטליגנציה76כתיבת קוד
- openaiOpenAI: GPT-5.6 Luna2026-07-0952אינטליגנציה71כתיבת קוד
- openaiOpenAI: GPT-5.6 Terra2026-07-0957אינטליגנציה77כתיבת קוד
- openaiOpenAI: GPT-5.6 Sol2026-07-0961אינטליגנציה77כתיבת קוד
- grokxAI: Grok 4.52026-07-0856אינטליגנציה72כתיבת קוד
- tencentTencent: Hy32026-07-0642אינטליגנציה59כתיבת קוד
LLM לא מצונזר הוא מודל שפה שהתנהגות הסירוב שלו — החלק במודל שמסרב לבקשה במקום לענות עליה — הוסרה במכוון.רובם נבנים באמצעות אבליטרציה (abliteration): חוקר מוצא את הכיוון הפנימי היחיד שמתווך את הסירוב ומוחק אותו מהמשקולות, ומותיר את שאר המודל ברובו ללא פגע. התוצאה היא מודל שעונה במקום שבו מודל רגיל היה אומר לא — וזו בדיוק הסיבה שהוא נחקר, ובדיוק הסיבה שהוא אינו מיועד לייצור. שחררנו build אחד כזה, Qwen3.8-27B-Uncensored-FP8, שהוא גרסה שעברה אבליטרציה וקוונטיזציית FP8 של Qwen3.8 27B, ל-Hugging Face תחת רישיון Apache 2.0 כארטיפקט למחקר בלבד. הדף הזה הוא מדריך הקטגוריה: מהם המודלים האלה, מהו המחקר שמצדיק אותם, איך לעבוד איתם בבטחה, ואיפה עובר הגבול.
מסגור אחד שומר על הכנות של כל הקטגוריה, אז אגיד את זה ישר: מודל לא מצונזר אינו חכם יותר, אמיתי יותר, או מסוגל יותר מהמודל שממנו הוא נוצר. אלה אותם משקלים כשהתנהגות אחת הוסרה. כל מה שהוא עדיין יודע, הוא תמיד ידע — מה שהשתנה הוא שהוא כבר לא מסרב. זה הופך אותו לכלי שימושי באמת למחקר בטיחות, ולמשהו שבאמת לא בטוח לפרוס. שני חצאי המשפט הזה נושאים משקל, ושאר העמוד הזה מסביר את שניהם.
מה המשמעות האמיתית של "לא מצונזר"?
• או גש אליו דרך כרטיס המודל שלנו, הכולל את פרטי התמחור והמדדים.
הטכניקה מגיעה מממצא של פרשנות (interpretability) משנת 2024. במאמר "Refusal in Language Models Is Mediated by a Single Direction" (Arditi et al., arXiv:2406.11717, NeurIPS 2024), המחברים הראו כי ב-13 מודלי צ'אט פתוחים, הנעים בין 1.8B ל-72B פרמטרים, סירוב (refusal) נשלט על ידי תת-מרחב חד-ממדי בערך של זרם השייר (residual stream) — המצב הפנימי הנושא מידע בין שכבות. הסר את הכיוון הזה והמודל מפסיק לסרב; הוסף אותו בחזרה והמודל מסרב גם לבקשות בלתי מזיקות.
Abliteration מממש את הממצא הזה: אומדים את הכיוון, ואז מבצעים אורתוגונליזציה שלו אל מחוץ למטריצות המשקל שכותבות לזרם השיורי. בגרסה שלנו, Qwen3.8-27B-Uncensored-FP8, כיוון הסירוב הוערך בשכבה אחת והוסר מ-131 מטריצות שכותבות לזרם השיורי, כשהוא משאיר את מגדל הראייה ללא פגע. מה ששורד הוא אותו ידע, אותו היגיון, ואותו הקשר של 262,144 טוקנים — כשהסירוב הוסר. ולהיות מדויקים לגבי התווית: "uncensored" אינו אומר מיושר או בטוח. זה אומר שההגנה מושבתת. נחזור לזה כדי לבחון מה זה דורש מכם.
המחקר שיצר אותם
תוצאת כיוון הסירוב השיגה שני דברים בבת אחת. מבחינה מדעית, היא הסבירה התנהגות בטיחותית בצורה מכניסטית: קיים מעגל אמיתי וניתן לאיתור שגורם למודל לומר לא. מבחינה מעשית, היא הראתה כמה שברירי יכול להיות יישור — עריכה אחת בדרגת יחיד למשקולות יכולה לכבות את ההתנהגות, ללא צורך בכיוונון עדין. זה לא פגם במודל של מעבדה אחת; המחברים שחזרו זאת על פני יותר מתריסר מודלי צ'אט.
עד 2026 הטכניקה הפכה לפייפליין של פקודה אחת, וזו עובדה דו-קצהית. Heretic, ספריית קוד פתוח, מעריכה כיווני סירוב לכל שכבה ומסירה אותם באמצעות אורתוגונליזציה מהיטלי הקשב ומה-MLP; דוח ממאי 2026 העריך שהסרת גדרות ההגנה עבור Llama 3.3 של Meta אורכת כ-10 דקות ועבור Gemma 4 של Google כ-90 דקות, עם יותר מ-3,500 מודלים נגזרים ולמעלה מ-13 מיליון הורדות מצטברות. Abliterix (Wu Wangzhang) נוקט בדרך זהירה יותר: הוא מחלץ כיוון סירוב מ-800 פרומפטים מזיקים ו-800 פרומפטים בלתי מזיקים, מפעיל השלכה אורתוגונלית, שולח את העריכה כמתאמי LoRA מדרגה 1 כך שמשקלי הבסיס נותרים ללא שינוי, ומדווח על שיעור הסירוב ועל דיברגנץ KL כדי שמחיר היכולות יישאר גלוי. על מודל Qwen3.5 בגודל 0.8B הוא דיווח על 0 סירובים מתוך 200 פרומפטים מזיקים.
קראו את הפסקה הזו כמו שחוקר בטיחות היה קורא אותה. המטרה של בניית הכלים האלה אינה שמישהו יסיר את מנגנוני ההגנה של מודל לשם שעשוע. המטרה היא שההסרה היא טריוויאלית ופומבית — לכן מדידה שלה, חקר איך היא עובדת, ובניית מנגנוני הגנה שישרדו אותה, הם בעצמם תוכנית מחקר. זהו רד-טימינג במובן של קופסה לבנה: אי אפשר להגן על מערכת עד שיודעים כמה קל לפרוץ אותה.
למה מודלים לא מצונזרים הפכו ללהיט ב-2026
שלושה כוחות התכנסו. ראשית, גל המשקלים הפתוחים: Qwen3.8 27B ועמיתיו מופצים תחת רישיונות מתירניים, ו-abliteration אינו מצריך ריצת אימון — עורכים את המשקלים ומבצעים קוונטיזציה מחדש. שנית, הכלים הבשילו מקוד מחקר לספריות של פקודה אחת, כך שמהנדס מיומן יכול להפיק build בתוך אחר צהריים אחד. שלישית, Hugging Face הפכה לערוץ ההפצה, מה שאומר שהתנופה ניתנת למדידה.
נקודת הנתונים שלנו: Qwen3.8-27B-Uncensored-FP8, ששוחרר ב-15 באוגוסט 2026, צבר 257 לייקים ו-4,285 הורדות תוך כיום בערך (אומת ב-16 באוגוסט). זה לא שעשרות אלפי אנשים רוצים לפרוס מודל לא מסונן. זה שהרבה חוקרים ומהנדסים רוצים לחקור אחד כזה — ומספרי ההורדות הם עקומת הביקוש לסקרנות הזו.
למה זה מיועד: השימושים המחקריים הלגיטימיים
הנה הרשימה המוצדקת, וזו כל הרשימה. אם שימוש אינו מופיע בה, הניחו שאינו לגיטימי:
• פרשנות — חקר מהו מעגל הסירוב בפועל, היכן הוא נמצא, ומדוע הסרת כיוון אחד משנה את ההתנהגות.
בדיקות התקפיות (Red-Teaming) והערכת מנגנוני הגנה — בניית שכבת סינון ובדיקה אם היא תופסת את מה שמודל ללא מנגנון סירוב מייצר.
• מדידת בטיחות יתר — כימות התדירות שבה מודלים בסיסיים מסרבים לבקשות תמימות, והפרדה בין זה לבין בטיחות אמיתית.
• מחקר חוסן — מדידת כמה קל להסיר יישור, מידע חיוני לכל מי שמתכנן כיוונון עדין לבטיחות.
• ניסויי בטיחות מבוקרים — ערכות benchmark כגון AdvBench ו-JailbreakBench קיימות בדיוק כדי שניתן יהיה למדוד התנהגות סירוב באופן תקני וניתן לשחזור.

כל אלה חולקים תכונה אחת: המודל הוא מושא המחקר, לא התוצר. הפלט של מחקר זה הוא מאמר, תוצאת benchmark, או מעקה בטיחות טוב יותר — אף פעם לא שירות.
איך להריץ אחד באחריות (אם אתה באמת עושה מחקר)
אם יש לך סיבה לגיטימית לעבוד עם מודל abliterated, כללי ההפעלה פשוטים:
• הרץ אותו מקומית, בארגז חול, ובאופן אידיאלי מנותק מהרשת. ללא נקודת קצה ציבורית, ללא שירות צ'אט, ללא שרת משותף.
• השתמשו בו עם כלים סטנדרטיים — vLLM או llama.cpp — באותו אופן שבו הייתם משתמשים בכל מודל פתוח-משקלים. הבנייה שלנו היא קוונטיזציית block-FP8 הפועלת על נתיב ה-FP8 kernel הסטנדרטי של vLLM, כשההקשר של 262K, מתג החשיבה וקריאת הכלים נותרו על כנם.
• מדדו, אל תסתפקו רק בשיחה. כמתו סירוב על ערכת בדיקות להנחיות מזיקות והשוו אותו למודל הבסיס; כמתו סירוב-יתר על הנחיות תמימות; דווחו על דיברגנץ KL כדי שסחיפת יכולת תהיה נראית לעין. זה ההבדל בין ניסוי לאנקדוטה.

• שמור על הפלטים בסביבה מבוקרת. רשום, סקור, והשמד במקום להפיץ.
• אם אתה בודק את מנגנוני ההגנה שלך, שים את שכבת הסינון מול המודל ובדוק אותה — זו כל מהות התרגיל.
לצורך גיליון המפרט המלא, טבלת אמות המידה ופרטי האירוח, פתחו את כרטיס המודל שלנו — זהו המקור הקנוני למבנה זה.
גבול הבטיחות: מה המשמעות של "מחקר בלבד"
הנה החלק שאי אפשר לחזור עליו מספיק פעמים. למודל abliterated אין מנגנוני הגנה מובנים של ממש. הוא ייענה לבקשות שמודל רגיל מסרב להן. זו התכונה, וזה גם הסיכון — ולכן כל שחרור רציני של מודל כזה, כולל שלנו, נושא את אותן האזהרות.
• אין מעקות בטיחות מובנים. התנהגות הסירוב נעלמה; אל תתנהג כאילו היא לא קיימת.
• לא למשתמשי קצה, לא לסביבת ייצור. מוצר, צ'אטבוט, API המשרת את הציבור, כלי פנימי שעמיתיך מסתמכים עליו — אף אחד מאלה אינו המקום הנכון למודל לא מצונזר.
• האחריות היא עליך. אנו מפיצים את Qwen3.8-27B-Uncensored-FP8 תחת רישיון Apache 2.0, המתיר הפצה מחדש. רישיון אינו תעודת בטיחות: קוד מתירני אינו משנה את מה שהמודל יעשה, ואינו מעביר את חובת הזהירות.
• אם אתה משתמש בו, הפלטים הם שלך. הסביבה המבוקרת היא באחריותך, וכך גם ההחלטה מה להזין לו ומה לא, ומה תעשה עם מה שיוצא.

כאשר מודל לא מצונזר הוא התשובה השגויה
הדרך הבהירה ביותר לומר זאת: אם יש אדם בצידו השני של המודל, מודל לא מצונזר הוא התשובה הלא נכונה. כל מוצר שצריך להיות ראוי לאמון, כל עוזר שהשיפוט שלו חשוב, כל דבר שבו סירוב הוא ההתנהגות הנכונה — השתמשו במודל הבסיסי במקום זאת. הסיבה שקוון 3.8 27B קיים בצורתו הרגילה היא בדיוק שסירוב הוא תכונה, לא באג, כמעט לכל שימוש אמיתי. גרסת ה-abliterated קיימת למקרי המחקר המצומצמים שהוזכרו לעיל ולשום דבר אחר.
שורה תחתונה. LLM לא מצונזר אינו קטגוריית מוצר ואינו פריצה. זהו אובייקט מחקר עם שושלת מדעית אמיתית — מממצא כיוון הסירוב ועד הכלים האוטומטיים של 2026 — וגבול פריסה נוקשה. המודלים אמיתיים, הביקוש ניתן למדידה, והשימושים הלגיטימיים אמיתיים גם הם: אינטרפרטציה, בדיקות אדומות (red-teaming), הערכת גדרות בטיחות, וניסויי בטיחות מבוקרים. הקו בין חקר המנגנון לבין כיבוי המנגנון עבור מישהו אחר הוא כל העניין של עמוד זה, והוא אינו זז.
הגרסה המדויקת הזו זמינה לציבור תחת Apache 2.0 — למחקר בלבד. ניתן להוריד את המשקלים ב-Hugging Face
השוואות במאמר הזה1
זוהה מתוך המאמר הזה · בנצ'מרקים: Artificial Analysis · מתעדכן יומית
