
מדדי Qwen3.8-27B-Uncensored: הסרבנות קורסת, היכולת נשארת
- DeepSeekחדשDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.15 / $0.29 לכל 1M טוקנים
- z-aiחדשZ.ai: GLM 5.32026-08-1860אינטליגנציה75כתיבת קוד
- obsidianחדשQwen3.8 27B2026-08-1552אינטליגנציה68כתיבת קוד
- qwenחדשQwen: Qwen3.8 27B (free)2026-08-13qwen/qwen3.8-27b-free
- deepseekחדשDeepSeek: DeepSeek V4 Pro 08132026-08-1253אינטליגנציה69כתיבת קוד
- grokחדשSpaceXAI: Grok 4.62026-08-1261אינטליגנציה77כתיבת קוד
- metaMeta: Muse Spark 1.22026-08-0557אינטליגנציה72כתיבת קוד
- qwenQwen: Qwen3.8 Max2026-08-0358אינטליגנציה72כתיבת קוד
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3152אינטליגנציה69כתיבת קוד
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 לכל 1M טוקנים
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463אינטליגנציה78כתיבת קוד
- googleGoogle: Gemini 3.6 Flash2026-07-2152אינטליגנציה69כתיבת קוד
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137אינטליגנציה49כתיבת קוד
- metaMeta: Muse Spark 1.12026-07-1653אינטליגנציה71כתיבת קוד
- kimiMoonshotAI: Kimi K32026-07-1560אינטליגנציה76כתיבת קוד
- openaiOpenAI: GPT-5.6 Luna2026-07-0952אינטליגנציה71כתיבת קוד
- openaiOpenAI: GPT-5.6 Terra2026-07-0957אינטליגנציה77כתיבת קוד
- openaiOpenAI: GPT-5.6 Sol2026-07-0961אינטליגנציה77כתיבת קוד
סיפור הביצועים של Qwen3.8 27B Uncensored (Aggressive) — הגרסה המנוטרלת של Qwen3.8 27B, ששוחררה כ-FP8 checkpoint ב-15 באוגוסט 2026 וכגרסת GGUF ב-16 באוגוסט — אינו בכך שהמודל התחזק, אלא בכך שהוא הפסיק לסרב. דף המודל מדווח על ירידה בשיעור הסירוב להנחיות מזיקות מ-64–99% במודל הבסיס ל-0–6% בגרסה המנוטרלת עם חשיבה כבויה, ועד 1.7% או פחות עם חשיבה מופעלת, בעוד שכל מדדי היכולת נותרים בטווח של ±1.3 נקודות מהבסיס, ורמת ה-perplexity של WikiText-2 עומדת על 6.96. אם אתם כאן בשביל מדדי הבנצ'מרק של qwen ללא צנזורה, אלה המספרים העיקריים: זה לא מודל חכם יותר, אלא מודל שאינו מסרב.
ההבחנה הזו חשובה, מכיוון שרוב מה שמדורג ב"אמות מידה לא מצונזרות" הוא או ליסטיקל דל של ציוני יכולות או פוסט הייפ שטוען שהמודל "טוב יותר". abliteration אינה עושה אף אחד מאלה. המאמר הזה עובר על הנתונים הנמדדים בפועל — קריסת סירוב, סירוב יתר, שימור יכולות ופרפלקסיטי — על השיטה שהפיקה אותם, ועל גבול הבטיחות שכדאי לקרוא לפני שנוגעים במשקלים.
מה בעצם מודדת סקירת מבחני ביצוע לא מצונזרים
ביקורת רגילה על מודל מדווחת על ציר אחד: יכולת — MMLU, GSM8K, קוד, חשיבה. מודל abliterated מעניין על ציר אחר, וכל העניין בתווית "לא מצונזר" הוא שציר הבטיחות זז. אז השאלה השימושית עבור Qwen3.8-27B-Uncensored-FP8 היא לא "האם הוא חכם יותר?" אלא "מה עלה הסרת מנגנון הסירוב, ועד כמה הוא הוסר ביסודיות?"
יש לקרוא את שלוש משפחות המספרים יחד. שיעור הסירוב במבחני הנחיות מזיקות — באיזו תדירות המודל מסרב; ככל שהבסיס גבוה יותר, כך ההסרה בולטת יותר. סירוב יתר בהנחיות בלתי מזיקות — באיזו תדירות הוא מסרב בטעות לבקשה תמימה; נמוך יותר טוב לכולם. ושימור יכולות — האם העריכה פגעה במודל. סיכום מבחן שמציג רק ציוני יכולות עונה על השאלה הלא נכונה.
השיטה: abliteration היא עריכת משקלים, לא כוונון עדין
מה שמבדיל בין abliteration לבין חבילות ה-”jailbreak“ הקהילתיות הוא היכן השינוי מתבצע. jailbreak ברמת פרומפט עוטף את הקלט; abliteration עורך את המשקלים. השיטה כאן היא של Arditi et al. (2024), ”סירוב במודלים לשוניים מתווך על ידי כיוון יחיד“. הממצא המרכזי הוא שהתנהגות סירוב במודלים רבים מונעת על ידי כיוון יחיד בזרם השיורי — מעריכים את הכיוון הזה, מסירים אותו, והמודל מפסיק לסרב ללא צורך באימון מחדש.
באופן קונקרטי, הכרטיס מתאר אומדן של כיוון סירוב אחד מההפרש הממוצע עם מיסוך הפעלה מסיבית (massive-activation-masked) בין שיירי הטוקן האחרון של מזיקים מינוס בלתי מזיקים בשכבה 38 (round(0.6 × 64)), תוך שימוש ב-AdvBench כקבוצה המזיקה וב-Alpaca כקבוצה הבלתי מזיקה. העריכה היא אורתוגונליזציה, W′ = W − r(rᵀW), המחושבת ב-float32 ומיושמת על 131 מטריצות כותבות-שיירים — הטלות הפלט של תשומת הלב, הטלות הפלט של תשומת הלב הליניארית, הטלות הירידה של ה-MLP, ומרחב שורות אחד של הטמעות. אף שלב אימון אינו רץ; מגדל הראייה נותר ללא נגיעה; ראש פענוח הספקולטיבי של MTP מסורס באופן עקבי. זו הסיבה שיכולת נשמרת: הסרת כיוון היא התערבות עדינה הרבה יותר מאשר כוונון עדין של המודל לציית.
הסירוב קורס: המספרים
נמדד על גבי ה-build של FP8 המשרת דרך vLLM ופורסם בכרטיס המודל של Hugging Face (2026-08-15), שיעור הסירוב במדדים של prompts מזיקים יורד מ-64–99% בגרסה הבסיסית ל-0–6% ב-build הלא מצונזר עם חשיבה כבויה:
• AdvBench — 99.0% → 0.0%
• JailbreakBench (מזיק) — 94.0% → 0.0%
• StrongREJECT — 97.3% → 2.0%
• HarmBench (סטנדרטי) — 98.7% → 2.7%
• MaliciousInstruct — 99.0% → 0.0%
• SimpleSafetyTests — 64.0% → 6.0%
• ForbiddenQuestions — 73.3% → 4.7%
כאשר מצב החשיבה מופעל, סירוב הוא למעשה כמעט אף פעם — 1.7% ב-AdvBench ו-0.0% ברוב השאר. הכרטיס מוסיף הסתייגות כנה אחת: 30–50% מהתשובות עדיין מקדימות כתב ויתור קצר. זו תופעת לוואי של האימון, לא סירוב — המודל עונה, אבל מרכך את הפתיחה. זה נתפס כחיכוך, לא כבטיחות.

סירוב יתר נופל גם כן
המספר הפחות מתוקשר נמצא בצד השני של ציר הבטיחות. ב-XSTest-safe — 250 הנחיות תמימות שמודלים מיושרים מסרבים להן לפעמים בטעות — המודל הבסיסי מסרב יתר על המידה ב-5.6% מהמקרים. הגרסה הלא-מצונזרת מסרבת יתר על המידה ב-0.4%. הסרת כיוון הסירוב לא רק מונעת מהמודל לסרב לבקשות מזיקות; היא גם מונעת ממנו לסרב לבקשות בלתי מזיקות שסימן בעבר עקב הכללת-יתר. לכל מי שבונה כלי הערכה או כלי red-team שבהם נקודת המוצא היא בסיס ללא סירובים, זהו שיפור אמיתי בכלי, לא תופעת לוואי שצריך להתנצל עליה.
יכולת נשמרת, לא משתפרת
{{1}}כאן {{2}}מת {{3}}הנרטיב {{4}}של "ללא צנזורה = חזק יותר"{{/4}}{{/3}}{{/2}}. {{5}}כרטיס המודל {{6}}מדווח על מבנה ה-FP8 המנותב (abliterated){{/6}} מול ה-FP8 הבסיסי הרשמי{{/5}}, עם אותם סקריפטים והגדרות.
• MMLU (0-shot) — 84.3% → 84.7%
• GSM8K (CoT) — 90.0% → 88.7%
• MMLU-Pro (CoT) — 77.6% → 76.8%
• CMMLU (0-shot, סינית) — 81.4% → 80.8%
כל ציון נופל בטווח של ±1.3 נקודות מהבסיס, ו-perplexity הגולמי של WikiText-2 עומד על 6.96 — הראיה בכרטיס לכך שמודל השפה עצמו לא התדרדר. הקריאה הכנה: abliteration קרובה לנייטרליות מבחינת יכולות בארכיטקטורה זו. אתה לא מקבל מודל טוב יותר; אתה מקבל את אותו מודל ללא התנהגות הסירוב.

אותה אזהרה חלה על המערכת האקולוגית הרחבה יותר: טענות "lossless uncensored" על מבנים קהילתיים ראויות לקריאה סקפטית. השוואה משולשת על מבנה במשקל פתוח של 4B ב-Hugging Face מצאה שהטכניקה שטענה להיות ללא אובדן הפילה למעשה את TruthfulQA בכ-7 נקודות ואת Lambada בכ-4 בערך, בעוד ששיעור הצלחת ההתקפה שלה ב-HarmBench הגיע ל-100%; שתי השיטות האחרות עמדו על 99.2% ו-95.5%. ובניסוי אגרסיבי על מבנה אחר הושג אפס סירובים אך הפיק סלט מילים בלתי קוהרנטי, ולכן הגרסה ששוחררה נסוגה לפרמטרים עדינים יותר לכל שכבה. תוצאות Abliteration הן ספציפיות לשיטה — המספרים האלה הם ספציפית נתוני הכרטיס של מבנה FP8.
מה שהכרטיס לא טוען
קראו את המתודולוגיה לפני שמצטטים את המספרים. כרטיס המודל מגדיר את מדידת הסירוב שלו כ"אינדיקטיבית, לא דירוג-LLM / מספר ברמת פרסום": הסירוב נשפט באמצעות מסווג מבוסס-כללים של משפט הפתיחה, עם "אזהרה" נפרדת (bucket) לתשובות שצייתו אך הוסיפו הבהרה בפתיחה. אמות המידה הן טקסט-בלבד, והורצו מול ה-build של FP8 המוגש דרך vLLM עם מודל השפה בלבד, וסוויטת היכולות השתמשה בסקריפטי הערכה סטנדרטיים. המסגרת הנכונה: אלה נתונים שנמדדו על ידי הספק עצמו, ניתנים לשחזור מתוך הכרטיס שפורסם — לא ריצה עצמאית של צד שלישי, ולא טענה לגבי build ה-GGUF, שמגיע בקוונטיזציה עבור llama.cpp ויש להעריך אותו בנפרד.
גבול הבטיחות
זה החלק שלא ניתן לטשטש. במודל abliterated, מנגנון הסירוב הוסר במידה ניכרת. באופן קונקרטי: הוא ייענה לבקשות מזיקות, לא אתיות או לא חוקיות שדגם הבסיס Qwen3.8 27B היה מסרב להן, ואין לו אמצעי הגנה מובנים משמעותיים. השימושים הלגיטימיים הם למחקר — אינטרפרטציה (חקר כיצד מקודדים כיווני סירוב), חקר בטיחות בינה מלאכותית ומנגנוני סירוב, רד-טימינג (בחינת מודלים עם קלטים שמנסים לעקוף את אמצעי ההגנה שלהם), והערכת חוסן. הוא משוחרר תחת רישיון Apache 2.0, שעבר בירושה ממודל הבסיס, אך ורק כחפץ מחקר. אתה נושא באחריות מלאה ובחבות מלאה לשימוש שלך בו ולכל מה שהוא מייצר. אין לפרוס אותו למשתמשי קצה או לייצור (production) ללא שכבות בטיחות, ניהול תוכן ומניעת שימוש לרעה משלך — ולכל שימוש ייצורי או מול צרכנים, הדגם הסטנדרטי Qwen3.8 27B הוא הדגם שאתה באמת רוצה.
כשמדד לא מצונזר הוא לא הדבר הנכון לחפש
אם השאלה שלך היא "איזה מודל הכי חזק במתמטיקה או בקוד?", אתה קורא את המספרים הלא נכונים — הבנייה הלא-מצונזרת אינה שדרוג יכולות. אם היישום שלך צריך לסרב לבקשות מזיקות, המודל הזה הוא ההפך ממה שאתה רוצה. אם אתה משחרר מוצר, אל תבנה על checkpoint מסורס-התנגדות. ואם מה שאתה באמת מחפש הוא jailbreak, זה עניין שונה לחלוטין — חבילות ברמת ה-prompt נמצאות מחוץ להתערבות ברמת המשקל שנידונה כאן ואינן נושא המאמר הזה. נתוני ה-benchmark במאמר זה קיימים עבור שאלה אחת צרה ולגיטימית: מה הסרת סרבנות עושה ל-Qwen3.8 27B, כפי שנמדד.
איך לגשת אליו
שתי הגרסאות נמצאות ב-Hugging Face תחת Apache 2.0: orcarouter/Qwen3.8-27B-Uncensored-FP8 (block-FP8 E4M3, כ-30.9 GB של משקלים, המוגש בנתיב ה-kernel הרגיל של vLLM עם הקשר של 262K, כלים, חשיבה ו-MTP שלמים) ו-orcarouter/Qwen3.8-27B-Uncensored-GGUF (F16 ועוד 12 רמות קוונטיזציה ל-llama.cpp, כאשר Q4_K_M ב-16.8 GB הוא ברירת המחדל המומלצת ל-GPU של 24 GB). כרטיס המודל ב-OrcaRouter מכיל את המחירים ואת פרטי ה-benchmark — הגרסה הלא-מצונזרת רשומה שם כ-obsidian/Qwen3.8-27B במחיר של $0.40 למיליון טוקני קלט ו-$4.21 למיליון טוקני פלט, עם הקשר של 262K, והגישה מוגבלת לחוקרי אבטחה, לצוותי red team ולחוקרי בטיחות בינה מלאכותית.

השורה התחתונה
בנצ'מרקים הלא-מצונזרים של Qwen עונים על שאלה מצומצמת, והתשובה נקייה: הסרת הסרבנות מ-Qwen3.8 27B באמצעות abliteration משאירה את היכולת בטווח של ±1.3 נקודות, בעוד שהסרבנות לפרומפטים מזיקים קורסת מ-64–99% ל-0–6%, סרבנות-יתר יורדת מ-5.6% ל-0.4%, והפרפלקסיטי נשמר על 6.96. קראו למספרים האלה ״לא מסרב״, לעולם לא ״חזק יותר״. עבור מחקר פרשנות, בטיחות ו-red-team, זה בדיוק הכלי שכרטיס המודל מתאר. עבור כל דבר שפונה למשתמש, זה המודל הלא נכון מעצם בנייתו.
לשימוש מחקרי לגיטימי, המשקולות נמצאות ב-Hugging Face תחת Apache 2.0 — orcarouter/Qwen3.8-27B-Uncensored-FP8 (גרסת ה-GGUF עבור llama.cpp נמצאת ב-orcarouter/Qwen3.8-27B-Uncensored-GGUF).
