
Qwen ללא צנזורה, מוסבר: איך להריץ את גרסת ה-Abliterated של Qwen3.8-27B-FP8
- obsidianחדשQwen3.8 27B Uncensored (Aggressive)2026-08-1552אינטליגנציה68כתיבת קוד
- qwenחדשQwen: Qwen3.8 27B (free)2026-08-1361 tok/s
- deepseekחדשDeepSeek: DeepSeek V4 Pro 08132026-08-1253אינטליגנציה69כתיבת קוד
- grokחדשSpaceXAI: Grok 4.62026-08-1261אינטליגנציה77כתיבת קוד
- metaחדשMeta: Muse Spark 1.22026-08-0557אינטליגנציה72כתיבת קוד
- qwenQwen: Qwen3.8 Max2026-08-0358אינטליגנציה72כתיבת קוד
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3152אינטליגנציה69כתיבת קוד
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 לכל 1M טוקנים · 231 tok/s
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463אינטליגנציה78כתיבת קוד
- googleGoogle: Gemini 3.6 Flash2026-07-2152אינטליגנציה69כתיבת קוד
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137אינטליגנציה49כתיבת קוד
- metaMeta: Muse Spark 1.12026-07-1653אינטליגנציה71כתיבת קוד
- kimiMoonshotAI: Kimi K32026-07-1560אינטליגנציה76כתיבת קוד
- openaiOpenAI: GPT-5.6 Luna2026-07-0952אינטליגנציה71כתיבת קוד
- openaiOpenAI: GPT-5.6 Terra2026-07-0957אינטליגנציה77כתיבת קוד
- openaiOpenAI: GPT-5.6 Sol2026-07-0961אינטליגנציה77כתיבת קוד
- grokxAI: Grok 4.52026-07-0856אינטליגנציה72כתיבת קוד
- tencentTencent: Hy32026-07-0642אינטליגנציה59כתיבת קוד
Qwen ללא צנזורה ב-Hugging Face כמעט תמיד אומר abliteration — הסרת כיוון הסירוב של המודל מהזרם השאריתי שלו — והגרסה שכדאי להתחיל איתה היא Qwen3.8-27B-Uncensored-FP8, ששוחררה ב-Hugging Face ב-15 באוגוסט 2026. זוהי גרסת abliterated, block-FP8 של Qwen3.8-27B, שרצה על אותו נתיב ליבת vLLM בדיוק כמו הגרסה הרשמית של FP8, עם קונטקסט של 262K, מגדל ראייה וראש פענוח ספקולטיבי MTP שלמים — וזכתה ל-257 לייקים ו-4,285 הורדות ביום הראשון. זהו כלי מחקר, לא צ’אטבוט: אין מנגנוני הגנה מובנים, רישיון Apache 2.0, והוא ייענה לבקשות שהמודל הבסיסי מסרב להן. מדריך זה מכסה מה abliteration באמת שינתה, כיצד להוריד את המשקלים בנפח 30.9 GB מ-Hugging Face, כיצד לשרת את המודל עם vLLM, SGLang או Transformers, ומה להריץ עליו למחקר לגיטימי.
מה "qwen uncensored" בעצם אומר
Abliteration היא התערבות ברמת המשקולות, לא כוונון עדין. כיוון הסירוב הוא וקטור בזרם השיורי של המודל, שכאשר הוא מופעל, מייצר "אני לא יכול לעזור עם זה"; אבליטרציה מוצאת את הכיוון הזה ומסירה אותו מהמשקולות באמצעות אורתוגונליזציה. במבנה זה ההסרה יושמה על 131 מטריצות כותבות לזרם השיורי (השיטה מ-Arditi et al. 2024, "Refusal in Language Models Is Mediated by a Single Direction"), והתוצאה עברה קוונטיזציה מחדש כדי להתאים לסכימה הרשמית Qwen3.8-27B-FP8 בית אחר בית, כך ש-vLLM מגיש אותה על אותו נתיב ליבת FP8. לא אומנו משקולות חדשות.
ההבחנה הזו חשובה כי התוצאות המובילות עבור "qwen uncensored" מערבבות שלושה דברים שונים: עריכות משקל מסוג abliterated כמו זו, "חבילות uncensored" מבוססות system-prompt שרק מסוות סירובים ברמת ה-prompt, ו-fine-tunes מסוג LoRA שאומנו ללא נתוני בטיחות. הן אינן שקולות, ורוב הדפים שמדורגים עבור השאילתה לא אומרים לך לאיזו משפחה הם מתייחסים. אם אתה רוצה לחקור את מנגנון הסירוב עצמו, רק ההתערבות ברמת המשקלים היא הדבר האמיתי.
מה שהסרת הסירוב עשתה בפועל — המספרים
המודל-קארד מפרסם ערכת הערכת בטיחות, שהורצה על המודל המשרת דרך vLLM ומתוארכת ל-15 באוגוסט 2026. עם חשיבה כבויה, שיעור הסירוב בשבעה מדדים של הנחיות מזיקות קורס מ-64–99% במודל הבסיס ל-0–6% במבנה זה: AdvBench 99.0% ל-0.0%, JailbreakBench 94.0% ל-0.0%, StrongREJECT 97.3% ל-2.0%, HarmBench 98.7% ל-2.7%, MaliciousInstruct 99.0% ל-0.0%, SimpleSafetyTests 64.0% ל-6.0%, ForbiddenQuestions 73.3% ל-4.7%. עם חשיבה דלוקה, המודל מסרב כמעט אף פעם — 1.7% או פחות. מספר נפרד וראוי לציון הוא שיעור ההסתייגות: 30–50% מהתשובות ה"לא מצונזרות" עדיין מקדימות הצהרת אחריות קצרה לפני שהן עונות; זהו תוצר לוואי של אימון, לא סירוב.
הצד השני הוא מה שלא השתנה. סירוב יתר להנחיות תמימות יורד מ-5.6% ל-0.4% ב-XSTest-safe, וכל מדדי היכולת נשארים בטווח של ±1.3 נקודות מהבסיס: MMLU מ-84.3% ל-84.7%, GSM8K מ-90.0% ל-88.7%, MMLU-Pro מ-77.6% ל-76.8%, CMMLU מ-81.4% ל-80.8%. ערך ה-perplexity של WikiText-2 הוא 6.96. במילים אחרות, ההתערבות הסירה את התנהגות הסירוב ללא פגיעה משמעותית במודל.

איך להוריד אותו מ-Hugging Face
המאגר הוא orcarouter/Qwen3.8-27B-Uncensored-FP8, והוא מוגבל: אתה מתחבר עם חשבון Hugging Face ומקבל את התנאים לפני הורדת הקבצים — השער עצמו הוא כתב הוויתור, משום שקריאת ה-README היא חלק מקבלת מה שהמודל הזה הוא. מה שאתה מוריד הוא 30.9 GB המפוזרים על פני שבעה חלקי safetensors (1,606 טנסורים) בפורמט block-FP8 (E4M3, בלוקים של 128×128, הפעלות דינמיות), כשמגדל הראייה, הנורמות, ה-embeddings ו-lm_head נשמרים ב-BF16. הרישיון הוא Apache 2.0, שעבר בירושה מהמודל הבסיסי Qwen/Qwen3.8-27B. אף ספק Inference של Hugging Face לא מארח אותו — אתה מריץ אותו בעצמך, או משתמש בכרטיס מתארח.
איך להריץ את זה
המשקלים הם כ-31 ג'יגה-בייט — כמחצית מנקודת הביקורת של BF16 (כ-56 ג'יגה-בייט) — וכרטיס המודל ממליץ על H100 יחיד עם 80GB או H200 עם 143GB, כשכ-40 ג'יגה-בייט של VRAM הם הרף הפרקטי למשקלים בתוספת מטמון KV קטן. חלון קונטקסט מלא של 262K דורש יותר, אבל מטמון KV בפורמט FP8 מקטין את הדרישה בחצי. התצורה שהכרטיס אימת הייתה H200 אחד עם --max-num-seqs 96, מטמון KV בפורמט FP8 ו-MTP מופעל.
vLLM היא הדרך המיועדת, והיא פקודה אחת, כי מתכונת ה-FP8 תואמת בדיוק את הגרסה הרשמית:
vllm serve "orcarouter/Qwen3.8-27B-Uncensored-FP8"
זה נותן לך נקודת קצה תואמת OpenAI בכתובת localhost:8000/v1/chat/completions. המקבילה של Docker היא docker model run hf.co/orcarouter/Qwen3.8-27B-Uncensored-FP8. להתקנה מלאה, הכרטיס מציע: --language-model-only עבור שירות טקסט בלבד, --speculative-config '{"method":"mtp","num_speculative_tokens":3}' כדי להפעיל את ראש פענוח הספקולטיבי MTP, --kv-cache-dtype fp8, --max-model-len 262144, --reasoning-parser qwen3, ו--enable-auto-tool-choice --tool-call-parser qwen3_coder עבור קריאה לכלים. אל תעביר את --quantization fp8 — הסכימה נקראת מתוך config.json. השמט את --kv-cache-dtype fp8 אם אתה רוצה מטמון KV מסוג BF16, והשמט את --language-model-only אם אתה צריך את מגדל הראייה.
עבור SGLang: python3 -m sglang.launch_server --model-path "orcarouter/Qwen3.8-27B-Uncensored-FP8" --host 0.0.0.0 --port 30000. עבור Transformers, כרטיס המודל מפרט גם את ה-API של pipeline — pipeline("image-text-to-text", model="orcarouter/Qwen3.8-27B-Uncensored-FP8") — וגם את AutoProcessor.from_pretrained(...) ובנוסף את AutoModelForMultimodalLM.from_pretrained(..., device_map="auto").

מה בעצם עושים עם זה במחקר
הנקודה במודל שממנו הוסרה סרבנות היא להיות מושא מחקר, והבנייה הזו קלה במיוחד למחקר משום שההתערבות שלה מתועדת. שלושה פרויקטי מחקר קונקרטיים ולגיטימיים:
• שחזר את דלתא הסירוב. הרץ את AdvBench, HarmBench, StrongREJECT או XSTest-safe נגד הגרסה שעברה אבליטרציה וגם נגד בסיס ה-FP8, ואמת את המספרים בכרטיס: 64–99% ל-0–6% על פרומפטים מזיקים, ו-5.6% ל-0.4% סירוב-יתר על פרומפטים תמימים. זוג המדידות לפני/אחרי הזה הוא בדיוק המדידה שצוות בטיחות צריך כדי לדעת אם שיטת הסרת הסירוב עובדת ומה היא עולה.
• חקור היכן מתגורר הסירוב. מכיוון שהבנייה מתעדת את 131 המטריצות שעברו אורתוגונליזציה, ניתן להשוות את כיווני זרם-השארית מול הבסיס ולראות מה ההתערבות הזיזה. התוצאה של הפעלת-החשיבה אינפורמטיבית כאן: הסירוב יורד ל־1.7% או פחות כשהחשיבה מופעלת, וזה עדות לכך שעקבות ההיגיון היא המקום שבו לכיוון יש את המשמעות הגדולה ביותר.
הערך את מחסום ההגנה שלך. קו בסיס ללא מחסום הגנה הוא הבקרה הנכונה לבדיקת שכבת ניהול. הרץ את המסנן שלך על הפלטים של המודל הזה ומדוד מה הוא תופס — כך מכמתים את שכבת הבטיחות שמוסיפים מעל.
כאשר המודל הזה הוא התשובה השגויה
אם אתה רוצה עוזר רגיל, או כל דבר שהיית מציב מול משתמשי קצה, זה המודל הלא נכון — אין לו מנגנוני בטיחות מובנים משמעותיים, הוא ייענה לבקשות שהמודל הבסיסי מסרב להן, ו-Apache 2.0 לא מעבירה את האחריות שלך הלאה. השתמש במקום זאת ב-Qwen3.8-27B המיושר המקורי. אם אתה רוצה לעקוף סירובים בצ'אטבוט, חבילת system-prompt משיגה יותר עם פחות סיכון מאשר עריכת משקלים. ואם אין לך כרטיס של ~40 GB אבל עדיין רוצה לחקור את המודל, הכרטיס המאוחסן obsidian/Qwen3.8-27B ב-OrcaRouter משרת את אותו קו 27B ללא צנזורה במחיר של $0.40 למיליון טוקני קלט ו-$4.21 למיליון טוקני פלט, עם אותו קונטקסט של 262K — הוא מוגבל לחוקרי אבטחה ובטיחות בינה מלאכותית, והחלטת המודרציה עדיין נשארת בידיים שלך.

גבול הבטיחות — קרא זאת לפני ההורדה
יישור הבטיחות של המודל הזה {{1}}הוסר באופן מהותי{{/1}}. הוא ייענה לבקשות {{2}}מזיקות, לא אתיות, פוגעניות או בלתי חוקיות{{/2}} שהמודל Qwen3.8-27B המקורי היה מסרב להן, ואין לו {{3}}מעקות בטיחות מובנים משמעותיים{{/3}}. הוא משוחרר {{4}}בקפדנות למחקר לגיטימי בלבד{{/4}} — {{5}}חקר יכולת פרשנות, בטיחות בינה מלאכותית ומנגנוני סירוב, רד-טימינג, הערכת עמידות וניסויים מבוקרים{{/5}}. אתה נושא ב{{6}}אחריות מלאה וחבות מלאה{{/6}} לגבי אופן השימוש בו ולגבי כל מה שהוא מייצר, ואינך {{7}}רשאי לפרוס אותו למשתמשי קצה או לסביבת ייצור{{/7}} מבלי להוסיף {{8}}שכבות בטיחות, ניטור ומניעת ניצול לרעה משלך{{/8}}. המחברים אינם נושאים ב{{9}}אחריות כלשהי{{/9}} לשימוש לרעה. הורדת המאגר משמעותה שאתה מקבל {{10}}תנאים אלה{{/10}}; הרישיון הוא {{11}}Apache 2.0{{/11}}.
מאמר זה אינו מכיל במתכוון פרומפטים מזיקים. מספרי הסירוב שלמעלה מגיעים מחבילת הערכת הבטיחות של כרטיס המודל עצמו, שהיא הדרך הנכונה למדוד מודל מסוג זה: להריץ את מבחני הסירוב הסטנדרטיים, לקרוא את המספרים, ולעצב את המחקר שלך סביב מה שהם מראים.
השורה התחתונה
"Qwen uncensored" הוא חיפוש אחר טכניקה, והגרסה שכדאי לנסות קודם היא Qwen3.8-27B-Uncensored-FP8: מבנה Qwen3.8 היחיד עם הסרת סירובים שמשרת בנתיב הקרנל הרשמי של FP8 של vLLM עם הקשר של 262K, ראייה ו-MTP שלמים, מגובה בהערכה שפורסמה לפני/אחרי. הורידו את קובץ ה-30.9 GB המוגבל מ-Hugging Face, הגישו אותו עם vLLM על H100 או H200 יחיד, והשתמשו בו למטרה שהוא נועד לה — מדידת סירובים, חקר מנגנון הסירוב, ובדיקת מעקות בטיחות. אל תשתמשו בו כצ'אטבוט, ואל תשלחו אותו למשתמשי קצה. המשקולות חופשיות; האחריות למה שתעשו איתן היא כולה שלכם.
למחקר לגיטימי, המשקלים נמצאים ב-Hugging Face: הורד מ-Hugging Face
