איור וקטורי שטוח בסגנון אדיטוריאל לכותרות (Hero) של בלוג טכנולוגיה, על הרצה מקומית של מודל שפה גדול לא מצונזר וחסר-סרבנות (abliterated) על החומרה שלך: שבב מודל גדול ומעוגל בכחול עמוק עם זוהר ציאן רך, מרחף במרכז-שמאל; המעגל הפנימי שלו מתמוסס ומשתנה מצורת מנעול סגור למנעול פתוח. מימינו, כרטיס GPU קומפקטי על שולחן עבודה, וחלון טרמינל צר עם פסי פקודות אופקיים מופשטים וצללית לאמה קטנה לצידו. בפינה העליונה — אייקון מיקרוסקופ קטן ומגן מעוגל עם משולש אזהרה, המרמזים על שימוש מחקרי וגבולות בטיחות. רקע תכלת בהיר ולבן, עם שטח ריק נדיב לאורך השליש התחתון. ללא טקסט קריא.
Guides & Insights

כיצד להריץ את Qwen3.8-27B-Uncensored מקומית: GGUF Quants, llama.cpp ו-Ollama

מחבר

Rowan Sterling

תאריך פרסום

מודלים אחרונים · 20צפו בכל המודלים
בנצ'מרקים: Artificial Analysis · מתעדכן יומית
חזרה לכל הפוסטים

כדי להריץ את Qwen3.8-27B-Uncensored מקומית, משוך את מאגר ה-GGUF המאובטח orcarouter/Qwen3.8-27B-Uncensored-GGUF מ-Hugging Face, בחר קוונטיזציה לפי ה-VRAM שלך — Q4_K_M (16.8 GB) לכרטיס GPU של 24 GB, IQ4_XS (15.3 GB) לכרטיס GPU של 16 GB, Q3_K_M (13.5 GB) כשאתה רוצה מרווח קונטקסט — והגש אותו עם build עדכני של llama.cpp באמצעות הדגל --jinja, והוסף --mmproj אם אתה צריך יכולות ראייה. אותו קובץ מיובא ל-Ollama בשלוש פקודות. זוהי גרסת ה-GGUF של build ה-abliterated של Qwen3.8 27B, ששוחרר ב-16 באוגוסט 2026, עם קונטקסט מקורי של 262K, מקרן הראייה וראש הניבוי הספקולטיבי MTP משומרים בכל קוונטיזציה. זהו כלי מחקר, לא עוזר: התנהגות הסירוב הוסרה ממנו, הוא אינו נושא מעקות בטיחות מובנים, והרישיון הוא Apache 2.0. קרא את גבול הבטיחות בתחתית עמוד זה לפני ההורדה — זו הנקודה של המאגר המאובטח.

איזה GGUF להוריד לפי VRAM

המאגר כולל זוג אחד בדיוק מלא ושנים-עשר קבצים מקוונטטים, כך שהחלטת ההורדה היא למעשה החלטת VRAM. המספרים שלהלן הם גדלי הקבצים שנקראו ממאגר Hugging Face ב-2026-08-16.

A quant-picker card titled 'Qwen3.8-27B-Uncensored GGUF — pick by VRAM', sourced to the Hugging Face repo orcarouter/Qwen3.8-27B-Uncensored-GGUF checked 2026-08-16. It lists: 24 GB GPU — Q4_K_M at 16.8 GB, the recommended default; 16 GB GPU — IQ4_XS at 15.3 GB (tight) or Q3_K_M at 13.5 GB (context headroom); 12 GB GPU — Q2_K at 10.9 GB only, quality drops; 48 GB+ — Q8_0 at 29.0 GB or F16 at 54.7 GB; plus a vision line reading add mmproj 0.9 GB for image input. Footer: only 16 of 64 layers use full attention, so the KV cache stays ~2 GB at 32K context and Q4_K_M fits a 24 GB card with long context.

מה בעצם יש במאגר

orcarouter/Qwen3.8-27B-Uncensored-GGUF מכיל חמישה עשר קבצי מודל: משקלי F16 המפוצלים לשני חלקים, שנים-עשר קבצי GGUF מכומתים — Q2_K, Q3_K_S, Q3_K_M, Q3_K_L, Q4_K_S, Q4_K_M, Q5_K_S, Q5_K_M, Q6_K, Q8_0, IQ3_M ו-IQ4_XS — ומקרן הראייה mmproj. הוא יצוא GGUF של אותה גרסה מסורסת כמו Qwen3.8-27B-Uncensored-FP8, ארוז מחדש עבור סביבות ריצה מקומיות מסוג llama.cpp, והוא יורש את רישיון Apache 2.0 של המודל הבסיסי ואת חלון ההקשר המקורי של 262,144 אסימונים.

שלוש תכונות משותפות לכל קוונט. הארכיטקטורה היא qwen35 — תשומת לב היברידית עם 48 שכבות לינאריות מסוג Gated DeltaNet ו-16 שכבות תשומת לב מלאה — וזו הסיבה שהמאגר מסרב להיטען בגרסאות ישנות יותר של llama.cpp ומדוע מטמון ה-KV נשאר קטן. ראש ה-MTP (nextn) לפענוח ספקולטיבי נשמר בכל הקוונטים, K-quant ו-IQ כאחד. ותבנית הצ׳אט היא תבנית ה-Qwen Jinja, שעליך להפעיל במפורש (ראה להלן) או ששיחות מרובות-סבבים יישברו.

מדוע מטמון ה-KV נשאר קטן מספיק כדי להיות משמעותי

זהו הפרט שגורם לסיפור המקומי לעבוד. מתוך 64 השכבות, רק 16 משתמשות בתשומת לב מלאה; 48 האחרות משתמשות בתשומת לב לינארית מסוג Gated DeltaNet, שאינה שומרת מטמון KV קונבנציונלי. ההשפעה המעשית, שנמדדה ב-Runbook המקורי עבור ארכיטקטורה זו, היא מטמון KV של בערך 2 GB בהקשר של 32K — בערך רבע ממה שמודל 27B קונבנציונלי היה צריך. זו הסיבה שקובץ Q4_K_M בנפח 16.8 GB עדיין נכנס לכרטיס של 24 GB עם חלון הקשר ארוך, ומדוע סדרת ה-GGUF הלא מצונזרת ניתנת להפעלה על חומרה שלא הייתה יכולה להכיל כלל את ה-checkpoint של BF16 בנפח 55.6 GB.

הרץ את זה עם llama.cpp

llama.cpp הוא המסלול המיועד. אתה צריך build עדכני: ה‑trunk רושם את ארכיטקטורת qwen35, ו‑builds ישנים יותר דוחים את הקובץ לחלוטין. צורת הפקודה, לפי הערות השימוש בכרטיס המודל ומדריך ההפעלה של ארכיטקטורה זו, היא:

A command card titled 'llama.cpp — serve the uncensored GGUF' showing the run command llama-server -m Qwen3.8-27B-Uncensored-Q4_K_M.gguf --ctx-size 32768 --n-gpu-layers 99 --jinja, an optional vision line adding --mmproj mmproj-Qwen3.8-27B-Uncensored-f16.gguf, and notes: a current build is required because the qwen35 architecture is refused by older llama.cpp versions; the MTP nextn head is preserved in every quant but needs a build with MTP support, stock builds ignore it. Footer: the Ollama path is a Modelfile with FROM ./Qwen3.8-27B-Uncensored-Q4_K_M.gguf, then ollama create qwen3.8-27b-uncensored -f Modelfile, then ollama run qwen3.8-27b-uncensored.

llama-server -m Qwen3.8-27B-Uncensored-Q4_K_M.gguf --ctx-size 32768 --n-gpu-layers 99 --jinja

זה נותן לך נקודת קצה תואמת OpenAI ב-localhost:8080. להוספת תמונות, הוסף --mmproj mmproj-Qwen3.8-27B-Uncensored-f16.gguf. החלף את Q4_K_M בקוונטיזציה התואמת ל-VRAM שלך; הדגלים זהים.

הרץ את זה עם Ollama

אולמה מריץ את אותו קובץ על ידי ייבואו מ-Modelfile, שהיא הדרך הנתמכת להוספת GGUF שאינו בספרייה. בתיקייה המכילה את ה-quant שהורדת:

./Qwen3.8-27B-Uncensored-Q4_K_M.gguf

שמור את השורה הזו כקובץ Modelfile, לאחר מכן ollama create qwen3.8-27b-uncensored -f Modelfile ו ollama run qwen3.8-27b-uncensored. עבור ראייה, הוסף את שורת mmproj לקובץ Modelfile (מ- FROM ... Q4_K_M.gguf בתוספת נתיב mmproj) ו-Ollama מחבר את המקרן. אותן אזהרות --ctx ו-template חלות: הגדר את גודל ההקשר שאתה יכול בפועל להכיל, וזכור שמודל שהוסרו ממנו סירובים עונה ללא גדר מגן בינך לבין הפלט.

מה שהסרת הסירוב שינתה בפועל

כרטיס המודל מפרסם ערכת הערכת בטיחות עבור build זה. כשהחשיבה כבויה, שיעור הסירוב במדדים הסטנדרטיים להנחיות מזיקות יורד מ-64–99% במודל הבסיס ל-0–6% במשקלים שעברו אבליטרציה; כשהחשיבה פועלת הוא כמעט אף פעם לא מסרב — 1.7% או פחות. מדדי היכולות נשארים בטווח של ±1.3 נקודות מהמודל הבסיסי. כך נראה כל שחרור שעבר אבליטרציה בקו הזה: סירובים הוסרו, יכולות נותרו על כנן, וההסתייגות שחלק נכבד מהתשובות עדיין מקדים הצהרה קצרה לפני המענה — תוצר לוואי של האימון, לא סירוב.

הצד השני הוא כל העניין בגבול הבטיחות שלהלן: מודל שמעולם לא מסרב אינו עוזר טוב יותר; הוא סוג אחר של עצם. הוא כלי בדיקה למדידת מנגנוני סירוב ולגילוי האם מעקה הבטיחות שלך עובד.

מה בעצם עושים עם זה במחקר

שלושה פרויקטים לגיטימיים שהם השימוש המורשה במודל נטול סירובים:

כשהבנייה הזו היא התשובה השגויה

אם אתה רוצה עוזר רגיל, או כל דבר שהיית מציב מול משתמשי קצה, זה הדגם הלא נכון — אין לו מעקות בטיחות מובנים משמעותיים, הוא ייענה לבקשות שהדגם הבסיסי מסרב להן, ו-Apache 2.0 אינו מעביר את האחריות ממך. השתמש ב-Qwen3.8-27B המקורי המכוונן למטרה זו. אם אתה רוצה להסיט סירובים בצ'אטבוט, חבילת system-prompt משיגה יותר עם פחות סיכון מעריכת משקלים. ואם אין לך GPU בכלל אבל עדיין רוצה לחקור את הדגם, הכרטיס המתארח obsidian/Qwen3.8-27B ב-OrcaRouter משרת את אותו קו לא מצונזר ב-$0.40 למיליון אסימוני קלט ו-$4.21 למיליון אסימוני פלט עם אותו חלון הקשר של 262K; הוא מוגבל לחוקרי אבטחה ובטיחות ב-AI באותה דרך שבה המאגר מוגבל, והחלטת המודרציה עדיין נשארת בצד שלך. כרטיס הדגם מכיל את פרטי התמחור והמדדים.

גבול הבטיחות — קרא זאת לפני ההורדה

A safety-boundary card for Qwen3.8-27B-Uncensored with two columns: under Research use it lists refusal-mechanism study, interpretability, red-teaming, robustness evaluation and guardrail testing; under Never deploy it lists end-user chatbots, production applications and consumer services, with a warning that this model has had its safety alignment removed and will comply with harmful, unethical or illegal requests the base model refuses, and a footer reading Apache 2.0, research-only, you assume full responsibility.

יישור הבטיחות של המודל הזה {{1}}הוסר באופן מהותי{{/1}}. הוא ייענה לבקשות {{2}}מזיקות, לא אתיות, פוגעניות או בלתי חוקיות{{/2}} שהמודל Qwen3.8-27B המקורי היה מסרב להן, ואין לו {{3}}מעקות בטיחות מובנים משמעותיים{{/3}}. הוא משוחרר {{4}}בקפדנות למחקר לגיטימי בלבד{{/4}} — {{5}}חקר יכולת פרשנות, בטיחות בינה מלאכותית ומנגנוני סירוב, רד-טימינג, הערכת עמידות וניסויים מבוקרים{{/5}}. אתה נושא ב{{6}}אחריות מלאה וחבות מלאה{{/6}} לגבי אופן השימוש בו ולגבי כל מה שהוא מייצר, ואינך {{7}}רשאי לפרוס אותו למשתמשי קצה או לסביבת ייצור{{/7}} מבלי להוסיף {{8}}שכבות בטיחות, ניטור ומניעת ניצול לרעה משלך{{/8}}. המחברים אינם נושאים ב{{9}}אחריות כלשהי{{/9}} לשימוש לרעה. הורדת המאגר משמעותה שאתה מקבל {{10}}תנאים אלה{{/10}}; הרישיון הוא {{11}}Apache 2.0{{/11}}.

מאמר זה אינו מכיל במתכוון פרומפטים מזיקים. מספרי הסירוב שלמעלה מגיעים מחבילת הערכת הבטיחות של כרטיס המודל עצמו, שהיא הדרך הנכונה למדוד מודל מסוג זה: להריץ את מבחני הסירוב הסטנדרטיים, לקרוא את המספרים, ולעצב את המחקר שלך סביב מה שהם מראים.

מקורות ותאריך

כל העובדות לעיל אומתו ב-2026-08-16. רשימת הקבצים והגדלים נקראים ממאגר Hugging Face orcarouter/Qwen3.8-27B-Uncensored-GGUF (נוצר ב-16 באוגוסט 2026; ארכיטקטורה qwen35; רישיון Apache 2.0; גישה מוגבלת). מספרי הסירוב והיכולות לקוחים מחבילת הערכת הבטיחות של כרטיס המודל. מדידת מטמון ה-KV (~2 GB בהקשר של 32K) לקוחה מספר הנהלים של OrcaRouter לארכיטקטורה זו, How to Run Qwen 3.8 27B Locally. התמחור והגבלת הגישה לקוחים מעמוד המודל obsidian/Qwen3.8-27B, שנבדק באותו יום. גדלי הקבצים המכומתים הם ב-GB עשרוניים כפי שהם מאוחסנים ב-Hugging Face.

למחקר לגיטימי, המשקלים נמצאים ב-Hugging Face: הורדה מ-Hugging Face — ללא כרטיס אשראי, פעיל תוך 60 שניות.

© 2026 OrcaRouter

לספקים

מפעילים פלטפורמת הסקה (inference)? הציגו את המודלים שלכם ב-OrcaRouter.

providers@orcarouter.ai

הצטרפו לקהילה שלנו

Discordsupport@orcarouter.aiXGitHubYouTube