
הגשת Qwen3.8-Flash-Next-Uncensored-FP8: מדריך תפעול vLLM עבור ה-build של block-FP8
- AlibabaחדשQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 לכל 1M טוקנים
- z-aiחדשZ.ai: GLM 5.3 Flash2026-08-2658אינטליגנציה72כתיבת קוד
- DeepSeekחדשDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.15 / $0.29 לכל 1M טוקנים
- z-aiחדשZ.ai: GLM 5.32026-08-1860אינטליגנציה75כתיבת קוד
- obsidianQwen3.8 27B2026-08-1552אינטליגנציה68כתיבת קוד
- qwenQwen: Qwen3.8 27B (free)2026-08-13qwen/qwen3.8-27b-free
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1253אינטליגנציה69כתיבת קוד
- grokSpaceXAI: Grok 4.62026-08-1261אינטליגנציה77כתיבת קוד
- metaMeta: Muse Spark 1.22026-08-0557אינטליגנציה72כתיבת קוד
- qwenQwen: Qwen3.8 Max2026-08-0358אינטליגנציה72כתיבת קוד
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3152אינטליגנציה69כתיבת קוד
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 לכל 1M טוקנים
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463אינטליגנציה78כתיבת קוד
- googleGoogle: Gemini 3.6 Flash2026-07-2152אינטליגנציה69כתיבת קוד
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137אינטליגנציה49כתיבת קוד
- metaMeta: Muse Spark 1.12026-07-1653אינטליגנציה71כתיבת קוד
- kimiMoonshotAI: Kimi K32026-07-1560אינטליגנציה76כתיבת קוד
- openaiOpenAI: GPT-5.6 Luna2026-07-0952אינטליגנציה71כתיבת קוד
Qwen3.8-Flash-Next-Uncensored-FP8 — מבנה ה-block-FP8 של Flash-Next המנוטרל — הוא הארטיפקט שלמעשה מורידים כאשר מגישים מודל זה על חומרת דאטהסנטר, והוא האחרון באוסף שקיבל runbook משלו. הוא נמצא ב-orcarouter/Qwen3.8-Flash-Next-Uncensored-FP8 באתר Hugging Face: כיוון הסירוב הוסר מהמודל Qwen3.8-Flash-Next של Qwen, ולאחר מכן בוצעה קוונטיזציה מחודשת לא מקוונת לסכמת ה-FP8 המדויקת של Qwen3.8-Flash-Next-FP8 הרשמי, כך ש-vLLM מגיש אותו באותו נתיב kernel. זהו המבנה שכל מי שמריץ מודל זה על GPUs מסוג Hopper ומעלה יפנה אליו, ולנתיב ההגשה יש דגל אחד שקל לטעות בו וקשה לאבחן כשהוא שגוי.
ראשית, הגבול, כי הקוראים ממשיכים לטשטש אותו וזה משנה את כל מה שבהמשך. Qwen3.8-Flash-Next-Uncensored ו-Qwen3.8-27B-Uncensored הם שני מודלים שונים, לא שתי גרסאות של מודל אחד. משקלי בסיס שונים — Qwen3.8-Flash-Next לעומת Qwen3.8-27B — ארכיטקטורות שונות, שחרורי משקלים שונים, אוספי Hugging Face שונים. הם חולקים טכניקת abliteration ושם משפחה; וזה הכל. אף אחד מהמספרים בעמוד ה-27B לא תקף למודל הזה, ואם הגעת לכאן מחיפוש 27B, מדריך ההפעלה המקומי של ה-27B הוא עמוד נפרד עם סט החלטות נפרד.
דף זה הוא דף ההגשה של Flash-Next FP8 ותו לא. מדריך ה-GGUF/MLX מכסה את ההסבר על abliteration עבור מודל זה ועל שתי שורות הבנייה לחומרת צרכן; הטכניקה שמאחורי כל המשפחה מוסברת במבוא ל-abliteration ובמסביר הרחב יותר על מודלים לא-מצונזרים; ול-Qwen3.8-27B-Uncensored-FP8, האח שכנראה הפנו אותך אליו, יש מדריך FP8 משלו. כאן אנו נשארים על שאלה אחת: איך מגישים את גרסת ה-block-FP8, מה נשבר כשעושים את זה לא נכון, ומה המספרים של הכרטיס עצמו כן ומה לא מספרים לך.
לפני שתתחיל: השער וזמן הריצה
שני דברים חוסמים את המאגר הזה, ושניהם מייצרים כשלונות שנראים כמו משהו אחר.
הראשון הוא הגישה. המאגר מוגן: עליך להיות מחובר ל־Hugging Face ולקבל את תנאי המאגר לפני שכל הורדה תעבוד. דף המודל עצמו קריא גם ללא חשבון — כל נוסח הכרטיס פומבי — אבל המשקולות לא. בפשטות, ללא הפעלה מחוברת שקיבלה את התנאים, גם hf download וגם vllm serve orcarouter/Qwen3.8-Flash-Next-Uncensored-FP8 נכשלים עם שגיאת אימות, ולא עם "אתה צריך ללחוץ על Agree" ידידותית. בצע קודם את הלחיצה החד־פעמית, ולאחר מכן משוך את כ־186 ה־GB עם ה־hf CLI או תן ל־vLLM לפתור את המאגר בריצה הראשונה.
השני הוא זמן הריצה. הצ'קפוינט נרשם תחת ארכיטקטורת qwen4_exp (Qwen4ExpForConditionalGeneration), ש-vLLM הרגיל ו-Transformers הרגיל לא יכולים לטעון. אתה צריך את תמונת ה-day-0 של vLLM ואת transformers 5.16 ומעלה. זוהי התקלה הנפוצה ביותר של "זה לא נטען" במדריכי הקהילה השבוע — לא הורדה פגומה, אלא זמן ריצה שקודם לארכיטקטורה. התמונה אינה אופציונלית; היא הנתיב.
חומרה, כדי שתוכל לתכנן לפני שתמשוך משהו: השימוש בכרטיס מיועד לצומת של 8 GPUs, וההנחיות של המתכון הרשמי של vLLM עבור ה-FP8 checkpoint חלות כאן מכיוון שהגרסאות תואמות טנזור-לטנזור — בסדר גודל של 265 GB של GPU VRAM לפריסה על צומת מלא, כאשר TP2 נחשב למינימום במחלקת GB300 ו-TEP4/TEP8 כתצורות המגש המלא המאומתות.
למה קיימת מהדורת FP8 — ולמה "נתיב קרנל זהה" הוא כל העניין
משקלי ה-BF16 שעברו abliteration הם מקור האמת; המאגר הזה הוא אותו מודל שעבר קוונטיזציה חוזרת במצב לא מקוון, תוך שכפול מכוון של המתכון הרשמי של Qwen3.8-Flash-Next-FP8. הקוונטייזר נוגע רק ב-512 היטלי המומחים המנותבים — experts.{e}.down/gate/up_proj — מפרק אותם מהפריסה התלת-ממדית של בניית ה-BF16 ומאחסן כל אחד כמשקלי float8_e4m3fn בתוספת סקלות weight_scale_inv מסוג BF16 בבלוקים של 128×128. ההפעלות הן FP8 דינמי לכל טוקן; אין ערכת כיול. כל השאר נשאר BF16: attention ו-linear_attn, המומחה המשותף, נתב ה-MoE (mlp.gate), מיקסרי ה-Hyper-Connection, embeddings, lm_head, ראש ה-MTP לפענוח ספקולטיבי, וכל מגדל הראייה.
הקביעה 'identical kernel path' היא יותר משיווק, וראויה למשפט אחד. הבנייה אומתה מול נקודת הביקורת הרשמית של FP8: סקלות הבלוקים משתכפלות בדיוק (scale_relerr = 0) וקודי FP8 תואמים לעיגול תת-ULP. זו הסיבה ש-vLLM מריץ אותו עם אותם קרנלי FP8 עם סקלת בלוקים ואותו פענוח ספקולטיבי MTP כמו בגרסה הרשמית — הטנסורים הם למעשה אותם טנסורים, למעט כיוון הסירוב.
באופן קונקרטי, זה נותן לך כ־186 ג״ב על פני 131 שאדרים (152,089 טנסורים, מתוכם 75,264 בפורמט FP8), 262,144 טוקנים של קונטקסט מקורי, מגדל הראייה + הווידאו נשמר בייט-לביט (333 טנסורים מסוג visual.*), וראש ה־MTP שלם. המשקלים עברו אבליטרציה קודם — כיוון סירוב יחיד שהוערך בשכבה 24 והותמר לקרטגונליות מתוך 149 טנסורים הכותבים ל-residual בפורמט float32, לפי Arditi et al. (2024) — והכותבים ל-residual של ראש ה־MTP נערכו באופן עקבי, כך שפענוח ספקולטיבי ממשיך לעבוד. הפרט האחרון הזה אינו מובן מאליו, והוא ההבדל בין ראש שמאיץ פענוח לראש שמאט אותו בשקט.

הדגל האחד שקובע אם הטעינה מצליחה או נכשלת.
הגישו את ה-build הזה ללא --enable-expert-parallel ותקבלו תקלה שנראית כמו באג צורה, לא טעות בקונפיגורציה. זו תקלת ההגשה המדווחת ביותר עבור ה-checkpoint הזה, והיא דטרמיניסטית לחלוטין.
הנה החשבון. לפרויקט המנותבים (routed experts) יש היתוך gate+up projection בגודל ביניים של 640. Block-FP8 מבצע קוונטיזציה בגושים ברוחב 128. תחת מקביליות טנזור פשוטה, ה-640 מתפצל בין הראנקים — 640 ÷ TP — ועבור דרגות ה-TP הנפוצות (2, 4, 8), הפרוסה לכל ראנק אינה מתחלקת ב-128: TP8 נותן 80, TP4 נותן 160, TP2 נותן 320. לאחר מכן vLLM מסרב לטעון את המשקלים עם שגיאה שנראית כמו אי-התאמת צורה: output_size של המשקלים של gate ושל up = 80 אינו מתחלק ב-block_n = 128 של קוונטיזציית המשקלים.
Expert parallelism פותר זאת על ידי פיצול משקלי המומחים בין דרגות expert-parallel במקום דרגות tensor-parallel, מה שמשמר את גבולות בלוקי ה-FP8. זו הסיבה שהדגל הוא חובה עבור build זה: עם --enable-expert-parallel, TP8 הופך ל-TEP8 תקין. (זה לא מזיק ל-build של BF16, שבו אין בלוקי FP8 לשמר.) המתכון הרשמי של vLLM מצהיר במפורש ש-TP8 רגיל אינו תואם לבלוקי הקוונטיזציה ברוחב 128 של ה-checkpoint, ו-issue של vLLM שנפתח יומיים אחרי שהמשקלים פורסמו מתעד את אותו כשל על צומת של 8×L40s ב-TP2, TP4 ו-TP8. אם טעינה מתה עם שגיאה שנראית כמו שגיאת צורה, בדוק את הדגל לפני שאתה בודק את ההורדה.
הפקודה המדויקת
להלן קריאת ה-docker של הכרטיס, משוכפלת נאמנה:
docker run -d --name flashnext --gpus all --ipc host -p 8000:8000 -v /path/to/Qwen3.8-Flash-Next-Uncensored-FP8:/model vllm/vllm-openai:qwen38-flash-next-x86_64-cu130 --model /model --served-model-name Qwen3.8-Flash-Next-Uncensored --tensor-parallel-size 8 --trust-remote-code --max-model-len 262144 --enable-expert-parallel --enable-auto-tool-choice --tool-call-parser qwen3_coder
עבדו על הדגלים שאינם ברורים:
• vllm/vllm-openai:qwen38-flash-next-x86_64-cu130 — תמונת day-0 של qwen4_exp. לא מדובר ב-vLLM גנרי; זוהי התמונה הספציפית לארכיטקטורה, ותמונות רגילות שקדמו ל-qwen4_exp לא יטענו את נקודת הביקורת כלל.
• --trust-remote-code — טוען את קוד המודל qwen4_exp שמגיע עם המאגר. בלי זה, הטוען מסרב עקרונית.
• --max-model-len 262144 — תואם את חלון ההקשר המקורי. כדאי להגדיר זאת במפורש כאן במקום להשאיר לברירת מחדל.
• --enable-expert-parallel — נדרש עבור בניית FP8, מהסיבות המפורטות בסעיף שלמעלה. הכרטיס מציין שזה אינו מזיק עבור BF16.
• --enable-auto-tool-choice --tool-call-parser qwen3_coder — מפעיל קריאות לכלים ולפונקציות באמצעות פורמט ה-XML של Qwen3-Coder. אם משאירים אותם כבויים, המודל עדיין מנהל שיחה, אך השימוש בכלים אגנטיים כבוי.
• --tensor-parallel-size 8 — הפעלת הכרטיס מניחה צומת של 8 GPUs (8× Hopper-class). עם --enable-expert-parallel מדובר בפריסת TEP8.
ברגע שהקונטיינר עולה, ה-endpoint תואם ל-OpenAI בכתובת :8000/v1. הגדר את --served-model-name למה שהלקוחות שלך מצפים; הכרטיס משתמש ב-Qwen3.8-Flash-Next-Uncensored.
חלופות, כולן בכרטיס או מאומתות על ידי אנשי מקצוע השבוע: vllm serve orcarouter/Qwen3.8-Flash-Next-Uncensored-FP8 ישירות לאחר אימות סשן ה-HF שלך; SGLang דרך התמונה lmsysorg/sglang:qwen38flashnext עם --tp 8 --ep 8 — אותה דרישת מקבילות מומחים, מאותה סיבה; ו-Transformers עם pipeline("image-text-to-text", ...) בגרסת transformers 5.16+ אם ברצונך לכתוב סקריפטים מול המודל במקום לשרת אותו.
מה שבאמת עובד כשמגישים אותו
הדפוסים בסעיף זה הם ממצאים קהילתיים מרונבוקים של אנשי פרקטיקה ומשרשורי פורום השבוע, ולא הנחיות ספק. כאשר יותר מתצורה אחת מדווחת על אותה התנהגות, כדאי להתייחס אליה כאל אמיתית:
• פענוח ספקולטיבי של MTP עובד. הוסף --speculative-config '{"method":"mtp","num_speculative_tokens":3}' ו-vLLM משתמש בראש ה-MTP השמור. מדריכי הפעלה מרובים מדווחים ש-MTP היא הסיבה לכך שהפענוח של המודל הזה נשאר שמיש למרות גודלו.
• OOM בטעינה? העבר את טבלת ה-n-gram. ה-embedding של n-gram מסוג PLE עם 51B פרמטרים הוא הפתעת הזיכרון בארכיטקטורה זו. VLLM_PLE_CPU_OFFLOAD=1 מעביר אותו ל-RAM של המארח — תן לו לפחות ~51 GB שם. גם המתכון הרשמי וגם ספרי ההפעלה (runbooks) של הקהילה לריבוי צמתים פונים לדגל הזה.
• הראייה היא אמיתית, לא שרידית. מגדל הראייה + הווידאו נשמר בייט-אחר-בייט, כך שזה נשאר מודל ראייה-שפה מלא. העבר חלק תוכן image_url בהשלמת צ'אט, ואותה נקודת קצה משרתת הבנת תמונות; בדיקות OCR קהילתיות על הגרסה הזו מדווחות על מעברים נקיים.
• החשיבה מופעלת כברירת מחדל — וזה משנה את תמונת הבטיחות. תבנית הצ'אט מאפשרת חשיבה אלא אם כן תציין אחרת. ניתן לשנות זאת לכל בקשה באמצעות chat_template_kwargs={"enable_thinking": true|false}, ולהוסיף מפענח חשיבה אם תרצה להפריד את טקסט החשיבה מהתשובה. בגלל ברירת המחדל הזו, אתה כמעט תמיד מגיש את המודל עם חשיבה מופעלת, אלא אם כן תכבה אותו במפורש.
• 262K מקורי, 1M עם עקיפת rope. ההקשר המקורי הוא 262,144 טוקנים. כדי להגיע ל-1M נדרשת עקיפת קנה-מידה מסוג YaRN rope במפורש, וכן משתנה סביבה שמסיר את תקרת max-model-len של vLLM — וכדאי קודם לבצע בדיקת רגרסיה לאיכות בהקשר קצר יותר, משום שהרחבה עיוורת פי 4 היא בדרך כלל המקום שבו איכות ההקשר הארוך מתדרדרת.

מה שהמספרים בכרטיס אומרים — ומה שהם לא
אלה הן המדידות של הספק עצמו על העריכה שלו, שפורסמו בכרטיס המודל ונמדדו על המשקלים המדויקים האלה שמוגשים עם vLLM מול הבסיס הרשמי תחת סקריפטים והגדרות זהים. דווח עליהם כפי שהם: אינדיקטיביות, ולא ביקורת עצמאית.
הכותרת היא קריסת הסירוב כשהחשיבה כבויה. בחבילת ההנחיות המזיקות של הכרטיס (n מ-50 עד 150 לכל מדד), הסירוב הבסיסי נע בין 64% ל-100%, ואילו בגרסה זו 0% עד 2.7%: AdvBench 100%→2.0%, JailbreakBench 94%→0.0%, StrongREJECT 99.3%→1.3%, HarmBench 100%→1.3%, MaliciousInstruct 98%→0.0%, SimpleSafetyTests 64%→2.0%, ForbiddenQuestions 75.3%→2.7%, ובדיקה מותאמת אישית בסינית/אנגלית 63.6%→0.0%.
כעת, החלק הכנה. שיעור הסירוב של המודל הבסיסי עצמו קורס כאשר החשיבה מופעלת — AdvBench יורד מ-100% במודל הבסיס ל-7.0% כשההנמקה פועלת — ולכן ההשוואה עם חשיבה מופעלת היא הרבה פחות דרמטית: הגרסה הזו עומדת על 0.0% באותה סדרה, אבל היא מקטינה במעט נתון שכבר הופחת על ידי המודל הבסיסי. אם תצטט רק את הנתונים ללא חשיבה, אתה מציג את החצי המחמיא של הסיפור, וזה בדיוק החצי שעל הערכת בטיחות לא להסתמך עליו.
סירוב יתר על הנחיות תמימות (XSTest-safe, n=250) יורד מ-9.6% במודל הבסיס ל-1.2% במבנה זה כשהחשיבה כבויה — שיפור אמיתי, שכן מודל שמסרב להנחיות תמימות הוא מצב הכשל השקט יותר. שמירת היכולות ב-MMLU / MMLU-Pro / GSM8K / CMMLU מראה הפרשים של −2.0, −1.2, −1.3 ו-−0.6 נקודות בהתאמה, תוצאה שבקנה אחד עם הטענה שאורתוגונליזציה של כיוון אחד כמעט אינה פוגעת ביכולת הכללית. קריאה לכלים, ראייה/OCR וחשיבה – כולם מדווחים כפועלים במבנה זה.
שני סייגים מרחפים מעל כל האמור לעיל. מדד הסירוב מגיע ממסווג מבוסס-כללים לפתיחות, שהכרטיס עצמו מכנה אינדיקטיבי ולא מספר ברמת שופט-LLM או ברמת פרסום — פאנל אנושי או מודל-שופט לא ישחזרו את הנתונים המדויקים הללו. וגם עמודת האזהרות חשובה: בחבילת ה-thinking-off, בערך מחצית עד שלושה רבעים מהפלטים של build זה עדיין נפתחים בהבהרה קצרה לפני שהם נענים. המודל ממעט לסרב; הוא מתחמק. המשמעות של "לא מצונזר" כאן היא שהוא עונה, לא שהוא עונה בלי פתיח.
סעיף הבטיחות אינו עניין פורמלי
קרא את זה לפני שתרים את המשקולות, לא אחרי.
למודל זה הוסר יישור הבטיחות שלו במידה ניכרת, והמנגנון ספציפי: כיוון סירוב יחיד הוערך בזרם השיורי (residual stream) והוצא באמצעות אורתוגונליזציה מכל מטריצת כתיבה שיורית — 149 כאלה — שחושבה ב-float32. התוצאה מפורסמת במפורש, לא מקרית. הכרטיס נוקט לשון בוטה: המודל ייענה לבקשות מזיקות, לא אתיות, פוגעניות או לא חוקיות שהמודל הבסיסי Qwen3.8-Flash-Next היה מסרב להן, ואין בו מנגנוני הגנה מובנים בעלי משמעות. הוא משוחרר אך ורק למחקר לגיטימי — פרשנות (interpretability), בטיחות בינה מלאכותית וחקר מנגנוני סירוב, רד-טימינג, הערכת עמידות וניסויים מבוקרים — והמשתמש נוטל על עצמו אחריות מלאה וחבות מלאה בגין מה שהוא מייצר. רישיון Apache 2.0 קובע מה מותר לעשות עם המשקולות.
שני דברים שצריך לדייק בהם, כי הבנייה הזו מקלה על טעות בהם.
ראשית, בדיקת פריצה (jailbreak) ש"מצליחה" נגד המודל הזה אינה הערכת בטיחות שעברה. זוהי ההתנהגות המפורסמת. אם הטענה של ההערכה שלך היא "בטיחות המודל הזה נעקפה," מדדת את העיצוב, לא פרצה. מה שהיה בפועל ממצא הוא סירוב ששורד את ה-abliteration, או רגרסיית יכולת — והמספרים בכרטיס מצביעים על כך ששניהם נדירים.
שנית, משטח התקיפה השמור רחב יותר מטקסט. מגדל הראייה נותר שלם בייט אחר בייט, וקריאת כלים עובדת, כך שהזנת תמונות ושימוש סוכני פעילים שניהם. תוכנית צוות אדום שבודקת רק הנחיות טקסט מפספסת את האופנים שהמודל הזה חושף בפועל. ומספרי הסירוב שלעיל הם מסווג מבוסס חוקים על העריכה של הספק עצמו — הם אינם ביקורת עצמאית על שום דבר, כולל בטיחות.
אל תפרוס זאת למשתמשי קצה או לסביבת ייצור מבלי להוסיף שכבות בטיחות, ניהול ומניעת שימוש לרעה משלך. תנאי המאגר אומרים זאת במפורש, וזו לא הצהרה שגרתית: הפלטים אינם משקפים את דעותיהם של המעלים או של Qwen / Alibaba.

איך להשיג קו בסיס מצונזר לשם השוואה
אם העבודה שלך היא מחקר על מנגנוני סירוב או red-teaming, כמעט בוודאות תרצה את הגרסה המצונזרת של המודל הזה לצד זו — אותה ארכיטקטורה ללא העריכה — כדי למדוד את ההפרש. בנייה לא-מצונזרת זו מיועדת לשימוש מקומי בלבד: המאגר מוגבל בגישה ואין בו פריסת inference מתארחת, וזאת במכוון, כך ש-payloads רגישים לעולם לא עוברים דרך API של צד שלישי.
לקו הבסיס המתארח, OrcaRouter מנתב את קו Qwen במחיר המחירון של הספק ללא תוספת מחיר — Qwen3.8-Flash ב-$0.15 למיליון טוקני קלט וב-$0.47 למיליון פלט, מועבר כמות שהוא, עם מעבר אוטומטי (failover) ומפתח אחד ל-200+ דגמים. שינוי מחיר של ספק מופיע באותו היום. אם אתה שוקל האם להריץ את הגרסה הזו בכלל, או כמה מהמחסנית שלך היא יכולה לשאת, זו הדרך הזולה להעמיד את הגרסה המצונזרת מולה בלי חוזה שני ובלי בסיס קוד שני.
התחל כאן
סיכום החלטה. אתה צריך: חשבון Hugging Face עם קבלת תנאי המאגר; צומת מסוג Hopper או חדש יותר — פקודת הכרטיס מיועדת ל-8 GPUs, ובסדר גודל של 265 GB של VRAM לפי הנחיות המתכון הרשמי עבור ה-checkpoint התואם מסוג FP8; תמונת ה-vLLM של יום 0 ו-transformers 5.16+; ובערך 186 GB של שטח דיסק עבור המשקלים.
סדר הרצה: קבל את תנאי המאגר → הורד את המשקלים → משוך את תמונת day-0 → הפעל שרת עם --enable-expert-parallel → ודא עם בקשה אל :8000/v1/chat/completions → ואז התחל את ההערכות שלך. אם טעינה נכשלת עם שגיאה שנראית כמו shape, בדוק את הדגל לפני שאתה בודק את ההורדה.
ושמרו על המסגרת. זהו כלי מחקר, ששוחרר בתנאי זה. המספרים שלו הם מדידות אינדיקטיביות של הספק עצמו על העריכה שלו. התנהגות הבטיחות שלו היא עיקר התרגיל, לא באג שצריך לעקוף. הגישו אותו, מדדו אותו, והציבו את המתינות שלכם בינו לבין כל דבר אנושי.
כל חמשת מבני ה-Flash-Next — BF16, GGUF, MLX, FP8 ו-NVFP4 — מרוכזים בתוךאוסף Qwen3.8-Flash-Next-Uncensored ב-Hugging Face.
דגם שונה, לא גרסה נוספת של זה: Qwen3.8-27B-Uncensored עבר אבליטרציה ממודל בסיס שונה ויש לו אוסף משלו ו-runbooks משלו.
המשקלים הללו הם מקומיים בלבד בעיצובם. עבור קו בסיס מתארח כדי למדוד מולו את הגרסה שעברה abliteration, Qwen3.8-Flash מוגש ב-OrcaRouter במחיר המחירון של הספק עם 0% תוספת — המודל הרגיל, עם יישור הבטיחות על כנו.
