כרטיס כותרת ראשי עבור Qwen3.8-27B-Uncensored-NVFP4, מבנה ה-NVFP4 של Qwen3.8-27B המסורס, המיועד לשרתי Blackwell, המציג את הכותרת 'Qwen3.8-27B-Uncensored-NVFP4' ואת כותרת המשנה 'מדריך שירות ל-GPUs של Blackwell' לצד אייקון שבב GPU עם תווית FP4, אייקון ברק של vLLM, מד חלון הקשר של 262K ואייקון מנעול סגור, עם הלוגו של OrcaRouter בפינה הימנית התחתונה.
Guides & Insights

Qwen3.8-27B-Uncensored-NVFP4: מדריך הפעלה להגשת מודלים על GPUs מסוג Blackwell

מחבר

Magnus Corvin

תאריך פרסום

מודלים אחרונים · 20צפו בכל המודלים
בנצ'מרקים: Artificial Analysis · מתעדכן יומית
חזרה לכל הפוסטים

Qwen3.8-27B-Uncensored-NVFP4 נמצא ב-Hugging Face מאז 19 באוגוסט 2026, ובמהלך עשרת הימים האחרונים הורד כ-32,700 פעמים. זו לא כתבת השקה — המשקלים בני עשרה ימים, אין הכרזה לדווח, והבניות האחיות Qwen3.8-27B-Uncensored-FP8 ו- Qwen3.8-27B-Uncensored-GGUF כבר מתועדות בבלוג זה. זהו מדריך הפעלה לבנייה שאנשים מורידים כרגע באופן פעיל: מה זה בעצם NVFP4, מדוע בנייה מסוימת זו מערבבת אותו עם FP8, אילו GPUs נהנים ואילו לא, כיצד לשרת אותה, ומי צריך לבחור בה על פני בניות FP8 או GGUF — ומי לא.

דבר אחד קודם, כי הוא מכשיל כל מוריד בפעם הראשונה: המאגר מוגבל. בפשטות, hf download orcarouter/Qwen3.8-27B-Uncensored-NVFP4 שורת הפקודה נכשלת עם שגיאת אימות עד שתתחבר ל-Hugging Face ותקבל את תנאי הגישה של המאגר בעמוד המודל. כל מה שלהלן מניח שעשית את שניהם.

וכמו כן, מלכתחילה: כרטיס המודל של המאגר הזה נמצא מאחורי אותו שער, כך ששום דבר כאן אינו מנסח אותו. מה שבא בהמשך מבוסס על רשימת הקבצים הציבורית ומטא-נתוני המאגר, על התיעוד הציבורי של NVIDIA לגבי NVFP4, ועל דיווחי שטח מאנשים שמפעילים גרסאות Qwen3.8-27B NVFP4 על Blackwell. כאשר מספר מגיע מאדם מהשטח ולא מספק, הטקסט מציין זאת.

A screenshot of the Hugging Face page for the gated orcarouter/Qwen3.8-27B-Uncensored-NVFP4 repo (captured August 29 2026), showing the access gate 'You need to agree to share your contact information to access this model', total downloads of 32,764, the apache-2.0 license, the BF16 / F8_E4M3 / U8 tensor types, and the abliterated, nvfp4, fp4, fp8, vllm and mixed-precision tags.

מהו ה-build הזה

Qwen3.8-27B-Uncensored-NVFP4 הוא קוונטיזציית NVFP4 של Qwen3.8-27B-Uncensored, הגרסה המאובליטרת של Ali​baba של Qw​en/Qwen3.8-27B שארגון orcarouter פרסם ב-2026-08-18. אבליטרציה מסירה את כיוון הסירוב של המודל מהרצף השיורי; טכניקה זו מוסברת במדריך המודלים הלא-מצונזרים שלנו ואינה מוסברת כאן שוב. הבסיס הוא ה-27B הדחוס עם תשומת לב היברידית — 48 שכבות תשומת לב לינאריות ועוד 16 שכבות תשומת לב מלאות — הבנה מולדת של תמונות ווידאו, הקשר של 262,144 טוקנים, וראש פענוח ספקולטיבי MTP מובנה. Apache 2.0 מקצה לקצה.

מה שהופך את הבנייה הזו למעניינת הוא לא ה-abliteration אלא פריסת הקוונטיזציה, כי היא בכוונה בנייה מקוונטטת — אם חיפשתם NVFP4, הפורמט הוא העיקר. לפי המטא-נתונים הציבוריים של הריפו ותצורת הקוונטיזציה, זוהי בניית compressed-tensors בעלת דיוק מעורב: הטלות הקשב הן FP8 (E4M3), ה-MLPs הן NVFP4 (4-bit, ארוז), ומקודד הראייה, ראש ה-MTP, ה-lm_head, והנורמות וההטיות של הקשב הליניארי נותרו ב-BF16. המטא-נתונים של safetensors ברשימת הקבצים הציבורית מתיישבים עם התכנית הזו: כ-3.5 מיליארד פרמטרים ב-BF16, 9.4 מיליארד ב-FP8-E4M3, ו-15 מיליארד בטנסורים הארוזים של 4-bit, כ-24.7 GB על הדיסק, על פני חמישה shards ועוד shard נפרד של model-extra. שום דבר מזה אינו טענה לגבי אופן ההגשה — צריכת ה-VRAM בזמן ריצה והתפוקה עבור הריפו המדויק הזה לא פורסמו בשום מקום שאוכל לצטט היום. הגודל על הדיסק נלקח מרשימת הקבצים, הפורמט נלקח מהתצורה, והתנהגות ההגשה להלן אומתה על ידי הקהילה על בניות NVFP4 קרובות.

מהו NVFP4, וכיצד הוא שונה מ-FP8 ומ-INT8/AWQ

NVFP4 הוא פורמט נקודה צפה של 4 סיביות של NVIDIA, שהוצג עבור ליבות הטנזור מהדור החמישי ב-Blackwell, והבלוג הטכני הרשמי של NVIDIA הוא המקור הראשוני הנכון עבורו. הוא מאחסן משקולות כ-E2M1 — סיבית סימן אחת, שתי סיביות מעריך, סיבית מנטיסה אחת — ומקנה להן קנה מידה בבלוקים: כל 16 ערכים חולקים קנה מידה FP8 מסוג E4M3, וכל הטנזור כולו מקבל סקלר FP32 לכל טנזור. התכנית הדו-מפלסית הזו היא כל עיקרו של הפורמט: היא משחזרת את טווח הדינמי שפורמט float פשוט של 4 סיביות היה מאבד, במחיר של כמה סיביות תקורה לכל בלוק. ההבדלים המעשיים, בצורה של שורה אחת:

NVFP4 לעומת FP8 — שניהם הם נקודה צפה, אבל FP8 (E4M3, 8-bit) פועל על Hopper ו-Blackwell, בעוד NVFP4 הוא 4-bit ומואץ רק בצורה מקורית על Blackwell. NVIDIA מציינת משקלים קטנים בערך פי 3.5 מ-FP16 ובערך פי 1.8 מ-FP8, ועל Blackwell מכפלת המטריצות רצה ישירות על ליבות Tensor Core FP4.

NVFP4 לעומת INT8/AWQ — INT8 (W8A8) ו-AWQ (W4A16) הם פורמטים של מספרים שלמים שפועלים החל מ-Ampere ואילך; AWQ הוא 4-bit, אבל הוא פורמט שלם, וברוב החומרה המשקולות עוברות דה-קוונטיזציה לסוג רחב יותר עבור פעולת ה-matmul. NVFP4 הוא פורמט נקודה צפה (float) ב-4-bit עם סקיילינג בלוקים, כך שהוא שומר על דיוק רב יותר בביטים הנמוכים, ויש לו נתיב FP4 GEMM מקורי שאין בפורמטים השלמים.

NVFP4 vs MXFP4 — השניים מתבלבלים כל הזמן. MXFP4 משתמש בבלוקים של 32 אלמנטים ובסקאלות E8M0 (חזקות של שתיים); NVFP4 משתמש בבלוקים של 16 אלמנטים ובסקאלות E4M3. הבלוקים העדינים יותר נותנים ל-NVFP4 בידוד חריגים טוב יותר, ולכן הפורמט הוא התקן הדה-פקטו של 4 ביט במערכות השרתים של בלקוול.

A two-column scoreboard titled 'NVFP4 vs FP8 — the format scoreboard', comparing NVFP4 (4-bit float E2M1, native FP4 GEMM on Blackwell, not accelerated on Hopper, this uncensored build ~24.7 GB on disk, ~3.5x smaller than FP16, best pick on Blackwell for the smallest footprint) against FP8 (8-bit float E4M3, native FP8 GEMM, full Hopper support, this uncensored build ~30.9 GB on disk, ~1.8x smaller than FP16, best pick on Hopper for max fidelity), with a footer line 'Format facts per NVIDIA; build sizes from public file listings.' and the OrcaRouter logo bottom-right.

איזו חומרה מרוויחה — ואיזו לא

העובדה החשובה ביותר בנוגע לבנייה הזו: NVFP4 הוא פורמט של Blackwell. הוא מצדיק את מקומו רק אצל GPUs שליבות הטנזור שלהם מיישמות FP4 GEMM באופן מובנה, ובכל דבר אחר הוא הכלי הלא נכון, לא משנה כמה מהירה המכונה על הנייר.

Blackwell — RTX 50-series, B200/B300, RTX PRO 6000, DGX Spark (GB10) — כאן NVFP4 הוא הבחירה הנכונה: ליבות טנזור FP4 מקוריות, טביעת הרגל הקטנה ביותר ברמת שרת בקו הלא־מצונזר, והפורמט שהבנייה נועדה עבורו.

Hopper — H100/H200 — אין FP4 GEMM מקורי. NVFP4 יורד לנתיב dequant של משקל בלבד, שהוא איטי יותר ואינו מועיל כלל. השתמש ב-Qwen3.8-27B-Uncensored-FP8 כאן; הגרסה הזו אומתה על חומרה זו בדיוק.

Ampere/Ada — RTX 3090/4090 — NVFP4 לא מאיץ גם על אלה. בניית GGUF, ברמת Q4_K_M של 16.8GB, היא הכלי הנכון לכרטיס של 24GB.

Apple Silicon — NVFP4 לא רלוונטי במק. ה-build של MLX (או GGUF) הוא זה שרץ.

הערה כנה אחת: פורקים קהילתיים אכן מריצים NVFP4 במשקל בלבד על חומרה שקדמה ל-Blackwell. בניית NVFP4 קהילתית של אותו מודל abliterated מוגדרת במפורש לכרטיסים מסוג V100 באמצעות פורק vLLM מתוקן, והמתכונים האחרונים של DGX Spark סביב Qwen3.8-27B הם עניין בפני עצמו. אלה מסלולים ייעודיים עם הסתייגויות משלהם, ובנייה זו אינה מכוונת אליהם. אם אתה על Blackwell, שום דבר מזה לא משנה; אם אתה לא על Blackwell, בניית FP8 או GGUF היא ההורדה הטובה ביותר.

איך להגיש את זה

הריפו מתויג עבור vLLM, ופורמט ה- compressed-tensors נקרא אוטומטית מ-config.json — אין צורך לבחור ידנית סכמת קוונטיזציה. מחסנית הטכנולוגיות שהמתרגלים מתכנסים עליה לבני NVFP4 של Qwen3.8-27B היא vLLM עדכני על כרטיס Blackwell, מטמון KV מסוג FP8, וראש ה-MTP של המודל עצמו המשמש לפענוח ספקולטיבי. המדריך של Unsloth ל-NVFP4, שהוא הפניה הקהילתית המצוטטת ביותר, ממליץ על vLLM 0.25.0 ומעלה עם FlashInfer ותלות ליבת CUTLASS-DSL לנתיב ה-FP4 המהיר.

נקודת התחלה עובדת, שהורכבה מהדגלים המאומתים של ה-build שלנו ב-FP8 ומהמתכונים של קהילת NVFP4, הכל בשורה אחת:

vllm serve orcarouter/Qwen3.8-27B-Uncensored-NVFP4 --kv-cache-dtype fp8 --max-model-len 262144 --reasoning-parser qwen3 --enable-auto-tool-choice --tool-call-parser qwen3_coder --speculative-config '{"method": "mtp", "num_speculative_tokens": 3}'

FP8 KV cache — הדרך התואמת ביותר להפחתת זיכרון המטמון בחצי; משתמשים מדווחים שהיא בערך מכפילה את טווח ההקשר שתוכלו להחזיק. תמיכה במטמון KV מסוג NVFP4 קיימת, אך מוגבלת לחלק ממנועי הקשב, ולכן FP8 KV הוא ברירת המחדל הבטוחה יותר.

פענוח ספקולטיבי MTP — המודל מגיע עם ראש הצעה MTP, והקוונטיזציה שומרת עליו ב-BF16. אנשי מקצוע מדווחים ששניים עד שלושה טוקני הצעה עובדים היטב עם משקלי NVFP4 על Blackwell, כשהיתרונות הגדולים ביותר הם בפלט מובנה כמו JSON וקריאות לכלים.

ראייה — מקודד הראייה נשמר ב-BF16 במבנה זה. הוסף --language-model-only כדי לשרת טקסט בלבד; השמט אותו אם אתה צריך קלט תמונה או וידאו.

ב-DGX Spark — כמה בעיות שדווחו מהשטח: יש להשאיר את --gpu-memory-utilization על 0.90 או פחות (ערכים גבוהים יותר גרמו למכונה להיתקע במהלך טעינת המשקולות), ולהוסיף את --safetensors-load-strategy lazy אם הזיכרון מוגבל. כמו כן, תזדקק ל-build מסוג GB10 של vLLM עבור ליבות ה-sm_121a.

האמת על הביצועים: אין נתוני תפוקה עצמאיים שפורסמו עבור המאגר הספציפי הזה. המדידות הקיימות הן עבור גרסאות NVFP4 קרובות. Unsloth מדווחת על פי 1.41–1.49 מתפוקת הטוקנים לשנייה של BF16 על B200 עבור גרסת ה-Qwen3.8-27B-NVFP4 שלה (89.8 עד 133.7 tok/s ב-batch 1, ו-3,048 עד 4,407 ב-batch 64), ומשתמש DGX Spark אחד בפורומים של NVIDIA מדווח על כ-20–32 tok/s עם משקלי NVFP4, מטמון KV מסוג FP8 ועומק MTP 3. שניהם ראויים לציטוט; אף אחד מהם אינו benchmark של המאגר הזה.

דפוסי שימוש שבאמת עובדים

מתרגלים שמפעילים מודלים ממשפחת Qwen3.8-27B על Blackwell מתכנסים לכמה הגדרות. יש להתייחס לאלה כדיווחי שטח, לא כהנחיות ספק — Qwen אינה מתעדת את רוב זה, והכרטיס של המאגר עצמו מוגבל.

reasoning_effort הוא החוגה שהכי חשובה.ברירת המחדל xhigh גורמת למודל לחשוב זמן רב על כל בקשה. אנשים שמפעילים לולאות סוכן מגדירים medium כברירת מחדל ומורידים ל-low — או משביתים את החשיבה לגמרי עם enable_thinking: false — עבור קריאות בודדות רגישות לזמן אחזור. על GPU יחיד מסוג Blackwell, חשיבה ברמת xhigh על משימה שגרתית היא הדרך שבה אתה מקבל מודל מהיר ותשובות איטיות.

הדוגמים מזווגים עם מצב החשיבה, לא עצמאיים.קונצנזוס הקהילה: כשמצב החשיבה דלוק, הרצה בטמפרטורה 1.0 / top_p 0.95; כשמצב החשיבה כבוי, הרצה בטמפרטורה 0.7 / top_p 0.80 עם presence_penalty 1.5. החלפת שני הסטים פוגעת באיכות הפלט.

השתמשו בתבנית צ’אט עדכנית. תבנית qwen3_5 עוטפת כל תור של עוזר בבלוק חשיבה, ומתרגלים רבים מדווחים על תשובות חוזרות או קטועות עם תבניות ישנות; הגרסאות Qwen-Fixed-Chat-Templates ו-Qwen-Sharp המתוקנות על ידי הקהילה קובעות את preserve_thinking ועוצרות את הלולאות. אם הפלט המוגש שלך גולש מעבר לאסימון העצירה, זה הדבר הראשון שצריך לבדוק.

תקציב לעקבות חשיבה ארוכות בעבודת סוכן. מתרגלים מדווחים שמודל הדור 3.8 פולט בערך פי שניים אסימונים למשימה מקודמו בדור 3.6 — הקפיצה באיכות נובעת בחלקה מחשיבה ארוכה יותר. לתשובות xhigh ארוכות, הזרם את פלט החשיבה או שתיתקל בפסקי זמן של שער.

קריאת כלים נותרת שלמה במהלך הקוונטיזציה.נתיב קריאת הפונקציות שורד הן את ה-abliteration והן את ההמרה ל-4 ביט; הפעל אותו עם מנתח קריאות הכלים של qwen3_coder והמודל בוחר כלים באותה דרך כמו דגם הבסיס.

A screenshot of the Artificial Analysis page for Qwen3.8 27B (medium) (captured August 29 2026), showing an Intelligence score of 44, a speed of 52.3 tokens per second, the comparison summary paragraph, $0.50 per 1M input and $3.00 per 1M output token pricing, and a 256k-token context window.

מי צריך לבחור את המבנה הזה — ומי לא

ההחלטה הכנה, מבלי לחזור על המתמטיקה של בחירת הקוונטיזציה שהפוסטים שלנו על FP8 ו-GGUF כבר מכסים בפירוט:

בחר ב-NVFP4 אם אתה משרת על Blackwell ורוצה את טביעת הרגל הקטנה ביותר ברמת שרת בקו הלא-מצונזר עם מהירות FP4-tensor-core — ואתה עושה מחקר, עבודת red-team או interpretability שזקוקה באופן לגיטימי למודל abliterated.

בחר ב-Qwen3.8-27B-Uncensored-FP8 אם אתה על Hopper, או שאתה רוצה את הנתיב המאומת ביותר של vLLM — אלה הם אותם משקלים ב-8-bit, מאומת על H200, עם סף של כ-40 GB VRAM.

בחרו ב-Qwen3.8-27B-Uncensored-GGUF אם יש לכם GPU לצרכן או Mac, או שאתם רוצים llama.cpp במקום vLLM — דרגת Q4_K_M היא הנקודה האופטימלית לשימוש מקומי.

אל תבחר באף אחד מהם אם אתה רוצה נאמנות מירבית, אתה בונה משהו שפונה למשתמשים (ראה את גבול הבטיחות להלן), או שאינך רוצה לארח בעצמך כלל — אותה שורה ללא צנזורה מוגשת דרך OrcaRouter המוגבל לחוקרים, כך שלא נדרש GPU.

גבול הבטיחות — מחקר בלבד

זהו מודל שעבר אבליטרציה (הסרת סירוב), והגרסה המכוונטת (quant) אינה מחזירה את מנגנוני הבטיחות. כיוון הסירוב הוסר מזרם השארית (residual stream) של Qw​en/Qwen3.8-27B, ו-NVFP4 הוא שינוי דיוק, לא התערבות בטיחותית — המודל ייענה לבקשות שהמודל הבסיסי מסרב להן, ולגרסה זו אין מודרציה מובנית. הוא משוחרר למחקר פרשנות (interpretability), בטיחות AI ומחקר red-team תחת רישיון Apache 2.0, והאחריות היא עליך.

שתי הערות הערכה שעולות לעתים רחוקות מדי בתחום המודלים הלא-מצונזרים. ראשית, בדיקת פריצה בודדת שעוברת בקלות אינה הערכת בטיחות עוברת — מודלים שעברו אבלציה נכשלים בכוונה בבדיקות כאלה. מדוד את מה שבאמת חשוב לך עם סוללות הבדיקות המתאימות (AdvBench, HarmBench ו-StrongREJECT לבדיקת מזיקות; XSTest-safe לבדיקת סירוב-יתר) והשווה את שיעורי הסירוב לפני ואחרי ההתערבות. שנית, הערך את הקוונטיזציה, לא רק את המודל הבסיסי: בנייה של 4-bit יכולה לשנות התנהגות במקרי קצה גם כשהציונים המצטברים נראים בסדר. אל תפרוס את זה למשתמשים קצה ללא שכבות אבטחה ומניעת שימוש לרעה משלך.

היכן OrcaRouter מתאים

build מכומת שגילו עשרה ימים הוא המקרה המובהק לניתוב במקום חיווט ישיר. אפשר להקים נתיב שמצביע על ה-build של NVFP4 שאתה מריץ בעצמך, ולעבור למודל מתארח כגיבוי אם ה-build מתנהג לא כראוי תחת עומס — ממשק אחד, בלי חיווט מחדש בין ספקים כשאתה מחליף. OrcaRouter מעביר את מחיר המחירון של הספק בתוספת 0%, כך שאם מחיר המודל הבסיסי משתנה, ה-endpoint שלך משקף זאת באותו היום במקום במחזור החיוב שלך.

ואם כל הנקודה היא להימנע מהרצת GPU לחלוטין: אותה שורה ללא צנזורה זמינה דרך OrcaRouter, מוגבלת לחוקרי אבטחה וצוותי אדום, עם מעבר אוטומטי בין ספקים. בין אם תארח בעצמך את ה-build הזה של NVFP4 או תשתמש בקו המאוחסן, זה מפתח API אחד בכל מקרה.

השורה התחתונה

Qwen3.8-27B-Uncensored-NVFP4 הוא ההורדה הנכונה אם אתה משרת את המודל המנוטרל (abliterated) על Blackwell ורוצה את טביעת הרגל הקטנה ביותר עם מהירות FP4-tensor-core. זו ההורדה הלא נכונה אם אתה עובד על Hopper (השתמש במבנה FP8), על GPU צרכני או של Apple (השתמש במבנה GGUF או MLX), או אם אתה צריך נאמנות מקסימלית. זה לא חדש — הוא זמין להורדה מאז 19 באוגוסט 2026 — אבל הוא מורד בכמויות גדולות, ועכשיו אתה יודע למה אתה נכנס לפני שאישרת את השער.

לא עוד גרסה של המודל הזה — Qwen3.8-Flash-Next-Uncensored היא גרסה נפרדת: עברה אבליטרציה מ-Qwen3.8-Flash-Next, תצוגה מקדימה של תמהיל מומחים עם 176B מאוחסנים / 6B פעילים של ארכיטקטורת Qwen4. אותה טכניקת אבליטרציה, משקלים שונים, אוסף משלו.

כל שש גרסאות ה-27B — BF16, GGUF, MLX, FP8, INT8 ו-NVFP4 — נאספות באוסף Qwen3.8-27B-Uncensored ב-Hugging Face.

משקלים אלו נועדו להיות מקומיים בלבד. כדי שיהיה בסיס אירוח שניתן למדוד מולו את הגרסה ה-abliterated, Qwen3.8-27B מוגש ב-OrcaRouter במחיר המחירון של הספק ללא תוספת מחיר — הדגם המקורי, עם יישור הבטיחות על כנו.

© 2026 OrcaRouter

לספקים

מפעילים פלטפורמת הסקה (inference)? הציגו את המודלים שלכם ב-OrcaRouter.

providers@orcarouter.ai

הצטרפו לקהילה שלנו

Discordsupport@orcarouter.aiXGitHubYouTube