כרטיס כותרת ראשי למאמר 'Qwen3.8-Flash-Next-Uncensored-NVFP4: A Blackwell Serving Runbook', המציג את הכותרת הראשית, את כותרת המשנה 'A Blackwell Serving Runbook — NVFP4 experts, FP8 attention, BF16 PLE', וארבעה שבבי מפרט: 'Blackwell בלבד — ליבות FP4 טנסור', '330 GB → 178 GB', 'בקרת גישה ב-Hugging Face' ו-'262K הקשר', עם לוגו OrcaRouter משולב בפינה הימנית התחתונה.
Guides & Insights

Qwen3.8-Flash-Next-Uncensored-NVFP4: מדריך תפעול להגשת Blackwell

מחבר

Gideon Frost

תאריך פרסום

מודלים אחרונים · 20צפו בכל המודלים
בנצ'מרקים: Artificial Analysis · מתעדכן יומית
חזרה לכל הפוסטים

Qwen3.8-Flash-Next-Uncensored-NVFP4רץ על משפחת GPU אחת בדיוק: Blackwell. NVFP4 רץ על ליבות Tensor FP4 בחומרה, ול-Hopper (H100/H200) ולכל דבר ישן יותר פשוט אין את הליבות האלה. אם אתה על Hopper, עצור כאן — ה-Qwen3.8-Flash-Next-Uncensored-FP8 build הוא זה שאתה רוצה. כל מה שלהלן מניח Blackwell (B100, B200, GB200, או כרטיס מסדרת RTX 50), build עדכני של vLLM עם תמיכה ב-qwen4_exp, ו-transformers ≥ 5.16.

זוהי קוונטיזציית ה-NVFP4 של הבנייה המנוטרלת (נטולת-הסירוב) של Qw​en, Qw​en/Qwen3.8-Flash-Next, מוקטנת מ-330 GB ב-BF16 ל-178 GB על הדיסק. OrcaRouter פרסם אותה ב-Hugging Face ב-27 באוגוסט 2026 בשם orcarouter/Qwen3.8-Flash-Next-Uncensored-NVFP4. המאגר מוגבל: עליך להיות מחובר ל-Hugging Face ולקבל את תנאי המאגר, או hf download ו-vllm serve orcarouter/Qwen3.8-Flash-Next-Uncensored-NVFP4 שניהם נכשלים בשגיאת אימות לפני שמועבר ולו בית אחד. הדף הזה הוא ספר נוהל להגשה, לא סיקור השקה — הבנייה בת יומיים, והשאלות שבאמת נתקלים בהן הן חומרה, דגלים, ואיזו בנייה לבחור.

A screenshot of the Hugging Face page for the gated orcarouter/Qwen3.8-Flash-Next-Uncensored-NVFP4 repo (captured August 29 2026), showing the gate banner 'You need to agree to share your contact information to access this model', 'Login or Sign Up to review the conditions', Model size 125B params, tensor types F8_E4M3 · BF16 · U8 · I64, the apache-2.0 licence, the base-model line Qwen/Qwen3.8-Flash-Next, and the abliterated, uncensored, nvfp4, fp4, fp8, vllm and vision-language tags.

ולפני שהמספרים מתחילים: Qwen3.8-Flash-Next-Uncensored אינו Qwen3.8-27B-Uncensored. מדובר בשני מודלים שונים שחולקים שם משפחה וטכניקת abliteration — משקלי בסיס שונים, ארכיטקטורות שונות ואוספים שונים ב-Hugging Face. Flash-Next עבר abliteration מ-Qw​en/Qwen3.8-Flash-Next, תצוגה מקדימה מנותבת מסוג mixture-of-experts של ארכיטקטורת Qwen4 (qwen4_exp): 512 מומחים, עשרה מנותבים ומומחה משותף אחד פעיל, attention היברידי (שכבות ליניאריות מסוג Gated DeltaNet לצד שכבות full-attention), Hyper-Connections, הטמעת n-gram מסוג PLE, מגדל ויז'ן ווידאו מובנה וראש ניבוי ספקולטיבי מסוג MTP. גרסת ה-27B עברה abliteration מ-Qw​en/Qwen3.8-27B, בסיס dense שונה לחלוטין. שום דבר ממספרי ה-serving של עמוד ה-27B אינו עובר למודל הזה; היכן שעמוד ה-27B באמת מועיל — המדריך ל-abliteration, המתמטיקה הכללית לבחירת קוונטיזציה — הוא מקושר למטה, כולל מה שכן ומה שלא עובר.

A scoreboard card for Qwen3.8-Flash-Next-Uncensored-NVFP4 with six rows: base model Qwen/Qwen3.8-Flash-Next (Qwen4 preview), access gated (HF login + accepted terms), precision NVFP4 experts - FP8 attention - BF16 PLE, on-disk size 178 GB from 330 GB BF16, KV cache BF16 (not quantized), hardware Blackwell only (FP4 tensor cores); footer reads 'All figures from the orcarouter model card, August 29 2026 - self-reported, not independently audited.'

מה זה הבילד הזה, דיוק אחרי דיוק

Qwen3.8-Flash-Next הוא MoE מנותב: כל טוקן מפעיל 10 מתוך 512 מומחים ועוד מומחה משותף אחד, ורק כמה מיליארדי פרמטרים פעילים לכל טוקן, אף על פי שהמודל המאוחסן גדול בהרבה. בניית NVFP4 היא קוונטיזציה מעורבת-דיוק של הערימה הזו באמצעות compressed-tensors, והחלוקה היא כל הסיפור:

• משקלי מומחה MoE — NVFP4 (4-bit, NVIDIA FP4 E2M1, group-16 עם סקלות בלוק FP8).

• קשב (self_attn.{q,k,v,o}), ההיטלים של linear_attn, המומחה המשותף, ו-lm_head — FP8 (8 ביט).

הטמעת n-gram של PLE, הטמעות טוקן וויז׳ן, Hyper-Connections, אינדקסר ה-QSA, conv/dt של Gated-DeltaNet, כל הנורמות, וכל מגדל הראייה — BF16, נשמרים בדיוק מלא.

שלוש תכונות של ההמרה חשובות יותר מעצם פיצול הדיוק. ראשית, היא מבוססת-משקלים בלבד (weight-only): האקטיבציות מקוטבות דינמית בזמן ריצה, אין כיול סטטי, והמשקלים נגזרים ישירות מהצ'קפוינט של BF16 (הכרטיס מכנה את הגזירה data-free). שנית, עריכת ה-abliteration מובנית במשקלים, ולכן הסרת הסירוב שורדת את הקוונטיזציה — המרה של 4-bit היא שינוי דיוק, לא התערבות בטיחותית. שלישית, מטמון ה-KV אינו מקוטב; הוא נשאר BF16 בזמן ריצה. את הנקודה האחרונה קל לפספס, והיא חשובה בהקשר המקורי של 262,144 טוקנים של המודל, שבו מטמון ה-KV הוא סעיף זיכרון אמיתי לצד המשקלים.

גודל הקובץ על הדיסק נשלט על ידי טנזור אחד. הכרטיס מתאר את ה-embedding של n-gram מסוג PLE כטנזור יחיד עם כ-66B פרמטרים, שנשמר ב-BF16 לפי עיצוב; הוא ה-shard הגדול ביותר והסיבה שהבנייה היא 178 GB במקום מספר קטן יותר. יש אי-התאמה אחת שכדאי לציין ולא לטאטא תחת השטיח: כרטיס האחות FP8 קורא לאותה טבלה בשם PLE n-gram עם 51B פרמטרים, וההערה W4A4 של כרטיס זה מתייחסת אליה כ-~100 GB. שני הכרטיסים מציגים מספרים שונים עבור אותה טבלה, אז התייחס לכל אחד כמספר של הכרטיס שלו — וכשאתה מתכנן גודל פריסה, הנח שהטבלה גדולה ב-BF16 ותכנן בהתאם.

התנאי המוקדם החומרתי, במפורט

זהו הקטע הקצר והחשוב ביותר בדף. NVFP4 הוא פורמט של Blackwell: הנתיב המהיר הוא GEMM בפורמט FP4 מקורי על ליבות הטנזור מהדור החמישי, וללא החומרה הזו, לפורמט אין על מה לרוץ. שורת הדרישות של הכרטיס עצמו מפורשת — GPU של Blackwell (B100 / B200 / GB200 / סדרת RTX 50), מכיוון ש-NVFP4 משתמש בליבות הטנזור FP4 החומרתיות, והוא לא ירוץ על Hopper (H100/H200) או על דורות ישנים יותר, שחסרה להם יכולת חישוב FP4.

ההפניות, במקום אחד:

• ב-Hopper (H100/H200) — הגש במקום זאת את Qwen3.8-Flash-Next-Uncensored-FP8. אלו הם אותם משקלים ב-8-bit, הוא רץ על Hopper ו-Blackwell, וזו הגרסה שמדריך ה-FP8 של הבלוג הזה מכסה.

• על GPU של NVIDIA לצרכן או על מחשב CPU — בניית ה-GGUF, עם 13 הקוונטים של llama.cpp, הוא הנתיב המקומי.

• ב-Apple Silicon — גרסת ה-MLX, בדרגות 4/6/8-bit, היא נתיב ה-Metal המקורי.

דרישת זמן הריצה מחייבת בדיוק כמו הסיליקון. qwen4_exp היא ארכיטקטורה חדשה לגמרי, ולכן גרסאות vLLM רגילות שקדמו לה יסרבו לטעון את נקודת הביקורת. אתה צריך vLLM עדכני עם תמיכה ב-qwen4_exp, כמו גם קורא NVFP4 של compressed-tensors (הפורמט מזוהה מ-config.json, ולא נבחר ידנית), ו-transformers ≥ 5.16. קלט מולטימודלי דורש בנוסף את ערימת הראייה של Qw​en של זמן הריצה; שירות טקסט בלבד עובד בלעדיה.

פקודת ה-serve של הכרטיס, דגל אחר דגל

ההפעלה של כרטיס המודל עצמו היא נקודת התחלה טובה, וכדאי להבין לשם מה משמש כל דגל במקום להעתיק-להדביק בלי לחשוב:

vllm serve orcarouter/Qwen3.8-Flash-Next-Uncensored-NVFP4 --tensor-parallel-size 4 --trust-remote-code --enable-expert-parallel --enable-auto-tool-choice --tool-call-parser qwen3_coder

--tensor-parallel-size 4 — משקלי המודל הם כ-178 GB על הדיסק, כך שהכרטיס מפצל אותם על פני ארבעה GPUs. זו הצורה שהבנייה מותאמת לה; אל תקרא את זה כהצעה.

--trust-remote-code— נדרש לארכיטקטורה מותאמת אישית. קוד המודל של qwen4_exp עדיין לא נמצא ברישום הסטנדרטי של transformers, ולכן vLLM טוען את קוד הארכיטקטורה מהמאגר. אתה נותן אמון בקוד הזה, שזו החלטה נורמלית אבל אמיתית עבור ארכיטקטורה חדשה לגמרי.

--enable-expert-parallel — מפצל את המומחים בין דרגות ה-tensor-parallel במקום לשכפל אותם, וזה מה שהופך MoE עם 512 מומחים לבר-ביצוע ב-TP4. כרטיס האחות FP8 מציין את הנימוק החד יותר במבנה הזה: בלעדיו, רוחב הביניים של ה-MoE חלקי TP אינו מתחלק בגודל הבלוק של FP8. התייחס אליו כאל חובה, לא כאופציה.

--enable-auto-tool-choice ו- --tool-call-parser qwen3_coder — יחד הם מפעילים קריאות פונקציות. הדגל auto מאפשר למודל להחליט אם לקרוא לכלי, והמפענח qwen3_coder מפענח את פורמט קריאת הכלים שלו, אותה משפחת מפענחים שמשרתת את Qwen3.8-27B ו-Qwen3.8-Flash-Next.

ברגע שהוא פעיל, נקודת הקצה התואמת OpenAI בכתובת /v1/chat/completions מציעה את מכלול התכונות המלא דרך מחסנית Qwen4 של סביבת הריצה: קריאת כלים כפי שתואר לעיל, חשיבה באמצעות chat_template_kwargs.enable_thinking, וראייה באמצעות חלקי תוכן image_url. אין צורך בשרת נפרד למולטימודאלי; זו אותה נקודת קצה.

הערה מבנית אחת מהכרטיס: אין וריאנט W4A4 סטטי לחלוטין של ה-build הזה, ולא הולך להיות אחד כזה בזול. המרה סטטית ל-W4A4 דורשת מעבר קדימה לכיול הפעלות (activation-calibration), והמעבר הזה חייב להחזיק את אמבדינג ה-n-gram בגודל ~100 GB על GPU יחיד. זו אותה סיבה שטבלת PLE שולטת ברשימת הקבצים, וזו הסיבה שה-build הזה נשאר עם משקלים בלבד (weight-only) והפעלות דינמיות.

דיווחי שטח מהקהילה — איך נראה בפועל השירות הזה.

לא פורסמו נתוני תפוקה או השהיה עבור מאגר מדויק זה, ודף זה לא ימציא אותם. מה שכן קיים הוא קבוצה הולכת וגדלה של דיווחי שטח ממתרגלים המשרתים את גרסאות ה-Qwen3.8-Flash-Next NVFP4 הבסיסיות — אותה ארכיטקטורה, אותו פיצול דיוק NVFP4/FP8/BF16, ללא עריכת ה-abliteration — והתנהגות השירות עוברת ישירות. אלו ממצאים של הקהילה, לא הנחיות ספק, והאנשים שדיווחו עליהם השתמשו בחומרת Blackwell עם אותה סכמת קוונטיזציה.

פענוח ספקולטיבי של MTP הוא מנוף הביצועים הגדול ביותר. המודל כולל ראש טיוטה לניבוי מרובה-טוקנים, ועל כרטיס RTX PRO 6000 אחד (96 GB, SM120) מודול ה-MTP נטען בצורה מקוונטטת ל-NVFP4 בכ-0.51 GB של VRAM — הדוח מדד אורך קבלה של 2.3–3.9 מתוך מקסימום 4 ושיעור קבלה של 0.86–0.96. אותו דוח מדד חציון פענוח בזרם יחיד של 180–226 טוק/שנייה (216.9 בקוד, 225.8 בעומס עבודה של קריאות לכלי סוכן, 136.6 בחשיבה) לעומת קו בסיס של כ-105 טוק/שנייה, וענה על הנחיה של 216,685 טוקנים תוך 8.4 שניות. יש להתייחס למספרים כאל מחשב של אדם אחד, לא כמפרט.

העבר את הטמעת ה-n-gram של PLE ל-RAM של המארח. מכיוון שהטבלה ענקית ולעתים רחוקות מהווה צוואר בקבוק לתפוקה, מתכונים מהקהילה בכרטיסי Blackwell יחידים מצמידים אותה למארח (~50 GiB של זיכרון RAM פנוי במארח בדוח RTX PRO 6000) וממפים אותה מ-NVMe, תוך הקרבת מעט חביון בתמורה ליכולת להפעיל את המודל בכלל. צפו שתצטרכו לעשות משהו כזה אלא אם כן יש לכם תקציב VRAM גדול מאוד.

נעץ את חלון ההקשר במפורש. עם מטמון KV ב-BF16 ו-MTP פעיל, מאגר KV בגודל אוטומטי תפח מעבר למה שהכרטיס יכול להכיל וגרם ל-OOM בעיבוד מקדים ארוך; קיבוע max-model-len / max-total-tokens ל-262144 החזיר את המרווח. בהקשר של 262K, מטמון ה-KV הוא סעיף תקציבי שמתכננים עבורו, לא ברירת מחדל.

באג בכיוונון האוטומטי של FlashInfer משחית בשקט את הפלט. מצב הכשל החשוב ביותר בשטח: הכיוונון האוטומטי בוחר טקטיקות ליבת MoE מאוחדת לפי זמן השהיה בלבד ולעולם לא בודק ערכים נומריים, ולכן בצורות מסוימות הפענוח קורס לאסימון חוזר. דוח ה-RTX PRO 6000 שחזר את זה כ-36 מתוך 36 פלטים שהושחתו עם כיוונון אוטומטי פעיל, ו-0 מתוך 36 כשהוא כבוי — הפתרון הוא להשבית את הכיוונון האוטומטי של FlashInfer (ב-vLLM: --no-enable-flashinfer-autotune; ב-SGLang: --disable-flashinfer-autotune). אם הפלט המוגש שלך מתדרדר פתאום, בדוק את זה לפני שאתה נוגע בכל דבר אחר.

DGX Spark (GB10, SM121) זקוק לפאצ'ים משלו. משקלי NVFP4 (~126 GiB בגרסת הקהילה) אינם נכנסים ל־Spark אחד של 128 GB, לכן מתכוני SGLang מריצים tensor-parallel 2 על פני שני צמתים דרך RoCE, ורזולבר ה־sparse-decode של QSA נועל את קרנל ה־FlashInfer המהיר מאחורי בדיקת is_sm100_supported() שנכשלת על SM121, מה שמוביל לנפילה לנתיב שקורס בזמן ה־warmup — התיקון הוא פאץ' קטן בתוספת PLE offload. צפו לקצב decode של ~47–50 tok/s, כשהשיא מגיע לקרוב ל־70 עם MTP4 ו־CUDA graphs, וודאו שהקרנל שלכם אכן רץ על SM121 לפני שתבטיחו benchmark.

חשיבה, קריאה לכלים וראייה דרך מחסנית Qwen4

הקונצנזוס הקהילתי בנוגע לדור Qwen3.8 עובר גם לדגם זה, עם האזהרה הרגילה שמדובר בפרקטיקה שדית, לא בהנחיית ספק.

reasoning_effort היא החוגה החשובה ביותר. תבנית הצ'אט מוגדרת כברירת מחדל ל-xhigh, מה שגורם למודל לחשוב באריכות על כל בקשה. מפעילי Agent-loop מגדירים medium כברירת מחדל ומורידים ל-low עבור קריאות רגישות לשהייה; enable_thinking false משבית את החשיבה לחלוטין כאשר אין צורך בה. על כרטיס Blackwell יחיד, השארת xhigh פועל עבור קריאות שגרתיות היא הדרך שבה מודל מהיר מייצר תשובות איטיות.

צמדו דוגמים עם מצב חשיבה. בקרב אנשי המקצוע נהוג להשתמש בטמפרטורה של 1.0 ו-top-p של 0.95 כאשר מצב החשיבה מופעל, ובטמפרטורה של 0.7 ו-top-p של 0.80 עם ענישת נוכחות של כ-1.5 כאשר הוא כבוי. ערבוב בין שתי הקבוצות פוגע באיכות הפלט.

קריאת כלים שורדת גם את ה-abliteration וגם את ההמרה ל-4-bit. נתיב קריאת הפונקציות שלם, וזה מה שה-parser של qwen3_coder ודגלי ה-auto-tool-choice מחברים. עבור צוות אדום, זו עובדה שהיא חרב פיפיות, כיוון שזה אומר ששימוש לרעה סוכני פעיל במלואו במודל לא מיושר — מכוסה להלן.

הראייה נשמרת, וזה מרחיב את משטח ההתקפה. מגדל הראייה מעולם לא עבר את האבליטרציה ונשאר ב-BF16, ולכן קלט תמונה עובד דרך חלקי תוכן image_url. אלה שמעריכים את הקו הלא־מצונזר מתייחסים לנתיב הרב־מודאלי כיעד הערכה מדרגה ראשונה: הזרקת הנחיה הנישאת בתוך תמונה נוחתת על מודל שאין בו התנהגות סירוב שצריך לעקוף.

איזו build כדאי לך לשרת

לקולקציית Flash-Next יש חמישה מבנים — BF16, GGUF, MLX, FP8 וזה של NVFP4 — וההיגיון הכנה מאחורי הבחירה נוגע לחומרה ולפשרויות, לא לדירוג.

NVFP4 (הגרסה הזו, כ-178 ג״ב בדיסק) — הבחירה של Blackwell. ליבות FP4 Tensor, מומחי 4-bit, הגרסה החדשה ביותר באוסף והקטנה ביותר מבין גרסאות שרת ה-vLLM של האוסף, וזה שהדף הזה עוסק בו.

FP8 (~186 GB על הדיסק) — הבחירה של Hopper, ומתאים באותה מידה גם ל-Blackwell. אותם משקלים ב-8-bit, שזה הנתיב המאומת באופן נרחב יותר של vLLM וזה עם הדרישה הברורה יותר להקבלת מומחים.

GGUF (13 כימות, IQ2_XXS ~52 GB עד Q5_K_M ~125 GB) — הבחירה של llama.cpp למחשבים אישיים עם NVIDIA, AMD או CPU. אין צורך ב-Blackwell, אין צורך ב-vLLM.

MLX (רמות 4/6/8 סיביות, בערך 163–221 GB) — הבחירה עבור Apple Silicon, Metal ילידי, כולל ראש MTP.

שתי הערות כנות לפני שתבחרו. ראשית, גרסאות ה-NVFP4 ו-FP8 נמצאות במרחק של כשמונה ג'יגה-בייט בלבד על הדיסק, משום ששתיהן שומרות את טבלת ה-n-gram הגדולה ב-BF16 — החיסכון של ה-4-bit מרוכז במשקלי המומחים, ולא בגודל הכולל. היתרון האמיתי של NVFP4 על Blackwell הוא מהירות ליבות הטנזור FP4 באותם מומחים, לא קובץ קטן בהרבה. שנית, הכרטיס מתאר את NVFP4 כגזירה דטרמיניסטית של משקלים שיורשת את הערכת ה-abliteration עם פשרה קטנה נוספת באיכות הנובעת ממומחי ה-4-bit, והוא אינו מכמת את הפשרה הזו. היא אינה מכמתת — יש להתייחס אליה כעלות אמיתית אך לא מוגדרת של המומחים הקטנים יותר, לא כזניחה.

ההערכה, שנקראה כהלכה

הכרטיס מדווח על אבליטרציה שנמדדה על מבנה BF16 שמוגש עם vLLM, לעומת ה-Qw​en/Qwen3.8-Flash-Next הרשמי: סירוב להנחיות מזיקות קורס מ-64–100% לכ-0–3.3%, סירוב יתר להנחיות תמימות נשאר קרוב לאפס, והיכולת נמצאת בטווח של ±2 נקודות מהבסיס. שלושה דברים שצריך לדייק בהם לגבי המספרים האלה: הם מדידות על מבנה BF16, שמבנה ה-4-bit הזה יורש אותן בהיקש ולא במדידה ישירה; הם נתוני הספק עצמו, שהופקו באמצעות מסווג מבוסס-כללים לזיהוי משפטי פתיחה, שכרטיסי האוסף מתארים כאינדיקטיביים ולא כאיכותיים ברמת פרסום — מדידה פנימית של העריכה של הספק עצמו, לא ביקורת עצמאית; והם אינם אומרים דבר על פשרת האיכות של NVFP4 שהוזכרה לעיל, שהכרטיס אינו מכמת.

גבול הבטיחות — מחקר בלבד

הבהרת הכרטיס היא ישירה, וזה החלק בעמוד שאסור שיישמע כנוסח סטנדרטי. מהמודל הזה הוסרה במידה ניכרת ההתאמה הבטיחותית: כיוון הסירוב הורחק אורתוגונלית מתוך זרם השארית, והמודל ייענה לבקשות מזיקות, לא אתיות או לא חוקיות שהמודל המקורי Qwen3.8-Flash-Next היה מסרב להן. הוא משוחרר אך ורק למחקר לגיטימי — חקר יכולת הפרשנות, בטיחות בינה מלאכותית וחקר מנגנוני סירוב, בדיקות חדירה (red-teaming) והערכת עמידות — והמחברים אינם נושאים באחריות כלשהי לשימוש לרעה. האחריות המלאה למה שהוא מייצר מוטלת עליך, ועליך להוסיף שכבות בטיחות וסינון משלך לפני שכל פלט מגיע למשתמש. Apache 2.0 הוא הרף המינימלי; שער מטרות המחקר נמצא מעליו.

שני דברים שהשיח על מודלים לא-מצונזרים מפספס, והכרטיס הזה הופך אותם לבלתי אפשריים להחמצה. ראשית, בדיקת jailbreak שמצליחה נגד המודל הזה איננה הערכת בטיחות שעברה — היא ההתנהגות המוצהרת. מודל abliterated נכשל בבדיקות האלה במכוון; מדידה שלו במבחן יחיד של "האם אפשר לפרוץ אותו" מודדת שהעריכה עבדה, לא שמעקה הבטיחות חזק. שנית, מגדל הראייה שנשמר ומסלול קריאת הכלים שנותר על כנו מרחיבים את שטח התקיפה האמיתי מעבר לטקסט: הזרקת הנחיה בקלט תמונה ושימוש לרעה בכלים אוטונומיים שניהם פעילים במלואם, וזו בדיוק הסיבה שהמסגור של צוות האדום מתייחס לזה כבדיקת יכולת, לא כמועמד לצ'אטבוט. אם מקרה השימוש שלך הוא השקת עוזר מול משתמשים, זה לא המודל שלך, וזה בכוונה.

היכן OrcaRouter מתאים

בנייה בת יומיים, עם גישה מוגבלת, לאירוח עצמי בלבד, היא המקרה הקלאסי לניתוב ולא לחיווט קשיח. כשאתה מריץ את בניית NVFP4 הזו בעצמך, אתה יכול להקים נתיב שמצביע עליה ועובר למודל מתארח אם הבנייה מתנהגת לא כראוי תחת עומס — ממשק אחד, ללא חיווט מחדש בין ספקים כשאתה מחליף. לעבודת הערכה ספציפית, קו הבסיס המסונן שמוגש הוא ההשוואה שאתה רוצה, וזה במרחק לחיצת מקש אחת: הקטלוג נושא את Qwen3.8-Flash של Ali​baba במחיר של $0.15 למיליון קלט ו-$0.47 למיליון פלט, מועבר במחיר המחירון של הספק עם 0% תוספת, כך שרתמת צוות אדום יכולה לעבור בין הבסיס המסונן המתארח לבין הבנייה הלא-מסוננת המקומית שלך ללא חוזה שני, וכל שינוי מחיר של ספק נוחת על נקודת הקצה שלך באותו היום.

A screenshot of the OrcaRouter model page for qwen/qwen3.8-flash (captured August 29 2026), showing the tagline 'Qwen3.8 Flash is a multimodal reasoning model from Alibaba', the Vision / Tools / JSON / Reasoning feature tags, pricing of $0.15 per 1M input tokens and $0.47 per 1M output tokens, a 1M-token context window with 131K max output, and the API endpoint https://api.orcarouter.ai/v1.

מי צריך להוריד את זה — ומי לא

הורידו את orcarouter/Qwen3.8-Flash-Next-Uncensored-NVFP4 אם אתם על Blackwell, רוצים את טביעת הרגל הקטנה ביותר של השרת באוסף Flash-Next עם מהירות ליבת FP4-tensor-core, ועושים את עבודת המחקר שהקו הזה קיים בשבילה. הורידו את Qwen3.8-Flash-Next-Uncensored-FP8 אם אתם על Hopper או רוצים את המסלול המאומת יותר באופן רחב. הורידו את בניית GGUF אם אתם על GPU צרכני או על מחשב CPU, את בניית MLX אם אתם על Apple Silicon, וכלום אם המטרה היא פריסה מול משתמשים. קראו את השער ואת כתב הוויתור לפני שתקבלו כל אחד מהם — הם תנאי המודל, לא פורמליות.

כל חמשת מבני ה-Flash-Next — BF16, GGUF, MLX, FP8 ו-NVFP4 — מרוכזים בתוךאוסף Qwen3.8-Flash-Next-Uncensored ב-Hugging Face.

דגם שונה, לא גרסה נוספת של זה: Qwen3.8-27B-Uncensored עבר אבליטרציה ממודל בסיס שונה ויש לו אוסף משלו ו-runbooks משלו.

המשקלים הללו הם מקומיים בלבד בעיצובם. עבור קו בסיס מתארח כדי למדוד מולו את הגרסה שעברה abliteration, Qwen3.8-Flash מוגש ב-OrcaRouter במחיר המחירון של הספק עם 0% תוספת — המודל הרגיל, עם יישור הבטיחות על כנו.

© 2026 OrcaRouter

לספקים

מפעילים פלטפורמת הסקה (inference)? הציגו את המודלים שלכם ב-OrcaRouter.

providers@orcarouter.ai

הצטרפו לקהילה שלנו

Discordsupport@orcarouter.aiXGitHubYouTube