כרטיס כותרת ראשי המציג Qwen3.8-27B על vLLM עם כותרת המשנה 'הרץ אותו בסביבת ייצור על GPU אחד או שניים', אייקון שרת, ותגיות פורמט עם התוויות NVFP4 24.6 GiB, FP8 48GB, ו-BF16 80GB.
Guides & Insights

Qwen3.8-27B על vLLM: הגישו אותו בפרודקשן על GPU אחד או שניים

מחבר

Rowan Sterling

תאריך פרסום

מודלים אחרונים · 20צפו בכל המודלים
בנצ'מרקים: Artificial Analysis · מתעדכן יומית
חזרה לכל הפוסטים

כן — Qwen3.8 27B עובד בייצור על vLLM היום, וברוב המקרים על GPU יחיד. הגרסה שחשובה היא vLLM 0.17.0 או חדשה יותר: היא כוללת את המתכון הרשמי, את קרנלי ההיבריד-אטנשן שהמודל הזה צריך, ונקודת קצה /v1 תואמת O​penAI. עבור GPU אחד מסוג Blackwell, הרץ את קוונטיזציית NVFP4 — המתכון של vLLM עצמו מודד אותה ב-24.6 GiB של VRAM בגודל tensor-parallel של 1. עבור כרטיס בודד של 48GB, הרץ FP8. BF16 מלא, checkpoint של 51.7GB, דורש GPU אחד של 80GB או שני כרטיסי 48GB ב-tensor-parallel. הפקודות המדויקות נמצאות למטה; הראשונה היא שורת פקודה אחת.

הכל כאן אומת ב-15 באוגוסט 2026, היום השלישי שבו המשקלים היו זמינים. הארכיטקטורה, ההקשר והרישיון מגיעים מכרטיס המודל Qwen3.8 27B באתר Hugging Face; גודל נקודת הבידוק (checkpoint) הוא סכום 18 חלקי ה-safetensors של המאגר; פקודות ה-vLLM והנתון 24.6 GiB מגיעים מדף המתכון של vLLM עצמו עבור מודל זה. Qwen3.8 27B הוא המודל הרב-מודאלי הצפוף של עליבאבא עם 27 מיליארד פרמטרים — משקלים תחת רישיון Apache 2.0, שפורסמו ב-13–14 באוגוסט — ומכיוון שהמשקלים פתוחים, אתה יכול לשרת אותו בעצמך במקום לשכור טוקנים. על הפיצול הזה (fork) המאמר הזה עוסק באמת.

העובדות שחשובות, עם מקורות

ארכיטקטורה — 27B צפוף (27.8B כולל מגדל הראייה ואוצר המילים המרופד), 64 שכבות, גודל חבוי 5,120, אוצר מילים 248,320. כרטיס המודל הרשמי, אומת היום.

Attention — היברידי: 16 שכבות קשב מלא, 48 שכבות לינאריות של Gated DeltaNet בתבנית בלוקים של 3:1. רק 16 שכבות שומרות על מטמון מפתח-ערך גדל; 48 האחרות שומרות במקום זאת על מצב רקורסיבי בגודל קבוע.

הקשר — 262,144 טוקנים במקור, ניתן להרחבה עד לכ-1M באמצעות קנה-מידה YaRN RoPE. כרטיס מודל, אומת היום.

קלט — טקסט, תמונה ווידאו מקוריים; פלט טקסט. vLLM חושף את כל שלושתם דרך ה-API הסטנדרטי של chat-completions, ללא קובץ projector נפרד.

רישיון — Apache 2.0. העובדה האחת הזו היא הסיבה לכך שהשאלה "לשרת לבד מול לשכור טוקנים" קיימת בכלל.

משקלים — נקודת הביקורת (checkpoint) של BF16 מסתכמת ב-51.7GB על פני 18 רסיסי safetensors (Hugging Face, אומת היום). Qwe​n מפרסמת גם נקודות ביקורת מסוג FP8 ו-NVFP4 המיועדות ל-vLLM.

דרישת vLLM — 0.17.0 או חדש יותר, עם transformers ≥ 5.8.0. דף המתכונים של vLLM, אומת היום. "כל vLLM" אינו הוראה בטוחה; קרנלים של השכבה הרקורסיבית הם מה שהגרסה החדשה מוסיפה.

חיזוי רב-טוקנים — ראש טיוטה לפענוח ספקולטיבי מובנה בתוך נקודת הבידוק, כך שאין צורך במודל טיוטה נפרד. vLLM מתעד את הדגל; עדיין אין נתון עצמאי להאצת מהירות.

סולם ה-GPU — איזה quant על איזה כרטיס

שלושה פורמטי הגשה מכסים את הטווח המעשי. בחר לפי ה-VRAM שבאמת יש לך, לא לפי "best quant".

NVFP4 — סך הכול 24.6 GiB (משקלים בתוספת מטמון KV מסוג FP8), לפי המתכון של vLLM ב-TP1. מתאים לכרטיס GPU יחיד ממחלקת Blackwell — בפועל RTX 5090 עם 32GB או B200. זהו המסלול עם זמן ההשהיה הנמוך ביותר וזה שמשמר את מירב ההקשר לכל כרטיס: המתכון של vLLM מדווח על קיבולת של 6.6M אסימוני KV אפילו עם הרחבת ההקשר ל-1M.

FP8 — כ-26GB של משקלים. כרטיס אחד של 48GB (L40S, RTX A6000, RTX 6000 Ada) מספיק כדי להריץ אותו עם מקום פנוי לקונטקסט; שני כרטיסי 48GB במצב tensor-parallel נותנים לך מרווח לקונטקסט ארוך יותר או למקביליות גבוהה יותר. המתכון של vLLM עצמו מריץ FP8 ב-TP4 על פני מגש עם ארבעה GPUs מדגם GB300 כשאתה רוצה את מטמון ה-KV הגדול ביותר האפשרי.

BF16 — 51.7GB של משקלים, אז GPU יחיד עם 80GB (H100, A100 80GB, B200, GB300) או שני כרטיסים של 48GB ב-TP2. זוהי אפשרות הדיוק הייחוס, וזו שבה משתמשת למעשה פקודת הרחבת ההקשר של 1M בהמשך.

MXFP4 — אין להשתמש ב-NVIDIA. נתיב ה-MXFP4 של vLLM חסר כרגע תמיכה בשיטה הלינארית; אותם משקלים מתפרסמים כ-NVFP4, שהיא הפורמט שמתכון ה-NVIDIA בפועל משתמש בו.

A GPU ladder card for Qwen3.8-27B on vLLM: NVFP4 at 24.6 GiB on one 32GB Blackwell card at TP1 highlighted as the single-GPU pick, FP8 at about 26GB on one 48GB card or two at TP2, BF16 at 51.7GB on one 80GB GPU or two 48GB at TP2, plus a warning that MXFP4 does not run on NVIDIA.

הרץ את זה — פקודות ה-vLLM

ברירת המחדל בעלת ההשהיה הנמוכה ל-GPU יחיד (NVFP4, GPU אחד של Blackwell), מילה במילה מהמתכון של vLLM:

vllm serve Inferact/Qwen3.8-27B-NVFP4 --tensor-parallel-size 1 --max-model-len 262144 --kv-cache-dtype fp8 --reasoning-parser qwen3 --enable-auto-tool-choice --tool-call-parser qwen3_coder

פקודת ה-FP8 מאותו מתכון (TP4, מגש GB300 אחד, מטמון ה-KV הגדול ביותר):

vllm serve Qwen/Qwen3.8-27B-FP8 --tensor-parallel-size 4 --max-model-len 262144 --kv-cache-dtype fp8 --reasoning-parser qwen3

עבור שני כרטיסי 48GB, השאר את פקודת FP8 והגדר --tensor-parallel-size 2 במקום 4.

צרף זאת לאחת מהפקודות כדי להפעיל פענוח ספקולטיבי של MTP:

--speculative-config '{"method":"mtp","num_speculative_tokens":3}'

הרחבת ההקשר ל-1M (גם מהמתכון של vLLM):

vllm serve Qwen/Qwen3.8-27B --max-model-len 1010000 --hf-overrides '{"text_config": {"max_position_embeddings": 1010000}}'

A terminal-style card showing the vLLM serve command for Qwen3.8-27B NVFP4 on one GPU with the flags tensor-parallel-size 1, max-model-len 262144, kv-cache-dtype fp8, reasoning-parser qwen3, and tool-call-parser qwen3_coder.

Point any O​penAI client at http://localhost:8000/v1 — the endpoint is a drop-in replacement. Two runtime details matter once it is up: thinking is on by default at reasoning_effort xhigh, so turn it off per request with chat_template_kwargs {"enable_thinking": false} or drop it to {"reasoning_effort": "low"} for faster answers. And the checkpoint ships temperature 1.0, top_p 0.95, top_k 20 in its generation config — pass those unless your app already overrides sampling.

מה שהעמודים של vLLM מבטיחים ומה שהם לא מבטיחים

אין עדיין נתוני תפוקה עבור 27B.נכון ל-15 באוגוסט, דף המתכונים של vLLM אינו מפרסם אמות מידה של תפוקה או השהיה עבור Qwen3.8 27B. הנתון של "4,000+ טוקנים לשנייה ל-GPU" שמסתובב סביב שייך ל-Qwen3.8 2.4T-A95B על מערך GB300 NVL72 עם 72 GPUs, הוא דיווח של הספק, ואינו המודל הזה. נתוני הטוקנים לשנייה מהקהילה שתראה מסתובבים עבור GGUF תחת llama.cpp או Ollama — סביבת ריצה שונה ועומס עבודה שונה מאלה של שירות vLLM.

הטענה בדבר מטמון KV זול תלויה בסביבת ההרצה. כרטיס המודל אומר שרק 16 מתוך 64 שכבות שומרות מטמון, אבל זה עוזר רק אם מנוע ההגשה אכן מיישם את שכבות Gated DeltaNet. הגרסה vLLM 0.17+ היא הגרסה שעושה זאת; לכן הצמדת הגרסה היא הדבר הראשון במאמר זה ולא הערת שוליים.

MTP מובנה אך לא נמדד כאן. ראש הדראפט נמצא בצ׳קפוינט, ו-vLLM מתעד את הדגל, אבל אף אחד עדיין לא פרסם נתון האצה עצמאי עבור ה-27B על vLLM. תכננו למדוד זאת על התעבורה שלכם.

NVIDIA היא הדרך המוכחת. המתכון של vLLM כתוב עבור GPUs של NVIDIA (NVFP4 ו-FP8). פריסות AMD Instinct או Intel Gaudi של מודל תשומת-הלב ההיברידי הזה עדיין בחזית הטכנולוגיה, ומאמר זה אינו מתיימר אחרת.

הגישו זאת בעצמכם, או שכרו את האסימונים

כאן Apache 2.0 עושה את העבודה שלו. אין דמי רישוי לכל טוקן על Qwen3.8 27B, כך שהשאלה האמיתית היחידה היא אם אתה הבעלים של החומרה או שוכר את הטוקנים.

אירוח עצמי (מאמר זה) — אתה משלם על ה-GPU פעם אחת, וכל טוקן לאחר מכן הוא חינם. RTX 5090 שכבר בבעלותך הופך את פקודת ה-NVFP4 לנקודת קצה בעלות שולית אפסית, מבלי שנתונים יוצאים מהמחשב. אם אתה צריך לשכור את ה-GPU, אז 5090 בענן או זוג A6000s הוא סעיף ההוצאה, והטיעון כולו מנצח רק אם כבר יש לך את הכרטיס או את נפח השימוש המתמשך.

שכור את הטוקנים — מכיוון שהמשקלים פתוחים, כמה מארחים מריצים אותו, ורצפת המחיר היא עלות החומרה. Qwen3.8 27B זמין היום ב-OrcaRouter במחיר של $0.33 למיליון טוקני קלט ו-$2.40 למיליון טוקני פלט — ללא תוספת מחיר של ספק, מכיוון ש-OrcaRouter מריץ את המשקלים הפתוחים על התשתית שלו — ואותם משקלים פתוחים מממנים שכבה חינמית מוגבלת בקצב שגובה $0 לבקשה ומחזירה HTTP 429 כשחורגים מהמכסה שלה. חודש מייצג של 10 מיליון טוקנים, עם 70% קלט, עומד על כ-$9.51 בשכבה בתשלום.

The decision rule — if you already own the GPU, self-host. If you would have to buy or rent one, the API breaks even fast at side-project volumes, and the same O​penAI-compatible client points at either endpoint, so the code does not change when you move.

The OrcaRouter model page for Qwen3.8 27B, showing the input price of 0.33 dollars per million tokens, output price of 2.40 dollars per million tokens, a 262K-token context window, text image and video input, and p50 time-to-first-token of 225 milliseconds.

כאשר vLLM הוא התשובה הלא נכונה

אתה אדם אחד על מחשב נייד — vLLM היא מנוע שרתים, לא אפליקציית שולחן עבודה. להרצה מקומית של משתמש יחיד, llama.cpp או Ollama עם Q4 GGUF פשוטים יותר ודורשים כרטיס של 24GB, לא GPU מסוג Blackwell; המדריך שלנו how-to-run-Qwen3.8-27B-locally מלווה את התהליך מקצה לקצה.

אתם צריכים תפוקה מובטחת עם אפס תפעול — אירוח עצמי פירושו שאתם אחראים על ה-paging, ה-queueing וה-failover. אם "ה-API מושבת" הוא לא ביטוי שאתם רוצים לשמוע, שכרו את הטוקנים במקום ותנו למישהו אחר להריץ את התשתית.

אתה באמת זקוק להקשר המלא של ~1M באיכות חוד החנית — זו המשימה של Qwen3.8 2.4T-A95B, המטופלת על ידי vLLM או SGLang על פני rack של GB300 NVL72 עם 72 GPU. Qwen3.8 27B על GPU אחד או שניים לא ישתווה לכך; המאמר שלנו על הגשת ה-2.4T מסביר מדוע המודל הזה הוא סוג אחר של בעיה.

אתה על כרטיס 24GB ישן יותר — NVFP4 הוא פורמט של Blackwell; בכרטיסי Ampere (RTX 3090) או Ada (RTX 4090) עם 24GB, נתיב ה-FP8 הוא האופציה של vLLM, ומעבר לכך, קוונטיזציית GGUF תחת llama.cpp היא העצירה המעשית. אותו דגם על כרטיס 24GB הוא עניין אחר.

עליך לשרת קונקורנטיות מרבית על כרטיס אחד — ברירות המחדל של GPU בודד לעיל הן נקודת התחלה, לא צורת הייצור. כוונן את --max-num-seqs, מטמון ה-KV, ותצורת ה-MTP מול תמהיל הבקשות שלך לפני שתחשיב זאת כמושלם.

השורה התחתונה

Qwen3.8 27B הוא ה-27B הצפוף (dense) הנדיר ש-vLLM משרת על GPU יחיד בסביבת ייצור. עדכן לגרסת vLLM 0.17.0 ומעלה, משוך את קוונטיזציית NVFP4 לכרטיס Blackwell של 32GB בגודל 24.6 GiB, את קוונטיזציית FP8 לכרטיס אחד של 48GB או לשניים ב-tensor-parallel, ושמור את BF16 ל-GPU של 80GB. הפקודות הן שורות בודדות, ה-endpoint תואם OpenAI, ומכיוון שהמשקלים הם תחת רישיון Apache 2.0, אתה יכול לשרת אותו בעצמך או לשכור אותו בתעריף של $0.33/$2.40 למיליון טוקנים, עם מסלול חינמי — אותו קוד לקוח בכל דרך. הדבר היחיד שעדיין לאף אחד אין הוא נתון תפוקה בלתי תלוי עבור ה-27B על vLLM, אז תכנן שעה לבדיקות ביצועים אחרי שתעלה אותו לפני שתבטיח למישהו מספר השהיה.

© 2026 OrcaRouter

לספקים

מפעילים פלטפורמת הסקה (inference)? הציגו את המודלים שלכם ב-OrcaRouter.

צרו קשר

הצטרפו לקהילה שלנו

DiscordEmailXGitHubYouTube