
דרישות VRAM של Qwen3.8-27B: כמה חומרה אתה באמת צריך
- deepseekחדשDeepSeek: DeepSeek V4 Pro 08132026-08-1253אינטליגנציה69כתיבת קוד
- grokחדשSpaceXAI: Grok 4.62026-08-1261אינטליגנציה77כתיבת קוד
- metaחדשMeta: Muse Spark 1.22026-08-0557אינטליגנציה72כתיבת קוד
- qwenחדשQwen: Qwen3.8 Max2026-08-0358אינטליגנציה72כתיבת קוד
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3152אינטליגנציה69כתיבת קוד
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 לכל 1M טוקנים · 2382 tok/s
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463אינטליגנציה78כתיבת קוד
- googleGoogle: Gemini 3.6 Flash2026-07-2152אינטליגנציה69כתיבת קוד
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137אינטליגנציה49כתיבת קוד
- metaMeta: Muse Spark 1.12026-07-1653אינטליגנציה71כתיבת קוד
- kimiMoonshotAI: Kimi K32026-07-1560אינטליגנציה76כתיבת קוד
- openaiOpenAI: GPT-5.6 Luna2026-07-0952אינטליגנציה71כתיבת קוד
- openaiOpenAI: GPT-5.6 Terra2026-07-0957אינטליגנציה77כתיבת קוד
- openaiOpenAI: GPT-5.6 Sol2026-07-0961אינטליגנציה77כתיבת קוד
- grokxAI: Grok 4.52026-07-0856אינטליגנציה72כתיבת קוד
- tencentTencent: Hy32026-07-0642אינטליגנציה59כתיבת קוד
- obsidianQwen3.6 35B A3B Uncensored (Aggressive)2026-07-0232אינטליגנציה42כתיבת קוד
- obsidianGemma4 26B A4B Uncensored (Balanced)2026-07-0226אינטליגנציה39כתיבת קוד
כ-17GB של VRAM הוא המספר שמסתובב עבור Qwen3.8-27B — דניאל האן מ-Unsloth אמר שהוא "אמור להתאים בכ-17GB של VRAM עם השחרור" — וכדאי לדייק מה זה ומה זה לא. מדובר בהערכה המבוססת על קודמו של ה-27B, לא במפרט מאליבאבא, מכיוון שהמודל טרם שוחרר; המאגר הרשמי הובטח לשבוע של 10 באוגוסט 2026 וטרם הופיע במועד כתיבת שורות אלה. מאמר זה ממיין את שאלת ה-VRAM למה שאפשר לתכנן עליו, מה באמת לא ודאי, ואיך המספר משתנה עם הקוונטיזציה שלך, חלון ההקשר שלך וסביבת ההרצה שלך.
קודם התשובה הכנה
אין עדיין מפרט חומרה רשמי עבור Qwen3.8-27B. כל מה שלהלן מוערך על סמך Qwen3.6-27B, הדגם שה-27B מחליף — אותו מספר פרמטרים, ככל הנראה אותה ארכיטקטורה היברידית, והדבר הקרוב ביותר לנקודת ייחוס בעניין הגודל. יש להתייחס למספרים כמעטפת תכנון, לא כגיליון דרישות. המדידות האמיתיות הראשונות יגיעו ממבצעי הקוונטיזציה וממתחזקי מסגרות ההסקה בתוך ימים ספורים משחרור המשקולות, ואלה הנתונים שלפיהם יש לנעול את החלטת הרכישה.
סולם הקוונט
כמות ה-VRAM הדרושה לך תלויה כמעט לחלוטין באיזו קוונטיזציה אתה מריץ. בהתבסס על הטבלה שנמדדה על ידי הקהילה עבור Qwen3.6-27B:
• Q4_K_M — בערך 16 GB VRAM. נקודת הזהב לכרטיסי 24 GB, והמקום הסביר שבו נמצא המספר "17 GB". ברירת המחדל של רוב הצוותים.
• Q3_K_M / IQ3 — כ-13 GB VRAM. מתאים לכרטיסי 16 GB ואפילו 12 GB, עם ירידת איכות ניכרת.
• Q6_K — בערך 21 GB VRAM. כמעט ללא אובדן, והתאמה הדוקה אך מציאותית לכרטיס של 24 GB.
• Q8_0 — כ-27–30 GB VRAM. לכרטיסי 48 GB, כשרוצים את טיפות האיכות האחרונות.
• שירות FP8 — בערך 27 GB של VRAM עבור המשקולות, וזו הסיבה ש-L40S בודד הוא בחירת ה-GPU הנפוצה להסקה.
• דיוק מלא (BF16) — בערך 54 GB VRAM. באופן ריאלי, כרטיס ברמה של H100, והתחום שבו אנשים מפסיקים לקרוא לזה "מקומי."
הגרסה הקצרה: GPU עם 24 GB הוא הרכישה הבטוחה עבור הדגם הזה, כרטיס עם 16 GB יכול להריץ אותו רק אם מקבלים את הקוונטיזציות הנמוכות, וכל מה שיש בו 8 GB או פחות לא בא בחשבון, אלא אם הדגם יתגלה כקל בהרבה מקודמו.

המשתנה שאף אחד לא מצטט: אורך ההקשר
כל המספרים {{1}}למעלה{{/1}} מתייחסים {{2}}להקשר צנוע{{/2}}. זיכרון ה-VRAM גדל עם ההקשר כי {{3}}מטמון ה-KV חייב להתקיים לצד המשקלים{{/3}}. ב-Qwen3.6-27B, הקשר של 2K {{4}}רץ בכ-11GB{{/4}}, הקשר של 32K {{5}}דחף את אותה קוונטיזציה מעבר ל-14GB{{/5}}, ו-128K {{6}}יותר מהכפיל את טביעת המטמון{{/6}}. אם Qwen3.8-27B {{7}}שומר על חלון הקשר מקורי גדול{{/7}} — ו{{8}}דור ה-{{KEEP}}Qwen{{/KEEP}} נטה לכיוון הזה{{/8}} — {{9}}תכננו כמה GB של מרווח מעבר לגודל הקוונטיזציה, או הגבילו את ההקשר בקונפיגורציית הריצה{{/9}}. בחירת אורך הקשר {{10}}שאינכם באמת משתמשים בו{{/10}} היא {{11}}הדרך הנפוצה ביותר שבה צוותים מגיעים לקניית כרטיס גדול יותר ממה שהיה נחוץ{{/11}}.
הג'וקר של הארכיטקטורה ההיברידית
Qwen3.6-27B היה מודל היברידי: רק 16 מתוך 65 השכבות שלו השתמשו במטמון KV מסורתי, בעוד 48 השתמשו במצב רקורסיבי קבוע. התוצאה הייתה בערך פי ארבעה פחות זיכרון KV מאשר מודל צפוף באותו גודל — וזה חלק גדול מהסיבה לכך שמודל 27B הרגיש כמו מודל לכרטיס של 24GB ולא של 48GB. אם Qwen3.8-27B ישמור על העיצוב ההיברידי (סביר, אך לא אושר), המתמטיקה של אורך ההקשר לעיל תהיה ידידותית יותר ממה שהיא נראית. הקטע הוא תמיכת זמן ריצה: build של llama.cpp או vLLM שלא מיישם את השכבות הרקורסיביות ידווח על שימוש גבוה בהרבה בזיכרון. בדוק אילו סביבות זמן ריצה שילבו תמיכה לפני שמניחים שההערכות תקפות.
אילו GPUs באמת עובדים
באופן קונקרטי, עבור הקלפים הנפוצים:
• RTX 4090 / 3090 / 5090 (24 GB) — Q4_K_M בנוחות, Q6_K אם אתם מוכנים להתאמץ. זה קהל היעד המיועד.
• RTX 3060 / 4060 Ti 16 GB — רק קוונטים ברמת IQ4 או Q3, עם קונטקסט צנוע. שמיש, אך לא נעים.
• כרטיסי 12 GB — Q3_K_M באיכות מופחתת. מתאים לניסויים, לא להגשה.
• Apple Silicon — מק עם 24 ג'יגה־בייט מריץ את אותם קבצי Q4 דרך MLX או llama.cpp; דגמי הבסיס של 16 ג'יגה־בייט נחנקים מהחלפות זיכרון ולמעשה בחוץ, כפי שהיו עם Qwen3.6-27B.
• 48 ג'יגה-בייט ומעלה (A6000, L40S, מערכים של שני כרטיסים) — הגשת Q8_0 או FP8 עם מרווח ראש אמיתי.

או דלג לגמרי על ה-GPU
אם חשבון החומרה לא יוצא לך, המודל לא חייב לסבול מכך. OrcaRouter הוא API אחד על פני יותר מ-200 מודלים — כולל משפחת Qwen — והוא מעביר את מחיר המחירון של הספק ללא תוספת, כך ש-Qwen3.8-Max עולה כיום $2.00 למיליון טוקני קלט ו-$6.00 למיליון טוקני פלט, בדיוק כמו בדף התמחור של הספק עצמו. ה-27B עצמו יהיה מודל מקומי, אבל כשישחררו את המשקולות שלו והוא יזכה לאמון, אותו מפתח ינותב לכל ספק שיארח אותו — אפשר לבנות סביב הדור הזה כבר עכשיו, בלי לגעת כלל בשוק סוחרי ה-GPU.

השורה התחתונה לשאלת החומרה: תכננו על 16 ג'יגה-בייט לריצה נוחה של 4-bit, 24 ג'יגה-בייט כדי להיות בצד הבטוח ולתת לעצמכם מרווח ראש לקונטקסט ולקוונטיזציות גבוהות יותר, והתייחסו לכל נתון כאן כזמני עד שהמאגר יפורסם ויופיעו המדידות האמיתיות הראשונות. התחזית של "17 ג'יגה-בייט" היא מספר תכנון סביר — היא פשוט עדיין לא עובדה.
