
דרישות VRAM של Qwen3.8-27B: כמה חומרה אתה באמת צריך
- typesafeחדשTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 לכל 1M טוקנים · 931 tok/s
- OpenAIחדשOpenAI: GPT-6 Luna2026-09-2237אינטליגנציה
- OpenAIחדשOpenAI: GPT-6 Sol2026-09-2248אינטליגנציה
- AnthropicחדשAnthropic: Claude Opus 5.52026-09-2258אינטליגנציה
- xAIחדשGrok 4.72026-09-2146אינטליגנציה
- OrcaחדשOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 לכל 1M טוקנים · 192 tok/s
- OrcaחדשOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 לכל 1M טוקנים · 1177 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040אינטליגנציה
- OpenAIOpenAI: GPT-6 Astra2026-09-0453אינטליגנציה77כתיבת קוד
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241אינטליגנציה76כתיבת קוד
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245אינטליגנציה76כתיבת קוד
- AnthropicAnthropic: Claude Fable 5.12026-09-0153אינטליגנציה82כתיבת קוד
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 לכל 1M טוקנים · 70 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 לכל 1M טוקנים · 107 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642אינטליגנציה72כתיבת קוד
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 לכל 1M טוקנים · 220 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845אינטליגנציה75כתיבת קוד
- obsidianQwen3.8 27B2026-08-1534אינטליגנציה68כתיבת קוד
- DeepSeekDeepSeek: DeepSeek V4 Pro 08132026-08-1236אינטליגנציה69כתיבת קוד
- xAISpaceXAI: Grok 4.62026-08-1244אינטליגנציה77כתיבת קוד
כ-17GB של VRAM הוא המספר שמסתובב עבור Qwen3.8-27B — דניאל האן מ-Unsloth אמר שהוא "אמור להתאים בכ-17GB של VRAM עם השחרור" — וכדאי לדייק מה זה ומה זה לא. מדובר בהערכה המבוססת על קודמו של ה-27B, לא במפרט מאליבאבא, מכיוון שהמודל טרם שוחרר; המאגר הרשמי הובטח לשבוע של 10 באוגוסט 2026 וטרם הופיע במועד כתיבת שורות אלה. מאמר זה ממיין את שאלת ה-VRAM למה שאפשר לתכנן עליו, מה באמת לא ודאי, ואיך המספר משתנה עם הקוונטיזציה שלך, חלון ההקשר שלך וסביבת ההרצה שלך.
קודם התשובה הכנה
אין עדיין מפרט חומרה רשמי עבור Qwen3.8-27B. כל מה שלהלן מוערך על סמך Qwen3.6-27B, הדגם שה-27B מחליף — אותו מספר פרמטרים, ככל הנראה אותה ארכיטקטורה היברידית, והדבר הקרוב ביותר לנקודת ייחוס בעניין הגודל. יש להתייחס למספרים כמעטפת תכנון, לא כגיליון דרישות. המדידות האמיתיות הראשונות יגיעו ממבצעי הקוונטיזציה וממתחזקי מסגרות ההסקה בתוך ימים ספורים משחרור המשקולות, ואלה הנתונים שלפיהם יש לנעול את החלטת הרכישה.
סולם הקוונט
כמות ה-VRAM הדרושה לך תלויה כמעט לחלוטין באיזו קוונטיזציה אתה מריץ. בהתבסס על הטבלה שנמדדה על ידי הקהילה עבור Qwen3.6-27B:
• Q4_K_M — בערך 16 GB VRAM. נקודת הזהב לכרטיסי 24 GB, והמקום הסביר שבו נמצא המספר "17 GB". ברירת המחדל של רוב הצוותים.
• Q3_K_M / IQ3 — כ-13 GB VRAM. מתאים לכרטיסי 16 GB ואפילו 12 GB, עם ירידת איכות ניכרת.
• Q6_K — בערך 21 GB VRAM. כמעט ללא אובדן, והתאמה הדוקה אך מציאותית לכרטיס של 24 GB.
• Q8_0 — כ-27–30 GB VRAM. לכרטיסי 48 GB, כשרוצים את טיפות האיכות האחרונות.
• שירות FP8 — בערך 27 GB של VRAM עבור המשקולות, וזו הסיבה ש-L40S בודד הוא בחירת ה-GPU הנפוצה להסקה.
• דיוק מלא (BF16) — בערך 54 GB VRAM. באופן ריאלי, כרטיס ברמה של H100, והתחום שבו אנשים מפסיקים לקרוא לזה "מקומי."
הגרסה הקצרה: GPU עם 24 GB הוא הרכישה הבטוחה עבור הדגם הזה, כרטיס עם 16 GB יכול להריץ אותו רק אם מקבלים את הקוונטיזציות הנמוכות, וכל מה שיש בו 8 GB או פחות לא בא בחשבון, אלא אם הדגם יתגלה כקל בהרבה מקודמו.

המשתנה שאף אחד לא מצטט: אורך ההקשר
כל המספרים {{1}}למעלה{{/1}} מתייחסים {{2}}להקשר צנוע{{/2}}. זיכרון ה-VRAM גדל עם ההקשר כי {{3}}מטמון ה-KV חייב להתקיים לצד המשקלים{{/3}}. ב-Qwen3.6-27B, הקשר של 2K {{4}}רץ בכ-11GB{{/4}}, הקשר של 32K {{5}}דחף את אותה קוונטיזציה מעבר ל-14GB{{/5}}, ו-128K {{6}}יותר מהכפיל את טביעת המטמון{{/6}}. אם Qwen3.8-27B {{7}}שומר על חלון הקשר מקורי גדול{{/7}} — ו{{8}}דור ה-{{KEEP}}Qwen{{/KEEP}} נטה לכיוון הזה{{/8}} — {{9}}תכננו כמה GB של מרווח מעבר לגודל הקוונטיזציה, או הגבילו את ההקשר בקונפיגורציית הריצה{{/9}}. בחירת אורך הקשר {{10}}שאינכם באמת משתמשים בו{{/10}} היא {{11}}הדרך הנפוצה ביותר שבה צוותים מגיעים לקניית כרטיס גדול יותר ממה שהיה נחוץ{{/11}}.
הג'וקר של הארכיטקטורה ההיברידית
Qwen3.6-27B היה מודל היברידי: רק 16 מתוך 65 השכבות שלו השתמשו במטמון KV מסורתי, בעוד 48 השתמשו במצב רקורסיבי קבוע. התוצאה הייתה בערך פי ארבעה פחות זיכרון KV מאשר מודל צפוף באותו גודל — וזה חלק גדול מהסיבה לכך שמודל 27B הרגיש כמו מודל לכרטיס של 24GB ולא של 48GB. אם Qwen3.8-27B ישמור על העיצוב ההיברידי (סביר, אך לא אושר), המתמטיקה של אורך ההקשר לעיל תהיה ידידותית יותר ממה שהיא נראית. הקטע הוא תמיכת זמן ריצה: build של llama.cpp או vLLM שלא מיישם את השכבות הרקורסיביות ידווח על שימוש גבוה בהרבה בזיכרון. בדוק אילו סביבות זמן ריצה שילבו תמיכה לפני שמניחים שההערכות תקפות.
אילו GPUs באמת עובדים
באופן קונקרטי, עבור הקלפים הנפוצים:
• RTX 4090 / 3090 / 5090 (24 GB) — Q4_K_M בנוחות, Q6_K אם אתם מוכנים להתאמץ. זה קהל היעד המיועד.
• RTX 3060 / 4060 Ti 16 GB — רק קוונטים ברמת IQ4 או Q3, עם קונטקסט צנוע. שמיש, אך לא נעים.
• כרטיסי 12 GB — Q3_K_M באיכות מופחתת. מתאים לניסויים, לא להגשה.
• Apple Silicon — מק עם 24 ג'יגה־בייט מריץ את אותם קבצי Q4 דרך MLX או llama.cpp; דגמי הבסיס של 16 ג'יגה־בייט נחנקים מהחלפות זיכרון ולמעשה בחוץ, כפי שהיו עם Qwen3.6-27B.
• 48 ג'יגה-בייט ומעלה (A6000, L40S, מערכים של שני כרטיסים) — הגשת Q8_0 או FP8 עם מרווח ראש אמיתי.

או דלג לגמרי על ה-GPU
אם חשבון החומרה לא יוצא לך, המודל לא חייב לסבול מכך. OrcaRouter הוא API אחד על פני יותר מ-200 מודלים — כולל משפחת Qwen — והוא מעביר את מחיר המחירון של הספק ללא תוספת, כך ש-Qwen3.8-Max עולה כיום $2.00 למיליון טוקני קלט ו-$6.00 למיליון טוקני פלט, בדיוק כמו בדף התמחור של הספק עצמו. ה-27B עצמו יהיה מודל מקומי, אבל כשישחררו את המשקולות שלו והוא יזכה לאמון, אותו מפתח ינותב לכל ספק שיארח אותו — אפשר לבנות סביב הדור הזה כבר עכשיו, בלי לגעת כלל בשוק סוחרי ה-GPU.

השורה התחתונה לשאלת החומרה: תכננו על 16 ג'יגה-בייט לריצה נוחה של 4-bit, 24 ג'יגה-בייט כדי להיות בצד הבטוח ולתת לעצמכם מרווח ראש לקונטקסט ולקוונטיזציות גבוהות יותר, והתייחסו לכל נתון כאן כזמני עד שהמאגר יפורסם ויופיעו המדידות האמיתיות הראשונות. התחזית של "17 ג'יגה-בייט" היא מספר תכנון סביר — היא פשוט עדיין לא עובדה.
