
Qwen3.8-27B GGUF: איזו קוונטיזציה להוריד עבור כרטיס המסך שלך
- DeepSeekחדשDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.15 / $0.29 לכל 1M טוקנים
- z-aiחדשZ.ai: GLM 5.32026-08-1860אינטליגנציה75כתיבת קוד
- obsidianחדשQwen3.8 27B2026-08-1552אינטליגנציה68כתיבת קוד
- qwenחדשQwen: Qwen3.8 27B (free)2026-08-13qwen/qwen3.8-27b-free
- deepseekחדשDeepSeek: DeepSeek V4 Pro 08132026-08-1253אינטליגנציה69כתיבת קוד
- grokחדשSpaceXAI: Grok 4.62026-08-1261אינטליגנציה77כתיבת קוד
- metaMeta: Muse Spark 1.22026-08-0557אינטליגנציה72כתיבת קוד
- qwenQwen: Qwen3.8 Max2026-08-0358אינטליגנציה72כתיבת קוד
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3152אינטליגנציה69כתיבת קוד
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 לכל 1M טוקנים
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463אינטליגנציה78כתיבת קוד
- googleGoogle: Gemini 3.6 Flash2026-07-2152אינטליגנציה69כתיבת קוד
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137אינטליגנציה49כתיבת קוד
- metaMeta: Muse Spark 1.12026-07-1653אינטליגנציה71כתיבת קוד
- kimiMoonshotAI: Kimi K32026-07-1560אינטליגנציה76כתיבת קוד
- openaiOpenAI: GPT-5.6 Luna2026-07-0952אינטליגנציה71כתיבת קוד
- openaiOpenAI: GPT-5.6 Terra2026-07-0957אינטליגנציה77כתיבת קוד
- openaiOpenAI: GPT-5.6 Sol2026-07-0961אינטליגנציה77כתיבת קוד
הורד את חבילת unsloth/Qwen3.8-27B-GGUF, והתאם את הקובץ לכרטיס שבאמת בבעלותך. זו כל התשובה: GPU של 24GB (RTX 4090 או 3090) אמור למשוך Q4_K_M בגודל 17.1GB; GPU של 16GB אמור למשוך IQ4_XS בגודל 15.7GB (או Q3_K_M בגודל 13.8GB אם אתה רוצה מרווח הקשר); GPU של 12GB מוגבל לקבצי 2-bit, UD-IQ2_XXS בגודל 9.0GB, וזו פשרה שיש לעשות במודע. Qwen3.8 27B — המודל הדחוס של Alibaba עם 27 מיליארד פרמטרים, משקלים תחת רישיון Apache 2.0 שפורסמו ב-13–14 באוגוסט 2026 — פועל מקומית בעלות נמוכה במיוחד, מכיוון שתשומת הלב ההיברידית שלו שומרת במטמון רק 16 מתוך 64 השכבות, כך שקוונטיזציה של 4-bit על 24GB נושאת בנוחות 32K–64K טוקנים של הקשר. והפורמט GGUF הוא הדרך היחידה בעלות שולית אפסית: אין צורך במפתח API, אין חיוב לפי טוקן, ושום נתון לא יוצא מהמחשב שלך.
בנוגע למקורות: הארכיטקטורה, חלון ההקשר והרישיון רשמיים, מתוך כרטיס הדגם Qwen3.8 27B ב-Hugging Face, אומתו ב-15 באוגוסט 2026. גדלי ה-GGUF לקוחים ממאגרי ה-GGUF של unsloth ו-ggml-org, באותו תאריך. ההנחיות לזיכרון VRAM לכל GPU הן ההמלצה הרשמית של unsloth. הערכות הבתים של מטמון KV-cache ונתוני ה-tokens-per-second נמדדו על ידי הקהילה בימים הראשונים לאחר השחרור, ואינם מפרטי יצרן. כל benchmark המוזכר להלן מדווח על ידי Alibaba ולא שוחזר.
בורר הקבצים, שורה אחת לכל כמות.
• UD-IQ2_XXS — 9.0GB — ההתאמה הנוחה היחידה לכרטיס 12GB; צפו לאובדן איכות נראה לעין.
• UD-Q2_K_XL — 10.7GB — כרטיסי 12GB, עם כמעט ללא הקשר פנוי.
• Q3_K_M — 13.8GB — כרטיסי 16GB שרוצים מרווח לקונטקסט.
• IQ4_XS — 15.7GB — כרטיסי 16GB: הקוונט הגדול ביותר שמתאים בשלמותו.
• Q4_K_M — 17.1GB — כרטיסי 24GB: הנקודה המתוקה, והקובץ שהמאמר הזה מפנה אליו.
• Q5_K_M — 19.8GB — 24GB, תוך ויתור על מרווח הקשר תמורת רווח קטן באיכות.
• Q6_K — 22.9GB — נכנס ב-24GB אם דוחסים; כמעט ללא אובדן.
• Q8_0 — 29.0GB — 32GB, פיצול לשני כרטיסים, או העברת עומס למעבד.
• BF16 — 54.7GB — כרטיסי שרת והתקני CPU כבדי RAM; דיוק ייחוס.
שתי חבילות, שני גדלי Q4_K_M: של unsloth הוא 17.1GB; של ggml-org הוא 19.0GB. החבילה של unsloth משתמשת בקוונטיזציה של Dynamic V3.0 (preview) עבור קבצי ה-UD-* שלה, והיא ברירת המחדל של רוב האפליקציות המקומיות; החבילה של ggml-org כוללת את ה-K-quants הסטנדרטיים ובנוסף את ראש חיזוי מרובה-הטוקנים (multi-token-prediction) הנפרד המשמש לפענוח ספקולטיבי. כל אחת מגרסאות Q4_K_M עובדת — ההבדל הוא כמה מאות מגה-בייט וקובץ ה-MTP.

מדוע ה-27B הזה נכנס לכרטיסים קטנים יותר מרוב הכרטיסים
Qwen3.8 27B כולל 64 שכבות, אך רק 16 מהן משתמשות ב-attention מלא. 48 השכבות האחרות משתמשות ב-Gated DeltaNet linear attention, השומר מצב רקורסיבי בגודל קבוע במקום מטמון key-value שגדל. פריסת הבלוקים בכרטיס המודל עצמו היא 3×(Gated DeltaNet → FFN) עבור כל 1×(Gated Attention → FFN) — יחס היברידי של 3:1. ההשפעה המעשית: מטמון ה-KV הוא בערך רבע ממה שמודל 27B צפוף רגיל צריך עבור אותו הקשר. מדידות קהילתיות השבוע העמידו את המטמון על כ-0.5GB בהקשר של 8K, 2.0GB ב-32K, ו-16.4GB בחלון המקורי המלא של 262K. זה הופך את ההמלצה הרגילה — רוב תקציב ה-VRAM שלך הולך למשקולות, לא להקשר, וכרטיס עם 24GB יכול להריץ Q4_K_M עם הקשר של 64K–96K בלי מאמץ. אתה יכול לכווץ את המטמון עוד יותר עם הדגל --cache-type-k של llama.cpp, שמכמת את המטמון עצמו.

שלוש מלכודות שיפילו אותך ביום הראשון
• גרסאות ישנות של llama.cpp דוחות את הקובץ. ה-GGUF מגדיר את הארכיטקטורה החדשה qwen35, אז אתה צריך build עדכני — כל דבר מלפני שבוע ההשקה מסרב לטעון אותו עם שגיאת ארכיטקטורה. עדכן את llama.cpp קודם, לפני שתוריד.
• מלכודת התבנית. תבנית הצ'אט הרשמית של Jinja עוטפת כל תור של העוזר בבלוק חשיבה גם כאשר מסלול החשיבה ריק, וזה יוצר בלוקים מקוננים והיסטוריה קטועה בשיחות מרובי-תורים — זה נראה כאילו המודל שכח את מה שאמרת. הריץ llama.cpp עם --jinja, והעדף חבילה שמגיעה עם chat_template.jinja מתוקן.
• Vision דורש קובץ נפרד. טקסט עובד מהקופסה; תמונות ווידאו פשוט אינן עושות דבר, אלא אם כן טוענים גם את מקרן ה-mmproj, כ-0.9GB. זה לא מופיע בדף ה-GGUF repo של unsloth — קח אותו מהמאגר הבסיסי או מהחבילה של ggml-org. אם אתה מתכנן להזין מסמכים או צילומי מסך, הוסף את --mmproj לפקודת השרת.
הרץ את זה: הפקודות
llama.cpp, ברגע שיש לך build עדכני:
llama-server -m Qwen3.8-27B-Q4_K_M.gguf --ctx-size 32768 --n-gpu-layers 99 --jinja --cache-type-k q8_0
...והוסף --mmproj Qwen3.8-27B-mmproj-bf16.gguf אם אתה צריך ראייה.
Ollama, אם אתה רוצה את רשומת הספרייה: ollama pull qwen3.8:27b, ולאחר מכן ollama run qwen3.8:27b. LM Studio ו-Unsloth Desktop קולטים את תבנית הצ'אט ואת פריקת ה-RAM באופן אוטומטי — הם המסלול הכי פחות טרחני להרצה ראשונה.
Local vs API: הכלכלה הכנה
ה-GGUF הוא המסלול החינמי: אפס עלות שולית, ללא הגבלות קצב, שום דבר לא יוצא מהמחשב שלך. הוא לא המסלול הזול במונחים מוחלטים — אתה מספק את ה-GPU עם 24GB (RTX 3090 משומש או RTX 4090 חדש, בתוספת חשמל), וקובץ של 2-bit על כרטיס של 12GB הוא חוויה מתפשרת.
מסלול ה-API קיים מכיוון שהמשקולות (weights) הן ברישיון Apache 2.0, כך שהעלות השולית של מתן השירות קרובה לאפס וכל אחד יכול לארח. Qwen3.8 27B זמין ב-OrcaRouter היום ב-$0.33 למיליון אסימוני קלט ו-$2.40 למיליון אסימוני פלט — מחיר הרשימה של הספק מועבר ללא תוספת מחיר — ובגלל שהמשקולות פתוחות, קיימת גם שכבה חינמית מוגבלת בקצב שגובה $0 לבקשה ומחזירה HTTP 429 כשחורגים מהמכסה. חודש מייצג של 10 מיליון אסימונים עם 70% נתח קלט עולה כ-$9.51 בשכבה בתשלום. אם כבר יש לכם GPU, הרצה מקומית משתלמת יותר מבחינת עלות; אם לא, שכירת אסימונים עדיפה על קניית כרטיס לפרויקט צדדי.

כשההמלצה הזו שגויה
Q4_K_M על 24GB הוא ברירת המחדל, לא התשובה האוניברסלית. בחר במשהו אחר כאשר:
• אתה צריך איכות מקסימלית בשרת או בתחנת עבודה — Q8_0 ב-29GB או BF16 ב-54.7GB עם offload ל-CPU ו-RAM, לא קובץ 4-bit.
• אתה על כרטיס Blackwell RTX 50-series — גרסת ה-NVFP4 מהירה בערך פי 1.5 באותם 24GB של VRAM ומשתמשת ב-FP8 KV cache להקשר ארוך יותר. ב-5090, NVFP4 עוקף כל GGUF במודל הזה.
• אתה צריך את ההקשר המלא של 262K — הקצה כ-16GB למטמון בנוסף למשקלים; זה מוריד כרטיס 24GB ל-Q3_K_M, או מאלץ קוונטיזציה של KV.
• אתה מסתמך על פענוח ספקולטיבי — בחר בחבילת ggml-org, ששומרת על ראש חיזוי רב-טוקנים; חלק מהקוונטים מסירים אותו כדי לחסוך כ-0.5GB.
• יש לך רק 12GB — תשובה כנה: 27B ב-2-bit גרוע באופן ניכר מאותו דגם שמוגש כראוי. נסה את שכבת ה-API החינמית לפני שאתה מתחייב להרצה מקומית ב-2-bit; אם זה מספיק טוב, ה-GGUF יכול לחכות עד שהחומרה תדביק את הפער.
השורה התחתונה
Qwen3.8 27B הוא ה-27B הנדיר שמתאים לכרטיס של 24GB ללא פשרות: הורדה של 17.1GB Q4_K_M, build עדכני של llama.cpp, ו-KV cache שזול מספיק כך שהקשר ארוך עולה כמעט כלום. הורד את הקובץ הזה אם יש לך את החומרה, זכור שהראייה (vision) דורשת את ה-mmproj הנפרד, וצפה למלכודת התבנית (template trap) בפעם הראשונה ששיחה מרובת-פניות נראית שוכחת. אם אין לך את החומרה, אותו דגם הוא API במחיר של $0.33/$2.40 עם שכבה חינמית מוגבלת בקצב, כך שאין שום סיבה להריץ קובץ 2-bit שאתה לא מרוצה ממנו. ה-GGUF הוא הנתיב החינמי; הוא פשוט כבר לא הנתיב היחיד.
