כרטיס כותרת גיבור {{1}}הקורא Qwen3.8-27B GGUF עם כותרת המשנה 'the right quant for your GPU', סמלת הורדה, וצ'יפים של קבצים עבור {{2}}Q4_K_M 17.1GB ו-{{3}}UD-IQ2 9.0GB{{/3}}.{{/2}}{{/1}}
Guides & Insights

Qwen3.8-27B GGUF: איזו קוונטיזציה להוריד עבור כרטיס המסך שלך

מחבר

Gideon Frost

תאריך פרסום

מודלים אחרונים · 20צפו בכל המודלים
בנצ'מרקים: Artificial Analysis · מתעדכן יומית
חזרה לכל הפוסטים

הורד את חבילת unsloth/Qwen3.8-27B-GGUF, והתאם את הקובץ לכרטיס שבאמת בבעלותך. זו כל התשובה: GPU של 24GB (RTX 4090 או 3090) אמור למשוך Q4_K_M בגודל 17.1GB; GPU של 16GB אמור למשוך IQ4_XS בגודל 15.7GB (או Q3_K_M בגודל 13.8GB אם אתה רוצה מרווח הקשר); GPU של 12GB מוגבל לקבצי 2-bit, UD-IQ2_XXS בגודל 9.0GB, וזו פשרה שיש לעשות במודע. Qwen3.8 27B — המודל הדחוס של Ali​baba עם 27 מיליארד פרמטרים, משקלים תחת רישיון Apache 2.0 שפורסמו ב-13–14 באוגוסט 2026 — פועל מקומית בעלות נמוכה במיוחד, מכיוון שתשומת הלב ההיברידית שלו שומרת במטמון רק 16 מתוך 64 השכבות, כך שקוונטיזציה של 4-bit על 24GB נושאת בנוחות 32K–64K טוקנים של הקשר. והפורמט GGUF הוא הדרך היחידה בעלות שולית אפסית: אין צורך במפתח API, אין חיוב לפי טוקן, ושום נתון לא יוצא מהמחשב שלך.

בנוגע למקורות: הארכיטקטורה, חלון ההקשר והרישיון רשמיים, מתוך כרטיס הדגם Qwen3.8 27B ב-Hugging Face, אומתו ב-15 באוגוסט 2026. גדלי ה-GGUF לקוחים ממאגרי ה-GGUF של unsloth ו-ggml-org, באותו תאריך. ההנחיות לזיכרון VRAM לכל GPU הן ההמלצה הרשמית של unsloth. הערכות הבתים של מטמון KV-cache ונתוני ה-tokens-per-second נמדדו על ידי הקהילה בימים הראשונים לאחר השחרור, ואינם מפרטי יצרן. כל benchmark המוזכר להלן מדווח על ידי Ali​baba ולא שוחזר.

בורר הקבצים, שורה אחת לכל כמות.

UD-IQ2_XXS — 9.0GB — ההתאמה הנוחה היחידה לכרטיס 12GB; צפו לאובדן איכות נראה לעין.

UD-Q2_K_XL — 10.7GB — כרטיסי 12GB, עם כמעט ללא הקשר פנוי.

Q3_K_M — 13.8GB — כרטיסי 16GB שרוצים מרווח לקונטקסט.

IQ4_XS — 15.7GB — כרטיסי 16GB: הקוונט הגדול ביותר שמתאים בשלמותו.

Q4_K_M — 17.1GB — כרטיסי 24GB: הנקודה המתוקה, והקובץ שהמאמר הזה מפנה אליו.

Q5_K_M — 19.8GB — 24GB, תוך ויתור על מרווח הקשר תמורת רווח קטן באיכות.

Q6_K — 22.9GB — נכנס ב-24GB אם דוחסים; כמעט ללא אובדן.

Q8_0 — 29.0GB — 32GB, פיצול לשני כרטיסים, או העברת עומס למעבד.

BF16 — 54.7GB — כרטיסי שרת והתקני CPU כבדי RAM; דיוק ייחוס.

שתי חבילות, שני גדלי Q4_K_M: של unsloth הוא 17.1GB; של ggml-org הוא 19.0GB. החבילה של unsloth משתמשת בקוונטיזציה של Dynamic V3.0 (preview) עבור קבצי ה-UD-* שלה, והיא ברירת המחדל של רוב האפליקציות המקומיות; החבילה של ggml-org כוללת את ה-K-quants הסטנדרטיים ובנוסף את ראש חיזוי מרובה-הטוקנים (multi-token-prediction) הנפרד המשמש לפענוח ספקולטיבי. כל אחת מגרסאות Q4_K_M עובדת — ההבדל הוא כמה מאות מגה-בייט וקובץ ה-MTP.

A file-picker card for the Qwen3.8-27B GGUF pack, listing quantizations with sizes and target GPUs: UD-IQ2_XXS 9.0GB for 12GB cards, Q3_K_M 13.8GB and IQ4_XS 15.7GB for 16GB cards, Q4_K_M 17.1GB highlighted for 24GB cards, Q5_K_M 19.8GB and Q6_K 22.9GB for 24GB, Q8_0 29GB for 32GB-plus, and BF16 54.7GB for servers.

מדוע ה-27B הזה נכנס לכרטיסים קטנים יותר מרוב הכרטיסים

Qwen3.8 27B כולל 64 שכבות, אך רק 16 מהן משתמשות ב-attention מלא. 48 השכבות האחרות משתמשות ב-Gated DeltaNet linear attention, השומר מצב רקורסיבי בגודל קבוע במקום מטמון key-value שגדל. פריסת הבלוקים בכרטיס המודל עצמו היא 3×(Gated DeltaNet → FFN) עבור כל 1×(Gated Attention → FFN) — יחס היברידי של 3:1. ההשפעה המעשית: מטמון ה-KV הוא בערך רבע ממה שמודל 27B צפוף רגיל צריך עבור אותו הקשר. מדידות קהילתיות השבוע העמידו את המטמון על כ-0.5GB בהקשר של 8K, 2.0GB ב-32K, ו-16.4GB בחלון המקורי המלא של 262K. זה הופך את ההמלצה הרגילה — רוב תקציב ה-VRAM שלך הולך למשקולות, לא להקשר, וכרטיס עם 24GB יכול להריץ Q4_K_M עם הקשר של 64K–96K בלי מאמץ. אתה יכול לכווץ את המטמון עוד יותר עם הדגל --cache-type-k של llama.cpp, שמכמת את המטמון עצמו.

A card titled 'Qwen3.8-27B — the KV cache is the cheap part', showing that only 16 of 64 layers keep a cache and listing community-estimated cache sizes of about 0.5GB at 8K context, 2.0GB at 32K, 4.0GB at 64K, 8.0GB at 128K, and 16.4GB at 262K, roughly four times less than a dense 27B.

שלוש מלכודות שיפילו אותך ביום הראשון

גרסאות ישנות של llama.cpp דוחות את הקובץ. ה-GGUF מגדיר את הארכיטקטורה החדשה qwen35, אז אתה צריך build עדכני — כל דבר מלפני שבוע ההשקה מסרב לטעון אותו עם שגיאת ארכיטקטורה. עדכן את llama.cpp קודם, לפני שתוריד.

מלכודת התבנית. תבנית הצ'אט הרשמית של Jinja עוטפת כל תור של העוזר בבלוק חשיבה גם כאשר מסלול החשיבה ריק, וזה יוצר בלוקים מקוננים והיסטוריה קטועה בשיחות מרובי-תורים — זה נראה כאילו המודל שכח את מה שאמרת. הריץ llama.cpp עם --jinja, והעדף חבילה שמגיעה עם chat_template.jinja מתוקן.

Vision דורש קובץ נפרד. טקסט עובד מהקופסה; תמונות ווידאו פשוט אינן עושות דבר, אלא אם כן טוענים גם את מקרן ה-mmproj, כ-0.9GB. זה לא מופיע בדף ה-GGUF repo של unsloth — קח אותו מהמאגר הבסיסי או מהחבילה של ggml-org. אם אתה מתכנן להזין מסמכים או צילומי מסך, הוסף את --mmproj לפקודת השרת.

הרץ את זה: הפקודות

llama.cpp, ברגע שיש לך build עדכני:

llama-server -m Qwen3.8-27B-Q4_K_M.gguf --ctx-size 32768 --n-gpu-layers 99 --jinja --cache-type-k q8_0

...והוסף --mmproj Qwen3.8-27B-mmproj-bf16.gguf אם אתה צריך ראייה.

Ollama, אם אתה רוצה את רשומת הספרייה: ollama pull qwen3.8:27b, ולאחר מכן ollama run qwen3.8:27b. LM Studio ו-Unsloth Desktop קולטים את תבנית הצ'אט ואת פריקת ה-RAM באופן אוטומטי — הם המסלול הכי פחות טרחני להרצה ראשונה.

Local vs API: הכלכלה הכנה

ה-GGUF הוא המסלול החינמי: אפס עלות שולית, ללא הגבלות קצב, שום דבר לא יוצא מהמחשב שלך. הוא לא המסלול הזול במונחים מוחלטים — אתה מספק את ה-GPU עם 24GB (RTX 3090 משומש או RTX 4090 חדש, בתוספת חשמל), וקובץ של 2-bit על כרטיס של 12GB הוא חוויה מתפשרת.

מסלול ה-API קיים מכיוון שהמשקולות (weights) הן ברישיון Apache 2.0, כך שהעלות השולית של מתן השירות קרובה לאפס וכל אחד יכול לארח. Qwen3.8 27B זמין ב-OrcaRouter היום ב-$0.33 למיליון אסימוני קלט ו-$2.40 למיליון אסימוני פלט — מחיר הרשימה של הספק מועבר ללא תוספת מחיר — ובגלל שהמשקולות פתוחות, קיימת גם שכבה חינמית מוגבלת בקצב שגובה $0 לבקשה ומחזירה HTTP 429 כשחורגים מהמכסה. חודש מייצג של 10 מיליון אסימונים עם 70% נתח קלט עולה כ-$9.51 בשכבה בתשלום. אם כבר יש לכם GPU, הרצה מקומית משתלמת יותר מבחינת עלות; אם לא, שכירת אסימונים עדיפה על קניית כרטיס לפרויקט צדדי.

The OrcaRouter model page for Qwen3.8 27B, showing the input price of 0.33 dollars per million tokens, output price of 2.40 dollars per million tokens, a 262K-token context window, and text, image and video input.

כשההמלצה הזו שגויה

Q4_K_M על 24GB הוא ברירת המחדל, לא התשובה האוניברסלית. בחר במשהו אחר כאשר:

אתה צריך איכות מקסימלית בשרת או בתחנת עבודה — Q8_0 ב-29GB או BF16 ב-54.7GB עם offload ל-CPU ו-RAM, לא קובץ 4-bit.

אתה על כרטיס Blackwell RTX 50-series — גרסת ה-NVFP4 מהירה בערך פי 1.5 באותם 24GB של VRAM ומשתמשת ב-FP8 KV cache להקשר ארוך יותר. ב-5090, NVFP4 עוקף כל GGUF במודל הזה.

אתה צריך את ההקשר המלא של 262K — הקצה כ-16GB למטמון בנוסף למשקלים; זה מוריד כרטיס 24GB ל-Q3_K_M, או מאלץ קוונטיזציה של KV.

אתה מסתמך על פענוח ספקולטיבי — בחר בחבילת ggml-org, ששומרת על ראש חיזוי רב-טוקנים; חלק מהקוונטים מסירים אותו כדי לחסוך כ-0.5GB.

יש לך רק 12GB — תשובה כנה: 27B ב-2-bit גרוע באופן ניכר מאותו דגם שמוגש כראוי. נסה את שכבת ה-API החינמית לפני שאתה מתחייב להרצה מקומית ב-2-bit; אם זה מספיק טוב, ה-GGUF יכול לחכות עד שהחומרה תדביק את הפער.

השורה התחתונה

Qwen3.8 27B הוא ה-27B הנדיר שמתאים לכרטיס של 24GB ללא פשרות: הורדה של 17.1GB Q4_K_M, build עדכני של llama.cpp, ו-KV cache שזול מספיק כך שהקשר ארוך עולה כמעט כלום. הורד את הקובץ הזה אם יש לך את החומרה, זכור שהראייה (vision) דורשת את ה-mmproj הנפרד, וצפה למלכודת התבנית (template trap) בפעם הראשונה ששיחה מרובת-פניות נראית שוכחת. אם אין לך את החומרה, אותו דגם הוא API במחיר של $0.33/$2.40 עם שכבה חינמית מוגבלת בקצב, כך שאין שום סיבה להריץ קובץ 2-bit שאתה לא מרוצה ממנו. ה-GGUF הוא הנתיב החינמי; הוא פשוט כבר לא הנתיב היחיד.

© 2026 OrcaRouter

לספקים

מפעילים פלטפורמת הסקה (inference)? הציגו את המודלים שלכם ב-OrcaRouter.

providers@orcarouter.ai

הצטרפו לקהילה שלנו

Discordsupport@orcarouter.aiXGitHubYouTube