
Qwen3.8-27B עם Unsloth: להריץ, לכמת או לכוונן אותו מקומית
- obsidianחדשQwen3.8 27B Uncensored (Aggressive)2026-08-15$0.40 / $4.21 לכל 1M טוקנים · 18 tok/s
- qwenחדשQwen: Qwen3.8 27B (free)2026-08-1335 tok/s
- deepseekחדשDeepSeek: DeepSeek V4 Pro 08132026-08-1253אינטליגנציה69כתיבת קוד
- grokחדשSpaceXAI: Grok 4.62026-08-1261אינטליגנציה77כתיבת קוד
- metaחדשMeta: Muse Spark 1.22026-08-0557אינטליגנציה72כתיבת קוד
- qwenחדשQwen: Qwen3.8 Max2026-08-0358אינטליגנציה72כתיבת קוד
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3152אינטליגנציה69כתיבת קוד
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 לכל 1M טוקנים · 2341 tok/s
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463אינטליגנציה78כתיבת קוד
- googleGoogle: Gemini 3.6 Flash2026-07-2152אינטליגנציה69כתיבת קוד
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137אינטליגנציה49כתיבת קוד
- metaMeta: Muse Spark 1.12026-07-1653אינטליגנציה71כתיבת קוד
- kimiMoonshotAI: Kimi K32026-07-1560אינטליגנציה76כתיבת קוד
- openaiOpenAI: GPT-5.6 Luna2026-07-0952אינטליגנציה71כתיבת קוד
- openaiOpenAI: GPT-5.6 Terra2026-07-0957אינטליגנציה77כתיבת קוד
- openaiOpenAI: GPT-5.6 Sol2026-07-0961אינטליגנציה77כתיבת קוד
- grokxAI: Grok 4.52026-07-0856אינטליגנציה72כתיבת קוד
- tencentTencent: Hy32026-07-0642אינטליגנציה59כתיבת קוד
כן — Unsloth מריץ את Qwen3.8 27B, וזו הדרך המהירה ביותר להעלות את המודל החדש של Alibaba תחת רישיון Apache-2.0 על כרטיס המסך שלכם. התשובה כולה בשורה אחת: פתחו את Unsloth Studio, חפשו "Qwen3.8 27B", בחרו UD-Q4_K_XL (17.9GB) על כרטיס של 24GB, וצ'וטטו תוך פחות מדקה. מאחורי הלחיצה הזו, Unsloth שחרר שלושה דברים באותו שבוע שבו שוחררו המשקלים (13–14 באוגוסט 2026): את unsloth/Qwen3.8-27B-GGUF, החבילה הבנויה על קוונטיזציית Unsloth Dynamic V3.0 (תצוגה מקדימה), תמיכה מלאה ב-Unsloth Studio וב-Desktop, ואת v0.1.800-beta, שחרור הכולל ייצוא GGUF, זיהוי imatrix ושיפורי התאמת VRAM. הוא גם מבצע fine-tuning למודל — הטענה של Unsloth היא אימון מהיר פי 2 עם 70% פחות VRAM. Qwen3.8 27B הוא מודל ראייה-שפה צפוף עם 27 מיליארד פרמטרים, שתשומת הלב ההיברידית שלו משאירה רק 16 מתוך 64 שכבות בתשומת לב מלאה, ולכן קובץ 4-bit נכנס לכרטיסים שרוב מודלי ה-27B לא יכולים להיכנס אליהם.
לגבי מקורות: עובדות המודל רשמיות, מכרטיס המודל Qwen3.8 27B ב-Hugging Face, אומתו ב-15 באוגוסט 2026. התמיכה של Unsloth, גדלי הקוונטיזציה, דרישות ה-VRAM ופקודות ההתקנה מגיעים מהערות השחרור והתיעוד של Unsloth, באותו יום. מחיר ה-API נלקח חי מהקטלוג של OrcaRouter, באותו יום. הטענות של Unsloth "2× faster, 70% less VRAM" ו-"by far the strongest model for its size" הן טענות ספק, שלא שוחזרו באופן בלתי תלוי.
מה פירוש "Qwen3.8 + Unsloth": ארבעה דברים שונים
Unsloth הוא ארבעה דברים נפרדים, ותוצאות חיפוש מילות המפתח מבלבלות ביניהם. לדעת איזה מהם אתה צריך זה חצי מההתקנה:
• unsloth/Qwen3.8-27B-GGUF — קבצי המשקלים המכומתים ב-Hugging Face, 21 קוונטים בתוספת מקרן ראייה. נבנה עם Dynamic V3.0 (תצוגה מקדימה), לא עם Dynamic 2.0 הישן יותר (שהוכרז ב-24 באפריל 2025 וקדם למודל זה). זהו מסלול "הורדת קובץ", שמיש מכל build של llama.cpp.
• Unsloth Studio — אפליקציית דפדפן שאתה מתקין או מריץ מ-Hugging Face Space. חפש במאגר הדגמים, לחץ על קוונט, שוחח עם כלים. אין צורך בהגדרת תבנית או פרמטרי ניבוי ידנית.
• Unsloth Desktop — אפליקציית ה-GUI המקומית ל-macOS, Windows ולינוקס, שעוטפת את Studio ואת האימון. כאן מתבצע ה-fine-tuning של "מהיר פי 2 עם 70% פחות VRAM".
• ספריית ה-Python של unsloth — from unsloth import FastLanguageModel, ממשק ה-API לכיוונון עדין של QLoRA המשמש במחברות ובסקריפטים.
הערות השחרור של Unsloth עבור v0.1.800-beta, שכותרתו "Release Qwen3.8 27B", אומרות ש-Qwen3.8 27B וה-Qwen3.8-2.4T-A95B בעל 2.4T פרמטרים "ניתן כעת להריץ מקומית ב-Unsloth", שה-27B "רץ על 17GB RAM באמצעות Unsloth Dynamic GGUFs", וש"ניתן גם לבצע fine-tune ל-Qwen3.8 27B ב-Unsloth". אותו שחרור מוסיף קוונטים NVFP4, בודק שטח דיסק לפני ייצוא GGUF, מזהה תמיכה אמיתית ב-imatrix של GGUF ב-Studio, ומאיץ את ה-inference בעד 10% על GGUF עם מגבלת VRAM ניתנת לכוונון.

בחר את הקוונט לפי ה-VRAM, לא לפי ויברס
טבלת הזיכרון של Unsloth היא בסך ה-RAM וה-VRAM (או זיכרון מאוחד), וזוהי ההנחיה הרשמית. Qwen3.8 27B ב-4 ביט דורש 17–19GB; RTX 4090 עם 24GB, RTX 5080, או Mac עם זיכרון מאוחד של 24GB הם הרף הריאלי להגדרה נוחה של 4 ביט. שלוש הבחירות שמכסות כמעט את כולם:
• 12GB → UD-IQ2_XXS ב-9.0GB — הקובץ היחיד שמתאים בשלמותו; צפו לאובדן איכות נראה לעין. עשו בחירה זו במודעות.
• 16GB → UD-Q3_K_XL ב-13.4GB — הקובץ ה-3-bit הטוב ביותר, לפי הבורר של Unsloth עצמו.
• 24GB → UD-Q4_K_XL ב-17.9GB — קובץ ה-4-bit המומלץ והתשובה המוגדרת כברירת מחדל של מאמר זה.
• 48–64GB → UD-Q8_K_XL ב-31.5GB — כמעט ללא אובדן על תחנת עבודה או מערך GPU כפול.
הסולם המלא, מרשימת הקבצים של unsloth/Qwen3.8-27B-GGUF ומהתיעוד של Unsloth, שניהם אומתו ב-15 באוגוסט 2026: UD-Q8_K_XL 31.5GB, UD-Q6_K_XL 25.9GB, UD-Q5_K_XL 20.2GB, UD-Q4_K_XL 17.9GB, UD-Q3_K_XL 13.4GB, UD-Q2_K_XL 10.7GB, UD-IQ3_XXS 11.9GB, UD-IQ2_M 10.3GB, UD-IQ2_XXS 9.0GB. גם ה-K-quants הסטנדרטיים (Q4_K_M 17.1GB, Q8_0 29.0GB) נמצאים שם, והחבילה כוללת מקרן ראייה (mmproj-BF16, 931MB) כך שתמונות ווידאו עובדים אם טוענים אותו. Unsloth מכנה את הסולם כולו "Dynamic V3.0 (preview)" — חדש יותר מ-Dynamic 2.0 שתראו בכתבות ישנות יותר, שנבנה עבור מודלים ששוחררו לפני יותר משנה.

הרץ את זה עם Unsloth בשלוש דקות
המסלול בלחיצה אחת: ב-macOS או Linux, הרץ curl -fsSL https://unsloth.ai/install.sh | sh, ולאחר מכן unsloth studio -p 8888 ופתח http://127.0.0.1:8888. ב-Windows: irm https://unsloth.ai/install.ps1 | iex. אם אתה רוצה אפס התקנות לחלוטין, Studio של Unsloth זמין גם כ-Hugging Face Space — פתח אותו בדפדפן, חפש "Qwen3.8 27B", ובחר quant לפי כמות הזיכרון שברשותך. Studio מכוון אוטומטית את פרמטרי הדגימה ואת תבנית הצ'אט, מעביר לזיכרון RAM כאשר ה-VRAM נגמר, ומזהה תצורות מרובות GPU — החלק של "ללא הגדרות" הוא אמיתי, וזו הדרך המהירה ביותר להריץ את המודל של השבוע.
הנתיב של קבצים תחילה, אם אתה כבר משתמש ב-llama.cpp: הורד קוונט אחד והרץ אותו ישירות. אלה הפקודות של Unsloth עצמן, מאומתות מול התיעוד שלהן.
hf download unsloth/Qwen3.8-27B-GGUF --local-dir unsloth/Qwen3.8-27B-GGUF --include "*UD-Q4_K_XL*"
./llama.cpp/llama-cli --model unsloth/Qwen3.8-27B-GGUF/Qwen3.8-27B-UD-Q4_K_XL.gguf --temp 1.0 --top-p 0.95 --top-k 20 --min-p 0.0
ערכי הדגימה האלה הם הגדרות מצב החשיבה המומלצות של כרטיס המודל. החלף את תבנית ה-glob של --include ל-*UD-Q3_K_XL* בכרטיס עם 16GB, והוסף --mmproj שמצביע על mmproj-BF16.gguf של החבילה אם אתה צריך יכולות ראייה. אזהרה אחת: llama.cpp חייב להיות build עדכני — הקובץ רושם את הארכיטקטורה החדשה qwen35, וכל גרסה מלפני שבוע ההשקה מסרבת לטעון אותו.
כוונן אותו עם Unsloth
כוונון עדין הוא המקום שבו Unsloth זוכה למוניטין שלה: הספרייה טוענת לאימון מהיר פי 2 עם 70% פחות זיכרון VRAM לעומת Transformers + PEFT הסטנדרטיים, וזה מה שהופך QLoRA על 27B לאפשרי בכרטיס צרכני יחיד. נקודת הכניסה לכיוונון היא הפשוט unsloth/Qwen3.8-27B מאגר (דף קבצי safetensors, 28B) במקום חבילת GGUF. הדפוס הסטנדרטי של Unsloth QLoRA, המיושם על מודל זה:
from unsloth import FastLanguageModel
model, tokenizer = FastLanguageModel.from_pretrained("unsloth/Qwen3.8-27B", max_seq_length=8192, load_in_4bit=True)
model = FastLanguageModel.get_peft_model(model, r=16)
אז לולאת trl.SFTTrainer רגילה על מערך הנתונים שלך. הקטע הזה הוא תבנית QLoRA הסטנדרטית מהתיעוד של Unsloth — טענות מדדי הביצועים הן של Unsloth עצמו ולא דבר ששחזרתי — וקיימים שני הסתייגויות: הליבות של Unsloth מתקנות את שכבות טרנספורמר הטקסט, כך שתכנן לטפל במקודד הראייה בנפרד, ושמור על חבילת unsloth בגרסה הנוכחית, כי הארכיטקטורה הזו בת ימים ספורים ואי-התאמות גרסאות נכשלות בקול רם.
במה Unsloth Studio מטפל עבורך
הרצת GGUF ידנית פירושה ללכת על חבל דק בין גודל הקונטקסט, פריקת RAM וקריאות לכלים. Studio מקפל את זה לברירות מחדל: הוא קובע את גודל הקונטקסט לפי הזיכרון שפנוי בפועל, פורק מודלי ראייה שאינם בשימוש כדי לפנות VRAM לשיחה או אימון, מזהה תצורות ריבוי GPU, ומחבר חיפוש אינטרנט, הרצת קוד וחיבורי סוכנים (Claude Code, Codex, MCP) ישירות מהקופסה. מהדורת v0.1.800-beta גם הדקה את החלקים שכואבים בפועל: ייצוא GGUF בודק כעת מקום בדיסק לפני תחילת מיזוג ארוך במקום להיכשל באמצע, Studio מזהה אם ה‑GGUF שהוא מייצא אכן תומך imatrix (כדי שלא תבזבזו ריצה), ושומרי הזיכרון כבר לא מזמינים מראש כמות עודפת של זיכרון GPU. עבור מודל בן שלושה ימים, "ללא תצורה" עושה עבודה אמיתית.
מקומי בחינם לעומת API בתשלום: הכלכלה הכנה
ההבדל המרכזי בין Unsloth לבין API אינו איכות — אלא מי הבעלים של החומרה. Unsloth הוא המסלול החינמי: עלות שולית אפסית לכל טוקן, שום דבר לא יוצא מהמכונה שלך, אין מגבלות קצב, ושליטה מלאה במשקלים. זה לא חינמי במונחים מוחלטים: אתה מספק את ה-GPU והחשמל, וקובץ של 2 ביט על כרטיס של 12GB הוא חוויה מתפשרת. Qwen3.8 27B הוא מודל דחוס ותומך ראייה, כך שב-4 ביט מדובר ב-17.9GB של משקלים לפני קונטקסט; המכונה היא מחיר הכניסה.
מסלול ה-API קיים מכיוון שהמשקלים הם תחת רישיון Apache-2.0, כך שכל אחד יכול לארח אותם בעלות שולית כמעט אפסית. Qwen3.8 27B נמצא בקטלוג של OrcaRouter כיום במחיר של $0.33 למיליון אסימוני קלט ו-$2.40 למיליון פלט, המודל באירוח עצמי על התשתית שלנו — ללא מחיר ספק שצריך להעביר — עם חלון הקשר של 262K אסימונים וקלט טקסט, תמונה ווידאו. מכיוון שהמשקלים פתוחים, קיימת גם שכבה חינמית מוגבלת בקצב שגובה $0 לכל בקשה. חודש מייצג של 10 מיליון אסימונים עם נתח כניסה של 70% עולה כ-$9.51 בשכבה בתשלום. אם כבר יש לך כרטיס של 24GB, הרצה מקומית מנצחת בעלות; אם לא, השכרת אסימונים במחיר הזה עדיפה על קניית כרטיס לפרויקט צד, והשכבה החינמית היא הדרך הכנה לבדוק את המודל לפני שמתחייבים לחומרה כלשהי.

כאשר Unsloth היא התשובה השגויה
Unsloth Studio ו-GGUF pack הם הבחירה הנכונה למכונה אחת. הם בחירה שגויה כאשר:
• יש לך כרטיס מסדרת Blackwell RTX 50. גרסאות הקוונטיזציה של unsloth/Qwen3.8-27B-NVFP4 מהירות בערך פי 1.5 מזו של BF16 באותו VRAM ומשתמשות במטמון FP8 KV לקונטקסט ארוך יותר. המסלול הזה עובר דרך vLLM או SGLang, לא דרך GGUF ולא דרך Studio.
• בסביבת ייצור, אתה צריך את החלון המקורי המלא של 262K או את הרחבת YaRN של 1M.מודל ראייה צפוף בהקשר ארוך הוא כבד; קביעת גודל ההקשר של Unsloth תרוץ בשמחה עם הקשר קצר יותר עבורך, אבל מחסנית שרתים עם ניהול KV תקין מנצחת אפליקציה מקומית.
• אתה משרת משתמשים רבים. Unsloth היא אפליקציה מקומית וספריית כוונון עדין, לא שרת רב-דיירים. עבור מקביליות, אוטוסקיילינג וערבויות זמינות, אתה רוצה נקודת קצה מתארחת.
• אין לך GPU בכלל. תשובה כנה: 27B עם 2-bit על כרטיס של 12GB גרוע במידה ניכרת מאותו דגם שמוגש כראוי. השתמש קודם בשכבת ה-API החינמית; אם זה מספיק טוב, קנה חומרה כשמקרה השימוש מוכח.
• אתם רוצים לכוונן את הצד החזותי. ההאצות של Unsloth מכוונות לשכבות הטרנספורמר של הטקסט; כיוונון רב-מודאלי מלא דורש סטאק טכנולוגי שונה.
השורה התחתונה
Qwen3.8 27B עם Unsloth היא בעיה פתורה החל מהשבוע: {{1}}התקינו את Studio, בחרו UD-Q4_K_XL לכרטיס 24GB (UD-Q3_K_XL ל-16GB, UD-IQ2_XXS ל-12GB){{/1}}, ו{{2}}המודל רץ ללא קונפיגורציה וללא חיוב לפי טוקן{{/2}}. {{3}}מסלול ה-fine-tuning הוא אמיתי{{/3}} ו{{4}}טענות המהירות של Unsloth הן הסיבה ש-QLoRA של 27B הוא מעשי על כרטיס אחד{{/4}}. {{5}}דעו שסולם הקוונטיזציה הוא Dynamic V3.0 (Preview), לא Dynamic 2.0 שמאמרים ישנים יותר מתארים{{/5}}; {{6}}שמרו על llama.cpp מעודכן{{/6}}; ו{{7}}אם אין ברשותכם החומרה, אותם משקלים זמינים כ-API במחיר $0.33/$2.40, כולל מסלול חינמי עם מגבלת קצב{{/7}} — {{8}}אז אין שום סיבה להריץ קובץ 2-bit שאינכם מרוצים ממנו{{/8}}. {{9}}הרצה מקומית היא המסלול החינמי{{/9}}, ו{{10}}לראשונה במחלקת משקל זו, היא גם המסלול הקל{{/10}}.
