כרטיס כותרת ראשי המציג Qwen3.8-27B עם Unsloth, עם כותרת המשנה 'להריץ, לכמת או לכוונן אותו מקומית', סמל חלון מסוף, ותגיות המציגות 'UD-Q4_K_XL 17.9GB' ו-'Studio no-config'.
Guides & Insights

Qwen3.8-27B עם Unsloth: להריץ, לכמת או לכוונן אותו מקומית

מחבר

Magnus Corvin

תאריך פרסום

מודלים אחרונים · 20צפו בכל המודלים
בנצ'מרקים: Artificial Analysis · מתעדכן יומית
חזרה לכל הפוסטים

כן — Unsloth מריץ את Qwen3.8 27B, וזו הדרך המהירה ביותר להעלות את המודל החדש של Ali​baba תחת רישיון Apache-2.0 על כרטיס המסך שלכם. התשובה כולה בשורה אחת: פתחו את Unsloth Studio, חפשו "Qwen3.8 27B", בחרו UD-Q4_K_XL (17.9GB) על כרטיס של 24GB, וצ'וטטו תוך פחות מדקה. מאחורי הלחיצה הזו, Unsloth שחרר שלושה דברים באותו שבוע שבו שוחררו המשקלים (13–14 באוגוסט 2026): את unsloth/Qwen3.8-27B-GGUF, החבילה הבנויה על קוונטיזציית Unsloth Dynamic V3.0 (תצוגה מקדימה), תמיכה מלאה ב-Unsloth Studio וב-Desktop, ואת v0.1.800-beta, שחרור הכולל ייצוא GGUF, זיהוי imatrix ושיפורי התאמת VRAM. הוא גם מבצע fine-tuning למודל — הטענה של Unsloth היא אימון מהיר פי 2 עם 70% פחות VRAM. Qwen3.8 27B הוא מודל ראייה-שפה צפוף עם 27 מיליארד פרמטרים, שתשומת הלב ההיברידית שלו משאירה רק 16 מתוך 64 שכבות בתשומת לב מלאה, ולכן קובץ 4-bit נכנס לכרטיסים שרוב מודלי ה-27B לא יכולים להיכנס אליהם.

לגבי מקורות: עובדות המודל רשמיות, מכרטיס המודל Qwen3.8 27B ב-Hugging Face, אומתו ב-15 באוגוסט 2026. התמיכה של Unsloth, גדלי הקוונטיזציה, דרישות ה-VRAM ופקודות ההתקנה מגיעים מהערות השחרור והתיעוד של Unsloth, באותו יום. מחיר ה-API נלקח חי מהקטלוג של OrcaRouter, באותו יום. הטענות של Unsloth "2× faster, 70% less VRAM" ו-"by far the strongest model for its size" הן טענות ספק, שלא שוחזרו באופן בלתי תלוי.

מה פירוש "Qwen3.8 + Unsloth": ארבעה דברים שונים

Unsloth הוא ארבעה דברים נפרדים, ותוצאות חיפוש מילות המפתח מבלבלות ביניהם. לדעת איזה מהם אתה צריך זה חצי מההתקנה:

unsloth/Qwen3.8-27B-GGUF — קבצי המשקלים המכומתים ב-Hugging Face, 21 קוונטים בתוספת מקרן ראייה. נבנה עם Dynamic V3.0 (תצוגה מקדימה), לא עם Dynamic 2.0 הישן יותר (שהוכרז ב-24 באפריל 2025 וקדם למודל זה). זהו מסלול "הורדת קובץ", שמיש מכל build של llama.cpp.

Unsloth Studio — אפליקציית דפדפן שאתה מתקין או מריץ מ-Hugging Face Space. חפש במאגר הדגמים, לחץ על קוונט, שוחח עם כלים. אין צורך בהגדרת תבנית או פרמטרי ניבוי ידנית.

Unsloth Desktop — אפליקציית ה-GUI המקומית ל-macOS, Windows ולינוקס, שעוטפת את Studio ואת האימון. כאן מתבצע ה-fine-tuning של "מהיר פי 2 עם 70% פחות VRAM".

ספריית ה-Python של unsloth — from unsloth import FastLanguageModel, ממשק ה-API לכיוונון עדין של QLoRA המשמש במחברות ובסקריפטים.

הערות השחרור של Unsloth עבור v0.1.800-beta, שכותרתו "Release Qwen3.8 27B", אומרות ש-Qwen3.8 27B וה-Qwen3.8-2.4T-A95B בעל 2.4T פרמטרים "ניתן כעת להריץ מקומית ב-Unsloth", שה-27B "רץ על 17GB RAM באמצעות Unsloth Dynamic GGUFs", וש"ניתן גם לבצע fine-tune ל-Qwen3.8 27B ב-Unsloth". אותו שחרור מוסיף קוונטים NVFP4, בודק שטח דיסק לפני ייצוא GGUF, מזהה תמיכה אמיתית ב-imatrix של GGUF ב-Studio, ומאיץ את ה-inference בעד 10% על GGUF עם מגבלת VRAM ניתנת לכוונון.

A card titled 'Three routes to Qwen3.8-27B with Unsloth' with three columns: Run - Studio one-click or GGUF file via llama.cpp; Quantize - Dynamic V3.0 preview, 2-bit to 8-bit, UD-Q4_K_XL 17.9GB recommended; Fine-tune - QLoRA, 2x faster with 70% less VRAM.

בחר את הקוונט לפי ה-VRAM, לא לפי ויברס

טבלת הזיכרון של Unsloth היא בסך ה-RAM וה-VRAM (או זיכרון מאוחד), וזוהי ההנחיה הרשמית. Qwen3.8 27B ב-4 ביט דורש 17–19GB; RTX 4090 עם 24GB, RTX 5080, או Mac עם זיכרון מאוחד של 24GB הם הרף הריאלי להגדרה נוחה של 4 ביט. שלוש הבחירות שמכסות כמעט את כולם:

12GB → UD-IQ2_XXS ב-9.0GB — הקובץ היחיד שמתאים בשלמותו; צפו לאובדן איכות נראה לעין. עשו בחירה זו במודעות.

16GB → UD-Q3_K_XL ב-13.4GB — הקובץ ה-3-bit הטוב ביותר, לפי הבורר של Unsloth עצמו.

24GB → UD-Q4_K_XL ב-17.9GB — קובץ ה-4-bit המומלץ והתשובה המוגדרת כברירת מחדל של מאמר זה.

48–64GB → UD-Q8_K_XL ב-31.5GB — כמעט ללא אובדן על תחנת עבודה או מערך GPU כפול.

הסולם המלא, מרשימת הקבצים של unsloth/Qwen3.8-27B-GGUF ומהתיעוד של Unsloth, שניהם אומתו ב-15 באוגוסט 2026: UD-Q8_K_XL 31.5GB, UD-Q6_K_XL 25.9GB, UD-Q5_K_XL 20.2GB, UD-Q4_K_XL 17.9GB, UD-Q3_K_XL 13.4GB, UD-Q2_K_XL 10.7GB, UD-IQ3_XXS 11.9GB, UD-IQ2_M 10.3GB, UD-IQ2_XXS 9.0GB. גם ה-K-quants הסטנדרטיים (Q4_K_M 17.1GB, Q8_0 29.0GB) נמצאים שם, והחבילה כוללת מקרן ראייה (mmproj-BF16, 931MB) כך שתמונות ווידאו עובדים אם טוענים אותו. Unsloth מכנה את הסולם כולו "Dynamic V3.0 (preview)" — חדש יותר מ-Dynamic 2.0 שתראו בכתבות ישנות יותר, שנבנה עבור מודלים ששוחררו לפני יותר משנה.

A VRAM picker card for Qwen3.8-27B with Unsloth, listing the official memory ladder: 2-bit 11-13GB, 3-bit 13-16GB, 4-bit 17-19GB, 6-bit 24GB, 8-bit 31GB, BF16 56GB, with UD-Q4_K_XL 17.9GB highlighted as the pick for 24GB cards, UD-Q3_K_XL 13.4GB for 16GB, and UD-IQ2_XXS 9.0GB for 12GB.

הרץ את זה עם Unsloth בשלוש דקות

המסלול בלחיצה אחת: ב-macOS או Linux, הרץ curl -fsSL https://unsloth.ai/install.sh | sh, ולאחר מכן unsloth studio -p 8888 ופתח http://127.0.0.1:8888. ב-Windows: irm https://unsloth.ai/install.ps1 | iex. אם אתה רוצה אפס התקנות לחלוטין, Studio של Unsloth זמין גם כ-Hugging Face Space — פתח אותו בדפדפן, חפש "Qwen3.8 27B", ובחר quant לפי כמות הזיכרון שברשותך. Studio מכוון אוטומטית את פרמטרי הדגימה ואת תבנית הצ'אט, מעביר לזיכרון RAM כאשר ה-VRAM נגמר, ומזהה תצורות מרובות GPU — החלק של "ללא הגדרות" הוא אמיתי, וזו הדרך המהירה ביותר להריץ את המודל של השבוע.

הנתיב של קבצים תחילה, אם אתה כבר משתמש ב-llama.cpp: הורד קוונט אחד והרץ אותו ישירות. אלה הפקודות של Unsloth עצמן, מאומתות מול התיעוד שלהן.

hf download unsloth/Qwen3.8-27B-GGUF --local-dir unsloth/Qwen3.8-27B-GGUF --include "*UD-Q4_K_XL*"

./llama.cpp/llama-cli --model unsloth/Qwen3.8-27B-GGUF/Qwen3.8-27B-UD-Q4_K_XL.gguf --temp 1.0 --top-p 0.95 --top-k 20 --min-p 0.0

ערכי הדגימה האלה הם הגדרות מצב החשיבה המומלצות של כרטיס המודל. החלף את תבנית ה-glob של --include ל-*UD-Q3_K_XL* בכרטיס עם 16GB, והוסף --mmproj שמצביע על mmproj-BF16.gguf של החבילה אם אתה צריך יכולות ראייה. אזהרה אחת: llama.cpp חייב להיות build עדכני — הקובץ רושם את הארכיטקטורה החדשה qwen35, וכל גרסה מלפני שבוע ההשקה מסרבת לטעון אותו.

כוונן אותו עם Unsloth

כוונון עדין הוא המקום שבו Unsloth זוכה למוניטין שלה: הספרייה טוענת לאימון מהיר פי 2 עם 70% פחות זיכרון VRAM לעומת Transformers + PEFT הסטנדרטיים, וזה מה שהופך QLoRA על 27B לאפשרי בכרטיס צרכני יחיד. נקודת הכניסה לכיוונון היא הפשוט unsloth/Qwen3.8-27B מאגר (דף קבצי safetensors, 28B) במקום חבילת GGUF. הדפוס הסטנדרטי של Unsloth QLoRA, המיושם על מודל זה:

from unsloth import FastLanguageModel

model, tokenizer = FastLanguageModel.from_pretrained("unsloth/Qwen3.8-27B", max_seq_length=8192, load_in_4bit=True)

model = FastLanguageModel.get_peft_model(model, r=16)

אז לולאת trl.SFTTrainer רגילה על מערך הנתונים שלך. הקטע הזה הוא תבנית QLoRA הסטנדרטית מהתיעוד של Unsloth — טענות מדדי הביצועים הן של Unsloth עצמו ולא דבר ששחזרתי — וקיימים שני הסתייגויות: הליבות של Unsloth מתקנות את שכבות טרנספורמר הטקסט, כך שתכנן לטפל במקודד הראייה בנפרד, ושמור על חבילת unsloth בגרסה הנוכחית, כי הארכיטקטורה הזו בת ימים ספורים ואי-התאמות גרסאות נכשלות בקול רם.

במה Unsloth Studio מטפל עבורך

הרצת GGUF ידנית פירושה ללכת על חבל דק בין גודל הקונטקסט, פריקת RAM וקריאות לכלים. Studio מקפל את זה לברירות מחדל: הוא קובע את גודל הקונטקסט לפי הזיכרון שפנוי בפועל, פורק מודלי ראייה שאינם בשימוש כדי לפנות VRAM לשיחה או אימון, מזהה תצורות ריבוי GPU, ומחבר חיפוש אינטרנט, הרצת קוד וחיבורי סוכנים (Claude Code, Codex, MCP) ישירות מהקופסה. מהדורת v0.1.800-beta גם הדקה את החלקים שכואבים בפועל: ייצוא GGUF בודק כעת מקום בדיסק לפני תחילת מיזוג ארוך במקום להיכשל באמצע, Studio מזהה אם ה‑GGUF שהוא מייצא אכן תומך imatrix (כדי שלא תבזבזו ריצה), ושומרי הזיכרון כבר לא מזמינים מראש כמות עודפת של זיכרון GPU. עבור מודל בן שלושה ימים, "ללא תצורה" עושה עבודה אמיתית.

מקומי בחינם לעומת API בתשלום: הכלכלה הכנה

ההבדל המרכזי בין Unsloth לבין API אינו איכות — אלא מי הבעלים של החומרה. Unsloth הוא המסלול החינמי: עלות שולית אפסית לכל טוקן, שום דבר לא יוצא מהמכונה שלך, אין מגבלות קצב, ושליטה מלאה במשקלים. זה לא חינמי במונחים מוחלטים: אתה מספק את ה-GPU והחשמל, וקובץ של 2 ביט על כרטיס של 12GB הוא חוויה מתפשרת. Qwen3.8 27B הוא מודל דחוס ותומך ראייה, כך שב-4 ביט מדובר ב-17.9GB של משקלים לפני קונטקסט; המכונה היא מחיר הכניסה.

מסלול ה-API קיים מכיוון שהמשקלים הם תחת רישיון Apache-2.0, כך שכל אחד יכול לארח אותם בעלות שולית כמעט אפסית. Qwen3.8 27B נמצא בקטלוג של OrcaRouter כיום במחיר של $0.33 למיליון אסימוני קלט ו-$2.40 למיליון פלט, המודל באירוח עצמי על התשתית שלנו — ללא מחיר ספק שצריך להעביר — עם חלון הקשר של 262K אסימונים וקלט טקסט, תמונה ווידאו. מכיוון שהמשקלים פתוחים, קיימת גם שכבה חינמית מוגבלת בקצב שגובה $0 לכל בקשה. חודש מייצג של 10 מיליון אסימונים עם נתח כניסה של 70% עולה כ-$9.51 בשכבה בתשלום. אם כבר יש לך כרטיס של 24GB, הרצה מקומית מנצחת בעלות; אם לא, השכרת אסימונים במחיר הזה עדיפה על קניית כרטיס לפרויקט צד, והשכבה החינמית היא הדרך הכנה לבדוק את המודל לפני שמתחייבים לחומרה כלשהי.

A cost comparison card titled 'Local free vs API paid', with the left column 'Unsloth local' listing zero marginal cost, 17.9GB weights for 4-bit, you supply the GPU, and the right column 'Qwen3.8-27B API' listing 0.33 dollars per million input, 2.40 dollars per million output, a free rate-limited tier, and about 9.51 dollars for a 10-million-token month.

כאשר Unsloth היא התשובה השגויה

Unsloth Studio ו-GGUF pack הם הבחירה הנכונה למכונה אחת. הם בחירה שגויה כאשר:

יש לך כרטיס מסדרת Blackwell RTX 50. גרסאות הקוונטיזציה של unsloth/Qwen3.8-27B-NVFP4 מהירות בערך פי 1.5 מזו של BF16 באותו VRAM ומשתמשות במטמון FP8 KV לקונטקסט ארוך יותר. המסלול הזה עובר דרך vLLM או SGLang, לא דרך GGUF ולא דרך Studio.

בסביבת ייצור, אתה צריך את החלון המקורי המלא של 262K או את הרחבת YaRN של 1M.מודל ראייה צפוף בהקשר ארוך הוא כבד; קביעת גודל ההקשר של Unsloth תרוץ בשמחה עם הקשר קצר יותר עבורך, אבל מחסנית שרתים עם ניהול KV תקין מנצחת אפליקציה מקומית.

אתה משרת משתמשים רבים. Unsloth היא אפליקציה מקומית וספריית כוונון עדין, לא שרת רב-דיירים. עבור מקביליות, אוטוסקיילינג וערבויות זמינות, אתה רוצה נקודת קצה מתארחת.

אין לך GPU בכלל. תשובה כנה: 27B עם 2-bit על כרטיס של 12GB גרוע במידה ניכרת מאותו דגם שמוגש כראוי. השתמש קודם בשכבת ה-API החינמית; אם זה מספיק טוב, קנה חומרה כשמקרה השימוש מוכח.

אתם רוצים לכוונן את הצד החזותי. ההאצות של Unsloth מכוונות לשכבות הטרנספורמר של הטקסט; כיוונון רב-מודאלי מלא דורש סטאק טכנולוגי שונה.

השורה התחתונה

Qwen3.8 27B עם Unsloth היא בעיה פתורה החל מהשבוע: {{1}}התקינו את Studio, בחרו UD-Q4_K_XL לכרטיס 24GB (UD-Q3_K_XL ל-16GB, UD-IQ2_XXS ל-12GB){{/1}}, ו{{2}}המודל רץ ללא קונפיגורציה וללא חיוב לפי טוקן{{/2}}. {{3}}מסלול ה-fine-tuning הוא אמיתי{{/3}} ו{{4}}טענות המהירות של Unsloth הן הסיבה ש-QLoRA של 27B הוא מעשי על כרטיס אחד{{/4}}. {{5}}דעו שסולם הקוונטיזציה הוא Dynamic V3.0 (Preview), לא Dynamic 2.0 שמאמרים ישנים יותר מתארים{{/5}}; {{6}}שמרו על llama.cpp מעודכן{{/6}}; ו{{7}}אם אין ברשותכם החומרה, אותם משקלים זמינים כ-API במחיר $0.33/$2.40, כולל מסלול חינמי עם מגבלת קצב{{/7}} — {{8}}אז אין שום סיבה להריץ קובץ 2-bit שאינכם מרוצים ממנו{{/8}}. {{9}}הרצה מקומית היא המסלול החינמי{{/9}}, ו{{10}}לראשונה במחלקת משקל זו, היא גם המסלול הקל{{/10}}.

© 2026 OrcaRouter

לספקים

מפעילים פלטפורמת הסקה (inference)? הציגו את המודלים שלכם ב-OrcaRouter.

צרו קשר

הצטרפו לקהילה שלנו

DiscordEmailXGitHubYouTube