
Qwen3.8-27B על Ollama: פקודה אחת, ארבעה קוונטים, ומה 'חינם' באמת עולה
- obsidianחדשQwen3.8 27B Uncensored (Aggressive)2026-08-15$0.40 / $4.21 לכל 1M טוקנים · 18 tok/s
- qwenחדשQwen: Qwen3.8 27B (free)2026-08-1335 tok/s
- deepseekחדשDeepSeek: DeepSeek V4 Pro 08132026-08-1253אינטליגנציה69כתיבת קוד
- grokחדשSpaceXAI: Grok 4.62026-08-1261אינטליגנציה77כתיבת קוד
- metaחדשMeta: Muse Spark 1.22026-08-0557אינטליגנציה72כתיבת קוד
- qwenחדשQwen: Qwen3.8 Max2026-08-0358אינטליגנציה72כתיבת קוד
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3152אינטליגנציה69כתיבת קוד
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 לכל 1M טוקנים · 2341 tok/s
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463אינטליגנציה78כתיבת קוד
- googleGoogle: Gemini 3.6 Flash2026-07-2152אינטליגנציה69כתיבת קוד
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137אינטליגנציה49כתיבת קוד
- metaMeta: Muse Spark 1.12026-07-1653אינטליגנציה71כתיבת קוד
- kimiMoonshotAI: Kimi K32026-07-1560אינטליגנציה76כתיבת קוד
- openaiOpenAI: GPT-5.6 Luna2026-07-0952אינטליגנציה71כתיבת קוד
- openaiOpenAI: GPT-5.6 Terra2026-07-0957אינטליגנציה77כתיבת קוד
- openaiOpenAI: GPT-5.6 Sol2026-07-0961אינטליגנציה77כתיבת קוד
- grokxAI: Grok 4.52026-07-0856אינטליגנציה72כתיבת קוד
- tencentTencent: Hy32026-07-0642אינטליגנציה59כתיבת קוד
הרץ אותו בפקודה אחת: ollama run qwen3.8:27b. זו כל התשובה לשאלה שהעמוד הזה עוסק בה. Qwen3.8 27B — המודל הצפוף של Alibaba עם 27 מיליארד פרמטרים, שמשקולותיו שוחררו ב-14 באוגוסט 2026 תחת רישיון Apache 2.0 — עלה לאוויר בספריית Ollama השבוע, ובניית ברירת המחדל כבר היא קוונטיזציה הגיונית של 18 GB מסוג Q4_K_M (17 GB משקולות ועוד מקודד ראייה של 931 MB). הוא רץ במלואו על GPU בעל 24 GB באורכי הקשר הרגילים, מתפצל למעבד כשהכרטיס שלך קטן יותר, ואינו עולה דבר לכל טוקן.
כל המידע כאן מתוארך ל-15 באוגוסט 2026. המפרטים מגיעים מכרטיס המודל Qwen3.8 27B; גדלי ההורדות, התגים ומספרי ההורדות מגיעים מהעמוד החי של ספריית Ollama; מדדי הביצועים מדווחים על ידי Alibaba ואין להם עדיין שכפול בלתי תלוי. המודל שוחרר לפני ימים ספורים, אז יש להתייחס לכל דבר שעשוי להשתנות כזמני.
השורה האחת שבאמת עובדת
אם כבר התקנת את Ollama, אתה במרחק שתי מילים:
ollama run qwen3.8:27b
התמיכה ב-Ollama נוספה בגרסה v0.32.12 — בהערת השחרור נכתב בפשטות: "מהדורה זו מוסיפה תמיכה ב-Qwen 3.8 27B." הריצה הראשונה מורידה את הבנייה המוגדרת כברירת מחדל (כ-18 GB, Q4_K_M), ואז מכניסה אותך ל-REPL של צ'אט עם מצב חשיבה מופעל כברירת מחדל. דף הספרייה מציג את הבנייה עם תגיות היכולות "vision tools thinking 27b", וכך אתה יודע שמסלולי הראייה וקריאת הכלים מחוברים לאותה הורדה. נכון לכתיבת שורות אלה, הדף מציג יותר מ-40,000 הורדות ורשימת תגיות שכבר מקיפה אחד-עשר וריאנטים.

שתי גרסאות שבאמת תשתמשו בהן:
• ollama run qwen3.8:27b-mlx — מהדורת ה‑Apple Silicon, אותו נפח של 18 GB, אבל מהודרת עבור Metal; זוהי הגרסה שפתק השחרור של Ollama מייעד במפורש "לביצועים מרביים ואיכות פלט המתאימים למשימות חוזרות ולסוכני קוד."
• ollama run qwen3.8:27b-q8_0 — קוונטיזציית 8 סיביות בגודל 30 גיגה-בייט, לכשיש לך VRAM מספיק ואתה רוצה משקלים קרובים יותר לדיוק מלא.
מה אתה בעצם מוריד
השם אומר 27B, אבל מספר הפרמטרים המלא הוא 28B: מודל שפה צפוף בגודל 27.3B בתוספת מקודד ראייה של 461M שמקנה לו קלט מובנה של תמונות ווידאו. שאר המפרט הראשי, ישירות מכרטיס המודל:
• 64 שכבות, גודל חבוי 5,120, אוצר מילים 248,320.
• קשב היברידי: 16 שכבות Gated Attention מלאות ו-48 שכבות Gated DeltaNet ליניאריות — תערובת ליניארית-רזה ביחס 3:1, והסיבה שמודל 27B מסוגל לשמר קונטקסט מקורי של 262,144 טוקנים (בר-הרחבה ל-1M) מבלי שמטמון KV יצרוך מרכז נתונים שלם.
• הבנה טבעית של תמונות ווידאו — "מתרשימים ומסמכים בתחום STEM ועד לסרטונים באורך שעות" הוא הניסוח של עליבאבא.
• Apache 2.0. הורידו אותו, שנו אותו, ומכרו מוצר המבוסס עליו. הרישיון הזה הוא העובדה המשפטית שעליה נשען כל ההיבט הכלכלי של שאר המאמר הזה.
ייחוס הדיוק המלא הוא BF16, ולכן קיימות התגיות של 56 GB; כל תגית קטנה יותר היא עסקה של דיוק תמורת טביעת רגל, והבנצ'מרקים של כרטיס המודל עצמו הם מה שאתה מוותר עליהם.
בחר קוונט, ואז בדוק את ה-VRAM שלך, לא להפך.
Ollama נותן לך אחד עשר תגים, אבל ההחלטה מצטמצמת לשלושה גדלים.
• 18 GB — Q4_K_M (ברירת מחדל). נכנס במלואו על כרטיס של 24 GB (בדרגת RTX 4090 / 5090) בהקשר רגיל, ועל כרטיסים של 16 GB עם העברה חלקית ל-CPU — איטי יותר, אבל זה עובד. זוהי הגרסה ל"פשוט להריץ את זה."
• 30 GB — Q8_0. משקלים ברמת דיוק כמעט מלאה, דורשים כ-40 ג'יגה-בייט של VRAM כדי להישאר לגמרי על ה-GPU. בדגם 27B, אתה כבר אמור לדעת למה אתה רוצה את הנאמנות הנוספת לפני שאתה משלם עליה.
• 56 GB — BF16. גרסת הייחוס. דורשת חומרה ברמת H100-class או 96 GB. אף אחד לא מריץ את זה על GPU צרכני, וזה בסדר.

המספר שמכשיל אנשים הוא מטמון ה-KV. הורדה של 18 GB לא אומרת ש-18 GB של VRAM מספיקים לסשן עם הקשר של 262K — בהקשר ארוך המטמון מוסיף כמה ג'יגה־בייטים על גבי המשקולות, ולכן כרטיס של 24 GB יחזיק את המודל בנוחות בהקשר של 8K–32K אבל לא ב-262K. בכרטיס גבולי, הפחת את ההקשר, לא את הקוונטיזציה.
Apple Silicon הוא יעד מדרגה ראשונה כאן.
הערת השחרור של Ollama בגרסה v0.32.12 מתייחסת ספציפית ל-macOS. באופן קונקרטי, הפקודה ollama run qwen3.8:27b-mlx זקוקה לכ-18 GB של זיכרון מאוחד, כך שמק עם 24 GB ומעלה מריץ אותה במלואה על ה-GPU עם מקום פנוי להקשר. קיימים גם תג MLX של 32 GB בפורמט mxfp8 ותג mlx-bf16 של 56 GB למכונות עם 64–128 GB. אם מק מסדרת M שלך עוקב אחר החדשות על דגמי השולחן, זו הגרסה שחיכית לה.
262K במפרט, פחות במושב
כרטיס המודל מפרט 262,144 טוקנים מקוריים, הניתנים להרחבה ל-1M; הדף בספרייה של Ollama מדווח על אותו חלון כ-256K. שני הדברים נכונים — 262,144 הוא 256K כפול 1024 — ואף אחד מהם לא אומר שכדאי להקליד את המספר הזה לתוך --num-ctx בכרטיס של 24 GB. מטמון ה-KV גדל בערך ליניארית עם גודל ההקשר, כך שבחומרה צרכנית תפעלו ב-16K–64K, לא ב-262K. התחילו עם ברירת המחדל של Ollama, העלו את --num-ctx רק כשמשימה באמת דורשת זאת, וזכרו שהנתון של 1M דורש את מנגנון ההרחבה בתוספת VRAM כדי להזין אותו.
מה שעדיין רעוע — קראו את זה לפני שאתם מהמרים על זה
• אין עדיין בנצ'מארקים בלתי תלויים. כל נתון בכרטיס המודל הוא דבריה של עליבאבא נכון ל-15 באוגוסט. השיפורים הנטענים לעומת Qwen3.6-27B גדולים — SWE-bench Pro 61.7 לעומת 53.5, Terminal Bench 2.1 73.0 לעומת 63.4, LiveCodeBench v6 90.3 לעומת 83.9, GPQA Diamond 89.2 לעומת 87.8 — וכולם נראים סבירים, ואף אחד מהם לא שוחזר על ידי מערכת בדיקה חיצונית. אל תבססו החלטת ייצור עליהם בלבד.
• סטאק הוויז'ן הוא בן ימים ספורים. דוח באגים מוקדם (ollama issue #17753) הראה שמבנה ה-Q4 מנתב קלט ראייה דרך מפענח Qwen3.5 ונכשל בטיפול בתמונות; זה תוקן תוך ימים ספורים ב-PR #17755, אבל הנתיב המולטי-מודאלי על מודל בן שבוע הוא בדיוק המקום שבו כדאי לבדוק לפני שמסתמכים עליו.
• הבנייה המוגדרת כברירת מחדל כוללת MTP. התג q4_K_M הוא גם הבנייה לחיזוי רב-טוקנים — פענוח מהיר יותר, והסיבה לכך ש"18 GB" ו-"27B" יכולים להתקיים יחד ללא סתירה.
• תוויות קוונטיזציה עלולות להטעות ב-Apple. תגי ה-18 GB "mlx" ו-"nvfp4" נבדלים בקוונטיזציה — NVFP4 הוא פורמט FP4 של NVIDIA — לכן ב-Mac העדיפו את גרסת ה-mlx הרגילה, אלא אם כן אתם זקוקים ספציפית לגרסת FP8/FP4 עבור GPU מסוג Blackwell.
"Free" עושה הרבה עבודה בכותרת הזו.
אחסון עצמי של 27B הוא חינם לכל טוקן, אבל הוא לא חינם. הניסוח הכנה הוא שלוש אפשרויות שעולות במטבעות שונים.
• הרץ את זה בעצמך (Ollama). $0 לכל טוקן, לא מקוון, בלתי מוגבל, פרטי — והחומרה היא שלך. GPU של 24 GB או Mac של 18 GB+ הם רכישה משמעותית, וכך גם החשמל וזמן ההתקנה. זו ההחלטה הנכונה כאשר Qwen3.8 27B הופך לכלי עבודה יומיומי.
• בצעו קריאה ל-API מוגבל קצב בעלות $0. OrcaRouter משרת את Qwen3.8 27B על התשתית שלו בעלות אפסית (מזהה דגם qwen/qwen3.8-27b-free, $0 לבקשה, מוגבל קצב) — מכיוון שהמשקלים פתוחים, אין עלות ספק per-token שצריך להעביר. זו הבחירה הנכונה כשאתם רוצים לנסות את הדגם בלי לקנות חומרה כדי לבדוק גרסה בת שבוע.
• קרא ל-API ללא הגבלה. אותו מודל ללא מגבלת קצב עולה $0.33 למיליון אסימוני קלט ו-$2.40 למיליון פלט ב-OrcaRouter (qwen/qwen3.8-27b, הקשר 262K, קלט טקסט, תמונה ווידאו). זו הבחירה הנכונה כשאתה צריך קנה מידה ייצור ולא רוצה לטפל ב-GPU.

החשבון שמכריע ביניהם: שימוש מזדמן מחזיר את עצמו טוב יותר ב-$0 או ב-$0.33/$2.40 מאשר במחיר של GPU; שימוש אינטראקטיבי יומיומי זול יותר מקומית; תפוקת ייצור מתמשכת היא הזולה ביותר כ-API שאינך צריך לשמור עליו פעיל. דרישות פרטיות ועבודה לא מקוונת מעבירות אותך לעמודה הראשונה, לא משנה מה אומר החשבון.
כשההמלצה הזו שגויה
• אתה באמת צריך קונטקסט של 100K+. המודל יכול לעשות זאת; כרטיס ה-24 GB שלך לא יכול. בקונטקסט ארוך אמיתי, GPU של 40 GB+ או API עם קונטקסט ארוך יותר אינו מותרות.
• אתה צריך וידאו בפרודקשן היום. הבאג בפרסר של מסלול הראייה תוקן זה עתה; וידאו בפרודקשן על מודל מולטימודלי בן שבוע הוא הימור שלא כדאי לקחת בלי גיבוי.
• אתה רוצה מקביליות.GPU צרכני אחד מייצר פלט אחד או שניים בו-זמנית. דגם 27B הוא לא שרת הגשה.
• אתה על חומרה עם CPU בלבד. דגם 27B ב-4-bit על CPU הוא הדגמה איטית, לא כלי. שימוש ב-API הוא הבחירה הכנה עד שיהיה לך GPU.
השורה התחתונה
Qwen3.8 27B על Ollama הוא הדרך הקלה ביותר להריץ 27B מהדור הנוכחי שמישהו הוציא עד כה: פקודה אחת, ברירת מחדל של 18 GB שמתאימה לכרטיס של 24 GB, build מהשורה הראשונה ל-Apple Silicon, וחופש Apache 2.0. הקוונט שכדאי לבחור הוא כמעט תמיד ברירת המחדל Q4_K_M — עברו ל-q8_0 רק כשאתם יכולים למדוד את ההבדל. וה"חינם" מותנה: אם תיגעו במודל מדי פעם, ה-API עם הגבלת הקצב ועלות $0 חופשי יותר מקניית חומרה; אם הוא הופך לכלי היומיומי שלכם, העותק המקומי הוא הדבר הזול ביותר שבבעלותכם. אמתו את המספרים לפני שאתם בונים עליהם — כל האמור במאמר זה היה נכון ב-15 באוגוסט 2026, והמודל הזה משתנה מיום ליום.
