
Qwen3.8-27B סקירה: ה-27B במשקל פתוח שהוא "אופוס בבית" — נבחן מול ההייפ
- obsidianחדשQwen3.8 27B Uncensored (Aggressive)2026-08-15$0.40 / $4.21 לכל 1M טוקנים · 22 tok/s
- qwenחדשQwen: Qwen3.8 27B (free)2026-08-1343 tok/s
- deepseekחדשDeepSeek: DeepSeek V4 Pro 08132026-08-1253אינטליגנציה69כתיבת קוד
- grokחדשSpaceXAI: Grok 4.62026-08-1261אינטליגנציה77כתיבת קוד
- metaחדשMeta: Muse Spark 1.22026-08-0557אינטליגנציה72כתיבת קוד
- qwenQwen: Qwen3.8 Max2026-08-0358אינטליגנציה72כתיבת קוד
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3152אינטליגנציה69כתיבת קוד
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 לכל 1M טוקנים · 273 tok/s
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463אינטליגנציה78כתיבת קוד
- googleGoogle: Gemini 3.6 Flash2026-07-2152אינטליגנציה69כתיבת קוד
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137אינטליגנציה49כתיבת קוד
- metaMeta: Muse Spark 1.12026-07-1653אינטליגנציה71כתיבת קוד
- kimiMoonshotAI: Kimi K32026-07-1560אינטליגנציה76כתיבת קוד
- openaiOpenAI: GPT-5.6 Luna2026-07-0952אינטליגנציה71כתיבת קוד
- openaiOpenAI: GPT-5.6 Terra2026-07-0957אינטליגנציה77כתיבת קוד
- openaiOpenAI: GPT-5.6 Sol2026-07-0961אינטליגנציה77כתיבת קוד
- grokxAI: Grok 4.52026-07-0856אינטליגנציה72כתיבת קוד
- tencentTencent: Hy32026-07-0642אינטליגנציה59כתיבת קוד
Qwen3.8 27Bהוא דגם ה-27B בעל המשקלים הפתוחים הטוב ביותר שתוכל לארח בעצמך כרגע, וזה לא ממש קרוב. המשקלים שוחררו ב-14 באוגוסט 2026 תחת רישיון Apache 2.0: 27B צפוף (28B אם סופרים את מקודד הראייה) עם הקשר מקורי של 262K, קלט תמונה ווידאו מקורי, וציוני קידוד-סוכן שדווחו על ידי הספק ועומדים על רמה של Claude Opus 4.6 Max ומעלה — SWE-bench Pro 61.7, DeepSWE 1.1 42.2, LiveCodeBench v6 90.3. המחיר העיקרי הוא אפס: הורד 55.6 GB והרץ אותו. גם האזהרות אמיתיות — בדיקות עצמאיות מוצאות שהוא איטי בערך פי שלושה ורעב יותר בטוקנים מקודמו, כל מדד בכרטיס עדיין מדווח על ידי Alibaba, וההקשר של 1M הוא תכונה זמינה רק באירוח. פסק הדין: אם יש לך GPU של 24 GB או יותר ואתה רוצה יכולת קרובה לחזית ללא חשבונית מדודה, ארח אותו בעצמך — אבל היכנס בידיעה מדויקת היכן המספרים רכים.
קודם כל, פסק הדין: האם כדאי לך להשתמש ב-Qwen3.8 27B?
תשובה קצרה — כן עבור עומסים מקומיים ופרטיים; המתן למספרים של צד שלישי לפני החלטת רכש. Qwen3.8 27B הוא המודל הנדיר שבו המשקולות הפתוחות הן המוצר וה-API הוא הנוחות. מכיוון שהרישיון הוא Apache 2.0, המחיר לכל token הוא אפס לצמיתות ברגע שיש לך את החומרה, וכל מה שאתה בונה עליו לא יכול להיות ברישוי מחדש או לחיוב רטרואקטיבית. מה שאתה מוותר עליו הוא מהירות, אימות ונוחות.
אם אתה כבר מריץ Qwen3.6-27B ומרוצה ממנו, השדרוג אמיתי אבל לא בחינם במונחי זמן־שעון. אם הגעת לכאן מההשקה של Qwen3.8-Max, זה החבר הקטן יותר מאותו דור שניתן לאירוח עצמי — כלי שונה למשימה שונה.
העובדות המהירות, נבדקו ב-15 באוגוסט 2026
• שוחרר — המשקלים הפכו לזמינים ב-14 באוגוסט 2026 ב-Qwen/Qwen3.8-27B ב-Hugging Face, ומשוקפים ב-ModelScope; סיקור הנוקב באזורי זמן מציין גם את 13 באוגוסט, והשחרור הגיע כשבוע לאחר שהוכרז דור Qwen3.8.
• רישיון — Apache 2.0: הורדה, שינוי, הפצה מחדש, שימוש מסחרי, עם הענקת פטנט מפורשת. לצמיתות.
• פרמטרים — 27B דחוס (28B כולל מקודד הראייה), 64 שכבות, גודל חבוי 5,120, אוצר מילים 248,320.
• ארכיטקטורה — קשב היברידי: 48 שכבות קשב ליניארי של Gated DeltaNet לעומת 16 שכבות Gated Attention מלאות (יחס של 3:1). זו הסיבה שמודל צפוף עם 27B פרמטרים יכול להכיל קונטקסט מקורי של 262K טוקנים.
• הקשר — 262,144 טוקנים באופן מקורי; ניתן להרחיב ל-1,000,000 באמצעות YaRN בגרסה המתארחת.
• קלט — תמיכה מקורית בתמונה ובווידאו לצד טקסט; מחזיר טקסט. מקודד הראייה הוא הסיבה לכך שמספר הפרמטרים עומד על 28B.
• חשיבה — מצב חשיבה מופעל כברירת מחדל וניתן להשביתו לפי בקשה; reasoning_effort (נמוך/בינוני/גבוה) ו-preserve_thinking לריצות סוכן ארוכות.
• משקלים — 55.6 GB של safetensors בפורמט BF16 ב-18 מקטעים; FP8 ו-GGUFs של הקהילה גם זמינים.
המפרטים שלמעלה לקוחים מכרטיס המודל והתצורה של Hugging Face עבור Qwen3.8 27B, שנקראו היום. טענות הבנצ'מרק מדווחות על ידי Alibaba; נכון להיום אף מעבדה עצמאית לא שחזרה אותן.
במה Qwen3.8 27B באמת טוב
המקרה החזק ביותר הוא הנדסת תוכנה סוכנתית. Alibaba מדווחת על קפיצה של פי 3 ב-DeepSWE 1.1 לעומת ה-27B הקודם (42.2 לעומת 13.3) וציון גבוה מ-Claude Opus 4.6 Max ב-SWE-bench Pro (61.7 לעומת 53.4). אלה הם המספרים שהקנו לו את הכינוי "Opus at home" — 27B דחוס שעושה עבודת קידוד קרובה לחזית על חומרה שאדם יכול להחזיק בפועל.

שלושה דברים מלבד המספרים הגולמיים הופכים את זה לרכישה מוצדקת:
• רב-מודאלי טבעי.תמונה ווידאו כקלט, טקסט כפלט — מסמך עם דיאגרמות או סרטון הדגמה אינו מודל נפרד. הציונים של חשיבה חזותית (85.6 כשתכונת שרשרת החשיבה מופעלת, 94.6 מתמטיקה חזותית, שניהם לפי דיווח הספק) הם המקום שבו מקודד הראייה מוכיח את ערכו.
• 262K קונטקסט מקורי.משימות סוכן ארוכות טווח, בסיסי קוד גדולים ותמלילים רב-שעתיים נכנסים בחלון אחד. עיצוב הקשב הליניארי ההיברידי שומר על עלות ה-KV של אותו קונטקסט נמוכה יותר מאשר מודל קשב מלא טהור באותו גודל.
• משקלים חופשיים וקבועים. זה כל העניין בקטגוריה: מודל API סגור מושכר; Qwen3.8 27B הוא בבעלותך. ב-4-bit הוא רץ על כרטיס של 24 GB (מחלקת RTX 3090/4090), ו-AMD סיפקה תמיכה כבר ביום ההשקה (עד 24.5 tokens/s על Ryzen AI Max+ 395 ו-51.8 tokens/s על Radeon AI PRO R9700, לפי הבלוג של AMD).
כאן הסקירה נעשית מכוערת: מהירות, טוקנים ואימות
הבדיקות הבלתי תלויות עד כה הן מסגרת בדיקות של בודק אחד, לא מעבדה — אבל זה האות הטוב ביותר שיש לנו. הרצת Qwen3.8 27B נגד Qwen3.6-27B על עשר משימות בעולם האמיתי (שנשפטו על ידי GPT-5.5 באמצעות מסגרת ה-llmcompare), ה-3.8 ניצח בתשע מתוך עשר וקיבל ציון ממוצע של 8.838 לעומת 6.862 — "אחת מהקפיצות האינטליגנטיות המרשימות ביותר" שהבודק ראה. הוא גם השתמש בכמעט פי שלושה טוקנים והיה איטי באופן ניכר; משימה אחת ארכה בערך 600% יותר זמן. אז הקפיצה באיכות היא אמיתית, וכך גם המחיר בזמן שעון.
עוד ארבעה דברים לחובתו:
• אין עדיין בנצ'מרקים של צד שלישי. כל נתוני המפתח במאמר זה דווחו על ידי Alibaba נכון ל-15 באוגוסט. כרטיס הספק מפורט, אך שחזור במעבדה עצמאית טרם בוצע. אם החלטתך תלויה במספרים מאומתים, חכה להם — המשקלים עדיין יהיו שם.
• מינימום ה-VRAM הוא אמיתי.BF16 דורש GPU ברמת 80 GB. כדי להתאים לכרטיס של 24 GB צריך להריץ 4-bit, ודיווחי קהילה (שרשור תגובות ב-dev.to, ימים ספורים לאחר ההשקה) אומרים שגרסאות מכומתות "מאבדות מיקוד לאחר קונטקסט ארוך". משקלים רשמיים אם יש לך את ה-VRAM; מכומתים אם לא.
• הקשר של 1M זמין רק בגרסת האירוח. המשקלים הפתוחים מוגבלים ל-262K. ההרחבה ל-1M היא תכונה של Qwen Cloud בגרסת האירוח, לא משהו שעותק מקומי עושה כברירת מחדל.
• "עוקף את Opus" זקוק להסתייגויות.בנצ'מרקים של סוכנים מתגמלים התנהגויות ספציפיות למעטפת הבדיקה, ותגובה מובילה בפוסט ההשקה ב-dev.to ניסחה זאת בלא כפפות: "הם לא גוברים על Opus בשימוש בעולם האמיתי." תייחסו ללוח התוצאות כאל חסם עליון ביום מוצלח, לא כהבטחה.
איך זה משתלב במשפחת Qwen 3.8
• לעומת Qwen3.6-27B — אותה קטגוריית חומרה והקשר של 262K, אבל קפיצת יכולת משמעותית במחיר של מהירות ויעילות טוקנים. אם אתה כבר מריץ 3.6 ומוגבל על ידי תפוקה, להישאר עם זה מוצדק.
• לעומת Qwen3-Coder-30B-A3B — ה-Coder הוא MoE עם כ-3.3B פרמטרים פעילים שרץ הרבה יותר מהר (~90–110 אסימונים/שנייה). ה-27B הדחוס איטי יותר לכל אסימון אבל יורש את הרווחים האג'נטיים של הדור; אם הציונים של ה-27B בהנדסת תוכנה יעמדו במבחנים בלתי תלויים, תפקידו של ה-Coder-30B מצטמצם.
• לעומת Qwen3.8-Max — הדגם המוביל מסוג 2.4T MoE הוא מודל למרכז נתונים (דרך API בלבד, בסביבות $2/$6 למיליון טוקנים לפי הסיקורים שפורסמו) עם חלון הקשר של 1M ווידאו. ה-27B הוא הדגם הניתן לפריסה. הם עונים על שאלות שונות.
עלות: שאלת "מקומי לעומת API" — הוכרעה
עבור מודל סגור אתה משווה מחירים לפי טוקן. עבור Qwen3.8 27B העלות השולית של טוקן היא אפס בחומרה שלך — המחיר האמיתי הוא עלות ה-GPU הראשונית והזמן שלך. ב-4-bit מדובר בכרטיס 24 GB; ב-BF16 מדובר במכונה ברמה של 80 GB. אם אתה רק צריך להעריך את המודל, או שאין לך את החומרה, קיים מסלול אירוח: OrcaRouter מפרט כעת את Qwen3.8 27B עם שכבה חינמית מוגבלת בקצב שגובה $0 ומחזירה HTTP 429 כשחורגים מהמכסה, ובנוסף שכבה בתשלום במחיר של $0.33 לכל מיליון טוקני קלט ו-$2.40 לכל מיליון טוקני פלט (נבדק ב-15 באוגוסט). גרסת האירוח של Qwen Cloud, עם הקשר של 1M, מסומנת כ"בקרוב".

המסגור הכנה: עבור מודל עם משקלים פתוחים, ספק הוא נוחות, לא תלות. הדרגה החינמית היא הדרך הזולה ביותר להחליט אם הורדה של 55.6 GB שווה את זה. אבל ברגע שהחלטת, המשקלים הם העיקר — והם חינמיים.
איך לנסות את זה בפועל
• הערכה מהירה ביותר — נסה את השכבה החינמית המאורחנת עם מגבלת קצב; אם היא עונה על מה שאתה צריך, סיימת וזה לא עולה כלום.
• Real test on your hardware — download a community GGUF (the Q4_K_M build is roughly 17 GB and fits a 24 GB card) and run it in llama.cpp or Ollama. Pass the Jinja chat template or the model answers you in thought tags. For vision from a GGUF you also need the separate mmproj file. Our runbook on running Qwen3.8 27B locally walks through it.
• דיוק מלא — huggingface-cli download Qwen/Qwen3.8-27B אל GPU ברמת 80 GB.
• ודא את מה שהורדת — בדוק שהמפרסם הוא ארגון Qwen ואמת shards מול crc32.txt; מאגרים דומים הופיעו לפני המהדורה.
כאשר הביקורת הזו שגויה (ומי צריך לדלג על Qwen3.8 27B)
• אין לך GPU ולא תשכור אחד. השכבה החינמית מוגבלת בקצב, והשכבה בתשלום היא $0.33/$2.40 למיליון — מודל API קטן עשוי לשרת אותך בזול יותר ובאמינות רבה יותר. המודל הזה מיועד לאנשים שרוצים להחזיק באינפרנס.
• אתה צריך הסכם רמת שירות.הדרגה המאונחת היא בת ימים ספורים; דף המודל של OrcaRouter, שנקרא היום, מציג שיעור שגיאות של 33.3% בשבעת הימים האחרונים וזמן אחזור חציוני (p50) לטוקן הראשון של 225 אלפיות השנייה. זהו מודל חדש לגמרי תחת עומס מוקדם, לא חוזה ייצור. מי שמארח בעצמו צריך לנעול את ה-commit של ההורדה שלו ולשמור על גיבוי.
• אתה צריך אמות מידה מאומתות לצורך החלטת רכישה.מספרים המדווחים על ידי ספקים מועילים בכיוון, אך אינם ברמת רכש. חכה לשחזור בלתי תלוי.
• קונטקסט של 262K למשקלים פתוחים לא מספיק.ההרחבה ל-1M זמינה כיום רק בגרסה מאוחסנת (hosted).
• תפוקה היא צוואר הבקבוק שלך.סיכום בתפזורת או אצוות גדולות יפגעו: זהו מודל 27B דחוס שצורך גם בערך פי 3 טוקנים של קודמו. לעבודה בתפזורת זולה, מודל קטן יותר או מהיר יותר עדיף.
• אתה על כרטיס של 12 ג'יגה-בייט. GGUF דו-ביטיים נכנסים בקושי עם אובדן איכות ניכר; זה לא המודל בשבילך.

השורה התחתונה
Qwen3.8 27B הוא דגם ה-27B החזק ביותר עם משקלים פתוחים הקיים כיום, והוא חינמי לנצח תחת Apache 2.0. אם יש לכם GPU של 24 GB+ ואתם רוצים קידוד אייג'נטי, חלון הקשר של 262K, וקלט תמונה/וידאו מקורי ללא חיוב מדוד, זה מה שכדאי לקנות. הסיבות להמתין מוחשיות לא פחות: אתם צריכים אישור בלתי תלוי של מדדי ביצועים, SLA, חלון הקשר עם משקלים פתוחים של יותר מ-262K, או תפוקה גבוהה יותר מזו שדגם 27B צפוף נותן לכם. המודל יצא, המשקלים אמיתיים, והמספרים טובים — רק תזכרו של מי המספרים.
