כרטיס כותרת עם הכיתוב 'Qwen3.8-27B', כותרת משנה 'משקלים פתוחים מגיעים השבוע', טקסט עליון 'Alibaba Qwen - מה שידוע לנו עד כה', ושורת תאריך 'השבוע של 10 באוגוסט 2026' לצד אייקון קופסה פתוחה ואייקון לוח שנה.
Guides & Insights

Qwen3.8-27B משקלים פתוחים: המקסימום שוחרר, ה-27B לא — מה שאנחנו יודעים עכשיו

מחבר

Rowan Sterling

תאריך פרסום

מודלים אחרונים · 20צפו בכל המודלים →
בנצ'מרקים: Artificial Analysis · מתעדכן יומית
חזרה לכל הפוסטים

ב-13 באוגוסט 2026, שבוע המשקלים הפתוחים שאליבאבא הבטיחה לדור Qwen3.8 שלה התפצל לשניים. משקלי דגם הדגל מסוג Max — Qwen3.8-2.4T-A95B, מודל sparse mixture-of-experts עם 2.4 טריליון פרמטרים, והשחרור הראשון של Qwen ברמת Max שאי פעם היה ניתן להורדה — שוחרר בפועל ב-Hugging Face וב-ModelScope, והוכרז בשעת לילה מאוחרת אמש דרך קהילת ModelScope. המודל הקטן יותר שעליו דף זה מדבר, Qwen3.8-27B, לא שוחרר: למרות שהיה אמור לצאת באותו שבוע של 10 באוגוסט, עדיין אין לו מאגר רשמי, כרטיס מודל, קובץ רישיון או מדד ביצועים משלו, וכלי מעקב של צד שלישי מתארים כעת את שחרורו כדחוי ללא תאריך חדש. השאלה שדף 'מה ידוע עד כה' הזה נבנה כדי לענות עליה — "מתי בעצם יוצא ה-27B?" — הפכה לשתי שאלות: מדוע משקלי ה-Max שוחררו ראשונים, ומה קרה ל-27B?

זהו עדיין מאמר מסוג "מה ידוע לנו עד כה", ולא סקירה.Qwen3.8-Max, דגם הדגל של ה-API, פעיל מאז ה-3 באוגוסט במחיר של 2/6 דולר למיליון טוקנים; דגם ה-open-weights הבסיסי שלו, Qwen3.8-2.4T-A95B, הפך זמין להורדה ב-13 באוגוסט; ומשקלי Qwen3.8-27B仍未 פורסמו. כל טענה להלן מסומנת בהתאם כ"מאומתת", "מדווחת על ידי היצרן" או "מוערכת על ידי הקהילה".

האות, ומה שהשבוע באמת סיפק

האות המוקדם היה פוסט ב-X מאת @kimmonismus, שסימן את "השבוע הבא" כשבוע שצריך לעקוב אחריו: "Q​wen-3.8 27b - Grok 4.6", כש-Astra בולטת בהיעדרה מהרשימה. מחצית ה-Grok של אותו שבוע שוחררה ב-12 באוגוסט. מחצית ה-Q​wen התפצלה לשניים. מה שהפוסט תפס היה המצב רוח בקרב אנשים שצופים בשחרורי מודלים למחייתם — השחרור של Qwe​n3.8 במשקלים פתוחים היה האירוע המרכזי בלוח השנה, והשבוע הגיע כשהפרטים עדיין לא ננעלו. שבוע לאחר מכן, הפרטים נפתרו חלקית: אחד משני שחרורי המשקלים הפתוחים שהובטחו הגיע, וזה לא זה שהפוסט ציין.

מה אושר

• המשפחה אמיתית והוכרזה רשמית. Alibaba חשפה את משפחת מודלי הבסיס Qwe​n3.8 ב-3 באוגוסט 2026, לאחר איטרציית תצוגה מקדימה באמצע יולי.

• Qwen3.8-Max הושק באותו יום.דגל ה-API — מודל ערבוב-מומחים עם 2.4 טריליון פרמטרים, בערך 95 מיליארד פרמטרים פעילים, חלון הקשר של מיליון טוקנים, וקלט של טקסט, תמונה ווידאו — עלה לאוויר ב-API של Q​wen במחיר של $2/$6 למיליון טוקנים. הוא זמין גם דרך OrcaRouter באותו מחיר רשום, המועבר ללא תוספת (0% markup).

• המשקלים הפתוחים של Max שוחררו ב־13 באוגוסט. Qwen3.8-2.4T-A95B — מודל הבסיס שעליו בנוי ה־API של Qwen3.8-Max — נהיה זמין להורדה מ־Hugging Face ומ־ModelScope, עם גרסה מכומתת FP8 לצידו. זוהי המהדורה הראשונה אי פעם של משקלים פתוחים ברמת Max של Q​wen. המודל הניתן להורדה הוא טקסט בלבד עם מצב חשיבה מופעל בכפייה, בעל הקשר (קונטקסט) מקורי של 256K טוקנים הניתן להרחבה לכמיליון בערך, וניתן לפריסה על SGLang, vLLM ו־TokenSpeed.

• Qwen3.8-27B הוא הדגם הקטן יותר בעל המשקלים הפתוחים במשפחה — ועדיין לא שוחרר. אליבאבא מיצבה אותו כנתיב הריאלי לפריסה מקומית ו-On-Premise, והתחייבה לפרסם את המשקלים שלו ב-Hugging Face וב-ModelScope לצד אלה של Max. נכון ל-13 באוגוסט, עדיין אין מאגר רשמי של Qwen3.8-27B. ההתחייבות הייתה אמיתית; האספקה טרם התרחשה.

• קיים ציון עצמאי ראשון לדור הזה. Artificial Analysis ממקמת את Qwen3.8-Max במדד אינטליגנציה של 56 בכ-$1.14 בערך למשימה — טוב באמת, עם האזהרות שמתלוות לכל דגל חדש בן ימים.

מה שאנחנו באמת יודעים על ה-27B

התמצית הכנה היא ש-"Qwen3.8-27B" הוא עדיין בעיקר שם ומספר פרמטרים. העובדות המאושרות הן שמדובר במודל עם כ-27 מיליארד פרמטרים, שהוא החבר בעל המשקלים הפתוחים בדור Qwe​n3.8, ושהוא מיועד לעבודה על GPU יחיד ובאתר הלקוח, ולא לאשכול של מאות GPU. דניאל האן מ-Unsloth מדווח שהוא אמור להתאים לכ-17GB של VRAM עם ההשקה — כרטיס מסך פרוסומר יחיד.

כל השאר לא אושר. אליבאבא לא פרסמה האם ה-27B הוא מודל צפוף או מודל מומחים מעורבים (mixture-of-experts), אורך חלון ההקשר שלו, אילו מודאליויות הוא מקבל, או כל תוצאות בנצ'מארק משל עצמה. מה שהשתנה השבוע הוא התזמון: ה-Max וה-27B הובטחו לאותו שבוע, ורק ה-Max הגיע. מעקבים של צד שלישי מדווחים כעת שה-27B נדחה ללא תאריך חדש — קריאה של הקהילה, לא הצהרה רשמית של אליבאבא, וייתכן שהמאגר עדיין יועלה לפני תום השבוע המובטח. אך נכון לכתיבת שורות אלו, הארגון הרשמי Qwen ב-Hugging Face אינו מפרט Qwen3.8-27B, וכמות המאגרים של "Qwen3.8-27B-FP8", "-GGUF" ו-"-MLX" שמופיעים בחיפוש הם כרטיסי מקום של הקהילה עם ספירת הורדות בספרה בודדת, לא המהדורה הרשמית.

נקודת הייחוס השימושית היא עדיין ה-27B של הדור הקודם: Qwen3.5-27B, מודל צפוף עם משקלים פתוחים וחלון הקשר של 32K. זהו חסם תחתון סביר ל-Qwen3.8-27B, ותזכורת לכך שמודלים בטווח 27B של Q​wen נבנו היסטורית כדי לרוץ על חומרה שבבעלות מפתחים בפועל.

ה-Max הוא נקודת הייחוס למה שה-27B עשוי לרשת.

A comparison scoreboard for Qwen3.8-Max and Qwen3.8-27B, contrasting the Max's 2.4T MoE total parameters, ~95B active params, 1M-token context, / pricing and AA Index 56 with the 27B's ~27B params, TBD context, TBD architecture, self-host and no independent score yet.

ה-27B לא יגיע לתקרה הגולמית של ה-Max, אבל המספרים של ה-Max — שפורסמו כעת בכרטיס מודל אמיתי — קובעים ציפיות לגבי איך נראים שיפורי הדור הזה. בהערכות שאליבאבא עצמה ערכה למודל המשקלים הפתוחים, Qwen3.8-2.4T-A95B משיג 93.0 ב-PaperBench, 86.1 ב-OSworld-Verified, 91.5 ב-CAD פרמטרי, 67.7 ב-SWE-bench Pro ו-86.6 ב-Terminal-Bench 2.1, כשהספק טוען לשוויון עם Claude Opus 4.8, Claude Fable 5, GPT-5.6 Sol ו-Gemini 3.1 Pro. אלה נתונים המדווחים על ידי הספק, שפורסמו בחומרי ההשקה וטרם שוחזרו על ידי מעבדה עצמאית. הרווח הסוכני שהשקת ה-API טענה לו — קפיצה של FrontierSWE מ-40.7 ל-73.5 בדור יחיד — נכלל באותם חומרי השקה. אם אפילו חלק מהשיפור הזה יזלוג מטה אל ה-27B, זה יאפס את המשמעות של "מודל קידוד מקומי טוב" במחלקה שלו.

ניואנס אחד שחשוב לזכור: ה-Max הניתן להורדה אינו זהה ל-Max של ה-API. Qwen3.8-2.4T-A95B הוא טקסט בלבד עם מצב חשיבה מאולץ, בעוד שה-API של Qwen3.8-Max מוסיף קלט חזותי, מצב ללא חשיבה, וקונטקסט של 1M-token כברירת מחדל. הפער הזה הוא בדיוק מסוג הדברים ש-27B עשוי לרשת — וכדאי לזכור כשקוראים כותרות Benchmark של "Qwe​n3.8" מבלי לבדוק על איזו גרסה הן מדברות.

המחיר הוא הנקודה שבה ה-Max הכי מוצדק: 2$/$6 למיליון טוקנים על פני כל הקונטקסט של 1M טוקנים ב-API, ללא תוספת תשלום עבור prompt ארוך. זה אגרסיבי עבור API מתקדם, וזה משמעותי לחישובי הניתוב — במספרים אלה, דור ה-3.8 הופך לאופציה עבור עומסי עבודה שנהגו כברירת מחדל לדגמי דגל יקרים יותר.

מה בעצם יכול להריץ את זה

A hardware reality-check card for Qwen3.8-27B showing community-projected VRAM requirements: Q4_K_M ~16GB, Q3_K_M ~13GB, Q6_K ~21GB, FP8 ~27GB, full precision H100 80GB, with a footer noting these are community projections based on Qwen 3.6-27B quant sizes.

עבור ה-27B, עליבאבא עדיין לא פרסמה דרישות חומרה, כך שהמספרים במחזור נותרים הערכות קהילה המבוססות על טבלת הקוונטיזציה של Q​wen 3.6-27B — אומדנים, לא מפרטים. טווחי העבודה שרוב האנשים מתכננים סביבם נותרו ללא שינוי:

• קוונטיזציית Q4_K_M, ~16GB VRAM — כרטיס RTX 4090 או מקבילו, נקודת האיזון שרוב המפתחים המקומיים יכוונו אליה.

• קוונטיזציית Q3_K_M, כ-13GB VRAM — מתאים לכרטיס 12GB כמו RTX 3060 באיכות מופחתת.

• Q6_K quant, ~21GB VRAM — כמעט ללא אובדן על כרטיסי 24GB.

• שירות FP8, כ-27GB VRAM — L40S יחיד, לפי התחזית הקודמת, להסקה ברמת ייצור.

• דיוק מלא, H100 80GB — המסלול ברמת benchmark, ולא משהו שרוב הצוותים יריצו.

הסיבוך החדש הוא שהמשפט "אפשר לארח בעצמך את דור Qwe​n3.8 עכשיו" נכון, אבל לא לגבי המודל שאנשים תכננו סביבו. המשקלים הפתוחים של Max הם מחלקת חומרה שונה לחלוטין: מודל הדיוק המלא BF16 הוא בערך 4.9TB, והקוונטיזציה הסלקטיבית השכבתית של Unsloth ב-1-bit מביאה אותו לכ-397GB — ניתן להרצה, אבל רק עם 410GB או יותר של RAM ו-VRAM במשולב. זו תשתית רצינית, לא כרטיס פרוסומר. זה בדיוק הפער שה-27B נועד למלא, מה שהופך את היעדרותו המתמשכת של ה-27B לסיבה לכך שנתיב ה-GPU הבודד המקומי לדור הזה עדיין לא קיים.

שאלת הרישיון: ה-Max הרגע קבע תקדים.

שאלת הרישיון עבור 27B עדיין לא נענתה, אבל "איך זה ייראה" כבר אינו ניחוש. המשקלים הפתוחים של Max שוחררו תחת רישיון מותאם אישית בשם "qwen3.8-max" — לא Apache 2.0. כפי שדווח בכרטיס המודל, הוא בדרך כלל חופשי לשימוש מסחרי ולאירוח, אך הוא מעורר דרישות נוספות בקנה מידה גדול: מוצרים עם יותר מ-100 מיליון משתמשים פעילים חודשיים או יותר מ-20 מיליון דולר בהכנסות חודשיות חייבים להציג את שם המודל, וחברות עם יותר מ-50 מיליון דולר בהכנסות שנתיות שמציעות שירותי מודל-כשירות (model-as-a-service) או שירותי עוזר עבודה מבוססי בינה מלאכותית נדרשות לרישיון נפרד. טענה שמסתובבת לפיה הרישיון אוסר שימוש בארה״ב, באיחוד האירופי, בבריטניה ובקוריאה היא שקרית — הרישיון אינו כולל הגבלות טריטוריאליות.

לספציפית דגם ה-27B, עדיין לא צוין רישיון. אבל ה-Max שוחרר תחת רישיון Q​wen מותאם אישית, לא תחת Apache 2.0, מה שהופך את Apache 2.0 להנחה גרועה גם עבור דגם האח. רישיון Tongyi Qianwen הישן — עם סעיף 100 מיליון ה-MAU — אינו מה שקיבל ה-Max; הרישיון של ה-Max הוא חדש, מדורג לפי קנה מידה. קרא את קובץ ה-LICENSE במאגר בפועל לפני שאתה מתכנן סביבו, וצפה שהרישיון של ה-27B יוכרע רק כשהמאגר שלו ישוחרר.

תזמון שרשרת הכלים: תמיכה מהיום הראשון הוכחה זה עתה

מנועי השרתים נעו במהירות כצפוי — עבור המודל ששוחרר. Qwen3.8-2.4T-A95B הושק עם תמיכה עובדת ב-SGLang, vLLM ו-TokenSpeed, וזה מה ש"זמין ל-API כמעט מיידית" נראה עבור שחרור גדול במשקלים פתוחים. עבור ה-27B, אותם מנועים הם ככל הנראה הראשונים שיספקו תמיכה ברגע שהמאגר שלו יופיע, והכיסוי של ה-Max מהיום הראשון הופך את הציפייה שה-27B יירש את התמיכה הזו לסבירה. קוונטיזציות קהילתיות של GGUF ו-AWQ עדיין בדרך כלל מפגרות בשבוע עד שבועיים, כך שחוויית ה"משוך והרץ" בסגנון Ollama כנראה עדיין לא תתקיים ביום השחרור של ה-27B — הגדרה ידנית של vLLM או llama.cpp היא ככל הנראה הדרך המקומית בהתחלה.

מה שעדיין לא ידוע

קטע הדלפה כנה נעצר במה שבאמת פומבי, והגבול רחב יותר מאשר לפני שבוע בכיוון אחד וצר יותר באחר: שאלות של מקס קיבלו מענה, ושל 27B לא.

• תאריך ההשקה החדש."השבוע של 10 באוגוסט" הייתה ההתחייבות; השבוע כמעט נגמר ומאגר הקוד לא הופיע. עוקבים של צד שלישי מדווחים על עיכוב ללא תאריך חדש, אבל עליבאבא לא פרסמה הצהרה רשמית.

• ארכיטקטורה. Dense או MoE עבור ה-27B, ואם MoE, מספר הפרמטרים הפעילים.

• גיליון המפרט. חלון הקשר, מודאליויות, מגבלות פלט, מצב חשיבה.

• מדדים. ל-27B אין ציונים רשמיים ואין הערכה בלתי תלויה.

• הרישיון. לא הוכרע עד שהמאגר של 27B ייצא לאוויר; הרישיון המותאם אישית של Max הוא התקדים שכדאי לעקוב אחריו.

• סיכון שיקוף. בעיית הפלייסהולדר נראית כעת בשטח — כרטיסי קהילה "Qwen3.8-27B-FP8", "-GGUF" ו-"-MLX" קיימים ללא קבצים רשמיים. עד שארגון Qwen הרשמי יפרסם את המאגר, הורידו רק מעמוד הארגון הרשמי.

מה זה אומר לבונים

החלוקה המעשית בדור Qwe​n3.8 היא כעת משולשת במקום כפולה. אם תרצו את ה-API המתקדם ביותר כיום, Qwen3.8-Max זמין דרך OrcaRouter במחיר המחירון של הספק — $2/$6, מועבר אליכם ב-0% תוספת — המחיר שאתם רואים הוא המחיר שקבעה Alibaba. אם תרצו לארח בעצמכם את דגם ה-Max, המשקולות הפתוחות זמינות להורדה כבר עכשיו, אבל תצטרכו חומרה לדגם בדייקנות מלאה של כ-4.9TB או לדגם מכומת של כ-397GB. ואם תרצו את הפריסה המקומית על GPU יחיד שהדור הזה היה צפוי לספק, אתם עדיין ממתינים ל-Qwen3.8-27B, שעדיין לא שוחרר. מפתח אחד תואם-OpenAI מכסה את צד ה-API כיום, וכשהאירוח של ה-27B יוסדר, אותו מפתח יוכל לנתב אליו.

Screenshot of the OrcaRouter model page for Qwen3.8-Max, showing model id qwen/qwen3.8-max, .00/1M input token pricing, a 1M-token context window, and an OpenAI-compatible Python code sample.

החלק האחרון הוא הנקודה הכללית יותר, וזה בדיוק מה ששחרור מודל פתוח-משקולות (open-weight) שלא הוכח ומתעכב מהווה עבורו מקרה מבחן. למודל שעדיין לא שוחרר בכלל אין רקורד, אין ערכת אמות מידה בלתי-תלויה ואין היסטוריית תקלות — וכשהוא סוף סוף יגיע, הוא יהיה חדש לגמרי. ניתוב הוא הדרך לנסות אותו בלי להמר על מסלול מול לקוחות: שלח אליו את התעבורה שיכולה לסבול הפתעות, בצע מעבר אוטומטי למודל מוכח כשהוא מתנהג לא כראוי, והעבר את כל עומס העבודה ברגע שהוא מרוויח אמון. שכבת הניתוב היא גם מה שהופך את חישובי המחיר לשקופים — כשאליבאבא מורידה את מחיר המודל שאתה קורא לו דרך נקודת קצה אחת, השינוי נכנס לתוקף באותו היום, כי מחיר המחירון עובר ישירות.

מה לצפות

• האם הריפו של 27B יופיע בכלל. רישום תחת הארגון הרשמי של Qwen ב-Hugging Face או ב-ModelScope הוא האירוע שמסיים את העיכוב — והשבוע של 10 באוגוסט כמעט נסגר בלעדיו.

• קובץ הרישיון של ה-27B.ה-Max נשלח עם רישיון מותאם לדרגות קנה מידה, לא Apache 2.0. האם ה-27B ימשיך בתקדים זה הוא הקו המשמעותי ביותר בהכרזה העתידית שלו.

• ארכיטקטורה ואורך הקשר. Dense-vs-MoE וחלון ההקשר קובעים למה נועד ה-27B.

• המדד העצמאי הראשון. הציון 56 של Max במדד Artificial Analysis Intelligence Index קבע את הרף; ההערכה החיצונית הראשונה של ה-27B תגלה לך כמה מההישגים של הדור שורדים בגודל צרכני.

• כיסוי שרשרת הכלים.האם ה-27B יורש את התמיכה של Max מהיום הראשון ב-SGLang/vLLM/TokenSpeed, וכמה מהר קוונטיזציות קהילתיות יגיעו.

שאלות נפוצות

האם Qwen3.8-27B כבר שוחרר?

לא. אליבאבא הכריזה על כך ב-3 באוגוסט 2026, והתחייבה לשחרר את המשקולות ל-Hugging Face ול-ModelScope לשבוע של 10 באוגוסט, אבל נכון ל-13 באוגוסט אין מאגר רשמי, כרטיס מודל או רישיון עבור Qwen3.8-27B. המשקולות הפתוחות מסוג Max — Qwen3.8-2.4T-A95B — שוחררו ב-13 באוגוסט; ה-27B לא שוחרר, ומעקבים של צד שלישי מדווחים שהוא נדחה ללא תאריך חדש.

איזו חומרה אני צריך כדי להריץ את Qwen3.8-27B?

לא אושר, אבל תחזיות הקהילה המבוססות על טבלת הקוונטיזציה של Q​wen 3.6-27B מציבות קוונט Q4_K_M בכ-16GB של VRAM (כרטיס RTX 4090), קוונט Q3_K_M בכ-13GB (כרטיסי 12GB), קוונט Q6_K בכ-21GB (כרטיסי 24GB), ושרת FP8 בכ-27GB (כרטיס L40S בודד). דניאל האן מ-Unsloth מדווח על כ-17GB בהשקה. יש להתייחס לאלה כהערכות עד שדגם הכרטיס הרשמי יפרסם הנחיות חומרה.

האם Qwen3.8-27B זמין דרך OrcaRouter?

עדיין לא. Qwen3.8-27B הוא מודל בעל משקלים פתוחים, לאירוח עצמי, ואינו זמין בפלטפורמה כיום. דגם הדגל של אותה משפחה — Qwen3.8-Max — זמין עכשיו דרך OrcaRouter במחיר המחירון של הספק של $2/$6 למיליון טוקנים עם 0% תוספת, וכאשר האירוח של ה-27B יתייצב, ניתן להוסיף אותו לאותו מפתח תואם OpenAI.

האם כדאי לי לחכות ל-Qwen3.8-27B או להשתמש ב-Qwen3.8-Max היום?

זה תלוי היכן רץ עומס העבודה. אם אתם צריכים API מתקדם כבר עכשיו, Qwen3.8-Max פעיל וזמין במחיר אגרסיבי של $2/$6 למיליון טוקנים. אם אתם רוצים לארח בעצמכם את דגמי ה-Max כיום, Qwen3.8-2.4T-A95B זמין להורדה כבר עכשיו, אבל הוא דורש חומרה רצינית — בערך 4.9TB של מודל בדיוק מלא, או כ-397GB בקוונטיזציה, עם 410GB+ של RAM ו-VRAM משולבים. אם אתם צריכים מודל מקומי או on-premise על כרטיס מסך צרכני יחיד, Qwen3.8-27B הוא עדיין הדגם שכדאי לחכות לו — הוא המסלול הריאלי לאירוח עצמי בדור הזה, ומועד ההשקה שלו הוא כעת שאלה פתוחה, לא תאריך קבוע.

השבוע המובטח כמעט הסתיים, וחצי ממנו לא הגיע. Qwen3.8-2.4T-A95B זמין להורדה, בעל רישיון, וניתן לשרת אותו; Qwen3.8-27B אושר כי הוא קיים, עדיין מחויב למשקלים פתוחים, ועדיין ללא מאגר קוד, ללא רישיון, ללא benchmark, וללא תאריך חדש. שימו לב אם המאגר של ה-27B ינחת לפני שהשבוע המובטח יסתיים לגמרי, מה אומר קובץ הרישיון שלו לצד זה של ה-Max, וכיצד ידרגו אותו ההערכות העצמאיות הראשונות. שלושת האותות האלה יגידו לכם אם מדובר בשחרור דו-שלבי שגרתי של משקלים פתוחים, כשהמודל הקטן עוד עתיד להגיע, או בעיכוב שכדאי לתכנן סביבו.

השוואות במאמר הזה1

זוהה מתוך המאמר הזה · בנצ'מרקים: Artificial Analysis · מתעדכן יומית