
Qwen3.8-27B לעומת Qwen 3.8: אותו דור, מעבד גרפי מול ארון שרתים
- deepseekחדשDeepSeek: DeepSeek V4.1 Flash2026-09-1040אינטליגנציה
- openaiחדשOpenAI: GPT-6 Astra2026-09-0453אינטליגנציה77כתיבת קוד
- googleחדשGoogle: Gemini 3.8 Flash2026-09-0241אינטליגנציה76כתיבת קוד
- qwenחדשQwen: Qwen3.8 Max (0902)2026-09-0240אינטליגנציה72כתיבת קוד
- anthropicחדשAnthropic: Claude Fable 5.12026-09-0153אינטליגנציה82כתיבת קוד
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 לכל 1M טוקנים
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642אינטליגנציה72כתיבת קוד
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 לכל 1M טוקנים
- z-aiZ.ai: GLM 5.32026-08-1845אינטליגנציה75כתיבת קוד
- obsidianQwen3.8 27B2026-08-1534אינטליגנציה68כתיבת קוד
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236אינטליגנציה69כתיבת קוד
- grokSpaceXAI: Grok 4.62026-08-1244אינטליגנציה77כתיבת קוד
- metaMeta: Muse Spark 1.22026-08-0540אינטליגנציה72כתיבת קוד
- qwenQwen: Qwen3.8 Max2026-08-0340אינטליגנציה72כתיבת קוד
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135אינטליגנציה69כתיבת קוד
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 לכל 1M טוקנים
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2451אינטליגנציה78כתיבת קוד
- googleGoogle: Gemini 3.6 Flash2026-07-2134אינטליגנציה69כתיבת קוד
השבוע Alibaba הציבה את Qwen3.8-27B במסלול ההסקה המהירה של Cerebras — הפעם הראשונה שלדגם ה-27B מסוג dense יש אפשרות מתארחת מהירה באמת — ו-Artificial Analysis סוף סוף הכניסה לאינדקס את שני הצדדים של ההתמודדות הזו. Qwen3.8-27B מקבל ציון 34 ב-AA Intelligence Index. Qwen 3.8, כלומר הליבה הפתוחה שאליה מתכוונים רוב האנשים כשהם כותבים את השם ללא סיומת, מקבל ציון 40. שני המספרים האלה מאתחלים מחדש השוואה שסיקור ההשקה באוגוסט נאלץ להסתמך בה כולה על דברי הספק בלבד.
המודל שמאחורי "Qwen 3.8" כשם עצמאי הוא Qwen3.8-2.4T-A95B: משקולות תערובת המומחים בעלות 2.4 טריליון פרמטרים שאליבאבא פרסמה תחת רישיון מותאם אישית. Qwen3.8-27B הוא החבר הצפוף של אותו דור — כ-27 מיליארד פרמטרים, Apache 2.0, בגודל שמתאים ל-GPU בודד. הם חולקים את שם המשפחה, אורך ההקשר המקורי של 262K, וחלון השקה. כל השאר בהם הוא חקר הפכים: אחד אתה יכול להחזיק בבעלותך, את האחר אתה יכול רק לשכור. הנה למה כל אחד מהם מיועד בפועל כעת, כשלשניהם יש מספרים עצמאיים.
אותו דור, צורות הפוכות
Qwen3.8-27B הוא מודל dense — 27B פרמטרים (28B בספירת מקודד הראייה), 64 שכבות, מחסנית קשב היברידית של 48 שכבות Gated DeltaNet linear-attention מול 16 שכבות full-attention. ההיברידיות הזו היא הסיבה ש-27B יכול לשאת 262,144 טוקנים של הקשר מקורי. Qwen3.8-2.4T-A95B היא ארכיטקטורת הדגל: 2.4T פרמטרים סה"כ, כ-95B פעילים לכל טוקן, 92 שכבות עם 512 מומחים בכל שכבה, ו-69 מתוך 92 השכבות האלה על linear attention. אותו טריק, פי תשעים טביעת רגל.
• ארכיטקטורה — Qwen3.8-27B: 27B צפוף, כל טוקן מפעיל את כולו. Qwen3.8-2.4T-A95B: 2.4T סה"כ / ~95B פעילים MoE.
• הקשר — לשניהם 262K נייטיבי; הרחבת ה-1M של ה-27B זמינה רק באירוח, וה-2.4T מגיע ל~984K כפי שנמדד.
• קלט — Qwen3.8-27B: טקסט, תמונה ווידאו. Qwen3.8-2.4T-A95B: טקסט בלבד, חשיבה נעולה דלוקה.
• רישיון — Qwen3.8-27B: Apache 2.0. Qwen3.8-2.4T-A95B: רישיון Qwen3.8-Max מותאם אישית.
• משקלים — Qwen3.8-27B: 55.6GB ב-BF16, עובר כימות לגרסת Q4 של כ-16GB. Qwen3.8-2.4T-A95B: כ-2.4TB ב-BF16, ארון GPU, לא מחשב שולחני.
• היכן פוגשים אותם — Qwen3.8-27B: באירוח עצמי או בשכירות זולה. Qwen3.8-2.4T-A95B: בשכירות, כי אף אדם שפוי לא מחזיק את הראק בבעלותו.
מספרים עצמאיים, סוף סוף
כל כתבת השוואה בין August ל-Qwen3.8-27B נשאה את אותה הסתייגות: „אין עדיין ציונים בלתי־תלויים”. זה כבר לא נכון. Artificial Analysis מדדה את שני המודלים נכון לשבוע הזה, וצורת הנתונים באמת מעניינת.
ב-Intelligence Index, Qwen3.8-2.4T-A95B מקבל ציון 40, ומדורג במקום ה-4 מתוך 113 במחלקה שלו. Qwen3.8-27B מקבל ציון 34 — מה שמציב אותו במקום הראשון מבין 140 מודלים במחלקת הגודל 4–40B של מודלים במשקולות פתוחות שאליה הוא שייך, הישג חזק באמת עבור 27B צפוף. שניהם איטיים לפי מדידה בלתי תלויה: 39.0 טוקנים של פלט לשנייה עבור ה-27B ו-38.1 עבור ה-2.4T, לעומת חציון המחלקה של כ-90. שניהם רבי־מלל, כשה-27B מייצר בערך 200M טוקנים של פלט לאורך הרצות המדד לעומת חציון המחלקה של 68M. אף אחד מהם אינו מודל חזית בולט; שניהם סוסי עבודה, והמדד אומר שה-2.4T הוא סוס העבודה החזק יותר בפער ברור.

התמחור בצד העצמאי מספר את אותו סיפור בדולרים. Artificial Analysis מתמחרת את ה-27B ב-$0.50 למיליון טוקני קלט ו-$3.00 למיליון טוקני פלט בגרסה המתארחת של Qwen Cloud (הנחת מטמון של 90%), ואת ה-2.4T ב-$2.00 / $6.00 (הנחת מטמון של 88%). עלות לכל משימת Intelligence Index: $0.82 עבור ה-27B לעומת $2.16 עבור ה-2.4T. המודל הקטן יותר זול להפעלה ליחידת אינטליגנציה — ושניהם יקרים ביחס למחלקת המהירות שלהם מכיוון ששניהם מודלי חשיבה ששורפים טוקני פלט.
כל השאר — SWE-bench Pro 61.7, DeepSWE 1.1 42.2, LiveCodeBench v6 90.3 עבור ה-27B; 86.6 ב-Terminal-Bench 2.1 ו-67.7 ב-SWE-bench Pro של ה-2.4T — נותר מדווח על ידי הספק, ללא שחזור, ומסומן ככזה לאורך כל המאמר הזה. מדדי ה-AA שלמעלה הם הרצפה העצמאית שמתחת לכל זה.
מה שהרישום למסחר של Cerebras משנה
ב-12 בספטמבר 2026, חשבון Qwen הודיע ש-Qwen3.8-27B פועל כעת על Cerebras, כשהרשומה שלו בקטלוג מופיעה תחת הכותרת "Qwen 3.8 27B זמין כעת ב-Cerebras PayGo". Cerebras מתמחרת אותו ב-0.99 דולר למיליון טוקנים בקלט וב-1.49 דולר למיליון טוקנים בפלט על חומרה בדרגת WSE שהעניקה לחברה את שמה בתחום המהירות. זה נותן ל-27B משהו שלליבת ה-2.4T מעולם לא היה: מסלול מהיר.

זה חשוב כי איטי ומפורט היה הפגיעה האמיתית היחידה ב-27B מהיום הראשון. במערכת הבדיקה העצמאית הוא עושה 39 t/s; בטלמטריית ההגשה שלנו הוא עושה ~154 טוקני פלט לשנייה עם חביון טוקן ראשון p50 של 4.48 שניות — ועכשיו ספק שני מתחרה באותו ציר. ל-2.4T, לעומת זאת, אין נתיב מהיר בכלל: ב-38 t/s אתה משלם מחירי חזית עבור מהירות בינונית, והדרך היחידה לעקוף זאת היא אשכול GPU שכור שמריץ את המשקלים הפתוחים בעצמך.
שלושה נתיבים עבור ה-27B, ואחד עבור ה-2.4T
נכון להיום, ה-dense 27B ניתן להשכרה בשלוש דרכים, ופער המחירים שווה קריאה לפני שתבחרו:
• מסלול בהתארחות עצמית — Qwen3.8-27B זמין ב-OrcaRouter במחיר $0.33 / $2.40 למיליון, פועל על התשתית שלנו. הקלט הזול ביותר בשוק עבורו, פלט של ~154 tok/s, חלון הקשר של 262K.
• מסלול הספק — הגרסה המתארחת של Qwen Cloud, $0.50 / $3.00 למיליון עם חלון הקשר של 1M טוקנים והנחת מטמון של 90%.
• מסלול מהיר — Cerebras PayGo, 0.99$ / 1.49$ למיליון, עם מיצוב על מהירות ולא על מחיר.

לליבת ה-open core בת ה-2.4T אין פער מקביל. ה-API הדגל שמשרת את אותה ארכיטקטורה — Qwen3.8-Max — הוא $2.00 / $6.00 למיליון, וזה המספר שנשאר תקף בין אם תקראו לו Max או ל-open core. אם תריצו את המשקולות במקום זאת, הכלכלה מתהפכת לחומרה: ה-2.4T זקוק ל~2.4TB של משקולות BF16 ולצומת multi-GPU, החלטת הון שאיש לא מקבל בקלילות. GPU של 24GB מריץ את גרסת ה-Q4 של ה-27B בעלות שולית שמתעגלת לאפס.
הדוגמה המעשית שמכריעה עבור רוב הצוותים: 100M טוקני קלט ו-20M טוקני פלט ביום. בתעריף $2/$6 של ה-2.4T זה כ-$320 ביום, ~$117,000 בשנה. ב-27B בתעריף שלנו של $0.33/$2.40 זה כ-$81 ביום — ובעותק בהרצה עצמית זו עלות החשמל. ה-2.4T מקנה לך יתרון איכות אמיתי, AA 40 מול 34. האם היתרון הזה שווה חשבון חודשי של חמש ספרות — זו כל השאלה שהשילוב הזה מעלה.
היכן שהם באמת נבדלים
מעבר לאינדקס, שלושה הבדלים מעשיים מכריעים איזה מהם מתאים לעומס עבודה נתון.
קלט מולטימודלי הוא המסנן הנקי ביותר. Qwen3.8-27B קורא טקסט, תמונות ווידאו — צילומי מסך, תרשימים, מסמכים עם איורים, פריימים של וידאו — כולם נכנסים לאותו חלון 262K. Qwen3.8-2.4T-A95B הוא טקסטואלי בלבד באופן אגרסיבי. אם הקלט שלך כולל משהו ויזואלי, ה-2.4T נפסל ללא קשר לאינדקס הגבוה יותר שלו.
שליטה בחשיבה היא במקום השני. ניתן להשבית את מצב החשיבה של ה-27B לפי בקשה, מה שחשוב לחילוץ רגיש לשהיה, שבו שרשרת מחשבה היא תקורה טהורה; הוא גם חושף את reasoning_effort. ליבת ה-2.4T לא יכולה לכבות את החשיבה — כל תגובה נפתחת בבלוק think>, ואתה משלם על הטוקנים האלה בין אם רצית בהם ובין אם לא. ה-API המוביל מתקן זאת, אבל הליבה הפתוחה לא.
רישוי הוא השלישי, והוא חשוב בשקט בקנה מידה. Apache 2.0 על ה-27B הוא הסטנדרט המתירני: שינוי, הפצה מחדש, מסחור, כולל הענקת פטנט. ה-2.4T משוחרר תחת רישיון Qwen3.8-Max מותאם אישית — מתירני ברוחו, אבל אלו התנאים של Alibaba, לא סטנדרט קהילתי, וכדאי לקרוא את הקובץ לפני שאתם בונים עליו מוצר.
{{2}}ניתוב{{/2}} {{1}}ההחלטה{{/1}}
שני הצדדים של ההתמודדות הזו נגישים דרך מפתח OrcaRouter אחד, וזה מה שהופך את השאלה "מה אני בוחר" לזולה לתשובה אמפירית. Qwen3.8-27B פעיל בתור qwen/qwen3.8-27b במחיר המחירון של הספק עם אפס תוספת, וה-API המוביל הבנוי על אותו ליבת 2.4T פעיל בתור qwen/qwen3.8-max במחיר של $2.00 / $6.00 למיליון — התעריף של Alibaba עצמה, מועבר ישירות, כך שכל שינוי מחיר של ספק מתעדכן כאן באותו היום.
אותה ארכיטקטורת 2.4T כמשקולות להורדה אינה משהו שאנחנו מספקים — אם אתה רוצה את הליבה הפתוחה דרך API היום, מסלול הדגל הוא הדרך המעשית להגיע אליה, וqwen/qwen3.8 מחווט מראש להידלק ברגע שספק מגיש את המשקולות הפתוחות. כלל ניתוב ששולח את התעבורה החזותית והרגישה לשיהוי אל qwen/qwen3.8-27b ואת זנב החשיבה הקשה אל qwen/qwen3.8-max לא עולה דבר להגדרה ומבצע מעבר אוטומטי בין ספקים. מפתח אחד, בלי חוזה שני, והפיצול הוא שינוי תצורה ולא ארכיטקטורה מחדש — הדרך הזולה ביותר לבדוק אם שש נקודות המדד הנוספות של ה-2.4T שוות לך $5.67 למיליון טוקנים של פלט.
מי צריך לבחור איזה
• בחרו ב-Qwen3.8-27B אם הקלט שלכם כולל תמונות או וידאו, אם אתם רוצים חשיבה שאפשר לכבות, אם יש ברשותכם GPU של 24GB או שאתם מתכננים לרכוש כזה, או אם ההוצאה שלכם לכל טוקן היא בנפח שמספיק ש-$0.33/$2.40 לעומת $2.00/$6.00 הוא כל הטיעון.
• בחרו ב-Qwen 3.8 (ליבת ה-2.4T) אם אתם בטקסט בלבד, אתם רוצים את נתון החשיבה העצמאית החזק ביותר במשפחה (AA 40), ותעריף של 2$/6$ — או העלות של הרצת צומת GPU — נכנס בנוחות לתקציב שלכם.
• בחר בשניהם אם התעבורה שלך משתרעת על שני הפרופילים: נתב דרך השער, תן לנתב לפצל לפי מודאליות ורמת קושי, ושנה את דעתך כשהצ'קפוינט הבא או המחיר של מי מהמודלים נוחת.
פסק הדין
השם Qwen 3.8 היה תמיד שני מוצרים שהעמידו פנים שהם משפחה אחת, וכעת לשניהם יש מספרים עצמאיים להתווכח עליהם. Qwen3.8-2.4T-A95B הוא המוח החזק יותר, טקסט בלבד, יקר, ובר-השכרה ללא ספק במחיר $2/$6. Qwen3.8-27B הוא זה שניתן לפרוס — מולטימודלי, Apache 2.0, ניתן לאירוח עצמי, והחל מהשבוע הזה סוף סוף יש גם לו מסלול מהיר. פער המדד אמיתי: 40 מול 34. כך גם פער המחיר: בערך פי חמישה מעלות לכל טוקן כאשר מריצים את 2.4T כ-API. עבור רוב הצוותים, ההחלטה אינה נוגעת לשש נקודות המדד. היא נוגעת לשאלה אם אתם קונים טוקנים או קונים חומרה — וה-27B הוא היחיד מבין השניים שמאפשר לכם לקנות את החומרה.
