
בנצ'מרקי Qwen3.8-27B: הטבלה המלאה, עם ההסתייגויות המצורפות
- openaiחדשOpenAI: GPT-6.1 Sol2026-09-2952אינטליגנציה
- anthropicחדשAnthropic: Claude Sonnet 5.52026-09-2856אינטליגנציה
- typesafeחדשTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 לכל 1M טוקנים · 219 tok/s
- OpenAIחדשOpenAI: GPT-6 Luna2026-09-2238אינטליגנציה
- OpenAIחדשOpenAI: GPT-6 Sol2026-09-2248אינטליגנציה
- AnthropicחדשAnthropic: Claude Opus 5.52026-09-2258אינטליגנציה
- xAIחדשGrok 4.72026-09-2146אינטליגנציה
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 לכל 1M טוקנים · 114 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 לכל 1M טוקנים · 1064 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040אינטליגנציה
- OpenAIOpenAI: GPT-6 Astra2026-09-0453אינטליגנציה77כתיבת קוד
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241אינטליגנציה76כתיבת קוד
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245אינטליגנציה76כתיבת קוד
- AnthropicAnthropic: Claude Fable 5.12026-09-0153אינטליגנציה82כתיבת קוד
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 לכל 1M טוקנים · 41 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 לכל 1M טוקנים · 104 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642אינטליגנציה72כתיבת קוד
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 לכל 1M טוקנים · 213 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845אינטליגנציה75כתיבת קוד
- obsidianQwen3.8 27B2026-08-1534אינטליגנציה68כתיבת קוד
Qwen/Qwen3.8-27B משיגה 73.0 ב-Terminal-Bench 2.1, 61.7 ב-SWE-bench Pro, 90.3 ב-LiveCodeBench v6 ו-84.3 ב-OSWorld-Verified — וכל אחד מהמספרים האלה הוא של אליבאבא עצמה. דגם המשקלים הפתוחים בעל 27 מיליארד הפרמטרים שוחרר ב-Hugging Face ב-14 באוגוסט 2026 תחת רישיון Apache 2.0, ובתוך שבועיים מהשחרור הוא צבר שלוש תוצאות עצמאיות של צד שלישי: המקום הראשון במשקלים פתוחים ב-benchmark הסוכנים המשפטיים של Harvey, במחקר שהריצו חברת הבינה המלאכותית המשפטית Harvey וחברת הזיכרון Engram; דירוג 9 כללי ב-WebDev leaderboard של Code Arena — הדגם היחיד בקטגוריית הגודל שלו בתוך העשירייה הראשונה, לפי הודעת אליבאבא מ-25 באוגוסט; והוכרז ב-26 באוגוסט, המקום הראשון במשקלים פתוחים ב-Image-to-WebDev leaderboard של Arena.ai, עם דירוג 7 כללי וציון מדווח של 1,574. עמוד זה הוא הסקירה המלאה עם המקורות: כל 25 אמות המידה הרשמיות מכרטיס הדגם, מה השתנה לעומת קודמו Qwen3.6-27B, מה מדדה בדיקת התפוקה העצמאית של AMD, תוצאות הסוכנים המשפטיים וה-webdev-arena האלה, ואילו טענות עדיין כדאי להתייחס אליהן כזמניות.
מדריך קריאה לפני המספרים: "רשמי" כאן פירושו ההערכה של אליבאבא שמודפסת בכרטיס המודל ב-Qwen/Qwen3.8-27B. זהו דיווח ספק שלא שוחזר. "בלתי תלוי" פירושו שמישהו מחוץ למעבדה מדד אותה — עד כה זה כולל מבחן תפוקת חומרה, מחקר סוכן בתחום המשפטי, ומיקומים בשניים מלוחות הדירוג לפיתוח אתרים של Arena.ai: ה-WebDev של Code Arena וזירת ה-Image-to-WebDev. אמות מידה שבהן למנגנון ההערכה יש חשיבות מסומנות בתוך הטקסט.
המודל, שורה אחת למפרט
• 27B פרמטרים צפופים (28B כולל מקודד הראייה), 64 שכבות, גודל חבוי 5120.
קשב היברידי — 48 שכבות קשב ליניארי של Gated DeltaNet ועוד 16 שכבות קשב מלא, יחס של 3:1 — וזה מה שהופך חלון של 262K טוקנים לזול להרצה.
• {{1}}262,144 טוקנים בהקשר מקורי, הניתן להרחבה ל-1,000,000 עם קנה מידה של YaRN.{{/1}}
קלט תמונה ווידאו מובנה (פלט טקסט), משקלים ברישיון Apache 2.0, כ-55.6GB ב-BF16.
הגרסה הקצרה: זהו המודל שנועד לקחת את מה שאליבאבא למדה מבניית Qwen3.8-Max בעל 2.4 טריליון פרמטרים, ולדחוס אותו למשהו שכרטיס GPU יחיד יכול להריץ.
כרטיס הניקוד: כל המדדים בכרטיס המודל
כל הציונים שלהלן הם לפי דיווח עליבאבא מכרטיס המודל מ-14 באוגוסט, כשהציון של Qwen3.6-27B שהמודל מחליף מופיע בסוגריים.
קידוד. Terminal-Bench 2.1 (קידוד טרמינל אייג'נטי) 73.0 (63.4); SWE-bench Pro 61.7 (53.5); QwenSWEBench 79.0 (49.3); DeepSWE 1.1 42.2 (13.3); NL2Repo-Bench 42.3 (36.2); LiveCodeBench v6 90.3 (83.9). ההרצות של SWE-bench Pro ו-QwenSWEBench השתמשו ברתמת Claude Code, לפי הערת שוליים בכרטיס המודל — כדאי לזכור זאת לפני שמשווים אותן למודל שנמדד ברתמה אחרת.
סוכנים לטווח ארוך ועבודת משרד. CoWorkBench 70.7 (61.0); JobBench 33.4 (21.8); Agents' Last Exam Pass@1 20.4 / score 42.9 (10.6 / 27.3).
חשיבה וידע.GPQA Diamond 89.2 (87.8); Humanity's Last Exam 30.8 (24.0); IFBench ביצוע הוראות 79.5 (69.1). HLE מוערך על ידי GPT-4o, לפי הכרטיס.
ראייה ושימוש במחשב. OSWorld-Verified 84.3 (63.9); WebArena-Verified 64.8 (48.8); AndroidWorld 81.9 (70.3); MathVision 94.6 עם CI / 90.0 ללא (85.1); BabyVision 85.6 עם CI / 65.7 ללא (28.9); OmniDocBench 1.5 91.1 (89.4); RealWorldQA 85.9 (84.1). "CI" הוא שיפור בזמן-הסקה של Alibaba; הפער בין מצבו המופעל למצבו הכבוי הוא המספר האינפורמטיבי ביותר בכרטיס לגבי כמה ניקוד אפשר לקנות עם כוח חישוב הסקה נוסף.

מה למעשה השתנה לעומת Qwen3.6-27B
כל המדדים בכרטיס עלו, אבל ההפרשים אינם אחידים — וצורת השיפור היא הסיפור. הרווחים מתרכזים בקידוד אוטונומי ובשימוש במחשב, לא בשליפת ידע:
• DeepSWE 1.1 (קידוד אגנטי) 13.3 → 42.2, בערך קפיצה של פי 3
• QwenSWEBench 49.3 → 79.0
• ציון הסוכנים בבחינה האחרונה: 27.3 → 42.9
• OSWorld-Verified 63.9 → 84.3 ו-AndroidWorld 70.3 → 81.9
• BabyVision (עם CI) 28.9 → 85.6 — העלייה היחסית הגדולה ביותר בכרטיס
בינתיים GPQA Diamond עבר מ-87.8 ל-89.2 ו-RealWorldQA מ-84.1 ל-85.9: אמיתי אבל קטן. זו לא מהדורה ש"חכמה יותר בכל דבר". זו מהדורה שמכוונת ישירות לסוכנים שקוראים מסכים, משתמשים בכלים וכותבים קוד על פני שלבים רבים.

התוצאה העצמאית הראשונה: #1 במשקל פתוח במדד Legal Agent של Harvey
מאז שעלה העמוד הזה, הפיתוח החשוב ביותר הוא משפטי, לא טכני. עליבאבא הודיעה כי Qwen3.8-27B הוא המודל בעל המשקלים הפתוחים המדורג ראשון במדד ה-Legal Agent של Harvey — טענת דירוג שמגיעה מחשבון הספק עצמו, ולכן יש להתייחס אליה כאל דברי עליבאבא. התוצאה שמאחורי זה היא מחקר שאינו של עליבאבא: Harvey, חברת ה-AI המשפטי, ו-Engram, סטארטאפ לזיכרון בינה מלאכותית, בנו משרד עורכי דין סינתטי בשם Calderwood & Harkness מתוך למעלה מ-100 מיליון טוקנים על פני כ-10,000 מסמכים ו-266 תיקים, ואז התאימו את Qwen3.8-27B אליו עם זיכרון פרמטרי, הערות דחוסות וכלי שליפה.
ב-250 משימות משפטיות, ה-27B המותאם השיג ממוצע של 67%, לפני כל מודל שהמחקר בדק — כולל Claude Opus 4.8 — ובמדד דיוק מחמיר של הכל-או-כלום, הוא הוביל על Opus 4.8 ב-30% לעומת 25%, בעלות של כ-$0.13 לשאילתה לעומת $1.32 עבור Opus 4.8. הנתונים הללו מדווחים על ידי Harvey/Engram, וטרם שוחזרו באופן בלתי תלוי. לפני אימון על המסמכים הפנימיים של המשרד, אותו מודל קיבל רק 4.7% בשאלות ספציפיות למשרד; לאחר שלמד אותם, 72.6%.
קראו את הפריט הראשון עם הסתייגות גדולה אחת: המודל שדורג ראשון במבחן למד את קורפוס הבדיקה מראש, וכוונן על 100 מיליון הטוקנים של החברה לפני שהוערך. זה הופך את זה להדגמה של מה שה-27B יכול לקלוט עם כוונון ספציפי לתחום, ולא לציון של המשקולות הרגילות של Apache-2.0 על מסגרת הערכה נייטרלית — והוא מכסה תחום אחד, משפטים, לא איכות כללית. מה שכן נתמך הוא המסר שמאחורי הציוץ: 27B קטן מספיק כדי לרוץ על מכונה מקומית הוא חזק מספיק לעבודה ברמה מקצועית כשהוא בעל הידע הנכון.
התוצאה העצמאית השנייה: #9 בדירוג הכללי ב-WebDev של Code Arena
התוצאה העצמאית השנייה היא תוצאת קוד, וזו הסיבה שהדף הזה השתנה ב-25 באוגוסט. Code Arena הוא לוח התוצאות לפיתוח אתרים של Arena.ai — הפרויקט שהיה ידוע בעבר בשם WebDev Arena, באתר שהיה ידוע בעבר בשם LMArena — שבו משתמשים בונים אפליקציות אמיתיות עם זוגות מודלים אנונימיים ומצביעים על איזה פלט הם מעדיפים לשחרר. בלוח התוצאות הציבורי הזה, Qwen3.8-27B ממוקם במקום ה-9 הכללי עם ציון של 1595, המודל היחיד בגודל שלו שנמצא בעשירייה הראשונה.
המיקום הוא החלק הבלתי-תלוי — הוא נמצא בלוח דירוג של צד שלישי שכל אחד יכול לפתוח. הכותרת סביבו היא הצהרת עליבאבא: המסגור של "המודל הקטן היחיד בעשירייה הראשונה", והמיקומים הנלווים, מגיעים מההודעה של Qwen מ-25 באוגוסט. הם ראויים לחזרה עם התווית הזו. ה-27B מדורג שישה מקומות מתחת ל-Qwen3.8-Max הגדול בהרבה (שההודעה ממקמת אותו במקום ה-3 הכללי), והרבה לפני ה-Gemma 4-31B בגודל דומה (שאותה הודעה ממקמת במקום ה-80). הנקודה היא לא ש-27B מנצח את מובילי החזית בבניית אפליקציות ווב; אלא שמודל קטן מספיק כדי לרוץ על GPU אחד נמצא בעשירייה הראשונה של זירת קידוד עיוורת ששאר המתמודדים בה הם מודלים גדולים בהרבה.
התוצאה העצמאית השלישית: המודל הפתוח #1 ב-Image-to-WebDev של Arena.ai
התוצאה העצמאית השלישית הגיעה ב-26 באוגוסט, והיא החזקה ביותר עד כה עבור מודל בגודל כזה. Image-to-WebDev הוא לוח האחות של WebDev של Code Arena ב-Arena.ai — הזירה שבה מודל מקבל צילום מסך או התייחסות חזותית אחרת וצריך להפוך אותו לממשק אינטרנט עובד, כשמצביעים אנושיים עיוורים בוחרים את הפלט שהם מעדיפים לשחרר. בלוח התוצאות הציבורי הזה, Qwen3.8-27B מדורג #1 בין המודלים הפתוחים ו-#7 בסך הכל, עם ציון זירה מדווח של 1,574.
המיקום הוא החלק הבלתי תלוי — הוא נמצא בלוח דירוג של צד שלישי שכל אחד יכול לפתוח. הכותרת סביבו היא הצהרה של Alibaba: ההודעה של צוות Qwen מ-26 באוגוסט מציגה את ה־27B כ"שווה ערך לדגמים גדולים פי 100 ממנו" במבחן זה, השוואה שלוח הדירוג אינו מתעד. ודירוג העדפות אינו פסק דין על איכות קוד — הצבעות Image-to-WebDev מודדות איזה פלט בן אדם היה מעדיף לשחרר, ולא האם ה־HTML מאובטח, נגיש או בר־תחזוקה. מה שהתוצאה כן מבססת הוא שדגם 27B בעל משקלים פתוחים מוביל כעת את כל התחום הפתוח שלו בהפיכת תמונה לעמוד, וזוהי המיומנות שעליה בנויה קטגוריית המוצרים הצומחת של "מצילום מסך לאתר".
הפערים הכנים: היכן שהוא עדיין מפסיד, והסתייגויות המתודולוגיה
מול החזית, התמונה מחמיאה אך לא חד-צדדית. היכן ש-Qwen3.8-27B ו-Claude Opus 4.6 Max חופפים, Qwen זוכה ברוב — SWE-bench Pro, QwenSWEBench, CoWorkBench, LiveCodeBench v6, OSWorld-Verified, AndroidWorld, IFBench, וכל בלוק הראייה. מול Muse Glimmer-30B של Meta, היריבה הטבעית במחלקה המקומית, הוא זוכה בכל שמונת הבנצ'מרקים החופפים באופן מוחלט. אבל הוא עדיין מפסיד ל-Claude Opus 4.6 Max ב-Terminal-Bench 2.1 (73.0 לעומת 78.2), GPQA Diamond (89.2 לעומת 91.3), Humanity's Last Exam (30.8 לעומת 40.0) ו-NL2Repo-Bench (42.3 לעומת 47.6). אם עומס העבודה שלך הוא החשיבה החזיתית הקשה ביותר — מתמטיקת חזית, שאלות רב-תחומיות מסיביות — ה-27B עדיין לא שם.
שלוש הסתייגויות לפני שתצטט מזה. ראשית, טבלת כרטיס המודל לעיל עדיין מדווחת כולה על ידי עליבאבא — אין מדד Artificial Analysis עבור ה-27B עדיין. כעת יש שלוש תוצאות עצמאיות של צד שלישי, אבל כל אחת צרה: דירוג Code Arena מודד בניית אפליקציות אינטרנט מפרומפטים טקסטואליים, דירוג Image-to-WebDev מודד הפיכת צילום מסך לעמוד עובד, שניהם נשפטים בהצבעות עיוורות על תפוקות אנונימיות, ומחקר הסוכן המשפטי של Harvey מכסה תחום יחיד עם מודל שאומן למבחן. אף אחת מהן אינה המשקולות הרשמיות המופעלות על רתמה כללית. שנית, כרטיס המודל משתמש ברתמת Claude Code עבור SWE-bench Pro ו-QwenSWEBench ובשופט GPT-4o עבור Humanity's Last Exam — השוואות עם מודלים שנמדדו במערכים אחרים יזיזו את המספרים. שלישית, ריצת MathVision של עליבאבא השתמשה בפרומפט קבוע בעוד שהמתחרים קיבלו את הגבוה מבין שתי גרסאות. שום דבר מזה לא אומר שהתוצאות שגויות; זה אומר שהן תקרה, לא רצפה, עד שמעבדות עצמאיות יריצו את המודל על רתמות כלליות ניטרליות.
מה נדרש כדי להריץ את זה
Qwen3.8-27B הוא מודל מקומי, מה שמשנה את המשמעות של "ביצועים": תפוקה על החומרה שלך במקום כרטיס מחיר. משקלי ה-BF16 הם בערך 55.6GB; בכמת ל-4-bit זה נכנס לכרטיס 24GB כמו RTX 3090 או 4090. AMD סיפקה תמיכה ב-Day-0 ביום ההשקה, והמדידות שלה ב-llama.cpp/Vulkan — אוגוסט 2026, ממוצע של שלוש ריצות או יותר — הציבו אותו על 24.5 אסימונים/שנייה ב-Ryzen AI Max+ 395 ועל 51.8 אסימונים/שנייה ב-Radeon AI PRO R9700 עם 32GB, על מערכות עם יותר מכ-24GB של זיכרון גרפי משתנה או VRAM. בדיקות קהילה של גרסת ה-FP8 על NVIDIA GH200 החזיקו 10 בקשות במקביל עם הקשר של 262K וזמן עד אסימון ראשון של פחות מ-10ms. המספרים שלך יהיו שונים — אלה GPUs של מישהו אחר — אבל הצורה אמיתית: זו הוצאה ראשונה של Qwen במחלקה הזו שרצה, לא רק בביקורת, על תחנת עבודה אחת.
משקלים חינם, או API בתשלום?
ההחלטה שהמודל הזה כופה היא ההחלטה שמפרידה בין מקומי למתארח: המשקלים לא עולים כלום, אבל ה-GPUs שלך לא בחינם. אירוח עצמי פירושו בעלות על הסיליקון — כרטיס אחד של 24GB אם אתה מקבל קוונטיזציה של 4-bit ויצירה איטית יותר, ומשהו גדול יותר אם אתה רוצה את כל ההקשר של 262K באיכות מלאה. האלטרנטיבה המתארחת ב-OrcaRouter עולה $0.33 למיליון טוקני קלט ו-$2.40 למיליון טוקני פלט, עם אותו הקשר של 262K וקלט של תמונה+וידאו, וזמן p50 עד לטוקן הראשון של 225ms שנמדד בשבעת הימים האחרונים — בלי GPU לקנות, בלי VRAM לטפל בו. החשבון הוא זה שאתה תמיד עושה עם משקלים פתוחים: תפוקת הטוקנים שאתה באמת צריך כפול העלות שלך לטוקן, מול המחיר הקבוע של כרטיס. בנפח רציף כבד, אירוח עצמי מנצח; בנפח מתפרץ או מתון, לשלם $0.33/$2.40 עדיף מלקנות סיליקון שרוב הזמן בטל.

שורה תחתונה
Qwen3.8-27B הוא המודל החזק ביותר עם משקלים פתוחים שאליבאבא שמה בקטגוריית גודל זו, לפי הנתונים של אליבאבא עצמה: הטוב ביותר בטבלה בקידוד אייג'נטי, שימוש במחשב וחשיבה חזותית, עם חלון הקשר של 262K ומשקלים ברישיון Apache 2.0. הקריאה הנכונה של כרטיס הניקוד היא מותנית — כל נתון בכרטיס המודל הוא מדווח-ספק, תלוי-מסגרת בדיקה, ועדיין לא שוחזר, והמודלים המתקדמים ביותר עדיין מנצחים במבחני ההיגיון הקשים ביותר. אם אתם מחליטים האם לארח אותו בעצמכם או לקרוא לו כ-API, התייחסו לטבלת ה-benchmark כאל הבטחה, לנתוני התפוקה של AMD כמדידת החומרה העצמאית הראשונה, לתוצאת הסוכן המשפטי של Harvey כסימן העצמאי הראשון לכך שהיכולת של המודל שורדת מחוץ למסגרות הבדיקה של אליבאבא עצמה, ולשני המיקומים ב-webdev-arena — מקום 9 כללי ב-WebDev של Code Arena ומודל פתוח מספר 1 ב-Image-to-WebDev של Arena.ai — כאישורי לוח תוצאות הקידוד העצמאיים הראשונים של יכולת זו. נעדכן עמוד זה ככל שמעבדות עצמאיות נוספות יפרסמו ציונים.
