
בנצ'מרקי Qwen3.8-27B: הטבלה המלאה, עם ההסתייגויות המצורפות
- obsidianחדשQwen3.8 27B Uncensored (Aggressive)2026-08-1552אינטליגנציה68כתיבת קוד
- qwenחדשQwen: Qwen3.8 27B (free)2026-08-1359 tok/s
- deepseekחדשDeepSeek: DeepSeek V4 Pro 08132026-08-1253אינטליגנציה69כתיבת קוד
- grokחדשSpaceXAI: Grok 4.62026-08-1261אינטליגנציה77כתיבת קוד
- metaחדשMeta: Muse Spark 1.22026-08-0557אינטליגנציה72כתיבת קוד
- qwenQwen: Qwen3.8 Max2026-08-0358אינטליגנציה72כתיבת קוד
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3152אינטליגנציה69כתיבת קוד
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 לכל 1M טוקנים · 230 tok/s
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463אינטליגנציה78כתיבת קוד
- googleGoogle: Gemini 3.6 Flash2026-07-2152אינטליגנציה69כתיבת קוד
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137אינטליגנציה49כתיבת קוד
- metaMeta: Muse Spark 1.12026-07-1653אינטליגנציה71כתיבת קוד
- kimiMoonshotAI: Kimi K32026-07-1560אינטליגנציה76כתיבת קוד
- openaiOpenAI: GPT-5.6 Luna2026-07-0952אינטליגנציה71כתיבת קוד
- openaiOpenAI: GPT-5.6 Terra2026-07-0957אינטליגנציה77כתיבת קוד
- openaiOpenAI: GPT-5.6 Sol2026-07-0961אינטליגנציה77כתיבת קוד
- grokxAI: Grok 4.52026-07-0856אינטליגנציה72כתיבת קוד
- tencentTencent: Hy32026-07-0642אינטליגנציה59כתיבת קוד
Qwen3.8-27Bמשיג ציונים של 73.0 ב-Terminal-Bench 2.1, 61.7 ב-SWE-bench Pro, 90.3 ב-LiveCodeBench v6 ו-84.3 ב-OSWorld-Verified — וכל אחד מהמספרים הללו הוא של אליבאבא עצמה. המודל בעל 27 מיליארד הפרמטרים והמשקלים הפתוחים עלה ל-Hugging Face ב-14 באוגוסט 2026 תחת Apache 2.0, ונכון ל-15 באוגוסט, אף אחד מחוץ לאליבאבא לא דירג את איכותו באופן בלתי תלוי. עמוד זה הוא הסקירה המלאה והמתועדת: כל 25 מדדי הביצוע הרשמיים מכרטיס המודל, מה השתנה לעומת קודמו Qwen3.6-27B, מה מדדה בדיקת התפוקה הבלתי תלויה של AMD, ואילו טענות עליכם להתייחס כזמניות.
מדריך קריאה לפני המספרים: "רשמי" כאן פירושו ההערכה של Alibaba שמודפסת על כרטיס המודל ב-Qwen/Qwen3.8-27B. זהו דיווח של הספק ולא שוכפל. "עצמאי" פירושו שמישהו מחוץ למעבדה מדד אותו — עד כה זה חל רק על תפוקת חומרה, ולא על אף ציון איכות. מבחני ביצועים שמנגנון ההרצה שלהם חשוב מסומנים בשורה.
המודל, שורה אחת למפרט
• 27B פרמטרים צפופים (28B כולל מקודד הראייה), 64 שכבות, גודל חבוי 5120.
קשב היברידי — 48 שכבות קשב ליניארי של Gated DeltaNet ועוד 16 שכבות קשב מלא, יחס של 3:1 — וזה מה שהופך חלון של 262K טוקנים לזול להרצה.
• {{1}}262,144 טוקנים בהקשר מקורי, הניתן להרחבה ל-1,000,000 עם קנה מידה של YaRN.{{/1}}
קלט תמונה ווידאו מובנה (פלט טקסט), משקלים ברישיון Apache 2.0, כ-55.6GB ב-BF16.
הגרסה הקצרה: זהו המודל שנועד לקחת את מה שאליבאבא למדה מבניית Qwen3.8-Max בעל 2.4 טריליון פרמטרים, ולדחוס אותו למשהו שכרטיס GPU יחיד יכול להריץ.
כרטיס הניקוד: כל המדדים בכרטיס המודל
כל הציונים שלהלן הם לפי דיווח עליבאבא מכרטיס המודל מ-14 באוגוסט, כשהציון של Qwen3.6-27B שהמודל מחליף מופיע בסוגריים.
קידוד. Terminal-Bench 2.1 (קידוד טרמינל אייג'נטי) 73.0 (63.4); SWE-bench Pro 61.7 (53.5); QwenSWEBench 79.0 (49.3); DeepSWE 1.1 42.2 (13.3); NL2Repo-Bench 42.3 (36.2); LiveCodeBench v6 90.3 (83.9). ההרצות של SWE-bench Pro ו-QwenSWEBench השתמשו ברתמת Claude Code, לפי הערת שוליים בכרטיס המודל — כדאי לזכור זאת לפני שמשווים אותן למודל שנמדד ברתמה אחרת.
סוכנים לטווח ארוך ועבודת משרד. CoWorkBench 70.7 (61.0); JobBench 33.4 (21.8); Agents' Last Exam Pass@1 20.4 / score 42.9 (10.6 / 27.3).
חשיבה וידע.GPQA Diamond 89.2 (87.8); Humanity's Last Exam 30.8 (24.0); IFBench ביצוע הוראות 79.5 (69.1). HLE מוערך על ידי GPT-4o, לפי הכרטיס.
ראייה ושימוש במחשב. OSWorld-Verified 84.3 (63.9); WebArena-Verified 64.8 (48.8); AndroidWorld 81.9 (70.3); MathVision 94.6 עם CI / 90.0 ללא (85.1); BabyVision 85.6 עם CI / 65.7 ללא (28.9); OmniDocBench 1.5 91.1 (89.4); RealWorldQA 85.9 (84.1). "CI" הוא שיפור בזמן-הסקה של Alibaba; הפער בין מצבו המופעל למצבו הכבוי הוא המספר האינפורמטיבי ביותר בכרטיס לגבי כמה ניקוד אפשר לקנות עם כוח חישוב הסקה נוסף.

מה למעשה השתנה לעומת Qwen3.6-27B
כל המדדים בכרטיס עלו, אבל ההפרשים אינם אחידים — וצורת השיפור היא הסיפור. הרווחים מתרכזים בקידוד אוטונומי ובשימוש במחשב, לא בשליפת ידע:
• DeepSWE 1.1 (קידוד אגנטי) 13.3 → 42.2, בערך קפיצה של פי 3
• QwenSWEBench 49.3 → 79.0
• ציון הסוכנים בבחינה האחרונה: 27.3 → 42.9
• OSWorld-Verified 63.9 → 84.3 ו-AndroidWorld 70.3 → 81.9
• BabyVision (עם CI) 28.9 → 85.6 — העלייה היחסית הגדולה ביותר בכרטיס
בינתיים GPQA Diamond עבר מ-87.8 ל-89.2 ו-RealWorldQA מ-84.1 ל-85.9: אמיתי אבל קטן. זו לא מהדורה ש"חכמה יותר בכל דבר". זו מהדורה שמכוונת ישירות לסוכנים שקוראים מסכים, משתמשים בכלים וכותבים קוד על פני שלבים רבים.

הפערים הכנים: היכן שהוא עדיין מפסיד, והסתייגויות המתודולוגיה
מול החזית התמונה מחמיאה אך לא חד-צדדית. בתחומים שבהם Qwen3.8-27B ו-Claude Opus 4.6 Max חופפים, Qwen מנצח ברוב המדדים — SWE-bench Pro, QwenSWEBench, CoWorkBench, LiveCodeBench v6, OSWorld-Verified, AndroidWorld, IFBench, וכל בלוק הראייה. מול Muse Glimmer-30B של Meta, המתחרה הטבעי במחלקה המקומית, הוא מנצח בכל שמונת המדדים החופפים ללא עוררין. אבל הוא עדיין מפסיד ל-Claude Opus 4.6 Max ב-Terminal-Bench 2.1 (73.0 לעומת 78.2), GPQA Diamond (89.2 לעומת 91.3), Humanity's Last Exam (30.8 לעומת 40.0) ו-NL2Repo-Bench (42.3 לעומת 47.6). אם עומס העבודה שלך הוא חשיבת החזית הקשה ביותר — מתמטיקת חזית, שאלות רב-תחומיות מסיביות — ה-27B עדיין לא שם.
שלוש הסתייגויות לפני שתצטטו מכל זה. ראשית, שום דבר מזה לא אומת באופן בלתי תלוי; אין מדד Artificial Analysis ואין ריצת LMArena עבור הדגם 27B נכון ל-15 באוגוסט, וכלי ההערכה של Alibaba עצמם אינם אלה שגורמים שלישיים ישתמשו בהם. שנית, כרטיס המודל משתמש בכלי ההערכה של Claude Code עבור SWE-bench Pro ו-QwenSWEBench, ובשופט GPT-4o עבור Humanity's Last Exam — השוואות עם מודלים שנבדקו על מערכים אחרים ישנו את המספרים. שלישית, ריצת MathVision של Alibaba השתמשה בהנחיה קבועה בעוד שהמתחרים קיבלו את הגבוה מבין שתי גרסאות. שום דבר מזה לא אומר שהתוצאות שגויות; זה אומר שהן תקרה, לא רצפה, עד שמישהו אחר יריץ את המודל.
מה נדרש כדי להריץ את זה
Qwen3.8-27B הוא מודל מקומי, מה שמשנה את משמעות "הביצועים": תפוקה על החומרה שלך במקום כרטיס מחיר. משקלי ה-BF16 הם בערך 55.6GB; בקוונטיזציה ל-4-bit הם נכנסים לכרטיס של 24GB כמו RTX 3090 או 4090. AMD סיפקה תמיכה ביום ההשקה, והמדידות שלה עם llama.cpp/Vulkan — אוגוסט 2026, ממוצע של שלוש ריצות או יותר — העמידו אותו על 24.5 אסימונים/שנייה ב-Ryzen AI Max+ 395 ועל 51.8 אסימונים/שנייה ב-Radeon AI PRO R9700 עם 32GB, על מערכות עם יותר מכ-24GB של זיכרון גרפי משתנה או VRAM. בדיקות קהילה של גרסת ה-FP8 על NVIDIA GH200 החזיקו 10 בקשות במקביל עם הקשר 262K וזמן עד לאסימון ראשון של מתחת ל-10ms. המספרים שלך יהיו שונים — אלה GPU של מישהו אחר — אבל המגמה אמיתית: זו מהדורת Qwen הראשונה במחלקה הזו שרצה על תחנת עבודה אחת, לא רק בסקירה.
משקלים חינם, או API בתשלום?
ההחלטה שהמודל הזה כופה היא ההחלטה שמפרידה בין מקומי למתארח: המשקלים לא עולים כלום, אבל ה-GPUs שלך לא בחינם. אירוח עצמי פירושו בעלות על הסיליקון — כרטיס אחד של 24GB אם אתה מקבל קוונטיזציה של 4-bit ויצירה איטית יותר, ומשהו גדול יותר אם אתה רוצה את כל ההקשר של 262K באיכות מלאה. האלטרנטיבה המתארחת ב-OrcaRouter עולה $0.33 למיליון טוקני קלט ו-$2.40 למיליון טוקני פלט, עם אותו הקשר של 262K וקלט של תמונה+וידאו, וזמן p50 עד לטוקן הראשון של 225ms שנמדד בשבעת הימים האחרונים — בלי GPU לקנות, בלי VRAM לטפל בו. החשבון הוא זה שאתה תמיד עושה עם משקלים פתוחים: תפוקת הטוקנים שאתה באמת צריך כפול העלות שלך לטוקן, מול המחיר הקבוע של כרטיס. בנפח רציף כבד, אירוח עצמי מנצח; בנפח מתפרץ או מתון, לשלם $0.33/$2.40 עדיף מלקנות סיליקון שרוב הזמן בטל.

השורה התחתונה
Qwen3.8-27B הוא המודל החזק ביותר במשקל פתוח שאליאבא שחררה בקטגוריית גודל זו, לפי הנתונים של אליאבא עצמה: המוביל בטבלה בקידוד סוכני, שימוש במחשב והסקת ראייה, עם חלון הקשר של 262K ומשקלי Apache 2.0. הקריאה הנכונה של כרטיס התוצאות היא מותנית — כל נתון מדווח על ידי הספק, ספציפי למסגרת הבדיקה, וטרם שוחזר, ומודלי החזית עדיין מנצחים במבחני ההסקה הקשים ביותר. אם אתה מחליט אם לארח אותו בעצמך או לקרוא לו כ-API, התייחס לטבלת המידדים כהבטחה ולנתוני התפוקה של AMD כמדידה העצמאית היחידה שקיימת כיום. נעדכן את הדף הזה ביום שבו מעבדה עצמאית תפרסם ציון.
