כרטיס כותרת לסיכום בדיקות הביצועים של Qwen3.8-27B, המציג כרטיס דוח בדיקות עם חותמת הנושאת את הכיתוב OPEN WEIGHTS וסמלים לקידוד, תפוקה, ראייה, הקשר ארוך וחומרה מקומית, עם שבבים הנושאים את הכיתובים 27B DENSE, 262K CONTEXT ו-APACHE 2.0.
Guides & Insights

בנצ'מרקי Qwen3.8-27B: הטבלה המלאה, עם ההסתייגויות המצורפות

מחבר

Rowan Sterling

תאריך פרסום

מודלים אחרונים · 20צפו בכל המודלים
בנצ'מרקים: Artificial Analysis · מתעדכן יומית
חזרה לכל הפוסטים

Qwen3.8-27Bמשיג ציונים של 73.0 ב-Terminal-Bench 2.1, 61.7 ב-SWE-bench Pro, 90.3 ב-LiveCodeBench v6 ו-84.3 ב-OSWorld-Verified — וכל אחד מהמספרים הללו הוא של אליבאבא עצמה. המודל בעל 27 מיליארד הפרמטרים והמשקלים הפתוחים עלה ל-Hugging Face ב-14 באוגוסט 2026 תחת Apache 2.0, ונכון ל-15 באוגוסט, אף אחד מחוץ לאליבאבא לא דירג את איכותו באופן בלתי תלוי. עמוד זה הוא הסקירה המלאה והמתועדת: כל 25 מדדי הביצוע הרשמיים מכרטיס המודל, מה השתנה לעומת קודמו Qwen3.6-27B, מה מדדה בדיקת התפוקה הבלתי תלויה של AMD, ואילו טענות עליכם להתייחס כזמניות.

מדריך קריאה לפני המספרים: "רשמי" כאן פירושו ההערכה של Alibaba שמודפסת על כרטיס המודל ב-Qwen/Qwen3.8-27B. זהו דיווח של הספק ולא שוכפל. "עצמאי" פירושו שמישהו מחוץ למעבדה מדד אותו — עד כה זה חל רק על תפוקת חומרה, ולא על אף ציון איכות. מבחני ביצועים שמנגנון ההרצה שלהם חשוב מסומנים בשורה.

המודל, שורה אחת למפרט

• 27B פרמטרים צפופים (28B כולל מקודד הראייה), 64 שכבות, גודל חבוי 5120.

קשב היברידי — 48 שכבות קשב ליניארי של Gated DeltaNet ועוד 16 שכבות קשב מלא, יחס של 3:1 — וזה מה שהופך חלון של 262K טוקנים לזול להרצה.

• {{1}}262,144 טוקנים בהקשר מקורי, הניתן להרחבה ל-1,000,000 עם קנה מידה של YaRN.{{/1}}

קלט תמונה ווידאו מובנה (פלט טקסט), משקלים ברישיון Apache 2.0, כ-55.6GB ב-BF16.

הגרסה הקצרה: זהו המודל שנועד לקחת את מה שאליבאבא למדה מבניית Qwen3.8-Max בעל 2.4 טריליון פרמטרים, ולדחוס אותו למשהו שכרטיס GPU יחיד יכול להריץ.

כרטיס הניקוד: כל המדדים בכרטיס המודל

כל הציונים שלהלן הם לפי דיווח עליבאבא מכרטיס המודל מ-14 באוגוסט, כשהציון של Qwen3.6-27B שהמודל מחליף מופיע בסוגריים.

קידוד. Terminal-Bench 2.1 (קידוד טרמינל אייג'נטי) 73.0 (63.4); SWE-bench Pro 61.7 (53.5); QwenSWEBench 79.0 (49.3); DeepSWE 1.1 42.2 (13.3); NL2Repo-Bench 42.3 (36.2); LiveCodeBench v6 90.3 (83.9). ההרצות של SWE-bench Pro ו-QwenSWEBench השתמשו ברתמת Claude Code, לפי הערת שוליים בכרטיס המודל — כדאי לזכור זאת לפני שמשווים אותן למודל שנמדד ברתמה אחרת.

סוכנים לטווח ארוך ועבודת משרד. CoWorkBench 70.7 (61.0); JobBench 33.4 (21.8); Agents' Last Exam Pass@1 20.4 / score 42.9 (10.6 / 27.3).

חשיבה וידע.GPQA Diamond 89.2 (87.8); Humanity's Last Exam 30.8 (24.0); IFBench ביצוע הוראות 79.5 (69.1). HLE מוערך על ידי GPT-4o, לפי הכרטיס.

ראייה ושימוש במחשב. OSWorld-Verified 84.3 (63.9); WebArena-Verified 64.8 (48.8); AndroidWorld 81.9 (70.3); MathVision 94.6 עם CI / 90.0 ללא (85.1); BabyVision 85.6 עם CI / 65.7 ללא (28.9); OmniDocBench 1.5 91.1 (89.4); RealWorldQA 85.9 (84.1). "CI" הוא שיפור בזמן-הסקה של Alibaba; הפער בין מצבו המופעל למצבו הכבוי הוא המספר האינפורמטיבי ביותר בכרטיס לגבי כמה ניקוד אפשר לקנות עם כוח חישוב הסקה נוסף.

A scoreboard card for Qwen3.8-27B, listing Terminal-Bench 2.1 73.0 (was 63.4), SWE-bench Pro 61.7 (was 53.5), LiveCodeBench v6 90.3 (was 83.9), GPQA Diamond 89.2 (was 87.8), OSWorld-Verified 84.3 (was 63.9) and native context 262K (1M via YaRN), with a footer reading Alibaba-reported, Aug 14 2026 model card — no independent scores yet.

מה למעשה השתנה לעומת Qwen3.6-27B

כל המדדים בכרטיס עלו, אבל ההפרשים אינם אחידים — וצורת השיפור היא הסיפור. הרווחים מתרכזים בקידוד אוטונומי ובשימוש במחשב, לא בשליפת ידע:

• DeepSWE 1.1 (קידוד אגנטי) 13.3 → 42.2, בערך קפיצה של פי 3

• QwenSWEBench 49.3 → 79.0

• ציון הסוכנים בבחינה האחרונה: 27.3 → 42.9

• OSWorld-Verified 63.9 → 84.3 ו-AndroidWorld 70.3 → 81.9

• BabyVision (עם CI) 28.9 → 85.6 — העלייה היחסית הגדולה ביותר בכרטיס

בינתיים GPQA Diamond עבר מ-87.8 ל-89.2 ו-RealWorldQA מ-84.1 ל-85.9: אמיתי אבל קטן. זו לא מהדורה ש"חכמה יותר בכל דבר". זו מהדורה שמכוונת ישירות לסוכנים שקוראים מסכים, משתמשים בכלים וכותבים קוד על פני שלבים רבים.

A card showing the biggest Qwen3.8-27B benchmark gains over Qwen3.6-27B: DeepSWE 1.1 13.3 to 42.2, QwenSWEBench 49.3 to 79.0, Agents' Last Exam score 27.3 to 42.9, OSWorld-Verified 63.9 to 84.3, BabyVision with CI 28.9 to 85.6, WebArena-Verified 48.8 to 64.8, with a footer reading Delta vs Qwen3.6-27B, Alibaba-reported.

הפערים הכנים: היכן שהוא עדיין מפסיד, והסתייגויות המתודולוגיה

מול החזית התמונה מחמיאה אך לא חד-צדדית. בתחומים שבהם Qwen3.8-27B ו-Claude Opus 4.6 Max חופפים, Qwen מנצח ברוב המדדים — SWE-bench Pro, QwenSWEBench, CoWorkBench, LiveCodeBench v6, OSWorld-Verified, AndroidWorld, IFBench, וכל בלוק הראייה. מול Muse Glimmer-30B של Meta, המתחרה הטבעי במחלקה המקומית, הוא מנצח בכל שמונת המדדים החופפים ללא עוררין. אבל הוא עדיין מפסיד ל-Claude Opus 4.6 Max ב-Terminal-Bench 2.1 (73.0 לעומת 78.2), GPQA Diamond (89.2 לעומת 91.3), Humanity's Last Exam (30.8 לעומת 40.0) ו-NL2Repo-Bench (42.3 לעומת 47.6). אם עומס העבודה שלך הוא חשיבת החזית הקשה ביותר — מתמטיקת חזית, שאלות רב-תחומיות מסיביות — ה-27B עדיין לא שם.

שלוש הסתייגויות לפני שתצטטו מכל זה. ראשית, שום דבר מזה לא אומת באופן בלתי תלוי; אין מדד Artificial Analysis ואין ריצת LMArena עבור הדגם 27B נכון ל-15 באוגוסט, וכלי ההערכה של Alibaba עצמם אינם אלה שגורמים שלישיים ישתמשו בהם. שנית, כרטיס המודל משתמש בכלי ההערכה של Claude Code עבור SWE-bench Pro ו-QwenSWEBench, ובשופט GPT-4o עבור Humanity's Last Exam — השוואות עם מודלים שנבדקו על מערכים אחרים ישנו את המספרים. שלישית, ריצת MathVision של Alibaba השתמשה בהנחיה קבועה בעוד שהמתחרים קיבלו את הגבוה מבין שתי גרסאות. שום דבר מזה לא אומר שהתוצאות שגויות; זה אומר שהן תקרה, לא רצפה, עד שמישהו אחר יריץ את המודל.

מה נדרש כדי להריץ את זה

Qwen3.8-27B הוא מודל מקומי, מה שמשנה את משמעות "הביצועים": תפוקה על החומרה שלך במקום כרטיס מחיר. משקלי ה-BF16 הם בערך 55.6GB; בקוונטיזציה ל-4-bit הם נכנסים לכרטיס של 24GB כמו RTX 3090 או 4090. AMD סיפקה תמיכה ביום ההשקה, והמדידות שלה עם llama.cpp/Vulkan — אוגוסט 2026, ממוצע של שלוש ריצות או יותר — העמידו אותו על 24.5 אסימונים/שנייה ב-Ryzen AI Max+ 395 ועל 51.8 אסימונים/שנייה ב-Radeon AI PRO R9700 עם 32GB, על מערכות עם יותר מכ-24GB של זיכרון גרפי משתנה או VRAM. בדיקות קהילה של גרסת ה-FP8 על NVIDIA GH200 החזיקו 10 בקשות במקביל עם הקשר 262K וזמן עד לאסימון ראשון של מתחת ל-10ms. המספרים שלך יהיו שונים — אלה GPU של מישהו אחר — אבל המגמה אמיתית: זו מהדורת Qwen הראשונה במחלקה הזו שרצה על תחנת עבודה אחת, לא רק בסקירה.

משקלים חינם, או API בתשלום?

ההחלטה שהמודל הזה כופה היא ההחלטה שמפרידה בין מקומי למתארח: המשקלים לא עולים כלום, אבל ה-GPUs שלך לא בחינם. אירוח עצמי פירושו בעלות על הסיליקון — כרטיס אחד של 24GB אם אתה מקבל קוונטיזציה של 4-bit ויצירה איטית יותר, ומשהו גדול יותר אם אתה רוצה את כל ההקשר של 262K באיכות מלאה. האלטרנטיבה המתארחת ב-OrcaRouter עולה $0.33 למיליון טוקני קלט ו-$2.40 למיליון טוקני פלט, עם אותו הקשר של 262K וקלט של תמונה+וידאו, וזמן p50 עד לטוקן הראשון של 225ms שנמדד בשבעת הימים האחרונים — בלי GPU לקנות, בלי VRAM לטפל בו. החשבון הוא זה שאתה תמיד עושה עם משקלים פתוחים: תפוקת הטוקנים שאתה באמת צריך כפול העלות שלך לטוקן, מול המחיר הקבוע של כרטיס. בנפח רציף כבד, אירוח עצמי מנצח; בנפח מתפרץ או מתון, לשלם $0.33/$2.40 עדיף מלקנות סיליקון שרוב הזמן בטל.

A decision card titled Free weights, your own compute — or pay per token. The self-host side lists $0 per token, Apache 2.0 weights, roughly 55.6GB BF16 with 4-bit fitting a 24GB card, 24.5 tokens/s on Ryzen AI Max+ 395 and 51.8 tokens/s on Radeon AI PRO R9700. The hosted-API side lists $0.33 input and $2.40 output per 1M tokens, 262K context with image and video input, and a 225ms p50 first token. A footer reads API price per OrcaRouter Aug 15 2026; throughput per AMD llama.cpp/Vulkan tests.

השורה התחתונה

Qwen3.8-27B הוא המודל החזק ביותר במשקל פתוח שאליאבא שחררה בקטגוריית גודל זו, לפי הנתונים של אליאבא עצמה: המוביל בטבלה בקידוד סוכני, שימוש במחשב והסקת ראייה, עם חלון הקשר של 262K ומשקלי Apache 2.0. הקריאה הנכונה של כרטיס התוצאות היא מותנית — כל נתון מדווח על ידי הספק, ספציפי למסגרת הבדיקה, וטרם שוחזר, ומודלי החזית עדיין מנצחים במבחני ההסקה הקשים ביותר. אם אתה מחליט אם לארח אותו בעצמך או לקרוא לו כ-API, התייחס לטבלת המידדים כהבטחה ולנתוני התפוקה של AMD כמדידה העצמאית היחידה שקיימת כיום. נעדכן את הדף הזה ביום שבו מעבדה עצמאית תפרסם ציון.

© 2026 OrcaRouter

לספקים

מפעילים פלטפורמת הסקה (inference)? הציגו את המודלים שלכם ב-OrcaRouter.

צרו קשר

הצטרפו לקהילה שלנו

DiscordEmailXGitHubYouTube