כרטיס כותרת ראשי עבור Qwen3.8-27B, מודל הראייה-שפה הצפוף בעל 27 מיליארד פרמטרים במשפחת Qwen3.8 של Alibaba, עם כותרת המשנה '27B צפוף - ראייה-שפה נייטיבית - Apache 2.0' ושלושה צ'יפים של תכונות שעליהם כתוב 'הקשר של 262,144 אסימונים', 'קלט טקסט + תמונה + וידאו' ו'פלט טקסט', עם הלוגו של OrcaRouter בפינה הימנית התחתונה.
Guides & Insights

Qwen3.8-27B: המודל המולטימודלי הקומפקטי בסדרת Qwen3.8 של Alibaba

מחבר

Gideon Frost

תאריך פרסום

מודלים אחרונים · 20צפו בכל המודלים →
בנצ'מרקים: Artificial Analysis · מתעדכן יומית
חזרה לכל הפוסטים

Qwen3.8-27B הוא החבר הצפוף והחד-צומתי בדור Qwe​n3.8 של Aliba​ba: מודל שפה-חזות ילידי בעל 27 מיליארד פרמטרים, שפורסם ב-Hugging Face תחת Apache 2.0, שמקבל טקסט, תמונות וווידאו ומחזיר טקסט עם חלון הקשר של 262,144 טוקנים. זהו עמוד הייחוס עבור אותו מודל — התיאור הקנוני של מהו, כמה עולה לקרוא לו, ומה הוא מסוגל לעשות — וכדאי לומר כבר מלכתחילה מדוע קיים עמוד עבור מודל שהמשקולות שלו הופיעו לראשונה באוגוסט 2026 ולא בשבעת הימים האחרונים. איננו מדווחים על השקה. אנו עונים על שאלה מתמשכת: קוראים מגיעים אלינו בגלל השם "Qwen3.8-27B" אלפי פעמים בחודש, ועד עכשיו אף עמוד משלנו לא היה הבעלים של התשובה הזו. השחרור של המודל עצמו, המתוארך בכרטיס של Qwe​n ונרשם כ-2026-08-14 על ידי Artificial Analysis, הוא עובדה שהעמוד הזה משתמש בה כדי לתארך את המודל, ולא אירוע שהוא מדווח עליו.

התייחסו לכך כאל החריג שזהו: בקריאה קפדנית של שבעה ימים, מודל מאמצע אוגוסט 2026 אינו עדכני, ופריט זה היה מדולג כחדשות. ההצדקה כאן שונה. זהו עמוד עזר שמספריו אומתו מול כרטיס המודל של Qwen עצמו, קובץ הרישיון של המאגר, כרטיס התעריפים של Qwen Cloud ו-Artificial Analysis בתאריך 2026-09-28, והסיבה לקיומו היא ביקוש חיפוש שמדדנו ממקור ראשון באותו יום. הוא אינו הכרזה שנייה, ואיש לא אמור לקרוא אותו ככזו.

היכן ממוקם 27B בהיצע של Qwen3.8

הדור Qwe​n3.8 אינו מודל אחד, וסיומת הגודל היא כל הפואנטה של השם. ההערות במאגר של Qwe​n עצמו על פני המשפחה מבהירות את הפיצול:

• Qwen3.8-27B — 27B פרמטרים צפופים, קלט תמונה ווידאו מקורי, Apache 2.0. החבר הידידותי לפריסה: מודל בגודל שיכול לרוץ על GPU אחד או צומת קטן, והנושא של עמוד זה.

• Qwen3.8-Max, הבנוי על Qwen3.8-2.4T-A95B — 2.4 טריליון פרמטרים בסך הכול עם 95B פעילים, המודל בדרגת Qwen-Max שאליבאבא חשפה לראשונה בדור הזה. המאגר שלו נושא רישיון ייעודי בשם qwen3.8-max ולא Apache 2.0.

• Qwen3.8-Flash-Next — תצוגה מקדימה של ארכיטקטורה ניסיונית שלדברי Qwe​n תהווה את הבסיס ל-Qwen4, ששוחררה תחת רישיון qwen-community-1.0. Qwen3.8-Flash המתארח מבוסס עליה.

אז "27B" אינו רמת גימור של דגם Max; זו מחלקת הגודל שצוות אחד יכול למעשה לשרת. מה ש-Aliba​ba טוענת שהוא יורש הוא מתכון האימון: הכרטיס מתאר את Qwen3.8-27B כמי שלוקח את ההתקדמויות של הדור בקידוד, בעבודה מקצועית, במחקר ובמשימות סוכניות בטווח ארוך ודוחס אותן לצ'קפוינט צפוף.

Scoreboard infographic titled 'Qwen3.8-27B - the scoreboard' with six rows: Parameters 27B dense (27.8B with vision), Context 262,144 native and 1M with YaRN, Modalities text + image + video in and text out, Licence Apache 2.0 with commercial use, Terminal Bench 2.1 of 73.0 marked vendor-reported, and AA Intelligence Index 33.7 marked independent, with a footer reading 'Qwen figures vendor-reported and unreproduced; AA figures per Artificial Analysis.' and the OrcaRouter logo in the bottom-right corner.

הארכיטקטורה ש-Qwen מפרסם

כל איור שלהלן הוא מתוך כרטיס המודל ב-Qwen/Qwen3.8-27B, שהוא התיעוד של הספק עצמו:

• פרמטרים — 27B כפי שמשווק. המטא-נתונים של safetensors של המאגר עצמו מסתכמים ל-27,781,427,952 פרמטרים ב-BF16 על פני 18 שרדים, כך שזה בערך 27.8B כאשר סופרים את מגדל הראייה. אין כאן תערובת מומחים: כל הפרמטרים פעילים בכל טוקן.

• צורה — 64 שכבות, ממד חבוי 5,120, ממד ביניים של הזנה קדימה 17,408, הטמעת טוקנים ופלט LM 248,320 (עם ריפוד).

• קשב היברידי — הפריסה ש-Qwen מציג היא 16 × (3 × (Gated DeltaNet → FFN) → 1 × (Gated Attention → FFN)): שלושה בלוקי קשב ליניארי על כל בלוק קשב מלא, יחס של 3:1. Gated DeltaNet מפעיל 48 ראשי קשב ליניארי עבור V ו-16 עבור QK בממד ראש 128; Gated Attention מפעיל 24 ראשי שאילתה מול 4 ראשי KV בממד ראש 256, עם ממד רוטרי של 64. היחס הזה הוא מה שהופך חלון של 262K לאפשרי במודל של 27B, והוא אותו קו שושלת ש-Qwen3.8-Flash-Next מרחיב עם קשב דליל.

• חיזוי ריבוי טוקנים — הכרטיס מציין שהמודל אומן עם MTP על פני מספר צעדים, טריק הטיוטה שמאיץ את ההפקה בערימות הגשה המודעות ל-MTP.

• שליטה בחשיבה — מצב חשיבה פועל כברירת מחדל וניתן לכבות אותו לפי בקשה. reasoning_effort מקבל xhigh (ברירת המחדל), medium או low, ו-preserve_thinking פועל כברירת מחדל כך שעקבות החשיבה נשמרות בין תורות במקום להיווצר מחדש.

חלון ההקשר ותקרת הפלט

הכרטיס מציין 262,144 טוקנים באופן נייטיבי, ניתן להרחבה עד 1,000,000 עם RoPE scaling (YaRN). הנחיות ההגשה של Qwe​n עצמה עבור הרצות סוכניות ארוכות, בתוך מעטפת 1M הזו, הן לאפשר עד 262,144 טוקנים לתוכן חשיבה ועד 131,072 טוקנים לתגובה הסופית — התקרה היא תצורת הגשה, לא מאפיין קבוע של ה-checkpoint.

כדאי להפריד בין שני חלונות, מפני שקל לבלבל ביניהם. המשקולות הפתוחות פועלות באופן נייטיבי ב-262,144; הגרסה המאוחסנת ב-Qwe​n Cloud, שכרטיס המודל מתאר ככזו שטרם הגיעה ("השירות בקרוב"), מופיעה בעמוד המודל של Qwe​n Cloud עם הקשר של 1M, קלט מרבי של 991K, פלט מרבי של 131K ותקציב חשיבה מרבי של 262K. דף המפרט של המוצר המאוחסן אינו דף המפרט של נקודת הביקורת.

מודאליות: מה נכנס ומה יוצא

הקלט הוא טקסט, תמונה ווידאו; הפלט הוא טקסט בלבד. הכרטיס מכנה את Qwen3.8-27B "מודל חזותי-לשוני ילידי שמבין תמונות ווידאו", וקוד הדוגמה שלו מעביר את כל שלושת סוגי הקלט. אין קלט אודיו, אין יצירת תמונות ואין פלט דיבור. רשומת המודל של Artificial Analysis עבור אותו צ'קפוינט מסכימה על המעטפת — תמונה, ווידאו וטקסט נכנסים, טקסט יוצא — וזו קריאה שנייה שימושית משום שהיא אינה העמוד של Alibaba עצמו.

מה שהשחרור של Apache 2.0 למעשה מתיר

הרישיון אינו תקציר בפוסט בבלוג; המאגר מכיל את נוסח Apache License, Version 2.0 עצמו, והמטא-נתונים של הכרטיס מצהירים license: apache-2.0. מה שזה מעניק, כפי שעולה מנוסח הרישיון: רישיון זכויות יוצרים תמידי, כלל-עולמי, ללא תמלוגים, לשכפל, להכין יצירות נגזרות, להציג בפומבי, לתת רישיון משנה ולהפיץ את היצירה ואת נגזרותיה, וכן רישיון פטנטים מהתורמים — כאשר שימוש מסחרי הוא בין המטרות המותרות, ללא הגבלת תחום שימוש, ללא סף מספר משתמשים וללא הסכם מסחרי נפרד. Apache 2.0 הוא גם מתירני במובן החשוב לשילוח מוצרים: ניתן להפיץ מחדש משקלות נגזרים בתנאים שונים, כל עוד אתם שומרים על הרישיון והודעות הייחוס ומציינים מה שיניתם (סעיפים 4a–4c). סעיף 6 אינו מעניק זכויות בשם Qwe​n או בסימני המסחר, כך שפיצול Apache-2.0 אינו יכול לשווק את עצמו כ-Qwe​n.

ההשוואה בתוך המשפחה מלמדת, והיא נראית מהמאגרים ולא מהסיקור: הצ'קפוינט 2.4T-A95B מכנה את עצמו אחר עם רישיון qwen3.8-max, ו-Qwen3.8-Flash-Next משתמש ב-qwen-community-1.0. ה-27B הוא זה מבין השלושה שמגיע תחת Apache 2.0 רגיל.

עמדת הבנצ'מרק העצמאי

Artificial Analysis הריצה את המודל, והתוצאה שלה ראויה להפרדה מהטבלה של עליבאבא עצמה, מכיוון שהשתיים עונות על שאלות שונות. המדד העצמאי, שנמדד על xhigh תצורה:

• Intelligence Index 33.7 — הערך השמור של Artificial Analysis, שדף המודל שלה מציג אותו מעוגל ל-34. שני דירוגים מפורסמים והם מודדים אוכלוסיות שונות: אריח הסיכום של אותו דף מציב את המודל במקום הראשון מבין 142 המודלים במחלקת הגודל שלו, בהשוואה באותה מחלקה שתיאור המוקפץ של הדף מתאר, ואילו הרשומה בקטלוג שלנו שמקורה ב-Artificial Analysis מתעדת מקום 45 מתוך 145, בערך באחוזון ה-67. אף אחד מהם אינו דירוג מול אותו שדה כמו האחר, ולכן אין לקרוא אותם כמספר אחד בשני פורמטים.

• מדד הקידוד 68.1 — מופיע בקטלוג שלנו עם artificialanalysis.ai כמקור הנקוב שלו, ומדורג 35 מתוך 138 במאגר של אותו מדד. המודל ממוקם גבוה יותר בקידוד מאשר באינטליגנציה כללית, וזה מתיישב עם המבנה של הטבלה של הספק עצמו.

• סולם המאמץ, אותה תשתית בדיקה — הורדת מאמץ החשיבה מזיזה את המדד מרחק רב: 33.7 ב-xhigh, 27.6 ב-medium, 26.2 ב-low, ו-20.2 כשהחשיבה כבויה לחלוטין. זהו פער מדוד של 13.5 נקודות, והוא הטיעון המוחשי ביותר לכוונון המאמץ לפי עומס העבודה ולא לפי המודל.

• היכן ששני המקורות מסכימים וחולקים — ב-GPQA Diamond, הכרטיס של Aliba​ba מדווח 89.2 ו-Artificial Analysis מודד 90.5. ב-Humanity's Last Exam הכרטיס מדווח 30.8 ו-Artificial Analysis 33.9. קרוב, אבל לא אותו מספר, וזה נורמלי: מסגרות בדיקה שונות, ריצות שונות. הסתייגות אחת שייכת למאמר ולא להערת שוליים — אף צד שלישי לא פרסם השוואה ראש-בראש בין Qwen3.8-27B לבין מי מהמודלים בטבלת ההשוואה של Aliba​ba, כשה它们 מורצים במאמץ מותאם על מסגרת בדיקה מותאמת, כך שכל השוואה חוצת-מודלים בעמוד הזה היא השוואה של מדידות נפרדות, ולא תוצאה.

Screenshot of the Artificial Analysis model page for Qwen3.8 27B in its xhigh configuration showing a same-class comparison rank of 1 of 142 next to an Intelligence tile, 46.6 output tokens per second at rank 55 of 142, $0.50 per million input tokens and $3.00 per million output tokens, a 256k-token context window, 27B total parameters, an Apache 2.0 licence, an open-weights marker and a release month of August 2026, with the summary text reporting a score of 34 on the Artificial Analysis Intelligence Index.

מה Qwen מדווח, ואיך לקרוא אותו

כרטיס המודל מציג כעשרים וארבעה ציונים עם עמודות השוואה עבור Qwen3.6-27B, Qwen3.7-Plus, Muse Glimmer-30B ו-Opus4.6 Max. כל זה מדווח על ידי הספק ואינו משוחזר — ההערכה של Aliba​ba עצמה, שהודפסה על ידי Aliba​ba — ומספר שורות משתמשות בהרנס של Claude Code שנשפט על ידי בניין GPT-5.4, כפי שמציינות הערות השוליים של הכרטיס. הנתונים הכותריים של הספק, על בסיס זה:

• קידוד טרמינלי סוכני — Terminal Bench 2.1 (Terminus) 73.0, לעומת 63.4 עבור Qwen3.6-27B שהוא מחליף, כאשר Opus4.6 Max מוביל את השורה עם 78.2.

• קידוד סוכני — SWE-bench Pro 61.7, QwenSWEBench 79.0, DeepSWE 1.1 42.2, NL2Repo-Bench 42.3, LiveCodeBench v6 90.3.

• סוכנים ועבודה משרדית — CoWorkBench 70.7, JobBench 33.4, Agents' Last Exam 42.9 לפי ציון (Pass@1 20.4).

• חשיבה כללית — GPQA Diamond 89.2, HLE 30.8, IFBench 79.5. Opus4.6 Max מוביל את שתי שורות החשיבה בטבלה של הספק עצמו, ב-91.3 ו-40.0.

• ראייה ושימוש במחשב — OSWorld-Verified 84.3, AndroidWorld 81.9, WebArena-Verified 64.8, OmniDocBench 1.5 91.1, RealWorldQA 85.9.

סיכום כן של הטבלה הזו צר יותר ממה שהטבלה נראית. לעומת קודמו הישיר השיפורים גדולים ועקביים — QwenSWEBench 79.0 לעומת 49.3, DeepSWE 42.2 לעומת 13.3 — וזו טענה על שינוי מתכון של דור אחד. לעומת מודלי החזית בעמודות השכנות היא מנצחת בכמה שורות ומפסידה באחרות, לפי המספרים של Alibaba עצמה, ולפי בחירת ה-harness של Alibaba עצמה.

מריץ את זה

המשקולות הן 18 שרדים בפורמט BF16 בתבנית Transformers, והכרטיס מפרט את Hugging Face Transformers, vLLM, SGLang ו-TokenSpeed כסטאקים נתמכים. כתבנו בנפרד את מסלולי הפריסה המקומית והקוונטיזציה, ואלה המקומות הנכונים לפרט הזה: Qwen3.8-27B על Ollama עבור דיימון מקומי, ואת סקירת הבנצ'מרקים עבור לוח התוצאות המלא, כולל מה שהשתנה מ-Qwen3.6-27B. הדף הזה נשאר על המודל עצמו.

Qwen3.8-27B בקטלוג שלנו

שני כרטיסים פעילים היום ב-OrcaRouter, זה לצד זה, ושניהם נקראו מחדש ב-2026-09-28 לפני שנכתבה הפסקה הזו. qwen/qwen3.8-27b מתומחר ב-$0.33 למיליון טוקנים בקלט וב-$2.40 למיליון טוקנים בפלט, עם חלון מלא של 262,144 טוקנים, קלט טקסט, תמונה ווידאו, ומשטחי ה-reasoning, הכלים, הפלט המובנה וה-JSON חשופים כפרמטרים. אחיו obsidian/Qwen3.8-27B — אותם משקלים המוגשים ב-block-FP8 כאשר מגדל הראייה נשמר בדיוק מלא, ובלשונו של הכרטיס עצמו, "designed to provide direct, complete responses across a wide range of prompts" — מתומחר ב-$0.40 בקלט וב-$4.21 בפלט. שניהם עונים ל-chat completions ול-Responses API, כך שניתן לכוון משימת ניתוח מסמכים או צילום מסך לאחד משני המודלים תחת מפתח אחד ונקודת קצה אחת, בלי חוזה שני ובלי שינוי בקוד.

לשם קנה מידה, ה-playground שלנו העביר 105.1 מיליון טוקנים דרך qwen/qwen3.8-27b בשבעת הימים האחרונים, עם זמן חציוני של 3.8 שניות עד הבת הראשון ושיעור שגיאות של 3.3% באותו חלון זמן. אלה נתוני ההגשה שלנו, לא פסק דין על המודל.

Screenshot of the OrcaRouter model page for qwen/qwen3.8-27b showing a 262K-token context window, text, image and video input, text output, the vision, tools, JSON and reasoning badges, a 3.80-second p50 time to first token, 105.1M tokens served in seven days, and list pricing of $0.33 per million input tokens and $2.40 per million output tokens.

החיפושים שמובילים לכאן

הביקוש שמאחורי העמוד הזה מפוזר ודליל ויושב ממש מחוץ לקליק. ב-28 הימים עד 2026-09-25 הנכס שלנו קיבל 8,931 חשיפות ו-273 קליקים על פני 69 איותים מדויקים ומובחנים של שם המודל — "qwen3.8 27b", "qwen3.8-27b", "qwen 3.8 27b" ועוד עשרות דרכים לכתוב את אותם שלושה טוקנים. המיקום הטוב ביותר שלנו עבור האיותים הגדולים ביותר נע בין 9.0 ל-10.6. אלה מיקומים שהחזקנו בהם במקרה בזכות עמודים אחרים, וזו בדיוק הבעיה שעמוד קנוני פותר: במקום התשיעי אתה נמצא בעמוד, ואף אחד לא לוחץ. המקום היחיד שבו התנועה ממירה הוא לא-אנגלית — איות של השם בשפה הרוסית יושב אצלנו במיקום 1.8 וממיר ב-14.4%.

שום דבר מזה אינו ראיה לגבי המודל. זו ראיה לגבי מה שאנשים מקלידים, וזה הסיבה שהדף קיים.

מה שכל זה מסתכם בו: צ'קפוינט צפוף של 27B עם פריסת קשב יוצאת דופן באמת, רישיון מתירני, הבנת וידאו נייטיבית, תנאי Apache-2.0 שמאפשרים לך להפיץ נגזרת, דירוג קידוד עצמאי ברבעון העליון של מה ש-Artificial Analysis מודדת, וטבלת ספקים שחזקה מול קודמו ומעורבת מול החזית. השאלה הפתוחה היא זו שאף אחד מחוץ ל-Alibaba עדיין לא יכול לענות עליה — כיצד מתנהג המסלול המתארח של 1M-token בפרודקשן, והאם ארכיטקטורת Flash-Next נוחתת במודל בגודל הזה.

ליבת 2.4T-A95B שמאחורי Qwen3.8-Max זמינה באותו קטלוג: qwen/qwen3.8-max במחיר $2.00 / $6.00 למיליון טוקנים, אם ה-27B אינו הגודל שאתם צריכים.

השוואות במאמר הזה1

זוהה מתוך המאמר הזה · בנצ'מרקים: Artificial Analysis · מתעדכן יומית