כרטיס גיבור עם הכיתוב 'Qwen3.8-27B for Coding' וכותרת המשנה 'למה לצפות לפני פרסום המשקלים', צ'יפים עבור 'כ-27B משקלים פתוחים', 'קידוד אייג'נטי' ו'הוכרז ב-3 באוגוסט 2026', עם הלוגו של OrcaRouter בפינה.
Engineering & Research

Qwen3.8-27B לקידוד: למה לצפות לפני שהמשקולות יוצאות

מחבר

Rowan Sterling

תאריך פרסום

מודלים אחרונים · 20צפו בכל המודלים
בנצ'מרקים: Artificial Analysis · מתעדכן יומית
חזרה לכל הפוסטים

אם אתם מריצים מודלים מקומיים לקידוד, המספר שחשוב ביותר מההשקה של Qwe​n3.8 של Alibaba ב-3 באוגוסט 2026 הוא לא הנתון שעמד בכותרת – 2.4 טריליון פרמטרים של Qwen3.8-Max – אלא ציון ה-FrontierSWE שקפץ מ-40.7 בדור הקודם ל-73.5 בדור הזה. הקפיצה הזו התרחשה בדגם הדגל. המודל שאולי יביא חלק ממנה לחומרה שלכם הוא Qwen3.8-27B, חבר דור Qwe​n3.8 בעל משקלים פתוחים עם כ-27 מיליארד פרמטרים, שהוכרז באותו יום ועדיין לא ניתן להורדה נכון לכתיבת שורות אלה. זהו מאמר של מה שידוע עד כה, לא סקירה: איש מחוץ למעבדה של Alibaba עדיין לא הריץ את Qwen3.8-27B, אין כרטיס מודל רשמי, וכל הורדה שטוענת שזהו המודל כרגע היא מקום שמור או העלאה של צד שלישי.

הנה נקודת המוצא הכנה לכל מי שמתכנן הגדרת קידוד מקומית סביב ה-27B: הרווחים של דגם הדגל מדווחים על ידי היצרן עד שתוצאות עצמאיות ינחתו, המפרטים של ה-27B עצמו אינם מאושרים, והדבר היחיד שאנחנו יכולים למדוד היום הוא קודמו Qwen3.6-27B — שכבר היה אחד מדגמי הקידוד המקומיים הטובים ביותר של 2026. זו רמת הבסיס שהדור הזה צריך לנצח, והיא גבוהה.

למה ה-27B הוא המודל שלמתכנתים באמת אכפת ממנו

Qwen3.8-Max הוא מודל מרכז נתונים: תערובת מומחים (Mixture-of-Experts) עם 2.4 טריליון פרמטרים, כ-95 מיליארד פרמטרים פעילים, הקשר של 1M טוקנים, וללא דרך לצרכנים להריץ אותו מקומית. Qwen3.8-27B הוא ההימור ההפוך — מודל בעל משקלים פתוחים בסדר גודל של ~27B, המיועד ל-GPU יחיד, ומוצב כמהדורת הדור הניתנת לאירוח עצמי. עבור קהל המפתחים, ה-27B הוא המוצר. ה-Max הוא ההוכחה שהאימון של הדור הזה השיג משהו.

מהו אותו "משהו", לפי הערכותיה של עליבאבא עצמה: Terminal-Bench 2.1 ב-86.6 (לעומת 74.5 עבור Qwen 3.7 Max), SWE-bench Pro ב-67.7, PaperBench ב-93.0, והקפיצה של FrontierSWE מ-40.7 ל-73.5 שמאותתת על שינוי מהותי בקידוד סוכני ארוך-טווח — המודל עובד באופן אוטונומי על משימות ריפוזיטורי מרובות-שלבים במקום לענות על הנחיות בודדות. עוקבים עצמאיים מציבים את Qwen3.8-Max על מדד קידוד Artificial Analysis של 71.8 ומדד אינטליגנציה של 58.1, כך שהדור אמיתי גם אחרי שמפשיטים את השיווק של עליבאבא. אף אחד מהמספרים האלה לא עובר ישירות ל-27B. אבל הם הסיבה ש-27B הוא הקודן המקומי המצופה ביותר של המחצית השנייה של 2026: מודל קטן יותר שיורש אפילו חלק מהשיפור הסוכני הזה יקבע מחדש מה המשמעות של "קידוד מקומי טוב" בקנה מידה של 27B.

Scoreboard titled 'Qwen3.8-27B for coding - what is known' listing: status announced, weights not yet downloadable; class approx 27B, successor to Qwen3.6-27B; 4-bit VRAM 16-24 GB projected; Terminal-Bench 2.1 (Max) 86.6 vendor-reported; FrontierSWE (Max) 73.5 up from 40.7; independent coding score none yet.

הקודם קבע את הרף: Qwen3.6-27B

Qwen3.6-27B הוא המודל שעליו מבוססת כל תחזית לגבי ה-3.8 27B, כי מדובר באותה מחלקה ובאותה פיזיקה. זהו מודל dense עם 27B פרמטרים, הקשר מקורי של 262K, מצבי חשיבה ואי-חשיבה, קלט מקורי של טקסט/תמונה/וידאו, ורישיון Apache 2.0. הוא זכה למוניטין שלו כקודן מקומי לא בזכות ניצחון בכל benchmark, אלא בזכות היותו המודל הגדול ביותר שעדיין התאים ל-GPU צרכני באיכות שמישה — הנקודה על עקומת הגודל/איכות שבה מפסיקים להמיר יכולות בחומרה.

זהו חלון ההקשר ב-3.8-27B: הוא צריך להיות לפחות ברמה של 3.6-27B באותה עלות חומרה, ובאופן אידיאלי טוב יותר בעבודה סוכנית, כי זו הסיבה הכנה היחידה לעבור לגרסה החדשה. אם הוא משתווה ל-3.6 בקידוד גולמי ומוסיף את השיפורים הסוכניים של הדור הזה, הוא הופך לבחירה המקומית כברירת מחדל. אם הוא רק משחזר את אותם הציונים, השדרוג שולי.

מציאות החומרה: 16 GB היא השאלה הלא נכונה

מכיוון שלא קיימים מפרטים רשמיים, תחזיות ה-VRAM מבוססות על מדידות של Qwen3.6-27B, והסיכום הכנה הוא שקוונטיזציה של 4-bit היא משחק של 24 GB, לא של 16 GB. ב-Q4_K_M המשקולות הן בערך 16–17 GB, מה שנשמע כאילו כרטיס של 16 GB יכול להכיל זאת — עד שמטמון ה-KV ותקורות המודל דוחפים את הדרישה האמיתית לכ-20–24 GB. ההנחיה המעשית מהמסמך של Alibaba Cloud עצמו היא חדה: Q4_K_M לא מתאים לכרטיס GPU של 16 GB בשימוש אמיתי. הנתונים מהקהילה נעים סביב:

Q3_K_M — כ-13 GB של משקלים, מתאים לכרטיסי 12–16 GB באיכות מופחתת.

• Q4_K_M — ~16–17 GB של משקלים, בפועל 20–24 GB עם קונטקסט — הנקודה המתוקה של RTX 3090/4090

• Q6_K — ~21–22 GB, כמעט ללא אובדן על כרטיסי 24 GB

• Q8_0 — ~28.6 GB, דורש 32 GB

• דיוק מלא של BF16 — ~54–56 GB, מחוץ להישג יד לכל GPU צרכני

Unsloth הציגה גרסת 4-bit שרצה על כ-17 GB, מה שעולה בקנה אחד עם מודל של ~27B ב-4-bit — התייחסו לזה כרצפה עבור עומס עבודה מצומצם ללא קונטקסט, לא כמספר הייצור שלכם. אם אתם מתכננים חומרה, תכננו סביב כרטיס מסך של 24 GB.

שרשרת כלים: מה מגיע ביום הראשון לעומת השבוע השני

כאשר המשקלים יוצאים, התמיכה לא מגיעה בבת אחת. מנועי ההגשה vLLM ו-SGLang בדרך כלל משלבים תמיכה בתוך ימים משחרור של אליבאבא, וכך מי שמארחים בעצמם מקבלים נקודת קצה תואמת OpenAI במהירות. כימותים קהילתיים של GGUF ו-AWQ מפגרים בשבוע עד שבועיים, מה שאומר שחוויית ה"משוך והרץ" דרך כלים מבוססי llama.cpp (Ollama, LM Studio) תישאר מאחור לעומת המשקלים הגולמיים — ואם ה-27B חולק ארכיטקטורה חדשה באמת עם ה-Max במקום שימוש חוזר בפריסת ה-3.6, צפו שהכלים ייקחו יותר זמן. בשבוע או שבועיים הראשונים, הנתיב המהיר ביותר יהיה vLLM על המשקלים הלא-מכומתים, לא משיכה בפקודה אחת.

Screenshot of the official Qwen Studio blog post 'Qwen3.8-Max: A New Bar for Coding and Cowork', dated 2026/08/03, announcing the Qwen3.8 generation.

מה 27B יכול בפועל לעשות עבור עבודה אגנטית

יש להגדיר את הציפיות נכון: הדמו האוטונומי בן 16 הימים — Qwe​n3.8 של עליבאבא שבונה רתמת סוכן שמתפתחת עצמאית על פני מאות קומיטים ללא התערבות אנושית — הוא תצוגת דגל. דגם 27B לא יבצע זאת. מה שמודל קוד מקומי ברמת 27B עושה היטב, על פי ניסיון הקהילה עם Qwen3.6-27B ו-Qwen3-Coder-30B-A3B:

• לנקות ולמיין כרטיסים, לזהות גורמי שורש, ולהניח תשתית לכך שמודל חזק יותר יסיים

• טיפול ברפקטורינג בקנה מידה של מאגר קוד ובלולאות קריאה לכלים במהירות אינטראקטיבית.

• הפעל את נפח הקידוד היומי שלך מקומית — הנתונים נשארים על המחשב שלך, והעלות קבועה.

• שמור על שיעור הצלחה של ~50/50 בתיקון מלא של באג מורכב באמת — מספיק כדי להועיל, לא מספיק אמין כדי להיות הסוכן היחיד שלך

ה-27B הוא מודל נפח עם זנב שיפוט. הוא יצטיין בחלק האמצעי עתיר הנפח של עומס העבודה שלך, ויטעה בעשרת האחוזים הקשים ביותר. זה לא פגם; זה התכנון.

בנייה סביבו: פצל את התנועה

המהלך שרוב הצוותים נוחתים עליו הוא פיצול: ה-27B המקומי מטפל בנפח — יצירה שגרתית, boilerplate, רפקטורינג, תיקונים בסגנון lint — ומודל frontier מתארח מטפל בזנב הקשה שבו נקודות נוספות בודדות של איכות מצדיקות את עלות ה-API. הדרך הנקייה להריץ את הפיצול הזה היא דרך ראוטר, כי שני הצדדים נכשלים בקצבים שונים ואתה לא רוצה שצינור הסוכן שלך ייתקע על צוואר בקבוק מקומי או תקלה של הספק.

זו זרימת העבודה שאורקה ראוטר (OrcaRouter) בנוי עבורה. Qwen3.8-Max פעיל שם במחיר המחירון של הספק — $2 למיליון אסימוני קלט, $6 למיליון אסימוני פלט — מועבר ללא תוספת מחיר, כך שכשאליבאבא מורידה את התעריף, החשבון שלך יורד באותו היום. אתה מפנה נקודת קצה אחת תואמת-OpenAI אל הפיצול, מנתב את הזנב הקשה ל-Qwen3.8-Max, שומר את ה-27B המקומי לנפח ברגע שהמשקולות שלו מגיעות, ומאפשר לניתוב אוטומטי במקרה תקלה (failover) לתפוס ספק איטי או כושל ללא שינוי קוד. אתה מעריך את ה-27B על החומרה שלך בזמן שמסלול הייצור נשאר חי — המודל שעדיין לא הוכח אף פעם לא הופך לנקודת כשל יחידה.

Screenshot of the OrcaRouter model page for Qwen3.8 Max showing model ID qwen/qwen3.8-max, $2.00 per 1M input tokens, p50 TTFT 4.84 s, and a code sample.

מה לבדוק ביום שבו המשקולות נופלות

כאשר המאגר הרשמי מופיע ב-Hugging Face או ב-ModelScope, ודא את אלה לפני שאתה בונה עליו משהו:

המאגר נמצא בארגון Qwen הרשמי — לא עותק מראה ולא חוטף שמות

• קובץ ה-LICENSE אכן קיים, ותואם לרישיון המצוין בהערות המהדורה.

כרטיס המודל חושף את חלון ההקשר, הארכיטקטורה (צפופה או MoE), ומצבי החשיבה.

• הרצות עצמאיות ראשונות מופיעות ב- Terminal-Bench או Artificial Analysis — טענות הספק נשארות טענות ספק עד אז

• תמיכה ב-GGUF מתווספת ל-llama.cpp ולסביבת הריצה המקומית המועדפת עליך

בנקודה האחרונה, המשמעת שצוינה קודם חלה: עד שריצה עצמאית תאשר את הרווחים בקוד, התייחס להבטחה שירשה מ‑FrontierSWE כסיבה לבדוק, לא כסיבה לשחרר.

הציפייה, בניסוח הוגן:Qwen3.8-27B היא על הנייר מהדורת הקידוד המקומית המבטיחה ביותר של 2026 — קו בסיס מוכח של 27B בתוספת דור של רווחי אימון אג'נטיים, בעלות חומרה שהקהילה כבר יודעת לשלם. האם היא תעמוד בהבטחה תלוי במה שהמשקלים מכילים בפועל. עקבו אחרי הריפו הרשמי, קראו את הרישיון, ותנו לבנצ'מרק הבלתי תלוי הראשון להכריע. עד אז, Qwen3.6-27B שומר על המקום חם, וספינת דגל מתארחת עם ניתוב נושאת את הזנב הקשה.

© 2026 OrcaRouter

לספקים

מפעילים פלטפורמת הסקה (inference)? הציגו את המודלים שלכם ב-OrcaRouter.

צרו קשר

הצטרפו לקהילה שלנו

DiscordEmailXGitHubYouTube