
AesCode 32B לעומת Qwen3.8 27B: מיקרוסופט בנתה אותו על Qwen, ואחד מהם ניתן לקריאה
- OrcaחדשOrca: OrcaCyber Zero 1.52026-10-10$3.00 / $7.50 לכל 1M טוקנים · 85 tok/s
- openaiחדשOpenAI: GPT-6.1 Sol2026-09-2952אינטליגנציה
- anthropicחדשAnthropic: Claude Sonnet 5.52026-09-2856אינטליגנציה
- typesafeTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 לכל 1M טוקנים · 115 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238אינטליגנציה
- OpenAIOpenAI: GPT-6 Sol2026-09-2248אינטליגנציה
- AnthropicAnthropic: Claude Opus 5.52026-09-2258אינטליגנציה
- xAIGrok 4.72026-09-2146אינטליגנציה
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 לכל 1M טוקנים · 47 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 לכל 1M טוקנים · 777 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040אינטליגנציה
- OpenAIOpenAI: GPT-6 Astra2026-09-0453אינטליגנציה77כתיבת קוד
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241אינטליגנציה76כתיבת קוד
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245אינטליגנציה76כתיבת קוד
- AnthropicAnthropic: Claude Fable 5.12026-09-0153אינטליגנציה82כתיבת קוד
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 לכל 1M טוקנים · 60 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 לכל 1M טוקנים · 452 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642אינטליגנציה72כתיבת קוד
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 לכל 1M טוקנים · 231 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845אינטליגנציה75כתיבת קוד
הפרט שמארגן מחדש את כל ההשוואה הזו נמצא בשורה השנייה של כרטיס המודל: AesCode 32B מתחיל מ-Qwen3-VL-32B-Instruct. מודל הקוד הייעודי לעיצוב של מיקרוסופט הוא כיוונון עדין של Qwen3-VL, ברישיון Apache 2.0, שיושב במאגר Hugging Face שנוצר ב-29 בספטמבר 2026, עם קומיט שכותרתו "Release AesCode-32B" מתאריך 7 באוקטובר 2026, ובלי שום הודעה ממיקרוסופט בשום מקום. Qwen3.8 27B הוא הקצה השני של אותה שושלת: המודל המולטימודלי הצפוף בעל 27B במשקלים פתוחים של הספק עצמו, שיצא ב-14 באוגוסט 2026 תחת Apache 2.0, הארכיטקטורה המחליפה את נקודת הביקורת VL שמיקרוסופט עשתה לה כיוונון עדין. אז זו לא התמודדות בין מאמצי הדגל של שני ספקים. זו התמודדות בין מודל כללי במשקלים פתוחים של מעבדה אחת לבין כיוונון עדין מחקרי של מתחרה על אותה משפחה, וההבדל המעשי ביניהם מתברר ככמעט כולו בשאלה מה מותר לך לעשות עם הקובץ ברגע שיש לך אותו.
אותו רישיון, אותה משפחה, כמות שונה של מודל
שניהם תחת Apache 2.0, שניהם מקבלים גם תמונות וגם טקסט, ושניהם מחזירים טקסט. כל מה שאחרי זה מתפצל, ושורת הפריסה היא המתפצלת ביותר.
• פרמטרים — AesCode 32B: 33B צפוף על בסיס Qwen3-VL-32B-Instruct. Qwen3.8 27B: 27B צפוף, 28B כשכוללים את מקודד הראייה, 64 שכבות בגודל חבוי של 5120.
• זיכרון כדי להריץ אותו — AesCode 32B: הכרטיס ממליץ לתכנן כ־65 GB של זיכרון מאיץ עבור פרמטרי bf16 בלבד, ודוגמת ה-serving שלו עצמה משתמשת במקביליות טנזורית בארבע דרכים. Qwen3.8 27B: כ־55.6 GB ב-bf16.
• הקשר — AesCode 32B: 24,576 טוקנים בתצורה המדווחת, כאשר הפרומפטים והתגובות בזמן האימון מוגבלים ל-8,192. Qwen3.8 27B: 262,144 טוקנים באופן מקורי, ניתן להרחבה עד 1,000,000 עם סקיילינג YaRN.
• קשב — AesCode 32B: בירושה מהשלד של Qwen3-VL. Qwen3.8 27B: היברידי, 48 שכבות קשב לינאריות של Gated DeltaNet ל-16 שכבות קשב מלאות ביחס 3:1, וזה מה שהופך חלון של 262K לבר-השגה לשירות.
• למה זה מיועד — AesCode 32B: יצירת תוצרי ויזואל עתירי מידע כ-HTML ו-CSS ניתנים לעריכה, וכן מחקר ביצירת קוד מולטימודלית. Qwen3.8 27B: עבודה סוכנית ומולטימודלית כללית — קידוד, שימוש במחשב, הבנת מסמכים ווידאו, וקריאה לכלים.
• מאיפה משיגים אותו — AesCode 32B: הורדה מ-Hugging Face; שום ספק הסקה לא מפריס אותו. Qwen3.8 27B: משקולות, או נקודת קצה מתארחת.
הקשר גדול פי שניים, טביעת רגל מעט קטנה יותר, Backbone חדש יותר בדור אחד, ורישיון זהה. השורה היחידה שבה AesCode 32B מנצח באופן מוחלט היא הראשונה, והוא מנצח בה הודות לכיוונון עדין ייעודי למשימה.
על מה כל אחד נמדד בפועל
שני משטרי ההערכה אינם נוגעים זה בזה, ולהעמיד פנים אחרת היא הטעות הסטנדרטית בדפים כמו זה.
הכרטיס של Qwen3.8 27B רחב וספציפי בעת ובעונה אחת. כתיבת קוד: Terminal-Bench 2.1 ב-73.0, SWE-bench Pro ב-61.7, QwenSWEBench ב-79.0, LiveCodeBench v6 ב-90.3. חשיבה: GPQA Diamond 89.2, Humanity's Last Exam 30.8. שימוש במחשב: OSWorld-Verified 84.3, WebArena-Verified 64.8, AndroidWorld 81.9. ראייה: MathVision 94.6 עם שיפור בזמן ההסקה של הספק ו-90.0 בלעדיו, OmniDocBench 1.5 ב-91.1. כל אלו המספרים של הספק עצמו על ההרנס של הספק עצמו — עם הערת שוליים שכדאי לקרוא, שלפיה הרצות SWE-bench Pro ו-QwenSWEBench השתמשו בהרנס של Claude Code, ולכן אין להשוותן ישירות למודלים שקיבלו ציון בהרנס אחר.
ל-AesCode 32B יש מבחן אחד והוא חד-תכליתי: 300 דגימות אינפוגרפיות, שלושה תוצרים לכל פרומפט ללא בחירה, כשהם מרונדרים ומדורגים על פני שבעה ערוצים. הנתון הבולט הוא ציון כולל (Overall) של 85.89 כשתמונת הייחוס מסופקת, לעומת 81.28 עבור GPT-5.5 ו-80.39 עבור Claude Opus 4.8 באותה מערכת בדיקה — ובנוסף לכך הטענה ש-AesCode 32B גובר על עמוד השדרה Qwen3-VL-32B של עצמו ב-22.4 נקודות בממד החזותי (Visual) וב-24.8 בציון הכולל.
שימו את אלה זה לצד זה ושום דבר לא מתיישר. Terminal-Bench מודדת אם משימת shell מושלמת; ההערכה של AesCode מודדת אם הטקסט של אינפוגרפיקה קריא, אם הפריסה שלה לא חורגת מהקנבס ואם הטבלה שלה היא טבלת HTML אמיתית. אין מדד משותף, אין מערכת הרצה משותפת ואין משימה משותפת. ההצהרה היחידה הכנה היא ש-AesCode 32B טוב בהרבה בתוצרי עיצוב מאשר ה-backbone של עצמו, ו-Qwen3.8 27B הוא מודל כללי חזק — ואף אחת מהטענות הללו לא אומרת לך דבר על האחרת.

פער הראיות אמיתי הפעם, בכיוון אחד
בנצ'מרקים של ספקים הם הנורמה בתעשייה הזו, ולכן יש משמעות לכך ששני אלה נבדלים במידה שבה טענות הספקים שלהם אומתו בידי גורם אחר.
Qwen3.8 27B הושק עם הטבלה של הספק עצמו, ואחר כך צבר תוצאות חיצוניות בתוך שבועות. התיעוד העצמאי של המודל כולל מחקר על סוכן משפטי שערכה חברת ה-AI המשפטית Harvey יחד עם סטארטאפ הזיכרון Engram, שבו Qwen3.8 27B מותאם הוביל על כל מודל שהמחקר בחן, כולל Claude Opus 4.8, ב-250 משימות משפטיות — עם הסתייגות חשובה: המודל המותאם למד תחילה את מאגר 100 מיליון הטוקנים של המשרד הנבחן, כך שזו תוצאה על ההתאמה לא פחות מאשר על המודל. הוא כולל גם מיקום בלוח המובילים WebDev של Code Arena ואת המקום הראשון בקטגוריית המשקולות הפתוחים בלוח המובילים Image-to-WebDev של Arena.ai, ושניהם טענות דירוג שהועברו מפי הספק ולא מתודולוגיה מפורסמת. והוא כולל גם לוח של צד שלישי עם ציון מפורסם: Artificial Analysis רושמת את Qwen3.8 27B בציון 33.70 במדד ה-Intelligence Index שלה, עם עלות של כ-1.01 דולר למשימה שהושלמה, ומפרסמת את פירוט הטוקנים שמאחורי זה.
ל-AesCode 32B אין דבר מכל זה. אין מיקום בזירה, אין רישום בלוח המובילים, אין שחזור על ידי צד שלישי, אין מבחן תפוקה עצמאי — ולא מפני שמישהו בדק ומצא אותו לוקה בחסר, אלא מפני שצ'קפוינט שאף ספק לא מגיש ממילא אינו יכול להיות מוערך באמצעות מערכת בדיקה חיצונית. המספרים שלו הם של הספק, שחושבו על ידי אותו מערך אימות שאימן את המודל, על דגימות שהספק בחר, מול קווי בסיס שהספק הריץ. המהדורה שקופה באופן יוצא דופן לגבי השיטה — שמות ערוצי התגמול, מספרי הרולאאוט, פרמטרי הפענוח ושיעורי הכשל כולם מפורסמים — אבל שקיפות לגבי איך הופק מספר אינה זהה לכך שמישהו אחר מפיק אותו.
האחד שמחייב כרטיס שמור
כאן השושלת מפסיקה להיות טריוויה ומתחילה להיות ההחלטה.
AesCode 32B דורש מכם 65 GB של זיכרון מאיץ, נתיב הגשה מולטימודלי, ונכונות להריץ מודל שטרם הוכרז בתור מאמצים מוקדמים. דוגמת ההגשה של המודל עצמו מגיעה למקביליות טנזורית בארבע דרכים, והמודל מתועד עם חלון הקשר של 24,576 טוקנים, בלי אפשרות של שירות מתארח להישען עליה. אם החומרה כבר נמצאת ברשותכם והצינור שלכם באמת זקוק לכוונון עדין ייעודי לתכנון, זהו שיקול סביר. עבור רוב הצוותים מדובר בפרויקט של שבועיים עד לפלט השימושי הראשון.
Qwen3.8 27B מתארח באופן עצמאי בתשתית של OrcaRouter עצמה וניתן לקרוא לו כבר היום במחיר של $0.33 למיליון טוקנים בקלט ו-$2.40 למיליון בפלט, עם חלון הקשר של 262,144 טוקנים וקלט של טקסט, תמונה ווידאו. אלה מחירי מחירון המועברים הלאה ללא תוספת רווח מצדנו, והוא יושב על אותו מפתח כמו יותר מ-200 מודלים אחרים, כך שההשוואה מול כל חלופה בקטלוג היא פרמטר בבקשה ולא חוזה שני. זה כל הטיעון המעשי, והוא טיעון גדול: המודל שנמצא דור אחד מאחורי עמוד השדרה של AesCode 32B במונחי משפחה הוא זה שתוכלו להעריך כבר אחר הצהריים, על הפרומפטים שלכם, במחיר של כמה סנטים.
יש כאן נקודה מסדר שני שזווית הניתוב ממחישה אותה. מכיוון ש-AesCode 32B הוא כיוונון עדין של נקודת ביקורת של Qwen3-VL, המשפחה מספקת לך דרך זולה לבדוק אם הצד המתארח של הארכיטקטורה עובד בכלל לפני שאתה מתחייב לאירוח עצמי של משהו.Qwen3-VL 235B A22B Instruct זמין במחיר $0.40 למיליון קלט ו-$1.60 פלט, ו-Qwen3-VL 8B Instruct במחיר $0.18 ו-$0.70. אף אחד מהם אינו AesCode 32B ואף אחד מהם לא אומן לאיכות עיצוב — אבל "האם מודל חזותי-לשוני יכול לקרוא את צילומי המסך שלנו ולכתוב את הסימון שאנחנו צריכים" אפשר לענות עליה איתם בכמה סנטים, ומעבר כשל אוטומטי תחת אותה נקודת קצה אומר שיום רע של ספק לא מפיל את הצינור.

מי צריך לבחור מה
קח את AesCode 32B אם הארטיפקט הוא התוצר. אתה מייצר שקופיות, לוחות מחוונים, פוסטרים או דוחות בכמות גדולה, אתה צריך פלט מובנה שנשאר ניתן לעריכה ולהשוואה — המודל מפיק מסמך HTML שלם, משתמש במבני טבלאות HTML אמיתיים ובמפרטי ECharts כך ששניהם נשארים ניתנים לבדיקה — ויש לך את החומרה או התקציב לשכור אותה. גש לזה בקבלת שלושה דברים: אין אימות בלתי תלוי של אף מספר, כ-65 GB למשקלים, וחלון הקשר של 24K שיגביל מסמכים ארוכים. שיעור הכשל החמור בגבולות הקנבס של 4.3% שהכרטיס מדווח עליו, לעומת 34.7% עבור GPT-5.5, הוא הנתון הבודד המעודד ביותר במהדורה, והוא גם של Microsoft.
קחו את Qwen3.8 27B אם אתם צריכים מודל מולטימודלי כללי במשקלים פתוחים שאפשר באמת להריץ ובאמת לשרת. הקשר של 262K, ניתן להרחבה עד למיליון; טביעת רגל לפריסה שנכנסת במקום שבו AesCode 32B לא נכנס; עמדת רישוי שאינה שונה; כמה מדידות בלתי תלויות גם של האיכות שלו וגם של העלות שלו לכל משימה שהושלמה; ואפשרות באירוח שמשמעה שתוכלו להתחיל היום ולעבור לאירוח עצמי מאוחר יותר בלי לשכתב את האינטגרציה. עיצוב הקשב המדורג והשכבתי שלו הוא הסיבה לכך שהקשר הארוך אפשרי בעלות סבירה, והקשר הארוך הוא הדבר שפייפליינים של עיצוב ומסמכים נוטים להזדקק לו ביותר.
ואם אתם זקוקים לשניהם — גם למחולל ארטיפקטים עיצוביים וגם לסוס עבודה כללי — הפיצול ההגיוני אינו להריץ שני מודלים של שפה-ראייה בדרג 30B על הערכה שלכם. נתבו את התעבורה הכללית לצד המארח והשאירו את המומחה באחסון עצמי, מאחורי מפתח אחד, שבו השבתה של ספק באחד מהנתיבים היא אירוע מעבר לגיבוי ולא תקרית.

הדבר שכדאי לשים לב אליו
מעמדו של AesCode 32B משתנה לחלוטין אם הוא יהפוך לזמין לקריאה. נכון לעכשיו, החולשה האמיתית היחידה של המודל היא נגישות, וזהו מצב זמני — ספק הסקה שיאמץ את הצ'קפוינט, או שמיקרוסופט תפרסם נקודת קצה, הופכים רכש בנפח 65 GB לבחירת מודל. עד אז, הסיכום הכנה של ההתמודדות הזו הוא שהפיין-טיון טוב יותר במשימה אחת, המודל הכללי טוב יותר בשמישות, ובמקרה, המודל הכללי הוא האב הקדמון: מיקרוסופט בחרה בצ'קפוינט Qwen3-VL לבנות עליו כי הוא היה הבסיס הרב-מודלי הפתוח החזק ביותר הזמין, וזה כשלעצמו הדבר המועיל ביותר שיש להשוואה הזו לומר על Qwen3.8 27B.
השוואות במאמר הזה1
זוהה מתוך המאמר הזה · בנצ'מרקים: Artificial Analysis · מתעדכן יומית
