
AesCode-8B לעומת Qwen3-8B: הם נראים כמו הורה וילד, אבל הם לא.
- OrcaחדשOrca: OrcaCyber Zero 1.52026-10-10$3.00 / $7.50 לכל 1M טוקנים · 87 tok/s
- openaiחדשOpenAI: GPT-6.1 Sol2026-09-2952אינטליגנציה
- anthropicחדשAnthropic: Claude Sonnet 5.52026-09-2856אינטליגנציה
- typesafeTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 לכל 1M טוקנים · 115 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238אינטליגנציה
- OpenAIOpenAI: GPT-6 Sol2026-09-2248אינטליגנציה
- AnthropicAnthropic: Claude Opus 5.52026-09-2258אינטליגנציה
- xAIGrok 4.72026-09-2146אינטליגנציה
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 לכל 1M טוקנים · 47 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 לכל 1M טוקנים · 777 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040אינטליגנציה
- OpenAIOpenAI: GPT-6 Astra2026-09-0453אינטליגנציה77כתיבת קוד
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241אינטליגנציה76כתיבת קוד
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245אינטליגנציה76כתיבת קוד
- AnthropicAnthropic: Claude Fable 5.12026-09-0153אינטליגנציה82כתיבת קוד
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 לכל 1M טוקנים · 61 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 לכל 1M טוקנים · 452 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642אינטליגנציה72כתיבת קוד
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 לכל 1M טוקנים · 231 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845אינטליגנציה75כתיבת קוד
השמות מזמינים טעות. AesCode-8B הוא מודל 8B עם עמוד שדרה של Qwen3-VL-8B-Instruct, Qwen3-8B הוא המודל 8B של הספק עצמו, והקריאה המתבקשת היא שהראשון הוא כיוונון עדין של השני. זה לא כך. התצורה שפורסמה של AesCode-8B מצהירה Qwen3-VL-8B-Instruct כבסיס — האח החזותי-לשוני, צ'קפוינט אחר עם תפקיד אחר — והמטא-נתונים של Hugging Face מפרטים אותו ככיוונון עדין של אותו מודל, ולא של Qwen3-8B הטקסטואלי בלבד. שני מודלי AesCode במחלקת המשקל הזו הם בני דודים ולא הורה וילד, וההבחנה הזו היא כל הסיבה שהדף הזה שימושי: הוא מספר לך מה Microsoft קנתה כשהתחילה מצ'קפוינט חזותי-לשוני, מה זה עלה בצד הטקסט, ולמה השוואה מול הגנרליסט 8B הרגיל של המשפחה בסופו של דבר מודדת פיצול ולא שדרוג.
שניהם Apache 2.0 ושניהם ניתנים להורדה, אך רישומי הפרסום שלהם לא יכלו להיות שונים יותר. Qwen3-8B שוחרר באפריל 2025 כחלק מסדרת Qwen3-generation של הספק, עם תיעוד, אינטגרציה במערכת האקולוגית ושמונה עשר חודשים של פריסות של אחרים מאחוריו. AesCode-8B אינו נושא תאריך שחרור בשום מקום בקבצים שלו. מיקרוסופט יצרה את המאגר ב-Hugging Face בתאריך 2026-09-29, ביצעה קומיט למשקלים תחת ההודעה "Release AesCode-8B" בשעה 03:35 UTC בתאריך 2026-10-07, והעלתה את קוד האימון ל-GitHub למחרת. אין פוסט של Microsoft Research, אין הודעת שחרור, אין דף מוצר ואין מאמר — הציטוט בכרטיס המודל מציין "Under review" עם שנת מציין המקום 2027, והמאגר הראה שתי הורדות נכון לכתיבת שורות אלה. כל נתון כמותי לגבי AesCode-8B בהמשך הוא של מיקרוסופט עצמה ואיש לא שחזר אותו.
אילן היוחסין שהשמות מסתירים
סדרת הדורות של Qwen3 מכילה מספר צ'קפוינטים בדרגת 8B שחולקים מוצא משותף ולא הרבה מעבר לכך. Qwen3-8B הוא הגנרליסט לטקסט בלבד: בערך 8.2 מיליארד פרמטרים בסך הכל, עם כ-7 מיליארד ללא embedding, attention עם שאילתות מקובצות, הקשר מקורי של 32K טוקנים הניתן להרחבה ל-131K באמצעות YaRN, ואימון על פני 119 שפות וניבים. הוא מבצע הסקה, משוחח, כותב קוד ומפעיל כלים, והוא אחד המודלים מסוג 8B הנפוצים ביותר באירוח עצמי באקוסיסטם הפתוח, בדיוק מהסיבות הללו. Qwen3-VL-8B-Instruct הוא החבר המולטימודלי: אותו דור משפחתי, מגדל ראייה ייעודי מעל, קלט של תמונה וטקסט, פלט טקסט.
מיקרוסופט התחילה מהשנייה. תצורת AesCode-8B מציינת Qwen3VLForConditionalGeneration, עם 36 שכבות נסתרות, גודל נסתר 4,096, 32 ראשי קשב ו-8 ראשי מפתח-ערך, אוצר מילים של 151,936 טוקנים ומיקומי mrope משולבים, והיא דורשת transformers 4.57 או חדש יותר. השברים מסתכמים ל-17,543,339,408 בייטים, כ-8.8 מיליארד פרמטרים bf16, ולכן שדה הגודל המעוגל של Hugging Face אומר 9B בעוד שהספק אומר 8B. זהו עיגול ולא אי-התאמה, ומספר הפרמטרים אינו הפיצול שחשוב — מודאליות הקלט והקשר ההגשה של 24,576 טוקנים הם שכן.
אז ההצגה הכנה אינה "מודל כללי מול הכיוונון העדין שלו". היא: מודל כללי טקסטואלי עם חלון הקשר ארוך ושמונה־עשר חודשי היסטוריית פרודקשן, מול צ'קפוינט מחקרי מולטימודלי שמפיק מסמך ומעולם לא הוערך באופן עצמאי.

מה מיקרוסופט בזבזה על תקציב האימונים
הבריף העיצובי מצוטט בכרטיס המודל והוא מסביר את הפיצול: מודלי קוד "אינם יכולים לראות כיצד פריסה, היררכיה וצבע מתחברים יחד על הקנבס", בעוד שמחוללי תמונות "מרכיבים עמודים מושכים חזותית אך לעתים קרובות משבשים טקסט, מספרים ויחסים לוגיים". AesCode הוא הניסיון לקחת חוש קומפוזיציה מאחד ואת יכולת האימות מהאחר, והמתכון יוצא דופן בדרך מסוימת.
כל פרומפט אימון משויך לתמונת ייחוס שנוצרה מאותו פרומפט — הריצות של מיקרוסופט עצמה השתמשו ב-GPT-Image-2 עבור התמונה וב-GPT-5.5 כדי להרחיב תקציר קצר לפרומפט תוכן מפורט. הייחוס נושא פריסה וסגנון בלבד; פרומפט הטקסט נשאר הסמכותי לגבי התוכן. ואז, בזמן הסקה, המודל בקושי זקוק לו: אם מונעים את הייחוס מ-AesCode-8B, ציון ה-Visual שלו יורד ב-1.00 נקודה מתוך מאה, לעומת 19.55 עבור ה-backbone ו-10.04 עבור GPT-5.5. תוצאה קשורה היא שתגמולים מבוססי ייחוס העלו את ציון ה-Visual בפרומפט בלבד מ-25.17 ל-69.71, כך שה-prior החזותי עבר לתוך המשקולות במקום להישאר בקלט.
השאר הוא סיפור של עיצוב תגמול. הפיקוח הוא "גרף עיצוב" של צמתים וקשתות — טקסט, תרשימים, טבלאות, כרטיסים, אזורים, משבצות תמונה, עם הכלה, יישור, סדר וחיבור כקשתות — שנבחר כך שכל מאפיין על הקנבס שייך לרכיב בעל שם ולכן יכול להיות מדורג בפני עצמו. שבעה ערוצים מדרגים את התוצאה: שישה מאמתים דטרמיניסטיים עבור ביצוע, טקסט, גבולות, נתוני טבלאות ותרשימים, פריסה סמנטית ורווח לבן, ועוד אחד Visual Graph Rubric ספציפי לדגימה שנשפט על ידי מודל ראייה-שפה. מועמדים מרונדרים בדפדפן Playwright בארגז חול עם בקשות חיצוניות חסומות, וההרנס קורא בחזרה את ה-DOM, סגנונות מחושבים, תיבות תוחמות וצילום מסך, ולכן טבלאות חייבות להיות טבלאות HTML ותרשימים חייבים להיות מפרטי ECharts. האימון היה כיוונון עדין מפוקח בהתנעה קרה (cold-start) על 3,000 הדגמות, ואחר כך GDPO על 7,408 פרומפטים במשך 400 צעדים על צומת בודד של שמונה NVIDIA B200s, כאשר כל ערוץ תגמול מנורמל בתוך קבוצת הרולאאוט שלו כך שאות דחוס מבוסס-חוקים לא יכול להטביע את האות החזותי הדליל. Microsoft מודדת את הנרמול הזה ב-5.12 נקודות Visual לעומת GRPO סקלרי רגיל.
שום חלק מהמנגנון הזה לא קיים כדי להפוך את AesCode-8B לעוזר כללי טוב יותר. הוא קיים כדי לאפשר בדיקה של הפלט, וזו הסיבה שההקשר של המודל הוא כפי שהוא.
זה לצד זה, כשהמספרים מסומנים
• Base — AesCode-8B: Qwen3-VL-8B-Instruct, צ׳קפוינט של ראייה ושפה. Qwen3-8B: הגנרליסט הטקסטואלי בלבד של אותו דור.
• פרמטרים — AesCode-8B: כ-8.8B bf16 על פני ארבעה מקטעים. Qwen3-8B: כ-8.2B בסך הכול, בערך 7B ללא הטמעה.
• קלטים — AesCode-8B: טקסט בתוספת תמונת ייחוס אופציונלית. Qwen3-8B: טקסט.
• פלט — AesCode-8B: מסמך HTML ו-CSS מלא. Qwen3-8B: טקסט, קריאות כלים, קוד.
• הקשר — AesCode-8B: 24,576 אסימונים בתצורה המדווחת. Qwen3-8B: 32K מקורי, 131K מורחב באמצעות YaRN.
• שפות — AesCode-8B: התגית של הכרטיס היא "en" בלבד. Qwen3-8B: 119 שפות וניבים.
• עדויות — AesCode-8B: מחוון האינפוגרפיקה בן 300 הדגימות של Microsoft עצמה, שלוש יצירות לכל פרומפט, ללא שכפול חיצוני. Qwen3-8B: שמונה עשר חודשים של בנצ'מרקים עצמאיים, עבודת קוונטיזציה ופריסה בפרודקשן.
• רישיון — Apache 2.0 בשניהם, ללא הגבלת גישה. תיקו, וזה לא הגורם המבדיל שאנשים מניחים שהוא.
פער הראיות הוא ההשוואה האמיתית
מיקרוסופט מדווחת על AesCode-8B עם 82.94 בסך הכל במחוון שלה, לפני GPT-5.5 מותנה-בייחוס עם 81.28 ו-Claude Opus 4.8 עם 80.39, ו-31.1 נקודות ויזואליות מעל שלושת המותנים בייחוס של עצמו בכך שאין שום דבר מיוחד בכותרת. הראשון הוא סגנון, שבו AesCode-8B עומד על 53.21 ואף מודל בהשוואה לא עובר את 60 — וההגדרה של מיקרוסופט לסגנון היא עיצוב שאינו זקוק לתיקון ויזואלי נוסף לפני מסירה, כך שבממד האחד ששואל אם אדם היה שולח את הדף ללא עריכה, המודל אינו המוביל. השני הוא כשל הגבול: גלישת קנבס חמורה חוזרת על עצמה ב-4.3% מתוך 300 הדגימות, לעומת 34.7% אצל GPT-5.5. השלישי הוא שחציו הוויזואלי של הציון מגיע משופט ראייה-שפה שאינו נקוב בשמו, מה שאומר שהחצי הדטרמיניסטי ניתן לשחזור בידי גורם חיצוני והחצי האחר אינו.
המספרים של Qwen3-8B מגיעים ממקום אחר לחלוטין, וזה חשוב יותר מאשר איזה סט גבוה יותר. שמונה עשרה חודשים של הערכה עצמאית, קוונטיזציות קהילתיות, בנצ'מרקים של שירות ופריסות בייצור הם סוג אחר של ראיות: זו אינה טענה, זהו רקורד מוכח. אתה יכול לגלות כיצד Qwen3-8B מתנהג תחת קוונטיזציה של ארבעה ביטים על כרטיס מסוים, כי מישהו פרסם זאת. אתה לא יכול לעשות זאת עבור AesCode-8B, כי נכון לשבוע זה אף אחד מחוץ למיקרוסופט לא הריץ אותו על שום דבר.
ואין מדד משותף בין שתי הטבלאות. ל-Qwen3-8B אין ציון פריסת אינפוגרפיקה; ל-AesCode-8B אין שום בנצ'מרק חשיבה כללית שפורסם. ההשוואה אינה צמודה או לא צמודה — היא אינה זמינה.
מה שנדרש בפועל כדי להריץ כל אחד מהם

Qwen3-8B הוא הקל שבהם. מודל טקסט של 8.2B עובר כימות ונכנס לכרטיס צרכני בודד, יש מאחוריו שמונה-עשר חודשים של כלי עבודה בכל מסגרות ההגשה וסביבות ההרצה המקומיות, והוא מתנהג באופן צפוי. הרחבת ההקשר ל-131K מתועדת ולא בגדר אגדה, וכיסוי 119 השפות הוא הסיבה שהוא מופיע בכל כך הרבה צינורות רב-לשוניים.
AesCode-8B הוא פרויקט הגשה. הפקודה של הכרטיס עצמו היא vllm serve microsoft/AesCode-8B --limit-mm-per-prompt image=2 --max-model-len 24576, עם transformers 4.57 ואילך עבור המסלול שאינו vLLM. 17.5 GB של משקולות bf16 צריכים להיכנס לצד מטמון KV עבור 24,576 טוקנים ועד שני תמונות, כך שכרטיס בודד של 24 GB מספיק מבחינה טכנית וצמוד באופן לא נוח, ו-40-48 GB או שני כרטיסי 24 GB הם המינימום הריאלי. הקצה תקציב גם לרנדרר, כי כל טענה לגבי איכותו של המודל הזה נעשתה על ידי רינדור פלט ה-HTML שלו בדפדפן מבודד — אם אתה רוצה לדעת אם הפלטים שלך טובים, זו התשתית שעליך להקים. ולשים לב שההקשר של 24,576 טוקנים תורגל על עמודי אינפוגרפיקה בודדים, ולא על מצגות מרובות שקופיות שהמודל מכוון אליהן, כך שלחץ הקשר על מצגת אמיתית הוא שטח לא נבדק.
הזמינות היא החצי השני של אותה נקודה. AesCode-8B אינו מדגם ש-OrcaRouter מנתב, ולא הצלחנו למצוא אותו מוגש בשום מקום אחר גם כן; הערכה היום משמעה משקולות על החומרה שלכם. האב הקדמון שלו הוא מקרה אחר — ניתן להפעיל את Qwen3-VL-8B-Instruct דרך OrcaRouter כבר עכשיו במחיר 0.18 דולר למיליון טוקני קלט ו-0.70 דולר למיליון טוקני פלט על פני חלון הקשר של 131,072 טוקנים, מה שהופך זאת לדרך הזולה ביותר לראות מה הגרסה הלא מכווננת של הארכיטקטורה הזו בדיוק עושה על הפרומפטים שלכם לאינפוגרפיקה. בהמשך אותו קו, Qwen3.8-27B ניתן לניתוב במחיר 0.33 ו-2.40 דולר. מחיר המחירון של הספק עובר הלאה ללא תוספת, והמעבר בין ספקים בעת תקלה הוא אוטומטי, כך שאב-טיפוס לפרומפט מול עמוד השדרה המתארח עולה מפתח אחד בלבד ולא שבוע GPU, ורק פרומפטים שבאמת מרונדרים היטב זוכים לעבודת השחזור.

איזה מהם אתה רוצה תלוי בארטיפקט
בחרו ב-AesCode-8B כאשר התוצר הוא עמוד והוא חייב להיות ניתן לעריכה. פלט HTML מובנה שניתן להשוות ב-Git, טבלאות כטבלאות אמיתיות ותרשימים כמפרטי ECharts, הוא ארטיפקט שונה בתכלית מפסקת טקסט, ושום כמות של יכולת כללית לא מהווה לו תחליף. קבלו את העסקה ביודעין: נקודת ביקורת מחקרית שלא הוכרזה עם מספר הורדות דו-ספרתי, חלון הקשר של 24K, אנגלית בלבד, ללא הערכה עצמאית, תקרת Style שהספק שלה עצמו מפרסם, וחשבון הגשה הנמדד בעשרות ג'יגה-בייט.
בחרו ב-Qwen3-8B לכל השאר — שזה, עבור רוב הצוותים, הכל. הוא הג'נרליסט המוכח במשקל הזה, יש לו חלון הקשר ארוך יותר, הוא מדבר מאה ותשע עשרה שפות, הוא רץ על חומרה שכבר בבעלותכם, ומאחוריו שמונה עשרה חודשים של ניסיון ייצור של אחרים שעומד מאחורי ההחלטות שאתם עומדים לקבל. אם אין לכם צורך ספציפי להפיק דפים מרונדרים, להשוואה הזו יש תשובה אחת.
הטיעון בעד הרצון בשניהם הוא אמיתי, והוא אינו שובר שוויון. פייפליין שקורא מסמכים ומפיק מצגות משתמש בשני מודלים עם שני סוגי פלט שונים באמת, והעמדה המועילה היא להשאיר את מרנדר העמודים על חומרה שיכולה להחזיק אותו, ולנתב את עבודת הקריאה וההיסק למשהו שמתארח מאחורי אותה נקודת קצה כמו כל השאר.
מה יהפוך את זה לעמוד סגירה טוב יותר?
שלושה דברים, ורק אחד מהם עוסק בבנצ'מרקים. שחזור בלתי־תלוי של 82.94 ושל הירידה בת 1.00 נקודה ביחס לרפרנס יעביר את AesCode-8B מטענת יצרן לתוצאה, ויאפשר להשיב לשאלת הגודל 8B מול 8B לגופו של עניין. ספק שיאמץ את הצ'ק־פוינט יצמצם את עמודת הפריסה ויהפוך "שבוע GPU" ל"קריאת API". והמאמר שהכרטיס מציין כנמצא בבדיקה — "AesCode: Aesthetic Code Generation with Decoupled Cross-Modal Rewards" — יענה על השאלה שכרטיס המודל אינו יכול: מה עושה הרובריקה החזותית כאשר גרף העיצוב שלפיו היא מדרגת שגוי בעצמו.
עד שאחד מאלה יתממש, הפרשנות שניתן להגן עליה היא הצרה. AesCode-8B הוא המעניין מבין שני המודלים האלה והפחות שמיש. הוא טוב מאוד בחלקים של עיצוב חזותי שמכונה יכולה לבדוק, בינוני בחלק שלא ניתן לאוטמט, והוא משתייך לאותה משפחת דור Qwen3 כמו המודל שאיתו משווים אותו, בלי להיות צאצא שלו. Qwen3-8B הוא זה שאפשר להכניס לפייפליין כבר אחר הצהריים.
השוואות במאמר הזה2
זוהה מתוך המאמר הזה · בנצ'מרקים: Artificial Analysis · מתעדכן יומית
