כרטיס כותרת ראשי עבור 'AesCode-32B' עם כתובית המשנה 'מיקרוסופט העלתה משקלים של 33B שכותבים מצגות כ-HTML ניתן לעריכה — ולא הודיעה דבר', שלושה צ'יפים עם הכיתוב '33B פרמטרים, BF16', 'בסיס: Qwen3-VL-32B-Instruct' ו'ללא API מתארח', אייקון קו שטוח של חלון דפדפן המכיל פריסת שקופית עם פאנל תרשים ושתי שורות טבלה, ושורת כותרת תחתונה עם הכיתוב 'לפי microsoft/AesCode-32B ב-Hugging Face וב-github.com/microsoft/AesCode, נקרא ב-11 באוקטובר 2026.'; הלוגו של OrcaRouter ממוקם בפינה הימנית התחתונה של הקנבס המורחב.
Guides & Insights

AesCode-32B: המודל השקט של מיקרוסופט בנפח 33B שכותב מצגות כ-HTML שניתן לעריכה

מחבר

Alistair Wren

תאריך פרסום

מודלים אחרונים · 20צפו בכל המודלים →
בנצ'מרקים: Artificial Analysis · מתעדכן יומית
חזרה לכל הפוסטים

חתימות הזמן של AesCode-32B אינן מסכימות זו עם זו, ואי-ההסכמה היא עיקר מה שיש לדווח. המאגר של Hugging Face microsoft/AesCode-32B נוצר ב-29 בספטמבר 2026, אבל כל מה שבו הגיע בקומיט יחיד המתוארך ל-7 באוקטובר 2026, שההודעה שלו היא פשוט "Release AesCode-32B" — והמערכת לאימון שהופכת את התוצאה לשחזורית נדחפה אל github.com/microsoft/AesCode ב-8 באוקטובר. מיקרוסופט לא הודיעה דבר: אין פוסט בבלוג, אין טרום-פרסום ב-arXiv, אין הגשה ללוח דירוג, אין דף דגם באתר שלה. מה שקיים הוא מודל חזותי-לשוני בן 33 מיליארד פרמטרים שלוקח פרומפט ומפיק מסמך HTML שלם ועצמאי — שקופית, פוסטר, לוח מחוונים — בתוספת מודל מלווה קטן יותר, microsoft/AesCode-8B. שניהם עברו כיוונון עדין ממודלים חזותיים של Qwen3-VL — Qwen3-VL-32B-Instruct וגם Qwen3-VL-8B-Instruct בהתאמה — שניהם ברישיון Apache 2.0, ושניהם ניתנים להורדה היום.

מזהה הריפו נקרא microsoft/AesCode-32B והכרטיס נפתח בטריק: AesCode מזווג את הפרומפט שלך עם תמונה שנוצרה מאותו פרומפט, משתמש בתמונה כהפניה אסתטית, והולך אחרי הטקסט בכל הנוגע לתוכן עצמו. מחוללי תמונות מרכיבים עמוד נאה ומשבשים את המספרים שעליו; מודלי קוד קולעים במספרים ואינם יכולים לראות איך העמוד נראה. AesCode הוא ניסיון להשיג את שניהם, והסיכום הכנה שלו נכון ל-11 באוקטובר 2026 הוא שהמשקלים אמיתיים וניתנים לבדיקה, שמספרי הבנצ'מרק הם של המעבדה עצמה על גבי מערכת בדיקה שהמעבדה כתבה, ושאף אחד מחוץ למיקרוסופט עדיין לא פרסם עבורו מספר. היצירה הזו שומרת על שלוש הקטגוריות האלה נפרדות לאורך כל הדרך.

מה בעצם נמצא במאגר, בייט אחר בייט

A headless-browser capture of the Hugging Face model page for microsoft/AesCode-32B, showing the repo heading, a Like count of 1, 'License: apache-2.0', the card intro text, the sentence describing training with GDPO, and the bulleted Paper, Code and Companion links; the surrounding Hugging Face navigation and search chrome is included.

התחל במה שתוכל לאמת בלי להאמין למילה אחת מכרטיס המודל. מאגר ה-32B מכיל ארבעה־עשר שברי safetensors המסתכמים ל-66,714,912,704 בתים, שב-BF16 הם בערך 33.4 מיליארד פרמטרים — בהתאמה ל"33B params" שבכרטיס ולאזהרה שהמשקלים לבדם דורשים כ-65 GB של זיכרון מאיץ. התצורה מצהירה Qwen3VLForConditionalGeneration כארכיטקטורה ו-qwen3_vl כסוג המודל, כך שזו אינה ארכיטקטורה חדשה ואינה זקוקה לאחת: היא נטענת עם transformers>=4.57, והכרטיס מספק פקודת vLLM שמגישה אותה על פני ארבע דרגות tensor-parallel עם שתי תמונות מותרות לכל פרומפט ותקרה של 24,576 אסימונים.

מוני המעורבות הם החלק השקט ביותר של השחרור. שתי הורדות ולייק אחד במאגר 32B בזמן כתיבת שורות אלה. אין רשומה במיפוי ספקי ההסקה של Hugging Face, כלומר אין נקודת קצה מתארחת שמחוברת מאחורי דף המאגר, ואין בנייה של GGUF, MLX או llama.cpp שמפורסמת בשום מקום. עבור מודל הנושא את השם של Microsoft ומציג תוצאות שגוברות על GPT-5.5 בטבלה של הספק עצמו, זהו טביעת רגל קטנה באופן בולט — וזו הראיה החזקה ביותר הזמינה לכך שזה עלה בלי השקה מאחוריו.

מאגר הקוד הנלווה משלים את החצי השני של ציר הזמן, וכאן שאלת תאריך השחרור נעשית ממש דו-משמעית. microsoft/AesCode נוצר ב-23 ביולי 2026 — עשרה שבועות לפני המשקלים — ומכיל ארבעה-עשר קומיטים, שכולם נכתבו על ידי אותו תורם ושכולם נושאים חתימת זמן בטווח של עשרים שניות זה מזה ב-8 באוקטובר 2026, בין 23:14:04 ל-23:14:24 UTC. הם כוללים את המפרט ליצירת פרומפטים ודרישות ניתנות לאימות, את צינור הנתונים שבונה גרפי עיצוב ושאלות רובריקה, שלב SFT להתנעה קרה, את לולאת למידת החיזוק GDPO, מאמת רינדור מבוסס Playwright, בדיקות, ואת ה-README שמתעד את כל זה. אין מהדורות ואין תגים, תיאור המאגר ריק, ויש לו כוכב אחד.

A headless-browser capture of the github.com/microsoft/AesCode repository page, showing the org and repo name 'microsoft / AesCode', the line 'No description, website, or topics provided', the README summary listing overview, results and the reproduction guide, a commit count of 14, an MIT licence label, and the top-level directory tree including assets, data_prep, eval and examples/hospital_dashboard.

אז מהו תאריך השחרור? רשומת המאגר אומרת 29 בספטמבר. הקומיט שנושא את המודל אומר 7 באוקטובר. הקוד שמסביר כיצד המודל נוצר אומר 8 באוקטובר. שלוש חתימות זמן בתוך חלון אחד של שבועיים, ואף אחת מהן אינה מלווה במשפט מ-Microsoft שאומר "אנחנו משחררים את זה." התייחסו ל-7–8 באוקטובר כתאריך הקובע עבור הארטיפקטים שרוב האנשים יורידו בפועל, ול-29 בספטמבר כתאריך שבו המאגר הוקצה. כל מי שאומר לך ש-AesCode-32B "הושק" ביום מסוים בוחר בשבילך באחת מחתימות הזמן האלה.

המנגנון: תמונה כהכוונה אסתטית, גרף כגמול

הטענה הטכנית של הכרטיס היא צרה וספציפית, מה שמהווה נקודה לזכותו. המודל מאומן באמצעות כיוונון עדין מפוקח עם התחלה קרה (cold-start) על 3,000 הדגמות בקצב למידה של 1e-5, ולאחר מכן עם GDPO — וריאנט של אופטימיזציית מדיניות יחסית לקבוצה — על פני 7,408 פרומפטים במשך 520 צעדים. מודל ה-8B השתמש באותו מתכון ועצר ב-400 צעדים. הרצת ה-RL השתמשה במנוע ההיברידי FSDP-vLLM של verl ללא critic וללא מודל תגמול שאומן בנפרד, AdamW בקצב קבוע של 5e-6 ללא warmup, 128 פרומפטים לכל צעד עם שמונה רולאאוטים כל אחד, ופרומפט ותגובה כל אחד מוגבל ל-8,192 טוקנים.

מה שהופך את התגמול ליוצא דופן הוא שהוא אינו סקלר בודד. כל מטרת אימון מתוארת כגרף עיצובי המכסה את כל הקנבס, כך שניתן לייחס תכונות בודדות בנפרד. מהגרף הזה מגיעים שבעה ערוצים — ביצוע, טקסט, גבול, תרשים טבלה, פריסה, רווח לבן ועיצוב — שכל אחד מהם מנורמל בתוך קבוצת ה-rollout שלו לפני צבירה, כך שאות דומיננטי אחד לא יכול להטביע את האחרים. מאמתים דטרמיניסטיים נותנים ציון למה שניתן לנתח מהקוד ומהרנדור שלו; שופט חזותי-לשוני נותן ציון למה שלא, תוך שימוש ברובריקה הקשורה לאלמנטים וליחסים של הגרף עצמו. HTML מועמד מקבל ציון על ידי רנדור שלו בדפדפן Playwright בתוך ארגז חול עם בקשות חיצוניות חסומות, שמייצא את ה-DOM, סגנונות מחושבים, תיבות תוחמות, מצב קונסולה וצילום מסך.

ההשלכה ההנדסית ראויה לציון מכיוון שהיא מופיעה בפלט שאתה מקבל: המודל מאומן לפלוט טבלאות כמבני טבלאות HTML אמיתיים ותרשימים כמפרטי ECharts, כך ששניהם ניתנים לבדיקה ישירה במקום להיות אפויים לתוך פיקסלים. זה ההבדל בין מצגת שאפשר למסור למעצב לבין מצגת שאפשר למסור ללינטר. דרישות השחזור בהתאם כבדות — ה-README דורש Python 3.10, CUDA 12.6 וצומת של שמונה מעבדי GPU מדגם B200, מצמיד קומיט ספציפי של verl וקובע במפורש שנדרש פאץ' כנגדו מכיוון ש-verl הסטנדרטי חסר תמיכה ב-Qwen3-VL, ומזהיר שבלי ספריות המערכת של Playwright הדפדפן נכשל בעת ההפעלה והדפים מקבלים ציון אפס, וכי בלי מחסנית ה-OCR המקובעת ערוץ התגמול המתאים מחזיר אפס במקום להימנע מלהשיב ומשבש בשקט את הסיגנל.

טבלת הבנצ'מרק, וארבע הסיבות שלא להיאחז בה בחוזקה

הנתונים המרכזיים של AesCode-32B מגיעים מ-300 דגימות אינפוגרפיות, שלושה תוצרים לכל פרומפט בטמפרטורה 0.8 ו-top-p 0.95, עד 12,000 אסימוני פלט בכל אחד, ללא בחירה בין התוצרים. הציונים הם באחוזים. כאשר יש ייחוס, מודל 32B מדווח על טקסט 95.34, גבול 97.27, טבלה/תרשים 90.37, וממוצע Rule של 94.33; בצד החזותי תוכן 85.76, פריסה 90.58, סגנון 55.99, עבור ממוצע חזותי של 77.44 וציון כולל של 85.89. באותה טבלה, GPT-5.5 עם ייחוס מקבל ציון כולל של 81.28 ו-Claude Opus 4.8 עם ייחוס מקבל 80.39, בעוד שעמוד השדרה Qwen3-VL-32B-Instruct שממנו אומן המודל מקבל 61.10.

A single-column scoreboard headed 'AesCode-32B - the scoreboard' with six rows reading 'Parameters: 33B BF16 (66.7 GB of weights)', 'Base model: Qwen3-VL-32B-Instruct', 'Overall (vendor): 85.89 vs GPT-5.5 at 81.28', 'Boundary: 97.27 - severe overflow on 4.3% of samples', 'Style: 55.99 - no model in the table clears 60' and 'Hosted API: none - self-host only', with a footer line reading 'All figures vendor-reported by Microsoft on its own rubric; no independent run has been published.'; the OrcaRouter logo sits in the bottom-right corner of the extended canvas.

ארבע הסתייגויות יש להזכיר באותה נשימה עם אותם נתונים, ואף אחת מהן אינה הכפשה של העבודה. ראשית, כל שורה, כולל השורות של GPT-5.5 ו-Claude Opus 4.8, הורצה על ידי Microsoft על ההרנס של Microsoft ועם הרובריקה של Microsoft — אלו אינם המספרים של המעבדות האחרות, אלא המדידות של Microsoft של מודלים של מתחרים, והכרטיס עצמו מכנה את הרובריקה "ספציפית לדגימה" לכל גרף עיצוב. שנית, הרובריקה נוצרת על ידי אותו צינור שייצר את נתוני האימון, וזה בדיוק המצב שבו מדד יכול להיסחף לעבר החוזקות של מודל; הכרטיס גלוי לב לגבי מגבלות הרובריקה הזו — סגנון, שדורש שעיצוב לא יזדקק לתיקון ויזואלי נוסף לפני מסירה, מכונה "התקרה המשותפת לכל מערכת" ואף מודל בטבלה לא עובר 60. שלישית, אין מדידה עצמאית של המודל הזה בשום מקום: אין רשומת לוח תוצאות של צד שלישי, אין שחזור, ובהינתן שיש שני הורדות, כמעט בוודאות אף אחד מחוץ למעבדה עדיין לא מריץ אותו. רביעית, ההשוואה היא אסימטרית באופן עדין שראוי לשים לב אליו — השורות של AesCode-32B כולן מותנות ברפרנס, כך שהמודל נמדד בתצורה שעבורה אומן, מה שהכרטיס מכיר בכך שהוא מראה שהאיכות עדיין הגבוהה ביותר כאשר מסופק רפרנס.

התוצאה היחידה בטבלה שמחזיקה מעמד טוב יותר מהכותרת היא טענת חוסן ולא טענת איכות. השמטת תמונת הייחוס בזמן ההסקה עולה ל-AesCode-8B רק 1.00 נקודת Visual, לעומת 19.55 עבור מודל הבסיס Qwen3-VL-8B-Instruct שלו ו-10.04 עבור GPT-5.5. הטיעון של הכרטיס הוא שאימון מותנה-ייחוס מטמיע תכנון חזותי בתוך המדיניות במקום ללמד את המודל להעתיק את מה שהוא רואה. זה מדווח על ידי הספק ולא משוחזר, וזה גם מסוג הטענות שהרצה עצמאית אחת תכריע — וגם מהסוג שהכי חשוב בייצור, שבו לא תמיד תהיה לך תמונת ייחוס בהישג יד.

מה העלות של תפעול, ומה זה אומר עבור ההשוואה

אין שום דבר זול בהארחה עצמית של המודל הזה. עשרה עד שנים-עשר אלף אסימוני פלט הם הגודל המעשי של ארטיפקט בודד, ומסמך HTML מלא עם מפרט ECharts קרוב יותר לקצה העליון של הטווח הזה מאשר לתחתון, כך שכל יצירה היא פענוח ארוך. מתכון ההגשה של הכרטיס עצמו דורש ארבעה GPUs במקביליות טנסורית כדי להחזיק כ-65 GB של פרמטרי BF16, ומתכון האימון דורש שמונה B200. זו מכונה אמיתית, לא פריסת תחביב, והיא קובעת את תנאי ההשוואה: המודלים שמולם נמדד AesCode-32B נשכרים לפי אסימון, והמודל עצמו נשכר לפי שעת GPU, בין אם החומרה בבעלותך ובין אם לא.

הצורה המעשית של ההשוואה הזו היא בדיוק הנקודה שבגללה קיימת שכבת ניתוב, וכדאי להיות מדויקים לגבי מה שאנחנו מארחים ומה שלא. AesCode-32B אינו נמצא בקטלוג של OrcaRouter ואנחנו לא מגישים אותו — אין לו נקודת קצה מאוחסנת בשום מקום שאני יכול לאמת, כולל זו של מיקרוסופט. מה שכן נמצא בקטלוג הוא הצד השני של השולחן: המודלים המאוחסנים שמולם היית משווה מחולל תוצרים בהפעלה עצמית, כולל GPT-5.5 ומודלי הראייה הקטנים יותר Qwen3-VL, נגישים דרך מפתח API אחד במחיר המחירון של הספק עם 0% תוספת, מה שאומר ששינוי מחיר של ספק נכנס לתוקף אצלנו באותו יום. השוואה בין נקודת קצה שכורה לבין מודל שאתה מריץ בעצמך אינה דורשת חוזה שני או SDK שני, ו-DSL לניתוב מאפשר לקריאה בהפעלה עצמית לשבת לצד קריאות מאוחסנות מאחורי נקודת קצה אחת. אם AesCode-32B יתברר כטוב בדבר האחד שכרטיס שלו מצהיר עליו, המחיר של לגלות זאת הוא חשבון GPU, והמחיר של החלופות שאיתן אתה משווה אותו הוא מפתח אחד שכנראה כבר יש לך.

מה אפשר לעשות עם זה היום, ומה לא קיים

• הורד והרץ אותו — המשקולות הן Apache 2.0, בהתאם לשלד Qwen3-VL, עם ארבעה עשר שברי BF16 ונתיב transformers עובד מעל גרסה 4.57 ומתכון vLLM בכרטיס.

• לשחזר את האימון — הקוד הוא ברישיון MIT ושלם מספיק כדי להיות בעל משמעות: מאמת התגמול, בונה המחוון, שלבי ה-SFT וה-GDPO, commit מקובע של verl יחד עם הפאץ׳ שמוסיף תמיכה ב-Qwen3-VL, ו-README שמפרט את מצבי הכשל במקום להסתיר אותם.

• העריך אותו ללא רפרנס — המודל מקבל פרומפטים עם או בלי תמונת הרפרנס, והטענה הניתנת לבדיקה ביותר של הכרטיס נמצאת בתצורה הזו.

• להשיג API עבור זה — לא תוכלו. אין נקודת קצה מתארחת, אין מיפוי ספק הסקה במאגר, ואין בנייה של GGUF או MLX; להריץ את זה משמעו להריץ את החומרה.

• קראו את המאמר — עדיין אינכם יכולים. הכרטיס מקשר למאמר שכותרתו AesCode: Aesthetic Code Generation with Decoupled Cross-Modal Rewards, והערך BibTeX של המאמר עצמו מציין את מקום הפרסום כ"בהליך ביקורת" ואת השנה כ-2027. חיפוש ב-arXiv אינו מחזיר מאמר בשם זה. קיים מאמר אחר, מוקדם יותר, של מיקרוסופט, בעל שם כמעט זהה — Code Aesthetics with Agentic Reward Feedback מאוקטובר 2025, שפרסם מודל AesCoder-4B וקבוצת נתונים AesCode-358K — ושום דבר בכרטיס של AesCode-32B אינו מצטט אותו או מציין זיקה אליו. אם תצאו לחפש קריאת רקע ותנחתו דווקא על זה, הרי שאתם קוראים על מודל אחר שנבנה בידי מחברים חופפים.

• להשוות אותו בלוח דירוג ציבורי — עדיין לא. לא נראה שאף אינדקס של צד שלישי העריך אותו, וזה לא מפתיע עבור מאגר עם שתי הורדות.

מי צריך לדאוג, ומי צריך לחכות

הקהל של זה צר יותר ממה שטבלת הכותרת מרמזת, וספציפי יותר מ"כל מי שבונה עם מודלים". אם המוצר שלך הופך פרומפטים למצגות, פוסטרים, דוחות או לוחות מחוונים שמישהו צריך לערוך אחר כך, כבר גילית את הבחירה שהמודל הזה מכוון אליה: יצירת תמונות נותנת לך מלבן יפהפה שאי אפשר לשנות, ויצירת קוד נותנת לך משהו שניתן לעריכה שנראה כאילו הורכב על ידי מהדר. מודל 33B עם משקולות פתוחות שפולט מסמך HTML מלא עם טבלאות אמיתיות ומפרטי ECharts, שנשאר בטווח של כנקודה אחת מהאיכות שלו כשהוא מותנה ברפרנס כשאין לך רפרנס לתת לו, ואשר אתה יכול לכוונן על סגנון הבית שלך תחת Apache 2.0, הוא דבר שימושי באמת שיהיה קיים. אף מודל אחר לא עושה את העבודה המדויקת הזו בגודל הזה עם התנאים האלה.

מנגד: כל מה שאתה יודע על האיכות מגיע מטבלה שהספק בנה, המחוון שמאחוריה נוצר באותו פייפליין שיצר את נתוני האימון, והתקרה היחידה שהכרטיס מודה בה — Style מתחת ל-60 עבור כל מערכת שנבדקה — היא בדיוק הממד שהכי חשוב למוצר רגיש לעיצוב. לצוות עם סיבה של ציות להשאיר את הייצור פנימי וצומת פנוי עם שמונה GPU יש מספיק כדי להתחיל היום. לצוות שבוחר מודל לייצור בשבוע הבא אין מספר עצמאי שעליו לבחור, והוא לא צריך לקרוא את 85.89 מול 81.28 כתוצאה סופית.

מה יהפוך את זה לסיפור?

ארבעה דברים, שאף אחד מהם עדיין לא קיים. הכרזה — מיקרוסופט לא אמרה דבר, והמאמר שהכרטיס מפנה אליו נמצא במפורש בבדיקה, כך שדוח טכני עם פרטי אימון מעבר לתקציר של הכרטיס עשוי להופיע בכל רגע. הרצה עצמאית — טענת העמידות ללא ייחוס וציון ה-Boundary, אשר לפי הכרטיס יורד לכשל חמור ב-4.3% מהדגימות לעומת 34.7% עבור GPT-5.5, שניהם זולים לבדיקה ושניהם שווים בדיקה. תמיכת שירות מחוץ למתכון של הספק — בניית GGUF או רשומת זמן ריצה מיינסטרימית ישנו את סיפור החומרה יותר מכל benchmark. ונקודת נתונים שנייה בשאלת הגודל: מודל 8B שמקבל 82.94 Overall לעומת 85.89 של ה-32B באותה טבלה הוא פער של שתי נקודות עבור רבע מהפרמטרים, שזה מסוג הדברים שאו משוחזר או מפסיק להיות מוזכר בשקט.

עד שאחד מאלה יתממש, התיאור המדויק של AesCode-32B הוא זה: משקלים אמיתיים תחת רישיון מתירני, ערימת אימון מפורטת דיה כדי להשתחזר במעבדה מצוידת היטב, טבלת בנצ'מרקים שהיא המדידה של חברה אחת את המודל של עצמה ואת זה של שני מתחרים, והיסטוריית מאגר שלא תאפשר לך לכנות שום יום בודד כתאריך ההשקה. זהו חפץ מעניין יותר ממה שמונה שתי ההורדות שלו מרמז, ופחות מוכח ממה ש-85.89 מרמז. שני החצאים של המשפט הזה הם הקריאה הכנה ב-11 באוקטובר 2026.

השוואות במאמר הזה2

זוהה מתוך המאמר הזה · בנצ'מרקים: Artificial Analysis · מתעדכן יומית