
AesCode-8B לעומת Gemma 4 12B: שני מודלי ראייה קטנים, שני פלטים שונים לחלוטין
- OrcaחדשOrca: OrcaCyber Zero 1.52026-10-10$3.00 / $7.50 לכל 1M טוקנים · 87 tok/s
- openaiחדשOpenAI: GPT-6.1 Sol2026-09-2952אינטליגנציה
- anthropicחדשAnthropic: Claude Sonnet 5.52026-09-2856אינטליגנציה
- typesafeTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 לכל 1M טוקנים · 115 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238אינטליגנציה
- OpenAIOpenAI: GPT-6 Sol2026-09-2248אינטליגנציה
- AnthropicAnthropic: Claude Opus 5.52026-09-2258אינטליגנציה
- xAIGrok 4.72026-09-2146אינטליגנציה
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 לכל 1M טוקנים · 47 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 לכל 1M טוקנים · 777 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040אינטליגנציה
- OpenAIOpenAI: GPT-6 Astra2026-09-0453אינטליגנציה77כתיבת קוד
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241אינטליגנציה76כתיבת קוד
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245אינטליגנציה76כתיבת קוד
- AnthropicAnthropic: Claude Fable 5.12026-09-0153אינטליגנציה82כתיבת קוד
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 לכל 1M טוקנים · 61 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 לכל 1M טוקנים · 452 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642אינטליגנציה72כתיבת קוד
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 לכל 1M טוקנים · 231 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845אינטליגנציה75כתיבת קוד
AesCode-8BוגםGemma 4 12B מקבלים תמונה ומשפט, ושניהם צ'קפוינטים של Apache-2.0 שאותם מורידים במקום לשכור, ולכן מנועי חיפוש ישמחו להציג אותם זה לצד זה. הדמיון אמיתי, והוא גם שטחי. Gemma 4 12B מחזיר תשובה — תיאור, תמלול, קטע קוד, עקבות חשיבה. AesCode-8B מחזיר עמוד מרונדר: שקופית, פוסטר או לוח מחוונים כמסמך HTML ו-CSS שלם שאפשר לפתוח בדפדפן ולערוך ביד. אותה צורת קלט, פחות או יותר אותה קטגוריית משקל, ופלט שאין לו כמעט דבר במשותף עם זה של האחר. ההבדל האחד הזה מכריע כמעט כל שאלה מעשית בהמשך, כולל איזו מהן תוכלו להציג למשתמש מחר.
ראוי להצהיר על כך כבר בהתחלה, משום שזה משפיע על מידת המשקל שאפשר לתת למספרים: Gemma 4 12B הושק על ידי DeepMind ב-2026-06-03 עם כרטיס מודל, תיעוד ומערכת אקוסיסטם, ומאז הוא נבדק באופן עצמאי. AesCode-8B לא הושק כלל. המאגר של Microsoft עבורו נוצר ב-2026-09-29, והמשקלים נחתו בקומיט שכותרתו "Release AesCode-8B" בשעה 03:35 UTC ב-2026-10-07, כאשר קוד האימון וההערכה הופיע ב-GitHub למחרת. אין פוסט של Microsoft Research, אין דף מוצר, אין הערת שחרור ואין preprint — הציטוט בכרטיס המודל הוא "Under review" עם שנת מציין המקום 2027. נכון לכתיבת שורות אלה, מאגר ה-8B מציג שתי הורדות ולייק אחד. לכן כל דבר כמותי בנוגע ל-AesCode-8B הוא של Microsoft בלבד, ושום דבר לא שוחזר בידי אף אחד אחר.
שני המודלים, בתנאים שלהם
Gemma 4 12B הוא מודל פתוח בגודל בינוני, צ'קפוינט צפוף בן 11.95 מיליארד פרמטרים, שהבחירה העיצובית המכוננת שלו היא שאין לו מקודד חזותי או קולי נפרד: טלאי תמונה וצורות גל קוליות נכנסים ישירות אל הטרנספורמר. הוא נושא חלון הקשר של 256K אסימונים וזקוק לכו-16 GB של VRAM, כאשר משקולות BF16 מגיעות לכ-27 GB ומבנים מכומתים מתחת ל-7 GB. הכרטיס של הספק עצמו — מדווח על ידי הספק, ומסומן ככזה כאן — מפרט DocVQA 94.9, InfoVQA 88.4, MMLU-Pro 77.2, GPQA Diamond 78.8, AIME 2026 77.5 ו-LiveCodeBench v6 72.0 במצב חשיבה. הערכה בלתי תלויה היא החלק החשוב יותר: Artificial Analysis מדרגת את תצורת החשיבה באינדקס אינטליגנציה של 14, מודדת כ-114 אסימונים בשנייה, ומתמחרת קריאה טיפוסית בשרת בסביבות $0.10 למיליון אסימוני קלט ו-$0.30 למיליון אסימוני פלט. שלושה וחצי חודשי פריסה עומדים מאחוריו.
AesCode-8B הוא כיוונון עדין של Qwen3-VL-8B-Instruct, שפורסם עם ארבעה חלקי safetensors בסך כולל של 17,543,339,408 בתים — כ-8.8 מיליארד פרמטרים ב-bf16, ולכן שדה הגודל המעוגל של Hugging Face מציג 9B בעוד שהספק אומר 8B. תצורת הפרסום היא מתכון ישיר של Qwen3-VL: 36 שכבות נסתרות, גודל נסתר 4,096, 32 ראשי קשב עם 8 ראשי מפתח-ערך, אוצר מילים של 151,936 אסימונים, ודרישה ל-transformers 4.57 או חדש יותר. הריצות המדווחות של Microsoft השתמשו בהקשר של 24,576 אסימונים עם עד 12,000 אסימוני פלט, טמפרטורה 0.8, top-p 0.95 ושלוש יצירות לכל פרומפט ללא בחירה. הרישיון הוא Apache 2.0, ללא הגבלת גישה, ללא נספח שימוש מקובל. מה שלא כלול בחבילה הוא נתוני האימון וההערכה, וכל נקודת קצה מתארחת — לא הצלחנו למצוא את AesCode-8B מוגש בשום מקום, והוא לא נמצא בקטלוג שלנו.
מה שהמודלים למעשה אומנו לעשות
תדריך העיצוב מצוטט בכרטיס המודל וכדאי לקרוא אותו כתזה כולה: מודלים של קוד "לא רואים כיצד פריסה, היררכיה וצבע מתחברים יחד על הקנבס", בעוד שמחוללי תמונות "מרכיבים עמודים מושכים חזותית אך לעתים קרובות מציגים באופן שגוי טקסט, מספרים ויחסים לוגיים". AesCode הוא הניסיון לשמור גם על חוש הקומפוזיציה וגם על יכולת האימות בו-זמנית.
המנגנון יוצא דופן בדרך אחת ספציפית. כל פרומפט אימון מותאם לתמונת ייחוס שנוצרה מאותו פרומפט עצמו, אשר מספקת פריסה וסגנון בעוד שפרומפט הטקסט נשאר הסמכות בכל הנוגע לתוכן. לאחר מכן, בעת ההסקה, המודל בקושי זקוק לתמונה: אם מונעים מ-AesCode-8B את הייחוס, ציון ה-Visual שלו יורד בנקודה אחת מתוך מאה. אם מונעים אותו מ-Qwen3-VL-8B-Instruct, הירידה היא 19.55. אם מונעים אותו מ-GPT-5.5, שנבחן תחת אותה מערכת בדיקה, הירידה היא 10.04. הפריור החזותי מצא את דרכו אל המשקלים ולא אל הקלט, וזו התוצאה המחקרית האמיתית שמתחת לכותרות.
יעד האימון של Gemma 4 12B הוא היעד המולטימודלי הרגיל, ואין זה ביקורת לומר זאת: לקרוא את התמונה, להשיב על השאלה, למלא אחר ההוראה, לקרוא לכלי. דבר בכרטיס שלו אינו מרמז שאי פעם כוון להפיק תוצר מרונדר, ואף הערכה שפורסמה של Gemma 4 12B אינה מודדת איכות פריסת מסמך, גלישת קנבס או עקביות עיצובית, מכיוון שאלה אינם המטריקות של המודל.
לוח התוצאות, ושל מי המחוון

• פרמטרים — AesCode-8B: 8.8B bf16, צפוף. Gemma 4 12B: 11.95B צפוף.
• קלטים — AesCode-8B: טקסט בתוספת תמונת ייחוס אופציונלית. Gemma 4 12B: טקסט, תמונה, אודיו ווידאו.
• פלט — AesCode-8B: מסמך HTML ו-CSS מלא. Gemma 4 12B: טקסט, כולל קריאות לכלים.
• הקשר — AesCode-8B: 24,576 אסימונים בתצורה המדווחת. Gemma 4 12B: 256K אסימונים.
• רישיון — שניהם Apache 2.0, ללא הגבלות גישה, כולל משקולות.
• עדויות — AesCode-8B: מחוון האינפוגרפיקה בן 300 הדגימות של מיקרוסופט עצמה, שלושה דורות לכל פרומפט, ללא שחזור בלתי תלוי. Gemma 4 12B: כרטיס ספק בתוספת מדד Intelligence Index עצמאי של 14 ותפוקה מדודה ב-Artificial Analysis.
עכשיו החלק שטבלת התוצאות לא יכולה לשאת. מיקרוסופט מדווחת ש-AesCode-8B נמצא ב-82.94 Overall באותה ערכת 300 דגימות, מקדים את GPT-5.5 המותנה ברפרנס עם 81.28 ואת Claude Opus 4.8 עם 80.39, ובפער של 31.1 נקודות Visual מבסיס ה-Qwen3-VL-8B של עצמו. יש לקרוא את כל זה כמדווח על ידי הספק וככזה שלא שוחזר, על רובריקה שהספק בנה, על דגימות שהספק בחר, ובניקוד של הרנס שהספק אימן את המודל נגדו. הכרטיס כן מספיק כדי לפרסם מימד שאף מודל בהשוואה לא עובר בו 60 — Style, שבו AesCode-8B נמצא ב-53.21 ו-GPT-5.5 מוביל עם 57.91 — וההגדרה של מיקרוסופט עצמה למימד הזה היא עיצוב שלא דורש שום תיקון ויזואלי נוסף לפני מסירה. בציר האחד ששואל אם אדם היה מפרסם את העמוד ללא עריכה, מודל ה-8B אינו המוביל. זה המספר שיש להיאחז בו כשמישהו מצטט את ה-82.94.
היכן שהם חופפים באמת
יש בדיוק מדף משותף אחד, והוא צר ממה שהוא נראה. אם אתם בוחנים מודלי ראייה קטנים ופתוחים עבור פייפליין עתיר מסמכים, שניהם מועמדים — האחד לקריאת מסמך, והשני להפקת מסמך. צוות שמייצר לוחות מחוונים פנימיים כ-HTML וגם צריך לחלץ נתונים מקובצי PDF שהועלו נוגע בשני המוצרים באותו שבוע.
הפיצול בתוך החפיפה הזו נקי. Gemma 4 12B הוא המודל שאתה מפנה למסמך נכנס. AesCode-8B הוא המודל שאתה מפנה לבריף כשהתוצר הוא עמוד. אף אחד מהם לא מחליף את האחר, ופייפליין שרוצה את שניהם הוא פייפליין דו-מודלי ולא בחירה.

פריסה, וזה בדיוק המקום שבו האסימטריה נושכת
סיפור ההגשה של Gemma 4 12B הסתיים. אתה מוריד אותו, מכמת אותו אם תרצה, מריץ אותו על 16 GB של VRAM, ויש בסיס גדול של כלים שכבר עושים זאת. אם אתה מעדיף לא להריץ אותו בכלל, קריאה משרת היא זולה ומתומחרת בנפרד.
סיפור ההגשה של AesCode-8B הוא שורת פקודה וקצת אריתמטיקה. כרטיס המודל נותן את הנתיב ישירות — vllm serve microsoft/AesCode-8B --limit-mm-per-prompt image=2 --max-model-len 24576, עם transformers 4.57 ואילך לנתיב שאינו vLLM. 17.5 GB של משקולות bf16 צריכים לשבת לצד מטמון KV עבור 24,576 אסימונים ועד שני תמונות, כך שכרטיס יחיד בנפח 24 GB מספיק מבחינה טכנית וצפוף באופן לא נוח; 40-48 GB, או שני כרטיסי 24 GB, הם המינימום הריאלי. הקצו גם רנדרר, כי כל טענת איכות לגבי המודל הזה נעשית על ידי רינדור פלט ה-HTML שלו בדפדפן מבודד, כך שניקוד התוצאות שלכם פירושו להקים משהו דמוי Playwright עם בקשות חיצוניות חסומות.
ואז יש את מצב הזמינות האמיתי. אנחנו לא מנתבים את AesCode-8B, וגם לא, ככל שאנחנו מצליחים לגלות, אף אחד אחר; הערכה היום פירושה משקולות על החומרה שלך. הדבר הקרוב ביותר שניתן לקרוא לו הוא הארכיטקטורה שממנה כוונן המודל. Qwen3-VL-8B-Instruct הוא ניתן לניתוב דרך OrcaRouter כעת במחיר $0.18 למיליון טוקנים בקלט ו-$0.70 למיליון טוקנים בפלט על פני הקשר של 131,072 טוקנים, ושני הצ'קפוינטים שאנחנו כן מספקים מתומחרים באותו אופן — Gemma 4 26B-A4B ב-$0.06 ו-$0.33, Gemma 4 31B ב-$0.13 ו-$0.38. מחיר המחירון של הספק עובר הלאה בלי תוספת רווח, ומעבר בין ספקים מתרחש אוטומטית, כך שהדרך הזולה לגלות אם הפרומפטים שלך מייצרים תוצאות טובות בכלל היא לבדוק קודם את מודל הבסיס הלא מכוונן ולהוציא את שבוע ה-GPU רק על הפרומפטים ששורדים.

איזה מהם אתה בעצם רוצה
בחר ב-AesCode-8B אם התוצר הוא עמוד. המודל פולט HTML מובנה וניתן לעריכה — טבלאות כטבלאות HTML, תרשימים כמפרטי ECharts — מה שאומר שהפלט מופיע כ-diff ב-Git ויכול להיות מעוצב מחדש על ידי מעצב בלי לייצר אותו מחדש. קבל את הפשרה: צ'קפוינט מחקרי שלא הוכרז עם מספר הורדות דו-ספרתי, ללא הערכה עצמאית, ללא נקודת קצה מתארחת, הקשר של 24K שאומת רק על עמודי אינפוגרפיקה בודדים, ותג שפה באנגלית בלבד על הכרטיס.
בחר ב-Gemma 4 12B לכל השאר. הוא קורא מסמכים טוב יותר מרוב המודלים שכפולים ממנו בגודלם, הוא מטפל באודיו, הוא מציית להוראות של כלים, יש לו רבע מיליון טוקנים של הקשר, ויש מאחוריו שלושה וחצי חודשים של ניסיון של אנשים אחרים. אם אתה בוחר באחד משני אלה להיות מודל הראייה הקטן שלך, ולא נתבקשת במפורש להפיק מצגות כקוד, זו התשובה.
ואם הדרישה הכנה היא גם וגם, אל תתייחס לכך כאל שובר שוויון. נתב את עבודת הקריאה למודל מתארח, והשאר את עבודת הרינדור על כל מכונה שיכולה להחזיק את המשקולות.
מה היה משנה את הדף הזה
שלושה אותות. שחזור בלתי־תלוי של ה-82.94 ושל ירידת הייחוס של 1.00 נקודות יעביר את AesCode-8B מטענת ספק לתוצאה, ויהפוך את שאלת הגודל 8B מול 12B למעניינת באמת ולא רק נומינלית. ספק הסקה שיאמץ את הצ'קפוינט יחסל את עמודת הפריסה, שהיא כרגע כל ההבדל המעשי. והמאמר שמיקרוסופט מצטטת כנמצא בבדיקה — "AesCode: Aesthetic Code Generation with Decoupled Cross-Modal Rewards" — יענה על השאלות שכרטיס המודל לא יכול, החל מהאופן שבו הרובריקה החזותית מתנהגת כאשר גרף העיצוב עצמו שגוי. עד שאחד מאלה יתממש, הקריאה הניתנת להגנה היא צרה ואמיתית: AesCode-8B טוב מאוד בחלקים של עיצוב חזותי שמכונה יכולה לבדוק, בינוני בחלק שהיא לא יכולה, ו-Gemma 4 12B הוא מוצר מוגמר שעושה עבודה אחרת.
השוואות במאמר הזה2
זוהה מתוך המאמר הזה · בנצ'מרקים: Artificial Analysis · מתעדכן יומית
