כרטיס כותרת שנוצר בסגנון הבית של OrcaRouter ועליו הכיתוב "PixelUMM vs Microsoft Mage-VL", עם ארבע אריחי נתונים סטטיסטיים: ">75%" (הפחתת הטוקנים החזותיים שמדווחת Mage-VL), "3.5×" (ההאצה המדווחת שלה בזמן שעון לעומת דגימת פריימים אחידה), "15.2B vs 4B" (הסך הכול של PixelUMM לעומת עמוד השדרה Qwen3-4B של Mage-VL) ו-"0 / 1" (יכולת היצירה האפסית של Mage-VL לעומת המודל האחד של PixelUMM שמכסה תמונות וווידאו). שורת כותרת תחתונה מציינת "המספרים של שתי המעבדות עצמן; ללא הרצה חוזרת בלתי תלויה של אף אחד מהמודלים.". הלוגו של OrcaRouter משולב לתוך הרצועה המרופדת בפינה הימנית התחתונה.
Guides & Insights

PixelUMM לעומת Microsoft Mage-VL: האחד מוחק את הטוקנייזר החזותי, והאחר משכתב אותו

מחבר

Rowan Sterling

תאריך פרסום

מודלים אחרונים · 20צפו בכל המודלים →
בנצ'מרקים: Artificial Analysis · מתעדכן יומית
חזרה לכל הפוסטים

גם PixelUMM וגם Microsoft Mage-VLנבנו על ידי צוותים שהיו משוכנעים שהדרך שבה ראייה הופכת לטוקנים היא צוואר הבקבוק הלא נכון — והם תיקנו אותו בכיוונים מנוגדים. Mage-VL, המודל הזורם יליד-הקודק של Microsoft, שומר על טוקנייזר והופך אותו להרבה יותר אגרסיבי: הוא עוקב אחרי המבנה של קודקי וידאו מודרניים, שומר על כל פריים עוגן ורק על אותם טלאים של פריימים חזויים שבהם הקודק מוציא ביטים, ומדווח על קיצוץ של יותר מ־75% בטוקנים חזותיים תוך השגת האצה של עד פי 3.5 בזמן שעון לעומת דגימת פריימים אחידה. PixelUMM, המודל המאוחד נטול-המקודד של NVIDIA, מסיר את הטוקנייזר לחלוטין — כל טלאי 16×16 של פיקסלים גולמיים מגיע לעמוד השדרה דרך הטלה ליניארית אחת, בלי VAE ובלי Vision Transformer בשום מקום. האחד דוחס באגרסיביות רבה יותר. האחר מסרב לדחוס בכלל. ורק אחד מהם יכול לייצר משהו.

ההבדל האחרון הוא מה שהופך את השילוב הזה למעניין יותר מקרב מפרטים. Mage-VL הוא צופה — מודל תפיסה זורם עם שער פרואקטיבי שמחליט מתי לדבר. PixelUMM הוא קורא שגם מצייר: אותם משקלים עונים על שאלות על תמונה ומייצרים וידאו חדש מהנחיית טקסט. אלו שתי תשובות בלתי תואמות לשאלה "מה צריך להיות מודל ראייה מאוחד", והמספרים של כל מעבדה הם שלה בלבד.

היכן מתרחשת הדחיסה

הנחת היסוד של Mage-VL היא פרדוקס מוראבק מודרני: מודלי חזות-שפה חזקים בהסקה לא-מקוונת קשה, אך איטיים ותובעניים מבחינת מחשוב בתפיסה פשוטה בזמן אמת. התיקון שלה הוא יישור קודק. במקום לפענח זרם לפריימים שנדגמו באופן אחיד ולהעביר גריד צפוף דרך ViT קפוא שאומן מראש על נתוני אינטרנט, Mage-VL מפריד זרם לפריימי עוגן (I) ולפריימים חזויים (P), משמר את כל טלאי פריימי העוגן, ושומר רק את טלאי הפריימים החזויים הנושאים תנועה אמיתית או פרט חדש. המקודד, Mage-ViT, מאומן מאפס על גריד טלאים בגודל 16×16 עם קידוד מיקום סיבובי תלת-ממדי, והוא במפורש אגנוסטי לקודק — אותו ממשק מקבל וקטורי תנועה ואנרגיית שאריות של H.264/AVC או HEVC, או מפת קצב נלמדת של קודק עצבי, ללא שינוי בארכיטקטורה או אימון מחדש.

הנחת היסוד של PixelUMM היא שהמקודד עצמו הוא הבעיה, לא היעילות שלו. המאמר שלה טוען שמודלים כמו BAGEL נושאים שני ממשקים חזותיים — ViT עבור תכונות סמנטיות ו-VAE עבור לטנטים של שחזור — מה שמכפיל בקירוב את ההקשר החזותי לכל תמונת התניה ומאלץ לבנות מחדש צינורות אימון מקדים של חזות-שפה סביב זרם שני. PixelUMM מוחק את שניהם: תמונות הופכות לטלאים מרחביים בגודל 16×16, סרטונים הופכים ל-tubelets מרחביים-זמניים בני 4 פריימים, ופיקסלים גולמיים מגיעים ל-Transformer מסוג decoder-only דרך הטלות ליניאריות בשכבה אחת. הבנה היא טקסט אוטורגרסיבי; יצירה היא התאמת זרימה במרחב הפיקסלים.

• אסטרטגיית דחיסה — Mage-VL: זמני, נגזר מקודק; לשמור על עוגנים, לדלל פריימים חזויים. PixelUMM: ללא; לשמור על כל טלאי של פיקסל גולמי.

• מה מאומן מאפס — Mage-VL: כל המחסנית החזותית, על כ-100 מיליון תמונות וסרטונים ללא תיוג. PixelUMM: מטמיעי הפיקסלים והמפענחים, על גבי עמוד שדרה לשוני Qwen3-8B.

• עמוד שדרה — Mage-VL: Qwen3-4B-Instruct-2507, הרכיב המאומן מראש היחיד, מאחורי מקרן MLP דו-שכבתי. PixelUMM: Qwen3-8B, כ-15.2B פרמטרים בסך הכול.

• התנהגות סטרימינג — Mage-VL: שער קוגניציה מדרג כל חלון מתגלגל ונשאר שקט עד שאירוע שראוי לתגובה מושלם, ורק אז מפעיל את המודל המלא. PixelUMM: אין מצב סטרימינג; בקשות הן קריאות יצירה או הבנה.

A headless-browser capture of the Hugging Face model card for the Microsoft Mage-VL repository, showing the model title, the Apache-2.0 licence tag, and the repository's download and like counters.

מה כל אחד עושה, ומה הוא לא עושה

Mage-VL הוא צ'קפוינט יחיד המספק בו-זמנית הבנה של תמונות ווידאו ואת שער ההזרמה הפרואקטיבי — אותם משקלים עונים על שאלות במצב לא מקוון ומניעים פרשנות מבוקרת-אירועים. הוא כולל את מעבד הקודק, את חבילת הקודק העצבית ואת השער. מהדורה שנייה, microsoft/Mage-ViT, היא המקודד החזותי העצמאי משלב האימון המקדים מאפס, המוצע כממשק קדמי מוכן לשילוב עבור אימון מולטימודלי אחר. מה ש-Mage-VL לא עושה הוא לייצר. הוא קורא.

PixelUMM מכסה טקסט-לתמונה, טקסט-לווידאו ב-96 פריימים ו-24 fps, וטקסט מותנה בתמונה ובווידאו. היא מגיעה עם ארבעה צ'ק-פוינטים — S8-F22-R05 כברירת מחדל שמכסה את כל ארבע המשימות, S8-F18-R01 שמכוונן לטקסט-לווידאו טוב יותר ב-480p וב-720p אך אינו מסוגל לבצע הבנת וידאו, ושני שלבי ביניים. מה שהיא לא עושה הוא סטרימינג, עריכה או תלת-ממד. אם אתה צריך מודל שצופה בפיד חי ומדבר כשמשהו קורה, PixelUMM היא ממש הצורה הלא נכונה, ואף עמודת בנצ'מרק לא תספר לך את זה.

פער האימוץ הוא האות הכנה הראשון

שתי המהדורות אינן בוגרות באותה מידה, ומוני ההורדות אומרים זאת בצורה ברורה יותר מכל פוסט השקה.

• Mage-VL — פורסם ב-Hugging Face ב-25 ביולי 2026 תחת Apache-2.0, עם דו"ח טכני נלווה ומזהה arXiv. עד תחילת אוקטובר הוא הציג כ-13,800 הורדות ו-414 לייקים, ומערכת אקולוגית קטנה של עבודה קהילתית צמחה סביבו.

• PixelUMM — פורסם ב-Hugging Face ב-1 באוקטובר 2026 תחת רישיון צ'קפוינט לא-מסחרי. מספר ההורדות שלו היה אפס ומספר הלייקים שלו היה שלושה בזמן כתיבת שורות אלה. הוא בן ימים ספורים.

עדיין אין הכרזה מאף אחת מהמעבדות לגבי השחרור של כל אחת מהן — Mage-VL שוחרר ביולי בלי הכרזה כזו, ו-PixelUMM שוחרר באוקטובר בלי הכרזה כזו. הסימטריה הזאת אמיתית, אבל זו תהיה טעות לפרש אותה כך ששני אלה הם תוצרים שקולים. Mage-VL זכה לעשרה שבועות של תשומת לב קהילתית; PixelUMM זכה לימים ספורים. מודל שאיש מחוץ למעבדה לא הריץ הוא דבר אחר ממודל שכמה אלפי אנשים הורידו, ורק אחד מהשניים נמצא בקטגוריה השנייה.

A generated scoreboard card titled “PixelUMM vs Microsoft Mage-VL — the scoreboard”, with the two model names as column headings and six dimension rows spanning both columns: visual tokenizer, backbone, trained from scratch, streaming, generation and licence. Mage-VL's column shows a codec-native sparse token grid, a Qwen3-4B-Instruct-2507 backbone, a Mage-ViT pretrained from scratch on about 100M unlabeled media, proactive streaming with a cognition gate, no generation, and Apache-2.0; PixelUMM's column shows no tokenizer at all, a Qwen3-8B backbone at 15.2B total, pixel embedders and decoders trained on top of it, no streaming mode, text-to-image and text-to-video plus understanding, and a noncommercial checkpoint licence. A footer notes that the figures are vendor-reported with no independent rerun.

לוח התוצאות, עם מקור

כל נתון הוא של המעבדה המפתחת עצמה. הנתונים של Mage-VL מגיעים מהכרטיס ומהדוח הטכני של מיקרוסופט; אלה של PixelUMM מהפרסום המוקדם שלו. אף אחד מהם לא שוחזר באופן עצמאי.

• טוקנים חזותיים — Mage-VL: דיווח על הפחתה של למעלה מ-75% לעומת דגימה צפופה של פריימים. PixelUMM: ללא הפחתה; הטענה היא שטלאים גולמיים מסירים קידוד שני במקום לכווץ את הראשון.

• מהירות שעון קיר — Mage-VL: עד פי 3.5 מהיר יותר מדגימת פריימים אחידה בדיוק תואם, לפי דיווח של מיקרוסופט. PixelUMM: אין טענת מהירות השוואתית במאמר.

• איכות מקודד — Mage-VL: Mage-ViT מדווח על 99.33% ב-CIFAR-10 ו-85.69% ב-ImageNet בתקציב של 256 טוקנים, מכ-100 מיליון מדיה לא מתויגת. PixelUMM: אין בנצ'מרק מקודד שווה ערך, מכיוון שאין מקודד להשוות.

• הבנת וידאו — Mage-VL: שיפורים מדווחים לעומת Qwen3-VL-4B בכל מדד וידאו ועיגון זמני שהוא מדווח, כולל +22.5 ב-QVHighlight ו-+17.1 ב-ActivityNet. PixelUMM: MVBench 70.53, Video-MME 57.33 ללא כתוביות, LongVideoBench 59.61, LVBench 40.41.

• הבנת תמונות — Mage-VL: ברמה של Qwen3-VL-4B בתמונות סטטיות, לפי דיווח של Microsoft. PixelUMM: MMMU 41.67, AI2D 80.12, DocVQA 90.42, ChartQA 82.96.

• יצירה — Mage-VL: אין. PixelUMM: GenEval בסך הכל 0.83 עם מנסח פרומפטים מחדש, DPG-Bench 85.74, VBench Part 1 איכות 84.10.

• סטרימינג — Mage-VL: גייטינג אירועים פרואקטיבי עם TimVal, F1, ROC-AUC ו-PR-AUC המובילים שדווחו בסטרימינג של SoccerNet. PixelUMM: לא נתמך.

• רישיון — Mage-VL: Apache-2.0, קוד ומשקלים. PixelUMM: קוד Apache-2.0, רישיון לא-מסחרי חד-כיווני של NVIDIA על הצ'קפוינט.

שתי העמודות אינן חופפות מספיק כדי לדרג. Mage-VL מדווח על מקודד יעיל שמנצח מתחרה באותו קנה מידה; PixelUMM מדווח על מודל 15B שנמצא באותה רצועה כמו המערכות המתמחות שסביבו, ואומר במפורש במאמרו שנתוני אימון שונים פירושם שהתוצאות "אינן יכולות לקבוע איזו ארכיטקטורה עדיפה".

הפיצול המעשי

בחר לפי המשימה, לא לפי הציון. אם אתה בונה תפיסת וידאו בזמן אמת — מוניטור שצופה בזרם ומגיב כשמשהו קורה, כאשר עלות הטוקנים היא האילוץ המחייב — Mage-VL הוא היחיד מבין השניים שעושה זאת, הוא ברישיון Apache-2.0, והקנה מידה שלו בדרגת 4B אומר שצומת אחד יכול לשרת אותו. אם אתה צריך מודל אחד שקורא תמונות ווידאו וגם מייצר אותם, PixelUMM הוא היחיד מבין השניים שעושה זאת, אבל הוא תוצר מחקרי ברישיון לא-מסחרי, המשקלים שלו הם 128 פלחים של נקודות ביקורת מבוזרות מאחורי אינדקס נסתר, והמרת טקסט לווידאו מפעילה כברירת מחדל את מעקות הבטיחות של Cosmos עם סביבת Python נפרדת לשער.

עבור צוות שזקוק לשתי היכולות גם יחד, הטיעון להגיע אליהן דרך שכבת ניתוב אחת ולא דרך שתי אינטגרציות ישירות הוא פשוט, אף שאף אחת מהן אינה מתארחת כיום: מפתח אחד, מחירי מחירון של הספקים המועברים הלאה בתוספת של 0%, וכללי failover שמאפשרים לך להציב מודל Apache-2.0 שזה עתה נפתח לפני נתח מהתעבורה, בעוד המודל המוכח מחזיק בשאר. OrcaRouter בנוי בדיוק לצורה הזו של בעיה — ולמען הבהירות, אנחנו לא מנתבים כרגע לא את PixelUMM ולא את Mage-VL, כך שזהו תיאור של זרימת העבודה, ולא רשימה.

מה יפתור את זה?

שני אירועים חשובים. הראשון הוא הרצה חוזרת ובלתי תלויה של מספרי המקודד של Mage-ViT או של תוצאות הווידאו של Mage-VL, בידי מישהו שאין לו אינטרס בהם — עשרה שבועות של הורדות טרם הניבו אף לא אחת כזו. השני הוא כל שינוי ברישיון הצ'קפוינט של PixelUMM, שהוא העובדה היחידה שמפרידה כיום בין ארטיפקט מחקרי לבין ארטיפקט בר-פריסה. עד שאחד מהשניים יתרחש, הדבר המועיל שאפשר לומר על הצמד הזה הוא ש-Microsoft הימרה על הפיכת הממשק החזותי לזול יותר ו-NVIDIA הימרה על הסרתו, ואף אחד משני ההימורים לא קיבל ציון מאף אחד מחוץ למעבדה שהציבה אותו.