כרטיס כותרת ראשי להשוואה 'InternLumina-U2 לעומת Microsoft Mage-VL' עם כותרת המשנה 'שתי מעבדות שקטות, שני הימורים על טוקני ראייה חכמים יותר' ושלושה שבטי נתונים — 'InternLumina-U2: 16B-A1B diffusion MoE', 'Microsoft Mage-VL: ~5B codec-native VLM', 'שניהם דיווחי ספק, ללא שכפול' — עם הלוגו של OrcaRouter בפינה הימנית התחתונה.
Guides & Insights

InternLumina-U2 מול Microsoft Mage-VL: שתי מעבדות שקטות שמהמרות שטוקני ראייה צריכים לשאת יותר

מחבר

Gideon Frost

תאריך פרסום

מודלים אחרונים · 20צפו בכל המודלים
בנצ'מרקים: Artificial Analysis · מתעדכן יומית
חזרה לכל הפוסטים

Microsoft Mage-VL ו-InternLumina-U2 שוחררו שתיהן בדרך שבה משחררות מעבדות מחקר כשהן לא בטוחות אם התוצאה היא כבר מוצר: בשקט. מיקרוסופט פרסמה את המשקלים והקוד של Mage-VL ב־Hugging Face ב־25 ביולי 2026 ללא הכרזה; ארגון InternLM של Shanghai AI Laboratory פרסם את קוד ההסקה של InternLumina-U2 ב־GitHub ב־1 בספטמבר 2026, גם הוא ללא הכרזה. בהפרש של חמישה שבועות, שתיים ממעבדות המחקר הגדולות בעולם שחררו מודלים שחולקים אמונה שקטה — שהדרך שבה אנחנו הופכים ראייה לטוקנים היא צוואר הבקבוק — ואז השאירו אותם לקהילה כדי שתבחין בהם. את אחד מהם אפשר להוריד ולהריץ היום, אם כי באופן מסורבל. את השני אי אפשר להריץ כלל, כיוון שהמשקלים שלו עדיין אינם קיימים. זו המפה הכנה של השניים, ושל הסיבה לכך ש"שניהם על פי דיווח הספק, שניהם לא מוכחים" אינו אותו משפט לגבי שניהם.

חמישה שבועות, שני הימורים על יעילות הייצוג

החוט המקשר הוא אמיתי, לא רטורי. Mage-VL הוא מודל וידאו ילידי-קודק: במקום לפענח זרם לפריימים בדגימה אחידה ולדחוף רשת צפופה של פאצ'ים דרך טרנספורמר ראייה קפוא שאומן מראש על נתוני אינטרנט, הוא עוקב אחר המבנה של קודקי וידאו מודרניים, מפריד זרם לפריימי עוגן ולנתוני התנועה הדחוסים שביניהם, ומזין את הייצוג הקומפקטי הזה ישירות. התמורה המדווחת של Microsoft היא הפחתה גדולה בכמות הטוקנים החזותיים ומסלול תפיסה סטרימינגי מהיר משמעותית — החברה ממסגרת זאת כתיקון של מעין פרדוקס מורבק עבור מודלי שפה-וידאו, שבו משימות תפיסה קטנות בזמן אמת עולות אותו כוח חישוב כמו חשיבה אופליין קשה. Mage-VL הוא צופה: הוא צורך וידאו ביעילות ועונה על שאלות בנוגע למה שהוא רואה, כמעט בזמן אמת.

InternLumina-U2 הוא הימור על אותו צוואר בקבוק מהכיוון השני. בעוד Mage-VL דוחס וידאו באמצעות מעקב אחר ה-codec, InternLumina-U2 דוחס כל קלט חזותי על ידי תיאור כל עמדה עם שמונה קודים דיסקרטיים משלימים במקום אחד, תוך שימוש בטוקנייזר שהמעבדה קוראת לו AToken. ההימור הוא שספר קודים יחיד מגביל את כמות המידע שטוקן ויזואלי אחד יכול לשאת, ולכן אוצר מילים של ספר קודים מרובה מאפשר למודל דיפוזיה אחד עם 16B פרמטרים לבצע הבנה ויצירה דרך אותו ממשק — לקרוא תרשים, לענות על שאלת וידאו, לתאר נכס תלת-ממדי, ליצור תמונה מטקסט, לערוך תמונה לפי הוראה — ללא מחסנית יצירה נפרדת. Mage-VL רוצה לקלוט זרמים בזול; InternLumina-U2 רוצה לקלוט ולצייר עם סט משקלות אחד.

לוח התוצאות

הנתונים של שני הדגמים הם דיווחי ספק שלא שוחזרו, ולכן לוח התוצאות מתייג כל שורה לפי מקורה.

• צורה — Mage-VL: מודל שפה-ראייה קומפקטי מבוסס-קודק (כ-5B פרמטרים ב-BF16) העטוף סביב עמוד שדרה טקסטואלי מסוג Qwen, המותאם להבנת תמונות ווידאו. InternLumina-U2: מודל MoE עם 16B פרמטרים ו-1B פעילים (16B-A1B), LLM דיפוזיה ספarse המכסה הבנה, יצירה ועריכה.

• ייצוג חזותי — Mage-VL: אסימונים ילידיים לקודק העוקבים אחר מבנה קודק הווידאו (עוגן בתוספת תנועה); דווח על הפחתה של למעלה מ-75% באסימונים חזותיים בווידאו מוזרם. InternLumina-U2: אסימונים דיסקרטיים לחלוטין משמונה ספרי־קוד מטוקנייזר ה-AToken.

• מה זה עושה — Mage-VL: צופה בקלט תמונה ווידאו, עונה בטקסט; בנוי לתפיסת זרימה. InternLumina-U2: טוען להבנת טקסט, הבנת תמונה, יצירת תמונה מטקסט, עריכת תמונה, הבנת וידאו והבנה תלת-ממדית.

• משקלים — Mage-VL: זמין לציבור ב־Hugging Face מאז 25 ביולי 2026 (microsoft/Mage-VL, Apache-2.0). InternLumina-U2: אינו זמין לציבור — מאגר ה־Hugging Face הוא שלד ריק, והמשקלים מסומנים כ"בקרוב".

• מספרי כותרת — Mage-VL: Video-MME 64.0, NExT-QA 83.1, OVO-Bench 64.0, כולם מדווחים על ידי מיקרוסופט. InternLumina-U2: ChartQA 86.52, MathVision 33.22, VideoMME 51.26, GenEval 0.81, כולם מדווחים על ידי המעבדה, ראשוניים וחלקיים.

• מציאות השירות — Mage-VL: ניתן להורדה, אך אין נתיב vLLM או SGLang סטנדרטי; הקוד דורש trust_remote_code, ואף ספק הסקה אינו פורס אותו כרגע. InternLumina-U2: לא ניתן לשירות על ידי איש — המשקולות אינן קיימות בפומבי, ואפילו מנהל ההסקה ששוחרר מצפה לקבצי checkpoint שאינם במאגר.

A comparison scoreboard for InternLumina-U2 and Microsoft Mage-VL: InternLumina-U2 with Shape 16B-A1B sparse MoE, Visual rep. 8-codebook discrete (AToken), Weights not public 'coming soon', Job understand/generate/edit, Headline ChartQA 86.5 GenEval 0.81, Serving none — weights absent; Microsoft Mage-VL with Shape ~5B codec-native VLM, Visual rep. codec-native stream tokens, Weights public since Jul 25 2026, Job watch video answer in text, Headline Video-MME 64.0 (reported), Serving trust_remote_code DIY, with a footer noting both sets of figures are vendor-reported and unreproduced, and the OrcaRouter logo in the bottom-right corner.

"זמין אבל מביך" אינו אותו דבר כמו "לא זמין".

זהו ההבחנה שהכי חשובה אם אתם באמת מנסים לבנות משהו. Mage-VL הוא אמיתי במובן שחשוב קודם: המשקולות נמצאות ב־Hugging Face, כרטיס המודל ספג תעבורת הורדות כבדה מאז סוף יולי, ומערכת אקולוגית קטנה של קוונטיזציות קהילתיות צמחה סביבו. "אמיתי" לא אומר "קל". כרטיס המודל מציג תגית קוד־מותאם־אישית, המקודד החזותי אינו ה־ViT הקפוא הסטנדרטי שמערכות הפריסה הקיימות מניחות, והריפו של מיקרוסופט עצמו נושא את ההשלכה המעשית — להריץ אותו פירושו trust_remote_code וללא פריסה ספקית מוכנה לשימוש. אבל צוות נחוש עם GPU יכול לטעון אותו, לכוון אותו לזרם וידאו, ולראות האם התזה מבוססת־הקודק מתקיימת עבור הנתונים שלהם. זה הבדל עצום לעומת InternLumina-U2, שבו אותו משפט מסתיים אחרת: צוות נחוש יכול לקרוא את קוד ההסקה, ואז זה נעצר, כי אין משקולות לטעון.

A screenshot of the GitHub repository InternLM/InternLumina-U2 (captured September 2 2026), showing the Apache-2.0 repo landing page, the multi-codebook diffusion description, and the per-task inference scripts that make up the public release.

כרטיס Hugging Face של microsoft/Mage-VL, שצולם ב-27 באוגוסט 2026 — תיאור הסטרימינג מסוג codec-native, רישיון Apache-2.0, תג arxiv, וקטע ספקי inference המראה שאף ספק אינו פורס את המודל כיום.

האסימטריה בהשוואות הביצועים עוקבת אחר אותו קו. המספרים של שני הדגמים הם טענות ספק ללא ריצות בלתי־תלויות חוזרות עדיין. אבל הטענות של Mage-VL לפחות נשענות על מוצר בר־הורדה, כלומר הפער בין הטענה לאימות הוא עניין של מישהו שיריץ אותו. הטענות של InternLumina-U2 נשענות על פריט מפת דרכים — "טבלאות השוואה מלאות יופיעו בדוח הטכני הקרוב" — ולא קיים מוצר שיוכל לאמת אותן. הטבלה החלקית של המעבדה עצמה אפילו מראה שהמודל מפגר אחרי לפחות יריב אחד שהוא טוען שהוא עולה עליו (GenEval 0.81 מול 0.89 של LLaDA2.0-Uni), וזו תזכורת שימושית לקרוא את התווית "מקדימה, חלקית" שלו כפשוטה.

היכן שהם יכולים ליצור במקום להתחרות

הדרך השימושית ביותר לקרוא את שני אלה היא כשלבים סמוכים בסולם, לא כמתחרים על אותה משרה. צופה codec-native כמו Mage-VL מעניין דווקא משום שהוא זול מספיק כדי להריץ אותו ברציפות — הדבר שצופה בכל פריים של הסטרים ומסלים רק כשמופיע משהו שראוי לתשומת לבו של מודל גדול יותר. המודל הגדול יותר שאליו הוא מסלים יכול, עקרונית, להיות מודל מאוחד מהסוג ש-InternLumina-U2 טוענת להיות: השער הפעיל תמיד שמחליט למה להסתכל, והמודל העמוק שבאמת קורא את התרשים, עוקב אחר הסצנה התלת-ממדית או מפיק את התמונה הערוכה. שניהם לא הוכחו — Mage-VL לא-מוכח אך בר-הרצה, InternLumina-U2 לא-מוכח וטרם שוחרר — ולכן המסגור הכנה הוא הרכבה שאפשר לבנות ברגע שכל צד אומת באופן עצמאי, לא תחרות ראש-בראש שאפשר להריץ היום.

A screenshot of the Hugging Face model page for microsoft/Mage-VL (captured August 27 2026), showing the codec-native streaming description, the Apache-2.0 license, the arxiv tag, and an inference-provider section showing no provider currently deploys the model.

מאגר ה-GitHub של InternLM/InternLumina-U2, שצולם ב-2 בספטמבר 2026 — דף הנחיתה של המאגר המציג את תיאור הדיפוזיה מרובת ספרי הקודים, את תג הרישיון Apache-2.0, ואת סקריפטים של נקודת הכניסה להסקה שמרכיבים את הגרסה הציבורית, בעוד שמשקלי המודל נשארים מחוץ לעץ הקבצים.

מה שכבת ניתוב עושה עם נקודות ביקורת לא מוכחות

אף אחד מהמודלים האלה לא מתארח ב‑OrcaRouter, ואנחנו לא נרמוז אחרת — ל‑Mage‑VL אין נתיב שירות תקני בשום מקום, ול‑InternLumina‑U2 אין משקלי מודל. מה שה‑DSL לניתוב באמת שימושי עבורו במצב הזה הוא ביטוי ההרכב שלמעלה כקריאה אחת במקום קוד דבק ייעודי: מודל תפיסה זול ופעיל תמיד שמזין מודל עמוק יותר, בשרשרת כך שהמודל היקר רץ רק כשהמודל הזול מאותת שמשהו השתנה. ולגבי בעיית הצ'קפוינטים הבלתי־מוכחים — שהיא כל פרופיל הסיכון של שני אלה — מעבר אוטומטי (failover) הוא המנגנון שמאפשר לצוות לנסות מודל כמו Mage‑VL על נתיב אמיתי בלי להמר על הנתיב כולו: בפעם הראשונה שהצ'קפוינט החדש נתקע, מחזיר פלט זבל או זורק שגיאה, הקריאה נופלת למודל מוכח, ואף מהנדס לא צריך לקום באמצע הלילה כדי להעיף מתג. API אחד על פני 200+ מודלים, מחיר המחירון של הספק מועבר ב‑0% עמלה, והדבר החדש נבחן מאחורי רשת ביטחון במקום מול הייצור.

השורה התחתונה

אם אתם רוצים לבדוק היום את התזה של וידאו ילידי-קודק (codec-native video), רק Mage-VL קיים — ו”קיים” מגיע עם הסתייגויות בנוגע לקוד מותאם אישית והרצה עצמית (DIY). אם אתם רוצים לבדוק את התזה של מודל אחיד עם ספרי-קוד מרובים (multi-codebook unified model), לא תוכלו, כי InternLumina-U2 הוא עדיין מפרט שממתין למשקלים שלו; מה שכן אפשר לעשות הוא לקרוא את הארכיטקטורה שלו עכשיו כדי שתהיו מוכנים ברגע שהסטאב ב-Hugging Face יתמלא. התייחסו למודל של מיקרוסופט כארטיפקט מביך אך אמיתי, ולמודל של Shanghai AI Lab כהבטחה מתועדת היטב, וזכרו שבהתמודדות הזו “מדווח על ידי הספק ולא שוחזר” חל על שניהם — זה פשוט אומר משהו אחר כשיש קובץ שאפשר להוריד.

© 2026 OrcaRouter

לספקים

מפעילים פלטפורמת הסקה (inference)? הציגו את המודלים שלכם ב-OrcaRouter.

providers@orcarouter.ai

הצטרפו לקהילה שלנו

Discordsupport@orcarouter.aiXGitHubYouTube