כרטיס כותרת שנוצר בסגנון הבית של OrcaRouter ועליו הכיתוב "PixelUMM מול InternLumina-U2", עם ארבעה אריחי נתונים סטטיסטיים: "41.67 / 57.33" (MMMU ו-Video-MME של PixelUMM), "0.81 / 51.26" (GenEval ו-Video-MME של InternLumina-U2), "Apache-2.0" (הקוד ושני הצ'קפוינטים של InternLumina-U2) ו-"1-way NC" (רישיון הצ'קפוינט של PixelUMM). בשורת הכותרת התחתונה נכתב: "נתונים כפי שדווחו על ידי הספק; לא בוצעה הרצה חוזרת עצמאית של אף אחד משני המודלים.". הלוגו של OrcaRouter משולב לתוך הרצועה המרופדת בפינה הימנית התחתונה.
Guides & Insights

PixelUMM לעומת InternLumina-U2: שתי גרסאות בטא ללא אנקודר, וההבדל היחיד שמכריע

מחבר

Elias Hawthorne

תאריך פרסום

מודלים אחרונים · 20צפו בכל המודלים →
בנצ'מרקים: Artificial Analysis · מתעדכן יומית
חזרה לכל הפוסטים

שני מודלים, שניהם ציבוריים, שניהם בעלי עיצוב יוצא דופן, ורק על אחד מהם ניתן לבנות מוצר. PixelUMM הוא המודל המאוחד נטול המקודד של NVIDIA — 15.2 מיליארד פרמטרים על שלד Qwen3-8B, קורא וכותב פיקסלים גולמיים דרך פאצ'ים בגודל 16×16 ו-tubelets של 4 פריימים, בלי VAE ובלי מקודד חזותי בשום מקום במערכת. InternLumina-U2 הוא מודל דיפוזיה מסוג mixture-of-experts בעל 16B של Shanghai AI Laboratory, שדוחס כל קלט חזותי לשמונה קודים בדידים משלימים דרך טוקנייזר בשם AToken. שניהם הימרו שהממשק החזותי הוא צוואר הבקבוק. ההימור שחשוב יותר הוא זה שבקבצי הרישיון: InternLumina-U2 מופץ עם משקולות Apache-2.0, ואילו PixelUMM מופץ עם צ'קפוינט תחת רישיון לא מסחרי. אם אתם בוחרים ביניהם למשהו מסחרי, המשפט הזה הוא כל ההשוואה, ושאר העמוד הזה הוא ההקשר עבורו.

שתי קבוצות הנתונים שלהלן מגיעות מהמעבדות עצמן. לאף אחד משני המודלים אין הערכה בלתי תלויה, דירוג Elo בזירה או שחזור על ידי צד שלישי. אף אחד מהשניים אינו מוגש באמצעות API מתארח כלשהו. מה ששונה הוא מה שמותר לך לעשות עם הארטיפקט לאחר שתוריד אותו, ועד כמה כל מהדורה באמת מתקדמת.

היכן כל אחד עומד כרגע

לוחות הזמנים של השחרור נעו במהירויות שונות, ושניהם בשקט.

• PixelUMM — מאגר GitHub נוצר ב-4 בספטמבר 2026; preprint של arXiv 2609.38597 מתאריך 29 בספטמבר 2026; מאגר המודל של Hugging Face נוצר ב-1 באוקטובר 2026 בשעה 21:40 UTC. לא צצו עבורו פוסט בבלוג של NVIDIA, הודעה לעיתונות או שרשור השקה.

• InternLumina-U2 — מאגר GitHub נוצר ב-1 בספטמבר 2026; סטאב Hugging Face נרשם באותו יום; משקלי נקודת ביקורת שאומנו על Ascend נוספו ב-10 בספטמבר 2026; משקלי נקודת ביקורת של NVIDIA/CUDA נוספו ב-24 בספטמבר 2026. שבעה שרדים לכל מחסנית, שניהם ניתנים להורדה היום.

ה-InternLumina-U2 שהיה קיים בתחילת ספטמבר — קוד בלבד, משקלים "בקרוב", מאגר מודל ריק — אינו ה-InternLumina-U2 שקיים כעת. כל מי שקרא עליו בראשית החודש והסיק שהמשקלים חסרים צריך לבדוק שוב; גם הצ'קפוינטים של Huawei Ascend וגם של NVIDIA/CUDA זמינים, תחת Apache-2.0, עם טוקנייזר, קונפיגורציה, תבנית צ'אט וקוד מידול מרחוק לצידם.

A headless-browser capture of the Hugging Face model card for the InternLumina-U2 repository, showing the model title, the Apache-2.0 licence tag, and the repository's download and like counters alongside the file listing for the checkpoint shards.

שתי תשובות לאותה שאלה

שני המודלים יוצאים מאותה תלונה: נשיאת מקודד ראייה להבנה ו VAE ליצירה פירושה ייצוג כל תמונה פעמיים, בערך מכפיל את ההקשר החזותי ומאלץ צינור אימון לתחזק שני ממשקים.

התשובה של PixelUMM היא למחוק את שניהם. פיקסלים גולמיים נכנסים ישירות דרך היטלים ליניאריים חד-שכבתיים — patch בגודל 16×16 לכל מיקום בתמונה, tubelet של 4 פריימים לכל מיקום בווידאו — ועמוד השדרה הוא Transformer מסוג decoder-only, שתכנון ה-Mixture-of-Transformers שלו משלב קשב משותף עם פרמטרים ייעודיים למשימה. את הטקסט חוזים באופן אוטורגרסיבי; את הפיקסלים חוזים באמצעות flow matching. המאמר מקדיש שמונה פרקים למחקרי עיצוב — גודל patch, ארטיפקטים של patch, דינמיקה במרחב פיקסלים לעומת מרחב VAE, סקיילינג חישובי — מה שאומר לך שהשאלה האמיתית של הצוות הייתה אם הפרדיגמה בכלל מחזיקה.

התשובה של InternLumina-U2 היא לשמור על ממשק בדיד אך לגרום לכל טוקן לשאת הרבה יותר. הטוקנייזר AToken מתאר כל מיקום חזותי באמצעות שמונה ספרי קוד משלימים המכסים מרקם, טקסט מוטבע וגאומטריה; שמונה ההטמעות משורשרות לכל מיקום ומוקרנות לטוקן עמוד שדרה אחד. הפענוח פועל בכיוון ההפוך, עם הסרת רעש מקבילה מרחבית וראש אוטורגרסיבי מרובה ספרי קוד החוזה את שמונת הקודים לפי הסדר. עמוד השדרה הוא LLM דיפוזי דליל משושלת LLaDA-2.0, 16B סך הכל עם 1B פעילים.

• ממשק חזותי — PixelUMM: טלאי פיקסלים גולמיים וטיובלטים, ללא טוקנייזר כלל. InternLumina-U2: טוקנים בדידים לחלוטין משמונה ספרי קוד מ-AToken, ללא לטנט רציף.

• עמוד שדרה — PixelUMM: Qwen3-8B (15.2B סה"כ), מפענח צפוף יחיד עם מומחי הבנה ויצירה. InternLumina-U2: 16B סה"כ / 1B פעיל, מודל שפה דיפוזי MoE דליל.

• שיטת יצירה — PixelUMM: התאמת זרימה במרחב הפיקסלים בתוספת טקסט אוטורגרסיבי. InternLumina-U2: דנוס דיפוזיה ממוסכת על קודים בדידים.

• משימות מוצהרות — PixelUMM: טקסט לתמונה, טקסט לווידאו, תמונה לטקסט, וידאו לטקסט. InternLumina-U2: אלה בתוספת עריכת תמונות והבנה תלת-ממדית.

• פורמט משקלים — PixelUMM: 128 רסיסי .distcp (~30 GB) מאחורי אינדקס .metadata מוסתר. InternLumina-U2: שבעה רסיסי .safetensors לכל ערימת חומרה, פריסת Hugging Face סטנדרטית.

A generated scoreboard card titled “PixelUMM vs InternLumina-U2 — the scoreboard”, with the two model names as column headings and six dimension rows spanning both columns: visual interface, backbone, generation method, video understanding, weight format and licence. PixelUMM's column shows raw pixel patches and tubelets, a Qwen3-8B backbone at 15.2B, pixel-space flow matching, Video-MME 57.33 with MVBench 70.53, 128 distributed-checkpoint shards, and a noncommercial checkpoint licence; InternLumina-U2's column shows eight-codebook discrete AToken tokens, a 16B-A1B sparse MoE diffusion backbone, masked diffusion denoising, Video-MME 51.26 with MVBench 59.74, seven safetensors shards per hardware stack, and Apache-2.0. A footer notes that the figures are vendor-reported with no independent rerun.

לוח התוצאות, כשהיסטוריית המקור שלו מצורפת.

קרא כל שורה כטענה של המעבדה עצמה. הטענות של PixelUMM מגיעות מהפרפרינט שלה; הטענות של InternLumina-U2 הן תיאור של המעבדה עצמה אותן כ'ראשוניות, חלקיות', כאשר טבלאות ההשוואה המלאות מועברות לדוח טכני שטרם הופיע.

• MMMU (חשיבה חזותית) — PixelUMM 41.67 (של המחברים עצמם). InternLumina-U2: לא דווח.

• ChartQA — PixelUMM 82.96. InternLumina-U2 86.52.

• DocVQA — PixelUMM 90.42. InternLumina-U2: לא דווח.

• Video-MME (ללא כתוביות) — PixelUMM 57.33. InternLumina-U2 51.26.

• MVBench — PixelUMM 70.53. InternLumina-U2 59.74.

• GenEval בסך הכול — PixelUMM 0.83 עם משכתב פרומפטים מבוסס LLM, 0.77 בלעדיו. InternLumina-U2 0.81.

• DPG-Bench בסך הכול — PixelUMM 85.74. InternLumina-U2 87.10.

• יצירת וידאו — PixelUMM VBench חלק 1 איכות 84.10 / סמנטי 79.80, חלק 2 סה"כ 83.24. InternLumina-U2: לא דווח.

• הבנה תלת-ממדית — PixelUMM: אין משימה כזו. InternLumina-U2 מדווחת 3D MM-Vet 41.8.

ההשוואה אינה מאוזנת משום ששתי המעבדות מפרסמות טבלאות שונות, ולא משום שאחת מהן מנצחת. ל-PixelUMM יש מדור מלא ליצירת וידאו ואין בו עריכה או תלת-ממד; InternLumina-U2 טוענת לשש משפחות משימות ומדווחת על טבלה חלקית ביחס אליהן. מספרים בין-מעבדתיים על אותו שם מבחן אינם אותה מדידה — הפיצולים, הפרומפטים והדגימה שונים — לכן התייחסו לשורות ChartQA ו-GenEval כבערך באותה רמה ועצרו שם.

רישוי הוא הנקודה שבה זה מפסיק להיות תיקו.

זה החלק שאף טבלת בנצ'מרק לא מציגה. המאגר של PixelUMM הוא Apache-2.0, והכרטיס מציין זאת באופן בולט. ה-checkpoint הוא ארטיפקט נפרד תחת NVIDIA One-Way Noncommercial License, מוגבל למחקר או להערכה לא-מסחריים, וקובץ מקור אחד שומר בנוסף על הודעת CC BY-NC 4.0 שעברה בירושה מ-DiT. שימוש למחקר: בסדר. תכונת מוצר פנימית: שיחה עם המחלקה המשפטית, ואולי קצרה.

InternLumina-U2 הוא Apache-2.0 מקצה לקצה, הקוד ושתי נקודות הביקורת, ללא החרגה נפרדת לשימוש לא-מסחרי. עבור צוות שצריך להשיק מוצר, זה לא יתרון קטן — זו כל ההחלטה. שני המודלים הם ברמת מחקר מבחינת בגרות. רק אחד מהם אינו מוגבל בשימוש.

איזה מהם כדאי לנסות בפועל, ואיך

אם העבודה שלך היא הבנת וידאו, או שאתה רוצה מודל שמייצר וידאו ותמונות מאותה קבוצת משקלים, PixelUMM הוא הארטיפקט השלם יותר והמאמר שלו הוא הקריאה השימושית יותר — אבל זהו פרויקט מחקרי ברישיון לא־מסחרי, ולכן מקומו על ספסל הערכה, לא בתוך פייפליין. אם העבודה שלך היא רוחב בתחום התרשימים, המסמכים ויצירת התמונות, או שאתה צריך עריכה ותלת־ממד, InternLumina-U2 מכסה יותר שטח ואינו כבול בתקרת רישיון; המחיר שלו הוא שעמוד השדרה הדיפוזיוני 16B-A1B והטוקנייזר AToken משמעם הנדסת הגשה אמיתית, והמספרים שפורסמו שלו חלקיים באופן מפורש.

נכון למועד כתיבת שורות אלה, אף אחד מהם אינו זמין באף API מתארח, וזה כולל את OrcaRouter — איננו מנתבים אף אחד מהמודלים. כשזה ישתנה, הטיעון להגיע אליהם דרך שכבת ניתוב במקום באמצעות אינטגרציה ישירה הוא אותו טיעון שחל על כל מודל שזה עתה נפתח: מפתח אחד ליותר מ-200 מודלים, מחירי מחירון של הספקים מועברים הלאה בתוספת של 0%, ומעבר אוטומטי לגיבוי כך שמודל שמתברר כרע יותר מכפי שהציעה טבלת הספק שלו יכול להיות מורד בדרגה באמצעות שינוי נתיב במקום כתיבה מחדש של פריסה. עד אז, העצה הכנה היא המשעממת — הורידו את המודל שהרישיון שלו מתיר את מקרה השימוש שלכם, הריצו הערכה משלכם על הנתונים שלכם, ואל תתכננו לפי המספרים של אף אחת מהמעבדות עד שמישהו מחוץ למעבדה יריץ אותם מחדש.

מה ישנה את התשובה

שלושה דברים, לפי סדר ההשפעה. רישיון מסחרי על ה-checkpoint של PixelUMM יהפוך את ההשוואה לקרובה באמת ויעביר אותה מ"לקרוא את המאמר" ל"להעריך את המשקולות". דוח טכני מ-Shanghai AI Laboratory הנושא את טבלאות ההשוואה המלאות יהפוך את המספרים החלקיים של InternLumina-U2 למשהו שניתן לבדוק, וגם יחשוף כמה מרוחב שש המשימות הוא בשוויון לעומת בעומק טוקנים. והשחזור העצמאי הראשון של אחד מהמודלים — הרצה חוזרת של GenEval או MVBench על ידי צוות ללא אינטרס בתוצאה — הוא הרגע שבו אחד מאלה מפסיק להיות טבלת ספק. עד אז, האחד הוא ארכיטקטורה יוצאת דופן שרק ניתן ללמוד, והשני הוא ארכיטקטורה יוצאת דופן שאפשר לשגר.