
PixelUMM לעומת InternLumina-U2: שתי גרסאות בטא ללא אנקודר, וההבדל היחיד שמכריע
- openaiחדשOpenAI: GPT-6.1 Sol2026-09-2952אינטליגנציה
- anthropicחדשAnthropic: Claude Sonnet 5.52026-09-2856אינטליגנציה
- typesafeחדשTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 לכל 1M טוקנים · 223 tok/s
- OpenAIחדשOpenAI: GPT-6 Luna2026-09-2238אינטליגנציה
- OpenAIחדשOpenAI: GPT-6 Sol2026-09-2248אינטליגנציה
- AnthropicחדשAnthropic: Claude Opus 5.52026-09-2258אינטליגנציה
- xAIחדשGrok 4.72026-09-2146אינטליגנציה
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 לכל 1M טוקנים · 124 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 לכל 1M טוקנים · 1148 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040אינטליגנציה
- OpenAIOpenAI: GPT-6 Astra2026-09-0453אינטליגנציה77כתיבת קוד
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241אינטליגנציה76כתיבת קוד
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245אינטליגנציה76כתיבת קוד
- AnthropicAnthropic: Claude Fable 5.12026-09-0153אינטליגנציה82כתיבת קוד
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 לכל 1M טוקנים · 48 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 לכל 1M טוקנים · 103 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642אינטליגנציה72כתיבת קוד
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 לכל 1M טוקנים · 212 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845אינטליגנציה75כתיבת קוד
- obsidianQwen3.8 27B2026-08-1534אינטליגנציה68כתיבת קוד
שני מודלים, שניהם ציבוריים, שניהם בעלי עיצוב יוצא דופן, ורק על אחד מהם ניתן לבנות מוצר. PixelUMM הוא המודל המאוחד נטול המקודד של NVIDIA — 15.2 מיליארד פרמטרים על שלד Qwen3-8B, קורא וכותב פיקסלים גולמיים דרך פאצ'ים בגודל 16×16 ו-tubelets של 4 פריימים, בלי VAE ובלי מקודד חזותי בשום מקום במערכת. InternLumina-U2 הוא מודל דיפוזיה מסוג mixture-of-experts בעל 16B של Shanghai AI Laboratory, שדוחס כל קלט חזותי לשמונה קודים בדידים משלימים דרך טוקנייזר בשם AToken. שניהם הימרו שהממשק החזותי הוא צוואר הבקבוק. ההימור שחשוב יותר הוא זה שבקבצי הרישיון: InternLumina-U2 מופץ עם משקולות Apache-2.0, ואילו PixelUMM מופץ עם צ'קפוינט תחת רישיון לא מסחרי. אם אתם בוחרים ביניהם למשהו מסחרי, המשפט הזה הוא כל ההשוואה, ושאר העמוד הזה הוא ההקשר עבורו.
שתי קבוצות הנתונים שלהלן מגיעות מהמעבדות עצמן. לאף אחד משני המודלים אין הערכה בלתי תלויה, דירוג Elo בזירה או שחזור על ידי צד שלישי. אף אחד מהשניים אינו מוגש באמצעות API מתארח כלשהו. מה ששונה הוא מה שמותר לך לעשות עם הארטיפקט לאחר שתוריד אותו, ועד כמה כל מהדורה באמת מתקדמת.
היכן כל אחד עומד כרגע
לוחות הזמנים של השחרור נעו במהירויות שונות, ושניהם בשקט.
• PixelUMM — מאגר GitHub נוצר ב-4 בספטמבר 2026; preprint של arXiv 2609.38597 מתאריך 29 בספטמבר 2026; מאגר המודל של Hugging Face נוצר ב-1 באוקטובר 2026 בשעה 21:40 UTC. לא צצו עבורו פוסט בבלוג של NVIDIA, הודעה לעיתונות או שרשור השקה.
• InternLumina-U2 — מאגר GitHub נוצר ב-1 בספטמבר 2026; סטאב Hugging Face נרשם באותו יום; משקלי נקודת ביקורת שאומנו על Ascend נוספו ב-10 בספטמבר 2026; משקלי נקודת ביקורת של NVIDIA/CUDA נוספו ב-24 בספטמבר 2026. שבעה שרדים לכל מחסנית, שניהם ניתנים להורדה היום.
ה-InternLumina-U2 שהיה קיים בתחילת ספטמבר — קוד בלבד, משקלים "בקרוב", מאגר מודל ריק — אינו ה-InternLumina-U2 שקיים כעת. כל מי שקרא עליו בראשית החודש והסיק שהמשקלים חסרים צריך לבדוק שוב; גם הצ'קפוינטים של Huawei Ascend וגם של NVIDIA/CUDA זמינים, תחת Apache-2.0, עם טוקנייזר, קונפיגורציה, תבנית צ'אט וקוד מידול מרחוק לצידם.

שתי תשובות לאותה שאלה
שני המודלים יוצאים מאותה תלונה: נשיאת מקודד ראייה להבנה ו VAE ליצירה פירושה ייצוג כל תמונה פעמיים, בערך מכפיל את ההקשר החזותי ומאלץ צינור אימון לתחזק שני ממשקים.
התשובה של PixelUMM היא למחוק את שניהם. פיקסלים גולמיים נכנסים ישירות דרך היטלים ליניאריים חד-שכבתיים — patch בגודל 16×16 לכל מיקום בתמונה, tubelet של 4 פריימים לכל מיקום בווידאו — ועמוד השדרה הוא Transformer מסוג decoder-only, שתכנון ה-Mixture-of-Transformers שלו משלב קשב משותף עם פרמטרים ייעודיים למשימה. את הטקסט חוזים באופן אוטורגרסיבי; את הפיקסלים חוזים באמצעות flow matching. המאמר מקדיש שמונה פרקים למחקרי עיצוב — גודל patch, ארטיפקטים של patch, דינמיקה במרחב פיקסלים לעומת מרחב VAE, סקיילינג חישובי — מה שאומר לך שהשאלה האמיתית של הצוות הייתה אם הפרדיגמה בכלל מחזיקה.
התשובה של InternLumina-U2 היא לשמור על ממשק בדיד אך לגרום לכל טוקן לשאת הרבה יותר. הטוקנייזר AToken מתאר כל מיקום חזותי באמצעות שמונה ספרי קוד משלימים המכסים מרקם, טקסט מוטבע וגאומטריה; שמונה ההטמעות משורשרות לכל מיקום ומוקרנות לטוקן עמוד שדרה אחד. הפענוח פועל בכיוון ההפוך, עם הסרת רעש מקבילה מרחבית וראש אוטורגרסיבי מרובה ספרי קוד החוזה את שמונת הקודים לפי הסדר. עמוד השדרה הוא LLM דיפוזי דליל משושלת LLaDA-2.0, 16B סך הכל עם 1B פעילים.
• ממשק חזותי — PixelUMM: טלאי פיקסלים גולמיים וטיובלטים, ללא טוקנייזר כלל. InternLumina-U2: טוקנים בדידים לחלוטין משמונה ספרי קוד מ-AToken, ללא לטנט רציף.
• עמוד שדרה — PixelUMM: Qwen3-8B (15.2B סה"כ), מפענח צפוף יחיד עם מומחי הבנה ויצירה. InternLumina-U2: 16B סה"כ / 1B פעיל, מודל שפה דיפוזי MoE דליל.
• שיטת יצירה — PixelUMM: התאמת זרימה במרחב הפיקסלים בתוספת טקסט אוטורגרסיבי. InternLumina-U2: דנוס דיפוזיה ממוסכת על קודים בדידים.
• משימות מוצהרות — PixelUMM: טקסט לתמונה, טקסט לווידאו, תמונה לטקסט, וידאו לטקסט. InternLumina-U2: אלה בתוספת עריכת תמונות והבנה תלת-ממדית.
• פורמט משקלים — PixelUMM: 128 רסיסי .distcp (~30 GB) מאחורי אינדקס .metadata מוסתר. InternLumina-U2: שבעה רסיסי .safetensors לכל ערימת חומרה, פריסת Hugging Face סטנדרטית.

לוח התוצאות, כשהיסטוריית המקור שלו מצורפת.
קרא כל שורה כטענה של המעבדה עצמה. הטענות של PixelUMM מגיעות מהפרפרינט שלה; הטענות של InternLumina-U2 הן תיאור של המעבדה עצמה אותן כ'ראשוניות, חלקיות', כאשר טבלאות ההשוואה המלאות מועברות לדוח טכני שטרם הופיע.
• MMMU (חשיבה חזותית) — PixelUMM 41.67 (של המחברים עצמם). InternLumina-U2: לא דווח.
• ChartQA — PixelUMM 82.96. InternLumina-U2 86.52.
• DocVQA — PixelUMM 90.42. InternLumina-U2: לא דווח.
• Video-MME (ללא כתוביות) — PixelUMM 57.33. InternLumina-U2 51.26.
• MVBench — PixelUMM 70.53. InternLumina-U2 59.74.
• GenEval בסך הכול — PixelUMM 0.83 עם משכתב פרומפטים מבוסס LLM, 0.77 בלעדיו. InternLumina-U2 0.81.
• DPG-Bench בסך הכול — PixelUMM 85.74. InternLumina-U2 87.10.
• יצירת וידאו — PixelUMM VBench חלק 1 איכות 84.10 / סמנטי 79.80, חלק 2 סה"כ 83.24. InternLumina-U2: לא דווח.
• הבנה תלת-ממדית — PixelUMM: אין משימה כזו. InternLumina-U2 מדווחת 3D MM-Vet 41.8.
ההשוואה אינה מאוזנת משום ששתי המעבדות מפרסמות טבלאות שונות, ולא משום שאחת מהן מנצחת. ל-PixelUMM יש מדור מלא ליצירת וידאו ואין בו עריכה או תלת-ממד; InternLumina-U2 טוענת לשש משפחות משימות ומדווחת על טבלה חלקית ביחס אליהן. מספרים בין-מעבדתיים על אותו שם מבחן אינם אותה מדידה — הפיצולים, הפרומפטים והדגימה שונים — לכן התייחסו לשורות ChartQA ו-GenEval כבערך באותה רמה ועצרו שם.
רישוי הוא הנקודה שבה זה מפסיק להיות תיקו.
זה החלק שאף טבלת בנצ'מרק לא מציגה. המאגר של PixelUMM הוא Apache-2.0, והכרטיס מציין זאת באופן בולט. ה-checkpoint הוא ארטיפקט נפרד תחת NVIDIA One-Way Noncommercial License, מוגבל למחקר או להערכה לא-מסחריים, וקובץ מקור אחד שומר בנוסף על הודעת CC BY-NC 4.0 שעברה בירושה מ-DiT. שימוש למחקר: בסדר. תכונת מוצר פנימית: שיחה עם המחלקה המשפטית, ואולי קצרה.
InternLumina-U2 הוא Apache-2.0 מקצה לקצה, הקוד ושתי נקודות הביקורת, ללא החרגה נפרדת לשימוש לא-מסחרי. עבור צוות שצריך להשיק מוצר, זה לא יתרון קטן — זו כל ההחלטה. שני המודלים הם ברמת מחקר מבחינת בגרות. רק אחד מהם אינו מוגבל בשימוש.
איזה מהם כדאי לנסות בפועל, ואיך
אם העבודה שלך היא הבנת וידאו, או שאתה רוצה מודל שמייצר וידאו ותמונות מאותה קבוצת משקלים, PixelUMM הוא הארטיפקט השלם יותר והמאמר שלו הוא הקריאה השימושית יותר — אבל זהו פרויקט מחקרי ברישיון לא־מסחרי, ולכן מקומו על ספסל הערכה, לא בתוך פייפליין. אם העבודה שלך היא רוחב בתחום התרשימים, המסמכים ויצירת התמונות, או שאתה צריך עריכה ותלת־ממד, InternLumina-U2 מכסה יותר שטח ואינו כבול בתקרת רישיון; המחיר שלו הוא שעמוד השדרה הדיפוזיוני 16B-A1B והטוקנייזר AToken משמעם הנדסת הגשה אמיתית, והמספרים שפורסמו שלו חלקיים באופן מפורש.
נכון למועד כתיבת שורות אלה, אף אחד מהם אינו זמין באף API מתארח, וזה כולל את OrcaRouter — איננו מנתבים אף אחד מהמודלים. כשזה ישתנה, הטיעון להגיע אליהם דרך שכבת ניתוב במקום באמצעות אינטגרציה ישירה הוא אותו טיעון שחל על כל מודל שזה עתה נפתח: מפתח אחד ליותר מ-200 מודלים, מחירי מחירון של הספקים מועברים הלאה בתוספת של 0%, ומעבר אוטומטי לגיבוי כך שמודל שמתברר כרע יותר מכפי שהציעה טבלת הספק שלו יכול להיות מורד בדרגה באמצעות שינוי נתיב במקום כתיבה מחדש של פריסה. עד אז, העצה הכנה היא המשעממת — הורידו את המודל שהרישיון שלו מתיר את מקרה השימוש שלכם, הריצו הערכה משלכם על הנתונים שלכם, ואל תתכננו לפי המספרים של אף אחת מהמעבדות עד שמישהו מחוץ למעבדה יריץ אותם מחדש.
מה ישנה את התשובה
שלושה דברים, לפי סדר ההשפעה. רישיון מסחרי על ה-checkpoint של PixelUMM יהפוך את ההשוואה לקרובה באמת ויעביר אותה מ"לקרוא את המאמר" ל"להעריך את המשקולות". דוח טכני מ-Shanghai AI Laboratory הנושא את טבלאות ההשוואה המלאות יהפוך את המספרים החלקיים של InternLumina-U2 למשהו שניתן לבדוק, וגם יחשוף כמה מרוחב שש המשימות הוא בשוויון לעומת בעומק טוקנים. והשחזור העצמאי הראשון של אחד מהמודלים — הרצה חוזרת של GenEval או MVBench על ידי צוות ללא אינטרס בתוצאה — הוא הרגע שבו אחד מאלה מפסיק להיות טבלת ספק. עד אז, האחד הוא ארכיטקטורה יוצאת דופן שרק ניתן ללמוד, והשני הוא ארכיטקטורה יוצאת דופן שאפשר לשגר.
