
NVIDIA PixelUMM שוחרר ללא הודעה מוקדמת — המשקלים פשוט נחתו
- openaiחדשOpenAI: GPT-6.1 Sol2026-09-2952אינטליגנציה
- anthropicחדשAnthropic: Claude Sonnet 5.52026-09-2856אינטליגנציה
- typesafeחדשTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 לכל 1M טוקנים · 223 tok/s
- OpenAIחדשOpenAI: GPT-6 Luna2026-09-2238אינטליגנציה
- OpenAIחדשOpenAI: GPT-6 Sol2026-09-2248אינטליגנציה
- AnthropicחדשAnthropic: Claude Opus 5.52026-09-2258אינטליגנציה
- xAIחדשGrok 4.72026-09-2146אינטליגנציה
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 לכל 1M טוקנים · 124 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 לכל 1M טוקנים · 1148 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040אינטליגנציה
- OpenAIOpenAI: GPT-6 Astra2026-09-0453אינטליגנציה77כתיבת קוד
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241אינטליגנציה76כתיבת קוד
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245אינטליגנציה76כתיבת קוד
- AnthropicAnthropic: Claude Fable 5.12026-09-0153אינטליגנציה82כתיבת קוד
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 לכל 1M טוקנים · 48 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 לכל 1M טוקנים · 103 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642אינטליגנציה72כתיבת קוד
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 לכל 1M טוקנים · 212 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845אינטליגנציה75כתיבת קוד
- obsidianQwen3.8 27B2026-08-1534אינטליגנציה68כתיבת קוד
הדרך הקלה ביותר לגלות ש-NVIDIA בנתה מודל מולטימודלי מאוחד חדש היא לשים לב שאיש לא סיפר לך. המאגר nvidia/PixelUMM הופיע ב-Hugging Face ב-21:40 UTC ב-1 באוקטובר 2026, כשהוא נושא צ'קפוינט של 15.2 מיליארד פרמטרים שכל מערך השכבות המאומן שלו יושב על גבי Qwen3-8B כשלד — ולא היה פוסט בבלוג, לא הודעה לעיתונות, לא שקופית בנאום מרכזי ולא שרשור השקה שיתלוו אליו. חיפושים אחר השם לא מעלים דבר בבלוג של NVIDIA עצמה. מה שכן קיים הוא מאגר GitHub, עמוד פרויקט שה-URL שלו עצמו עדיין אומר "preview", מאמר מקדים ב-arXiv שמספרו 2609.38597, וצ'קפוינט שמפוצל על פני 128 קבצים עם אינדקס נסתר שהטוען מסרב לפעול בלעדיו. PixelUMM אמיתי וניתן להורדה היום. האם NVIDIA מחשיבה אותו כמשוחרר היא שאלה שהחברה לא השיבה עליה.
הפער הזה — בין ארטיפקט שקיים לבין ספק שלא אמר דבר — הוא כל הסיפור כאן, וכדאי להיות מדויקים לגבי באיזה צד שלו יושבת כל עובדה. כל מה שלהלן מגיע מהמאגר, מכרטיס המודל ומהמאמר שהמחברים עצמם פרסמו. שום דבר לא מגיע מהכרזה, כי לא הייתה כזו.
מה הופיע, ומתי
המסלול נמשך כארבעה שבועות, וכל חלק נחת בשקט.
• 4 בספטמבר 2026 — nv-tlabs/PixelUMM נוצר ב-GitHub תחת רישיון מאגר Apache-2.0, ומתואר בפשטות כ"הבנה ויצירה מאוחדות של תמונות ווידאו ללא מקודד". הוא נותר עם קומיט ראשוני בודד עד סוף ספטמבר.
• 28–29 בספטמבר 2026 — הקומיט הראשוני של המאגר נכנס, ו-arXiv מקצה לכתב היד המוקדם את המזהה arXiv:2609.38597, המתוארך ל-29 בספטמבר, ובו מפורטים מחברים מ-NVIDIA ומאוניברסיטת ווטרלו: Cong Wei, Xuanchi Ren, Bryan Chu, Weiming Ren, Huan Ling, Jiahui Huang, Laura Leal-Taixé, Sanja Fidler, Wenhu Chen, Zian Wang ו-Jay Zhangjie Wu.
• 1 באוקטובר 2026, 21:32 UTC — קומיט אחרון למאגר, שכותרתו "docs: add PixelUMM paper citation".
• 1 באוקטובר 2026, 21:40 UTC — מאגר המודלים של Hugging Face נוצר, שמונה דקות לאחר מכן, ומתמלא ברסיסי הצ׳קפוינט.
עמוד הפרויקט מתארח בנתיב שכתוב בו, פשוטו כמשמעו, pixelumm-project-page-preview, ולמאמר אין שורת מקום פרסום — לא CVPR, לא NeurIPS, ולא "התקבל ל־". ביחד, הרצף נקרא כמו צוות מחקר שמעלה לאוויר ארטיפקט של מאמר ומסתפק בכך שההעלאה ל-HF תשמש כהכרזה. זו תצפית על הראיות, לא טענה על כוונה: ייתכן בהחלט שלחברת NVIDIA יש השקה מתוכננת לשלב מאוחר יותר, ושום דבר כאן לא שולל זאת.

מהו PixelUMM בעצם
התזה העיצובית מנוסחת בשורה הראשונה של כרטיס המודל: אין VAE, אין מקודד חזותי. בעוד שמודל מאוחד קונבנציונלי נושא שני ממשקים חזותיים — שנאי חזותי שמפיק תכונות סמנטיות להבנה, ומקודד אוטומטי וריאציוני שמפיק לטנטים של שחזור ליצירה — PixelUMM אינו נושא אף אחד מהם. תמונות נחתכות לטלאים של 16×16 פיקסלים; סרטונים נחתכים לטובולטים מרחב-זמניים בני 4 פריימים; שניהם מגיעים לשלד הרשת דרך לא יותר מאשר הטלות ליניאריות חד-שכבתיות. פיקסלים גולמיים נכנסים; פיקסלים גולמיים יוצאים.
• ארכיטקטורה — Transformer מבוסס-מפענח בלבד עם הטמעות טלאים של פיקסלים גולמיים וראש יצירת פיקסלים איטרטיבי, המתואר במאמר כ-Mixture-of-Transformers המשלבת קשב משותף עם פרמטרים ייחודיים למשימה.
• Backbone — Qwen3-8B, מוצמד למהדורה b968826d9c46dd6066d109eabc6255188de91218. רק קובצי התצורה והטוקנייזר שלו נדרשים; הצ'קפוינט מכיל את משקולות השפה הנלמדות שלו.
• פרמטרים — 15,199,672,064 (בקירוב 15.2B), מוצג כ-"8B MoT" בטבלאות הבנצ'מרק של המאמר עצמו, שבהן סימון הגודל מונה בנפרד את עמוד השדרה ואת מומחה היצירה.
• מטרות — חיזוי טקסט אוטורגרסיבי והתאמת זרימה במרחב הפיקסלים, שאומנו במשותף, וזה מה שמאפשר למערכת משקלים אחת גם לענות על שאלה בנוגע לתמונה וגם לצייר תמונה חדשה.
• משימות — טקסט לתמונה, טקסט לווידאו ב-96 פריימים / 24 fps / 4 שניות, טקסט מותנה בתמונה, וטקסט מותנה בווידאו.
החלק האמפירי של המאמר יוצא דופן באופן שראוי לציין. שמונה מהפרקים שלו הם מחקרים של בחירות עיצוב ולא של מיקומים בלוח המובילים — גודל פאץ׳ תמונה, גודל פאץ׳ וידאו, ארטיפקטים של פאצ׳ים, דינמיקת אימון במרחב פיקסלים לעומת מרחב VAE, גודל מודל, סקיילינג מחשוב, התניית הקשר מולטימודלית, וממשקי הבנת וידאו. זהו מאמר שנכתב בידי אנשים שמנסים לענות על השאלה אם הגישה עובדת, ולא מאמר שמנסה לנצח בטבלה.
המספרים הם של המחברים עצמם
כל נתון להלן מדווח על ידי מחברי PixelUMM בפרסום המוקדם שלהם. אין שחזור עצמאי, אין Elo של זירה, ואין הערכה של צד שלישי, כי המודל בן שישה שבועות לכל היותר וקודם לכל מערכת בדיקה חיצונית. התייחסו לאלה כאל טענות עם קישור להורדה, ולא כביצועים מאומתים.
• הבנת תמונות — MMMU 41.67, MMStar 53.99, AI2D 80.12, DocVQA 90.42, ChartQA 82.96, OCRBench 78.00, BLINK 53.46, MMMU-Pro 27.63, לפי פרוטוקול LMMS-Eval הרשמי (64,750 יצירות על פני 21 משימות).
• הבנת וידאו — MVBench 70.53, Video-MME 57.33 ללא כתוביות, LongVideoBench 59.61, LVBench 40.41.
• יצירת תמונות — GenEval בציון כולל 0.83 עם משכתב פרומפטים מבוסס LLM, ו-0.77 בלעדיו; DPG-Bench בציון כולל 85.74.
• יצירת וידאו — ציון איכות 84.10 ב-VBench Part 1, ציון סמנטי 79.80; VBench Part 2 סך הכול 83.24.
הקריאה הכנה היא שאלה מספרים תחרותיים בתוך הקטגוריה, לא מובילים בקטגוריה, והמאמר עצמו אומר זאת: הוא מציין שמכיוון שנתוני האימון שונים בין מודלים, התוצאות "אינן יכולות לקבוע איזו ארכיטקטורה עדיפה". מול Qwen3-VL-8B הפער בהבנת תמונות גדול ב-MMMU (41.67 לעומת 69.60) וב-MMMU-Pro, שם המחברים לא מדווחים על נתון מתחרה. מול Qwen-Image 20B פער ה-GenEval הוא 0.83 עד 0.87. מה ש-PixelUMM אינו, לפי המספרים שלו עצמו, הוא מודל מתקדם ביותר. מה שהוא כן, לפי המספרים שלו עצמו, הוא מודל 15B עם ארכיטקטורה יוצאת דופן באמת שנמצאת באותו טווח כמו המערכות המתמחות שסביבו.
הקצה החד ביותר הוא הרישיון, לא הבנצ'מרק
המאגר הוא Apache-2.0 וכרטיס המודל מצהיר על כך בבירור. ה-checkpoint הוא ארטיפקט אחר עם תנאים שונים, וזה הפרט שסביר ביותר לתפוס צוות לא מוכן. המשקלים מופצים תחת רישיון NVIDIA One-Way Noncommercial, שהשימוש בו מוגבל למחקר או להערכה לא-מסחריים — היתר מחמיר באופן מהותי יותר מהקוד שלצידו. קובץ מקור אחד במאגר, modeling/pixelumm/modeling_utils.py, שומר בנוסף על הודעת CC BY-NC 4.0 הנגזרת מ-DiT.
עבור קבוצת מחקר, צוות הערכה או כל מי שמפרסם מאמר, זהו רישיון שמיש לחלוטין. עבור צוות מוצר שבונה אב־טיפוס לתכונה פנימית, זה הדבר הראשון שצריך להציג בפני המחלקה המשפטית, והתשובה עשויה להיות לא. מודל שאי אפשר לשחרר הוא סוג אחר של נכס ממודל שאפשר לשחרר, ושום מידת שוויון במדדי בנצ׳מרק לא תשנה זאת.

מה נדרש כדי להריץ את זה
זו אינה הורדה של סוף שבוע. תיעוד הסביבה דורש Linux x86-64, Python 3.12, ערכת פיתוח של CUDA 13.0, מעבד גרפי של NVIDIA, ו-FlashAttention שנבנה מהמקור מול אותה ערכה — תמונת CUDA של זמן ריצה בלבד לא תספיק. ה-checkpoint עצמו אינו קובץ model.safetensors: מדובר ב-128 פרגמנטים (shards) מסוג .distcp בנפח כולל של כ-30 GB, בתוספת אינדקס .metadata נסתר, והטוען (loader) דורש שכל פרגמנט מוזכר ואותו אינדקס יהיו נוכחים.
שני פרטים נוספים מעצבים את מה שאפשר לעשות איתו בפועל. ראשית, טקסט-לווידאו מפעיל כברירת מחדל את מנגנוני ההגנה (guardrails) של Cosmos, ואלה דורשים גישה למאגר המוגבל nvidia/Cosmos-1.0-Guardrail וכן סביבת Python שנייה עם גרסה ראשית שונה של Transformers — התחברות לבדה אינה פותחת את המשקולות. שנית, דוגמת האימון הצעצועית בת ארבעת השלבים, המתכון היחיד לאימון שפורסם, מתועדת כדורשת שבעה GPUs עם לפחות 48 GiB כל אחד וכ-61 GB של דיסק פנוי עבור הפלט. כיוונון עדין על תחנת עבודה אינו המסלול המיועד; הסקה על כרטיס מודרני בודד היא כן.
המאגר מכיל ארבעה צ'קפוינטים. S8-F22-R05 הוא ברירת המחדל וזה שבו נעשה שימוש בהערכת המאמר, והוא מכסה את כל ארבע המשימות. S8-F18-R01 עבר 10,000 צעדי כיוונון עדין נוספים ברזולוציות 480p ו-720p, ובדרך כלל מניב תוצאות מעט טובות יותר של טקסט לווידאו, אך הוא אינו יכול לבצע הבנת וידאו. S8-F19-R03 ו-S8-F21-R02 הם שלבי ביניים. הבחירה ביניהם היא החלטה אמיתית, לא פרט שולי.
מה שלא אושר
רשימה קצרה, והיא חשובה יותר מהארוכה שלמעלה.
• אין הודעה של NVIDIA. לא פורסמה הודעה לעיתונות ולא הופיע פוסט בבלוג של החברה עצמה עבור דגם זה במועד כתיבת שורות אלה. ייתכן שההשקה השקטה היא מכוונת — תוצרי מחקר לעתים יוצאים לאור בדרך זו — או שאולי ההשקה פשוט טרם התרחשה.
• אין הערכה בלתי תלויה. כל מספר במאמר זה הוא של המחברים עצמם. שום דבר לא הורץ מחדש מחוץ ל-NVIDIA ול-Waterloo.
• אין נתיב מתארח בשום מקום. לא ניתן לקרוא ל-PixelUMM דרך API היום, וזה כולל את OrcaRouter — אנחנו לא מנתבים אותו, ולא יכולים, מפני שצ'קפוינט עם רישיון לא מסחרי אינו משהו שפלטפורמת הגשה מסחרית יכולה להציע. כל מי שאומר לך אחרת מתאר הגדרת אירוח עצמי.
• אין עמדה מוצהרת לגבי רישוי עתידי. התנאים הלא-מסחריים הם התנאים כפי שסופקו. האם הם יוקלו אינו ידוע, ובהתחשב בהיסטוריה של NVIDIA עם נקודות ביקורת מחקריות, אין זה משהו שכדאי לתכנן לפיו.

למה לשים לב בהמשך
שלושה אירועים יהפכו את PixelUMM מארטיפקט מחקרי למשהו שקהל רחב יותר יכול להשתמש בו. הראשון הוא שינוי רישוי בצ׳קפוינט — הקובץ הבודד הזה הוא המחסום כולו בין "מעניין" ל"שמיש במוצר". השני הוא השקה רשמית של NVIDIA, שתבוא עם מסגור שהרפוזיטורי לא יכול לספק: לשם מה מיועד המודל, והאם זהו כיוון מוצרי או מאמר. השלישי הוא הרפרודוקציה העצמאית הראשונה, ככל הנראה הרצה חוזרת של GenEval או MVBench בידי מישהו עם אשכול GPU פנוי, וזה הרגע שבו המספרים של המחברים מפסיקים להיות המספרים היחידים.
עד אז, העמדה הנכונה היא זו שהראיות תומכות בה. PixelUMM קיים, הקוד והמאמר פומביים וקריאים, המשקלים ניתנים להורדה, ואף אחת מטענות הביצועים לא נבדקה על ידי מישהו מחוץ לצוות שהשמיע אותן. זו אינה ביקורת על העבודה — כך נראה שחרור מחקרי בן שישה שבועות. זה גם בדיוק המצב שבו שכבת ניתוב תצדיק את עצמה מאוחר יותר, אם הרישיון אי-פעם ייקל: מפתח אחד על פני המודלים שאתם כבר סומכים עליהם, מחירי מחירון מועברים הלאה בתוספת של 0%, ומנגנון מעבר-כשל שמאפשר לכם להפנות פרוסה מהתעבורה אל משהו לא מוכח בלי להמר על נתיב ייצור בגללו. אולם לעת עתה, הסיכום הכנה פשוט יותר. NVIDIA בנתה משהו יוצא דופן, פרסמה אותו ביסודיות ולא סיפרה לאיש. המאגר הוא ההכרזה.
