
طُرح NVIDIA PixelUMM دون إعلان — وصلت الأوزان للتو
- openaiجديدOpenAI: GPT-6.1 Sol2026-09-2952الذكاء
- anthropicجديدAnthropic: Claude Sonnet 5.52026-09-2856الذكاء
- typesafeجديدTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 لكل مليون رمز · 223 tok/s
- OpenAIجديدOpenAI: GPT-6 Luna2026-09-2238الذكاء
- OpenAIجديدOpenAI: GPT-6 Sol2026-09-2248الذكاء
- AnthropicجديدAnthropic: Claude Opus 5.52026-09-2258الذكاء
- xAIجديدGrok 4.72026-09-2146الذكاء
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 لكل مليون رمز · 124 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 لكل مليون رمز · 1148 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040الذكاء
- OpenAIOpenAI: GPT-6 Astra2026-09-0453الذكاء77البرمجة
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241الذكاء76البرمجة
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245الذكاء76البرمجة
- AnthropicAnthropic: Claude Fable 5.12026-09-0153الذكاء82البرمجة
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 لكل مليون رمز · 48 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 لكل مليون رمز · 103 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642الذكاء72البرمجة
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 لكل مليون رمز · 212 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845الذكاء75البرمجة
- obsidianQwen3.8 27B2026-08-1534الذكاء68البرمجة
أسهل طريقة لمعرفة أن NVIDIA أنشأت نموذجًا موحدًا جديدًا متعدد الوسائط هي أن تلاحظ أن لا أحد أخبرك. nvidia/PixelUMM، وهو مستودع ظهر على Hugging Face في الساعة 21:40 UTC يوم 1 أكتوبر 2026، حاملًا نقطة تفتيش بـ15.2 مليار معامل يقع كامل مكدسه المُتعلَّم فوق Qwen3-8B كعمود فقري — ولم يكن هناك منشور مدونة، ولا بيان صحفي، ولا شريحة كلمة رئيسية، ولا سلسلة إطلاق ترافقه. لا تُظهر عمليات البحث عن الاسم شيئًا على مدونة NVIDIA نفسها. ما يوجد بدلًا من ذلك هو مستودع GitHub، وصفحة مشروع لا يزال رابطها نفسه يقول "preview"، ونسخة arXiv أولية برقم 2609.38597، ونقطة تفتيش مقسمة عبر 128 ملفًا مع فهرس مخفي يرفض المُحمِّل تشغيلها بدونه. PixelUMM حقيقي وقابل للتنزيل اليوم. أما ما إذا كانت NVIDIA تعتبره مُصدَرًا فهو سؤال لم تجب عليه الشركة.
تلك الفجوة — بين أثر موجود وجهة موردة لم تقل شيئًا — هي القصة كلها هنا، ويجدر بنا أن نكون دقيقين بشأن أي جانب منها تقع عليه كل حقيقة. كل ما يلي يأتي من المستودع، وبطاقة النموذج، والورقة البحثية التي نشرها المؤلفون أنفسهم. ولا شيء منه يأتي من إعلان، لأنه لم يكن هناك أي إعلان.
ما الذي ظهر، ومتى؟
يستمر المسار حوالي أربعة أسابيع، وقد استقرت كل قطعة بهدوء.
• 4 سبتمبر 2026 — تم إنشاء nv-tlabs/PixelUMM على GitHub بموجب ترخيص Apache-2.0 للمستودع، الموصوف ببساطة بأنه "فهم وتوليد موحد للصور والفيديو بدون مُشفِّر". يبقى مع التزام أولي واحد حتى نهاية سبتمبر.
• 28–29 سبتمبر 2026 — يُسجَّل أول إيداع في المستودع، وتمنح arXiv النسخة الأولية الرقم arXiv:2609.38597، المؤرخة في 29 سبتمبر، وتضم مؤلفين من NVIDIA وجامعة واترلو: Cong Wei، Xuanchi Ren، Bryan Chu، Weiming Ren، Huan Ling، Jiahui Huang، Laura Leal-Taixé، Sanja Fidler، Wenhu Chen، Zian Wang و Jay Zhangjie Wu.
• 1 أكتوبر 2026، 21:32 UTC — إيداع نهائي في المستودع بعنوان "docs: add PixelUMM paper citation".
• 1 أكتوبر 2026، 21:40 UTC — يُنشأ مستودع النموذج على Hugging Face بعد ثماني دقائق، ويُملأ بأجزاء نقطة التحقق.
صفحة المشروع مستضافة على مسار يُقرأ حرفيًا باسم pixelumm-project-page-preview، ولا تحمل الورقة أي سطر مكان نشر — لا CVPR، ولا NeurIPS، ولا عبارة «accepted to». وإذا جُمعت معًا، يُقرأ التسلسل وكأن فريقًا بحثيًا يدفع أرتيفاكت ورقة بحثية إلى العلن ويترك رفع HF يكون الإعلان. هذه ملاحظة عن الأدلة، لا ادعاء بشأن النية: فقد يكون لدى NVIDIA إطلاق مخطط له لاحقًا، ولا شيء هنا يستبعد ذلك.

ما هو PixelUMM حقًا
تُطرح أطروحة التصميم في السطر الأول من بطاقة النموذج: لا VAE، ولا مُرمِّز رؤية. فبينما يحمل نموذج موحّد تقليدي واجهتين بصريتين — محوّل رؤية ينتج سمات دلالية للفهم، ومُشفّر تلقائي تبايني ينتج كوامن إعادة البناء للتوليد — فإن PixelUMM لا يحمل أيًّا منهما. تُقطَّع الصور إلى رقع بكسلية 16×16؛ وتُقطَّع الفيديوهات إلى أنبوبيات زمكانية من 4 إطارات؛ ويصل كلاهما إلى العمود الفقري عبر لا شيء سوى إسقاطات خطية أحادية الطبقة. تدخل البكسلات الخام؛ وتخرج البكسلات الخام.
• البنية — محوّل يعتمد على فك الترميز فقط، مزوّد بتضمينات رقع من البكسلات الخام ورأس توليد بكسل تكراري، ويوصف في الورقة البحثية بأنه Mixture-of-Transformers يجمع بين انتباه مشترك ومعاملات خاصة بالمهمة.
• العمود الفقري — Qwen3-8B، مثبّت على المراجعة b968826d9c46dd6066d109eabc6255188de91218. لا حاجة إلا إلى ملفات التكوين والمُرمِّز الخاصة به؛ إذ تحمل نقطة الحفظ أوزانها اللغوية المتعلّمة.
• المعاملات — 15,199,672,064 (نحو 15.2 مليار)، مكتوبة بصيغة "8B MoT" في جداول القياس المرجعية الخاصة بالورقة البحثية نفسها، حيث يحسب تدوين الحجم الشبكة الأساسية وخبير التوليد بشكل منفصل.
• الأهداف — التنبؤ النصي الانحداري الذاتي ومطابقة التدفق في الفضاء البكسلي، يُدرَّبان بشكل مشترك، وهو ما يسمح لمجموعة واحدة من الأوزان بالإجابة عن سؤال يتعلق بصورة ورسم صورة جديدة.
• المهام — من النص إلى الصورة، ومن النص إلى الفيديو بمعدل 96 إطارًا / 24 إطارًا في الثانية / 4 ثوانٍ، والنص المشروط بالصورة، والنص المشروط بالفيديو.
القسم التجريبي في الورقة غير معتاد على نحو يستحق التنبيه. ثمانية من أقسامه دراسات لخيارات التصميم بدلًا من مراتب في لوحة المتصدرين — حجم رقعة الصورة، وحجم رقعة الفيديو، وتشوهات الرقع، وديناميكيات التدريب في فضاء البكسل مقابل فضاء VAE، وحجم النموذج، وتحجيم الحوسبة، والتكييف بالسياق متعدد الوسائط، وواجهات فهم الفيديو. هذه ورقة كتبها أشخاص يحاولون الإجابة عمّا إذا كان النهج يعمل، لا ورقة يحاول أصحابها الفوز بجدول.
الأرقام هي أرقام المؤلفين أنفسهم
كل رقم أدناه يذكره مؤلفو PixelUMM في مسودتهم البحثية الخاصة. لا توجد إعادة إنتاج مستقلة، ولا تصنيف إيلو في أي ساحة، ولا تقييم من طرف ثالث، لأن عمر النموذج ستة أسابيع على الأكثر، وهو يسبق أي أداة اختبار خارجية. تعامل مع هذه على أنها ادعاءات مرفقة برابط تنزيل، لا على أنها أداء مُتحقَّق منه.
• فهم الصور — MMMU 41.67، MMStar 53.99، AI2D 80.12، DocVQA 90.42، ChartQA 82.96، OCRBench 78.00، BLINK 53.46، MMMU-Pro 27.63، وفق بروتوكول LMMS-Eval الرسمي (64,750 توليدًا عبر 21 مهمة).
• فهم الفيديو — MVBench 70.53، Video-MME 57.33 بدون ترجمات، LongVideoBench 59.61، LVBench 40.41.
• توليد الصور — النتيجة الإجمالية في GenEval 0.83 مع مُعيد صياغة أوامر يعمل بنموذج لغوي كبير، و0.77 بدونه؛ والنتيجة الإجمالية في DPG-Bench 85.74.
• توليد الفيديو — درجة الجودة في الجزء الأول من VBench 84.10، ودرجة الدلالة الدلالية 79.80؛ إجمالي الجزء الثاني من VBench 83.24.
القراءة الصادقة هي أن هذه أرقام تنافسية ضمن فئتها، وليست أرقامًا رائدة في فئتها، والورقة تقول ذلك بنفسها: فهي تشير إلى أنه نظرًا لاختلاف بيانات التدريب بين النماذج، فإن النتائج "لا يمكن أن تحدد أي بنية متفوقة". مقابل Qwen3-VL-8B، فإن فجوة فهم الصور كبيرة في MMMU (41.67 مقابل 69.60) وفي MMMU-Pro حيث لا يقدم المؤلفون رقمًا منافسًا. مقابل Qwen-Image 20B، فإن فجوة GenEval هي 0.83 إلى 0.87. ما ليس عليه PixelUMM، وفقًا لأرقامه الخاصة، هو نموذج متطور للغاية. ما هو عليه، وفقًا لأرقامه الخاصة، هو نموذج 15B ببنية غير عادية حقًا، ويقع في نفس النطاق الذي تقع فيه الأنظمة المتخصصة من حوله.
الميزة الأكثر حِدّة هي الترخيص، وليس المعيار المرجعي.
المستودع مرخّص بموجب Apache-2.0، وبطاقة النموذج تُعلن ذلك بوضوح. أما نقطة التحقق فهي مُخرَج مختلف بشروط مختلفة، وهذا هو التفصيل الأرجح أن يُفاجئ به فريقٌ ما. تُوزَّع الأوزان بموجب NVIDIA One-Way Noncommercial License، الذي يقتصر استخدامه على البحث أو التقييم غير التجاريين — وهو منح أضيق جوهريًا من الكود المجاور له. ويحتفظ أيضًا ملف مصدري واحد في المستودع، modeling/pixelumm/modeling_utils.py، بإشعار CC BY-NC 4.0 مشتق من DiT.
بالنسبة إلى مجموعة بحثية أو فريق تقييم أو أي شخص ينشر ورقة بحثية، هذا ترخيص قابل للاستخدام تمامًا. أما بالنسبة إلى فريق منتج يضع نموذجًا أوليًا لميزة داخلية، فهو أول ما يُعرض على القسم القانوني، وقد تكون الإجابة لا. النموذج الذي لا يمكنك طرحه أصل من نوع مختلف عن النموذج الذي يمكنك طرحه، ولا يغيّر ذلك أي قدر من التكافؤ في الاختبارات المعيارية.

ما الذي يتطلبه تشغيله
هذا ليس تنزيلًا يمكن إنجازه في عطلة نهاية الأسبوع. توثيق البيئة يطلب Linux x86-64، وPython 3.12، ومجموعة أدوات تطوير CUDA 13.0، ووحدة معالجة رسومات من NVIDIA، وFlashAttention مبنية من المصدر مقابل تلك المجموعة — لن تكفي صورة CUDA المخصّصة للتشغيل فقط. النقطة المرجعية (checkpoint) نفسها ليست ملف model.safetensors: بل هي 128 جزءًا من نوع .distcp يبلغ مجموعها نحو 30 جيجابايت، إضافة إلى فهرس .metadata مخفي، ويشترط المُحمِّل وجود كل جزء مُشار إليه وهذا الفهرس.
هناك تفصيلان إضافيان يشكّلان ما يمكنك فعله به فعليًا. أولًا، يعمل تحويل النص إلى فيديو مع حواجز حماية Cosmos افتراضيًا، وتحتاج هذه إلى الوصول إلى مستودع nvidia/Cosmos-1.0-Guardrail المقيّد بالإضافة إلى بيئة Python ثانية بإصدار رئيسي مختلف من Transformers — ولا يكفي تسجيل الدخول وحده لفتح الأوزان. ثانيًا، مثال التدريب التجريبي ذو الخطوات الأربع، وهو وصفة التدريب الوحيدة المنشورة، موثّق بأنه يحتاج إلى سبع وحدات GPUs بما لا يقل عن 48 GiB لكل منها وحوالي 61 GB من مساحة القرص الحرة للمخرجات. الضبط الدقيق على محطة عمل ليس المسار المقصود؛ بل الاستدلال على بطاقة حديثة واحدة.
يتضمن المستودع أربع نقاط تفتيش. S8-F22-R05 هو الافتراضي والمستخدم في تقييم الورقة البحثية، ويغطي المهام الأربع كلها. خضع S8-F18-R01 إلى 10,000 خطوة ضبط دقيق إضافية عند 480p و720p، وهو يعطي عموماً نتائج أفضل قليلاً في تحويل النص إلى فيديو، لكنه لا يستطيع أداء فهم الفيديو. S8-F19-R03 وS8-F21-R02 مرحلتان وسيطتان. الاختيار بينها قرار حقيقي، وليس تفصيلاً.
ما الذي لم يتم تأكيده؟
قائمة قصيرة، وهي أهم من القائمة الطويلة الواردة أعلاه.
• لا يوجد إعلان من NVIDIA. لم يظهر أي بيان صحفي ولا أي منشور على مدونة الشركة نفسها لهذا النموذج وقت كتابة هذا النص. قد يكون الطرح الهادئ متعمدًا — فغالبًا ما تُطلق المخرجات البحثية بهذه الطريقة — أو ربما لم يحدث الإطلاق بعد ببساطة.
• لا يوجد تقييم مستقل.كل رقم في هذه المقالة مأخوذ من المؤلفين أنفسهم. لم تتم إعادة تشغيل أي شيء خارج NVIDIA وWaterloo.
• لا يوجد مسار مستضاف في أي مكان. لا يمكنك استدعاء PixelUMM عبر واجهة API اليوم، وهذا يشمل OrcaRouter — نحن لا نوجّهه، ولا يمكننا ذلك، لأن نقطة تحقق مرخّصة بترخيص غير تجاري ليست شيئًا يمكن لمنصة تقديم تجارية أن تقدّمه. أي شخص يخبرك بخلاف ذلك فهو يصف إعدادًا مستضافًا ذاتيًا.
• لا يوجد موقف معلن بشأن التراخيص المستقبلية. الشروط غير التجارية هي الشروط كما تم إصدارها. وما إذا كانت ستُخفَّف غير معروف، وبالنظر إلى تاريخ NVIDIA مع نقاط التحقق البحثية، فليس أمرًا يمكن التخطيط على أساسه.

ما الذي يجب الانتباه إليه تالياً
ثلاثة أحداث ستحوّل PixelUMM من نتاج بحثي إلى شيء يمكن لجمهور أوسع استخدامه. الأول هو تغيير في ترخيص نقطة الحفظ — ذلك الملف الواحد هو الحاجز الكامل بين «المثير للاهتمام» و«القابل للاستخدام في منتج». الثاني هو إطلاق رسمي من NVIDIA، سيأتي مصحوبًا بتأطير لا يستطيع المستودع تقديمه: ما الغرض من النموذج، وهل هو اتجاه لمنتج أم ورقة بحثية. الثالث هو أول إعادة إنتاج مستقلة، وعلى الأرجح إعادة تشغيل لـ GenEval أو MVBench من شخص لديه عنقود GPU فائض، وهي اللحظة التي تتوقف فيها أرقام المؤلفين عن كونها الأرقام الوحيدة.
حتى ذلك الحين، الموقف الصحيح هو الذي يدعمه الدليل. فـ PixelUMM موجود، والشيفرة والورقة البحثية متاحتان للعموم ويمكن قراءتهما، والأوزان قابلة للتنزيل، ولم يتحقق أي شخص خارج الفريق الذي قدّمها من أي من ادعاءات الأداء. هذا ليس انتقادًا للعمل — بل هكذا يبدو إصدار بحثي عمره ستة أسابيع. وهو أيضًا بالضبط الوضع الذي تجني فيه طبقة توجيه فائدتها لاحقًا، إذا خفّت شروط الترخيص يومًا: مفتاح واحد عبر النماذج التي تثق بها بالفعل، وأسعار القائمة تمرّ دون أي هامش ربحي، وتجاوز للفشل يتيح لك توجيه شريحة من الحركة إلى شيء غير مُثبت دون المراهنة بمسار إنتاجي عليه. أما الآن، فالخلاصة الصادقة أبسط. بنت NVIDIA شيئًا غير معتاد، ونشرته بشكل وافٍ ولم تخبر أحدًا. المستودع هو الإعلان.
