بطاقة عنوان مُولَّدة بأسلوب OrcaRouter تحمل نص «PixelUMM vs InternLumina-U2»، مع أربع بلاطات إحصائية: «41.67 / 57.33» (PixelUMM MMMU وVideo-MME)، و«0.81 / 51.26» (InternLumina-U2 GenEval وVideo-MME)، و«Apache-2.0» (كود InternLumina-U2 وكلا نقطتي التحقق)، و«1-way NC» (ترخيص نقطة تحقق PixelUMM). ويقرأ سطر تذييل: «أرقام مُبلَّغ عنها من المورّد؛ لا إعادة تشغيل مستقلة لأي من النموذجين». وشعار OrcaRouter مُركَّب في الشريط المبطَّن أسفل اليمين.
Guides & Insights

PixelUMM مقابل InternLumina-U2: إصداران تجريبيان خاليان من المُرمِّز، والفرق الوحيد الذي يحسم الأمر

الكاتب

Elias Hawthorne

تاريخ النشر

أحدث النماذج · 20عرض جميع النماذج →
المعايير: Artificial Analysis · يُحدَّث يوميًا
العودة إلى جميع المقالات

نموذجان، كلاهما عامّان، وكلاهما مصمَّمان على نحو غير معتاد، وواحد فقط منهما يمكنك بناء منتج عليه. PixelUMM هو نموذج NVIDIA الموحَّد الخالي من مُرمِّز — 15.2 مليار معامل على بنية Qwen3-8B الأساسية، يقرأ ويكتب البكسلات الخام عبر رقع 16×16 ووحدات أنبوبية من 4 إطارات، دون أي VAE ودون أي مُرمِّز رؤية في أي موضع من المنظومة. InternLumina-U2 هو نموذج انتشار قائم على مزيج الخبراء بحجم 16B من مختبر شنغهاي للذكاء الاصطناعي، يضغط كل مدخل بصري إلى ثماني شيفرات منفصلة تكميلية عبر مُرمِّز رموز يُسمى AToken. راهن كلاهما على أن الواجهة البصرية هي عنق الزجاجة. الرهان الذي يهم أكثر هو الموجود في ملفات الترخيص: يأتي InternLumina-U2 بأوزان Apache-2.0، بينما يأتي PixelUMM بنقطة تفتيش بموجب ترخيص غير تجاري. إذا كنت تختار بينهما لأي غرض تجاري، فإن تلك الجملة هي المقارنة بأكملها، وباقي هذه الصفحة سياق لها.

كلتا مجموعتي الأرقام الواردتين أدناه تأتيان من المختبرات نفسها. لا يمتلك أيٌّ من النموذجين تقييمًا مستقلًا، أو تصنيف Elo في الساحة، أو إعادة إنتاج من طرف ثالث. ولا يُقدَّم أيٌّ منهما عبر أي واجهة برمجة تطبيقات مُستضافة. ما يختلف هو ما يُسمح لك بفعله بالمُخرَج بعد تنزيله، ومدى تقدّم كل إصدار فعليًا.

أين يقف كل واحد الآن

لقد تحرّكت الجداول الزمنية للإصدار بسرعات متفاوتة، وكلاهما بهدوء.

• PixelUMM — أُنشئ مستودع GitHub في 4 سبتمبر 2026؛ ومنشور arXiv المسبق 2609.38597 بتاريخ 29 سبتمبر 2026؛ وأُنشئ مستودع نموذج Hugging Face في 1 أكتوبر 2026 الساعة 21:40 بالتوقيت العالمي المنسق. لم يظهر له أي منشور مدونة أو بيان صحفي أو سلسلة إطلاق من NVIDIA.

• InternLumina-U2 — مستودع GitHub أُنشئ في 1 سبتمبر 2026؛ سُجّل الهيكل المبدئي على Hugging Face في اليوم نفسه؛ أُضيفت أوزان نقاط التحقق المدرّبة على Ascend في 10 سبتمبر 2026؛ أُضيفت أوزان نقاط التحقق الخاصة بـ NVIDIA/CUDA في 24 سبتمبر 2026. سبع شظايا لكل حزمة، وكلتاهما قابلتان للتنزيل اليوم.

إن InternLumina-U2 الذي كان موجودًا في أوائل سبتمبر — شيفرة فقط، والأوزان "قريبًا"، ومستودع نماذج فارغ — ليس هو InternLumina-U2 الموجود الآن. أي شخص قرأ عنه في بداية الشهر واستنتج أن الأوزان مفقودة عليه أن يعيد التحقق؛ فنقطتا فحص Huawei Ascend وNVIDIA/CUDA متاحتان الآن، بموجب Apache-2.0، مع المُجزِّئ اللغوي والإعدادات وقالب المحادثة وشيفرة النمذجة عن بُعد إلى جانبهما.

A headless-browser capture of the Hugging Face model card for the InternLumina-U2 repository, showing the model title, the Apache-2.0 licence tag, and the repository's download and like counters alongside the file listing for the checkpoint shards.

إجابتان على نفس السؤال

يبدأ كلا النموذجين من نفس الشكوى: حمل مُشفِّر رؤية للفهم و VAE للتوليد يعني تمثيل كل صورة مرتين، مما يضاعف السياق البصري تقريبًا ويجبر خط أنابيب التدريب على الحفاظ على واجهتين.

جواب PixelUMM هو حذف كليهما. تدخل البكسلات الخام مباشرةً عبر إسقاطات خطية أحادية الطبقة — رقعة 16×16 لكل موضع في الصورة، وtubelet من 4 إطارات لكل موضع في الفيديو — والعمود الفقري هو Transformer بفك ترميز فقط، يقترن تصميمه Mixture-of-Transformers بين انتباه مشترك ومعاملات خاصة بكل مهمة. يُتنبأ بالنص انحدارياً ذاتياً؛ ويُتنبأ بالبكسلات عبر مطابقة التدفق. تكرّس الورقة ثمانية أقسام لدراسات التصميم — حجم الرقعة، تشوهات الرقع، ديناميكيات فضاء البكسل مقابل فضاء VAE، توسّع الحوسبة — وهو ما يخبرك بأن سؤال الفريق الحقيقي كان: هل تصمد هذه المقاربة أصلاً؟

جواب InternLumina-U2 هو الاحتفاظ بواجهة منفصلة لكن جعل كل رمز يحمل قدرًا أكبر بكثير. يصف مُرمِّز AToken كل موضع بصري بثماني كتب شيفرة تكميلية تغطي الملمس والنص المضمّن والهندسة؛ وتُدمج التمثيلات الثمانية لكل موضع وتُسقَط في رمز عمود فقري واحد. يجري فك الترميز في الاتجاه المعاكس، مع إزالة ضوضاء متوازية مكانيًا ورأس انحداري ذاتي متعدد القواميس يتنبأ بالشيفرات الثماني بالترتيب. العمود الفقري هو نموذج LLM انتشار متناثر من سلالة LLaDA-2.0، بإجمالي 16B منها 1B نشط.

• واجهة بصرية — PixelUMM: بقع بكسلات خام ووحدات أنبوبية دقيقة، بلا أي مُرمِّز رموز على الإطلاق. InternLumina-U2: رموز منفصلة تمامًا بثماني كتب ترميز من AToken، بلا كامن مستمر.

• البنية الأساسية — PixelUMM: Qwen3-8B (15.2B إجمالًا)، مُفكِّك ترميز كثيف واحد مع خبراء الفهم والتوليد. InternLumina-U2: 16B إجمالي / 1B نشط، نموذج لغوي انتشار MoE متناثر.

• طريقة التوليد — PixelUMM: مطابقة التدفق في فضاء البكسل مع نص انحداري ذاتي. InternLumina-U2: إزالة الضوضاء بالانتشار المُقنّع على رموز منفصلة.

• المهام المعلنة — PixelUMM: تحويل النص إلى صورة، وتحويل النص إلى فيديو، وتحويل الصورة إلى نص، وتحويل الفيديو إلى نص. InternLumina-U2: تلك المهام، إضافةً إلى تحرير الصور والفهم ثلاثي الأبعاد.

• تنسيق الأوزان — PixelUMM: 128 .distcp جزءًا (~30 GB) خلف فهرس .metadata مخفي. InternLumina-U2: سبعة .safetensors أجزاء لكل مكدس عتاد، بتخطيط Hugging Face القياسي.

A generated scoreboard card titled “PixelUMM vs InternLumina-U2 — the scoreboard”, with the two model names as column headings and six dimension rows spanning both columns: visual interface, backbone, generation method, video understanding, weight format and licence. PixelUMM's column shows raw pixel patches and tubelets, a Qwen3-8B backbone at 15.2B, pixel-space flow matching, Video-MME 57.33 with MVBench 70.53, 128 distributed-checkpoint shards, and a noncommercial checkpoint licence; InternLumina-U2's column shows eight-codebook discrete AToken tokens, a 16B-A1B sparse MoE diffusion backbone, masked diffusion denoising, Video-MME 51.26 with MVBench 59.74, seven safetensors shards per hardware stack, and Apache-2.0. A footer notes that the figures are vendor-reported with no independent rerun.

لوحة النتائج، مع مصدرها مرفقًا.

اقرأ كل صف باعتباره ادعاءً خاصًا بالمختبر نفسه. تأتي ادعاءات PixelUMM من نسخته الأولية؛ أما ادعاءات InternLumina-U2 فهي وصف المختبر نفسه لها بأنها "أولية وجزئية"، مع تأجيل جداول المقارنة الكاملة إلى تقرير فني لم يصدر بعد.

• MMMU (استدلال الصور) — PixelUMM 41.67 (نتيجة المؤلفين). InternLumina-U2: لم يتم الإبلاغ عنه.

• ChartQA — PixelUMM 82.96. InternLumina-U2 86.52.

• DocVQA — PixelUMM 90.42. InternLumina-U2: لم يتم الإبلاغ عنه.

• Video-MME (بدون ترجمات) — PixelUMM 57.33. InternLumina-U2 51.26.

• MVBench — PixelUMM 70.53. InternLumina-U2 59.74.

• إجمالي GenEval — PixelUMM 0.83 مع معيد صياغة مطالبات LLM، و0.77 بدونه. InternLumina-U2 0.81.

• DPG-Bench الإجمالي — PixelUMM 85.74. InternLumina-U2 87.10.

• توليد الفيديو — PixelUMM VBench جودة الجزء 1 84.10 / الدلالي 79.80، إجمالي الجزء 2 83.24. InternLumina-U2: غير مُبلَّغ عنه.

• الفهم ثلاثي الأبعاد — PixelUMM: لا توجد مهمة كهذه. يُبلغ InternLumina-U2 عن نتيجة 41.8 على 3D MM-Vet.

المقارنة غير متكافئة لأن المختبرين ينشران جدولين مختلفين، لا لأن أحدهما يتفوق. لدى PixelUMM قسم كامل لتوليد الفيديو ولا يوجد لديه تحرير أو ثلاثي الأبعاد؛ بينما تدّعي InternLumina-U2 ست عائلات من المهام وتقدّم جدولاً جزئياً عبرها. الأرقام العابرة للمختبرات على اسم المعيار نفسه ليست القياس نفسه — إذ تختلف التقسيمات والمطالبات النصية وأخذ العينات — لذا تعامل مع صفّي ChartQA وGenEval باعتبارهما متعادلين تقريباً وتوقف عند هذا الحد.

الترخيص هو حيث ينتهي هذا التعادل

هذا هو الجزء الذي لا يُظهره أي جدول قياس أداء. مستودع PixelUMM خاضع لرخصة Apache-2.0، والبطاقة تنص على ذلك بشكل بارز. نقطة التحقق مُخرَج منفصل بموجب رخصة NVIDIA One-Way Noncommercial، مقتصرة على البحث أو التقييم غير التجاري، كما يحتفظ ملف مصدري واحد إضافةً إلى ذلك بإشعار CC BY-NC 4.0 موروث من DiT. الاستخدام البحثي: لا بأس به. ميزة داخلية في المنتج: حديث مع الإدارة القانونية، وربما حديث قصير.

InternLumina-U2 مرخّص بموجب Apache-2.0 من البداية إلى النهاية، الكود وكلتا نقطتي التحقق، دون أي استثناء منفصل للاستخدام غير التجاري. وبالنسبة لفريق يحتاج إلى الإطلاق، فهذه ليست ميزة هامشية صغيرة — بل هي القرار بأكمله. كلا النموذجين بمستوى بحثي من حيث النضج. واحد فقط منهما غير مقيّد في الاستخدام.

أيّ واحد ينبغي تجربته فعلاً، وكيف

إذا كان عملك في فهم الفيديو أو كنت تريد نموذجًا يولّد الفيديو والصور من مجموعة أوزان واحدة، فإن PixelUMM هو العمل الأكثر اكتمالًا وورقته البحثية هي القراءة الأكثر فائدة — لكنه مشروع بحثي برخصة غير تجارية، لذا مكانه منصة تقييم، لا خط إنتاج. وإذا كان عملك يتعلق باتساع توليد المخططات والمستندات والصور، أو كنت تحتاج إلى التحرير والثلاثي الأبعاد، فإن InternLumina-U2 يغطي مساحة أوسع ولا يحمل سقفًا ترخيصيًا؛ وثمنه أن العمود الفقري الانتشار 16B-A1B ومُرمِّز AToken يعنيان هندسة تشغيل حقيقية، وأن أرقامه المنشورة جزئية صراحةً.

لا يتوفّر أيٌّ منهما عبر أي واجهة برمجة تطبيقات مستضافة حتى لحظة كتابة هذه السطور، وهذا يشمل OrcaRouter — نحن لا نوجّه أيًّا من النموذجين. عندما يتغير ذلك، فإن الحجة لصالح الوصول إليهما عبر طبقة توجيه بدلًا من التكامل المباشر هي نفس الحجة التي تنطبق على أي نموذج مفتوح حديثًا: مفتاح واحد عبر أكثر من 200 نموذج، وتمرير أسعار قوائم المزوّدين بهامش ربح 0%، وتحويل تلقائي عند الفشل بحيث يمكن خفض رتبة نموذج يتبين أنه أسوأ مما اقترحه جدول مورّده عبر تغيير مسار بدلًا من إعادة كتابة عملية نشر. حتى ذلك الحين، النصيحة الصادقة هي المملة — نزّل أي نموذج يسمح ترخيصه بحالة استخدامك، وشغّل تقييمك الخاص على بياناتك الخاصة، ولا تخطط بناءً على أرقام أيٍّ من المختبرين حتى يعيد شخص من خارج المختبر تشغيلها.

ما الذي سيغيّر الإجابة؟

ثلاثة أشياء، مرتبة حسب التأثير. ترخيص تجاري لنقطة تفتيش PixelUMM سيجعل المقارنة متكافئة حقًا وسينقلها من «اقرأ الورقة» إلى «قيّم الأوزان». تقرير فني من Shanghai AI Laboratory يتضمن جداول المقارنة الكاملة سيحوّل أرقام InternLumina-U2 الجزئية إلى شيء قابل للتحقق، وسيكشف أيضًا عن مقدار اتساع المهام الست الذي يكون عند التكافؤ مقابل عند عمق التوكنات. وأول إعادة إنتاج مستقلة لأي من النموذجين — إعادة تشغيل GenEval أو MVBench من فريق ليس له مصلحة في النتيجة — هي اللحظة التي يتوقف فيها أي منهما عن كونه جدول مورّد. وحتى ذلك الحين، أحدُهما بنية معمارية غير معتادة يمكنك دراستها فقط، والآخر بنية معمارية غير معتادة يمكنك إطلاقها.