
PixelUMM مقابل InternLumina-U2: إصداران تجريبيان خاليان من المُرمِّز، والفرق الوحيد الذي يحسم الأمر
- openaiجديدOpenAI: GPT-6.1 Sol2026-09-2952الذكاء
- anthropicجديدAnthropic: Claude Sonnet 5.52026-09-2856الذكاء
- typesafeجديدTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 لكل مليون رمز · 223 tok/s
- OpenAIجديدOpenAI: GPT-6 Luna2026-09-2238الذكاء
- OpenAIجديدOpenAI: GPT-6 Sol2026-09-2248الذكاء
- AnthropicجديدAnthropic: Claude Opus 5.52026-09-2258الذكاء
- xAIجديدGrok 4.72026-09-2146الذكاء
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 لكل مليون رمز · 124 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 لكل مليون رمز · 1148 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040الذكاء
- OpenAIOpenAI: GPT-6 Astra2026-09-0453الذكاء77البرمجة
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241الذكاء76البرمجة
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245الذكاء76البرمجة
- AnthropicAnthropic: Claude Fable 5.12026-09-0153الذكاء82البرمجة
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 لكل مليون رمز · 48 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 لكل مليون رمز · 103 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642الذكاء72البرمجة
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 لكل مليون رمز · 212 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845الذكاء75البرمجة
- obsidianQwen3.8 27B2026-08-1534الذكاء68البرمجة
نموذجان، كلاهما عامّان، وكلاهما مصمَّمان على نحو غير معتاد، وواحد فقط منهما يمكنك بناء منتج عليه. PixelUMM هو نموذج NVIDIA الموحَّد الخالي من مُرمِّز — 15.2 مليار معامل على بنية Qwen3-8B الأساسية، يقرأ ويكتب البكسلات الخام عبر رقع 16×16 ووحدات أنبوبية من 4 إطارات، دون أي VAE ودون أي مُرمِّز رؤية في أي موضع من المنظومة. InternLumina-U2 هو نموذج انتشار قائم على مزيج الخبراء بحجم 16B من مختبر شنغهاي للذكاء الاصطناعي، يضغط كل مدخل بصري إلى ثماني شيفرات منفصلة تكميلية عبر مُرمِّز رموز يُسمى AToken. راهن كلاهما على أن الواجهة البصرية هي عنق الزجاجة. الرهان الذي يهم أكثر هو الموجود في ملفات الترخيص: يأتي InternLumina-U2 بأوزان Apache-2.0، بينما يأتي PixelUMM بنقطة تفتيش بموجب ترخيص غير تجاري. إذا كنت تختار بينهما لأي غرض تجاري، فإن تلك الجملة هي المقارنة بأكملها، وباقي هذه الصفحة سياق لها.
كلتا مجموعتي الأرقام الواردتين أدناه تأتيان من المختبرات نفسها. لا يمتلك أيٌّ من النموذجين تقييمًا مستقلًا، أو تصنيف Elo في الساحة، أو إعادة إنتاج من طرف ثالث. ولا يُقدَّم أيٌّ منهما عبر أي واجهة برمجة تطبيقات مُستضافة. ما يختلف هو ما يُسمح لك بفعله بالمُخرَج بعد تنزيله، ومدى تقدّم كل إصدار فعليًا.
أين يقف كل واحد الآن
لقد تحرّكت الجداول الزمنية للإصدار بسرعات متفاوتة، وكلاهما بهدوء.
• PixelUMM — أُنشئ مستودع GitHub في 4 سبتمبر 2026؛ ومنشور arXiv المسبق 2609.38597 بتاريخ 29 سبتمبر 2026؛ وأُنشئ مستودع نموذج Hugging Face في 1 أكتوبر 2026 الساعة 21:40 بالتوقيت العالمي المنسق. لم يظهر له أي منشور مدونة أو بيان صحفي أو سلسلة إطلاق من NVIDIA.
• InternLumina-U2 — مستودع GitHub أُنشئ في 1 سبتمبر 2026؛ سُجّل الهيكل المبدئي على Hugging Face في اليوم نفسه؛ أُضيفت أوزان نقاط التحقق المدرّبة على Ascend في 10 سبتمبر 2026؛ أُضيفت أوزان نقاط التحقق الخاصة بـ NVIDIA/CUDA في 24 سبتمبر 2026. سبع شظايا لكل حزمة، وكلتاهما قابلتان للتنزيل اليوم.
إن InternLumina-U2 الذي كان موجودًا في أوائل سبتمبر — شيفرة فقط، والأوزان "قريبًا"، ومستودع نماذج فارغ — ليس هو InternLumina-U2 الموجود الآن. أي شخص قرأ عنه في بداية الشهر واستنتج أن الأوزان مفقودة عليه أن يعيد التحقق؛ فنقطتا فحص Huawei Ascend وNVIDIA/CUDA متاحتان الآن، بموجب Apache-2.0، مع المُجزِّئ اللغوي والإعدادات وقالب المحادثة وشيفرة النمذجة عن بُعد إلى جانبهما.

إجابتان على نفس السؤال
يبدأ كلا النموذجين من نفس الشكوى: حمل مُشفِّر رؤية للفهم و VAE للتوليد يعني تمثيل كل صورة مرتين، مما يضاعف السياق البصري تقريبًا ويجبر خط أنابيب التدريب على الحفاظ على واجهتين.
جواب PixelUMM هو حذف كليهما. تدخل البكسلات الخام مباشرةً عبر إسقاطات خطية أحادية الطبقة — رقعة 16×16 لكل موضع في الصورة، وtubelet من 4 إطارات لكل موضع في الفيديو — والعمود الفقري هو Transformer بفك ترميز فقط، يقترن تصميمه Mixture-of-Transformers بين انتباه مشترك ومعاملات خاصة بكل مهمة. يُتنبأ بالنص انحدارياً ذاتياً؛ ويُتنبأ بالبكسلات عبر مطابقة التدفق. تكرّس الورقة ثمانية أقسام لدراسات التصميم — حجم الرقعة، تشوهات الرقع، ديناميكيات فضاء البكسل مقابل فضاء VAE، توسّع الحوسبة — وهو ما يخبرك بأن سؤال الفريق الحقيقي كان: هل تصمد هذه المقاربة أصلاً؟
جواب InternLumina-U2 هو الاحتفاظ بواجهة منفصلة لكن جعل كل رمز يحمل قدرًا أكبر بكثير. يصف مُرمِّز AToken كل موضع بصري بثماني كتب شيفرة تكميلية تغطي الملمس والنص المضمّن والهندسة؛ وتُدمج التمثيلات الثمانية لكل موضع وتُسقَط في رمز عمود فقري واحد. يجري فك الترميز في الاتجاه المعاكس، مع إزالة ضوضاء متوازية مكانيًا ورأس انحداري ذاتي متعدد القواميس يتنبأ بالشيفرات الثماني بالترتيب. العمود الفقري هو نموذج LLM انتشار متناثر من سلالة LLaDA-2.0، بإجمالي 16B منها 1B نشط.
• واجهة بصرية — PixelUMM: بقع بكسلات خام ووحدات أنبوبية دقيقة، بلا أي مُرمِّز رموز على الإطلاق. InternLumina-U2: رموز منفصلة تمامًا بثماني كتب ترميز من AToken، بلا كامن مستمر.
• البنية الأساسية — PixelUMM: Qwen3-8B (15.2B إجمالًا)، مُفكِّك ترميز كثيف واحد مع خبراء الفهم والتوليد. InternLumina-U2: 16B إجمالي / 1B نشط، نموذج لغوي انتشار MoE متناثر.
• طريقة التوليد — PixelUMM: مطابقة التدفق في فضاء البكسل مع نص انحداري ذاتي. InternLumina-U2: إزالة الضوضاء بالانتشار المُقنّع على رموز منفصلة.
• المهام المعلنة — PixelUMM: تحويل النص إلى صورة، وتحويل النص إلى فيديو، وتحويل الصورة إلى نص، وتحويل الفيديو إلى نص. InternLumina-U2: تلك المهام، إضافةً إلى تحرير الصور والفهم ثلاثي الأبعاد.
• تنسيق الأوزان — PixelUMM: 128 .distcp جزءًا (~30 GB) خلف فهرس .metadata مخفي. InternLumina-U2: سبعة .safetensors أجزاء لكل مكدس عتاد، بتخطيط Hugging Face القياسي.

لوحة النتائج، مع مصدرها مرفقًا.
اقرأ كل صف باعتباره ادعاءً خاصًا بالمختبر نفسه. تأتي ادعاءات PixelUMM من نسخته الأولية؛ أما ادعاءات InternLumina-U2 فهي وصف المختبر نفسه لها بأنها "أولية وجزئية"، مع تأجيل جداول المقارنة الكاملة إلى تقرير فني لم يصدر بعد.
• MMMU (استدلال الصور) — PixelUMM 41.67 (نتيجة المؤلفين). InternLumina-U2: لم يتم الإبلاغ عنه.
• ChartQA — PixelUMM 82.96. InternLumina-U2 86.52.
• DocVQA — PixelUMM 90.42. InternLumina-U2: لم يتم الإبلاغ عنه.
• Video-MME (بدون ترجمات) — PixelUMM 57.33. InternLumina-U2 51.26.
• MVBench — PixelUMM 70.53. InternLumina-U2 59.74.
• إجمالي GenEval — PixelUMM 0.83 مع معيد صياغة مطالبات LLM، و0.77 بدونه. InternLumina-U2 0.81.
• DPG-Bench الإجمالي — PixelUMM 85.74. InternLumina-U2 87.10.
• توليد الفيديو — PixelUMM VBench جودة الجزء 1 84.10 / الدلالي 79.80، إجمالي الجزء 2 83.24. InternLumina-U2: غير مُبلَّغ عنه.
• الفهم ثلاثي الأبعاد — PixelUMM: لا توجد مهمة كهذه. يُبلغ InternLumina-U2 عن نتيجة 41.8 على 3D MM-Vet.
المقارنة غير متكافئة لأن المختبرين ينشران جدولين مختلفين، لا لأن أحدهما يتفوق. لدى PixelUMM قسم كامل لتوليد الفيديو ولا يوجد لديه تحرير أو ثلاثي الأبعاد؛ بينما تدّعي InternLumina-U2 ست عائلات من المهام وتقدّم جدولاً جزئياً عبرها. الأرقام العابرة للمختبرات على اسم المعيار نفسه ليست القياس نفسه — إذ تختلف التقسيمات والمطالبات النصية وأخذ العينات — لذا تعامل مع صفّي ChartQA وGenEval باعتبارهما متعادلين تقريباً وتوقف عند هذا الحد.
الترخيص هو حيث ينتهي هذا التعادل
هذا هو الجزء الذي لا يُظهره أي جدول قياس أداء. مستودع PixelUMM خاضع لرخصة Apache-2.0، والبطاقة تنص على ذلك بشكل بارز. نقطة التحقق مُخرَج منفصل بموجب رخصة NVIDIA One-Way Noncommercial، مقتصرة على البحث أو التقييم غير التجاري، كما يحتفظ ملف مصدري واحد إضافةً إلى ذلك بإشعار CC BY-NC 4.0 موروث من DiT. الاستخدام البحثي: لا بأس به. ميزة داخلية في المنتج: حديث مع الإدارة القانونية، وربما حديث قصير.
InternLumina-U2 مرخّص بموجب Apache-2.0 من البداية إلى النهاية، الكود وكلتا نقطتي التحقق، دون أي استثناء منفصل للاستخدام غير التجاري. وبالنسبة لفريق يحتاج إلى الإطلاق، فهذه ليست ميزة هامشية صغيرة — بل هي القرار بأكمله. كلا النموذجين بمستوى بحثي من حيث النضج. واحد فقط منهما غير مقيّد في الاستخدام.
أيّ واحد ينبغي تجربته فعلاً، وكيف
إذا كان عملك في فهم الفيديو أو كنت تريد نموذجًا يولّد الفيديو والصور من مجموعة أوزان واحدة، فإن PixelUMM هو العمل الأكثر اكتمالًا وورقته البحثية هي القراءة الأكثر فائدة — لكنه مشروع بحثي برخصة غير تجارية، لذا مكانه منصة تقييم، لا خط إنتاج. وإذا كان عملك يتعلق باتساع توليد المخططات والمستندات والصور، أو كنت تحتاج إلى التحرير والثلاثي الأبعاد، فإن InternLumina-U2 يغطي مساحة أوسع ولا يحمل سقفًا ترخيصيًا؛ وثمنه أن العمود الفقري الانتشار 16B-A1B ومُرمِّز AToken يعنيان هندسة تشغيل حقيقية، وأن أرقامه المنشورة جزئية صراحةً.
لا يتوفّر أيٌّ منهما عبر أي واجهة برمجة تطبيقات مستضافة حتى لحظة كتابة هذه السطور، وهذا يشمل OrcaRouter — نحن لا نوجّه أيًّا من النموذجين. عندما يتغير ذلك، فإن الحجة لصالح الوصول إليهما عبر طبقة توجيه بدلًا من التكامل المباشر هي نفس الحجة التي تنطبق على أي نموذج مفتوح حديثًا: مفتاح واحد عبر أكثر من 200 نموذج، وتمرير أسعار قوائم المزوّدين بهامش ربح 0%، وتحويل تلقائي عند الفشل بحيث يمكن خفض رتبة نموذج يتبين أنه أسوأ مما اقترحه جدول مورّده عبر تغيير مسار بدلًا من إعادة كتابة عملية نشر. حتى ذلك الحين، النصيحة الصادقة هي المملة — نزّل أي نموذج يسمح ترخيصه بحالة استخدامك، وشغّل تقييمك الخاص على بياناتك الخاصة، ولا تخطط بناءً على أرقام أيٍّ من المختبرين حتى يعيد شخص من خارج المختبر تشغيلها.
ما الذي سيغيّر الإجابة؟
ثلاثة أشياء، مرتبة حسب التأثير. ترخيص تجاري لنقطة تفتيش PixelUMM سيجعل المقارنة متكافئة حقًا وسينقلها من «اقرأ الورقة» إلى «قيّم الأوزان». تقرير فني من Shanghai AI Laboratory يتضمن جداول المقارنة الكاملة سيحوّل أرقام InternLumina-U2 الجزئية إلى شيء قابل للتحقق، وسيكشف أيضًا عن مقدار اتساع المهام الست الذي يكون عند التكافؤ مقابل عند عمق التوكنات. وأول إعادة إنتاج مستقلة لأي من النموذجين — إعادة تشغيل GenEval أو MVBench من فريق ليس له مصلحة في النتيجة — هي اللحظة التي يتوقف فيها أي منهما عن كونه جدول مورّد. وحتى ذلك الحين، أحدُهما بنية معمارية غير معتادة يمكنك دراستها فقط، والآخر بنية معمارية غير معتادة يمكنك إطلاقها.
