
PixelUMM مقابل Microsoft Mage-VL: أحدهما يحذف مُرمِّز الرموز البصرية، والآخر يعيد كتابته
- openaiجديدOpenAI: GPT-6.1 Sol2026-09-2952الذكاء
- anthropicجديدAnthropic: Claude Sonnet 5.52026-09-2856الذكاء
- typesafeجديدTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 لكل مليون رمز · 223 tok/s
- OpenAIجديدOpenAI: GPT-6 Luna2026-09-2238الذكاء
- OpenAIجديدOpenAI: GPT-6 Sol2026-09-2248الذكاء
- AnthropicجديدAnthropic: Claude Opus 5.52026-09-2258الذكاء
- xAIجديدGrok 4.72026-09-2146الذكاء
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 لكل مليون رمز · 124 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 لكل مليون رمز · 1148 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040الذكاء
- OpenAIOpenAI: GPT-6 Astra2026-09-0453الذكاء77البرمجة
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241الذكاء76البرمجة
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245الذكاء76البرمجة
- AnthropicAnthropic: Claude Fable 5.12026-09-0153الذكاء82البرمجة
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 لكل مليون رمز · 48 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 لكل مليون رمز · 103 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642الذكاء72البرمجة
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 لكل مليون رمز · 212 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845الذكاء75البرمجة
- obsidianQwen3.8 27B2026-08-1534الذكاء68البرمجة
كلٌّ من PixelUMM و Microsoft Mage-VLبناه فريقان مقتنعان بأن الطريقة التي تُحوَّل بها الرؤية إلى رموز هي عنق الزجاجة الخاطئ — وقد أصلحاها في اتجاهين متعاكسين. يحتفظ Mage-VL، نموذج البث الأصلي القائم على الكوديك من Microsoft، بمُرمِّز الرموز ويجعله أكثر عدوانية بكثير: فهو يتبع بنية الكوديكات الحديثة للفيديو، ويحتفظ بكل إطار مرجعي، وبفقط رقاع الإطارات المتوقعة التي يصرف فيها الكوديك بتات، ويُبلِغ عن خفض الرموز البصرية بأكثر من 75% مع تحقيق تسريع في الزمن الفعلي يصل إلى 3.5× مقارنةً بأخذ عينات الإطارات المنتظم. أما PixelUMM، النموذج الموحّد الخالي من المُرمِّز من NVIDIA، فيزيل مُرمِّز الرموز كليًا — كل رقعة 16×16 من البكسل الخام تصل إلى العمود الفقري عبر إسقاط خطي واحد، دون وجود أي VAE وأي محوّل رؤية في أي مكان. أحدهما يضغط بقوة أكبر. والآخر يرفض الضغط على الإطلاق. وواحد فقط منهما يستطيع توليد أي شيء.
هذا الفرق الأخير هو ما يجعل هذا الاقتران أكثر إثارة للاهتمام من معركة مواصفات. إن Mage-VL مراقب — نموذج إدراك بثّي مزوّد ببوابة استباقية تقرر متى يتحدث. أما PixelUMM فهو قارئ يرسم أيضًا: الأوزان نفسها تجيب عن أسئلة حول صورة وتولّد فيديو جديدًا من مُوجّه نصي. إنهما إجابتان غير متوافقتين عن سؤال "ما الذي ينبغي أن يكون عليه نموذج رؤية موحّد"، وأرقام كل مختبر خاصة به.
أين يحدث الضغط
فرضية Mage-VL هي مفارقة مورافيك الحديثة: نماذج الرؤية واللغة قوية في الاستدلال غير المتصل الصعب، لكنها بطيئة وشرهة حسابيًا في الإدراك اللحظي البسيط. وحلّها هو مواءمة الترميز (codec alignment). فبدلًا من فك ترميز بث إلى إطارات مُعيّنة بانتظام وتمرير شبكة كثيفة عبر ViT مجمّد مُدرّب مسبقًا على الويب، يفصل Mage-VL البث إلى إطارات مرجعية (I) وإطارات متوقعة (P)، ويحتفظ بكل الرقع في الإطارات المرجعية، ويُبقي فقط على رقع الإطارات المتوقعة التي تحمل حركة حقيقية أو تفاصيل جديدة. ويُدرَّب المُرمِّز، Mage-ViT، من الصفر على شبكة رقع 16×16 مع ترميز موضعي دوراني ثلاثي الأبعاد، وهو محايد صراحةً تجاه المُرمِّزات — إذ تقبل الواجهة نفسها متجهات الحركة وطاقة البواقي الخاصة بـ H.264/AVC أو HEVC، أو خريطة المعدل المتعلَّمة لمُرمِّز عصبي، دون أي تغيير في البنية أو إعادة تدريب.
فرضية PixelUMM هي أن المُشفّر نفسه هو المشكلة، وليس كفاءته. وتجادل ورقتها بأن نماذج مثل BAGEL تحمل واجهتين بصريتين — ViT للميزات الدلالية وVAE للتمثيلات الكامنة لإعادة البناء — مما يضاعف تقريباً السياق البصري لكل صورة تكييف، ويجبر خطوط أنابيب التدريب المسبق للرؤية واللغة على إعادة بنائها حول تيار ثانٍ. يحذف PixelUMM كليهما: تصبح الصور رقعاً مكانية 16×16، وتصبح الفيديوهات أنابيب زمكانية من 4 إطارات، وتصل البكسلات الخام إلى محوّل بفك ترميز فقط عبر إسقاطات خطية أحادية الطبقة. الفهم هو نص انحدار ذاتي؛ والتوليد هو مطابقة تدفق في فضاء البكسل.
• استراتيجية الضغط — Mage-VL: زمنية، مستمدة من الترميز؛ الإبقاء على المراسي، وتخفيف كثافة الإطارات المتوقعة. PixelUMM: لا شيء؛ الإبقاء على كل رقعة من البكسل الخام.
• ما الذي يُدرَّب من الصفر — Mage-VL: كامل المنظومة البصرية، على نحو 100 مليون صورة وفيديو غير مُصنَّفة. PixelUMM: مُضمِّنات ومُفكِّكات البكسل، فوق بنية لغوية أساسية Qwen3-8B.
• العمود الفقري — Mage-VL: Qwen3-4B-Instruct-2507، المكوّن الوحيد المُدرَّب مسبقًا، خلف مُسقِّط MLP ثنائي الطبقات. PixelUMM: Qwen3-8B، بنحو 15.2 مليار معامل في الإجمالي.
• سلوك البث — Mage-VL: تُقيّم بوابة إدراكية كل نافذة متدرجة وتبقى صامتة حتى يكتمل حدث يستحق الاستجابة، وعندها فقط تستدعي النموذج الكامل. PixelUMM: لا يوجد وضع بث؛ الطلبات إما نداءات توليد أو فهم.

ما يفعله كل واحد، وما لا يفعله
Mage-VL هو نقطة تفتيش واحدة توفر في الوقت نفسه فهم الصور والفيديو وبوابة البث الاستباقية — الأوزان نفسها تجيب عن الأسئلة دون اتصال وتقود التعليق المُشغَّل بالأحداث. وهي تضم معالج الترميز، وحزمة الترميز العصبي، والبوابة. إصدار ثانٍ، microsoft/Mage-ViT، هو المشفّر البصري المستقل من مرحلة التدريب المسبق من الصفر، ويُقدَّم كواجهة أمامية جاهزة للدمج في تدريب متعدد الوسائط آخر. ما لا يفعله Mage-VL هو التوليد. إنه يقرأ.
يغطي PixelUMM تحويل النص إلى صورة، وتحويل النص إلى فيديو بمعدل 96 إطارًا و24 إطارًا في الثانية، والنص المشروط بالصورة والفيديو. ويأتي بأربع نقاط تفتيش — S8-F22-R05 كنقطة تفتيش افتراضية تغطي المهام الأربع كلها، S8-F18-R01 مضبوطة لتحويل نص إلى فيديو أفضل عند 480p و720p لكنها غير قادرة على فهم الفيديو، ومرحلتين وسيطتين. ما لا تفعله هو البث المباشر أو التحرير أو ثلاثي الأبعاد. إذا كنت بحاجة إلى نموذج يراقب بثًا مباشرًا ويتحدث عندما يحدث شيء ما، فإن PixelUMM غير مناسب تمامًا، ولن يخبرك أي عمود في المقاييس بذلك.
فجوة التبني هي الإشارة الصادقة الأولى
الإصداران ليسا متساويين في النضج، وعدادات التنزيل تقول ذلك بوضوح أكثر من أي منشور إطلاق.
• Mage-VL — نُشر على Hugging Face في 25 يوليو 2026 بموجب Apache-2.0، مع تقرير تقني مرافق ومعرّف arXiv. وبحلول أوائل أكتوبر كان يُظهر نحو 13,800 عملية تنزيل و414 إعجابًا، ونمت حوله منظومة صغيرة من الأعمال المجتمعية.
• PixelUMM — نُشر على Hugging Face في 1 أكتوبر 2026 بموجب ترخيص غير تجاري لنقطة حفظ. كان عدد تنزيلاته صفرًا وعدد إعجاباته ثلاثة عند كتابة هذا. عمره أيام قليلة.
لا يزال لا يوجد إعلان من أي من المختبرين عن الإصدار الخاص بكل منهما — فقد صدر Mage-VL في يوليو دون إعلان، وصدر PixelUMM في أكتوبر دون إعلان. هذا التناظر حقيقي، لكن سيكون من الخطأ تفسيره على أن الاثنين نتاجان متكافئان. لقد حظي Mage-VL بعشرة أسابيع من اهتمام المجتمع؛ أما PixelUMM فلم يحظَ سوى بأيام. إن نموذجًا لم يشغّله أحد خارج المختبر يختلف عن نموذج حمّله بضعة آلاف من الأشخاص، وواحد فقط من هذين الاثنين يندرج في الفئة الثانية.

لوحة النتائج، مع المصدر
كل رقم يخصّ المختبر المطوِّر نفسه. أرقام Mage-VL تأتي من بطاقة Microsoft وتقريرها التقني؛ وأرقام PixelUMM من مسودتها الأولية. ولم يُعَد إنتاج أيٍّ منهما بشكل مستقل.
• الرموز البصرية — Mage-VL: انخفاض مُبلَّغ عنه يتجاوز 75% مقارنةً بأخذ العينات الإطاري الكثيف. PixelUMM: لا انخفاض؛ والحجة هي أن الرقع الخام تُلغي ترميزًا ثانيًا بدلًا من تقليص الأول.
• السرعة الفعلية — Mage-VL: أسرع بما يصل إلى 3.5× من أخذ عينات الإطارات المنتظم عند دقة متماثلة، وفق ما أوردته Microsoft. PixelUMM: لا يوجد أي ادعاء مقارن بشأن السرعة في الورقة البحثية.
• جودة المُرمِّز — Mage-VL: يُسجِّل Mage-ViT دقة 99.33% على CIFAR-10 و85.69% على ImageNet ضمن ميزانية 256 رمزًا، انطلاقًا من نحو 100 مليون وسيط غير مُصنَّف. PixelUMM: لا يوجد اختبار مرجعي مكافئ للمُرمِّز، إذ لا يوجد مُرمِّز لاختباره.
• فهم الفيديو — Mage-VL: تحسّنات مُبلَّغ عنها مقارنةً بـ Qwen3-VL-4B على كل معيار من معايير الفيديو والتحديد الزمني يذكره، بما في ذلك +22.5 على QVHighlight و+17.1 على ActivityNet. PixelUMM: MVBench 70.53، وVideo-MME 57.33 بدون ترجمات فرعية، وLongVideoBench 59.61، وLVBench 40.41.
• فهم الصور — Mage-VL: على قدم المساواة مع Qwen3-VL-4B في الصور الثابتة، وفقًا لما أوردته Microsoft. PixelUMM: MMMU 41.67، AI2D 80.12، DocVQA 90.42، ChartQA 82.96.
• التوليد — Mage-VL: لا يوجد. PixelUMM: إجمالي GenEval 0.83 مع مُعيد كتابة المطالبات، وDPG-Bench 85.74، وجودة VBench الجزء 1 84.10.
• البث — Mage-VL: بوابة أحداث استباقية مع أعلى قيم TimVal وF1 وROC-AUC وPR-AUC المُبلَّغ عنها على بث SoccerNet. PixelUMM: غير مدعوم.
• الترخيص — Mage-VL: Apache-2.0، الشيفرة والأوزان. PixelUMM: شيفرة Apache-2.0، ورخصة NVIDIA One-Way Noncommercial License على نقطة الحفظ.
العمودان لا يتداخلان بما يكفي لإجراء ترتيب. يفيد Mage-VL بأن مشفّرًا فعّالًا يتفوق على منافس من النطاق نفسه؛ ويفيد PixelUMM بأن نموذجًا بحجم 15B يقع في النطاق نفسه الذي تقع فيه الأنظمة المتخصصة المحيطة به، ويقول صراحةً في ورقته الخاصة إن اختلاف بيانات التدريب يعني أن النتائج "لا يمكن أن تثبت أيّ معمارية هي الأفضل".
الانقسام العملي
اختر حسب المهمة، لا حسب النتيجة. إذا كنت تبني إدراكًا للفيديو في الوقت الفعلي — مراقبًا يشاهد بثًا ويعلّق عند حدوث شيء ما، مع كون تكلفة الرموز هي القيد الملزم — فإن Mage-VL هو الوحيد من بين الاثنين الذي يفعل ذلك، وهو Apache-2.0، وحجمه من فئة 4B يعني أن عقدة واحدة يمكنها تشغيله. إذا كنت تحتاج إلى نموذج واحد يقرأ الصور والفيديو ويولّدهما أيضًا، فإن PixelUMM هو الوحيد من بين الاثنين الذي يفعل ذلك، لكنه نتاج بحثي بترخيص غير تجاري، وأوزانه 128 جزءًا من نقاط تفتيش موزعة خلف فهرس مخفي، ويشغّل تحويل النص إلى فيديو حواجز حماية Cosmos افتراضيًا مع بيئة Python منفصلة للبوابة.
بالنسبة لفريق يحتاج إلى كلتا الإمكانيتين، فإن الحجة لتحقيقهما عبر طبقة توجيه واحدة بدلاً من تكاملين مباشرين واضحة، رغم أن أياً منهما ليس مستضافًا اليوم: مفتاح واحد، وأسعار قوائم المزودين تمرر دون أي هامش ربح، وقواعد تجاوز الفشل التي تتيح لك وضع نموذج Apache-2.0 مفتوح حديثًا أمام شريحة من حركة المرور بينما يحتفظ النموذج المُثبت بالباقي. تم بناء OrcaRouter لهذا الشكل من المشكلات — ولنكون صريحين، لا نوجّه PixelUMM ولا Mage-VL في الوقت الحالي، لذا فإن هذا وصف لسير العمل، وليس قائمة.
ما الذي سيحسم الأمر؟
هناك حدثان مهمان. الأول هو إعادة تشغيل مستقلة لأرقام مُرمِّز Mage-ViT أو لنتائج الفيديو الخاصة بـ Mage-VL من قبل شخص لا مصلحة له فيها — ولم تُنتج عشرة أسابيع من التنزيلات واحدة بعد. والثاني هو أي تغيير في ترخيص نقطة التفتيش الخاصة بـ PixelUMM، وهو العامل الوحيد الذي يفصل حالياً بين أثر بحثي وأثر قابل للنشر. وإلى أن يتحقق أي منهما، فإن الشيء المفيد الذي يمكن قوله عن هذين الأمرين هو أن Microsoft راهنت على جعل الواجهة البصرية أرخص، وراهنت NVIDIA على إزالتها، ولم يخضع أي من الرهانين لتقييم أي شخص خارج المختبر الذي قام به.
