بطاقة عنوان رئيسية للمقارنة 'InternLumina-U2 مقابل Microsoft Mage-VL' مع عنوان فرعي 'مختبران هادئان، رهانان على رموز رؤية أذكى' وثلاث رقاقات إحصائية — 'InternLumina-U2: 16B-A1B diffusion MoE'، 'Microsoft Mage-VL: ~5B codec-native VLM'، 'كلا الرقمين مُبلَغ عنهما من قِبل البائع وغير مُعاد إنتاجهما' — مع شعار OrcaRouter في الزاوية السفلية اليُمنى.
Guides & Insights

InternLumina-U2 مقابل Microsoft Mage-VL: مختبران هادئان يراهنان على أن رموز الرؤية يجب أن تحمل المزيد

الكاتب

Gideon Frost

تاريخ النشر

أحدث النماذج · 20عرض جميع النماذج
المعايير: Artificial Analysis · يُحدَّث يوميًا
العودة إلى جميع المقالات

أصدرت مايكروسوفت نموذج Mage-VL ونموذج InternLumina-U2 بالطريقة التي تُصدر بها المختبرات البحثية عندما لا يكون متأكدًا بعدُ ما إذا كانت النتيجة منتجًا أم لا: بصمت. نشرت مايكروسوفت أوزان وكود Mage-VL على Hugging Face في 25 يوليو 2026 دون أي إعلان؛ ونشرت منظمة InternLM التابعة لمختبر شنغهاي للذكاء الاصطناعي كود تشغيل InternLumina-U2 على GitHub في 1 سبتمبر 2026 دون أي إعلان أيضًا. بفاصل خمسة أسابيع، أطلقت اثنتان من أكبر المختبرات في العالم نموذجين يحملان قناعة هادئة مشتركة — وهي أن الطريقة التي نحوّل بها الرؤية إلى رموز هي العائق الحقيقي — ثم تركتهما للمجتمع ليلاحظهما. أحدهما يمكنك تحميله وتشغيله اليوم، لكن بشكل غير مُريح. والآخر لا يمكنك تشغيله إطلاقًا، لأن أوزانه غير موجودة بعد. هذه هي الخريطة الصادقة للنموذجين، وسبب أن عبارة "كلاهما موثّق من جهة البائع، وكلاهما غير مُثبت" ليست الجملة نفسها بالنسبة إليهما.

خمسة أسابيع، رهانان على كفاءة التمثيل

الخط الرئيسي حقيقي، لا خطابي. Mage-VL نموذج فيديو مولود من الترميز: فبدلاً من فكّ التدفق إلى إطارات منتظمة العينات ودفع شبكة كثيفة من الرقع عبر محوّل رؤية مُدرّب مسبقًا على الويب، يتبع بنية برامج ترميز الفيديو الحديثة، فيفصل التدفق إلى إطارات ارتكاز وبيانات حركة مضغوطة بينها، ويبتلع ذلك التمثيل المدمج مباشرة. المكسب المعلن من مايكروسوفت هو خفض كبير في الرموز المرئية ومسار إدراك متدفق أسرع بشكل ملموس — وتقدّمه الشركة باعتباره إصلاحًا لنوع من مفارقة مورافيك في نماذج لغة الفيديو، حيث تكلف مهام الإدراك الصغيرة في الزمن الحقيقي حسابًا بقدر المهام الاستدلالية الصعبة غير المتصلة. Mage-VL مراقِب: يستهلك الفيديو بكفاءة ويجيب عن أسئلة حول ما يراه، في زمن شبه حقيقي.

InternLumina-U2 هو رهان على نفس الاختناق من الاتجاه المعاكس. حيث يقوم Mage-VL بضغط الفيديو باتباع الترميز، بينما يقوم InternLumina-U2 بضغط كل مدخل بصري عبر وصف كل موضع بثمانية ترميزات تكميلية متقطعة بدلاً من ترميز واحد، باستخدام مُرمّز تسميه المختبر AToken. الرهان هو أن قاموس ترميز واحد يحد من كمية المعلومات التي يمكن أن يحملها الترميز البصري الواحد، لذا فإن مفردات متعددة القواميس تتيح لنموذج نشر واحد بمعاملات 16B القيام بالفهم والتوليد عبر الواجهة نفسها — قراءة مخطط، الإجابة عن سؤال فيديو، وصف أصل ثلاثي الأبعاد، توليد صورة من نص، تعديل صورة بناءً على تعليمات — دون حاجة إلى حزمة توليد منفصلة. يريد Mage-VL إدراك التدفقات بتكلفة منخفضة؛ بينما يريد InternLumina-U2 الإدراك والرسم بمجموعة أوزان واحدة.

لوحة النتائج

أرقام كلا النموذجين مُعلنة من قِبل البائع وغير مُعاد إنتاجها، لذا يُصنّف لوح النتائج كل صف بمصدر بياناته.

• الشكل — Mage-VL: نموذج رؤية-لغة مضغوط أصيل الترميز (نحو 5 مليارات معامل بدقة BF16) مبني حول نواة Qwen النصية، مُدرَّب على فهم الصور والفيديو. InternLumina-U2: نموذج MoE بـ16 مليار معامل منها 1 مليار نشط (16B-A1B)، وهو نموذج لغوي كبير (LLM) انتشارِيّ متناثر يغطي الفهم والتوليد والتحرير.

• التمثيل البصري — Mage-VL: رموز أصلية من الترميز تتبع بنية ترميز الفيديو (مرساة بالإضافة إلى الحركة)؛ وتم الإبلاغ عن تقليل يزيد على 75% في رموز الفيديو المتدفق. InternLumina-U2: رموز ثمانية كتب شيفرة منفصلة تمامًا من مُرمّز AToken.

• ما الذي يفعله — Mage-VL: يشاهد مدخلات الصورة والفيديو ويجيب بالنص؛ مصمم للإدراك التدفقي. InternLumina-U2: يدّعي فهم النصوص والصور، والتوليد من النص إلى الصورة، وتحرير الصور، وفهم الفيديو، والفهم ثلاثي الأبعاد.

الأوزان — Mage-VL: متاحة للعموم على Hugging Face منذ 25 يوليو 2026 (microsoft/Mage-VL، Apache-2.0). InternLumina-U2: غير متاحة للعموم — مستودع Hugging Face مجرد هيكل فارغ، والأوزان مُعلَّمة بأنها «قريبًا».

• الأرقام البارزة — Mage-VL: Video-MME 64.0، NExT-QA 83.1، OVO-Bench 64.0، جميعها من إبلاغ Microsoft. InternLumina-U2: ChartQA 86.52، MathVision 33.22، VideoMME 51.26، GenEval 0.81، جميعها من إبلاغ المختبر، أولية وجزئية.

والواقع المُقدَّم — Mage-VL: قابل للتنزيل، لكن لا يوجد مسار قياسي عبر vLLM أو SGLang؛ إذ يتطلب الكود trust_remote_code، ولا توفّره حاليًا أي جهة استدلال. InternLumina-U2: لا يمكن لأي جهة تقديمه — فالأوزان غير متاحة للعموم، وحتى مشغّل الاستدلال المُصدَر يتوقع ملفات نقاط تفتيش غير موجودة في المستودع.

A comparison scoreboard for InternLumina-U2 and Microsoft Mage-VL: InternLumina-U2 with Shape 16B-A1B sparse MoE, Visual rep. 8-codebook discrete (AToken), Weights not public 'coming soon', Job understand/generate/edit, Headline ChartQA 86.5 GenEval 0.81, Serving none — weights absent; Microsoft Mage-VL with Shape ~5B codec-native VLM, Visual rep. codec-native stream tokens, Weights public since Jul 25 2026, Job watch video answer in text, Headline Video-MME 64.0 (reported), Serving trust_remote_code DIY, with a footer noting both sets of figures are vendor-reported and unreproduced, and the OrcaRouter logo in the bottom-right corner.

«متاح لكنه محرج» ليس مثل «غير متاح».

هذا هو الفرق الأكثر أهمية إذا كنت تحاول فعلاً بناء شيء ما. إن Mage-VL حقيقي بالمعنى الذي يهم أولاً: الأوزان متاحة على Hugging Face، وبطاقة النموذج شهدت حركة تنزيل كثيفة منذ أواخر يوليو، ونشأ حوله نظام بيئي صغير من التكميمات التي أعدّها المجتمع. كونُه «حقيقياً» لا يعني أنه «سهل». تُظهر بطاقة النموذج وسم كود مخصص، والمشفّر البصري ليس ViT المجمّد القياسي الذي تفترضه حزم الخدمة الحالية، ومستودع Microsoft نفسه يحمل النتيجة العملية — تشغيله يعني trust_remote_code ولا وجود لنشر جاهز من مزوّد. لكن فريقاً مصمّماً يمتلك GPU يمكنه تحميله وتوجيهه إلى بث فيديو ومعرفة ما إذا كانت الأطروحة القائمة على الكودك الأصلي تنطبق على بياناتهم. هذا فرق شاسع عن InternLumina-U2، حيث تنتهي الجملة نفسها بشكل مختلف: يمكن لفريق مصمّم قراءة كود الاستدلال، ثم يتوقف عند ذلك، لأنه لا توجد أوزان لتحميلها.

A screenshot of the GitHub repository InternLM/InternLumina-U2 (captured September 2 2026), showing the Apache-2.0 repo landing page, the multi-codebook diffusion description, and the per-task inference scripts that make up the public release.

بطاقة microsoft/Mage-VL على Hugging Face، التي التُقطت في 27 أغسطس 2026 — وصف البث الأصلي للترميز (codec-native)، وترخيص Apache-2.0، ووسم arxiv، وقسم موفّري الاستدلال الذي يُظهر عدم وجود أي موفّر ينشر النموذج حاليًا.

التفاوت في المعايير يتبع المنحى نفسه. أرقام النموذجين هي ادعاءات من الجهة المطوّرة دون أي إعادة تشغيل مستقلة حتى الآن. لكن ادعاءات Mage-VL تستند على الأقل إلى نموذج قابل للتنزيل، ما يعني أن الفجوة بين الادعاء والتحقق مجرد مسألة قيام أحدهم بتشغيله. أما ادعاءات InternLumina-U2 فتستند إلى بند في خارطة الطريق — «ستظهر جداول المقارنة الكاملة في التقرير الفني القادم» — ولا يوجد أي نموذج مطروح يمكنه التحقق منها. والجدول الجزئي الذي نشره المختبر نفسه يُظهر حتى أن النموذج متخلّف عن منافس واحد على الأقل يدّعي أنه يتفوّق عليه (GenEval 0.81 مقابل 0.89 لنموذج LLaDA2.0-Uni)، وهو تذكير مفيد بأن نقرأ وسم «أولي وجزئي» حرفيًا.

حيث يمكنهم التأليف بدلاً من التنافس

أكثر طريقة مفيدة لقراءة هذين الاثنين هي بوصفهما درجتين متجاورتين على سلّم، لا بوصفهما متنافسين على الوظيفة نفسها. فالراصد القائم على الترميز مثل Mage-VL مثير للاهتمام تحديدًا لأنه رخيص بما يكفي ليعمل باستمرار — فهو يراقب كل إطار من البثّ ولا يُصعّد إلا عندما يظهر شيء يستحق انتباه نموذج أكبر. والنموذج الأكبر الذي يُصعَّد إليه يمكن، من حيث المبدأ، أن يكون نموذجًا موحّدًا من النوع الذي يدّعي InternLumina-U2 أنه كذلك: البوابة الدائمة التشغيل التي تقرر ما الذي تنظر إليه، والنموذج العميق الذي يقرأ المخطط فعلًا، ويتتبّع المشهد ثلاثي الأبعاد، أو يُنتج الصورة المُعدَّلة. وكلاهما غير مُثبَت — Mage-VL غير مُثبَت لكنه قابل للتشغيل، وInternLumina-U2 غير مُثبَت ولم يُطرَح بعد — لذا فإن التأطير الصادق هو تركيب يمكنك بناؤه بمجرد التحقق المستقل من صحة كل جانب، وليس مواجهة مباشرة يمكنك خوضها اليوم.

A screenshot of the Hugging Face model page for microsoft/Mage-VL (captured August 27 2026), showing the codec-native streaming description, the Apache-2.0 license, the arxiv tag, and an inference-provider section showing no provider currently deploys the model.

مستودع InternLM/InternLumina-U2 على GitHub، تم التقاطه في 2 سبتمبر 2026 — صفحة المستودع الرئيسية التي تعرض وصف الانتشار متعدد القواميس، وشارة ترخيص Apache-2.0، ونصوص نقطة الدخول للاستدلال التي تشكّل الإصدار العام بينما تبقى الأوزان خارج شجرة الملفات.

ماذا تفعل طبقة التوجيه بنقاط تفتيش غير مثبتة؟

لا يُستضاف أيٌّ من هذين النموذجين على OrcaRouter، {{1}}ولن نوحي بخلاف ذلك{{/1}} — فـ Mage-VL لا يملك مسار خدمة معياريًا في أي مكان، وInternLumina-U2 لا تتوفّر لها أوزان. {{2}}ما يجعل لغة DSL الخاصة بالتوجيه مفيدة فعلًا في هذه الحالة{{/2}} هو التعبير عن التركيبة أعلاه كاستدعاء واحد بدلًا من لصق مخصص: {{3}}نموذج إدراك رخيص يعمل باستمرار يغذّي نموذجًا أعمق، مرتبطين بحيث لا يعمل النموذج المكلف إلا عندما يقول الرخيص إن شيئًا تغيّر{{/3}}. وبالنسبة لمشكلة نقطة التحقق غير المثبتة — {{4}}وهي ملف المخاطرة بأكمله لهذين النموذجين{{/4}} — {{5}}التحويل التلقائي عند الفشل هو الآلية التي تتيح للفريق تجربة نموذج مثل Mage-VL على مسار حقيقي دون المراهنة على هذا المسار به{{/5}}: أول مرة تتعطل فيها نقطة التحقق الجديدة، أو تُرجع بيانات تالفة، أو ترمي خطأ، ينتقل الاستدعاء إلى نموذج مثبت، ولا يُحتاج إلى إيقاظ مهندس لقلب مفتاح. {{6}}واجهة برمجية واحدة عبر أكثر من 200 نموذج، وسعر قائمة المزوّد يُمرَّر بهامش ربح 0%، والجديد يُختبر خلف شبكة أمان لا أمام بيئة الإنتاج{{/6}}.

الخلاصة

إذا كنت تريد اختبار فرضية "الفيديو الأصيل عبر الترميز" (codec-native-video) اليوم، فلن تجد سوى نموذج Mage-VL — وحتى "وجودُه" محفوفٌ بتحفظات تتعلق بكود مخصص وإعداد خدمة ذاتي. أما إذا كنت تريد اختبار فرضية "النموذج الموحّد متعدد الكتب البرمجية" (multi-codebook unified-model)، فلن تستطيع ذلك، لأن InternLumina-U2 ما زال مواصفةً تنتظر أوزانها؛ وما يمكنك فعله الآن هو قراءة بنيته المعمارية لتكون جاهزًا في اللحظة التي يمتلئ فيها التطبيق الأولي على Hugging Face. تعامل مع نموذج Microsoft بوصفه قطعةً أثريةً مُربكةً لكنها حقيقية، ومع نموذج Shanghai AI Lab بوصفه وعدًا موثّقًا توثيقًا جيدًا، وتذكّر أنه في هذه المواجهة ينطبق وصف "مُبلَّغ عنه من البائع وغير مُعاد إنتاجه" على كليهما — لكنه يعني شيئًا مختلفًا عندما يكون هناك ملف يمكنك تنزيله.

© 2026 OrcaRouter

لمقدمي الخدمات

هل تدير منصة استدلال؟ اعرض نماذجك على OrcaRouter.

providers@orcarouter.ai

انضم إلى مجتمعنا

Discordsupport@orcarouter.aiXGitHubYouTube