بطاقة عنوان رئيسية مُولَّدة لـ MiniCPM-V 4.7 مقابل Microsoft Mage-VL، بعنوان فرعي: طريقتان لخفض تكلفة مشاهدة الفيديو، وبطاقة على اليسار نصّها: Mage-VL: تخلخل الرموز الأصلي في المرمّز، ورموز بصرية أقل بنسبة 75%، وبطاقة على اليمين نصّها: MiniCPM-V 4.7: انتباه خطي، وذاكرة KV ثابتة لما يتجاوز 256K، وكبسولة نصّها: اضغط الإدخال، أو اضغط الحالة، مع شعار OrcaRouter في الزاوية السفلية اليمنى.
Guides & Insights

MiniCPM-V 4.7 مقابل Microsoft Mage-VL: رهانان مختلفان للغاية على ما ينبغي أن يكلفه نموذج الرؤية لكل إطار

الكاتب

Magnus Corvin

تاريخ النشر

أحدث النماذج · 20عرض جميع النماذج →
المعايير: Artificial Analysis · يُحدَّث يوميًا
العودة إلى جميع المقالات

MiniCPM-V 4.7 و Microsoft Mage-VL كلاهما نموذجان للرؤية واللغة يزعمان توفير الرموز لك، ويصلان إلى ذلك عبر مسارين متعاكسين. Mage-VL، الذي أطلقته Microsoft في 25 يوليو 2026، يهاجم جانب الفيديو: يستعير بنية برنامج ترميز الفيديو، ويحتفظ بكل رقعة من الإطار المرجعي، وبالرقعات فقط من الإطارات المتوقعة التي تحمل حركة حقيقية، ويزعم تقليل الرموز البصرية بأكثر من 75% مع تسريع فعلي يصل إلى 3.5× مقارنة بأخذ عينات الإطارات المنتظم. MiniCPM-V 4.7، الذي رفعته OpenBMB في 6 أكتوبر 2026، يهاجم الجانب التسلسلي: نموذج MoE متناثر بـ 35.2 مليار معامل، مع 30 من أصل 40 طبقة له على مسار انتباه خطي، مما يجعل ذاكرة KV تنمو ببطء عبر سياق 256K. أحد النموذجين يضغط ما ينظر إليه. والآخر يضغط ما يتذكره. وواحد فقط منهما يأتي مع أي شيء يمكنك تقييمه.

ما هو كل واحد

Microsoft Mage-VL هو نموذج أساس متعدد الوسائط أصيل بالنسبة إلى الترميز، ذو بثّ استباقي، بحجم 4B، صدر بموجب Apache-2.0 مع تقرير تقني وقسم تقييم موسّع. بُني عمدًا على خلاف ما يسمّيه مؤلفوه مفارقة مورافيك الخاصة بنماذج VLM — قوي في الاستدلال دون اتصال، بطيء في الإدراك الآني. يُدرَّب المُشفّر البصري Mage-ViT بالكامل من الصفر على نحو 100 مليون صورة وفيديو غير موسومة، بدلًا من تهيئته من ViT مُدرَّب مسبقًا على الويب، والمكوّن الوحيد المُدرَّب مسبقًا في المنظومة هو العمود اللغوي Qwen3-4B-Instruct-2507. نقطة الحفظ الكاملة هي نموذج موحّد واحد يقوم بفهم الصور، والاستدلال على الفيديو دون اتصال، والتعليق التدفّقي المُبوَّب بالأحداث، دون متغيّرات منفصلة، وإصدار microsoft/Mage-ViT المرافق يوفّر المُشفّر بمفرده. وقد جمع نحو 10,600 عملية تنزيل و420 إعجابًا منذ صدوره.

‏MiniCPM-V 4.7 هو openbmb/MiniCPM-V-4.7-35B-A3B، نقطة حفظ بصيغة BF16 تضم 35,212,875,824 معلمة موزعة على ستة عشر جزءًا بإجمالي 70.4 غيغابايت، كتبتها Transformers 5.2.0 ورُفعت في 6 أكتوبر 2026 دون بطاقة نموذج.

A generated two-column comparison scoreboard titled 'MiniCPM-V 4.7 vs Microsoft Mage-VL — the scoreboard'. Left column 'MiniCPM-V 4.7' lists Parameters 35.2B sparse, Licence none declared, Token savings linear attention, Context 256K, Vision 16x downsample, Evidence no card no benchmarks. Right column 'Mage-VL' lists Parameters 4.74B dense, Licence Apache-2.0, Token savings 75% fewer visual tokens, Context up to 768 frame windows, Vision from-scratch Codec-ViT, Evidence full card with tables. The footer reads 'Mage-VL figures vendor-reported; MiniCPM-V 4.7 figures read from config.json.'

تكوين النص الخاص به موسوم بـ qwen3_5_moe_text مع 256 خبيرًا و8 نشطين لكل رمز؛ ومصفوفة layer_types الخاصة به تشغّل ثلاث طبقات انتباه خطي مقابل كل طبقة انتباه كامل عبر 40 طبقة؛ وبرج الرؤية الخاص به هو minicpmv4_7_vision الداخلي المكوّن من 27 طبقة مع تقليل أبعاد بمقدار 16× وما يصل إلى تسع شرائح صور. طول السياق 256K. لا توجد أي تنزيلات، وثلاث إعجابات، ولا معايير قياس، ولا ترخيص.

الصفوف الستة التي يمكن للقارئ التحقق منها

نفس الأبعاد الستة، على كلا الجانبين. وحيث لا يوجد رقم، تُترك الفجوة ظاهرة.

• المعلمات — Mage-VL: 4.74B، كثيف، كلها نشطة لكل رمز. MiniCPM-V 4.7: 35.2B إجمالاً، متفرق، 8 من 256 خبيرًا لكل رمز. رقم MiniCPM ليس قابلاً للمقارنة مع رقم نموذج كثيف.

• الترخيص — Mage-VL: Apache-2.0، مذكور في البطاقة ووسوم المستودع. MiniCPM-V 4.7: لا شيء معلن.

• من أين تأتي وفورات التوكنات — Mage-VL: تخلخل التوكنات البصرية عند المشفّر، متوائم مع الترميز، ويُزعم أنه يقلّل أكثر من 75%. MiniCPM-V 4.7: انتباه خطي عند المفكّك، ما يقلّص نمو ذاكرة KV-cache عبر التسلسلات الطويلة لكنه لا يقلّل التوكنات التي تغذّيه بها.

• السياق — Mage-VL: تم تدريبه عبر مرحلة سياق طويل على 350 ألف فيديو كنوافذ ترميز متدحرجة تصل إلى 384 أو 768 إطارًا. MiniCPM-V 4.7: max_position_embeddings: 262144.

• أصل مشفر الرؤية — Mage-VL: من الصفر، دُرِّب على ~100 مليون إطار غير مُصنَّف؛ تُبلغ البطاقة عن 85.69% ImageNet مع 256 رمزًا وتحسّن رتيب مع ميزانية الرموز. MiniCPM-V 4.7: أُعيد استخدام برج النسب من تصميم MiniCPM-V 4.6 بنفس بنية 1152-مخفي و27 طبقة، مع افتراضي تخفيض العينات 16x.

• الأدلة — Mage-VL: بطاقة كاملة تضم DocVQA ‏95.14، وInfoVQA ‏80.33، وOCRBench ‏81.80، وChartQAPro ‏32.57، وMMStar ‏67.32، وCV-Bench-3D ‏94.75، وفارق CrossPoint قدره +53.1 مقارنةً بـ Qwen3-VL-4B، وكلها مُبلَّغ عنها من المورّد مقابل بنية أساسية مطابقة. MiniCPM-V 4.7: لا شيء.

• سلوك البثّ — Mage-VL: بوابة إدراكية تُقيّم كل نافذة متحركة وتبقى صامتة حتى يكتمل الحدث، مُدرَّبة على نحو 3.3 مليون عيّنة بثّية. MiniCPM-V 4.7: غير موصوف في أي مكان.

A screenshot of the Hugging Face model page for openbmb/MiniCPM-V-4.7-35B-A3B (captured 7 October 2026) showing the model header with three likes, the tags safetensors, minicpmv4_7 and region:us, and the file listing with no README or licence field.

الجزء الذي يخطئ فيه الجميع بشأن أرقام Mage-VL

جداول المعايير في بطاقة Mage-VL قوية، وأقواها هي أيضًا الأكثر عرضة لسوء القراءة. تضع صفوف المقارنة Mage-VL-4B في مواجهة Qwen3-VL-4B وPhi-4-Multimodal-Instruct وPhi-4-Reasoning-Vision، والمكاسب البارزة — +22.5 على QVHighlight، و+24.5 على VideoEval-Pro، و+53.1 على CrossPoint — حقيقية بمعنى أنها تظهر في جداول المورّد. وهي أيضًا قياسات المورّد نفسه، أنتجها الفريق الذي درّب النموذج، على نفس منصة التقييم. ولم يُعِد إنتاجها أي طرف مستقل. هذا طبيعي لنموذج عمره أربعة أشهر، وليس مأخذًا عليه، لكنه يعني أن الفعل الصحيح هو «يُبلِّغ»، لا «يُسجِّل».

هناك أمران يستحقان الإشادة بهما خارج الجداول. أولاً، التصميم المتطابق للعمود الفقري — إبقاء مفكك ترميز Qwen3-4B ثابتًا وتبديل ViT فقط — هو دليل أنظف من موقع في لوحة الصدارة، لأنه يعزل المكدس البصري بدلاً من النظام بأكمله. ثانيًا، مجموعة بيانات التدريب الخاصة بـ Mage-ViT تتكون من حوالي 100 مليون إطار غير مصنف مقابل مليارات أزواج الصور والنصوص التي تستخدمها المشفرات المُدرَّبة مسبقًا على الويب، لذا فإن مطابقة سلوك SigLIP2-at-10B من فئة 10 مليارات في التمييز العنقودي هو ادعاء محدد وقابل للتحقق حول كفاءة البيانات بدلاً من تفاخر عام.

لا يمتلك MiniCPM-V 4.7 أيًّا من هذا. ليست نسخة أضعف — بل لا شيء على الإطلاق.

A screenshot of the Hugging Face model page for microsoft/Mage-VL (captured 7 October 2026) showing the model header, the mage_vl and video-understanding tags, the Apache-2.0 licence badge, the project page and GitHub links, and the opening of the Mage-VL card describing it as a codec-native, proactive-streaming multimodal foundation model at a 4B scale.

لا يوجد جدول، لا من المورّد ولا من غيره، وملف التهيئة الذي يصف البنية يستثني نفسه صراحةً من قول أي شيء عن الدقة.

المعمارية: إجابتان على السؤال نفسه

يحاول كلا النموذجين الإجابة عن سؤال «كيف تجعل الاستدلال متعدد الوسائط رخيصًا؟»، والتباين هنا مُعلِّم لأنهما إجابتان تتكاملان بدلًا من أن تتنافسا.

يقلل Mage-VL من حجم المدخلات. شبكته 16×16 من الرقع مشتركة بين الإطار المرجعي والإطارات المتوقعة، ولا تُسهم الإطارات المتوقعة إلا بالرقع التي يُنفق فيها المرمز بتات — أي حيث توجد الحركة والتفاصيل الجديدة. والنتيجة هي تدفقات رموز متغيرة الطول لكل إطار، ولهذا يحتاج المكدس إلى مُسقِط يمكنه تسليم تسلسل متغير إلى مفكك ترميز سببي، ولهذا يمكن للواجهة نفسها أن تقبل متجهات حركة H.264/HEVC أو خريطة معدل متعلَّمة لمرمز عصبي دون إعادة تدريب. ثم يحافظ ترميز دوراني ثلاثي الأبعاد على اتساق المواضع المكانية-الزمانية عبر التناثر. وميزانية الرموز هي الكمية التي تُدار.

يقلّل MiniCPM-V 4.7 من الحالة. تحتفظ طبقات الانتباه الخطي فيه بحالة ثابتة الحجم بدلًا من ذاكرة تخزين مؤقت متنامية للمفاتيح والقيم، لذا تتوقف تكلفة الذاكرة لمحادثة طويلة عن النمو خطيًا مع عدد الرموز. إن ميزانية التسلسل هي ما تتم إدارته، وسياق 256K هو المكسب. والجدير بالذكر أن إعدادات MiniCPM-V 4.7 تعلن عن اختزال بصري بمعامل 16x — فهو يضغط الإدخال أيضًا — لكنها لا تفصح عما إذا كان يحتفظ بالوضع 4x القابل للتبديل الذي أتاحه MiniCPM-V 4.6.

ببساطة: حيلة Mage-VL تؤتي ثمارها في الفيديو حيث تكون معظم الإطارات شبه متطابقة مع الإطارات المجاورة لها. وحيلة MiniCPM-V 4.7 تؤتي ثمارها في المستندات الطويلة والجلسات الطويلة متعددة الأدوار حيث تتراكم الرموز (tokens). إن خط أنابيب يستقبل بثًا مباشرًا ثم يجري محادثة طويلة بشأنه سيستفيد من كليهما، ولا يقوم أي من النموذجين حتى الآن بعمل الآخر.

إدخالها في سير عمل حقيقي

Mage-VL عملي لتجربته اليوم: نقطة تحقق واحدة، وبنية موثّقة، ورخصة Apache-2.0، وبطاقة تخبرك بما يضمّه المستودع. صدر في يوليو، وقد أتيح للأدوات المحيطة به وقت كافٍ لتستقر.

MiniCPM-V 4.7 ليس من العملي تجربته اليوم، لأسباب مملة. يعني 70 جيجابايت بصيغة BF16 دون تكميم ذاكرة مسرّع لا يُرجّح أن تكون لديك فارغة، وغياب الترخيص يعني أن مسألة ما إذا كان مسموحًا لك باستخدامه على الإطلاق تظل مفتوحة. تتطلب مسارات الشيفرة المخصصة trust_remote_code، ولم يُختبر بعد ما إذا كان مزيج MoE والانتباه الخطي يمتلك أنوية في مكدس الخدمة لديك.

ما ينطبق على كليهما هو أن نموذج الرؤية المستضاف ذاتيًا ليس سوى مكوّن واحد في نظام يتعيّن عليه أيضًا استدعاء النماذج الرائدة. وهذا ما يبرّر وضع النصف المستضاف خلف موجّه واحد بدلًا من عقد ثانٍ وSDK ثانٍ: يصل OrcaRouter إلى أكثر من 200 نموذج بمفتاح واحد، ويمرّر سعر القائمة لكل مزوّد كما هو دون أي هامش نضيفه نحن، ويتحوّل تلقائيًا إلى بديل عند تدهور أحد المزوّدين. لا يُعدّ Mage-VL ولا MiniCPM-V 4.7 نموذجًا مستضافًا على تلك الخدمة — فكلاهما أوزان تستضيفها بنفسك — لذا اعتبر هذا بمثابة البنية التحتية على الجانب الآخر من عملية التسليم، لا كقناة إتاحة لأي من النموذجين.

حكم

Mage-VL نموذج مكتمل، مرخّص، ومُقاس بمعايير مرجعية، ذو فلسفة تصميم محددة ومدعومة بحجج جيدة، وتقوم قضيته على بث الفيديو والاستدلال المكاني حيث يفعل مُرمّزه الأصيل للترميز (codec-native) شيئًا مختلفًا بنيويًا عن الجميع. أما MiniCPM-V 4.7 فهو نقطة تفتيش أكبر، غير مرخّصة، وغير مُقاسة، فلسفة تصميمه واضحة للقراءة لكن سلوكه صفحة بيضاء. في كل ما يمكن للقارئ أن يبني عليه اليوم، يفوز Mage-VL افتراضيًا — لا لأنه أفضل، بل لأنه الوحيد من الاثنين الذي يمكن الحكم عليه أصلًا. أعد النظر في هذه المقارنة عندما يظهر ملف README الخاص بـ MiniCPM-V 4.7؛ إذا جلب ذلك اليوم معايير مرجعية ورخصة، فسيكون السؤال المثير هو ما إذا كان نموذج خليط خبراء (MoE) بسياق 256K وانتباه خطي يتفوق على مُرمّز تخلخل أصيل للترميز (codec-native sparsity encoder) على الفيديو الطويل، وذلك صراع مفتوح حقًا.