بطاقة عنوان مُولّدة بأسلوب OrcaRouter الخاص، تحمل النص “PixelUMM vs North Micro Vision Instruct”، مع أربع بطاقات إحصائية: “2.4B” (إجمالي معلمات North Micro Vision Instruct)، و“~180k” (تنزيلاته من Hugging Face حتى أوائل أكتوبر)، و“0.921 / 90.42” (درجة DocVQA الخاصة به على شكل كسر دقة مقابل النسبة المئوية لـ PixelUMM)، و“Apache-2.0” (ترخيص الشيفرة والأوزان الخاص به، مقابل نقطة تحقق غير تجارية لـ PixelUMM). ويقرأ سطر تذييل: “أرقام حسب تقارير المورّد؛ لا إعادة تشغيل مستقلة لأي من النموذجين”. وشعار OrcaRouter مُركّب في الشريط المبطّن في أسفل اليمين.
Guides & Insights

PixelUMM مقابل North Micro Vision Instruct: نموذج بحثي غير تجاري في مواجهة قارئ بـ2.4 مليار معلمة يمكنك إطلاقه

الكاتب

Alistair Wren

تاريخ النشر

أحدث النماذج · 20عرض جميع النماذج →
المعايير: Artificial Analysis · يُحدَّث يوميًا
العودة إلى جميع المقالات

ضع North Micro Vision Instruct وPixelUMM جنبًا إلى جنب، ويكاد يكون فارق الحجم تشتيتًا للانتباه: 2.4 مليار معامل لقارئ Cohere ذي الدقة الأصلية مقابل 15.2 مليار للنموذج الموحد من NVIDIA. المحور المثير للاهتمام هو المشفّر. بُني North Micro Vision Instruct بالطريقة التقليدية — مشفّر رؤية بحجم 400M مُهيأ من SigLIP 2 SO400M، يغذّي نموذجًا لغويًا بحجم 2B، مُغلّفًا بمفردات من 262,144 رمزًا ومُتاحًا بموجب Apache-2.0. أما PixelUMM فبُني على الحجة القائلة إن هذا الترتيب تحديدًا هو عنق الزجاجة، ويحذف المشفّر: تدخل رقع البكسل الخام بحجم 16×16 إلى عمود فقري Qwen3-8B عبر إسقاطات خطية أحادية الطبقة، والأوزان نفسها تولّد الفيديو كما تجيب عن أسئلة حوله. أحدهما جهاز قراءة متخصص يمكنك تنزيله ونشره اليوم. والآخر أطروحة بحثية مع رابط تنزيل ورخصة تُبقيه خارج المنتجات.

أرقام كلا النموذجين أدناه صادرة عن مختبراتهما الخاصة. لم يُعَد إنتاج أيٍّ منهما بشكل مستقل، كما أن كلاً منهما ينشر مجموعة اختبارات معيارية مختلفة، لذا فإن التداخل بينهما أضيق مما يبدو.

الحجة لصالح البنية المملة

نُشر North Micro Vision Instruct على Hugging Face في 10 أغسطس 2026، وأُتيح له ثمانية أسابيع لجمع المستخدمين، وبحلول أوائل أكتوبر كان يُظهر نحو 180,000 عملية تنزيل و150 إعجابًا — أي اهتمام يزيد بمقدار مرتبة عشرية كاملة عن مستودع PixelUMM الذي لا يتجاوز عمره أيامًا. وعرضه محدد وغير لامع: فمعظم نماذج الرؤية تصغّر الصورة إلى شبكة ثابتة وتفقد التفاصيل الدقيقة التي تعتمد عليها المستندات، لذا يعالج هذا النموذج الصور بالدقة الأصلية، مع الحفاظ على نسبة الأبعاد والنصوص الصغيرة.

• المعاملات — 2.4 مليار إجمالاً: نموذج لغوي بحجم 2 مليار مع مُرمِّز رؤية بحجم 400 مليون مُدرَّب خصيصًا انطلاقًا من SigLIP 2 SO400M.

• السياق — عمود فقري لغوي بسعة 128 ألف رمز، لكن نطاق تشغيل متعدد الوسائط مُتحقَّق منه يبلغ نحو 8 آلاف رمز. توضح البطاقة صراحةً أن السياقات متعددة الوسائط الأطول تعتمد على الاستقراء ولم تخضع لاختبارات مرجعية.

• المدخلات والمخرجات — نص وصور متداخلة كمدخلات، ونص كمخرجات. متعدد اللغات عبر أكثر من إحدى عشرة لغة. لا توليد من أي نوع.

• الدرجات المُبلّغ عنها — DocVQA 0.921، وChartQA 0.808، وOCRBench 0.792، جميعها مُبلّغ عنها من Cohere ولم يُعَد إنتاجها. وMMMU 0.329، وهو ما لا تُخفيه البطاقة: هذا متخصص في القراءة، وليس نموذجًا عامًّا في الاستدلال.

• النشر — Transformers 5.16.0 ومسرّع، ووحدة معالجة رسومات حديثة واحدة عند 2.4B بدقة bfloat16، مع Flash Attention 2 اختياري وليس مطلوبًا.

لا شيء في ذلك التصميم يُعد مبتكرًا. وهو أيضًا السبب الذي يجعله قابلًا للتنزيل والضبط الدقيق ووضعه أمام مستندات حقيقية هذا الأسبوع.

A headless-browser capture of the Hugging Face model card for the North Micro Vision Instruct repository, showing the model title, the Apache-2.0 licence tag, and the repository's download and like counters.

الحجة ضد ذلك، التي يقدمها الطرف الآخر

تفتتح المسودة الأولية لـ PixelUMM بذكر تكلفة تلك البنية. يوفّر محوّل رؤية مجمّد مُدرَّب مسبقًا على الويب سمات دلالية للفهم؛ ويوفّر VAE منفصل كوامن موجهة نحو إعادة البناء للتوليد؛ وحمل كليهما معًا يضاعف تقريبًا السياق البصري لكل صورة تكييف، ويفرض إعادة بناء خطوط أنابيب التدريب المسبق للرؤية واللغة حول مسار ثانٍ. يتجنب North Micro Vision Instruct هذا التضاعف فقط عبر رفض المهمة الثانية بالكامل — فهو لا يولّد، لذا يحتاج إلى واجهة واحدة، لا اثنتين.

يمضي PixelUMM بالحجة إلى نتيجتها النهائية. لا مشفّر، ولا VAE، ولا مُرمِّز رموز: رقاع بكسل بحجم 16×16 للصور، وأنابيب زمكانية من 4 إطارات للفيديو، وكلاهما يصل إلى محوّل بمعمارية فك التشفير فقط عبر إسقاطات خطية أحادية الطبقة، مع الفهم عبر نص انحداري ذاتي والتوليد عبر مطابقة التدفق في فضاء البكسل. أقسامه التجريبية الثمانية دراسات لخيارات التصميم لا انتصارات في لوحات الصدارة — حجم الرقعة، تشوهات الرقعة، ديناميكيات التدريب في فضاء البكسل مقابل فضاء VAE، توسّع الحوسبة — وهي ورقة تسأل ما إذا كان البارادايم يصمد، لا ورقة تدّعي أنه فاز بالفعل.

• المسار البصري — North Micro Vision Instruct: مُشفِّر رؤية مُدرَّب مسبقًا بسعة 400M عند الدقة الأصلية. PixelUMM: بدون مُشفِّر؛ رقع خام عبر إسقاط خطي.

• ما يمكنه فعله — North Micro Vision Instruct: قراءة الصور والمستندات، والإجابة نصيًا، والتحديد وكتابة التعليقات. PixelUMM: قراءة الصور والفيديو، وإنشاء صور وفيديو مدته 4 ثوانٍ من النص.

• النطاق — ‏2.4B كثيف مقابل نحو 15.2B إجمالًا على بنية Qwen3-8B الأساسية، ويُعرض باسم "8B MoT" في جداول الورقة البحثية نفسها.

• الترخيص — Apache-2.0 على الشيفرة والأوزان مقابل Apache-2.0 على الشيفرة مع ترخيص NVIDIA One-Way Noncommercial License على نقطة التحقق.

A generated scoreboard card titled “PixelUMM vs North Micro Vision Instruct — the scoreboard”, with the two model names as column headings and six dimension rows spanning both columns: parameters, visual path, inputs and outputs, DocVQA, MMMU and licence. North Micro Vision Instruct's column shows 2.4B total, a 400M SigLIP 2 SO400M vision encoder at native resolution, interleaved text and images in with text out, DocVQA 0.921, MMMU 0.329 and Apache-2.0; PixelUMM's column shows about 15.2B total, no encoder with raw patches through a linear projection, image and video reading plus image and video generation, DocVQA 90.42, MMMU 41.67 and a noncommercial checkpoint licence. A footer notes that the figures are vendor-reported with no independent rerun.

قراءة لوحتي النتائج بأمانة

ينشر النموذجان معايير قياس مختلفة، وحيث تتقاطع تختلف المقاييس.

• DocVQA — North Micro Vision Instruct 0.921 ككسر دقة. PixelUMM 90.42 كنسبة مئوية. نفس اسم المعيار، لكن بتقسيمات وإعدادات مطالبات مختلفة، وواحد فقط من الاثنين يزعم أن التعامل مع الدقة الأصلية هو السبب.

• ChartQA — North Micro Vision Instruct 0.808. PixelUMM 82.96. مرة أخرى، النطاق نفسه تقريبًا بمجرد التوقف عن مقارنة السلاسل الخام.

• OCRBench — North Micro Vision Instruct 0.792. PixelUMM 78.00.

• MMMU — North Micro Vision Instruct 0.329، وPixelUMM 41.67. وكلاهما منخفض وفق معايير نماذج الرؤية واللغة الكبيرة، وكلا المختبرين يبلغان عنهما دون تجميل.

• PixelUMM فقط — MVBench ‏70.53، وVideo-MME ‏57.33، وLongVideoBench ‏59.61، وGenEval ‏0.83 مع أداة لإعادة صياغة التوجيهات، وجودة VBench الجزء 1 عند 84.10.

• North Micro Vision Instruct-only — الإرساء والوصف ومهام الصور المتعددة؛ غياب موثق لاستدعاء الأدوات وعدم وجود سلوك وكيلي صراحةً.

المثير في هذا التداخل هو مدى اقتراب نموذج متخصص بحجم 2.4B من نموذج عام بحجم 15.2B في قراءة المستندات والمخططات. هذا ليس دليلًا على فشل النهج الخالي من المُرمِّز — بل هو دليل على أن قراءة المستندات مهمة يناسبها جدًا مُرمِّز مدمج بدقة أصلية، وأن معمارية PixelUMM تستهدف حجة مختلفة. وتعترف ورقة PixelUMM نفسها بهذه النقطة في جملة تستحق الاقتباس: لأن بيانات التدريب تختلف بين النماذج، فإن نتائجها «لا يمكن أن تحدد أي معمارية هي الأفضل».

أين يقع القرار فعليًا

إذا كانت لديك مستندات أو مخططات أو استمارات أو لقطات شاشة وتحتاج إلى إجابات هذا الشهر، فإن North Micro Vision Instruct هو الخيار العملي، وليس الأمر متقاربًا: Apache-2.0، و2.4B، ومسار تحميل Transformers قياسي، بلا بيئة guardrail، وبلا فهرس نقاط تفتيش موزّع، وبلا مكدس Python ثانٍ. اضبطه بدقة على توزيع مستنداتك الخاص وستحصل على متخصص. المأخذ هو النطاق — وجّهه نحو مهمة استدلال وسيجدك رقم MMMU.

عرض PixelUMM هو الاتساع وسؤال بحثي. فهو يقرأ ويولّد، الصور والفيديو، من مجموعة واحدة من الأوزان، وهو القراءة الأكثر إثارة للاهتمام بفارق كبير. لكن نقطة حفظه تخضع لترخيص غير تجاري، وأوزانه عبارة عن 128 شظية لنقطة حفظ موزعة خلف فهرس بيانات وصفية مخفي بإجمالي يقارب 30 غيغابايت، وهو يتطلب مجموعة أدوات CUDA 13 مع FlashAttention المُجمّع من المصدر، كما أن مساره لتحويل النص إلى فيديو يشغّل ضوابط Cosmos التي تحتاج إلى مستودع مقيّد وبيئة منفصلة. هذا مقعد مختبر، وليس نشرًا.

The routing angle arrives later, if it arrives at all. Neither model is available through any hosted API today — OrcaRouter routes neither — and neither will be until their licensing permits it. When a model like North Micro Vision Instruct does show up behind a shared endpoint, the reason to prefer that over a direct integration is the ordinary one: one key across 200+ models, provider list prices passed through at 0% markup, failover that demotes a model which underperforms its card, and no second contract to negotiate when you want to A/B a replacement. That is a description of the workflow, not a claim about availability.

الاختبار الوحيد الذي سيفصل بينهم

شغّل كليهما على المجموعة نفسها من المستندات وبالدقة نفسها، وقيّم حالات النص الصغير، ثم غيّر متغيرًا واحدًا: أزل مُرمِّز الرؤية من المقارنة عبر تغذية PixelUMM بمدخلاتها ذات الدقة الأصلية. إذا صمد النموذج الخالي من المُرمِّز مع النص الكثيف بجزء صغير من تكلفة المعلمات، فهذا أقوى دليل ممكن على الفرضية — وهو اختبار يستطيع أي شخص يملك بطاقة احتياطية تشغيله، لأن كلا نقطتي الحفظ يمكن تنزيلهما. وإلى أن يفعل ذلك أحدهم، يظل الملخص العملي قائمًا: القارئ الصغير بترخيص Apache-2.0 هو ما تنشره، والنموذج العام الكبير غير التجاري هو ما تدرسه.