بطاقة عنوان رئيسية للمقارنة "InternLumina-U2 مقابل North Micro Vision Instruct" مع العنوان الفرعي "قارئ مستندات يمكنك تشغيله اليوم مقابل نموذج 16B غير متوفر بعد" وثلاث شرائح إحصائية — "North Micro: 2.4B، قابل للتشغيل اليوم"، "InternLumina-U2: 16B، لا أوزان متاحة بعد"، "ChartQA 0.808 مقابل 86.52 (كلاهما مُبلَغ)" — مع شعار OrcaRouter في الزاوية السفلية اليمنى.
Guides & Insights

InternLumina-U2 مقابل North Micro Vision Instruct: قارئ مستندات يمكنك تشغيله اليوم مقابل نموذج 16B لم يكتمل بعد

الكاتب

Magnus Corvin

تاريخ النشر

أحدث النماذج · 20عرض جميع النماذج
المعايير: Artificial Analysis · يُحدَّث يوميًا
العودة إلى جميع المقالات

إذا كنت بحاجة إلى نموذج يقرأ المستندات ولقطات الشاشة والرسوم البيانية هذا الأسبوع، فهذه المقارنة تعطيك إجابةً عمليةً قصيرة: نورث مايكرو فيجن إنستركت هو نموذج مفتوح الأوزان من كوهير بعدد 2.4 مليار معامل، صدر بموجب ترخيص Apache-2.0، وهو متاح للتنزيل منذ 10 أغسطس 2026، وهو جيد بما يكفي في مهام المستندات ليستحق أن توجّهه إلى ملفاتك الخاصة اليوم. إنترن لومينا-U2 هو نموذج الانتشار من مختبر شنغهاي للذكاء الاصطناعي بعدد 16 مليار معامل — تصميم أكثر طموحًا بكثير يدّعي أيضًا فهم الرسوم البيانية والمستندات، من بين نصف دستة مهام أخرى — لكن أوزانه غير متاحة للعموم، ومستودعه على هاغينغ فيس مجرد هيكل فارغ، ولا يمكن لأي شخص في أي مكان تشغيله بعد. أما الإجابة الأطول فتتعلق بما يحدث عندما يقدّم نموذجان بترخيص Apache-2.0 ادعاءات متداخلة حول القراءة، لكن واحدًا فقط منهما شيء يمكنك أن تمسكه بيدك.

الـ2.4B الموجود فعلياً

North Micro Vision Instruct هو المتخصص في الرؤية في عائلة North من Cohere: حوالي 2.4 مليار معامل إجمالاً، نموذج مضغوط صُمم للقراءة بالدقة الأصلية. تتمثل نقطة التصميم في أن معظم نماذج الرؤية تصغّر الصور إلى شبكة ثابتة وتفقد التفاصيل الدقيقة التي تعتمد عليها المستندات — لذا يقبل North Micro Vision Instruct الصور بدقتها الأصلية حتى حوالي صفحة A4 بدقة 200 نقطة في البوصة، مع الحفاظ على نسبة الأبعاد والنصوص الصغيرة. الأرقام التي أعلنتها Cohere قوية لفئة هذا الحجم: DocVQA عند 0.921، وChartQA عند 0.808، وOCRBench عند 0.792، وكلها من إعلان Cohere ولم تُستنسخ، مع سياق متعدد الوسائط مُتحقق منه بحوالي 8K رمزًا، ونقطة ضعف موثقة في MMMU (0.329) — وهو تذكير بأنه متخصص في القراءة وليس معممًا في الاستدلال. ليس لديه واجهة برمجة تطبيقات مستضافة خاصة به ولا مسار استضافة قياسي؛ القصة العملية هي الاستضافة الذاتية لنموذج بحجم 2.4 مليار معامل، وهو صغير بما يكفي ليعمل على وحدة معالجة رسومية واحدة حديثة في محطة عمل. كان تبنّي المجتمع ثابتًا — حيث أظهرت بطاقة Hugging Face عشرات الآلاف من التنزيلات شهريًا بحلول أواخر أغسطس.

الـ16B الذي هو وعد

إنترنلومينا-U2 هو نتاجٌ من نوع مختلف. ما نشرته مختبرات شانغهاي للذكاء الاصطناعي في 1 سبتمبر 2026 هو كود استدلال ومعمارية، وليس نموذجًا: نموذج لغوي كبير انتشاري قائم على خليط متناثر من الخبراء، بإجمالي 16 مليار معلمة منها مليار واحد نشط، مبني على تمثيل بصري منفصل بالكامل من ثماني قواميس رموز. ومن بين عائلات المهام الست التي يغطيها السكربت المُحرِّك للمستودع — النصوص، فهم الصور، تحويل النص إلى صورة، تحرير الصور، فهم الفيديو، الفهم ثلاثي الأبعاد — يتضمن فهم الصور صراحةً المخططات الكثيفة والمستندات. يعرض الجدول الأولي في صفحة المشروع أرقام المخططات والمستندات التي يبلغ عنها المختبر في النطاق نفسه الذي يدّعيه المتخصص: 86.52 على ChartQA و83.65 على CharXiv-DQ، إلى جانب 62.15 على HallusionBench و33.22 على MathVision. وتصف الصفحة النتائج بأنها «أولية وجزئية»، والتقرير الفني الذي سيحمل الجداول الكاملة مُعلَّم بأنه «قريبًا»، والحقيقة الحاسمة — وهي أنه لا توجد أوزان يمكن لأي شخص التحقق من خلالها.

لوحة النتائج

جميع الأرقام الواردة أدناه مُبلَّغة من المورّد. نتائج North Micro Vision Instruct هي تقييم Cohere الخاص؛ أما نتائج InternLumina-U2 فهي الجدول الأولي الجزئي للمختبر.

• الحجم والشكل — North Micro Vision Instruct: ~2.4B كثيف، قارئ بالدقة الأصلية. InternLumina-U2: 16B إجمالاً / 1B نشط، MoE متناثر، نموذج انتشار منفصل متعدد القواميس.

• ما يفعله — North Micro Vision Instruct: يقرأ الصور والمستندات والمخططات وشاشات الواجهات؛ ويجيب نصيًا مع الإسناد. InternLumina-U2: يدّعي القراءة بالإضافة إلى التوليد — يفهم الصور/الفيديو/ثلاثي الأبعاد، ويولّد الصور ويحرّرها.

الأوزان — North Micro Vision Instruct: عامة منذ 10 أغسطس 2026 (CohereLabs/North-Micro-Vision-Instruct, Apache-2.0). InternLumina-U2: غير عامة؛ الصفحة المؤقتة على Hugging Face فارغة، والأوزان مُعلَّمة بأنها «قريبًا».

• درجات القراءة الرئيسية — North Micro Vision Instruct: DocVQA 0.921، ChartQA 0.808، OCRBench 0.792 (أبلغت عنها Cohere). InternLumina-U2: ChartQA 86.52، CharXiv-DQ 83.65، HallusionBench 62.15 (أبلغ عنها المختبر، وهي أولية).

سياق المستند — North Micro Vision Instruct: دقة أصلية تصل إلى ~A4 عند 200 نقطة في البوصة، وسياق متعدد الوسائط مُتحقق منه يصل إلى ~8K. InternLumina-U2: المخططات الكثيفة والصور الطبيعية تتم معالجتها عبر مُرمِّز AToken متعدد كتب الرموز؛ السياق غير محدد بعد.

• نقاط ضعف معروفة — North Micro Vision Instruct: MMMU 0.329، لا استدعاء للأدوات — قارئ وليس مُفكِّرًا أو وكيلًا. InternLumina-U2: يتخلَّف عن منافسٍ مُسمّى واحد على الأقل في GenEval (0.81 مقابل 0.89) في جدوله الجزئي؛ كل شيء غير مُتحقَّق منه.

• كيفية تشغيله — North Micro Vision Instruct: استضف نموذج 2.4B بنفسك؛ كان دعم vLLM لا يزال قيد الإطلاق عندما كُتب هذا. InternLumina-U2: لا يمكن لأحد تشغيله — لا توجد أوزان، والسائق المُصدَر يتطلب دليل نقاط تفتيش وملفات tokenizer غير موجودة في المستودع.

A comparison scoreboard for InternLumina-U2 and North Micro Vision Instruct: InternLumina-U2 with Size 16B-A1B diffusion MoE, Weights not public 'coming soon', Reading scores ChartQA 86.52 (reported), Weak spot GenEval 0.81 trails rival, Context not yet specified, Run it no one can today; North Micro Vision Instruct with Size ~2.4B dense reader, Weights public since Aug 10 2026, Reading scores ChartQA 0.808 DocVQA 0.921, Weak spot MMMU 0.329 no tools, Context native-res ~A4 8K ctx, Run it self-host one GPU, with a footer noting all figures are vendor-reported and unreproduced, and the OrcaRouter logo in the bottom-right corner.

نفس المعيار، منهجان معرفيان مختلفان تمامًا

ChartQA هو السبيل الأنظف لرؤية الفرق بين الادعاءين. كلا النموذجين يوردان رقمًا لـChartQA؛ {{1}}North Micro Vision Instruct{{/1}} يورد 0.808 ككسر دقّة، بينما {{2}}InternLumina-U2{{/2}} يورد 86.52 كنسبة مئوية — {{3}}المرجع نفسه{{/3}}، {{4}}وبشكل أساسي النتيجة نفسها في النطاق الواقع بين منتصف الثمانينات وأواخرها على مقياسين مختلفين{{/4}}، {{5}}مع الأخذ في الحسبان اختلافات تقسيمات التقييم وإعدادات التلقين التي تجعل المقارنات بين الأوراق البحثية عبر ChartQA مضللة حتى عندما يوجد النموذجان معًا{{/5}}. {{6}}الفارق المعرفي هو ما يهم:{{/6}} {{7}}رقم 0.808 الخاص بـ{{/7}} North Micro Vision Instruct {{8}}مرتبط بأداة قابلة للتنزيل، لذا يمكن لأي فريق يملك وحدة معالجة رسومية ومجموعة من الرسوم البيانية أن يعيد إنتاج النتيجة أو يدحضها هذا الأسبوع{{/8}}. {{9}}رقم 86.52 الخاص بـ{{/9}} InternLumina-U2 مرتبط بخارطة طريق. الرقم الذي لا يمكنك التحقق منه هو رقم لا ينبغي لك البناء عليه — وهذا تحديدًا هو الموقف الذي يعترف به المختبر نفسه عندما يصف جدوله بأنه أوّلي.

A screenshot of the Hugging Face model page for CohereLabs/North-Micro-Vision-Instruct (captured August 27 2026), showing the 2.4B native-resolution vision-language description, the Apache-2.0 license, and the model-size and download figures.

بطاقة CohereLabs/North-Micro-Vision-Instruct على Hugging Face، الملتقطة في 27 أغسطس 2026 — وصف نموذج اللغة والرؤية بالدقة الأصلية بحجم 2.4 مليار معامل، ورخصة Apache-2.0، ومعايير قراءة المستندات التي أبلغت عنها Cohere.

القراءة، مقابل القراءة والرسم

الفجوة في الفلسفة المعمارية أكثر أهميةً من الفجوة في المعايير. {{1}}North Micro Vision Instruct{{/1}} متخصص ضيّق النطاق: يقرأ النصوص، ويؤدي هذه المهمة الواحدة بتكلفة منخفضة بما يكفي لتشغيله على كل صفحة، وكل لقطة شاشة، وكل فاتورة في خط المعالجة، دون أن تراقب فاتورة GPU الخاصة بك. وهذا الانخفاض في التكلفة هو الميزة عينها، فذكاء المستندات على نطاق واسع مشكلة تكلفة بقدر ما هو مشكلة دقة. أما {{2}}InternLumina-U2{{/2}} فهو الرهان المعاكس: نموذج ضخم متناثر يحاول دمج القراءة مع توليد الصور وتحرير الصور وفهم الفيديو والفهم ثلاثي الأبعاد في واجهة موحّدة مشتركة من الرموز المنفصلة، انطلاقًا من فرضية أن الفهم والتوليد يعزز أحدهما الآخر. وإذا نجح هذا النهج، فهو فئة مختلفة من الأدوات — لكن عبارة «إذا نجح» تحمل عبئًا كبيرًا؛ فلن يكون نموذج الانتشار من نوع MoE بحجم {{3}}16B-A1B{{/3}}، المزوَّد بمُرمِّز مخصص ومعالجة مسبقة لبيانات ثلاثية الأبعاد مُصيَّرة عبر Blender، قارئًا منخفض التكلفة دائم التشغيل مثل المتخصص {{4}}2.4B{{/4}} أبدًا. إنهما ليسا بديلين فعليين؛ إنهما أداة يمكن نشرها اليوم واتجاه بحثي يمكن الاستعداد له.

A screenshot of the GitHub repository InternLM/InternLumina-U2 (captured September 2 2026), showing the Apache-2.0 repo landing page with the 'Omni-Visual Understanding, Image Generation and Editing' description and the per-task inference scripts.

مستودع InternLM/InternLumina-U2 على GitHub، مُلتقط في 2 سبتمبر 2026 — صفحة المستودع الرئيسية مع وصف «الفهم البصري الشامل، وتوليد الصور وتحريرها» وسكربتات الاستدلال الخاصة بكل مهمة؛ مسار فهم الصور من بينها هو الذي يستهدف الصور الطبيعية والرسوم البيانية الكثيفة.

ماذا يعني هذا إذا كنت تبني خط أنابيب مستندات؟

«لا يُستضاف أيٌّ من النموذجين على OrcaRouter — فـ North Micro Vision Instruct نموذجٌ يُستضاف ذاتيًا دون API مستضافة، فيما لا تتوفر أوزانٌ لـ InternLumina-U2 يمكن لأي جهةٍ استضافتها — لذا فإن زاوية التوجيه هنا ليست "استدعاءهما معًا عبر مفتاحٍ واحدٍ اليوم"، بل هي النمط الذي ستستخدمه في اليوم الذي يتغيّر فيه أحدُهما: خطُّ معالجة المستندات يقترن دائمًا تقريبًا بقارئٍ منخفض التكلفة مع نموذج استدلالٍ أكبر، وقيمةُ طبقة التوجيه هي التعبير عن هذا الاقتران في استدعاءٍ واحد، مع بقاء تمرير التكلفة بهامش 0% نزيهًا على النماذج المستضافة التي تستخدمها فعلًا. وعندما يصدر أخيرًا checkpoint مرخّص برخصة Apache-2.0 مثل InternLumina-U2، لن يكون القرار الحكيم اقتلاعَ بنية المستندات العاملة، بل وضعَ الوافد الجديد على مسارٍ اختباريٍّ خلف آلية تجاوز الأعطال التلقائية، ليكسب حركة مرور الإنتاج عبر النجاة منها، وما أن يفشل على مخططٍ حقيقيٍّ حتى يعود الاستدعاء إلى النموذج الذي أثبت نفسه بالفعل. واجهة API واحدة عبر أكثر من 200 نموذج هي الآلية؛ وتجاوز الأعطال هو شبكة الأمان؛ والمتخصص الذي يمكنك تشغيله اليوم هو ما يدفع الفواتير بينما ما يزال وعد 16B قيد التحقيق.»

الحكم

من أجل قراءة المستندات والرسوم البيانية في الوقت الحالي، فإن "North Micro Vision Instruct" هو الوحيد بين الاثنين الموجود بشكل قابل للاستخدام فعليًا — صغير الحجم، مرخّص بموجب Apache-2.0، قابل للتنزيل، وبنِتائج موثّقة من البائع يمكنك التحقق منها فعلاً. أما InternLumina-U2 فهو artifact الأكثر إثارة للاهتمام على المدى الطويل، لأنه يحاول جعل القراءة مهارة واحدة من ست مهارات في نموذج موحّد واحد، {{1}}وإذا نجح ذلك فسوف يغيّر معنى "نموذج الرؤية"{{/1}}. راقب مستودع Hugging Face الفارغ الخاص به {{2}}بنفس الطريقة التي تراقب بها العدّ التنازلي للإطلاق{{/2}}: {{3}}في اليوم الذي تظهر فيه ملفات safetensors، يتحول الوعد إلى نموذج، وتصبح المقارنة حقيقية{{/3}}. {{4}}وحتى ذلك الحين، لا تدع نسبة 86.52 المذكورة من البائع على معيار للرسوم البيانية تتفوق على نسبة {{KEEP}}0.808{{/KEEP}} القابلة للتنزيل في عملية اتخاذ قرارك{{/4}}.

© 2026 OrcaRouter

لمقدمي الخدمات

هل تدير منصة استدلال؟ اعرض نماذجك على OrcaRouter.

providers@orcarouter.ai

انضم إلى مجتمعنا

Discordsupport@orcarouter.aiXGitHubYouTube