
شمال مايكرو فيجن إنستركت: نموذج VLM الوثائقي الهادئ بحجم 2.4B من كوهير، مشروح
- openaiجديدOpenAI: GPT-6.1 Sol2026-09-2952الذكاء
- anthropicجديدAnthropic: Claude Sonnet 5.52026-09-2856الذكاء
- typesafeجديدTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 لكل مليون رمز · 144 tok/s
- OpenAIجديدOpenAI: GPT-6 Luna2026-09-2238الذكاء
- OpenAIجديدOpenAI: GPT-6 Sol2026-09-2248الذكاء
- AnthropicجديدAnthropic: Claude Opus 5.52026-09-2258الذكاء
- xAIجديدGrok 4.72026-09-2146الذكاء
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 لكل مليون رمز · 124 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 لكل مليون رمز · 933 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040الذكاء
- OpenAIOpenAI: GPT-6 Astra2026-09-0453الذكاء77البرمجة
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241الذكاء76البرمجة
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245الذكاء76البرمجة
- AnthropicAnthropic: Claude Fable 5.12026-09-0153الذكاء82البرمجة
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 لكل مليون رمز · 50 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 لكل مليون رمز · 106 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642الذكاء72البرمجة
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 لكل مليون رمز · 217 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845الذكاء75البرمجة
- obsidianQwen3.8 27B2026-08-1534الذكاء68البرمجة
CohereLabs/North-Micro-Vision-Instruct — "North Micro Vision" اختصارًا — هو نموذج رؤية-لغة بمعاملات تبلغ 2.4 مليار، طُرح بهدوء: ظهرت الأوزان على Hugging Face في 10 أغسطس 2026، وتلاه إعلان Cohere في 12 أغسطس، وبعد يومٍ واحد لا توجد حتى الآن واجهة برمجية مستضافة، ولا قائمة أسعار، ولا إدخال في لوحات صدارة تابعة لجهات خارجية. صُمم North Micro Vision لمهمة واحدة — قراءة المستندات بالدقة الأصلية، كما يحدّق الشخص في صفحة A4 ممسوحة ضوئيًا لا كما تلتقط نماذج التسميات التوضيحية نظرةً خاطفةً على صورة مصغرة — وبطاقة تعريف النموذج صريحة بشكل غير معتاد فيما لا يقدمه: لا استدعاء أدوات، ولا حلقة تفكير، ويُثبط استخدام التعليمات النظامية بنشاط. هذا تقرير «ما نعرفه حتى الآن»، لذا فإن كل رقم أدناه مُعلَّم: ما يثبته المستودع نفسه، وما تدّعيه Cohere دون أن يعيد أحد إنتاجه، وما تضيفه النظرة الوحيدة من طرف ثالث المنشورة حتى الآن.
ما الذي أصدرته Cohere فعليًا
كل شيء في هذا القسم يُقرأ مباشرة من المستودع: config.json وREADME وبطاقة النموذج. هذه هي المصادر الأساسية لـ Cohere، وبالنسبة لمعظم ما هو معروف عن النموذج، فهي المصادر الوحيدة.
• الحجم — إجمالي 2.4B معلمة: مُشفّر رؤية بحوالي 400M بالإضافة إلى نموذج لغة "North Micro LLM" بحجم 2B، بصيغة bfloat16، حوالي 4.97 جيجابايت من الأوزان
• الترخيص — Apache 2.0، مسموح به تجاريًا، الأوزان والمُرمِّز مفتوحان
• مشفّر الرؤية — مُدرَّب خصيصًا للدقة الأصلية، وتمت تهيئته من SigLIP 2 SO400M
• نموذج لغة — نموذج North Micro LLM الداخلي بحجم 2B الذي يتبع بنية Command A+: ثلاث طبقات انتباه بنافذة منزلقة متداخلة مع طبقة انتباه عامة واحدة، انتباه استعلامات مجمعة (16 رأس استعلام على 8 رؤوس KV)، ترميزات مرتبطة، ومفردات من 262,144 رمزًا
• المسقط — "DeepStack": يتم حقن تضمينات الرقع من عدة طبقات للترميز البصري في طبقات اللغة المبكرة بدلاً من إلحاقها مرة واحدة في البداية، وهذا هو ما يجعل النصوص الصغيرة وهندسة الجداول تصمد.
— الدقة — إدخال بالدقة الأصلية مع الحفاظ على نسبة الأبعاد، حتى حوالي 1654 × 2339 بكسل، وهو ما يعادل صفحة A4 واحدة عند حوالي 200 نقطة في البوصة.
• السياق — سياق نصي 128K على العمود الفقري للغة؛ سياق متعدد الوسائط مُتحقق منه 8K (التفاصيل أدناه)
• اللغات — 11 مدعومة: الإنجليزية، الصينية، الألمانية، الفرنسية، الإسبانية، الإيطالية، البرتغالية، الهندية، اليابانية، الكورية، العربية
لاحقة "Instruct" مهمة. هذه هي نقطة التحقق المضبوطة بالتعليمات — نموذج دردشة وأسئلة وأجوبة بصرية — وهي حاليًا نقطة التحقق الوحيدة. شجرة النموذج تسرد بالفعل أحد عشر تكميمًا من المجتمع وثلاثة نماذج مضبوطة بدقة، لكن لم يُنشر أي متغير أساسي منفصل تحت اسم مختلف.
لماذا تستحق البنية فقرة
معظم نماذج VLM ذات 2-3B معاملات تقوم بتصغير صورتك إلى شبكة ثابتة وتفقد التفاصيل الدقيقة. رهان North Micro Vision هو العكس: الحفاظ على الدقة، وإنفاق الرموز. يستخدم مشفر الرؤية 2D RoPE بالإضافة إلى تضمينات موضعية 1D مكتسبة، ويقوم مُسقط DeepStack بتغذية تضمينات البقع إلى طبقات لغوية متعددة بدلاً من مقدمة واحدة، وهذا هو كيف تنجو الجداول المزدحمة أو الحواشي السفلية. الترميز الموضعي هو mRoPE متداخل، لذا فإن عدد رموز الرؤية يتدرج مع دقة الصورة بدلاً من أن يكون مقيدًا بإعداد مسبق.
هذا الاختيار هو المنتج بأكمله — وله تكلفة. تشير تقديرات تحليل إطلاق RohitAI إلى أن صفحة A4 أصلية بأقصى دقة تعادل تقريبًا 3,800 موضعًا بصريًا مدمجًا. اقرأ هذا الرقم بجانب ملاحظة السياق أدناه: 3,800 رمزًا مرئيًا بالإضافة إلى الموجه يمكن أن تملأ حصة كبيرة من النافذة متعددة الوسائط المعتمدة قبل أن تطرح سؤالك.
بطاقة المعيار، تُقرأ بصدق.

كل رقم في هذا القسم مُقدَّم من البائع. لم يُعَد إنتاج أيٍّ منها في مختبر مستقل، ولا يظهر النموذج على أي لوحة تصنيف عامة حتى الآن. على الورق، السجل قوي فعلًا في النقاط التي تشير إليها Cohere:
• DocVQA — 0.921 (الإجابة على الأسئلة البصرية للمستندات)
• ChartQA — 0.808 (قراءة المخططات)
• OCRBench — 0.792 (OCR في العالم الحقيقي)
• إسناد RefCOCO — متوسط P@1 هو 0.732 (الإشارة إلى الأشياء)
• MMMU — 0.329 (معرفة متعددة الوسائط على مستوى جامعي — نقطة الضعف، كما هو متوقع عند هذا الحجم)
• IFEval — 0.749 (اتباع التعليمات)
يَزعم الإطار الترويجي لإطلاق كوهير أن North Micro Vision يتفوق على Gemma 4 E2B و Ministral 3 3B «في مجموعة من معايير الفهم البصري»، مع تركيز القوة في فهم المستندات والإجابة عن الأسئلة البصرية. هذا هو ادعاء كوهير بشأن نموذجها الخاص — تعامل معه على هذا الأساس. غير أن هناك نقطة ملتوية: المقارنة التي أجرتها كوهير مع عائلة Liquid استخدمت النسخة 1.6B وليس النسخة 3B، لذلك لا توجد مقارنة صحيحة بين North وLFM2.5-VL-3B في البطاقة، رغم أن النموذجين سيتنافسان على نفس ميزانية المستندات الطرفية.
أول إطلالة من طرف ثالث نُشرت حتى الآن — وهي عبارة عن اختبارات مدوّن واحد، لا مجموعة اختبارات مخبرية — تُضيف الصورة التي تتركها البطاقة ناقصة. وتشير إلى أن North Micro Vision يتفوق على Ministral 3 3B Instruct في خمسة من سبعة مجالات تتعلق بالمستندات والرسوم البيانية وOCR، وهو ما يطابق سردية البائع. لكنها تشير أيضًا إلى أن Qwen3.5-2B يتفوق على North Micro Vision في ستة من تلك المجالات السبعة وفي كل المجالات المُعلنة للأسئلة البصرية العامة والاستدلال والعدّ والهلوسة والمعرفة النصية؛ والمكسب الوحيد لـNorth Micro Vision على Qwen3.5-2B في تلك المجموعة هو AI2D. كما يبلغ English OCRBench v2 0.367 مقابل 0.792 المُتصدَّر في OCRBench — وهو تذكير بأن نتائج OCR تعتمد بشكل كبير على أي تقسيم وأي مستوى صعوبة تشغّله. تشغيلة واحدة ليست حكمًا نهائيًا، لكنها أول دليل على أن المنافس الحقيقي لـNorth Micro Vision بهذا الحجم هو عائلة Qwen 3.5، لا النماذج التي اختارت Cohere أن تقيس أداءها بمقارنتها بها.
نافذة سياق واحدة، رقمان
تدرج البطاقة 128 ألفًا من سياق النص و8 آلاف من السياق متعدد الوسائط المُتحقق منه، والفجوة بينهما تقوم بعمل حقيقي. رقم 128 ألف يخص العمود الفقري اللغوي وحده؛ ولم يتم تدريب أو التحقق من المطالبات التي تجمع الصورة والنص والتي تتجاوز 8 آلاف رمزًا، لذا فإن أي شيء يتجاوز هذا الخط هو استقراء. ومع أن صفحة A4 كثيفة تستهلك حوالي 3800 موضعًا بصريًا، يمكنك الوصول إلى نافذة 8 آلاف هذه بمستند واحد وسؤال قصير. النتيجة العملية: خطط لخط أنبوبتك حول اقتصاص الصفحات إلى مناطق — الجدول، كتلة التوقيع، فاتورة واحدة — بدلًا من إدخال صفحات كاملة وتوقع حوار طويل حولها.
ما تخبرك به بطاقة النموذج ألا تفعله
نورث مايكرو فيجن هي طبقة إدراك، وليست وكيلًا، وتوضح Cohere ذلك بوضوح منعش. تقول البطاقة إن النموذج ليس نموذج استدلال، وله قدرة محدودة في الرياضيات والبرمجة، ولا يدعم استدعاء الأدوات أو سير العمل الوكيل، ولا ينبغي أن يحل محل مساعد عام أكبر. وتذهب أبعد من معظم البطاقات: فهي توصي بعدم استخدام تعليمات النظام، لأن النموذج لم يُدرَّب عليها. ولا توجد درجات ثقة معايرة أيضًا. التصميم الذي يستلزمه ذلك هو انقسام: تقرأ نورث مايكرو فيجن وتستخرج، ويتولى المخطط البنية، وتتولى القواعد الثوابت، ويتعامل نموذج أقوى مع الاستدعاءات الغامضة، ويوافق إنسان على أي شيء ذي عواقب. تعامل مع النص على الصفحة كبيانات، وليس كسياسة أبدًا — تعليمة ممسوحة ضوئيًا مدفونة في مستند هي بالضبط نوع حقن التعليمات البصرية الذي يدافع عنه هذا الانقسام.

كيفية تشغيله اليوم

يُقرّ الدليل السريع باحتكاكه الخاص بشفافية: تتطلب بطاقة النموذج إصدار Transformers 5.16.0، وهو لم يكن أحدث إصدار مستقر على PyPI يوم الإطلاق، لذا يقوم المستخدمون الأوائل بالتثبيت من المصدر. دعم vLLM العام مُدرج على أنه "قريبًا"؛ قامت Cohere بالتقييم باستخدام بناء داخلي لـ vLLM. الدعم البيئي من اليوم الأول جيد بخلاف ذلك: وصفات NVIDIA NeMo AutoModel للنشر على الحواف وGPU، ووصفات الضبط الدقيق الكامل وQLoRA الخاصة بـ Axolotl، وكميات MLX المجتمعية لأجهزة Apple Silicon — يبلغ حجم البناء رباعي البت حوالي 2.17 جيجابايت. هناك مأزق نشر يستحق الذكر: اضبط max_pixels صراحةً، لأن sequence_len لا يحد من رموز الصور، وبدون ذلك قد تتجاوز نافذة الوسائط المتعددة المُتحقق منها دون قصد.
نورث مايكرو فيجن ليست على OrcaRouter، وحسب بطاقتها الخاصة ليست على أي مزود استدلال — هذه قصة استضافة ذاتية، نقطة انتهى. وهذا بالضبط سبب أهمية طبقة التوجيه في الجملة التالية: اللحظة التي يقيم فيها أي مزود نقطة نهاية لها، فإن الموجّه هو ما يتيح لك وضع نموذج Apache-2.0 عمره أيام بجوار النماذج التي تستدعيها بالفعل في الإنتاج — واجهة برمجة واحدة، لا عقد جديد، سعر قائمة المزود يُمرَّر بهامش ربح 0%، وتجاوز تلقائي للفشل بحيث يمكن لنموذج غير مُثبت أن يتحمل حركة مرور حقيقية بينما يلتقط نموذج مُثبت المكالمات التي يخطئ فيها. حتى توجد نقطة النهاية تلك، فإن المقارنة التي يمكنك إجراؤها فعليًا اليوم هي بين نقطة التحقق هذه والنماذج المستضافة للمستندات التي تدفع مقابلها بالفعل، جنبًا إلى جنب على صفحاتك الخاصة.
من الذي يجب أن يتحرك، ومن الذي يجب أن ينتظر؟
انتقل إذا كانت لديك مهمة استخراج مستندات محدودة النطاق — فواتير، كشوف بنكية، عقود، نماذج منظمة — ومتطلبات توطين البيانات أو التدقيق التي تجعل واجهة برمجة التطبيقات المستضافة غير جذابة. ترخيص Apache 2.0، والتكييف المجالي منخفض التكلفة عبر QLoRA، ومُرمِّز بدقة أصلية هي مزيج غير مألوف حقًا لهذا النوع من المهام، وقيود بطاقة النموذج نفسها واضحة بما يكفي حتى لا تفاجأ. انتظر إذا كنت تحتاج إلى نقطة نهاية مستضافة، أو تسعيرًا لكل توكن، أو سلوكًا وكيلًا — لا شيء من ذلك موجود بعد. وانتظر أيضًا قبل اعتبار أي معيار مذكور أعلاه أمرًا محسومًا: كل رقم بارز هو من Cohere، والتشغيل الخارجي الوحيد يرسم صورة أكثر تنافسية في قمة فئة النماذج الصغيرة، ولم يصدر النموذج منذ أقل من أسبوع. ما يستحق المتابعة هو قصة التقديم — في اليوم الذي يدعم فيه كل من Transformers القياسية وإصدار vLLM العام هذا النموذج، يتوقف North Micro Vision عن كونه مستودعًا يتعين عليك مجادلته ويصبح نموذجًا يمكنك ببساطة توجيهه إلى مستنداتك.
