بطاقة رئيسية مُولَّدة مقسّمة اللوحات تقارن بين NVIDIA NemotronLabs AI for Media - Sports Tennis وNorth Micro Vision Instruct، مع تسمية النصف الأيسر بقارئ التنس 31B وشريحة "الإنجليزية فقط" بجانب أيقونة مقطع نقطة تنس، وتسمية النصف الأيمن بمتخصص المستندات 2.4B وشريحة "أكثر من 11 لغة" بجانب أيقونة مستند ومخطط أعمدة، مع شعار OrcaRouter في الزاوية السفلى اليمنى.
Guides & Insights

Nemotron Sports Tennis مقابل North Micro Vision Instruct: قارئ تنس بحجم 31B ضد متخصص مستندات بحجم 2.4B

الكاتب

Elias Hawthorne

تاريخ النشر

أحدث النماذج · 20عرض جميع النماذج
المعايير: Artificial Analysis · يُحدَّث يوميًا
العودة إلى جميع المقالات

الإجابة المختصرة أولاً: NVIDIA NemotronLabs AI for Media - Sports Tennis وNorth Micro Vision Instruct ليسا بديلين لبعضهما، ولا أحد يختار بينهما يجد نفسه في الواقع أمام اختيار حقيقي بينهما. أحدهما نموذج متعدد الوسائط بحجم 31B قامت NVIDIA بضبطه الدقيق ليجيب عن أسئلة تتعلق بنقاط التنس، ويحتاج إلى نحو 80 GB من ذاكرة GPU، ولا يقرأ سوى الإنجليزية. والآخر نموذج لغوي بصري بحجم 2.4B من Cohere يتسع على بطاقة محطة عمل واحدة، ويتعامل مع إحدى عشرة لغة، وقد صُمم قبل كل شيء لقراءة المستندات — الصفحات والمخططات والجداول وOCR.

إنهما يقعان في الفئة العريضة نفسها ولا يكادان يتقاطعان في أي مكان آخر. وما يلي هو النسخة الصادقة من المقارنة: حيث يختلفان فعليًا، وما نشره كل مورّد وما لم ينشره، والحالة الوحيدة التي يكون فيها الاختيار حقيقيًا.

ما صُمِّم كل نموذج للقيام به

يجمع North Micro Vision Instruct بين نموذج لغوي بحجم 2B — هو North Micro LLM من Cohere، وفق معمارية Command A+ — ومشفّر رؤية بمعاملات 400M مُدرَّب تخصيصيًا انطلاقًا من SigLIP 2 SO400M، ليبلغ الإجمالي 2.4B. ويعمل مسار الرؤية بالدقة الأصلية، محافظًا على نسب الأبعاد بدل تغيير الحجم إلى شبكة ثابتة، ويحقن مُسقِط DeepStack تضمينات الرقع من طبقات مشفّر متعددة في طبقات اللغة المبكرة المقابلة بدل إضافة تمثيل واحد في المقدمة. والإطار الذي أعلنته Cohere هو أساس مضغوط للنمذجة الأولية والضبط الدقيق الخاص بمهام محددة، مع فهم المستندات كالقدرة الرائدة. وبطاقة النموذج صريحة على نحو غير معتاد بشأن السقف: North Micro Vision Instruct صراحةً ليس نموذج استدلال، ولا يملك استدعاء أدوات، ولم يُدرَّب على التوجيهات النظامية.

Sports Tennis هو الشكل المعاكس في كل بُعد. بدأت NVIDIA من نقطة التحقق الخاصة بها Nemotron 3 Nano Omni 30B-A3B-Reasoning — خليط خبراء هجين من Mamba2-Transformer، بإجمالي 31 مليار معامل، مع نحو 3 مليارات معامل نشط لكل توكن — وضبطته ضبطًا دقيقًا على مجموعة بيانات تنس خاصة وموسومة يدويًا. جُمّد كل من مُشفّر الرؤية (C-RADIOv4-H) ومُشفّر الكلام (Parakeet)؛ ولم تتحرك سوى معاملات نموذج اللغة. والنتيجة نموذج ضيّق النطاق بحكم التصميم: يجيب عن أسئلة منظمة متعددة الخيارات وأسئلة مفتوحة عبر مقطع كامل لنقطة تنس، تشمل ميكانيكا الضربات، والتمركز في الملعب، وحركة اللاعب، ووقائع المباراة، ومعرفة القواعد، والإشارات الصوتية. تصفه NVIDIA بأنه يعمل على أفضل نحو عندما تُمرَّر نقطة كاملة — من الإرسال حتى نهاية التبادل — كمدخل.

الأبعاد التي تفصل بينهم فعليًا

• المعاملات — North Micro Vision Instruct: 2.4 مليار (2 مليار للغة، 400 مليون للرؤية). Sports Tennis: 31 مليارًا إجمالًا، ~3 مليارات نشطة لكل رمز.

• المُدخلات — North Micro Vision Instruct: نص وصور متداخلة، الدقة الأصلية، صور متعددة. Sports Tennis: فيديو حتى دقيقتين، وصوت حتى ساعة، وصور، ونص.

• المخرجات — كلاهما يُرجع نصًا. بالإضافة إلى ذلك، يُرجع North Micro Vision Instruct صناديق إحاطة للتأسيس على مقياس مُعاير من 0 إلى 1000.

• اللغات — North Micro Vision Instruct: أحد عشر أو أكثر، بما في ذلك الإنجليزية والألمانية والفرنسية والإسبانية والإيطالية والبرتغالية والهندية واليابانية والكورية والصينية والعربية. Sports Tennis: الإنجليزية فقط.

• السياق — North Micro Vision Instruct: عمود فقري لغوي بسعة 128 ألف رمز، لكن Cohere تُشير إلى أن النطاق متعدد الوسائط المُتحقَّق منه يصل إلى 8 آلاف رمز، مع اعتماد السياقات متعددة الوسائط الأطول على الاستقراء وكونها غير مُختبَرة بمعايير قياسية. Sports Tennis: حتى 256 ألف رمز.

• الحجم — North Micro Vision Instruct: حوالي 4.97 GB بدقة BF16، ونحو 2.17 GB عند 4 بت. Sports Tennis: حوالي 62 GB بدقة BF16، ويتطلب وحدة معالجة رسومات واحدة بسعة 80 GB.

• الترخيص — North Micro Vision Instruct: Apache 2.0. Sports Tennis: OpenMDW-1.1، مع ذكر البطاقة للاستخدام التجاري وغير التجاري.

A generated two-column scoreboard titled 'NVIDIA NemotronLabs AI for Media - Sports Tennis vs North Micro Vision Instruct — the scoreboard.' Left column lists Parameters 31B (about 3B active), Inputs video audio image text, Languages English only, Published benchmarks none, Footprint about 62 GB, GPU floor 1 x 80 GB. Right column lists Parameters 2.4B, Inputs interleaved text and images at native resolution, Languages eleven or more, Published benchmarks DocVQA 0.921 / ChartQA 0.808 / OCRBench 0.792 / MMMU 0.329, Footprint about 5 GB at BF16, GPU floor a single workstation card. Footer reads 'NVIDIA figures from its model card with no published results; Cohere figures vendor-reported.'

معايير القياس: أحد النموذجين يمتلكها، والآخر يمتلك بروتوكولاً

هنا بالتحديد، لا يمكن أن تختلف البطاقتان أكثر من ذلك في الوضعية.

تنشر Cohere أرقامًا لـ North Micro Vision Instruct. DocVQA 0.921، وChartQA 0.808، وOCRBench 0.792 — وMMMU 0.329. جميعها مُبلَّغ عنها من الجهة المورّدة، ولم يُعِد أحد إنتاجها بشكل مستقل، كما تشير Cohere نفسها إلى أن نتائج OCR تتفاوت بشكل حاد حسب التقسيم. هذا الرقم الأخير يستحق التوقف عنده: درجة MMMU البالغة 0.329 منخفضة، وهي متسقة مع كل ما تقوله البطاقة عن تصميم النموذج. هذا متخصص في القراءة، وليس نموذج استدلال عام، والشركة التي بنته تقول ذلك. هذا النوع من الإفصاح أكثر فائدة من رقم مُطْرٍ.

لا تنشر NVIDIA شيئًا. تصف بطاقة Sports Tennis تقييمها بعناية — قسم اختبار من 12 مباراة محتجزة بالكامل، و2,689 مقطعًا على مستوى النقاط و80,872 سؤالًا من مباريات لا تتداخل مع التدريب، تُقيَّم بواسطة دقة الاختيار من متعدد الآلية، و pass@9 بتقييم LLM-as-judge على الردود المفتوحة، مع استبعاد تقسيم المباريات المرئية صراحةً من الاختبار المُبلَّغ عنه — ثم لا تبلّغ عن أي نتيجة من أي منها. الجانب التدريبي مفصل بالقدر نفسه: 1,312,129 مثال سؤال وجواب، و1,226,081 مثال اختيار من متعدد و86,048 مثالًا مفتوحًا، مستمدة من 43,084 مقطعًا على مستوى النقاط عبر 239 مباراة، وموسومة وفق 38 فئة وسم.

حتى لو كانت NVIDIA قد نشرت النتائج، فلن تكون قابلة للمقارنة. لا يوجد أي معيار مرجعي يظهر فيه كلٌ من نموذج فهم المستندات ونموذج نقاط التنس. إن التداخل بين هاتين القصتين التقييميتين يساوي صفرًا.

A screenshot of the Hugging Face model card for CohereLabs/North-Micro-Vision-Instruct, captured September 11, 2026, showing the description as a 2.4B-parameter open-weight vision-language model with native-resolution image support under Apache 2.0, model details listing a 2B language model and a 400M vision encoder custom-trained from SigLIP 2 SO400M, a 128K-token language backbone context with an 8K validated multimodal range, eleven listed languages, and the note that public vLLM support is coming soon.

النشر: حيث يكمن الفرق العملي

نموذج 2.4B هو، بفارق كبير، الأسهل في التشغيل. تعني أوزان BF16 التي تبلغ نحو 5 GB أن وحدة معالجة رسومات واحدة حديثة في محطة عمل قادرة على تشغيله، بينما تصل النسخة رباعية البتات، عند نحو 2.17 GB، إلى حجم أصغر من ذلك. توجد منافذ مستقلة لبيئة تشغيل Core AI من Apple، مع ما يُذكر من نحو 18.2 رمز/ثانية عند int8 على iPhone 17 Pro، وفشل تكميم int4 فشلًا تامًا. العقبة تكمن في البرمجيات: يتطلب North Micro Vision Instruct الإصدار Transformers 5.16.0 — القابل للتثبيت من المصدر حتى يصل إلى PyPI — كما كان دعم vLLM العام لا يزال موصوفًا بأنه قادم قريبًا على بطاقة النموذج. تُدعم عملية الضبط الدقيق عبر Axolotl. لا توجد واجهة برمجة تطبيقات مستضافة من الطرف الأول؛ والمسار العملي هو الاستضافة الذاتية.

Sports Tennis هو الشيء الأصعب في التشغيل ولا مفر من ذلك. وحدة GPU واحدة بسعة 80 GB بدقة BF16، ولا توجد نقطة تفتيش مُكمّمة منشورة، الإنجليزية فقط، وLinux فقط، على PyTorch/Transformers أو NeMo أو Megatron. اختبرت NVIDIA على A100، وH100، وH200، وB200، وGB200 NVL72، وRTX PRO 6000 SE، وL40S، وDGX Spark، وJetson Thor، وRTX 5090 — قائمة عتاد تقول عمّا أرادت NVIDIA التحقق منه أكثر مما تقول عمّا يستطيع فريق عادي توفيره. سياسة الاستدلال الافتراضية للبطاقة بالحد الأدنى أيضًا: إطاران في الثانية حتى 128 إطارًا، و256 توكنًا جديدًا، وفك ترميز جشع.

لا يُقدَّم أيٌّ من النموذجين على OrcaRouter. لا يملك North Micro Vision Instruct نقطة نهاية من الجهة الأولى، وهو غير موجود في كتالوجنا؛ ولا يملك Sports Tennis نقطة نهاية في أي مكان، بما أن NVIDIA نشرت الأوزان ولم توفّر خدمة مستضافة. كلاهما قراران يخصّان الاستضافة الذاتية.

ما تفيد فيه طبقة التوجيه هو خط الأنابيب المحيط بها — أيًا من هذه تشغله محليًا، فإن نماذج النسخ والتلخيص والاسترجاع والتطبيق التي تحيط به تكون مستضافة، ووضع تلك خلف مفتاح API واحد مع تجاوز الفشل التلقائي يتجنب إنشاء مجموعة بيانات اعتماد وعقد منفصلة لكل منها. نمرر سعر قائمة المزود كما هو بهامش ربح 0% على النماذج التي نوفرها، لذا تبقى الأجزاء من المنظومة التي لا تستضيفها بنفسك بسعر البائع.

A screenshot of the Hugging Face model card for nvidia/NVIDIA-NemotronLabs-AI-for-Media-Sports-Tennis, captured September 11, 2026, showing the At a Glance table with 31B total parameters, about 3B active, a 256k-token context, video/audio/image/text input, text output, 1.31M Q&A pairs over 43k point clips, and a minimum GPU of one A100 80GB or H100 80GB, alongside a sidebar showing two downloads last month and no inference provider deployment.

عندما يكون الخيار حقيقيًا

هناك سيناريو واحد يكون فيه الاختيار بين هذين قرارًا حقيقيًا، ويستحق أن نكون محددين بشأنه لأنه ليس واضحًا.

إنها حالة مؤسسة إعلامية أو رياضية تعالج بالفعل المستندات وتريد إضافة فهم الفيديو على مستوى النقطة. قناة بث لديها خط أنابيب أرشيف، أو دوري لديه تقارير مباريات وملفات PDF إحصائية، أو صاحب حقوق لديه نصوص ومقاطع مصورة معًا — بالنسبة لهم، من المرجح أن North Micro Vision Instruct موجود بالفعل في المنظومة لأغراض OCR واستخراج المخططات، بينما Sports Tennis هي القدرة الجديدة التي سيضيفونها. السؤال ليس "أيهما" بل "ما الذي تكلفني به القدرة الثانية من حيث البنية التحتية"، والجواب هو وحدة معالجة رسومات في مركز بيانات وقيود اللغة الإنجليزية فقط.

خارج تلك الحالة، لا يتنافس النموذجان ببساطة. إذا كنت بحاجة إلى قراءة المستندات بإحدى عشرة لغة على بطاقة محطة عمل، فإن North Micro Vision Instruct هو الجواب وSports Tennis غير ذي صلة بك. وإذا كنت بحاجة إلى طرح أسئلة منظمة حول نقاط التنس مع سياق صوتي، فإن Sports Tennis هو الوحيد بين الاثنين الذي يفعل ذلك، وكونه يفتقر إلى معايير أداء منشورة يمثل مخاطرة تقبلها بدلًا من أن يكون سببًا لاختيار النموذج الآخر.

أيهما أختار؟

اختر North Micro Vision Instruct إذا كان عملك يتضمن المستندات أو المخططات أو التعرّف الضوئي على الحروف (OCR) أو الإرساء أو فهم الصور متعدد اللغات، وإذا كنت تقدّر مورّدًا ينشر أرقامه الضعيفة إلى جانب أرقامه القوية. إنه صغير، وبترخيص Apache 2.0، وموثّق جيدًا، وصادق بشأن كونه ليس نموذج استدلال. إن MMMU الخاص به البالغ 0.329 ليس عيبًا تكتشفه لاحقًا؛ بل تخبرك Cohere به مسبقًا.

لا تختر NVIDIA NemotronLabs AI for Media - Sports Tennis إلا إذا كنت تحتاج تحديدًا إلى استدلال على مستوى النقاط في التنس مع الصوت، وكان لديك وحدة معالجة رسومات بسعة 80 جيجابايت يمكنك الاستغناء عنها، وكنت مرتاحًا لأن تكون أول من يقيّمه. لم ينشر أحد نتيجة لهذا النموذج، لذا فإن التنزيل هو التجربة. هذا ليس سببًا لتجنّبه — فمتخصص ضيّق النطاق بمجموعة تدريب موسومة بعناية فائقة من 43,084 مقطعًا هو بالضبط نوع النماذج الذي يمكن أن يتفوق على نموذج عام في مهمته الخاصة — لكنه سبب لاعتبار أول عملية نشر تجربةً لا التزامًا.

الشيء الوحيد الذي لا ينبغي أن تفعله هو أن تتعامل مع هذين على أنهما قابلان للتبادل لمجرد أن كليهما مكتوب على البطاقة «نموذج رؤية-لغة». فقارئ المستندات ومحلّل التنس لم يكونا يومًا المنتج نفسه، وفي هذين النموذجين، الفرق في ما يفعلانه أكبر بكثير من الفرق في مدى إتقانهما لما يفعلانه.