
Nemotron Sports Tennis مقابل Microsoft Mage-VL: طريقتان لقراءة بث رياضي
- deepseekجديدDeepSeek: DeepSeek V4.1 Flash2026-09-10$0.15 / $0.60 لكل مليون رمز
- openaiجديدOpenAI: GPT-6 Astra2026-09-0453الذكاء77البرمجة
- googleجديدGoogle: Gemini 3.8 Flash2026-09-0241الذكاء76البرمجة
- qwenجديدQwen: Qwen3.8 Max (0902)2026-09-0240الذكاء72البرمجة
- anthropicجديدAnthropic: Claude Fable 5.12026-09-0153الذكاء82البرمجة
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 لكل مليون رمز
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642الذكاء72البرمجة
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.24 / $0.73 لكل مليون رمز
- z-aiZ.ai: GLM 5.32026-08-1845الذكاء75البرمجة
- obsidianQwen3.8 27B2026-08-1534الذكاء68البرمجة
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236الذكاء69البرمجة
- grokSpaceXAI: Grok 4.62026-08-1244الذكاء77البرمجة
- metaMeta: Muse Spark 1.22026-08-0540الذكاء72البرمجة
- qwenQwen: Qwen3.8 Max2026-08-0340الذكاء72البرمجة
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135الذكاء69البرمجة
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 لكل مليون رمز
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2451الذكاء78البرمجة
- googleGoogle: Gemini 3.6 Flash2026-07-2134الذكاء69البرمجة
لدى Microsoft Mage-VL رقم يمكن الإشارة إليه: في معيار توقيت الاستجابة SoccerNet يسجل TimVal قدره 55.54 وPR-AUC قدره 9.30، وهو الأفضل في المقاييس الحساسة للدقة على الرغم من أنه لم يُدرَّب قط على مجموعة البيانات تلك، ويوضح مؤلفوه أنه ظل صامتًا خلال بث كأس العالم 2026 حتى الثانية 29.36، حين ينطلق لاعب ويطلق النموذج تعليقًا مباشرًا. أما NVIDIA NemotronLabs AI for Media - Sports Tennis فليس لديه أي رقم على الإطلاق. إنه نموذج متعدد الوسائط بحجم 31B مُضبط بدقة على 43,084 مقطعًا لنقاط التنس نشرته NVIDIA في سبتمبر 2026 مع بروتوكول تقييم كامل على بطاقته ولا نتيجة واحدة منه.
فهذه ليست مواجهة مباشرة يمكن تسجيل نقاطها. لكنها تبقى مقارنة مفيدة حقًا، إذ يجيب النموذجان عن السؤال نفسه — هل يمكن لنموذج رؤية-لغة أن يتابع رياضة مباشرة — من خلال رهانين معماريين متعارضين، أحدهما مدعوم بالأدلة والآخر مدعوم بوصف للبيانات. هذا التفاوت هو المقال.
التفرع: بث، أم مقطع
يُعدّ اختلاف التصميم أكثر أهمية من أعداد المعاملات، وهو يفسّر كل شيء آخر تقريبًا بشأن هذين النموذجين.
تم بناء Microsoft Mage-VL حول الفيديو المستمر. مشفّره البصري، Mage-ViT، مدرَّب من الصفر ويقرأ الفيديو بالطريقة التي يقرأ بها برنامج الترميز: فهو يقسّم التدفق إلى إطارات مرجعية (I)، تُحتفظ بها كاملة، وإطارات متوقعة (P)، حيث لا تُحتفظ إلا بالرقع التي تحمل حركة حقيقية أو تفاصيل جديدة، على شبكة رقع مشتركة بحجم 16×16. وهذا يقلل الرموز البصرية بأكثر من 75%، ووفقًا لـ Microsoft، يمنح تسريعًا في زمن الاستدلال الفعلي يصل إلى 3.5× مقارنةً بأخذ عينات الإطارات المنتظم. وفوق ذلك يوجد تقسيم بين النظام 1 والنظام 2: بوابة إدراك خفيفة تُقيّم كل نافذة متحركة وتظل صامتة تجاه المحتوى الروتيني، ولا تستدعي النموذج الكامل إلا عند اكتمال حدث يستحق استجابة. إنه نموذج واحد يؤدي المهمتين، وليس خط أنابيب.
يأخذ نموذج التنس الخاص بشركة NVIDIA الرهان الآخر بالكامل. تنص بطاقته صراحةً على أنه «يعمل على أفضل وجه عندما يُمرَّر مقطع كامل لنقطة تنس كمدخل» — من الإرسال حتى نهاية تبادل الضربات، وحتى دقيقتين من mp4، مع الصوت. سياسة الاستدلال الافتراضية هي إطاران في الثانية حتى 128 إطارًا، و256 رمزًا جديدًا، وفك ترميز جشع، وفيديو مع صوت. لا توجد بوابة، ولا وضع بث، ولا مُشغِّل أحداث. إنه نموذج للإجابة عن الأسئلة حول مقطع محدود: تعطيه نقطة، وتسأله عمّا حدث، فيخبرك.
هذان ليسا تنفيذين لفكرة واحدة. الإدراك أثناء البث والاستدلال على مستوى المقاطع منتجان مختلفان. جهة بثّ تريد تعليقًا مباشرًا تحتاج إلى شكل Mage-VL. ومحلل يريد الاستعلام عن أرشيف من 43,084 نقطة يحتاج إلى شكل Sports Tennis. ولا يصلح أي من النموذجين كبديل جاهز لمهمة الآخر.
كلاهما مبني على بنية أساسية هجينة — مع اختلاف واحد مهم
• المعاملات — Sports Tennis: إجمالي 31B، ونحو 3B نشطة لكل توكن، MoE هجين يجمع بين Mamba2 وTransformer. Mage-VL: إجمالي 4B، حيث يقترن Mage-ViT بحجم 316M بفك ترميز Qwen3-4B-Instruct-2507.
• المشفّرات — يجمّد Sports Tennis كلاً من مشفّر الرؤية C-RADIOv4-H ومشفّر الكلام Parakeet، ويضبط بدقة معلمات نموذج اللغة فقط. يدرّب Mage-VL كامل حزمة الرؤية لديه من الصفر على نحو 100 مليون صورة وفيديو غير موسومة، مع نموذج اللغة Qwen3 بوصفه المكوّن الوحيد المُدرَّب مسبقًا.
• الصوت — يتعامل Sports Tennis مع الصوت كمدخل من الدرجة الأولى، ويُدرج تفسير الإشارات الصوتية ضمن فئاته الـ38 للتعليق التوضيحي. وخط أنابيب Mage-VL المنشور بصري؛ وعمل SoccerNet يتعلق بتوقيت الاستجابة على الإطارات.
• الوسائط المُخرَجة — كلاهما ينتج نصًا فقط.
• تأثير المضاعف — لأن Mage-ViT كان أرخص في التدريب المسبق من برج رؤية واسع النطاق على الويب، تُفيد Microsoft بتدريب على فيديوهات لمدة أطول 8× ضمن الميزانية نفسها. أما ادعاء NVIDIA بالكفاءة فهو معماري بدلاً من ذلك: 3B معاملات نشطة لكل رمز من إجمالي 31B.

أين تكمن الأدلة
هذا هو الجزء من المقارنة الذي لا يوجد فيه تقارب، ويجدر ذكره بوضوح.
Microsoft Mage-VL نموذج منشور، له تقرير فني، وصفحة مشروع، ومستودع GitHub، ونطاق معايير يغطي فهم الصور، وفهم الفيديو، والتأصيل الزمني، والاستدلال المكاني، والبث. مقابل Qwen3-VL-4B — النواة اللغوية نفسها بحجم 4B، مع تبديل مُرمّز الرؤية فقط — يحقّق Mage-VL تحسنًا على كل معيار فيديو وتأصيل زمني مُبلَّغ عنه، مع أكبر المكاسب في المهام كثيفة التوطين: +22.5 على Timelens-QVHighlight، و+17.1 على ActivityNet، و+11.0 على VSI-Bench، و+24.5 على VideoEval-Pro. ويسجّل DocVQA 95.14، وMMStar 67.32، وCrossPoint 80.00 على جانب الصور، وVideoMME 64.0 وLongVideoBench 61.3 على الفيديو، ودرجة إجمالية 64.00 على OVO-Bench من بين معماريات البث. كل هذه أرقام مُبلَّغ عنها من Microsoft ولم يُعِد أحد إنتاج أي منها بشكل مستقل — لكنها موجودة، وهي كثيرة، وهي متسقة داخليًا عبر مجموعة واسعة على نحو غير معتاد من المهام.
لا يقدّم Sports Tennis أي نتائج. توثّق بطاقته قسماً اختبارياً من 12 مباراة مستبعدة بالكامل، مع 2,689 مقطعاً على مستوى النقاط و80,872 سؤالاً، وتصف التقييم عبر دقة الاختيار من متعدد الآلية وLLM-as-judge pass@9، وتشير إلى أن تقسيم المباريات غير المرئية فقط هو ما استُخدم في الاختبار المُبلَّغ عنه — ثم لا تنشر أي نتيجة. ومجموعة بيانات التدريب الخاصة به حقيقية ومحدّدة: 1,312,129 مثال سؤال وجواب، و1,226,081 اختيار من متعدد و86,048 سؤالاً مفتوح النهاية، من 43,084 مقطعاً عبر 239 مباراة، موسومة وفق 38 فئة وسم من لقطات بثّ ولقطات ملتقطة في الملعب لعام 2025. لا يمكن التحقق من أي من ذلك من الخارج، والأرقام التي من شأنها أن تجعله قابلاً للتحقق مفقودة.
ثمة تحفظ واحد يسير في الاتجاه المعاكس، ويجدر تسميته حتى لا يُقرأ هذا كنصر خالص لمايكروسوفت. SoccerNet ليس التنس. تأتي أوراق اعتماد Mage-VL في البث المباشر من بيانات بث كرة القدم وفق بروتوكول محدد، وعرضه التوضيحي في كأس العالم 2026 ليس سوى عرض توضيحي. أما ما إذا كانت البوابة الأصلية للكوديك تنتقل بسلاسة إلى التنس — حيث تكون النقاط قصيرة ومتكررة وشديدة البنية — فأمر غير مختبر. الفرق أن ادعاء Mage-VL قابل للدحض على الأقل من طرف ثالث، أما ادعاء Sports Tennis فغير قابل للدحض من أي شخص دون مجموعة بيانات NVIDIA.

ما يتطلبه تشغيلها
الفجوة هنا تبلغ نحو خمسة أضعاف في العتاد، وهي التي تحدد من يستطيع واقعيًا تجربة كل نموذج.
• رياضة التنس — وحدة معالجة رسوميات واحدة بنحو 80 غيغابايت عند BF16، والأوزان حوالي 62 غيغابايت. يلزم A100 80GB أو H100 80GB كحد أدنى، ويُوصى بـ B200 أو H200. لا تُنشر أي نقطة تفتيش مُكمَّمة، لذا لا يوجد مسار رخيص للتقليص. الإنجليزية فقط. بيئات التشغيل هي PyTorch/Transformers بالإضافة إلى NeMo وMegatron.
• Mage-VL — حوالي 10.6 GB عند BF16، ما يجعل بطاقة GPU بسعة 16 GB الحد العملي الأدنى للعمل على الصور، و24 GB أو أكثر للفيديو الطويل والبث. رخصة Apache-2.0 لـ Mage-VL وMIT لـ Mage-ViT، مع أن مستودع العائلة يذكر أن النماذج أُطلقت لأغراض البحث فقط. لاحظ الجوانب الحرجة: trust_remote_code مطلوب، ولا يوجد مسار تقديم عبر vLLM أو SGLang بعد، ويحتاج خط أنابيب الترميز إلى FFmpeg أو ffprobe — مع احتياج مسار الترميز العصبي أيضًا إلى DCVC-RT.
إذا كنت تريد تقييم نموذج لفيديو الرياضة هذا الشهر على بطاقة واحدة في محطة عمل، فإن Mage-VL هو الوحيد من بين الاثنين الذي يمكنك تحميله فعلاً. وهذا حكم عملي حتى في غياب حكم مبني على اختبار معياري.

أيّ واحد قد تلجأ إليه
لأي شيء مباشر — التعليق، وكشف الأحداث على بثّ جارٍ، والتنبيه منخفض الكمون على فيديو البث — فإن Microsoft Mage-VL هو الخيار القابل للدفاع عنه اليوم: فقد صُمّم لهذا الغرض تحديدًا، ولديه معيار قياس أداء البث ليُحتجّ به لصالحه، ويعمل على العتاد الذي تملكه معظم الفرق بالفعل. أما العمل الكثيف بالأرشيف، ذو الشكل الاستعلامي، في التنس على وجه التحديد — بناء فهرس قابل للبحث للنقاط، وإجراء تحليل منظّم عبر آلاف التبادلات، وطرح أسئلة يكون فيها مقطع النقطة كاملًا هو وحدة المعنى — فإن نموذج NVIDIA هو الوحيد من بين الاثنين الذي بُني لهذا الغرض. أما ما إذا كان يؤدي المهمة جيدًا، فحتى سبتمبر 2026، فهو غير معروف حقًا.
ثمة خيار ثالث يستحق الذكر، لأنه المآل الذي تنتهي إليه معظم خطوط المعالجة الحقيقية. إن أردت تجربة النموذج المتخصص غير المُثبت دون المراهنة على مسار إنتاجي به، فأبقِه خلف الواجهة نفسها التي تثق بها للنماذج التي تعتمد عليها. ولا يوفّر OrcaRouter أيًّا من هذين — فقد نشرت NVIDIA الأوزان بلا نقطة وصول، وMage-VL ليس لديه مسار خدمة مستضاف — لذا فكلاهما قرار استضافة ذاتية. وما مفتاح واحد يغطي أكثر من 200 نموذج مستضافيشتريه لك هو بقية المنظومة: نماذج النسخ والتلخيص والتطبيقات المحيطة بمكوّن الفيديو الرياضي تبقى خلف نقطة وصول واحدة، مع تحويل تلقائي عند تراجع أي مزوّد، والمكوّنان المتحرّكان الوحيدان اللذان تملكهما هما النموذجان المتخصصان اللذان تشغّلهما بنفسك.
الحكم
Microsoft Mage-VL وNVIDIA NemotronLabs AI for Media - Sports Tennis ليسا متنافسين بالمعنى الذي تعنيه عادةً صفحة المواجهة. فـMage-VL نموذج بثّ منشور ومُختبَر بمعايير أداء، بحجم 4B، يعمل على محطة عمل، ولديه عرض توضيحي حقيقي لتعليق رياضي مُفعّل بالحدث. أما Sports Tennis فهو متخصص غير معلن عنه، وغير مُختبَر بمعايير، بحجم 31B، على مستوى المقاطع، ويحتاج إلى وحدة معالجة رسومية في مركز بيانات، ولا يحمل أي دليل منشور على أنه يعمل.
احكم بناءً على الأدلة، ويفوز Mage-VL بالانسحاب. احكم بناءً على النطاق، وهما لا يتداخلان. لكن هناك سبب لمواصلة متابعة نموذج NVIDIA: ضبط دقيق لمشفّر مجمّد على 43,084 نقطة تنس مُعلّمة بشكل صحيح هو بالضبط نوع مجموعة التدريب العمودية الضيقة عالية الجودة التي لا تمتلكها النماذج العامة، وإذا نشرت NVIDIA يومًا ما النتائج المحجوزة، فسيحصل سؤال المتخصص مقابل العام في الفيديو الرياضي على أول إجابة حقيقية له. حتى ذلك الحين، Mage-VL هو النموذج الذي يملك الإثباتات، وSports Tennis هو النموذج الذي يملك وعدًا.
