
Nemotron Sports Tennis לעומת Microsoft Mage-VL: שתי דרכים לקרוא שידור ספורט
- deepseekחדשDeepSeek: DeepSeek V4.1 Flash2026-09-10$0.15 / $0.60 לכל 1M טוקנים
- openaiחדשOpenAI: GPT-6 Astra2026-09-0453אינטליגנציה77כתיבת קוד
- googleחדשGoogle: Gemini 3.8 Flash2026-09-0241אינטליגנציה76כתיבת קוד
- qwenחדשQwen: Qwen3.8 Max (0902)2026-09-0240אינטליגנציה72כתיבת קוד
- anthropicחדשAnthropic: Claude Fable 5.12026-09-0153אינטליגנציה82כתיבת קוד
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 לכל 1M טוקנים
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642אינטליגנציה72כתיבת קוד
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.24 / $0.73 לכל 1M טוקנים
- z-aiZ.ai: GLM 5.32026-08-1845אינטליגנציה75כתיבת קוד
- obsidianQwen3.8 27B2026-08-1534אינטליגנציה68כתיבת קוד
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236אינטליגנציה69כתיבת קוד
- grokSpaceXAI: Grok 4.62026-08-1244אינטליגנציה77כתיבת קוד
- metaMeta: Muse Spark 1.22026-08-0540אינטליגנציה72כתיבת קוד
- qwenQwen: Qwen3.8 Max2026-08-0340אינטליגנציה72כתיבת קוד
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135אינטליגנציה69כתיבת קוד
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 לכל 1M טוקנים
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2451אינטליגנציה78כתיבת קוד
- googleGoogle: Gemini 3.6 Flash2026-07-2134אינטליגנציה69כתיבת קוד
ל-Microsoft Mage-VL יש מספר שאפשר להצביע עליו: בבנצ'מרק תזמון התגובה של SoccerNet הוא מציג TimVal של 55.54 ו-PR-AUC של 9.30, הטוב ביותר במדדים הרגישים לדיוק למרות שמעולם לא אומן על מערך הנתונים הזה, והמחברים שלו מדגימים אותו צופה בשידור שלם של מונדיאל 2026, כשהוא שותק עד 29.36 שניות, כאשר שחקן פורץ והמודל מפעיל פרשנות חיה. ל-NVIDIA NemotronLabs AI for Media - Sports Tennis אין מספר בכלל. זהו מודל מולטימודלי של 31B שעבר כיוונון עדין על 43,084 קליפים של נקודות טניס; NVIDIA פרסמה אותו בספטמבר 2026 עם פרוטוקול הערכה מלא בכרטיס שלו, ואף לא תוצאה אחת ממנו.
אז זה לא קרב ראש-בראש שאפשר לתת לו ניקוד. זו בכל זאת השוואה מועילה באמת, כי שני המודלים עונים על אותה שאלה — האם מודל חזותי-לשוני יכול לעקוב אחר ספורט חי — עם הימורים ארכיטקטוניים הפוכים, ואחד מההימורים האלה מגובה בראיות בעוד שהאחר מגובה בתיאור נתונים. האסימטריה הזו היא המאמר.
הפיצול: זרם, או קליפ
ההבדל בתכנון חשוב יותר ממספר הפרמטרים, והוא מסביר כמעט כל דבר אחר לגבי שני המודלים האלה.
Microsoft Mage-VL בנוי סביב וידאו רציף. המקודד החזותי שלו, Mage-ViT, מאומן מאפס וקורא וידאו כפי שקודק עושה: הוא מפצל זרם לפריימי עוגן (I), הנשמרים במלואם, ולפריימים חזויים (P), שבהם נשמרים רק הטלאים הנושאים תנועה ממשית או פרט חדש, על רשת טלאים משותפת של 16×16. זה מפחית אסימונים חזותיים ביותר מ-75%, ולפי מיקרוסופט מניב האצת הסקה בזמן שעון של עד פי 3.5 לעומת דגימת פריימים אחידה. מעל זה יושבת חלוקה של מערכת 1 / מערכת 2: שער קוגניציה קל-משקל נותן ציון לכל חלון מתגלגל ושותק בתוכן שגרתי, ומפעיל את המודל המלא רק כאשר אירוע הראוי לתגובה מסתיים. זהו מודל אחד שמבצע את שני התפקידים, לא צינור עיבוד.
המודל לטניס של NVIDIA בוחר בהימור האחר לחלוטין. הכרטיס שלו מציין במפורש שהוא "עובד בצורה הטובה ביותר כאשר קטע מלא של נקודת טניס מועבר כקלט" — מההגשה ועד סוף הנקודה, עד שתי דקות של mp4, עם אודיו. מדיניות ההסקה המוגדרת כברירת מחדל היא 2 פריימים לשנייה עד 128 פריימים, 256 טוקנים חדשים, פענוח חמדני, וידאו ואודיו. אין שער, אין מצב סטרימינג, אין טריגר אירוע. זהו מודל לשאלות ותשובות על קטע תחום: אתה נותן לו נקודה, אתה שואל מה קרה, והוא מספר לך.
אלה אינן שתי מימושים של רעיון אחד. תפיסה בזרימה וחשיבה ברמת קליפ הן מוצרים שונים. גוף שידור שרוצה פרשנות בזמן אמת זקוק לצורה של Mage-VL. אנליסט שרוצה לבצע שאילתות בארכיון של 43,084 נקודות זקוק לצורה של Sports Tennis. אף אחד מהמודלים אינו מהווה תחליף ישיר לתפקידו של האחר.
שניהם בנויים על עמוד שדרה היברידי — עם הבדל חשוב אחד
• פרמטרים — Sports Tennis: סה״כ 31B, כ־3B פעילים לכל טוקן, MoE היברידי של Mamba2-Transformer. Mage-VL: סה״כ 4B, Mage-ViT בגודל 316M המשויך לדקודר Qwen3-4B-Instruct-2507.
• מקודדים — Sports Tennis מקפיא גם את מקודד הראייה C-RADIOv4-H וגם את מקודד הדיבור Parakeet, ומכוונן עדין רק את פרמטרי מודל השפה. Mage-VL מאמן את כל סטאק הראייה שלו מאפס על כ-100 מיליון תמונות וסרטונים ללא תוויות, כאשר מודל השפה Qwen3 הוא הרכיב המאומן מראש היחיד.
• אודיו — Sports Tennis מתייחס לאודיו כקלט ממדרגה ראשונה ומציין פרשנות של רמזי אודיו בין 38 קטגוריות התיוג שלו. הצינור המפורסם של Mage-VL הוא חזותי; עבודת SoccerNet עוסקת בתזמון תגובות על פריימים.
• מודאליות פלט — שניהם מפיקים טקסט בלבד.
• אפקט המכפיל — מכיוון שאימון מקדים של Mage-ViT היה זול יותר מאשר של מגדל חזותי בקנה מידה אינטרנטי, Microsoft מדווחת על אימון על סרטונים ארוכים פי 8 באותו תקציב. הטענה של NVIDIA ליעילות היא לעומת זאת ארכיטקטונית: 3B פרמטרים פעילים לכל טוקן מתוך 31B בסך הכול.

היכן נמצאות הראיות
זהו החלק בהשוואה שאינו צמוד, וכדאי לומר זאת בבירור.
Microsoft Mage-VL הוא מודל שפורסם עם דו״ח טכני, דף פרויקט, מאגר GitHub ומגוון בנצ׳מרקים המכסה הבנת תמונות, הבנת וידאו, עיגון טמפורלי, הסקה מרחבית וסטרימינג. לעומת Qwen3-VL-4B — אותו בסיס לשוני של 4B, כשרק מקודד הראייה הוחלף — Mage-VL משתפר בכל בנצ׳מרק מדווח של וידאו ועיגון טמפורלי, עם השיפורים הגדולים ביותר במשימות עתירות לוקליזציה: +22.5 ב-Timelens-QVHighlight, +17.1 ב-ActivityNet, +11.0 ב-VSI-Bench, +24.5 ב-VideoEval-Pro. הוא מדווח על DocVQA 95.14, MMStar 67.32 ו-CrossPoint 80.00 בצד התמונות, VideoMME 64.0 ו-LongVideoBench 61.3 בווידאו, וציון כולל של 64.00 ב-OVO-Bench בקרב ארכיטקטורות סטרימינג. כל אלה מדווחים על ידי Microsoft ואף אחד מהם לא שוחזר באופן עצמאי — אבל הם קיימים, הם רבים, והם עקביים פנימית על פני קבוצה רחבה באופן יוצא דופן של משימות.
Sports Tennis לא מדווח דבר. הכרטיס שלו מתעד מחיצת בדיקה של 12 משחקים שהוצאו לחלוטין, עם 2,689 קליפים ברמת נקודה ו-80,872 שאלות, מתאר ניקוד לפי דיוק אוטומטי בבחירה מרובה ו-LLM-as-judge pass@9, מציין שרק חלוקת המשחקים שלא נראו שימשה לבדיקה המדווחת — ואז לא מפרסם שום תוצאה. קורפוס האימון שלו אמיתי וספציפי: 1,312,129 דוגמאות שו"ת, 1,226,081 בחירה מרובה ו-86,048 פתוחות, מ-43,084 קליפים ב-239 משחקים, מתויגים לפי 38 קטגוריות תיוג מצילומי שידור ולכידת מגרש משנת 2025. שום דבר מזה אינו ניתן לאימות מבחוץ, והמספרים שהיו הופכים אותו לניתן לאימות חסרים.
הסתייגות אחת פועלת בכיוון ההפוך, וכדאי לציין אותה כדי שזה לא ייקרא כניצחון נקי עבור Microsoft. SoccerNet הוא לא טניס. האסמכתאות של Mage-VL בתחום הסטרימינג מגיעות מנתוני שידורי כדורגל תחת פרוטוקול ספציפי, וההדגמה שלו במונדיאל 2026 היא הדגמה. השאלה אם השער הילידי-קודק (codec-native gate) עובר באופן נקי לטניס — שבו הנקודות קצרות, תכופות ובעלות מבנה כבד — טרם נבדקה. ההבדל הוא שהטענה של Mage-VL ניתנת לפחות להפרכה על ידי צד שלישי, ואילו זו של Sports Tennis אינה ניתנת להפרכה על ידי איש ללא מערך הנתונים של NVIDIA.

מה שנדרש כדי להפעיל אותם
הפער כאן הוא בערך פי חמישה בחומרה, והוא קובע מי יכול באופן ריאלי לנסות כל מודל.
• Sports Tennis — GPU אחד עם כ-80 GB ב-BF16, משקולות בסביבות 62 GB. A100 80GB או H100 80GB כמינימום, B200 או H200 מומלצים. לא פורסם צ'קפוינט מכומת, ולכן אין דרך זולה להפחית את הדרישות. אנגלית בלבד. סביבות ההרצה הן PyTorch/Transformers בתוספת NeMo ו-Megatron.
• Mage-VL — כ-10.6 GB ב-BF16, מה שהופך כרטיס מסך של 16 GB לרף המעשי לעבודה עם תמונות, ול-24 GB או יותר עבור וידאו ארוך וסטרימינג. רישיון Apache-2.0 עבור Mage-VL ו-MIT עבור Mage-ViT, אם כי מאגר המשפחה מציין שהמודלים משוחררים למטרות מחקר בלבד. שימו לב לקצוות החדים: trust_remote_code נדרש, אין עדיין נתיב הגשה ב-vLLM או ב-SGLang, וצינור הקודקים זקוק ל-FFmpeg או ל-ffprobe — כאשר נתיב הקודק הנוירוני זקוק בנוסף ל-DCVC-RT.
אם ברצונך להעריך החודש מודל וידאו ספורטיבי על כרטיס תחנת עבודה יחיד, Mage-VL הוא היחיד מבין השניים שתוכל למעשה לטעון. זו הכרעה מעשית גם בהיעדר הכרעת בנצ'מרק.

איזה מהם היית בוחר?
לכל דבר שמתרחש בזמן אמת — פרשנות, זיהוי אירועים בפיד פעיל, התראות בשהיה נמוכה על וידאו משודר — Microsoft Mage-VL היא הבחירה המוצדקת כיום: היא תוכננה בדיוק לכך, יש לה את מבחן הביצועים של סטרימינג כדי לטעון לזכותה, והיא מתאימה לחומרה שרוב הצוותים כבר מחזיקים. לעבודה עתירת ארכיון ובעלת צורת שאילתה בטניס ספציפית — בניית אינדקס ניתן לחיפוש של נקודות, הפעלת ניתוח מובנה על פני אלפי ראלים, שאילת שאלות שבהן קטע הנקודה השלם הוא יחידת המשמעות — המודל של NVIDIA הוא היחיד מבין השניים שנבנה לכך. האם הוא עושה את העבודה היטב, נכון לספטמבר 2026, אינו ידוע באמת.
יש אפשרות שלישית שראוי לתת לה שם, כי לשם מגיעים רוב הצינורות האמיתיים. אם אתה רוצה לנסות את המומחה הלא־מוכח בלי להמר עליו בנתיב ייצור, החזק אותו מאחורי אותו ממשק של המודלים שאתה סומך עליהם. OrcaRouter לא מספקת אף אחד מאלה — NVIDIA פרסמה משקלים בלי נקודת קצה, ול-Mage-VL אין נתיב הגשה מתארח — כך ששתיהן החלטות של אירוח עצמי. מה שמפתח יחיד שמכסה יותר מ-200 מודלים מתארחים קונה לך הוא שאר הסטאק: מודלי התמלול, הסיכום והיישום סביב רכיב וידאו הספורט נשארים מאחורי נקודת קצה אחת, עם מעבר אוטומטי לגיבוי אם ספק נחלש, ושני המודלים המומחים שאתה מפעיל בעצמך הם החלקים הנעים היחידים שבבעלותך.
פסק הדין
Microsoft Mage-VL ו-NVIDIA NemotronLabs AI for Media - Sports Tennis אינם יריבים במובן שדף השוואה בדרך כלל מתכוון אליו. Mage-VL הוא מודל סטרימינג מפורסם ועם בנצ'מרקים, בעל 4B, שרץ על תחנת עבודה, ויש לו הדגמה אמיתית של פרשנות ספורט מותנית-אירועים. Sports Tennis הוא מומחה ברמת קליפ, שלא הוכרז וללא בנצ'מרקים, בעל 31B, שזקוק ל-GPU של מרכז נתונים, ואין לו שום עדות מפורסמת לכך שהוא עובד.
אם שופטים לפי הראיות, Mage-VL זוכה בניצחון טכני. אם שופטים לפי ההיקף, אין ביניהם חפיפה. אבל יש סיבה להמשיך לעקוב אחרי המודל של NVIDIA: כיוונון עדין של מקודד קפוא על 43,084 נקודות טניס שתויגו נכון הוא בדיוק סוג מערך האימון הוורטיקלי, הצר והאיכותי, שאין למודלים גנרליסטיים, ואם NVIDIA אי פעם תפרסם את תוצאות הבדיקה המוחזקות, השאלה של מומחה מול גנרליסט בווידאו ספורט תקבל לראשונה תשובה אמיתית. עד אז, Mage-VL הוא המודל עם הקבלות, ו-Sports Tennis הוא המודל עם ההבטחה.
