
Nemotron Sports Tennis לעומת InternLumina U2: ההשוואה שאף אחד מהמודלים לא יכול להפסיד
- deepseekחדשDeepSeek: DeepSeek V4.1 Flash2026-09-10$0.15 / $0.60 לכל 1M טוקנים
- openaiחדשOpenAI: GPT-6 Astra2026-09-0453אינטליגנציה77כתיבת קוד
- googleחדשGoogle: Gemini 3.8 Flash2026-09-0241אינטליגנציה76כתיבת קוד
- qwenחדשQwen: Qwen3.8 Max (0902)2026-09-0240אינטליגנציה72כתיבת קוד
- anthropicחדשAnthropic: Claude Fable 5.12026-09-0153אינטליגנציה82כתיבת קוד
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 לכל 1M טוקנים
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642אינטליגנציה72כתיבת קוד
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.24 / $0.73 לכל 1M טוקנים
- z-aiZ.ai: GLM 5.32026-08-1845אינטליגנציה75כתיבת קוד
- obsidianQwen3.8 27B2026-08-1534אינטליגנציה68כתיבת קוד
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236אינטליגנציה69כתיבת קוד
- grokSpaceXAI: Grok 4.62026-08-1244אינטליגנציה77כתיבת קוד
- metaMeta: Muse Spark 1.22026-08-0540אינטליגנציה72כתיבת קוד
- qwenQwen: Qwen3.8 Max2026-08-0340אינטליגנציה72כתיבת קוד
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135אינטליגנציה69כתיבת קוד
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 לכל 1M טוקנים
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2451אינטליגנציה78כתיבת קוד
- googleGoogle: Gemini 3.6 Flash2026-07-2134אינטליגנציה69כתיבת קוד
שאל מה טוב יותר — NVIDIA NemotronLabs AI for Media - Sports Tennis או InternLumina U2 — והתשובה הכנה היא שהשאלה אינה נפתרת. שני המאגרים הופיעו שניהם ב-Hugging Face בספטמבר 2026, שניהם מודלים מולטימודליים מסוג תערובת מומחים שנבנו על ידי מעבדות ממומנות היטב, וכמעט אין להם דבר אחר במשותף. המודל של NVIDIA הוא מומחה 31B שקורא נקודת טניס בודדת ועונה על שאלות לגביה. InternLumina U2, מצוות InternLM של Shanghai AI Laboratory ופורסם בתור internlm/InternLumina-U2, הוא מודל מאוחד 16B שמבין תמונות, וידאו ותלת-ממד וגם יוצר ועורך תמונות. אין להם בנצ'מרק משותף, אין משתמש יעד משותף ואין פרופיל פריסה משותף. השוואה ביניהם דומה פחות לבחירת טלפון ויותר לבחירה בין סטטוסקופ למדפסת תלת-ממד.
מה שהופך את הזיווג הזה לראוי לכתוב עליו בכלל הוא דפוס שמשותף לשני המודלים: אף אחד מהם לא הוערך באופן עצמאי, ושניהם מתוארים על ידי הספק שלהם כמשהו שאינו מוגמר. זו ההשוואה האמיתית — לא איזה מודל מנצח, אלא כמה מכל אחד מהם אפשר באמת לאמת היום.
שני תפקידים שונים שלובשים את אותה מילה
"מולטימודאלי" מכסה את שניהם ולא אומר לך דבר. הנה הפיצול:
• מה הוא קולט — ספורט טניס: וידאו (mp4 עד 2 דקות), אודיו (wav/mp3), תמונות, טקסט. InternLumina U2: טקסט, תמונות, וידאו ותלת-ממד. מודל הטניס הוא היחיד מבין השניים עם מהותי נתיב אודיו, המחווט דרך מקודד דיבור Parakeet שקורא צלילי קהל ופגיעה לצד הפריימים.
• מה זה מחזיר — Sports Tennis: טקסט בלבד. InternLumina U2: טקסט ותמונות שנוצרו או נערכו, באמצעות ייצוג חזותי בדיד לחלוטין של 8 ספרי קוד הבנוי על AToken.
• מה המשתמש שואל — ספורט טניס: "מה קרה בנקודה הזו, היכן עמד השחקן, האם הכדור נחת בפנים." InternLumina U2: "תאר את התרשים הזה, ואז צייר לי גרסה חדשה שלו."
• ארכיטקטורה — Sports Tennis: MoE היברידי מסוג Mamba2-Transformer, 31B בסך הכול עם כ-3B פעילים לכל טוקן, היורש את עמוד השדרה והמקודדים שלו מ-Nemotron 3 Nano Omni. InternLumina U2: MoE דליל של 16B עם 1B פרמטרים פעילים, הבנוי כמודל שפה דיפוזי מרובה־ספרי־קוד ולא כמודל אוטורגרסיבי קונבנציונלי.
• הקשר — Sports Tennis מפרסמת עד 256k טוקנים. הכרטיס של InternLumina U2 אינו מפרסם נתון על גודל ההקשר.
• רישיון — Sports Tennis מופץ תחת OpenMDW-1.1, כאשר הכרטיס מציין שימוש מסחרי ולא-מסחרי. InternLumina U2 הוא Apache 2.0.

הדבר שלמעשה הופך אותם לבלתי ניתנים להשוואה
אין לוח תוצאות משותף, וכדאי לדייק לגבי הסיבה לכך במקום להשאיר זאת כמשיכת כתפיים מעורפלת.
Sports Tennis עבר כוונון עדין על מערך נתוני טניס קנייני של NVIDIA — 1,312,129 דוגמאות של שאלות ותשובות (Q&A) מתוך 43,084 קליפים ברמת נקודה מ-239 משחקים, שתויגו לפי 38 קטגוריות תיוג, כולם נאספו ב-2025. ערכת הבדיקה שלו היא מחיצה שמורה של 12 משחקים, 2,689 קליפים ו-80,872 שאלות. כל אחד מהארטיפקטים האלה הוא של NVIDIA עצמה. לאף גורם חיצוני אין את הנתונים, ולכן אף גורם חיצוני לא יכול לשחזר ציון — וכפי שמסתבר, NVIDIA לא פרסמה ציון לשחזר. הכרטיס מתעד את פרוטוקול ההערכה בפירוט ואז לא מדווח על שום תוצאה ממנו. שום דבר על דיוק, שום דבר לפי קטגוריה, כלום.
InternLumina U2 נמצא בצד השני של אותו קיר. הוא מפרסם מספרים, אך הם חלקיים באופן מפורש. כרטיס המודל אומר זאת בשורה אחת: "תוצאות ראשוניות, חלקיות. טבלאות השוואה מלאות יופיעו בדוח הטכני הקרוב." מה שקיים הוא פיזור של נתונים שדווחו על ידי ספקים על פני יכולות שונות מאוד — ChartQA 86.52 ו-CharXiv-DQ 83.65 במסמכים, MathVision 33.22 ו-DynaMath 56.37 במתמטיקה חזותית, VideoMME 51.26 ו-MVBench 59.74 בווידאו, 3D MM-Vet 41.8, DPG-Bench 87.10 ו-GenEval 0.81 ביצירה, ImgEdit 3.83 בעריכה. והטבלה של עמוד הפרויקט עצמו מראה שהמודל מפגר אחרי לפחות מתחרה נקוב אחד בלפחות מדד עיקרי אחד: GenEval 0.81 לעומת 0.89 של LLaDA2.0-Uni.
אז למודל אחד יש הערכה מתועדת ובלי תוצאות, ולשני יש תוצאות והערכה לא שלמה במפורש. אף אחד מהם לא נותן לך מספר שאפשר להעמיד זה לצד זה. כל עמוד שמדרג את השניים האלה המציא את הדירוג שלו.

היכן שהם חופפים באמת, ומה זה מראה
הבנת וידאו היא הטריטוריה היחידה ששניהם טוענים לה, וגם שם החפיפה דקה יותר ממה שהיא נראית. InternLumina U2 מדווח על VideoMME 51.26 ו-MLVU 57.03 ו-MVBench 59.74 — ציוני הבנה כללית של וידאו, כפי שדווחו על ידי הספק. Sports Tennis לא מדווח על דבר, אבל הכרטיס מתאר משימה צרה בהרבה ועמוקה בהרבה: הסקה ברמת נקודה על פני ראלי מלא עם אודיו, על פני 38 קטגוריות תיוג עדינות הכוללות מכניקת חבטות, מיקום במגרש, תנועה ומצב הניקוד.
ההסקה הסבירה היא ש-InternLumina U2 יהיה הג'נרליסט הטוב יותר ו-Sports Tennis יהיה קורא הטניס הטוב יותר, אך זוהי הסקה מצורת המשימה, לא מנתונים. בהחלט ייתכן שהיא שגויה בכל אחד משני הכיוונים. מה שאינו הסקה הוא שבנצ'מרק וידאו כללי ובנצ'מרק טניס קנייני ברמת נקודה אינם יכולים להיות מוצבים על אותו ציר, ושמחולל מאוחד של 16B ומומחה עם מקודד קפוא של 31B לא נבנו כדי לענות על אותה שאלה.
להריץ כל אחד מהם זה פרויקט מסוג אחר
פריסה היא המקום שבו הפער מפסיק להיות פילוסופי.
Sports Tennis מציין מינימום קשיח של GPU אחד עם כ-80 GB של זיכרון ב-BF16, כשהמשקלים הם בסביבות 62 GB, ונבדק על פני A100, H100, H200, B200, GB200 NVL72, RTX PRO 6000 SE, L40S, DGX Spark, Jetson Thor ו-RTX 5090. אין צ'קפוינט מכומת, ולכן לא ניתן להתפשר היום על דרישת 80 GB כלפי מטה. הוא גם באנגלית בלבד.
הבעיה המעניינת יותר של InternLumina U2 אינה הזיכרון, אלא הסיליקון. המאגר מארח נקודות ביקורת המחולקות לפי חומרת האימון: תיקייה שלמה של ascend/ עם שבעה שברי safetensors שאומנו על Huawei Ascend NPUs, ותיקיית nvidia/ המסומנת "בקרוב." אם אתם מריצים חומרת NVIDIA — אשר, עבור מודל שאחיו הוא כיוונון עדין לטניס של Nemotron, הם רוב האנשים שקוראים את זה — נקודת הביקורת שאתם רוצים היא זו שטרם נחתה. קוד האינפרנס והוראות ההגדרה נמצאים במאגר GitHub של InternLM ולא ב-Hub, והדוח הטכני עדיין בהמתנה.
זה הופך על פיה את הציפייה הרגילה. המודל הקנייני, שלא נמדד בבנצ'מרק ובעל צורת מכשיר, הוא זה שאפשר להוריד ולהריץ כבר עכשיו ביום הראשון. מודל המחקר הפתוח Apache-2.0 הוא זה שממתין לבנייה ספציפית לחומרה.

היכן נתב משתלב — והיכן לא
אף אחד מהמודלים האלה לא מתארח ב-OrcaRouter, ואין דרך הגונה להתחמק מכך בניסוח. ל-Sports Tennis אין נקודת קצה בשום מקום; NVIDIA פרסמה משקלים ותו לא. המאגר של InternLumina U2 עצמו מציין שהצ'קפוינטים של NVIDIA עדיין בהמתנה, כך שאין מה לשרת מצדנו גם כן. זוהי החלטה של אירוח עצמי בשני המקרים, ולא החלטת ניתוב.
שאלת הניתוב מופיעה שכבה אחת למעלה. צוות שרוצה להעריך מומחה כמו Sports Tennis מול כללן כמו InternLumina U2 לא עושה זאת בבידוד — הוא עושה זאת כמועמד אחד בצינור עיבוד שזקוק גם לתמלול דיבור, טיפול במסמכים, סיכום והלוגיקה היישומית סביבם. הרכיבים האלה מתארחים, והם החלקים שבהם מפתח API יחיד שמכסה יותר מ-200 מודלים עם מעבר אוטומטי בין ספקים חוסך שבוע של עבודת אינטגרציה. מפתח אחד למודלים שאפשר לקרוא להם, כך שאלה שאתם חייבים להריץ בעצמכם הם הדבר היחיד שאתם באמת מתחזקים.
השאלה הפתוחה
כשמעמידים זה לצד זה, NVIDIA NemotronLabs AI for Media - Sports Tennis ו-InternLumina U2 הם המחשה סבירה לשתי דרכים לשחרר מודל מולטימודלי בצורה גרועה בפומבי. האחד תיעד את ההערכה שלו והסתיר את התוצאות; האחר פרסם תוצאות ותייג את ההערכה שלו כבלתי שלמה. נכון לספטמבר 2026, שניהם טענות שאי אפשר להפריך.
הדבר המעניין לצפות בו אינו איזה מהם יתגלה כחזק יותר — הם לעולם לא ייבחנו על אותו הדבר. אלא איזו מעבדה תסגור ראשונה את הפער שלה. אם NVIDIA תפרסם נתוני טניס, היא תפתור את הבעיה הקשה יותר, מפני שבנצ'מרק קנייני מסוג held-out של 12 משחקים שלא נראו הוא הדרך הכנה היחידה לדרג כיוונון עדין לתחום, ו-NVIDIA כבר בנתה את הפיצול. אם InternLM תספק את הצ'קפוינטים של NVIDIA ואת הדוח הטכני, היא תהפוך את מודל ה-Apache-2.0 שלה לשמיש באמת על החומרה שבבעלות משתמשיה. יהיה אשר יהיה, ההשוואה הזו תהיה שווה קריאה חוזרת — מפני שנכון לעכשיו, הדבר הבר-הגנה ביותר שהכרטיס של כל אחד משני המודלים תומך בו הוא משיכת כתפיים.
