כרטיס כותרת המציג ניגוד בין Ling-3.0-flash-VL, מודל ראייה-שפה עם 124 מיליארד פרמטרים ו-5.5 מיליארד פעילים ברישיון MIT, בעל מדד אינטליגנציה עצמאי של 25 ונתיב הגשה של NVIDIA CUDA, לבין InternLumina U2, מודל דיפוזיה עם ריבוי ספרי קודים עם 16 מיליארד פרמטרים ומיליארד פעילים ברישיון Apache-2.0, שהצ'קפוינט היחיד שפורסם שלו אומן ב-Ascend, ומכסה הבנה וכן יצירה, עריכה ותלת-ממד.
Guides & Insights

Ling-3.0-flash-VL לעומת InternLumina U2: שניהם הושקו, סיליקון שונה

מחבר

Alistair Wren

תאריך פרסום

מודלים אחרונים · 20צפו בכל המודלים
בנצ'מרקים: Artificial Analysis · מתעדכן יומית
חזרה לכל הפוסטים

שני המודלים האלה הם כעת אמיתיים, ניתנים להרצה ולהורדה, מה שלא היה נכון לפני שבועיים — וההבדל ביניהם כמעט שאינו קשור לבנצ'מרקים. Ling-3.0-flash-VL, מהמעבדה inclusionAI של Ant Group, העלה משקולות BF16 ו-FP8 ל-Hugging Face בין 4 ל-8 בספטמבר 2026, פרסם לצידן מתכוני הגשה של SGLang ו-vLLM, וקיבל ציון עצמאי של 25 ב-Artificial Analysis Intelligence Index v4.3. InternLumina U2, מצוות InternLM של Shanghai AI Laboratory, שלח תחילה קוד הסקה ואז שחרר את משקולות המודל שאומנו על Ascend ל-Hugging Face ב-10 בספטמבר — שבעה שברי safetensors בתוך ascend/ תיקיית משנה, ומשלים את המאגר לשישה-עשר קבצים.

העוקץ הוא בשביל מה נועדו שני שחרורי המשקלים האלה. המסלול המוצהר של Ling-3.0-flash-VL הוא מסלול ה-CUDA שכולם כבר מחזיקים: צומת עם שמונה מאיצים מריץ את בניית ה-FP8, ומערכי ההגשה הם אלה שאתם כבר מריצים. נקודת הבדיקה המוצהרת של InternLumina U2 היא זו של Ascend, וקובץ ה-README מפורש: תורידו את נקודת הבדיקה שתואמת לאיך שאתם מתכננים להריץ אינפרנס — כאשר נקודת הבדיקה שאומנה על NVIDIA עדיין רשומה כ״בקרוב״. שני מודלים שיצאו באותו שבוע, ורק אחד מהם רץ על החומרה שרוב הצוותים עומדים מולה.

זה ממסגר מחדש את ההשוואה בצורה מועילה. זה כבר לא טקסט של "משוחרר מול vaporware", וכל מי שעדיין מתאר את InternLumina U2 כממתין למשקלים נשען על README בן שבוע. זהו טקסט על שני עיצובים חזותיים מאוחדים שונים מאוד שהגיעו לשתי אקוסיסטמות סיליקון שונות, ועל אילו חלקים בכל שחרור באמת הושלמו.

מה כל גרסה מכילה כעת

Ling-3.0-flash-VL הוא תערובת מומחים דלילה בעלת 124 מיליארד פרמטרים, שמפעילה כ-5.5 מיליארד פרמטרים לכל טוקן, על גבי גזע היברידי בעל 42 שכבות המחליף בין Kimi Delta Attention לבלוקי MLA עם שער ביחס 5:1. מקודד חזותי ברזולוציה שרירותית ומקרן MLP דו-שכבתי מזינים את הגזע הזה, כאשר VideoRoPE מטפל במיקום המרחבי והזמני. הוא קולט טקסט, תמונות ווידאו ומחזיר טקסט. גם BF16 (64 מקטעים) וגם FP8 (כ-126 GB, מגדל החזות נשמר במכוון ברמת דיוק גבוהה מזו של משקלי המומחים) זמינים לציבור תחת רישיון MIT, והשחרור שלם דיו עד שקהילת הבנצ'מרקים העצמאית העניקה לו ציון — 25 במדד Intelligence Index v4.3, כשהוא מדורג #2 מתוך 64 בקטגוריית הגודל שלו, מול חציון קטגורי של 8. מה שלא מפורסם הוא מחיר לכל טוקן עבור מודל החזות, ודוגמאות ה-API שלו נושאות -rc1 מזהה שמשאיר פתוח אם הצ'קפוינט המוגש תואם למשקלים הפתוחים.

InternLumina U2 הוא מודל sparse mixture-of-experts עם 16 מיליארד פרמטרים וכ-1 מיליארד פרמטרים פעילים, הבנוי על עמוד שדרה של מודל שפת דיפוזיה מסוג LLaDA-2.0 MoE, ומכסה שש משפחות משימות במודל אחד: שאלות ותשובות בטקסט, יצירת תמונה מטקסט, הבנת תמונות, עריכת תמונות, הבנת וידאו והבנת תלת-ממד. קוד ההסקה עבור כל אלה זמין לציבור ב-main. הצ'קפוינט שאומן על Ascend זמין כעת לציבור ב-Hugging Face. עדיין חסרים, לפי מפת הדרכים של המאגר עצמו: הצ'קפוינט שאומן על NVIDIA, קוד האימון (מאגר נפרד), והדוח הטכני. מפת הדרכים מסמנת ארבעה תיבות ומשאירה שתיים פתוחות — קוד ההסקה, משקולות Ascend, ומערכת האימון וההסקה של Ascend הושלמו; קוד האימון והדוח הטכני לא.

פרט מעשי אחד נמצא בין שתי הפסקאות האלה. הפעלת מסלולי הראייה של U2 דורשת את משקולות הטוקנייזר של AToken ב-atoken_inference/checkpoints/atoken-sod.pt, והדרייבר ששוחרר מצפה לספריית checkpoint מפוצלת עם נכסי המודל שנשמרים יחד. הקוד אמיתי ומותקן מול Python 3.11, PyTorch 2.6.0 ובמסלול CUDA, flash-attn 2.7.2. תמיכת Ascend נמצאת ב-ascend-npu-support ענף נפרד ודורשת CANN יחד עם build תואם של torch_npu במקום שרשרת הכלים של CUDA. שום דבר מזה לא מוסתר; הכול מתועד. זו פשוט דרך ארוכה יותר מ-pip install ומחרוזת מודל.

שתי תשובות לשאלה "מהו טוקן חזותי"

הארכיטקטורות חלוקות על משהו עמוק יותר מספירת הפרמטרים, והמחלוקת היא הדבר המעניין ביותר בהצבתן זו לצד זו.

Ling-3.0-flash-VL שומר על החוזה הסטנדרטי. תמונה הופכת לרצף של טוקנים דרך מקודד הראייה והמקרן, הטוקנים האלה נכנסים לגזע טרנספורמר, והכל פועל באופן אוטורגרסיבי. החידוש אינו באופן שבו הראייה מיוצגת אלא בכמה בזול הגזע פועל — 5.5 מיליארד פרמטרים פעילים לכל טוקן מתוך 124 מיליארד בסך הכל, וזו הסיבה כולה שהמודל מופיע על החזית של אינטליגנציה מול פרמטרים פעילים. VideoRoPE מעניק למיקום מרחבי וזמני קידוד עקבי אחד, כך שווידאו אינו זקוק למנגנון נפרד.

InternLumina U2 משנה את הייצוג עצמו. היא משתמשת בטוקנייזר AToken של אפל, שבו כל מיקום חזותי מתואר על ידי שמונה ספרי קוד משלימים — מרקם מקומי, טקסט מוטבע, גיאומטריה ופרטים בתדר גבוה כזרמים נפרדים ולא כווקטור אחד מכווץ. כל ספר קוד שומר על ה-embedding שלו בדרך פנימה, ושמונת ה-embeddings לכל מיקום משורשרים ומוקרנות לכדי טוקן עמוד שדרה יחיד. בדרך החוצה, החיזוי הוא מה שהצוות מכנה מרחבי-מקבילי ואוטורגרסיבי בעומק ספרי-קוד: עמוד השדרה הדיפוזיוני מסיר רעש ממיקומים מרחביים מוסתרים רבים בבת אחת, ואז ראש אוטורגרסיבי רב-ספרי-קוד חוזה את שמונת הקודים עבור כל מיקום לפי הסדר. הבנה ויצירה עוברות דרך אותה מכונה — וזו הטענה האמיתית. הטיעון של הצוות הוא שספר קוד יחיד מגביל את כמות המידע שטוקן חזותי אחד יכול לשאת, בעוד שהיברידים דיסקרטיים-רציפים מפצלים את ההבנה והיצירה בין ייצוגים ומסלולי פענוח שונים, ושללכת באופן דיסקרטי מלא עם מספר ספרי קוד הוא הדרך לקבל מודל מאוחד באמת ולא שתי ערימות מוברגות יחד.

שתי העמדות הללו הן עמדות קוהרנטיות, והן נושאות עלויות מנוגדות. ייצוגים מרובי ספרי קוד יכולים להכיל פרטים חזותיים עדינים יותר; הם גם מכפילים את תקציב הטוקנים לכל תמונה במספר ספרי הקוד והופכים את הפענוח למורכב בהרבה יותר, מה שכנראה חלק מהסיבה לכך ש-16B-A1B היה הגודל שנבחר. הדלילות של Ling קונה הסקה זולה לכל טוקן; היא גם משמעה קיבולת פעילה קטנה יותר לכל מעבר קדימה, שהוא המחיר שחציון המחלקה של 8 במדד האינטליגנציה ממחיש בשקט — Ling-3.0-flash-VL עוברת אותו בנוחות ב-25, אבל היא לא מתחרה במודלים צפופים מהחזית בהסקה גולמית.

משטחי המשימה חופפים רק חלקית

לסווג את שניהם תחת "מודל מולטימודלי" מגזים בחפיפה. הידיעה היכן נגמרת החפיפה מונעת המון השוואות שגויות לפני קנייה.

• קלטים — Ling-3.0-flash-VL מקבל טקסט, תמונות ווידאו, עד 40 תמונות לבקשה, ומחזיר טקסט; InternLumina U2 מקבל טקסט, תמונות, וידאו ונכסי תלת-ממד, ומחזיר טקסט, תמונות מחוללות או תמונות ערוכותbr /> • יצירת תמונות — Ling-3.0-flash-VL אינו יכול ליצור או לערוך תמונות כלל; הטענה המרכזית של InternLumina U2 היא שהוא עושה את שניהם, עד 1024×1024, מאותם משקלים שקוראים תמונותbr /> • תלת-ממד — ל-Ling-3.0-flash-VL אין מסלול תלת-ממדי; InternLumina U2 מגיע עם צינור עיבוד מבוסס Blender שמרנדר נכסי GLB ו-GLTF ל-64 תצוגות צבע ועומק מזווגות כדי שהמודל יוכל להסיק מהןbr /> • וידאו — Ling-3.0-flash-VL מטפל בווידאו באמצעות קידוד זמני VideoRoPE; InternLumina U2 דוגם 64 פריימיםbr /> • הקשר ופלט — Ling-3.0-flash-VL מציג חלון הקשר של 262K טוקנים לעומת 256K שמצוינים בכרטיס המודל שלו, ופלט מקסימלי קצר יחסית; InternLumina U2 לא פרסם אף אחד מהנתונים האלהbr /> • פרמטרים פעילים — Ling-3.0-flash-VL מפעיל בערך 5.5B לכל טוקן; InternLumina U2 מפעיל בערך 1B, שזה חמישית מכך

קרא את הרשימה הזאת, והמסקנה היא ששני אלה הם תחליפים בדיוק למשימה אחת — קריאת תמונה ומענה על שאלות לגביה — ומשלימים זה את זה כמעט בכל מקום אחר. אם אתה זקוק למודל שמייצר או עורך תמונה, Ling-3.0-flash-VL אינו מועמד ושום בנצ'מרק לא משנה זאת. אם אתה זקוק למודל אחד שקורא תרשים, מייצר וריאציה ומבצע הסקה על נכס תלת-ממדי, InternLumina U2 מכוון לכך ו-Ling-3.0-flash-VL לא מתייחס לכך.

The GitHub repository page for InternLM/InternLumina-U2 showing the Apache-2.0 license, a commit titled Document weight downloads and mark Ascend checkpoint released from two days earlier, a file listing including infer_t2i_sft.py, infer_mmu_sft.py, infer_video_sft.py and infer_3d_sft.py, 52 stars, and the Releases panel reading No releases published.

מדדי ביצוע: ציון עצמאי אחד מול עמוד של מספרי ספקים

איכות הראיות אינה צמודה, וכדאי להיות מדויקים לגבי הסיבה לכך במקום להכריז על מנצח.

ה-25 של Ling-3.0-flash-VL במדד Intelligence Index v4.3 הוא הרצה של צד שלישי על פרוטוקול שפורסם, כאשר חציון המחלקה הוא 8 לשם הקשר, ובנוסף תפוקה מדודה של 142.9 טוקני פלט לשנייה מול חציון עמיתים של 105.1 וזמן של 2.21 שניות לטוקן הראשון. כרטיס הספק שלו טוען בנפרד 42 על גרסת v4.1.1 שהוצאה משימוש של הפרוטוקול, שהוא סולם שונה ולא ניתן להציבו לצד ה-25 כאילו המודל ירד בביצועים; המדד נוסח מחדש בספטמבר 2026 ונוקד מחדש בכל התחומים. הספק גם מדווח על ניצחון 1,441 מול 1,440 ב-Image-to-WebDev Arena על GPT-5.4 תחת הכינוי "linthium" — פער של נקודה אחת בתוך רעש Elo, וזאת לפי דיווח הספק.

המספרים של InternLumina U2 הם של המעבדה עצמה, מסומנים כראשוניים וחלקיים, בעוד שטבלאות ההשוואה המלאות והדוח הטכני עדיין בהמתנה. כעת הם מופיעים בטבלה ב-README של המאגר ולא בלוח מובילים של בנצ'מרק, והם עדיין לא ניתנים לאימות באופן בלתי תלוי מפני שאף צד שלישי לא פרסם הרצה. כפי שהמעבדה מציגה אותם:

• הבנה — ChartQA 86.52, CharXiv-DQ 83.65, HallusionBench 62.15, MMMU-Pro 36.13, MathVision 33.22, DynaMath 56.37br /> • וידאו — Video-MME 51.26, MVBench 59.74, MLVU 57.03br /> • יצירה ועריכה — GenEval 0.81, DPG 87.10, TIIF Short 84.60, TIIF Long 85.95, ImgEdit 3.83br /> • מקורות — כל נתון של InternLumina U2 מדווח על ידי הספק והוא ראשוני; כל נתון של Ling-3.0-flash-VL מדווח על ידי הספק למעט Intelligence Index, שהוא לפי Artificial Analysis

שניים מאלה ראויים לדגל. GenEval 0.81 מפגר אחרי 0.89 של מתחרה בשם מפורש לפי הטבלה של המעבדה עצמה — מקרה נדיר של ספק שמפרסם הפסד, וסיבה לסמוך על שאר הגיליון קצת יותר. ו-ImgEdit עם 3.83 חסר משמעות בלי הטבלה הנלווית, שהיא חלק ממה שהדוח הטכני הממתין יישא. התייחס לרשימת InternLumina U2 כתוצאות שהמעבדה מתכוונת להגן עליהן, לא כתוצאות שאתה יכול לפעול לפיהן. שים לב גם שציוני ההבנה שלו וציון האינדקס של Ling-3.0-flash-VL אינם כמויות ברות השוואה: האחד הוא קבוצה של מספרי ספק ספציפיים למשימה, והאחר הוא אינדקס מורכב של צד שלישי.

A two-column comparison scoreboard for Ling-3.0-flash-VL and InternLumina U2 across six shared dimensions: Intelligence Index 25 on v4.3 versus none yet, active parameters 5.5B versus 1B, total parameters 124B versus 16B, license MIT versus Apache-2.0, published checkpoint NVIDIA CUDA versus Ascend only, and task surface understanding only versus plus generation, editing and 3D, with a footer noting the Ling figure is per Artificial Analysis and InternLumina U2 figures are vendor-reported preliminary.

רישיון, חומרה, ומה באמת עולה הימור על כל אחד מהם

Ling-3.0-flash-VL מופץ ברישיון MIT בשני פורמטי הדיוק, וזה בערך הכי נקי שמשקלים פתוחים יכולים להיות — בלי תנאים מצורפים, בלי הגבלות על תחום השימוש, בלי עמימות לגבי פריסה מסחרית. בניית ה-FP8 בכ-126 ג'יגה-בייט נכנסת בתוך צומת של שמונה מאיצים בדרגת 80GB; BF16 הוא בערך כפול מזה. תמיכת הגשה כבר קיימת ב-SGLang ובפורק של vLLM המתוחזק על ידי Ant. הסיכון השיורי הוא מסחרי ולא משפטי: Ant אינה מפרסמת תעריף לפי טוקן עבור מודל הראייה, הגישה החינמית ב-Ling Studio היא קידומית ולא תעריף, ו-Artificial Analysis מציגה אותו במחיר $0.00 למיליון טוקנים בקלט ובפלט רק מפני שנקודת הקצה שהיא מסוגלת לראות היא זו החינמית.

InternLumina U2 הוא Apache-2.0 במאגר הראשי, עם שתי החרגות שכדאי לקרוא: הספרייה המצורפת VeOmni/ שומרת על רישיון ה-Apache-2.0 במעלה הזרם שלה, ו-atoken_inference/ נגזר מ-ml-atoken של Apple ומופץ מחדש בתנאים המקוריים של Apple. הטענה בנוגע לתשתית רצינית — היא מכוונת גם ל-GPU של NVIDIA וגם ל-NPU של Huawei Ascend עם יישור מספרי ברמת האופרטור בין הבקאנדים, והצוות מדווח על אימון מקצה לקצה באשכול Ascend בן אלף כרטיסים עם שיפור של פי 1.85 ביעילות האימון הודות לאופרטורים ממוזגים, שרדינג HSDP מכוון ונקודות ביקורת גרדיאנט. זו הנדסה אמיתית. היא גם אורתוגונלית לשאלה אם המודל שווה משהו: יעילות האימון על Ascend לא אומרת דבר על איכות הפלט, ונקודת הביקורת שקיימת היום היא זו שמיועדת לסטאק הזה.

אז האסימטריה המעשית היא לא פתוח מול סגור. שניהם פתוחים, שניהם ברישיון מתירני, ושניהם ניתנים להורדה היום. זה ששחרור אחד מניח את החומרה שכנראה יש לך והאחר מניח את החומרה שכנראה אין לך. אם הצי שלך הוא NVIDIA, Ling-3.0-flash-VL הוא עבודה של אחר צהריים ו-InternLumina U2 הוא המתנה. אם הצי שלך הוא Ascend — וזה נפוץ יותר ויותר בשוק הסיני שהמודל הזה נבנה עבורו — המשוואה הזו מתהפכת לחלוטין, ו-InternLumina U2 הוא זה עם מסלול מוגמר בעוד שהמתכונים של Ling-3.0-flash-VL מניחים CUDA.

שאלות שאנשים באמת שואלים על השילוב הזה

האם המשקלים של InternLumina U2 זמינים להורדה כבר?

כן, הצ'קפוינט שאומן על Ascend הוא — שבעה שברי safetensors שפורסמו תחת ascend/ ב-Hugging Face, לצד קובצי התצורה, הטוקנייזר והמידול. הצ'קפוינט שאומן על NVIDIA נמצא בתיקיית משנה נפרדת ועדיין רשום כ"בקרוב", וקוד האימון והדוח הטכני טרם פורסמו.

האם Ling-3.0-flash-VL עדיף באופן מוחלט מכיוון שיש לו ציון עצמאי?

לא — הוא מגובה בראיות טובות יותר וקל יותר להריץ אותו על חומרה נפוצה, שזו טענה שונה. Ling-3.0-flash-VL לא יכול ליצור או לערוך תמונות, לא יכול לעבד נכסי תלת-ממד, ואין לו מחיר מפורסם. אם המשימה שלך היא יצירת תמונות, עריכת תמונות או הבנת תלת-ממד, InternLumina U2 מטפל בכך ו-Ling-3.0-flash-VL לא מטפל בכך כלל, לא משנה כמה בנצ'מרקים יש למודל Ling.

האם ה-42 בכרטיס המודל של Ling-3.0-flash-VL סותר את ה-25 של Artificial Analysis?

לא באופן ישיר. ה-42 נמדד לפי פרוטוקול Intelligence Index v4.1.1, וה-25 לפי v4.3; המדד נוסח מחדש בספטמבר 2026 והניקוד בו חושב מחדש באופן גורף, ושתי הגרסאות בנויות ממערכי הערכה שונים. מה שאפשר לומר הוא שה-42 מעולם לא שוחזר באופן עצמאי, וה-25 הופק באופן עצמאי.

היכן שניתן לקרוא לאחד משני אלה

לא Ling-3.0-flash-VL ולא InternLumina U2 נמצאים בקטלוג המודלים שלנו, ואמירה אחרת תהיה טענה שקורא יכול לבדוק תוך עשר שניות. Ling-3.0-flash-VL נגיש דרך הפלטפורמה של Ant עצמה, שמפרסמת נקודת קצה תואמת OpenAI ונקודת קצה תואמת Anthropic, דרך גישה לניסיון חינם ב-Ling Studio, ודרך המשקולות הפתוחות אם תארחו אותן בעצמכם. InternLumina U2 נגיש דרך הצ'קפוינט של Hugging Face ודרך דרייבר ההסקה של המאגר, על החומרה שהצ'קפוינט מיועד לה.

מה שאנחנו מנתבים הוא מודל הראייה שהצימוד הזה נשקל לרוב כנגדו בפועל: DeepSeek V4 Flash Vision Exp, זמין בקטלוג עם חלון הקשר של 1M טוקנים ותעריף מפורסם, באותה נקודת קצה תואמת OpenAI כמו שאר הקטלוג. כאשר מעבדה משחררת משקלים פתוחים, שכבת ניתוב יכולה בדרך כלל להציע את המודל בלי להמתין ששירות האירוח של המעבדה עצמה יתייצב — וזהו ההבדל המעשי בין מודל שאפשר לצטט לבין מודל שאפשר לקרוא לו. ההבדל הזה קיים עבור Ling-3.0-flash-VL ולעת עתה אקדמי עבור InternLumina U2, שסיפור השחרור שלו הוא מסלול חומרה ולא שאלת אירוח.

The Artificial Analysis model page for Ling-3.0-flash-VL showing an Intelligence Index of 25 on v4.3 with a class rank of #2 of 64 against a class median of 8, 124B total and 5.5B active parameters, a 262K-token context window, an MIT license and 142.9 output tokens per second.

הפסיקה מפוצלת באמת, והיא מתפצלת לפי חומרה ומשימה ולא לפי איכות. Ling-3.0-flash-VL הוא המהדורה השלמה: MIT, שני פורמטי הדיוק, מדורג על ידי צד שלישי, CUDA-first, ומוגבל להבנה. InternLumina U2 הוא העיצוב השאפתני יותר והמהדורה הפחות גמורה: צ'קפוינט של ערימת חומרה אחת פורסם, משטח מאוחד של שש משימות הכולל יצירה ותלת-ממד, ודוח טכני שעדיין חייבים. אם אתה צריך מודל חזון על חומרת NVIDIA השבוע, הבחירה מתבקשת מאליה. אם העיצוב הרב-קודבוקי של InternLumina U2 הוא מה שמעניין אותך, הדבר שכדאי לעקוב אחריו הוא הצ'קפוינט של NVIDIA — והעמדה הכנה עד אז היא שטבלת הבנצ'מרקים שלו, כולל השורה שבה הוא מפסיד, מתארת מודל שהמחצית השנייה שלו טרם שוחררה.