כרטיס כותרת עבור Ling-3.0-flash-VL, המסכם את המודל כמודל מייצג מקורי (native) רב-מודלי מסוג תערובת מומחים (mixture-of-experts) בעל 124B פרמטרים ו-5.5B פעילים, מבית המעבדה inclusionAI של Ant Group, שיצא בספטמבר 2026 תחת רישיון MIT, עם ציון 25 במדד Artificial Analysis Intelligence Index v4.3 וקצב של 142.9 טוקני פלט לשנייה.
Guides & Insights

Ling-3.0-flash-VL: המודל החזותי של Ant עם 5.5B פרמטרים אקטיביים מגיע למקום ה-25 במדד האינטליגנציה

מחבר

Rowan Sterling

תאריך פרסום

מודלים אחרונים · 20צפו בכל המודלים
בנצ'מרקים: Artificial Analysis · מתעדכן יומית
חזרה לכל הפוסטים

ל-Ling-3.0-flash-VL יש עכשיו מספר בנצ'מרק שאיש ב-Ant Group לא הקליד, וזו הידיעה. המודל המולטימודלי הילידי הראשון שיצא ממעבדת inclusionAI של Ant מקבל ציון 25 במדד הבינה של Artificial Analysis — הרצה בלתי תלויה, בסקאלה הנוכחית v4.3, שפורסמה לצד עמוד מודל שמפרט את מהירותו, זמן האחזור והמחיר שלו. הוא מגיע שלושה שבועות לאחר שכרטיס המודל של הספק עצמו הצהיר על 42 באותו מדד, והדבר המועיל ביותר שקורא יכול לעשות עם שני המספרים האלה הוא להבין מדוע אין כאן סתירה: Ant מדדה לפי פרוטוקול Intelligence Index v4.1.1, ו-Artificial Analysis מדדה לפי v4.3, ואלה סרגלים שונים שנבנו ממערכי הערכה שונים. המספר של הספק לא שרד מפגש עם צד שלישי, אלא יותר מכך — הוא נמדד מחדש בסקאלה שלא הייתה קיימת כשנכתב.

המודל שמתחת לציון הוא תערובת מומחים דלילה עם 124B פרמטרים בסך הכל וכ-5.5B פעילים לכל טוקן, המשוחרר תחת רישיון MIT עם משקלים BF16 ו-FP8, המקבל טקסט, תמונות ווידאו ומחזיר טקסט. נתון הפרמטרים הפעילים הזה הוא כל הטיעון בעד הדבר. ב-5.5B פעילים, Ling-3.0-flash-VL יושב על מה שהפך לעקומה המעניינת ביותר במודלים פתוחים — חזית האינטליגנציה לעומת פרמטרים פעילים ולא גודל כולל — והוא שם כי הוא עושה כמות עבודה סבירה ליחידת חישוב הסקה, לא כי הוא עצום.

היצירה הזו מכסה מה שוחרר בפועל ומתי, מה אומרת ההרצה הבלתי תלויה, מדוע טענת הפארטו מחזיקה מעמד טוב יותר מרוב, כמה עולה המודל והיכן אפשר למעשה לפנות אליו. הגרסה הקצרה, למי שרוצה רק את זה: Ling-3.0-flash-VL הוא אמיתי, עם משקולות פתוחות, זול באופן יוצא דופן להרצה, מעל הממוצע באופן מדיד בקבוצת הגודל שלו, ומילולי יותר ואיטי יותר לשחרור באופן ניכר ממה שהציון הגולמי מרמז. ה-42 המוצהר על ידי הספק מעולם לא שוחזר באופן בלתי תלוי ואינו בר-השוואה ל-25 שנמצא כעת בלוח.

מה שבאמת יצא, וציר הזמן שממשיך להשתטח

הסיקור של מהדורה זו נוטה לקפל כמה אירועים נפרדים לתאריך השקה אחד, והתאריכים חשובים משום שהם מסבירים מדוע כתבות מוקדמות תיארו מודל שאיש מחוץ ל-Ant לא יכול היה לדרג. מאגר ה-Hugging Face inclusionAI/Ling-3.0-flash-VL נוצר ב-4 בספטמבר 2026 — 64 שברים של משקולות BF16, רישיון MIT, מחסנית קוד מותאמת אישית עבור ארכיטקטורת bailing_moe_v3_vl, ולמשך כמה ימים, כמעט איש לא הוריד אותו. כימות FP8 הגיע לאחר מכן ב-8 בספטמבר, כ-126 GB על פני 64 שברים, כאשר מגדל הראייה נשמר בדיוק גבוה יותר ממשקולות המומחים. Artificial Analysis מפרטת את המהדורה כ-10 בספטמבר 2026, שהוא התאריך שדף הבית שלה מעוגן אליו, ועמוד המודל הנושא את הציון עלה לאוויר בסביבות אותו זמן.

אז "שוחרר בספטמבר 2026" הוא מדויק אך חסר תועלת. הרצף המעשי היה: משקולות ב-4, פורמט דיוק שני ב-8, ומדידה עצמאית ב-10. הסיבה שזה חשוב היא שמודל עם משקולות על הדיסק אבל בלי נקודת קצה מתארחת ובלי ציון מצד שלישי הוא, עבור רוב הצוותים, עדיין לא דבר שאפשר להעריך — זה קובץ הורדה שצריך להקצות עבורו משאבים. Ling-3.0-flash-VL חצה את הקו הזה כאשר גם ה-API וגם הציון העצמאי היו קיימים.

תמיכת ההגשה הגיעה יחד עם המשקולות ולא אחריהן. Ant פרסמה מדריך מתכונים לפריסת SGLang ומתחזקת פורק של vLLM מכוונן ל-Ling עבור הארכיטקטורה, שזה החלק של שחרור פתוח שבדרך כלל מפגר בשבועות. כאן הוא לא פיגר.

המספר שעל הלוח, וזה שעל הכרטיס

הנה התמונה הבלתי תלויה מ-Artificial Analysis, שהיא המדידה היחידה מצד שלישי של המודל הזה שקיימת כיום:

• Intelligence Index — 25 ב-v4.3, מדורג במקום #2 מתוך 64 במחלקת הגודל שלו, לעומת חציון מחלקה של 8br /> • סך כל הפרמטרים — 124Bbr /> • פרמטרים פעילים — 5.5B לכל טוקןbr /> • מהירות פלט — 142.9 טוקנים/שנייה, #10 מתוך 64, לעומת חציון עמיתים של 105.1br /> • זמן עד לטוקן הראשון — 2.21 שניות, לעומת חציון עמיתים של 2.29br /> • חלון הקשר — 262K טוקנים כפי שנמדד על ידי Artificial Analysis, לעומת 256K שכרטיס המודל עצמו מצייןbr /> • רישיון — MIT, משקלים פתוחים

והנה נתון הספק שלעיתים כה קרובות הוא מודפס לצדו: 42 בפרוטוקול Artificial Analysis Intelligence Index v4.1.1, ארבע נקודות מעל מה שLing-3.0-flashהטקסטואלי בלבד השיג באותו פרוטוקול. הטענה הזו מופיעה בכרטיס המודל, אין לה שום עקבות הערכה שפורסמה, והיא אינה המספר ש־Artificial Analysis מדווחת עליו. שני דברים נכונים בעת ובעונה אחת: ה־42 אינו משוחזר, והוא אינו ראיה לשום חוסר יושר, מפני ש־v4.1.1 ו־v4.3 אינם מודדים את אותו הדבר. Artificial Analysis ניסחה מחדש את המדד שלה בספטמבר 2026 ונתנה ציון מחדש לכל הלוח שלה; v4.3 משלב עשר הערכות, ובהן AA-Briefcase, GDPval-AA v2, AutomationBench-AA, Terminal-Bench v4.0 ו־Humanity's Last Exam. כל מאמר שעדיין מצטט 42 לצד 25 בלי לציין את הגרסה משווה בין שני מבחנים שונים וקורא לכך ירידה.

The Artificial Analysis model page for Ling-3.0-flash-VL showing an Intelligence Index of 25 on v4.3 with a class ranking of #2 of 64, 124B total and 5.5B active parameters, a 262K-token context window, 142.9 output tokens per second, a 2.21 second time to first token, 160M output tokens from the Intelligence Index ranked #8 of 64, and a listed price of $0.00 per 1M tokens in and out.

הפרט שראוי לציין מעבר לציון הראשי הוא ורבוזיות. Artificial Analysis מתעדת ש-Ling-3.0-flash-VL מוציא 160M אסימוני פלט כדי להשלים את Intelligence Index, כשהוא מדורג במקום ה-8 מתוך 64 לעומת חציון של 84M, ומתייגת אותו כ"מאוד ורבוזי". עבור מודל שהמסר השיווקי שלו הוא הסקה זולה באמצעות מספר קטן של פרמטרים פעילים, זה מתנגש ישירות עם המסר השיווקי. משלמים לפי אסימון, לא לפי פרמטר. מודל שמפעיל 5.5B אבל פולט כמעט פי שניים ממספר האסימונים החציוני כדי לענות על אותן שאלות מחזיר חלק מהיתרון המבני הזה בחזרה בקופה — וזה בדיוק סוג האינטראקציה שטבלת מחירים לפי אסימון מסתירה ומדידת עלות לכל משימה חושפת.

טענת פארטו, כשהיא נבחנת תחת מעט לחץ

הטענה ש-Ling-3.0-flash-VL נמצא על חזית פארטו של אינטליגנציה מול פרמטרים פעילים היא, באופן לא שגרתי, כזו שהנתונים הבלתי־תלויים תומכים בה ולא רק מתירים אותה. החציון בקטגוריה במדד זה הוא 8; Ling-3.0-flash-VL משיג 25; והוא עושה זאת תוך הפעלת 5.5B פרמטרים לכל טוקן. עבור צוותים שהאילוץ המכריע שלהם הוא תפוקה ניתנת לשירות — מאיץ בודד, תקציב בקשות קבוע, פריסה בקצה — היחס הזה הוא כל ההחלטה, וזהו הישג חזק באמת.

שתי הסתייגויות מונעות מכך מלהיות ניצחון נקי. הראשונה היא אי-ההתאמה במספר הפרמטרים: כרטיס המודל אומר כ-5.5B פעילים, בעוד ש-SGLang cookbook מתאר מודל עם 5.1B פעילים. שניהם מסמכים של Ant, ההבדל קטן, והוא משנה מעט את צורת העקומה ולא את הכיוון. השנייה היא ש"frontier" היא טענה יחסית על תחום שמתקדם מדי שבוע. להיות הטוב ביותר ביחס שבין אינטליגנציה לפרמטרים פעילים בגודל נתון הוא מעמד שאתה מחזיק בו עד שיוצא המודל הבא בטווח הזה, והטווח הזה צפוף.

ההדגמה המרכזית של הספק עצמו — שלפיה Ling-3.0-flash-VL, המתמודד בזירת Image-to-WebDev Arena תחת הכינוי "linthium", השיג1,441מולGPT-5.4, שרשם 1,440 — צריכה להיקרא כאמצעי למשיכת תשומת לב ולא כתוצאה. פער של נקודה אחת נמצא בתוך הרעש של Elo בזירה, הוא מדווח מטעם הספק, והוא אינו מסוג הפערים שמכריעים משהו. טענת היכולת שמאחוריו מעניינת יותר מהמספר: המודל בנוי ללולאת משוב חזותית, שבה הוא מייצר קוד פרונטאנד מפריסה, מרנדר את הפלט של עצמו, מביט ברינדור ומתקן — לצפות, לפעול, לאמת, לתקן, במקום לתת כיתוב פעם אחת ולעצור.

A single-column scoreboard card for Ling-3.0-flash-VL listing six rows: Intelligence Index 25 on v4.3, active parameters 5.5B, total parameters 124B, context window 262K tokens, output speed 142.9 tokens per second, and license MIT open weights, with a footer noting the index figure is per Artificial Analysis and the vendor card claims 42 on the retired v4.1.1 protocol.

מה זה עולה, וזה פחות ברור ממה שזה נראה

הדף של Artificial Analysis מציג את Ling-3.0-flash-VL ב-$0.00 לכל 1M טוקני קלט ו-$0.00 לכל 1M טוקני פלט, לעומת חציוני עמיתים של $0.14 ו-$0.40. זה אינו מחיר. זה רק מראית עין של מחיר. Artificial Analysis מתמחרת את נקודת הקצה שהיא יכולה לראות, ונקודת הקצה שהיא יכולה לראות היא חינמית — המודל רץ ב-Ling Studio של Ant כניסיון חינם, וגישה מקדמת חינמית היא מה שהרישום משקף. התיעוד הרב-מודלי של Ant עצמה אינו מפרסם כלל תמחור לפי טוקן עבור מודל הראייה, כך שאין כרטיס תעריפים של ספק שכנגדו ניתן לאמת את האפס. לצורך תחושת קנה מידה, האח הטקסטואלי בלבד, Ling-3.0-flash, נרשם בסביבות $0.075 לכל 1M טוקני קלט ו-$0.22 לכל 1M טוקני פלט, וגם הווריאנטים של Ling הספציפיים לתחום של Ant הושקו כ-API חינמיים.

התייחסו לאפס כאל חלון בדיקה ולא כתעריף. שכבות חינמיות במודלים שזה עתה שוחררו הן כלי לרכישת לקוחות, והנחת התכנון הכנה היא ש־Ling-3.0-flash-VL יישא בסופו של דבר מחיר בסביבה של אחיו הטקסטואלי. קיימת גם עמימות מתמשכת שהגעתו של endpoint בתשלום לא תפתור: בדוגמאות ה־API של Ant עצמה משתמשים במזהה המודל Ling-3.0-flash-VL-rc1, סמן של מועמד לשחרור, ועדיין לא ברור אם ה־checkpoint המוגש זהה בייט-בייט למשקולות הפתוחות מ־4 בספטמבר. אם אתם מריצים בנצ'מרקים על הפרומפטים שלכם מול ה־API המתארח ומצפים שהתוצאות יעברו לבנייה ב־BF16 באירוח עצמי, זו הנחה שכדאי לבדוק לפני שבונים עליה.

תמונת העלויות מתהפכת בהתאם לצד שבו אתם נמצאים. עבור צוות שכבר יש לו מאיצים, בניית ה-FP8 בגודל של כ-126 GB נכנסת בתוך צומת בעל שמונה מאיצים מדרג 80GB, ומספר הפרמטרים הפעילים של 5.5B אומר שאתם משלמים את העלות המופחתת של אותו צומת לעומת טביעת רגל חישובית קטנה מאוד לכל טוקן — הגרסה הזולה ביותר האפשרית של המודל הזה היא זו שאתם מארחים בעצמכם. עבור צוות בלי מאיצים, השאלה היא אם נקודת קצה בתשלום תגיע לפני שהמסלול החינמי ייסגר.

איפה שאתה יכול בעצם להתקשר לזה, כולל החלק שבו אנחנו אומרים לא

Ling-3.0-flash-VL נגיש דרך הפלטפורמה של Ant עצמה — נקודת קצה תואמת OpenAI בכתובת api.ant-ling.com/v1/chat/completions ולצדה גם נקודה תואמת Anthropic — ובנוסף גישת ניסיון חינם ב-Ling Studio, ובנוסף משקולות פתוחות שתוכלו להריץ בעצמכם. גם שערים עצמאיים החלו לרשום אותו, וזו באמת הדרך המהירה ביותר לנסות אותו בלי להקצות שום דבר.

The thing worth stating plainly is that OrcaRouter does not route Ling-3.0-flash-VL today. It is not on our model catalogue, so anything you read here about calling it through us would be fiction, and we would rather you knew that up front. What we do route is the vision model most directly comparable to it: DeepSeek V4 Flash Vision Exp, Deep​Seek's experimental multimodal build, which is live on our catalogue with a 1M-token context window and a published rate. If your actual requirement is a capable vision model behind one OpenAI-compatible endpoint — with a fallback chain configured so a provider hiccup retries before your response starts, and provider list pricing passed through with nothing added on top, so a vendor price change reaches you the same day it lands — that is the model to try first while Ling-3.0-flash-VL remains off-catalogue.

A release-timeline card for Ling-3.0-flash-VL covering four dated events: the Hugging Face repository created September 4 2026 with MIT-licensed BF16 weights, FP8 weights published September 8 at roughly 126 GB, the release anchored to September 10 by Artificial Analysis, and an independent Intelligence Index score of 25 published the same week, with a footer noting the model is not carried on the OrcaRouter catalogue.

מה לראות מכאן

שלושה דברים יכריעו אם הגרסה הזו תיראה משמעותית בעוד חצי שנה. הראשון הוא הרצה עצמאית שנייה: ציון בודד ממעריך בודד הוא נקודת נתונים, והשאלה המעניינת היא אם המיקום של Ling-3.0-flash-VL על עקומת האינטליגנציה מול פרמטרים פעילים ישרוד מסגרת הערכה שונה. השני הוא תמחור אמיתי. עד ש-Ant תפרסם מחירון למודל הראייה, כל השוואת עלויות שמערבת אותו היא אומדן עטוף במחלצות של מספר, והמסלול החינמי ממלא את התפקיד שמחיר היה ממלא אחרת. השלישי הוא פער האיכות של FP8 — מגדל הראייה הוחזק במכוון ברמת דיוק גבוהה יותר ממשקולות המומחים באותה בנייה, והאם הגרסה המכומתת משתווה ל-BF16 במשימות ראייה עדינות הוא בדיוק מסוג השאלות שמופיעות רק כשאנשים מריצים אותו בפרודקשן במקום לבצע עליו בנצ'מרק.

המסקנה הזמינה היום צרה יותר מכפי שסיקור ההשקה רמז, ושימושית יותר מהציון לבדו. Ling-3.0-flash-VL הוא מודל ראייה אמיתי, ברישיון MIT, הניתן לאירוח עצמי, שמפעיל חלק קטן מ-124B הפרמטרים שלו, משיג 25 במדד עצמאי עדכני לעומת חציון של 8 בקטגוריה, ומחזיר חלק מהיתרון הזה בחזרה באמצעות מילוליות יתר. זהו מודל טוב עם צורה כנה. ה-42 שעל הכרטיס הוא מספר מסרגל שכבר לא קיים.