כרטיס כותרת ראשי שנוצר עבור Ling-3.0-flash-VL, עם כתובית 'Ant משיקה מודל מולטי-מודאלי על קו Ling המהיר', המציג שלושה אייקוני קלט: טקסט, תמונה ווידאו קצר, המוזנים דרך שבב הנושא '124B sparse MoE · 5.5B active' אל אייקון פלט טקסט; בתחתית שבבים עם 'MIT weights', 'Live API' ו-'FP8', והערה 'המשקלים פורסמו ב-4 בספטמבר 2026', ומימין למטה לוגו OrcaRouter.
Guides & Insights

Ling-3.0-flash-VL: Ant משיקה מודל מולטי-מודאלי על קו ה-Ling המהיר

מחבר

Magnus Corvin

תאריך פרסום

מודלים אחרונים · 20צפו בכל המודלים
בנצ'מרקים: Artificial Analysis · מתעדכן יומית
חזרה לכל הפוסטים

ב-4 בספטמבר 2026, מעבדת inclusionAI של Ant Group פרסמה משקלים ברישיון MIT עבור Ling-3.0-flash-VL ב-Hugging Face, ובאותו יום עדכנה את תיעוד המפתחים של פלטפורמת Ant Ling כך שיתאים. Ling-3.0-flash-VL הוא נקודת הביקורת הראשונה בעלת יכולות ראייה במשפחת Ling-3.0-flash: אותו שלד דליל של ~124 מיליארד פרמטרים מבוסס mixture-of-experts שהפך את Ling-3.0-flash הטקסטואלי בלבד לאחד ממודלי החשיבה הזולים ביותר שזכו לתשומת לב בסוף הקיץ, וכעת הוא קורא תמונות וקטעי וידאו קצרים לצד טקסט. קוונטיזציית FP8 נוספה ב-8 בספטמבר, בבוקר שבו נכתבים הדברים האלה. כך שבתוך ארבעה ימים רכש המהדורה שלושה ממשקים שהקורא יכול לפעול דרכם — משקלים פתוחים, API רשמי בפלטפורמת Ling של Ant, וציון שדווח על ידי הספק של 42 בפרוטוקול מדד Artificial Analysis Intelligence גרסה 4.1.1, ארבע נקודות מעל הציון הנמדד באופן בלתי תלוי של האח הטקסטואלי, 38. מה שעדיין אין למהדורה הוא הכרזה רשמית: כרטיס Hugging Face והמדריך למפתחים הם ההשקה כולה, ולכן מאמר זה מפריד בין מה שהספק מצהיר לבין מה שמי שמחוץ לחברה יכול לאמת.

ההשקה חשובה בגלל מה שהיא עושה למפת המוצרים של Ant. עד אמצע 2026, העבודה המולטימודלית בתיק הדגמים של Ant ישבה בקו Ming הנפרד, בעוד Ling-3.0-flash מוקמה — כולל במדריך של הבלוג הזה עצמו למודל הטקסט — כשכבה המהירה, טקסט-וכלים, עבור סוכנים, קידוד ומחקר מעמיק. Ling-3.0-flash-VL מבטלת את הגבול הזה: היא מביאה מידע חזותי לתוך מודל חשיבה הבנוי סביב טביעת רגל קטנה במיוחד של פרמטרים מופעלים וריצות סוכן ארוכות, ומעניקה את התוצאה למפתחים בשלוש דרכים בבת אחת. זה הופך אותה להחלטה שונה באמת מהווריאנטים המוכווני-תחום הקודמים (Ling-3.0-flash-Fin, Ling-3.0-flash-Sante), ששוחררו כ-API חינמיים ללא משקלים. המודל הזה פתוח, רץ על הפלטפורמה בתשלום של Ant, וצעיר מספיק כדי שאיש מחוץ לספק עדיין לא פרסם ריצה עצמאית. העובדה האחרונה היא החשובה ביותר בכתבה.

מה שוחרר, ומתי

כל תאריך שלהלן ניתן לאימות מתוך המאגרים והמסמכים; שום חלק ממנו אינו נשען על הודעה לעיתונות שאינה קיימת.

• 4 בספטמבר — המאגר של Hugging Face בשם inclusionAI/Ling-3.0-flash-VL נוצר בשעה 15:24 UTC עם 64 רסיסי משקולות bf16, ערימת קוד מותאם אישית מלאה עבור ה-bailing_moe_v3_vl ארכיטקטורה, תבנית צ'אט עם חשיבה מופעלת כברירת מחדל, ורישיון MIT. מספר ההורדות עומד על עשרות נכון לכתיבת שורות אלה: זהו שחרור שרק עוקב-מאגרים היה קולט ביום הראשון.

• 4 בספטמבר — פורטל המפתחים של Ling-platform של Ant הוסיף את מדריך ההבנה המולטימודלית המתעד את המודל ב-API הרשמי (החותמת "עודכן לאחרונה" של הדף עצמו מציינת 4 בספטמבר 2026). כלי התקשורת הסיניים למפתחים דיווחו על היכולת למחרת, והציגו אותה כהבנת תמונות וסרטונים קצרים למענה חזותי על שאלות ולניתוח תוכן.

החל מה-5 בספטמבר — תמיכה בהרצה ובפריסה הופיעה במהירות: מדריך פריסה של SGLang למודל, מזלג vLLM מותאם שמתוחזק על ידי ארגון inclusionAI, ורשימה בספריית פריסה עם משקלים משלך הכוללת נקודת קצה מוכנה להשלמות צ'אט. אלה הם רכיבי ריצה ותשתית, לא הכרזות, אבל הם מראים לך שהמודל נבנה כדי להיות מוגש, לא רק פורסם.

• 8 בספטמבר — קוונטיזציית ה-FP8 של inclusionAI/Ling-3.0-flash-VL-fp8 הגיעה (64 שארדים, ~126 GB), כשמגדל הראייה הושאר במכוון בדיוק גבוה יותר בעוד משקלי ה-MoE נדחסו ל-FP8 E4M3. לאירוח עצמי על פחות GPUs או GPUs קטנים יותר, זהו ה-checkpoint שרוב האנשים יורידו בפועל.

An English screenshot of the Hugging Face model page for inclusionAI/Ling-3.0-flash-VL (captured September 8, 2026), showing the model tags text-generation, safetensors, bailing_moe_v3_vl, conversational and custom_code, a 'License: mit' badge, 'Downloads last month 42', model size 125B params, and an Inference Providers note that the model is not deployed by any provider. The card text introduces Ling-3.0-flash-VL as a 'next-generation native multimodal model' built on Ling-3.0-flash with 124B total parameters, only 5.5B activated per token, image and video inputs, and a context window of up to 1M tokens.

הכרטיס שלמעלה הוא הדבר הקרוב ביותר שיש למהדורה הזו לפוסט השקה — תיאור מודל, ארכיטקטורה, קישורים למתכוני SGLang ו-vLLM, ואין הכרזה בשום מקום אחר שאנחנו יכולים למצוא. שים לב לפער שחשוב לציין כבר בהתחלה: כרטיס המודל אומר "רק 5.5B פרמטרים מופעלים לכל טוקן", בעוד ספר הבישול של SGLang שנכתב בערך באותה מהדורה מתאר מודל "פעיל 5.1B". לגבי checkpoint חדש לגמרי, ההבדל הוא כנראה עניין של חישוב מגדל הראייה ולא שני מודלים שונים, אבל זה בדיוק סוג הפרטים שצריך לסמן כלא מוכרע ולא להחליק.

מודל 124B שמפעיל 5.5B — עכשיו עם עיניים

Ling-3.0-flash-VL שומר על המתכון ההיברידי של sparse-MoE שהגדיר את אחיו הטקסטואלי. הכרטיס מתאר עמוד שדרה של 42 שכבות המחליפות בין שכבות Kimi-Delta-Attention ו־Gated-MLA ביחס של 5:1 — אותו קצב מבני כמו Ling-3.0-flash — עם סך כולל של כ־124.8 מיליארד פרמטרים ורק חלק קטן מופעל לכל טוקן. מה שחדש הוא ערימת התפיסה: מקודד חזותי מסוג ViT המזין מקרן MLP דו־שכבתי אל עמוד השדרה הלשוני, בתוספת VideoRoPE שמקודד גם מיקום מרחבי וגם מיקום זמני כך שפריימים של וידאו מגיעים בסדר שהמודל יכול לנמק עליו. הקלט הוא טקסט, תמונה וווידאו; הפלט הוא טקסט.

• פרמטרים — 124B בסך הכל, ~5.5B מופעלים לטוקן לפי כרטיס הספק (ראה את הסתייגות החישוב לעיל).

• הקשר — מפורסם כ"עד 1M טוקנים"; מתכוני הפריסה שקיימים כיום מפעילים 256K באמצעות YaRN rope scaling, וזהו הנתון המעשי הכנה שכדאי לתכנן לפיו עד שמישהו יפרסם ריצה ארוכה יותר מאומתת.

• חשיבה — ההנמקה מופעלת כברירת מחדל באמצעות תבנית הצ'אט; גם הדוגמאות הרשמיות של ה-API וגם מתכוני ההגשה מציגים לכל בקשה enable_thinking: false כמתג עבור קריאות רגישות לזמן אחזור.

• רישיון — MIT, שני פורמטי הדיוק, ללא סייגים. זהו אותו רישיון נקי שהפך את פתיחת הקוד של מודל הטקסט באוגוסט למשמעותית, וזו בדיוק הסיבה שאירוח עצמי הוא אפשרות מציאותית ולא אזור אפור.

הכוונה העיצובית חשובה לא פחות מגיליון המפרט. אנט ממקמת את Ling-3.0-flash-VL כמודל ש"מביא מידע חזותי לתוך התהליך המלא של הבנה, חשיבה, פעולה ואימות" — שזו השפה של עומסי עבודה סוכניים (agentic), לא של תיאור תמונות. מודל שיכול לצפות בהקלטת מסך של 30 שניות, להחזיק סשן ארוך של קריאות לכלים (tool-calling) בהקשר, ולשמור על עלות ההפעלה שלו קרובה ל-5B פרמטרים, מכוון ישירות לסוכנים מבוססי שימוש במחשב ובווידאו קצר. זהו מוצר שונה ממודלי שפה-ראייה המותאמים למענה על שאלות על תמונה בודדת, וזו המסגרת שלפיה יש לקרוא כל מדד (benchmark) בהמשך.

מה שה-API הרשמי למעשה מקבל

מדריך הפלטפורמה של Ant Ling מתעד את Ling-3.0-flash-VL בשתי צורות API: נקודת קצה תואמת OpenAI בכתובת api.ant-ling.com/v1/chat/completions ונקודת קצה תואמת Anthropic בכתובת api.ant-ling.com/anthropic/v1/messages. כדאי לדעת את המגבלות לפני שתבנה מולו:

• תמונות — JPEG ו-PNG, base64 בלבד, עד 40 תמונות לכל בקשה, כל תמונה עד 16,384 × 784 פיקסלים וכל מחרוזת base64 עד 32 MB. התואם ל-OpenAI הוא image_url.detail. הפרמטר נחשב לזניח; המנוע מחליט על הרזולוציה באופן פנימי.

• וידאו — MP4, MOV או WMV, קליפ אחד לכל בקשה, מוגבל ל-30 שניות, דגימה בקצב קבוע של 2 פריימים לשנייה עד 32 פריימים, base64 עד 32 MB. וידאו עובד רק על נקודת הקצה התואמת ל-OpenAI; נקודת הקצה התואמת ל-Anthropic מקבלת טקסט ותמונות, אך לא וידאו.

• מזהה המודל — דוגמאות ה-curl במדריך קוראות למודל Ling-3.0-flash-VL-rc1 ולא Ling-3.0-flash-VL. הסיומת -rc1 ההיא היא סמן מועמד לשחרור ושאלה פתוחה אמיתית: אף מסמך לא מציין אילו משקלים הפלטפורמה משרתת או האם נקודת הביקורת של ה-API תואמת למבנה המשקלים הפתוחים מ-4 בספטמבר. אם אתה משווה את ה-API מול המשקלים הפתוחים, זה הדבר הראשון שצריך לבדוק, לא הנחה.

An English screenshot of Ant's Ling-platform developer tutorial 'Multimodal Understanding' (captured September 8, 2026, cropped to the article column), which opens 'Ling-3.0-flash-VL is a vision-language model that supports multimodal inputs and understands text, images, and video', then lists the image-understanding limits: JPEG and PNG formats, each image up to 16,384 × 784 pixels, each base64 string up to 32 MB, up to 40 images per request and a 32 MB maximum request body, with OpenAI Chat Completions and Anthropic Messages API columns.

העמוד שלמעלה הוא המקום שבו נמצאים אילוצי הקלט — פורמטי תמונה ווידאו, מגבלות לכל בקשה, ושתי צורות נקודות הקצה. זה גם המקום שבו מאושר שהמודל הוא הצעת API מסחרית פעילה ולא שלד תיעודי בלבד.

המספרים — ומי דיווח עליהם

A generated single-column scoreboard titled 'Ling-3.0-flash-VL — the scoreboard', with rows 'Released: Sep 4 2026 — MIT weights plus live API', 'Architecture: 124B sparse MoE, ~5.5B active per token', 'Inputs: text, images, short video', 'Context: up to 1M tokens', 'AA Intelligence Index: 42 (vendor-reported)' and 'Text sibling Ling-3.0-flash: 38 (AA-measured)', with the footer 'VL figure per Ant model card; 38 measured by Artificial Analysis.' and the OrcaRouter logo bottom-right.

המספר הראשי היחיד בכרטיס הוא 42 בפרוטוקול מדד הבינה המלאכותית של Artificial Analysis, גרסה 4.1.1, שלפי אנט גבוה בארבע נקודות מהציון 38 של Ling-3.0-flash הטקסטואלי בלבד. ההבחנה במשפט הזה היא קריטית. ה-38 הוא מדידה של Artificial Analysis — רצה באופן עצמאי, פורסמה בלוח המובילים שלהם, ומצוטטת בהסכמה בכל הסיקור התעשייתי של מודל הטקסט. ה-42 הוא טענה בכרטיס המודל של אנט עצמה, שנעשתה תחת פרוטוקול מדד AA אך טרם פורסמה על ידי Artificial Analysis, שלא היה לה דף עבור Ling-3.0-flash-VL נכון לכתיבת שורות אלה. אף אחד מחוץ לאנט עדיין לא הריץ את נקודת הבקרה הזו. יש להתייחס ל-42 כאל נתון יצרן מאותה משפחה שהפיקה את ה-38 האמיתי של מודל הטקסט — סיבה לבדוק, לא מספר לצטט כעובדה מבוססת.

כל השאר במהדורה הוא איכותני או מתודולוגי. הכרטיס מתאר את המודל באמצעות תרשים יכולות של "להבין, להסיק, לפעול", ורומז להרצת הערכה סוכנותית של Terminal-Bench תחת פרוטוקול בסגנון AA, אך אינו מפרסם תוצאות מספריות שניתן לשחזר כאן; ספר המתכונים לפריסה מציג תאי דיוק (MMMU-Pro, GSM8K) הקשורים לתצורות שרת ספציפיות שכדאי לקרוא, אך מדובר במדידות הסמוכות לתשתית ולא בהערכות עצמאיות. הסיכום הכנה קצר: מודל הגיוני, זול לשירות, בעל יכולות ראייה, שעדיין אין לו לוח תוצאות עצמאי פומבי.

מה זה עולה, ומה ההיסטוריה המשפחתית מרמזת

המדריך המולטי-מודאלי של Ant אינו מציין מחיר פר-טוקן עבור Ling-3.0-flash-VL, כך שכל מה שמופיע כאן הוא הערכה, והדבר מסומן במפורש. נקודת העיגון השימושית היא אחיו הטקסטואלי על אותה פלטפורמה: המחיר הרשמי מדרגה ראשונה של Ling-3.0-flash הוא כ-0.075$ לכל מיליון טוקני קלט ו-0.22$ לכל מיליון טוקני פלט, עם קריאות מטמון זולות בכ-80% בערך, והקונסולה הסינית מתמחרת אותו ברנמינבי (¥0.40 קלט / ¥1.20 פלט לכל מיליון טוקנים) לאחר מבצע הנחה של 75% שהסתיים ב-31 באוגוסט. מודל מולטי-מודאלי בגודל 124B-A5.5B יקר יותר לתפעול מאשר מודל טקסט בגודל 124B-A5.1B — מגדל הראייה הוא דחוס ורץ עבור כל טוקן תמונה — ולכן מחיר בתוך הטווח הזה או מעט מעליו הוא ההנחה המוקדמת הסבירה. ההיסטוריה המשפחתית פועלת גם בכיוון ההפוך: גרסאות התחום Fin ו-Sante הושקו כ-API חינמיים, כך ש-Ant הוכיחה שהיא מוכנה להשתמש במחיר אפס כדי לזרז אימוץ של גרסת Ling שהיא רוצה להחדיר לשוק. השאלה אם גרסת ה-VL תתמחר לפי טווח מודל הטקסט בתשלום או לפי הדפוס של הגרסה החינמית פשוט עדיין אינה פומבית.

עבור המסלול של אירוח עצמי המספרים קונקרטיים מכיוון שהקבצים ציבוריים. גרסת ה-bf16 היא בערך הורדה של 250 ג'יגה-בייט על פני 64 שארדים — עניין של מספר GPUs על כל דבר מלבד הצמתים הבודדים הגדולים ביותר — בעוד שגרסת ה-FP8 (~126 ג'יגה-בייט, מגדל הראייה נשמר ב-bf16) מתאימה בנוחות לצומת עם 8 מאיצים מסוג 80 ג'יגה-בייט, והיא הגרסה שרוב הצוותים יריצו בפועל. טענות התפוקה מספר הבישול קיימות אבל קשורות לספקים; צפו לאזהרה הרגילה שטוקנים לשנייה בפועל תלויים בחומרה שלכם ובגודל ה-batch שלכם.

היכן ששכבת ניתוב מתאימה — בכנות

בהשקה, אף שער מודלים מרכזי של צד שלישי שבדקנו לא כולל את Ling-3.0-flash-VL, וגם OrcaRouter — פלטפורמת הניתוב שהבלוג הזה שייך אליה — לא מציעה אותו. אין לקרוא שום דבר בכתבה זו כאילו הוא כן. זהו מצבו הכנה של מודל בן ארבעה ימים, וכדאי לומר זאת במפורש, כי האפשרויות העומדות בפני הקורא בפועל כיום הן בדיוק שתיים: לפנות ל-API הרשמי של Ant, או לאכסן בעצמך את משקלי ה-MIT. זווית הניתוב היא מה שקורה בהמשך. ברגע שמודל כזה מגיע לשרתי צד שלישי, הכלכלה של נתב מעבר היא הסיבה להעדיף אותו לצורך הערכה: מחיר המחירון של הספק מועבר עם 0% תוספת, כך שהורדת מחיר של ספק (או ניסוי בשכבת חינם כמו ההשקות של Fin ו-Sante) נכנסת לתוקף באותו יום שבו היא מוכרזת, ומעבר אוטומטי מאפשר לכוון עומס עבודה אמיתי למודל פתוח בן ימים ספורים בלי להמר על זמינות הספק האחד או על התנהגותו של checkpoint אחד. עבור משפחה שתמחרה את עצמה מחדש פעם אחת והתפצלה לארבע גרסאות בתוך שישה שבועות, זה לא היפותטי — זה ההבדל בין בדיקה חוזרת ידנית בכל פעם ש-Ant זז לבין בדיקה חוזרת פעם אחת דרך API אחד.

מה לצפות

שחרור זה צעיר מספיק כך שהאותות השימושיים הם ברובם בדיקות שכל אחד יכול להריץ. ראשית, האם Artificial Analysis (או מעבדה עצמאית אחרת) מפרטת את Ling-3.0-flash-VL ומאשרת או מתקנת את ה-42 — נקודת נתונים יחידה זו מפרידה בין "המודל הטוב ביותר של המשפחה" לבין "מספר ספק אחר". שנית, האם ה-rc1 מזהה בממשק הרשמי מתייחס למשקולות הפתוחות של ה-4 בספטמבר; אם לא, ממשק ה-API והנתיב של האירוח העצמי הם מודלים שונים, וכל השוואה שתקרא צריכה לציין באיזה מהם השתמשה. שלישית, תמחור: תעריף VL מפורסם בפלטפורמת Ling, והאם הוא עוקב אחר מדרגת המחיר בתשלום של מודל הטקסט או לפי ספר המשחקים של ה-API החופשי של Fin/Sante. רביעית, האם נקודת הביקורת FP8 שומרת על דיוק הכרטיס בשרת אמיתי — מגדל הראייה שנשמר ב-bf16 הוא סימן טוב, אבל טענות על ראייה מכומתת דורשות ריצה, לא קונפיגורציה. וחמישית, שאלת מפת המוצרים: כעת, כשהראייה נמצאת בתוך קו Ling המהיר, שים לב אם Ant שומרת על Ming כמותג מולטימודלי נפרד או נותנת לשניים להתכנס.

עבור מפתח, התשובה לטווח הקצר היא קצרה. אם אתה רוצה לבנות על זה היום, ה-API הרשמי הוא הנתיב ללא תשתית, ומשקלי ה-FP8 הם נתיב האירוח העצמי, ושניהם אמיתיים נכון לשבוע זה. אם אתה רוצה לבנות על המספר 42, חכה שמישהו מחוץ ל-Ant ישחזר אותו. כל מה שבאמת שימושי ב-Ling-3.0-flash-VL — משקלי MIT, ארכיטקטורה סבירה, עיצוב אגרסיבי של מחיר-להפעלה, וציון ספק שכדאי לקחת ברצינות — נמצא במקום; כל מה שיהפוך אותו לברירת מחדל בטוחה עדיין חסר.