
Ling-3.0-flash-VL: Ant משיקה מודל מולטי-מודאלי על קו ה-Ling המהיר
- deepseekחדשDeepSeek: DeepSeek V4.1 Flash2026-09-1040אינטליגנציה
- openaiחדשOpenAI: GPT-6 Astra2026-09-0453אינטליגנציה77כתיבת קוד
- googleחדשGoogle: Gemini 3.8 Flash2026-09-0241אינטליגנציה76כתיבת קוד
- qwenחדשQwen: Qwen3.8 Max (0902)2026-09-0240אינטליגנציה72כתיבת קוד
- anthropicחדשAnthropic: Claude Fable 5.12026-09-0153אינטליגנציה82כתיבת קוד
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 לכל 1M טוקנים
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642אינטליגנציה72כתיבת קוד
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 לכל 1M טוקנים
- z-aiZ.ai: GLM 5.32026-08-1845אינטליגנציה75כתיבת קוד
- obsidianQwen3.8 27B2026-08-1534אינטליגנציה68כתיבת קוד
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236אינטליגנציה69כתיבת קוד
- grokSpaceXAI: Grok 4.62026-08-1244אינטליגנציה77כתיבת קוד
- metaMeta: Muse Spark 1.22026-08-0540אינטליגנציה72כתיבת קוד
- qwenQwen: Qwen3.8 Max2026-08-0340אינטליגנציה72כתיבת קוד
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135אינטליגנציה69כתיבת קוד
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 לכל 1M טוקנים
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2451אינטליגנציה78כתיבת קוד
- googleGoogle: Gemini 3.6 Flash2026-07-2134אינטליגנציה69כתיבת קוד
ב-4 בספטמבר 2026, מעבדת inclusionAI של Ant Group פרסמה משקלים ברישיון MIT עבור Ling-3.0-flash-VL ב-Hugging Face, ובאותו יום עדכנה את תיעוד המפתחים של פלטפורמת Ant Ling כך שיתאים. Ling-3.0-flash-VL הוא נקודת הביקורת הראשונה בעלת יכולות ראייה במשפחת Ling-3.0-flash: אותו שלד דליל של ~124 מיליארד פרמטרים מבוסס mixture-of-experts שהפך את Ling-3.0-flash הטקסטואלי בלבד לאחד ממודלי החשיבה הזולים ביותר שזכו לתשומת לב בסוף הקיץ, וכעת הוא קורא תמונות וקטעי וידאו קצרים לצד טקסט. קוונטיזציית FP8 נוספה ב-8 בספטמבר, בבוקר שבו נכתבים הדברים האלה. כך שבתוך ארבעה ימים רכש המהדורה שלושה ממשקים שהקורא יכול לפעול דרכם — משקלים פתוחים, API רשמי בפלטפורמת Ling של Ant, וציון שדווח על ידי הספק של 42 בפרוטוקול מדד Artificial Analysis Intelligence גרסה 4.1.1, ארבע נקודות מעל הציון הנמדד באופן בלתי תלוי של האח הטקסטואלי, 38. מה שעדיין אין למהדורה הוא הכרזה רשמית: כרטיס Hugging Face והמדריך למפתחים הם ההשקה כולה, ולכן מאמר זה מפריד בין מה שהספק מצהיר לבין מה שמי שמחוץ לחברה יכול לאמת.
ההשקה חשובה בגלל מה שהיא עושה למפת המוצרים של Ant. עד אמצע 2026, העבודה המולטימודלית בתיק הדגמים של Ant ישבה בקו Ming הנפרד, בעוד Ling-3.0-flash מוקמה — כולל במדריך של הבלוג הזה עצמו למודל הטקסט — כשכבה המהירה, טקסט-וכלים, עבור סוכנים, קידוד ומחקר מעמיק. Ling-3.0-flash-VL מבטלת את הגבול הזה: היא מביאה מידע חזותי לתוך מודל חשיבה הבנוי סביב טביעת רגל קטנה במיוחד של פרמטרים מופעלים וריצות סוכן ארוכות, ומעניקה את התוצאה למפתחים בשלוש דרכים בבת אחת. זה הופך אותה להחלטה שונה באמת מהווריאנטים המוכווני-תחום הקודמים (Ling-3.0-flash-Fin, Ling-3.0-flash-Sante), ששוחררו כ-API חינמיים ללא משקלים. המודל הזה פתוח, רץ על הפלטפורמה בתשלום של Ant, וצעיר מספיק כדי שאיש מחוץ לספק עדיין לא פרסם ריצה עצמאית. העובדה האחרונה היא החשובה ביותר בכתבה.
מה שוחרר, ומתי
כל תאריך שלהלן ניתן לאימות מתוך המאגרים והמסמכים; שום חלק ממנו אינו נשען על הודעה לעיתונות שאינה קיימת.
• 4 בספטמבר — המאגר של Hugging Face בשם inclusionAI/Ling-3.0-flash-VL נוצר בשעה 15:24 UTC עם 64 רסיסי משקולות bf16, ערימת קוד מותאם אישית מלאה עבור ה-bailing_moe_v3_vl ארכיטקטורה, תבנית צ'אט עם חשיבה מופעלת כברירת מחדל, ורישיון MIT. מספר ההורדות עומד על עשרות נכון לכתיבת שורות אלה: זהו שחרור שרק עוקב-מאגרים היה קולט ביום הראשון.
• 4 בספטמבר — פורטל המפתחים של Ling-platform של Ant הוסיף את מדריך ההבנה המולטימודלית המתעד את המודל ב-API הרשמי (החותמת "עודכן לאחרונה" של הדף עצמו מציינת 4 בספטמבר 2026). כלי התקשורת הסיניים למפתחים דיווחו על היכולת למחרת, והציגו אותה כהבנת תמונות וסרטונים קצרים למענה חזותי על שאלות ולניתוח תוכן.
החל מה-5 בספטמבר — תמיכה בהרצה ובפריסה הופיעה במהירות: מדריך פריסה של SGLang למודל, מזלג vLLM מותאם שמתוחזק על ידי ארגון inclusionAI, ורשימה בספריית פריסה עם משקלים משלך הכוללת נקודת קצה מוכנה להשלמות צ'אט. אלה הם רכיבי ריצה ותשתית, לא הכרזות, אבל הם מראים לך שהמודל נבנה כדי להיות מוגש, לא רק פורסם.
• 8 בספטמבר — קוונטיזציית ה-FP8 של inclusionAI/Ling-3.0-flash-VL-fp8 הגיעה (64 שארדים, ~126 GB), כשמגדל הראייה הושאר במכוון בדיוק גבוה יותר בעוד משקלי ה-MoE נדחסו ל-FP8 E4M3. לאירוח עצמי על פחות GPUs או GPUs קטנים יותר, זהו ה-checkpoint שרוב האנשים יורידו בפועל.

הכרטיס שלמעלה הוא הדבר הקרוב ביותר שיש למהדורה הזו לפוסט השקה — תיאור מודל, ארכיטקטורה, קישורים למתכוני SGLang ו-vLLM, ואין הכרזה בשום מקום אחר שאנחנו יכולים למצוא. שים לב לפער שחשוב לציין כבר בהתחלה: כרטיס המודל אומר "רק 5.5B פרמטרים מופעלים לכל טוקן", בעוד ספר הבישול של SGLang שנכתב בערך באותה מהדורה מתאר מודל "פעיל 5.1B". לגבי checkpoint חדש לגמרי, ההבדל הוא כנראה עניין של חישוב מגדל הראייה ולא שני מודלים שונים, אבל זה בדיוק סוג הפרטים שצריך לסמן כלא מוכרע ולא להחליק.
מודל 124B שמפעיל 5.5B — עכשיו עם עיניים
Ling-3.0-flash-VL שומר על המתכון ההיברידי של sparse-MoE שהגדיר את אחיו הטקסטואלי. הכרטיס מתאר עמוד שדרה של 42 שכבות המחליפות בין שכבות Kimi-Delta-Attention ו־Gated-MLA ביחס של 5:1 — אותו קצב מבני כמו Ling-3.0-flash — עם סך כולל של כ־124.8 מיליארד פרמטרים ורק חלק קטן מופעל לכל טוקן. מה שחדש הוא ערימת התפיסה: מקודד חזותי מסוג ViT המזין מקרן MLP דו־שכבתי אל עמוד השדרה הלשוני, בתוספת VideoRoPE שמקודד גם מיקום מרחבי וגם מיקום זמני כך שפריימים של וידאו מגיעים בסדר שהמודל יכול לנמק עליו. הקלט הוא טקסט, תמונה וווידאו; הפלט הוא טקסט.
• פרמטרים — 124B בסך הכל, ~5.5B מופעלים לטוקן לפי כרטיס הספק (ראה את הסתייגות החישוב לעיל).
• הקשר — מפורסם כ"עד 1M טוקנים"; מתכוני הפריסה שקיימים כיום מפעילים 256K באמצעות YaRN rope scaling, וזהו הנתון המעשי הכנה שכדאי לתכנן לפיו עד שמישהו יפרסם ריצה ארוכה יותר מאומתת.
• חשיבה — ההנמקה מופעלת כברירת מחדל באמצעות תבנית הצ'אט; גם הדוגמאות הרשמיות של ה-API וגם מתכוני ההגשה מציגים לכל בקשה enable_thinking: false כמתג עבור קריאות רגישות לזמן אחזור.
• רישיון — MIT, שני פורמטי הדיוק, ללא סייגים. זהו אותו רישיון נקי שהפך את פתיחת הקוד של מודל הטקסט באוגוסט למשמעותית, וזו בדיוק הסיבה שאירוח עצמי הוא אפשרות מציאותית ולא אזור אפור.
הכוונה העיצובית חשובה לא פחות מגיליון המפרט. אנט ממקמת את Ling-3.0-flash-VL כמודל ש"מביא מידע חזותי לתוך התהליך המלא של הבנה, חשיבה, פעולה ואימות" — שזו השפה של עומסי עבודה סוכניים (agentic), לא של תיאור תמונות. מודל שיכול לצפות בהקלטת מסך של 30 שניות, להחזיק סשן ארוך של קריאות לכלים (tool-calling) בהקשר, ולשמור על עלות ההפעלה שלו קרובה ל-5B פרמטרים, מכוון ישירות לסוכנים מבוססי שימוש במחשב ובווידאו קצר. זהו מוצר שונה ממודלי שפה-ראייה המותאמים למענה על שאלות על תמונה בודדת, וזו המסגרת שלפיה יש לקרוא כל מדד (benchmark) בהמשך.
מה שה-API הרשמי למעשה מקבל
מדריך הפלטפורמה של Ant Ling מתעד את Ling-3.0-flash-VL בשתי צורות API: נקודת קצה תואמת OpenAI בכתובת api.ant-ling.com/v1/chat/completions ונקודת קצה תואמת Anthropic בכתובת api.ant-ling.com/anthropic/v1/messages. כדאי לדעת את המגבלות לפני שתבנה מולו:
• תמונות — JPEG ו-PNG, base64 בלבד, עד 40 תמונות לכל בקשה, כל תמונה עד 16,384 × 784 פיקסלים וכל מחרוזת base64 עד 32 MB. התואם ל-OpenAI הוא image_url.detail. הפרמטר נחשב לזניח; המנוע מחליט על הרזולוציה באופן פנימי.
• וידאו — MP4, MOV או WMV, קליפ אחד לכל בקשה, מוגבל ל-30 שניות, דגימה בקצב קבוע של 2 פריימים לשנייה עד 32 פריימים, base64 עד 32 MB. וידאו עובד רק על נקודת הקצה התואמת ל-OpenAI; נקודת הקצה התואמת ל-Anthropic מקבלת טקסט ותמונות, אך לא וידאו.
• מזהה המודל — דוגמאות ה-curl במדריך קוראות למודל Ling-3.0-flash-VL-rc1 ולא Ling-3.0-flash-VL. הסיומת -rc1 ההיא היא סמן מועמד לשחרור ושאלה פתוחה אמיתית: אף מסמך לא מציין אילו משקלים הפלטפורמה משרתת או האם נקודת הביקורת של ה-API תואמת למבנה המשקלים הפתוחים מ-4 בספטמבר. אם אתה משווה את ה-API מול המשקלים הפתוחים, זה הדבר הראשון שצריך לבדוק, לא הנחה.

העמוד שלמעלה הוא המקום שבו נמצאים אילוצי הקלט — פורמטי תמונה ווידאו, מגבלות לכל בקשה, ושתי צורות נקודות הקצה. זה גם המקום שבו מאושר שהמודל הוא הצעת API מסחרית פעילה ולא שלד תיעודי בלבד.
המספרים — ומי דיווח עליהם

המספר הראשי היחיד בכרטיס הוא 42 בפרוטוקול מדד הבינה המלאכותית של Artificial Analysis, גרסה 4.1.1, שלפי אנט גבוה בארבע נקודות מהציון 38 של Ling-3.0-flash הטקסטואלי בלבד. ההבחנה במשפט הזה היא קריטית. ה-38 הוא מדידה של Artificial Analysis — רצה באופן עצמאי, פורסמה בלוח המובילים שלהם, ומצוטטת בהסכמה בכל הסיקור התעשייתי של מודל הטקסט. ה-42 הוא טענה בכרטיס המודל של אנט עצמה, שנעשתה תחת פרוטוקול מדד AA אך טרם פורסמה על ידי Artificial Analysis, שלא היה לה דף עבור Ling-3.0-flash-VL נכון לכתיבת שורות אלה. אף אחד מחוץ לאנט עדיין לא הריץ את נקודת הבקרה הזו. יש להתייחס ל-42 כאל נתון יצרן מאותה משפחה שהפיקה את ה-38 האמיתי של מודל הטקסט — סיבה לבדוק, לא מספר לצטט כעובדה מבוססת.
כל השאר במהדורה הוא איכותני או מתודולוגי. הכרטיס מתאר את המודל באמצעות תרשים יכולות של "להבין, להסיק, לפעול", ורומז להרצת הערכה סוכנותית של Terminal-Bench תחת פרוטוקול בסגנון AA, אך אינו מפרסם תוצאות מספריות שניתן לשחזר כאן; ספר המתכונים לפריסה מציג תאי דיוק (MMMU-Pro, GSM8K) הקשורים לתצורות שרת ספציפיות שכדאי לקרוא, אך מדובר במדידות הסמוכות לתשתית ולא בהערכות עצמאיות. הסיכום הכנה קצר: מודל הגיוני, זול לשירות, בעל יכולות ראייה, שעדיין אין לו לוח תוצאות עצמאי פומבי.
מה זה עולה, ומה ההיסטוריה המשפחתית מרמזת
המדריך המולטי-מודאלי של Ant אינו מציין מחיר פר-טוקן עבור Ling-3.0-flash-VL, כך שכל מה שמופיע כאן הוא הערכה, והדבר מסומן במפורש. נקודת העיגון השימושית היא אחיו הטקסטואלי על אותה פלטפורמה: המחיר הרשמי מדרגה ראשונה של Ling-3.0-flash הוא כ-0.075$ לכל מיליון טוקני קלט ו-0.22$ לכל מיליון טוקני פלט, עם קריאות מטמון זולות בכ-80% בערך, והקונסולה הסינית מתמחרת אותו ברנמינבי (¥0.40 קלט / ¥1.20 פלט לכל מיליון טוקנים) לאחר מבצע הנחה של 75% שהסתיים ב-31 באוגוסט. מודל מולטי-מודאלי בגודל 124B-A5.5B יקר יותר לתפעול מאשר מודל טקסט בגודל 124B-A5.1B — מגדל הראייה הוא דחוס ורץ עבור כל טוקן תמונה — ולכן מחיר בתוך הטווח הזה או מעט מעליו הוא ההנחה המוקדמת הסבירה. ההיסטוריה המשפחתית פועלת גם בכיוון ההפוך: גרסאות התחום Fin ו-Sante הושקו כ-API חינמיים, כך ש-Ant הוכיחה שהיא מוכנה להשתמש במחיר אפס כדי לזרז אימוץ של גרסת Ling שהיא רוצה להחדיר לשוק. השאלה אם גרסת ה-VL תתמחר לפי טווח מודל הטקסט בתשלום או לפי הדפוס של הגרסה החינמית פשוט עדיין אינה פומבית.
עבור המסלול של אירוח עצמי המספרים קונקרטיים מכיוון שהקבצים ציבוריים. גרסת ה-bf16 היא בערך הורדה של 250 ג'יגה-בייט על פני 64 שארדים — עניין של מספר GPUs על כל דבר מלבד הצמתים הבודדים הגדולים ביותר — בעוד שגרסת ה-FP8 (~126 ג'יגה-בייט, מגדל הראייה נשמר ב-bf16) מתאימה בנוחות לצומת עם 8 מאיצים מסוג 80 ג'יגה-בייט, והיא הגרסה שרוב הצוותים יריצו בפועל. טענות התפוקה מספר הבישול קיימות אבל קשורות לספקים; צפו לאזהרה הרגילה שטוקנים לשנייה בפועל תלויים בחומרה שלכם ובגודל ה-batch שלכם.
היכן ששכבת ניתוב מתאימה — בכנות
בהשקה, אף שער מודלים מרכזי של צד שלישי שבדקנו לא כולל את Ling-3.0-flash-VL, וגם OrcaRouter — פלטפורמת הניתוב שהבלוג הזה שייך אליה — לא מציעה אותו. אין לקרוא שום דבר בכתבה זו כאילו הוא כן. זהו מצבו הכנה של מודל בן ארבעה ימים, וכדאי לומר זאת במפורש, כי האפשרויות העומדות בפני הקורא בפועל כיום הן בדיוק שתיים: לפנות ל-API הרשמי של Ant, או לאכסן בעצמך את משקלי ה-MIT. זווית הניתוב היא מה שקורה בהמשך. ברגע שמודל כזה מגיע לשרתי צד שלישי, הכלכלה של נתב מעבר היא הסיבה להעדיף אותו לצורך הערכה: מחיר המחירון של הספק מועבר עם 0% תוספת, כך שהורדת מחיר של ספק (או ניסוי בשכבת חינם כמו ההשקות של Fin ו-Sante) נכנסת לתוקף באותו יום שבו היא מוכרזת, ומעבר אוטומטי מאפשר לכוון עומס עבודה אמיתי למודל פתוח בן ימים ספורים בלי להמר על זמינות הספק האחד או על התנהגותו של checkpoint אחד. עבור משפחה שתמחרה את עצמה מחדש פעם אחת והתפצלה לארבע גרסאות בתוך שישה שבועות, זה לא היפותטי — זה ההבדל בין בדיקה חוזרת ידנית בכל פעם ש-Ant זז לבין בדיקה חוזרת פעם אחת דרך API אחד.
מה לצפות
שחרור זה צעיר מספיק כך שהאותות השימושיים הם ברובם בדיקות שכל אחד יכול להריץ. ראשית, האם Artificial Analysis (או מעבדה עצמאית אחרת) מפרטת את Ling-3.0-flash-VL ומאשרת או מתקנת את ה-42 — נקודת נתונים יחידה זו מפרידה בין "המודל הטוב ביותר של המשפחה" לבין "מספר ספק אחר". שנית, האם ה-rc1 מזהה בממשק הרשמי מתייחס למשקולות הפתוחות של ה-4 בספטמבר; אם לא, ממשק ה-API והנתיב של האירוח העצמי הם מודלים שונים, וכל השוואה שתקרא צריכה לציין באיזה מהם השתמשה. שלישית, תמחור: תעריף VL מפורסם בפלטפורמת Ling, והאם הוא עוקב אחר מדרגת המחיר בתשלום של מודל הטקסט או לפי ספר המשחקים של ה-API החופשי של Fin/Sante. רביעית, האם נקודת הביקורת FP8 שומרת על דיוק הכרטיס בשרת אמיתי — מגדל הראייה שנשמר ב-bf16 הוא סימן טוב, אבל טענות על ראייה מכומתת דורשות ריצה, לא קונפיגורציה. וחמישית, שאלת מפת המוצרים: כעת, כשהראייה נמצאת בתוך קו Ling המהיר, שים לב אם Ant שומרת על Ming כמותג מולטימודלי נפרד או נותנת לשניים להתכנס.
עבור מפתח, התשובה לטווח הקצר היא קצרה. אם אתה רוצה לבנות על זה היום, ה-API הרשמי הוא הנתיב ללא תשתית, ומשקלי ה-FP8 הם נתיב האירוח העצמי, ושניהם אמיתיים נכון לשבוע זה. אם אתה רוצה לבנות על המספר 42, חכה שמישהו מחוץ ל-Ant ישחזר אותו. כל מה שבאמת שימושי ב-Ling-3.0-flash-VL — משקלי MIT, ארכיטקטורה סבירה, עיצוב אגרסיבי של מחיר-להפעלה, וציון ספק שכדאי לקחת ברצינות — נמצא במקום; כל מה שיהפוך אותו לברירת מחדל בטוחה עדיין חסר.
