
Ling-3.0-flash-VL לעומת Ling 3.0 Flash: מוח אחד של 124B, עכשיו עם עיניים
- orcaחדשOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 לכל 1M טוקנים
- deepseekחדשDeepSeek: DeepSeek V4.1 Flash2026-09-1040אינטליגנציה
- openaiחדשOpenAI: GPT-6 Astra2026-09-0453אינטליגנציה77כתיבת קוד
- googleGoogle: Gemini 3.8 Flash2026-09-0241אינטליגנציה76כתיבת קוד
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245אינטליגנציה76כתיבת קוד
- anthropicAnthropic: Claude Fable 5.12026-09-0153אינטליגנציה82כתיבת קוד
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 לכל 1M טוקנים
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642אינטליגנציה72כתיבת קוד
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 לכל 1M טוקנים
- z-aiZ.ai: GLM 5.32026-08-1845אינטליגנציה75כתיבת קוד
- obsidianQwen3.8 27B2026-08-1534אינטליגנציה68כתיבת קוד
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236אינטליגנציה69כתיבת קוד
- grokSpaceXAI: Grok 4.62026-08-1244אינטליגנציה77כתיבת קוד
- metaMeta: Muse Spark 1.22026-08-0540אינטליגנציה72כתיבת קוד
- qwenQwen: Qwen3.8 Max2026-08-0345אינטליגנציה76כתיבת קוד
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135אינטליגנציה69כתיבת קוד
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 לכל 1M טוקנים
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2451אינטליגנציה78כתיבת קוד
Ling-3.0-flash-VL ו-Ling 3.0 Flash אינם יריבים, וקריאה של הזיווג הזה כעימות בין דגמים תוביל אתכם למסקנה שגויה. Ling-3.0-flash-VL הוא נקודת הבידוק (checkpoint) של שפה-ראייה שמעבדת ה-inclusionAI של Ant Group שחררה השבוע — המשקולות זמינות ב-Hugging Face תחת רישיון MIT מאז 4 בספטמבר 2026 — והוא נבנה ישירות על Ling 3.0 Flash, מודל הטקסט הפתוח בעל 124 מיליארד הפרמטרים של המעבדה, שמשמש כעמוד התווך של השכבה המהירה שלה מאז סוף יולי. השניים חולקים את אותו עיצוב MoE היברידי-ליניארי, את אותו כלכלת הפעלה דלילה (sparse-activation), את אותו מתכון להגשת הקשר של 256K, ואת אותו רישיון MIT. מה שנקודת הבידוק ה-VL מוסיפה הוא הדבר היחיד שמודל הטקסט מעולם לא היה לו: קלט תמונה ווידאו טבעי, המועבר דרך מקודד ViT, מקרן MLP דו-שכבתי, וקידוד זמני של VideoRoPE. לכן ההשוואה מצטמצמת לשאלה מעשית אחת — אם עומס העבודה שלכם אף פעם לא מסתכל על תמונה, האם הדגם עם העיניים מצדיק את המעבר?
הסיבה שבגללה השאלה בכלל ראויה להישאל היא ש-inclusionAI אינה ממסגרת את Ling-3.0-flash-VL כקו מוצרים נפרד. כרטיס המודל שלה מכנה אותו "מודל המולטי-מודאלי הילידי מהדור הבא שלנו", הבנוי על Ling-3.0-flash, שיורש את יכולות השפה, ההסקה וההקשר הארוך של אותו מודל ומרחיב אותן בראייה המשתתפת בלולאה המלאה של הבנה, הסקה, פעולה ואימות — לא ראייה כתוסף חיצוני. עבור משפחת מודלים שמהדורת הדגל הקודמת שלה הייתה במפורש טקסט בלבד, זהו שינוי אמיתי, והוא משנה איזה checkpoint צוות שעובד עם טקסט וכלים צריך לאמץ כסטנדרט.
שתי נקודות ביקורת, עמוד שדרה אחד
Ling 3.0 Flash, יריב ההשוואה הזו, הוא הבשל יותר מבין השניים. הוא הוכרז בסוף יולי 2026, וקוד המקור שלו שוחרר תחת רישיון MIT ב-7 באוגוסט. זהו מודל היברידי-ליניארי של תערובת מומחים, עם 124B פרמטרים בסך הכול וכ-5.1B פרמטרים פעילים לכל טוקן — 35 שכבות KDA ו-7 שכבות Gated MLA, המוערמות ביחס של 5:1, 512 מומחים מנותבים, מתוכם 8 מופעלים, וקונטקסט מקורי של 256K, כלומר 262,144 טוקנים. הוא מיועד לטקסט בלבד, עם תמיכה בקריאת כלים וחשיבה המופעלת כברירת מחדל דרך תבנית הצ'אט, ופרופיל עלות נמוך במידה חריגה ביחס לגודלו. הוא גם החצי המתועד של הצמד: Artificial Analysis כוללת אותו בלוח הדירוג החי שלה, שם הוא מדורג ראשון מבין 63 המודלים במחלקתו, עם תפוקה נמדדת של כ-313 טוקנים בשנייה ב-API של הספק.
{{1}}Ling-3.0-flash-VL שומר על הארכיטקטורה הזו ומוסיף מעליה ערימה חזותית.{{/1}} כרטיס המודל מתאר מקודד חזותי מסוג ViT שתכונותיו מיושרות למרחב הטקסט באמצעות מקרן MLP דו-שכבתי, כש-VideoRoPE מקודד גם את המיקום המרחבי וגם את הסדר הזמני — כך שהמודל מסוגל לאתר אירועים ולבצע הסקה על סרטונים ארוכים. {{2}}עמוד השדרה הוא אותו הכלאיים KDA-to-MLA ביחס 5:1, והפעם עם 124B סה"כ / 5.5B פעילים לכל טוקן, על גזע בן 42 שכבות.{{/2}} הקלטים: טקסט, תמונה ווידאו; הפלט: טקסט. חלון ההקשר המוצהר מגיע עד 1M טוקנים, כשהמתכון המומלץ של SGLang משרת 256K באמצעות סקלת YaRN. {{3}}בדומה לאחיו הטקסטואלי, הוא מגיע עם חשיבה מופעלת כברירת מחדל (ניתן להשבית אותה לכל בקשה באמצעות chat_template_kwargs), והוא רץ תחת SGLang או תחת פיצול מותאם אישית של vLLM מבית inclusionAI.{{/3}} {{4}}גרסת ה-BF16 שוקלת כ-250 GB בדיסק, על פני 64 רסיסי safetensor — באותה קטגוריית גודל של רבע טרה-בייט כמו משקלי מודל הטקסט.{{/4}}
כמה טרי זה? נכון למועד כתיבת שורות אלה, למאגר VL יש מספר הורדות בעשרות בודדות, כרטיס המודל שלו עוד היה בשלבי עדכון, ו־Artificial Analysis לא כללה אותו ברשימה. כל מה שלהלן שאינו מיוחס במפורש ל־Artificial Analysis הוא דיווח עצמי של inclusionAI.

לוח התוצאות
האסימטריה כאן אינה איכות — היא מודאליות. שישה ממדים מקיפים את ההחלטה:
• אינטליגנציה (כרטיס ספק, AA Index v4.1.1) — Ling-3.0-flash-VL: 42, לפי דיווח הספק. Ling 3.0 Flash: 38, נתון המדד הקודם שהכרטיס מצטט.
• הלוח החי של AA היום (v4.3) — Ling-3.0-flash-VL: לא מופיע עדיין. Ling 3.0 Flash: מוערך ב-25, מדורג #1 מתוך 63 בקטגוריה שלו.
• קלטים — Ling-3.0-flash-VL: טקסט, תמונה ווידאו. Ling 3.0 Flash: טקסט בלבד.
• הקשר — שניהם טוענים לעד 1M טוקנים; שניהם בפועל מוגשים עם 256K (262,144) כיום.
• מחיר — Ling-3.0-flash-VL: עדיין אין מחיר רשום; רק משקלים פתוחים ברישיון MIT. Ling 3.0 Flash: כ-$0.07 לכל מיליון קלט ו-$0.22 לכל מיליון פלט ב-API הרשמי של הספק.
• בחרו בו עבור — Ling-3.0-flash-VL: מסמכים, צילומי מסך, תרשימים, וידאו וסוכני פעולה בממשק משתמש. Ling 3.0 Flash: קריאות לכלים עתירי טקסט וצינורות עבודה אוטונומיים לטווח ארוך.

לוח התוצאות שמודל הטקסט לא יכול להיכנס אליו
כאן השניים באמת נפרדים, והפער הוא מבני ולא תחרותי: במבחני תמונה ווידאו, ל־Ling 3.0 Flash הטקסטואלי בלבד אין כניסה כלל, כי הוא אינו יכול לקבל את הקלט. התרשים של Ling-3.0-flash-VL עצמו — הערכה של inclusionAI, שלא שוחזרה, שהופעלה חלקית בבית וחלקית מול ה־API של המתחרים בתנאי בדיקה רשמיים — מציג מספרים בשלוש הקטגוריות שהכרטיס מדגיש. בהבנת תמונה מורכבת הוא מראה MMMU-Pro של 79.0 ו־MathVision של 84.87, עם ציון נמוך בהרבה של 19.88 ב־Humanity's Last Exam-Multimodal, המשקף כמה הסט הזה קשה לכולם. בעבודה על מסמכים ותרשימים הוא חזק: OmniDocBench1.5 ב־91.35 ו־CharXiv_RQ ב־81.30. ובחבילות הסוכנות-מולטי-מודאליות שהופכות את המהדורה הזו למעניינת — ClawEval-MM ב־59.9, WebVoyager ב־90.83, Vision2Web ב־57.69 — הוא מתבקש לקרוא ממשק ולפעול על פיו, וזה בדיוק תפקיד סוכן ה־GUI שהמודל הטקסטואלי לא יכול לבצע.
קראו אותם בהקשר ותצטייר תמונה קוהרנטית: זהו לא מודל מכוונן לזכייה בטריוויה על תמונות, אלא מודל מכוונן להפיכת פיקסלים לפעולה — לקרוא את הפריסה, לעקוב אחר התרשים, להפעיל את הדף. בתרשים של הספק עצמו הוא מוביל בשדה ההשוואה המשולשת (Qwen3.8-27B במאמץ חשיבה גבוה, Gemini 3.5 Flash-Lite, ו-Kimi-K2.6) על OmniDocBench, WebVoyager, ו-ClawEval-MM, ומפגר במערכי ידע והסקה קשים כמו MathVision ו-HLE-MM. התייחסו לכל אחד מהמספרים האלה כאל טענה של inclusionAI עד שמעבדה נייטרלית תאשר אותם — אבל כיוון הכיוונון ברור ועקבי.
המספר היחיד שכדאי להתווכח עליו: 42 לעומת 38
הטענה שסביר ביותר שתגרום לצוות שעוסק בטקסט בלבד לעבור היא הטענה המרכזית: inclusionAI מדווחת ש-Ling-3.0-flash-VL השיג 42 במדד Artificial Analysis Intelligence Index (v4.1.1), ארבע נקודות מעל ה-38 שהיא מייחסת ל-Ling 3.0 Flash באותה גרסת מדד. שימו לב מה המדד הזה מודד: הציון המורכב של v4.1.1 מבוסס על סוויטות טקסט וסוכנים — GDPval, Terminal-Bench, SciCode, GPQA Diamond, Humanity's Last Exam וכדומה, ובאף אחת מהן אין משימות תמונה. אז הספק טוען שהוספת אימון ויזואלי לתשתית המשותפת שיפרה את האינטליגנציה הטקסטואלית של המודל בארבע נקודות, ולא רק שכעת הוא יכול לתאר תמונות. זוהי טענה בולטת וסבירה לחלוטין — כוונון רב-מודלי מבוסס הוראות בדרך כלל משפר את יכולת הטקסט.
שתי הסתייגויות בנוגע למקורות הנתונים שומרות על המספר הזה בפרופורציה. ראשית, ה-38 הוא נתון מדור אינדקס מוקדם יותר: Artificial Analysis העבירה מאז את לוח התוצאות החי שלה לגרסת אינדקס חדשה יותר (v4.3), שבו היא מציגה כרגע את Ling 3.0 Flash עם ציון מוערך של 25, ועדיין מדרגת אותו ראשון מבין 63 המודלים בקטגוריה שלו. צמד הנתונים 42־לעומת־38 של הספק נמצא על הסולם הישן, ולכן אסור לקרוא אותו כ"ארבע נקודות מעל הציון שבו AA מדרגת את מודל הטקסט כיום". שנית, ה-42 הוא נתון משלה של inclusionAI על מודל ש-Artificial Analysis טרם הוסיפה לרשימתה, ו-inclusionAI לא פרסמה את תוצאות נקודת ביקורת ה־VL על ערכות בדיקות הטקסט הבודדות (SWE-Bench, Terminal-Bench) שטבלת מודל הטקסט שלה עצמה מפרטת. ארבע נקודות הוא בדיוק גודל הרווח שהיית רוצה לשחזר לפני שתעביר צינור עיבוד טקסט בלבד בהתבסס עליו.

מחיר: לאחד יש מחירון, ולשני אין.
השוואת העלויות כוללת כרגע רק מחיר אחד. Ling 3.0 Flash ניתן להפעלה היום דרך ה-API של הספק עצמו, במחיר של כ-0.07 דולר למיליון טוקני קלט ו-0.22 דולר למיליון טוקני פלט — תמחור שנקבע על ידי הספק, המאומת ברישום של Artificial Analysis — עם קלט במטמון (cached input) זול יותר, והנחות תקופת ההשקה שלו הסתיימו. ל־Ling-3.0-flash-VL אין מחיר API שפורסם בשום מקום; עדיין לא ניתן לשלם עבורו לפי טוקן. אם אתה רוצה אותו השבוע, עליך לארח אותו בעצמך: משקולות MIT בכ־250 GB בפורמט BF16, על אותה מחלקת חומרה שמודל הטקסט כבר דורש — 4× GPUs של 141GB (H20-3e או H200) או צומת Blackwell עם 4 GPUs ב־tensor-parallel 4, או 8× H100/H800 של 80GB ב־TP8.
זה ממסגר מחדש את הכלכלה עבור צוות שעובד עם טקסט בלבד. אם אתם קונים טוקנים, מודל הטקסט במחיר של $0.07/$0.22 הוא זול ומוכח. אם אתם כבר מארחים בעצמכם את מודל הטקסט 124B, ה-VL checkpoint אינו רכישת תשתית שנייה — מדובר בעוד כ-~250 GB של משקולות על אותה מחלקת מכונות, שמוצדק רק על ידי עומסי עבודה שבאמת צורכים פיקסלים. המודל עם העיניים מצדיק את קיומו רק כשהעיניים נמצאות בלולאה.
מי צריך לבחור איזה
• טקסט בלבד ונפח גבוה — הישאר על Ling 3.0 Flash. אתה מקבל מודל מוכח ומדורג AA, מחיר אמיתי לכל טוקן, וקריאת כלים בוגרת. השיפור של ארבע נקודות במדד של מודל ה-VL לא שוחזר, ותפוקתו בצד הטקסט לא נמדדה; אין עדיין ראיות לכך שהוא מודל הטקסט הטוב יותר, רק טענה שהוא כזה.
• הראייה נכנסת ללולאה — מסמכים, צילומי מסך, תרשימים, תמונות, פריימים של וידאו, או ממשק משתמש שהסוכן שלך צריך לקרוא וללחוץ עליו — Ling-3.0-flash-VL הוא הבחירה המובנת מאליה, מכיוון שהוא אותו מנוע חשיבה שאתה כבר מכיר, עם שכבת הראייה שנוספה לו, במקום מודל מולטי-מודאלי נפרד שעליך להעריך מחדש מאפס.
• תעבורה מעורבת, ללא הכרעה — המהלך בסיכון הנמוך הוא להשאיר את שתיהן נגישות ולנתב לפי בקשה, במקום לתכנן מחדש סביב אחת. זו בדיוק התכונה ששער מודלים נועד לתת לך: API אחד על פני יותר מ-200 מודלים, מחירוני הספקים מועברים כמו שהם ב-0% תוספת, ומעבר אוטומטי כשספק מתדרדר. אף אחת מנקודות הביקורת של Ling אינה עדיין מאחורי נקודת קצה של OrcaRouter — מחיר מודל הטקסט הוא מחירו של הספק עצמו, ולמודל ה-VL אין מחיר אירוח כלל — אבל כשה-VL יקבל מחיר כזה, העברת תת-קבוצה של תעבורה אליו ומדידת התוצאות הוא שינוי תצורה, לא פרויקט אינטגרציה.
מה עדיין חסר
• הרצה עצמאית של Ling-3.0-flash-VL על מדד Artificial Analysis Intelligence Index עדכני — ה-42 הוא הדיווח של inclusionAI על גרסת מדד מוקדמת יותר.
• כל מחיר API מתארח עבור מודל ה-VL, שהוא המחסום הגדול ביותר לאימוץ מזדמן.
• פרסמנו פיצולים של טקסט בלבד (SWE-Bench Pro, Terminal-Bench 2.1) עבור checkpoint של VL, כך שצוות שעובד בעיקר עם טקסט יוכל לוודא שערימת הוויז'ן לא עלתה לו בכלום.
• נתון זמן השהיה מקצה לקצה או תפוקה עבור VL תחת עומס תמונות — מהירות מודל הטקסט נמדדת; מהירותו של מודל הראייה אינה נמדדת.
אישור נייטרלי לתרשים מדד ה־vision-benchmark; חלקים ממנו הורצו על מערך הבדיקות העצמי של inclusionAI, ולפחות מדד פנימי אחד מתוכנן לפרסום מאוחר יותר.
פסק הדין
זו אינה תחרות איכות בין מודלים; זוהי החלטת מודאליות, עם טענה בת ארבע נקודות מצורפת. אם הקלטים שלכם הם טקסט, הישארו עם Ling 3.0 Flash — הוא זול יותר, מדורג AA, וכבר נמדד; יתרון מודל ה־VL על פניו הוא כרגע נתון של הספק בסולם מדד ישן יותר. אם עומס העבודה שלכם מתחיל ממסך — עמוד מסמך, צילום מסך, תרשים, פריים וידאו, או GUI שהסוכן שלכם צריך להפעיל — Ling-3.0-flash-VL הוא אותו מוח 124B שכבר מוכר לכם, שעכשיו מסוגל לראות, וזו אפשרות חדשה באמת שלא הייתה קיימת בשכבה המהירה של Ling לפני שבוע. אמצו אותו היכן שהראייה אמיתית, אמתו את ה־42 לפני שתעבירו כל דבר על סמך זה, והשאירו את הבחירה הפיכה בשכבת הניתוב עד שיגיעו ציון עצמאי ומחיר מחירון.
