
Ling-3.0-flash-VL לעומת DeepSeek V4 Flash Vision Exp: שני הימורים על ראייה פתוחה
- deepseekחדשDeepSeek: DeepSeek V4.1 Flash2026-09-1040אינטליגנציה
- openaiחדשOpenAI: GPT-6 Astra2026-09-0453אינטליגנציה77כתיבת קוד
- googleחדשGoogle: Gemini 3.8 Flash2026-09-0241אינטליגנציה76כתיבת קוד
- qwenחדשQwen: Qwen3.8 Max (0902)2026-09-0240אינטליגנציה72כתיבת קוד
- anthropicחדשAnthropic: Claude Fable 5.12026-09-0153אינטליגנציה82כתיבת קוד
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 לכל 1M טוקנים
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642אינטליגנציה72כתיבת קוד
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.24 / $0.73 לכל 1M טוקנים
- z-aiZ.ai: GLM 5.32026-08-1845אינטליגנציה75כתיבת קוד
- obsidianQwen3.8 27B2026-08-1534אינטליגנציה68כתיבת קוד
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236אינטליגנציה69כתיבת קוד
- grokSpaceXAI: Grok 4.62026-08-1244אינטליגנציה77כתיבת קוד
- metaMeta: Muse Spark 1.22026-08-0540אינטליגנציה72כתיבת קוד
- qwenQwen: Qwen3.8 Max2026-08-0340אינטליגנציה72כתיבת קוד
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135אינטליגנציה69כתיבת קוד
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 לכל 1M טוקנים
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2451אינטליגנציה78כתיבת קוד
- googleGoogle: Gemini 3.6 Flash2026-07-2134אינטליגנציה69כתיבת קוד
Ling-3.0-flash-VLו-DeepSeek V4 Flash Vision Exp הם שני מודלי הראייה בעלי המשקולות הפתוחות בקטגוריית המשקל הזו שצוות יכול באופן מעשי להוריד ולהריץ כבר היום, והם נבנו בידי אנשים שחלוקים בדעתם באשר לייעודה של הראייה. Ling-3.0-flash-VL, ממעבדת inclusionAI של Ant Group, מפעיל כ-5.5 מיליארד מ-124 מיליארד הפרמטרים שלו לכל טוקן, ומתייחס לראייה כאל משהו שמופעל בתוך לולאת משוב — יצירה, רינדור, התבוננות, תיקון — בעלות ההסקה הנמוכה ביותר האפשרית. DeepSeek V4 Flash Vision Exp, הבנייה הרב-מודלית הראשונה של DeepSeek, מצמיד חלון הקשר של מיליון טוקנים לתפוקה מקסימלית של 384 אלף טוקנים, ומתייחס לראייה כאל קלט נוסף שסוכן קורא בדרכו להשלים משימה ארוכה. האחד עבר אופטימיזציה סביב השאלה כמה מועט עולה לו לחשוב. האחר עבר אופטימיזציה סביב השאלה כמה רב הוא יכול להכיל בזמן שהוא עושה זאת.
ההבדל הזה, ולא דלתא בבנצ׳מרק, הוא מה שצריך להנחות את הבחירה. לשני המודלים אין פרוטוקול הערכה משותף שלפיו אפשר להשוות, ורק לאחד מהם יש ציון בלתי תלוי בכלל. להלן הצורה הכנה של ההתמודדות: ההימורים הארכיטקטוניים, המפרטים שלמעשה נבדלים, מצב הבנצ׳מרק כולל למה הוא דל, מה העלות של כל אחד, ואיזה מהם מנצח עבור איזו משימה — וגם החלק שבו נאמר בגלוי איזה משני אלה נמצא בקטלוג שלנו.
שני ההימורים, בניסוח מדויק
הצד של Ling בעניין הזה הוא הימור על דלילות אקטיבציה כמנוף העלות העיקרי. Ling-3.0-flash-VL הוא sparse mixture-of-experts עם 124B פרמטרים בסך הכול — כרטיס המודל מציג כ-124.8B, ו-SGLang cookbook מתאר 5.1B פעילים בעוד הכרטיס אומר בערך 5.5B — המריץ trunk היברידי בן 42 שכבות שמחליף בין Kimi Delta Attention לבלוקי MLA שעריים ביחס 5:1. מקודד ראייה ברזולוציה שרירותית ומקרן MLP דו-שכבתי מזינים את ה-trunk הזה, כאשר VideoRoPE מטפל במיקום המרחבי והזמני כך שפריימים של וידאו נוחתים בסדר קוהרנטי. התוצאה האדריכלית היא מודל שעולה חלק קטן ממודל dense של 124B להרצה לכל טוקן, וזו כל הסיבה שהוא מופיע בחזית של אינטליגנציה מול פרמטרים פעילים.
צד ה-DeepSeek הוא הימור על הקשר ועל סיבולת סוכנית. DeepSeek V4 Flash Vision Exp נוטל את ארכיטקטורת הטקסט של DeepSeek-V4-Flash ומוסיף מקודד חזותי ומאיישר, ואז ממשיך באימון — מקור אחד מעריך את התוצאה בסביבות 305B פרמטרים, מה ש-DeepSeek לא אישרה בפירוט. הוא כולל חלון הקשר של 1,048,576 טוקנים ופלט מרבי של 384,000 טוקנים, תומך בפלט JSON, בקריאות לכלים, ב-Responses API, ב-Anthropic API ובהמשך קידומת שיחה, ו-DeepSeek הבהירה במפורש שזה אינו מודל של שאלות ותשובות חזותיות. זוהי תפיסה עבור סוכנים: קריאת צילומי מסך מהאינטרנט, ממשקי תוכנה ותרשימים, ואז המשך לקריאות כלים. תמונות מומרות לטוקנים ומחויבות בהתאם, עם תקרה של 384 טוקנים לתמונה.
קראו את שתי הפסקאות האלה יחד, וצורת ההחלטה מתבהרת. אם עומס העבודה שלכם הוא "תסתכלו על זה, תחליטו משהו, תפעלו, תסתכלו שוב", מספר הפרמטרים הפעילים של Ling הוא מה שהופך את הלולאה לאפשרית מבחינת עלות, ועיצוב המשוב החזותי שלה מכוון בדיוק לכך. אם עומס העבודה שלכם הוא "לקרוא את המסמך הזה בן 400 העמודים עם האיורים שבו ולהמשיך הלאה", חלון ההקשר של DeepSeek הוא התכונה, ושום דבר בצד של Ling לא מתחרה בו.
למה השוואת הבנצ'מרק דקה יותר ממה שהיא נראית
זהו הקטע שרוב ההשוואות מדלגות עליו, ודילוג עליו מפיק טבלת מספרים שאינה אומרת דבר. הנה מצב הראיות בפועל.
ל-Ling-3.0-flash-VL יש מדידה עצמאית אחת: 25 ב-Artificial Analysis Intelligence Index v4.3, מדורג #2 מתוך 64 בקטגוריית הגודל שלו, לעומת חציון הקטגוריה של 8. כרטיס היצרן טוען בנפרד 42 בפרוטוקול Intelligence Index v4.1.1, שהוא סולם שהוצא משימוש ואינו בר-השוואה — יש להתייחס ל-42 כלא משוחזר.
ל-DeepSeek V4 Flash Vision Exp אין עמוד Artificial Analysis בכלל. כל מספר שמפורסם עבורו הוא של DeepSeek עצמה, מהודעת ההשקה, וכמה מהם מתייחסים במפורש ל-Opus-4.8 ולא לפרוטוקול קבוע. זו אינה ביקורת על המספרים; זו אמירה על מה שאפשר לעשות איתם. אי אפשר לשים מודל שנמדד באופן עצמאי ומודל שנמדד רק בידי הספק באותה עמודה ולהכריז על מנצח, וכל עמוד שעושה זאת מייצר תוצאה מלאכותית.
מה שלגיטימי הוא להשוות כל מודל מול הרשומה המדווחת של עצמו, עם מקור המידע מצורף:
• Ling-3.0-flash-VL, עצמאי — Intelligence Index 25 ב-v4.3, מקום 2 מתוך 64 בקטגוריה, חציון הקטגוריה 8, לפי Artificial Analysisbr /> • Ling-3.0-flash-VL, ספק — 42 בפרוטוקול v4.1.1 שהוצא משימוש, ו-1,441 לעומת 1,440 של GPT-5.4 ב-Image-to-WebDev Arena בשם "linthium"; שניהם מדווחים על ידי הספק והפער בארנה נמצא בתוך רעש ה-Elobr /> • DeepSeek V4 Flash Vision Exp, ספק — Terminal Bench 2.1 83.9; DeepSWE 59.3 לעומת 58.0 של Opus-4.8; Agents' Last Exam 27.3 לעומת 25.7 של Opus-4.8; Toolathlon-Verified 75.9; Cybergym 75.3; Chartography 64.3; NL2Repo 57.7; DSBench-Hard 63.6; ZeroBench Pass@5 35.0; ApexBench Pass@1 36.5; AutomationBench 25.7br /> • DeepSeek V4 Flash Vision Exp, עצמאי — לא פורסמו
שימו לב ממה מורכבת רשימת DeepSeek ברובה: הערכות סוכניות והנדסת תוכנה, ולא הערכות ראייה. ההצגה של DeepSeek עצמה היא שבמשימות טקסט בלבד מודל הראייה משתווה ל-DeepSeek-V4-Flash הרשמי ללא רגרסיה, ושהשיפורים הם במבחני סוכן מולטימודליים — שם DeepSeek מתארת את התוצאה כמתקרבת ל-Opus-4.8 ולא כעוקפת אותו, ומודה בפער של כעשרה נקודות במשימות המובנות של מדעי הנתונים והקוד NL2Repo ו-DSBench-Hard. זוהי קבוצה זהירה במיוחד של טענות, והיא אומרת לך שהמודל נמכר כשדרוג תפיסה למערך סוכנים קיים ולא כתקרה חדשה.

המפרטים שלמעשה מתפצלים
רוב המידע בשני דפי המפרט תואם: שניהם בעלי משקלים פתוחים תחת MIT, שניהם קולטים טקסט ותמונות ומחזירים טקסט, שניהם מסופקים עם משקלי BF16 ועם בניות מכומתות, לשניהם פורסמו מתכוני serving, ושניהם מטפלים בווידאו בדרך כלשהי. הפערים מתרכזים בארבעה מקומות.
• פרמטרים — Ling-3.0-flash-VL הוא 124B בסך הכול עם כ-5.5B פעילים לכל טוקן; DeepSeek V4 Flash Vision Exp מדווח בסביבות 305B ללא נתון פרמטרים פעילים שפורסםbr /> • חלון הקשר — Ling-3.0-flash-VL נמדד 262K טוקנים לפי Artificial Analysis לעומת 256K שכרטיס המודל של Ling מציין; DeepSeek V4 Flash Vision Exp פועל עם 1,048,576 טוקנים באופן נייטיביbr /> • פלט מרבי — Ling-3.0-flash-VL קצר בהרבה, בעשרות אלפי טוקנים; DeepSeek V4 Flash Vision Exp מגיע ל-384,000br /> • טיפול בתמונות — Ling-3.0-flash-VL מקבל עד 40 תמונות לבקשה ברזולוציה של עד 16,384 × 784 פיקסלים כל אחת, base64 בלבד; DeepSeek V4 Flash Vision Exp מקבל base64, כתובות URL חיצוניות או הפניה ל-Files API, ומגביל את עלות התמונה ל-384 טוקנים לתמונהbr /> • פרמטרים פעילים — Ling-3.0-flash-VL מפעיל כ-5.5B לכל טוקן; DeepSeek V4 Flash Vision Exp לא פרסם נתון פרמטרים פעילים
שורת הטיפול בתמונות היא זו שלא זוכה להערכה מספקת. תקרה קשיחה של 384 טוקנים לתמונה פירושה שתרשים צפוף או צילום מסך של עמוד שלם נדחסים בערך לאותו תקציב כמו תמונה ממוזערת — זול, ומאבד מידע באופן שחשוב למשימות קריאה עדינה. הגישה של Ling הולכת לכיוון ההפוך: תקציב פיקסלים גדול מאוד לכל תמונה, תעבורה מבוססת base64 בלבד, ולכן מטען בקשה כבד בהרבה. איזו מהן טובה יותר תלוי לחלוטין בשאלה אם התמונות שלך הן צילומים של מסמכים שאתה צריך לקרוא בדיוק, או צילומי מסך של UI שאתה צריך להבין בקירוב.
השורה השנייה המוערכת בחסר היא פלט מקסימלי. תקרת עשרות אלפי הטוקנים של Ling-3.0-flash-VL מתאימה ללולאת תיאור-ואז-תיקון ומגבילה כל דבר שרוצה להפיק ארטיפקט גדול — קובץ ארוך שנוצר, שכתוב מלא של מסמך, דיף של אלפי שורות. הפלט של 384K של DeepSeek קיים בדיוק משום שעומס העבודה המיועד שלו מסתיים בתוצאת קריאת כלי גדולה או בארטיפקט שנוצר. אם ה-pipeline שלך מצפה שהמודל יחזיר משהו ארוך, השורה הבודדת הזו מכריעה את ההתמודדות לפני שכל בנצ'מרק עושה זאת.
מחיר, וההבדל בין חינם לבין ללא מחיר
ל-DeepSeek V4 Flash Vision Exp יש מספר אמיתי בקטלוג שלנו: $0.24 לכל מיליון טוקני קלט ו-$0.73 לכל מיליון טוקני פלט, עם חלון הקשר של 1,048,576 טוקנים ופלט מקסימלי של 384,000 טוקנים, נגיש בתור deepseek/deepseek-v4-flash-vision-exp. זהו תעריף מפורסם, שמחויב באותו אופן כמו V4-Flash הטקסטואלי, כאשר תמונות מומרות לטוקנים בקצב של עד 384 לכל תמונה. זהו תעריף שאפשר לשים בגיליון אלקטרוני.
ל-Ling-3.0-flash-VL אין אחד. העמוד של Artificial Analysis מפרט אותו ב-$0.00 לכל 1M קלט ו-$0.00 לכל 1M פלט לעומת חציוני מתחרים של $0.14 ו-$0.40 — אבל זה משקף את תקופת הניסיון החינמית שרצה ב-Ling Studio של Ant, ולא תעריף. התיעוד המולטימודלי של Ant אינו מפרסם מחיר לכל טוקן עבור מודל הראייה, כך שאין מול מה לבדוק את האפס. האח הטקסטואלי בלבד Ling-3.0-flash נרשם בסביבות $0.075 לכל 1M קלט ו-$0.22 לכל 1M פלט, והמהדורות של Ling הספציפיות לתחום מבית Ant הושקו כ-API-ים חינמיים, מה שמרמז על מבנה סופי דומה — אבל רמז אינו מחיר.
העמד אותם זה לצד זה בכנות, והשוואת העלויות היא: למודל אחד יש תעריף, ולשני חלון מבצעי וניחוש סביר. כל מי שטוען ש־Ling-3.0-flash-VL זול יותר מ־DeepSeek V4 Flash Vision Exp משווה ניסיון חינם למחיר מחירון. הטענה שניתן להגן עליה היא ש־Ling-3.0-flash-VL סביר מאוד להיות זול יותר לכל טוקן לאחר שיתומחר, מפני ש־5.5B פרמטרים פעילים הם יתרון מבני ששום שינוי תעריף לא מוחק — עם ההסתייגות שהרברבנות של Ling-3.0-flash-VL מכרסמת בו. Artificial Analysis מתעדת שהוא שורף 160M טוקנים של פלט במדד Intelligence Index, מדורג #8 מתוך 64 לעומת חציון של 84M ומתויג כ״רברבני מאוד״. אתה משלם לפי טוקן שנפלט, כך שמודל שאומר כמעט פי שניים כדי להגיע לאותה תשובה מחזיר חלק ממה שההפעלה הדלילה שלו מרוויחה.
איזה אחד, בשביל מה
עץ ההחלטה הכן מתפצל לפי הקשר ואורך הפלט לפני שהוא מתפצל לפי כל דבר אחר, מפני שאלו הממדים שבהם שני המודלים אינם תחליפיים.
בחר DeepSeek V4 Flash Vision Exp כאשר המשימה שלך ארוכה ומסתיימת בארטיפקט: מסמכים בני מאות עמודים עם איורים, בסיסי קוד שנקראים מתחילתם ועד סופם, לולאות סוכנים שצריכות להפיק תוצאה גדולה, עומסי עבודה שבהם אתה רוצה למסור תמונה באמצעות כתובת URL או הפניה ל-Files API במקום base64, וצינורות עיבוד שבהם אתה צריך את Responses API, המשך מקידומת, או תעריף מפורסם לפי טוקן שאפשר לתקצב לפיו. זה גם היחיד מבין השניים שיש לו ספק שטוען לשוויון עם מודל הטקסט שלו במשימות טקסט, מה שחשוב אם מודל אחד מחליף שניים במערכת שלך.
בחר Ling-3.0-flash-VLכאשר האילוץ המכריע שלך הוא עלות לכל קריאה והלולאה שלך קצרה: אוטומציה של ממשק משתמש גרפי, בדיקה חוזרת של צילומי מסך, יצירת פרונטאנד עם מחזור רינדור ותיקון, בדיקות נקודתיות של מסמכים רפואיים או פיננסיים שבהן אתה צריך רזולוציה גבוהה לכל תמונה ויכול להסתפק בפלט קטן. מספר הפרמטרים הפעילים 5.5B הוא הסיבה לבחור בו, רישיון MIT הוא הסיבה שזה בטוח לאחסון עצמי, ועיצוב לולאת המשוב החזותי מכוון בדיוק לתבנית התבוננות-פעולה-אימות-תיקון. היה מודע לכך שאתה בוחר מודל ללא תמחור עם נתיב כניסה חינמי וללא התחייבות לגבי מה שיבוא לאחר מכן.
ואם מה שאתה באמת צריך הוא מודל אחד שקורא תמונות ביכולת טובה בלי שום קצה קיצוני — בלי טריק דלילות של 5.5B, בלי חלון של מיליון טוקנים — אז אף אחד מאלה אינו התשובה המעניינת, ומודלי הראייה הבינוניים הרגילים ישרתו אותך טוב יותר ובזול יותר מאשר כל אחד מהמומחים.
להפעיל אותם, ואיפה אנחנו משתלבים בכנות
DeepSeek V4 Flash Vision Exp נמצא בקטלוג שלנו. אפשר לפנות אליו דרך נקודת הקצה של OrcaRouter התואמת ל-OpenAI עם מחרוזת המודל deepseek/deepseek-v4-flash-vision-exp, באותו מפתח שאתם משתמשים בו לכל דבר אחר, בתעריף המפורסם של $0.24/$0.73 בלי שום תוספת — מחיר המחירון של הספק מועבר ישירות, כך שאם DeepSeek מוריד את התעריף הוא מגיע אליכם באותו יום ולא בחידוש החוזה הבא. אם אתם מכניסים מודל ראייה למסלול ייצור בפעם הראשונה, זה הבטוח יותר מבין השניים להתחיל איתו בשכבת ניתוב, כי אפשר להגדיר שרשרת גיבוי כך ששגיאת ספק תנסה שוב בנתיב אחר לפני שהתגובה שלכם מתחילה. אף אחד לא רוצה שקריאת הראייה הראשונה שלו בייצור תהיה זו שתלמד אותו על כשל של ספק יחיד.

Ling-3.0-flash-VL אינו בקטלוג שלנוואין בכוונתנו לרמוז אחרת. ניתן להגיע אליו דרך הפלטפורמה של Ant עצמה, שמפרסמת נקודת קצה תואמת OpenAI ותואמת Anthropic, דרך גישה לניסיון חינם ב-Ling Studio, ודרך המשקלים הפתוחים ב-Hugging Face, שאותם תוכלו להריץ בעצמכם עם מתכון SGLang המפורסם או עם הפורק של Ant ל-vLLM. דבר אחד שכדאי לאמת לפני שאתם משקיעים במסלול הזה: הדוגמאות של ה-API של Ant משתמשות במזהה Ling-3.0-flash-VL-rc1, סמן של מועמד לשחרור, ושאלת ההתאמה בין ה-checkpoint המוגש למשקלים הפתוחים טרם הוכרעה בפומבי. אם אתם מריצים בנצ'מרק מול ה-API המתארח ומצפים שהמספרים יעברו לפריסת BF16 באירוח עצמי, בדקו את ההנחה הזו תחילה.

הסיכום שעומד בבדיקה מדוקדקת: אלה אינן תשובות מתחרות לאותה שאלה. DeepSeek V4 Flash Vision Exp הוא שכבת תפיסה בעלת הקשר ארוך עבור סוכנים, עם מחיר מפורסם וגיליון בנצ'מרק שדווח על ידי הספק, שנשען על הערכות סוכניות. Ling-3.0-flash-VL הוא מודל ראייה זול להפעלה עם ציון עצמאי אמיתי אחד, מסלול חינם ללא תמחור, ועיצוב שמכוון ללולאות תיקון קצרות. התאימו את צורת עומס העבודה שלכם לצורה של המודל, והעובדה שרק לאחד מהם יש ציון עצמאי על הלוח צריכה להשפיע על מידת המשקל שאתם נותנים לשיווק של האחר.
אותו מפתח מגיע לשאר הקטלוג, ואתה יכול לעיין בקטלוג המודלים המלא כדי לראות מה עוד נמצא מאחורי נקודת קצה אחת תואמת OpenAI.
השוואות במאמר הזה2
זוהה מתוך המאמר הזה · בנצ'מרקים: Artificial Analysis · מתעדכן יומית
