כרטיס כותרת ראשי עבור 'Ling-3.1-flash מול DeepSeek V4.1 Flash', עם כותרת משנה 'שתי נקודות מדד, פי שלושה מהחשבון'. שני כרטיסים מעוגלים יושבים זה לצד זה עם מרווח ברור: השמאלי, עם התווית 'Ling-3.1-flash', מציג 'מדד AA: 41', 'עלות לכל משימה: $0.99', 'משקלים: סגור'; הימני, עם התווית 'DeepSeek V4.1 Flash (Max)', מציג 'מדד AA: 39', 'עלות לכל משימה: $0.27', 'משקלים: MIT'. שורת פוטר מציינת 'עלויות ונתוני מדד לפי Artificial Analysis.' הלוגו של OrcaRouter משולב בפינה הימנית התחתונה.
Guides & Insights

Ling-3.1-flash לעומת DeepSeek V4.1 Flash: שתי נקודות במדד, חשבון גבוה פי שלושה

מחבר

Elias Hawthorne

תאריך פרסום

מודלים אחרונים · 20צפו בכל המודלים →
בנצ'מרקים: Artificial Analysis · מתעדכן יומית
חזרה לכל הפוסטים

Ling-3.1-flash ו-DeepSeek V4.1 Flash (Max) נמצאים במרחק של שתי נקודות זה מזה במדד Artificial Analysis Intelligence Index — 41 לעומת 39 — ובכלל לא קרובים זה לזה במחיר. אם מריצים את עשר ההערכות שמרכיבות את המדד הזה על כל אחד מהמודלים, Ling-3.1-flash עולה בערך 0.99 דולר למשימה לעומת 0.27 דולר של DeepSeek. שניהם מודלים מסוג mixture-of-experts עם כ-550 מיליארד פרמטרים וחלון הקשר מוצהר של 1M טוקנים. האחד הוא מודל סגור, טקסט בלבד, ממעבדת InclusionAI של Ant Group, ששוחרר ב-2026-10-01 ועדיין ללא משקלים מפורסמים או רישיון. האחר פתוח תחת MIT מאז 2026-09-10, מקבל גם תמונות וגם טקסט, פועל אצל 23 ספקים, והוא המודל שרוב הצוותים כבר היו מחזיקים בקובץ הגדרות. ההשוואה אינה צמודה ברוב הצירים. השאלה המעניינת היא למה שתי הנקודות האלה קיימות בכלל.

איפה Ling-3.1-flash באמת מוביל

הוא מוביל בהערכות שמודדות הפעלת מסוף וכתיבת קוד שצריך לרוץ, והפער ראוי לציון מפורש כי המדד המצרפי מסתיר אותו.

• Terminal-Bench 4.0 — Ling-3.1-flash 0.333 לעומת DeepSeek V4.1 Flash (Max) 0.333. שניהם צנועים במונחים מוחלטים; הפער הוא רבע מזה של DeepSeek V4.1 Flash (Max).

• SciCode — 0.541 לעומת 0.519.

• הסקה פיזיקלית של CritPt — 0.180 לעומת 0.143.

• עבודה אג'נטית בעולם האמיתי של GDPval-AA — 1,621.75 Elo לעומת 1,600 Elo.

שניים מתוך הארבעה הם כמעט תיקו, אחד הוא ניצחון צר, ו-Terminal-Bench 4.0 הוא השורה היחידה שבה ההבדל היה שורד שינוי של seed. השוו זאת למקומות שבהם DeepSeek מנצח: AA-Briefcase v1.1 בעבודת ידע סוכנית ב-1,420.47 Elo מול 1,400.35, AutomationBench-AA ב-0.689 מול 0.617, AA-LCR בחשיבה ארוכת הקשר ב-0.84 מול 0.83, ו—השורה החשובה ביותר לייצור— AA-Omniscience ב-−5.30 מול +2.22 של Ling-3.1-flash במדד שבו הזיה גרועה מסירוב. הדיוק של DeepSeek שם הוא 46.4% עם שיעור הזיות של 96.5% מבין השאלות שהוא עונה עליהן; Ling-3.1-flash עונה נכונה על 29.1% עם שיעור הזיות של 37.9%. אף אחד מהם אינו מודל שאתה מכוון אותו לבסיס ידע בלי אחזור לפניו.

פער המחירים גדול מפער המדד, וזה לא רק המחירון.

התעריפים הכותרתיים נראים כמעט זהים. Artificial Analysis מתעדת את שניהם בעלות של $0.30 למיליון טוקני קלט. הם נבדלים בחדות בשני המספרים האחרים:

• פלט — Ling-3.1-flash $0.90 למיליון לעומת DeepSeek V4.1 Flash (Max) $1.20 למיליון. כאן Ling-3.1-flash הוא הדגם הזול יותר באופן מוחלט, ב-25%.

• קריאת מטמון — Ling-3.1-flash $0.06 למיליון לעומת DeepSeek V4.1 Flash (Max) $0.006 למיליון, הנחה של 98% לעומת הנחה של 80%. כאן שני המודלים מפסיקים להיות ברי השוואה.

התעריף המשוקלל בתמהיל של 7:2:1 של פגיעות מטמון/קלט/פלט יוצא $0.192 עבור Ling-3.1-flash ו-$0.184 עבור DeepSeek V4.1 Flash (Max) — כמעט ללא הבדל. אבל התמהיל הוא הנחה לגבי האופן שבו אתם משתמשים במודל, וההנחה הזו עושה עבודה רבה. כל עומס עבודה עם שימוש חוזר כבד בפרומפט — פרומפט מערכת ארוך, הקדמה לאחזור, לולאת סוכן ששולחת מחדש את ההקשר המצטבר בכל תור — דוחף את התמהיל האפקטיבי לקריאות מטמון, ושם הפער של פי 10 בתמחור המטמון משתלט. נפח הטוקנים מצטבר באותו אופן: Ling-3.1-flash הוא מודל הסקה פטפטן, שמייצר 220 מיליון טוקני פלט לאורך הערכות המדד לעומת 250 מיליון של DeepSeek, ובממוצע כ-357 שניות למשימת הערכה לעומת 285 של DeepSeek. הוא עושה יותר חשיבה לכל תשובה ולוקח לו יותר זמן לעשות זאת.

A two-column generated scoreboard titled 'Ling-3.1-flash vs DeepSeek V4.1 Flash — the scoreboard'. The left column, 'Ling-3.1-flash', reads 'AA Index: 41', 'Cost per task: $0.99', 'Terminal-Bench: 0.333', 'Cache read: $0.06', 'Weights: closed', 'Modality: text'; the right column, 'DeepSeek V4.1 Flash (Max)', reads 'AA Index: 39', 'Cost per task: $0.27', 'Terminal-Bench: 0.268', 'Cache read: $0.006', 'Weights: MIT', 'Modality: text + image'. A footer line reads 'Both columns per Artificial Analysis.' The OrcaRouter logo is composited in the bottom-right corner.

דוגמה מעובדת: אותה לולאת סוכן בשניהם

קח סוכן מפעיל-כלים שמריץ מיליון אסימוני קלט לכל משימה, כאשר 90% מהם מוגשים מהמטמון, ומחזיר 200,000 אסימוני פלט. ב-Ling-3.1-flash לפי הנתונים שלמעלה: 900,000 אסימוני קלט במטמון ב-$0.06 ועוד 100,000 קלט חדש ב-$0.30 ועוד 200,000 פלט ב-$0.90 מסתכמים לכ-$0.26 לכל משימה. אותה לולאה בדיוק ב-DeepSeek V4.1 Flash (Max) מסתכמת לכ-$0.14 — בערך חצי.

כעת החילו את לוח הזמנים של DeepSeek, כי זה החלק שרוב ההשוואות מדלגות עליו. תעריף שעות השפל של DeepSeek הוא זה שלמעלה, ושעות השפל מכסות סופי שבוע ואת רוב שעות היום; אבל במהלך שני חלונות בימי חול, 01:00–04:00 ו-06:00–10:00 UTC, תמחור הקלט והמטמון מוכפל. העבירו את אותה לולאה לחלון עומס, והעלות של DeepSeek מגיעה לכמעט $0.28 — ובשלב הזה מחירון התעריפים האחיד והגבוה יותר של Ling-3.1-flash הוא האפשרות הזולה יותר לאותה שעה, והנחת המטמון של פי 10 נוטרלה על ידי השעון.

זו כל ההחלטה בצמד מספרים אחד. אם תעבורת הסוכנים שלך עתירת מטמון ואתה יכול לתזמן אותה, DeepSeek V4.1 Flash (Max) עולה בערך חצי מהעלות של Ling-3.1-flash תמורת פער של שתי נקודות במדד. אם התעבורה שלך עתירת מטמון ונופלת בחלונות השיא של DeepSeek, שני המודלים עולים בערך אותו דבר, והשורה הטובה במעט של Ling-3.1-flash בסוכן טרמינלי הופכת לשובר השוויון.

הצירים שבהם אין מה להשוות

שלושה ממדים אינם קרובים זה לזה, והם אלה שנוטים להכריע ארכיטקטורה לפני שמדברים על מחיר.

• משקלים ורישיון — Ling-3.1-flash לא פרסמה משקלים, אין לה טקסט רישיון, ו-Artificial Analysis מסווגת אותה כקניינית. DeepSeek V4.1 Flash (Max) הוא משקלים פתוחים תחת MIT, ניתן להורדה מ-Hugging Face, עם שימוש מסחרי מותר. אחד מאלה יכול להתארח באופן עצמאי, לעבור כוונון עדין ולהיות מבודד מרשת; האחר לא יכול.

• מודאליות — Ling-3.1-flash הוא טקסט נכנס, טקסט יוצא. DeepSeek V4.1 Flash (Max) מקבל תמונות לצד טקסט ומקבל ציון במדדים מולטימודליים. אם חלק כלשהו מהפייפליין שלך מוסר למודל צילום מסך, תרשים או סריקה, ה־

• משטח השירות — DeepSeek V4.1 Flash (Max) זמין באמצעות 23 ספקים, כולל OrcaRouter; Ling-3.1-flash פועל דרך ה-API של היצרן עצמו והפלטפורמות של צד שלישי שמפיצות את המהדורה שלו. עבור מסלול ייצור, מספר הספקים הוא תכונת עמידות, לא תחרות פופולריות.

עוד אסימטריה אחת שלא מופיעה באף אחת מהרשימות האלה: DeepSeek V4.1 Flash (Max) חושף 384,000 אסימוני פלט בתגובה אחת. Ant לא פרסמה אורך פלט מרבי עבור Ling-3.1-flash, כך שאין עדיין אפשרות להעריך מולו עומס של יצירה ארוכה. היעדר תקרה מפורסמת אינו זהה לכך שהיא קטנה, אבל זה גם לא מספר שאפשר לתכנן לפיו.

להריץ את שניהם, ואיך זה נראה בפועל

Ling-3.1-flash אינו נמצא בקטלוג של OrcaRouter היום — חיפוש מול ה-API הציבורי שלנו למודלים מחזיר not-found עבור המודל תחת InclusionAI, והכתבה הזו לא תעמיד פנים אחרת. DeepSeek V4.1 Flash ניתן לניתוב כרגע במחיר הספק: מחיר מחירון ללא תוספת, כך ששינוי מחיר מצד ספק נכנס לתוקף אצלנו באותו יום שבו הוא מגיע, והוא יושב מאחורי אותו מפתח API יחיד כמו שאר הקטלוג, עם מעבר אוטומטי בין ספקי upstream.

לאסימטריה הזו יש ביטוי מעשי. הדרך השפויה לנהל השוואה שבה מודל אחד סגור, מתומחר בערך פי ארבעה מקודמו, ונגיש דרך ספק אחד, היא לשמור את המודל הפתוח, הניתן לשירות נרחב, כמסלול ברירת המחדל, ולהתייחס למאתגר כאל משהו שבודקים ולא כאל משהו שמתחייבים לו. DeepSeek V4.1 Flash (Max) יכול לשאת את לולאת הייצור כבר היום — משקולות פתוחות, קלט תמונות, פלט של 384K, הנחת מטמון של 98% — בעוד Ling-3.1-flash מקבל את העבודה הספציפית לסוכנים, שבה השוליים שלו ב-Terminal-Bench וב-SciCode באמת חלים. מכיוון ששניהם מדברים בפורמט chat-completions תואם OpenAI, הפיצול הזה הוא החלטת ניתוב ולא פרויקט אינטגרציה: נקודת קצה אחת, מפתח אחד, וכלל ששולח את המשימות שכל מודל טוב בהן באופן מדיד.

פסק הדין

על סמך הראיות הזמינות, DeepSeek V4.1 Flash (Max) מנצח בעימות הזה, והוא מנצח בעיקר בזכות דברים שאין להם שום קשר לשתי נקודות Index: משקלים פתוחים תחת MIT, קלט תמונות, 384,000 אסימוני פלט, הנחת מטמון של 98%, ו-23 ספקים שאפשר לעבור ביניהם במקרה כשל. הטיעון של Ling-3.1-flash צר יותר אך אמיתי — הוא סוכן הטרמינל והכלים הטוב יותר מבין השניים, והוא היחיד מבין השניים שלא פרסם לוח תעריפים שמוטמע בו מכפיל לשעות שיא.

שני דברים היו משנים את ההערכה הזו. אם Ant תפרסם משקלים תחת רישיון מתירני, פער הפתיחות ייסגר וההשוואה תהפוך לשיחה ישירה על יכולת ועלות. ואם חלון ההקשר הארוך המוגש של Ant יאומת ב-1M טוקנים ששני המודלים מצהירים עליהם, הטענה לשוויון בהקשר תפסיק להיות טענה. עד אז, הסיכום הכנה הוא שמודל יכול לנצח בשורה של בנצ'מרק סוכני ועדיין להפסיד בהערכה — ושפער של שתי נקודות במדד בין המודלים האלה שווה בערך פי 3.6 מהעלות לכל משימה, וזו עסקה שרק עומס עבודה ספציפי צריך לבצע.

Screenshot of the OrcaRouter model page for deepseek/deepseek-v4.1-flash, in English, captured 2026-10-07. The page header reads 'DeepSeek V4.1 Flash', 'ctx 1M tokens', 'Max output 384K', inputs 'text + image' and output 'text', with vision, tools, JSON and reasoning capability icons and a release date of 2026-09-10. Four stat tiles read $0.15, $0.60, 1.81 s and 6.04 s. The description states the model 'accepts text and image input, carries a context window of 1,048,576 tokens, and can generate up to 384,000 tokens in a single response. OrcaRouter bills it at $0.15 per 1M input tokens and $0.60 per 1M output tokens.' A code sample shows base_url https://api.orcarouter.ai/v1 with model 'deepseek/deepseek-v4.1-flash'.Screenshot of the Artificial Analysis model page for DeepSeek V4.1 Flash (Max), in English, captured 2026-10-07, marked 'Open weights model' and 'Released September 2026'. It shows an Intelligence Index of 39, 227 output tokens per second, $0.27 cost per Intelligence Index task, 250M output tokens generated across the index, input $0.30 with a 98% cache discount and output $1.20 per 1M tokens, a 1M context window, text and image input, 552B total parameters, 16B active parameters, and a licence of MIT with weights on Hugging Face.