
בנצ'מרקים של DeepSeek V4.1 Flash: מה 74.2 מוכיח ומה לא
- typesafeחדשTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 לכל 1M טוקנים · 984 tok/s
- openaiחדשOpenAI: GPT-6 Luna2026-09-2237אינטליגנציה
- openaiחדשOpenAI: GPT-6 Sol2026-09-2248אינטליגנציה
- anthropicחדשAnthropic: Claude Opus 5.52026-09-2258אינטליגנציה
- grokחדשGrok 4.72026-09-2146אינטליגנציה
- OrcaחדשOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 לכל 1M טוקנים · 195 tok/s
- orcaחדשOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 לכל 1M טוקנים · 1327 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040אינטליגנציה
- openaiOpenAI: GPT-6 Astra2026-09-0453אינטליגנציה77כתיבת קוד
- googleGoogle: Gemini 3.8 Flash2026-09-0241אינטליגנציה76כתיבת קוד
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245אינטליגנציה76כתיבת קוד
- anthropicAnthropic: Claude Fable 5.12026-09-0153אינטליגנציה82כתיבת קוד
- tencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 לכל 1M טוקנים
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 לכל 1M טוקנים · 109 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642אינטליגנציה72כתיבת קוד
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 לכל 1M טוקנים · 221 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845אינטליגנציה75כתיבת קוד
- obsidianQwen3.8 27B2026-08-1534אינטליגנציה68כתיבת קוד
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236אינטליגנציה69כתיבת קוד
- grokSpaceXAI: Grok 4.62026-08-1244אינטליגנציה77כתיבת קוד
DeepSeek V4.1 Flash קיבל ציון 74.2 ב-DeepSWE v1.1, עשירית נקודה מעל GPT-6 Astra, חצי נקודה מעל Gemini 3.8 Flash ו-Claude Opus 5, והמספר צוטט כל השבוע כהחלפת משמר. כדאי להיות מדויקים לגבי מה שהוא באמת. המודל עצמו אינו חדש — DeepSeek V4.1 Flash הפך לזמין באופן כללי ב-2026-09-10, לפני שישה ימים — כך ששום דבר כאן אינו השקה. מה שנחת בתוך החלון הזה הוא שכבת המדידה: הרשומות העצמאיות הראשונות במדד, תוצאת הארנה העצמאית הראשונה, תמיכת הרצה מיום האפס בשלוש ערימות טכנולוגיות, והחלטת ספק לפרוש את דגם הדגל שלו לטובת זה. העמוד הזה הוא סקירה של מה שנמדד בפועל, כשהמקור מצוין עבור כל נתון, והצהרה פשוטה של מה שאיש טרם ביסס.
מספר DeepSWE, וארבעת המודלים שבטווח חצי נקודה ממנו
DeepSWE v1.1 הוא בנצ'מרק להנדסת תוכנה לטווח ארוך מבית Datacurve — 113 משימות מקוריות על פני 91 מאגרי קוד פתוח וחמש שפות תכנות, הבנוי סביב שינויים בריבוי קבצים ונכונות התנהגותית. בכרטיס המודל של DeepSeek עצמה, הטבלה כפי שדווחה על ידי הספק מציגה: DeepSeek V4.1 Flash 74.2, Claude Opus 5 74.0, GPT-5.6 Sol 73.0, Kimi K3 67.5, GLM-5.3 66.9, DeepSeek V4-Pro-0813 62.7, DeepSeek V4-Flash 54.4.
לוח הדירוג העצמאי לאותו בנצ'מרק אינו משחזר את הסדר הזה, וההבדלים חשובים יותר מהכותרת. לוח הדירוג DeepSWE v1.1 Pass@1 של Datacurve מציב את Muse Spark 1.3 (FAIR) במקום הראשון עם 75.40, לפני DeepSeek V4.1 Flash עם 74.20. מאחוריו: GPT-6 Astra עם 74.12 (extra high) ו-74.10 (max), Gemini 3.8 Flash עם 73.83 (high), Claude Opus 5 עם 73.65 (max).
אז ה-74.2 הוא רשומה אמיתית בלוח מובילים אמיתי של צד שלישי, והוא שני, לא ראשון. הטענה שהסתובבה ביום ההשקה — שזהו המתקדם ביותר ב-DeepSWE — לא מחזיקה מעמד מול לוח המובילים שנושא את הניקוד. Muse Spark 1.3 מוביל בפער של 1.2 נקודות.
עכשיו החלק שמדלגים עליו. ארבעה מודלי חזית נמצאים בטווח של 0.55 נקודות זה מזה בבנצ'מרק הזה: 74.20, 74.12, 73.83, 73.65. זה טווח צר יותר מרעש המדידה. השונות המפורסמת בין הרצות על DeepSWE היא בסדר גודל של 1.4 עד 3.2 נקודות — פי שלושה עד שישה מגודלו של כל פער רביעיית המובילים. יתרון של 0.2 נקודות על GPT-6 Astra אינו ממצא; כך נראה תיקו כשמדפיסים אותו בשתי ספרות אחרי הנקודה.
רגישות לפיגום היא הסיבה השנייה שלא להיאחז במספר, וכאן התיעוד של הספק עצמו מספק את ההוכחה. DeepSeek מדווחת על DeepSWE בשמונה פיגומים באותם חומרי שחרור. הציון 74.2 הושג ב-mini-SWE. אותו מודל השיג 72.6 ב-DSH Minimal, 70.5 ב-DSH Standard, 69.8 ב-Claude Code, 67.6 ב-DSH PTC, 66.2 ב-Pi, 65.6 ב-Codex ו-65.5 ב-OpenCode. זהו פער של 8.7 נקודות במודל אחד ובנצ'מרק אחד, שנגרם אך ורק מהרתמה שעוטפת אותו. כל מי שמשווה מספר של DeepSeek שהופק על mini-SWE למספר של מתחרה שהופק בלולאת סוכן אחרת, משווה פיגומים, לא מודלים.
היכן שהאינדקס העצמאי ממקם אותו בפועל
Artificial Analysis מריצה חבילת בדיקות קבועה בהגדרות מאמץ מוצהרות, מה שהופך את ה-Intelligence Index שלה לבדיקה חיצונית הנקייה ביותר הזמינה. בעמוד הדגם של DeepSeek V4.1 Flash, במאמץ חשיבה מקסימלי, המדד מציג 40 — מדורג #6 מתוך 113 דגמים בקטגוריה זו, לעומת חציון קטגוריה של 18. המתחרים הסגורים נמצאים מעליו: Claude Opus 5 (max) 51, GPT-5.6 Sol (max) 47, GLM-5.3 (max) 45, Kimi K3 (max) 44, Gemini 3.8 Flash (high) 41. דגם הדגל הקודם של DeepSeek עצמה, V4-Pro-0813, נמצא מתחת עם 36.
קראו את שני לוחות התוצאות זה לצד זה, והאי-הסכמה היא מבנית, לא טעות. במדד הנבחר של DeepSeek, בתשתית הנכונה, המודל משתווה לחזית. במערך חיצוני קבוע הממוצע על פני חשיבה, קידוד, מתמטיקה ועבודת סוכנים, הוא מפגר ב-11 נקודות אחרי Claude Opus 5 ובנקודה אחת אחרי Gemini 3.8 Flash. שני הדברים יכולים להיות נכונים. טבלת ספק היא טיעון; מדד הוא ממוצע.
בעמוד האינדקס מופיעים גם שני נתונים שחשובים להחלטת ניתוב ולעיתים רחוקות מגיעים לכותרות. DeepSeek V4.1 Flash פועל בקצב של 214.4 טוקני פלט לשנייה במאמץ מקסימלי — מהיר. הוא גם יצר 250M טוקני פלט בהשלמת Intelligence Index, לעומת חציון של 140M, מה ש-Artificial Analysis מסמנת כעודף מילים בולט. עודף המילים אינו בעיית איכות; הוא חשבון. מודל שחושב ב-79% יותר טוקנים מעמיתיו מוותר על חלק מיתרון המחיר שלו בכל קריאת הסקה ארוכה.

ProgramBench: ציון של מודל בודד וציון של ריבוי סוכנים אינם אותה מדידה
זהו המספר שסביר ביותר שייקרא בטעות, ולכן כדאי להפרידו בקפידה.
• מודל יחיד, תצורה סטנדרטית — DeepSeek V4.1 Flash משיג 20.3 ב-ProgramBench (Almost@1), לפי כרטיס המודל של DeepSeek עצמה. זהו מתחת ל GPT-5.6 Sol עם 23.0 והרבה מתחת ל-Claude Opus 5 עם 37.0, ורק מעט מעל GLM-5.3 עם 19.0 ו-Kimi K3 עם 17.5. הנתון מדווח על ידי הספק, והוא אינו מחמיא למודל.
• תצורת צוות רב-סוכנים — הדוח הטכני של DeepSeek, DeepSeek-V4.1-Flash: דחיפת הגבולות של דחיסת מטמון KV, מתאר מתכון ראשוני ל-Agent Swarm RL שבו סוכן מוביל מתאם בין חברי צוות דרך לוח משימות משותף. על תת-קבוצה של ProgramBench ובה 172 משימות בביטחון גבוה — משימות שבהן הפתרון הייחוסי עובר ב-95% או יותר — תצורת ריבוי הסוכנים מטפסת מ-13.59% במועד של שעה אחת לשיא של 30.04% בשמונה שעות, בעוד שקו הבסיס של הסוכן היחיד נע מ-12.79% ל-20.39%.
ה-30.04% הוא המקור לטענת ה"30%", והוא אינו ציון של מודל בודד. מדובר בצוות סוכנים שקיבל שמונה שעות, שנמדד על תת-קבוצה מסוננת, בהערכה ראשונית של הספק עצמו. ההשוואה שהוא מזמין — "הרבה מעל Sol בודד, כמעט פי 2 מ-Kimi K3" — הוגנת אריתמטית מול 23.0 של Sol ו-17.5 של K3, והיא גם השוואה בין תצורת ריבוי-סוכנים לבין קווי בסיס של מודל בודד על מערך משימות שונה. אותו דוח מראה את ההשפעה על FrontierSWE v2: ריבוי-סוכנים מגיע ל-32.90% בעשרים שעות לעומת 28.20% בסוכן בודד. הפער אמיתי, הוא מצטמצם ככל שדוחים את מועד הסיום, ועלות הטוקנים להשגתו אינה קטנה — כתיבה מעשית אחת מדווחת על יותר מפי 10 טוקנים וזמני ריצה שמתקרבים לארבע שעות.
מספר הפרמטרים טרם נקבע, לכן התייחס לכל השוואת גדלים כאל זמנית
הערות השחרור של DeepSeek מתארות "MoE בעל 552B פרמטרים". זהו הנתון של הספק, וזה מה שרוב הסיקור חוזר עליו. הוא גם לא כל הארטיפקט.
כרטיס המודל של DeepSeek עצמו מתעד רכיב שני לצד עמוד השדרה של הטרנספורמר: "זיכרון מותנה Engram (196B פרמטרים, נגיש בדלילות באמצעות חיפוש מבוסס טוקנים)." חברו את השניים ותקבלו 748B. זה החשבון שעומד מאחורי הפרשנות הקהילתית שהופצה ב-r/LocalLLaMA תוך שעות מהשחרור, ומדד ה-safetensors של כרטיס המודל עצמו מפרט 763B פרמטרים על פני סוגי הטנסורים שלו. נתון ה-510 GB FP8 בקירוב מגיע מאותו קו ניתוח: מה שאתם למעשה מורידים ומחזיקים בזיכרון.
הפיוס הוא שהם סופרים דברים שונים. 552B הוא עמוד השדרה החישובי — הפרמטרים שטוקן זורם דרכם. 196B הוא טבלת חיפוש שמתייעצים איתה בשכבות מסוימות ומחזירה מידע מאוחסן במקום לחשב עליו. 8B ו-16B, נתוני האקטיבציה המצוטטים על ידי DeepSeek, הם הפרוסות לכל טוקן שפעילות במהלך prefill ו-decode בהתאמה. כל ארבעת המספרים מתארים את אותו מודל.
שום דבר מכל זה לא הופך את ההשוואה לבטוחה. כל טענה מהצורה „המודל הזה משתווה למודל חזית בשבר מהגודל” נשענת על כותרת של ספק שמשמיטה חמישית מהארטיפקט. עד שמישהו יפרסם דיווח פרמטרים שניתן לשחזור, טיעונים מבוססי־גודל צריכים לכלול את ההסתייגות בתוך הטקסט.
ARC-AGI: אין תוצאה עבור מודל זה
אין ציון ARC-AGI-2 או ARC-AGI-1 עבור DeepSeek V4.1 Flash. עמוד התוצאות המאומתות של ARC Prize אינו כולל רשומה עבור הצ'קפוינט הזה, ולטבלת הבנצ'מרקים של DeepSeek עצמה אין שורת ARC. תוצאת DeepSeek המאומתת היחידה של ARC Prize היא עבור הצ'קפוינט הישן יותר V4 Flash 0731 — 61.4% ב-ARC-AGI-2 semi-private במאמץ חשיבה מקסימלי ו-89.0% ב-ARC-AGI-1, בעלות של $0.04 ו-$0.02 לכל משימה בהתאמה. אלה המספרים של קודמו על מודל שונה, וציטוטם כתוצאות של V4.1 Flash יהיה שגוי. אם ARC-AGI חשוב להערכה שלך, המודל הזה אינו מדורג נכון לעכשיו.
מה עוד נחת בתוך החלון
שלושה דברים השתנו עבור קורא שמחליט אם לנסות את המודל הזה, ואף אחד מהם אינו השחרור של המודל עצמו.
• תוצאת ארנה עצמאית.OpenDesign Arena הריצה שלושה-עשר מודלים דרך משימות עיצוב זהות — אפליקציות ווב, לוחות בקרה, מסכים לנייד, דפי נחיתה. DeepSeek V4.1 Flash צבר 81.2 מתוך 100 לעומת 82.7 של GPT-6 Astra, במחיר של $0.023 לעיצוב מוגמר לעומת $1.61, והשלים את המשימה תוך 5.3 דקות לעומת 11.1. שיעור האספקה — תוצרים שמישים ללא תיקונים — עמד על 57.7% לעומת 60% של Astra. זוהי אחת המדידות העצמאיות הראשונות באמת של המודל, והיא מודדת specifically תוצרי עיצוב, לא הסקה כללית או קידוד.
• תמיכת הגשה ביום-0 בשלושה סטאקים. vLLM פרסמה אימג' יום-0 (2026-09-09) שאומת על חומרת NVIDIA ו-AMD. SGLang ו-Miles פרסמו תמיכת הסקה ו-RL מיום-0 ב-2026-09-10, כולל מסלול host-offload של Engram שהעלה את קיבולת מטמון ה-KV ב-36% על 4x GB300, ואופטימיזציית bounded-replay שהעלתה את תפוקת ה-prefill פי 1.56 על 8x H200. Cambricon הכריזה על התאמת יום-0 לסטאק vLLM באותו יום. עבור מודל שנקודת המכירה שלו היא דחיסת מטמון KV אגרסיבית — רבע מנפח ה-HBM של הדור הקודם, שמינית מה-SSD שלו — היכולת לרוץ על סטאקים סטנדרטיים מהיום הראשון היא ההבדל בין תוצאת מעבדה למשהו שאפשר לפרוס.
• הספק הוציא מכלל שימוש את דגם הדגל שלו. DeepSeek מוציאה בהדרגה משימוש את V4-Pro. החל מ-04:00 UTC ב-2026-09-14, כל בקשה שמציינת “deepseek-v4-pro” מנותבת אל V4.1 Flash ומחויבת בתעריפי Flash, ויימשך עד להשקתו של V4.1 Pro. DeepSeek V4.1 Pro טרם שוחרר — זהו דגם עתידי, וההפניה היא פתרון זמני שמונע מאינטגרציות מקובעות להישבר. כמו כן הוצאו משימוש: “deepseek-v4-flash” ו-“deepseek-v4-flash-vision-exp”, ששניהם מנותבים באופן זמני אל V4.1 Flash לצורך תאימות. אם יש לך מזהה דגם מקובע בסביבת הייצור, ההפניה הזו היא העובדה התפעולית היחידה בעמוד הזה שאסור לך להתעלם ממנה.
מה השפעת המחיר על ההחלטה
התמחור הוא הנקודה שבה המודל הזה מפסיק להיות סיפור של בנצ'מרק. לפי התעריפים שפרסמה DeepSeek בעצמה, בתוקף מ-04:00 UTC ב-2026-09-10, כאשר שעות השיא מוגדרות כ-01:00–04:00 ו-06:00–10:00 UTC בימי חול, וכל השאר מחוץ לשעות השיא.
• מחוץ לשעות עומס, למיליון טוקנים — $0.003 פגיעה במטמון, $0.15 החמצה במטמון, $0.60 פלט.
• שיא, למיליון טוקנים — $0.006 פגיעת מטמון, $0.30 החמצת מטמון, $1.20 פלט.
• קלט במטמון, בהשוואה למודל חזית סגור — שלוש עשיריות סנט למיליון לעומת כחמישים סנט. עבור סוכן שרץ בלולאה על אותו מאגר, שכבה זו נושאת את רוב האסימונים.
• נמדד בקטלוג שלנו — $0.15 לקלט ו-$0.60 לפלט למיליון, זמן חציוני של 784 מ״ש עד לטוקן הראשון, 211 טוקנים לשנייה בשבעת הימים האחרונים.
Artificial Analysis מפרטת את אותו מודל במחיר של $0.30 לקלט ו-$1.20 לפלט, עם הנחת מטמון של 98% ומחיר משוקלל של $0.18 למיליון — זהו שכבת השיא, ושתי הספרות הן אותו מחיר בשעות שונות של היום. כדאי להפנים את ההבחנה הזו לפני שמשווים בין ספקים: אין להשוות מודל עם שעון דו-שכבתי לפי תעריף כותרת בודד.
זו גם הסיבה לכך שתמחור ללא תוספת חשוב כאן יותר מהרגיל. OrcaRouter מנתב את DeepSeek V4.1 Flash לצד שאר הקטלוג שלו בתוספת של 0% — מחיר המחירון של הספק, ללא שינוי, כך שמדרגות השיא והשפל של DeepSeek מגיעות אלינו בדיוק כפי ש-DeepSeek מפרסמת אותן, ושינוי מחיר של ספק נכנס לתוקף עוד באותו יום. במודל שתעריפו מוכפל למשך ארבע שעות בכל בוקר בימי חול, פלטפורמה שמשטחת את המדרגות מסתירה את המספר היחיד שהיה צריך.


מה שאף אחד לא קבע
הפער בסיפור הזה אינו בנצ'מרק חסר. הוא בכך שאין השוואת ראש בראש מהימנה בין DeepSeek V4.1 Flash למתחרים הנקובים בשמם על רתמת בדיקה משותפת, שהורצה על ידי מישהו שאין לו אינטרס בתוצאה. כל מספר בעמוד הזה הוא אחד משלושה דברים: מדווח על ידי הספק, הופק על ידי צד שלישי בתצורה שונה, או ממוצע על פני סוויטה קבועה שלא תוכננה לבודד את ההתמודדות הזו. אין הרצה שבה DeepSeek V4.1 Flash ו-GPT-6 Astra הוערכו על אותן משימות, באותו שלד, באותה הגדרת מאמץ, ופורסמה עם שונות.
שלושה דברים ספציפיים היו משנים את התמונה, ואף אחד מהם לא קיים היום.
• השוואת DeepSWE מבוקרת-שלד. הפער של 8.7 נקודות בין השלדים השונים של DeepSeek עצמה גדול יותר מכל פער בין ארבעת המודלים המובילים בטבלת הדירוג. עד שהחזית תימדד על רתמה אחת, הסדר בראש הטבלה הזו אינו בעל משמעות.
• שחזור בלתי תלוי של תוצאת צוות הסוכנים של ProgramBench. 30.04% מקורם בדוח הטכני של הספק על תת-קבוצה מסוננת של 172 משימות, בתצורה ראשונית, עם עלות טוקנים שלא אופיינה עבור תקציבי ייצור.
• ARC-AGI.אין ציון כלל לנקודת ביקורת זו.
המשמעות המעשית היא טענה צרה יותר ממה שהכותרות תומכות בה. DeepSeek V4.1 Flash נמצא במרחק מדיד בתוך הרעש מהחזית בבנצ'מרק אחד של קידוד לטווח ארוך, תחרותי באמת במשימות עיצוב עצמאיות בעלות של כ-1.4% בלבד, ובפיגור של כעשרה נקודות במדד מצטבר. זה מספיק כדי להצדיק הרצה שלו מול עומס העבודה שלכם ולתת להערכה שלכם להכריע בשאלה. זה לא מספיק כדי להצדיק כתיבה מחדש של טבלת ניתוב בייצור על סמך 0.2 נקודות — והעובדה ששתי הטענות הללו נכונות היא כל הממצא.
השוואות במאמר הזה1
זוהה מתוך המאמר הזה · בנצ'מרקים: Artificial Analysis · מתעדכן יומית
