
DeepSeek V4.1 Flash: דגם בסיס חדש לגמרי שעוטה מספר גרסת משנה
- openaiחדשOpenAI: GPT-6 Astra2026-09-0453אינטליגנציה77כתיבת קוד
- googleחדשGoogle: Gemini 3.8 Flash2026-09-0241אינטליגנציה76כתיבת קוד
- qwenחדשQwen: Qwen3.8 Max (0902)2026-09-0240אינטליגנציה72כתיבת קוד
- anthropicחדשAnthropic: Claude Fable 5.12026-09-0153אינטליגנציה82כתיבת קוד
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 לכל 1M טוקנים
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642אינטליגנציה72כתיבת קוד
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.24 / $0.73 לכל 1M טוקנים
- z-aiZ.ai: GLM 5.32026-08-1845אינטליגנציה75כתיבת קוד
- obsidianQwen3.8 27B2026-08-1534אינטליגנציה68כתיבת קוד
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236אינטליגנציה69כתיבת קוד
- grokSpaceXAI: Grok 4.62026-08-1244אינטליגנציה77כתיבת קוד
- metaMeta: Muse Spark 1.22026-08-0540אינטליגנציה72כתיבת קוד
- qwenQwen: Qwen3.8 Max2026-08-0340אינטליגנציה72כתיבת קוד
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135אינטליגנציה69כתיבת קוד
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 לכל 1M טוקנים
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2451אינטליגנציה78כתיבת קוד
- googleGoogle: Gemini 3.6 Flash2026-07-2134אינטליגנציה69כתיבת קוד
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2123אינטליגנציה49כתיבת קוד
DeepSeek V4.1 Flash שוחרר ב-10 בספטמבר 2026: משקלים פתוחים ברישיון MIT, חלון הקשר של מיליון טוקנים, ארכיטקטורת Causal Encoder-Decoder חדשה לגמרי, ושלדת mixture-of-experts עם 552 מיליארד פרמטרים ש-DeepSeek עצמה מסווגת בכרטיס המודל שלה תחת מה שהחברה מכנה "משפחת הארכיטקטורות החדשה" שלה. כמו כן, אם העוקב שסימן את השם צודק, זו הפעם הראשונה ש-DeepSeek תלתה מספר גרסת .1 על מודל בסיס חדש לחלוטין — תווית שבדרך כלל מסמנת כוונון עדין, לא בנייה מחדש. DeepSeek V4.1 Pro, דגל הדגל שמספר זה מרמז עליו כעת, עדיין לא קיים.
אי-ההתאמה הזו שווה יותר מאשר התפלפלות לשונית. כל מי שמשווה דורות של DeepSeek על פי מספר גרסה יקרא את "V4 Flash ל-V4.1 Flash" כצעד תיקון ויקצה תשומת לב בהתאם. הארכיטקטורה שמתחת לפני השטח אומרת אחרת, והחלטתה של החברה עצמה לפרוש דגם דגל עם 1.6 טריליון פרמטרים לטובת דגם Flash אומרת אחרת בקול רם עוד יותר.

מה בעצם שוחרר ב-10 בספטמבר
זה לא הדלפה ולא גרסת בטא. מבחן ה-API בן היומיים שהחל ב-8 בספטמבר תחת מזהה המודל deepseek-v4.1-flash-expires-on-0910 הסתיים כפי שהסיומת שלו הבטיחה, והגרסה הרשמית שוחררה היום באפליקציית האינטרנט של DeepSeek, באפליקציית המובייל וב-API הרשמי, עם משקלים ודוח טכני שפורסמו ב-Hugging Face תחת deepseek-ai/DeepSeek-V4.1-Flash.
הפרטים המעשיים חשובים יותר מהטקס:
• שם המודל — נקרא deepseek-flash. השמות הקודמים deepseek-v4-flash ו-deepseek-v4-flash-vision-exp עדיין מתקבלים, אך הם כבר לא מפנים למודלים שאליהם הפנו בעבר: שניהם הוצאו משימוש, ובקשות שמציינות אותם מטופלות על ידי DeepSeek V4.1 Flash ומחויבות בתעריף Flash.
• מה יש בקופסה — פרמטרי backbone של 552B, חלון הקשר של 1M טוקנים, פלט מקסימלי של 384K, פלט JSON, קריאה לפונקציות, ומצב חשיבה שפועל כברירת מחדל עם הגדרות מאמץ נמוך, גבוה ומקסימלי.
• רישיון — MIT, כולל משקלים, עם תיקיית הסקה ומודול קידוד נפרד במאגר. DeepSeek מזמין במפורש את קהילת הקוד הפתוח לבנות תמיכת הסקה, וזהו האות הסטנדרטי לכך שהגשה ביום אפס במנועי הריצה המרכזיים היא עניין של ימים ולא שבועות.
ה-.1 שאינו מהדורת נקודה
הטענה שהתחילה את הכתבה הזו הגיעה מ-teortaxesTex, משקיף DeepSeek בעל שם עט אך נעקב מקרוב, בפוסט מ-10 בספטמבר: שזו {{1}}הפעם הראשונה שבה DeepSeek מתייגת מודל בסיס חדש לחלוטין עם גרסת .1{{/1}}, ש-V4.1 הוא {{2}}שונה מ-V4 יותר מאשר, נניח, LLaMA 3 מ-LLaMA 1{{/2}}, וש-DeepSeek {{KEEP}}don't feel this is worth V5 yet{{/KEEP}} — מבלי שהמפרסם יוכל לומר מדוע לא.
יש להתייחס לחלק הסיבתי כאל היסק ולחלק המבני כאל דבר שניתן לבדיקה. ההיסק — מדוע DeepSeek בחרה ב-.1 על פני V5 — הוא קריאה של משקיף אחד בלבד, ושום דבר מעבר לכך; אף אחד מחוץ לחברה לא הסביר את ההחלטה, והחומרים של DeepSeek עצמה אינם מתייחסים לכך מעולם. החלק שניתן לבדיקה הוא הארכיטקטורה, והיא אינה נקראת כמו מהדורת נקודה. יומן השינויים של DeepSeek מתאר את V4.1 Flash כ"המודל הקטן ביותר במשפחת הארכיטקטורות החדשה שלנו", וזה משפט מוזר לכתוב על העלאת גרסה: העלאת גרסה מרחיבה משפחה, היא אינה מקימה אחת.
יש עלות אמיתית לעמימות, והיא נופלת על הקונים ולא על DeepSeek. מספרי גרסה הם האות הזול ביותר שיש למפתח כדי לדעת "האם מדובר בדור חדש או בכיוונון מחדש, וכמה מתקציב ההערכה שלי הוא ראוי?" DeepSeek הפכה כעת את האות הזה לבלתי אמין בכיוון אחד — מודל שמייסד משפחת ארכיטקטורה נמצא במרחק מקום עשרוני אחד ממודל ששינה את מתכון הפוסט-אימון שלו. החברה יכולה לשמור את הסימון V5 שלה לעתיד. כל מי שעורך הערכת מעבר משלם על הבלבול.
מה פירוש "ארכיטקטורה חדשה" במשקלים
כרטיס המודל ספציפי בצורה יוצאת דופן, מה שהופך את הטענה הדורית לקלה לבדיקה ללא אף benchmark. ארבעה דברים בולטים.

• הפעלה א-סימטרית — פיצול המקודד-מפענח הסיבתי (Causal Encoder-Decoder) הוא טרנספורמר בעל 40 שכבות המאורגן כמקודד סיבתי בעל 20 שכבות ואחריו מפענח בעל 20 שכבות, כאשר מטמון ה-KV הגלובלי של המפענח מוקרן מהמצבים הנסתרים הסופיים של המקודד, במקום להיגזר מהשכבות של המפענח עצמו. המשמעות של העיצוב הזה היא שהמודל מפעיל רק 8B פרמטרים לכל טוקן בשלב ה-prefill ו-16B בשלב ה-decode. עומסי עבודה של סוכנים הכבדים בקלט — מסמכים ארוכים, עקבות כלים ארוכות — מקבלים את החצי הזול של המודל; ה-generation מקבל את החצי היקר.
• דחיסת מטמון KV, נמדדת לכל טוקן — DeepSeek-V4.1-Flash מריץ מטמון KV ראשי בפורמט FP4 ב-890 בתים לטוקן, מה שהכרטיס מעמיד על כרבע מזה של DeepSeek V4 Flash. הסיקור הסיני הרחיק לכת והציג את הדחיסה ביחס לדור הראשון של דגם V4 כהפחתה של פי 437; המספר הגדול הזה הוא אריתמטיקה שמקורה בספק על בסיס שונה, ולכן יש להתייחס אליו כאל טענה ולא כאל מדידה.
• SWA Bounded Replay — תשומת לב עם חלון נע (sliding-window attention) בדרך כלל כופה עליך לשמור את מצב KV על SSD כדי לשחזר הקשר. זה בונה מחדש מצבי SWA KV חסרים על ידי השמעה חוזרת של רק חלון הטוקנים האחרון במקום, ובכך חותך את טביעת הרגל הקבועה של KV לכשמינית מזו של DeepSeek V4 Flash.
• Compressed Sparse Attention 2 — כל שכבת קשב פועלת באחד משלושה מצבים סטטיים (Full, Reindex, או Reuse), תוך שיתוף מצב KV ומדד (indexer) בין השכבות, עם מדד דליל היררכי (hierarchical sparse indexer) הקובע את העלות של שכבות עמוקות יותר באופן בלתי תלוי באורך ההקשר.
קראו את הארבעה יחד והתמונה האסטרטגית ניתנת לקריאה: זו ארכיטקטורה שמתעדפת ראשית דלילות ויעילות מטמון, בגודל שמאפשר להרחיב את אותו מבנה בהמשך. האזכור של "משפחת ארכיטקטורה חדשה" עושה עבודה אמיתית — זו הצהרה שעוד דברים בדרך.
מדדי הביצועים: מדווחים על ידי הספק, וטרם נסתרו
DeepSeek פרסמה סט בנצ'מרקים עם השחרור. לפי המספרים של החברה עצמה, V4.1 Flash משיגה GPQA Diamond 90.9, דירוג Codeforces של 3471, MathArena Apex 65.6, Terminal-Bench 2.1 ב-90.6, DeepSWE v1.1 ב-74.2, ו-63.9 ב-HLE עם כלים — האחרון נושא הערת שוליים המגבילה את נתון הבסיס 36.8 לתת-קבוצת הטקסט הטהור של אותו בנצ'מרק.
תייגו אותם כפי שהם: מדובר במספרים שדיווח הספק, שפורסמו ללא הערכה בלתי-תלויה נלווית, והם המספרים שבהם השתמשה DeepSeek כדי להצדיק את פרישת מודל הדגל שלה — וזה מה שהופך אותם למספרים שכדאי ביותר לבדוק. נכון ליום ההשקה ב-10 בספטמבר, Artificial Analysis טרם פרסמה מדידה של DeepSeek V4.1 Flash, ודף המודל של Hugging Face עצמו עדיין נשא את ההערה שהמודל "אינו פרוס על ידי אף Inference Provider." הטענה המרכזית של ההשקה הזו — שמודל בדרגת Flash מנצח באופן מקיף מודל דגל בעל 1.6T פרמטרים בביצועים, בעלות, במהירות ובזמן העיבוד הכולל — היא כרגע טענה של הספק בלבד, ללא ביקורת חיצונית.
יש גם אזהרה כנה בצד השני. אותו דיווח של הספק מראה ש־V4.1 Flash מנצח ב־13 מתוך 16 השוואות מול Kimi K3 וב־11 מתוך 13 מול GLM-5.3, בעוד הוא עדיין מפגר אחרי GPT-5.6 Sol ו־Claude Opus 5 במשימות החדשות יותר של Terminal-Bench 3.0 ו־4.0 וב־ProgramBench. זהו מבנה קוהרנטי — חזק ביותר בעבודת הקידוד, הטרמינל ואוטומציית הסוכנים שהארכיטקטורה הזו מותאמת לה, חלש יותר במשימות חשיבה מתקדמות — וזה המבנה שהיה לצעד דורי אמיתי.
המחיר, ומתג הניתוב שכדאי לסמן ביומן.
התמחור החדש נכנס לתוקף עם ההשקה, והוא אותו תעריף Flash כמו קודם ולא קיצוץ: עבור deepseek-flash, קלט עם פגיעת מטמון עולה $0.003 למיליון אסימונים בשעות השפל ו-$0.006 בשעות השיא, קלט ללא פגיעת מטמון $0.15 ו-$0.30, ופלט $0.60 ו-$1.20. שעת השיא היא בדיוק כפולה משעת השפל וחלה בשעות 01:00–04:00 ו-06:00–10:00 UTC בימי חול.
הקיצוץ נוחת במקום על תעבורת Pro. DeepSeek V4 Pro מתומחר ב-$0.022 ו-$0.044 עבור קלט עם cache-hit, $0.66 ו-$1.32 עבור קלט עם cache-miss, ו-$1.98 ו-$3.96 עבור פלט — כך שהעברת בקשות הנושאות את השם Pro ל-V4.1 Flash מורידה את עלות הפלט שלהן בכ-70% בעוד, לפי חשבונו של DeepSeek, מעלה את היכולת שמשיבה להן.

ניתוב מחדש זה מתוכנן, לא היפותטי. לאחר 12:00 שעון בייג'ינג ב-14 בספטמבר 2026, בקשות שמציינות את deepseek-v4-pro יעברו ל-V4.1 Flash ויחויבו בתמחור Flash, ויישארו שם עד ש-DeepSeek V4.1 Pro ישוחרר. אם האינטגרציה שלך מקודדת את שם מודל ה-Pro באופן קשיח, שום דבר לא נשבר — תקבל מודל שונה במחיר של כשליש ממחיר הפלט, ללא שינוי בקוד וללא הודעה מעבר לרשומת changelog. אם אתה מנתב לפי רמת יכולות במקום לפי שם מודל, 14 בספטמבר הוא התאריך לבדיקה חוזרת.
מה זה אומר אם תתקשר ל-DeepSeek היום
OrcaRouter אינו כולל עדיין את DeepSeek V4.1 Flash — נכון להיום, דף המודל עבור deepseek-v4.1-flash מחזיר "model not found", ואנחנו מעדיפים לומר זאת במפורש מאשר לרמוז אחרת. שני דברים נובעים מכך. ראשית, הניתוב מחדש ש-DeepSeek הכריזה עליו הוא התנהגות API של צד ראשון, ולכן המעבר ב-14 בספטמבר מתרחש בנקודת הקצה של DeepSeek עצמה, ללא קשר לדרך שבה אתה מגיע אליה. שנית, אם אתה רוצה את הארכיטקטורה החדשה היום, אתה פונה לספק ישירות.
מה שאנחנו עושים הוא לנתב את שאר קו DeepSeek על מפתח אחד: DeepSeek V4 Flash ו-DeepSeek V4 Pro, לצד יותר מ-200 מודלים אחרים. התמחור שם הוא מחירון הספק של DeepSeek שמועבר ישירות עם 0% תוספת, וזה החלק שחשוב בגרסה כמו זו — כשספק מוריד מחיר, ההנחה נכנסת לתוקף אצלנו באותו היום, במקום אחרי מחזור תמחור מחדש. וכאשר V4.1 Flash אכן יגיע לקטלוג, תעריף המחצית בשעות השפל המוזכר לעיל הוא המחיר, לא הנחה שאנחנו מנהלים עליה משא ומתן.
טיעון הניתוב עבור מודל כה חדש אינו באמת על מחיר. הוא נוגע לכמה מנתיב הייצור שלך אתה מסכן על ארכיטקטורה של שבוע ראשון, ללא אמת מידה עצמאית וללא שרת של צד שלישי. החזקת המודל החדש מאחורי דרגה שניתן להחליף — או בדיקתו על מפתח שאינו מפתח הייצור שלך — היא ההבדל בין הערכה לתקרית.
מה יפתור את שאלת השם?
שלושה דברים, בסדר עולה של כמה הם היו מספרים לך.
הערכה בלתי תלויה של DeepSeek V4.1 Flash תבחן את טענת הארכיטקטורה על מערך בדיקה של גורם חיצוני. זוהי המדידה היחידה שהופכת טבלת ספק לעובדה, והיא ככל הנראה הידיעה הבאה.
DeepSeek V4.1 Pro יבחן את הטענה המשפחתית. הודעת הניתוב כינתה אותו כנקודת הקצה של חלון Pro-to-Flash, מה שהופך אותו למודל שכל המהדורה הזו בנויה סביבו — והוא נותר המודל שדיפ סיק אישרה עליו הכי פחות: ללא כרטיס, ללא ספירת פרמטרים, ללא תאריך, ללא משקלים, ללא מחיר.
והשימושית, אם כי לא זוהרת: האם DeepSeek תעשה זאת שוב. תווית .1 שנייה על מודל בסיס חדש אחר תהפוך חריגה למוסכמה, ומוסכמה היא משהו שמפתח יכול לתכנן סביבו. מודל אחד הוא קוריוז. התיוג הופך למטעה באופן שימושי רק כשיש דפוס.
לעת עתה, הקריאה המעשית נפרדת בצורה ברורה לפי מי שאתה. אם אתה על DeepSeek V4 Pro, סמן את ה-14 בספטמבר בלוח שנה והרץ מחדש את ההערכות שלך לפני כן, כי המודל שמאחורי השם הזה משתנה בין אם תבקש בכך ובין אם לא. אם אתה על DeepSeek V4 Flash, אתה כבר מועבר, באותו מחיר, לארכיטקטורה ש-DeepSeek בנתה כדי להתרחב. ואם חיכית ל-V5, התשובה הכנה היא ש-DeepSeek ככל הנראה הוציאה את הדור וסירבה לקרוא לו בשם — וזה סוג הדברים שאתה יכול לעשות רק פעם אחת לפני שאנשים מפסיקים לבטוח במספר.
השוואות במאמר הזה2
זוהה מתוך המאמר הזה · בנצ'מרקים: Artificial Analysis · מתעדכן יומית
