
DeepSeek V4.1 Flash לעומת DeepSeek V4 Pro: ההעברה ש-DeepSeek תכננה, ואז ביטלה
- orcaחדשOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 לכל 1M טוקנים
- deepseekחדשDeepSeek: DeepSeek V4.1 Flash2026-09-1040אינטליגנציה
- openaiחדשOpenAI: GPT-6 Astra2026-09-0453אינטליגנציה77כתיבת קוד
- googleGoogle: Gemini 3.8 Flash2026-09-0241אינטליגנציה76כתיבת קוד
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245אינטליגנציה76כתיבת קוד
- anthropicAnthropic: Claude Fable 5.12026-09-0153אינטליגנציה82כתיבת קוד
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 לכל 1M טוקנים
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642אינטליגנציה72כתיבת קוד
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 לכל 1M טוקנים
- z-aiZ.ai: GLM 5.32026-08-1845אינטליגנציה75כתיבת קוד
- obsidianQwen3.8 27B2026-08-1534אינטליגנציה68כתיבת קוד
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236אינטליגנציה69כתיבת קוד
- grokSpaceXAI: Grok 4.62026-08-1244אינטליגנציה77כתיבת קוד
- metaMeta: Muse Spark 1.22026-08-0540אינטליגנציה72כתיבת קוד
- qwenQwen: Qwen3.8 Max2026-08-0345אינטליגנציה76כתיבת קוד
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135אינטליגנציה69כתיבת קוד
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 לכל 1M טוקנים
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2451אינטליגנציה78כתיבת קוד
DeepSeek V4.1 Flash שוחרר ב-2026-09-10, ו-DeepSeek V4 Pro היה אמור להיעלם עד עכשיו. התוכנית, שהוכרזה יומיים לפני שחרור ה-Flash ואושרה סופית ביום השחרור, הייתה שב-2026-09-14 בשעה 12:00 לפי שעון בייג'ינג כל בקשה אל deepseek-v4-pro תנותב בשקט אל החדש והזול יותר, deepseek-flash ותחויב בתעריפי Flash. DeepSeek ביטלה זאת ב-2026-09-11 לאחר שמפתחים התנגדו, וב-2026-09-14 עבר המועד בעוד V4 Pro עדיין פעיל והחיוב שלו לא השתנה. אז זה לא השוואת השקה — המודל משמאל בן שמונה ימים והמודל מימין הוא מודל דגל בן שנה בחודש הרביעי לזמינותו הכללית. זוהי השוואה בין שני מודלים שהיצרן שלהם פרסם מדדי ביצועים שלפיהם הזול ניצח, ואז גילה שמשתמשיו לא הסכימו, ונסוג. הרצף הזה הוא הדבר השימושי ביותר שמישהו פרסם החודש על מי משני המודלים, כי זו בדיוק ההחלטה שאתה עומד לקבל בעצמך.
מה באמת קרה, לפי הסדר
לוח הזמנים חשוב כאן יותר מכל מדד בודד, כי ההיפוך הוא הסיפור וההודעה הייתה שקטה במכוון.
• 2026-09-09 — DeepSeek מודיעה למשתמשים שלפני הגעתו של V4.1 Pro, בקשות V4 Pro ינותבו אל V4.1 Flash ויחויבו לפי תעריפי Flash. המסר הוא ש-Flash עברה באופן מקיף את Pro בביצועים, בעלות, במהירות ובזמן השלמת משימות.
• 2026-09-10 — DeepSeek V4.1 Flash יוצא בהשקה כללית באפליקציה, באינטרנט וב-API. המשקולות מפורסמות ב-Hugging Face תחת MIT. שם המודל ב-API הופך ל-deepseek-flash. הדור הקודם deepseek-v4-flash ו-deepseek-v4-flash-vision-exp מוצאים משימוש לחלוטין, כאשר המזהים הישנים שלהם מנותבים באופן זמני ל-V4.1 Flash. השבתת Pro נדחית ל-2026-09-14, 12:00 שעון בייג'ינג (04:00 UTC).
• 2026-09-11 — DeepSeek חוזרת בה. בתגובה לדרישת המשתמשים, היא מודיעה כי שירות ה-API של V4 Pro ימשיך לפעול לאחר 2026-09-14 עם חיוב ללא שינוי, והמעבר האוטומטי ל-V4.1 Flash מבוטל.
• 2026-09-14 — המועד האחרון חולף. V4 Pro עדיין ממשיך לפעול במחיר $0.66 / $1.98 למיליון טוקנים בשעות שפל.
האסימטריה ברצף הזה היא כל המאמר. משתמשי Flash הועברו בין אם רצו בכך ובין אם לא — מזהה ה-V4 Flash הישן מחזיר כעת מודל אחר. משתמשי Pro זכו להקלה, והסיבה אינה ש-V4 Pro משיג תוצאות טובות יותר במבחני ביצועים. אלא שמערכות ייצור כווננו מולו: פרומפטים, שלדי סוכנים, רתמות הערכה והנחות שחזוריות שהחלפת backend מבטלת ללא כל שינוי בקוד בצד הקורא. עמוד ההשוואה של DeepSeek עדיין מציג את שני המודלים היום, זה לצד זה, מה שאומר שהחברה מתכוונת לספק את שניהם.
זה לצד זה: שני המק"טים
כל מה שלהלן הוא המפרט הרשמי שפרסמה DeepSeek, אלא אם צוין מקור. המחירים הם למיליון טוקנים, מחוץ לשעות העומס, כשתעריף השיא בסוגריים — שעות השיא של DeepSeek הן בין 01:00 ל-04:00 ושוב בין 06:00 ל-10:00 UTC, בימים שני עד שישי, וכל שאר השעות הן מחוץ לשעות העומס, במחצית מתעריף השיא.
• שם מודל API — deepseek-flash (DeepSeek-V4.1-Flash) לעומת deepseek-v4-pro (DeepSeek-V4-Pro-0813).
• קלט, החמצת מטמון — $0.15 ($0.30) לעומת $0.66 ($1.32).
• קלט, פגיעת מטמון — $0.003 ($0.006) לעומת $0.022 ($0.044).
• פלט — $0.60 ($1.20) לעומת $1.98 ($3.96).
• הקשר / פלט מקסימלי — 1M טוקנים / 384K בשניהם. זהה.
• קלט תמונה — נתמך באופן מובנה ב-Flash; מופיע כלא נתמך ב-V4 Pro.
• מגבלת בו-זמניות — 2,500 ב-Flash לעומת 500 ב-V4 Pro.
• פרמטרים מדווחים — Flash: 552B סה״כ, נתון מהיצרן, שעליו יש ערעור קהילתי אמין (עוד על כך בהמשך). V4 Pro: 1.6T סה״כ, ~49B פעילים, שגם Artificial Analysis מפרטת אותו ועמוד המתכון של vLLM מאשר.
• תקציב פעיל לכל טוקן — Flash מפעיל בערך 8B בשלב ה-prefill ו-16B בשלב ה-decode באופן מכוון, וזו בדיוק הנקודה של הארכיטקטורה הזו; Pro מפעיל כ-49B לכל טוקן.
• רישיון — משקולות פתוחות MIT בשניהם.
• תאריך GA — Flash 2026-09-10; V4 Pro 0813 2026-08-13, לאחר תצוגה מקדימה באפריל.

פער המחירים הוא הטיעון כולו.
קלט יקר פי 4.4 ב-Pro. פלט הוא פי 3.3. פגיעות מטמון — השכבה ששולטת בהרצת סוכן ארוכה עם הנחיית מערכת יציבה — הן פי 7.3. מכיוון שהשיא מכפיל כל שכבה משני הצדדים, היחס זהה בשיא; הפער אינו תוצר של הנחה.
שים על זה עומס עבודה. קח סוכן קידוד שעושה 10 מיליון טוקנים קלט בחודש עם שיעור פגיעה במטמון של 70% ו-2 מיליון טוקנים פלט. על V4.1 Flash בשעות שפל זה $0.45 של קלט טרי, $0.021 של קלט במטמון ו-$1.20 של פלט: $1.67. על V4 Pro בשעות שפל זה $1.98, $0.154 ו-$3.96: $6.09. בערך פי 3.6, על עומס עבודה שהוא בכוונה לא בולט.
זו הרשימה של DeepSeek עצמה, וזה המחיר שאתה משלם בפועל כאן: OrcaRouter מעבירה את תעריפי המחירון של הספקים הלאה בתוספת של 0%, כך ששינוי מחיר של DeepSeek מגיע לצד שלנו באותו יום במקום להיות ארוז מחדש. שני המודלים יושבים על אותו מפתח, וזה חשוב לקטע בהמשך — זה שעוסק בבדיקת הגירה שכבר אינך צריך לבצע.

היכן ש-DeepSeek V4.1 Flash באמת מנצח
הראיה החזקה ביותר לטובת Flash אינה טבלת הבנצ'מרקים של DeepSeek. היא Artificial Analysis, שהיא עצמאית, וקוראים אותה ישירות מדפי המודלים שלה.
• Intelligence Index — Flash (חשיבה, מאמץ מרבי) מקבל ציון 40 ומדורג במקום ה-6 מתוך 113 מודלים. V4 Pro 0813 (חשיבה, מאמץ מרבי) מקבל ציון 36 ומדורג במקום ה-7. אותו מדד, אותה הגדרת מאמץ, פער של ארבע נקודות, כשהמודל הזול יותר דווקא מקדים.
• מהירות פלט — 214.4 טוקנים/שנייה לעומת 94.4 טוקנים/שנייה. זה פי 2.3, וזה נמדד, לא נטען.
• זמן עד לאסימון הראשון — 1.21 שניות לעומת 1.74 שניות.
• DeepSWE v1.1 — 74.2 עבור Flash בלוח המובילים המנוטר, מקום ראשון, לפני GPT-6 Astra עם 74.10, Claude Opus 5 עם 74.00 ו-Gemini 3.8 Flash עם 73.70. הנתון 62.7 של V4 Pro 0813 באותו מבחן הוא הנתון של DeepSeek עצמה. הפער בצמרת הוא 0.2 נקודות, כלומר תיקו, לא ניצחון — אבל פער של 11.5 נקודות מול Pro אינו תיקו.
• יעילות שירות — המפענח של Flash מפיק את ה-KV הגלובלי שלו ממצבו החבוי הסופי של המקודד במקום לחשב אותו מחדש בכל שכבה, וזה מה שמייצר את האקטיבציה הא-סימטרית של 8B-prefill / 16B-decode. פרופיל InferenceX של SemiAnalysis מציב את מטמון ה-KV בכ-890 בייטים לכל טוקן — בערך רבע מזה של V4 Flash — עם אחסון KV מתמשך עד לכדי שמינית בערך. זו הסיבה שהמחיר הוא מה שהוא, וזו גם הסיבה שהמודל זמין ב-2,500 קונקרנסי כאשר Pro מוגבל ל-500.
• ראייה ב-API המוגש — לא רק במשקולות. עמוד התמחור של DeepSeek עצמו מפרט קלט תמונות כנתמך ב-Flash ולא נתמך ב-V4 Pro, ו-DeepSeek מתארת אותו כדי גמ הדגל הראשון שלה עם הבנה מולטימודלית מקורית. זהו דגם הדגל הראשון של DeepSeek שבו קריאת צילום מסך אינה דורשת נקודת קצה נפרדת.
כל שאר מספרי הכותרת שתראו מצוטטים — Terminal-Bench 2.1 ב-90.6, GPQA Diamond ב-90.9, Codeforces 3471 — הם של DeepSeek עצמה, לא שוחזרו על ידינו, ויש לקרוא אותם תוך התחשבות בכך.
איפה DeepSeek V4 Pro הוא עדיין הבחירה הנכונה
היה קל לפסול את V4 Pro אחרי שבוע כזה. היפוך ההתיישנות אומר אחרת, וגם דף המפרט אומר אחרת.
Pro נושאת 1.6T פרמטרים בסך הכול ומפעילה ~49B לכל טוקן, לעומת 16B של Flash בפענוח. לא משנה מה שהאינדקס אומר, קיבולת לכל טוקן היא משאב ממשי, ועומסי העבודה שבהם היא באה לידי ביטוי הם בעלי אופק ארוך: ריצות סוכנים בנות שעות רבות, ריפקטורים גדולים, משימות שבהן פנייה שגויה מוקדמת עולה בכל המסלול. פער של ארבע נקודות באינדקס מודד את הממוצע של עשר הערכות, לא את הזנב של ההתפלגות שלך.
Pro הוא גם הגודל הידוע. הוא זמין באופן כללי מאז 2026-08-13, לאחר תצוגה מקדימה באפריל, והבילד 0813 קיבל את הביצועים שלו מפוסט-אימון ולא מהארכיטקטורה — אותה כמות פרמטרים, אותו מבנה כמו בתצוגה המקדימה, התנהגות שונה. אלה ארבעה חודשים של כלי קהילה, רתמות סוכנים שפורסמו, תבניות פרומפטים ומצבי כשל. Flash נמצא ב-GA כבר שמונה ימים, והאקוסיסטם סביבו דק בהתאם. אם האמינות של הצוות שלכם באה מידיעה מדויקת כיצד מודל נכשל, Pro הוא המקום שבו הידע הזה חי.
והשירות לא הופסק. המחויבות של DeepSeek מפורשת והחיוב שלה לא השתנה, המשקלים הם MIT, וV4 Pro עדיין בקטלוג שלנו באותו תעריף מחירון. ההוצאה משימוש שבוטלה אינה דחיית ביצוע — זוהי הצהרה ש-DeepSeek מתכוונת להמשיך לשרת את השכבה.

שלושה דברים שאפשר לזקוף לחובת שני המודלים
מעקות בטיחות, כי טעות בהחלטה הזו תעלה ביוקר.
• מספר הפרמטרים שנוי במחלוקת. 552B הוא הנתון של DeepSeek. ניתוח קהילתי מהימן טוען שה-checkpoint ששוחרר הוא 748B — עמוד השדרה של ה-transformer בגודל 552B בתוספת טבלת הזיכרון המותנה Engram בגודל ~196B, שהיא מבנה חיפוש שאליו פונים בשתי נקודות ברשת ולא שכבה שהאות זורם דרכה. ההורדה שפורסמה היא 510.3 GB על פני 48 שברי safetensors של משקלים צפופים ב-FP8 עם מומחים מנותבים ב-FP4. שני המספרים יכולים להיות נכונים בו-זמנית, תלוי אם סופרים את האחזור בנפרד מהחישוב. התייחסו ל-552B כאל נתון שמדווח על ידי הספק ובדקו את טביעת הרגל בדיסק לפני שאתם מתכננים פריסה.
• ציון בלוח מובילים הוא מסך, לא חוזה. ה-74.2 של DeepSWE v1.1 הוא מדד של מערכת הרצה. ביקורת שפרסמה בעצמה EyesTech Systems Lab טוענת שציוני Flash-class האלה קורסים כשמעבירים אותם למאגרים מבודדים, רב-קבציים מהעולם האמיתי — ומעמידה את DeepSeek V4.1 Flash על 31.4% ב-SWE-bench Pro לעומת 74.2% בכותרות, ירידה גדולה מזו של מודלי החזית בהשוואה שלה עצמה. הביקורת הזו אינה עצמאית — המחבר מוכר כלי לאיתור בדיוק של ניצול מערכת ההרצה שהוא מתאר — ולא ראינו שחזור שלה. עם זאת, זו התנוחה הנכונה: אמתו במאגרים שלכם לפני שאתם עוברים.
• מילוליות היא שורת עלות. Artificial Analysis מדדה ש-V4.1 Flash מייצר 250M אסימוני פלט במהלך הרצת ה-Intelligence Index שלו, לעומת חציון של 140M עבור מודלים דומים עם משקלים פתוחים, ומכנה אותו מילולי מאוד. פלט הוא הכיוון היקר בטבלת המחירים הזו, כך שמודל שחושב בקול רם מכרסם בחיסכון של עצמו. בעומס עתיר הסקה, תקצב לפי מספר האסימונים, לא רק לפי מחיר האסימון.
עוד דבר אחד, שייאמר בבירור כדי שאיש לא יתכנן על סמך שמועה: DeepSeek V4.1 Pro לא שוחרר. המיגרציה שבוטלה הוצגה כפתרון זמני "לפני ההשקה של V4.1 Pro", ושום דבר בכך לא השתנה.
בחר ב־DeepSeek V4.1 Flash אם
• עומס העבודה שלך הוא בנפח גבוה, רגיש לשהיה או מוגבל בעלויות — סיווג, חילוץ, ניתוב, סיכום, צ׳אט, ורוב יצירת הקוד.
• אתה צריך קלט תמונה באותה נקודת קצה כמו טקסט. זהו הדגם המוביל הראשון של DeepSeek שבו זה קריאה אחת ולא מודל שני.
• הפרומפטים שלך ניתנים לשמירה במטמון. בפי 7.3 בפגיעות מטמון הפער הוא הרחב ביותר בדיוק במקום שבו חי עומס הסוכנים, והנחיית מערכת יציבה מהווה את רוב הקלט של ריצה ארוכה.
• השבוע אתה מתחיל מדף חלק ואין לך רתמה שמכוונת למוזרויות של מודל מסוים. אין דבר שצריך הגנה.
• אתה רוצה את תקרת המקביליות הגבוהה יותר. 2,500 לעומת 500 הם הבדל של פי חמישה בכמה שאתה יכול לדחוף דרכו לפני שאתה נכנס לתור.
בחר ב-DeepSeek V4 Pro אם
• כבר יש לך פרודקשן שמכויל נגד זה. ההיפוך אומר שיש לך זמן — השתמש בו כדי לבדוק במקום להתחמק מהשאלה.
• המשימות שלך הן בעלות אופק ארוך וכשל בהן יקר, ומדדת שכ-49B פרמטרים פעילים לכל טוקן מקנים לך משהו שאין ל-16B של Flash, על הנתונים שלך ולא על לוח דירוג.
• אתה זקוק להתנהגות צפויה מראש, טקסטואלית בלבד, בלי נתיב ראייה שעליו יש להרהר, או שיש לך קווי בסיס להערכה שהחלפת מודל תבטל אותם באמצע המחקר.
• דפוס הגישה שלך הוא בנפח נמוך ובסיכון גבוה, שבו 3.6× על חשבון קטן אינו הגורם המכריע.
אם כבר בניתם על DeepSeek V4 Pro
הדבר המועיל שהשתנה ב-2026-09-11 הוא שהמיגרציה שלך הפסיקה להיות מועד אחרון והפכה להחלטה. זה בהחלט טוב יותר עבורך ובהחלט גרוע יותר עבור תיבת הדואר הנכנס שלך, כי ההחלטה עדיין צריכה להתקבל, ועכשיו אף אחד לא מקבל אותה בשבילך.
התחל בתמחור זה. הפער של פי 3.3–4.4 הוא המספר שאתה מפסיד, והדוגמה המחושבת למעלה הופכת אותו לסכום חודשי בכדקה בערך. ואז בדוק זאת בדרך היחידה שנחשבת: שקף מקטע מתעבורת הייצור אל Flash, השאר את Pro בנתיב הראשי, והשווה את הפלטים במשימות שלך. מכיוון ששני המודלים עונים על אותו מפתח במחיר המחירון של הספק עם מעבר אוטומטי במקרה כשל, הרצת הצל הזו היא שינוי ניתוב ולא אינטגרציה שנייה, והנתב יכול להחזיר בקשה חזרה אל Pro מבלי שתכתוב את הגיבוי. צוותים ששורפים טוקנים על מיגרציה שהם לא ביקשו הם הסיבה ששכבת הניתוב קיימת מלכתחילה.
אל תניח ש-Flash הוא תחליף ישיר. זוהי ארכיטקטורה שונה — מקודד–מפענח סיבתי בעל 40 שכבות עם הפעלה א-סימטרית — והיא מפורטת יותר בהסקה. התנהגות ברמת הפרומפט לא תעבור בצורה נקייה באף אחד מהכיוונים, לכן מדדו את ההגירה לפי הפלטים, לא לפי האינדקס.
מה לצפות
שלושה דברים קובעים איך השילוב הזה ייראה בעוד חודש. ראשית, האם V4.1 Pro ייצא ויחזיר דרג Pro אמיתי — כל ההגירה שבוטלה הייתה במפורש פתרון ביניים עבורו, כך שבמפת הדרכים של DeepSeek עדיין יש חור בצורת ספינת דגל. שנית, האם ההפוגה תשרוד את מהלך המחירים הבא של DeepSeek; חברה שמוכנה לתכנן ניתוב מחדש שקט פעם אחת למדה שהיא לא יכולה, לא שהיא לא צריכה. שלישית, האם מישהו מחוץ ל-DeepSeek ישחזר את נתוני הבנצ'מרק של Flash על מאגרי קוד שלא שונו, וזו התוצאה היחידה שתכריע את הוויכוח בין יעילות לקיבולת, שסביבו כל ההשוואה הזו סובבת. עד אז, העמדה הכנה היא זו שההיפוך עצמו מרמז עליה: Flash הוא ברירת המחדל הטובה יותר לכל דבר חדש, Pro הוא ההימור הטוב יותר לכל דבר שכבר נבנה, ו-DeepSeek רק אמרה לך שהיא תשרת את שניהם בזמן שאתה מבין איזה מהם אתה.
השוואות במאמר הזה1
זוהה מתוך המאמר הזה · בנצ'מרקים: Artificial Analysis · מתעדכן יומית
