
DeepSeek V4.1 Flash לעומת DeepSeek V4 Flash: אותו כרטיס תעריף Flash, מודל שאומן מחדש
- openaiחדשOpenAI: GPT-6 Astra2026-09-0453אינטליגנציה77כתיבת קוד
- googleחדשGoogle: Gemini 3.8 Flash2026-09-0241אינטליגנציה76כתיבת קוד
- qwenחדשQwen: Qwen3.8 Max (0902)2026-09-0240אינטליגנציה72כתיבת קוד
- anthropicחדשAnthropic: Claude Fable 5.12026-09-0153אינטליגנציה82כתיבת קוד
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 לכל 1M טוקנים
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642אינטליגנציה72כתיבת קוד
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.24 / $0.73 לכל 1M טוקנים
- z-aiZ.ai: GLM 5.32026-08-1845אינטליגנציה75כתיבת קוד
- obsidianQwen3.8 27B2026-08-1534אינטליגנציה68כתיבת קוד
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236אינטליגנציה69כתיבת קוד
- grokSpaceXAI: Grok 4.62026-08-1244אינטליגנציה77כתיבת קוד
- metaMeta: Muse Spark 1.22026-08-0540אינטליגנציה72כתיבת קוד
- qwenQwen: Qwen3.8 Max2026-08-0340אינטליגנציה72כתיבת קוד
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135אינטליגנציה69כתיבת קוד
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 לכל 1M טוקנים
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2451אינטליגנציה78כתיבת קוד
- googleGoogle: Gemini 3.6 Flash2026-07-2134אינטליגנציה69כתיבת קוד
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2123אינטליגנציה49כתיבת קוד
השבוע שבו DeepSeek V4.1 Flash הפכה מיורשת משוערת לדגם ה-Flash המשווק היה קצר ורועש. ב-8 בספטמבר הדגם הופיע כניסוי API בן יומיים תחת מזהה הדגם deepseek-v4.1-flash-expires-on-0910 — מבנה ש-DeepSeek עצמה כינתה "גרסת ביניים". ב-9 בספטמבר הפלטפורמה הפתוחה שלה ציינה שהגרסה הרשמית, DeepSeek V4.1 Flash, עתידה להגיע בסביבות 10 בספטמבר, ושהיא "עולה באופן מקיף" על DeepSeek V4 Pro ביכולת, בעלות, במהירות ובזמן מקצה לקצה. ב-10 בספטמבר הודעת ההשקה כללה כרטיס תעריפים חדש לסדרת Flash, עם קיצוץ מחירים שנכנס לתוקף בשעה 12:00 שעון בייג'ינג, קיצוץ ש-DeepSeek V4 Flash לא ראתה מאז העלאת המחירים באוגוסט. ככל שיהיו עובדות נוספות, DeepSeek V4 Flash, סוסת העבודה לטקסט, אינה עוד הדרך החדשה ביותר להריץ עומס Flash, ומאמר זה עוסק במה שזה משנה בפועל עבור האפליקציה שאתה מריץ היום.
השוואות בשלב כה מוקדם הן חד-צדדיות, וכדאי לומר זאת לפני שהמספרים מתחילים. ל-DeepSeek V4 Flash יש גיליון מפרט שפורסם, חודש של תעבורת ייצור מאחורי העדכון DeepSeek-V4-Flash-0731, משקלים פתוחים ומדידות עצמאיות מ-Artificial Analysis. ל-DeepSeek V4.1 Flash יש הודעה רשמית, יומיים של מבחני מהירות של הקהילה, ואין עדיין גיליון שפורסם, אין דוח טכני ואין ציון של צד שלישי. טענות ספק מסומנות להלן כטענות ספק; נתוני קהילה מסומנים כנמדדים על ידי הקהילה.
דרגת ה-Flash אופסה זה עתה — שלושה שינויים, שבוע אחד
DeepSeek V4 Flash, מודל תערובת המומחים עם 284 מיליארד פרמטרים ו-13 מיליארד פעילים, היה ברירת המחדל ההגיונית, בעלת העלות הנמוכה והתפוקה הגבוהה, עבור חלק גדול מתעבורת הטקסט בייצור מאז הרענון שלה ב-31 ביולי. שלוש הכרזות בשלושה ימים הזיזו את הקרקע מתחתיה:
• 8 בספטמבר — DeepSeek פתחה בטא מוגבלת בזמן של V4.1 Flash לכל חשבון API, מוגבלת ל-20 בקשות במקביל ומתוכננת לפוג ב-10 בספטמבר, תחת שם מודל שנשא תאריך תפוגה משלו.
• 9 בספטמבר — הפלטפורמה הפתוחה הכריזה על השחרור הרשמי של DeepSeek V4.1 Flash בסביבות 10 בספטמבר, תוך תיאור מבנה מודל חדש עם תמיכה מולטי-מודאלית טבעית, וטענה שהיא עולה על DeepSeek V4 Pro בביצועים, בעלות, במהירות ובזמן השלמה כולל.
• 10 בספטמבר — ההשקה הרשמית מביאה רשימת מחירים חדשה לסדרת Flash, שתיכנס לתוקף בשעה 12:00 שעון בייג’ין, ותפחית את התעריפים שגבתה DeepSeek V4 Flash מאז העלאת מחירים ב-17 באוגוסט שספגה ביקורת חריפה מצד מפתחים.
האחרון שבהם ראוי לסיקור נפרד, מכיוון שמדובר בהורדת המחיר הנדירה שהיא אכן הורדת מחיר אמיתית. ברשימה החדשה, קלט בשעות השפל עם פגיעת מטמון יורד מ-¥0.05 ל-¥0.02 למיליון טוקנים — קיצוץ של 60% — בעוד קלט ללא פגיעת מטמון עובר מ-¥1.5 ל-¥1 ופלט מ-¥4.5 ל-¥4. התעריפים בשעות השיא הם כפול מהמחירים בשעות השפל. במונחי דולר אמריקאי מעוגלים, מדובר בערך ב-$0.003 למיליון טוקנים עבור קלט עם פגיעת מטמון, $0.14 עבור קלט ללא פגיעת מטמון ו-$0.56 עבור פלט בשעות השפל – ובשעות השיא הכפול. הפער של 24 הימים בין העלייה באוגוסט לקיצוץ הזה לא היה תוצאה של תזמון מקרי; איפוס המחירים הוא חלק מההשקה של V4.1 Flash.
אותה רמה, דגם שונה
הקריאה הקלה היא ש-V4.1 Flash הוא V4 Flash עם חוגת מהירות מוגברת. זה לא כך. הרענון של 0731 היה עדכון פוסט-אימון על הבסיס הקיים של DeepSeek V4 Flash — אותה ארכיטקטורה, אותו פריסת mixture-of-experts של 284B סך הכול / 13B פעילים. התיאור של DeepSeek ל-V4.1 Flash מצביע על משהו גדול יותר: מבנה מודל חדש, שכמה גופי תקשורת פירשו כסבב אימון מקדים חדש, ולא ככוונון עדין. ההבחנה חשובה מכיוון שמודל שאומן מחדש אינו יורש את התנהגות המודל הישן כפי שרענון עושה — הנחיה, קריאת כלים וסגנון פלט יכולים כולם להשתנות, גם כשהיכולת אינה משתנה.
• ארכיטקטורה — DeepSeek V4.1 Flash: מבנה מודל חדש, המתואר על ידי DeepSeek כבנייה חדשה עם קלט מולטימודלי מקורי. DeepSeek V4 Flash: רענון הפוסט-אימון V4-Flash-0731 של MoE עם סך של 284B פרמטרים / 13B פעילים.
• קלט — V4.1 Flash מטפל בקלט טקסט ותמונה באופן מובנה במודל הבסיס; DeepSeek V4 Flash הוא טקסט בלבד, ותמונות דורשות את המבנה הנוסף הנפרד DeepSeek-V4-Flash-Vision-Exp.
• הקשר ופלט — DeepSeek V4 Flash מפרסם קונטקסט של 1M ופלט מקסימלי של 384K; חומרי ההשקה של DeepSeek מציינים ש-V4.1 Flash שומר על חלון קונטקסט בקנה מידה של מיליון טוקנים, אך לא פורסם כרטיס רשמי.
• מקביליות — DeepSeek V4 Flash מפרטת תקרה של 2,500 חיבורים מקבילים; גרסת הבטא של V4.1 Flash הוגבלה ל-20, והטענה של DeepSeek על "מקביליות גבוהה" בגרסת השחרור לא גובתה במספר שפורסם עד למועד הכתיבה.
• משקלים — DeepSeek V4 Flash הוא בעל משקלים פתוחים תחת רישיון MIT; לא הוכרז דבר לגבי V4.1 Flash.
• מעמד עצמאי — DeepSeek V4 Flash נמדד על ידי Artificial Analysis; ל-DeepSeek V4.1 Flash עדיין אין ציון של צד שלישי.
הנקודה של טקסט לעומת מולטימודלי ראויה למשפט נוסף אחד אפילו בהשוואת טקסט, כי היא קובעת למי מיועד V4.1 Flash. אם ה-pipeline שלך הרץ את DeepSeek V4 Flash עבור טקסט ואת DeepSeek-V4-Flash-Vision-Exp עבור תמונות, V4.1 Flash הוא המבנה הראשון של DeepSeek שמכסה את שני המסלולים במודל אחד — נקודת קצה אחת לתחזוקה, בלי אנקודר מחובר בצד.

היכן שהם באמת נבדלים: תפוקה ומה עולה משימה שהושלמה
במחירים זהים, שני הדגמים נבדלים במהירות, והמהירות היא המקום שבו המספרים נשמעים הכי חזק. Artificial Analysis מודד את DeepSeek V4 Flash 0731 בכ־120–140 אסימוני פלט לשנייה ב-API של DeepSeek עצמו, תלוי בתצורה ובחלון המדידה. בודקים ביום הראשון של V4.1 Flash דיווחו על יצירת טקסט רציפה של בערך 280 עד 500 אסימונים לשנייה, תלוי במשימה, עם שיאים מעל 500 בריצות בעלות מקביליות נמוכה; המספרים הגבוהים יותר נמדדו על ידי הקהילה, לא פורסמו על ידי הספק, ואסימונים לשנייה הם לעולם לא תכונה מהותית של מודל. ובכל זאת, הכיוון עקבי בכל דיווחי היום הראשון, והטענה של DeepSeek עצמה לגבי יצירת טקסט מהירה יותר וזמן השלמה כולל קצר יותר מצביעה לאותו כיוון.
פער המהירות הזה משנה את הכלכלה גם כששני המודלים נמצאים באותו מחירון, כי אתה משלם לפי אסימון ואסימונים מגיעים מהר יותר. משימת אחזור הקשר ארוך או יצירת קוד שלקחה דקה על V4 Flash יכולה להסתיים בחלקיק מהזמן על V4.1 Flash באותו מחיר לאסימון — כמה בודקים ביום ההשקה הראשון דיווחו על מהירות גבוהה פי חמישה עד שש מקצה לקצה בדיוק בסוגי המשימות האלה. התלונות המוקדמות של הבטא על "זה מוציא כסף מהר יותר" היו הצד השני של אותו מטבע: במחיר ללא שינוי לאסימון, מודל שפולט אסימונים מהר פי שתיים עד שלוש מרוקן יתרה מהר יותר לדקה. האם החשבון לכל משימה אכן יורד תלוי בשאלה אם המודל החדש מסיים עם פחות אסימונים ופחות ניסיונות חוזרים, וזה בדיוק מה שאף אחד עדיין לא יכול להוכיח.
בכרטיס המחיר עצמו, שני הדגמים יושבים זה לצד זה. למיליון אסימונים בשעות השפל ברשימה של 10 בספטמבר: ¥0.02 לקלט עם פגיעת מטמון, ¥1 לקלט עם החטאה במטמון ו-¥4 לפלט, בשעות השיא כפול — אותה רשימה שחלה על שכבת ה-Flash לפני הקיצוץ הייתה ¥0.05, ¥1.5 ו-¥4.5. עבור עומס עבודה כבד במטמון, הקיצוץ הוא הכותרת: ¥0.02 לעומת ¥0.05 הוא הפחתה של 60% באסימונים שמרכיבים את רוב זרם הקלט של השלמה אוטומטית או לולאת סוכן. עבור עבודת קליטה חדשה שמפספסת את המטמון, החיסכון קרוב לשליש. שום דבר מזה לא הופך את V4.1 Flash לזול יותר לאסימון מאשר V4 Flash — הם חולקים את הכרטיס — אבל התפוקה הגבוהה יותר של הארכיטקטורה היא המבדיל, וזה לא עולה כלום נוסף.

הקבלות הן עבור V4 Flash; הטענות הן עבור V4.1 Flash
העובדה החשובה ביותר בנוגע למדד של ההתמודדות הזו כרגע היא שאין מדד למודל החדש. הטענה המרכזית של DeepSeek V4.1 Flash — שהיא עולה על DeepSeek V4 Pro באופן מקיף ביכולות, בעלות ובמהירות — היא דיווח יצרן שלא שוחזר. לא פורסם מספר פרמטרים, לא פורסמה טבלת הערכה, ולא פורסם דוח טכני. Artificial Analysis לא ביצעה עליו מדידות נכון לכתיבת הדברים. בניגוד למשפחת מודלים שהשקת דגם הדגל האחרונה שלה זכתה לבחינה בלתי תלויה, הטענה "סמכו עלינו, הוא עוקף את ה-Pro" היא טענה שהקורא צריך להתייחס אליה בספקנות עד שגורם שלישי יבחן אותה.
לעומת זאת, ל-DeepSeek V4 Flash יש תיעוד אמיתי מאחוריו. Artificial Analysis מונה את גרסת ההיגיון 0731 בין המודלים המובילים בקטגוריה שלו, מדרג אותה הרבה מעל החציון של מודלים דומים עם משקלים פתוחים, ומודד את תפוקת הפלט ב-API של DeepSeek עצמו בטווח של ~120–140 אסימונים בשנייה שצוין לעיל. אלה המספרים שלפיהם תישפט V4.1 Flash כאשר ייחשף הציון שלה, והם מציבים רף גבוה יותר ממה שמרמזת התווית 'פלאש מהיר וזול'. המודל שהגרסה החדשה מחליפה אינו חלש; הוא סוס עבודה חזק באמת עם משקלים פתוחים. זה מה שהופך את החלטת השדרוג לאמיתית ולא לטקסית.
ניתוב עושה את העבודה הכבדה — בתוך DeepSeek, ובשבילך.
החלק הכי פחות מדווח בהשקה הזו הוא ש-DeepSeek מנתב תנועה בין המודלים של עצמו. ההכרזה שלהם מפורשת: ברגע ש-V4.1 Flash יהיה זמין ועד ש-V4.1 Pro ייצא, כל בקשת API המכוונת ל-deepseek-v4-pro תוגש על ידי DeepSeek V4.1 Flash ותחויב במחיר של דרגת ה-Flash. משתמשי V4 Pro מקבלים את הארכיטקטורה החדשה ושבריר מהעלות לכל token בלי לשנות שורת קוד אחת. שים לב למה שלא מנותב: קריאות deepseek-v4-flash. מודל ה-Flash הישן ממשיך לשרת את מי שעדיין מפנה אליו, וזו בדיוק הסיבה שההשוואה הזו קיימת — אם אתה על V4 Pro המעבר קורה בשבילך, ואם אתה על V4 Flash זו החלטה שאתה צריך לקבל בעצמך.
ספק שמחליט בשקט שדגם זול יותר צריך לשרת את הקריאות המכוונות לדגם הפרמיום שלו הוא הבעת תמיכה בולטת ב-V4.1 Flash — וזו גם אותה הלוגיקה ששכבת ניתוב מיישמת בין ספקים. זה הפער שפלטפורמה כמו OrcaRouter ממלאת: API אחד ל-200+ דגמים, כשמחירי המחירון של הספקים מועברים הלאה ב-0% תוספת, כך שהקיצוץ במחיר ה-Flash של DeepSeek מ-10 בספטמבר פעיל אצלנו באותו יום.DeepSeek V4 Flash ב-OrcaRouterנשאר זמין לקריאה עם אותו מפתח כמו כל דגם אחר שאתה מריץ, מה שהופך את האימוץ הבטוח של דגם חדש כבר ביום הראשון לזול באמת: הפנה נתח תנועה ל-DeepSeek V4.1 Flash ב-API של DeepSeek עצמו, השאר את DeepSeek V4 Flash כגיבוי אוטומטי באותו כלל ניתוב, ותן למנגנון ה-failover לתפוס את מקרי הקצה בזמן שהארכיטקטורה החדשה מוכיחה את שוויה.
DeepSeek V4.1 Flash לעומת DeepSeek V4 Flash: באיזו כדאי להשתמש?
אם התשובה הכנה הייתה שדגם אחד מתאים לכולם, לא היה מאמר. השניים כיום מתאימים לפרופילי סיכון שונים, והחלוקה ביניהם נקייה בצורה יוצאת דופן.

עברו ל‑DeepSeek V4.1 Flash אם אתם מתחילים היום עומס עבודה חדש מסוג Flash, אם זמן האחזור (latency) והתפוקה (throughput) הם האילוץ המחייב, אם אתם רוצים קלט תמונה מבלי לתחזק מודל שני, או אם נוח לכם לתת לניתוב (routing) של DeepSeek עצמו להוריד את הסיכון מטענת דרג ה‑Pro. המודל זמין ב‑API הראשוני (first‑party) של DeepSeek תחת השם deepseek‑v4.1‑flash, מתומחר במסלול ה‑Flash (Flash card) הזהה למודל שהוא מחליף, וכל האותות מהיום הראשון מעידים על כך שהוא מהיר באופן משמעותי.
הישארו על DeepSeek V4 Flash אם אתם משרתים תעבורת ייצור ברף התחרותיות שפורסם של 2,500, אם אתם מסתמכים על המשקולות הפתוחות שלו לצורך אירוח עצמי או עמידה ברגולציה, או אם ההנחיות, ההערכות ולוגיקת קריאות הכלים שלכם מכווננים להתנהגות של 0731 ואינם יכולים לספוג את המוזרויות של מודל שאומן מחדש ביום הראשון. ריצת פרה-טריינינג חדשה היא שינוי התנהגותי, לא רק שינוי מהירות, ומבנה 0731 הוא הגרסה עם חודש הקבלות.
עבור רוב הצוותים ברירת המחדל המוצדקת היא דרך האמצע: להתייחס ל-DeepSeek V4.1 Flash כברירת מחדל לעומסי עבודה חדשים, לשמור את DeepSeek V4 Flash כגיבוי לעומס העבודה שמשלם את החשבונות, ולתת לכרטיס הניקוד העצמאי הראשון — יחד עם כרטיס מפרט שפורסם ומספר מקביליות — להכריע את הוויכוח ששום בטא של יומיים לא יכולה להכריע. שכבת ה-Flash קיבלה זה עתה מנוע חדש; הישן אינו מיושן, הוא אמת המידה.
סקרנים לראות איך נראית תנועה ברמת Pro בזמן ש-DeepSeek מנתבת אותה ל-V4.1 Flash במחירי Flash? DeepSeek V4 Pro על OrcaRouter — שניהם על מפתח אחד, מחויבים במחיר המחירון של DeepSeek.
השוואות במאמר הזה4
זוהה מתוך המאמר הזה · בנצ'מרקים: Artificial Analysis · מתעדכן יומית
