
ההשקה הרשמית של DeepSeek V4 Flash: המודל הזול, המהיר והסוכני עם הקשר של 1M — הסבר
- qwenחדשQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 לכל 1M טוקנים · 224 tok/s
- orcaחדשOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicחדשAnthropic: Claude Opus 52026-07-2461אינטליגנציה78כתיבת קוד
- googleחדשGoogle: Gemini 3.6 Flash2026-07-2150אינטליגנציה69כתיבת קוד
- googleחדשGoogle: Gemini 3.5 Flash-Lite2026-07-2137אינטליגנציה49כתיבת קוד
- metaMeta: Muse Spark 1.12026-07-1651אינטליגנציה71כתיבת קוד
- kimiMoonshotAI: Kimi K32026-07-1557אינטליגנציה76כתיבת קוד
- openaiOpenAI: GPT-5.6 Luna2026-07-0951אינטליגנציה71כתיבת קוד
- openaiOpenAI: GPT-5.6 Terra2026-07-0955אינטליגנציה77כתיבת קוד
- openaiOpenAI: GPT-5.6 Sol2026-07-0959אינטליגנציה77כתיבת קוד
- grokxAI: Grok 4.52026-07-0854אינטליגנציה72כתיבת קוד
- tencentTencent: Hy32026-07-0641אינטליגנציה59כתיבת קוד
- obsidianQwen3.6 35B A3B Uncensored (Aggressive)2026-07-0232אינטליגנציה42כתיבת קוד
- obsidianGemma4 26B A4B Uncensored (Balanced)2026-07-0226אינטליגנציה39כתיבת קוד
- anthropicAnthropic: Claude Sonnet 52026-06-3053אינטליגנציה72כתיבת קוד
- klingKling: Kling 3.0 Turbo2026-06-1757אינטליגנציה52כתיבת קוד57מתמטיקה
- z-aiZ.ai: GLM 5.22026-06-1651אינטליגנציה69כתיבת קוד60מתמטיקה
- kimiMoonshotAI: Kimi K2.7 Code2026-06-1242אינטליגנציה61כתיבת קוד61מתמטיקה
- anthropicAnthropic: Claude Fable 52026-06-0960אינטליגנציה77כתיבת קוד
- qwenQwen: Qwen3.7 Plus2026-06-0139אינטליגנציה56כתיבת קוד59מתמטיקה
מודל היעילות של DeepSeek, V4 Flash, עבר משלב התצוגה המקדימה לגרסת בטא ציבורית רשמית — ה-code>-0731/code> build שוחרר ב-31 ביולי 2026. הארכיטקטורה לא השתנתה (עדיין מדובר במודל mixture-of-experts עם 284 מיליארד פרמטרים והקשר של מיליון טוקנים), אבל סבב נוסף של אימון-אחר שיפר משמעותית את יכולותיו האייג׳נטיות, כתיבת הקוד וקריאה לכלים, וכעת הוא תומך באופן מקורי ב-Responses API עם התאמות ספציפיות לסוכנים בסגנון Codex. מדריך זה מסביר מהו V4 Flash, מה שדרגה בפועל המהדורה הרשמית, כיצד לקרוא את המדדים (כפי שדווחו על ידי DeepSeek), מה העלות שלו וכיצד להשתמש בו — כל מספר מסומן לפי מקור.
הערת דיוק: פרטי השחרור וציוני הבנצ'מרק שלהלן לקוחים מיומן השינויים הרשמי של ה-API של DeepSeek (מתוארך ל-31 ביולי 2026); הארכיטקטורה, גודל ההקשר והתמחור נבדקו מול דף המודל של OrcaRouter; המדדים המשולבים של Artificial Analysis הם עצמאיים. ציוני הבנצ'מרק המדווחים על ידי DeepSeek משתמשים בהגדרות ה-harness של החברה עצמה — התייחסו אליהם כנתוני ספק והריצו הערכות משלכם. המפרטים והמחירים משתנים; ודאו לפני שאתם בונים.
בקיצור. V4 Flash הוא האח החסכוני של הענק DeepSeek V4 Pro: MoE עם 284B / 13B פעילים, קונטקסט של 1M טוקנים ועד 384K פלט, מכוון לעבודה אגנטית בעלת נפח גבוה וזמן השהיה נמוך. השחרור הרשמי ב-31 ביולי הוא שדרוג שלאחר אימון — באותו גודל, אבל עם סוכנים וקידוד טובים משמעותית — שמוסיף גם תמיכה מקורית ב-Responses-API וב-Codex. DeepSeek מדווח על ציונים גבוהים במשימות אגנטיות וקידוד (לדוגמה, Terminal-Bench 2.1 82.7, Toolathlon 70.3), וזה עולה בערך $0.15 / $0.29 למיליון טוקני קלט/פלט, בערך שליש ממחיר V4 Pro. רק ה-API של Flash שודרג; V4 Pro ואפליקציית/אתר DeepSeek נותרו ללא שינוי. ב-OrcaRouter אתה מקבל את זה ב-0% תוספת דרך נקודת קצה אחת תואמת OpenAI.
נקודות עיקריות
• שחרור רשמי (build -0731, 31 ביולי 2026): שדרוג פוסט-אימון של התצוגה המקדימה — אותה ארכיטקטורה, סוכנים, קידוד ושימוש בכלים חזקים בהרבה.
• הארכיטקטורה ללא שינוי: סה"כ 284B / 13B פעילים (MoE), חלון הקשר של 1M טוקנים (1,048,576), פלט של עד 384K, קלט טקסט בלבד, עם חשיבה, כלים ו-JSON.
• חדש: תמיכה מקורית ב-Responses API והתאמה ספציפית ל-Codex; ממשיך לתמוך בממשקי OpenAI ChatCompletions ובסגנון Anthropic. מזהה מודל code>deepseek-v4-flash/code>.
• השגים שדיווח DeepSeek בתחום סוכני/קידוד: Terminal-Bench 2.1 82.7, Toolathlon (מאומת) 70.3, Cybergym 76.7, DeepSWE 54.4, NL2Repo 54.2, DSBench-FullStack 68.7.
• זול מאוד: בערך $0.15 / $0.29 לכל מיליון אסימוני קלט/פלט, עם ~$0.02 לקריאות מטמון (OrcaRouter, 0% תוספת) — בערך שליש מהמחיר של V4 Pro שעומד על $0.44 / $0.88. רק ה-API של Flash השתנה; Pro והאפליקציה/אתר נשארו זהים.
מה שהגרסה הרשמית שדרגה בפועל
V4 Flash הופיע לראשונה כתצוגה מקדימה ב-24 באפריל 2026. השחרור הרשמי של 31 ביולי 2026 (code>-0731/code> build, לפי יומן השינויים של ה-API של DeepSeek) הוא במפורש לא ארכיטקטורה חדשה: סך הפרמטרים והפרמטרים הפעילים (284B / 13B) והקונטקסט של 1M נותרו ללא שינוי. מה שהשתנה הוא אימון-אחרי (post-training) — כוונון עדין נוסף שלדברי DeepSeek שיפר משמעותית את יכולות הליבה של סוכנים, קידוד וקריאה לכלים. שתי תוספות מעשיות חשובות: V4 Flash תומך כעת באופן טבעי ב-Responses API ומותאם במיוחד לסוכני קידוד בסגנון Codex, תוך שהוא עדיין מציע ממשקי OpenAI ChatCompletions ו-Anthropic. חשוב לציין שרק ה-API של Flash שודרג במהדורה זו; V4 Pro וחוויות האפליקציה/האינטרנט של DeepSeek נותרו ללא שינוי. עבור צוותים, משמעות הדבר היא שיפור ישיר (drop-in) לעומסי עבודה של סוכנים באותו מחיר, ללא מיגרציה.

{{1}}ארכיטקטורה{{/1}}: {{2}}MoE קטן-אקטיבי הבנוי לתפוקה{{/2}}
V4 Flash הוא מודל תערובת מומחים עם כ-284 מיליארד פרמטרים בסך הכול, אבל רק כ-13 מיליארד פעילים לכל טוקן. מספר הפרמטרים הפעילים הנמוך הזה הוא כל העניין: הוא שומר על הסקה מהירה וזולה, בעוד מאגר מומחים גדול משמר את האיכות. חלון ההקשר הוא 1,048,576 טוקנים מלאים (כמיליון), עם פלט מקסימלי גדול מאוד של 384K, והמודל תומך בחשיבה (חשיבה מורחבת), קריאה לכלים, ו-JSON מובנה. הקלט הוא טקסט בלבד. מטרת העיצוב — עבודה בנפח גבוה, זמן השהיה נמוך ופעילות אוטונומית — באה לידי ביטוי בנתוני השירות: p50 זמן עד לטוקן ראשון בסביבות 394 מילישניות ותפוקה של כ-184 טוקנים בשנייה במדידות של OrcaRouter.
מדדים: מה שהמספרים הרשמיים אומרים
השחרור הרשמי נשען בכבדות על הערכות agentic וקידוד, שמרוצות עם ה-harness של DeepSeek עצמו (הגדרות minimal-mode / max-effort). הנה איך לקרוא את התוצאות המרכזיות, כולן מדווחות על ידי DeepSeek:
• Terminal-Bench 2.1: 82.7 — משימות שורת פקודה/תוכנה אייג'נטיות בטרמינל אמיתי. ציון גבוה כאן מצביע על מודל שבאמת יכול להפעיל כלים ומעטפות, ולא רק לענות על שאלות.
• Toolathlon (מאומת): 70.3 ו- Automation Bench (ציבורי): 25.1 — רוחב ואמינות של שימוש בכלים ואוטומציה מקצה לקצה. אמינות קריאת כלים היא התכונה הקריטית להצלחת סוכנים.
• Cybergym: 76.7 — פתרון בעיות סוכני בסגנון אבטחה/CTF.
• DeepSWE: 54.4, NL2Repo: 54.2, DSBench-FullStack: 68.7, DSBench-Hard: 59.6 — הנדסת תוכנה וקידוד Full-Stack, מיצירה ברמת מאגר קוד ועד משימות מדע נתונים קשות. הציון הגבוה ב-DSBench-FullStack (68.7) מצביע על מיומנות קידוד מעשית ורב-קבצית.
• Agent Last Exam: 25.2 — מבחן חשיבה אייג'נטית קשה במיוחד, שבו אפילו המודלים המובילים מקבלים ציון נמוך; שימושי כאות יחסי, לא כמוחלט.
לצורך הקשר בלתי תלוי, Artificial Analysis (מוערך ב-2026-06-25, build תצוגה מקדימה) הציבה את V4 Flash בסביבות 56.2 AA Coding, 40.3 AA Intelligence, ו-50.0 AA Math — גנרליסט בעל נטייה לקוד מעל חציון המודלים הפתוחים. הקפיצה הרשמית שלאחר האימון מכוונת ישירות לציר הסוכני/קוד, כך שצפו שה-build החדש יותר ירגיש חזק יותר בדיוק במשימות הללו. כמו תמיד, המספרים ב-harness של הספק אופטימיים; אמתו על עומסי העבודה שלכם.
תמחור: המספר שמשנה תקציבים
ב-OrcaRouter, שמעביר את התמחור של הספק במרווח של 0%, V4 Flash עולה בערך 0.15 דולר למיליון אסימוני קלט ו-0.29 דולר למיליון אסימוני פלט, עם קריאות מטמון בסביבות 0.02 דולר — ו-DeepSeek שמרה על מחיר נמוך במהדורה זו (ללא עלייה עבור השדרוג). זה בערך שליש מהמחיר של DeepSeek V4 Pro שעומד על 0.44 / 0.88 דולר. במונחים ריאליים: 10 מיליון אסימונים בחודש בפיצול של 70% קלט / 30% פלט עולים בסדר גודל של כמה דולרים על V4 Flash; תעלו למיליארד אסימונים והפער מול דגם דגל הופך לשורת הוצאה שמחלקת הכספים שמה לב אליה. מטמון הנחיות (Prompt caching) מקצץ את העלות עוד יותר עבור סוכנים וצ'אט עם הנחיית מערכת יציבה, מכיוון שקלט שמוחזר מהמטמון מחויב בערך בעשירית מקלט חדש. יכולת אייג'נטית זולה יותר באותו מחיר נמוך — זו כל ההבטחה של המהדורה הזו.
היכן V4 Flash משתלב: סולם ה-DeepSeek V4
קו ה-V4 של DeepSeek הוא סולם. V4 Pro הוא מודל הדגל — מודל גדול בהרבה, ברמה עליונה, לחשיבה ולקוד. V4 Flash הוא שכבת היעילות: הרבה פחות חישוב פעיל, שבריר מהמחיר, ואחרי שדרוג הפוסט-אימון הזה, יכולות סוכנות וקידוד חזקות באמת. העובדה ש-DeepSeek השקיעה בהפיכת Flash ל-סוכן טוב יותר (Responses API, התאמה ל-Codex, מדדי שימוש בכלים) אומרת לך היכן היא מצפה שהנפח ירוץ: תעבורה יומיומית של משימות סוכנות וקידוד על Flash, וההיגיון הקשה ביותר שמור ל-Pro. זה משקף את הדפוס של כל התעשייה — ברירת מחדל זולה עם דגל פרימיום — ולכן ניתוב לפי קושי עדיף על שימוש כברירת מחדל במודל הגדול ביותר.

שלושה תרחישים מהעולם האמיתי
1. סוכני קידוד וזרימות עבודה בסגנון Codex
התמיכה המובנית של גרסת -0731 ב-Responses-API וב-Codex, ובנוסף הציונים שלה ב-Terminal-Bench (82.7) וב-DSBench-FullStack (68.7), הופכים את V4 Flash למנוע חזק וזול לסוכני קוד אוטונומיים — תיקון בעיות, רפקטורינג, יצירת טסטים ושימוש רב-שלבי בכלים.
2. סוכנים המשתמשים בכלים בנפח גבוה
מהירות ראשונית של טוקנים (~394 ms), תפוקה גבוהה (~184 tok/s), הקשר של 1M, ואמינות חזקה ב-Toolathlon (70.3) מתאימים לסוכני ייצור שמפעילים כלים בקנה מידה גדול — אחזור מידע, אוטומציה ותזמור.
3. עיבוד מסמכים ארוכים בתקציב מוגבל
ההקשר המלא של 1M טוקנים ופלט של 384K מטפלים בסיכום, ניתוח או המרה של קלטים גדולים מאוד — לוגים, בסיסי קוד, דוחות ארוכים — במעבר אחד ובעלות נמוכה.
איך לגשת ל-V4 Flash
ניתן לקרוא ל־V4 Flash ישירות ב־API של DeepSeek (מזהה המודל code>deepseek-v4-flash/code>; הוא תומך ב־Responses API, ב־OpenAI ChatCompletions ובממשקים בסגנון Anthropic), או דרך נקודת קצה ניטרלית לספק. a href="https://www.orcarouter.ai/">OrcaRouter/a> חושף את V4 Flash בתוספת של 0% דרך נקודת קצה תואמת OpenAI יחידה (code>deepseek/deepseek-v4-flash/code>) לצד 185+ מודלים אחרים — כך שתוכל להשוות אותו ל־GPT-5.6 Luna, Gemini 3.6 Flash, GLM-5.2, Qwen 3.8 ו־Kimi K3 במקום אחד, ולנתב כל בקשה לזה שזול ביותר עבור המשימה. מכיוון שהוא תואם ל־OpenAI, אימוץ V4 Flash — או מעבר ממנו — הוא שינוי תצורה, לא אינטגרציה מחדש.

מגבלות והסתייגויות כנות
V4 Flash הוא מודל יעילות, לא דגל: במשימות ההיגיון הקשות ביותר הוא נופל מ-V4 Pro ומהמודלים המערביים המובילים. הקלט הוא טקסט בלבד (ללא תמיכה מובנית בתמונות). ציוני ה-benchmark כאן הם דיווח עצמי של DeepSeek באמצעות מערכת הבדיקה שלו, לכן יש להתייחס למספרים המדויקים ככיווניים ולצפות שהערכות בלתי תלויות ינועו מעט נמוך יותר. ו"זול לכל token" אינו "זול לכל משימה" אם נותנים ללולאות היגיון או סוכן לרוץ זמן רב — הגבילו את מאמץ ההיגיון ואת איטרציות הכלים בקריאות פשוטות. בצעו אימות על עומס העבודה שלכם לפני שמתחייבים להפנות אליו תעבורת ייצור.
שאלות נפוצות
מה זה DeepSeek V4 Flash?
מודל היעילות של DeepSeek בקו V4: מודל mixture-of-experts עם 284B / 13B פרמטרים פעילים, עם הקשר של 1M טוקנים, עד 384K פלט, מכוון לעבודה מהירה, בנפח גבוה, אייג'נטית וקוד. הגרסה הרשמית שלו (build -0731) שוחררה ב-31 ביולי 2026.
מה השתנה בגרסה הרשמית?
הארכיטקטורה לא השתנתה; מדובר בשדרוג שלאחר אימון שמשפר משמעותית את היכולות הסוכניות, הקידוד וקריאה לכלים, ומוסיף תמיכה מקורית ב-Responses-API עם התאמת Codex. רק ה-Flash API שודרג — V4 Pro והאפליקציה והאתר נותרו ללא שינוי.
כמה עולה V4 Flash?
בערך $0.15 למיליון אסימוני קלט ו-$0.29 למיליון אסימוני פלט ב-OrcaRouter (תוספת של 0%), עם כ-$0.02 לקריאות מטמון — בערך שליש מהמחיר של V4 Pro שעומד על $0.44 / $0.88. המחירים נשארו נמוכים במהדורה זו.
עד כמה V4 Flash טוב במשימות סוכן ובקוד?
DeepSeek מדווחת על ציונים גבוהים: Terminal-Bench 2.1 82.7, Toolathlon (מאומת) 70.3, Cybergym 76.7, DeepSWE 54.4, DSBench-FullStack 68.7 — כל הנתונים הם מ-harness של הספק, אז בדקו על המשימות שלכם.
איך V4 Flash משתווה ל-V4 Pro?
Pro הוא ספינת הדגל הגדולה בהרבה עבור החשיבה והקידוד הקשים ביותר; Flash הוא שכבת היעילות בכשליש מהמחיר עם יכולת סוכנית/קידוד חזקה. נתב משימות קשות ל-Pro, ואת כל השאר ל-Flash.
מהו חלון ההקשר?
1,048,576 אסימונים מלאים (כ-1M), עם עד 384K אסימוני פלט.
האם V4 Flash הוא רב-מודאלי?
לא — הקלט הוא טקסט בלבד. הוא תומך בחשיבה, הפעלת כלים ופלט JSON.
האם V4 Flash עובד עם ה-API של Responses ועם Codex?
כן — מהדורת -0731 מוסיפה תמיכה מקורית ב-Responses-API והתאמה ספציפית ל-Codex, לצד ממשקי OpenAI ChatCompletions וסגנון Anthropic.
איך אני משתמש ב-V4 Flash?
ישירות באמצעות ה-API של DeepSeek, או דרך נקודת הקצה התואמת ל-OpenAI של OrcaRouter ברווח של 0% (code>deepseek/deepseek-v4-flash/code>), שבה ניתן גם להשוות ולנתב בין מודלים מתחרים.
השורה התחתונה
ההשקה הרשמית של DeepSeek V4 Flash שומרת על הנוסחה הזולה והמהירה והופכת אותו לסוכן טוב בהרבה: אותו MoE עם 284B / 13B-active והקשר של 1M, אבל עם אימון מחדש לקידוד ולשימוש בכלים חזקים יותר, עם תמיכה מקורית ב-Responses-API וב-Codex — באותו תמחור של כ-$0.15 / $0.29. זה לא דגם דגל ולא מולטימודלי, אבל עבור רוב גדול של עבודות סוכן, כתיבת קוד ומסמכים ארוכים, זו אחת האפשרויות עם התמורה הטובה ביותר לטוקן ב-2026. נסו אותו דרך נקודת קצה תואמת OpenAI ללא תוספת מחיר כמו OrcaRouter, ונתבו את המיעוט הכי קשה של הבקשות לדגם דגל — השילוב הזה קשה לנצח מבחינת עלות.
השוואות במאמר הזה1
זוהה מתוך המאמר הזה · בנצ'מרקים: Artificial Analysis · מתעדכן יומית
